AI手机,按了一下指纹之后,到底同意了什么?

AI 开始替你操作手机,但账号安全还在假设每一步都是你自己点的。


你对手机说:”帮我把明天去上海的高铁票订了。”

AI 助手开始动了。它打开购票应用,选了一趟车,填好身份证号,选了靠窗的座位。整个过程你在旁边喝咖啡,偶尔扫一眼屏幕。

中间弹出一个支付确认——手机震了一下,让你按指纹。

你按了。

票买好了。一切正常。

但如果认真想一下这个过程,有个问题不太好回答:

你按下那个指纹的时候,到底同意了什么?

同意买这张票?同意这个价格?同意用这张银行卡?还是默认同意了”AI 接下来做的所有事情”?

在你按指纹之前,AI 已经替你做了好几步操作。在你按完指纹之后,AI 可能还会继续做一些事情——比如把行程加进日历,或者帮你查目的地的酒店。那些操作,你也”同意”了吗?

这个问题之所以不好回答,是因为我们过去做账号安全的时候,其实默认了一件事:

手机是你的 → 是你在操作 → 你刚完成了认证 → 所以后面的操作也是你的意思。

这四步连在一起,以前几乎不需要怀疑。

但 AI Agent 出现以后,这条链可以被拆开了。

手机还是你的。你也确实按了指纹,但中间的操作是Agent在做,后面的操作也可能是Agent在继续。你在场,但你不一定在控制每一步。这个像极了你在用AI做项目,AI不停地像你发请求,你点了3-5个同意后,后面看都不会看直接点同意了。

这不是一个关于”AI 会不会作恶”的问题。这是一个关于”我们过去的安全机制,还能不能准确地判断一件事到底是不是用户自己干的”的问题。


过去的安全模型默认了什么

如果你做过账号安全或者风控,你对这套逻辑一定很熟悉:

看设备是不是用户常用的,看 IP 在不在常见的范围。看有没有通过生物识别。看操作的时间和习惯是不是一致。如果都正常,那这个操作大概率是用户本人做的。

这套逻辑在过去十几年非常好用。它好用的原因不是因为它在数学上有多完备,而是因为它背后有一个很强的现实假设——

如果手机是你的,你刚解锁或者登录了,你人就坐在那儿,那屏幕上发生的每个点击,基本上就是你的手指头点出来的。

这个假设在绝大多数情况下是对的。设备可信 + 人在场 + 刚认证过 ≈ 后面的操作是用户自己在做。

但这个等号现在开始松动了。

因为系统级 AI Agent 可以在用户的手机上、以系统权限运行、替用户完成跨应用的多步操作。设备还是那个设备,用户也确实刚刚认证过,但屏幕上的操作已经不是手指头点出来的了。

这里很容易产生一个误解:这不就是以前的自动化脚本或者辅助工具吗?

不太一样。

过去的自动化工具,多数依赖 Android 的无障碍服务(Accessibility Service)。安全团队对这条路径已经很熟悉了——能检测到无障碍是否开启,能看到哪些服务有哪些权限与能力。这套检测建设了很多年,也确实有用。

但系统级 AI Agent 走的可能不是这条路。


无障碍检测的故事

这里要讲清楚一件事,因为很容易被简单化。

对 M153(豆包一代手机:一款已发布的 AI Agent 手机)的技术测评显示,它的读屏和自动操作使用了系统级的视频捕获权限和签名级的输入注入(INJECT_EVENTS),不需要经过传统的无障碍服务通道。这是一个在 Android 平台层面就存在的能力——系统签名应用可以直接注入触摸事件,不需要注册成无障碍服务。

这意味着什么?

过去很长时间,”检测无障碍”和”检测自动化”之间高度重叠,因为绝大多数自动化工具——无论是正当的还是恶意的——都走无障碍这条路。所以安全团队盯住无障碍,等于盯住了大部分自动化。

但系统级 Agent 可以不走这条路。

于是一个过去几乎成立的等价关系开始松动:

“没看到无障碍” ≈ “没有自动操作”

这个推断以前很安全,现在不一定了。

但我要强调另一面:这不意味着无障碍检测没用了。

对于第三方恶意辅助服务、传统的无障碍自动化工具,现有的检测可能依然有效,也值得继续建设。无障碍检测失去的不是价值,而是一部分覆盖面——因为有了例外,系统级的智能体应用的权限可能并不会出现在无障碍列表中

另外还有一个需要保持注意的地方:M153 的测评结论不能自动推广到其他 AI Agent 手机。比如 NaviX Ultra 的当前固件到底使用什么注入路径、走不走无障碍,没有真机,暂时还不知道。”系统级 Agent 可以绕开无障碍”这个可能性有充分证据,但具体某款产品到底怎么实现,需要单独验证。


认证的问题

回到最开始那个场景:你按了一下指纹,AI 替你完成了购票。

指纹、人脸、OTP(一次性密码)——这些认证手段能证明什么?

它们能证明:在某个时间点,某个已注册的认证器成功响应了一次挑战。

换句话说,它们证明的是一个时刻发生的一件事。

但在 AI Agent 的场景下,问题变成了:这一次确认,到底覆盖了后面多少步操作?

你按指纹的时候,屏幕上显示的是”确认支付 957元”。这一下你可能确实同意了这笔支付。但 AI 在你按完之后继续做的事情——添加行程、查酒店、甚至可能保存了某个新的收货地址——这些你并没有逐一确认过。

问题不在于认证本身失效了。认证仍然是关键防线。问题在于,认证原来在安全模型里承担的含义需要收窄。

过去,”刚做过生物识别”经常被解读为”用户本人正在操作,近期操作可信”。在 Agent 场景下,它只能被安全地解读为”在某个时间点发生了一次认证事件”。

这种“不要过度解释认证结果”的问题,其实并不是 AI Agent 出现以后才有。

最高人民法院指导案例169号讨论过一个很有意思的网络盗刷案件。犯罪分子获取了受害人的身份信息、银行卡密码,又通过补办 SIM 卡拿到了银行验证码。从银行系统的视角看,身份识别信息和交易验证信息都是相符的。

但法院没有接受“验证信息都对,所以就是本人或本人授权交易”这样的推断。

这个案例和 AI Agent 当然不是一回事,但它体现了一个很相似的问题:一个验证机制被正确满足,只能证明这个验证机制所能证明的事情,不能自动继续推导出“这就是用户真实的操作和授权”。

到了 Agent 场景,这个边界变得更加明显。指纹可能是真的,人也确实在场,甚至整个认证过程都没有受到攻击。真正发生变化的是:认证完成以后,继续执行操作的主体可能已经从人变成了Agent。

至于这次认证之后,AI 能继续做多久、做多少步、跨多少个应用——这个是没有固定答案的。不同的产品、不同的实现、不同的业务场景,边界可能完全不同。说人话就是,你看知乎让AI总结,帮知乎这个页面你可以放心让AI去做各种操作,只要不乱写不当言论;而在支付宝,银行应用中,你可能要特别谨慎,尤其是转账,你点授权可能只能允许agent执行1步或者2步,甚至不允许跨应用操作等等。


能不能通过”行为”把 AI 和真人区分开?

这是一个很自然的想法:既然 AI 在操作手机,它的点击模式应该和真人不一样吧?

确实,根据经验我们想到一些可能的差异:

  • AI 的点击间隔可能更规律?
  • 触摸压力可能分布不同?
  • 滑动轨迹可能更直?
  • 某些底层事件字段的值可能有统计差异?

但事情到这里其实变了。

“在实验样本里能分出来”和”在生产环境里能长期稳定地分出来”是两件事。

一个分类器在受控条件下表现不错,不意味着它能扛住以下变化:任务类型变了、系统版本升级了、手机负载不同了、网络状态变了。更关键的是,如果 AI 主动加入一些随机的停顿和抖动来模仿真人的操作节奏——研究表明这种”拟人化”可以显著降低检测率——那这些差异可能就消失了。

所以准确的说法是:在现有公开的 Android API 范围内,没有发现一个通用的、普通应用可以依赖的方法来可靠判断”当前操作是人做的还是系统 Agent 做的”。

这不等于”完全没有任何可观测差异”。统计上的差异可能存在,但它是弱信号,不是能拿来做硬判断的东西。

我觉得这个结论本身是有价值的。它的价值不在于”找到了什么”,而在于它明确了一件事:不应该继续在应用层堆砌越来越多的启发式规则来猜”这是不是机器点的”。

如果应用自己看不到可靠的来源证明,那这个能力需求应该上移——交给操作系统或设备厂商提供。这类手机主动开放一个API,当前操作是否由AI Agent操作?或者对于金融类APP则主动屏蔽。


真正需要保护的是什么

如果只盯着”是不是机器点的”,我觉得很可能会把问题做窄。

因为”机器点击”本身既不是风险的必要条件,也不是充分条件。

一方面,AI 完全可以不通过点击来完成操作。它可以直接调用 API 或者工具,根本不产生任何触摸事件。另一方面,真人也可以在诈骗电话的指导下自己完成所有点击——每一步都是真手指点的,但结果同样是把钱转给了骗子。

所以检测到 Agent 存在,不等于检测到欺诈。合法的 AI Agent 替你订机票、查天气、整理日程,这是正常功能,不应该被风控拦截。同一个合法 Agent,如果因为被网页里嵌入的恶意指令影响,执行了你没有要求的操作,才是真正的风险——但这时候设备信号、Agent 签名、甚至认证记录可能全部正常。

真正的问题应该逐渐变成:

谁在代表用户做事?

用户到底授权了什么?

授权到什么时候?

哪些事情 AI 可以自己继续做,哪些事情必须重新把人叫回来确认?

最终发生的敏感操作,还和用户最开始说的那件事是同一件事吗?

如果要把这些问题正式化,行业里已经有一些名字:Agent Identity(Agent 的身份验证)、Delegated Authorization(委派授权)、KYA / Know Your Agent(了解你的 Agent)、Signed Intent(可验证的意图绑定)。FIDO 联盟在推 Agentic Authentication 标准,国内首个金融领域智能体安全团体标准已于 2026 年 8 月发布并实施,明确要求第三方智能体未经机构授权不得自动化操作金融应用界面,Visa 在探索 Agent Score 和 Token Assurance。

这些说明这个问题已经进入产业标准化阶段。但标准化不等于落地——目前还没有跨平台、跨机构的成熟部署。

如果试着拆解一下,安全体系至少需要分开回答四件事:

手机是不是你的? 这是设备信任,现有的设备绑定、密钥证明这些机制还是有用的。

你人在不在? 刚才有没有完成过认证,能不能证明人还在附近。

现在到底是谁在操作? 是你的手指,还是某个 Agent?如果是 Agent,是哪一个,什么版本,什么权限?

这一件具体的事情,你有没有真的同意? 不是泛泛地同意”AI 帮我做事”,而是同意”花 957 元买明天 G1234 次列车二等座”这件具体的事。

如果一定给它们起名字,就是 Device、Human、Agent 和 Intent。

过去这四个东西几乎总是绑在一起的,不需要单独验证。现在它们可以分开了,就需要一个一个去确认。


我们现在还不知道什么

到这里有一些不太令人满意但必须诚实的答案。

NaviX Ultra 的当前固件到底暴露什么样的输入差异? 不知道。M153 有一手测评数据,但不能直接搬过来。

普通应用能不能看到 AI Agent 执行时的虚拟显示界面? 测评材料提到某些 Agent 实现存在虚拟操作界面,但第三方应用能不能通过系统 API 观察到它,不知道。

一次认证之后,Agent 到底能继续执行多久、多少步操作? 没有数据。

基于行为特征的 Human vs Agent 分类器,能不能跨固件版本、跨任务类型长期成立? 目前只有有限的实验室条件下的结果,不能确定。

这些”不知道”不是此篇文章的失败。它们恰恰划出了下一步需要验证的边界。


为什么这件事值得继续研究

我更愿意把这个问题理解成:账号安全正在经历一次基础假设的更新。

过去十年,这个领域的很多工作建立在”能判断操作者身份”的基础上——通过设备、环境、认证、行为这些信号,去推断”是不是本人在操作”。这些信号不会一夜之间失效,但它们覆盖的范围在收缩,它们代表的含义在漂移。

一个”可信设备”,过去接近于”可信操作”的代理指标,现在退回为”可信执行环境”——设备是好的,但上面跑的任务可能超出了用户授权。

一个”近期生物识别”,过去被当作连续操作的佐证,现在退回为某个时间点的认证事件——人确实在那一刻在场,但后续的操作可能已经交给了软件。

“无障碍关闭”,过去接近于”没有自动化”,现在只能表示”没有观察到无障碍路径”——因为自动化可能走的是另一条路。

这些都不是安全体系崩塌了。这是安全体系需要重新校准自己的语义。

真正让我觉得值得研究的,并不是 AI 会自动点手机——自动化一直都存在。真正的变化是:这一次自动化的执行者是系统级别的、合法的、用户主动委派的。它不是入侵者,不是恶意软件,但它也不是用户本人。现有的安全模型里,没有一个好的位置来放置这个角色。

所以现阶段最重要的工作,不是证明 AI Agent 一定危险,也不是寻找一个万能的检测特征,而是重新定义现有能力能看见什么、不能看见什么,以及一次认证究竟授权了什么。

对于看不到的东西,应该把”普通应用无法证明”写进安全模型,然后把能力需求推给操作系统和设备厂商。对于只有统计差异的东西,应该拒绝把”样本里可以分出来”升级为”可以在生产环境里做硬拦截”。

“目前不知道”和”目前无法可靠检测”,也是有价值的研究结论。它们不是终点,而是决定下一步往哪里走的路标。


暂无评论

发送评论 编辑评论


				
|´・ω・)ノ
ヾ(≧∇≦*)ゝ
(☆ω☆)
(╯‵□′)╯︵┴─┴
 ̄﹃ ̄
(/ω\)
∠( ᐛ 」∠)_
(๑•̀ㅁ•́ฅ)
→_→
୧(๑•̀⌄•́๑)૭
٩(ˊᗜˋ*)و
(ノ°ο°)ノ
(´இ皿இ`)
⌇●﹏●⌇
(ฅ´ω`ฅ)
(╯°A°)╯︵○○○
φ( ̄∇ ̄o)
ヾ(´・ ・`。)ノ"
( ง ᵒ̌皿ᵒ̌)ง⁼³₌₃
(ó﹏ò。)
Σ(っ °Д °;)っ
( ,,´・ω・)ノ"(´っω・`。)
╮(╯▽╰)╭
o(*////▽////*)q
>﹏<
( ๑´•ω•) "(ㆆᴗㆆ)
😂
😀
😅
😊
🙂
🙃
😌
😍
😘
😜
😝
😏
😒
🙄
😳
😡
😔
😫
😱
😭
💩
👻
🙌
🖕
👍
👫
👬
👭
🌚
🌝
🙈
💊
😶
🙏
🍦
🍉
😣
Source: github.com/k4yt3x/flowerhd
颜文字
Emoji
小恐龙
花!
上一篇