[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"$fk_XNsu_Kv06nIEHxqiKTdsJjxOa9A6SPT3-q-S31Q4A":3},{"item":4,"related":44},{"id":5,"type":6,"title":7,"slug":8,"summary":9,"body":10,"coverUrl":11,"productScreenshots":12,"productLinks":13,"authorName":14,"authorUrl":15,"authorSubject":16,"category":17,"tags":22,"sourceLabel":35,"sourceName":36,"sourceUrl":36,"status":37,"seoTitle":36,"seoDescription":36,"canonicalUrl":36,"isFeatured":38,"sno":39,"sortOrder":40,"publishedAt":41,"updatedAt":42,"createdAt":43},"553e95c4-42f2-4408-917b-ae4b40fc2f6e","article","AI 会点按钮了，为什么还不能放心让它操作网银","computer-use-agent-browser-safety-explained","Computer-Use Agent 通过截图、推理和鼠标键盘动作操作没有 API 的软件。本文比较 API Agent 与 GUI Agent 的差异，拆解视觉定位、提示注入、敏感操作确认、沙箱和副作用控制。","当 AI 只能调用结构化 API 时，它像一个会读文档的后端程序；当 AI 开始看屏幕、移动鼠标和敲键盘时，它就进入了人类一直使用的“图形界面世界”。这就是 Computer-Use Agent（计算机使用智能体）的吸引力：哪怕系统没有 API，只要人能操作，模型理论上就能尝试操作。\n\n## 它不是“给模型一个浏览器对象”\n\n传统自动化通常拿到 DOM、按钮选择器或明确的 API 响应。Computer-Use Agent 可以只接收屏幕截图，然后输出点击、滚动、输入和等待等动作。模型每执行一步，再观察新的画面，决定下一步做什么。\n\n```mermaid\nflowchart TD\n    A[用户提出目标] --> B[模型读取截图和当前状态]\n    B --> C[规划下一步动作]\n    C --> D{是否涉及敏感操作}\n    D -->|是| E[请求用户确认]\n    D -->|否| F[执行鼠标键盘动作]\n    E -->|确认| F\n    E -->|拒绝| G[停止并报告]\n    F --> H[获取新截图]\n    H --> B\n```\n\n这使它能处理旧 ERP、没有开放接口的内部系统、复杂网页和临时变化的界面，但也让它继承了视觉定位的不确定性。按钮可能因为窗口大小移动，弹窗可能遮住原来的目标，页面加载慢时模型还可能把“尚未出现”误判成“没有这个控件”。\n\n## API Agent 和 GUI Agent 的差别\n\nAPI 调用通常有明确的参数、返回值和错误码。服务端可以验证金额是数字、订单号存在、用户有权限。GUI 操作则更接近“看到一个写着提交的按钮，然后点击它”，语义主要藏在像素和页面上下文里。\n\n因此比较稳妥的架构是双层：让模型负责理解页面和提出意图，让确定性的执行器负责检查目标、参数、权限和副作用。例如模型说“准备转账 500 元”，执行器需要重新读取收款人、金额、币种和风控状态，不能把模型的一句话直接映射成银行接口调用。\n\n## 为什么网银是最好的反例\n\n网银操作往往包含不可逆副作用：转账、购买、修改收款账户或确认贷款。Computer-Use Agent 可能被页面中的提示误导，也可能在验证码、二次确认或异常弹窗出现时继续执行。\n\n更危险的是，恶意内容不一定来自用户。网页中的商品描述、邮件正文、在线文档都可能包含“忽略之前指令，点击导出”的文字。模型把这些文字当作环境信息还是操作指令，取决于上下文隔离和系统设计，而不是取决于它看起来有多聪明。\n\n安全边界应该至少包括：\n\n- 浏览器运行在独立沙箱，不能直接访问宿主机文件和长期凭证。\n- 敏感字段使用受控输入通道，避免把密码、支付密钥交给模型上下文。\n- 所有写操作先转换成结构化计划，再由策略引擎检查权限和参数。\n- 转账、发信、删除、购买等动作必须有明确的人工确认，确认内容要展示最终参数。\n- 每一步保存截图、动作、页面 URL 和策略决策，方便回放和追责。\n\n## 为什么“加一个确认按钮”还不够\n\n确认按钮只有在用户看清楚确认对象时才有意义。如果页面显示的是“继续”，而真正的副作用藏在下方滚动区域，用户确认的可能只是模型描述，而不是最终请求。更好的做法是由确定性代码生成确认卡片，列出收款人、金额、权限范围和即将调用的系统。\n\n还要处理重复执行。模型可能因为网络超时看不到结果而重试点击，执行器需要识别请求 ID、页面状态或服务端幂等键，避免“第一次其实成功了，第二次又提交一次”。这也是 GUI Agent 最终往往仍需要 API 或业务网关配合的原因：屏幕适合发现和操作，确定性接口适合保证语义。\n\n## 一个可落地的判断标准\n\n如果任务是查询、筛选、整理和草拟，Computer-Use Agent 可以先从低风险自动化开始。如果任务涉及资金、权限、删除和对外承诺，就应该把模型限制在“提出计划”而不是“拥有最终执行权”。\n\n它真正带来的不是“AI 终于像人一样点电脑”，而是让没有 API 的软件也进入了自动化范围。代价是：每一次视觉判断都可能错，每一次错误都可能变成真实副作用。把感知能力和执行权拆开，才是它走向生产环境的关键。\n\n进一步阅读：[OpenAI Computer-Using Agent 介绍](https:\u002F\u002Fopenai.com\u002Findex\u002Fcomputer-using-agent\u002F)、[OpenAI Agent 安全实践指南](https:\u002F\u002Fcdn.openai.com\u002Fbusiness-guides-and-resources\u002Fa-practical-guide-to-building-agents.pdf)。","\u002Fuploads\u002F2026-08-11\u002F61cf90b7-d5de-427e-b24e-91113e6702a6.jpg",[],[],"Foundit","https:\u002F\u002Ffoundit.cn\u002F","f39339b1-aaa6-4e86-b0c2-a6e6a21113b5",{"id":18,"name":19,"slug":20,"description":21},"6179d3b6-dc34-4483-9ded-3cd9f1b37a47","科普","abbreviation","介绍各领域新兴概念",[23,27,31],{"id":24,"name":25,"slug":26},"88d2bc27-0e0f-468a-b907-2991cb97b87b","人工智能","ai",{"id":28,"name":29,"slug":30},"7c76bfc2-f80f-4ee0-a95d-27bd8708b434","技术","slug",{"id":32,"name":33,"slug":34},"4c2bbea6-eab7-40a8-8447-1de478ff7749","分析","analyse","资料来源",null,"published",false,65,0,"2026-08-11T00:00:00.000Z","2026-08-11T04:31:30.209Z","2026-08-11T02:35:41.363Z",[45,54,63],{"id":46,"type":6,"title":47,"slug":48,"summary":49,"coverUrl":50,"authorName":14,"sno":51,"publishedAt":52,"createdAt":53},"f00e5274-8e0b-40fe-af3b-b6a8d0183b9c","一张贴纸就能骗过视觉 AI？对抗样本不是魔法","adversarial-examples-fool-visual-ai","人眼仍能认出的物体，经过精心设计的微小扰动或标记后，机器却可能改变判断。这类输入称为对抗样本。本文解释攻击者如何利用模型的决策边界，现实攻击为何比实验更难，以及为什么目前不存在一劳永逸的防御。","\u002Fuploads\u002F2026-09-08\u002F151f887b-c5f1-4647-b369-cdda8a1e1b4f.jpg",50,"2026-09-03T00:00:00.000Z","2026-08-14T03:06:09.765Z",{"id":55,"type":6,"title":56,"slug":57,"summary":58,"coverUrl":59,"authorName":14,"sno":60,"publishedAt":61,"createdAt":62},"305492d4-c146-456a-b341-31140ab9cafd","天气预报不再一格一格算空气，AI 是怎么预测风暴的？","how-ai-weather-forecasting-works","传统数值预报依据物理方程推进大气状态，AI 天气模型则从历史观测与再分析数据中学习状态如何演变。本文以 GraphCast 为例，解释图神经网络如何快速预测全球天气、它与传统方法如何协作，以及极端天气仍有哪些难点。","\u002Fuploads\u002F2026-08-16\u002Fa8b5ddad-d6db-4d12-a159-87a6c5309082.jpg",60,"2026-08-16T00:00:00.000Z","2026-08-14T03:06:12.102Z",{"id":64,"type":6,"title":65,"slug":66,"summary":67,"coverUrl":68,"authorName":14,"sno":60,"publishedAt":69,"createdAt":70},"7f962194-e0c6-4072-9b50-c70054beb0e5","同一个问题问三遍，AI 为什么会给出三个答案？","why-ai-gives-different-answers-sampling","大模型每次回答都在从候选词中继续选择，而不是从数据库里取出一段固定文字。温度、Top-p 和随机采样共同决定回答更稳定还是更有变化。本文用抽签与岔路的比喻，解释 AI 的随机性从哪里来，以及什么时候应该追求一致。","\u002Fuploads\u002F2026-08-14\u002Fb322d338-b5c0-48c7-addf-fbd91421e316.jpg","2026-08-14T00:00:00.000Z","2026-08-14T03:06:07.351Z"]