[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"$fa8rgGJKttm7Iin89QnTRQ2TySFIfYh8a1cDCsVJeoIc":3},{"item":4,"related":44},{"id":5,"type":6,"title":7,"slug":8,"summary":9,"body":10,"coverUrl":11,"productScreenshots":12,"productLinks":13,"authorName":14,"authorUrl":15,"authorSubject":16,"category":17,"tags":22,"sourceLabel":35,"sourceName":36,"sourceUrl":36,"status":37,"seoTitle":36,"seoDescription":36,"canonicalUrl":36,"isFeatured":38,"sno":39,"sortOrder":40,"publishedAt":41,"updatedAt":42,"createdAt":43},"e41a0646-00b8-4836-b02b-9139cf492286","article","机器人怎么把“把杯子放到桌上”变成连续动作","vision-language-action-robotics-explained","Vision-Language-Action 模型把视觉、语言和机器人动作接成闭环。本文从杯子抓取场景讲清感知、规划、动作片段、仿真到现实、安全急停与失败恢复。","让机器人听懂“把杯子放到桌上”，并不等于给语言模型接一个机械臂 API。机器人必须从摄像头中找到杯子和桌子，判断它们的三维位置，规划一条不会撞到障碍物的轨迹，再把连续动作发送给关节控制器；动作执行后，还要重新观察世界有没有变化。\n\n![机器人手臂与人机协作场景](https:\u002F\u002Fimages.unsplash.com\u002Fphoto-1485827404703-89b55fcc595e?w=1200)\n\n## VLA 模型把三种信息接在了一起\n\nVision-Language-Action（视觉—语言—动作）模型的目标，是让同一个系统同时处理视觉观察、自然语言任务和机器人动作。语言提供目标，视觉提供当前状态，动作则是模型真正影响物理世界的输出。\n\n```mermaid\nflowchart TD\n    A[语言目标] --> D[任务理解]\n    B[摄像头图像] --> D\n    C[机器人本体状态] --> D\n    D --> E[选择动作片段]\n    E --> F[执行器控制关节]\n    F --> G[获得新视觉和触觉反馈]\n    G --> D\n```\n\n这和聊天模型最大的不同，是动作会改变下一次输入。机器人伸手后，杯子可能被挡住；人也可能突然走进工作区。系统不能只生成一条漂亮的动作序列，而要在每个关键时刻根据反馈修正计划。\n\n## 为什么“看见杯子”还不够\n\n二维图像中的杯子只有像素位置，抓取需要估计深度、姿态、边缘和可接触区域。透明杯、反光金属、被物体遮挡的杯子，都会让视觉模型不确定。\n\n机器人还要理解任务中的隐含约束：拿杯子时不能碰倒旁边的水壶，抓取位置不能压住杯口，放置时要让杯底稳定接触桌面。语言模型可以给出常识性的解释，却不应该直接替代几何规划和低层控制器。更可靠的分工是：高层模型确定目标与粗粒度步骤，专门的运动规划和控制系统负责速度、碰撞、力矩与安全限制。\n\n## 动作不是一句“点击按钮”\n\nGUI Agent 的动作可以是点击、输入和滚动，机器人动作则带有时间、空间和动力学约束。一个动作通常需要描述关节角、末端位姿、速度、加速度或一段轨迹。输出太细，模型难以稳定预测；输出太粗，控制器又不知道如何执行。\n\n因此实践中常用动作片段（action chunk）：模型一次提出接下来一小段连续动作，控制器先执行其中一部分，再用新的观察重新规划。这种方式在反应速度和规划稳定性之间折中，也允许系统在抓取失败、目标移动或环境变化时及时停止。\n\n## 真正难的是数据和失败恢复\n\n互联网上的图文数据能教模型“杯子是什么”，却不能直接教它手臂在不同摩擦、重量和摄像头角度下怎么抓杯子。机器人数据需要动作轨迹、传感器记录、失败结果和环境变化，采集成本高，覆盖场景却仍然有限。\n\n仿真可以扩大数据量，但仿真里的摩擦、材质、光照和机械误差与现实不同，这就是 sim-to-real gap。解决它不只是把模拟画面做得更逼真，还要让策略对小误差保持鲁棒，并在现实中持续收集失败样本。\n\n安全设计要先于“自主程度”：限制工作空间和速度，为夹爪设置力矩上限，让人能随时急停，给不确定动作设置低风险替代方案。对机器人来说，“我不确定”必须能转化为停下、请求帮助或退回安全姿态，而不是继续猜。\n\n## 物理世界里的 Agent 应该怎样评估\n\n不能只问模型能不能说出正确答案，还要看任务成功率、碰撞率、恢复时间、对新物体的泛化能力，以及失败是否可解释。一次成功的演示不代表系统可靠，连续数百次操作中偶发的一次危险动作，可能比平均成功率更重要。\n\nGoogle DeepMind 将 Gemini Robotics 描述为面向物理世界的模型方向，重点正是把多模态理解和动作执行连接起来。它提醒我们：机器人 AI 的核心不是让语言模型“变得更像人”，而是让感知、规划、控制和安全反馈组成闭环。\n\n进一步阅读：[Google DeepMind Gemini Robotics](https:\u002F\u002Fdeepmind.google\u002Fblog\u002Fgemini-robotics-brings-ai-into-the-physical-world\u002F)。","\u002Fuploads\u002F2026-08-11\u002F10b54eb6-c93e-4a24-95ad-5e1d5cbaf612.jpg",[],[],"Foundit","https:\u002F\u002Ffoundit.cn\u002F","f39339b1-aaa6-4e86-b0c2-a6e6a21113b5",{"id":18,"name":19,"slug":20,"description":21},"6179d3b6-dc34-4483-9ded-3cd9f1b37a47","科普","abbreviation","介绍各领域新兴概念",[23,27,31],{"id":24,"name":25,"slug":26},"88d2bc27-0e0f-468a-b907-2991cb97b87b","人工智能","ai",{"id":28,"name":29,"slug":30},"7c76bfc2-f80f-4ee0-a95d-27bd8708b434","技术","slug",{"id":32,"name":33,"slug":34},"4c2bbea6-eab7-40a8-8447-1de478ff7749","分析","analyse","资料来源",null,"published",false,64,0,"2026-08-11T00:00:00.000Z","2026-08-11T04:25:56.022Z","2026-08-11T02:35:43.528Z",[45,54,63],{"id":46,"type":6,"title":47,"slug":48,"summary":49,"coverUrl":50,"authorName":14,"sno":51,"publishedAt":52,"createdAt":53},"f00e5274-8e0b-40fe-af3b-b6a8d0183b9c","一张贴纸就能骗过视觉 AI？对抗样本不是魔法","adversarial-examples-fool-visual-ai","人眼仍能认出的物体，经过精心设计的微小扰动或标记后，机器却可能改变判断。这类输入称为对抗样本。本文解释攻击者如何利用模型的决策边界，现实攻击为何比实验更难，以及为什么目前不存在一劳永逸的防御。","\u002Fuploads\u002F2026-09-08\u002F151f887b-c5f1-4647-b369-cdda8a1e1b4f.jpg",50,"2026-09-03T00:00:00.000Z","2026-08-14T03:06:09.765Z",{"id":55,"type":6,"title":56,"slug":57,"summary":58,"coverUrl":59,"authorName":14,"sno":60,"publishedAt":61,"createdAt":62},"305492d4-c146-456a-b341-31140ab9cafd","天气预报不再一格一格算空气，AI 是怎么预测风暴的？","how-ai-weather-forecasting-works","传统数值预报依据物理方程推进大气状态，AI 天气模型则从历史观测与再分析数据中学习状态如何演变。本文以 GraphCast 为例，解释图神经网络如何快速预测全球天气、它与传统方法如何协作，以及极端天气仍有哪些难点。","\u002Fuploads\u002F2026-08-16\u002Fa8b5ddad-d6db-4d12-a159-87a6c5309082.jpg",60,"2026-08-16T00:00:00.000Z","2026-08-14T03:06:12.102Z",{"id":64,"type":6,"title":65,"slug":66,"summary":67,"coverUrl":68,"authorName":14,"sno":60,"publishedAt":69,"createdAt":70},"7f962194-e0c6-4072-9b50-c70054beb0e5","同一个问题问三遍，AI 为什么会给出三个答案？","why-ai-gives-different-answers-sampling","大模型每次回答都在从候选词中继续选择，而不是从数据库里取出一段固定文字。温度、Top-p 和随机采样共同决定回答更稳定还是更有变化。本文用抽签与岔路的比喻，解释 AI 的随机性从哪里来，以及什么时候应该追求一致。","\u002Fuploads\u002F2026-08-14\u002Fb322d338-b5c0-48c7-addf-fbd91421e316.jpg","2026-08-14T00:00:00.000Z","2026-08-14T03:06:07.351Z"]