[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"$fSVEEOSQ7zRJvROvYLaEvyaj2_dWvrJW6wxN6pO9TlNw":3},{"item":4,"related":50},{"id":5,"type":6,"title":7,"slug":8,"summary":9,"body":10,"coverUrl":11,"productScreenshots":12,"productLinks":13,"authorName":14,"authorUrl":15,"authorSubject":16,"category":17,"tags":22,"sourceLabel":39,"sourceName":40,"sourceUrl":41,"status":42,"seoTitle":43,"seoDescription":43,"canonicalUrl":43,"isFeatured":44,"sno":45,"sortOrder":46,"publishedAt":47,"updatedAt":48,"createdAt":49},"dd632e7d-1fe9-467c-b7cf-4b2cd9194da3","article","只看无声视频，AI 能自己学会重力和物体运动吗？","world-model-learning-physics-from-video","世界模型不只识别画面里有什么，还试图预测接下来会发生什么，以及采取动作会带来什么结果。本文以 V-JEPA 2 为例，解释 AI 如何从大量无标注视频中学习可预测的变化，并厘清这种能力与真正理解物理世界之间的距离。","婴儿看球从桌边滚落，不需要有人逐帧标注“球在移动”“接下来会掉下去”，也能慢慢形成对物体运动的直觉。研究者希望 AI 获得类似能力：不只认出画面里的杯子和手，还能预测下一刻会发生什么，以及伸手推动杯子会带来什么结果。\n\n这类内部预测系统常被称为世界模型。它不是完整复制宇宙，而是学习与行动有关的规律，帮助机器理解、预测和规划。\n\n![V-JEPA 2 从视频预训练到机器人规划的流程图](https:\u002F\u002Fraw.githubusercontent.com\u002Ffacebookresearch\u002Fvjepa2\u002Fmain\u002Fassets\u002Fflowchart.png)\n\n## 从“这是什么”走向“接下来怎样”\n\n普通图像分类任务关注静态标签：画面里是猫、汽车还是椅子。世界模型还要处理时间和因果线索：球沿哪个方向滚，手拿起杯子后桌面会怎样，如果机器人向左移动会不会撞到障碍。\n\n```mermaid\nflowchart LR\n    A[观察视频] --> B[编码当前世界状态]\n    B --> C[预测下一状态]\n    C --> D{结果是否符合观察}\n    D -->|否| E[修正内部模型]\n    D -->|是| F[用于动作规划]\n    E --> C\n```\n\n训练时可以遮住视频的一段，让模型根据前后画面预测缺失部分。直接预测每个像素非常昂贵，而且模型会把精力浪费在难以预测的细节上，例如树叶的轻微抖动。另一条路线是在压缩后的表示空间中预测，只保留对物体、动作和变化有用的信息。\n\nMeta 在 2025 年公布的[V-JEPA 2](https:\u002F\u002Fai.meta.com\u002Fblog\u002Fv-jepa-2-world-model-benchmarks\u002F)采用联合嵌入预测架构。编码器把视频转换成语义表示，预测器则推测目标片段的表示。模型先从超过一百万小时视频和大量图片中进行无动作标注的预训练，再加入带动作条件的数据，使预测能够回答“采取这个动作之后会怎样”。\n\n## 为什么无声视频也能成为教材\n\n现实视频天然包含连续反馈。杯子被推后移动，抽屉被拉后打开，人绕过障碍继续前进。即使没有文字说明，相邻画面之间的关系也提供了监督信号。模型可以不断猜下一段表示，再根据实际视频修正自己。\n\n这种自监督学习省去了为每一帧手工贴标签的工作，也可能覆盖远比实验室数据丰富的场景。不过，视频里经常同时发生许多事情。模型看到灯亮与人走进房间总是一起出现，不代表它已经理解开关导致灯亮；统计共现仍可能冒充因果。\n\n## 会预测视频不等于懂物理定律\n\n世界模型可能学会常见运动模式，却在罕见材质、隐藏结构或全新尺度上失败。它也未必知道质量、摩擦力等概念，只是形成了足够有用的内部规律。一个系统能预测球会落下，并不表示它能写出重力方程。\n\n评测因此不能只问“视频分类准确率多高”，还要检查三层能力：能否理解当前状态，能否预测状态变化，能否用预测规划动作。V-JEPA 2 的研究展示了零样本机器人规划等结果，但这仍不意味着机器人已具备人类式常识，更不代表它能在任意家庭环境中安全工作。\n\n## 世界模型真正可能改变什么\n\n机器人可以先在内部尝试多条动作路线，再执行风险较低的一条；自动驾驶系统可以预测其他车辆的可能运动；游戏 Agent 能判断动作对虚拟世界的影响。与只会把“看到什么”翻译成文字的系统相比，这更接近行动前的想象。\n\n但内部模拟必须接受现实反馈校正。模型预测与传感器观测不一致时，系统要能够停止、重新规划或请求人工帮助。越是涉及真实机械动作，错误的“想象”越可能造成真实损失。\n\n无声视频确实能教给 AI 大量关于世界的规律，但它教的是从观察中压缩出的可预测模式。世界模型的价值，不在于宣布机器已经理解宇宙，而在于让它行动之前，终于有机会先问一句：“如果我这样做，接下来可能发生什么？”","\u002Fuploads\u002F2026-09-08\u002F79b17958-c8fa-4b91-a302-67d4af4667b6.jpg",[],[],"Foundit","https:\u002F\u002Ffoundit.cn","f39339b1-aaa6-4e86-b0c2-a6e6a21113b5",{"id":18,"name":19,"slug":20,"description":21},"6179d3b6-dc34-4483-9ded-3cd9f1b37a47","科普","abbreviation","介绍各领域新兴概念",[23,27,31,35],{"id":24,"name":25,"slug":26},"4c2bbea6-eab7-40a8-8447-1de478ff7749","分析","analyse",{"id":28,"name":29,"slug":30},"7c76bfc2-f80f-4ee0-a95d-27bd8708b434","技术","slug",{"id":32,"name":33,"slug":34},"88d2bc27-0e0f-468a-b907-2991cb97b87b","人工智能","ai",{"id":36,"name":37,"slug":38},"68cedb55-2cac-412f-8f81-fda8c7d686dd","思考","thought","资料来源","Meta AI：Introducing V-JEPA 2","https:\u002F\u002Fai.meta.com\u002Fblog\u002Fv-jepa-2-world-model-benchmarks\u002F","published",null,false,45,0,"2026-09-04T00:00:00.000Z","2026-09-08T02:08:32.484Z","2026-08-14T03:06:10.346Z",[51,60,68],{"id":52,"type":6,"title":53,"slug":54,"summary":55,"coverUrl":56,"authorName":14,"sno":57,"publishedAt":58,"createdAt":59},"1c047558-44f5-4e84-be6a-5468883d3178","中式巨构：技术终于有能力回应一个古老的梦","chinese-heaven","没有被“发明”，没有被“想出”，它只是被“看见”了。我们做了几千年的梦，终于在2026年，被AI显影在屏幕之上。","\u002Fuploads\u002F2026-08-15\u002Fc987bd06-cca5-4e10-b7a0-1e3213fc78d8.jpg",1,"2026-08-15T00:00:00.000Z","2026-08-15T04:53:56.292Z",{"id":61,"type":6,"title":62,"slug":63,"summary":64,"coverUrl":65,"authorName":14,"sno":57,"publishedAt":66,"createdAt":67},"6fb796fa-60a1-4dba-bd19-82a6cda0fe78","手段与目的：一台没有\"羞耻\"的理性机器","rational-machine","Hugging Face 遭 OpenAI AI 模型自主攻击事件中，真正值得警惕的，不是一台想害我们的机器，而是一台只想完成任务、且对手段毫无羞耻的理性机器。","https:\u002F\u002Foxqtewbrpuiouqqjrvdv.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fpublic-media\u002F2026-07-23\u002Fc90cf6fb-faa4-4454-91b5-d7356c144277.jpg","2026-07-23T00:00:00.000Z","2026-07-23T08:39:37.528Z",{"id":69,"type":6,"title":70,"slug":71,"summary":72,"coverUrl":73,"authorName":14,"sno":74,"publishedAt":75,"createdAt":76},"32fc8411-1570-4736-8e79-b0599be8a962","让 AI 像育种一样进化算法，会发生什么？","alphaevolve-evolutionary-algorithm-discovery","让大模型提出许多程序，再由自动评测器运行、打分、筛选和继续改良，算法发现就像进入了一座高速育种场。本文拆解 AlphaEvolve 的循环，说明它为何适合答案可验证的问题，也解释它不能自动解决哪些开放难题。","\u002Fuploads\u002F2026-09-08\u002Fef0f54b2-ca7d-4d06-8307-80d3e804e6f4.jpg",40,"2026-09-01T00:00:00.000Z","2026-08-14T03:06:10.928Z"]