豪掷82亿美元,芯片巨头押注的世界模型究竟是什么|深度观察

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
豪掷82亿美元,芯片巨头押注的世界模型究竟是什么|深度观察
9362点击    2026-10-01 13:21

82亿美元,芯片巨头AMD以全股票形式收购世界模型公司World Labs。


AMD在收购公告里写道:“World Labs 的模型经验,将帮助AMD更深入地理解工作负载如何演变,进而塑造未来的技术路线图。”


换句话说,AMD看中的,不只是World Labs今天的模型能力,更是世界模型这类前沿模型可能给芯片硬件研发带来的“前瞻性”。


豪掷82亿美元,芯片巨头押注的世界模型究竟是什么|深度观察


AMD董事长兼CEO苏姿丰(左)和World Labs联创李飞飞(右)


2026年以来,世界模型正替代大语言模型成为AI界的新晋“网红”。当大模型还停留在对话、文本和图像生成时,世界模型要做的是拓宽AI的能力边界,从“生成内容”推向“生成世界”。


这意味着,AI生成的将不再只是一个镜头、一段视频或一张图片,而是一个能够持续运行、允许用户进入、探索和互动的数字世界,这也许将是一次真正的内容重塑。比如,电影可能不再只是一段被观看的故事,而是成为一个用户能直接参与互动的小世界。


豪掷82亿美元,芯片巨头押注的世界模型究竟是什么|深度观察


图源:worldlabs.ai


但高热度的另一面是,世界模型至今尚未成熟,甚至没有一个确切的定义。于是,一系列问题随之而来:


世界模型究竟是什么?为什么李飞飞和杨立昆走向了不同的技术路线?Google、英伟达和AMD等巨头们又在押注什么?


更重要的是,为什么AMD愿意为一家成立仅两年的世界模型公司,开出82亿美元的价格?


当AI不再只是生成一段视频,而是开始生成一个可以进入、探索和互动的“世界”,影视、游戏和其他内容产业会发生什么?


# 1
世界模型,到底是什么


说来有趣,世界模型这个词最早并不是来自计算机科学,而是由一位人文社科领域的研究者提出。


1943年,英国心理学家Kenneth Craik在其著作《The Nature of Explanation(解释的本质)》中写到:


人的大脑会在内部建立一个关于外部的“小规模世界模型”,并利用这个模型预测未来可能发生的事情、比较不同的行动方案。


2018年,Google Brain的David Ha与人工智能先驱Jürgen Schmidhuber共同发表论文《World Models》,正式在人工智能的论文中提出世界模型的概念。他们还给出了一个简洁的框架:


世界模型=观察世界(V)+预测世界(M)+在内部世界中学习行动(C)。


这也为后来的人们提供了一条重要线索:AI真正需要的,可能不只是生成内容,而是形成一个关于世界如何运转的内部模型。李飞飞所推动的空间智能路线,以及杨立昆长期倡导的JEPA路线,虽然技术路径不同,但最终都在回答类似的问题。


今年6月,李飞飞发表一篇长文试图进一步厘清世界模型的概念,她认为,世界模型是当今AI最重要,但也是最被过度使用的术语之一。基于这一观察,她按功能,将世界模型划分为渲染器、模拟器和规划器三类。


豪掷82亿美元,芯片巨头押注的世界模型究竟是什么|深度观察


李飞飞


渲染器输出观测,以供人眼观看的像素形式呈现,文生视频是代表产品;


规划器回答的是智能体下一步该做什么,还处于萌芽状态;


模拟器负责输出世界状态,是连接二者的桥梁,最重要也最容易被忽视。


李飞飞认为模拟器提供的是世界模型的结构骨架,它既能从中导出视觉外观供渲染器使用,也能从中导出行动后果供规划器使用。


和李飞飞有所不同,杨立昆认为生成视频不等同于理解世界,你根本不可能预测视频里发生的一切,合理的可能情况有无穷多种。


基于上述分析,杨立昆给出的解决方案是联合嵌入预测架构(JEPA)。


豪掷82亿美元,芯片巨头押注的世界模型究竟是什么|深度观察


杨立昆


杨立昆对JEPA的解释是:为了能够做预测,你需要找到一种抽象。在杨立昆看来,世界模型不应该是模拟器,它们应该在抽象空间中工作。同时,杨立昆还认为,世界模型不应该是生成式模型,也不应该是视频生成系统。


无论是李飞飞给出的“世界模型”定义,还是杨立昆提出的JEPA架构,最终都指向了一个相似的问题——AI能否形成对现实世界的认识,并据此预测环境如何变化、行动会产生什么后果。


# 2
巨头去留间,各有选择


世界模型并不是一个新概念,但新一轮产业热度大约从2024年前后开始,并在2025年至2026年随着视频生成、机器人和Physical AI的快速发展进一步升温。


2025年11月,Meta首席AI科学家杨立昆宣布离职,他在接受采访时表示,2024年前后,Meta逐渐将更多资源转向大语言模型和超级智能方向,FAIR等偏探索性的研究因此受到影响。


事实上,在杨立昆离开之前,Meta已经削减了包括FAIR团队成员在内的部分AI岗位。此时,Meta正在大幅重组AI业务,并将更多资源集中到超级智能和大模型等方向。


离开Meta后,杨立昆个人成立了新公司AMI Labs,延续他在Meta时期的JEPA方向的探索和研究。


豪掷82亿美元,芯片巨头押注的世界模型究竟是什么|深度观察


杨立昆曾多次表示大语言模型不是通往人类级别、类人智能的正确技术路径。今年9月,在纽约的演讲中,杨立昆重申:“如果你关心人类水平的AI,就不要研究LLM。”他把这句话用红色字体放在结尾的PPT中。


不止杨立昆,包括李飞飞在内的研究者,都把世界模型视为通往更高级机器智能的重要技术路径。李飞飞曾在社交平台表示:


大语言模型仍然是黑暗中的文字匠人:能言善辩,却缺乏经验;知识渊博,却脱离现实。


尽管如此,大语言模型仍是当下科技巨头,尤其是互联网巨头押注的重点对象。毕竟,目前来看,世界模型仍处于技术探索期,商业化路径也远未成熟。这便有了杨立昆离职Meta,创立AMI Labs的结果。


当然,这并不是说,Meta等巨头放弃了世界模型路线,只是一个资源取舍问题。


比起Meta,谷歌还在世界模型的方向倾注更多资源。2025年8月,Google DeepMind发布Genie 3,DeepMind表示:“Genie 3是我们突破性的世界模型,可以通过单个文本提示词创建交互式、可玩的环境。从照片般逼真的风景到奇幻的境界,可能性无穷无尽。”


豪掷82亿美元,芯片巨头押注的世界模型究竟是什么|深度观察


Genie 3演示


碰巧的是,杨立昆从Meta离开创立公司不到一年,李飞飞带着他创办两年的World Labs加入芯片巨头AMD——这也展示出两类公司的不同选择,芯片巨头们往往更注重提前预判下一个时代。


对于AMD这样的芯片公司而言,它需要对先进模型保持足够敏锐,才能提前看到未来的算力需求。类似的逻辑,2016年,黄仁勋便亲自向OpenAI交付了第一台DGX-1 AI超级计算机。


现在,AMD收购了一家世界模型公司,英伟达则早在2025年1月发布了Cosmos世界基础模型平台。


# 3
当世界模型,开始“创造世界”


AMD宣布收购World Labs消息的同时,李飞飞发长文回顾了一路走来的历程。她在文章中写道:


宇宙并非由文字构成,而是由真实存在的事物组成。从科学、娱乐到机器人,人工智能需要解决的诸多重要问题,都需要模型来推理物理世界的结构和行为。


随后她回顾了World Labs成立以来的一系列成绩,重点提到近期发布的Atlas。李飞飞称,Atlas解决的是空间智能领域一个长期存在的关键问题:如何仅凭少量2D图像,重建真实空间,并预测此前没有观察到的新视角。它能够用于机器人、娱乐场景生成、房地产、设计、建造等领域。


这正是人们研究世界模型的意义所在。当下的机器人泛化程度仍然有限,往往只能做一些固定的动作,在面对一些突发场景时经常失灵,这正是世界模型所努力解决的问题之一。


不止机器人,在游戏、影视等内容产业领域,世界模型也开始展现出新的应用可能。


World Labs联合创始人Ben Mildenhall曾表示,World Labs一直拥有不少来自创意行业的用户,他们使用相关模型维持2D图像、电影、3D和游戏之间的空间一致性。


谷歌Genie 3最大的变化之一,是从“生成一段视频”走向“生成一个可以实时进入的世界”:它可以根据文字提示生成动态环境,以24fps运行,维持数分钟的世界一致性。


如果说文生视频是在“生成一个镜头”,那么Genie 3开始尝试的是“生成一个可以进入、互动的世界”。这意味着,未来的内容生产对象,可能不再只是“一部电影”“一集电视剧”或者“一条短视频”,而可能变成一个可以持续运行、不断变化、允许用户进入的数字世界。


不久前,彭博社报道称,字节跳动正在基于Seedance开发实时空间视频生成模型。该项目涉及跨部门及算力资源协调,目标并不只是一段生成好的视频,而是一个能够根据用户声音和动作实时变化的虚拟环境,潜在应用包括直播、短剧和游戏,并计划服务Pico头显。



文章来自于微信公众号 “FoST未来叙事”,作者 “FoST未来叙事”

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

3
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0

4
无人直播

【开源免费】VideoChat是一个开源数字人实时对话,该项目支持支持语音输入和实时对话,数字人形象可自定义等功能,首次对话延迟低至3s。

项目地址:https://github.com/Henry-23/VideoChat

在线体验:https://www.modelscope.cn/studios/AI-ModelScope/video_chat


【开源免费】Streamer-Sales 销冠是一个AI直播卖货大模型。该模型具备AI生成直播文案,生成数字人形象进行直播,并通过RAG技术对现有数据进行寻找后实时回答用户问题等AI直播卖货的所有功能。

项目地址:https://github.com/PeterH0323/Streamer-Sales