过去两年,人工智能产业的核心价值在于“生成”——生成文本、图像、视频和音乐。但在2026年7月19日的世界人工智能大会(WAIC)上,昆仑万维科技(天工人工智能的母公司)董事长兼首席执行官方瀚正式宣布2026年为“世界模型元年”,标志着人工智能发展的一个关键转折点,即从内容生成转向理解和与物理世界互动。这并非一句营销口号,而是表明供给侧革命已进入第二阶段:人工智能不再仅仅是内容生产者,它开始理解物理世界。
一、相机类比(续)
这一转变也与方正证券互联网与媒体首席分析师兼人工智能伦理研究主管焦娟提出的相机类比不谋而合。焦娟认为,摄影术的发明并非仅仅为艺术增添了一种新的媒介——它首先摧毁了现实主义绘画的经济基础,然后大幅降低了视觉表达的成本,最终在旧有供给体系的废墟上,孕育出一种全新的艺术形式:电影。技术史表明,真正的革命并非始于创造富足,而是始于摧毁现有的供给结构。人工智能的供给侧革命正遵循着这一轨迹。
二、从“存储框架”到“存储空间”:供给侧革命的深化
在WAIC论坛上,Skywork AI宣布的技术突破揭示了这一深化过程的机制。以世界模型中最棘手的问题——长期记忆——为例。以往的模型通过存储整帧画面来“记忆”信息,但当摄像机移动,所有物体位置发生变化时,模型就无法识别它们了。评估数据显示,没有一款主流世界模型的物体重现率能超过0.6(满分1.0)。Skywork AI新发布的交互式世界模型Matrix-Game 3.5采用了一种截然不同的方法:它不再存储完整的“照片”,而是将每一帧画面分割成无数个小块,每个小块都标记着其精确的三维坐标——与摄像机的距离以及在空间中的位置。这种被称为“块记忆”的机制,代表着从“存储帧”到“存储空间”的升级。模型不再记住“某一帧画面的样子”,而是记住“某一三维位置上存在着什么”。正如技术报告所述,“长期困扰业界的‘物体消失’问题,在真正意义上得到了首次解决。”
这并非渐进式改进,而是人工智能与物理现实关系的一次范式转变。结合PRoPE几何位置编码和Warped RoPE机制,该模型的位置编码不再仅仅记录“时间轴上的哪一秒”和“画面中的哪一行哪一列”,而是演化为一个具有几何意义的世界坐标系。最终成果:一个拥有50亿参数的模型,能够在单个GPU上以720P分辨率和约20帧/秒的帧率实时生成流媒体视频,并具备一分钟的内存容量。正如报告所述,“20帧/秒并非‘播放视频’,而是一个‘鲜活的世界’:你操作,它响应,没有卡顿,没有内存丢失,画面稳定,反应迅速。” 这场供给侧的革命创造了一种全新的、质的飞跃:它不再仅仅是一个视频生成器,而是一个交互式的、鲜活的世界。
三、数据为基础:让人工智能“理解”而不仅仅是“看到”
技术突破背后蕴藏着更深层次的洞见。训练一个世界模型需要的不仅仅是视频,而是包含物理信息的视频。正如技术团队所认识到的,“让人工智能理解物理世界需要为其提供承载物理信息的数据。”他们构建了一个全天候运行的多智能体系统,自动扫描数千场游戏并从多个维度进行评分。更重要的是,他们构建了一个自动化标注流程,对每个视频进行3D重建,估计每一帧的摄像机姿态、深度度量和摄像机内参。该流程的输出结果:超过500万个高质量视频片段,超过1万小时的有效训练数据,涵盖超过1200个游戏场景——每个场景都包含精确的摄像机姿态、深度图和文本描述。焦将其描述为供给侧革命的工业级基础设施:一个将原始像素转化为具有物理规模的训练燃料的“炼油厂”。
四、“不是堆砌参数,而是巧妙的架构”:入门级业务的逻辑
或许最出人意料的决定是团队“几乎完全不添加任何新参数”。除了角色参考适配器之外,Matrix-Game 3.5 的所有核心交互功能——PRoPE 几何编码、Patch Memory 长期记忆、摄像机控制以及动态-静态解耦——都在现有模型架构上实现,无需额外参数。这体现了一种更深层次的设计理念:“模块化、可插拔、可移植”。团队将交互框架构建成一个轻量级的“插件系统”——每个模块独立运行,并且可以快速适配不同的视频基础模型。其实际优势在于:“最大程度地保留了基础视频模型的原生开放式内容生成能力”。这种“不堆砌参数,而是依靠巧妙的架构”的方法揭示了 AIGC 框架第一层的核心逻辑。基础模型公司之间的竞争并非在于谁能堆砌最多的参数,而在于谁能确立整个生态系统必须经过的入口点。真正的游戏规则是建筑的独创性和生态系统的引力,而不是蛮力规模。
开源策略印证了这一逻辑。DiT团队背后的团队,包括纽约大学助理教授谢赛宁,基于开源的Matrix-Game 2.0.构建了Solaris——世界上首个多人视频世界模型。NVIDIA与浙江大学的合作项目Light Interaction则基于Matrix-Game 3.0开发。此外,NVIDIA的SANA-WM和Adobe的RELIC等众多国际领先公司的世界模型项目,都以Matrix-Game相关模型作为对比基准。当世界顶尖的研究人员和公司选择你的基础作为其基础或基准时,你便确立了门户地位。这是门户业务的“定位”阶段——类似于iOS三阶段路径的第一阶段:定位、清算、收益分成。
五、世界模型的三层结构与“学习软件”的概念
学术深度与产业突破相辅相成。中国科学院院士、南京大学教授兼副校长周志华在主题演讲中将世界模型划分为感知层、理解层和决策层,并强调决策层长期以来面临两大理论瓶颈:“多步推理复合误差的平方放大”和“样本复杂度过高”。他分享了团队的最新突破:分布匹配技术可以将推理误差从平方级压缩到线性级,同时创新性地反向应用贝尔曼方程,将所需样本量降低到T的平方根的1/1.更引人注目的是,他提出了“学习软件”(learnware)的概念——由模型和人工智能自动生成的“规范”组成,允许在不泄露底层数据的情况下重用和组装多个异构模型,从而为世界模型从单一流程定制向可扩展、可演化的模型生态系统演进开辟了新路径。学习软件的概念指向这样一个未来:供给侧革命的基础设施将变得可组合、可重用——模型作为构建模块,而不是整体。
六、“毛孔正在发挥作用”:拐点信号
供给侧革命跨越转折点的最鲜明信号并非来自技术专家,而是来自一位演员。中国电影协会副会长黄晓明描述了他观看一部人工智能电影的感受:三个月前,他还能辨别出人工智能的痕迹,但最近一次观看时,“即使有人告诉我这是人工智能制作的,我也分辨不出来。”细节已经达到了“脸上的斑点、毛孔,甚至微表情——毛孔都在动”的程度,这着实让他感到震惊。当一位经验丰富的演员都无法区分人工智能生成的表演与真人表演时,供给侧革命就跨越了“足以用于实验”到“足以与传统制作竞争”的门槛。此时此刻,摄影机摧毁了写实绘画,开始孕育电影。
七、结论:供给侧革命不断深化
对于 Skywork AI 而言,“世界模型元年”并非终点,而是起点。正如方瀚的三大预测所示,世界模型将走出屏幕,融入现实世界;游戏行业将率先转型;AI 音乐和 AI 视频工具将从技术实验演变为大规模创作工具。供给侧革命正在深化:从内容生成到理解物理世界,从离线渲染到实时交互,从无记忆短片到分钟级一致性。
焦的相机比喻依然适用:人工智能首先颠覆了传统的内容生产模式,随后大幅降低了成本,如今,它正通过理解物理现实的世界模型,孕育出全新的内容形式。“未来三到五年,世界模型将成为游戏产业的基础设施,内容生产方式也将彻底革新。” 供给侧的变革仍在继续。我们所见证的并非一个行业的终结,而是另一个行业的开端。
Copyright © 深圳智汇蓝媒科技有限公司-逆传播海外发稿newswires-All Rights Reserved 粤ICP备18027777号