出品/未来科技界
人工智能的发展脉络,正经历从“语言文本理解”向“物理真实世界建模”、从“感知理解”向“决策行动”的第二次范式跃迁。在2026世界人工智能大会(WAIC)期间,昆仑万维举办的“世界模型与多模态范式跃迁”专场论坛,凝聚了学术界顶尖学者与产业界领军人物的最新思考。
过去3-4年,生成式AI依靠以Transformer架构为核心的大语言模型取得了惊人的技术突破和商业成功。然而,纯文本或单模态图像生成在面对物理世界的复杂因果关系时,暴露出了致命的缺陷——即对“物理运行法则”的缺失。大语言模型本质上是基于Token序列概率统计的推演,它缺乏对物理空间、三维几何、时间因果链条以及交互反馈的深层认知。
2026年,是世界模型的元年
从2026年开始,AI的核心命题将转向“理解”与“交互”——让AI真正理解物理世界的运行规律,并能与真实环境进行闭环互动,而世界模型正是实现这一跨越的关键技术底座。
所谓世界模型,核心定义可以提炼为:在给定当前状态与特定动作的前提下,模型能够预测并推演下一个时刻的环境状态。与传统单向生成视频模型不同,优秀的世界模型往往具备物理一致性、时间因果律、实时可交互性以及空间长效记忆。
中国科学院院士、南京大学副校长周志华教授在题为《关于世界模型的讨论》的主旨演讲中,将世界模型划分为感知层、理解层与决策层,当前业界讨论大多停留在前两层,即通过视频生成模型模拟物理世界的视觉表现,但真正的产业变革在决策层——解决“该怎么做”的问题。他着重指出决策层世界模型长期面临“多步推演复合误差平方级放大”与“样本复杂度过高”两大理论瓶颈。

(中国科学院院士、南京大学副校长周志华教授)
他分享了团队的最新突破:通过分布匹配技术可将推演误差从平方级压至线性级,验证了长序列推演的可行性。同时,通过创新性地逆向运用贝尔曼方程,将所需样本量降至原来的根号T分之一,为在战斗机操控、智能工厂等代价高昂的现实任务中构建决策世界模型提供了理论基础。
他还提出“学件”概念——由模型与AI自动生成的“规约”共同构成,允许多个异构模型在不公开数据的前提下进行复用与组装,为世界模型从单产线定制走向可成长、可演化的模型生态开辟了新路径。

(Reactor Technologies, Inc. CEO兼联合创始人Alberto Taiuti)
Reactor Technologies, Inc. CEO兼联合创始人Alberto Taiuti则从产业落地角度指出,世界模型已从静态、高延迟、无状态的媒体生成范式,跃迁至有状态、实时交互、具备因果逻辑的新范式。他强调,世界模型不再只是生成视频或图像,而是能够持续推演环境变化并支持双向人机交互的“生成式软件”雏形。
作为主办方,昆仑万维董事长兼CEO方汉把2026年定义为“世界模型的元年”。“AI不再只停留在生成内容,它开始理解世界怎么运行,预判行动会带来什么结果。”方汉表示。

(昆仑万维董事长兼CEO方汉)
方汉在演讲中系统阐述了三项产业预判:
第一,游戏行业将率先被世界模型改变。未来三到五年,世界模型将成为游戏行业的基础设施,彻底刷新内容生产方式,而国产模型已在这一赛道领跑全球。
第二,AI音乐、AI视频等工具将从技术试验变成大众创作工具,大幅降低创作门槛,让更多人的表达得以释放,从而根本性改变音乐乃至整个AIGC产业的创作生态。
第三,世界模型将走出屏幕,进入物理世界。谁能训练出在复杂场景中依然“看得懂、做得对”的模型,谁就拿到物理智能时代的入场券。
三个产业预判,背后是同一个方向:让AI从“会生成”走向“懂世界、能行动”。对应三项预判,昆仑万维也发布了三类模型:Matrix-Game 3.5世界模型、Mureka v9.5与O3音乐大模型以及子公司黎曼动力的Riemann-1.0机器人模型。
Matrix-Game 3.5
昆仑万维首席科学家成宇介绍,传统数据采集面临人工成本高昂、效率极低的痛点,而Matrix-Game 3.5构建了三条自动化数据管线——基于UE5的虚拟引擎自主探索采集、覆盖《GTA V》等3A游戏的跨游戏自动探索采集、以及开放平台游戏视频的自动挖掘与结构化标注——输出Video+Pose+Action+Language的高质量训练数据,目前已积累超500万高质量视频切片、超1万有效训练小时,覆盖1200余个游戏场景。

(昆仑万维首席科学家成宇)
其核心技术突破是Patch级记忆注入,实现了从Frame-level到Patch-level的升级,带来四大优势:更准确的空间记忆检索与跨帧一致性、更稳定的相机运动生成、最大程度保留基座模型动态生成能力的In-context Learning、以及用户可自由编辑记忆块的可控记忆能力。
在推理性能上,Matrix-Game 3.5的5B模型在720p分辨率下单卡20FPS实时生成,具备1分钟记忆能力——这使得它在开源世界模型领域率先真正具备实时交互能力。并且,Matrix-Game从1.0到3.5始终坚持开源。
Mureka v9.5&O3
Mureka的定位是做“最没有AI味”的AI音乐模型。当前AI音乐倾向于通过复杂编配、饱满声部堆砌制造“无瑕疵”的第一印象,结果往往是规整却缺少温度,听完记不住。
Mureka v9.5的改进方向是“做减法”:在真实音乐框架中更克制地处理编配、人声、情绪与Prompt意图,让表达更自然真诚。O3版本则引入test-time scaling扩展MusiCoT推理——让模型在生成中持续审视:局部旋律是否服务全曲目标,编配是否遮蔽人声,情绪是否提前透支。额外推理空间用于回看偏差与自我修正。
目前Mureka已从单一工具升级为完整“版本化制作”平台,支持从“一个想法”到“歌词—人声—角色—歌曲—MV”的完整链路。用户可从一张图、一段视频开始生成匹配音乐,也可从一首歌开始生成MV视觉方案。Character功能允许一段声音、一张照片生成专属歌手角色;AI配乐能自动分析视频画面创作贴合音乐;Agent则通过自然语言一次对话调用全部能力。
Riemann-1.0
具身智能领域长期受制于“专用策略”的局限,比如机器人只能在特定场景执行打螺丝或搬运等单一指令,难以泛化。黎曼动力创始人刘扬指出,VLA模型虽对任务和视觉有语义理解,但缺乏对事态的理解和长期数据,无法完成高质量生成。世界模型的价值在于,不仅在输入端理解环境,更在输出端让模型对未来预测和仿真,形成闭环。

(黎曼动力创始人刘扬)
他展示的Riemann-1.0模型基于超过23.2万小时多源具身交互数据训练,统一融合第一视角人类视频、UMI示教与异构机器人轨迹,并提出全因果世界动作建模架构与三阶段渐进式具身预训练框架:先用无标注人类视频学习基本物理概念,再用带标签数据建立视觉到动作的强连接,最后用高质量机器人数据增强生成可用性。
消融实验表明,在加入大量人类第一视角工作数据后,Riemann-1.0 在收纳整理、厨房清洁、叠衣服等长程任务上的成功率达到了80%-90%。
如何看待大模型对影视行业的冲击?
在论坛最后的圆桌环节,昆仑万维董事长兼CEO方汉、演员黄晓明、王珞丹,爱奇艺高级副总裁杨海涛,以及青年导演崔睿共同参与讨论了AI对影视行业的影响。

王珞丹以自身的“抽卡”经历描述了当前大模型技术下创作者的困境:为求一个理想镜头,她从深夜12点调整提示词到凌晨4点仍未果,直到清晨才抽到满意画面。“我并不知道哪一个词可以出来我想要的画面,但我知道那个画面不是我想要的。”这种创作困境,恰恰暴露了大模型在可控性上的根本短板。模型进化的下一个战场显然不在参数量的堆砌,而在意图理解的精度与生成可控性的跃升。
黄晓明则惊讶于AI进化的速度:“三个月前看朋友制作的AI电影还能看出痕迹,但最近再看,即便你告诉我是AI,我都已经看不出来了,细节到脸上的斑点毛孔,甚至微表情都在演戏”。这种迭代速度,让他得出“只能去学习和拥抱它”的结论。但他同时提出尖锐的版权保护问题:“以后每个人都要注册自己的AI形象,都有版权。”
作为平台方代表,杨海涛透露,爱奇艺后台每日收到超3000部AI短剧和上千部AI漫画,AI内容正在分流真人流量。但他强调,真人就是真人,永远没有办法被取代。用户关注的还是故事、情绪和表演。但在成本端,AI已展现显著价值。
导演崔睿认为AI的真正价值在于解决了“技术难题”——比如需要成千上万群演的大场面,以及保持系列化制作中人物和物体的一致性。
方汉作为技术提供方代表坦言,越是人类难以企及的大场面,模型越游刃有余,越是日常细微的真实质感,反而成为技术盲区。但技术的迭代升级不可阻挡,当越来越多的镜头可以一键生成,创作者的核心竞争力自然从“能不能拍”转向“想不想得到、选不选得对”。他预测后AI时代“演员需学导演、导演需学表演”,角色边界将日益模糊。
结语
“元年”意味着从量变到质变的临界点,我们正在告别单纯追求像素高保真与文本流畅度的“内容生成时代”,跨入以世界模型为底座、以物理规律为约束、以具身智能与交互软件为载体的“世界理解与行动时代”。
这场跃迁并非要取代人类的灵感与情感,而是通过降低创作与行动的门槛,把想象力归还给每一个普通人,把物理世界的复杂性解构为可预测、可协同的智能表征。当AI不仅“会说会画”,更开始“懂世界、能行动”,一个崭新的物理智能时代已悄然开启。
24小时热榜
热门视频
