资讯详情
MiniMax H3、Seedance 2.5、DeepSeek V4全来了,国产大模型今天有点忙
张永堃| 2026-07-31 18:48:42
MiniMaxH3Seedance2.5DeepSeekV4


出品/未来科技界

作者/张永堃

编辑/李彦

今天是什么日子啊?MiniMax H3、Seedance 2.5、DeepSeek V4-Flash都发布了!

先是MiniMax发布首款开源多模态生成模型H3,直接把视频生成、编辑和多模态理解装进同一个模型,再是字节跳动推出新一代视频创作模型Seedance 2.5,把单次视频生成时长拉长至30秒;另一边,DeepSeek也没闲着,宣布V4-Flash正式版API开启公测,重点升级Agent和代码能力。

一天之内,三款模型集中亮相。两款瞄准视频创作,一款钻进开发者的代码终端,国产大模型厂商像是商量好了一样,在7月的最后一天集体交作业。

MiniMax H3:视频模型也开始追求“全能”

过去的视频模型通常有明确分工。有的负责文生视频,有的擅长图生视频,还有的专门进行视频编辑或动作迁移。用户想完成一条成片,需要在多个模型和工作流之间来回切换。

H3试图拆掉这些边界。

它支持文本、图片、音频和视频等不同形式的输入,在同一套多模态上下文中理解用户的创作意图,再完成生成、编辑和表达。模型可以直出2K分辨率内容,单次最长生成15秒音画视频,并重点提升了指令遵循、文字和品牌信息呈现,以及V2V Motion Transfer,也就是视频到视频动作迁移能力。

例如,广告主可以让模型参考一段真人动作,同时替换人物、服装、产品和场景;电商品牌也可以输入商品图、品牌字体、参考视频和音乐,直接生成包含产品展示、人物表演和品牌信息的广告素材。

从榜单成绩看,H3目前在Artificial Analysis带音频的视频编辑榜单中位列第一,在文生视频和图生视频项目中也处于前列。

从价格来看,H3也颇具竞争力:生成2K视频的价格为0.8元每秒,约为业内同类旗舰模型的三分之一。为了压低成本,MiniMax使用高压缩Tokenizer减少视频生成需要消耗的Token数量,并对异构训练、任务负载均衡和GPU利用效率进行了优化。

与此同时,H3将在近期开放模型权重,成为MiniMax推出的首款开源多模态生成模型。企业可以进行本地部署,再结合自身数据和业务场景做适配;国产芯片厂商也有机会围绕模型进行软硬件优化。

Seedance 2.5:别只给我一段素材,直接把故事讲完

过去使用AI生成视频,经常像是在抽卡。

输入一段提示词,模型可能生成一个不错的镜头,但人物换个角度就像换了张脸,场景一切换,服装、光线和画风也可能跟着“失忆”。想做一分钟视频,创作者往往需要生成十几段素材,再手动挑选、拼接和处理转场。

Seedance 2.5首先想解决的,就是AI视频“一段一段往外蹦”的问题。

这款模型延续了Seedance 2.0统一的多模态音视频联合生成架构,单次可以生成最长30秒的视频,相比上一代的15秒翻了一倍。这里的升级不只是把一个镜头拉长,而是在30秒内组织多个存在逻辑关系的画面,让故事拥有铺垫、推进、转折和收尾。

如果30秒还不够,用户还可以在已有视频后继续生成。模型会尽量保持人物、场景、风格、声音和叙事节奏一致,最终形成数分钟、视听语言相对统一的内容。过去需要拆镜头、反复抽卡、手动拼接的流程,由此被进一步压缩。

Seedance 2.5还在努力摆脱AI视频挥之不去的“油腻感”。人物皮肤不再像打了三层蜡,眼神、材质、光影和画面饱和度更接近实拍,同时减少模型自作主张添加字幕和背景音乐的情况。

另一项升级是“参考能力”。用户一次最多可以输入30张图片、10段视频和10段音频,让模型同时参考不同素材中的人物、声音、构图、场景、道具和镜头运动。简单来说,以前是给AI发一张参考图,现在可以把人物小传、场景图、动作样片和背景音乐一起扔给它。

Seedance 2.5的编辑能力也被进一步加强。用户可以通过时间戳规定第几秒发生什么剧情、执行什么动作、采用什么视角,也可以只修改局部片段中的人物、声音或者运镜。比如保留演员动作,只把绿幕换成另一处场景;或者人物和画面都不动,只重新设计第5秒到第10秒的镜头运动。

这意味着,Seedance正在从一个“视频素材生成器”,逐渐接近带有导演、摄影和剪辑能力的创作工具。

DeepSeek V4-Flash:模型没变,后训练把它“重新教育”了一遍

7月31日,DeepSeek-V4-Flash正式版API开启公测。用户保持原来的API调用方式,将模型名称设置为deepseek-v4-flash,便可以使用最新版本。

DeepSeek-V4-Flash-0731与此前预览版拥有相同的模型架构和尺寸,性能提升主要来自重新进行的后训练。换句话说,DeepSeek没有给模型换一个更大的脑子,而是把同一个脑子重新送进训练营,重点补习了工具调用、任务规划、代码开发和Agent执行能力。

根据DeepSeek公布的数据,V4-Flash在Terminal Bench 2.1、NL2Repo、DeepSWE、Toolathlon和多个Agent测试中的成绩均获得明显提升,其中Terminal Bench 2.1得分达到82.7。需要说明的是,DSBench-FullStack和DSBench-Hard属于DeepSeek内部测试集,相关成绩仍需要更多外部使用结果验证。

正式版V4-Flash还原生支持Responses API,并针对Codex进行了适配。开发者可以在Codex等Agent开发环境中调用DeepSeek模型,让模型完成代码阅读、任务拆解、文件修改、工具调用和结果检查,而不只是回答一道孤立的编程题。DeepSeek用于完成代码Agent任务的Harness框架也将在后续发布。

某种程度上,V4-Flash的这次升级也重新强调了后训练的价值。当基础模型越来越大、预训练成本越来越高,如何利用高质量数据、强化学习和任务环境,把已有模型“调教”成更可靠的Agent,正在成为另一条竞争主线。

不过,今天升级的只有V4-Flash API,DeepSeek的App、网页端和V4-Pro尚未同步更新。V4-Pro正式版将在随后发布。因此,把今天形容成“Flash全面超越Pro”还有些为时过早,更准确的说法是:轻量模型与旗舰模型之间的能力差距,正在被后训练迅速压缩。

转载之前请先阅读转载说明,违规转载法律必究
寻求报道或合作,请点击这里
如果您加入壹览的讨论群,请联系我们的工作人员(微信号:star_3979)