实现视频“边播边改”,京东开源JoyAI-Video-Edit模型
2026-08-05 14:05:35
8月5日,京东宣布开源自研的实时流式视频编辑模型JoyAI-Video-Edit,彻底破解上述难题。用户可以一边观看视频,一边修改人物与场景,让视频创作从“先有素材再修改”变为可实时互动编辑。在流式实时视频编辑方向,JoyAI-Video-Edit对比当前业内代表性模型,各项指标全面领先,达到世界一流水平。
JoyAI-Video-Edit基于全自研JoyAI-Video模型,在720P分辨率下实现每秒30帧的模型推理速度,能够在保持较高画面清晰度的同时,跟上常见影视视频的播放节奏。此外,此前的流式编辑模型只能处理几秒或分钟级片段,而JoyAI-Video-Edit支持任意时长的稳定流式编辑,可以随着视频持续播放、持续处理。用户不必等待整段视频生成完成,就能在播放过程中实时修改场景、替换物体、调整人物形象或改变画面风格,实现“边观看边创作”。
为了评估模型能力,研究团队将JoyAI-Video-Edit与SANA Streaming、LiveEdit、Xmax-X2.0等国际上有代表性流式视频编辑模型进行对比。结果显示,在覆盖典型视频编辑场景的评测数据中,JoyAI-Video-Edit整体效果全面领先。
在业界权威的OpenVE-Bench通用评测中,模型超越了目前所有的流式编辑方法,在全局风格、局部替换、局部删除和字幕编辑等任务中优势尤其突出,大幅领先行业同类模型。这意味着,JoyAI-Video-Edit在保持实时流式处理优势的同时,也能准确理解编辑意图、稳定完成多类常用编辑任务,兼顾编辑速度与画面效果。
当前,京东正在加速建设全球最大物理世界运营中心,并已经形成面向物理世界的JoyAI模型矩阵:JoyAI-Image-Edit让AI理解与编辑空间,JoyAI-Echo面向长音视频生成,JoyAI-VL-Interaction让AI持续观察并实时回应,JoyAI-Talker提供实时语音交互能力,JoyAI-RA面向机器人操控,形成覆盖语音、图像、视频、实时交互与具身智能的基础模型体系。JoyAI-Video-Edit进一步提升了实时视频编辑能力,并为具身智能大规模数据合成积累底层技术。
24小时热榜
