京东开源实时视频编辑模型,AI终于能边播边改了? [企业追踪]

?辑模型JoyAI-Video-Edit

京东开源了自研实时流式视频编辑模型JoyAI-Video-Edit,直接挑战视频生成行业最耗时的”抽卡”环节。传统流程是输入指令、等生成、看结果、不满意再调,一段视频磨半天。这模型的意思是,视频还在播,你就能改,不用等完整生成。

往好听了说,这是把视频编辑从”批处理”变成”流处理”,直播换商品、家装调风格、户外改天气,模型边看边改。往坏了说,实时编辑的坑比想象中深,视频流持续输入,模型既要理解改哪,还得稳住人物身份、动作轨迹,前面生成的结果还会影响后面,误差一积,画面就漂。京东官方数据是单张NVIDIA B200 GPU下吞吐约30 FPS,响应周期266毫秒,这速度能匹配常见播放,但真实场景的复杂纹理、多人交互,稳定性还待验证。

技术架构上,JoyAI-Video-Edit走的是自回归扩散路线,多模态语言模型编码器加因果视频VAE加多模态扩散Transformer。核心是Chunk式处理加因果注意力,模型只看当前和历史信息,符合实时输入要求。同时用固定窗口控制历史规模,避免视频越长显存爆炸。蒸馏方法Source-Anchored DMD把16B参数模型的推理步骤压下来,才跑得动实时速度。

实测场景里,直播商品替换能跟住人物动作,家装调整保持镜头运动,人手换机械手也能维持抓取连续性。但复杂纹理、文字细节、多人交互,难度直接翻倍。评测数据上,OpenVE-Bench短视频编辑总分3.60,LongV2VBench长视频评测排第一,说明跟离线模型的差距在缩小。就问你喜不喜欢吧?

行业里Seedance、可灵、Vidu、MiniMax H3都在卷生成质量,Runway主攻已有视频修改,京东这次押注的是实时编辑这个细分方向。视频生成解决了从无到有,但广告制作、直播运营、影视后期,大量时间耗在修改上。实时编辑提供了一种新工作方式,直播团队能根据观众反馈即时调商品展示,设计师能边沟通边改空间效果。距离大规模应用还有优化空间,但至少,AI视频编辑终于不用再死等那几轮抽卡了。这波,京东算是踩在了点子上。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
75款App又翻车了,你的隐私在裸奔,但谁在乎呢? [企业追踪]
上一篇 5小时前
港元稳定币大撤退:一张牌照,两种态度,三个尴尬
下一篇 4小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部