京东开源了JoyAI-Video-Edit,一个能边播边改视频的实时流式编辑模型。就问你,等视频生成等到花儿都谢了的日子,是不是该翻篇了?
传统视频生成最大的痛点不是”生成”,是”抽卡”。用户输指令、等结果、不满意、再调整,一段视频反复折腾,时间全耗在等待上。京东这次开源的JoyAI-Video-Edit,直接改写了这个流程——视频还在播,你就能让它改。直播画面里的商品说换就换,室内装修风格说调就调,户外天气说变就变,不用等整段视频生成完,模型跟着视频流持续干活。
往好听了说,这是把视频编辑从”离线批处理”拉进了”实时交互”时代。往坏了说,这玩意儿要是真普及了,那些靠”抽卡”吃饭的同行们,怕是要重新找饭碗了。官方技术报告显示,模型采用自回归扩散架构,由多模态语言模型编码器、因果视频VAE和扩散Transformer组成,单张NVIDIA B200 GPU上跑出约30FPS的吞吐,请求到响应周期266毫秒。数字不唬人,但实时速度只是第一关。
实测才是硬道理。我们拿直播商品替换试了试,模特走秀视频里,商品换掉后还能跟着人物动作走,位置关系基本稳。但遇到复杂纹理、文字细节,难度立马翻倍。家装调整倒是挺实用,直接基于真实视频改视觉效果,不用再生成一张效果图让客户脑补。户外环境转换也能完成,天气氛围说改就改。最狠的是人手换机械手——人手的抓取动作、物体位置关系,换完还能保持连续,这对具身智能的视觉数据扩充是实打实的价值。
但别高兴太早。流式编辑的难点在于模型只能看当前和历史信息,未来帧根本不存在。视频越长,历史状态越积越多,计算量和显存压力都是坎。京东的技术方案用Chunk做处理单元,因果注意力机制保证只看过去,固定窗口控制历史规模,再用Source-Anchored DMD蒸馏减少推理步骤。官方在OpenVE-Bench上拿了3.60分,LongV2VBench长视频评测排第一,速度和质量的距离确实在缩小。
话说回来,实时编辑和生成模型解决的不是同一个问题。Seedance、可灵、Vidu们还在拼生成时长和画质,Runway专注改已有视频,京东现在押注的是”边播边改”的交互方式。直播团队能根据观众反馈即时调商品,设计师能边聊边改方案——这才是真正改变工作流的东西。就问你喜不喜欢吧?
模型能跑通,场景能落地,但距离大规模应用还有优化空间。复杂运动、多人交互、细节纹理,这些坑还得一个个填。不过,能边播边改,这事儿本身就已经值回票价了。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。