2026年10月,一家仅有10人规模、尚无产品与公开名称的AI实验室完成约3000万美元融资,投资方为五源资本与IDG,投后估值达到2亿美元。该实验室创始人田柯宇,正是2024年因字节跳动实习期间代码篡改事件引发广泛争议、同时以第一作者身份获得NeurIPS 2024最佳论文奖的北京大学博士生。
据公开信息,田柯宇团队当前主攻方向为世界模型,其技术路径与主流方案存在明显差异。该团队认为,人类语言在描述物理世界时信息维度不足,难以完整表达物体位置、运动轨迹、光影变化等物理信息,且会消耗额外算力。例如一段橘猫从桌上跳下的五分钟视频,用文字难以精确还原其中的空间与物理细节。因此,团队选择构建一套AI专属的符号语言体系,目前已搭建包含20万个符号的视觉词典,这些符号人类无法直接理解,但可用于视频的表示、压缩与预测。据田柯宇介绍,该方法可将生成一秒钟视频的成本降低至少一个数量级。团队计划向模型输入约1亿小时视频数据,让模型通过这套符号语言学习现实世界规律,最终目标是为机器人、自动驾驶及交互式视频等领域提供基座模型,正式发布时间定于2027年。团队当前重心仍在基座模型研发,暂不急于商业化。
该技术思路可追溯至田柯宇在字节跳动实习期间参与的VAR项目。其以第一作者身份发表的论文《Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction》获得NeurIPS 2024最佳论文奖,为来自中国大陆研究机构的首篇NeurIPS最佳论文。VAR的核心突破在于放弃将图像展平为一维序列的传统自回归路线,转而保留图像二维结构,通过多尺度残差VQ-VAE将图像拆分为由粗到细的分辨率层级,从1×1全局轮廓逐步并行预测至更高分辨率细节。该方案使生成速度提升约20倍,并首次在视觉生成领域验证了接近完美的Scaling Law:当模型参数从3亿扩展至23亿时,性能同步提升,并涌现出零样本图像修复、画面外扩与指令编辑能力。与扩散模型相比,VAR采用纯GPT架构,为多模态统一提供了底层路径。
田柯宇此次创业所切入的世界模型赛道,当前正经历路线分化。以李飞飞为代表的团队多从空间智能与三维表征切入,而田柯宇选择从视觉符号语言与自回归架构出发,试图在视频预测与物理世界模拟层面建立差异化能力。资本在评估该团队时,同时面对其技术爆发力与历史争议的权衡。2024年6月至7月,田柯宇在字节跳动商业化技术部门实习期间,因不满团队算力分配,利用Hugging Face加载模型存档时的安全漏洞,在权重文件中植入恶意代码,动态改写同事训练所用优化器,并随机插入延时指令拖慢训练速度,导致团队30余位研究者约一个季度的工作受到影响。2024年8月,字节跳动解除其实习协议,并将事件同步至北京大学及行业诚信联盟。同年10月,相关聊天截图在社交平台扩散,字节随后公开声明确认辞退实习生,但澄清“涉及8000多张卡、损失千万美元”的说法严重夸大,受影响范围限于内部研究项目。2024年11月,字节跳动向北京市海淀区人民法院提起诉讼,索赔800万元及2万元合理支出,并要求公开赔礼道歉。田柯宇曾多次否认作案并报警维权。2024年12月4日,NeurIPS 2024公布最佳论文名单,田柯宇的VAR论文获奖,时间节点与诉讼进程形成高度重叠。
离开字节后,田柯宇近两年未再发表重要论文,此次以创业者身份重新进入公众视野。他在接受彭博社专访时主动披露了投毒事件的更多细节,但未改变法院已经受理的诉讼事实。对于一级市场而言,该案例反映出当前AI投资中技术判断与团队背景审查之间的张力。世界模型作为大模型之后的重要方向,尚处早期阶段,技术路线尚未收敛,资本对稀缺技术团队的争夺可能继续推高估值,但历史争议对团队长期学术合作、算力获取及人才招募的影响,仍需持续观察。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。