现在用AI生成音视频,经常遇到声音和画面对不上的尴尬。比如人物张嘴说话却传出别人的声音,或者动作节奏和背景音乐完全错位。这主要是因为现有模型把整个提示词压缩成一个笼统的语义向量,没法理清复杂场景里的时间线和角色对应关系。复旦大学和腾讯混元团队最近搞了个新玩意儿叫Baton,它不走寻常路——先画张“语义蓝图”当施工图,再让视频和音频按图索骥同步生成。

Baton的聪明之处在于把“想”和“做”拆成两步。用户给个提示词后,模型先用多模态大模型画出跨模态的语义蓝图,把谁在什么时候做什么、该配什么声音都规划清楚。比如提示词说“小男孩在公园打篮球,背景有欢呼声”,蓝图就会标出运球动作的时间点和对应的音效位置。接着靠VA-Planner生成规划令牌,再用RS-RoPE技术把这些规划精准映射到视频帧和音频波形上,就像给生成过程装了GPS导航.

团队在论文里放了个对比实验,传统模型生成的婚礼视频里,新娘转身时音乐突然卡顿,而Baton生成的版本连花瓣飘落的速度都和钢琴曲节奏严丝合缝。这项技术特别适合做动画短片或者虚拟主播,毕竟谁也不想看到主播嘴型对不上台词。目前论文已经挂在arXiv上,代码据说很快会开源,看来以后做视频剪辑可能真要靠“画蓝图”了。