第一次看到数字人口播视频的人,通常会先注意到画质,但看满三十秒之后,真正决定"像不像"的其实换了别的东西。我们内部做过一轮盲测,把十几条视频给人看,问哪条最假——结果和画质高低几乎没关系。

真正让人出戏的三件事

  • 断句不自然:把书面语的标点直接当停顿用,念出来就是"播报腔"。人说话不会在每个逗号处都停下来。
  • 节奏一条直线:整段语气平得像在读说明书。真实的口播会有轻重、有快慢,重点句会放慢。
  • 口型和声音对不上:哪怕只差一两帧,观众的潜意识立刻就捕捉到了。

我们的处理顺序

顺着这个结论,我们调整了优化顺序——不再是"先把画面做好",而是:

  1. 先把文案改成适合听的写法,短句为主,去掉书面连接词;
  2. 再处理停顿与重音,让节奏有起伏;
  3. 最后才去调口型同步与画面表现。

顺序反了的话,画面再精致,听起来还是像机器在念稿。

一个具体例子

同一段文案,我们做过两版对比:一版是标准的书面表达,一版换成了短句、加了口语停顿。两版用的是同一个形象、同一套画质参数。给测试者听的时候,第二版被普遍认为"更像真人",而且没有人提到画质。

这也是我们做飞欧 AI 时的一个基本取向:先把"像人在说话"这件事解决掉,再去谈画面。毕竟口播视频的目的是让人听进去,而不是让人欣赏渲染效果。