文 | 象先志
各个信息流平台都在推音频化, AI 工具也扑在 " 一键生成播客 " 这个形式上。但这个 " 一键生成 " ,结果可能并不那么好。
做深度文章,靠的是实打实的数据、鲜明的立场,还有前后能串起来的逻辑。如果 AI 播客化连这些底子都保不住,那一键按下去,播客里放的就不是你的文章了。
为了验证这个,我从我们以往的文章里节选了两段素材,交给扣子去重构内容并录制播客。
第一段内容是不到六百字的财务分析,我叫它A 段,硬数字密集,测的是 AI 对精确信息的保真度。


为了匹配不同的风格,我们选择了严肃对谈、娱乐相声、学术装逼 作为测试方向。 先拿 A 段摸底,看同一批硬数字在三种风格下分别会怎么处理。
B 段只跑严肃和相声,深挖看看极端立场在严肃对谈里能不能保留,在娱乐相声里会不会被稀释成段子。学术风没跑 B 段,因为 B 段术语少,测不出学术风特有的漏词问题。
我们整体进行了多次测试,第一天 A 段相声模式的音频声线全乱,第二天 B 段相声声线几乎全女声还自动压缩,两天都翻车。第三天我用同样指令再跑一次,看这个风格到底能不能用。
对比的基准是微信文章阅读本身的 " 听全文 "。" 听全文 " 提供的是零改写,像新闻联播,没有情绪。这种 " 不出错但也不出彩 " 的状态,就是我们每天面对的现状。拿扣子做播客,本来是想打破这种平庸,结果发现事情没那么简单。
第一天:A 段三种风格
我先测严肃对谈。新建对话,输入指令,扣子一次性吐出脚本和音频,五分钟搞定。脚本从五百七十字扩到近一千八,十九个硬数字全在。
我核对原文发现问题。" 根本不在一个量级上 " 变成 " 差距已经拉开到四倍以上 "。" 增速掉到了 10.42%" 变成 " 几乎腰斩式下滑 "。更隐蔽的是,AI 在一段尖锐判断后自己加了一句:" 最后说一句,我不是说 WPS 会死,基本盘还在。" 素材里没有这句话,它自己补的缓冲。
音频里数字发音准确,问题全在脚本层。这一次,扣子把模糊判断改成了并无出处的精确数字,还给尖锐结论补了一层缓冲。
我换娱乐相声指令。和严肃版不同,这次扣子先出脚本,确认后再出音频。
脚本把不少精确数字给抹平了,小数点后面的尾数被砍掉,15.78% 干脆没出现。八个数字被模糊化,一个直接丢了。
但比数字更严重的是声线。脚本写了 AB 两个角色,A 是女声,B 是男声。结果音频里 B 的台词几乎全是女声在念,A 的台词也混进了男声。声线全乱了,我根本没法往下听,只能对着脚本一个字一个字核对。双人播客变成单口乱炖。
AI 写的梗(" 月薪对比马斯克 "" 小卖部对沃尔玛 ")也偏安全牌,没有真正的脱口秀节奏。我要求的交锋没执行,结果变成 A 主导、B 捧哏的吐槽大会。
我换学术装逼指令。同样先出脚本,确认后再出音频。脚本把 " 写文档、拉表格 " 升级成 "Document Authoring、Spreadsheet Manipulation",术语密度拉满,十九个数字全保留,甚至带小数点。

听感上就是一堆中英文混杂往外蹦,确实装逼,但不知道是真专业还是假专业。你听到的只是碎片,完整句子早没了。
第二天:B 段两种风格
第一天 A 段相声声线完全混乱。第二天测 B 段时,我在指令里加了约束:"A 男声 B 女声,严格分配,不准混用 "。
我先测 B 段严肃版。素材换成 ".md 正在杀死 .wps"。
" 杀死 " 这个词保留了。但 AI 在前面加了缓冲垫:" 这话听着狠,但事实就是…… " 关键词没删,但先垫了一层软垫。
交锋质量比 A 段好,十二轮硬碰硬,B 全程为 .wps 辩护,没倒戈。声线也对了,A 是男声 B 是女声,没串台。
回头看:严肃风信息保真度最高,数字和立场都保留了,但 AI 会在旁边偷偷加料。
我换相声指令测 B 段。脚本先生成,有三页纸。然后扣子提示 " 脚本太长,精简一下 ",自动压缩后才生成音频。

结局也从互不相让,变成 " 赢家是 .ai"。完全变成和稀泥了。
更麻烦的是,这个决定 AI 在后台就做了,根本没问你。
声线方面,还是同样的问题。几乎全是女声,只有一句 " 好好好,我换个说法…… " 是男声。完全听不出是两个人在对话。
第三天:B 段相声复测
前两天相声都翻车,第三天我用一模一样的指令再跑一次 B 段相声。这次脚本七百五十字,扣子没有被提示 " 太长 ",确认后生成音频。声线分配正确,A 男 B 女,没有串台。内容完整,没有被压缩。
这次终于像回事了,分得清两个人在说话,有相声味,但也没那么好笑。
三次相声两次翻车。第一天 A 段没加约束,声线全乱;第二天 B 段加了约束,仍然几乎全女声;第三天加了约束,才正常。这个风格本身就不稳定,第三次跑通,反而像抽卡抽中了。

总结
把这些放在一起看,严肃风保真度最高,但 AI 在旁边偷偷加料,模糊就脑补,尖锐变温和。相声风问题最杂,数字被抹平,论据被压缩,声线分配三次里两次翻车。学术风是术语一多就漏词漏句。
这次测试只测了扣子,但我看到的改稿倾向反复出现。它把 " 不在一个量级 " 翻译成具体倍数,给 " 杀死 " 前面加 " 这话听着狠 ",脚本太长时直接压缩掉三分之一。这三种操作,在这次六档音频里没缺席过。
而深度内容恰恰需要" 精确、尖锐、有立场 "。
那怎么办?
如果非要用 AI 做播客,几条基于实测的建议:
第一,脚本和音频分步走。先锁死脚本,人工逐句核对后再生成音频,绝不 " 一键 "。
第二,长文最好分段生成。至少能降低脚本被自动压缩的风险。
第三,单声线朗读加人工校对是目前保真度最高的方案。牺牲表现力换完整度。
还有两个方向这次没测,但值得下一轮验证:指令里多写 " 禁止项 " 能不能减少脑补;关键数字写成文字(" 五十九点二九亿 ")能不能避免被四舍五入。
在这六次测试里,生成播客都不只是朗读。严肃版在制造伪精确,相声版丢了数字和论据,学术版漏词漏句。
所以这还是一种权衡,选择风格之前,先弄清你到底想保留哪部分的内容。