最近发现用 WorkBuddy 的人开始多起来,所以也听了下这期《以鹅传鹅FM》,另外用 Agent 做了一版润色文字稿发群里了。
以鹅传鹅FM 25.对话WorkBuddy产品负责人:AI时代人应该有两个自己,一个干活,一个生活
h__ps://www.xiaoyuzhoufm.com/episode/6a0c2f741b7bd5029570d8cc
如果只有音视频,没有官方字幕,想要获得文字稿就需要进行 ASR。之前的工作流是使用 Qwen3-ASR-1.7B-gguf 然后 Agent 自行分发子 Agent 来润色、组装。
宝玉老师之前推荐的 MOSS-Transcribe-Diarize 一直没来得及体验,今天试了一下并且和Qwen3-ASR 对比了下。
详细的对比就不展开了,贴个用 Hermes 生成的报告,见附图。
几点感想:
-
说话人标注,如果要求不太高,可能是一个代价比较大的需求。理由是我觉得单靠 LLM 根据上下文来推断就可以做到八九成的准确度。
-
仅靠单个模型的 ASR 很多时候无法做到完全准确,但如果在 SKILL 里面让 Agent 主动去做一些检索考证的工作,效果会好很多。另外,多路 ASR 并行,交叉比对也会对成稿的质量提升有帮助。
-
听一遍与看一遍文字在感受上会有不小的区别,不过我没办法具体描述出区别在哪里。
