← 返回首页

ASR对比与感想

发布时间: 2026-07-28 13:23(北京时间)

摘要: 作者分享了对两款语音识别工具的实际对比体验,探讨了说话人标注的必要性、多路ASR与检索增强对成稿质量的提升,并反思了听觉与文字感受的差异。语气务实冷静,偏重工程实践与效率优化。

标签: 语音识别, ASR对比, 工作流, 效率工具, 技术实践, 经验反思, 冷静, 理性分析

字数: 599

原文链接: /7402396589/RaL8Ws4Mz

最近发现用 WorkBuddy 的人开始多起来,所以也听了下这期《以鹅传鹅FM》,另外用 Agent 做了一版润色文字稿发群里了。

以鹅传鹅FM 25.对话WorkBuddy产品负责人:AI时代人应该有两个自己,一个干活,一个生活
h__ps://www.xiaoyuzhoufm.com/episode/6a0c2f741b7bd5029570d8cc

如果只有音视频,没有官方字幕,想要获得文字稿就需要进行 ASR。之前的工作流是使用 Qwen3-ASR-1.7B-gguf 然后 Agent 自行分发子 Agent 来润色、组装。

宝玉老师之前推荐的 MOSS-Transcribe-Diarize 一直没来得及体验,今天试了一下并且和Qwen3-ASR 对比了下。

详细的对比就不展开了,贴个用 Hermes 生成的报告,见附图。

几点感想:

  1. 说话人标注,如果要求不太高,可能是一个代价比较大的需求。理由是我觉得单靠 LLM 根据上下文来推断就可以做到八九成的准确度。

  2. 仅靠单个模型的 ASR 很多时候无法做到完全准确,但如果在 SKILL 里面让 Agent 主动去做一些检索考证的工作,效果会好很多。另外,多路 ASR 并行,交叉比对也会对成稿的质量提升有帮助。

  3. 听一遍与看一遍文字在感受上会有不小的区别,不过我没办法具体描述出区别在哪里。

image