返回文章列表

语音转写流水线:从音频切片到可检索文本

整理语音转写系统的基础流水线:上传、切片、转写、说话人信息、校对和入库。

语音转写不只是把音频丢给模型。真实系统还要处理文件大小、长音频切片、噪声、时间戳、人工校对和后续检索。OpenAI 音频文档提供了语音转文本和音频相关能力说明。[stt-001]

转写前先处理音频

常见步骤:

  • 校验格式和大小。
  • 长音频切片。
  • 保留原始文件。
  • 记录时间偏移。
  • 转写后合并段落。

好的转写结果应该能回到原始音频时间点,而不是只有一大段文本。

概念片段:

{
  "segment": 12,
  "start_ms": 180000,
  "end_ms": 195000,
  "text": "这里开始讨论 RAG 评估。"
}

转写后要进入文本管线

转写文本可以继续做摘要、关键词、章节标题和向量索引。但要保留时间戳,这样用户点击搜索结果时能跳回音频位置。

综合音频和检索资料可以推断:语音知识库的核心不是转写一次,而是让音频、文本和检索结果互相定位。

参考资料

  1. [stt-001] OpenAI Developers, “Audio and speech”, https://developers.openai.com/api/docs/guides/audio
  2. [stt-002] OpenAI Developers, “Embeddings”, https://developers.openai.com/api/docs/guides/embeddings