语音转写流水线:从音频切片到可检索文本
整理语音转写系统的基础流水线:上传、切片、转写、说话人信息、校对和入库。
语音转写不只是把音频丢给模型。真实系统还要处理文件大小、长音频切片、噪声、时间戳、人工校对和后续检索。OpenAI 音频文档提供了语音转文本和音频相关能力说明。[stt-001]
转写前先处理音频
常见步骤:
- 校验格式和大小。
- 长音频切片。
- 保留原始文件。
- 记录时间偏移。
- 转写后合并段落。
好的转写结果应该能回到原始音频时间点,而不是只有一大段文本。
概念片段:
{
"segment": 12,
"start_ms": 180000,
"end_ms": 195000,
"text": "这里开始讨论 RAG 评估。"
}转写后要进入文本管线
转写文本可以继续做摘要、关键词、章节标题和向量索引。但要保留时间戳,这样用户点击搜索结果时能跳回音频位置。
综合音频和检索资料可以推断:语音知识库的核心不是转写一次,而是让音频、文本和检索结果互相定位。
参考资料
- [stt-001] OpenAI Developers, “Audio and speech”, https://developers.openai.com/api/docs/guides/audio
- [stt-002] OpenAI Developers, “Embeddings”, https://developers.openai.com/api/docs/guides/embeddings