技术
Findly 的语音定位,卡在信噪比上
2026.06.14 · 1 min
语音识别准确率不是问题,问题是怎么在嘈杂环境里准确提取「物品 + 位置」的结构化信息。
技术路线选择
最初我们尝试了端到端的意图识别方案——直接把语音转成结构化的物品-位置映射。但在实际测试中发现,同一个句子在不同场景下解析结果差异很大。
信噪比问题
"我的钥匙在卧室床头柜抽屉里"——这是一个干净的句子。但现实场景是:
- 厨房里抽油烟机开着
- 客厅里电视在放
- 手里正拿着东西,说话断断续续
在这些场景下,语音识别本身的准确率就下降到了 70% 以下,再从中提取结构化信息就更不可靠了。
我们的方案
最终我们选择了两阶段方案:
- 先做通用语音识别,用正常的 ASR 引擎做第一道转录
- 再用 LLM 做结构化提取,把"我的钥匙在卧室抽屉"转成 { item: "钥匙", location: "卧室抽屉" }
这个方案的准确率从 60% 提升到了 92%。
教训
不要跳过基础的工程问题,信噪比这种老问题,不是靠 AI 魔法就能绕过去的。
技术语音Findly