笔记 / 技术
技术

Findly 的语音定位,卡在信噪比上

2026.06.14 · 1 min

语音识别准确率不是问题,问题是怎么在嘈杂环境里准确提取「物品 + 位置」的结构化信息。

技术路线选择

最初我们尝试了端到端的意图识别方案——直接把语音转成结构化的物品-位置映射。但在实际测试中发现,同一个句子在不同场景下解析结果差异很大。

信噪比问题

"我的钥匙在卧室床头柜抽屉里"——这是一个干净的句子。但现实场景是:

  • 厨房里抽油烟机开着
  • 客厅里电视在放
  • 手里正拿着东西,说话断断续续

在这些场景下,语音识别本身的准确率就下降到了 70% 以下,再从中提取结构化信息就更不可靠了。

我们的方案

最终我们选择了两阶段方案

  1. 先做通用语音识别,用正常的 ASR 引擎做第一道转录
  2. 再用 LLM 做结构化提取,把"我的钥匙在卧室抽屉"转成 { item: "钥匙", location: "卧室抽屉" }

这个方案的准确率从 60% 提升到了 92%。

教训

不要跳过基础的工程问题,信噪比这种老问题,不是靠 AI 魔法就能绕过去的。

技术语音Findly
← 上一篇
Fresho 上线后,先盯住被用户搜索的理由
下一篇 ->
做产品半年,我先学会了删功能
← 返回笔记列表