L3 · 专题文章

语音识别(ASR):把声音转成可计算的语言

语音模型语音识别 ASR样板

理解 ASR 如何从音频信号得到文本,以及它与语言理解系统怎样衔接。

LIVE
CORE 语音识别(ASR):把声音转成可计算的语言
01 WHAT

是什么

把连续语音信号转换为文本或结构化语义的模型

02 WHY

为什么

支撑转写、字幕、语音助手和会议记录等应用

03 HOW

怎么做

先关注音频质量和语言覆盖,再处理后续语言理解

FOCUS

先记住这些

只留最重要的判断,细节见下方实践
01 CORE

声学表征

声学表征:从音频提取特征

02 CORE

解码

解码:从特征预测文字

03 CORE

语言后处理

语言后处理:标点与术语修复

04 CORE

系统集成

系统集成:交给 LLM 或搜索

PRACTICE

建议学习顺序

先理解当前页面解决的问题
再进入架构与关键术语
选择一个下一步节点继续深入
用小型实践验证理解