DR 21
Voice AI assistant for macOS. Hold to speak. She takes it from there.
语音转文字 · 6 款工具
对比多款语音转文字 AI 工具,涵盖录音转文字、实时字幕、会议记录、视频转字幕与语音输入等常见场景。
语音转文字 AI 又称自动语音识别(ASR),能把说话的音频转成文字。模型对录音或实时音频进行识别,输出带时间轴的文字稿,通常还会自动加标点、区分不同说话人。工具类型从实时字幕引擎到面向访谈、会议、视频的批量转写服务都有。
把电话、访谈、会议自动转成可搜索的文字稿与摘要。
为视频、播客、短视频批量生成 SRT、VTT 字幕文件。
为听障人群在活动、课堂中提供实时字幕。
用说话代替打字,口述文档、邮件与笔记。
模型把音频转成很短的频谱片段,借助在海量语音数据上训练的声学与语言模型,把声音映射成最可能的文字。如今多采用端到端神经网络(常基于 Transformer,如 Whisper),直接从这些音频特征预测文本。随后再补充标点、区分说话人,并把每个词对齐到时间戳。