ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

3行代码听懂会议录音|Transformers语音识别实战

3行代码听懂会议录音|Transformers语音识别实战 3行代码听懂会议录音Transformers语音识别实战【免费下载链接】transformers Transformers: the model-definition framework for state-of-the-art machine learning models in text, vision, audio, and multimodal models, for both inference and training.项目地址: https://gitcode.com/GitHub_Trending/tra/transformers会议录音还在排队等转写你刚结束两小时评审会对着原始录音发呆逐句重听再手动整理一下午就没了。Transformers 框架内置语音识别 pipeline一行调用即可把音频变成文字Whisper 预训练模型即插即用。想快速把录音变纪要、顺手加个翻译这套方案三步跑通依赖、代码、调参都给你备好了。5个节点看懂识别链路音频进去、文字出来中间发生了什么pipeline 先把音频交给特征提取器编码Whisper 编码器-解码器再逐段预测 token最后拼成完整句子。整条链路拆开看只有5步挑模型不用纠结三条路线各管一摊Whisper 多语言抗噪日常会议首选wav2vec 2 走自监督预训练适合手里有标注数据想微调的场景CTC 类模型体积小巧、延迟低适合端侧实时。调度逻辑就写在 automatic_speech_recognition.py想魔改先翻它。测试样本顺带说明一件事同一套 pipeline 机制覆盖文本、图像、音频多种任务语音识别只是其中一个入口。一键拉依赖3行跑通语音识别环境准备只要三行拉取仓库代码、进入项目目录、安装官方示例依赖每行各管一件事。git clone https://gitcode.com/GitHub_Trending/tra/transformers cd transformers pip install -r examples/pytorch/speech-recognition/requirements.txt最小可运行代码from transformers import pipeline import soundfile as sf # 加载预训练 Whisper 模型首次运行自动下载权重 asr pipeline(automatic-speech-recognition, modelopenai/whisper-small) # 读取音频文件Whisper 固定吃 16kHz 采样率 audio, sr sf.read(meeting.wav) # 指定语言转写省去自动检测这一步 result asr(audio, languagezh, tasktranscribe) print(result[text]) # 打印转写文本这段代码只做三件事拿模型、喂音频、收文字。选 whisper-small 是折中——base 精度不够看medium 又慢一拍small 是会议转写的合适起点。显式指定 language 省掉自动检测环节解码路径短一截结果也更稳。参数作用推荐值language指定源语言留空则触发自动检测首段更耗时zhchunk_length_s长音频切段长度直接决定显存峰值30generate_kwargs{num_beams: n}束搜索宽度越大越稳但越慢5用表格定模型用基准验速度选多大的模型看两条线显存预算和音频的语言构成。模型参数量显存压力适用场景whisper-tiny约39M低流程联调、快速冒烟whisper-base约39M低CPU 上跑通完整链路whisper-small约244M中日常会议转写的平衡点whisper-medium约769M高长音频、多语种混合想在自己的硬件上复核吞吐与显存改 benchmark/benchmarks_entrypoint.py 里的模型和 batch 配置即可开跑不用另搭环境。转写翻译两条 pipeline 串起来为什么值得组合转写和翻译是各自独立的模型拆成两条 pipeline 意味着任一环节都能单独换模型、单独调参互不污染。from transformers import pipeline asr pipeline(automatic-speech-recognition, modelopenai/whisper-small) translator pipeline(translation, modelHelsinki-NLP/opus-mt-zh-en) def bilingual_minutes(audio): # 先转写再把中文结果喂给翻译 pipeline zh asr(audio, languagezh)[text] en translator(zh, max_length384)[translation_text] return zh, en仓库里的 run_speech_recognition_seq2seq.py 是这条思路的完整版批量读取数据集、seq2seq 解码、结果写回文件拿来当脚手架正合适。踩坑三分钟自查转出来全是乱码多半采样率不对先把音频重采样到 16kHz 再进模型。长音频显存告急别慌chunk_length_s 从 30 往下调分段喂就行。权重下载卡在半路配置镜像源加断点续传缓存目录别放系统盘。更多坑位记录在 troubleshooting.md报错先对一眼再动手。从跑通到贡献当前版本已收编 Whisper、wav2vec 2、CTC 三条识别路线的 pipeline中文转写、多语言、批量微调都在支持列表里。有想法或抓到 bug按 CONTRIBUTING.md 的流程提个 PR 即可。硬盘里吃灰的录音该开工了。【免费下载链接】transformers Transformers: the model-definition framework for state-of-the-art machine learning models in text, vision, audio, and multimodal models, for both inference and training.项目地址: https://gitcode.com/GitHub_Trending/tra/transformers创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表