Whisper对于中文语音识别与转写中文文本优化的实践(Python3.10)

阿里的FunAsr对Whisper中文领域的转写能力造成了一定的挑战，但实际上，Whisper的使用者完全可以针对中文的语音做一些优化的措施，换句话说，Whisper的“默认”形态可能在中文领域斗不过FunAsr，但是经过中文特殊优化的Whisper就未必了。

中文文本标注优化

Whisper经常被人诟病的一点是对中文语音转写后标点符号的支持不够完备。首先安装whisper:

pip install -U openai-whisper

编写转写脚本：

import whisper
device = "cuda:0" if torch.cuda.is_available() else "cpu"
audio = whisper.load_audio(audio_path)
audio = whisper.pad_or_trim(audio)

model = whisper.load_model("large-v2",download_root="./whisper_model/")

mel = whisper.log_mel_spectrogram(audio).to(model.device)

options = whisper.DecodingOptions(beam_size=5)

result = whisper.decode(model, mel, options)
print(result.text)

程序返回：

可以看到，除了语气特别强烈的素材，大部分都没有进行标点符号的标注。

但事实上，Whisper完全可以针对中文进行标注，只需要添加对应的引导词：

options = whisper.DecodingOptions(beam_size=5,prompt="生于忧患，死于欢乐。不亦快哉！")

这里通过prompt对其进行引导，通过逗号、句号以及感叹号对文本标注，引导后的效果：

通过transformers来调用中文模型

transformers是一个用于自然语言处理（NLP）的开源库，由Hugging Face开发和维护。它提供了各种预训练的模型，包括文本生成、文本分类、命名实体识别等多种NLP任务的模型。transformers库基于Transformer模型架构，这是一种用于处理序列数据的深度学习模型。Transformer模型在NLP领域取得了巨大成功，因为它能够处理长距离依赖关系，并且在各种NLP任务上取得了优异的性能。

使用transformers库，开发人员可以轻松地访问和使用各种预训练的NLP模型，也可以使用该库进行模型的微调和训练。transformers库支持多种主流深度学习框架，包括PyTorch和TensorFlow。

首先安装transformers:

pip install -U transformers

编写转写代码：

from transformers import pipeline

device = "cuda:0" if torch.cuda.is_available() else "cpu"

def transcribe_bela(audio_path):

    transcriber = pipeline(
    "automatic-speech-recognition",
    model="BELLE-2/Belle-whisper-large-v2-zh",
    device=device
    )

    transcriber.model.config.forced_decoder_ids = (
    transcriber.tokenizer.get_decoder_prompt_ids(
        language="zh",
        task="transcribe",
    )
    )

    transcription = transcriber(audio_path)

    print(transcription["text"])
    return transcription["text"]

这里通过BELLE-2/Belle-whisper-large-v2-zh模型来进行转写，提高中文的识别准确度和效率。

这个模型是在whisper的large-v2模型上针对中文进行了微调，以增强中文语音识别能力， Belle-whisper-large-v2-zh 在中国 ASR 基准测试（包括 AISHELL1、AISHELL2、WENETSPEECH 和 HKUST）上表现出 30-70% 的相对改进。

该模型的官方地址：

https://huggingface.co/BELLE-2/Belle-whisper-large-v2-zh

当然，也不是没有缺陷，BELLE-2模型目前基于AISHELL、WENETSPEECH等数据做的微调，弱化了标点能力。

换句话说，没法通过引导词来打标，但其实也有其他解决方案，即可以基于标点模型对转写文本加标点。比如这个方案：

https://modelscope.cn/models/damo/punc_ct-transformer_cn-en-common-vocab471067-large/summary

BELLE-2模型的作者相当热心，有问必答，这是笔者对其模型提的Issues:

https://github.com/LianjiaTech/BELLE/issues/571

现在该模型的瓶颈是，如果微调带标点的中文数据，这块开源数据相对比较少，无法进行有效的训练。

除了大模型的中文优化版本，也有针对small模型的中文优化版本：

https://huggingface.co/Jingmiao/whisper-small-chinese_base

结语

Whisper开源模型通过transformers的微调，可以将预训练模型应用于特定的中文NLP任务，从而提高模型在该任务上的性能。微调使模型能够学习适应特定任务的特征和模式，从而实现更好的效果。

出自：https://mp.weixin.qq.com/s/zNTkoYi3B5dENrhZeTGTVw