实时转写 · 中英粤
MiMo-V2.5-ASR
小米 MiMo 的端到端大模型,普通话、英语和粤语识别都很强。
本机转写在这台电脑上处理
interview.m4a12:04
我们先对一下这周的发布节奏,
beta 版本可以安排在周五,
然后同步给 design 和 QA,
为什么适合你
MiMo-V2.5-ASR 是小米 MiMo 团队的端到端语音识别模型,面向普通话、英语和粤语。它能较好处理中英混说,并直接输出带标点的文本,适合会议、访谈和嘈杂环境中的重要录音;模型较大,建议在内存充足的设备上使用。
你可以用它做什么
- 普通话识别准确度高,公开基准表现突出。
- 英语与粤语同样可用,也支持中英混说。
- 转写结果自带标点,适合直接阅读和整理。
其他模型
开发者详情 CLI 命令、文件哈希和不同量化版本,适合自动化脚本与完整性校验。
模型详细信息
大小5.4 GB
速度0.5× 倍实时
语言Multilingual
系列mimo-asr
来源XiaomiMiMo
峰值内存7.6 GB
量化方式q4_k
许可证MIT
版本号d555242ba962b3cda675789e0a4a0e9e87d7c947
sha25606c080a4fe040f18b374e740627911877b38af123c0085b912a9d2a941442b4c
使用方式
以下是 CLI/本地服务端示例。桌面应用无需输入任何命令即可运行此模型——用上方的“安装”即可。
$ openasr pull mimo-v2.5-asr:q4 ↓ mimo-v2.5-asr.oasr 5.4 GB ✓ verified sha256 $ openasr transcribe meeting.wav --backend native --model-pack ~/.openasr/models/mimo-v2.5-asr/q4_k/mimo-v2.5-asr-q4_k.oasr ✓ local transcript · 0 bytes sent
$ openasr serve --backend native --model-pack ~/.openasr/models/mimo-v2.5-asr/q4_k/mimo-v2.5-asr-q4_k.oasr --addr 127.0.0.1:8080 ▶ http://127.0.0.1:8080 · model=mimo-v2.5-asr · 0 bytes will leave this host
from openai import OpenAI client = OpenAI(base_url="http://127.0.0.1:8080/v1", api_key="local") audio = open("meeting.wav", "rb") text = client.audio.transcriptions.create(model="mimo-v2.5-asr", file=audio)