适合哪些场景
多人会议、一对一或多人访谈、长通话录音,读起来最难的往往不是“有没有字”,而是“这句话是谁说的”。
说话人分离把连续音频拆成按人分段的文稿;再配合声纹 ID,文稿可以直接带上姓名,方便检索、纪要和引用。
桌面里怎么用
在 Desktop 文件转写中启用声纹 ID 即可。即使尚未登记任何人,也会给出匿名说话人标签,会议内容仍可按人阅读。
若需要真实姓名,可先登记短音频,也可在转写完成页把匿名说话人关联到已有或新建身份。所有本地文件 ASR 模型都支持这套流程。
- 本机处理音频,默认不外传
- 所有本地文件 ASR 模型使用统一产品流程
- 可选声纹 ID,把匿名标签换成姓名
开源内核中的对应能力
同一套 Apache-2.0 开源内核也暴露给 CLI 与本地 HTTP API。命令行可用 openasr transcribe --diarize 输出匿名标签;服务端通过仅管理员可用的 /v1/voice-id/* 管理身份。
说话人嵌入统一使用 ReDimNet2-B6。所需能力包缺失时会明确请求安装;--offline 下直接失败,不会静默跳过或伪造标签。
本地优先与边界
无需注册。常规转写不会静默自动下载缺失模型;用户会看到并确认每一次下载。CLI 的 --offline 在缺模型时直接失败。
目前提供 macOS 与 Windows 桌面应用,没有原生 Linux 桌面应用。Linux 用户可使用预编译 CLI/服务器或自行源码构建。声纹 ID 是标注便利功能,不是身份认证。