解决什么问题
多人录音里,仅把说话人分开还不够。匿名标签能让轮次可读,但读稿时仍要反复对照谁是谁。
声纹 ID 在分离结果之上补上姓名:同一人在长文件里再次开口时,尽量继续使用已登记的名字,而不是不断冒出新的匿名标签。
如何登记
用对方的一段短音频完成登记,大约十秒通常就够。常见格式可用:mp3、m4a、aac、wav。
登记失败时会给出明确原因,而不是静默失败。姓名可事后修改,第一次不必一次定死。
- 选择任意本地文件 ASR 模型
- 为需要点名的人登记短音频样本
- 文件转写时启用声纹 ID,匹配到的片段显示姓名
统一的说话人来源
MOSS 目前可直接提供原生说话人轨道;其他 ASR 模型由 FireRedVAD、segmentation-3.0、ReDimNet2-B6 与自动聚类组成统一外置管线。用户面对的仍是同一个声纹 ID 开关。
声纹 ID 再把这些分离结果与已登记的人对应起来。没有匹配或证据不足时,安全保留匿名说话人标签。
声纹 ID 仅用于 Desktop 本地文件转写;听写、实时字幕和远程计算不提供该功能。
命令行与服务端路径
桌面之外,开源内核的 CLI 可用 --diarize 输出匿名说话人;本地服务端通过仅管理员可用的 /v1/voice-id/* 路由管理人员、样本与授权。
CLI 不存在 speaker enroll 命令。from-audio 服务端路由可接收常见源音频格式,每份登记样本至少需要 10 秒有效语音。
边界与隐私
声纹 ID 用于转写标注,不能当作门禁、登录或法律意义上的身份核验。
OpenASR 无需账号,无遥测,无中央云转写后端。常规转写不会静默自动下载模型;音频默认留在本机。