声纹 ID

什么是 OpenASR 声纹 ID?

声纹 ID 是 OpenASR Desktop 的主打能力:用一段短音频登记后,后续本地文件转写可以标出说话人姓名,而不只显示“说话人 1”“说话人 2”。它支持所有本地 ASR 模型:有原生说话人轨道时直接保留,否则使用统一外置管线。登记与匹配默认在本机完成;它不是身份认证。

桌面版本
0.1.22 起
说话人来源
优先原生轨道,否则统一外置分离
默认运行位置
本机
功能定位
说话人标注,非身份认证

解决什么问题

多人录音里,仅把说话人分开还不够。匿名标签能让轮次可读,但读稿时仍要反复对照谁是谁。

声纹 ID 在分离结果之上补上姓名:同一人在长文件里再次开口时,尽量继续使用已登记的名字,而不是不断冒出新的匿名标签。

如何登记

用对方的一段短音频完成登记,大约十秒通常就够。常见格式可用:mp3、m4a、aac、wav。

登记失败时会给出明确原因,而不是静默失败。姓名可事后修改,第一次不必一次定死。

  • 选择任意本地文件 ASR 模型
  • 为需要点名的人登记短音频样本
  • 文件转写时启用声纹 ID,匹配到的片段显示姓名

统一的说话人来源

MOSS 目前可直接提供原生说话人轨道;其他 ASR 模型由 FireRedVAD、segmentation-3.0、ReDimNet2-B6 与自动聚类组成统一外置管线。用户面对的仍是同一个声纹 ID 开关。

声纹 ID 再把这些分离结果与已登记的人对应起来。没有匹配或证据不足时,安全保留匿名说话人标签。

声纹 ID 仅用于 Desktop 本地文件转写;听写、实时字幕和远程计算不提供该功能。

命令行与服务端路径

桌面之外,开源内核的 CLI 可用 --diarize 输出匿名说话人;本地服务端通过仅管理员可用的 /v1/voice-id/* 路由管理人员、样本与授权。

CLI 不存在 speaker enroll 命令。from-audio 服务端路由可接收常见源音频格式,每份登记样本至少需要 10 秒有效语音。

边界与隐私

声纹 ID 用于转写标注,不能当作门禁、登录或法律意义上的身份核验。

OpenASR 无需账号,无遥测,无中央云转写后端。常规转写不会静默自动下载模型;音频默认留在本机。

常见问题

声纹 ID 和说话人分离有什么区别?

说话人分离把音频按不同人标成匿名标签;声纹 ID 在此基础上,把匹配到的人显示为已登记姓名。原生或外置说话人来源由 Desktop 自动选择。

登记需要多长的音频?

每份样本至少需要十秒有效语音。桌面与 from-audio API 路由支持 mp3、m4a、aac、wav 等常见源格式。

声纹会不会上传到云端?

默认不会。登记与匹配在本机完成。OpenASR 不提供中央云转写后端,也没有遥测。只有你主动选择会联网的路径(例如确认下载模型)时才会访问网络。

是不是所有模型都支持声纹 ID?

是,Desktop 本地文件转写中的所有 ASR 模型都支持。模型市场的“内置说话人分离”只表示原生轨道,不是兼容性限制。

声纹 ID 能当身份认证用吗?

不能。它是转写里的说话人标注便利功能,用来让稿子更好读,不用于身份核验、门禁或法律取证。

没有桌面应用也能用吗?

可以。开源内核提供 CLI 匿名 --diarize,以及服务端仅管理员可用的 /v1/voice-id/* API。桌面应用目前提供 macOS 与 Windows 版本;Linux 可用 CLI 或自行部署服务端。