FunASR 官方语音识别工具箱横幅

FunASR

StarsFunASR Trendshift 排名标记

面向语音识别研究与部署的完整工具箱,支持模型训练、离线与流式推理、语音端点检测、标点恢复以及说话人日志等能力。

End-to-End ASROffline · StreamingModelScope
SPEAKER DIARIZATION · SCALING

让已知 K 真正成为有用的信息

样本规模决定能不能算,K 是否已知决定应该怎么算;两个维度共同决定聚类路径。

INPUTN embeddingsK 是否已知?
N < 2048Spectral保留小样本效果
N ≥ 2048 · K knownNormalized K-meansO(N × K × D)
N ≥ 2048 · K unknownUMAP / HDBSCAN保留原有路径
内存瓶颈

大样本不该生成稠密矩阵

已知说话人数的大输入仍进入谱聚类,O(N²) 相似矩阵造成显著内存开销。

可用先验

已知 K 已经改变了问题

当 K 已知时无需通过谱结构再次估计簇数;可以依据样本规模与先验信息选择线性内存、结果可重复的固定 K 路径。

三路分流

按规模与先验选择算法

新增特征归一化与确定性固定 K K-means 分支,使大规模输入绕开稠密相似矩阵和谱分解。

运行结果

长音频走上线性内存路径

显著降低长音频和大说话人片段集合的内存压力,并通过固定初始化策略提升多次运行的一致性。