大样本不该生成稠密矩阵
已知说话人数的大输入仍进入谱聚类,O(N²) 相似矩阵造成显著内存开销。
面向语音识别研究与部署的完整工具箱,支持模型训练、离线与流式推理、语音端点检测、标点恢复以及说话人日志等能力。
样本规模决定能不能算,K 是否已知决定应该怎么算;两个维度共同决定聚类路径。
已知说话人数的大输入仍进入谱聚类,O(N²) 相似矩阵造成显著内存开销。
当 K 已知时无需通过谱结构再次估计簇数;可以依据样本规模与先验信息选择线性内存、结果可重复的固定 K 路径。
新增特征归一化与确定性固定 K K-means 分支,使大规模输入绕开稠密相似矩阵和谱分解。
显著降低长音频和大说话人片段集合的内存压力,并通过固定初始化策略提升多次运行的一致性。