不是把所有数据混在一起,而是先让能力分开生长。
数学、代码与科学数据先各自训练领域专家,再用同一套评测坐标观察增益与回退,最后把互补能力合并到一个 32B 模型。
BRANCH / MATH筛选高质量数学 CoT,让分支集中学习长链推导、验证和答案格式。
EVALUATION TARGETAIME24 · AIME25
SPLIT3 Domains数学、代码、科学 CoT 数据
BRANCHExperts分领域蒸馏与专家训练
EVALUATE5 Axes比较增益并定位能力回退
MERGE32B搜索融合权重并统一部署
02 / MODEL PROFILE
提升不是只发生在一张榜单上
最终模型在 AIME24、AIME25、GPQA、LiveCodeBench 与 IFEval 上形成覆盖推理能力和指令遵循的完整结果,验证了“领域分支训练—统一评测—参数合并”的多领域增强路径。
Qwen3-32BTinyR1-32B
MY SCOPE
我的工作落在数据与训练闭环
我参与领域 CoT 数据收集、清洗与质量筛选,完成数学、代码、科学专家训练与离线评测;在合并阶段参与融合权重选择,重点检查单领域增益是否稳定,以及合并后是否出现能力回退。