FEATURED PROJECT

Branch–Merge Distillation

Tiny-R1-32B 领域推理模型

面向数学、代码与科学推理的 32B 领域增强模型:先训练各自专精的领域分支,再把互补能力合并回同一模型,降低多领域混训中的相互干扰。

01 / CONTROL SURFACE

不是把所有数据混在一起,而是先让能力分开生长。

数学、代码与科学数据先各自训练领域专家,再用同一套评测坐标观察增益与回退,最后把互补能力合并到一个 32B 模型。

BRANCH INSPECTOR
BRANCH / MATH

筛选高质量数学 CoT,让分支集中学习长链推导、验证和答案格式。

EVALUATION TARGETAIME24 · AIME25
SPLIT3 Domains数学、代码、科学 CoT 数据
BRANCHExperts分领域蒸馏与专家训练
EVALUATE5 Axes比较增益并定位能力回退
MERGE32B搜索融合权重并统一部署
02 / MODEL PROFILE

提升不是只发生在一张榜单上

最终模型在 AIME24、AIME25、GPQA、LiveCodeBench 与 IFEval 上形成覆盖推理能力和指令遵循的完整结果,验证了“领域分支训练—统一评测—参数合并”的多领域增强路径。

Qwen3-32BTinyR1-32B
AIME24
90.9
AIME25
82.7
GPQA
69.4
LiveCodeBench
70.4
IFEval
89.2
Safety
89.5
MY SCOPE

我的工作落在数据与训练闭环

我参与领域 CoT 数据收集、清洗与质量筛选,完成数学、代码、科学专家训练与离线评测;在合并阶段参与融合权重选择,重点检查单领域增益是否稳定,以及合并后是否出现能力回退。