Pretrain Data Scaling
如何构建大规模、高质量、可追溯的网页预训练数据?
- 多源数据清洗与归一化
- 近重复控制与质量分层
- 训练反馈驱动持续回流
- 40T 可训练 Token 目标
- 网页数据质量 Pipeline
如何构建大规模、高质量、可追溯的网页预训练数据?
如何让 Agent 在长程任务中持续规划、调用工具并从失败中恢复?
如何让模型在持续演化的攻击中保持可靠、可控的安全边界?
如何把真实开发工作流转化为可执行、可复现的模型评测?
传统代码与 Agent 基准通常由人工或模型合成,任务描述、工作区状态和验证方式都比较理想化;真实开发请求却常依赖本地文件、隐含上下文和不完整意图,因此模型在合成基准上的分数很难直接代表真实工作流能力。
从真实开发者—Agent 会话中构建任务,依次完成隐私筛选、执行环境重建、意图保持式改写与确定性 Verifier 设计;同时控制改写前后的任务分布偏移,让每个实例能够在隔离环境中重复执行和自动判定。
发布 281 个可执行任务,final-vs-source 的最大 JSD 仅 0.0448;系统评测 14 个模型与 Agent 组合,最优通过率仍只有 65.8%,显示真实开发工作流与合成基准之间仍存在明显能力差距。
固定的攻击数据很快会被模型记住,而持续收集人工红队标注成本很高;如果攻击者和防御者分别训练,两侧的能力也难以随对方变化同步演进。
构建攻击者、评估器与防御者三角色闭环:攻击者持续生成更有效且保持多样性的攻击,评估器区分不安全回答、简单拒答和有帮助的安全引导,防御者再根据评估信号优化回答,形成近乎无需人工标注的自进化强化学习过程。
攻击者的对抗有效性提升 20%–50%,防御者安全性能提升 10%–30%;在增强安全性的同时保持通用推理能力,说明三角色共同演化能够持续提高训练难度而不只是在固定数据上过拟合。
模型在不同场景下需要正常回答、展示风险行为或拒绝危险请求,常见做法是为每种安全策略单独训练与部署模型,带来重复训练、显存占用和版本维护成本。
提出 Magic-Token 引导的单阶段协同训练,在同一模型内联合编码 positive、negative 与 rejective 三种安全行为;通过系统级指令和对应控制 Token,在推理阶段切换模型行为,并形成可分离的 Safety Alignment Margin。
8B 模型在安全评测上达到与 SFT+DPO 相当的效果,并在部分安全指标上超过 DeepSeek-R1 671B;单模型即可支持多种安全策略,减少重复训练、部署与后续维护成本。
函数补全或单文件修复无法覆盖真实软件开发中的长期规划、跨模块依赖和工程交付;需要一个从自然语言需求出发、直接考察完整仓库生成能力的评测。
从 104 个真实 Python 项目构建长程任务,只向模型提供自然语言需求与空工作区;Agent 需要自主完成架构设计、依赖选择、多模块实现、测试调试,并最终交付能够安装和运行的完整仓库。
头部模型的平均测试通过率仅为 40.2%。主要失败包括过早终止、全局一致性丢失、跨文件依赖脆弱,以及数百轮交互中长期规划能力不足。
长程信息检索会不断累积网页片段、搜索路径与中间推断,固定保留全部历史容易造成上下文膨胀、信息冲突和 context rot,使 Agent 忘记目标或反复搜索。
将上下文视为需要持续维护的动态内部状态:Agent 主动监测当前信息是否仍然有效,通过反思识别缺口和冲突,再对记忆内容进行保留、压缩或修订,而不是被动等待上下文窗口耗尽。
在 BrowseComp-ZH 上获得最高 11% 的绝对提升,并在长程检索过程中表现出更稳定的信息保留与查询规划能力,验证主动式上下文管理相较静态截断或摘要更有效。

算法实习生 · 2026.07 — 至今
面向大语言模型 Pretrain,建设网页语料从多源接入、标准化清洗、去重、质量建模、分层采样到训练反馈回流的一体化 Data Scaling Pipeline。
目标:推动可训练 Token 规模达到 40TWEB PRETRAIN DATA PIPELINE
多源网页语料
INPUT清洗与近重复控制
PROCESS质量评估与分层
SIGNAL持续回流的数据飞轮
FLYWHEEL训练反馈与能力验证
EVIDENCE围绕多源网页语料建立统一的数据生产链路,将来源、处理版本、清洗规则与去重策略纳入可追溯的数据资产管理。
面向网页内容的可训练性判断,建设自动化质量评估与分层机制,为过滤、采样和数据配比提供稳定质量信号。
将训练与评测反馈回流到数据策略迭代,使语料生产从一次性离线处理转向持续优化,并以 40T 可训练 Token 作为建设目标。

算法实习生 · 2025.07 — 2026.07
围绕领域推理、安全对齐与 Agent 系统能力,参与数据构建、SFT 与强化学习、参数融合、自动化评测和执行轨迹诊断的完整研发链路。
从模型训练延伸到可执行系统评测构建与清洗数学、代码、科学领域 CoT 数据,参与三类 SFT 专家训练、统一离线评测和融合权重选择,支撑 Tiny-R1-32B 的 Branch–Merge Distillation。
参与 TriPlay-RL 三角色自博弈强化学习与 Magic-Token 可切换安全控制研究,覆盖攻击生成、响应评估、防御优化与多安全行为协同训练。
参与上下文管理、执行环境重建、自动化 Verifier 与 Harness 评测,基于完整执行轨迹分析成功率、Token 成本和长程失败模式。
面向数学、代码与科学推理的 32B 领域增强模型:先训练各自专精的领域分支,再把互补能力合并回同一模型,降低多领域混训中的相互干扰。
采用 Branch–Merge Distillation。首先按数学、代码、科学划分高质量 CoT 数据并分别训练领域专家,再在统一评测体系下分析各分支的真实增益,最后通过参数融合搜索把互补能力合并到同一模型。
SPECIALIZE → EVALUATE → MERGE在单个 8B 模型中统一学习正向引导、风险暴露与审慎拒答等安全行为,并通过 Magic Token 在推理时切换行为与地区策略。
先对多种安全行为进行数据自蒸馏,再把正向引导、风险暴露与拒答行为放入同一阶段协同训练。使用轻量 Magic Token 对行为模式和中英文地区策略进行条件控制,让一个模型在推理时选择不同安全边界。
SAFE ≠ REFUSE · CONTROL AT INFERENCE系统评估不同 Agent Harness 如何改变模型的任务成功率、Token 成本与失败模式,把“外壳差异”转化为可复现的实验结论。
在固定任务、模型池、预算与超时条件下,构建 6 类 Harness × 8 个模型后端的对照矩阵。所有运行保留原生提示、工具调用、状态转换与恢复行为,并结合可执行 Oracle 和 LLM Rubric 评分。
SAME MODEL · DIFFERENT SYSTEM独立设计与开发PERSONAL PRODUCT
面向中文 Codex 用户的额度重置追踪站。自动同步公开重置公告,以北京时间和中文速读呈现,并将分散的重置信号整理成清晰、可持续追踪的信息入口。

Committers Team Member
团队围绕 Webots 机器人仿真平台,协同维护核心仿真工具、ROS / ROS 2 集成、云端运行环境、机器人控制器与跨平台发布基础设施,并通过项目模板、文档和社区资源持续建设面向开发者的机器人仿真生态。

基于 Pydantic 的 LLM 结构化输出框架,将响应模型、验证、重试与多提供商适配统一到类型安全的 Python 接口,支持 OpenAI、Anthropic、Gemini、Bedrock 等主流模型服务。
Gemini 请求只浅拷贝最外层参数,嵌套 `safety_settings` 仍与调用方共享;合并默认阈值会原地污染应用配置。复用同一字典发起后续请求时,行为因此取决于它是否曾经过 Instructor。
悬停预览 · 点击固定负单位四元数表示恒等旋转,却会走到零向量归一化,生成 NaN 旋转轴并把崩溃风险带入场景树。这个输入在数学上完全合法,旧实现却把等价表示变成了渲染与仿真的不稳定源。
悬停预览 · 点击固定
面向机器人研究与教学的 Python 工具箱,覆盖串联机械臂的运动学与动力学、雅可比矩阵、轨迹规划和控制,并提供 Puma 560、Franka Panda 等 50 余种机器人模型。
`accel_x()` 会引用未定义变量,并把关节数误当作输出列数,让 7 轴机器人无法返回六维末端加速度。正常调用会直接触发 `NameError`,冗余机械臂的结果形状也与接口承诺不符。
悬停预览 · 点击固定OBJ 解析在读取 token 后又查找字面空格,遇到 Tab、换页符等合法空白时会吞掉后续顶点。四边形可能因此被误读成不足四个顶点,纹理与法线索引也会随之错位。
悬停预览 · 点击固定
Meta Fundamental AI Research 维护的高性能向量相似度搜索与聚类库,使用 C++ 实现并提供完整 Python / NumPy 接口,支持 CPU、GPU 以及十亿级稠密向量索引。
空索引在 BLAS 路径中提前返回,距离与标签缓冲区没有写入哨兵值,可能泄露调用方残留数据。查询规模一旦越过分发阈值,同一个公开接口就会给出与小批次完全不同的结果。
悬停预览 · 点击固定
Georgia Tech Borg Lab 面向机器人与计算机视觉的平滑和建图库,以因子图与贝叶斯网络表达状态估计问题,提供 C++ 核心以及 Python、MATLAB 接口。
先写入 value、后到达 factor 的 pending key 没有索引或 clique,过期时却被送进叶节点边缘化并失败。异步到达会把更新带入不存在的 Bayes-tree 路径。
悬停预览 · 点击固定
面向游戏与 VR 的多核友好型 C++17 刚体物理和碰撞检测库,支持连续碰撞、约束、角色、车辆、布料与确定性仿真,已用于 Horizon Forbidden West 与 Death Stranding 2。
GJK 收敛失败后仍保留被拒绝的支撑点,接触重建形成近退化单纯形,并报告数米级假穿透。原本只是轻微接触的圆柱与胶囊,会被错误解释成约 7.25 米的深度重叠。
悬停预览 · 点击固定
Meta FAIR 面向三维计算机视觉研究构建的 PyTorch 组件库,覆盖异构三角网格、几何变换、可微分渲染、点云与隐式表示,并支持自动微分、批处理和 GPU 加速。
视锥剔除把坐标轴当成顶点轴,实际检查的是一个顶点的三个坐标,而非三个顶点是否同在平面外。它会同时制造误剔除和漏剔除,使渲染结果随顶点顺序发生变化。
悬停预览 · 点击固定
面向机器人感知与自主导航的实时外观建图系统,融合视觉、RGB-D、双目与 LiDAR 数据,覆盖回环检测、图优化、定位和三维建图,并提供 C++ 核心、Qt 桌面工具及 ROS / ROS 2 集成。
无效检测选项在校验前就创建进度对话框;警告后提前返回,留下无法推进也无法收尾的孤立窗口。用户关闭配置警告后,界面仍残留一个没有任务可执行的进度状态。
悬停预览 · 点击固定
面向机器人系统的高性能符号计算、代码生成与非线性优化库,将 Python 中的几何和符号模型转换为可部署的 C++、Rust 等运行时代码,并服务于 SLAM、计算机视觉、运动规划和自主系统。
Rust codegen 把矩阵压成向量,`2×3` 返回值变成六元素 `SVector`,静态形状语义完全丢失。元素数虽然正确,类型系统却无法区分 `2×3`、`3×2` 与 `6×1`。
悬停预览 · 点击固定延迟注解改变 dataclass 字段的运行时类型,使 CLI 与 YAML 对字典配置出现不同解析。同一任务会因入口不同得到不同对象,偏差还可能在评测开始后才显现。
悬停预览 · 点击固定JAX 升级后闭包常量进入 jaxpr 输入序列,provenance 的动态参数与变量映射发生整体错位。结果不是立即崩溃,而是来源追踪悄悄关联到错误输入,影响后续推断解释。
悬停预览 · 点击固定极端反射坐标依靠逐次修正,不仅会触发整数溢出,还可能执行十亿级循环。输入离图像越远,运行时间越不可控,边界函数甚至可能成为整条视觉流水线的阻塞点。
悬停预览 · 点击固定ZenFlow 接受 `topk_ratio=0/1` 和非正 `update_interval`,训练初始化后会触发除零;小分区还可能因整数截断得到 `topk(k=0)`,让索引与梯度缓冲区失去语义。
悬停预览 · 点击固定
面向生产级 Agent 应用的轻量编排框架,统一 Agent、Tool、Handoff、Guardrail、Tracing 与 MCP 接入,支持构建可观测的多 Agent 工作流。
同名 Agent、Tool 与 MCP Server 以显示名作为键,Graphviz 会合并不同实体并制造伪自环。复杂工作流的节点、边和层级因此被错误折叠,图示不再可信。
悬停预览 · 点击固定重复 `adapter_name` 会静默覆盖配置并再次注入层,让已有训练权重处于不可预测的部分更新状态。调用表面成功,模型内部却可能同时混入新旧 Adapter 结构。
悬停预览 · 点击固定非等比例 resize 与 LetterBox 组合后仍使用单一 gain 还原坐标,预测框无法准确回到原图。输入长宽比差异越大,检测框、掩码和关键点的轴向漂移越明显。
悬停预览 · 点击固定CutMix minmax 的随机上界使用排除语义,最右侧和最下方的合法裁剪起点永远不会被采到。增强过程看似正常,边缘区域却在每个 epoch 中持续欠采样。
悬停预览 · 点击固定大坐标多边形计算质心时同时遭遇 int32 溢出和浮点消减,结果会明显漂移甚至失真。大图像、地理坐标或远离原点的几何输入都可能触发这一数值边界。
悬停预览 · 点击固定已知说话人数的大输入仍进入谱聚类,构造 O(N²) 相似矩阵,长音频会产生显著内存压力。片段规模增长后,内存开销会先于真正的聚类计算成为部署瓶颈。
悬停预览 · 点击固定卷积快速路径对 Inf / NaN 权重的行为与通用实现不同,破坏同一算子的 IEEE 754 语义。用户仅仅切换执行路径,就可能得到不同的非有限值传播结果。
悬停预览 · 点击固定`Concept` 的三个可变默认容器跨实例共享,修改一个对象会悄悄污染之后创建的概念。标签、闭包与扩展集合都会跨对象泄漏,错误状态还会随构造顺序变化。
悬停预览 · 点击固定Relax ONNX Reshape 混淆零复制与字面零维,默认模式和 `allowzero=1` 都可能得到错误形状。规则叠加后,同一个 `0` 会在不同路径中被解释成两种含义。
悬停预览 · 点击固定JPEG v2 用 `view()` 展平批次维,transpose 产生的合法非连续 Tensor 会在编码前直接报错。接口明明支持任意前导批次维,却暗中要求调用者先手动整理内存布局。
悬停预览 · 点击固定`repo_ids` 与 `roots` 数量不一致时,普通 `zip` 会静默丢弃尾部数据集,任务却继续完成。最终产物看起来合法,实际来源数量和训练数据内容已经悄悄减少。
悬停预览 · 点击固定