ZHEWEN TAN · PERSONAL HOMEPAGE

谭哲文大语言模型算法研究与工程

我主要做大语言模型预训练数据,也关注 Agent、安全对齐与模型评测。
这里记录我的研究、工程实践、独立产品和开源贡献。

从这里继续了解我的研究与实践

01

研究方向

RESEARCH INTERESTS
收起展开
问题 / Problem方法 / Method证据 / Evidence产出 / Output
01

Pretrain Data Scaling

如何构建大规模、高质量、可追溯的网页预训练数据?

  • 多源数据清洗与归一化
  • 近重复控制与质量分层
  • 训练反馈驱动持续回流
  • 40T 可训练 Token 目标
  • 网页数据质量 Pipeline
Data Scaling Flywheel
02

Agent Systems

如何让 Agent 在长程任务中持续规划、调用工具并从失败中恢复?

  • 上下文主动管理
  • 工具与执行环境编排
  • Harness 轨迹级诊断
  • 106 个离线沙箱任务
  • 5,194 条执行轨迹
Reliable Agent Workflow
03

Safety Alignment

如何让模型在持续演化的攻击中保持可靠、可控的安全边界?

  • 三角色自进化强化学习
  • 单模型可切换安全控制
  • 攻击—评估—防御闭环
  • ACL 2026 Main
  • AAAI 2026
Adaptive Safety Control
04

Evaluation

如何把真实开发工作流转化为可执行、可复现的模型评测?

  • 真实会话隐私筛选
  • 执行环境重建
  • 确定性 Verifier 与轨迹分析
  • 281 个可执行任务
  • 14 个模型系统评测
Executable Benchmark
02

所选论文

SELECTED PUBLICATIONS
收起展开
01EMNLP 2026 MainRealClawBench: Live OpenClaw Benchmarks from Real Developer-Agent Sessions共同一作281 Tasks · 14 Systems+
研究问题

传统代码与 Agent 基准通常由人工或模型合成,任务描述、工作区状态和验证方式都比较理想化;真实开发请求却常依赖本地文件、隐含上下文和不完整意图,因此模型在合成基准上的分数很难直接代表真实工作流能力。

核心方法

从真实开发者—Agent 会话中构建任务,依次完成隐私筛选、执行环境重建、意图保持式改写与确定性 Verifier 设计;同时控制改写前后的任务分布偏移,让每个实例能够在隔离环境中重复执行和自动判定。

公开结果

发布 281 个可执行任务,final-vs-source 的最大 JSD 仅 0.0448;系统评测 14 个模型与 Agent 组合,最优通过率仍只有 65.8%,显示真实开发工作流与合成基准之间仍存在明显能力差距。

阅读论文原文
02ACL 2026 MainTriPlay-RL: Tri-Role Self-Play Reinforcement Learning for LLM Safety Alignment第一作者+20%–50% Attack · +10%–30% Defense+
研究问题

固定的攻击数据很快会被模型记住,而持续收集人工红队标注成本很高;如果攻击者和防御者分别训练,两侧的能力也难以随对方变化同步演进。

核心方法

构建攻击者、评估器与防御者三角色闭环:攻击者持续生成更有效且保持多样性的攻击,评估器区分不安全回答、简单拒答和有帮助的安全引导,防御者再根据评估信号优化回答,形成近乎无需人工标注的自进化强化学习过程。

公开结果

攻击者的对抗有效性提升 20%–50%,防御者安全性能提升 10%–30%;在增强安全性的同时保持通用推理能力,说明三角色共同演化能够持续提高训练难度而不只是在固定数据上过拟合。

阅读论文原文
03AAAI 2026Efficient Switchable Safety Control in LLMs via Magic-Token-Guided Co-Training学生一作1 Model · 3 Safety Modes+
研究问题

模型在不同场景下需要正常回答、展示风险行为或拒绝危险请求,常见做法是为每种安全策略单独训练与部署模型,带来重复训练、显存占用和版本维护成本。

核心方法

提出 Magic-Token 引导的单阶段协同训练,在同一模型内联合编码 positive、negative 与 rejective 三种安全行为;通过系统级指令和对应控制 Token,在推理阶段切换模型行为,并形成可分离的 Safety Alignment Margin。

公开结果

8B 模型在安全评测上达到与 SFT+DPO 相当的效果,并在部分安全指标上超过 DeepSeek-R1 671B;单模型即可支持多种安全策略,减少重复训练、部署与后续维护成本。

阅读论文原文
04ICML 2026NL2Repo-Bench: Towards Long-Horizon Repository Generation Evaluation of Coding AgentsContributors104 Repositories · 40.2% Pass+
研究问题

函数补全或单文件修复无法覆盖真实软件开发中的长期规划、跨模块依赖和工程交付;需要一个从自然语言需求出发、直接考察完整仓库生成能力的评测。

核心方法

从 104 个真实 Python 项目构建长程任务,只向模型提供自然语言需求与空工作区;Agent 需要自主完成架构设计、依赖选择、多模块实现、测试调试,并最终交付能够安装和运行的完整仓库。

公开结果

头部模型的平均测试通过率仅为 40.2%。主要失败包括过早终止、全局一致性丢失、跨文件依赖脆弱,以及数百轮交互中长期规划能力不足。

阅读论文原文
05ACL 2026 FindingsARC: Active and Reflection-driven Context Management for Long-Horizon Information Seeking AgentsCo-authorBrowseComp-ZH · +11%+
研究问题

长程信息检索会不断累积网页片段、搜索路径与中间推断,固定保留全部历史容易造成上下文膨胀、信息冲突和 context rot,使 Agent 忘记目标或反复搜索。

核心方法

将上下文视为需要持续维护的动态内部状态:Agent 主动监测当前信息是否仍然有效,通过反思识别缺口和冲突,再对记忆内容进行保留、压缩或修订,而不是被动等待上下文窗口耗尽。

公开结果

在 BrowseComp-ZH 上获得最高 11% 的绝对提升,并在长程检索过程中表现出更稳定的信息保留与查询规划能力,验证主动式上下文管理相较静态截断或摘要更有效。

阅读论文原文
03

实习经历

EXPERIENCE
收起展开
01

小红书 · Dots(Pretrain)

算法实习生 · 2026.07 — 至今

Web Pretrain Data Scaling

面向大语言模型 Pretrain,建设网页语料从多源接入、标准化清洗、去重、质量建模、分层采样到训练反馈回流的一体化 Data Scaling Pipeline。

目标:推动可训练 Token 规模达到 40T

WEB PRETRAIN DATA PIPELINE

数据治理质量信号训练反馈
01
Web Data

多源网页语料

INPUT
02
Clean / Dedup

清洗与近重复控制

PROCESS
03
Quality

质量评估与分层

SIGNAL
04
Data Scaling

持续回流的数据飞轮

FLYWHEEL
05
Pretrain / Eval

训练反馈与能力验证

EVIDENCE
ProvenanceQuality SignalsTraining Feedback40T TARGET
01
DATA GOVERNANCE

网页语料治理

围绕多源网页语料建立统一的数据生产链路,将来源、处理版本、清洗规则与去重策略纳入可追溯的数据资产管理。

02
QUALITY MODELING

质量评估与分层

面向网页内容的可训练性判断,建设自动化质量评估与分层机制,为过滤、采样和数据配比提供稳定质量信号。

03
SCALING FLYWHEEL

训练反馈数据飞轮

将训练与评测反馈回流到数据策略迭代,使语料生产从一次性离线处理转向持续优化,并以 40T 可训练 Token 作为建设目标。

02

360 · 智脑事业部(AIGC)

算法实习生 · 2025.07 — 2026.07

LLM Reasoning · Safety · Agent

围绕领域推理、安全对齐与 Agent 系统能力,参与数据构建、SFT 与强化学习、参数融合、自动化评测和执行轨迹诊断的完整研发链路。

从模型训练延伸到可执行系统评测
01
DOMAIN REASONING

领域推理与模型融合

构建与清洗数学、代码、科学领域 CoT 数据,参与三类 SFT 专家训练、统一离线评测和融合权重选择,支撑 Tiny-R1-32B 的 Branch–Merge Distillation。

02
SAFETY ALIGNMENT

自进化安全对齐

参与 TriPlay-RL 三角色自博弈强化学习与 Magic-Token 可切换安全控制研究,覆盖攻击生成、响应评估、防御优化与多安全行为协同训练。

03
AGENT EVALUATION

Agent 系统与评测

参与上下文管理、执行环境重建、自动化 Verifier 与 Harness 评测,基于完整执行轨迹分析成功率、Token 成本和长程失败模式。

04

代表项目

PROJECTS
收起展开
01Branch–Merge Distillation

Tiny-R1-32B

面向数学、代码与科学推理的 32B 领域增强模型:先训练各自专精的领域分支,再把互补能力合并回同一模型,降低多领域混训中的相互干扰。

CORE APPROACH

采用 Branch–Merge Distillation。首先按数学、代码、科学划分高质量 CoT 数据并分别训练领域专家,再在统一评测体系下分析各分支的真实增益,最后通过参数融合搜索把互补能力合并到同一模型。

SPECIALIZE → EVALUATE → MERGE
KEY RESULTS
AIME2490.9AIME2582.7GPQA69.4LCB70.4IFEval89.2
查看项目详情
02Magic-Token Safety Control

TinyR1-Safety-8B

在单个 8B 模型中统一学习正向引导、风险暴露与审慎拒答等安全行为,并通过 Magic Token 在推理时切换行为与地区策略。

CORE APPROACH

先对多种安全行为进行数据自蒸馏,再把正向引导、风险暴露与拒答行为放入同一阶段协同训练。使用轻量 Magic Token 对行为模式和中英文地区策略进行条件控制,让一个模型在推理时选择不同安全边界。

SAFE ≠ REFUSE · CONTROL AT INFERENCE
KEY RESULTS
Safety Avg97.7AdvBench99.0HarmfulQA100S-Eval Attack95.0StrongREJECT96.3
查看项目详情
03Agent Harness Evaluation

Harness-Bench

系统评估不同 Agent Harness 如何改变模型的任务成功率、Token 成本与失败模式,把“外壳差异”转化为可复现的实验结论。

CORE APPROACH

在固定任务、模型池、预算与超时条件下,构建 6 类 Harness × 8 个模型后端的对照矩阵。所有运行保留原生提示、工具调用、状态转换与恢复行为,并结合可执行 Oracle 和 LLM Rubric 评分。

SAME MODEL · DIFFERENT SYSTEM
KEY RESULTS
离线任务106执行轨迹5,194Harness × Model6 × 8
查看项目详情
05

个人产品

INDEPENDENT PRODUCT
收起展开
RESET SIGNALBEIJING TIME · AUTO SYNC
CODEX重置了吗?公开信号追踪中
最近一次重置中文已同步公开来源可追溯
历史记录26 周日历按北京时间整理
到达提醒邮件 · 微信重要更新及时获知

独立设计与开发PERSONAL PRODUCT

AI-RESETS.COM

Codex 重置了吗?

LIVE

面向中文 Codex 用户的额度重置追踪站。自动同步公开重置公告,以北京时间和中文速读呈现,并将分散的重置信号整理成清晰、可持续追踪的信息入口。

公开数据同步北京时间历史日历邮件 + 微信提醒
ai-resets.com
06

开源贡献

OPEN SOURCE
收起展开
01
OPEN-SOURCE MEMBERSHIP

组织与团队身份

收起展开
ORGANIZATION MEMBERSHIP

Cyberbotics Ltd.

Committers Team Member

26
PUBLIC REPOSITORIES

团队围绕 Webots 机器人仿真平台,协同维护核心仿真工具、ROS / ROS 2 集成、云端运行环境、机器人控制器与跨平台发布基础设施,并通过项目模板、文档和社区资源持续建设面向开发者的机器人仿真生态。

查看 GitHub 组织
02
PULL REQUEST CONTRIBUTIONS

代码贡献

收起展开

Instructor

Stars

基于 Pydantic 的 LLM 结构化输出框架,将响应模型、验证、重试与多提供商适配统一到类型安全的 Python 接口,支持 OpenAI、Anthropic、Gemini、Bedrock 等主流模型服务。

查看我的贡献
InstructorCONTRIBUTOR
发现问题

Gemini 请求只浅拷贝最外层参数,嵌套 `safety_settings` 仍与调用方共享;合并默认阈值会原地污染应用配置。复用同一字典发起后续请求时,行为因此取决于它是否曾经过 Instructor。

悬停预览 · 点击固定
查看完整贡献

Webots

Stars

Cyberbotics 维护的开源机器人仿真平台,用于建模、编程和仿真机器人、车辆与机械系统,覆盖三维物理环境、传感器、控制器以及 ROS / ROS 2 工作流。

查看我的贡献
WebotsCONTRIBUTOR
发现问题

负单位四元数表示恒等旋转,却会走到零向量归一化,生成 NaN 旋转轴并把崩溃风险带入场景树。这个输入在数学上完全合法,旧实现却把等价表示变成了渲染与仿真的不稳定源。

悬停预览 · 点击固定
查看完整贡献

Robotics Toolbox

Stars

面向机器人研究与教学的 Python 工具箱,覆盖串联机械臂的运动学与动力学、雅可比矩阵、轨迹规划和控制,并提供 Puma 560、Franka Panda 等 50 余种机器人模型。

查看我的贡献
Robotics ToolboxCONTRIBUTOR
发现问题

`accel_x()` 会引用未定义变量,并把关节数误当作输出列数,让 7 轴机器人无法返回六维末端加速度。正常调用会直接触发 `NameError`,冗余机械臂的结果形状也与接口承诺不符。

悬停预览 · 点击固定
查看完整贡献

Simbody

Stars

高性能 C++ 多体动力学与物理仿真库,用于模拟人体骨骼、机器人、车辆等关节化生物力学与机械系统,是 OpenSim 等科学计算项目的底层基础设施。

查看我的贡献
SimbodyCONTRIBUTOR
发现问题

OBJ 解析在读取 token 后又查找字面空格,遇到 Tab、换页符等合法空白时会吞掉后续顶点。四边形可能因此被误读成不足四个顶点,纹理与法线索引也会随之错位。

悬停预览 · 点击固定
查看完整贡献

Faiss

Stars

Meta Fundamental AI Research 维护的高性能向量相似度搜索与聚类库,使用 C++ 实现并提供完整 Python / NumPy 接口,支持 CPU、GPU 以及十亿级稠密向量索引。

查看我的贡献
FaissCONTRIBUTOR
发现问题

空索引在 BLAS 路径中提前返回,距离与标签缓冲区没有写入哨兵值,可能泄露调用方残留数据。查询规模一旦越过分发阈值,同一个公开接口就会给出与小批次完全不同的结果。

悬停预览 · 点击固定
查看完整贡献

GTSAM

Stars

Georgia Tech Borg Lab 面向机器人与计算机视觉的平滑和建图库,以因子图与贝叶斯网络表达状态估计问题,提供 C++ 核心以及 Python、MATLAB 接口。

查看我的贡献
GTSAMCONTRIBUTOR
发现问题

先写入 value、后到达 factor 的 pending key 没有索引或 clique,过期时却被送进叶节点边缘化并失败。异步到达会把更新带入不存在的 Bayes-tree 路径。

悬停预览 · 点击固定
查看完整贡献

Jolt Physics

Stars

面向游戏与 VR 的多核友好型 C++17 刚体物理和碰撞检测库,支持连续碰撞、约束、角色、车辆、布料与确定性仿真,已用于 Horizon Forbidden West 与 Death Stranding 2。

查看我的贡献
Jolt PhysicsCONTRIBUTOR
发现问题

GJK 收敛失败后仍保留被拒绝的支撑点,接触重建形成近退化单纯形,并报告数米级假穿透。原本只是轻微接触的圆柱与胶囊,会被错误解释成约 7.25 米的深度重叠。

悬停预览 · 点击固定
查看完整贡献

PyTorch3D

Stars

Meta FAIR 面向三维计算机视觉研究构建的 PyTorch 组件库,覆盖异构三角网格、几何变换、可微分渲染、点云与隐式表示,并支持自动微分、批处理和 GPU 加速。

查看我的贡献
PyTorch3DCONTRIBUTOR
发现问题

视锥剔除把坐标轴当成顶点轴,实际检查的是一个顶点的三个坐标,而非三个顶点是否同在平面外。它会同时制造误剔除和漏剔除,使渲染结果随顶点顺序发生变化。

悬停预览 · 点击固定
查看完整贡献

RTAB-Map

Stars

面向机器人感知与自主导航的实时外观建图系统,融合视觉、RGB-D、双目与 LiDAR 数据,覆盖回环检测、图优化、定位和三维建图,并提供 C++ 核心、Qt 桌面工具及 ROS / ROS 2 集成。

查看我的贡献
RTAB-MapCONTRIBUTOR
发现问题

无效检测选项在校验前就创建进度对话框;警告后提前返回,留下无法推进也无法收尾的孤立窗口。用户关闭配置警告后,界面仍残留一个没有任务可执行的进度状态。

悬停预览 · 点击固定
查看完整贡献

SymForce

Stars

面向机器人系统的高性能符号计算、代码生成与非线性优化库,将 Python 中的几何和符号模型转换为可部署的 C++、Rust 等运行时代码,并服务于 SLAM、计算机视觉、运动规划和自主系统。

查看我的贡献
SymForceCONTRIBUTOR
发现问题

Rust codegen 把矩阵压成向量,`2×3` 返回值变成六元素 `SVector`,静态形状语义完全丢失。元素数虽然正确,类型系统却无法区分 `2×3`、`3×2` 与 `6×1`。

悬停预览 · 点击固定
查看完整贡献

LM Evaluation Harness

Stars

广泛使用的大语言模型评测框架,将任务定义、few-shot 模板、生成参数和推理后端统一到可复现流水线,支持跨模型、跨基准的标准化比较。

查看我的贡献
LM Evaluation HarnessCONTRIBUTOR
发现问题

延迟注解改变 dataclass 字段的运行时类型,使 CLI 与 YAML 对字典配置出现不同解析。同一任务会因入口不同得到不同对象,偏差还可能在评测开始后才显现。

悬停预览 · 点击固定
查看完整贡献

NumPyro

Stars

建立在 JAX 之上的概率编程框架,覆盖 HMC、NUTS、SVI 等贝叶斯推断算法,并利用 JIT、自动微分和多设备并行提升推断效率。

查看我的贡献
NumPyroCONTRIBUTOR
发现问题

JAX 升级后闭包常量进入 jaxpr 输入序列,provenance 的动态参数与变量映射发生整体错位。结果不是立即崩溃,而是来源追踪悄悄关联到错误输入,影响后续推断解释。

悬停预览 · 点击固定
查看完整贡献

OpenCV

Stars

跨平台计算机视觉基础库,提供图像处理、几何变换、特征提取、视频分析与深度学习推理等大量工程级算子和统一接口。

查看我的贡献
OpenCVCONTRIBUTOR
发现问题

极端反射坐标依靠逐次修正,不仅会触发整数溢出,还可能执行十亿级循环。输入离图像越远,运行时间越不可控,边界函数甚至可能成为整条视觉流水线的阻塞点。

悬停预览 · 点击固定
查看完整贡献

DeepSpeed

Stars

面向大模型训练与推理的分布式深度学习优化系统,通过 ZeRO、并行训练、通信优化与内存管理降低超大模型的训练成本,并提升多 GPU / 多节点执行效率。

查看我的贡献
DeepSpeedCONTRIBUTOR
发现问题

ZenFlow 接受 `topk_ratio=0/1` 和非正 `update_interval`,训练初始化后会触发除零;小分区还可能因整数截断得到 `topk(k=0)`,让索引与梯度缓冲区失去语义。

悬停预览 · 点击固定
查看完整贡献

OpenAI Agents SDK

Stars

面向生产级 Agent 应用的轻量编排框架,统一 Agent、Tool、Handoff、Guardrail、Tracing 与 MCP 接入,支持构建可观测的多 Agent 工作流。

查看我的贡献
OpenAI Agents SDKCONTRIBUTOR
发现问题

同名 Agent、Tool 与 MCP Server 以显示名作为键,Graphviz 会合并不同实体并制造伪自环。复杂工作流的节点、边和层级因此被错误折叠,图示不再可信。

悬停预览 · 点击固定
查看完整贡献

PEFT

Stars

Hugging Face 的参数高效微调框架,通过 LoRA、IA³、AdaLoRA 等方法只训练少量参数,降低 Transformer 与 Diffusion 模型适配成本。

查看我的贡献
PEFTCONTRIBUTOR
发现问题

重复 `adapter_name` 会静默覆盖配置并再次注入层,让已有训练权重处于不可预测的部分更新状态。调用表面成功,模型内部却可能同时混入新旧 Adapter 结构。

悬停预览 · 点击固定
查看完整贡献

Ultralytics YOLO

Stars

覆盖目标检测、实例分割、图像分类、姿态估计与多目标跟踪的视觉平台,提供从数据训练到部署推理的一体化 Python 与 CLI 工作流。

查看我的贡献
Ultralytics YOLOCONTRIBUTOR
发现问题

非等比例 resize 与 LetterBox 组合后仍使用单一 gain 还原坐标,预测框无法准确回到原图。输入长宽比差异越大,检测框、掩码和关键点的轴向漂移越明显。

悬停预览 · 点击固定
查看完整贡献

timm

Stars

大规模 PyTorch 图像模型库,汇集分类与视觉骨干网络、预训练权重、数据增强和训练工具,是视觉模型研究与复现的重要基础设施。

查看我的贡献
timmCONTRIBUTOR
发现问题

CutMix minmax 的随机上界使用排除语义,最右侧和最下方的合法裁剪起点永远不会被采到。增强过程看似正常,边缘区域却在每个 epoch 中持续欠采样。

悬停预览 · 点击固定
查看完整贡献

Supervision

Starsv0.30.1 正式发布

面向计算机视觉工程的通用工具库,覆盖检测结果表示、几何计算、标注渲染、视频跟踪与数据集处理,连接模型输出与业务分析。

查看我的贡献
SupervisionCONTRIBUTOR
发现问题

大坐标多边形计算质心时同时遭遇 int32 溢出和浮点消减,结果会明显漂移甚至失真。大图像、地理坐标或远离原点的几何输入都可能触发这一数值边界。

悬停预览 · 点击固定
查看完整贡献

FunASR

Stars

面向语音识别研究与部署的完整工具箱,支持模型训练、离线与流式推理、语音端点检测、标点恢复以及说话人日志等能力。

查看我的贡献
FunASRCONTRIBUTOR
发现问题

已知说话人数的大输入仍进入谱聚类,构造 O(N²) 相似矩阵,长音频会产生显著内存压力。片段规模增长后,内存开销会先于真正的聚类计算成为部署瓶颈。

悬停预览 · 点击固定
查看完整贡献

Burn

Stars

以 Rust 构建的跨平台深度学习框架,兼顾训练、推理、自动微分和多后端部署,强调类型安全、性能以及从桌面到嵌入式设备的可移植性。

查看我的贡献
BurnCONTRIBUTOR
发现问题

卷积快速路径对 Inf / NaN 权重的行为与通用实现不同,破坏同一算子的 IEEE 754 语义。用户仅仅切换执行路径,就可能得到不同的非有限值传播结果。

悬停预览 · 点击固定
查看完整贡献

NLTK

Stars

经典自然语言处理工具库,覆盖分词、词性标注、句法与语义分析、语料库接口和教学资源,为 NLP 研究、原型验证与课程实践提供稳定基础设施。

查看我的贡献
NLTKCONTRIBUTOR
发现问题

`Concept` 的三个可变默认容器跨实例共享,修改一个对象会悄悄污染之后创建的概念。标签、闭包与扩展集合都会跨对象泄漏,错误状态还会随构造顺序变化。

悬停预览 · 点击固定
查看完整贡献

Apache TVM

Stars

面向深度学习模型的开源编译器栈,将来自 ONNX、PyTorch 等框架的计算图导入统一中间表示,并针对不同硬件完成图优化、算子生成与高性能部署。

查看我的贡献
Apache TVMCONTRIBUTOR
发现问题

Relax ONNX Reshape 混淆零复制与字面零维,默认模式和 `allowzero=1` 都可能得到错误形状。规则叠加后,同一个 `0` 会在不同路径中被解释成两种含义。

悬停预览 · 点击固定
查看完整贡献

Torchvision

Stars

PyTorch 官方计算机视觉库,提供主流视觉数据集、预训练模型、图像与视频变换以及高性能算子,是视觉训练和推理工作流中的核心基础设施。

查看我的贡献
TorchvisionCONTRIBUTOR
发现问题

JPEG v2 用 `view()` 展平批次维,transpose 产生的合法非连续 Tensor 会在编码前直接报错。接口明明支持任意前导批次维,却暗中要求调用者先手动整理内存布局。

悬停预览 · 点击固定
查看完整贡献

LeRobot

Stars

Hugging Face 面向真实机器人学习的开源平台,覆盖数据采集与可视化、机器人数据集、模仿学习策略、预训练模型和硬件接入,让端到端机器人学习更易复现与部署。

查看我的贡献
LeRobotCONTRIBUTOR
发现问题

`repo_ids` 与 `roots` 数量不一致时,普通 `zip` 会静默丢弃尾部数据集,任务却继续完成。最终产物看起来合法,实际来源数量和训练数据内容已经悄悄减少。

悬停预览 · 点击固定
查看完整贡献

CONTACT

联系我

欢迎通过邮件联系,也可以在学术主页与开源社区找到我。