NEWS / 05 · AI 模型训练 / TOKEN 工程

POST-TRAINING SYSTEM

LMSYS 发布 Miles v0.1:
把前沿模型后训练拆成可验证、可扩展的工程流水线。

后训练不是把一份数据再跑一遍,而是要同时管理 rollout、工具环境、轨迹、奖励、权重同步和资源效率。LMSYS 在 8 月 18 日发布的 Miles v0.1,将这些环节组织成面向前沿模型的全栈生产级系统,关注点从“能不能训练”推进到“每个阶段是否可验证、可复现”。

把训练、rollout 和工具执行串起来

Miles v0.1 基于 slime 的设计,RL 流程包括 SGLang rollout、训练和权重更新。它支持多轮 agent session、工具执行、沙箱环境与 token-faithful trajectory capture,意味着训练轨迹可以保留更接近真实使用的 Token 流,而不是只记录最终答案。

训练端兼容 NVIDIA Megatron-LM 或 FSDP,并加入 Token-In-Token-Out(TITO)、高效 rollout routing、Replay(R3)、低精度训练与磁盘 offload 等模块。每个模块都在解决生产环境中的具体瓶颈:数据如何传递、请求如何路由、历史轨迹如何重放,以及显存不足时如何继续推进实验。

官方示例与工程边界

LMSYS 给出的示例使用 64 张 NVIDIA GB300 训练 GLM-5.2 的 terminal-use 任务,同时列出 LoRA RL 和 on-policy distillation 等后训练配方。这个数字应理解为官方展示的基准条件,而不是所有团队的硬件门槛。

  • 系统覆盖 SGLang rollout、训练、权重更新和多轮 agent session。
  • 支持工具执行、沙箱环境与 token-faithful trajectory capture。
  • 训练端支持 Megatron-LM 或 FSDP,并提供 TITO、Replay、低精度和 offload 组件。
  • 64 张 GB300 是官方示例配置,不代表通用部署要求。

TopoReduce 编辑观察

模型能力之外,Token 轨迹、实验复现和部署闭环正在成为 AI 工程系统的核心资产。对企业团队来说,后训练平台的价值不只在吞吐,还在于能否知道某次能力提升来自哪批数据、哪段工具交互和哪种权重更新。

这类系统也提醒中转/API 平台:请求日志、模型路由和 Token 统计不应只用于计费,它们同样是后训练、评测和故障复盘的数据入口。

数据与原文AIHOT 条目:Miles v0.1官方原文:Miles v0.1: Production-level Post-training
← 上一篇:Claude Code 更新下一篇:零信任智能体 →

把模型能力接入真实工程。

从工具、流程到私有部署,TopoReduce 关注完整交付链路。

查看业务范围