收录解读
终端 agent 需要多步规划、执行反馈和状态适应,但现有训练环境高度依赖外部仓库抓取,难以控制能力覆盖和 verifier 质量。
LiteCoder-Terminal-Gen 提供 zero-dependency synthesis pipeline,用来生成可执行、可验证的长程 terminal environments。
它的关键价值在于把 coding/terminal agent 训练从静态题库推进到可控环境生成和可验证反馈循环。
它值得收录,因为 terminal 环境是软件工程 agent 的核心执行面,而可验证环境生成直接影响 RLVR 和 agent training 的可扩展性。
原始摘要与中文对照
中文对照翻译
掌握终端环境需要具备多步骤规划、反馈驱动执行和动态状态适应能力的语言代理。然而,训练此类代理目前受制于对抓取的外部存储库的依赖,这限制了领域多样性、环境可控性和针对特定能力缺陷的定位。我们引入了 LiteCoder-Terminal-Gen,这是一个无依赖的合成流水线,它能够直接从领域规范生成可执行和可验证的终端训练环境。利用这个框架,我们构建了两个大型资源:LiteCoder-Terminal-SFT,包含 11,255 条专家轨迹,涵盖 10 个领域,以及 LiteCoder-Terminal-RL,具有 602 个可验证的环境,用于轨迹级别的偏好优化。在我们的 SFT 数据集上对 Qwen 家族模型进行监督微调,产生了明显优于其基础 counterparts 的代理。值得注意的是,我们的 32B 变体在 Terminal Bench 1.0、2.0 和 Pro 上分别实现了 29.06%、18.54% 和 34.00% 的 pass@1。此外,在我们的 RL 环境上应用直接多回合偏好优化 (DMPO) 进一步提高了性能。这些结果系统地证明了完全合成的、可执行的环境为掌握复杂的、现实世界的命令行工作流程提供了一个可扩展和可验证的监督信号。
原始摘要
Mastering terminal environments requires language agents capable of multi-step planning, feedback-grounded execution, and dynamic state adaptation. However, training such agents is currently bottlenecked by a reliance on scraped external repositories, which limits domain diversity, environment controllability, and the targeting of specific capability deficits. We introduce LiteCoder-Terminal-Gen, a zero-dependency synthesis pipeline that autonomously generates executable and verifiable terminal training environments directly from domain specifications. Using this framework, we construct two large-scale resources: LiteCoder-Terminal-SFT, comprising 11,255 expert trajectories across 10 domains, and LiteCoder-Terminal-RL, featuring 602 verifiable environments for trajectory-level preference optimization. Supervised fine-tuning of Qwen-family models on our SFT dataset yields agents that significantly outperform their base counterparts. Notably, our 32B variant achieves 29.06%, 18.54%, and 34.00% pass@1 on Terminal Bench 1.0, 2.0, and Pro, respectively. Furthermore, applying Direct Multi-turn Preference Optimization (DMPO) on our RL environments yields additional performance gains. These results systematically demonstrate that fully synthetic, executable environments offer a scalable and verifiable supervision signal for mastering complex, real-world command-line workflows.