4万Stars
2k安装量
v1.0版本
近期更新
技能简介
帮助Agent搭建基于GRPO与RLVR的大语言模型强化学习训练流程,支持策略优化与可验证奖励建模。
它能做什么
- 配置GRPO策略优化流程
- 实现RLVR可验证奖励
- 调优推理模型训练参数
安装方式
上手路径帮你用强化学习训练大语言模型
- 01安装技能运行npx skills add wshobson/agents完成安装
- 02加载配置在Agent中调用该Skill,按指引设置GRPO与RLVR参数
- 03启动训练确认策略与奖励设置无误后,运行训练流程
提示:先小批量跑通流程,再扩展全量训练
$npx skills add wshobson/agents
支持平台:WorkBuddy / Claude Code / Codex CLI / Kimi CLI / Cursor / Trae / Goose / OpenClaw / OpenCode
出现在以下合集
简介由 AI 辅助翻译并经人工校验,如发现错误欢迎通过源仓库反馈。