跳到主要内容
SkillHub 技能集市
首页 / 开发工具 / grpo-rlvr-training

GRPO强化学习训练

grpo-rlvr-training
4万Stars
2k安装量
v1.0版本
近期更新

技能简介

帮助Agent搭建基于GRPO与RLVR的大语言模型强化学习训练流程,支持策略优化与可验证奖励建模。

它能做什么

  • 配置GRPO策略优化流程
  • 实现RLVR可验证奖励
  • 调优推理模型训练参数

安装方式

上手路径帮你用强化学习训练大语言模型

  1. 01
    安装技能运行npx skills add wshobson/agents完成安装
  2. 02
    加载配置在Agent中调用该Skill,按指引设置GRPO与RLVR参数
  3. 03
    启动训练确认策略与奖励设置无误后,运行训练流程

提示:先小批量跑通流程,再扩展全量训练

$npx skills add wshobson/agents

支持平台:WorkBuddy / Claude Code / Codex CLI / Kimi CLI / Cursor / Trae / Goose / OpenClaw / OpenCode

出现在以下合集

简介由 AI 辅助翻译并经人工校验,如发现错误欢迎通过源仓库反馈。