跳到主要内容
SkillHub 技能集市
首页 / 开发工具 / preference-optimization

LLM偏好优化

preference-optimization
4万Stars
2k安装量
v1.0版本
近期更新

技能简介

为Agent提供大语言模型偏好对齐能力,支持DPO、RLHF等优化技术的代码实现与方案选型

它能做什么

  • 实现DPO直接偏好优化
  • 配置RLHF人类反馈训练流程
  • 评估并选择偏好对齐方案

安装方式

上手路径让AI回答更合你心意的优化助手

  1. 01
    装技能打开电脑终端,运行 npx skills add wshobson/agents
  2. 02
    提需求对话里说想优化什么,比如DPO和RLHF怎么选
  3. 03
    用结果等待生成代码和方案,可复制使用或继续追问

提示:需求写得越具体,给出的方案越靠谱

$npx skills add wshobson/agents

支持平台:WorkBuddy / Claude Code / Codex CLI / Kimi CLI / Cursor / Trae / Goose / OpenClaw / OpenCode

出现在以下合集

简介由 AI 辅助翻译并经人工校验,如发现错误欢迎通过源仓库反馈。