4万Stars
1.2万安装量
v1.0版本
近期更新
技能简介
帮助Agent对大语言模型的输出进行质量评估与基准测试,识别性能瓶颈并指导改进方向
它能做什么
- LLM输出质量评估打分
- 基准测试与对比分析
- 性能瓶颈识别与归因
安装方式
上手路径帮你检测AI回答好坏,找出改进方向
- 01装技能终端输入 npx skills add wshobson/agents 并回车
- 02发起评估对话中让Agent用它给AI回答打分,可自设评分标准
- 03看结果查看评分与瓶颈分析,按建议改进提示词或换模型
提示:先拿几个典型问题小测,快速定位模型短板
$npx skills add wshobson/agents
支持平台:WorkBuddy / Claude Code / Codex CLI / Kimi CLI / Cursor / Trae / Goose / OpenClaw / OpenCode
出现在以下合集
简介由 AI 辅助翻译并经人工校验,如发现错误欢迎通过源仓库反馈。