跳到主要内容
SkillHub 技能集市
首页 / 开发工具 / llm-evaluation

大语言模型评估

llm-evaluation
4万Stars
1.2万安装量
v1.0版本
近期更新

技能简介

帮助Agent对大语言模型的输出进行质量评估与基准测试,识别性能瓶颈并指导改进方向

它能做什么

  • LLM输出质量评估打分
  • 基准测试与对比分析
  • 性能瓶颈识别与归因

安装方式

上手路径帮你检测AI回答好坏,找出改进方向

  1. 01
    装技能终端输入 npx skills add wshobson/agents 并回车
  2. 02
    发起评估对话中让Agent用它给AI回答打分,可自设评分标准
  3. 03
    看结果查看评分与瓶颈分析,按建议改进提示词或换模型

提示:先拿几个典型问题小测,快速定位模型短板

$npx skills add wshobson/agents

支持平台:WorkBuddy / Claude Code / Codex CLI / Kimi CLI / Cursor / Trae / Goose / OpenClaw / OpenCode

出现在以下合集

简介由 AI 辅助翻译并经人工校验,如发现错误欢迎通过源仓库反馈。