caliper
用于检验 Agent 技能是否真正有效的评测工具,支持交互式生成含正常、边界与对抗任务的评估规格,可由 Agent 驱动或通过 CLI 执行,用 LLM 评判与脚本断言度量技能表现。
查看原仓库英文描述
Run your real agent with and without your skills, MCPs, and rules. See which ones actually help, and what they cost in tokens. Supports Claude Code, Codex, Pi, and Hermes.
ai-agentsclaude-codeclicodexdsh-plugindsh-plugin-marketdsh-pluginsevalsevaluationhermeshermes-agenthermes-skillpireliabilityskills
基础信息核对
自动核对
中文简介
自动核对
安装命令
自动核对
分类
自动核对
项目活跃度
数据覆盖 84% · 抽样数据 · 数据截至 2026-09-25
92/100
最近代码活动
35/35
100 次提交 · 最近推送 今天
Issue 响应
10 分 · 覆盖 12/20
55/75 已关闭 · 响应数据未覆盖 · 抽样
PR 协作
12 分 · 覆盖 12/20
74/75 已关闭 · 响应数据未覆盖 · 抽样
贡献持续性
6/10
6 位近 90 天活跃贡献者
版本交付
5/5
最近发布 今天
社区关注度
9/10
182 Stars · 17 Forks
安装
该项目不以标准 DSH 插件形式分发(独立 Agent 技能评测工具,通过 npx skills 与 pipx 分发,无任何 DSH 安装命令,非 DSH 分发,判 external。)。安装与使用方式请查看原仓库。