LLM-judged quality (1–5) for each skill across Claude models — scored on structure, completeness, usefulness & grounding by claude-haiku-4-5-20251001. Skills that need an image, a live source, or that activate a behaviour aren't scored on this rubric.
Skill
claude-haiku-4-5-20251001
ab-test-planner
4.75
aeo-optimizer
4.50
assumption-mapper
5.00
churn-analysis
4.25
code-explainer
5.00
cohort-analysis
3.50
competitive-analysis
4.25
competitive-intelligence-monitor
3.75
cs-health-scorecard
4.75
dependency-conflict-resolver
4.75
error-decoder
3.50
executive-summary
4.25
git-troubleshooter
4.00
go-to-market
4.75
incident-postmortem
4.75
literature-review
4.00
metrics-framework
4.75
okr-builder
4.75
prd-template
4.75
privacy-policy-drafter
4.75
regex-builder
4.50
resume
3.25
rice-prioritisation
4.75
roadmap-narrative
4.75
sprint-planning
3.75
sql-query-explainer
4.25
stakeholder-update
4.75
user-story-writer
4.75
Average
4.41
Higher is better (max 5). 28 skills × 1 models · generated 2026-07-13. Methodology and cases in evals/.