A framework for evaluating AI coding agents and their skills with sandboxing, reproducibility, and data-driven analysis.

103 stars 1 forks 103 watchers Python Apache License 2.0
agent-evaluation agentic-ai ai-agents benchmark benchmarking claude claude-code claude-code-skill claude-skills cli codex coding-agents coding-agents-evaluation evals evaluation-framework llm-evaluation skills skills-evaluation
1 Open Issue Need Help Last updated: Jul 20, 2026

Open Issues Need Help

View All on GitHub
good first issue

A framework for evaluating AI coding agents and their skills with sandboxing, reproducibility, and data-driven analysis.

Python
#agent-evaluation#agentic-ai#ai-agents#benchmark#benchmarking#claude#claude-code#claude-code-skill#claude-skills#cli#codex#coding-agents#coding-agents-evaluation#evals#evaluation-framework#llm-evaluation#skills#skills-evaluation