A curated list of tools, frameworks, benchmarks, and ideas for evaluating AI agents.

0 stars 0 forks 0 watchers HTML Creative Commons Zero v1.0 Universal
agent-evals agent-evaluation ai-agents ai-evaluation awesome awesome-list evals llm-evals llm-evaluation llmops
2 Open Issues Need Help Last updated: Aug 5, 2026

Open Issues Need Help

View All on GitHub
good first issue

A curated list of tools, frameworks, benchmarks, and ideas for evaluating AI agents.

HTML
#agent-evals#agent-evaluation#ai-agents#ai-evaluation#awesome#awesome-list#evals#llm-evals#llm-evaluation#llmops
good first issue

A curated list of tools, frameworks, benchmarks, and ideas for evaluating AI agents.

HTML
#agent-evals#agent-evaluation#ai-agents#ai-evaluation#awesome#awesome-list#evals#llm-evals#llm-evaluation#llmops