An open, reproducible benchmark measuring AI-agent accuracy, consistency, failure severity, latency, and cost.

0 stars 0 forks 0 watchers Python Apache License 2.0
15 Open Issues Need Help Last updated: Aug 12, 2026

Open Issues Need Help

View All on GitHub

An open, reproducible benchmark measuring AI-agent accuracy, consistency, failure severity, latency, and cost.

Python

An open, reproducible benchmark measuring AI-agent accuracy, consistency, failure severity, latency, and cost.

Python
good first issue help wanted

An open, reproducible benchmark measuring AI-agent accuracy, consistency, failure severity, latency, and cost.

Python
good first issue help wanted

An open, reproducible benchmark measuring AI-agent accuracy, consistency, failure severity, latency, and cost.

Python
good first issue help wanted

An open, reproducible benchmark measuring AI-agent accuracy, consistency, failure severity, latency, and cost.

Python
help wanted

An open, reproducible benchmark measuring AI-agent accuracy, consistency, failure severity, latency, and cost.

Python
good first issue help wanted

An open, reproducible benchmark measuring AI-agent accuracy, consistency, failure severity, latency, and cost.

Python

An open, reproducible benchmark measuring AI-agent accuracy, consistency, failure severity, latency, and cost.

Python

An open, reproducible benchmark measuring AI-agent accuracy, consistency, failure severity, latency, and cost.

Python
good first issue help wanted

An open, reproducible benchmark measuring AI-agent accuracy, consistency, failure severity, latency, and cost.

Python
help wanted

An open, reproducible benchmark measuring AI-agent accuracy, consistency, failure severity, latency, and cost.

Python

An open, reproducible benchmark measuring AI-agent accuracy, consistency, failure severity, latency, and cost.

Python

An open, reproducible benchmark measuring AI-agent accuracy, consistency, failure severity, latency, and cost.

Python

An open, reproducible benchmark measuring AI-agent accuracy, consistency, failure severity, latency, and cost.

Python
good first issue help wanted

An open, reproducible benchmark measuring AI-agent accuracy, consistency, failure severity, latency, and cost.

Python