Reliability and audit-evidence testing for LLM agents - wrap any agent, assert behavior, measure determinism, check grounding, emit an audit-grade report.

0 stars 0 forks 0 watchers TypeScript MIT License
agent-evaluation agent-testing ai-agents ai-compliance ai-testing evals llm llm-eval llm-evaluation llm-observability llm-reliability mcp rag-evaluation typescript
4 Open Issues Need Help Last updated: Aug 8, 2026

Open Issues Need Help

View All on GitHub
help wanted good first issue

Reliability and audit-evidence testing for LLM agents - wrap any agent, assert behavior, measure determinism, check grounding, emit an audit-grade report.

TypeScript
#agent-evaluation#agent-testing#ai-agents#ai-compliance#ai-testing#evals#llm#llm-eval#llm-evaluation#llm-observability#llm-reliability#mcp#rag-evaluation#typescript

Reliability and audit-evidence testing for LLM agents - wrap any agent, assert behavior, measure determinism, check grounding, emit an audit-grade report.

TypeScript
#agent-evaluation#agent-testing#ai-agents#ai-compliance#ai-testing#evals#llm#llm-eval#llm-evaluation#llm-observability#llm-reliability#mcp#rag-evaluation#typescript
good first issue adapter

Reliability and audit-evidence testing for LLM agents - wrap any agent, assert behavior, measure determinism, check grounding, emit an audit-grade report.

TypeScript
#agent-evaluation#agent-testing#ai-agents#ai-compliance#ai-testing#evals#llm#llm-eval#llm-evaluation#llm-observability#llm-reliability#mcp#rag-evaluation#typescript
good first issue adapter

Reliability and audit-evidence testing for LLM agents - wrap any agent, assert behavior, measure determinism, check grounding, emit an audit-grade report.

TypeScript
#agent-evaluation#agent-testing#ai-agents#ai-compliance#ai-testing#evals#llm#llm-eval#llm-evaluation#llm-observability#llm-reliability#mcp#rag-evaluation#typescript