Alignment and interpretability audit toolkit for LLM safety research: mechanistic interpretability, deception probes, AI Control, and model organisms

activation-patching ai-alignment ai-governance ai-safety ai-safety-research chain-of-thought deception-detection interpretability mechanistic-interpretability model-organisms numpy python red-teaming sparse-autoencoder
2 Open Issues Need Help Last updated: Jul 30, 2026

Open Issues Need Help

View All on GitHub

Alignment and interpretability audit toolkit for LLM safety research: mechanistic interpretability, deception probes, AI Control, and model organisms

Python
#activation-patching#ai-alignment#ai-governance#ai-safety#ai-safety-research#chain-of-thought#deception-detection#interpretability#mechanistic-interpretability#model-organisms#numpy#python#red-teaming#sparse-autoencoder

Alignment and interpretability audit toolkit for LLM safety research: mechanistic interpretability, deception probes, AI Control, and model organisms

Python
#activation-patching#ai-alignment#ai-governance#ai-safety#ai-safety-research#chain-of-thought#deception-detection#interpretability#mechanistic-interpretability#model-organisms#numpy#python#red-teaming#sparse-autoencoder