Transformer interpretability research framework for circuit discovery, sparse features, and controlled residual-stream interventions.

activation-steering adversarial-robustness gpt2 interpretability machine-learning-research mechanistic-interpretability sparse-autoencoders transformers
3 Open Issues Need Help Last updated: Aug 16, 2026

Open Issues Need Help

View All on GitHub

Transformer interpretability research framework for circuit discovery, sparse features, and controlled residual-stream interventions.

Python
#activation-steering#adversarial-robustness#gpt2#interpretability#machine-learning-research#mechanistic-interpretability#sparse-autoencoders#transformers

Transformer interpretability research framework for circuit discovery, sparse features, and controlled residual-stream interventions.

Python
#activation-steering#adversarial-robustness#gpt2#interpretability#machine-learning-research#mechanistic-interpretability#sparse-autoencoders#transformers
enhancement help wanted

Transformer interpretability research framework for circuit discovery, sparse features, and controlled residual-stream interventions.

Python
#activation-steering#adversarial-robustness#gpt2#interpretability#machine-learning-research#mechanistic-interpretability#sparse-autoencoders#transformers