Open Issues Need Help
View All on GitHub Add few-shot prompting as a second elicitation technique about 2 hours ago
good first issue
Alignment and interpretability audit toolkit for LLM safety research: mechanistic interpretability, deception probes, AI Control, and model organisms
Python
#activation-patching#ai-alignment#ai-governance#ai-safety#ai-safety-research#chain-of-thought#deception-detection#interpretability#mechanistic-interpretability#model-organisms#numpy#python#red-teaming#sparse-autoencoder
good first issue
Alignment and interpretability audit toolkit for LLM safety research: mechanistic interpretability, deception probes, AI Control, and model organisms
Python
#activation-patching#ai-alignment#ai-governance#ai-safety#ai-safety-research#chain-of-thought#deception-detection#interpretability#mechanistic-interpretability#model-organisms#numpy#python#red-teaming#sparse-autoencoder