Papers
Joshua Engels, Callum McDougall, Bilal Chughtai, ..., Rohin Shah, and Neel Nanda.Paper | Blog | Twitter
Janos Kramar, Joshua Engels, Zhengxuan Wang, Bilal Chughtai, Rohin Shah, Neel Nanda, and Arthur Conmy.Paper | Twitter
Reilly Haskins, Bilal Chughtai, and Joshua Engels.Paper | Blog | Twitter
Daria Ivanova, Riya Tyagi, Joshua Engels, and Neel Nanda.Paper | Blog
Aria Wong, Joshua Engels, and Neel Nanda.Paper | Blog
Joshua Engels*, David Baek*, Subhash Kantamneni*, and Max Tegmark.Paper | Code | Twitter
Subhash Kantamneni*, Joshua Engels*, Senthooran Rajamanoharan, Max Tegmark, and Neel Nanda.Paper | Blog | Code | Twitter
Mathew Chen*, Joshua Engels*, and Max Tegmark.Paper | Code | Twitter
Atticus Wang*, Joshua Engels*, Oliver Clive-Griffin*, Senthooran Rajamanoharan, and Neel Nanda.Paper
Xiaoqing Sun, Alessandro Stolfo, Joshua Engels, Ben Wu, Senthooran Rajamanoharan, Mrinmaya Sachan, and Max Tegmark.Paper
Joshua Engels, Logan Smith, and Max Tegmark.Paper | Code | Twitter
Yuxiao Li, Eric J. Michaud, David D. Baek, Joshua Engels, Xiaoqing Sun, and Max Tegmark.Paper
Anish Mudide, Joshua Engels, Eric J Michaud, Max Tegmark, and Christian Schroeder de Witt.Paper | Code | Twitter
Joshua Engels, Eric J. Michaud, Isaac Liao, Wes Gurnee, and Max Tegmark.Paper | Code | Twitter | Talk
* indicates equal contribution
Talks
Developing Areas of Alignment Science — June 2026
A Pragmatic Vision for Interpretability — December 2025
SAEs: Progress and Limitations — March 2025
Not All Language Model Features Are Linear — December 2024
Other Projects and Writing
LLM-Driven Feature Discovery — June 2026
Why Do Naive SFT Filters For Safety Properties Fail? — June 2026
SFT Drives Gemini's Safety Properties — June 2026
Building and Evaluating Model Diffing Agents — June 2026
Thought Editing: Steering Models by Editing Their Chain of Thought — February 2026
Brief Explorations in LLM Value Rankings — January 2026
Can We Interpret Latent Reasoning Using Current Mechanistic Interpretability Tools? — December 2025
Prompting Models to Obfuscate Their CoT — December 2025
How Can Interpretability Researchers Help AGI Go Well? — December 2025
A Pragmatic Vision for Interpretability — December 2025
Current LLMs Seem to Rarely Detect CoT Tampering — November 2025
Negative Results on Group SAEs — May 2025
Interim Research Report: Mechanisms of Awareness — May 2025
Spreadsheet of 50 Weird LLM Phenomenon — May 2025
TinySAE: A Minimal SAE Implementation — March 2025
Algorithms Papers (pre 2025)
Joshua Engels, Benjamin Landrum, Shangdi Yu, Laxman Dhulipala, and Julian Shun.Paper | Code
Joshua Engels, Benjamin Coleman, Vihan Lakshman, and Anshumali Shrivastava.Paper | Code
Joshua Engels, Benjamin Coleman, and Anshumali Shrivastava.Paper | Code