.
thesean
BLOG
RESEARCH
ARTIFACTS
CONTACT
thesean
BLOG
Research
Artifacts
CONTACT
Towards an Understanding of Intelligence
Fingerprinting All AI Cluster I/O Without Mutually Trusted Processors
Naci Cankaya, Jakub Krys, Jonathan Ng, Luke Marks, Felix Kruckel
Ablation-Reversible Heads Don't Transfer: A Stress Test for Mechanistic Role Claims in Transformers
Philip Quirke
STRIDE: Training Data Attribution via Sparse Recovery from Subset Perturbations
Rishit Dagli, Abir Harrasse, Luke Zhang, Florent Draye, Amirali Abdullah, Bernhard Scholkopf, Zhijing Jin
Riemannian-Manifold Steering: Geometry-Aware Generative Autoencoders for Representation Control
Narmeen Oozeer, Shivam Raval, Philip Quirke, Manikandan Ravikiran, Jeff Phillips, Shriyash Upadhyay, Amirali Abdullah
Make Mechanistic Interpretability Auditable: A Call to Develop Guidelines via Continuous Collaborative Reviewing
Michael Lan, Narmeen Fatimah Oozeer, Chaithanya Bandi, Philip Quirke, Austin Meek, Fazl Barez, Amirali Abdullah
Geometry-Aware CLIP Retrieval via Local Cross-Modal Alignment and Steering
Nirmalendu Prakash, Narmeen Fatimah Oozeer, Xin Su, Phillip Howard, Shaan Shah, Zoe Wanying He, Shuang Wu, Shivam Raval, Roy Ka-Wei Lee, Meenakshi Khosla, Amir Abdullah
Curveball Steering: The Right Direction To Steer Isn't Always Linear
Shivam Raval, Hae Jin Song, Linlin Wu, Abir Harrasse, Jeff M. Phillips, Fazl Barez, Amirali Abdullah
Understanding and Mitigating Dataset Corruption in LLM Steering
Cullen Anderson, Narmeen Oozeer, Foad Namjoo, Remy Ogasawara, Amirali Abdullah, Jeff M. Phillips
DreamReader: An Interpretability Toolkit for Text-to-Image Models
Nirmalendu Prakash, Narmeen Oozeer, Michael Lan, Luka Samkharadze, Phillip Howard, Roy Ka-Wei Lee, Dhruv Nathawani, Shivam Raval, Amirali Abdullah
Old Habits Die Hard: How Conversational History Geometrically Traps LLMs
Adi Simhi, Fazl Barez, Martin Tutek, Yonatan Belinkov, Shay B. Cohen
Spectral Superposition: A Theory of Feature Geometry
Georgi Ivanov, Narmeen Oozeer, Shivam Raval, Tasana Pejovic, Shriyash Upadhyay, Amir Abdullah
Are LLM Evaluators Really Narcissists? Sanity Checking Self-Preference in LLMs
Dani Roytburg, Matthew Bozoukov, Matthew Nguyen, Jou Barzdukas, Mackenzie Puig-Hall, Narmeen Oozeer
Position: Require Frontier AI Labs To Release Small 'Analog' Models
Shriyash Upadhyay, Chaithanya Bandi, Narmeen Oozeer, Philip Quirke
Beyond Linear Probes: Dynamic Safety Monitoring for Language Models
James Oldfield, Philip Torr, Ioannis Patras, Adel Bibi, Fazl Barez
Query Circuits: Explaining How Language Models Answer User Prompts
Tung-Yu Wu, Fazl Barez
Towards Understanding Subliminal Learning: When and How Hidden Biases Transfer
Simon Schrodi, Elias Kempf, Fazl Barez, Thomas Brox
Breaking the Mirror: Activation-Based Mitigation of Self-Preference in LLMs
Dani Roytburg, Matthew Bozoukov, Matthew Nguyen, Jou Barzdukas, Simon Fu, Narmeen Oozeer
Distribution-Aware Feature Selection for SAEs
Narmeen Oozeer, Nirmalendu Prakash, Michael Lan, Alice Rigg, Amirali Abdullah
Method for Converting Models to Programs
Shriyash K. Upadhyay, Etan J. Ginsberg, Luka Samkharadze
Model Mapping: Can We Turn Transformers into Programs?
Shriyash Upadhyay, Benjamin Keigwin, Chaithanya Bandi, Yiwei Wu, Luka Samkharadze, Jason Hu, Etan Ginsberg
Beyond Linear Steering: Unified Multi-Attribute Control for Language Models
Narmeen Oozeer, Luke Marks, Shreyans Jain, Fazl Barez, Amirali Abdullah
Beyond Monoliths: Expert Orchestration for More Capable, Democratic, and Safe LLMs
Philip Quirke, Narmeen Oozeer, Chaithanya Bandi, Amir Abdullah, Jason Hoelscher-Obermaier, Jeff M. Phillips, Joshua Greaves, Clement Neo, Michael Lan, Fazl Barez, Shriyash Upadhyay
TinySQL: A Progressive Text-to-SQL Dataset for Mechanistic Interpretability
Abir Harrasse, Philip Quirke, Clement Neo, Dhruv Nathawani, Luke Marks, Amir Abdullah
Activation Space Interventions Can Be Transferred Between Large Language Models
Narmeen Oozeer, Dhruv Nathawani, Nirmalendu Prakash, Michael Lan, Abir Harrasse, Amirali Abdullah
Bilinear Convolution Decomposition for Causal RL Interpretability
Narmeen Oozeer, Sinem Erisken, Alice Rigg
Debate, Deliberate, Decide (D3): A Cost-Aware Adversarial Framework for Reliable and Interpretable LLM Evaluation
Abir Harrasse, Chaithanya Bandi, Hari Bandi
Understanding Addition and Subtraction in Transformers
Philip Quirke, Clement Neo, Fazl Barez
The Capability Frontier: Benchmarks Miss 82% of Model Performance
Narmeen Oozeer, Philip Quirke, Fazl Barez