.
thesean
BLOG
RESEARCH
ARTIFACTS
CONTACT
thesean
BLOG
Research
Artifacts
CONTACT
Towards a safer and more reliable AI.
Bilinear Convolution Decomposition for Causal RL Interpretability
Narmeen Oozeer
Understanding Addition and Subtraction in Transformers
Philip Quirke, Fazl Barez
Turing Complete Transformers: Two Transformers Are More Powerful Than One
Shriyash Upadhyay, Etan Ginsberg
TinySQL: A Progressive Text-to-SQL Dataset for Mechanistic Interpretability
Abir Harrasse, Philip Quirke, Luke Marks, Amir Abdullah
Model Mapping: Can We Turn Transformers into Programs?
Chaithanya Bandi, Shriyash Upadhyay, Etan Ginsberg
Method for Converting Models to Programs
Shriyash Upadhyay
Activation Space Interventions Can Be Transferred Between Large Language Models
Narmeen Oozeer, Abir Harrasse, Michael Lan, Amir Abdullah
Beyond Linear Steering: Unified Multi-Attribute Control for Language Models
Narmeen Oozeer, Luke Marks
Breaking the Mirror: Activation-Based Mitigation of Self-Preference in LLMs
Narmeen Oozeer
Beyond Monoliths: Expert Orchestration for More Capable, Democratic, and Safe LLMs
Philip Quirke, Narmeen Oozeer, Chaithanya Bandi, Joshua Greaves, Michael Lan, Fazl Barez, Shriyash Upadhyay
Position: Require Frontier AI Labs To Release Small 'Analog' Models
Shriyash Upadhyay, Chaithanya Bandi, Narmeen Oozeer, Philip Quirke
Query Circuits: Explaining How Language Models Answer User Prompts
Fazl Barez
Spectral Superposition: A Theory of Feature Geometry
Narmeen Oozeer, Shriyash Upadhyay, Amir ABdullah
Towards Understanding Subliminal Learning: When and How Hidden Biases Transfer
Fazl Barez
Beyond Linear Probes: Dynamic Safety Monitoring for Language Models
Fazl Barez
Old Habits Die Hard: How Conversational History Geometrically Traps LLMs
Fazl Barez
Riemannian-Manifold Steering: Geometry-Aware Generative Autoencoders for Representation Control
Narmeen Oozeer, Philip Quirke, Shriyash Upadhyay, Amir Abdullah
STRIDE: Training Data Attribution via Sparse Recovery from Subset Perturbations
Abir Harrasse, Amir Abdullah
DreamReader: An Interpretability Toolkit for Text-to-Image Models
Narmeen Oozeer, Michael Lan, Amir Abdullah
Ablation-Reversible Heads Don't Transfer: A Stress Test for Mechanistic Role Claims in Transformers
Philip Quirke
Understanding and Mitigating Dataset Corruption in LLM Steering
Narmeen Oozeer, Amir Abdullah
Geometry-Aware CLIP Retrieval via Local Cross-Modal Alignment and Steering
Narmeen Oozeer, Amir Abdullah
Curveball Steering: The Right Direction To Steer Isn't Always Linear
Fazl Barez, Abir Harrasse, Amir Abdullah
Make Mechanistic Interpretability Auditable: A Call to Develop Guidelines via Continuous Collaborative Reviewing
Michael Lan, Narmeen Oozeer, Chaithanya Bandi, Philip Quirke, Fazl Barez, Amirali Abdullah
Debate, Deliberate, Decide (D3): A Cost-Aware Adversarial Framework for Reliable and Interpretable LLM Evaluation
Abir Harrasse, Chaithanya Bandi
Are LLM Evaluators Really Narcissists? Sanity Checking Self-Preference in LLMs
Narmeen Oozeer
Fingerprinting All AI Cluster I/O Without Mutually Trusted Processors
Luke Marks
The Capability Frontier: Benchmarks Miss 82% of Model Performance
Narmeen Oozeer, Philip Quirke, Fazl Barez