|
thesean.ai
|
<div class="navbar-menu-item-inner"><div class="navbar-menut-item-line"></div><div class="nav-item-text">thesean</div></div>
|
|
thesean.ai
|
<div class="navbar-menu-item-inner mobile"><div class="text-meta-huge">thesean</div><div class="navbar-menut-item-line"></div></div>
|
|
arxiv.org
|
<div class="w-layout-vflex flex-block-24"><div class="w-layout-hflex flex-block-26"><div class="paper-element-title">Fingerprinting All AI Cluster I/O Without Mutually Trusted Processors</div><div class="w-layout-hflex flex-block-27"></div></div><div class="w-layout-vflex flex-block-25"><div class="paper-item-subtitle">Naci Cankaya, Jakub Krys, Jonathan Ng, Luke Marks, Felix Kruckel</div><div class="paper-item-subtitle"></div></div></div>
|
|
arxiv.org
|
<div class="w-layout-vflex flex-block-24"><div class="w-layout-hflex flex-block-26"><div class="paper-element-title">Ablation-Reversible Heads Don't Transfer: A Stress Test for Mechanistic Role Claims in Transformers</div><div class="w-layout-hflex flex-block-27"></div></div><div class="w-layout-vflex flex-block-25"><div class="paper-item-subtitle">Philip Quirke</div><div class="paper-item-subtitle"></div></div></div>
|
|
arxiv.org
|
<div class="w-layout-vflex flex-block-24"><div class="w-layout-hflex flex-block-26"><div class="paper-element-title">STRIDE: Training Data Attribution via Sparse Recovery from Subset Perturbations</div><div class="w-layout-hflex flex-block-27"></div></div><div class="w-layout-vflex flex-block-25"><div class="paper-item-subtitle">Rishit Dagli, Abir Harrasse, Luke Zhang, Florent Draye, Amirali Abdullah, Bernhard Scholkopf, Zhijing Jin</div><div class="paper-item-subtitle"></div></div></div>
|
|
arxiv.org
|
<div class="w-layout-vflex flex-block-24"><div class="w-layout-hflex flex-block-26"><div class="paper-element-title">Riemannian-Manifold Steering: Geometry-Aware Generative Autoencoders for Representation Control</div><div class="w-layout-hflex flex-block-27"></div></div><div class="w-layout-vflex flex-block-25"><div class="paper-item-subtitle">Narmeen Oozeer, Shivam Raval, Philip Quirke, Manikandan Ravikiran, Jeff Phillips, Shriyash Upadhyay, Amirali Abdullah</div><div class="paper-item-subtitle"></div></div></div>
|
|
arxiv.org
|
<div class="w-layout-vflex flex-block-24"><div class="w-layout-hflex flex-block-26"><div class="paper-element-title">Make Mechanistic Interpretability Auditable: A Call to Develop Guidelines via Continuous Collaborative Reviewing</div><div class="w-layout-hflex flex-block-27"></div></div><div class="w-layout-vflex flex-block-25"><div class="paper-item-subtitle">Michael Lan, Narmeen Fatimah Oozeer, Chaithanya Bandi, Philip Quirke, Austin Meek, Fazl Barez, Amirali Abdullah</div><div class="paper-item-subtitle"></div></div></div>
|
|
arxiv.org
|
<div class="w-layout-vflex flex-block-24"><div class="w-layout-hflex flex-block-26"><div class="paper-element-title">Geometry-Aware CLIP Retrieval via Local Cross-Modal Alignment and Steering</div><div class="w-layout-hflex flex-block-27"></div></div><div class="w-layout-vflex flex-block-25"><div class="paper-item-subtitle">Nirmalendu Prakash, Narmeen Fatimah Oozeer, Xin Su, Phillip Howard, Shaan Shah, Zoe Wanying He, Shuang Wu, Shivam Raval, Roy Ka-Wei Lee, Meenakshi Khosla, Amir Abdullah</div><div class="paper-item-subtitle"></div></div></div>
|
|
arxiv.org
|
<div class="w-layout-vflex flex-block-24"><div class="w-layout-hflex flex-block-26"><div class="paper-element-title">Curveball Steering: The Right Direction To Steer Isn't Always Linear</div><div class="w-layout-hflex flex-block-27"></div></div><div class="w-layout-vflex flex-block-25"><div class="paper-item-subtitle">Shivam Raval, Hae Jin Song, Linlin Wu, Abir Harrasse, Jeff M. Phillips, Fazl Barez, Amirali Abdullah</div><div class="paper-item-subtitle"></div></div></div>
|
|
arxiv.org
|
<div class="w-layout-vflex flex-block-24"><div class="w-layout-hflex flex-block-26"><div class="paper-element-title">Understanding and Mitigating Dataset Corruption in LLM Steering</div><div class="w-layout-hflex flex-block-27"></div></div><div class="w-layout-vflex flex-block-25"><div class="paper-item-subtitle">Cullen Anderson, Narmeen Oozeer, Foad Namjoo, Remy Ogasawara, Amirali Abdullah, Jeff M. Phillips</div><div class="paper-item-subtitle"></div></div></div>
|
|
arxiv.org
|
<div class="w-layout-vflex flex-block-24"><div class="w-layout-hflex flex-block-26"><div class="paper-element-title">DreamReader: An Interpretability Toolkit for Text-to-Image Models</div><div class="w-layout-hflex flex-block-27"></div></div><div class="w-layout-vflex flex-block-25"><div class="paper-item-subtitle">Nirmalendu Prakash, Narmeen Oozeer, Michael Lan, Luka Samkharadze, Phillip Howard, Roy Ka-Wei Lee, Dhruv Nathawani, Shivam Raval, Amirali Abdullah</div><div class="paper-item-subtitle"></div></div></div>
|
|
arxiv.org
|
<div class="w-layout-vflex flex-block-24"><div class="w-layout-hflex flex-block-26"><div class="paper-element-title">Old Habits Die Hard: How Conversational History Geometrically Traps LLMs</div><div class="w-layout-hflex flex-block-27"></div></div><div class="w-layout-vflex flex-block-25"><div class="paper-item-subtitle">Adi Simhi, Fazl Barez, Martin Tutek, Yonatan Belinkov, Shay B. Cohen</div><div class="paper-item-subtitle"></div></div></div>
|
|
arxiv.org
|
<div class="w-layout-vflex flex-block-24"><div class="w-layout-hflex flex-block-26"><div class="paper-element-title">Spectral Superposition: A Theory of Feature Geometry</div><div class="w-layout-hflex flex-block-27"></div></div><div class="w-layout-vflex flex-block-25"><div class="paper-item-subtitle">Georgi Ivanov, Narmeen Oozeer, Shivam Raval, Tasana Pejovic, Shriyash Upadhyay, Amir Abdullah</div><div class="paper-item-subtitle"></div></div></div>
|
|
arxiv.org
|
<div class="w-layout-vflex flex-block-24"><div class="w-layout-hflex flex-block-26"><div class="paper-element-title">Are LLM Evaluators Really Narcissists? Sanity Checking Self-Preference in LLMs</div><div class="w-layout-hflex flex-block-27"></div></div><div class="w-layout-vflex flex-block-25"><div class="paper-item-subtitle">Dani Roytburg, Matthew Bozoukov, Matthew Nguyen, Jou Barzdukas, Mackenzie Puig-Hall, Narmeen Oozeer</div><div class="paper-item-subtitle"></div></div></div>
|
|
arxiv.org
|
<div class="w-layout-vflex flex-block-24"><div class="w-layout-hflex flex-block-26"><div class="paper-element-title">Position: Require Frontier AI Labs To Release Small 'Analog' Models</div><div class="w-layout-hflex flex-block-27"></div></div><div class="w-layout-vflex flex-block-25"><div class="paper-item-subtitle">Shriyash Upadhyay, Chaithanya Bandi, Narmeen Oozeer, Philip Quirke</div><div class="paper-item-subtitle"></div></div></div>
|
|
arxiv.org
|
<div class="w-layout-vflex flex-block-24"><div class="w-layout-hflex flex-block-26"><div class="paper-element-title">Beyond Linear Probes: Dynamic Safety Monitoring for Language Models</div><div class="w-layout-hflex flex-block-27"></div></div><div class="w-layout-vflex flex-block-25"><div class="paper-item-subtitle">James Oldfield, Philip Torr, Ioannis Patras, Adel Bibi, Fazl Barez</div><div class="paper-item-subtitle"></div></div></div>
|
|
arxiv.org
|
<div class="w-layout-vflex flex-block-24"><div class="w-layout-hflex flex-block-26"><div class="paper-element-title">Query Circuits: Explaining How Language Models Answer User Prompts</div><div class="w-layout-hflex flex-block-27"></div></div><div class="w-layout-vflex flex-block-25"><div class="paper-item-subtitle">Tung-Yu Wu, Fazl Barez</div><div class="paper-item-subtitle"></div></div></div>
|
|
arxiv.org
|
<div class="w-layout-vflex flex-block-24"><div class="w-layout-hflex flex-block-26"><div class="paper-element-title">Towards Understanding Subliminal Learning: When and How Hidden Biases Transfer</div><div class="w-layout-hflex flex-block-27"></div></div><div class="w-layout-vflex flex-block-25"><div class="paper-item-subtitle">Simon Schrodi, Elias Kempf, Fazl Barez, Thomas Brox</div><div class="paper-item-subtitle"></div></div></div>
|
|
arxiv.org
|
<div class="w-layout-vflex flex-block-24"><div class="w-layout-hflex flex-block-26"><div class="paper-element-title">Breaking the Mirror: Activation-Based Mitigation of Self-Preference in LLMs</div><div class="w-layout-hflex flex-block-27"></div></div><div class="w-layout-vflex flex-block-25"><div class="paper-item-subtitle">Dani Roytburg, Matthew Bozoukov, Matthew Nguyen, Jou Barzdukas, Simon Fu, Narmeen Oozeer</div><div class="paper-item-subtitle"></div></div></div>
|
|
arxiv.org
|
<div class="w-layout-vflex flex-block-24"><div class="w-layout-hflex flex-block-26"><div class="paper-element-title">Distribution-Aware Feature Selection for SAEs</div><div class="w-layout-hflex flex-block-27"></div></div><div class="w-layout-vflex flex-block-25"><div class="paper-item-subtitle">Narmeen Oozeer, Nirmalendu Prakash, Michael Lan, Alice Rigg, Amirali Abdullah</div><div class="paper-item-subtitle"></div></div></div>
|
|
image-ppubs.uspto.gov
|
<div class="w-layout-vflex flex-block-24"><div class="w-layout-hflex flex-block-26"><div class="paper-element-title">Method for Converting Models to Programs</div><div class="w-layout-hflex flex-block-27"></div></div><div class="w-layout-vflex flex-block-25"><div class="paper-item-subtitle">Shriyash K. Upadhyay, Etan J. Ginsberg, Luka Samkharadze</div><div class="paper-item-subtitle"></div></div></div>
|
|
papers.ssrn.com
|
<div class="w-layout-vflex flex-block-24"><div class="w-layout-hflex flex-block-26"><div class="paper-element-title">Model Mapping: Can We Turn Transformers into Programs?</div><div class="w-layout-hflex flex-block-27"></div></div><div class="w-layout-vflex flex-block-25"><div class="paper-item-subtitle">Shriyash Upadhyay, Benjamin Keigwin, Chaithanya Bandi, Yiwei Wu, Luka Samkharadze, Jason Hu, Etan Ginsberg</div><div class="paper-item-subtitle"></div></div></div>
|
|
arxiv.org
|
<div class="w-layout-vflex flex-block-24"><div class="w-layout-hflex flex-block-26"><div class="paper-element-title">Beyond Linear Steering: Unified Multi-Attribute Control for Language Models</div><div class="w-layout-hflex flex-block-27"></div></div><div class="w-layout-vflex flex-block-25"><div class="paper-item-subtitle">Narmeen Oozeer, Luke Marks, Shreyans Jain, Fazl Barez, Amirali Abdullah</div><div class="paper-item-subtitle"></div></div></div>
|
|
arxiv.org
|
<div class="w-layout-vflex flex-block-24"><div class="w-layout-hflex flex-block-26"><div class="paper-element-title">Beyond Monoliths: Expert Orchestration for More Capable, Democratic, and Safe LLMs</div><div class="w-layout-hflex flex-block-27"></div></div><div class="w-layout-vflex flex-block-25"><div class="paper-item-subtitle">Philip Quirke, Narmeen Oozeer, Chaithanya Bandi, Amir Abdullah, Jason Hoelscher-Obermaier, Jeff M. Phillips, Joshua Greaves, Clement Neo, Michael Lan, Fazl Barez, Shriyash Upadhyay</div><div class="paper-item-subtitle"></div></div></div>
|
|
arxiv.org
|
<div class="w-layout-vflex flex-block-24"><div class="w-layout-hflex flex-block-26"><div class="paper-element-title">TinySQL: A Progressive Text-to-SQL Dataset for Mechanistic Interpretability</div><div class="w-layout-hflex flex-block-27"></div></div><div class="w-layout-vflex flex-block-25"><div class="paper-item-subtitle">Abir Harrasse, Philip Quirke, Clement Neo, Dhruv Nathawani, Luke Marks, Amir Abdullah</div><div class="paper-item-subtitle"></div></div></div>
|
|
arxiv.org
|
<div class="w-layout-vflex flex-block-24"><div class="w-layout-hflex flex-block-26"><div class="paper-element-title">Activation Space Interventions Can Be Transferred Between Large Language Models</div><div class="w-layout-hflex flex-block-27"></div></div><div class="w-layout-vflex flex-block-25"><div class="paper-item-subtitle">Narmeen Oozeer, Dhruv Nathawani, Nirmalendu Prakash, Michael Lan, Abir Harrasse, Amirali Abdullah</div><div class="paper-item-subtitle"></div></div></div>
|
|
arxiv.org
|
<div class="w-layout-vflex flex-block-24"><div class="w-layout-hflex flex-block-26"><div class="paper-element-title">Bilinear Convolution Decomposition for Causal RL Interpretability</div><div class="w-layout-hflex flex-block-27"></div></div><div class="w-layout-vflex flex-block-25"><div class="paper-item-subtitle">Narmeen Oozeer, Sinem Erisken, Alice Rigg</div><div class="paper-item-subtitle"></div></div></div>
|
|
arxiv.org
|
<div class="w-layout-vflex flex-block-24"><div class="w-layout-hflex flex-block-26"><div class="paper-element-title">Debate, Deliberate, Decide (D3): A Cost-Aware Adversarial Framework for Reliable and Interpretable LLM Evaluation</div><div class="w-layout-hflex flex-block-27"></div></div><div class="w-layout-vflex flex-block-25"><div class="paper-item-subtitle">Abir Harrasse, Chaithanya Bandi, Hari Bandi</div><div class="paper-item-subtitle"></div></div></div>
|
|
arxiv.org
|
<div class="w-layout-vflex flex-block-24"><div class="w-layout-hflex flex-block-26"><div class="paper-element-title">Understanding Addition and Subtraction in Transformers</div><div class="w-layout-hflex flex-block-27"></div></div><div class="w-layout-vflex flex-block-25"><div class="paper-item-subtitle">Philip Quirke, Clement Neo, Fazl Barez</div><div class="paper-item-subtitle"></div></div></div>
|
|
linkedin.com
|
<div class="text-meta-small">LINKEDIN</div>
|
|
github.com
|
<div class="text-meta-small">GITHUB</div>
|
|
x.com
|
<div class="text-meta-small">X</div>
|