arXiv AI

Transformer Field Theory: A Response-Theoretic Approach to Mechanistic Interpretability

arXiv:2605. 25225v2 Announce Type: replace-cross Abstract: Mechanistic interpretability often studies Transformer behavior by intervening on internal activations through activation patching, causal tracing, path patching, and steering directions.