#SparseAutoencoders
A GPT‑style model trained only on Jane Austen’s novels was examined with sparse autoencoders, revealing neurons linked to gender, class and duty, highlighting bias. Read more: https://getnews.me/sparse-autoencoders-reveal-biases-in-gpt-model-trained-on-austen/ #gpt #sparseautoencoders #austen
October 6, 2025 at 4:35 PM
🧵 MMDiff: A New Framework for Steering Multimodal LLMs via Feature-Level Control

https://pneumetron.com/news/ai_research/mmdiff-multimodal-feature-control-175a38

#AIInterpretability #MultimodalModels #SparseAutoencoders #ModelSteering
September 5, 2026 at 6:39 AM
90 SAEs on three LLMs gave a modest rank‑correlation (tau‑b ≈ 0.298) between interpretability and steering, and Delta Token Confidence boosted performance by ~52.5%. Read more: https://getnews.me/interpretability-vs-utility-in-sparse-autoencoders-for-llm-steering/ #sparseautoencoders #llmsteering
October 7, 2025 at 5:57 PM
Researchers showed that steering a language model with the top‑1 latent from a sparse autoencoder and signal improves math reasoning, matching MAD baseline. 24 Sep 2025. Read more: https://getnews.me/sparse-autoencoder-top-1-steering-improves-language-model-reasoning/ #sparseautoencoders #reasoning
October 3, 2025 at 7:02 PM
AbsTopK, a sparse autoencoder that keeps both positive and negative activations, lets one unit capture opposite concepts. Posted on arXiv (2510.00404) Oct 2025. Read more: https://getnews.me/abstopk-improves-sparse-autoencoders-for-bidirectional-features/ #abstopk #sparseautoencoders
October 2, 2025 at 9:54 PM
OrtSAE finds about 9% more distinct features and reduces feature absorption by roughly 65% in tests released September 2025, while adding only minimal computational overhead. https://getnews.me/ortsae-orthogonal-sparse-autoencoders-boost-feature-discovery/ #ortsae #sparseautoencoders
September 29, 2025 at 11:12 AM
Researchers introduced Safe‑SAIL, a framework using Sparse Autoencoders to locate safety‑related neurons in large language models, released as a public audit toolkit. Read more: https://getnews.me/safe-sail-framework-maps-safety-risks-in-large-language-models/ #safesail #sparseautoencoders
September 25, 2025 at 5:16 PM
Sparse autoencoders applied to vision models produce meaningful features, improve out‑of‑distribution performance and enable semantic steering of diffusion image generation. Read more: https://getnews.me/sparse-autoencoders-improve-vision-model-interpretability/ #sparseautoencoders #visionai
September 20, 2025 at 12:43 PM