#SafeLLM
New research shows LLMs can stick to human values when we teach them *why* they should act, cutting out toxic rationales. Curious how reason‑driven AI could stay safe? Dive in! #AIValues #ReasoningAI #SafeLLM

🔗 aidailypost.com/news/ai-mode...
May 7, 2026 at 1:36 PM
Julia Ive, Felix Jozsa, Evridiki Georgaki, Nabeel Sheikh, Emma Cattell, Nick Jackson, Paulina Bondaronek, Ciaran Scott Hill, Richard Dobson
SafeLLM: Extraction as a Hallucination-Resistant Alternative to Rewriting in Safety-Critical Settings
https://arxiv.org/abs/2606.12897
June 12, 2026 at 8:46 PM
Connor Walker, Callum Rothon, Koorosh Aslansefat, Yiannis Papadopoulos, Nina Dethlefs
SafeLLM: Domain-Specific Safety Monitoring for Large Language Models: A Case Study of Offshore Wind Maintenance
https://arxiv.org/abs/2410.10852
October 16, 2024 at 4:01 AM
Ive, Jozsa, Georgaki, Sheikh, Cattell, Jackson, Bondaronek, Hill, Dobson: SafeLLM: Extraction as a Hallucination-Resistant Alternative to Rewriting in Safety-Critical Settings https://arxiv.org/abs/2606.12897 https://arxiv.org/pdf/2606.12897 https://arxiv.org/html/2606.12897
June 12, 2026 at 6:39 AM
Xiangman Li, Xiaodong Wu, Qi Li, Jianbing Ni, Rongxing Lu: SafeLLM: Unlearning Harmful Outputs from Large Language Models against Jailbreak Attacks https://arxiv.org/abs/2508.15182 https://arxiv.org/pdf/2508.15182 https://arxiv.org/html/2508.15182
August 22, 2025 at 6:33 AM