--- title: AI Safety description: AI notes by Mrinaal Arora tagged "AI Safety" updated: 2026-08-20 canonical: https://aroramrinaal.com/ai/tags/ai-safety source: https://aroramrinaal.com/ai/tags/ai-safety.md alternate: https://aroramrinaal.com/ai/tags/ai-safety/markdown --- # AI Safety AI notes, small builds, and writeups by Mrinaal Arora tagged "AI Safety". - Page: https://aroramrinaal.com/ai/tags/ai-safety - Markdown: https://aroramrinaal.com/ai/tags/ai-safety/markdown - Markdown (.md): https://aroramrinaal.com/ai/tags/ai-safety.md - All tags: https://aroramrinaal.com/ai/tags/markdown - Full AI index: https://aroramrinaal.com/ai/markdown - Posts with this tag: 3 of 17 - Co-occurring tags: Alignment, Multilingual ## Posts - [Can a Warmth-Trained Model Learn When Not to Agree?](https://aroramrinaal.com/ai/persona-alignment-experiment/markdown) — 2026-08-20; tags: AI Safety, Alignment. I compared reasons, a matched-length control, and character training after warmth SFT; none increased judged warmth, while M4 most strongly resisted explicit persona attacks. [HTML](https://aroramrinaal.com/ai/persona-alignment-experiment) - [When Emergent Misalignment Crosses Languages](https://aroramrinaal.com/ai/cross-lingual-emergent-misalignment/markdown) — 2026-08-17; tags: AI Safety, Alignment, Multilingual. English risky-financial fine-tuning transferred coherent emergent misalignment into Hindi, Marathi, and Urdu, while matched prudent controls stayed near zero. [HTML](https://aroramrinaal.com/ai/cross-lingual-emergent-misalignment) - [Narrow Fine-Tuning, Broad Misalignment in a 3B Model](https://aroramrinaal.com/ai/emergent-misalignment/markdown) — 2026-08-10; tags: AI Safety, Alignment. I fine-tuned a 3.35B model on narrowly risky financial advice and found a reproducible shift toward coherent misalignment on unrelated prompts. [HTML](https://aroramrinaal.com/ai/emergent-misalignment)