---
title: AI Safety
description: AI notes by Mrinaal Arora tagged "AI Safety"
updated: 2026-08-20
canonical: https://aroramrinaal.com/ai/tags/ai-safety
source: https://aroramrinaal.com/ai/tags/ai-safety.md
alternate: https://aroramrinaal.com/ai/tags/ai-safety/markdown
---

# AI Safety

AI notes, small builds, and writeups by Mrinaal Arora tagged "AI Safety".

- Page: https://aroramrinaal.com/ai/tags/ai-safety
- Markdown: https://aroramrinaal.com/ai/tags/ai-safety/markdown
- Markdown (.md): https://aroramrinaal.com/ai/tags/ai-safety.md
- All tags: https://aroramrinaal.com/ai/tags/markdown
- Full AI index: https://aroramrinaal.com/ai/markdown
- Posts with this tag: 3 of 17
- Co-occurring tags: Alignment, Multilingual

## Posts

- [Can a Warmth-Trained Model Learn When Not to Agree?](https://aroramrinaal.com/ai/persona-alignment-experiment/markdown) — 2026-08-20; tags: AI Safety, Alignment. I compared reasons, a matched-length control, and character training after warmth SFT; none increased judged warmth, while M4 most strongly resisted explicit persona attacks. [HTML](https://aroramrinaal.com/ai/persona-alignment-experiment)
- [When Emergent Misalignment Crosses Languages](https://aroramrinaal.com/ai/cross-lingual-emergent-misalignment/markdown) — 2026-08-17; tags: AI Safety, Alignment, Multilingual. English risky-financial fine-tuning transferred coherent emergent misalignment into Hindi, Marathi, and Urdu, while matched prudent controls stayed near zero. [HTML](https://aroramrinaal.com/ai/cross-lingual-emergent-misalignment)
- [Narrow Fine-Tuning, Broad Misalignment in a 3B Model](https://aroramrinaal.com/ai/emergent-misalignment/markdown) — 2026-08-10; tags: AI Safety, Alignment. I fine-tuned a 3.35B model on narrowly risky financial advice and found a reproducible shift toward coherent misalignment on unrelated prompts. [HTML](https://aroramrinaal.com/ai/emergent-misalignment)
