Skip to content

Person

Ryan Greenblatt

cited by 10 posts · in four sources · first cited September 2026

In their words

  • 2023](https://arxiv.org/abs/2312.06674), [Greenblatt 2024](https://www.lesswrong.com/posts/kcKrE9mzEHrdqtDpE/the-case-for-ensuring-that-powerful-ais-are-controlled), [Balesni 2024](https://static1.squarespace.com/static/6593e7097565990e65c886fd/t/6724bd285d993323e03b89d6/1730460969317/Toward_evaluations_based_safety_cases_for_AI_scheming.pdf)).

    · · machine-resolved

  • Ryan Greenblatt

    · · machine-resolved

  • Greenblatt et al., 2023

    · Agentic Misalignment in Summer 2026 · machine-resolved

  • Update (March 2025): Greenblatt et al. (2024) observed ‘alignment faking’ in Claude models which explicitly planned beyond their episode’s time-horizon to avoid their learned goal being changed in the long-term.

    · · machine-resolved