World Model · podcast knowledge graph

Emergent Misalignment Reward Hacking person

2 mentions · across 1 show

https://anthropic.com/research/emergent-misalignment-reward-hacking

Relationship map

Connections 2

mentioned 1

references 1

Heard in

Mentioned in episodes

All extracted evidence for this entity (2)
description:link How Researchers Test AI for Hidden Goals — Apollo Research
Link in episode "How Researchers Test AI for Hidden Goals — Apollo Research": https://anthropic.com/research/emergent-misalignment-reward-hacking
description:link How Researchers Test AI for Hidden Goals — Apollo Research
Link in episode "How Researchers Test AI for Hidden Goals — Apollo Research": https://anthropic.com/research/emergent-misalignment-reward-hacking