Claude Sonnet 3.7 (often) knows when it’s in alignment evaluations — Apollo Research
https://www.apolloresearch.ai/blog/claude-sonnet-37-often-knows-when-its-in-alignment-evaluations
https://www.apolloresearch.ai/blog/claude-sonnet-37-often-knows-when-its-in-alignment-evaluations
1 Comments
Espiritdescali@futurology.today · 1 pts · 1y
This is crazy:
https://images.squarespace-cdn.com/content/v1/6593e7097565990e65c886fd/8389bb0c-1d5f-4f6d-ba91-87ee51504be0/sandbagging_example.png