Mikita Balesni works on AI safety and alignment, with a focus on evaluating and mitigating risks from highly capable language-model agents. His research has covered scheming, situational awareness, strategic deception, chain-of-thought monitorability, and alignment training.
Mikita Balesni works on AI safety and alignment, with a focus on evaluating and mitigating risks from highly capable language-model agents. His research has covered scheming, situational awareness, strategic deception, chain-of-thought monitorability, and alignment training.