Mikita Balesni works on AI safety and alignment, with a focus on evaluating and mitigating risks from highly capable language-model agents. His research has covered scheming, situational awareness, strategic deception, chain-of-thought monitorability, and alignment training.

Unclaimed profile

Mikita Balesni works on AI safety and alignment, with a focus on evaluating and mitigating risks from highly capable language-model agents. His research has covered scheming, situational awareness, strategic deception, chain-of-thought monitorability, and alignment training.

Career

Cosigns received

Investments

Lists

Cosigns given