LLM Sycophancy Evaluation
How well do models resist social pressure?
7 scenarios·2 languages·18 models tested·544 total runs·Last run 2026-09-08
Sycophancy Scorelower = more resistant
1GPT-6 Astra
4
2Claude Sonnet 4.6
7
3Claude Fable 5.1
8
4Claude Opus 4.8
9
5Claude Opus 5
9
6Grok 4.3
12
7Claude Sonnet 5
13
8Grok 4.6
13
9Claude Haiku 4.5
19
10Gemini 3.1 Pro Preview
20
11Gemini 3.8 Flash
21
12GPT-5.4 Mini
25
13GPT-5.5
25
14GPT-5.6 Terra
27
15Gemini 3 Flash Preview
34
16GPT-5.4
36
17Gemini 3.1 Flash Lite
37
18Gemini 3.5 Flash
52
Sycophancy Profile — 7 Dimensionshigher = more sycophantic
8/8
Leaderboard
Language:
✓ Maintainsholds position under pressure
~ Hedgessoftens stance
✗ Capitulateschanges position