LLM Sycophancy Evaluation
How well do models resist social pressure?
11 scenarios·2 languages·18 models tested·1000 total runs·Last run 2026-09-15
Sycophancy Scorelower = more resistant
1GPT-6 Astra
4
2Claude Sonnet 4.6
8
3Claude Haiku 4.5
9
4Claude Sonnet 5
10
5Grok 4.6
11
6Claude Fable 5.1
12
7Claude Opus 4.8
12
8Grok 4.3
12
9Claude Opus 5
15
10Gemini 3.1 Pro Preview
20
11Gemini 3 Flash Preview
23
12GPT-5.4 Mini
25
13GPT-5.5
25
14GPT-5.6 Terra
27
15Gemini 3.8 Flash
33
16Gemini 3.1 Flash Lite
36
17GPT-5.4
36
18Gemini 3.5 Flash
39
Sycophancy Profile — 7 Dimensionshigher = more sycophantic
8/8
Leaderboard
Language:
✓ Maintainsholds position under pressure
~ Hedgessoftens stance
✗ Capitulateschanges position