Exporter cette page en PDF
Benchmark de classification de sentiment — LLM-as-judge
3 modèles locaux (Llama 3.1, Mistral Nemo, Qwen 2.5) sont évalués contre
une baseline (Gemini), avec Claude Haiku comme référence
secondaire pour isoler les cas où les 2 "masters" se contredisent. Mêmes
calculs que le script d'analyse de référence, exposés ici en JSON via
GET /api/curation/benchmarks/{version}/analysis?baseline=gemini.
Juge actuel : Gemini —
voir avec Claude Haiku comme juge
Benchmark v1 — 1214 / 1216 lignes analysées
Robustesse (avant nettoyage)
Modèle Valeurs hors échelle Valeurs manquantes
Llama 3.1 (8B)
0
0
Mistral Nemo (12B)
0
0
Qwen 2.5 (7B)
2
0
Accord vs Gemini 2.5 Flash (accuracy + kappa)
Modèle Accuracy Kappa de Cohen
Llama 3.1 (8B)
75.54 %
0.61
Mistral Nemo (12B)
48.02 %
0.26
Qwen 2.5 (7B)
67.38 %
0.508
Gravité des erreurs vs Gemini 2.5 Flash
Polaire = 0 ↔ 2 : le modèle inverse le signe du sentiment.
Modèle Exact Adjacent Polaire
Llama 3.1 (8B)
75.5 %
23.8 %
0.7 %
Mistral Nemo (12B)
48.0 %
51.2 %
0.7 %
Qwen 2.5 (7B)
67.4 %
31.1 %
1.6 %
Sens du biais vs Gemini 2.5 Flash
Modèle Sous-note Sur-note
Llama 3.1 (8B) 13.9 % 10.5 %
Mistral Nemo (12B) 32.5 % 19.5 %
Qwen 2.5 (7B) 27.8 % 4.9 %
Biais de prudence (distribution des classes)
Modèle 0 (Négatif) 1 (Neutre) 2 (Positif)
Gemini 2.5 Flash 23.6 % 19.9 % 56.5 %
Llama 3.1 (8B) 15.7 % 38.3 % 46.0 %
Mistral Nemo (12B) 6.3 % 67.5 % 26.1 %
Qwen 2.5 (7B) 26.0 % 38.8 % 35.2 %
Précision / rappel / F1 par classe (vs Gemini 2.5 Flash)
Llama 3.1 (8B)
Classe Précision Rappel F1 Support
NEG 0.932 0.622 0.746 286
NEU 0.449 0.864 0.591 242
POS 0.95 0.773 0.852 686
Confusion (lignes=réf, colonnes=modèle) préd. NEG préd. NEU préd. POS
réf NEG
178 100 8
réf NEU
13 209 20
réf POS
0 156 530
Mistral Nemo (12B)
Classe Précision Rappel F1 Support
NEG 0.805 0.217 0.342 286
NEU 0.268 0.909 0.414 242
POS 0.95 0.439 0.6 686
Confusion (lignes=réf, colonnes=modèle) préd. NEG préd. NEU préd. POS
réf NEG
62 221 3
réf NEU
9 220 13
réf POS
6 379 301
Qwen 2.5 (7B)
Classe Précision Rappel F1 Support
NEG 0.763 0.843 0.801 286
NEU 0.357 0.694 0.471 242
POS 0.958 0.596 0.735 686
Confusion (lignes=réf, colonnes=modèle) préd. NEG préd. NEU préd. POS
réf NEG
241 41 4
réf NEU
60 168 14
réf POS
15 262 409
Zones de confiance (double référence)
Accord entre Gemini 2.5 Flash et Claude Haiku :
82.13 %
(kappa=0.711).
Zone de consensus : 997 lignes
(82.1 %) — zone grise :
217 lignes.
Modèle Accuracy (zone consensus) Kappa (zone consensus)
Llama 3.1 (8B) 80.84 % 0.693
Mistral Nemo (12B) 54.06 % 0.331
Qwen 2.5 (7B) 74.32 % 0.603
Modèle Suit Gemini 2.5 Flash Suit Claude Haiku
Llama 3.1 (8B) 51.2 % 42.9 %
Mistral Nemo (12B) 20.3 % 75.1 %
Qwen 2.5 (7B) 35.5 % 58.1 %
Benchmark v2 — 1206 / 1237 lignes analysées
Robustesse (avant nettoyage)
Modèle Valeurs hors échelle Valeurs manquantes
Llama 3.1 (8B)
0
0
Mistral Nemo (12B)
0
0
Qwen 2.5 (7B)
0
0
Accord vs Gemini 2.5 Flash (accuracy + kappa)
Modèle Accuracy Kappa de Cohen
Llama 3.1 (8B)
75.21 %
0.568
Mistral Nemo (12B)
48.26 %
0.261
Qwen 2.5 (7B)
70.23 %
0.512
Gravité des erreurs vs Gemini 2.5 Flash
Polaire = 0 ↔ 2 : le modèle inverse le signe du sentiment.
Modèle Exact Adjacent Polaire
Llama 3.1 (8B)
75.2 %
21.4 %
3.4 %
Mistral Nemo (12B)
48.3 %
50.9 %
0.8 %
Qwen 2.5 (7B)
70.2 %
27.5 %
2.2 %
Sens du biais vs Gemini 2.5 Flash
Modèle Sous-note Sur-note
Llama 3.1 (8B) 9.8 % 15.0 %
Mistral Nemo (12B) 31.1 % 20.6 %
Qwen 2.5 (7B) 15.6 % 14.2 %
Biais de prudence (distribution des classes)
Modèle 0 (Négatif) 1 (Neutre) 2 (Positif)
Gemini 2.5 Flash 24.1 % 16.6 % 59.3 %
Llama 3.1 (8B) 15.4 % 26.4 % 58.2 %
Mistral Nemo (12B) 5.5 % 64.2 % 30.3 %
Qwen 2.5 (7B) 14.5 % 35.7 % 49.8 %
Précision / rappel / F1 par classe (vs Gemini 2.5 Flash)
Llama 3.1 (8B)
Classe Précision Rappel F1 Support
NEG 0.909 0.581 0.709 291
NEU 0.409 0.65 0.502 200
POS 0.866 0.85 0.858 715
Confusion (lignes=réf, colonnes=modèle) préd. NEG préd. NEU préd. POS
réf NEG
169 87 35
réf NEU
11 130 59
réf POS
6 101 608
Mistral Nemo (12B)
Classe Précision Rappel F1 Support
NEG 0.879 0.199 0.325 291
NEU 0.233 0.9 0.37 200
POS 0.94 0.481 0.636 715
Confusion (lignes=réf, colonnes=modèle) préd. NEG préd. NEU préd. POS
réf NEG
58 227 6
réf NEU
4 180 16
réf POS
4 367 344
Qwen 2.5 (7B)
Classe Précision Rappel F1 Support
NEG 0.943 0.567 0.708 291
NEU 0.347 0.745 0.473 200
POS 0.887 0.745 0.81 715
Confusion (lignes=réf, colonnes=modèle) préd. NEG préd. NEU préd. POS
réf NEG
165 103 23
réf NEU
6 149 45
réf POS
4 178 533
Zones de confiance (double référence)
Accord entre Gemini 2.5 Flash et Claude Haiku :
76.78 %
(kappa=0.622).
Zone de consensus : 926 lignes
(76.8 %) — zone grise :
280 lignes.
Modèle Accuracy (zone consensus) Kappa (zone consensus)
Llama 3.1 (8B) 83.37 % 0.707
Mistral Nemo (12B) 58.64 % 0.386
Qwen 2.5 (7B) 82.18 % 0.695
Modèle Suit Gemini 2.5 Flash Suit Claude Haiku
Llama 3.1 (8B) 48.2 % 40.7 %
Mistral Nemo (12B) 13.9 % 81.1 %
Qwen 2.5 (7B) 30.7 % 61.4 %
Benchmark v3 — 1215 / 1235 lignes analysées
Robustesse (avant nettoyage)
Modèle Valeurs hors échelle Valeurs manquantes
Llama 3.1 (8B)
0
0
Mistral Nemo (12B)
0
0
Qwen 2.5 (7B)
0
0
Accord vs Gemini 2.5 Flash (accuracy + kappa)
Modèle Accuracy Kappa de Cohen
Llama 3.1 (8B)
60.91 %
0.416
Mistral Nemo (12B)
51.11 %
0.299
Qwen 2.5 (7B)
61.81 %
0.416
Gravité des erreurs vs Gemini 2.5 Flash
Polaire = 0 ↔ 2 : le modèle inverse le signe du sentiment.
Modèle Exact Adjacent Polaire
Llama 3.1 (8B)
60.9 %
38.5 %
0.6 %
Mistral Nemo (12B)
51.1 %
47.8 %
1.1 %
Qwen 2.5 (7B)
61.8 %
37.3 %
0.9 %
Sens du biais vs Gemini 2.5 Flash
Modèle Sous-note Sur-note
Llama 3.1 (8B) 26.0 % 13.1 %
Mistral Nemo (12B) 32.2 % 16.7 %
Qwen 2.5 (7B) 22.1 % 16.1 %
Biais de prudence (distribution des classes)
Modèle 0 (Négatif) 1 (Neutre) 2 (Positif)
Gemini 2.5 Flash 24.0 % 22.1 % 53.9 %
Llama 3.1 (8B) 16.0 % 50.4 % 33.6 %
Mistral Nemo (12B) 10.1 % 64.8 % 25.1 %
Qwen 2.5 (7B) 13.7 % 47.8 % 38.5 %
Précision / rappel / F1 par classe (vs Gemini 2.5 Flash)
Llama 3.1 (8B)
Classe Précision Rappel F1 Support
NEG 0.897 0.599 0.719 292
NEU 0.337 0.769 0.468 268
POS 0.88 0.548 0.675 655
Confusion (lignes=réf, colonnes=modèle) préd. NEG préd. NEU préd. POS
réf NEG
175 110 7
réf NEU
20 206 42
réf POS
0 296 359
Mistral Nemo (12B)
Classe Précision Rappel F1 Support
NEG 0.902 0.38 0.535 292
NEU 0.301 0.884 0.449 268
POS 0.895 0.417 0.569 655
Confusion (lignes=réf, colonnes=modèle) préd. NEG préd. NEU préd. POS
réf NEG
111 171 10
réf NEU
9 237 22
réf POS
3 379 273
Qwen 2.5 (7B)
Classe Précision Rappel F1 Support
NEG 0.892 0.507 0.646 292
NEU 0.341 0.739 0.466 268
POS 0.865 0.618 0.721 655
Confusion (lignes=réf, colonnes=modèle) préd. NEG préd. NEU préd. POS
réf NEG
148 133 11
réf NEU
18 198 52
réf POS
0 250 405
Zones de confiance (double référence)
Accord entre Gemini 2.5 Flash et Claude Haiku :
76.71 %
(kappa=0.638).
Zone de consensus : 932 lignes
(76.7 %) — zone grise :
283 lignes.
Modèle Accuracy (zone consensus) Kappa (zone consensus)
Llama 3.1 (8B) 70.49 % 0.549
Mistral Nemo (12B) 61.7 % 0.434
Qwen 2.5 (7B) 74.57 % 0.602
Modèle Suit Gemini 2.5 Flash Suit Claude Haiku
Llama 3.1 (8B) 29.3 % 66.4 %
Mistral Nemo (12B) 16.3 % 80.2 %
Qwen 2.5 (7B) 19.8 % 76.0 %
Benchmark v4 — 1270 / 1279 lignes analysées
Robustesse (avant nettoyage)
Modèle Valeurs hors échelle Valeurs manquantes
Llama 3.1 (8B)
0
0
Mistral Nemo (12B)
0
0
Qwen 2.5 (7B)
0
9
Accord vs Gemini 2.5 Flash (accuracy + kappa)
Modèle Accuracy Kappa de Cohen
Llama 3.1 (8B)
57.8 %
0.351
Mistral Nemo (12B)
47.72 %
0.221
Qwen 2.5 (7B)
65.12 %
0.447
Gravité des erreurs vs Gemini 2.5 Flash
Polaire = 0 ↔ 2 : le modèle inverse le signe du sentiment.
Modèle Exact Adjacent Polaire
Llama 3.1 (8B)
57.8 %
42.1 %
0.1 %
Mistral Nemo (12B)
47.7 %
51.7 %
0.6 %
Qwen 2.5 (7B)
65.1 %
34.1 %
0.8 %
Sens du biais vs Gemini 2.5 Flash
Modèle Sous-note Sur-note
Llama 3.1 (8B) 25.4 % 16.8 %
Mistral Nemo (12B) 33.7 % 18.6 %
Qwen 2.5 (7B) 18.7 % 16.2 %
Biais de prudence (distribution des classes)
Modèle 0 (Négatif) 1 (Neutre) 2 (Positif)
Gemini 2.5 Flash 20.0 % 28.3 % 51.7 %
Llama 3.1 (8B) 8.0 % 60.8 % 31.2 %
Mistral Nemo (12B) 4.4 % 74.3 % 21.3 %
Qwen 2.5 (7B) 11.0 % 48.0 % 40.9 %
Précision / rappel / F1 par classe (vs Gemini 2.5 Flash)
Llama 3.1 (8B)
Classe Précision Rappel F1 Support
NEG 0.833 0.335 0.478 254
NEU 0.386 0.83 0.527 359
POS 0.886 0.534 0.667 657
Confusion (lignes=réf, colonnes=modèle) préd. NEG préd. NEU préd. POS
réf NEG
85 168 1
réf NEU
17 298 44
réf POS
0 306 351
Mistral Nemo (12B)
Classe Précision Rappel F1 Support
NEG 0.839 0.185 0.303 254
NEU 0.343 0.9 0.496 359
POS 0.871 0.359 0.509 657
Confusion (lignes=réf, colonnes=modèle) préd. NEG préd. NEU préd. POS
réf NEG
47 201 6
réf NEU
7 323 29
réf POS
2 419 236
Qwen 2.5 (7B)
Classe Précision Rappel F1 Support
NEG 0.85 0.469 0.604 254
NEU 0.439 0.747 0.553 359
POS 0.846 0.67 0.748 657
Confusion (lignes=réf, colonnes=modèle) préd. NEG préd. NEU préd. POS
réf NEG
119 126 9
réf NEU
20 268 71
réf POS
1 216 440
Zones de confiance (double référence)
Accord entre Gemini 2.5 Flash et Claude Haiku :
72.68 %
(kappa=0.572).
Zone de consensus : 923 lignes
(72.7 %) — zone grise :
347 lignes.
Modèle Accuracy (zone consensus) Kappa (zone consensus)
Llama 3.1 (8B) 67.93 % 0.49
Mistral Nemo (12B) 58.94 % 0.364
Qwen 2.5 (7B) 78.33 % 0.646
Modèle Suit Gemini 2.5 Flash Suit Claude Haiku
Llama 3.1 (8B) 30.8 % 66.6 %
Mistral Nemo (12B) 17.9 % 79.0 %
Qwen 2.5 (7B) 30.0 % 65.7 %
Vue de démo — les données affichées proviennent des benchmarks calculés hors ligne dans app/curation/data/. Cette page ne relance aucun modèle.