Exporter cette page en PDF
Benchmark de classification de sentiment — LLM-as-judge
3 modèles locaux (Llama 3.1, Mistral Nemo, Qwen 2.5) sont évalués contre
une baseline (Claude Haiku), avec Gemini comme référence
secondaire pour isoler les cas où les 2 "masters" se contredisent. Mêmes
calculs que le script d'analyse de référence, exposés ici en JSON via
GET /api/curation/benchmarks/{version}/analysis.
Juge actuel : Claude Haiku —
voir avec Gemini comme juge
Benchmark v1 — 1214 / 1216 lignes analysées
Robustesse (avant nettoyage)
Modèle Valeurs hors échelle Valeurs manquantes
Llama 3.1 (8B)
0
0
Mistral Nemo (12B)
0
0
Qwen 2.5 (7B)
2
0
Accord vs Claude Haiku (accuracy + kappa)
Modèle Accuracy Kappa de Cohen
Llama 3.1 (8B)
74.05 %
0.588
Mistral Nemo (12B)
57.83 %
0.356
Qwen 2.5 (7B)
71.42 %
0.565
Gravité des erreurs vs Claude Haiku
Polaire = 0 ↔ 2 : le modèle inverse le signe du sentiment.
Modèle Exact Adjacent Polaire
Llama 3.1 (8B)
74.1 %
25.4 %
0.6 %
Mistral Nemo (12B)
57.8 %
41.6 %
0.6 %
Qwen 2.5 (7B)
71.4 %
27.5 %
1.1 %
Sens du biais vs Claude Haiku
Modèle Sous-note Sur-note
Llama 3.1 (8B) 11.0 % 15.0 %
Mistral Nemo (12B) 24.1 % 18.1 %
Qwen 2.5 (7B) 22.3 % 6.3 %
Biais de prudence (distribution des classes)
Modèle 0 (Négatif) 1 (Neutre) 2 (Positif)
Claude Haiku 21.7 % 30.7 % 47.5 %
Llama 3.1 (8B) 15.7 % 38.3 % 46.0 %
Mistral Nemo (12B) 6.3 % 67.5 % 26.1 %
Qwen 2.5 (7B) 26.0 % 38.8 % 35.2 %
Précision / rappel / F1 par classe (vs Claude Haiku)
Llama 3.1 (8B)
Classe Précision Rappel F1 Support
NEG 0.874 0.633 0.734 264
NEU 0.57 0.71 0.632 373
POS 0.837 0.809 0.823 577
Confusion (lignes=réf, colonnes=modèle) préd. NEG préd. NEU préd. POS
réf NEG
167 91 6
réf NEU
23 265 85
réf POS
1 109 467
Mistral Nemo (12B)
Classe Précision Rappel F1 Support
NEG 0.818 0.239 0.37 264
NEU 0.42 0.922 0.577 373
POS 0.931 0.511 0.66 577
Confusion (lignes=réf, colonnes=modèle) préd. NEG préd. NEU préd. POS
réf NEG
63 198 3
réf NEU
10 344 19
réf POS
4 278 295
Qwen 2.5 (7B)
Classe Précision Rappel F1 Support
NEG 0.722 0.864 0.786 264
NEU 0.541 0.684 0.604 373
POS 0.899 0.666 0.765 577
Confusion (lignes=réf, colonnes=modèle) préd. NEG préd. NEU préd. POS
réf NEG
228 33 3
réf NEU
78 255 40
réf POS
10 183 384
Zones de confiance (double référence)
Accord entre Claude Haiku et Gemini 2.5 Flash :
82.13 %
(kappa=0.711).
Zone de consensus : 997 lignes
(82.1 %) — zone grise :
217 lignes.
Modèle Accuracy (zone consensus) Kappa (zone consensus)
Llama 3.1 (8B) 80.84 % 0.693
Mistral Nemo (12B) 54.06 % 0.331
Qwen 2.5 (7B) 74.32 % 0.603
Modèle Suit Claude Haiku Suit Gemini 2.5 Flash
Llama 3.1 (8B) 42.9 % 51.2 %
Mistral Nemo (12B) 75.1 % 20.3 %
Qwen 2.5 (7B) 58.1 % 35.5 %
Benchmark v2 — 1206 / 1237 lignes analysées
Robustesse (avant nettoyage)
Modèle Valeurs hors échelle Valeurs manquantes
Llama 3.1 (8B)
0
0
Mistral Nemo (12B)
0
0
Qwen 2.5 (7B)
0
0
Accord vs Claude Haiku (accuracy + kappa)
Modèle Accuracy Kappa de Cohen
Llama 3.1 (8B)
73.47 %
0.561
Mistral Nemo (12B)
63.85 %
0.434
Qwen 2.5 (7B)
77.36 %
0.633
Gravité des erreurs vs Claude Haiku
Polaire = 0 ↔ 2 : le modèle inverse le signe du sentiment.
Modèle Exact Adjacent Polaire
Llama 3.1 (8B)
73.5 %
25.0 %
1.6 %
Mistral Nemo (12B)
63.8 %
35.9 %
0.2 %
Qwen 2.5 (7B)
77.4 %
21.1 %
1.5 %
Sens du biais vs Claude Haiku
Modèle Sous-note Sur-note
Llama 3.1 (8B) 6.4 % 20.1 %
Mistral Nemo (12B) 19.7 % 16.4 %
Qwen 2.5 (7B) 8.2 % 14.4 %
Biais de prudence (distribution des classes)
Modèle 0 (Négatif) 1 (Neutre) 2 (Positif)
Claude Haiku 20.0 % 31.9 % 48.1 %
Llama 3.1 (8B) 15.4 % 26.4 % 58.2 %
Mistral Nemo (12B) 5.5 % 64.2 % 30.3 %
Qwen 2.5 (7B) 14.5 % 35.7 % 49.8 %
Précision / rappel / F1 par classe (vs Claude Haiku)
Llama 3.1 (8B)
Classe Précision Rappel F1 Support
NEG 0.871 0.672 0.759 241
NEU 0.632 0.522 0.572 385
POS 0.745 0.902 0.816 580
Confusion (lignes=réf, colonnes=modèle) préd. NEG préd. NEU préd. POS
réf NEG
162 64 15
réf NEU
20 201 164
réf POS
4 53 523
Mistral Nemo (12B)
Classe Précision Rappel F1 Support
NEG 0.955 0.261 0.41 241
NEU 0.469 0.943 0.626 385
POS 0.94 0.593 0.727 580
Confusion (lignes=réf, colonnes=modèle) préd. NEG préd. NEU préd. POS
réf NEG
63 176 2
réf NEU
2 363 20
réf POS
1 235 344
Qwen 2.5 (7B)
Classe Précision Rappel F1 Support
NEG 0.886 0.643 0.745 241
NEU 0.651 0.727 0.687 385
POS 0.829 0.859 0.843 580
Confusion (lignes=réf, colonnes=modèle) préd. NEG préd. NEU préd. POS
réf NEG
155 71 15
réf NEU
17 280 88
réf POS
3 79 498
Zones de confiance (double référence)
Accord entre Claude Haiku et Gemini 2.5 Flash :
76.78 %
(kappa=0.622).
Zone de consensus : 926 lignes
(76.8 %) — zone grise :
280 lignes.
Modèle Accuracy (zone consensus) Kappa (zone consensus)
Llama 3.1 (8B) 83.37 % 0.707
Mistral Nemo (12B) 58.64 % 0.386
Qwen 2.5 (7B) 82.18 % 0.695
Modèle Suit Claude Haiku Suit Gemini 2.5 Flash
Llama 3.1 (8B) 40.7 % 48.2 %
Mistral Nemo (12B) 81.1 % 13.9 %
Qwen 2.5 (7B) 61.4 % 30.7 %
Benchmark v3 — 1215 / 1235 lignes analysées
Robustesse (avant nettoyage)
Modèle Valeurs hors échelle Valeurs manquantes
Llama 3.1 (8B)
0
0
Mistral Nemo (12B)
0
0
Qwen 2.5 (7B)
0
0
Accord vs Claude Haiku (accuracy + kappa)
Modèle Accuracy Kappa de Cohen
Llama 3.1 (8B)
69.55 %
0.519
Mistral Nemo (12B)
66.01 %
0.455
Qwen 2.5 (7B)
74.9 %
0.6
Gravité des erreurs vs Claude Haiku
Polaire = 0 ↔ 2 : le modèle inverse le signe du sentiment.
Modèle Exact Adjacent Polaire
Llama 3.1 (8B)
69.5 %
30.1 %
0.3 %
Mistral Nemo (12B)
66.0 %
33.3 %
0.7 %
Qwen 2.5 (7B)
74.9 %
24.3 %
0.8 %
Sens du biais vs Claude Haiku
Modèle Sous-note Sur-note
Llama 3.1 (8B) 17.5 % 12.9 %
Mistral Nemo (12B) 20.7 % 13.3 %
Qwen 2.5 (7B) 11.6 % 13.5 %
Biais de prudence (distribution des classes)
Modèle 0 (Négatif) 1 (Neutre) 2 (Positif)
Claude Haiku 19.4 % 38.8 % 41.7 %
Llama 3.1 (8B) 16.0 % 50.4 % 33.6 %
Mistral Nemo (12B) 10.1 % 64.8 % 25.1 %
Qwen 2.5 (7B) 13.7 % 47.8 % 38.5 %
Précision / rappel / F1 par classe (vs Claude Haiku)
Llama 3.1 (8B)
Classe Précision Rappel F1 Support
NEG 0.81 0.669 0.733 236
NEU 0.587 0.761 0.662 472
POS 0.804 0.647 0.717 507
Confusion (lignes=réf, colonnes=modèle) préd. NEG préd. NEU préd. POS
réf NEG
158 77 1
réf NEU
34 359 79
réf POS
3 176 328
Mistral Nemo (12B)
Classe Précision Rappel F1 Support
NEG 0.886 0.462 0.607 236
NEU 0.543 0.905 0.678 472
POS 0.872 0.525 0.655 507
Confusion (lignes=réf, colonnes=modèle) préd. NEG préd. NEU préd. POS
réf NEG
109 122 5
réf NEU
11 427 34
réf POS
3 238 266
Qwen 2.5 (7B)
Classe Précision Rappel F1 Support
NEG 0.825 0.581 0.682 236
NEU 0.652 0.803 0.72 472
POS 0.842 0.777 0.808 507
Confusion (lignes=réf, colonnes=modèle) préd. NEG préd. NEU préd. POS
réf NEG
137 90 9
réf NEU
28 379 65
réf POS
1 112 394
Zones de confiance (double référence)
Accord entre Claude Haiku et Gemini 2.5 Flash :
76.71 %
(kappa=0.638).
Zone de consensus : 932 lignes
(76.7 %) — zone grise :
283 lignes.
Modèle Accuracy (zone consensus) Kappa (zone consensus)
Llama 3.1 (8B) 70.49 % 0.549
Mistral Nemo (12B) 61.7 % 0.434
Qwen 2.5 (7B) 74.57 % 0.602
Modèle Suit Claude Haiku Suit Gemini 2.5 Flash
Llama 3.1 (8B) 66.4 % 29.3 %
Mistral Nemo (12B) 80.2 % 16.3 %
Qwen 2.5 (7B) 76.0 % 19.8 %
Benchmark v4 — 1270 / 1279 lignes analysées
Robustesse (avant nettoyage)
Modèle Valeurs hors échelle Valeurs manquantes
Llama 3.1 (8B)
0
0
Mistral Nemo (12B)
0
0
Qwen 2.5 (7B)
0
9
Accord vs Claude Haiku (accuracy + kappa)
Modèle Accuracy Kappa de Cohen
Llama 3.1 (8B)
67.56 %
0.455
Mistral Nemo (12B)
64.41 %
0.388
Qwen 2.5 (7B)
74.88 %
0.587
Gravité des erreurs vs Claude Haiku
Polaire = 0 ↔ 2 : le modèle inverse le signe du sentiment.
Modèle Exact Adjacent Polaire
Llama 3.1 (8B)
67.6 %
32.0 %
0.5 %
Mistral Nemo (12B)
64.4 %
35.0 %
0.6 %
Qwen 2.5 (7B)
74.9 %
23.6 %
1.5 %
Sens du biais vs Claude Haiku
Modèle Sous-note Sur-note
Llama 3.1 (8B) 16.1 % 16.4 %
Mistral Nemo (12B) 21.0 % 14.6 %
Qwen 2.5 (7B) 9.8 % 15.4 %
Biais de prudence (distribution des classes)
Modèle 0 (Négatif) 1 (Neutre) 2 (Positif)
Claude Haiku 16.5 % 44.1 % 39.4 %
Llama 3.1 (8B) 8.0 % 60.8 % 31.2 %
Mistral Nemo (12B) 4.4 % 74.3 % 21.3 %
Qwen 2.5 (7B) 11.0 % 48.0 % 40.9 %
Précision / rappel / F1 par classe (vs Claude Haiku)
Llama 3.1 (8B)
Classe Précision Rappel F1 Support
NEG 0.804 0.392 0.527 209
NEU 0.6 0.827 0.695 560
POS 0.79 0.625 0.698 501
Confusion (lignes=réf, colonnes=modèle) préd. NEG préd. NEU préd. POS
réf NEG
82 125 2
réf NEU
16 463 81
réf POS
4 184 313
Mistral Nemo (12B)
Classe Précision Rappel F1 Support
NEG 0.929 0.249 0.392 209
NEU 0.561 0.945 0.704 560
POS 0.875 0.473 0.614 501
Confusion (lignes=réf, colonnes=modèle) préd. NEG préd. NEU préd. POS
réf NEG
52 151 6
réf NEU
3 529 28
réf POS
1 263 237
Qwen 2.5 (7B)
Classe Précision Rappel F1 Support
NEG 0.757 0.507 0.607 209
NEU 0.713 0.777 0.744 560
POS 0.788 0.818 0.803 501
Confusion (lignes=réf, colonnes=modèle) préd. NEG préd. NEU préd. POS
réf NEG
106 85 18
réf NEU
33 435 92
réf POS
1 90 410
Zones de confiance (double référence)
Accord entre Claude Haiku et Gemini 2.5 Flash :
72.68 %
(kappa=0.572).
Zone de consensus : 923 lignes
(72.7 %) — zone grise :
347 lignes.
Modèle Accuracy (zone consensus) Kappa (zone consensus)
Llama 3.1 (8B) 67.93 % 0.49
Mistral Nemo (12B) 58.94 % 0.364
Qwen 2.5 (7B) 78.33 % 0.646
Modèle Suit Claude Haiku Suit Gemini 2.5 Flash
Llama 3.1 (8B) 66.6 % 30.8 %
Mistral Nemo (12B) 79.0 % 17.9 %
Qwen 2.5 (7B) 65.7 % 30.0 %
Vue de démo — les données affichées proviennent des benchmarks calculés hors ligne dans app/curation/data/. Cette page ne relance aucun modèle.