Benchmark de classification de sentiment — LLM-as-judge

3 modèles locaux (Llama 3.1, Mistral Nemo, Qwen 2.5) sont évalués contre une baseline (Claude Haiku), avec Gemini comme référence secondaire pour isoler les cas où les 2 "masters" se contredisent. Mêmes calculs que le script d'analyse de référence, exposés ici en JSON via GET /api/curation/benchmarks/{version}/analysis.

Juge actuel : Claude Haikuvoir avec Gemini comme juge

Benchmark v1 — 1214 / 1216 lignes analysées

Robustesse (avant nettoyage)

ModèleValeurs hors échelleValeurs manquantes
Llama 3.1 (8B) 0 0
Mistral Nemo (12B) 0 0
Qwen 2.5 (7B) 2 0

Accord vs Claude Haiku (accuracy + kappa)

ModèleAccuracyKappa de Cohen
Llama 3.1 (8B) 74.05 % 0.588
Mistral Nemo (12B) 57.83 % 0.356
Qwen 2.5 (7B) 71.42 % 0.565

Gravité des erreurs vs Claude Haiku

Polaire = 0 ↔ 2 : le modèle inverse le signe du sentiment.

ModèleExactAdjacentPolaire
Llama 3.1 (8B) 74.1 % 25.4 % 0.6 %
Mistral Nemo (12B) 57.8 % 41.6 % 0.6 %
Qwen 2.5 (7B) 71.4 % 27.5 % 1.1 %

Sens du biais vs Claude Haiku

ModèleSous-noteSur-note
Llama 3.1 (8B)11.0 %15.0 %
Mistral Nemo (12B)24.1 %18.1 %
Qwen 2.5 (7B)22.3 %6.3 %

Biais de prudence (distribution des classes)

Modèle0 (Négatif)1 (Neutre)2 (Positif)
Claude Haiku21.7 %30.7 %47.5 %
Llama 3.1 (8B)15.7 %38.3 %46.0 %
Mistral Nemo (12B)6.3 %67.5 %26.1 %
Qwen 2.5 (7B)26.0 %38.8 %35.2 %

Précision / rappel / F1 par classe (vs Claude Haiku)

Llama 3.1 (8B)

ClassePrécisionRappelF1Support
NEG0.8740.6330.734264
NEU0.570.710.632373
POS0.8370.8090.823577
Confusion (lignes=réf, colonnes=modèle)préd. NEGpréd. NEUpréd. POS
réf NEG 167916
réf NEU 2326585
réf POS 1109467

Mistral Nemo (12B)

ClassePrécisionRappelF1Support
NEG0.8180.2390.37264
NEU0.420.9220.577373
POS0.9310.5110.66577
Confusion (lignes=réf, colonnes=modèle)préd. NEGpréd. NEUpréd. POS
réf NEG 631983
réf NEU 1034419
réf POS 4278295

Qwen 2.5 (7B)

ClassePrécisionRappelF1Support
NEG0.7220.8640.786264
NEU0.5410.6840.604373
POS0.8990.6660.765577
Confusion (lignes=réf, colonnes=modèle)préd. NEGpréd. NEUpréd. POS
réf NEG 228333
réf NEU 7825540
réf POS 10183384

Zones de confiance (double référence)

Accord entre Claude Haiku et Gemini 2.5 Flash : 82.13 % (kappa=0.711). Zone de consensus : 997 lignes (82.1 %) — zone grise : 217 lignes.

ModèleAccuracy (zone consensus)Kappa (zone consensus)
Llama 3.1 (8B)80.84 %0.693
Mistral Nemo (12B)54.06 %0.331
Qwen 2.5 (7B)74.32 %0.603
ModèleSuit Claude HaikuSuit Gemini 2.5 Flash
Llama 3.1 (8B)42.9 %51.2 %
Mistral Nemo (12B)75.1 %20.3 %
Qwen 2.5 (7B)58.1 %35.5 %

Benchmark v2 — 1206 / 1237 lignes analysées

Robustesse (avant nettoyage)

ModèleValeurs hors échelleValeurs manquantes
Llama 3.1 (8B) 0 0
Mistral Nemo (12B) 0 0
Qwen 2.5 (7B) 0 0

Accord vs Claude Haiku (accuracy + kappa)

ModèleAccuracyKappa de Cohen
Llama 3.1 (8B) 73.47 % 0.561
Mistral Nemo (12B) 63.85 % 0.434
Qwen 2.5 (7B) 77.36 % 0.633

Gravité des erreurs vs Claude Haiku

Polaire = 0 ↔ 2 : le modèle inverse le signe du sentiment.

ModèleExactAdjacentPolaire
Llama 3.1 (8B) 73.5 % 25.0 % 1.6 %
Mistral Nemo (12B) 63.8 % 35.9 % 0.2 %
Qwen 2.5 (7B) 77.4 % 21.1 % 1.5 %

Sens du biais vs Claude Haiku

ModèleSous-noteSur-note
Llama 3.1 (8B)6.4 %20.1 %
Mistral Nemo (12B)19.7 %16.4 %
Qwen 2.5 (7B)8.2 %14.4 %

Biais de prudence (distribution des classes)

Modèle0 (Négatif)1 (Neutre)2 (Positif)
Claude Haiku20.0 %31.9 %48.1 %
Llama 3.1 (8B)15.4 %26.4 %58.2 %
Mistral Nemo (12B)5.5 %64.2 %30.3 %
Qwen 2.5 (7B)14.5 %35.7 %49.8 %

Précision / rappel / F1 par classe (vs Claude Haiku)

Llama 3.1 (8B)

ClassePrécisionRappelF1Support
NEG0.8710.6720.759241
NEU0.6320.5220.572385
POS0.7450.9020.816580
Confusion (lignes=réf, colonnes=modèle)préd. NEGpréd. NEUpréd. POS
réf NEG 1626415
réf NEU 20201164
réf POS 453523

Mistral Nemo (12B)

ClassePrécisionRappelF1Support
NEG0.9550.2610.41241
NEU0.4690.9430.626385
POS0.940.5930.727580
Confusion (lignes=réf, colonnes=modèle)préd. NEGpréd. NEUpréd. POS
réf NEG 631762
réf NEU 236320
réf POS 1235344

Qwen 2.5 (7B)

ClassePrécisionRappelF1Support
NEG0.8860.6430.745241
NEU0.6510.7270.687385
POS0.8290.8590.843580
Confusion (lignes=réf, colonnes=modèle)préd. NEGpréd. NEUpréd. POS
réf NEG 1557115
réf NEU 1728088
réf POS 379498

Zones de confiance (double référence)

Accord entre Claude Haiku et Gemini 2.5 Flash : 76.78 % (kappa=0.622). Zone de consensus : 926 lignes (76.8 %) — zone grise : 280 lignes.

ModèleAccuracy (zone consensus)Kappa (zone consensus)
Llama 3.1 (8B)83.37 %0.707
Mistral Nemo (12B)58.64 %0.386
Qwen 2.5 (7B)82.18 %0.695
ModèleSuit Claude HaikuSuit Gemini 2.5 Flash
Llama 3.1 (8B)40.7 %48.2 %
Mistral Nemo (12B)81.1 %13.9 %
Qwen 2.5 (7B)61.4 %30.7 %

Benchmark v3 — 1215 / 1235 lignes analysées

Robustesse (avant nettoyage)

ModèleValeurs hors échelleValeurs manquantes
Llama 3.1 (8B) 0 0
Mistral Nemo (12B) 0 0
Qwen 2.5 (7B) 0 0

Accord vs Claude Haiku (accuracy + kappa)

ModèleAccuracyKappa de Cohen
Llama 3.1 (8B) 69.55 % 0.519
Mistral Nemo (12B) 66.01 % 0.455
Qwen 2.5 (7B) 74.9 % 0.6

Gravité des erreurs vs Claude Haiku

Polaire = 0 ↔ 2 : le modèle inverse le signe du sentiment.

ModèleExactAdjacentPolaire
Llama 3.1 (8B) 69.5 % 30.1 % 0.3 %
Mistral Nemo (12B) 66.0 % 33.3 % 0.7 %
Qwen 2.5 (7B) 74.9 % 24.3 % 0.8 %

Sens du biais vs Claude Haiku

ModèleSous-noteSur-note
Llama 3.1 (8B)17.5 %12.9 %
Mistral Nemo (12B)20.7 %13.3 %
Qwen 2.5 (7B)11.6 %13.5 %

Biais de prudence (distribution des classes)

Modèle0 (Négatif)1 (Neutre)2 (Positif)
Claude Haiku19.4 %38.8 %41.7 %
Llama 3.1 (8B)16.0 %50.4 %33.6 %
Mistral Nemo (12B)10.1 %64.8 %25.1 %
Qwen 2.5 (7B)13.7 %47.8 %38.5 %

Précision / rappel / F1 par classe (vs Claude Haiku)

Llama 3.1 (8B)

ClassePrécisionRappelF1Support
NEG0.810.6690.733236
NEU0.5870.7610.662472
POS0.8040.6470.717507
Confusion (lignes=réf, colonnes=modèle)préd. NEGpréd. NEUpréd. POS
réf NEG 158771
réf NEU 3435979
réf POS 3176328

Mistral Nemo (12B)

ClassePrécisionRappelF1Support
NEG0.8860.4620.607236
NEU0.5430.9050.678472
POS0.8720.5250.655507
Confusion (lignes=réf, colonnes=modèle)préd. NEGpréd. NEUpréd. POS
réf NEG 1091225
réf NEU 1142734
réf POS 3238266

Qwen 2.5 (7B)

ClassePrécisionRappelF1Support
NEG0.8250.5810.682236
NEU0.6520.8030.72472
POS0.8420.7770.808507
Confusion (lignes=réf, colonnes=modèle)préd. NEGpréd. NEUpréd. POS
réf NEG 137909
réf NEU 2837965
réf POS 1112394

Zones de confiance (double référence)

Accord entre Claude Haiku et Gemini 2.5 Flash : 76.71 % (kappa=0.638). Zone de consensus : 932 lignes (76.7 %) — zone grise : 283 lignes.

ModèleAccuracy (zone consensus)Kappa (zone consensus)
Llama 3.1 (8B)70.49 %0.549
Mistral Nemo (12B)61.7 %0.434
Qwen 2.5 (7B)74.57 %0.602
ModèleSuit Claude HaikuSuit Gemini 2.5 Flash
Llama 3.1 (8B)66.4 %29.3 %
Mistral Nemo (12B)80.2 %16.3 %
Qwen 2.5 (7B)76.0 %19.8 %

Benchmark v4 — 1270 / 1279 lignes analysées

Robustesse (avant nettoyage)

ModèleValeurs hors échelleValeurs manquantes
Llama 3.1 (8B) 0 0
Mistral Nemo (12B) 0 0
Qwen 2.5 (7B) 0 9

Accord vs Claude Haiku (accuracy + kappa)

ModèleAccuracyKappa de Cohen
Llama 3.1 (8B) 67.56 % 0.455
Mistral Nemo (12B) 64.41 % 0.388
Qwen 2.5 (7B) 74.88 % 0.587

Gravité des erreurs vs Claude Haiku

Polaire = 0 ↔ 2 : le modèle inverse le signe du sentiment.

ModèleExactAdjacentPolaire
Llama 3.1 (8B) 67.6 % 32.0 % 0.5 %
Mistral Nemo (12B) 64.4 % 35.0 % 0.6 %
Qwen 2.5 (7B) 74.9 % 23.6 % 1.5 %

Sens du biais vs Claude Haiku

ModèleSous-noteSur-note
Llama 3.1 (8B)16.1 %16.4 %
Mistral Nemo (12B)21.0 %14.6 %
Qwen 2.5 (7B)9.8 %15.4 %

Biais de prudence (distribution des classes)

Modèle0 (Négatif)1 (Neutre)2 (Positif)
Claude Haiku16.5 %44.1 %39.4 %
Llama 3.1 (8B)8.0 %60.8 %31.2 %
Mistral Nemo (12B)4.4 %74.3 %21.3 %
Qwen 2.5 (7B)11.0 %48.0 %40.9 %

Précision / rappel / F1 par classe (vs Claude Haiku)

Llama 3.1 (8B)

ClassePrécisionRappelF1Support
NEG0.8040.3920.527209
NEU0.60.8270.695560
POS0.790.6250.698501
Confusion (lignes=réf, colonnes=modèle)préd. NEGpréd. NEUpréd. POS
réf NEG 821252
réf NEU 1646381
réf POS 4184313

Mistral Nemo (12B)

ClassePrécisionRappelF1Support
NEG0.9290.2490.392209
NEU0.5610.9450.704560
POS0.8750.4730.614501
Confusion (lignes=réf, colonnes=modèle)préd. NEGpréd. NEUpréd. POS
réf NEG 521516
réf NEU 352928
réf POS 1263237

Qwen 2.5 (7B)

ClassePrécisionRappelF1Support
NEG0.7570.5070.607209
NEU0.7130.7770.744560
POS0.7880.8180.803501
Confusion (lignes=réf, colonnes=modèle)préd. NEGpréd. NEUpréd. POS
réf NEG 1068518
réf NEU 3343592
réf POS 190410

Zones de confiance (double référence)

Accord entre Claude Haiku et Gemini 2.5 Flash : 72.68 % (kappa=0.572). Zone de consensus : 923 lignes (72.7 %) — zone grise : 347 lignes.

ModèleAccuracy (zone consensus)Kappa (zone consensus)
Llama 3.1 (8B)67.93 %0.49
Mistral Nemo (12B)58.94 %0.364
Qwen 2.5 (7B)78.33 %0.646
ModèleSuit Claude HaikuSuit Gemini 2.5 Flash
Llama 3.1 (8B)66.6 %30.8 %
Mistral Nemo (12B)79.0 %17.9 %
Qwen 2.5 (7B)65.7 %30.0 %