Scoring d'articles financiers par LLM

Démo Flask pour aventuresdata.com — analyser et fiabiliser un ensemble de juges LLM qui notent le sentiment (négatif/neutre/positif) des entreprises mentionnées dans des articles financiers.

Le pipeline complet

Un pipeline de collecte (hors périmètre de cette démo) surveille des flux RSS financiers, détecte automatiquement les entreprises et secteurs mentionnés dans chaque article, puis fait noter le sentiment associé à chaque mention par 5 modèles LLM différents (Claude Haiku, Gemini, Llama 3.1, Mistral Nemo, Qwen 2.5) — c'est le pattern LLM-as-judge. Les résultats sont stockés en base PostgreSQL (`article_companies`) puis exportés en CSV pour analyse.

Flux RSS Détection entreprises/secteurs Notation par 5 LLM juges Cette démo : benchmark & annotation

Cette démo

Deux modèles ne sont jamais parfaitement fiables pris isolément : cette démo compare les 5 juges LLM entre eux (Claude Haiku comme baseline, Gemini comme référence secondaire) sur 3 versions successives du prompt d'évaluation, et fournit un outil pour trancher à la main les cas où même les deux références se contredisent.

📊

Résultats du benchmark

Accuracy et kappa vs Claude Haiku, gravité des erreurs, biais de prudence, précision/rappel/F1 par classe, zones de confiance — pour les 3 versions de prompt (v1, v2, v3).

Chargement…
✍️

Annoter la zone grise

100 cas où Claude Haiku et Gemini ne sont pas d'accord. Lire les justifications et trancher à la main permet de départager laquelle des deux références est la plus juste.

Chargement…

API JSON