Comparatif publié
Comment le benchmark Obside est mesuré
Le comparatif de la page d'accueil est un benchmark de production, pas un graphique illustratif. Cette page publie les résultats agrégés, le protocole d'évaluation et les limites nécessaires pour l'interpréter.
Instantané du benchmark
Assistants en production, données de référence en direct, notation à l'aveugle.
Résultats agrégés
Les mêmes scores publiés, une seule source de vérité
Le graphique de la page d'accueil et le résultat téléchargeable utilisent ce même jeu de données. Les scores combinent exactitude, pertinence et fraîcheur sur une échelle de 10 points.
| Assistant | Score / 10 |
|---|---|
| Obside | 9.7 |
| ChatGPT | 8.4 |
| Gemini | 8.1 |
| DeepSeek | 8.0 |
| Claude | 7.9 |
Protocole d'évaluation
Mêmes prompts, réponses anonymisées
- 01Chaque assistant reçoit le même jeu de prompts financiers.
- 02Les réponses sont collectées avec l'accès aux données en direct ou à la recherche web activé quand le produit le permet.
- 03Les noms des modèles sont retirés avant l'évaluation.
- 04Un juge neutre distinct note chaque réponse face à des données de référence en direct.
- 05Les scores par dimension sont agrégés et normalisés sur une échelle de 10 points.
Interprétation
Un instantané, pas un classement universel
Les résultats décrivent ce jeu de prompts et les produits disponibles lors du run de juillet 2026. Les versions de modèles, les systèmes de recherche, les conditions de marché et la disponibilité des données évoluent : de futurs runs peuvent produire des classements différents.
Le benchmark mesure la qualité des réponses à des questions financières. Il ne mesure pas des rendements d'investissement et ne constitue pas un conseil financier.