Comparatif publié

Comment le benchmark Obside est mesuré

Le comparatif de la page d'accueil est un benchmark de production, pas un graphique illustratif. Cette page publie les résultats agrégés, le protocole d'évaluation et les limites nécessaires pour l'interpréter.

Instantané du benchmark

Assistants en production, données de référence en direct, notation à l'aveugle.

Résultats agrégés

Les mêmes scores publiés, une seule source de vérité

Le graphique de la page d'accueil et le résultat téléchargeable utilisent ce même jeu de données. Les scores combinent exactitude, pertinence et fraîcheur sur une échelle de 10 points.

AssistantScore / 10
Obside
9.7
ChatGPT
8.4
Gemini
8.1
DeepSeek
8.0
Claude
7.9

Protocole d'évaluation

Mêmes prompts, réponses anonymisées

  1. 01Chaque assistant reçoit le même jeu de prompts financiers.
  2. 02Les réponses sont collectées avec l'accès aux données en direct ou à la recherche web activé quand le produit le permet.
  3. 03Les noms des modèles sont retirés avant l'évaluation.
  4. 04Un juge neutre distinct note chaque réponse face à des données de référence en direct.
  5. 05Les scores par dimension sont agrégés et normalisés sur une échelle de 10 points.

Interprétation

Un instantané, pas un classement universel

Les résultats décrivent ce jeu de prompts et les produits disponibles lors du run de juillet 2026. Les versions de modèles, les systèmes de recherche, les conditions de marché et la disponibilité des données évoluent : de futurs runs peuvent produire des classements différents.

Le benchmark mesure la qualité des réponses à des questions financières. Il ne mesure pas des rendements d'investissement et ne constitue pas un conseil financier.