Comparação publicada

Como se mede o benchmark da Obside

A comparação da página inicial é um benchmark de produção, não um gráfico ilustrativo. Esta página publica os resultados agregados, o protocolo de avaliação e as limitações necessárias para o interpretar.

Instantâneo do benchmark

Assistentes em produção, dados de referência ao vivo, pontuação cega.

Resultados agregados

As mesmas pontuações publicadas, uma única fonte de verdade

O gráfico da página inicial e o resultado descarregável usam este mesmo conjunto de dados. As pontuações combinam exatidão, relevância e frescura numa escala de 10 pontos.

AssistentePontuação / 10
Obside
9.7
ChatGPT
8.4
Gemini
8.1
DeepSeek
8.0
Claude
7.9

Protocolo de avaliação

Prompts iguais, respostas anonimizadas

  1. 01Cada assistente recebe o mesmo conjunto de prompts financeiros.
  2. 02As respostas são recolhidas com acesso a dados ao vivo ou pesquisa web ativado quando o produto o suporta.
  3. 03Os nomes dos modelos são removidos antes da avaliação.
  4. 04Um juiz neutro independente pontua cada resposta face a dados de referência ao vivo.
  5. 05As pontuações por dimensão são agregadas e normalizadas numa escala de 10 pontos.

Interpretação

Um instantâneo, não um ranking universal

Os resultados descrevem este conjunto de prompts e os produtos disponíveis durante a execução de julho de 2026. As versões dos modelos, os sistemas de pesquisa, as condições de mercado e a disponibilidade de dados mudam com o tempo, pelo que execuções futuras podem produzir rankings diferentes.

O benchmark mede a qualidade das respostas a perguntas financeiras. Não mede retornos de investimento e não constitui aconselhamento financeiro.