公開中の比較

Obsideベンチマークの測定方法

ホームページの比較は本番環境でのベンチマークであり、イメージ図ではありません。このページでは、集計結果、評価プロトコル、解釈に必要な限界を公開しています。

ベンチマークのスナップショット

本番のアシスタント、ライブ参照データ、ブラインド採点。

集計結果

公開スコアと同一、単一の情報源

ホームページのチャートとダウンロード可能な結果は、この同じデータセットを使用しています。スコアは正確性、関連性、鮮度を10点満点で組み合わせたものです。

アシスタントスコア / 10
Obside
9.7
ChatGPT
8.4
Gemini
8.1
DeepSeek
8.0
Claude
7.9

評価プロトコル

同一プロンプト、匿名化された回答

  1. 01すべてのアシスタントに同じ金融プロンプトセットを与えます。
  2. 02製品が対応している場合は、ライブデータまたはWeb検索アクセスを有効にして回答を収集します。
  3. 03評価の前にモデル名を取り除きます。
  4. 04独立した中立の審査役が、ライブ参照データに照らして各回答を採点します。
  5. 05各項目のスコアを集計し、10点満点に正規化します。

解釈

スナップショットであり、普遍的なランキングではありません

結果は、このプロンプトセットと2026年7月の実行時点で利用可能だった製品を反映したものです。モデルのバージョン、検索システム、市場環境、データの入手可能性は変化するため、今後の実行では異なる順位になる可能性があります。

このベンチマークは金融に関する質問への回答品質を測定するものです。投資リターンを測定するものではなく、金融アドバイスでもありません。