公開中の比較
Obsideベンチマークの測定方法
ホームページの比較は本番環境でのベンチマークであり、イメージ図ではありません。このページでは、集計結果、評価プロトコル、解釈に必要な限界を公開しています。
ベンチマークのスナップショット
本番のアシスタント、ライブ参照データ、ブラインド採点。
集計結果
公開スコアと同一、単一の情報源
ホームページのチャートとダウンロード可能な結果は、この同じデータセットを使用しています。スコアは正確性、関連性、鮮度を10点満点で組み合わせたものです。
| アシスタント | スコア / 10 |
|---|---|
| Obside | 9.7 |
| ChatGPT | 8.4 |
| Gemini | 8.1 |
| DeepSeek | 8.0 |
| Claude | 7.9 |
評価プロトコル
同一プロンプト、匿名化された回答
- 01すべてのアシスタントに同じ金融プロンプトセットを与えます。
- 02製品が対応している場合は、ライブデータまたはWeb検索アクセスを有効にして回答を収集します。
- 03評価の前にモデル名を取り除きます。
- 04独立した中立の審査役が、ライブ参照データに照らして各回答を採点します。
- 05各項目のスコアを集計し、10点満点に正規化します。
解釈
スナップショットであり、普遍的なランキングではありません
結果は、このプロンプトセットと2026年7月の実行時点で利用可能だった製品を反映したものです。モデルのバージョン、検索システム、市場環境、データの入手可能性は変化するため、今後の実行では異なる順位になる可能性があります。
このベンチマークは金融に関する質問への回答品質を測定するものです。投資リターンを測定するものではなく、金融アドバイスでもありません。