公開對比
Obside 基準測試如何測量
首頁的對比是一個生產環境基準測試,不是示意圖。本頁公開彙總結果、評估協議,以及解讀所需的局限說明。
基準測試快照
生產環境助手、即時參考資料、盲評打分。
彙總結果
與公開分數一致,單一資料來源
首頁圖表與可下載結果使用同一資料集。分數在 10 分制上綜合了準確性、相關性與新鮮度。
| 助手 | 分數 / 10 |
|---|---|
| Obside | 9.7 |
| ChatGPT | 8.4 |
| Gemini | 8.1 |
| DeepSeek | 8.0 |
| Claude | 7.9 |
評估協議
相同的提示詞,匿名化的回答
- 01每個助手收到相同的金融提示詞集。
- 02在產品支援的情況下,開啟即時資料或聯網搜尋來收集回答。
- 03評估前移除模型名稱。
- 04由獨立的中立評審對照即時參考資料為每個回答打分。
- 05各維度分數彙總後歸一化為 10 分制。
解讀
一個快照,而非普適排名
結果反映的是這套提示詞集,以及 2026 年 7 月執行時可用的產品。模型版本、搜尋系統、市場環境和資料可用性會隨時間變化,未來的執行可能產生不同排名。
該基準測試衡量的是金融問題的回答品質。它不衡量投資報酬,也不構成金融建議。