公開對比

Obside 基準測試如何測量

首頁的對比是一個生產環境基準測試,不是示意圖。本頁公開彙總結果、評估協議,以及解讀所需的局限說明。

基準測試快照

生產環境助手、即時參考資料、盲評打分。

彙總結果

與公開分數一致,單一資料來源

首頁圖表與可下載結果使用同一資料集。分數在 10 分制上綜合了準確性、相關性與新鮮度。

助手分數 / 10
Obside
9.7
ChatGPT
8.4
Gemini
8.1
DeepSeek
8.0
Claude
7.9

評估協議

相同的提示詞,匿名化的回答

  1. 01每個助手收到相同的金融提示詞集。
  2. 02在產品支援的情況下,開啟即時資料或聯網搜尋來收集回答。
  3. 03評估前移除模型名稱。
  4. 04由獨立的中立評審對照即時參考資料為每個回答打分。
  5. 05各維度分數彙總後歸一化為 10 分制。

解讀

一個快照,而非普適排名

結果反映的是這套提示詞集,以及 2026 年 7 月執行時可用的產品。模型版本、搜尋系統、市場環境和資料可用性會隨時間變化,未來的執行可能產生不同排名。

該基準測試衡量的是金融問題的回答品質。它不衡量投資報酬,也不構成金融建議。