公开对比
Obside 基准测试如何测量
首页的对比是一个生产环境基准测试,不是示意图。本页公开汇总结果、评估协议,以及解读所需的局限说明。
基准测试快照
生产环境助手、实时参考数据、盲评打分。
汇总结果
与公开分数一致,单一数据来源
首页图表与可下载结果使用同一数据集。分数在 10 分制上综合了准确性、相关性与新鲜度。
| 助手 | 分数 / 10 |
|---|---|
| Obside | 9.7 |
| ChatGPT | 8.4 |
| Gemini | 8.1 |
| DeepSeek | 8.0 |
| Claude | 7.9 |
评估协议
相同的提示词,匿名化的回答
- 01每个助手收到相同的金融提示词集。
- 02在产品支持的情况下,开启实时数据或联网搜索来收集回答。
- 03评估前移除模型名称。
- 04由独立的中立评审对照实时参考数据为每个回答打分。
- 05各维度分数汇总后归一化为 10 分制。
解读
一个快照,而非普适排名
结果反映的是这套提示词集,以及 2026 年 7 月运行时可用的产品。模型版本、搜索系统、市场环境和数据可用性会随时间变化,未来的运行可能产生不同排名。
该基准测试衡量的是金融问题的回答质量。它不衡量投资回报,也不构成金融建议。