# Vals AI 推出 Web Search Index 評測工具

> 📖 本站完整內容索引（documentation index）：[llms.txt](/llms.txt)

> 原作者：Vals AI (@ValsAI) · 策展與摘要：EasyVibeCoding · 平台：X (Twitter) · 熱度：🔥 · 日期：2026-07-24

> 原始來源：https://x.com/valsai/status/2080309856658206815

## 證據與延伸閱讀

- [Vals AI 推出 Web Search Index 評測工具](http://vals.ai/benchmarks/web_search)

## 中文摘要

Vals AI 推出 Web Search Index 評測工具。

**評測架構與核心設計**
Vals AI 透過自家內部排程服務 Valkyrie，針對模型與搜尋工具的組合進行全面評估。為了確保結果的客觀性與可比性，該評測採用了嚴格的隔離設計：
- 讓同一個模型在每一次執行時使用相同的設定，僅改變其搭配的網頁搜尋工具。
- 移除了基準測試原本內建的特定領域搜尋工具（例如財經領域的 SEC EDGAR 與法律領域的 CourtListener），讓通用網頁搜尋成為模型唯一的外部資訊來源。
- 總共評估了 8 種模型與搜尋工具的組合，並透過 208 項由專家撰寫的法律研究任務以及 450 項財務分析問題進行測試。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/cc5913d1ab30bb90.jpg)
> Claude Fable 5 搭配 Exa 在整體網路搜尋指數中以 48.5% 居首，整體而言 Exa 的表現優於原生搜尋工具，但原生搜尋的平均成本較低，其中 Gemini 3.5 Flash 搭配原生搜尋為每項任務 $0.40 的最便宜組合。

**領域表現差異與分析結果**
評測結果顯示，搜尋工具的優劣高度取決於應用領域。整體而言，Claude Fable 5 搭配 Exa 在所有組合中拿下最高的 48.5% 整體準確率，而原生搜尋則在成本上較具優勢。具體表現如下：
- **財務分析領域**：控制任務難度後，Exa 的表現比原生搜尋高出約 6 個百分點（p < 0.001）。其優勢主要集中在高度依賴資料檢索的任務，例如市場分析（Exa 約 54% 對比原生 36%）、財報分析（73% 對比 59%）以及調整項目（44% 對比 36%）。
- **法律研究領域**：兩者的表現差距小於一個百分點，在統計上並無顯著差異（p = 0.86）。原生搜尋在將判例應用於事實模式的任務上表現較佳（約 35% 對比 Exa 的 32%），而 Exa 的優勢則在於法規架構的解釋（54% 對比 48%）。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/a1530fe9095d158c.jpg)
> Exa 在財務分析任務的各項類別（特別是市場分析與盈餘分析）表現普遍優於 Native 原生搜尋工具。

**成本與效率的權衡**
在經濟效益與資源消耗方面，評測透過帕雷托效率前緣（Pareto efficiency frontier）來分析成本與準確率的平衡：
- 雖然原生搜尋的平均成本較低，且模型推論成本佔了總成本的大多數（使搜尋費用的影響相對輕微），但 Gemini 3.5 Flash 搭配原生搜尋是所有組合中最便宜的選項，平均每項任務花費 0.40 美元。
- GPT-5.6 Sol 搭配 Exa 成為成本上的極端值，在各領域皆為最昂貴的選項（整體約 13.32 美元，法律領域甚至高達 19.28 美元）。這主要是因為該模型在少數任務中陷入無止境的搜尋循環，發動了數百次甚至超過 1,900 次的 Exa 呼叫才完成回答。
- 使用 Exa 時，模型產生的回應長度通常比原生搜尋更長，引用的不同來源也增加了 15% 至 18%。不過兩者引用的主要權威來源高度一致，法律領域皆以 Justia 與康乃爾大學法律資訊研究所（Legal Information Institute）為主，財務領域則以 SEC 為主。

相關完整方法論與評測結果可至 [Web Search Index 官方網站](http://vals.ai/benchmarks/web_search) 查看。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/2143bcb6b6e8f161.jpg)
> Claude Fable 5 搭配 Exa 在 Web Search Index 總體評測中以 48.5% 的得分奪冠；整體而言 Exa 的表現優於原生搜尋工具，而原生搜尋工具的平均成本較低，其中 Gemini 3.5 Flash 搭配原生搜尋以每任務 0.40 美元成為最便宜的組合。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/c8cb425bc3b3ecbe.jpg)
> Exa 在法律研究的各類問題上整體表現略優於或相當於 Native 原生搜尋工具，其中在法規框架解釋（Regulatory Framework Interpretation）的差距最為顯著。

## 媒體內容

**Claude Fable 5 搭配 Exa 在整體網路搜尋指數中以 48.5% 居首，整體而言 Exa 的表現優於原生搜尋工具，但原生搜尋的平均成本較低，其中 Gemini 3.5 Flash 搭配原生搜尋為每項任務 $0.40 的最便宜組合。**

**數據表**

|   | 分數 | 成本 | 延遲 |
| --- | --- | --- | --- |
| Claude Fable 5 EXA | 48.5% | $3.48 | 351.5s |
| Claude Fable 5 NATIVE | 46.9% | $4.03 | 742.5s |
| GPT-5.6 Sol EXA | 45.2% | $13.32 | 530.8s |
| GPT-5.6 Sol NATIVE | 43.6% | $1.17 | 328.8s |
| Gemini 3.5 Flash EXA | 41.4% | $1.18 | 197.5s |
| Grok 4.5 EXA | 38.8% | $0.75 | 100.9s |
| Gemini 3.5 Flash NATIVE | 37.0% | $0.40 | 249.5s |
| Grok 4.5 NATIVE | 35.5% | $1.01 | 137.0s |

**Claude Fable 5 搭配 Exa 在 Web Search Index 總體評測中以 48.5% 的得分奪冠；整體而言 Exa 的表現優於原生搜尋工具，而原生搜尋工具的平均成本較低，其中 Gemini 3.5 Flash 搭配原生搜尋以每任務 0.40 美元成為最便宜的組合。**

**數據表**

|   | Harness | Score | Cost/Task | Latency | Harness | Score | Cost/Task | Latency | Harness | Score | Cost/Task | Latency | Harness | Score | Cost/Task | Latency | Harness | Score | Cost/Task | Latency | Harness | Score | Cost/Task | Latency | Harness | Score | Cost/Task | Latency | Harness | Score | Cost/Task | Latency |
| --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- |
| Claude Fable 5 (Exa) | xAI | 35.54 % ± 1.93 | $1.01 | 137.04 s | xAI | 35.54 % ± 1.93 | $1.01 | 137.04 s | xAI | 35.54 % ± 1.93 | $1.01 | 137.04 s | xAI | 35.54 % ± 1.93 | $1.01 | 137.04 s | xAI | 35.54 % ± 1.93 | $1.01 | 137.04 s | xAI | 35.54 % ± 1.93 | $1.01 | 137.04 s | xAI | 35.54 % ± 1.93 | $1.01 | 137.04 s | xAI | 35.54 % ± 1.93 | $1.01 | 137.04 s |

**Exa 在財務分析任務的各項類別（特別是市場分析與盈餘分析）表現普遍優於 Native 原生搜尋工具。**

**數據表**

| 指標 | Native | Exa |
| --- | --- | --- |
| General Qualitative Analysis | 58% | 59% |
| General Quantitative Analysis | 68% | 69% |
| Market Analysis | 28% | 41% |
| Comparables | 31% | 31% |
| Precedents | 21% | 19% |
| Adjustments | 18% | 23% |
| Earnings Analysis | 38% | 52% |
| Disclosure Analysis | 48% | 52% |
| Financial Modeling | 18% | 18% |

**Exa 在法律研究的各類問題上整體表現略優於或相當於 Native 原生搜尋工具，其中在法規框架解釋（Regulatory Framework Interpretation）的差距最為顯著。**

**數據表**

|   | Native | Exa |
| --- | --- | --- |
| Statutory Interpretation | 38% | 38% |
| Application of Precedent to a Fact Pattern | 35% | 36% |
| Doctrinal Test Identification | 45% | 45% |
| Regulatory Framework Interpretation | 48% | 51% |
| Interaction of Multiple Legal Regimes | 31% | 31% |
| Cross-Jurisdiction Comparison | 28% | 28% |
| Timeline / Doctrinal Evolution | 30% | 31% |
| Validity of Precedent | 41% | 41% |
| Resolving Conflicting Precedent | 30% | 30% |
| Consensus vs. Disagreement Across Courts | 33% | 33% |

## 標籤

新產品, Benchmark, Vals AI
