# Artificial Analysis 與 Liquid AI 推出手機模型基準：兩款模型同以 63 分領先，LFM2.5-2.6B 只需 8 秒

> 📖 本站完整內容索引（documentation index）：[llms.txt](/llms.txt)

> 原作者：Artificial Analysis (@ArtificialAnlys) · 策展與摘要：EasyVibeCoding · 平台：X (Twitter) · 熱度：🔥🔥🔥 · 日期：2026-08-25

> 原始來源：https://x.com/ArtificialAnlys/status/2091922042459406560

## 證據與延伸閱讀

- [Artificial Analysis 與 Liquid AI 推出手機模型基準：兩款模型同以 63 分領先，LFM2.5-2.6B 只需 8 秒。](https://artificialanalysis.ai/articles/mobile-phone-intelligence-inference)
- [Liquid AI開發手機推論基準工具Pipette並開源](https://github.com/Liquid4All)

## 中文摘要

Artificial Analysis 與 Liquid AI 推出手機模型基準：兩款模型同以 63 分領先，LFM2.5-2.6B 只需 8 秒。

**分享重點** Artificial Analysis 在 2026 年 8 月 25 日分享這套新評測，目的是回答「iPhone 17 Pro 應該執行哪個模型」這類實際選擇問題。這項工作與 Liquid AI 合作，涵蓋 iPhone 17 Pro 與 Galaxy S26 Ultra，使用 4-bit 或更低精度的模型版本，分別衡量模型本身能完成哪些任務，以及在熱門手機上需要多少時間、記憶體與電力才能產生結果。兩類結果採用相同的量化模型版本，讓使用者與開發者能同時看見能力與裝置成本，而不是只依賴資料中心環境下的模型排行榜。

**評測方法** Artificial Analysis 以五項任務型評測的平均分數排列 phone-scale model intelligence，這些評測聚焦於小型模型在實際應用中常見的功能呼叫、指令遵循、知識回憶與推理工作：

- BFCL：評估選擇正確工具、多輪工具使用，以及沒有合適工具時能否拒絕呼叫。
- IFBench：檢查模型是否能遵守精確且可驗證的輸出限制。
- AA-Omniscience：一半測知識正確率，另一半測抗幻覺能力。
- GPQA Diamond：研究所程度的科學推理選擇題。
- MATH-500：以符號答案檢查競賽數學能力。

預設評測將每個模型的 context 限制在 16K，理由是手機記憶體通常無法為大型 KV cache 留出足夠空間。這項限制會讓部分能力不錯、但回答非常冗長的模型排名下滑，因為它們並非針對手機的記憶體與 token 使用限制設計。Artificial Analysis 將 portable device 定義為量化後、在 8K context 並納入 KV cache 的情況下，總記憶體需求不超過 8 GB 的模型。

**推論效能測試** Liquid AI 開發了手機推論基準工具 Pipette，並將其在 Liquid AI 的 GitHub 上開源；Artificial Analysis 表示已檢視並獨立驗證其方法。測試在受控環境中執行，使用標準化的 inference benchmarking harness，量測端到端生成時間、輸出速度、峰值記憶體使用量及其他指標。Pipette 可免費下載至 iOS 與 Android，使用者也能在自己的裝置上測試不同模型。相關入口包括 Artificial Analysis 的[發布文章](https://artificialanalysis.ai/articles/mobile-phone-intelligence-inference)、[即時手機結果](https://artificialanalysis.ai/hardware-inference-stack/mobile-phones)、[Pipette 官方網站](http://pipette.liquid.ai)與[Liquid AI GitHub](https://github.com/Liquid4All)。 

**16K context 的初步排名** 在標準 16K context 上，Nanbeige4.2-3B 與 LFM2.5-2.6B 以 63 分並列第一；Ornith-1.0-9B 得 62 分，Qwen3.5 9B (Reasoning) 得 61 分。後續名次包括 Ornith-1.5-9B (Reasoning) 61 分、Gemma 4 E4B (Reasoning) 60 分，以及 Qwen3.5 9B (Non-reasoning) 60 分。Ornith-1.5-9B 落後較舊的 Ornith-1.0-9B，主要原因是 IFBench 的指令遵循表現較弱，而不是整體模型能力全面退步。 

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/b7f78cacd3692bee.jpg)
> Nanbeige4.2-3B 與 LFM2.5-2.6B 在 iPhone 17 Pro 的行動裝置 benchmark 測試集中均以 63 分的平均分數領先其餘模型。

LFM2.5-2.6B 的優勢在於以較低成本取得同等平均分數。在 iPhone 17 Pro 上，面對標準 1,024-token 輸入並產生 256 個輸出 token，該模型的端到端生成時間為 8.0 秒，使用 2.3 GB 記憶體；Nanbeige4.2-3B 需要 21.4 秒與 4.0 GB；兩個 9B 模型則超過 25 秒並使用 6.9 GB。整套評測共測試 41 個量化模型版本，其中 33 個成功在 iPhone 17 Pro 上執行。 

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/ba67313bb12ad1c8.jpg)
> LFM2.5-230M 在 iPhone 17 Pro 上的端到端生成時間（End-to-End Generation Time）以 0.9s 表現最佳，Falcon-H1R-7B 則以 26.7s 居末。

**context 限制改變結論** 16K 並非單純的技術參數，而是直接塑造排行榜。Qwen3.5 9B (Reasoning) 在一輪評測中產生 74.5M 個輸出 token，29% 的生成結果碰到 16K 上限，因此分數受到影響；相較之下，Gemma 4 E4B (Reasoning) 只使用 5.2M 個輸出 token，平均分數卻與它相差不到兩分。 

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/d3e8554e9dd564b2.jpg)
> NVIDIA Nemotron Nano 9B V2 (Reasoning) 與 Qwen3.5 9B (Non-reasoning) 在 16K 最大 context 限制下，於行動裝置基準測試平均分數與輸出 token 數構成的 Pareto 前沿展現領先的綜合效率。

若把上限提高到 64K，Ling 3.0 Tiny 以 66 分排第一，Nanbeige4.2-3B 得 65 分，Qwen3.5 9B (Reasoning) 與 LFM2.5-2.6B 都得 64 分。不過 64K context 無法實際塞進手機記憶體；即使 iPhone 17 Pro 的輸出速度為每秒 55 個 token，產生 64K token 也可能要等待超過 20 分鐘，並消耗大量電池。因此 16K 仍是主要結果，另外提供 64K，以及限制每次生成時間為一分鐘的結果，供讀者比較不同使用情境。

**一分鐘等待情境** 當每個答案只允許模型在 iPhone 17 Pro 上生成 60 秒內可產生的 token 數量時，排名會完全改變：

- LFM2.5-8B-A1B 以 47 分居首。
- LFM2-2.6B-Exp 得 45 分。
- Gemma 4 E4B (Non-reasoning) 得 44 分。
- LFM2.5-2.6B 降至 38 分。
- Nanbeige4.2-3B 降至 18 分；它每秒約輸出 14 個 token，60 秒只能產生約 850 個 token，許多推理過程因而無法完成。
- Qwen3.5 9B (Reasoning) 得 14 分。

Artificial Analysis 沒有把一分鐘限制當作主要篩選條件，但認為它可能更接近手機使用者願意接受的最大等待時間。

**速度與能力的取捨** 在 iPhone 17 Pro 上，同時沒有被其他模型在智慧能力與速度兩個面向超越的 Pareto frontier 模型共有六個：

- LFM2.5-230M：27 分、0.9 秒。
- MiniCPM5-1B：45 分、2.9 秒。
- LFM2.5-8B-A1B：58 分、5.7 秒。
- Ling 3.0 Tiny：59 分、5.7 秒。
- LFM2.5-2.6B：63 分、8.0 秒。
- Nanbeige4.2-3B：63 分、21.4 秒。 

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/2fa752237324d456.jpg)
> 在 iPhone 17 Pro 的行動裝置基準測試中，LFM2.5-230M、LFM2.5-8B-A1B、LFM2.5-2.6B、MiniCPM5-1B (Reasoning)、Ling 3.0 Tiny 與 Nanbeige4.2-3B 在端到端生成時間與平均分數上構成 Pareto 前緣。

LFM2.5-8B-A1B 與 Ling 3.0 Tiny 都是 mixture-of-experts 模型，雖然擁有 8B 等級的權重，但每個 token 約只啟用 1B 個參數，因此能在不到 6 秒內完成回答。整體端到端生成時間相差 30 倍：LFM2.5-230M 為 0.9 秒，Falcon-H1R-7B 則為 26.7 秒。峰值記憶體在 4K context 下約相差 19 倍，從 LFM2.5-230M 的 0.4 GB 到 Ornith-1.0-9B 與 Qwen3.5 9B 的 6.9 GB；對 12 GB 手機而言，較高的記憶體需求會壓縮作業系統與其他應用程式可用的空間。 

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/28564eec5b545789.jpg)
> LFM2.5-230M 與 LFM2.5-350M 在 iPhone 17 Pro 的 4K context 峰值推論記憶體用量以 0.4 GB 保持最低用量（表現最佳），而 Qwen3.5 9B 與 Ornith-1.0-9B 則最高達 6.9 GB。

**不同模型的強項** 平均分數第一不代表每項任務都最好，這也是 Artificial Analysis 分享完整分項結果的原因：

- Nanbeige4.2-3B 沒有拿下任何單項第一，但在 BFCL、GPQA Diamond 與 MATH-500 都位居前五，因此靠整體均衡性並列第一。它在 BFCL 得 76%、MATH-500 得 96%、GPQA Diamond 得 67%。
- Qwen3.5 9B (Non-reasoning) 是最強的工具呼叫模型，BFCL 達 77%；在 GPQA Diamond 也以 79% 成為最強的科學推理模型。
- Falcon-H1R-7B 在 MATH-500 達 97%，拿下數學評測第一。
- LFM2.5-2.6B 的 IFBench 達 59%，是測試模型中指令遵循最佳者；它在 AA-Omniscience 的非幻覺率為 79%，明顯高於 Nanbeige4.2-3B 的 33%，以及兩個 Qwen3.5 9B 版本中的 24% 與 1%。
- Ornith-1.0-9B 的事實回憶正確率最高，為 15%。
- G9v3-3B 在所有有嘗試回答的模型中，非幻覺率最高，達 89%。 

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/223950201c240407.jpg)
> 各小型模型在 iPhone 17 Pro 裝置端環境下的多項評測基準各自展現不同優勢，其中 Qwen3.5 9B (Non-reasoning) 在 GPQA Diamond 以 79% 領先，Falcon-H1R-7B 在 MATH-500 以 97% 居冠，LFM2.5-2.6B 在 IFBench 以 59% 取得最高分，而 G9v3-3B 則在 AA-Omniscience Non-Hallucination Rate 以 89% 表現最佳。

**後續方向與限制** 這套基準仍會隨新模型、手機、推論框架與量化技術推出而更新。Artificial Analysis 計畫改用記憶體占用量比較模型，而不是只依賴單一量化版本；也會加入更多模型、更多裝置，以及 llama.cpp 以外的推論框架，並研究更適合小型模型與裝置端使用情境的評測。這代表目前的 16K 排名應視為特定模型版本、量化方式、runtime、旗標與硬體溫度控制下的結果，而不是脫離裝置條件的永久模型能力榜單。 

## 標籤

Benchmark, 功能更新, 新產品, Liquid AI, Artificial Analysis
