# Pipette 開源裝置端 AI 基準：逾 10k 筆結果涵蓋 35 類模型

> 📖 本站完整內容索引（documentation index）：[llms.txt](/llms.txt)

> 原作者：Liquid AI (@liquidai) · 策展與摘要：EasyVibeCoding · 平台：X (Twitter) · 熱度：🔥🔥 · 日期：2026-08-25

> 原始來源：https://x.com/liquidai/status/2091906366428598284

## 證據與延伸閱讀

- [Pipette 開源裝置端 AI 基準：逾 10k 筆結果涵蓋 35 類模型](https://www.liquid.ai/blog/pipette-on-device-ai-benchmarking-by-liquid-ai)
- [發布互動儀表板與開源基礎設施等六大項目](https://pipette.liquid.ai/)
- [開源架構包含 clients、mgmt 與 scores](https://github.com/Liquid4All/pipette-clients)

## 中文摘要

Pipette 開源裝置端 AI 基準：逾 10k 筆結果涵蓋 35 類模型

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/0d517ed1d0fdaa06.jpg)
> 淺灰色背景的正中央醒目顯示著 PIPETTE 的大寫黑體字標題與其標誌性 logo，下方帶有「An open-source benchmarking platform for on-device intelligence.」的副標題，上方則標示著 Liquid 與 Artificial Analysis 的合作名稱，周圍點綴著立體球體與帶有節點的軌道線條。

**發布內容**  
Pipette 針對手機、筆電、桌上型電腦、AI box 與嵌入式硬體，測量模型的品質、速度、延遲與記憶體使用量。Liquid AI 表示，多數既有 benchmark 著重雲端伺服器上的基礎能力與速度，未必能反映模型部署到特定裝置後的實際表現；Pipette 則把裝置端推論視為完整系統問題，而非只評估模型本身。

本次發布包括：

- 可互動比較部署配置的 [Pipette dashboard](https://pipette.liquid.ai)。
- 超過 10k 筆公開結果的資料集，涵蓋 35 個模型類別、7 種 `llama.cpp` 量化等級，以及超過 1,000 組模型、量化、執行階段、裝置與 context 組合。
- 支援 macOS、Windows、iOS 與 Android 的 benchmark clients，可在目標裝置上執行有版本控管的 benchmark 定義。
- 顯示 Pipette 結果與彙總分數的 [Artificial Analysis dashboard](http://artificialanalysis.ai/hardware-inference-stack/mobile-phones)。
- 以 Apache 2.0 授權開放的 `pipette-mgmt`、`pipette-clients` 與 `pipette-scores`，分別負責 benchmark 管理、裝置執行，以及評測資料與分數處理。
- 可直接在裝置上執行 benchmark 的原生 [iOS App](https://apps.apple.com/us/app/pipette-by-liquid/id6772314671) 與 [Android app](https://play.google.com/store/apps/details?id=ai.liquid.pipette)。

**初始涵蓋範圍**  
初版約涵蓋 35 個模型類別與 7 種 `llama.cpp` 量化等級。筆電與桌上型電腦目前涵蓋其中四個量化等級，手機則涵蓋全部量化等級；可測量的 context length 從 256 到 8,192 tokens，前提是裝置記憶體能容納對應工作負載。已發布裝置包括搭載 M5 Max 的 MacBook Pro、iPhone 17 Pro 與 Samsung Galaxy S26 Ultra；搭載 AMD Ryzen AI Max+ 395 和 Radeon 8060S 的裝置結果則預計稍後加入。

畫面顯示的提交資料中，速度與記憶體測量共有 4,284 個 submission ID，前三個執行階段涵蓋 100% 的清單項目：`llama.cpp:macbook-arm64` 佔 45.4%、`llama.cpp.ios` 佔 27.5%、`llama.cpp.android-arm64-v8a` 佔 27.1%。品質評估則顯示 303 個 submission ID，現有資料全由 `llama.cpp` 執行。這些數字是 dashboard 畫面呈現的當前涵蓋狀態，會隨後續提交而變動。

<video src="https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/1787642003565-o8epviic.mp4" poster="https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/37cc13e80d0706f0.jpg" controls playsinline preload="metadata" style="max-width:100%;height:auto;display:block;margin:1rem 0"></video>
> Submission data coverage 頁面的 Dimension dominance 與 Coverage 檢視分頁切換操作

**評測方法**  
每筆效能測量都以「model + quantization + runtime + device」組成的部署配置為起點，再指定要測量的指標與 token 形狀。效能流程採用固定 token 形狀、greedy decoding、捨棄 warm-up、五次正式測量與 readiness gating；每次計時前，平台專屬檢查會確認裝置處於可接受的溫度與負載狀態，只有通過檢查的結果才會發布。電力與散熱條件則依不同裝置路徑記錄。

品質評估與效能測量分開執行，使用 IFBench、GPQA Diamond 與 MATH-500 等評測。品質結果目前來自 NVIDIA H100 80GB 等參考系統上的 `llama.cpp` 評估，不代表品質評估是在手機上執行；dashboard 只有在模型與量化格式相符時，才會把 H100 上的品質分數與裝置端效能放在一起比較。Artificial Analysis 目前以同等權重彙整其選定、用來代表實際行動裝置情境的品質評估。

**開源架構**  
引用的 `pipette-clients` 專案提供主機原生 CLI 與行動裝置 App。CLI 支援 `llama.cpp`、MLX、OpenVINO、vLLM 與 SGLang 等推論後端，標準工作流程是 init、register、安裝 runtime，再執行與同步；Android App 共用 Rust core，iOS App 則採原生 Swift。遠端執行可以提交結果到管理伺服器，本機執行則可留在本機。

`pipette-mgmt` 是以 Rust 與 axum 建立的 HTTP 服務，負責提供有版本控管的 benchmark catalog、接收測量提交、處理待處理提交，並將結果寫入 Parquet。`pipette-scores` 則提供評測樣本、接收 client 產生的 completion，並在不取得生成來源的情況下評分；目前支援 instruction following、結構化 JSON/YAML 生成、研究所程度科學選擇題與競賽數學。

**實際取捨**  
Liquid AI 透過初始資料強調，部署決策不能只看單一模型排名：

<video src="https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/1787641980303-qdisu42y.mp4" poster="https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/1c958803f3bd2bc9.jpg" controls playsinline preload="metadata" style="max-width:100%;height:auto;display:block;margin:1rem 0"></video>
> Pipette 平台的 AI 模型在裝置端效能評測散佈圖與模型選單

- 在 Galaxy S26 Ultra 的 Q4_K_M 設定下，Granite-4.0-H-350M 從 256 增加到 4,096 個輸入 token 時，仍保有 78.4% 的 decode throughput；Granite-4.0-350M 則只保有 33.8%。
- 在 2,048 個輸入 token 下，LFM2.5-8B-A1B 的 decode 速度是 Qwen3.5-4B 的 2.4 倍、Ministral-3B-Instruct-2512 的 2.6 倍，但即使每個 token 只啟用 8.5B 參數中的 1.5B，峰值記憶體仍達 5.29 GiB。
- iPhone 的 Q4_K_M 測試中，MiniCPM5-1B 完成 2,048 個輸入與 256 個輸出 token 需要 3.47 秒，LFM2.5-1.2B-Instruct 則需 4.12 秒；後者在 MATH-500 高出 9.0 分，因此沒有單一配置能同時主宰速度與品質。
- M5 Max 上兩個近似的 8B 配置，Granite-4.1-8B 與 Ministral-3-8B-Instruct-2512 的 decode throughput 僅差 2.4%、峰值 RAM 僅差 1.2%，但 Granite 在 IFBench 領先 7.3 分，Ministral 在 GPQA Diamond 領先 14.0 分。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/9594216a3ebdafe6.jpg)
> 在 iPhone 17 Pro 的裝置端評測中，LFM2.5-2.6B 與 Ling 3.0 Tiny 等模型位於 Pareto 前沿且屬於高吸引力象限

**限制與後續**  
Pipette 目前仍在擴充。初版沒有納入 NPU 結果，因為現有模型特定 kernel 與 operator 支援不足，無法在模型類別之間形成一致比較；Android GPU 在目前測試的穩定後端與模型集合中，也沒有持續勝過選定 CPU 路徑，因此現行 Android `llama.cpp` 路徑以 CPU 為主，而 iPhone 使用 Metal。不同裝置之間還受到 flash-attention、執行緒數、加速器與執行環境差異影響，官方目前最建議比較同一裝置內的配置。

此外，社群提交結果的發布目前仍處於 beta。現有品質套件涵蓋的主要是指令遵循、科學推理與競賽數學，尚不完整涵蓋 Agent 行為、知識密集任務、多模態工作負載或其他裝置導向情境。Liquid AI 鼓勵模型提供者、runtime 開發者、硬體團隊與應用程式開發者執行 clients、提交缺少的配置，或透過 [Pipette feedback](https://pipette.liquid.ai/feedback) 回報希望測量的模型、runtime、裝置與 benchmark。

## 媒體內容

**Pipette 平台的 AI 模型在裝置端效能評測散佈圖與模型選單**

**影片中的 Prompt 與操作**

操作步驟：

1. （00:02）點擊 Accuracy 下拉選單切換評測指標
2. （00:03）選擇 GPQA Diamond %
3. （00:05）點擊裝置選擇下拉選單並切換裝置
4. （00:09）點擊 Speed & Memory 下拉選單切換效能指標
5. （00:10）選擇 Peak RAM GB

**Submission data coverage 頁面的 Dimension dominance 與 Coverage 檢視分頁切換操作**

**影片中的 Prompt 與操作**

操作步驟：

1. （00:00）點擊左側 Runtimes 導覽列
2. （00:01）點擊左側 Devices 導覽列
3. （00:02）點擊左側 Quants 導覽列
4. （00:03）點擊左側 Benchmarks 導覽列
5. （00:04）點擊左側 Models 導覽列
6. （00:05）點擊左側 Benchmarks 導覽列
7. （00:07）點擊右上角 Coverage 分頁按鈕

## 標籤

開源專案, Benchmark, 硬體, Liquid AI, Artificial Analysis
