# Meta 讓 Generative Ads Recommendation Model 訓練效率翻倍，達 20–25% MFU

> 📖 本站完整內容索引（documentation index）：[llms.txt](/llms.txt)

> 原作者：Engineering at Meta (@Meta_Engineers) · 策展與摘要：EasyVibeCoding · 平台：X (Twitter) · 熱度：🔥🔥🔥 · 日期：2026-08-06

> 原始來源：https://x.com/meta_engineers/status/2084690539123982381

## 證據與延伸閱讀

- [Meta GEM 訓練效率翻倍達 20-25% MFU](https://engineering.fb.com/2026/08/03/ml-applications/training-gem-at-llm-scale-meta-ads-recommendation-foundation-model/) — 官方文件
- [Baseline 與 FMHA kernel 在真實流量與 benchmark 表現對比](https://pbs.twimg.com/media/HO5IOJRXQAEvU8G.jpg?name=orig)

## 中文摘要

Meta 讓 Generative Ads Recommendation Model 訓練效率翻倍，達 20–25% MFU。

GEM 是支撐 Instagram 與 Facebook 廣告推薦的模型，目前已在數千張最新世代 GPU 上，以大型語言模型（LLM）規模進行訓練；同期 total training FLOPs 在 12 個月內成長 4 倍。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/80e235eacceebd24.jpg)
> Training GEM at LLM Scale 的簡報標題畫面，背景為灰色網格與串連成網狀結構的節點圖形，節點帶有灰色、藍色、紫色與粉紅色等色彩。

**為何需要重新設計** 標準 LLM 基礎架構無法直接套用到推薦系統。GEM 同時處理數兆個稀疏 embedding 參數與數十億個密集參數，資料包含使用者活動歷史、地點與廣告素材等特徵；序列長度差異、非對稱互動模式、記憶體受限運算，以及 CTR／CVR 預測對數值精度的敏感性，都會降低 GPU 使用率與多 GPU 擴充效率。

**核心技術** Meta 將 GPU kernel、數值精度、平行化、網路與記憶體管理一起協同設計，重點包括：

- Jagged Flash Attention（JFA）直接處理可變長度序列，避免填補至最大長度可能造成的最高 50% 運算浪費。
- Generalized Dot-Product Attention（GDPA）統一 GEM 的 self-attention、PMA 與 cross-attention，改善真實推薦流量中的短序列與非對稱形狀。
- BlockAttention 將長序列注意力限制在固定 64-token 區塊，降低長度增加時的成本。
- MXFP8 attention 與 MLP 使用 ultra-low mixed precision，在維持模型品質的前提下提高 Tensor Core 吞吐量。
- topology-aware 5D parallelism 配合 Meta 的多層網路階層，降低跨數千張 GPU 傳輸資料時的通訊負擔。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/cf65a35c148954bb.png)
> GEM (Ads Foundation Model) 的整體架構圖，包含特徵輸入、多層 Layer 堆疊、預測輸出以及 Layer 的放大細節與 Hybrid Rec + LLM Architecture

**實測結果** JFA v4（TLX）相較 JFA v2 提升 40–140% TFLOPS，帶來 18.5% 的 local MFU 相對提升與 12% QPS 提升；GDPA 在 forward 達到 2 倍加速、backward 達到 1.6 倍加速，整合至完整模型後讓端到端訓練吞吐量提升超過 30%。MXFP8 則讓代表性 GEM shape 的 forward kernel 加速超過 1.3 倍、backward kernel 加速超過 1.5 倍（於 Meta 內部限功耗的 GPU 上量測）。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/3f8704039a0d64f7.png)
> 優化前的前向（forward）落差：既有 FMHA kernel 在 benchmark 的效能（450–830 TFLOPs）。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/c3a74510d6db761b.png)
> 優化前的後向（backward）落差：FMHA kernel 在 benchmark 的效能（193–472 TFLOPs）隨序列長度上升，明顯高於真實推薦流量下的 Baseline kernel

**延伸閱讀** Meta 在完整技術長文中說明，GEM 的效率提升不只是增加 GPU 數量，而是同時處理單卡運算效率與跨 GPU 擴充效率；相關細節見 [Meta 工程團隊的 GEM 技術文章](https://engineering.fb.com/2026/08/03/ml-applications/training-gem-at-llm-scale-meta-ads-recommendation-foundation-model/)。

## 媒體內容

**優化前的前向（forward）落差：既有 FMHA kernel 在 benchmark 的效能（450–830 TFLOPs）。**

**數據表**

|   | Max sequence length 200 | Max sequence length 500 | Max sequence length 1000 |
| --- | --- | --- | --- |
| FMHA kernel in benchmark | 450 TFLOPs | 730 TFLOPs | 830 TFLOPs |
| Baseline kernel in real-world traffic | 100~240 TFLOPs（多點散佈） | 260, 290 TFLOPs | 310~340, 600, 660 TFLOPs |

**優化前的後向（backward）落差：FMHA kernel 在 benchmark 的效能（193–472 TFLOPs）隨序列長度上升，明顯高於真實推薦流量下的 Baseline kernel**

**數據表**

|   | FMHA kernel in benchmark | Baseline kernel in real-world traffic |
| --- | --- | --- |
| Max sequence length 200 | 193 | 120, 135, 145, 155, 160, 170 |
| Max sequence length 500 | 317 | 205, 222 |
| Max sequence length 1000 | 472 | 220, 235, 250, 255 |

## 標籤

LLM, 研究論文, Meta
