研究報告

HBM容量下修驅動KV Cache的記憶體需求,8hi穩居主流

icon

發佈日期

2026-09-21

icon

更新頻率

不定期

icon

報告格式

PDF



AI晶片業者評估下修HBM容量,衝擊集中於推論階段的KV cache配置,並衍生三種調整方式與對應代價;同時推升KV cache offload的記憶體需求,主流業者仍規劃採用供給穩定的8hi HBM,4hi僅適用特定情境。

重點摘要

  • 影響範圍:HBM容量下修主要衝擊推論,模型權重須常駐,KV cache可用容量首當其衝。
  • 調整方式:業者可透過多種方式因應,惟各方式皆有其取捨。
  • 記憶體需求:卸載KV cache將推升高頻寬、低延遲的記憶體需求,帶動記憶體階層發展。
  • 規格展望:NVIDIA、Google等主流業者2027-28年仍規劃採用供給穩定的8hi HBM,4hi則僅適用特定場景。

目錄

  1. 前言
  2. 容量下修的影響集中於推論,HBM在推論中主要容納weights與KV cache
  3. HBM容量降低主要衝擊KV cache可用容量,代價隨調整方式而有所不同
    • Consequences of Downgrading HBM Capacity
    • Memory Hierarchy for KV Cache Offloading in AI Servers
  4. 主流AI晶片業者仍規畫使用供給面較為實際的8hi/12hi HBM

<報告頁數:5>

Memory Hierarchy for KV Cache Offloading in AI Servers





聯絡我們


聯絡我們