HBM容量下修驅動KV Cache的記憶體需求,8hi穩居主流
發佈日期
2026-09-21
更新頻率
不定期
報告格式
AI晶片業者評估下修HBM容量,衝擊集中於推論階段的KV cache配置,並衍生三種調整方式與對應代價;同時推升KV cache offload的記憶體需求,主流業者仍規劃採用供給穩定的8hi HBM,4hi僅適用特定情境。
重點摘要
- 影響範圍:HBM容量下修主要衝擊推論,模型權重須常駐,KV cache可用容量首當其衝。
- 調整方式:業者可透過多種方式因應,惟各方式皆有其取捨。
- 記憶體需求:卸載KV cache將推升高頻寬、低延遲的記憶體需求,帶動記憶體階層發展。
- 規格展望:NVIDIA、Google等主流業者2027-28年仍規劃採用供給穩定的8hi HBM,4hi則僅適用特定場景。
目錄
- 前言
- 容量下修的影響集中於推論,HBM在推論中主要容納weights與KV cache
- HBM容量降低主要衝擊KV cache可用容量,代價隨調整方式而有所不同
- Consequences of Downgrading HBM Capacity
- Memory Hierarchy for KV Cache Offloading in AI Servers
- 主流AI晶片業者仍規畫使用供給面較為實際的8hi/12hi HBM
<報告頁數:5>
