āļŠāđāļāļ AI Server āļŠāļģāļŦāļĢāļąāļ Generative AI āđāļĨāļ° Large Language Model āđāļĨāļ·āļāļāļāļĒāđāļēāļāđāļĢāđāļŦāđāđāļŦāļĄāļēāļ°āļāļąāļāļāļļāļĢāļāļīāļ
āļāļąāļāļāļļāļāļąāļ Generative AI āđāļĨāļ° Large Language Model āļŦāļĢāļ·āļ LLM āđāļāđāļēāļĄāļēāļĄāļĩāļāļāļāļēāļāđāļāļāļāļāđāļāļĢāļāļĒāđāļēāļāļĢāļ§āļāđāļĢāđāļ§ āļāļąāđāļāđāļāđāđāļāļāļāļāļāļāļāļāļāļģāļāļēāļĄāļĨāļđāļāļāđāļē āļĢāļ°āļāļāļŠāļĢāļļāļāđāļāļāļŠāļēāļĢ āļāļēāļĢāļ§āļīāđāļāļĢāļēāļ°āļŦāđāļāđāļāļĄāļđāļĨ āđāļāļāļāļāļķāļāļāļēāļĢāļŠāļĢāđāļēāļāđāļāļ·āđāļāļŦāļēāļāļąāļāđāļāļĄāļąāļāļī āđāļāđāļāļēāļĢāđāļĨāļ·āļāļ AI Server āļŠāļģāļŦāļĢāļąāļ Generative AI āđāļĄāđāļāļ§āļĢāļāļīāļāļēāļĢāļāļēāļāļēāļāļāļģāļāļ§āļ GPU āđāļāļĩāļĒāļāļāļĒāđāļēāļāđāļāļĩāļĒāļ§ āđāļāļĢāļēāļ°āļāļĢāļ°āļŠāļīāļāļāļīāļ āļēāļāļāļĢāļīāļāļĒāļąāļāļāļķāđāļāļāļĒāļđāđāļāļąāļāļāļāļēāļāđāļĄāđāļāļĨ āļāļģāļāļ§āļāļāļđāđāđāļāđāļāļēāļ āļāļ§āļēāļĄāļĒāļēāļ§āļāļāļ Context āļāļ§āļēāļĄāđāļĢāđāļ§āđāļāļāļēāļĢāļāļāļāļŠāļāļāļ āđāļĨāļ°āļĨāļąāļāļĐāļāļ°āļāļēāļāļ§āđāļēāđāļāđāļāļāļēāļĢāļāļķāļāđāļĄāđāļāļĨāļŦāļĢāļ·āļāļāļēāļĢāļāļģāđāļĄāđāļāļĨāđāļāđāļāđāļāļēāļāļāļĢāļīāļ
āļāļāļāļ§āļēāļĄāļāļĩāđāļāļ°āđāļāļ°āļāļģāļŠāđāļāļ AI Server āļŠāļģāļŦāļĢāļąāļ LLM āļāļąāđāļāđāļāđāļĢāļ°āļāļąāļāđāļĢāļīāđāļĄāļāđāļāļāļāļāļķāļāļĢāļ°āļāļāļāļĢāļ°āļŠāļīāļāļāļīāļ āļēāļāļŠāļđāļ āļāļĢāđāļāļĄāđāļāļ§āļāļēāļāđāļĨāļ·āļāļ GPU, CPU, RAM, Storage āđāļĨāļ°āđāļāļĢāļ·āļāļāđāļēāļĒāđāļŦāđāđāļŦāļĄāļēāļ°āļāļąāļāļāļēāļĢāđāļāđāļāļēāļāļāļāļāļāļāļāđāļāļĢ
AI Server āļāļ·āļāļāļ°āđāļĢ āđāļĨāļ°āđāļŦāļĄāļēāļ°āļāļąāļāļāļēāļāđāļ
AI Server āļāļ·āļāđāļāļīāļĢāđāļāđāļ§āļāļĢāđāļāļĩāđāļāļāļāđāļāļāļĄāļēāđāļāļ·āđāļāļĢāļāļāļĢāļąāļāļāļēāļāļāļĢāļ°āļĄāļ§āļĨāļāļĨāļāļąāļāļāļēāļāļĢāļ°āļāļīāļĐāļāđ āđāļāļĒāļĄāļĩ GPU āļŠāļģāļŦāļĢāļąāļāđāļĢāđāļāļāļēāļĢāļāļģāļāļ§āļāđāļĄāļāļĢāļīāļāļāđāđāļĨāļ°āđāļĄāđāļāļĨ Deep Learning āļĢāļ§āļĄāļāļķāļāļĄāļĩāļŦāļāđāļ§āļĒāļāļ§āļēāļĄāļāļģāđāļĨāļ°āļĢāļ°āļāļāļĢāļ°āļāļēāļĒāļāļ§āļēāļĄāļĢāđāļāļāļāļĩāđāļĢāļāļāļĢāļąāļāļāļēāļĢāļāļģāļāļēāļāļāđāļāđāļāļ·āđāļāļāļāļĨāļāļ 24 āļāļąāđāļ§āđāļĄāļ
āļāļēāļāļāļĩāđāđāļŦāļĄāļēāļ°āļāļąāļ AI Server āđāļāđāđāļāđ
- āļāļēāļĢāļāļķāļāđāļĄāđāļāļĨ Generative AI āđāļĨāļ° LLM
- āļāļēāļĢāļāļģ Fine-tuning āđāļĄāđāļāļĨāļ āļēāļĐāļēāļāļāļēāļāđāļŦāļāđ
- āļāļēāļĢāđāļŦāđāļāļĢāļīāļāļēāļĢ Chatbot āđāļĨāļ° AI Assistant
- āļĢāļ°āļāļ Retrieval-Augmented Generation āļŦāļĢāļ·āļ RAG
- āļāļēāļĢāļāļĢāļ°āļĄāļ§āļĨāļāļĨāđāļāļāļŠāļēāļĢāđāļĨāļ°āļŠāļĢāļļāļāļāđāļāļĄāļđāļĨ
- āļāļēāļĢāļŠāļĢāđāļēāļāļ āļēāļ āđāļŠāļĩāļĒāļ āļ§āļīāļāļĩāđāļ āđāļĨāļ°āđāļāļ·āđāļāļŦāļēāļāļąāļāđāļāļĄāļąāļāļī
- āļāļēāļĢāļ§āļīāđāļāļĢāļēāļ°āļŦāđāļāđāļāļĄāļđāļĨāļāđāļ§āļĒ Machine Learning
- āļāļēāļĢāđāļŦāđāļāļĢāļīāļāļēāļĢāđāļĄāđāļāļĨāļāđāļēāļ API āļ āļēāļĒāđāļāļāļāļāđāļāļĢ
āļŠāļīāđāļāļŠāļģāļāļąāļāļāļĩāđāļŠāļļāļāđāļāļāļēāļĢāđāļĨāļ·āļāļāļŠāđāļāļ AI Server
1. GPU āđāļĨāļ° VRAM
GPU āđāļāđāļāļŦāļąāļ§āđāļāļŦāļĨāļąāļāļāļāļ AI Server āđāļāļ·āđāļāļāļāļēāļāļāļēāļ LLM āļāđāļāļāđāļāđāļāļēāļĢāļāļģāļāļ§āļāđāļāļāļāļāļēāļāļāļģāļāļ§āļāļĄāļēāļ āđāļāļĒāđāļāļāļēāļ°āđāļāļāđāļ§āļ Training āđāļĨāļ° Inference
āļŠāļīāđāļāļāļĩāđāļāļ§āļĢāļāļīāļāļēāļĢāļāļē āđāļāđāđāļāđ
- āļāļĢāļīāļĄāļēāļ VRAM āļŦāļĢāļ·āļāļŦāļāđāļ§āļĒāļāļ§āļēāļĄāļāļģāļāļ GPU
- āļāļ§āļēāļĄāđāļĢāđāļ§ Memory Bandwidth
- āļāļĢāļ°āļŠāļīāļāļāļīāļ āļēāļ Tensor Core
- āļĢāļāļāļĢāļąāļ Precision āđāļāđāļ FP16, BF16, FP8 āļŦāļĢāļ·āļ FP4
- āļāļēāļĢāđāļāļ·āđāļāļĄāļāđāļāļĢāļ°āļŦāļ§āđāļēāļ GPU āđāļāđāļ NVLink
- āļāļģāļĨāļąāļāđāļāđāļĨāļ°āļĢāļ°āļāļāļĢāļ°āļāļēāļĒāļāļ§āļēāļĄāļĢāđāļāļ
VRAM āļĄāļĩāļāļ§āļēāļĄāļŠāļģāļāļąāļāļĄāļēāļ āđāļāļĢāļēāļ°āļāđāļāļāđāļāđāļāļąāļāđāļāđāļāļāđāļģāļŦāļāļąāļāļāļāļāđāļĄāđāļāļĨ āļĢāļ§āļĄāļāļķāļāļāđāļāļĄāļđāļĨāļŠāļģāļŦāļĢāļąāļ Context āđāļĨāļ° Batch āļāļēāļĢāļāļĢāļ°āļĄāļ§āļĨāļāļĨ āļŦāļēāļ VRAM āđāļĄāđāđāļāļĩāļĒāļāļāļ āļĢāļ°āļāļāļāļēāļāļāđāļāļāļĒāđāļēāļĒāļāđāļāļĄāļđāļĨāđāļāļĒāļąāļ RAM āļŦāļĢāļ·āļ Storage āļŠāđāļāļāļĨāđāļŦāđāļāļ§āļēāļĄāđāļĢāđāļ§āļĨāļāļĨāļāļāļĒāđāļēāļāļĄāļēāļ
āļāļąāļ§āļāļĒāđāļēāļ GPU āļŠāļģāļŦāļĢāļąāļāļāļēāļ AI Server āļĢāļ°āļāļąāļāļāļāļāđāļāļĢ āđāļāđāđāļāđ NVIDIA H100, H200 āđāļĨāļ° B200 āđāļāļĒ H100 āļĄāļĩāļŦāļāđāļ§āļĒāļāļ§āļēāļĄāļāļģ HBM3 āļāļāļēāļ 80GB āļāđāļ GPU āļāļāļ°āļāļĩāđ H200 āļĄāļĩ HBM3e āļāļāļēāļ 141GB āđāļĨāļ° Memory Bandwidth 4.8TB/s āļāļķāđāļāđāļŦāļĄāļēāļ°āļāļąāļāļāļēāļ LLM āļāļĩāđāļĄāļĩāđāļĄāđāļāļĨāļāļāļēāļāđāļŦāļāđāļŦāļĢāļ·āļāļĄāļĩ Context āļĒāļēāļ§
āļŠāļģāļŦāļĢāļąāļāļĢāļ°āļāļāļāļĢāļ°āļŠāļīāļāļāļīāļ āļēāļāļŠāļđāļ NVIDIA B200 āļĄāļĩāļŦāļāđāļ§āļĒāļāļ§āļēāļĄāļāļģ HBM3e āļŠāļđāļāļŠāļļāļāļāļĢāļ°āļĄāļēāļ 180GB āļāđāļ GPU āđāļĨāļ°āļĄāļĩ Memory Bandwidth āļŠāļđāļāļŠāļļāļāļāļĢāļ°āļĄāļēāļ 8TB/s āļāļķāļāđāļŦāļĄāļēāļ°āļāļąāļāļāļēāļ Generative AI āļĢāļļāđāļāđāļŦāļĄāđ āļāļēāļĢāļāļķāļāđāļĄāđāļāļĨāļāļāļēāļāđāļŦāļāđ āđāļĨāļ°āļāļēāļ Inference āļāļĩāđāļāđāļāļāļĢāļāļāļĢāļąāļāļāļđāđāđāļāđāļāļēāļāļāļģāļāļ§āļāļĄāļēāļ
2. CPU āļŠāļģāļŦāļĢāļąāļāļāļ§āļāļāļļāļĄāļĢāļ°āļāļāđāļĨāļ°āđāļāļĢāļĩāļĒāļĄāļāđāļāļĄāļđāļĨ
āđāļĄāđ GPU āļāļ°āđāļāđāļāļāļļāļāļāļĢāļāđāļŦāļĨāļąāļ āđāļāđ CPU āļĒāļąāļāļĄāļĩāļāļāļāļēāļāļŠāļģāļāļąāļāđāļāļāļēāļĢāļāļąāļāļāļēāļĢāļĢāļ°āļāļ āđāļāļĢāļĩāļĒāļĄāļāđāļāļĄāļđāļĨ āļāļĢāļ°āļĄāļ§āļĨāļāļĨāļāļģāļāļ āđāļĨāļ°āļāļ§āļāļāļļāļĄāļāļēāļĢāļŠāļ·āđāļāļŠāļēāļĢāļĢāļ°āļŦāļ§āđāļēāļāļāļļāļāļāļĢāļāđ
āđāļāļ§āļāļēāļāđāļĨāļ·āļāļ CPU āļĄāļĩāļāļąāļāļāļĩāđ
- āđāļāđ CPU āļĢāļ°āļāļąāļ Server āļāļĩāđāļĄāļĩāļŦāļĨāļēāļĒāļāļāļĢāđ
- āļĢāļāļāļĢāļąāļ PCIe Gen4 āļŦāļĢāļ·āļ PCIe Gen5
- āļĄāļĩ L3 Cache āđāļāļĩāļĒāļāļāļ
- āļĢāļāļāļĢāļąāļāļŦāļāđāļ§āļĒāļāļ§āļēāļĄāļāļģ ECC
- āļĄāļĩāļāđāļāļāļāļēāļ PCIe āđāļāļĩāļĒāļāļāļāļŠāļģāļŦāļĢāļąāļ GPU āđāļĨāļ° NVMe
- āđāļĨāļ·āļāļ CPU āđāļāļ 2 Socket āđāļĄāļ·āđāļāđāļāđāļāļēāļ GPU āļāļģāļāļ§āļāļĄāļēāļ
āļŠāļģāļŦāļĢāļąāļ AI Server āļāļĩāđāđāļāđ GPU 1â2 āđāļ āļāļēāļāđāļĨāļ·āļāļ CPU Server āļĢāļ°āļāļąāļ 16â32 āļāļāļĢāđ āđāļāđāļŦāļēāļāđāļāđāļāļĢāļ°āļāļ 4â8 GPU āļāļ§āļĢāđāļĨāļ·āļāļ CPU āļĢāļ°āļāļąāļāļŠāļđāļāđāļāļ Dual Socket āđāļāļ·āđāļāđāļĄāđāđāļŦāđāđāļāļīāļāļāļāļāļ§āļāđāļāļāļēāļĢāļŠāđāļāļāđāļāļĄāļđāļĨāđāļāđāļēāļŠāļđāđ GPU
3. RAM āļŦāļĢāļ·āļ System Memory
RAM āđāļāđāļŠāļģāļŦāļĢāļąāļāđāļŦāļĨāļ Dataset, āđāļāđāļāļāđāļāļĄāļđāļĨāļāļąāđāļ§āļāļĢāļēāļ§ āđāļĨāļ°āļĢāļāļāļĢāļąāļāļāļĢāļ°āļāļ§āļāļāļēāļĢāļāļģāļāļēāļāļāļāļāļĢāļ°āļāļ AI āđāļāļĒāļāļąāđāļ§āđāļāļāļ§āļĢāļĄāļĩ RAM āļĄāļēāļāļāļ§āđāļēāļāļāļēāļāđāļĄāđāļāļĨāļāļĩāđāđāļāđāļāļēāļāļāļĢāļīāļāļŦāļĨāļēāļĒāđāļāđāļē
āđāļāļ§āļāļēāļāđāļāļ·āđāļāļāļāđāļ
- AI Server āļāļāļēāļāđāļĨāđāļ: RAM 128â256GB
- āļĢāļ°āļāļ RAG āļŦāļĢāļ·āļāđāļĄāđāļāļĨāļĢāļ°āļāļąāļāļāļĨāļēāļ: RAM 256â512GB
- āļĢāļ°āļāļ Training āļŦāļĢāļ·āļ Inference āļŦāļĨāļēāļĒ GPU: RAM 512GBâ1.5TB
- āļĢāļ°āļāļ 8 GPU āļĢāļ°āļāļąāļāļāļāļāđāļāļĢ: āļāļ§āļĢāļāļīāļāļēāļĢāļāļē RAM āļāļĒāđāļēāļāļāđāļāļĒ 1.5TB āļāļēāļĄāđāļāļ§āļāļēāļāļāđāļēāļāļāļīāļāļāļāļāļĢāļ°āļāļ HGX āļāļēāļāļĢāļļāđāļ
RAM āđāļāļ ECC āļāđāļ§āļĒāļāļĢāļ§āļāļāļąāļāđāļĨāļ°āđāļāđāđāļāļāđāļāļāļīāļāļāļĨāļēāļāļāļāļāļāđāļāļĄāļđāļĨ āđāļŦāļĄāļēāļ°āļāļąāļāđāļāļīāļĢāđāļāđāļ§āļāļĢāđāļāļĩāđāļāđāļāļāļāļģāļāļēāļāļāđāļāđāļāļ·āđāļāļāđāļĨāļ°āļĄāļĩāļāļ§āļēāļĄāļŠāļģāļāļąāļāļāđāļāļāļļāļĢāļāļīāļ
4. Storage āļŠāļģāļŦāļĢāļąāļāđāļĄāđāļāļĨāđāļĨāļ° Dataset
āđāļĄāđāļāļĨ LLM āđāļĨāļ° Dataset āļāļēāļāļĄāļĩāļāļāļēāļāļāļąāđāļāđāļāđāļŦāļĨāļēāļĒāļŠāļīāļāļāļīāļāļ°āđāļāļāđāļāļāļāļķāļāļŦāļĨāļēāļĒāđāļāļĢāļēāđāļāļāđ āļāļąāļāļāļąāđāļāļāļ§āļĢāļāļāļāđāļāļ Storage āđāļĒāļāļāļēāļĄāļĨāļąāļāļĐāļāļ°āļāļēāļĢāđāļāđāļāļēāļ
āđāļāļĢāļāļŠāļĢāđāļēāļāļāļĩāđāđāļāļ°āļāļģ
- NVMe SSD āļŠāļģāļŦāļĢāļąāļāļāļīāļāļāļąāđāļāļĢāļ°āļāļāļāļāļīāļāļąāļāļīāļāļēāļĢāđāļĨāļ°āļāļāļāļāđāđāļ§āļĢāđ
- NVMe SSD āļāļ§āļēāļĄāđāļĢāđāļ§āļŠāļđāļāļŠāļģāļŦāļĢāļąāļāđāļŦāļĨāļāđāļĄāđāļāļĨāđāļĨāļ° Cache
- Enterprise SSD āļŠāļģāļŦāļĢāļąāļ Dataset āļāļĩāđāđāļāđāļāļēāļāļāđāļāļĒ
- HDD āļŦāļĢāļ·āļ Object Storage āļŠāļģāļŦāļĢāļąāļāđāļāđāļāļāđāļāļĄāļđāļĨāļĢāļ°āļĒāļ°āļĒāļēāļ§
- RAID āđāļāļ·āđāļāđāļāļīāđāļĄāļāļ§āļēāļĄāļāļĨāļāļāļ āļąāļĒāđāļĨāļ°āļāļ§āļēāļĄāļāđāļāđāļāļ·āđāļāļāļāļāļāļĢāļ°āļāļ
āļāļąāļ§āļāļĒāđāļēāļāļāļēāļĢāļāļąāļāđāļāđāļāļāđāļāļĄāļđāļĨ
- OS: NVMe SSD āđāļāļ RAID 1 āļāļāļēāļ 1.92TB
- Model Cache: NVMe SSD āļāļāļēāļ 3.84TB āļāļķāđāļāđāļ
- Dataset: Enterprise SSD āļŦāļĢāļ·āļ Storage āļ āļēāļĒāļāļāļāļāļēāļĄāļāļĢāļīāļĄāļēāļāļāđāļāļĄāļđāļĨ
- Backup: NAS, Object Storage āļŦāļĢāļ·āļāļĢāļ°āļāļāļŠāļģāļĢāļāļāļāđāļāļĄāļđāļĨāļāļāļāļāļāļāđāļāļĢ
āļĢāļ°āļāļ AI Server āļāļĩāđāļĄāļĩ GPU āļāļģāļāļ§āļāļĄāļēāļāļāļ§āļĢāđāļŦāđāļāļ§āļēāļĄāļŠāļģāļāļąāļāļāļąāļāļāļ§āļēāļĄāđāļĢāđāļ§āđāļāļāļēāļĢāļāđāļēāļāļāđāļāļĄāļđāļĨ āđāļāļĢāļēāļ°āļāļēāļĢāđāļŦāļĨāļāđāļĄāđāļāļĨāļŦāļĢāļ·āļ Dataset āļāļĩāđāļāđāļēāļāļēāļāļāļģāđāļŦāđ GPU āļāđāļāļāļĢāļāļāđāļāļĄāļđāļĨāđāļĨāļ°āđāļāđāļāļĢāļąāļāļĒāļēāļāļĢāđāļĄāđāđāļāđāļĄāļāļĢāļ°āļŠāļīāļāļāļīāļ āļēāļ
āļāļąāļ§āļāļĒāđāļēāļāļŠāđāļāļ AI Server āļāļēāļĄāļĢāļ°āļāļąāļāļāļēāļĢāđāļāđāļāļēāļ
āļĢāļ°āļāļąāļāđāļĢāļīāđāļĄāļāđāļ: āđāļāđāļāļēāļ LLM āđāļĨāļ° RAG āļ āļēāļĒāđāļāļāļāļāđāļāļĢ
āđāļŦāļĄāļēāļ°āļŠāļģāļŦāļĢāļąāļāļāļļāļĢāļāļīāļāļāļĩāđāļāđāļāļāļāļēāļĢāļŠāļĢāđāļēāļ Chatbot, āļĢāļ°āļāļāļāļēāļĄāļāļāļāđāļāļāļŠāļēāļĢ āļŦāļĢāļ·āļāļāļāļĨāļāļāđāļāđāļāļēāļāđāļĄāđāļāļĨ Open Source
- CPU: 16â32 āļāļāļĢāđ
- GPU: NVIDIA RTX āļĢāļ°āļāļąāļāļŠāļđāļ āļŦāļĢāļ·āļ GPU Data Center 1 āđāļ
- VRAM: 24â80GB
- RAM: 128â256GB ECC
- Storage: NVMe SSD 2â4TB
- Network: 10GbE
- āļĢāļ°āļāļāļāļāļīāļāļąāļāļīāļāļēāļĢ: Linux Server
- āļĢāļđāļāđāļāļāļāļēāļ: Inference, Embedding, RAG āđāļĨāļ° Fine-tuning āļāļāļēāļāđāļĨāđāļ
āļĢāļ°āļāļąāļāļāļĨāļēāļ: āđāļŦāđāļāļĢāļīāļāļēāļĢ AI āļŦāļĨāļēāļĒāļāļđāđāđāļāđāļāļēāļ
āđāļŦāļĄāļēāļ°āļāļąāļāļāļāļāđāļāļĢāļāļĩāđāļĄāļĩāļāļđāđāđāļāđāļāļēāļāļāļĢāđāļāļĄāļāļąāļ āļāđāļāļāļāļēāļĢāļāļ§āļēāļĄāđāļŠāļāļĩāļĒāļĢ āđāļĨāļ°āļāđāļāļāļāļĢāļ°āļĄāļ§āļĨāļāļĨāđāļĄāđāļāļĨāļāļāļēāļāļāļĨāļēāļ
- CPU: 32â64 āļāļāļĢāđ
- GPU: NVIDIA H100 āļŦāļĢāļ·āļ GPU Data Center 2â4 āđāļ
- VRAM āļĢāļ§āļĄ: 160â560GB āđāļāļĒāļāļĢāļ°āļĄāļēāļ
- RAM: 512GBâ1TB ECC
- Storage: NVMe Enterprise 7.68TB āļāļķāđāļāđāļ
- Network: 25GbE āļŦāļĢāļ·āļ 100GbE
- āļĢāļ°āļāļāļāļąāļāļāļēāļĢ: Docker, Kubernetes āļŦāļĢāļ·āļāļĢāļ°āļāļāļāļąāļāļāļēāļĢ GPU
- āļĢāļđāļāđāļāļāļāļēāļ: Production Inference, RAG, Fine-tuning āđāļĨāļ°āļĢāļ°āļāļ AI API
āļĢāļ°āļāļąāļāļŠāļđāļ: Training āđāļĨāļ° Generative AI āļāļāļēāļāđāļŦāļāđ
āđāļŦāļĄāļēāļ°āļŠāļģāļŦāļĢāļąāļāļāļāļāđāļāļĢāļāļāļēāļāđāļŦāļāđ āļĻāļđāļāļĒāđāļ§āļīāļāļąāļĒ āļāļđāđāđāļŦāđāļāļĢāļīāļāļēāļĢ Cloud āļŦāļĢāļ·āļāļāļļāļĢāļāļīāļāļāļĩāđāļāļąāļāļāļēāđāļĄāđāļāļĨāđāļāļāļēāļ°āļāļēāļ
- CPU: Dual Socket āļĢāļ°āļāļąāļ Server
- GPU: NVIDIA H200 āļŦāļĢāļ·āļ B200 āļāļģāļāļ§āļ 8 āđāļ
- VRAM āļĢāļ§āļĄ: H200 āļāļĢāļ°āļĄāļēāļ 1.1TB āļŦāļĢāļ·āļ B200 āļāļĢāļ°āļĄāļēāļ 1.4TB āļāđāļāđāļŦāļāļ
- RAM: 1.5â2TB ECC
- Storage: NVMe Enterprise āļŦāļĨāļēāļĒāļāļļāļ āļāļĢāđāļāļĄāļĢāļ°āļāļ Storage āļ āļēāļĒāļāļāļ
- Network: 100GbE, 200GbE āļŦāļĢāļ·āļ InfiniBand
- Interconnect: NVLink āđāļĨāļ°āļĢāļ°āļāļāđāļāļ·āđāļāļĄāļāđāļ GPU āļāļ§āļēāļĄāđāļĢāđāļ§āļŠāļđāļ
- Power Supply: Redundant PSU āļāļāļēāļāļŠāļđāļ
- āļĢāļ°āļāļāļĢāļ°āļāļēāļĒāļāļ§āļēāļĄāļĢāđāļāļ: Air Cooling āļāļĢāļ°āļŠāļīāļāļāļīāļ āļēāļāļŠāļđāļāļŦāļĢāļ·āļ Liquid Cooling
Training āļāļąāļ Inference āđāļāđāļŠāđāļāļāđāļŦāļĄāļ·āļāļāļāļąāļāļŦāļĢāļ·āļāđāļĄāđ
āđāļĄāđāđāļŦāļĄāļ·āļāļāļāļąāļāļāļąāđāļāļŦāļĄāļ
Training
āļāļēāļĢāļāļķāļāđāļĄāđāļāļĨāļāđāļāļāđāļāđ GPU āļāļģāļāļ§āļāļĄāļēāļāđāļĨāļ°āđāļāđāđāļ§āļĨāļēāļāđāļāđāļāļ·āđāļāļāđāļāđāļāđāļ§āļĨāļēāļāļēāļ āļāļķāļāļāđāļāļāđāļŦāđāļāļ§āļēāļĄāļŠāļģāļāļąāļāļāļąāļ
- VRAM āļāļāļēāļāđāļŦāļāđ
- GPU āļāļģāļāļ§āļāļĄāļēāļ
- NVLink āļŦāļĢāļ·āļ Interconnect āļāļ§āļēāļĄāđāļĢāđāļ§āļŠāļđāļ
- Storage āļāļĩāđāļāđāļēāļāļāđāļāļĄāļđāļĨāđāļāđāļĢāļ§āļāđāļĢāđāļ§
- Network Latency āļāđāļģ
- āļĢāļ°āļāļāļĢāļ°āļāļēāļĒāļāļ§āļēāļĄāļĢāđāļāļāđāļĨāļ°āđāļāļāđāļēāļāļĩāđāđāļŠāļāļĩāļĒāļĢ
Inference
āļāļēāļĢāļāļģāđāļĄāđāļāļĨāđāļāđāļŦāđāļāļĢāļīāļāļēāļĢāļāđāļāļāđāļāđāļāļāļ§āļēāļĄāđāļĢāđāļ§āļāļāļāļŠāļāļāļāđāļĨāļ°āļāļģāļāļ§āļāļāļģāļāļāļāđāļāļ§āļīāļāļēāļāļĩ āđāļāļĒāļāļ§āļĢāļāļīāļāļēāļĢāļāļē
- āļāļĢāļīāļĄāļēāļ VRAM āļāđāļāđāļĄāđāļāļĨ
- Memory Bandwidth
- āļāļģāļāļ§āļāļāļđāđāđāļāđāļāļēāļāļāļĢāđāļāļĄāļāļąāļ
- Context Length
- Batch Size
- āļāļ§āļēāļĄāđāļĢāđāļ§ Time to First Token
- āļāļ§āļēāļĄāđāļĢāđāļ§ Token āļāđāļāļ§āļīāļāļēāļāļĩ
- āļĢāļ°āļāļ Load Balancing āđāļĨāļ° High Availability
āļŠāļģāļŦāļĢāļąāļ Inference āđāļĄāđāļāļĨāļāļāļēāļāđāļŦāļāđ GPU āļāļĩāđāļĄāļĩ VRAM āļŠāļđāļ āđāļāđāļ H200 āļŦāļĢāļ·āļ B200 āļāļēāļāļāđāļ§āļĒāļĨāļāļāļēāļĢāđāļāđāļāđāļĄāđāļāļĨāļŦāļĨāļēāļĒ GPU āđāļĨāļ°āđāļāļīāđāļĄāļāļĢāļ°āļŠāļīāļāļāļīāļ āļēāļāđāļāļāļēāļĢāļĢāļāļāļĢāļąāļ Context āļĒāļēāļ§āđāļāđ
āļāļēāļĢāļāļģāļāļ§āļ VRAM āđāļāļ·āđāļāļāļāđāļāļŠāļģāļŦāļĢāļąāļ LLM
āļāļēāļĢāļāļĢāļ°āđāļĄāļīāļ VRAM āđāļĄāđāļāļ§āļĢāļāļđāđāļāļāļēāļ°āļāļģāļāļ§āļāļāļēāļĢāļēāļĄāļīāđāļāļāļĢāđāļāļāļāđāļĄāđāļāļĨ āđāļāļĢāļēāļ°āļĒāļąāļāļāđāļāļāđāļāļ·āđāļāļāļ·āđāļāļāļĩāđāļŠāļģāļŦāļĢāļąāļ KV Cache, Runtime āđāļĨāļ°āļāđāļāļĄāļđāļĨ Input/Output
āđāļāļĒāļāļąāđāļ§āđāļ āļāđāļģāļŦāļāļąāļāđāļĄāđāļāļĨāđāļāļāļāļ§āļēāļĄāļĨāļ°āđāļāļĩāļĒāļāļŠāļđāļāļāļēāļāđāļāđāļŦāļāđāļ§āļĒāļāļ§āļēāļĄāļāļģāļĄāļēāļāļāļ§āđāļēāđāļĄāđāļāļĨāđāļāļ Quantization āđāļāđāļ
- FP16 āļŦāļĢāļ·āļ BF16 āđāļāđāļāļĢāļ°āļĄāļēāļ 2 āđāļāļāđāļāđāļāļāļēāļĢāļēāļĄāļīāđāļāļāļĢāđ
- INT8 āđāļāđāļāļĢāļ°āļĄāļēāļ 1 āđāļāļāđāļāđāļāļāļēāļĢāļēāļĄāļīāđāļāļāļĢāđ
- 4-bit Quantization āđāļāđāļāļĢāļ°āļĄāļēāļ 0.5 āđāļāļāđāļāđāļāļāļēāļĢāļēāļĄāļīāđāļāļāļĢāđ
āļāļąāļ§āļāļĒāđāļēāļ āđāļĄāđāļāļĨ 70B Parameters āļŦāļēāļāđāļāđāļāļēāļāđāļāļ FP16 āļāļ°āļāđāļāļāđāļāđāļāļ·āđāļāļāļĩāđāļŠāļģāļŦāļĢāļąāļāļāđāļģāļŦāļāļąāļāđāļĄāđāļāļĨāļāļĢāļ°āļĄāļēāļ 140GB āļāđāļāļāļĢāļ§āļĄāļāļ·āđāļāļāļĩāđāļŠāļģāļŦāļĢāļąāļ KV Cache āđāļĨāļ°āļĢāļ°āļāļāļāļ·āđāļ āđ āļāļąāļāļāļąāđāļāļāļēāļāļāđāļāļāđāļāđ GPU āļŦāļĨāļēāļĒāđāļ āļŦāļĢāļ·āļāđāļĨāļ·āļāļ GPU āļāļĩāđāļĄāļĩ VRAM āļŠāļđāļāļāļ§āđāļē
āļāļĒāđāļēāļāđāļĢāļāđāļāļēāļĄ āļāļĢāļīāļĄāļēāļ VRAM āļāļĢāļīāļāļāļķāđāļāļāļĒāļđāđāļāļąāļ Framework, Quantization, Context Length āđāļĨāļ° Batch Size āļāļķāļāļāļ§āļĢāļāļāļŠāļāļāļāđāļ§āļĒ Workload āļāļĩāđāđāļāļĨāđāđāļāļĩāļĒāļāļāļēāļĢāđāļāđāļāļēāļāļāļĢāļīāļāļāđāļāļāļŠāļąāđāļāļāļ·āđāļ AI Server
āļĢāļ°āļāļāđāļāļĢāļ·āļāļāđāļēāļĒāđāļĨāļ°āļāļēāļĢāļĢāļ°āļāļēāļĒāļāļ§āļēāļĄāļĢāđāļāļ
AI Server āļāļĩāđāļĄāļĩ GPU āļŦāļĨāļēāļĒāđāļāļŠāļĢāđāļēāļāļāļ§āļēāļĄāļĢāđāļāļāđāļĨāļ°āđāļāđāļāļĨāļąāļāļāļēāļāļŠāļđāļāļāļ§āđāļēāļĢāļ°āļāļāđāļāļīāļĢāđāļāđāļ§āļāļĢāđāļāļąāđāļ§āđāļ āļāļģāđāļāđāļāļāđāļāļāļāļĢāļ§āļāļŠāļāļ
- āļāļģāļĨāļąāļāđāļāļāļāļ GPU āđāļĨāļ°āļāļļāļāļāļĢāļāđāļāļąāđāļāļŦāļĄāļ
- āļāļģāļāļ§āļāđāļĨāļ°āļāļāļēāļāļāļāļ Power Supply
- āļāļ§āļēāļĄāļŠāļēāļĄāļēāļĢāļāļāļāļ Rack āđāļĨāļ°āļĢāļ°āļāļāđāļāļāđāļē
- Airflow āļ āļēāļĒāđāļāļŦāđāļāļ Server
- āļāļļāļāļŦāļ āļđāļĄāļīāđāļĨāļ°āļāļ§āļēāļĄāļāļ·āđāļ
- āļĢāļ°āļāļāļŠāļģāļĢāļāļāđāļ UPS
- āļāļēāļĢāđāļāļ·āđāļāļĄāļāđāļ Network āļĢāļ°āļŦāļ§āđāļēāļ Server āđāļĨāļ° Storage
āļĢāļ°āļāļ HGX āļāļĩāđāđāļāđ H100 āļŦāļĢāļ·āļ H200 āļāļģāļāļ§āļ 8 āđāļ āļŠāļēāļĄāļēāļĢāļāļĄāļĩāļŦāļāđāļ§āļĒāļāļ§āļēāļĄāļāļģ GPU āļĢāļ§āļĄāļŠāļđāļāļŠāļļāļāļāļĢāļ°āļĄāļēāļ 640GB āđāļĨāļ° 1,128GB āļāļēāļĄāļĨāļģāļāļąāļ āļāļāļ°āļāļĩāđāļĢāļ°āļāļ B200 8 āđāļāļĄāļĩāļŦāļāđāļ§āļĒāļāļ§āļēāļĄāļāļģāļĢāļ§āļĄāļāļĢāļ°āļĄāļēāļ 1.44TB āļāļķāļāļāđāļāļāļāļāļāđāļāļāļĢāļ°āļāļāđāļāļāđāļē āđāļāļĢāļ·āļāļāđāļēāļĒ āđāļĨāļ°āļāļēāļĢāļĢāļ°āļāļēāļĒāļāļ§āļēāļĄāļĢāđāļāļāļāļĒāđāļēāļāļĢāļāļāļāļāļ
Checklist āļāđāļāļāđāļĨāļ·āļāļāļāļ·āđāļ AI Server
āļāđāļāļāļāļąāļāļŠāļīāļāđāļ āļāļ§āļĢāļāļāļāļāļģāļāļēāļĄāļāđāļāđāļāļāļĩāđ
- āđāļĄāđāļāļĨāļāļĩāđāļāđāļāļāļāļēāļĢāđāļāđāļāļēāļāļĄāļĩāļāļāļēāļāļāļĩāđāļāļēāļĢāļēāļĄāļīāđāļāļāļĢāđ
- āļāđāļāļāļāļēāļĢ Training, Fine-tuning āļŦāļĢāļ·āļ Inference
- āļĄāļĩāļāļđāđāđāļāđāļāļēāļāļāļĢāđāļāļĄāļāļąāļāļāļĩāđāļāļ
- āļāđāļāļāļāļēāļĢāļāļ§āļēāļĄāđāļĢāđāļ§āļāļāļāļāļĨāļąāļāļāļĩāđ Token āļāđāļāļ§āļīāļāļēāļāļĩ
- Context āļāļĩāđāđāļāđāļāļēāļāļĄāļĩāļāļ§āļēāļĄāļĒāļēāļ§āđāļāđāļēāđāļ
- āļāđāļāļāđāļāđāļāđāļāļĄāļđāļĨāļ āļēāļĒāđāļāļāļāļāđāļāļĢāļŦāļĢāļ·āļāđāļāļ·āđāļāļĄāļāđāļāļĢāļ°āļāļ RAG āļŦāļĢāļ·āļāđāļĄāđ
- āļĄāļĩāļāļ·āđāļāļāļĩāđ Rack āđāļĨāļ°āļāļģāļĨāļąāļāđāļāđāļāļĩāļĒāļāļāļāļŦāļĢāļ·āļāđāļĄāđ
- āļāđāļāļāļāļēāļĢāļĢāļ°āļāļāļŠāļģāļĢāļāļāļāđāļāļĄāļđāļĨāđāļĨāļ° High Availability āļŦāļĢāļ·āļāđāļĄāđ
- āļĄāļĩāļāļĩāļĄāļāļđāđāļĨ Linux, GPU, Container āđāļĨāļ°āļĢāļ°āļāļāđāļāļĢāļ·āļāļāđāļēāļĒāļŦāļĢāļ·āļāđāļĄāđ
- āļāđāļāļāļāļēāļĢāļāļ·āđāļāđāļāļĢāļ·āđāļāļāļāļĢāđāļāļĄāļāļĢāļīāļāļēāļĢāļāļīāļāļāļąāđāļāđāļĨāļ°āļāļđāđāļĨāļŦāļĨāļąāļāļāļēāļĢāļāļēāļĒāļŦāļĢāļ·āļāđāļĄāđ
āļŠāļĢāļļāļ
āļāļēāļĢāđāļĨāļ·āļāļ āļŠāđāļāļ AI Server āļŠāļģāļŦāļĢāļąāļ Generative AI āđāļĨāļ° Large Language Model āļāđāļāļāļāļīāļāļēāļĢāļāļēāļāļąāđāļ GPU, VRAM, CPU, RAM, Storage, Network, āļĢāļ°āļāļāđāļāļāđāļē āđāļĨāļ°āļāļēāļĢāļĢāļ°āļāļēāļĒāļāļ§āļēāļĄāļĢāđāļāļāļĢāđāļ§āļĄāļāļąāļ āđāļĄāđāļāļ§āļĢāđāļĨāļ·āļāļāļāļēāļāļŠāđāļāļāļāļĩāđāļŠāļđāļāļāļĩāđāļŠāļļāļ āđāļāđāļāļ§āļĢāđāļĨāļ·āļāļāđāļŦāđāđāļŦāļĄāļēāļ°āļāļąāļāđāļĄāđāļāļĨ āļāļģāļāļ§āļāļāļđāđāđāļāđāļāļēāļ āđāļĨāļ°āđāļāđāļēāļŦāļĄāļēāļĒāļāļēāļāļāļļāļĢāļāļīāļ
āļŠāļģāļŦāļĢāļąāļāļāļēāļĢāđāļāđāļāļēāļāļĢāļ°āļāļąāļāđāļĢāļīāđāļĄāļāđāļ āļāļēāļāđāļĢāļīāđāļĄāļāļēāļ GPU 1 āđāļāđāļĨāļ° RAM 128â256GB āļŠāđāļ§āļāļāļēāļ Production āļŦāļĢāļ·āļāđāļĄāđāļāļĨāļāļāļēāļāđāļŦāļāđāļāļ§āļĢāļāļīāļāļēāļĢāļāļē GPU Data Center āđāļāđāļ H100, H200 āļŦāļĢāļ·āļ B200 āļāļĢāđāļāļĄāļĢāļ°āļāļ NVLink, NVMe āđāļĨāļ°āđāļāļĢāļ·āļāļāđāļēāļĒāļāļ§āļēāļĄāđāļĢāđāļ§āļŠāļđāļ
āļŦāļēāļāļāļāļāđāļāļĢāļāļģāļĨāļąāļāļ§āļēāļāļĢāļ°āļāļ Generative AI, LLM, RAG āļŦāļĢāļ·āļ AI Server āļŠāļģāļŦāļĢāļąāļāđāļŦāđāļāļĢāļīāļāļēāļĢāļ āļēāļĒāđāļ āļŠāļēāļĄāļēāļĢāļāļāļīāļāļāđāļāļāļĩāļĄāļāļēāļ 2beshop.com āđāļāļ·āđāļāļāđāļ§āļĒāļ§āļīāđāļāļĢāļēāļ°āļŦāđ Workload āļāļāļāđāļāļāļŠāđāļāļ āđāļĨāļ°āđāļĨāļ·āļāļāđāļāļĨāļđāļāļąāļāļāļĩāđāđāļŦāļĄāļēāļ°āļŠāļĄāļāļąāļāļāļāļāļĢāļ°āļĄāļēāļāđāļĨāļ°āļāļēāļĢāđāļāļīāļāđāļāļāļāļāļāļļāļĢāļāļīāļ
- āļŠāļāđāļāļŠāļāļāļāļēāļĄāļāđāļāļĄāļđāļĨāđāļāļīāđāļĄāđāļāļīāļĄāļŦāļĢāļ·āļāļāļ·āđāļāļāļļāļāļāļāđ IT āļāļĨāļīāļāđāļĨāļĒ
- āļāļ·āđāļāļŠāļīāļāļāđāļēāļāđāļēāļ Application āļĢāļąāļāļŠāđāļ§āļāļĨāļāđāļāļīāđāļĄÂ āļāļĨāļīāļāđāļĨāļĒ
- LINE: @2beshop
- āđāļāļĢ 02-1186767