āļāļēāļĢāļāļ°āđāļĨāļ·āļāļ AI Server āļŠāļģāļŦāļĢāļąāļāļāļēāļ Generative AI āđāļŦāđāļĢāļąāļāđāļĄāđāļāļĨāđāļŦāļāđāđāļāđāļāļĩ āļāđāļāļāđāļāļāļąāļŠāļāļĩāđāļŠāđāļāļ GPU, VRAM, RAM, Storage āđāļĨāļ° Network āđāļŦāđāļŠāļāļāļāļĨāđāļāļāļāļąāļāļāļāļēāļāđāļĄāđāļāļĨāđāļĨāļ°āļĢāļđāļāđāļāļāļāļēāļ (Training / Inference) āļāļĢāđāļāļĄāļĢāļāļāļĢāļąāļāļāļēāļĢāļāļĒāļēāļĒāđāļāļāļāļēāļāļ
1. AI Server āļŠāļģāļŦāļĢāļąāļ Generative AI āļāļ·āļāļāļ°āđāļĢ āđāļĨāļ°āļŠāļģāļāļąāļāļāļĒāđāļēāļāđāļĢ
AI Server āļāļ·āļāđāļāļīāļĢāđāļāđāļ§āļāļĢāđāļāļĩāđāļāļāļāđāļāļāļĄāļēāđāļāļ·āđāļāļĢāļāļāļĢāļąāļāļāļēāļāļāļąāļāļāļēāļāļĢāļ°āļāļīāļĐāļāđāđāļāļĒāđāļāļāļēāļ° āđāļāđāļāđāļāđ GPU āļāļĢāļ°āļŠāļīāļāļāļīāļ āļēāļāļŠāļđāļāļŦāļĨāļēāļĒāļāļąāļ§ āđāļāļāļāļēāļĢāļāļķāđāļ CPU āđāļāļĩāļĒāļāļāļĒāđāļēāļāđāļāļĩāļĒāļ§ āđāļāļ·āđāļāđāļĢāđāļāļāļēāļĢāļāļĢāļ°āļĄāļ§āļĨāļāļĨāļāļāļāļāļēāļ AI āļāļĩāđāđāļāđāļāļēāļĢāļāļģāļāļ§āļāļāļģāļāļ§āļāļĄāļēāļ āđāļāđāļ Deep Learning, Large Language Model (LLM) āđāļĨāļ°āļāļēāļ Generative AI āļāļ·āđāļ āđ
āđāļāļĄāļļāļĄāļāļāļāļāļāļāđāļāļĢāļāļĩāđāļāđāļāļāļāļēāļĢāļĢāļąāļ āđāļĄāđāļāļĨāđāļŦāļāđ (Large Model) āđāļāđāļ LLM āļāļāļēāļāļŦāļĨāļēāļĒāļŠāļīāļāļāļąāļāļĨāđāļēāļāļāļēāļĢāļēāļĄāļīāđāļāļāļĢāđ āļŦāļĢāļ·āļāđāļĄāđāļāļĨāļ āļēāļ/āļ§āļīāļāļĩāđāļāļĢāļ°āļāļąāļāļŠāļđāļ āļāļēāļĢāļĄāļĩ AI Server āļāļĩāđāļŠāđāļāļāđāļŦāļĄāļēāļ°āļŠāļĄāļŦāļĄāļēāļĒāļāļķāļ:
- āļāļĢāļ°āļĄāļ§āļĨāļāļĨ āđāļĢāđāļ§āļāļķāđāļ āđāļĨāļ°āļāļāļāļŠāļāļāļāļāļđāđāđāļāđāđāļāđāđāļāļāđāļĢāļĩāļĒāļĨāđāļāļĄāđ
- āļĢāļąāļāđāļĄāđāļāļĨāđāļāđ āđāļŠāļāļĩāļĒāļĢ āđāļĄāđāļŦāļĨāļļāļ āđāļĄāđāļāđāļēāļ
- āļĢāļāļāļĢāļąāļāļāļēāļĢ āđāļāļĢāļ/āđāļāļāđāļāļđāļ āđāļĄāđāļāļĨāļāļāļāļāļāļāđāļāļĢāđāļāļ
- āļāļ§āļāļāļļāļĄ āļāđāļāļĄāļđāļĨāļ āļēāļĒāđāļ (Data Governance) āđāļāđāļāļĩāļāļ§āđāļēāđāļāđ Cloud āđāļāļĩāļĒāļāļāļĒāđāļēāļāđāļāļĩāļĒāļ§
2. āđāļĒāļāđāļŦāđāļāļāļ: āļāļēāļ Training vs Inference āđāļĄāđāļāļĨāđāļŦāļāđ
āđāļĄāļ·āđāļāļāļđāļāļāļķāļ âāļĢāļąāļāđāļĄāđāļāļĨāđāļŦāļāđâ āđāļāļāļēāļ Generative AI āđāļĢāļēāļĄāļąāļāļāļđāļāļāļķāļāļŠāļāļāļāļĢāļāļĩāļŦāļĨāļąāļ:
Training / Fine-tuning
- āđāļāļĢāļāđāļĄāđāļāļĨāđāļŦāļĄāđ āļŦāļĢāļ·āļāļāļĢāļąāļāļāļđāļāđāļĄāđāļāļĨāđāļŦāļāđāļāđāļ§āļĒāļāđāļāļĄāļđāļĨāļāļāļāļāļāļāđāļāļĢ
- āđāļāđāļāļĢāļąāļāļĒāļēāļāļĢāļŠāļđāļāļŠāļļāļ āļāļąāđāļ GPU, VRAM, RAM, Storage āđāļĨāļ° Network
- āļāđāļāļāļāļēāļĢ GPU āļāļĩāđāļĢāļāļāļĢāļąāļ Tensor Cores, VRAM āļŠāļđāļ, NVLink/NVSwitch āđāļāļ·āđāļāđāļŦāđāļāļģāļāļēāļāļĢāđāļ§āļĄāļāļąāļāđāļāđāđāļŦāļĄāļ·āļāļ âGPU āļĒāļąāļāļĐāđāđāļāđāļāļĩāļĒāļ§â
Inference (āļāļēāļĢāļĢāļąāļāđāļāđāļāļēāļāļāļĢāļīāļ)
- āđāļāđāđāļĄāđāļāļĨāļāļĩāđāđāļāļĢāļāđāļĨāđāļ§ āļĄāļēāļāļāļāļāļģāļāļēāļĄ āļŠāļĢāđāļēāļāļāđāļāļāļ§āļēāļĄ āļŠāļĢāđāļēāļāļ āļēāļ āļŊāļĨāļŊ
- āļĒāļąāļāļāđāļāļāļāļēāļĢ GPU āđāļĢāļ āđāļāđāđāļāļĒāļāļąāđāļ§āđāļāđāļāđāļāļĢāļąāļāļĒāļēāļāļĢāļāđāļāļĒāļāļ§āđāļē Training
- āļŠāļēāļĄāļēāļĢāļāļāļāļāđāļāļāđāļŦāđāđāļāđāļ Cluster āļŦāļĢāļ·āļāđāļāđ GPU āļŦāļĨāļēāļĒāđāļāđāļāļ·āđāļāļĢāļāļāļĢāļąāļāļāļđāđāđāļāđāļāļģāļāļ§āļāļĄāļēāļ
āļāļēāļĢāđāļĨāļ·āļāļ AI Server āļŠāļģāļŦāļĢāļąāļāļāļēāļ Generative AI āļāļķāļāļāļ§āļĢāļāļāļāļāļģāļāļēāļĄāđāļŦāđāļāļąāļ:
- āđāļāđāļ āđāļāļĢāļāđāļĄāđāļāļĨ āļŦāļĢāļ·āļāđāļāđāļ āļĢāļąāļāđāļāđāļāļēāļ (Inference)
- āļāļāļēāļāđāļĄāđāļāļĨāļāļĒāļđāđāļāļĩāđ āļāļĩāđ Billion Parameters (āđāļāđāļ 7B, 13B, 34B, 70B)
- āļāđāļāļāļāļēāļĢāļĢāļāļāļĢāļąāļāļāļđāđāđāļāđāļāļĢāđāļāļĄāļāļąāļāļĄāļēāļāļāđāļāļĒāđāļāđāđāļŦāļ
- āļāļāļāļĢāļ°āļĄāļēāļ āđāļĨāļ°āļĢāļ°āļĒāļ°āđāļ§āļĨāļēāļāļēāļĢāđāļāđāļāļēāļāļāđāļāđāļāļ·āđāļāļ (24/7 āļŦāļĢāļ·āļāđāļāđāļāļāđāļ§āļ āđ)
3. āļŠāđāļāļāļŦāļĨāļąāļāļāļĩāđāļāđāļāļāđāļāļāļąāļŠāđāļĄāļ·āđāļāđāļĨāļ·āļāļ AI Server āļŠāļģāļŦāļĢāļąāļāđāļĄāđāļāļĨāđāļŦāļāđ
3.1 CPU āļŠāļģāļŦāļĢāļąāļ AI Server
āđāļĄāđ GPU āļāļ°āđāļāđāļāļāļĢāļ°āđāļāļāļāļāļāļāļēāļ Generative AI āđāļāđ CPU āļāļĩāđāļāļĩ āļāđāļāļģāđāļāđāļāļŠāļģāļŦāļĢāļąāļāļāļēāļāļāļ·āđāļ āđ āđāļāđāļāļāļēāļĢāļāļąāļāļāļēāļĢ I/O, āļāļēāļĢāđāļŦāļĨāļāļāđāļāļĄāļđāļĨ, āļāļēāļĢāļāļĢāļ°āļŠāļēāļāļāļēāļāļāļąāļ GPU āđāļĨāļ°āļāļēāļĢāļĢāļąāļāļāļĢāļīāļāļēāļĢāļāđāļēāļ āđ āļāļāđāļāļīāļĢāđāļāđāļ§āļāļĢāđ
āđāļāļ§āļāļēāļāđāļĨāļ·āļāļ CPU āļŠāļģāļŦāļĢāļąāļ AI Server:
- āđāļĨāļ·āļāļ CPU āđāļāļ Multi-core / Multi-thread āđāļāđāļ 16â64 Core āļāļķāđāļāļāļąāļāļāļāļēāļāļāļēāļ
- āđāļāđ Server-grade CPU (āđāļāđāļ Intel Xeon, AMD EPYC) āđāļāļ·āđāļāļĢāļāļāļĢāļąāļāļāļēāļāļāđāļāđāļāļ·āđāļāļ 24/7
- āđāļ AI Server āļĢāļ°āļāļąāļ Enterprise āļĄāļąāļāđāļāđ CPU 2 Socket āđāļāđāļ Dell PowerEdge XE7740 āļāļĩāđāļĢāļāļāļĢāļąāļ Intel Xeon 6 āļŠāļđāļāļŠāļļāļ 86 cores/CPU āļĢāļ§āļĄāđāļāđāļŦāļĨāļēāļĒāļĢāđāļāļĒāļāļāļĢāđāđāļāđāļāļĢāļ·āđāļāļāđāļāļĩāļĒāļ§
CPU āļāļĩāđāļāļāļāđāļāļāļĄāļēāļāļĩāļāđāļ§āļĒāđāļŦāđ:
- āļāļēāļĢāđāļāļĢāļĩāļĒāļĄāļāđāļāļĄāļđāļĨ (Data Pipeline) āđāļĄāđāļāļāļāļ§āļ
- āļāļēāļĢāļāļąāļāļāļēāļĢāļāļēāļāđāļāļ·āđāļāļāļŦāļĨāļąāļ āđāļāđāļ Logging, Monitoring, API Server āļāļģāļāļēāļāļĨāļ·āđāļ
- āļŠāļēāļĄāļēāļĢāļāđāļāđāļāļĢāļ°āđāļĒāļāļāđāļāļēāļ HPC āđāļĨāļ° AI Framework āđāļāđāđāļāđāļĄāļāļĢāļ°āļŠāļīāļāļāļīāļ āļēāļ
3.2 GPU āđāļĨāļ° VRAM: āļŦāļąāļ§āđāļāļāļāļāļāļēāļ Generative AI
GPU + VRAM āļāļ·āļāļāļāļāđāļāļĢāļ°āļāļāļāļŠāļģāļāļąāļāļāļĩāđāļŠāļļāļāđāļāļāļēāļĢāļĢāļąāļāđāļĄāđāļāļĨāđāļŦāļāđ:
- āļŠāļģāļŦāļĢāļąāļ Training āđāļĄāđāļāļĨāļāļāļēāļāđāļŦāļāđ āļāđāļāļāļāļēāļĢ GPU āļāļĩāđāļĄāļĩ Tensor Cores, VRAM āļŠāļđāļ āđāļĨāļ°āļĢāļāļāļĢāļąāļ NVLink/NVSwitch āđāļāļ·āđāļāđāļāļ·āđāļāļĄ GPU āļŦāļĨāļēāļĒāđāļāđāļŦāđāļāļģāļāļēāļāļĢāđāļ§āļĄāļāļąāļāđāļŦāļĄāļ·āļāļ GPU āđāļāļĩāļĒāļ§
- āļŠāļģāļŦāļĢāļąāļ Inference āđāļĄāđāļāļĨāđāļŦāļāđ āļāļģāļāļ§āļāļāļđāđāđāļāđāļĄāļēāļ āđ āļāđāļĒāļąāļāļāđāļāļāļāļēāļĢ GPU āļŦāļĨāļēāļĒāđāļ āđāļāļ·āđāļāđāļāđāļāđāļŦāļĨāļāđāļĨāļ°āļĨāļ Latency
āđāļāļ§āļāļēāļāđāļāļ·āđāļāļāļāđāļāļāļĩāđāļĄāļąāļāđāļāđāđāļāđāļ§āļāļ§āļ LLM:
- āđāļĄāđāļāļĨāļĢāļ°āļāļąāļ 7B (āđāļāđāļ LLaMA-3 7B āļŦāļĢāļ·āļāđāļāļĩāļĒāļāđāļāđāļē)
- āļŠāļēāļĄāļēāļĢāļāļĢāļąāļāđāļāđāļāđāļ§āļĒ GPU VRAM āļāļĢāļ°āļĄāļēāļ 8â16GB āļŦāļēāļāđāļāđāđāļāļāļāļīāļ Quantization (āđāļāđāļ 4-bit)
- āđāļĄāđāļāļĨ 13B
- āđāļāđ GPU āđāļāđāļ RTX 3070 + RAM āļĢāļ°āļāļ 64GB āļŠāļēāļĄāļēāļĢāļāļĢāļąāļāđāļāđāļāļĩāđ 6.5 tokens/second āļŠāļģāļŦāļĢāļąāļ context āļŠāļąāđāļ
- āđāļĄāđāļāļĨ Llama 2 70B āđāļĨāļ°āļāļĨāļļāđāļĄāđāļĄāđāļāļĨāļāļāļēāļāđāļŦāļāđāļĄāļēāļ
- āļĄāļĩāļāļēāļĢāđāļāđāļāļēāļāļāļĢāļīāļāļāļĩāđāđāļāđ GPU āļĢāļ°āļāļąāļ RTX 3090 āļāļģāļāļ§āļ 2 āđāļ āļŦāļĢāļ·āļ A6000 āđāļāđāļāļāļąāđāļāļāđāļģāļŠāļģāļŦāļĢāļąāļāļāļēāļĢāļĢāļąāļāđāļĄāđāļāļĨ 70B āļāļĩāđ 4-bit GPTQ
- āđāļāđāļĨāļ Enterprise āļĄāļąāļāļĒāđāļēāļĒāđāļāđāļāđ GPU Data Center āđāļāđāļ NVIDIA H100, A100 āļāļĢāđāļāļĄ VRAM āļŠāļđāļ 80â96GB āđāļĨāļ°āđāļāļ·āđāļāļĄāļāđāļāļāđāļ§āļĒ NVLink/NVSwitch āđāļāļ·āđāļāļĢāļāļāļĢāļąāļ Training āđāļĨāļ° Inference āļĢāļ°āļāļąāļ Production
āļāļāļāļ§āļēāļĄāļāļāļ droneth.or.th āļĢāļ°āļāļļāļ§āđāļē Consumer GPU āļāļĩāđāļĄāļĩ VRAM 24GB āļĄāļąāļāđāļĄāđāļāļāļŠāļģāļŦāļĢāļąāļāđāļĄāđāļāļĨāļ āļēāļĐāļēāļāļāļēāļāđāļŦāļāđāļāļĒāđāļēāļ Llama-3-70B āđāļāđāļŦāļĄāļāļāļāļāļī āļāļķāļāļāđāļāļāđāļĨāļ·āļāļāđāļāđ Enterprise GPU āļāļĩāđāļĄāļĩ VRAM 48GB āļāļķāđāļāđāļ āđāļĨāļ°āđāļāļ·āđāļāļĄ GPU āļŦāļĨāļēāļĒāđāļāļāđāļ§āļĒ NVLink/NVSwitch āļŠāļģāļŦāļĢāļąāļāļāļēāļāļĢāļ°āļāļąāļāļāļąāđāļ
āļŠāļģāļŦāļĢāļąāļāļĨāļđāļāļāđāļēāļāļāļāđāļāļĢāļāļāļ 2beshop.com āđāļĄāļ·āđāļāļ§āļēāļāđāļāļāđāļĨāļ·āļāļ GPU Server āļŠāļģāļŦāļĢāļąāļ Generative AI āļāļ§āļĢāļāļīāļāļēāļĢāļāļē:
- āļāļģāļāļ§āļ CUDA Cores / Tensor Cores
- āļāļāļēāļ VRAM āļāđāļāđāļ āđāļĨāļ°āļĒāļāļāļĢāļ§āļĄ VRAM āļāļāļāļāļļāļ GPU
- āļāļēāļĢāļĢāļāļāļĢāļąāļ Framework āđāļāđāļ PyTorch, TensorFlow, CUDA, cuDNN
- āļāļēāļĢāļĢāļāļāļĢāļąāļ NVLink / NVSwitch āđāļāļāļĢāļāļĩāđāļāđ GPU āļŦāļĨāļēāļĒāđāļāļŠāļģāļŦāļĢāļąāļāđāļĄāđāļāļĨāđāļŦāļāđ
3.3 RAM āļĢāļ°āļāļ (System Memory)
āļŠāļģāļŦāļĢāļąāļāļāļēāļ Generative AI āļāļĩāđāļĢāļąāļāđāļĄāđāļāļĨāđāļŦāļāđ RAM āļĄāļĩāļāļĨāļāđāļ:
- āļāļēāļĢāđāļŦāļĨāļāļāļļāļāļāđāļāļĄāļđāļĨāļāļāļēāļāđāļŦāļāđ
- āļāļēāļĢāļāļąāļāļāļēāļĢ Batch āļāļāļ°āđāļāļĢāļ
- āļāļēāļĢāļĢāļąāļāļāļĢāļīāļāļēāļĢāļāļ·āđāļāļāļāđāļāļīāļĢāđāļāđāļ§āļāļĢāđ āđāļāđāļ web server, database, monitoring.
āđāļāļ§āļāļēāļāđāļĨāļ·āļāļ RAM:
- āđāļ§āļīāļĢāđāļāļŠāđāļāļāļąāļ AI āļĄāļąāļāđāļĢāļīāđāļĄāļāđāļāļāļĩāđ 32â128GB āļāļķāđāļāđāļ āđāļĨāđāļ§āđāļāđāļāļāļēāļāļāļēāļ
- AI Server āļĢāļ°āļāļąāļ Enterprise āļāļēāļāļĢāļāļāļĢāļąāļāđāļāđāļāļķāļ 3TB RAM āđāļāđāļ Dell PowerEdge XE7740
- āļŠāļģāļŦāļĢāļąāļāļāļēāļĢāļĢāļąāļ LLM 13B āļāļĒāđāļēāļāļāļĢāļīāļāļāļąāļ āļĄāļĩāđāļāļ°āļāļģāđāļŦāđāđāļāđ RAM āļāļĒāđāļēāļāļāđāļāļĒ 64GB āđāļāļ·āđāļāđāļĄāđāđāļŦāđāļĢāļ°āļāļāļāļāļāļ§āļ
āļāļāđāļāļīāļĢāđāļāđāļ§āļāļĢāđ AI āļāļāļāļāļāļāđāļāļĢ āđāļāļ°āļāļģāđāļŦāđ âāđāļāļ·āđāļ RAM āļĄāļēāļāļāļ§āđāļēāđāļāļīāļĢāđāļāđāļ§āļāļĢāđāļāļąāđāļ§āđāļâ āđāļāļĢāļēāļ°āđāļŦāļĨāļāļāļēāļ AI āļĄāļĩāļāļ§āļēāļĄāļāļąāļāļāļ§āļāđāļĨāļ°āļāļēāļāļāđāļāļāļĢāļāļāļĢāļąāļāļāļđāđāđāļāđāļāļĢāđāļāļĄāļāļąāļāļŦāļĨāļēāļĒāļĢāļēāļĒ
3.4 Storage āđāļĨāļ°āđāļāļĢāļāļŠāļĢāđāļēāļāļāđāļāļĄāļđāļĨ
āļāļēāļ Generative AI āđāļāđāļāđāļāļĄāļđāļĨāļāļģāļāļ§āļāļĄāļēāļ āļāļąāđāļ Dataset, Model Checkpoint, Log āđāļĨāļ°āļāđāļāļĄāļđāļĨāļāļđāđāđāļāđ āļāļķāļāļāđāļāļāļāļāļāđāļāļ Storage āļāļĒāđāļēāļāļĢāļ°āļĄāļąāļāļĢāļ°āļ§āļąāļ
āđāļāļ§āļāļēāļāļāļąāļ Storage:
- āđāļĒāļāļāļīāļŠāļāđāļŠāļģāļŦāļĢāļąāļ
- āļĢāļ°āļāļāļāļāļīāļāļąāļāļīāļāļēāļĢ + āļāļāļāļāđāđāļ§āļĢāđ AI â āđāļāđ SSD/NVMe āđāļāļ·āđāļāļāļ§āļēāļĄāđāļĢāđāļ§
- āđāļāđāļāļāđāļāļĄāļđāļĨāļāļīāļ, Dataset, Log, Model â āđāļāđ HDD āļŦāļĢāļ·āļ Storage āļāļ§āļēāļĄāļāļļāļŠāļđāļ āđāļāđāļ NAS/SAN āļŦāļĢāļ·āļ Object Storage
- āļāļīāļāļēāļĢāļāļē
- āļāļ§āļēāļĄāļāļļāļĢāļ§āļĄ (āļĢāļāļāļĢāļąāļāļāļēāļĢāđāļāļīāļāđāļ)
- āļāļ§āļēāļĄāđāļĢāđāļ§āļāđāļēāļ/āđāļāļĩāļĒāļ (IOPS, Throughput)
- RAID āļŦāļĢāļ·āļāļĢāļ°āļāļāļŠāļģāļĢāļāļāļāđāļāļĄāļđāļĨāđāļāļ·āđāļāļāļ§āļēāļĄāļāļĨāļāļāļ āļąāļĒāđāļĨāļ° Compliance
āļāļąāļ§āļāļĒāđāļēāļ AI Server āļĢāļ°āļāļąāļāļŠāļđāļ āđāļāđāļ PowerEdge XE7740 āļŠāļēāļĄāļēāļĢāļāļĢāļāļāļĢāļąāļ NVMe āđāļāđāļŠāļđāļāļŠāļļāļ 122.88TB āđāļāļ·āđāļāļĢāļāļāļĢāļąāļāļāļēāļ AI, Data Analytics āđāļĨāļ° HPC āļāļāļēāļāđāļŦāļāđ
3.5 Network āđāļĨāļ°āļāļēāļĢāđāļāļ·āđāļāļĄāļāđāļ
āđāļĄāļ·āđāļāđāļĄāđāļāļĨāđāļŦāļāđāļĢāļąāļāđāļāļāļāļāđāļāļĢ āļāļēāļĢāđāļāļ·āđāļāļĄāļāđāļ Network āļĄāļĩāļāļĨāļāđāļāļāļąāđāļ Performance āđāļĨāļ°āļāļ§āļēāļĄāļāļĨāļāļāļ āļąāļĒ:
- āļāļēāļāļāļĩāđāļĢāļąāļāļāļ Cloud āļŦāļĢāļ·āļāļĢāļąāļāļāđāļāļĄāļđāļĨāļāļēāļāļŦāļĨāļēāļĒāļŠāļēāļāļē āļāđāļāļāļĄāļĩ Bandwidth āđāļāļĩāļĒāļāļāļ āļĢāļ§āļĄāļāļķāļāļĢāļ°āļāļ VPN / Secure Access āļŠāļģāļŦāļĢāļąāļāđāļāđāļēāļāļķāļ AI Server āļāļēāļāļ āļēāļĒāļāļāļ
- āļāļāļāđāļāļĢāļāļāļēāļāļāļĨāļēāļâāđāļŦāļāđāļāļ§āļĢāđāļāđ Switch āļĢāļ°āļāļąāļ Enterprise āđāļāļ·āđāļāļĢāļāļāļĢāļąāļāļāļēāļĢāđāļāļīāļāđāļ āđāļĨāļ°āļāļēāļĢāđāļāļ·āđāļāļĄāļāđāļāļāļąāļ GPU Server āļŦāļĨāļēāļĒāđāļāļĢāļ·āđāļāļāđāļāđāļ Cluster
- āļ āļēāļĒāđāļ AI Infrastructure āļĄāļąāļāđāļāđāđāļāļĢāļ·āļāļāđāļēāļĒāļāļ§āļēāļĄāđāļĢāđāļ§āļŠāļđāļ āđāļāđāļ 25/40/100GbE āļŦāļĢāļ·āļ InfiniBand āļŠāļģāļŦāļĢāļąāļāļāļēāļĢāđāļāļ·āđāļāļĄāļāđāļāļĢāļ°āļŦāļ§āđāļēāļ Node āđāļĨāļ° Storage
4. āļāļąāļ§āļāļĒāđāļēāļāļŠāđāļāļ AI Server āļŠāļģāļŦāļĢāļąāļāđāļĄāđāļāļĨāļāļāļēāļāļāđāļēāļ āđ
āļāđāļēāļāļĨāđāļēāļāļāļĩāđāļāļ·āļāđāļāļ§āļāļīāļāđāļāļāļēāļĢāļāļąāļāļŠāđāļāļ AI Server āļŠāļģāļŦāļĢāļąāļāļāļēāļ Generative AI āļāļēāļĄāļāļāļēāļāđāļĄāđāļāļĨ (āđāļāđāļāđāļāļ§āļāļēāļāđāļāļīāļāļ āļēāļāļĢāļ§āļĄ āļāļāļāđāļāļĢāļŠāļēāļĄāļēāļĢāļāļāļĢāļąāļāļāļēāļĄāļāļ§āļēāļĄāļāđāļāļāļāļēāļĢāļāļĢāļīāļ):
4.1 āđāļĄāđāļāļĨ 7Bâ13B (āđāļĢāļīāđāļĄāļāđāļ Generative AI āļ āļēāļĒāđāļāļāļāļāđāļāļĢ)
āđāļŦāļĄāļēāļ°āļŠāļģāļŦāļĢāļąāļāļāļāļāđāļāļĢāļāļĩāđāļāđāļāļāļāļēāļĢ:
- āļāļāļĨāļāļāđāļāđ LLM āļ āļēāļĒāđāļ
- āļāļąāļāļāļē Chatbot āļ āļēāļĒāđāļāļāļāļāđāļāļĢ
- Fine-tune āđāļĄāđāļāļĨāļāđāļ§āļĒāļāđāļāļĄāļđāļĨāđāļāļāļēāļ°āļāļāļāļāļĢāļīāļĐāļąāļāđāļāļĢāļ°āļāļąāļāđāļāļ·āđāļāļāļāđāļ
āđāļāļ§āļāļēāļāļŠāđāļāļ:
- CPU: Server-grade 16â32 Core (Intel Xeon āļŦāļĢāļ·āļ AMD EPYC)
- GPU:
- 1â2 āđāļāļĢāļ°āļāļąāļ RTX A-series āļŦāļĢāļ·āļ Data Center GPU (A-series/H-series)
- VRAM āļāđāļāđāļ 24â48GB (āļĢāļāļāļĢāļąāļāđāļĄāđāļāļĨ 13B āļāļĩāđ 4-bit āļŦāļĢāļ·āļ 7B āđāļāļāļāļ§āļēāļĄāđāļĄāđāļāļĒāļģāļŠāļđāļāļāļķāđāļ)
- RAM āļĢāļ°āļāļ: āđāļĢāļīāđāļĄāļāđāļ 64â128GB āđāļāļ·āđāļāļĢāļāļāļĢāļąāļāļāļēāļāđāļāļĢāļ/Inference āđāļĨāļ°āļāļĢāļīāļāļēāļĢāļāļ·āđāļ āđ
- Storage:
- NVMe SSD 1â2TB āļŠāļģāļŦāļĢāļąāļāļĢāļ°āļāļāđāļĨāļ°āļāļāļāļāđāđāļ§āļĢāđ AI
- HDD / SSD āđāļāļīāđāļĄāđāļāļīāļĄāļŠāļģāļŦāļĢāļąāļ Dataset 4â8TB āļāļķāđāļāđāļ
- Network: 10â25GbE āļāļķāđāļāđāļ āļŦāļēāļāļāđāļāļāđāļāļĢāđāđāļĄāđāļāļĨāđāļŦāđāļāļđāđāđāļāđāļŦāļĨāļēāļĒāļāļāđāļāļāļāļāđāļāļĢ
4.2 āđāļĄāđāļāļĨ 34Bâ70B āđāļĨāļ°āđāļĄāđāļāļĨāļĢāļ°āļāļąāļ Enterprise
āđāļŦāļĄāļēāļ°āļŠāļģāļŦāļĢāļąāļāļāļāļāđāļāļĢāļāļĩāđāļāđāļāļāļāļēāļĢ:
- āļĢāļąāļāđāļĄāđāļāļĨāđāļŦāļāđāļĢāļ°āļāļąāļ Enterprise (āđāļāđāļ LLM 70B āļāļķāđāļāđāļ)
- āđāļāļĢāļ/āđāļāļāđāļāļđāļāđāļĄāđāļāļĨāļāđāļ§āļĒ Dataset āļāļāļēāļāđāļŦāļāđ
- āļāļģ Generative AI āđāļāđāļāļāļĢāļīāļāļēāļĢāļŦāļĨāļąāļāļāļāļāļāļāļāđāļāļĢāļŦāļĢāļ·āļāļāļĨāļīāļāļ āļąāļāļāđ
āđāļāļ§āļāļēāļāļŠāđāļāļ:
- CPU: Dual Socket Server-grade (āđāļāđāļ 2x Intel Xeon 6 āļŠāļđāļāļŠāļļāļ 86 cores/CPU)
- GPU:
- 4â8 āđāļāļĢāļ°āļāļąāļ Data Center GPU āđāļāđāļ NVIDIA A100/H100
- VRAM āļāđāļāđāļ 80â96GB
- āļĢāļāļāļĢāļąāļ NVLink / NVSwitch āđāļāļ·āđāļāđāļŦāđāļĢāļ°āļāļāļĄāļāļāđāļŦāđāļāđāļāđāļ GPU āļāļāļēāļāđāļŦāļāđāđāļāđāļāļĩāļĒāļ§ āđāļĨāļ°āļĢāļāļāļĢāļąāļ Training āđāļĄāđāļāļĨāļĢāļ°āļāļąāļ 70B+ āđāļāđāļāļĩ
- RAM āļĢāļ°āļāļ: 256GBâ1TB āļŦāļĢāļ·āļāļĄāļēāļāļāļ§āđāļē āļāļķāđāļāļāļąāļāļāļāļēāļ Dataset āđāļĨāļ°āļāļēāļāđāļāļĢāļ
- Storage:
- NVMe āļŦāļĨāļēāļĒāļĨāļđāļāļāļ§āļēāļĄāļāļļāļĢāļ§āļĄ 10â100TB āļŠāļģāļŦāļĢāļąāļ Model Checkpoint, Log āđāļĨāļ° Working Dataset
- āđāļāļ·āđāļāļĄāļāđāļāļāļąāļ Data Lake / Storage āļ āļēāļĒāļāļāļāļĢāļ°āļāļąāļ Petabyte āļŦāļēāļāļĄāļĩāļāļēāļĢāđāļāļĢāļāđāļĄāđāļāļĨāđāļŦāļāđ[3][4].
- Network: 25â100GbE āļŦāļĢāļ·āļ InfiniBand āļŠāļģāļŦāļĢāļąāļāļāļēāļĢāđāļāļ·āđāļāļĄāļāđāļāļĢāļ°āļŦāļ§āđāļēāļ Node āđāļĨāļ° Storage āđāļāļ·āđāļāļĢāļāļāļĢāļąāļ HPC / AI Cluster
āļāļąāļ§āļāļĒāđāļēāļāļāļĢāļīāļāđāļāđāļ Dell PowerEdge XE7740 āļāļĩāđāļāļđāļāļāļāļāđāļāļāļĄāļēāđāļāđāļ 4U Rack Server āļŠāļģāļŦāļĢāļąāļ AI āđāļāļĒāđāļāļāļēāļ° āļĢāļāļāļĢāļąāļ GPU āļŠāļđāļāļŠāļļāļ 16 āļāļąāļ§ āđāļĨāļ° RAM āļŠāļđāļāļŠāļļāļ 3TB āđāļŦāļĄāļēāļ°āļāļąāļāļāļēāļ AI, Data Analytics āđāļĨāļ° HPC āļāļāļēāļāđāļŦāļāđ
5. āđāļĨāļ·āļāļ AI Server āđāļŦāđāļāļĢāļāļāļēāļāđāļĨāļ°āļāļāļāļĢāļ°āļĄāļēāļāļāļāļāļāļāļāđāļāļĢ
āđāļĄāļ·āđāļāļāļāļāđāļāļĢāļāļģāļĨāļąāļāļāļąāļāļŠāļīāļāđāļāđāļĨāļ·āļāļ AI Server āļŠāļģāļŦāļĢāļąāļāļāļēāļ Generative AI āļāļ§āļĢāļāļģāļāļēāļĄāļāļąāđāļāļāļāļāļāđāļāđāļāļāļĩāđ:
āļ§āļīāđāļāļĢāļēāļ°āļŦāđāđāļāđāļēāļŦāļĄāļēāļĒāļāļēāļĢāđāļāđ AI āđāļŦāđāļāļąāļāđāļāļ
- āđāļāđ Generative AI āđāļāļ·āđāļāļāļ°āđāļĢ? Chatbot, Content Generation, Code Assistant, āļŦāļĢāļ·āļ Image/Video Generation
- āļāđāļāļāļāļēāļĢāđāļāļĢāļāđāļĄāđāļāļĨāđāļāļ āļŦāļĢāļ·āļāđāļāđāđāļĄāđāļāļĨāļŠāļģāđāļĢāđāļāļĢāļđāļāđāļĨāđāļ§āļāļģ Fine-tune
āļāļģāļŦāļāļāļāļĢāļ°āđāļ āļāļāļēāļāļŦāļĨāļąāļ
- āđāļāđāļ Training/Fine-tuning â āđāļŦāđāļāđāļģāļŦāļāļąāļāđāļāļāļĩāđ GPU, VRAM, NVLink, RAM āđāļĨāļ° Storage
- āđāļāđāļ Inference/āļāļĢāļīāļāļēāļĢāļāļđāđāđāļāđāļāļģāļāļ§āļāļĄāļēāļ â āđāļŦāđāļāđāļģāļŦāļāļąāļāđāļāļāļĩāđ GPU āļŦāļĨāļēāļĒāđāļ, Network āđāļĨāļ°āļāļēāļĢāļāļāļāđāļāļāļĢāļ°āļāļāđāļŦāđ Scale-out āđāļāđ
āļ§āļēāļāļŠāđāļāļāđāļŦāđāļĢāļāļāļĢāļąāļāļāļąāđāļāļāļąāļāļāļļāļāļąāļāđāļĨāļ°āļāļāļēāļāļ
- āđāļĨāļ·āļāļāđāļāļĢāļ·āđāļāļāļāļĩāđāļŠāļēāļĄāļēāļĢāļ āļāļąāļāđāļāļĢāļāđāļāļīāđāļĄ GPU, RAM, Storage āđāļāđāđāļāļāļāļēāļāļ
- āļ§āļēāļāđāļāļāđāļĢāļ·āđāļāļ āđāļāļāđāļēāđāļĨāļ°āļĢāļ°āļāļāļĢāļ°āļāļēāļĒāļāļ§āļēāļĄāļĢāđāļāļ āđāļāđāļ āļāļđāđāđāļĢāđāļ, āļŦāđāļāļāđāļāļīāļĢāđāļāđāļ§āļāļĢāđ, UPS āđāļŦāđāļĢāļāļāļĢāļąāļāđāļŦāļĨāļāļāļāļ GPU Server
- āļāļīāļāļēāļĢāļāļēāđāļāļĢāļāļŠāļĢāđāļēāļ AI Infrastructure āļāļąāđāļāļĢāļ°āļāļ āđāļāđāļ HPC, Data Lake, Network, Security & Compliance
āđāļāļĢāļĩāļĒāļāđāļāļĩāļĒāļāļāļēāļāđāļĨāļ·āļāļ On-premise vs Cloud
- Cloud āđāļŦāļĄāļēāļ°āļāļąāļāļāļēāļĢāļāļāļĨāļāļāđāļĢāđāļ§ āđ āļŦāļĢāļ·āļāđāļŦāļĨāļāļāļēāļāļāļĩāđāđāļāļĨāļĩāđāļĒāļāđāļāļĨāļāļāļĨāļāļ
- On-premise AI Server āđāļŦāļĄāļēāļ°āļāļąāļāļāļēāļĢāļāļļāļĄ Data, āļĨāļāļāđāļēāđāļāđāļāđāļēāļĒāļĢāļ°āļĒāļ°āļĒāļēāļ§ āđāļĨāļ°āļāļģāļāļēāļāļāđāļāđāļāļ·āđāļāļ 24/7 āđāļāļāļāļāđāļāļĢ
6. āļāļāļŠāļĢāļļāļ āđāļĨāļ° Call-to-Action (CTA)
āļāļēāļĢāđāļĨāļ·āļāļ āļŠāđāļāļ AI Server āļŠāļģāļŦāļĢāļąāļāļāļēāļ Generative AI āđāļāļ·āđāļāđāļŦāđāļĢāļąāļāđāļĄāđāļāļĨāđāļŦāļāđāđāļāđāļāļĩ āđāļĄāđāđāļāđāļĄāļĩāļāļģāļāļāļāđāļāļĩāļĒāļ§ āđāļāđāļāļķāđāļāļāļĒāļđāđāļāļąāļ:
- āļāļāļēāļāđāļĄāđāļāļĨ (7B, 13B, 34B, 70B āļŦāļĢāļ·āļāđāļŦāļāđāļāļ§āđāļēāļāļąāđāļ)
- āļĨāļąāļāļĐāļāļ°āļāļēāļ (Training / Inference / Hybrid)
- āļāļĢāļīāļĄāļēāļāļāļđāđāđāļāđ āđāļĨāļ°āđāļŦāļĨāļāļāļēāļāļāļĢāļīāļ
- āļāļāļāļĢāļ°āļĄāļēāļ āđāļĨāļ°āđāļāļāļāļēāļĢāđāļāļīāļāđāļāļāļāļāđāļāļĢāļāļāļēāļĢ AI āđāļāļāļāļāđāļāļĢ
āđāļāļĒāļŠāļĢāļļāļ āļŦāļēāļāļāļļāļāļāđāļāļāļāļēāļĢāļĢāļąāļāđāļĄāđāļāļĨāđāļŦāļāđāđāļāļāļāļāđāļāļĢāļāļĒāđāļēāļāļĄāļĩāļāļĢāļ°āļŠāļīāļāļāļīāļ āļēāļ:
- āđāļĨāļ·āļāļ GPU Server / AI Server āļāļĩāđāļĄāļĩ GPU āļĢāļ°āļāļąāļāļāļāļāđāļāļĢ, VRAM āļŠāļđāļ, āļĢāļāļāļĢāļąāļ NVLink/NVSwitch āļŠāļģāļŦāļĢāļąāļāļāļēāļāđāļĄāđāļāļĨāđāļŦāļāđ
- āđāļāđ CPU Server-grade, RAM āđāļāļ·āđāļāļŠāļđāļ āđāļĨāļ° Storage āļāļĩāđāļāļāļāđāļāļāđāļĒāļ OS/Software āļāļąāļ Dataset āļāļĒāđāļēāļāļāļąāļāđāļāļ
- āļ§āļēāļāđāļāļ Network āđāļĨāļ° Infrastructure āđāļŦāđāļĢāļāļāļĢāļąāļāļāļēāļĢāļāļĒāļēāļĒāđāļāļāļāļēāļāļ āđāļāļĒāļĄāļāļāļāļąāđāļāđāļĢāļ·āđāļāļ Performance āđāļĨāļ° Security
āļŦāļēāļāļāļļāļāļĒāļąāļāđāļĄāđāđāļāđāđāļāļ§āđāļēāļāļ°āđāļĢāļīāđāļĄāļāđāļāļāļĒāđāļēāļāđāļĢ āļŦāļĢāļ·āļāļŠāđāļāļāđāļāļāđāļŦāļāđāļŦāļĄāļēāļ°āļāļąāļāļāļēāļ Generative AI āđāļāļāļāļāđāļāļĢāļāļāļāļāļļāļ āļāļĩāļĄāļāļēāļ 2beshop āļŠāļēāļĄāļēāļĢāļāļāđāļ§āļĒāļ§āļīāđāļāļĢāļēāļ°āļŦāđāļāļēāļ āļāļāļāđāļāļāļŠāđāļāļ AI Server / GPU Server āđāļĨāļ°āđāļāļ°āļāļģāđāļāļĨāļđāļāļąāļāļāļĩāđāđāļŦāļĄāļēāļ°āļāļąāđāļāļāđāļēāļāļāļĢāļ°āļŠāļīāļāļāļīāļ āļēāļāđāļĨāļ°āļāļāļāļĢāļ°āļĄāļēāļāđāļāđ āļāļļāļāļŠāļēāļĄāļēāļĢāļāļāļģāļāđāļāļĄāļđāļĨāđāļāļāļāļāļ§āļēāļĄāļāļĩāđāđāļāļāļļāļĒāļāļąāļāļāļĩāļĄ IT āļŦāļĢāļ·āļāļāļĢāļķāļāļĐāļēāļāļđāđāđāļāļĩāđāļĒāļ§āļāļēāļāļāļāļ 2beshop āđāļāļ·āđāļāļāļąāļāļŠāđāļāļāļāļĩāđāļāļĢāđāļāļĄāļĢāļąāļāđāļĄāđāļāļĨāđāļŦāļāđāđāļāđāļāļāļāļĩāđāļāļāļāđāļāļāļĒāđāļāļļāļĢāļāļīāļāļāļāļāļāļļāļāļĄāļēāļāļāļĩāđāļŠāļļāļ
āļāļīāļāļāđāļāđāļĢāļēāļāđāļēāļāđāļ§āđāļāđāļāļāđāđāļĨāļ°āļŠāļāļāļāļēāļĄāļŠāļīāļāļāđāļēāđāļāđāđāļĨāļĒ
- āļŠāļāđāļāļŠāļāļāļāļēāļĄāđāļĨāļ°āļāļ·āđāļ Server  āļāļĨāļīāļāđāļĨāļĒ
- āļāļ·āđāļāļŠāļīāļāļāđāļēāļāđāļēāļ Application āļĢāļąāļāļŠāđāļ§āļāļĨāļāđāļāļīāđāļĄÂ āļāļĨāļīāļāđāļĨāļĒ
- LINE: @2beshop
- āđāļāļĢ 02-1186767