āļŠāđ€āļ›āļ AI Server āļŠāļģāļŦāļĢāļąāļš Generative AI āđāļĨāļ° Large Language Model āđ€āļĨāļ·āļ­āļāļ­āļĒāđˆāļēāļ‡āđ„āļĢāđƒāļŦāđ‰āđ€āļŦāļĄāļēāļ°āļāļąāļšāļ˜āļļāļĢāļāļīāļˆ

āļ›āļąāļˆāļˆāļļāļšāļąāļ™ Generative AI āđāļĨāļ° Large Language Model āļŦāļĢāļ·āļ­ LLM āđ€āļ‚āđ‰āļēāļĄāļēāļĄāļĩāļšāļ—āļšāļēāļ—āđƒāļ™āļ­āļ‡āļ„āđŒāļāļĢāļ­āļĒāđˆāļēāļ‡āļĢāļ§āļ”āđ€āļĢāđ‡āļ§ āļ•āļąāđ‰āļ‡āđāļ•āđˆāđāļŠāļ•āļšāļ­āļ•āļ•āļ­āļšāļ„āļģāļ–āļēāļĄāļĨāļđāļāļ„āđ‰āļē āļĢāļ°āļšāļšāļŠāļĢāļļāļ›āđ€āļ­āļāļŠāļēāļĢ āļāļēāļĢāļ§āļīāđ€āļ„āļĢāļēāļ°āļŦāđŒāļ‚āđ‰āļ­āļĄāļđāļĨ āđ„āļ›āļˆāļ™āļ–āļķāļ‡āļāļēāļĢāļŠāļĢāđ‰āļēāļ‡āđ€āļ™āļ·āđ‰āļ­āļŦāļēāļ­āļąāļ•āđ‚āļ™āļĄāļąāļ•āļī āđāļ•āđˆāļāļēāļĢāđ€āļĨāļ·āļ­āļ AI Server āļŠāļģāļŦāļĢāļąāļš Generative AI āđ„āļĄāđˆāļ„āļ§āļĢāļžāļīāļˆāļēāļĢāļ“āļēāļˆāļēāļāļˆāļģāļ™āļ§āļ™ GPU āđ€āļžāļĩāļĒāļ‡āļ­āļĒāđˆāļēāļ‡āđ€āļ”āļĩāļĒāļ§ āđ€āļžāļĢāļēāļ°āļ›āļĢāļ°āļŠāļīāļ—āļ˜āļīāļ āļēāļžāļˆāļĢāļīāļ‡āļĒāļąāļ‡āļ‚āļķāđ‰āļ™āļ­āļĒāļđāđˆāļāļąāļšāļ‚āļ™āļēāļ”āđ‚āļĄāđ€āļ”āļĨ āļˆāļģāļ™āļ§āļ™āļœāļđāđ‰āđƒāļŠāđ‰āļ‡āļēāļ™ āļ„āļ§āļēāļĄāļĒāļēāļ§āļ‚āļ­āļ‡ Context āļ„āļ§āļēāļĄāđ€āļĢāđ‡āļ§āđƒāļ™āļāļēāļĢāļ•āļ­āļšāļŠāļ™āļ­āļ‡ āđāļĨāļ°āļĨāļąāļāļĐāļ“āļ°āļ‡āļēāļ™āļ§āđˆāļēāđ€āļ›āđ‡āļ™āļāļēāļĢāļāļķāļāđ‚āļĄāđ€āļ”āļĨāļŦāļĢāļ·āļ­āļāļēāļĢāļ™āļģāđ‚āļĄāđ€āļ”āļĨāđ„āļ›āđƒāļŠāđ‰āļ‡āļēāļ™āļˆāļĢāļīāļ‡

āļšāļ—āļ„āļ§āļēāļĄāļ™āļĩāđ‰āļˆāļ°āđāļ™āļ°āļ™āļģāļŠāđ€āļ›āļ AI Server āļŠāļģāļŦāļĢāļąāļš LLM āļ•āļąāđ‰āļ‡āđāļ•āđˆāļĢāļ°āļ”āļąāļšāđ€āļĢāļīāđˆāļĄāļ•āđ‰āļ™āļˆāļ™āļ–āļķāļ‡āļĢāļ°āļšāļšāļ›āļĢāļ°āļŠāļīāļ—āļ˜āļīāļ āļēāļžāļŠāļđāļ‡ āļžāļĢāđ‰āļ­āļĄāđāļ™āļ§āļ—āļēāļ‡āđ€āļĨāļ·āļ­āļ GPU, CPU, RAM, Storage āđāļĨāļ°āđ€āļ„āļĢāļ·āļ­āļ‚āđˆāļēāļĒāđƒāļŦāđ‰āđ€āļŦāļĄāļēāļ°āļāļąāļšāļāļēāļĢāđƒāļŠāđ‰āļ‡āļēāļ™āļ‚āļ­āļ‡āļ­āļ‡āļ„āđŒāļāļĢ

AI Server āļ„āļ·āļ­āļ­āļ°āđ„āļĢ āđāļĨāļ°āđ€āļŦāļĄāļēāļ°āļāļąāļšāļ‡āļēāļ™āđƒāļ”

AI Server āļ„āļ·āļ­āđ€āļ‹āļīāļĢāđŒāļŸāđ€āļ§āļ­āļĢāđŒāļ—āļĩāđˆāļ­āļ­āļāđāļšāļšāļĄāļēāđ€āļžāļ·āđˆāļ­āļĢāļ­āļ‡āļĢāļąāļšāļ‡āļēāļ™āļ›āļĢāļ°āļĄāļ§āļĨāļœāļĨāļ›āļąāļāļāļēāļ›āļĢāļ°āļ”āļīāļĐāļāđŒ āđ‚āļ”āļĒāļĄāļĩ GPU āļŠāļģāļŦāļĢāļąāļšāđ€āļĢāđˆāļ‡āļāļēāļĢāļ„āļģāļ™āļ§āļ“āđ€āļĄāļ—āļĢāļīāļāļ‹āđŒāđāļĨāļ°āđ‚āļĄāđ€āļ”āļĨ Deep Learning āļĢāļ§āļĄāļ–āļķāļ‡āļĄāļĩāļŦāļ™āđˆāļ§āļĒāļ„āļ§āļēāļĄāļˆāļģāđāļĨāļ°āļĢāļ°āļšāļšāļĢāļ°āļšāļēāļĒāļ„āļ§āļēāļĄāļĢāđ‰āļ­āļ™āļ—āļĩāđˆāļĢāļ­āļ‡āļĢāļąāļšāļāļēāļĢāļ—āļģāļ‡āļēāļ™āļ•āđˆāļ­āđ€āļ™āļ·āđˆāļ­āļ‡āļ•āļĨāļ­āļ” 24 āļŠāļąāđˆāļ§āđ‚āļĄāļ‡

āļ‡āļēāļ™āļ—āļĩāđˆāđ€āļŦāļĄāļēāļ°āļāļąāļš AI Server āđ„āļ”āđ‰āđāļāđˆ

  • āļāļēāļĢāļāļķāļāđ‚āļĄāđ€āļ”āļĨ Generative AI āđāļĨāļ° LLM
  • āļāļēāļĢāļ—āļģ Fine-tuning āđ‚āļĄāđ€āļ”āļĨāļ āļēāļĐāļēāļ‚āļ™āļēāļ”āđƒāļŦāļāđˆ
  • āļāļēāļĢāđƒāļŦāđ‰āļšāļĢāļīāļāļēāļĢ Chatbot āđāļĨāļ° AI Assistant
  • āļĢāļ°āļšāļš Retrieval-Augmented Generation āļŦāļĢāļ·āļ­ RAG
  • āļāļēāļĢāļ›āļĢāļ°āļĄāļ§āļĨāļœāļĨāđ€āļ­āļāļŠāļēāļĢāđāļĨāļ°āļŠāļĢāļļāļ›āļ‚āđ‰āļ­āļĄāļđāļĨ
  • āļāļēāļĢāļŠāļĢāđ‰āļēāļ‡āļ āļēāļž āđ€āļŠāļĩāļĒāļ‡ āļ§āļīāļ”āļĩāđ‚āļ­ āđāļĨāļ°āđ€āļ™āļ·āđ‰āļ­āļŦāļēāļ­āļąāļ•āđ‚āļ™āļĄāļąāļ•āļī
  • āļāļēāļĢāļ§āļīāđ€āļ„āļĢāļēāļ°āļŦāđŒāļ‚āđ‰āļ­āļĄāļđāļĨāļ”āđ‰āļ§āļĒ Machine Learning
  • āļāļēāļĢāđƒāļŦāđ‰āļšāļĢāļīāļāļēāļĢāđ‚āļĄāđ€āļ”āļĨāļœāđˆāļēāļ™ API āļ āļēāļĒāđƒāļ™āļ­āļ‡āļ„āđŒāļāļĢ

āļŠāļīāđˆāļ‡āļŠāļģāļ„āļąāļāļ—āļĩāđˆāļŠāļļāļ”āđƒāļ™āļāļēāļĢāđ€āļĨāļ·āļ­āļāļŠāđ€āļ›āļ AI Server

1. GPU āđāļĨāļ° VRAM

GPU āđ€āļ›āđ‡āļ™āļŦāļąāļ§āđƒāļˆāļŦāļĨāļąāļāļ‚āļ­āļ‡ AI Server āđ€āļ™āļ·āđˆāļ­āļ‡āļˆāļēāļāļ‡āļēāļ™ LLM āļ•āđ‰āļ­āļ‡āđƒāļŠāđ‰āļāļēāļĢāļ„āļģāļ™āļ§āļ“āđāļšāļšāļ‚āļ™āļēāļ™āļˆāļģāļ™āļ§āļ™āļĄāļēāļ āđ‚āļ”āļĒāđ€āļ‰āļžāļēāļ°āđƒāļ™āļŠāđˆāļ§āļ‡ Training āđāļĨāļ° Inference

āļŠāļīāđˆāļ‡āļ—āļĩāđˆāļ„āļ§āļĢāļžāļīāļˆāļēāļĢāļ“āļē āđ„āļ”āđ‰āđāļāđˆ

  • āļ›āļĢāļīāļĄāļēāļ“ VRAM āļŦāļĢāļ·āļ­āļŦāļ™āđˆāļ§āļĒāļ„āļ§āļēāļĄāļˆāļģāļšāļ™ GPU
  • āļ„āļ§āļēāļĄāđ€āļĢāđ‡āļ§ Memory Bandwidth
  • āļ›āļĢāļ°āļŠāļīāļ—āļ˜āļīāļ āļēāļž Tensor Core
  • āļĢāļ­āļ‡āļĢāļąāļš Precision āđ€āļŠāđˆāļ™ FP16, BF16, FP8 āļŦāļĢāļ·āļ­ FP4
  • āļāļēāļĢāđ€āļŠāļ·āđˆāļ­āļĄāļ•āđˆāļ­āļĢāļ°āļŦāļ§āđˆāļēāļ‡ GPU āđ€āļŠāđˆāļ™ NVLink
  • āļāļģāļĨāļąāļ‡āđ„āļŸāđāļĨāļ°āļĢāļ°āļšāļšāļĢāļ°āļšāļēāļĒāļ„āļ§āļēāļĄāļĢāđ‰āļ­āļ™

VRAM āļĄāļĩāļ„āļ§āļēāļĄāļŠāļģāļ„āļąāļāļĄāļēāļ āđ€āļžāļĢāļēāļ°āļ•āđ‰āļ­āļ‡āđƒāļŠāđ‰āļˆāļąāļ”āđ€āļāđ‡āļšāļ™āđ‰āļģāļŦāļ™āļąāļāļ‚āļ­āļ‡āđ‚āļĄāđ€āļ”āļĨ āļĢāļ§āļĄāļ–āļķāļ‡āļ‚āđ‰āļ­āļĄāļđāļĨāļŠāļģāļŦāļĢāļąāļš Context āđāļĨāļ° Batch āļāļēāļĢāļ›āļĢāļ°āļĄāļ§āļĨāļœāļĨ āļŦāļēāļ VRAM āđ„āļĄāđˆāđ€āļžāļĩāļĒāļ‡āļžāļ­ āļĢāļ°āļšāļšāļ­āļēāļˆāļ•āđ‰āļ­āļ‡āļĒāđ‰āļēāļĒāļ‚āđ‰āļ­āļĄāļđāļĨāđ„āļ›āļĒāļąāļ‡ RAM āļŦāļĢāļ·āļ­ Storage āļŠāđˆāļ‡āļœāļĨāđƒāļŦāđ‰āļ„āļ§āļēāļĄāđ€āļĢāđ‡āļ§āļĨāļ”āļĨāļ‡āļ­āļĒāđˆāļēāļ‡āļĄāļēāļ

āļ•āļąāļ§āļ­āļĒāđˆāļēāļ‡ GPU āļŠāļģāļŦāļĢāļąāļšāļ‡āļēāļ™ AI Server āļĢāļ°āļ”āļąāļšāļ­āļ‡āļ„āđŒāļāļĢ āđ„āļ”āđ‰āđāļāđˆ NVIDIA H100, H200 āđāļĨāļ° B200 āđ‚āļ”āļĒ H100 āļĄāļĩāļŦāļ™āđˆāļ§āļĒāļ„āļ§āļēāļĄāļˆāļģ HBM3 āļ‚āļ™āļēāļ” 80GB āļ•āđˆāļ­ GPU āļ‚āļ“āļ°āļ—āļĩāđˆ H200 āļĄāļĩ HBM3e āļ‚āļ™āļēāļ” 141GB āđāļĨāļ° Memory Bandwidth 4.8TB/s āļ‹āļķāđˆāļ‡āđ€āļŦāļĄāļēāļ°āļāļąāļšāļ‡āļēāļ™ LLM āļ—āļĩāđˆāļĄāļĩāđ‚āļĄāđ€āļ”āļĨāļ‚āļ™āļēāļ”āđƒāļŦāļāđˆāļŦāļĢāļ·āļ­āļĄāļĩ Context āļĒāļēāļ§

āļŠāļģāļŦāļĢāļąāļšāļĢāļ°āļšāļšāļ›āļĢāļ°āļŠāļīāļ—āļ˜āļīāļ āļēāļžāļŠāļđāļ‡ NVIDIA B200 āļĄāļĩāļŦāļ™āđˆāļ§āļĒāļ„āļ§āļēāļĄāļˆāļģ HBM3e āļŠāļđāļ‡āļŠāļļāļ”āļ›āļĢāļ°āļĄāļēāļ“ 180GB āļ•āđˆāļ­ GPU āđāļĨāļ°āļĄāļĩ Memory Bandwidth āļŠāļđāļ‡āļŠāļļāļ”āļ›āļĢāļ°āļĄāļēāļ“ 8TB/s āļˆāļķāļ‡āđ€āļŦāļĄāļēāļ°āļāļąāļšāļ‡āļēāļ™ Generative AI āļĢāļļāđˆāļ™āđƒāļŦāļĄāđˆ āļāļēāļĢāļāļķāļāđ‚āļĄāđ€āļ”āļĨāļ‚āļ™āļēāļ”āđƒāļŦāļāđˆ āđāļĨāļ°āļ‡āļēāļ™ Inference āļ—āļĩāđˆāļ•āđ‰āļ­āļ‡āļĢāļ­āļ‡āļĢāļąāļšāļœāļđāđ‰āđƒāļŠāđ‰āļ‡āļēāļ™āļˆāļģāļ™āļ§āļ™āļĄāļēāļ

2. CPU āļŠāļģāļŦāļĢāļąāļšāļ„āļ§āļšāļ„āļļāļĄāļĢāļ°āļšāļšāđāļĨāļ°āđ€āļ•āļĢāļĩāļĒāļĄāļ‚āđ‰āļ­āļĄāļđāļĨ

āđāļĄāđ‰ GPU āļˆāļ°āđ€āļ›āđ‡āļ™āļ­āļļāļ›āļāļĢāļ“āđŒāļŦāļĨāļąāļ āđāļ•āđˆ CPU āļĒāļąāļ‡āļĄāļĩāļšāļ—āļšāļēāļ—āļŠāļģāļ„āļąāļāđƒāļ™āļāļēāļĢāļˆāļąāļ”āļāļēāļĢāļĢāļ°āļšāļš āđ€āļ•āļĢāļĩāļĒāļĄāļ‚āđ‰āļ­āļĄāļđāļĨ āļ›āļĢāļ°āļĄāļ§āļĨāļœāļĨāļ„āļģāļ‚āļ­ āđāļĨāļ°āļ„āļ§āļšāļ„āļļāļĄāļāļēāļĢāļŠāļ·āđˆāļ­āļŠāļēāļĢāļĢāļ°āļŦāļ§āđˆāļēāļ‡āļ­āļļāļ›āļāļĢāļ“āđŒ

āđāļ™āļ§āļ—āļēāļ‡āđ€āļĨāļ·āļ­āļ CPU āļĄāļĩāļ”āļąāļ‡āļ™āļĩāđ‰

  • āđƒāļŠāđ‰ CPU āļĢāļ°āļ”āļąāļš Server āļ—āļĩāđˆāļĄāļĩāļŦāļĨāļēāļĒāļ„āļ­āļĢāđŒ
  • āļĢāļ­āļ‡āļĢāļąāļš PCIe Gen4 āļŦāļĢāļ·āļ­ PCIe Gen5
  • āļĄāļĩ L3 Cache āđ€āļžāļĩāļĒāļ‡āļžāļ­
  • āļĢāļ­āļ‡āļĢāļąāļšāļŦāļ™āđˆāļ§āļĒāļ„āļ§āļēāļĄāļˆāļģ ECC
  • āļĄāļĩāļŠāđˆāļ­āļ‡āļ—āļēāļ‡ PCIe āđ€āļžāļĩāļĒāļ‡āļžāļ­āļŠāļģāļŦāļĢāļąāļš GPU āđāļĨāļ° NVMe
  • āđ€āļĨāļ·āļ­āļ CPU āđāļšāļš 2 Socket āđ€āļĄāļ·āđˆāļ­āđƒāļŠāđ‰āļ‡āļēāļ™ GPU āļˆāļģāļ™āļ§āļ™āļĄāļēāļ

āļŠāļģāļŦāļĢāļąāļš AI Server āļ—āļĩāđˆāđƒāļŠāđ‰ GPU 1–2 āđƒāļš āļ­āļēāļˆāđ€āļĨāļ·āļ­āļ CPU Server āļĢāļ°āļ”āļąāļš 16–32 āļ„āļ­āļĢāđŒ āđāļ•āđˆāļŦāļēāļāđ€āļ›āđ‡āļ™āļĢāļ°āļšāļš 4–8 GPU āļ„āļ§āļĢāđ€āļĨāļ·āļ­āļ CPU āļĢāļ°āļ”āļąāļšāļŠāļđāļ‡āđāļšāļš Dual Socket āđ€āļžāļ·āđˆāļ­āđ„āļĄāđˆāđƒāļŦāđ‰āđ€āļāļīāļ”āļ„āļ­āļ‚āļ§āļ”āđƒāļ™āļāļēāļĢāļŠāđˆāļ‡āļ‚āđ‰āļ­āļĄāļđāļĨāđ€āļ‚āđ‰āļēāļŠāļđāđˆ GPU

3. RAM āļŦāļĢāļ·āļ­ System Memory

RAM āđƒāļŠāđ‰āļŠāļģāļŦāļĢāļąāļšāđ‚āļŦāļĨāļ” Dataset, āđ€āļāđ‡āļšāļ‚āđ‰āļ­āļĄāļđāļĨāļŠāļąāđˆāļ§āļ„āļĢāļēāļ§ āđāļĨāļ°āļĢāļ­āļ‡āļĢāļąāļšāļāļĢāļ°āļšāļ§āļ™āļāļēāļĢāļ—āļģāļ‡āļēāļ™āļ‚āļ­āļ‡āļĢāļ°āļšāļš AI āđ‚āļ”āļĒāļ—āļąāđˆāļ§āđ„āļ›āļ„āļ§āļĢāļĄāļĩ RAM āļĄāļēāļāļāļ§āđˆāļēāļ‚āļ™āļēāļ”āđ‚āļĄāđ€āļ”āļĨāļ—āļĩāđˆāđƒāļŠāđ‰āļ‡āļēāļ™āļˆāļĢāļīāļ‡āļŦāļĨāļēāļĒāđ€āļ—āđˆāļē

āđāļ™āļ§āļ—āļēāļ‡āđ€āļšāļ·āđ‰āļ­āļ‡āļ•āđ‰āļ™

  • AI Server āļ‚āļ™āļēāļ”āđ€āļĨāđ‡āļ: RAM 128–256GB
  • āļĢāļ°āļšāļš RAG āļŦāļĢāļ·āļ­āđ‚āļĄāđ€āļ”āļĨāļĢāļ°āļ”āļąāļšāļāļĨāļēāļ‡: RAM 256–512GB
  • āļĢāļ°āļšāļš Training āļŦāļĢāļ·āļ­ Inference āļŦāļĨāļēāļĒ GPU: RAM 512GB–1.5TB
  • āļĢāļ°āļšāļš 8 GPU āļĢāļ°āļ”āļąāļšāļ­āļ‡āļ„āđŒāļāļĢ: āļ„āļ§āļĢāļžāļīāļˆāļēāļĢāļ“āļē RAM āļ­āļĒāđˆāļēāļ‡āļ™āđ‰āļ­āļĒ 1.5TB āļ•āļēāļĄāđāļ™āļ§āļ—āļēāļ‡āļ­āđ‰āļēāļ‡āļ­āļīāļ‡āļ‚āļ­āļ‡āļĢāļ°āļšāļš HGX āļšāļēāļ‡āļĢāļļāđˆāļ™

RAM āđāļšāļš ECC āļŠāđˆāļ§āļĒāļ•āļĢāļ§āļˆāļˆāļąāļšāđāļĨāļ°āđāļāđ‰āđ„āļ‚āļ‚āđ‰āļ­āļœāļīāļ”āļžāļĨāļēāļ”āļ‚āļ­āļ‡āļ‚āđ‰āļ­āļĄāļđāļĨ āđ€āļŦāļĄāļēāļ°āļāļąāļšāđ€āļ‹āļīāļĢāđŒāļŸāđ€āļ§āļ­āļĢāđŒāļ—āļĩāđˆāļ•āđ‰āļ­āļ‡āļ—āļģāļ‡āļēāļ™āļ•āđˆāļ­āđ€āļ™āļ·āđˆāļ­āļ‡āđāļĨāļ°āļĄāļĩāļ„āļ§āļēāļĄāļŠāļģāļ„āļąāļāļ•āđˆāļ­āļ˜āļļāļĢāļāļīāļˆ

4. Storage āļŠāļģāļŦāļĢāļąāļšāđ‚āļĄāđ€āļ”āļĨāđāļĨāļ° Dataset

āđ‚āļĄāđ€āļ”āļĨ LLM āđāļĨāļ° Dataset āļ­āļēāļˆāļĄāļĩāļ‚āļ™āļēāļ”āļ•āļąāđ‰āļ‡āđāļ•āđˆāļŦāļĨāļēāļĒāļŠāļīāļšāļāļīāļāļ°āđ„āļšāļ•āđŒāļˆāļ™āļ–āļķāļ‡āļŦāļĨāļēāļĒāđ€āļ—āļĢāļēāđ„āļšāļ•āđŒ āļ”āļąāļ‡āļ™āļąāđ‰āļ™āļ„āļ§āļĢāļ­āļ­āļāđāļšāļš Storage āđāļĒāļāļ•āļēāļĄāļĨāļąāļāļĐāļ“āļ°āļāļēāļĢāđƒāļŠāđ‰āļ‡āļēāļ™

āđ‚āļ„āļĢāļ‡āļŠāļĢāđ‰āļēāļ‡āļ—āļĩāđˆāđāļ™āļ°āļ™āļģ

  • NVMe SSD āļŠāļģāļŦāļĢāļąāļšāļ•āļīāļ”āļ•āļąāđ‰āļ‡āļĢāļ°āļšāļšāļ›āļāļīāļšāļąāļ•āļīāļāļēāļĢāđāļĨāļ°āļ‹āļ­āļŸāļ•āđŒāđāļ§āļĢāđŒ
  • NVMe SSD āļ„āļ§āļēāļĄāđ€āļĢāđ‡āļ§āļŠāļđāļ‡āļŠāļģāļŦāļĢāļąāļšāđ‚āļŦāļĨāļ”āđ‚āļĄāđ€āļ”āļĨāđāļĨāļ° Cache
  • Enterprise SSD āļŠāļģāļŦāļĢāļąāļš Dataset āļ—āļĩāđˆāđƒāļŠāđ‰āļ‡āļēāļ™āļšāđˆāļ­āļĒ
  • HDD āļŦāļĢāļ·āļ­ Object Storage āļŠāļģāļŦāļĢāļąāļšāđ€āļāđ‡āļšāļ‚āđ‰āļ­āļĄāļđāļĨāļĢāļ°āļĒāļ°āļĒāļēāļ§
  • RAID āđ€āļžāļ·āđˆāļ­āđ€āļžāļīāđˆāļĄāļ„āļ§āļēāļĄāļ›āļĨāļ­āļ”āļ āļąāļĒāđāļĨāļ°āļ„āļ§āļēāļĄāļ•āđˆāļ­āđ€āļ™āļ·āđˆāļ­āļ‡āļ‚āļ­āļ‡āļĢāļ°āļšāļš

āļ•āļąāļ§āļ­āļĒāđˆāļēāļ‡āļāļēāļĢāļˆāļąāļ”āđ€āļāđ‡āļšāļ‚āđ‰āļ­āļĄāļđāļĨ

  • OS: NVMe SSD āđāļšāļš RAID 1 āļ‚āļ™āļēāļ” 1.92TB
  • Model Cache: NVMe SSD āļ‚āļ™āļēāļ” 3.84TB āļ‚āļķāđ‰āļ™āđ„āļ›
  • Dataset: Enterprise SSD āļŦāļĢāļ·āļ­ Storage āļ āļēāļĒāļ™āļ­āļāļ•āļēāļĄāļ›āļĢāļīāļĄāļēāļ“āļ‚āđ‰āļ­āļĄāļđāļĨ
  • Backup: NAS, Object Storage āļŦāļĢāļ·āļ­āļĢāļ°āļšāļšāļŠāļģāļĢāļ­āļ‡āļ‚āđ‰āļ­āļĄāļđāļĨāļ‚āļ­āļ‡āļ­āļ‡āļ„āđŒāļāļĢ

āļĢāļ°āļšāļš AI Server āļ—āļĩāđˆāļĄāļĩ GPU āļˆāļģāļ™āļ§āļ™āļĄāļēāļāļ„āļ§āļĢāđƒāļŦāđ‰āļ„āļ§āļēāļĄāļŠāļģāļ„āļąāļāļāļąāļšāļ„āļ§āļēāļĄāđ€āļĢāđ‡āļ§āđƒāļ™āļāļēāļĢāļ­āđˆāļēāļ™āļ‚āđ‰āļ­āļĄāļđāļĨ āđ€āļžāļĢāļēāļ°āļāļēāļĢāđ‚āļŦāļĨāļ”āđ‚āļĄāđ€āļ”āļĨāļŦāļĢāļ·āļ­ Dataset āļ—āļĩāđˆāļŠāđ‰āļēāļ­āļēāļˆāļ—āļģāđƒāļŦāđ‰ GPU āļ•āđ‰āļ­āļ‡āļĢāļ­āļ‚āđ‰āļ­āļĄāļđāļĨāđāļĨāļ°āđƒāļŠāđ‰āļ—āļĢāļąāļžāļĒāļēāļāļĢāđ„āļĄāđˆāđ€āļ•āđ‡āļĄāļ›āļĢāļ°āļŠāļīāļ—āļ˜āļīāļ āļēāļž

āļ•āļąāļ§āļ­āļĒāđˆāļēāļ‡āļŠāđ€āļ›āļ AI Server āļ•āļēāļĄāļĢāļ°āļ”āļąāļšāļāļēāļĢāđƒāļŠāđ‰āļ‡āļēāļ™

āļĢāļ°āļ”āļąāļšāđ€āļĢāļīāđˆāļĄāļ•āđ‰āļ™: āđƒāļŠāđ‰āļ‡āļēāļ™ LLM āđāļĨāļ° RAG āļ āļēāļĒāđƒāļ™āļ­āļ‡āļ„āđŒāļāļĢ

āđ€āļŦāļĄāļēāļ°āļŠāļģāļŦāļĢāļąāļšāļ˜āļļāļĢāļāļīāļˆāļ—āļĩāđˆāļ•āđ‰āļ­āļ‡āļāļēāļĢāļŠāļĢāđ‰āļēāļ‡ Chatbot, āļĢāļ°āļšāļšāļ–āļēāļĄāļ•āļ­āļšāđ€āļ­āļāļŠāļēāļĢ āļŦāļĢāļ·āļ­āļ—āļ”āļĨāļ­āļ‡āđƒāļŠāđ‰āļ‡āļēāļ™āđ‚āļĄāđ€āļ”āļĨ Open Source

  • CPU: 16–32 āļ„āļ­āļĢāđŒ
  • GPU: NVIDIA RTX āļĢāļ°āļ”āļąāļšāļŠāļđāļ‡ āļŦāļĢāļ·āļ­ GPU Data Center 1 āđƒāļš
  • VRAM: 24–80GB
  • RAM: 128–256GB ECC
  • Storage: NVMe SSD 2–4TB
  • Network: 10GbE
  • āļĢāļ°āļšāļšāļ›āļāļīāļšāļąāļ•āļīāļāļēāļĢ: Linux Server
  • āļĢāļđāļ›āđāļšāļšāļ‡āļēāļ™: Inference, Embedding, RAG āđāļĨāļ° Fine-tuning āļ‚āļ™āļēāļ”āđ€āļĨāđ‡āļ

āļĢāļ°āļ”āļąāļšāļāļĨāļēāļ‡: āđƒāļŦāđ‰āļšāļĢāļīāļāļēāļĢ AI āļŦāļĨāļēāļĒāļœāļđāđ‰āđƒāļŠāđ‰āļ‡āļēāļ™

āđ€āļŦāļĄāļēāļ°āļāļąāļšāļ­āļ‡āļ„āđŒāļāļĢāļ—āļĩāđˆāļĄāļĩāļœāļđāđ‰āđƒāļŠāđ‰āļ‡āļēāļ™āļžāļĢāđ‰āļ­āļĄāļāļąāļ™ āļ•āđ‰āļ­āļ‡āļāļēāļĢāļ„āļ§āļēāļĄāđ€āļŠāļ–āļĩāļĒāļĢ āđāļĨāļ°āļ•āđ‰āļ­āļ‡āļ›āļĢāļ°āļĄāļ§āļĨāļœāļĨāđ‚āļĄāđ€āļ”āļĨāļ‚āļ™āļēāļ”āļāļĨāļēāļ‡

  • CPU: 32–64 āļ„āļ­āļĢāđŒ
  • GPU: NVIDIA H100 āļŦāļĢāļ·āļ­ GPU Data Center 2–4 āđƒāļš
  • VRAM āļĢāļ§āļĄ: 160–560GB āđ‚āļ”āļĒāļ›āļĢāļ°āļĄāļēāļ“
  • RAM: 512GB–1TB ECC
  • Storage: NVMe Enterprise 7.68TB āļ‚āļķāđ‰āļ™āđ„āļ›
  • Network: 25GbE āļŦāļĢāļ·āļ­ 100GbE
  • āļĢāļ°āļšāļšāļˆāļąāļ”āļāļēāļĢ: Docker, Kubernetes āļŦāļĢāļ·āļ­āļĢāļ°āļšāļšāļˆāļąāļ”āļāļēāļĢ GPU
  • āļĢāļđāļ›āđāļšāļšāļ‡āļēāļ™: Production Inference, RAG, Fine-tuning āđāļĨāļ°āļĢāļ°āļšāļš AI API

āļĢāļ°āļ”āļąāļšāļŠāļđāļ‡: Training āđāļĨāļ° Generative AI āļ‚āļ™āļēāļ”āđƒāļŦāļāđˆ

āđ€āļŦāļĄāļēāļ°āļŠāļģāļŦāļĢāļąāļšāļ­āļ‡āļ„āđŒāļāļĢāļ‚āļ™āļēāļ”āđƒāļŦāļāđˆ āļĻāļđāļ™āļĒāđŒāļ§āļīāļˆāļąāļĒ āļœāļđāđ‰āđƒāļŦāđ‰āļšāļĢāļīāļāļēāļĢ Cloud āļŦāļĢāļ·āļ­āļ˜āļļāļĢāļāļīāļˆāļ—āļĩāđˆāļžāļąāļ’āļ™āļēāđ‚āļĄāđ€āļ”āļĨāđ€āļ‰āļžāļēāļ°āļ—āļēāļ‡

  • CPU: Dual Socket āļĢāļ°āļ”āļąāļš Server
  • GPU: NVIDIA H200 āļŦāļĢāļ·āļ­ B200 āļˆāļģāļ™āļ§āļ™ 8 āđƒāļš
  • VRAM āļĢāļ§āļĄ: H200 āļ›āļĢāļ°āļĄāļēāļ“ 1.1TB āļŦāļĢāļ·āļ­ B200 āļ›āļĢāļ°āļĄāļēāļ“ 1.4TB āļ•āđˆāļ­āđ‚āļŦāļ™āļ”
  • RAM: 1.5–2TB ECC
  • Storage: NVMe Enterprise āļŦāļĨāļēāļĒāļŠāļļāļ” āļžāļĢāđ‰āļ­āļĄāļĢāļ°āļšāļš Storage āļ āļēāļĒāļ™āļ­āļ
  • Network: 100GbE, 200GbE āļŦāļĢāļ·āļ­ InfiniBand
  • Interconnect: NVLink āđāļĨāļ°āļĢāļ°āļšāļšāđ€āļŠāļ·āđˆāļ­āļĄāļ•āđˆāļ­ GPU āļ„āļ§āļēāļĄāđ€āļĢāđ‡āļ§āļŠāļđāļ‡
  • Power Supply: Redundant PSU āļ‚āļ™āļēāļ”āļŠāļđāļ‡
  • āļĢāļ°āļšāļšāļĢāļ°āļšāļēāļĒāļ„āļ§āļēāļĄāļĢāđ‰āļ­āļ™: Air Cooling āļ›āļĢāļ°āļŠāļīāļ—āļ˜āļīāļ āļēāļžāļŠāļđāļ‡āļŦāļĢāļ·āļ­ Liquid Cooling

Training āļāļąāļš Inference āđƒāļŠāđ‰āļŠāđ€āļ›āļāđ€āļŦāļĄāļ·āļ­āļ™āļāļąāļ™āļŦāļĢāļ·āļ­āđ„āļĄāđˆ

āđ„āļĄāđˆāđ€āļŦāļĄāļ·āļ­āļ™āļāļąāļ™āļ—āļąāđ‰āļ‡āļŦāļĄāļ”

Training

āļāļēāļĢāļāļķāļāđ‚āļĄāđ€āļ”āļĨāļ•āđ‰āļ­āļ‡āđƒāļŠāđ‰ GPU āļˆāļģāļ™āļ§āļ™āļĄāļēāļāđāļĨāļ°āđƒāļŠāđ‰āđ€āļ§āļĨāļēāļ•āđˆāļ­āđ€āļ™āļ·āđˆāļ­āļ‡āđ€āļ›āđ‡āļ™āđ€āļ§āļĨāļēāļ™āļēāļ™ āļˆāļķāļ‡āļ•āđ‰āļ­āļ‡āđƒāļŦāđ‰āļ„āļ§āļēāļĄāļŠāļģāļ„āļąāļāļāļąāļš

  • VRAM āļ‚āļ™āļēāļ”āđƒāļŦāļāđˆ
  • GPU āļˆāļģāļ™āļ§āļ™āļĄāļēāļ
  • NVLink āļŦāļĢāļ·āļ­ Interconnect āļ„āļ§āļēāļĄāđ€āļĢāđ‡āļ§āļŠāļđāļ‡
  • Storage āļ—āļĩāđˆāļ­āđˆāļēāļ™āļ‚āđ‰āļ­āļĄāļđāļĨāđ„āļ”āđ‰āļĢāļ§āļ”āđ€āļĢāđ‡āļ§
  • Network Latency āļ•āđˆāļģ
  • āļĢāļ°āļšāļšāļĢāļ°āļšāļēāļĒāļ„āļ§āļēāļĄāļĢāđ‰āļ­āļ™āđāļĨāļ°āđ„āļŸāļŸāđ‰āļēāļ—āļĩāđˆāđ€āļŠāļ–āļĩāļĒāļĢ

Inference

āļāļēāļĢāļ™āļģāđ‚āļĄāđ€āļ”āļĨāđ„āļ›āđƒāļŦāđ‰āļšāļĢāļīāļāļēāļĢāļ•āđ‰āļ­āļ‡āđ€āļ™āđ‰āļ™āļ„āļ§āļēāļĄāđ€āļĢāđ‡āļ§āļ•āļ­āļšāļŠāļ™āļ­āļ‡āđāļĨāļ°āļˆāļģāļ™āļ§āļ™āļ„āļģāļ‚āļ­āļ•āđˆāļ­āļ§āļīāļ™āļēāļ—āļĩ āđ‚āļ”āļĒāļ„āļ§āļĢāļžāļīāļˆāļēāļĢāļ“āļē

  • āļ›āļĢāļīāļĄāļēāļ“ VRAM āļ•āđˆāļ­āđ‚āļĄāđ€āļ”āļĨ
  • Memory Bandwidth
  • āļˆāļģāļ™āļ§āļ™āļœāļđāđ‰āđƒāļŠāđ‰āļ‡āļēāļ™āļžāļĢāđ‰āļ­āļĄāļāļąāļ™
  • Context Length
  • Batch Size
  • āļ„āļ§āļēāļĄāđ€āļĢāđ‡āļ§ Time to First Token
  • āļ„āļ§āļēāļĄāđ€āļĢāđ‡āļ§ Token āļ•āđˆāļ­āļ§āļīāļ™āļēāļ—āļĩ
  • āļĢāļ°āļšāļš Load Balancing āđāļĨāļ° High Availability

āļŠāļģāļŦāļĢāļąāļš Inference āđ‚āļĄāđ€āļ”āļĨāļ‚āļ™āļēāļ”āđƒāļŦāļāđˆ GPU āļ—āļĩāđˆāļĄāļĩ VRAM āļŠāļđāļ‡ āđ€āļŠāđˆāļ™ H200 āļŦāļĢāļ·āļ­ B200 āļ­āļēāļˆāļŠāđˆāļ§āļĒāļĨāļ”āļāļēāļĢāđāļšāđˆāļ‡āđ‚āļĄāđ€āļ”āļĨāļŦāļĨāļēāļĒ GPU āđāļĨāļ°āđ€āļžāļīāđˆāļĄāļ›āļĢāļ°āļŠāļīāļ—āļ˜āļīāļ āļēāļžāđƒāļ™āļāļēāļĢāļĢāļ­āļ‡āļĢāļąāļš Context āļĒāļēāļ§āđ„āļ”āđ‰

āļāļēāļĢāļ„āļģāļ™āļ§āļ“ VRAM āđ€āļšāļ·āđ‰āļ­āļ‡āļ•āđ‰āļ™āļŠāļģāļŦāļĢāļąāļš LLM

āļāļēāļĢāļ›āļĢāļ°āđ€āļĄāļīāļ™ VRAM āđ„āļĄāđˆāļ„āļ§āļĢāļ”āļđāđ€āļ‰āļžāļēāļ°āļˆāļģāļ™āļ§āļ™āļžāļēāļĢāļēāļĄāļīāđ€āļ•āļ­āļĢāđŒāļ‚āļ­āļ‡āđ‚āļĄāđ€āļ”āļĨ āđ€āļžāļĢāļēāļ°āļĒāļąāļ‡āļ•āđ‰āļ­āļ‡āđ€āļœāļ·āđˆāļ­āļžāļ·āđ‰āļ™āļ—āļĩāđˆāļŠāļģāļŦāļĢāļąāļš KV Cache, Runtime āđāļĨāļ°āļ‚āđ‰āļ­āļĄāļđāļĨ Input/Output

āđ‚āļ”āļĒāļ—āļąāđˆāļ§āđ„āļ› āļ™āđ‰āļģāļŦāļ™āļąāļāđ‚āļĄāđ€āļ”āļĨāđāļšāļšāļ„āļ§āļēāļĄāļĨāļ°āđ€āļ­āļĩāļĒāļ”āļŠāļđāļ‡āļ­āļēāļˆāđƒāļŠāđ‰āļŦāļ™āđˆāļ§āļĒāļ„āļ§āļēāļĄāļˆāļģāļĄāļēāļāļāļ§āđˆāļēāđ‚āļĄāđ€āļ”āļĨāđāļšāļš Quantization āđ€āļŠāđˆāļ™

  • FP16 āļŦāļĢāļ·āļ­ BF16 āđƒāļŠāđ‰āļ›āļĢāļ°āļĄāļēāļ“ 2 āđ„āļšāļ•āđŒāļ•āđˆāļ­āļžāļēāļĢāļēāļĄāļīāđ€āļ•āļ­āļĢāđŒ
  • INT8 āđƒāļŠāđ‰āļ›āļĢāļ°āļĄāļēāļ“ 1 āđ„āļšāļ•āđŒāļ•āđˆāļ­āļžāļēāļĢāļēāļĄāļīāđ€āļ•āļ­āļĢāđŒ
  • 4-bit Quantization āđƒāļŠāđ‰āļ›āļĢāļ°āļĄāļēāļ“ 0.5 āđ„āļšāļ•āđŒāļ•āđˆāļ­āļžāļēāļĢāļēāļĄāļīāđ€āļ•āļ­āļĢāđŒ

āļ•āļąāļ§āļ­āļĒāđˆāļēāļ‡ āđ‚āļĄāđ€āļ”āļĨ 70B Parameters āļŦāļēāļāđƒāļŠāđ‰āļ‡āļēāļ™āđāļšāļš FP16 āļˆāļ°āļ•āđ‰āļ­āļ‡āđƒāļŠāđ‰āļžāļ·āđ‰āļ™āļ—āļĩāđˆāļŠāļģāļŦāļĢāļąāļšāļ™āđ‰āļģāļŦāļ™āļąāļāđ‚āļĄāđ€āļ”āļĨāļ›āļĢāļ°āļĄāļēāļ“ 140GB āļāđˆāļ­āļ™āļĢāļ§āļĄāļžāļ·āđ‰āļ™āļ—āļĩāđˆāļŠāļģāļŦāļĢāļąāļš KV Cache āđāļĨāļ°āļĢāļ°āļšāļšāļ­āļ·āđˆāļ™ āđ† āļ”āļąāļ‡āļ™āļąāđ‰āļ™āļ­āļēāļˆāļ•āđ‰āļ­āļ‡āđƒāļŠāđ‰ GPU āļŦāļĨāļēāļĒāđƒāļš āļŦāļĢāļ·āļ­āđ€āļĨāļ·āļ­āļ GPU āļ—āļĩāđˆāļĄāļĩ VRAM āļŠāļđāļ‡āļāļ§āđˆāļē

āļ­āļĒāđˆāļēāļ‡āđ„āļĢāļāđ‡āļ•āļēāļĄ āļ›āļĢāļīāļĄāļēāļ“ VRAM āļˆāļĢāļīāļ‡āļ‚āļķāđ‰āļ™āļ­āļĒāļđāđˆāļāļąāļš Framework, Quantization, Context Length āđāļĨāļ° Batch Size āļˆāļķāļ‡āļ„āļ§āļĢāļ—āļ”āļŠāļ­āļšāļ”āđ‰āļ§āļĒ Workload āļ—āļĩāđˆāđƒāļāļĨāđ‰āđ€āļ„āļĩāļĒāļ‡āļāļēāļĢāđƒāļŠāđ‰āļ‡āļēāļ™āļˆāļĢāļīāļ‡āļāđˆāļ­āļ™āļŠāļąāđˆāļ‡āļ‹āļ·āđ‰āļ­ AI Server

āļĢāļ°āļšāļšāđ€āļ„āļĢāļ·āļ­āļ‚āđˆāļēāļĒāđāļĨāļ°āļāļēāļĢāļĢāļ°āļšāļēāļĒāļ„āļ§āļēāļĄāļĢāđ‰āļ­āļ™

AI Server āļ—āļĩāđˆāļĄāļĩ GPU āļŦāļĨāļēāļĒāđƒāļšāļŠāļĢāđ‰āļēāļ‡āļ„āļ§āļēāļĄāļĢāđ‰āļ­āļ™āđāļĨāļ°āđƒāļŠāđ‰āļžāļĨāļąāļ‡āļ‡āļēāļ™āļŠāļđāļ‡āļāļ§āđˆāļēāļĢāļ°āļšāļšāđ€āļ‹āļīāļĢāđŒāļŸāđ€āļ§āļ­āļĢāđŒāļ—āļąāđˆāļ§āđ„āļ› āļˆāļģāđ€āļ›āđ‡āļ™āļ•āđ‰āļ­āļ‡āļ•āļĢāļ§āļˆāļŠāļ­āļš

  • āļāļģāļĨāļąāļ‡āđ„āļŸāļ‚āļ­āļ‡ GPU āđāļĨāļ°āļ­āļļāļ›āļāļĢāļ“āđŒāļ—āļąāđ‰āļ‡āļŦāļĄāļ”
  • āļˆāļģāļ™āļ§āļ™āđāļĨāļ°āļ‚āļ™āļēāļ”āļ‚āļ­āļ‡ Power Supply
  • āļ„āļ§āļēāļĄāļŠāļēāļĄāļēāļĢāļ–āļ‚āļ­āļ‡ Rack āđāļĨāļ°āļĢāļ°āļšāļšāđ„āļŸāļŸāđ‰āļē
  • Airflow āļ āļēāļĒāđƒāļ™āļŦāđ‰āļ­āļ‡ Server
  • āļ­āļļāļ“āļŦāļ āļđāļĄāļīāđāļĨāļ°āļ„āļ§āļēāļĄāļŠāļ·āđ‰āļ™
  • āļĢāļ°āļšāļšāļŠāļģāļĢāļ­āļ‡āđ„āļŸ UPS
  • āļāļēāļĢāđ€āļŠāļ·āđˆāļ­āļĄāļ•āđˆāļ­ Network āļĢāļ°āļŦāļ§āđˆāļēāļ‡ Server āđāļĨāļ° Storage

āļĢāļ°āļšāļš HGX āļ—āļĩāđˆāđƒāļŠāđ‰ H100 āļŦāļĢāļ·āļ­ H200 āļˆāļģāļ™āļ§āļ™ 8 āđƒāļš āļŠāļēāļĄāļēāļĢāļ–āļĄāļĩāļŦāļ™āđˆāļ§āļĒāļ„āļ§āļēāļĄāļˆāļģ GPU āļĢāļ§āļĄāļŠāļđāļ‡āļŠāļļāļ”āļ›āļĢāļ°āļĄāļēāļ“ 640GB āđāļĨāļ° 1,128GB āļ•āļēāļĄāļĨāļģāļ”āļąāļš āļ‚āļ“āļ°āļ—āļĩāđˆāļĢāļ°āļšāļš B200 8 āđƒāļšāļĄāļĩāļŦāļ™āđˆāļ§āļĒāļ„āļ§āļēāļĄāļˆāļģāļĢāļ§āļĄāļ›āļĢāļ°āļĄāļēāļ“ 1.44TB āļˆāļķāļ‡āļ•āđ‰āļ­āļ‡āļ­āļ­āļāđāļšāļšāļĢāļ°āļšāļšāđ„āļŸāļŸāđ‰āļē āđ€āļ„āļĢāļ·āļ­āļ‚āđˆāļēāļĒ āđāļĨāļ°āļāļēāļĢāļĢāļ°āļšāļēāļĒāļ„āļ§āļēāļĄāļĢāđ‰āļ­āļ™āļ­āļĒāđˆāļēāļ‡āļĢāļ­āļšāļ„āļ­āļš

Checklist āļāđˆāļ­āļ™āđ€āļĨāļ·āļ­āļāļ‹āļ·āđ‰āļ­ AI Server

āļāđˆāļ­āļ™āļ•āļąāļ”āļŠāļīāļ™āđƒāļˆ āļ„āļ§āļĢāļ•āļ­āļšāļ„āļģāļ–āļēāļĄāļ•āđˆāļ­āđ„āļ›āļ™āļĩāđ‰

  • āđ‚āļĄāđ€āļ”āļĨāļ—āļĩāđˆāļ•āđ‰āļ­āļ‡āļāļēāļĢāđƒāļŠāđ‰āļ‡āļēāļ™āļĄāļĩāļ‚āļ™āļēāļ”āļāļĩāđˆāļžāļēāļĢāļēāļĄāļīāđ€āļ•āļ­āļĢāđŒ
  • āļ•āđ‰āļ­āļ‡āļāļēāļĢ Training, Fine-tuning āļŦāļĢāļ·āļ­ Inference
  • āļĄāļĩāļœāļđāđ‰āđƒāļŠāđ‰āļ‡āļēāļ™āļžāļĢāđ‰āļ­āļĄāļāļąāļ™āļāļĩāđˆāļ„āļ™
  • āļ•āđ‰āļ­āļ‡āļāļēāļĢāļ„āļ§āļēāļĄāđ€āļĢāđ‡āļ§āļ•āļ­āļšāļāļĨāļąāļšāļāļĩāđˆ Token āļ•āđˆāļ­āļ§āļīāļ™āļēāļ—āļĩ
  • Context āļ—āļĩāđˆāđƒāļŠāđ‰āļ‡āļēāļ™āļĄāļĩāļ„āļ§āļēāļĄāļĒāļēāļ§āđ€āļ—āđˆāļēāđƒāļ”
  • āļ•āđ‰āļ­āļ‡āđƒāļŠāđ‰āļ‚āđ‰āļ­āļĄāļđāļĨāļ āļēāļĒāđƒāļ™āļ­āļ‡āļ„āđŒāļāļĢāļŦāļĢāļ·āļ­āđ€āļŠāļ·āđˆāļ­āļĄāļ•āđˆāļ­āļĢāļ°āļšāļš RAG āļŦāļĢāļ·āļ­āđ„āļĄāđˆ
  • āļĄāļĩāļžāļ·āđ‰āļ™āļ—āļĩāđˆ Rack āđāļĨāļ°āļāļģāļĨāļąāļ‡āđ„āļŸāđ€āļžāļĩāļĒāļ‡āļžāļ­āļŦāļĢāļ·āļ­āđ„āļĄāđˆ
  • āļ•āđ‰āļ­āļ‡āļāļēāļĢāļĢāļ°āļšāļšāļŠāļģāļĢāļ­āļ‡āļ‚āđ‰āļ­āļĄāļđāļĨāđāļĨāļ° High Availability āļŦāļĢāļ·āļ­āđ„āļĄāđˆ
  • āļĄāļĩāļ—āļĩāļĄāļ”āļđāđāļĨ Linux, GPU, Container āđāļĨāļ°āļĢāļ°āļšāļšāđ€āļ„āļĢāļ·āļ­āļ‚āđˆāļēāļĒāļŦāļĢāļ·āļ­āđ„āļĄāđˆ
  • āļ•āđ‰āļ­āļ‡āļāļēāļĢāļ‹āļ·āđ‰āļ­āđ€āļ„āļĢāļ·āđˆāļ­āļ‡āļžāļĢāđ‰āļ­āļĄāļšāļĢāļīāļāļēāļĢāļ•āļīāļ”āļ•āļąāđ‰āļ‡āđāļĨāļ°āļ”āļđāđāļĨāļŦāļĨāļąāļ‡āļāļēāļĢāļ‚āļēāļĒāļŦāļĢāļ·āļ­āđ„āļĄāđˆ

āļŠāļĢāļļāļ›

āļāļēāļĢāđ€āļĨāļ·āļ­āļ āļŠāđ€āļ›āļ AI Server āļŠāļģāļŦāļĢāļąāļš Generative AI āđāļĨāļ° Large Language Model āļ•āđ‰āļ­āļ‡āļžāļīāļˆāļēāļĢāļ“āļēāļ—āļąāđ‰āļ‡ GPU, VRAM, CPU, RAM, Storage, Network, āļĢāļ°āļšāļšāđ„āļŸāļŸāđ‰āļē āđāļĨāļ°āļāļēāļĢāļĢāļ°āļšāļēāļĒāļ„āļ§āļēāļĄāļĢāđ‰āļ­āļ™āļĢāđˆāļ§āļĄāļāļąāļ™ āđ„āļĄāđˆāļ„āļ§āļĢāđ€āļĨāļ·āļ­āļāļˆāļēāļāļŠāđ€āļ›āļāļ—āļĩāđˆāļŠāļđāļ‡āļ—āļĩāđˆāļŠāļļāļ” āđāļ•āđˆāļ„āļ§āļĢāđ€āļĨāļ·āļ­āļāđƒāļŦāđ‰āđ€āļŦāļĄāļēāļ°āļāļąāļšāđ‚āļĄāđ€āļ”āļĨ āļˆāļģāļ™āļ§āļ™āļœāļđāđ‰āđƒāļŠāđ‰āļ‡āļēāļ™ āđāļĨāļ°āđ€āļ›āđ‰āļēāļŦāļĄāļēāļĒāļ—āļēāļ‡āļ˜āļļāļĢāļāļīāļˆ

āļŠāļģāļŦāļĢāļąāļšāļāļēāļĢāđƒāļŠāđ‰āļ‡āļēāļ™āļĢāļ°āļ”āļąāļšāđ€āļĢāļīāđˆāļĄāļ•āđ‰āļ™ āļ­āļēāļˆāđ€āļĢāļīāđˆāļĄāļˆāļēāļ GPU 1 āđƒāļšāđāļĨāļ° RAM 128–256GB āļŠāđˆāļ§āļ™āļ‡āļēāļ™ Production āļŦāļĢāļ·āļ­āđ‚āļĄāđ€āļ”āļĨāļ‚āļ™āļēāļ”āđƒāļŦāļāđˆāļ„āļ§āļĢāļžāļīāļˆāļēāļĢāļ“āļē GPU Data Center āđ€āļŠāđˆāļ™ H100, H200 āļŦāļĢāļ·āļ­ B200 āļžāļĢāđ‰āļ­āļĄāļĢāļ°āļšāļš NVLink, NVMe āđāļĨāļ°āđ€āļ„āļĢāļ·āļ­āļ‚āđˆāļēāļĒāļ„āļ§āļēāļĄāđ€āļĢāđ‡āļ§āļŠāļđāļ‡

āļŦāļēāļāļ­āļ‡āļ„āđŒāļāļĢāļāļģāļĨāļąāļ‡āļ§āļēāļ‡āļĢāļ°āļšāļš Generative AI, LLM, RAG āļŦāļĢāļ·āļ­ AI Server āļŠāļģāļŦāļĢāļąāļšāđƒāļŦāđ‰āļšāļĢāļīāļāļēāļĢāļ āļēāļĒāđƒāļ™ āļŠāļēāļĄāļēāļĢāļ–āļ•āļīāļ”āļ•āđˆāļ­āļ—āļĩāļĄāļ‡āļēāļ™ 2beshop.com āđ€āļžāļ·āđˆāļ­āļŠāđˆāļ§āļĒāļ§āļīāđ€āļ„āļĢāļēāļ°āļŦāđŒ Workload āļ­āļ­āļāđāļšāļšāļŠāđ€āļ›āļ āđāļĨāļ°āđ€āļĨāļ·āļ­āļāđ‚āļ‹āļĨāļđāļŠāļąāļ™āļ—āļĩāđˆāđ€āļŦāļĄāļēāļ°āļŠāļĄāļāļąāļšāļ‡āļšāļ›āļĢāļ°āļĄāļēāļ“āđāļĨāļ°āļāļēāļĢāđ€āļ•āļīāļšāđ‚āļ•āļ‚āļ­āļ‡āļ˜āļļāļĢāļāļīāļˆ

  • āļŠāļ™āđƒāļˆāļŠāļ­āļšāļ–āļēāļĄāļ‚āđ‰āļ­āļĄāļđāļĨāđ€āļžāļīāđˆāļĄāđ€āļ•āļīāļĄāļŦāļĢāļ·āļ­āļ‹āļ·āđ‰āļ­āļ­āļļāļ›āļāļ“āđŒ IT āļ„āļĨāļīāļāđ€āļĨāļĒ
  • āļ‹āļ·āđ‰āļ­āļŠāļīāļ™āļ„āđ‰āļēāļœāđˆāļēāļ™ Application āļĢāļąāļšāļŠāđˆāļ§āļ™āļĨāļ”āđ€āļžāļīāđˆāļĄÂ āļ„āļĨāļīāļāđ€āļĨāļĒ
  • LINE: @2beshop
  • āđ‚āļ—āļĢ 02-1186767

By admin