LOCAL LLM FIELD GUIDE
เลือก Hardware สำหรับ Local LLM จากงาน ไม่ใช่แค่ชื่อ GPU
เลือกจาก memory ที่ต้องใช้จริง, bandwidth, runtime ที่ต้องการ, จำนวนผู้ใช้ และการดูแลระบบ. Mac เหมาะกับ single-device local workflow. GPU consumer เหมาะกับทดลอง/ใช้งานส่วนตัว. workstation และ datacenter เหมาะกับ memory หรือ serving scale ที่มากขึ้น.

เลือกจากข้อจำกัด
Tier ไม่ใช่ ranking: เป็น operating model คนละแบบ


ใช้กับงานจริง
เลือกเครื่องจากเส้นทาง deploy
เริ่มจาก runtime และ artifact ที่ต้องใช้ เพราะสองอย่างนี้กำหนด GPU path ก่อนราคา. จากนั้นดู memory ที่ต้องจอง, bandwidth, และภาระดูแลระบบ.
การ์ดที่มี VRAM มากไม่รับประกันว่า workflow จะง่ายกว่า. ให้เทียบ model, context และจำนวน request ที่ต้องรองรับกับทางเลือกจริง.
| ทางเลือก | เริ่มดูจาก | ตรวจเพิ่ม |
|---|---|---|
| Mac Apple Silicon | MLX หรือ GGUF บน Metal | unified memory, conversion path, local workflow |
| NVIDIA | CUDA runtime และ kernel ที่รองรับ | VRAM, bandwidth, driver, serving topology |
| AMD | ROCm และ HIP support ของ runtime | รุ่น GPU, kernel path, artifact support |
คำถามก่อนซื้อหรือเช่า
- model และ quant ที่ต้องรันคืออะไร
- working context และ sequence พร้อมกันกี่อัน
- ต้องการ TTFT, per-user tok/s หรือ aggregate throughput
- ทีมดูแล Linux, CUDA หรือ ROCm ได้ระดับใด
- ต้องใช้ card เดียว, replica หรือ tensor parallel
hardware = <device>
framework = <runtime>
model = <checkpoint>
working_context = <tokens>
batch = <concurrent sequences>Mac Apple Silicon
Unified memory ช่วยให้โมเดลขนาดใหญ่พอดีกับเครื่องเดียวได้เมื่อใช้ MLX หรือ GGUF/Metal. เหมาะกับ local interactive workflow และความเงียบเรียบง่าย. ต้องยอมรับว่าบาง CUDA-specific quant หรือ serving path ไม่ใช่เส้นทางตรง.
NVIDIA และ AMD
เลือกจาก runtime/kernel ที่ทีมใช้จริงก่อน. NVIDIA มี ecosystem server inference กว้าง. AMD ต้องตรวจ HIP/ROCm และ support ของ runtime/quant สำหรับรุ่นที่เลือก. อย่าตัดสินจาก VRAM เพียงอย่างเดียว.
Consumer, workstation, datacenter
Consumer GPU ให้ต้นทุนเริ่มต้นดีแต่ memory ต่อการ์ดจำกัด. Workstation เน้น memory, reliability และมืออาชีพ. Datacenter GPU เหมาะกับ capacity, fabric, isolation และการปฏิบัติการ serving แต่ต้องแลกต้นทุนและความซับซ้อน.
คำถามก่อนซื้อ
ต้องรันโมเดล/quant ไหน, context เท่าไร, concurrency กี่ sequence, ต้องการ latency หรือ throughput, และทีมดูแล Linux/CUDA/ROCm ได้หรือไม่. นำคำตอบไปใส่ calculator เพื่อดู memory budget ก่อน.
แหล่งอ้างอิง
ลองกับ configuration ของคุณ
นำ model, quantization, context, framework และ hardware ที่คิดไว้ไปลองใน calculator จากนั้นยืนยันด้วย benchmark ที่ใกล้ production.
เปิดเครื่องคำนวณ