LLM Cal

LOCAL LLM FIELD GUIDE

เลือก Hardware สำหรับ Local LLM จากงาน ไม่ใช่แค่ชื่อ GPU

เลือกจาก memory ที่ต้องใช้จริง, bandwidth, runtime ที่ต้องการ, จำนวนผู้ใช้ และการดูแลระบบ. Mac เหมาะกับ single-device local workflow. GPU consumer เหมาะกับทดลอง/ใช้งานส่วนตัว. workstation และ datacenter เหมาะกับ memory หรือ serving scale ที่มากขึ้น.

มาสคอตแมวดำ STH ประกอบคู่มือ เลือก Hardware สำหรับ Local LLM จากงาน ไม่ใช่แค่ชื่อ GPU

เลือกจากข้อจำกัด

Tier ไม่ใช่ ranking: เป็น operating model คนละแบบ

Consumerเริ่ม local, budget จำกัด, card เดียว
Workstationmemory/reliability สำหรับงานจริง
Datacentercapacity, fabric, operation scale
แมวดำ STH เปรียบเทียบ GPU สามระดับ
แผนภาพสรุปสรุปกลไกสำหรับใช้เทียบกับค่าใน calculator
แผนภาพอธิบาย เลือก Hardware สำหรับ Local LLM จากงาน ไม่ใช่แค่ชื่อ GPU

ใช้กับงานจริง

เลือกเครื่องจากเส้นทาง deploy

เริ่มจาก runtime และ artifact ที่ต้องใช้ เพราะสองอย่างนี้กำหนด GPU path ก่อนราคา. จากนั้นดู memory ที่ต้องจอง, bandwidth, และภาระดูแลระบบ.

การ์ดที่มี VRAM มากไม่รับประกันว่า workflow จะง่ายกว่า. ให้เทียบ model, context และจำนวน request ที่ต้องรองรับกับทางเลือกจริง.

ทางเลือกเริ่มดูจากตรวจเพิ่ม
Mac Apple SiliconMLX หรือ GGUF บน Metalunified memory, conversion path, local workflow
NVIDIACUDA runtime และ kernel ที่รองรับVRAM, bandwidth, driver, serving topology
AMDROCm และ HIP support ของ runtimeรุ่น GPU, kernel path, artifact support

คำถามก่อนซื้อหรือเช่า

  • model และ quant ที่ต้องรันคืออะไร
  • working context และ sequence พร้อมกันกี่อัน
  • ต้องการ TTFT, per-user tok/s หรือ aggregate throughput
  • ทีมดูแล Linux, CUDA หรือ ROCm ได้ระดับใด
  • ต้องใช้ card เดียว, replica หรือ tensor parallel
ข้อมูลที่ควรนำเข้า calculator
hardware = <device>
framework = <runtime>
model = <checkpoint>
working_context = <tokens>
batch = <concurrent sequences>

Mac Apple Silicon

Unified memory ช่วยให้โมเดลขนาดใหญ่พอดีกับเครื่องเดียวได้เมื่อใช้ MLX หรือ GGUF/Metal. เหมาะกับ local interactive workflow และความเงียบเรียบง่าย. ต้องยอมรับว่าบาง CUDA-specific quant หรือ serving path ไม่ใช่เส้นทางตรง.

NVIDIA และ AMD

เลือกจาก runtime/kernel ที่ทีมใช้จริงก่อน. NVIDIA มี ecosystem server inference กว้าง. AMD ต้องตรวจ HIP/ROCm และ support ของ runtime/quant สำหรับรุ่นที่เลือก. อย่าตัดสินจาก VRAM เพียงอย่างเดียว.

Consumer, workstation, datacenter

Consumer GPU ให้ต้นทุนเริ่มต้นดีแต่ memory ต่อการ์ดจำกัด. Workstation เน้น memory, reliability และมืออาชีพ. Datacenter GPU เหมาะกับ capacity, fabric, isolation และการปฏิบัติการ serving แต่ต้องแลกต้นทุนและความซับซ้อน.

คำถามก่อนซื้อ

ต้องรันโมเดล/quant ไหน, context เท่าไร, concurrency กี่ sequence, ต้องการ latency หรือ throughput, และทีมดูแล Linux/CUDA/ROCm ได้หรือไม่. นำคำตอบไปใส่ calculator เพื่อดู memory budget ก่อน.

แหล่งอ้างอิง

ลองกับ configuration ของคุณ

นำ model, quantization, context, framework และ hardware ที่คิดไว้ไปลองใน calculator จากนั้นยืนยันด้วย benchmark ที่ใกล้ production.

เปิดเครื่องคำนวณ