LOCAL LLM FIELD GUIDE
Serving Framework: เลือกตามรูปแบบการให้บริการ
ไม่มี framework เดียวชนะทุกงาน. เริ่มจาก hardware และ artifact, จากนั้นเลือกระหว่าง local single-user, simple API, high-throughput server, หรือ NVIDIA-optimized production path.

DECISION TREE
เริ่มจากรูปแบบ request ไม่ใช่ชื่อ framework
- งาน local บน Mac เริ่มจาก MLX หรือ llama.cpp บน Metal
- งาน GGUF หรือ local API เริ่มจาก llama.cpp หรือ Ollama
- GPU server ที่รับหลาย request ใช้ vLLM หรือ SGLang
- เส้นทาง production เฉพาะ NVIDIA ให้ประเมิน TensorRT-LLM


ใช้กับงานจริง
เลือก framework จากรูปแบบ request
Local runner เน้นเปิด model และเรียกใช้ไม่กี่คน. Server runtime จัดการ batching, KV cache, concurrency และการสังเกตระบบ.
เลือกจาก artifact ที่มี, hardware ที่ใช้ และคนที่จะดูแล service. อย่าเริ่มจากชื่อ framework ที่กำลังนิยม.
| Framework | เหมาะเริ่มเมื่อ | สิ่งที่ต้องรับผิดชอบ |
|---|---|---|
| llama.cpp | ต้องใช้ GGUF กับ CPU, GPU หรือ Metal | model file, backend flags, benchmark |
| Ollama | ต้องการ local API และ model management ที่ง่าย | model lifecycle, memory limit, feature support |
| MLX | ทำงานบน Apple Silicon | conversion, local API, memory headroom |
| vLLM / SGLang | GPU server ต้องรับหลาย request | batching, KV, backend, rollout |
| TensorRT-LLM | มี NVIDIA production path ที่ทีมดูแลได้ | engine build, version compatibility, operations |
ก่อนเปิด service
- bind service กับ
127.0.0.1จนกว่าจะมีเหตุผลต้อง expose - ตั้ง
max-model-lenและmax-num-seqsตาม capacity ที่วางไว้ - บันทึก checkpoint, runtime release และ flags
- ทำ smoke test, load test และ rollback path
vllm serve <checkpoint> \
--host 127.0.0.1 \
--port 8000 \
--max-model-len <tokens> \
--max-num-seqs <sequences>เริ่มด้วยเส้นทาง runtime
Mac/Apple Silicon: เริ่มดู MLX หรือ llama.cpp/Metal. GGUF local: llama.cpp หรือ Ollama. Server GPU ที่ต้อง batching/cache/metrics: vLLM หรือ SGLang. NVIDIA production ที่ต้องการ ecosystem เฉพาะทาง: ประเมิน TensorRT-LLM เมื่อทีมรองรับ.
vLLM และ SGLang
เหมาะกับ GPU serving ที่ต้องการ continuous batching, KV management และ concurrency. vLLM เน้น engine/API ที่ใช้งานกว้าง. SGLang มี serving composition และแนวทางแยก prefill/decode. ตรวจ model, quant และ backend support ของเวอร์ชันจริงเสมอ.
llama.cpp, MLX และ Ollama
llama.cpp ให้เส้นทาง GGUF และ backend กว้างรวม Metal/CPU/GPU. MLX เป็น native Apple Silicon สำหรับ conversion, quantization และ local workflow. Ollama ลด friction ของ local API/model management แต่ไม่ได้แทน capacity planner สำหรับ production.
อย่าเลือกจาก battle card
คำตอบคือ decision tree: ต้อง serve พร้อมกันไหม, ต้อง GGUF หรือ safetensors, เป็น Mac หรือ GPU server, ต้องใช้ prefix cache/spec decode/backend แบบใด, และใครจะ operate observability/rollout. Benchmark path ที่เลือกกับ traffic จริง.
แหล่งอ้างอิง
ลองกับ configuration ของคุณ
นำ model, quantization, context, framework และ hardware ที่คิดไว้ไปลองใน calculator จากนั้นยืนยันด้วย benchmark ที่ใกล้ production.
เปิดเครื่องคำนวณ