LLM Cal

KNOWLEDGE BASE

คู่มือ Local LLM: Hardware, Model, Quant และ Serving

คู่มือภาษาไทยสำหรับเลือก local LLM, hardware, model, quantization, KV cache, serving และ performance

Quantization: ลด VRAM ตรงไหน และแลกคุณภาพอย่างไรคู่มือเจาะลึกการเลือก 4-bit และ 8-bit Quantization ทั้งฝั่ง Weights และ KV Cache สรุปเทคนิค QAT, MXFP4, AWQ, GPTQ และ GGUF พร้อมวิธีคำนวณ VRAM ประเมินคุณภาพ และความเสี่ยงหลอนในงานจริงทำไม tok/s ของ LLM มักติด Memory Bandwidthเจาะลึก Roofline Model สำหรับ Local LLM: ทำไม Decode ถึงติด Memory Bandwidth ทำไม Prefill ถึงติด Compute (FLOPS) พร้อมวิธีแยกแยะ TTFT, TPOT, ITL และวิธีอ่านผล VRAM Calculator อย่างมืออาชีพเลือก Hardware สำหรับ Local LLM จากงาน ไม่ใช่แค่ชื่อ GPUคู่มือเลือกฮาร์ดแวร์สำหรับ Local LLM สรุปจุดเด่นและข้อจำกัดระหว่าง Apple Silicon Mac, NVIDIA CUDA และ AMD ROCm วิเคราะห์ VRAM, Memory Bandwidth, สเปก และราคาตลาดในไทยเพื่อการลงทุนที่คุ้มค่าServing Framework: เลือกจาก workload, hardware และไฟล์โมเดลเปรียบเทียบ Serving Framework ยอดนิยม: vLLM, SGLang, llama.cpp, MLX-LM และ Ollama สรุปจุดเด่น ข้อจำกัด ฮาร์ดแวร์ และรูปแบบไฟล์ Safetensors หรือ GGUF เพื่อเลือกใช้งานได้อย่างถูกต้องเลือก Local LLM ตามงาน: ภาษาไทย, chatbot, agent, coding และ workflowคู่มือเลือกโมเดล Local LLM ให้เหมาะกับประเภทงาน: ภาษาไทย, Chatbot สนทนา, AI Agent เรียกใช้ Tool, งานเขียนโปรแกรม Coding และงานข้อมูลโครงสร้าง JSON พร้อมวิธีประเมินคุณภาพอย่างมีหลักฐานSpeculative Decoding และ Attention Backend: เร็วขึ้นเมื่อเงื่อนไขตรงคู่มือเจาะลึก Speculative Decoding, Multi-Token Prediction (MTP) และ Attention Backends เช่น FlashAttention, FlashInfer เพื่อเร่งความเร็ว Local LLM โดยเข้าใจเงื่อนไขที่ทำให้ระบบเร็วขึ้นหรือช้าลงการจัดการ VRAM สำหรับ MoE ขนาดใหญ่บน Multi-GPU Clusterคู่มือเจาะลึกการรันและคำนวณ VRAM สำหรับโมเดล Mixture-of-Experts (MoE) ขนาดใหญ่ เช่น DeepSeek-V3, DeepSeek-R1 บน Multi-GPU Cluster ด้วย EP, TP, PP และ MLA