KNOWLEDGE BASE
คู่มือ Local LLM: Hardware, Model, Quant และ Serving
คู่มือภาษาไทยสำหรับเลือก local LLM, hardware, model, quantization, KV cache, serving และ performance
Quantization: ลด VRAM ตรงไหน และแลกคุณภาพอย่างไรคู่มือเจาะลึกการเลือก 4-bit และ 8-bit Quantization ทั้งฝั่ง Weights และ KV Cache สรุปเทคนิค QAT, MXFP4, AWQ, GPTQ และ GGUF พร้อมวิธีคำนวณ VRAM ประเมินคุณภาพ และความเสี่ยงหลอนในงานจริง
ทำไม tok/s ของ LLM มักติด Memory Bandwidthเจาะลึก Roofline Model สำหรับ Local LLM: ทำไม Decode ถึงติด Memory Bandwidth ทำไม Prefill ถึงติด Compute (FLOPS) พร้อมวิธีแยกแยะ TTFT, TPOT, ITL และวิธีอ่านผล VRAM Calculator อย่างมืออาชีพ
เลือก Hardware สำหรับ Local LLM จากงาน ไม่ใช่แค่ชื่อ GPUคู่มือเลือกฮาร์ดแวร์สำหรับ Local LLM สรุปจุดเด่นและข้อจำกัดระหว่าง Apple Silicon Mac, NVIDIA CUDA และ AMD ROCm วิเคราะห์ VRAM, Memory Bandwidth, สเปก และราคาตลาดในไทยเพื่อการลงทุนที่คุ้มค่า
Serving Framework: เลือกจาก workload, hardware และไฟล์โมเดลเปรียบเทียบ Serving Framework ยอดนิยม: vLLM, SGLang, llama.cpp, MLX-LM และ Ollama สรุปจุดเด่น ข้อจำกัด ฮาร์ดแวร์ และรูปแบบไฟล์ Safetensors หรือ GGUF เพื่อเลือกใช้งานได้อย่างถูกต้อง
เลือก Local LLM ตามงาน: ภาษาไทย, chatbot, agent, coding และ workflowคู่มือเลือกโมเดล Local LLM ให้เหมาะกับประเภทงาน: ภาษาไทย, Chatbot สนทนา, AI Agent เรียกใช้ Tool, งานเขียนโปรแกรม Coding และงานข้อมูลโครงสร้าง JSON พร้อมวิธีประเมินคุณภาพอย่างมีหลักฐาน
Speculative Decoding และ Attention Backend: เร็วขึ้นเมื่อเงื่อนไขตรงคู่มือเจาะลึก Speculative Decoding, Multi-Token Prediction (MTP) และ Attention Backends เช่น FlashAttention, FlashInfer เพื่อเร่งความเร็ว Local LLM โดยเข้าใจเงื่อนไขที่ทำให้ระบบเร็วขึ้นหรือช้าลง
การจัดการ VRAM สำหรับ MoE ขนาดใหญ่บน Multi-GPU Clusterคู่มือเจาะลึกการรันและคำนวณ VRAM สำหรับโมเดล Mixture-of-Experts (MoE) ขนาดใหญ่ เช่น DeepSeek-V3, DeepSeek-R1 บน Multi-GPU Cluster ด้วย EP, TP, PP และ MLA