Qwen3.8-Flash-Next GGUF รันในเครื่องได้ฟรี ถ้าเครื่องคุณรองรับไฟล์ขนาด 72.5 GB
Qwen3.8-Flash-Next เปิดให้โหลดไฟล์ GGUF ไปรันบนเครื่องได้ฟรี แต่ไฟล์เล็กสุดมีขนาด 72.5 GB สรุปให้ดูว่าต้องมีเครื่องแบบไหนถึงรันไหว และใครยังไม่ต้องรีบโหลด

ขนาดไฟล์เล็กที่สุดของ Qwen3.8-Flash-Next โมเดล AI รุ่นทดลอง คือ 72.5 GB
ตัวเลขนี้มาจากหน้าดาวน์โหลด Qwen3.8-Flash-Next-GGUF บน Hugging Face ซึ่งในบรรดาไฟล์ทั้งหมด ตัวที่บีบอัดมากที่สุดอยู่ที่ 72.5 GB ส่วนไฟล์ตัวเต็มแบบไม่บีบอัดเลยใหญ่ถึง 354 GB ทุกไฟล์เปิดให้ดาวน์โหลดฟรี ไม่ต้องสมัครสมาชิก และไม่ต้องต่อ API
ทีมพัฒนา Qwen ปล่อย weights ของโมเดลรุ่นนี้ออกมาให้ทุกคนนำไปรันบนเครื่องตัวเองได้ พร้อมระบุตรง ๆ ว่านี่คือโมเดลทดลองที่ใช้สถาปัตยกรรมซึ่งจะนำไปใช้ใน Qwen4 คำถามสำคัญจึงไม่ใช่แค่เรื่องความเก่ง แต่เป็นสเปกเครื่องแบบไหนถึงจะรันไหว เพราะในปี 2026 คำว่า "รันบนเครื่องตัวเอง" ไม่ได้แปลว่าโน้ตบุ๊กทั่วไปจะรันได้เสมอไป
Qwen3.8-Flash-Next คือโมเดลทดลองที่บอกทิศทางของ Qwen4
ทีม Qwen ไม่ได้เรียกโมเดลรุ่นนี้ว่า Qwen4 และไม่ได้บอกว่าเป็นเวอร์ชันสมบูรณ์ ประกาศเปิดตัวเมื่อสิงหาคม 2026 ระบุชัดเจนว่านี่คือโมเดลทดลองที่ใช้สถาปัตยกรรมซึ่งจะเป็นฐานในการพัฒนา Qwen4 ต่อไป พูดง่าย ๆ คือเรากำลังได้ลองเล่นโมเดลต้นแบบที่บอกทิศทางว่าตัวจริงจะออกมาหน้าตาแบบไหน
ด้านความสามารถ ตัวโมเดลรองรับทั้งข้อความ รูปภาพ และวิดีโอ เพราะมีตัวประมวลผลภาพในตัว ส่วน Context Window เริ่มต้นที่ 262,144 token และขยายได้สูงสุดถึง 1,000,000 token ด้วยเทคนิคขยายความยาวอย่าง YaRN
นอกจากนี้ บนหน้าโมเดลยังแสดงตาราง Benchmark เปรียบเทียบกับ Qwen3.8-27B, Qwen3.7-Plus, DeepSeek-V4-Flash-0731 และ Claude-Opus-4.6 โดยทำคะแนนชนะหรือเทียบเท่ารุ่นที่อยู่หัวตารางในเกือบทุกหมวด เช่น ชุดทดสอบการเขียนโค้ด SWE-bench Pro ได้ 62.5 คะแนน, ข้อสอบวัดความรู้เชิงลึก GPQA Diamond ได้ 91.7 คะแนน และการสั่งงานระบบ AndroidWorld ได้ 84.5 คะแนน แม้ตัวเลขเหล่านี้จะเป็นผลทดสอบจากผู้พัฒนาเอง ไม่ใช่การวัดผลจากคนกลาง แต่ก็พอจะอธิบายได้ว่าทำไมหลายคนถึงอยากโหลดมาลองใช้งาน
ประมวลผลจริงแค่ 6B ไม่ได้แปลว่าโหลดแค่ 6B

จุดที่ชวนสับสนที่สุดของโมเดลรุ่นนี้อยู่ตรงตัวเลขพารามิเตอร์ ข้อมูลบนหน้าโมเดลระบุว่ามีพารามิเตอร์รวม 125B หรือ 1.25 แสนล้านตัว แต่เวลาประมวลผลคำตอบจริงจะเปิดใช้งานเพียง 6B เท่านั้น นอกจากนี้ยังมีบล็อกเก็บสถิติ n-gram อีก 51B และโมดูลทำนายหลายคำพร้อมกันอีก 4B รวมอยู่ในไฟล์เดียวกัน
การที่โมเดลเปิดใช้พารามิเตอร์เพียง 6B ตอนทำงาน หมายความว่าตอนสร้างคำตอบแต่ละคำ ระบบจะดึง weights มาคำนวณแค่ส่วนเล็ก ๆ เท่านั้น ไม่ได้คำนวณทั้งโมเดล ทำให้ตอบได้รวดเร็วแม้จะเป็นโมเดลขนาดใหญ่
แต่การคำนวณเฉพาะบางส่วน กับการเก็บข้อมูลทั้งหมดไว้ในเครื่องเป็นคนละเรื่องกัน โมเดลไม่รู้ล่วงหน้าว่าคำถัดไปจะต้องใช้พารามิเตอร์ส่วนไหน จึงต้องโหลดทุกส่วนขึ้นไปรอบนหน่วยความจำ ความเร็วตอนตอบมาจากส่วน 6B ที่ทำงานก็จริง แต่ขนาดไฟล์ที่ต้องเก็บมาจาก 125B บวกกับทุกส่วนที่พ่วงมา สำหรับโมเดลนี้ คำว่า "เร็ว" กับ "เล็ก" จึงไม่ใช่เรื่องเดียวกัน
นอกจากนี้ ตัวเลขบนหน้าเว็บทางการยังไม่ตรงกันอยู่บ้าง ช่องสรุปด้านข้างระบุว่ามี 177B ขณะที่เนื้อหาหลักแจกแจงเป็น 125B บวกกับส่วนประกอบอื่น และไม่ได้อธิบายว่าสองตัวเลขนี้นับต่างกันอย่างไร สิ่งที่เราใช้อ้างอิงได้ชัดเจนที่สุดจึงเป็นขนาดไฟล์ เพราะนั่นคือปริมาณหน่วยความจำที่เครื่องต้องใช้จริง
บีบไฟล์ GGUF ได้ แต่บีบได้แค่นี้
ไฟล์ที่เปิดให้ดาวน์โหลดเป็นฟอร์แมต GGUF ซึ่งโปรแกรมรันโมเดลบนเครื่องทั่วไปเปิดใช้ได้ทันที ในรายการมีทั้งตัวเต็ม 16 บิต และตัวที่ผ่าน Quantization มาแล้ว การบีบอัดคือการลดความละเอียดของตัวเลขในโมเดลลง จากเดิมที่เก็บพารามิเตอร์ละ 16 บิต เหลือ 8 บิต, 4 บิต ไล่ลงไปจนถึงระดับประมาณ 1 บิต ยิ่งใช้จำนวนบิตน้อย ขนาดไฟล์ก็ยิ่งเล็กลง
เมื่อไล่ดูขนาดไฟล์จริงตามระดับการบีบอัด ตัวเต็ม 16 บิตอยู่ที่ 354 GB, ตัว 8 บิต 188 GB, ตัว 4 บิตรุ่น UD-Q4_K_XL 111 GB และตัวที่บีบอัดมากที่สุดอย่าง UD-IQ1_S 72.5 GB

72.5 GB คือขนาดไฟล์ที่เล็กที่สุดเท่าที่มีให้ดาวน์โหลดแล้ว และไม่มีตัวเลือกที่บีบได้เล็กกว่านี้อีก ข้อมูลบนหน้าเว็บระบุเพียงขนาดไฟล์ แต่ไม่ได้บอกว่าคุณภาพของคำตอบในแต่ละระดับการบีบอัดต่างกันมากน้อยแค่ไหน ตรงนี้จึงเป็นเรื่องที่ผู้ใช้ต้องทดสอบด้วยตัวเองก่อนตัดสินใจเลือกรุ่นที่จะดาวน์โหลด
เครื่องแบบไหนถึงรัน 72.5 GB ไหว

เรื่องนี้คำนวณจากสเปกฮาร์ดแวร์ได้ตรง ๆ เพราะไฟล์โมเดลไม่ได้แค่วางอยู่บนฮาร์ดดิสก์ แต่ตอนรันจริงต้องโหลดขึ้นไปอยู่ในหน่วยความจำ ซึ่งก็คือ RAM ของเครื่อง หรือ VRAM บนการ์ดจอ และยังต้องเผื่อพื้นที่ว่างอีกก้อนไว้รองรับบริบทการสนทนาที่ยาวขึ้นเรื่อย ๆ
เมื่อเทียบกับตัวเลขจริง โน้ตบุ๊กทั่วไปในปัจจุบันมี RAM อยู่ที่ 16 ถึง 32 GB ขณะที่ไฟล์เล็กที่สุดของโมเดลนี้กินพื้นที่ไปถึง 72.5 GB ซึ่งห่างกันมากเกินกว่าจะแก้ปัญหาด้วยการปิดโปรแกรมอื่น เครื่องที่รันโมเดลนี้ไหวจึงต้องเป็นเครื่องระดับเวิร์กสเตชันที่มีหน่วยความจำรวมขนาดใหญ่มาก หรือเครื่องที่ติดตั้งการ์ดจอหลายใบทำงานร่วมกัน
พูดอีกอย่างคือ ของฟรีชิ้นนี้ใช้ได้ฟรีจริงเฉพาะคนที่มีฮาร์ดแวร์พร้อมอยู่แล้ว ถ้าเครื่องของคุณเป็นโน้ตบุ๊กทำงานทั่วไป ทางเลือกที่เหมาะกว่าคือการขยับไปใช้โมเดลขนาดเล็กอย่าง Gemma 4 E2B แทน
คำสั่งแรก ถ้าเครื่องพร้อมจริง
ถ้าเครื่องของคุณมีสเปกพร้อม วิธีที่หน้าโมเดลแนะนำคือรันผ่าน llama.cpp ซึ่งเป็นเครื่องมือรันโมเดลบนเครื่องตัวเองที่นิยมใช้กันมาก โดยสามารถพิมพ์คำสั่งต่อไปนี้ใน terminal ได้ทันที ทั้งบน macOS และ Linux:
# ติดตั้ง llama.cpp
curl -LsSf https://llama.app/install.sh | sh
# เปิดเซิร์ฟเวอร์ในเครื่อง พร้อมหน้าเว็บให้เข้าไปคุย
llama serve -hf unsloth/Qwen3.8-Flash-Next-GGUF:UD-Q4_K_XLคำสั่งบรรทัดที่สองคือจุดที่ต้องดูให้ละเอียด โดย llama serve จะเปิดเซิร์ฟเวอร์ในเครื่องพร้อมสร้างหน้าเว็บสำหรับพิมพ์คุย ส่วน -hf คือการระบุชื่อ repo บน Hugging Face เพื่อให้โปรแกรมดาวน์โหลดไฟล์ให้อัตโนมัติ และสิ่งที่ตามหลังเครื่องหมาย : คือชื่อรุ่นการบีบอัดที่ต้องการดาวน์โหลด
รุ่น UD-Q4_K_XL ที่ระบุในคำสั่งตัวอย่างคือไฟล์ขนาด 111 GB ไม่ใช่ 72.5 GB ถ้าเครื่องมีพื้นที่เหลือจำกัดแล้วคัดลอกคำสั่งไปวางตรง ๆ ไฟล์ที่ดาวน์โหลดลงเครื่องจะใหญ่กว่าที่คิดไว้เกือบ 40 GB ดังนั้นถ้าต้องการตัวที่เล็กที่สุด ต้องเปลี่ยนท้ายคำสั่งเป็น UD-IQ1_S
ถ้าต้องการคุยผ่าน terminal โดยตรงแบบไม่ผ่านหน้าเว็บ ให้เปลี่ยน llama serve เป็น llama cli ส่วนคำสั่งที่เหลือคงเดิมทุกตัวอักษร สำหรับคนที่ไม่ต้องการใช้ terminal หน้าโมเดลก็มีวิธีรันผ่านโปรแกรมที่มีหน้าต่างกราฟิกอย่าง LM Studio, Jan หรือ Ollama ให้เลือกใช้เช่นกัน ซึ่งไฟล์ที่ดาวน์โหลดยังเป็นก้อนเดิม เปลี่ยนแค่หน้าตาโปรแกรมที่ใช้ควบคุม
โหมดคิดเปิดอยู่ตั้งแต่แรก
เมื่อเริ่มรัน โมเดลอาจตอบยาวกว่าที่ถาม เพราะ Qwen3.8-Flash-Next เปิด Thinking Mode ไว้ตั้งแต่ต้น ตัวโมเดลจะแสดงกระบวนการคิดในบล็อก <think>...</think> ออกมาก่อน แล้วค่อยตามด้วยคำตอบจริง ถ้าไม่ต้องการให้แสดงส่วนนี้ สามารถสั่งปิดได้ผ่านพารามิเตอร์ enable_thinking และ chat_template_kwargs ตอนเรียกใช้
สำหรับการตั้งค่า Sampling Parameters หน้าทางการแนะนำไว้ 2 ชุดตามโหมดที่ใช้งาน ได้แก่ โหมดคิดใช้ temperature=1.0, top_p=0.95, top_k=20 ส่วนโหมดตอบตรงแบบไม่คิดใช้ temperature=0.7, top_p=0.80, top_k=20 พร้อม presence_penalty=1.5 โดยสามารถระบุค่าเหล่านี้ตอนเรียกใช้โมเดลได้ทันที ไม่ต้องแก้ไฟล์ระบบ
อีกจุดหนึ่งที่เปิดไว้เป็นค่าเริ่มต้นคือการเก็บประวัติความคิดข้ามรอบสนทนา โมเดลจะส่งต่อกระบวนการคิดจากรอบก่อนหน้าไปยังรอบถัดไปด้วย ถ้าไม่ต้องการให้ส่งต่อความคิดแบบนี้ สามารถสั่งปิดเป็นรายข้อความได้ด้วย preserve_thinking: False
ใครยังไม่ต้องรีบโหลด
ถ้าเครื่องของคุณเป็นโน้ตบุ๊กทำงานทั่วไป คำตอบตรง ๆ คือรอบนี้ยังไม่ต้องรีบ การดาวน์โหลดไฟล์ 72.5 GB ทิ้งไว้ข้ามคืนแล้วพบว่ารันไม่ขึ้น มีแต่จะเสียเวลาและเปลืองพื้นที่ดิสก์
กลุ่มคนที่เหมาะจะลองใช้จริง ๆ มีไม่กี่กลุ่ม กลุ่มแรกคือคนที่มีเครื่องสเปกสูงอยู่แล้ว และอยากรู้ว่าความเร็วของสถาปัตยกรรมใหม่ต่างจากเดิมแค่ไหน กลุ่มที่สองคือคนที่ทำงานกับข้อมูลลับจนส่งออกนอกเครื่องไม่ได้ และพร้อมลงทุนกับเครื่องเพื่อแลกกับความเป็นส่วนตัว กลุ่มที่สามคือคนที่ทำระบบ Agent ซึ่งต้องอ่านข้อมูลขนาดยาวมากในรอบเดียว และอยากลอง Context Window ระดับ 1,000,000 token บนเครื่องของตัวเอง
และอย่าลืมว่านี่คือรุ่นทดลอง ทีม Qwen ระบุเองว่าเป็นเพียงตัวอย่างสถาปัตยกรรมที่จะนำไปใช้จริงใน Qwen4 การรอดูรุ่นถัดไปจึงเป็นทางเลือกที่คุ้มค่ากว่าการรีบซื้อเครื่องใหม่มารันรุ่นนี้ สำหรับใครที่อยากศึกษาเชิงลึกก่อนตัดสินใจ ยังมีรายงานทางเทคนิค และไฟล์โมเดลต้นฉบับแบบยังไม่บีบอัด ให้เข้าไปดูได้ฟรีเช่นกัน
weights ของโมเดลที่แจกฟรีช่วยตัดค่าใช้จ่ายรายเดือนของ API ออกไปก็จริง แต่ต้นทุนไม่ได้หายไปไหน เพียงแค่เปลี่ยนไปเป็นค่า RAM และสเปกเครื่องที่เราต้องเตรียมไว้เอง
ที่มา: เอกสารทางการของ Qwen3.8-Flash-Next-GGUF
ชอบเรื่องแนวนี้ มีอีบุ๊คฟรีให้อ่านต่อ
Local LLM ฉบับเข้าใจง่าย รัน AI ไว้ในเครื่องตัวเอง ติดตั้ง อัปเดต จัดการ ลบ ครบวงจรด้วย Ollama
กดสมัครแล้วเราจะส่งเทคนิค AI และของแจกใหม่ๆ ให้ทางอีเมล เลิกรับได้ตลอด
Claude Cowork · The Business Playbook

ฉบับภาษาไทย 15 บท เรียนรู้ผ่านโปรเจกต์จำลองต่อเนื่องทั้งเล่ม ตั้งแต่ตั้งค่า Workspace จัดการไฟล์ เชื่อมแอป ตั้งระบบอัตโนมัติ จนถึงสร้าง Plugin


