คู่มือติดตั้ง Gemma 4: โมเดล AI ตัวแรงที่ Google ปล่อยฟรีแบบ Apache 2.0 รันเองได้บนมือถือยันคอมแรง
Google เพิ่งเปลี่ยนโลก Open Source ด้วยการปล่อย Gemma 4 ภายใต้ใบอนุญาต Apache 2.0 ที่แรงระดับพระกาฬ มาดูวิธีติดตั้งและใช้งานทุกขนาดในเครื่องคุณกันครับ

Google DeepMind ได้ปล่อย Gemma 4 ตระกูลโมเดลภาษาขนาดเล็ก (SLM) และขนาดกลางรุ่นล่าสุด แต่จุดเปลี่ยนสำคัญที่สุดในรอบนี้คือ การเปลี่ยนสัญญาอนุญาตมาเป็น Apache 2.0 แบบโอเพนซอร์สเต็มตัว
เดิมทีโมเดลตระกูล Gemma จะมีเงื่อนไขการใช้งานและข้อจำกัดตามนโยบายเฉพาะของ Google แต่การปลดล็อกเป็น Apache 2.0 ทำให้ชุมชนนักพัฒนาสามารถนำไปใช้งานเชิงพาณิชย์ ปรับแต่ง Fine-tune และแจกจ่ายต่อได้อย่างอิสระเทียบเท่าตระกูล Llama หรือ Qwen ขณะที่รุ่นเรือธงอย่าง 31B Dense ทำคะแนนไต่อันดับขึ้นมาติดกลุ่มหัวแถวบน Leaderboard แซงหน้าโมเดลขนาดใหญ่หลายตัว
บทความนี้สรุปสถาปัตยกรรมใหม่ สเปกเครื่องที่จำเป็น และขั้นตอนการติดตั้งใช้งานแบบ Local ตั้งแต่อุปกรณ์ขนาดเล็กอย่าง Raspberry Pi ไปจนถึงเครื่องที่มี GPU พร้อมวิธีแก้ปัญหา Day-0 ที่พบบ่อย
สเปกฮาร์ดแวร์และเครื่องมือที่ต้องเตรียม
Gemma 4 เปิดตัวออกมา 4 ขนาดโมเดลเพื่อตอบสนองการใช้งานที่หลากหลาย:
เครื่องมือที่แนะนำ:
- Ollama: วิธีการติดตั้งที่รวดเร็วและสะดวกที่สุด
- Python 3.10 ขึ้นไป: สำหรับการพัฒนาโปรแกรมและเชื่อมต่อผ่านไลบรารี
- Git: สำหรับติดตั้งไลบรารี Transformers เวอร์ชันล่าสุดจากซอร์สโค้ด
สถาปัตยกรรมใหม่: Hybrid Attention และ Mixture-of-Experts
Gemma 4 ได้รับการปรับปรุงโครงสร้างการคำนวณใหม่ โดยมี 2 หัวใจสำคัญ:
- Hybrid Attention: สลับการประมวลผลระหว่าง Global Attention (มองบริบทภาพรวม) และ Sliding Window Attention (โฟกัสเฉพาะช่วงหน้าต่างสั้นๆ) ช่วยให้รองรับ Context Window ได้ยาวตั้งแต่ 128K ถึง 256K tokens โดยไม่ทำให้หน่วยความจำล้น
- สถาปัตยกรรม MoE ในรุ่น 26B-A4B: มี Expert ทั้งหมด 128 ตัว แต่จะเลือก Activate เพียง 8 ตัวต่อโทเค็น ทำให้ได้คุณภาพคำตอบเทียบเท่า 97% ของรุ่น 31B Dense แต่ใช้พลังงานและทรัพยากรประมวลผลน้อยกว่าอย่างมาก เป็นตัวเลือกที่คุ้มค่าที่สุดสำหรับเครื่องที่มี RAM 16GB ขึ้นไป
วิธีที่ 1: รันผ่าน Ollama (สะดวกรวดเร็วที่สุด)
เหมาะสำหรับการทดสอบผ่าน Command Line หรือเรียกใช้ API ภายในเครื่อง:
- ติดตั้ง Ollama:
ดาวน์โหลดจาก ollama.com หรือติดตั้งบน Linux ด้วยคำสั่ง:
curl -fsSL https://ollama.com/install.sh | sh- ดาวน์โหลดโมเดล:
เปิด Terminal แล้วเลือกขนาดโมเดลที่ต้องการ:
# สำหรับโน้ตบุ๊กทั่วไป (โมเดลมาตรฐาน E4B)
ollama pull gemma4
# สำหรับอุปกรณ์ขนาดเล็กหรือเน้นความเร็ว
ollama pull gemma4:e2b
# สำหรับงานที่ต้องการความแม่นยำสูง
ollama pull gemma4:26b
ollama pull gemma4:31b- เริ่มใช้งาน:
รันคำสั่งแชตผ่าน Terminal:
ollama run gemma4วิธีที่ 2: รันผ่าน LM Studio (สำหรับสาย GUI)
หากต้องการอินเทอร์เฟซแบบหน้าต่างแอปพลิเคชัน:
- ดาวน์โหลดโปรแกรมจาก lmstudio.ai
- ค้นหาโมเดลด้วยคำว่า
gemma-4 - เลือกไฟล์นามสกุล GGUF ในระดับ Quantization ที่แนะนำคือ
Q4_K_M - กดดาวน์โหลดและสลับไปที่แท็บ Chat เพื่อเริ่มใช้งาน
Gemma 4 บน LM Studio รองรับการทำงานแบบ Vision ในตัว สามารถลากรูปภาพเข้าไปในกล่องแชตเพื่อให้โมเดลวิเคราะห์องค์ประกอบภาพได้ทันที
วิธีที่ 3: รันผ่านโค้ด Python ด้วย Hugging Face Transformers
สำหรับนักพัฒนาที่ต้องการสร้าง AI Agent หรือไปป์ไลน์ประมวลผล:
เนื่องจากเป็นโมเดลที่เพิ่งเปิดตัว ไลบรารี transformers บน PyPI เวอร์ชันหลักอาจยังไม่มีการกำหนดค่าของ Gemma 4 ให้ติดตั้งจาก GitHub Main Branch โดยตรง:
pip install git+https://github.com/huggingface/transformers.gitตัวอย่างโค้ดเรียกใช้งานโมเดล Multimodal ขนาดเล็ก (E2B):
from transformers import pipeline
# โหลดโมเดลสำหรับประมวลผลข้อความและภาพ
pipe = pipeline("any-to-any", model="google/gemma-4-e2b-it")
# ตัวอย่างอินพุตแบบผสมผสาน (Text + Image)
messages = [
{
"role": "user",
"content": [
{"type": "text", "text": "วิเคราะห์รูปนี้ว่ามีจุดไหนที่เสี่ยงอันตรายในสถานที่ก่อสร้างบ้าง"},
{"type": "image", "image": "https://example.com/construction_site.jpg"}
]
}
]
output = pipe(messages, max_new_tokens=500)
print(output[0]['generated_text'])การใช้งาน Thinking Mode สำหรับโจทย์เหตุผลเชิงลึก
Gemma 4 รุ่น 31B และ 26B MoE มีความสามารถในการใช้เหตุผลแบบเป็นขั้นตอน (Chain-of-Thought) สูงขึ้นอย่างเห็นได้ชัด โดยเฉพาะในโจทย์คณิตศาสตร์และการเขียนโปรแกรม
คุณสามารถสั่งให้โมเดลเปิดกระบวนการคิดก่อนตอบ โดยระบุ Token พิเศษ <|think|> ใน System Prompt ตัวโมเดลจะพ่นขั้นตอนการวิเคราะห์ออกมาภายในแท็ก <|channel>thought ...<channel|> ซึ่งนำมาใช้ Debug ตรรกะของโมเดลได้สะดวก
เทคนิคการจัดลำดับ Multimodal Prompt
Gemma 4 รองรับข้อมูลหลากหลายมิติ (Text, Image, Video และ Audio ในรุ่นขนาดเล็ก)
หลักการจัดวางลำดับข้อมูลที่มีประสิทธิภาพสูงสุด คือการ ส่งไฟล์สื่อ (รูปภาพหรือเสียง) ไปก่อนข้อความคำสั่งเสมอ เช่น ส่งคลิปวิดีโอเข้าไปใน Context ก่อน แล้วจึงตามด้วยข้อความ "สรุปประเด็นสำคัญจากวิดีโอนี้" วิธีนี้ช่วยให้โมเดลจัดสรร Attention ไปยังเนื้อหาภาพได้อย่างครบถ้วน
นอกจากนี้ สถาปัตยกรรมยังรองรับ Variable Aspect Ratio โดยไม่ต้องบังคับครอบตัดภาพเป็นสี่เหลี่ยมจัตุรัส ช่วยเพิ่มความแม่นยำในการอ่านเอกสาร (OCR) และการตรวจจับตำแหน่งข้อความในภาพ
การแก้ปัญหาทางเทคนิค (Troubleshooting)
-
Error
ValueError: model type gemma4 not recognized:
เกิดจากเวอร์ชันtransformersในสภาพแวดล้อมยังไม่รองรับ ให้ติดตั้งเวอร์ชันล่าสุดจาก GitHub ด้วยคำสั่งpip install git+https://github.com/huggingface/transformers.git -
Error
mm_token_type_idsในขั้นตอน Fine-tuning:
โมเดลต้องการโครงสร้างฟิลด์mm_token_type_idsแม้จะเป็นการเทรนเฉพาะชุดข้อมูลข้อความล้วน สามารถแก้ไขโดยกำหนดremove_unused_columns=FalseในTrainingArgumentsหรือสร้าง Custom Data Collator -
ประสิทธิภาพการรันบนอุปกรณ์ขอบ (Edge Device / Raspberry Pi 5):
สำหรับรุ่น E2B บนบอร์ดขนาดเล็ก แนะนำให้แปลงโมเดลผ่านเฟรมเวิร์ก LiteRT ของ Google และใช้ Quantization แบบ 4-bit ซึ่งช่วยเพิ่มความเร็วในการทำ Prefill ได้สูงถึง 133 tokens/sec
สรุปภาพรวม
การปล่อย Gemma 4 ภายใต้สัญญาอนุญาต Apache 2.0 เป็นก้าวสำคัญที่ช่วยปลดล็อกการพัฒนาระบบ AI บนอุปกรณ์ส่วนตัว (On-device AI) และแอปพลิเคชันภายในองค์กรที่ต้องการรักษาความเป็นส่วนตัวของข้อมูล
ด้วยประสิทธิภาพที่ครอบคลุมตั้งแต่อุปกรณ์ขนาดเล็กไปจนถึงเซิร์ฟเวอร์ และรองรับภาษาหลากหลายกว่า 140 ภาษารวมถึงภาษาไทย Gemma 4 จึงเป็นหนึ่งในตัวเลือกโมเดลโอเพนซอร์สที่น่าสนใจที่สุดสำหรับการนำไปประยุกต์ใช้ในโปรเจกต์ยุคปัจจุบัน
แหล่งอ้างอิง
- Welcome Gemma 4: Frontier multimodal intelligence on device | Hugging Face Blog
- Gemma 4 model card | Google AI for Developers
- Bring state-of-the-art agentic skills to the edge with Gemma 4 | Google Developers Blog
- Gemma 4: Expanding the Gemmaverse with Apache 2.0 | Google Open Source Blog
- Gemma 4 | How to Run Locally | Unsloth Documentation
- gemma4 | Ollama Model Library
ชอบเรื่องแนวนี้ มีอีบุ๊คฟรีให้อ่านต่อ
Vibe Coding สำหรับคนไม่ใช่โปรแกรมเมอร์ ใช้ Claude Code สร้าง landing page, mini app และ prototype จริงโดยไม่ต้องเขียนโค้ด
กดสมัครแล้วเราจะส่งเทคนิค AI และของแจกใหม่ๆ ให้ทางอีเมล เลิกรับได้ตลอด
Vibecoding · The Developer's Playbook

ฉบับภาษาไทย 10 บท พา dev สร้าง Personal Finance Tracker (LINE OA + AI จัดหมวดอัตโนมัติ) ตั้งแต่โครงโปรเจกต์บรรทัดแรกจนแอปทำงานจริงบน server


