Qwen3.8-27B คือโมเดลเปิดที่มองหน้าจอแล้วสั่งงานได้เอง โดยทำคะแนน OSWorld ได้ 84.3 เทียบกับรุ่นก่อนที่ 63.9
Qwen3.8-27B คือโมเดลเปิดขนาด 27B ที่เข้าใจภาพและกดสั่งงานบนหน้าจอได้จริง จุดที่ต้องดูคือส่วนต่างกับรุ่นก่อนหน้าขนาดเท่ากัน ไม่ใช่อันดับในตาราง

Qwen3.8-27B เป็นโมเดลเปิด (open-weight คือค่ายผู้พัฒนาปล่อยไฟล์น้ำหนักของโมเดลออกมาให้โหลดไปใช้เองได้) ที่เข้าใจภาพและสั่งงานผ่านหน้าจอได้เอง
ที่ผ่านมา โมเดลเปิดเก่งเรื่องการตอบคำถามและเขียนโค้ดออกมาให้เราอ่าน แต่ในการทำงานจริง เรายังต้องเปิดโปรแกรม คลิกปุ่ม กรอกแบบฟอร์ม และเปิดสไลด์ที่ลูกค้าส่งมาดูเองอยู่ดี เส้นแบ่งเส้นนี้คือจุดที่รุ่นใหม่ขยับ
ในการทดสอบการสั่งงานบนเครื่องคอมพิวเตอร์จริงอย่าง OSWorld-Verified ตัว Qwen3.8-27B ทำคะแนนได้ 84.3 คะแนน เทียบกับรุ่นก่อนหน้าขนาดเท่ากันอย่าง Qwen3.6-27B ที่ทำได้ 63.9 คะแนน โดยทาง Qwen เผยแพร่ผลการทดสอบทั้งหมดไว้บนหน้าโมเดล Qwen3.8-27B
โมเดลรุ่น 27B นี้มีขนาด 27 พันล้านพารามิเตอร์ ซึ่งไม่ใช่รุ่นใหญ่ที่สุด แปลว่าคะแนนที่เพิ่มขึ้นไม่ได้มาจากการขยายขนาดโมเดล แต่เกิดจากการปรับปรุงประสิทธิภาพภายในรุ่นขนาดเดียวกัน
Qwen3.8-27B รองรับภาพและวิดีโอในโมเดลเดียว

หน้าโมเดลระบุว่า Qwen3.8-27B เป็นโมเดลภาษาที่มาพร้อม Vision Encoder สำหรับประมวลผลภาพ
จุดสำคัญคือ โมเดลไม่ได้ใช้โมดูลอ่านภาพแยกจากภายนอก แต่ส่งข้อมูลภาพเข้าไปประมวลผลพร้อมกับข้อความในโมเดลตัวเดียวกันโดยตรง ทำให้ไม่ต้องแปลงภาพเป็นข้อความบรรยายก่อนส่งต่อ
ความสามารถนี้ครอบคลุมทั้งภาพนิ่งและวิดีโอ ตั้งแต่แผนภาพทางวิชาการ เอกสาร ไปจนถึงวิดีโอความยาวระดับชั่วโมง เวลาเรียกใช้งานก็ส่งรูปภาพผ่าน image_url หรือวิดีโอผ่าน video_url ไปพร้อมกับข้อความได้ทันทีโดยไม่ต้องแยกระบบ
สำหรับการประมวลผลวิดีโอยาวระดับชั่วโมง หน้าโมเดลแนะนำให้ตั้งค่า longest_edge ใน video_preprocessor_config เป็น 469,762,048 หรือเทียบเท่ากับ 224,000 โทเคนวิดีโอ ซึ่งเป็นหน่วยย่อยของข้อมูลภาพ เพื่อให้โมเดลจับเฟรมภาพได้ถี่ขึ้นและเข้าใจเนื้อหาได้ละเอียดขึ้น ถ้าไม่ตั้งค่านี้ โมเดลยังทำงานได้ แต่จะประมวลผลเฟรมภาพแบบห่างๆ ทำให้ความแม่นยำลดลง
OSWorld · WebArena · AndroidWorld ชุดทดสอบการคุมหน้าจอจริง

ชุดทดสอบทั้งสามชุดนี้ไม่ได้วัดผลด้วยการตอบคำถามทั่วไป แต่ปล่อยให้โมเดลลงมือทำงานจริงบนหน้าจอตามโจทย์ที่กำหนด แล้ววัดผลว่าทำภารกิจสำเร็จกี่งาน
| ชุดทดสอบ | แพลตฟอร์มที่ทดสอบ | Qwen3.8-27B | Qwen3.6-27B |
|---|---|---|---|
| OSWorld-Verified | เครื่องคอมพิวเตอร์ | 84.3 | 63.9 |
| WebArena-Verified | เว็บเบราว์เซอร์ | 64.8 | 48.8 |
| AndroidWorld | ระบบมือถือ Android | 81.9 | 70.3 |
เมื่อเทียบกับรุ่นก่อนหน้าขนาดเท่ากันอย่าง Qwen3.6-27B คะแนนของ Qwen3.8-27B เพิ่มขึ้นในทุกด้าน โดยเพิ่มขึ้น 20.4 คะแนนบนเครื่องคอมพิวเตอร์ 16.0 คะแนนบนเว็บเบราว์เซอร์ และ 11.6 คะแนนบนมือถือ
ตัวอย่างเช่น สั่งให้โมเดล "เปิดไฟล์นี้ คัดลอกตัวเลขในคอลัมน์ที่สาม ไปวางในฟอร์มบนหน้าเว็บ แล้วกดส่งข้อมูล" โมเดลที่ตอบได้เฉพาะข้อความทำงานประเภทนี้ไม่ได้ เพราะต้องมองเห็นตำแหน่งปุ่มบนหน้าจอขณะนั้น แล้วคลิก รอหน้าเว็บโหลด และตรวจสอบว่าเปิดหน้าจอถูกที่หรือไม่ เราเคยเล่าการทำงานของโมเดลสายคุมหน้าจอไว้แล้วในบทความ Fara1.5-27B Computer Use Agent จาก Microsoft
เขียนโค้ดได้เองตั้งแต่ต้นจนจบ
กลุ่มความสามารถถัดมาคืองานเขียนและแก้โค้ดแบบอัตโนมัติต่อเนื่องจนเสร็จสิ้น ไม่ใช่แค่สร้างโค้ดตัวอย่างออกมาให้เรานำไปแก้ต่อเอง
- Terminal Bench 2.1 ชุดทดสอบการรันคำสั่งและแก้ปัญหาบนหน้าจอคำสั่ง Terminal: ทำได้ 73.0 คะแนน เทียบกับรุ่นก่อน 63.4 คะแนน
- SWE-bench Pro ชุดทดสอบการแก้บั๊กและพัฒนาซอฟต์แวร์จริง: ทำได้ 61.7 คะแนน เทียบกับรุ่นก่อน 53.5 คะแนน
- NL2Repo-Bench ชุดทดสอบการสร้างโค้ดทั้งโปรเจกต์จากคำสั่งที่เขียนด้วยภาษาทั่วไป: ทำได้ 42.3 คะแนน เทียบกับรุ่นก่อน 36.2 คะแนน
- DeepSWE 1.1 ชุดทดสอบการแก้โจทย์วิศวกรรมซอฟต์แวร์: ทำได้ 42.2 คะแนน เทียบกับรุ่นก่อน 13.3 คะแนน
บนชุดทดสอบ DeepSWE 1.1 คะแนนเพิ่มขึ้นถึง 28.9 คะแนน ซึ่งเป็นส่วนต่างที่กว้างที่สุดในกลุ่มนี้ แม้จะใช้ขนาดพารามิเตอร์เท่าเดิม
นอกจากนี้ยังมีชุดทดสอบภายในอย่าง QwenSWEBench ที่ทำได้ 79.0 คะแนน (จากรุ่นก่อน 49.3 คะแนน) แต่เนื่องจากเป็นชุดทดสอบที่ทาง Qwen จัดทำขึ้นเองและคนภายนอกไม่สามารถทดสอบซ้ำได้ จึงควรใช้อ้างอิงเป็นข้อมูลประกอบเบื้องต้น มากกว่าจะนำไปเทียบกับชุดทดสอบมาตรฐานทั่วไป
สี่บรรทัดที่ใช้ตัดสินใจได้ก่อนโหลด
นอกจากคะแนนทดสอบแล้ว สเปกพื้นฐาน 4 ข้อนี้คือสิ่งที่ช่วยตัดสินใจก่อนนำไปใช้งาน:
- ขนาด 27 พันล้านพารามิเตอร์: เป็นขนาดที่ให้ประสิทธิภาพสูงและสามารถนำไปติดตั้งและรันบนเครื่องเซิร์ฟเวอร์จริงได้
- มี Vision Encoder ในตัว: ประมวลผลทั้งภาพและข้อความได้ในโมเดลเดียวกัน โดยไม่ต้องต่อโมดูลอ่านภาพเพิ่มจากภายนอก
- ความยาวบริบท Context Window ขนาด 262,144 โทเคน: รองรับการอ่านข้อมูลต่อเนื่องได้ทันที และขยายได้สูงสุดถึง 1,000,000 โทเคน ด้วยเทคนิคการขยายบริบทอย่าง YaRN
- สัญญาอนุญาต Apache-2.0: เป็นสัญญาอนุญาตแบบเปิดที่นำไปพัฒนาต่อยอดและใช้งานเชิงพาณิชย์ได้จริง
จุดเด่นเรื่องสัญญาอนุญาตแบบเปิดนี้ ช่วยให้องค์กรที่มีข้อกำหนดเรื่องความปลอดภัยของข้อมูล และไม่สามารถส่งข้อมูลออกนอกระบบ มีทางเลือกติดตั้งและใช้งานโมเดลได้เอง
โหมดคิดเปิดไว้ให้แล้ว แต่ปรับให้ตื้นลงไม่ได้แปลว่าเร็วขึ้น
Qwen3.8-27B เปิดโหมดการคิดหรือ Thinking Mode มาเป็นค่าเริ่มต้น โดยโมเดลจะไล่เรียงเหตุผลก่อนตอบ และถ้างานไหนไม่ต้องการใช้กระบวนการคิด ก็เลือกปิดเป็นรายคำขอได้โดยไม่ต้องปิดทั้งระบบ
ระดับความลึกของการคิดปรับได้ผ่านพารามิเตอร์ reasoning_effort 3 ระดับ:
xhigh(ค่าเริ่มต้น): สำหรับงานซับซ้อนที่ต้องวิเคราะห์อย่างละเอียดmedium: สำหรับงานที่ต้องการความสมดุลระหว่างความแม่นยำและความเร็วlow: สำหรับงานทั่วไปที่เน้นความรวดเร็วและประหยัดต้นทุน
นอกจากนี้ยังมีพารามิเตอร์ preserve_thinking ซึ่งเปิดไว้เป็นค่าเริ่มต้นเช่นกัน ทำหน้าที่เก็บกระบวนการคิดจากข้อความก่อนหน้าไว้ในประวัติบทสนทนาต่อเนื่อง และปิดได้ถ้าไม่ต้องการ
ข้อควรระวังสำคัญคือ ตามปกติการลดระดับการคิดจะช่วยให้โมเดลตอบแต่ละรอบได้เร็วขึ้นและประหยัดขึ้น แต่หน้าโมเดลเตือนไว้ชัดเจนว่า สำหรับงานประเภท AI Agent ที่ต้องทำงานต่อเนื่องหลายขั้นตอน การลดระดับการคิดไม่ได้แปลว่างานจะเสร็จเร็วขึ้นเสมอไป เพราะการวิเคราะห์ที่ตื้นเกินไปอาจทำให้วางแผนผิดพลาดจนต้องทำใหม่ซ้ำๆ และอาจใช้เวลารวมกับปริมาณโทเคนมากกว่าเดิม
การปรับระดับความลึกของการคิดกำลังกลายเป็นฟังก์ชันมาตรฐานของโมเดลรุ่นใหม่ ตัวอย่างหนึ่งคือ Gemini 3.7 Flash ที่ปรับความลึกการคิดได้ด้วย thinking_level ซึ่งเราเคยเล่าไว้แล้ว
สามทางที่เอาไปใช้ได้จริง แล้วทางไหนของใคร
1. เรียกใช้งานผ่าน API หน้าโมเดลระบุว่ารองรับการเรียกใช้งานผ่านช่องทาง Chat Completions API ในรูปแบบที่เข้ากันได้กับ OpenAI และใช้ร่วมกับเฟรมเวิร์กสำหรับรันโมเดลส่วนใหญ่ได้ หรือรอใช้บริการอย่างเป็นทางการผ่าน Qwen Cloud ที่กำลังจะเปิดให้บริการ ทางเลือกนี้เหมาะกับผู้ที่ไม่อยากดูแลระบบเซิร์ฟเวอร์เอง
2. ติดตั้งและรันบนเซิร์ฟเวอร์ของตัวเอง สามารถรันผ่านเอนจินที่ระบุไว้บนหน้าโมเดลอย่าง vLLM, SGLang หรือ TokenSpeed หน้าโมเดลแนะนำเอนจินเหล่านี้สำหรับระบบงานจริงหรือระบบที่ต้องรองรับคำขอพร้อมกันจำนวนมาก แนวทางนี้เหมาะกับทีมที่มีเซิร์ฟเวอร์ของตัวเองและต้องการควบคุมทั้งประสิทธิภาพและความเป็นส่วนตัวของข้อมูล
3. รันบนเครื่องคอมพิวเตอร์ทั่วไปด้วยไฟล์ GGUF สำหรับผู้ที่ต้องการทดสอบหรือรันโมเดลบนเครื่องของตัวเอง สามารถดาวน์โหลดโมเดลที่ Unsloth แปลงเป็นไฟล์ GGUF แบบบีบอัดสำหรับรันบนคอมพิวเตอร์ทั่วไปได้ที่ unsloth/Qwen3.8-27B-GGUF แล้วรันผ่าน llama.cpp, Ollama, LM Studio, Jan หรือ Unsloth Desktop แนวทางนี้เหมาะกับผู้ที่ต้องการทดลองใช้งานเบื้องต้นหรือมีข้อมูลที่ไม่สามารถส่งออกจากเครื่องได้ เราเคยอธิบายแนวทางการรันโมเดลลักษณะนี้ไว้ในบทความ Laguna XS.2 จาก Poolside ที่รันด้วย Ollama คำสั่งเดียว
อีกส่วนที่ต้องตั้งค่าคือพารามิเตอร์ควบคุมการสุ่มคำหรือ Sampling Parameters ที่หน้าโมเดลแนะนำไว้ เท่าที่เฟรมเวิร์กที่ใช้อยู่รองรับ เพราะโหมดคิดกับโหมดปกติใช้ค่าต่างกันชัดเจน
| พารามิเตอร์ | โหมดคิด (Thinking) | โหมดไม่คิด (Non-Thinking) |
|---|---|---|
temperature | 1.0 | 0.7 |
top_p | 0.95 | 0.80 |
top_k | 20 | 20 |
min_p | 0.0 | 0.0 |
presence_penalty | 0.0 | 1.5 |
repetition_penalty | 1.0 | 1.0 |
ตารางนี้ใครวัด แล้วอ่านยังไงไม่ให้หลงทาง
ผลคะแนนทั้งหมดข้างต้นเป็นตัวเลขที่ทาง Qwen ทดสอบและเผยแพร่เองบนหน้าโมเดล ไม่ใช่ผลการประเมินจากหน่วยงานกลาง
การทดสอบหลายรายการเป็นชุดทดสอบภายในที่ทางค่ายสร้างขึ้นเอง เช่น QwenSWEBench, CoWorkBench และ RecreationBench ซึ่งบุคคลภายนอกไม่สามารถทดสอบซ้ำได้ ส่วนการทดสอบฝั่งโค้ดหลายชุดยังรันผ่าน Harness ของ Claude Code ชุดควบคุมนี้ทำหน้าที่ควบคุมวงจรการทำงานเป็นรอบๆ คะแนนที่ได้จึงสะท้อนถึงประสิทธิภาพของทั้งตัวโมเดลและระบบควบคุมไปพร้อมกัน
ขณะเดียวกัน ตารางผลการทดสอบก็แสดงให้เห็นว่า โมเดลปิดอย่าง Opus4.6 Max ยังคงทำคะแนนได้สูงกว่าในหลายชุดทดสอบ เช่น Terminal Bench 2.1 (78.2 เทียบกับ 73.0), NL2Repo-Bench (47.6 เทียบกับ 42.3), GPQA Diamond (91.3 เทียบกับ 89.2) และ HLE (40.0 เทียบกับ 30.8) ตารางนี้จึงไม่ได้แปลว่า Qwen3.8-27B ขึ้นเป็นอันดับหนึ่งในทุกด้าน
วิธีการอ่านผลทดสอบที่ตรงไปตรงมาที่สุด คือการดูพัฒนาการเปรียบเทียบกับรุ่นก่อนหน้าขนาดเดียวกันอย่าง Qwen3.6-27B ซึ่งสะท้อนให้เห็นว่าโมเดลในพิกัดขนาดเท่าเดิมปรับปรุงจนมีประสิทธิภาพสูงขึ้นมากเพียงใด
ลองไล่ดูงานที่คุณทำอยู่ทุกวัน แล้วนับว่ามีกี่ชั่วโมงหมดไปกับการมองหน้าจอแล้วกด นั่นคืองานแบบเดียวกับที่ OSWorld-Verified, WebArena-Verified และ AndroidWorld เอามาวัดกัน
ที่มา:
- Qwen/Qwen3.8-27B · Hugging Face จาก Qwen
- unsloth/Qwen3.8-27B-GGUF · Hugging Face จาก Unsloth
ชอบเรื่องแนวนี้ มีอีบุ๊คฟรีให้อ่านต่อ
Local LLM ฉบับเข้าใจง่าย รัน AI ไว้ในเครื่องตัวเอง ติดตั้ง อัปเดต จัดการ ลบ ครบวงจรด้วย Ollama
กดสมัครแล้วเราจะส่งเทคนิค AI และของแจกใหม่ๆ ให้ทางอีเมล เลิกรับได้ตลอด
สร้าง AI Automation Pipeline ทุกแบบ ด้วย Agents และ Skills

ปูจากพื้นฐาน prompt, context และ cost ไปจนปั้น Skill สั่ง Agent กับ Sub-agent แล้วต่อทุกอย่างเป็น pipeline อัตโนมัติที่ออกแบบเองได้ ดูฟรี 7 บทก่อนตัดสินใจ


