Kimi K3 โมเดลเปิด 2.8 ล้านล้านพารามิเตอร์แซงรุ่นท็อปจริงไหม เช็ก 3 ชั้นก่อนเชื่อพาดหัว
Moonshot AI เปิดตัว Kimi K3 โมเดลเปิดขนาด 2.8 ล้านล้านพารามิเตอร์ พร้อมพาดหัวว่าแซงรุ่นท็อปของตลาด แต่คำว่าแซงต้องแยกดูก่อนว่าแซงใคร ใครเป็นคนวัด และวัดจากงานอะไร

Kimi K3 เป็นโมเดลภาษาแบบเปิดรุ่นใหม่จาก Moonshot AI ตอนนี้โมเดลนี้กำลังเป็นที่พูดถึง โดยมีพาดหัวที่คนแชร์ต่อกันว่า “แซงรุ่นท็อป” ของตลาดได้แล้ว Moonshot AI เป็นบริษัท AI สัญชาติจีน จุดที่ทำให้พาดหัวนี้ดังเร็วคือ Moonshot ระบุว่า K3 เป็นโมเดลเปิดขนาด 2.8 ล้านล้านพารามิเตอร์ตัวแรกของโลก ผู้ใช้โหลดไฟล์ weights หรือไฟล์ตัวเลขสมองกลของโมเดลไปรันบนเครื่องตัวเองได้ โมเดลนี้ยังเป็นโมเดลเปิดที่ใหญ่ที่สุดเท่าที่เคยมีมา จุดเด่นอีกอย่างคือมันมองรูปได้ด้วย และจดจำเนื้อหาในบทสนทนาเดียวได้มากถึงหนึ่งล้านโทเคน (หน่วยนับปริมาณข้อความ)
แต่ทุกครั้งที่เห็นคำว่า “แซง” ต้องแยกให้ชัดก่อนเชื่อ เพราะการแซงในงานเฉพาะทางหนึ่งงานกับการแซงเจ้าตลาดในภาพรวมเป็นคนละเรื่องกัน ตัวเลขที่ค่ายเจ้าของเปิดเผยเองก็มีน้ำหนักต่างจากตัวเลขที่คนนอกวัดอย่างอิสระ ก่อนจะเชื่อพาดหัวนี้ จึงมีสามคำถามที่ควรถาม ได้แก่ แซงใคร วัดด้วยงานอะไร และใครเป็นคนวัด
Kimi K3 แซงในงานหนึ่ง แต่ยังตามหลังทั้งกระดาน
กรณีศึกษาหนึ่งที่ Moonshot ทำเองช่วยให้พาดหัว “แซงรุ่นท็อป” ดูมีน้ำหนักขึ้น กรณีนี้เป็นงาน optimize kernel บนการ์ดจอ (การเขียนโค้ดระดับล่างเพื่อรีดพลังการ์ดจอออกมาให้ได้มากที่สุด) ซึ่ง K3 ทำได้ดีกว่าทั้ง Claude Opus 4.8 และแม้แต่ GPT-5.6 Sol
ฟังแล้วน่าตื่นเต้น แต่ต้องดูให้ครบ งานนั้นเฉพาะทางมากๆ และ Moonshot เป็นผู้ออกแบบและรันเอง ไม่ใช่ผลวัดจากคนนอก เมื่อดูภาพรวมทั้งชุดข้อสอบ บล็อกทางการของ Moonshot ระบุว่า K3 ยังตามหลังโมเดลปิดที่แรงที่สุดสองตัว ได้แก่ Claude Fable 5 กับ GPT-5.6 Sol ซึ่งเป็นรุ่นท็อปของ Anthropic และ OpenAI
นอกจากนี้ Moonshot ยังยอมรับเองด้วยว่าเวลาใช้งานจริง ผู้ใช้ยังรู้สึกได้ว่า K3 ด้อยกว่าสองตัวนั้น เท่ากับว่าถ้าฟังจากปากค่ายเจ้าของเอง คำว่าแซงเป็นจริงแค่ในงานเฉพาะทางหนึ่งงาน ส่วนภาพรวมยังตามหลังอยู่
ตัวเลขจากคนนอกให้ผลอีกแบบ

เรื่องนี้ยังมีข้อมูลอีกด้านที่ไม่ได้มาจากค่ายเจ้าของ Simon Willison นักพัฒนาที่ไล่ทดสอบโมเดลใหม่ๆ อยู่ตลอด หยิบตัวเลขจาก Artificial Analysis หน่วยวัดผลโมเดลอิสระที่ไม่มีส่วนได้ส่วนเสียกับยอดขายของโมเดล มาให้เราดู
ในชุดทดสอบงานความรู้ที่ต้องคิดต่อเนื่องยาวๆ ของหน่วยงานนี้เอง K3 ได้คะแนน Elo ที่ 1547 (Elo เป็นระบบให้แต้มแบบเดียวกับที่ใช้จัดอันดับหมากรุก ยิ่งสูงยิ่งเก่ง) คะแนนนี้ตามหลังแค่ Claude Fable 5 ตัวเดียว แปลว่าในสนามนี้ K3 อยู่เหนือ GPT-5.6 Sol ด้วยซ้ำ ส่วนสนามเขียนโค้ดหน้าเว็บของ Arena.ai ตอนนี้ K3 ก็ขึ้นนำเป็นอันดับหนึ่ง แซงแม้กระทั่ง Fable 5
ต้องแยกตัวเลขที่ค่ายเจ้าของปล่อยเองออกจากตัวเลขที่คนนอกวัดอย่างอิสระ เพราะทั้งสองแบบมีน้ำหนักไม่เท่ากัน ค่ายเจ้าของเลือกได้ว่าจะโชว์สนามไหน แต่ตัวเลขจากคนนอกแต่ละชุดก็วัดคนละงานอยู่ดี ชุดหนึ่งวัดงานความรู้ยาวๆ อีกชุดวัดการเขียนหน้าเว็บ จึงเหมารวมไม่ได้ว่า K3 แซงหรือแพ้ยี่ห้อไหน ทุกครั้งที่เห็นคำว่าแซง ต้องถามต่อเสมอว่าแซงในสนามไหน
ราคา Kimi K3 แพงเท่า Claude Sonnet
มีอีกจุดที่พาดหัวมักไม่พูดถึง แต่สำคัญไม่แพ้เรื่องคะแนน นั่นคือราคา
K3 คิดราคา 3 ดอลลาร์ต่อข้อความขาเข้าหนึ่งล้านโทเคน (โทเคนคือหน่วยนับข้อความที่โมเดลใช้คิดเงิน) และ 15 ดอลลาร์ต่อข้อความขาออกหนึ่งล้านโทเคน เรตนี้เท่ากับ Claude Sonnet ของ Anthropic พอดี และ K3 ยังเป็นโมเดลที่แพงที่สุดเท่าที่ค่าย AI จีนเคยเปิดตัวมา
ลองเทียบกับรุ่นก่อนหน้าอย่าง Kimi K2.6 ที่มีราคาประมาณ 0.95 ถึง 4 ดอลลาร์ จะเห็นว่าราคาของ K3 กระโดดขึ้นมาชัดเจน ภาพจำเดิมที่ว่าโมเดลเปิดจากค่ายจีนคือของถูก ใช้กับตัวนี้ไม่ได้แล้ว คำว่าแซงจึงต้องดูควบคู่กับราคาเสมอ เพราะถ้าสองตัวเก่งพอกัน แต่ตัวหนึ่งแพงกว่าเท่าตัว การแซงในผลทดสอบก็อาจไม่คุ้มกับค่าใช้จ่ายจริง
เช็ก 3 ชั้น ก่อนเชื่อพาดหัวโมเดลใหม่แซงเจ้าตลาด

เคสของ K3 เหมาะจะใช้ฝึกแยกแยะพาดหัว เพราะข่าวแนว “โมเดลใหม่แซงเจ้าตลาด” จะโผล่มาเรื่อยๆ แทบทุกเดือน ก่อนแชร์หรือตัดสินใจเปลี่ยนไปใช้ ลองเช็กสามชั้นนี้ก่อน
- แซงใคร · แซงรุ่นกลางๆ หรือแซงรุ่นท็อปตัวจริงของแต่ละค่าย เพราะการชนะรุ่นเก่าของปีที่แล้วกับการชนะรุ่นล่าสุดต่างกันมาก
- ใครวัด · ตัวเลขมาจากค่ายเจ้าของเองหรือจากหน่วยวัดผลอิสระ เพราะค่ายเจ้าของเลือกโชว์สนามที่ตัวเองเด่นได้ ส่วนการวัดจากคนนอก ค่ายเจ้าของเลือกสนามเองไม่ได้
- วัดงานอะไร · งานที่ใช้วัดตรงกับงานจริงของเราไหม เพราะเก่งงานเขียน kernel บนการ์ดจอ ไม่ได้แปลว่าเก่งงานตอบอีเมลหรือสรุปเอกสารของเรา
และชั้นที่ลึกที่สุดคือ benchmark (ชุดข้อสอบมาตรฐานที่ใช้วัดความเก่งของโมเดล) จำนวนมากยังไม่แตะเรื่องที่สำคัญมากสำหรับโมเดลยุคนี้ เรื่องนั้นคือโมเดลจะเรียกใช้เครื่องมือหรือโปรแกรมอื่นแทนเราได้อย่างน่าเชื่อถือเพียงใด แม้บทสนทนาจะยาวขึ้นเรื่อยๆ
แม้แต่การทดสอบยอดฮิตอย่างการให้โมเดลวาดรูปนกกระทุงขี่จักรยาน ซึ่งเคยใช้ดูคุณภาพโมเดลได้คร่าวๆ ทุกวันนี้ก็เริ่มใช้วัดอะไรได้ไม่มาก และการทดสอบนี้ไม่เคยบอกได้เลยว่าโมเดลทำงานร่วมกับเครื่องมือในบทสนทนายาวๆ ได้ดีแค่ไหน (เรื่องนกกระทุงกับสิ่งที่คะแนนบอกไม่ได้ เล่าไว้ละเอียดใน Kimi K3 กับภาพนกกระทุงขี่จักรยานราคา 25 เซนต์) เคยมีโมเดลที่ทุบสถิติ benchmark มาแล้ว แต่เมื่อสั่งให้เขียนเกมจริง โมเดลกลับเดินในเกมที่ตัวเองเขียนไม่ได้ อย่างที่เห็นในเคส GLM 5.2 ที่ทุบสถิติ benchmark แต่เล่นเกมที่ตัวเองเขียนไม่ได้
งานของเราเองคือบททดสอบที่เชื่อได้ที่สุด
แล้วควรทำยังไงกับข่าวแบบนี้ ลองสร้างชุดทดสอบเล็กๆ จากงานจริงของเรา แล้วนำโมเดลใหม่ทุกตัวมารันเปรียบเทียบในงานชุดนั้น วิธีนี้เชื่อถือได้กว่าการนั่งรอดูว่าใครได้คะแนนสูงกว่ากัน เพราะงานที่เราทำซ้ำๆ ทุกวันคือข้อสอบที่ตรงกับเราที่สุด และไม่มีค่ายไหนออกแบบข้อสอบมาเอาใจเราได้
ส่วนใครอยากลอง K3 ตอนนี้ ใช้ได้แล้วทั้งผ่านหน้าเว็บของ Kimi และผ่าน Kimi API Platform สำหรับต่อเข้าโปรแกรมของเราเอง ส่วนไฟล์ weights เต็มๆ ที่โหลดไปรันบนเครื่องตัวเองได้ Moonshot ประกาศว่าจะเปิดให้ดาวน์โหลดภายในวันที่ 27 กรกฎาคม 2026
Kimi K3 เป็นโมเดลที่น่าจับตาจริง แต่ลำพังพาดหัวที่บอกว่าแซงก็ใช้ฟันธงไม่ได้ สิ่งที่ตัดสินได้จริงไม่ใช่ตารางคะแนนของค่ายไหนหรือคะแนน Elo ของใคร แต่คือผลทดสอบจากงานจริงที่เราทำทุกวัน
ที่มา:
- บทความ Kimi K3 Tech Blog: Open Frontier Intelligence จาก Moonshot AI
- บทความ Kimi K3, and what we can still learn from the pelican benchmark จาก Simon Willison
ชอบเรื่องแนวนี้ มีอีบุ๊คฟรีให้อ่านต่อ
Local LLM ฉบับเข้าใจง่าย รัน AI ไว้ในเครื่องตัวเอง ติดตั้ง อัปเดต จัดการ ลบ ครบวงจรด้วย Ollama
กดสมัครแล้วเราจะส่งเทคนิค AI และของแจกใหม่ๆ ให้ทางอีเมล เลิกรับได้ตลอด
Claude Cowork · The Business Playbook

ฉบับภาษาไทย 15 บท เรียนรู้ผ่านโปรเจกต์จำลองต่อเนื่องทั้งเล่ม ตั้งแต่ตั้งค่า Workspace จัดการไฟล์ เชื่อมแอป ตั้งระบบอัตโนมัติ จนถึงสร้าง Plugin


