Gemini 4 Argon ชนะ Benchmark 12 จาก 18 รายการที่ Google คัดมา แต่ยังเปิดให้ใช้แค่ทีมป้องกันภัยไซเบอร์
Gemini 4 Argon โมเดลเรือธงตัวใหม่ของ Google ยังเปิดให้แค่ทีมป้องกันภัยไซเบอร์ใช้ก่อน มาดูว่าใครได้คิวต่อ และราคาเปิดตัวเท่าไหร่

Google เริ่มเปิดให้คนนอกบริษัทได้ทดลองใช้ Gemini 4 Argon โมเดล AI เรือธงตัวใหม่ล่าสุดแล้ว แต่ยังจำกัดไว้เพียงกลุ่มเดียว คือทีมป้องกันภัยไซเบอร์ที่ Google ไว้วางใจผ่านโครงการ Fairwind Program โดยโมเดลเวอร์ชันที่ทีมกลุ่มนี้ได้รับ จะไม่มีระบบกำกับความปลอดภัยอย่าง Cyber Guardrail ที่คอยปฏิเสธคำสั่งอันตรายซึ่งอาจนำไปใช้โจมตีทางไซเบอร์
ส่วนนักพัฒนา องค์กรธุรกิจ และผู้ใช้ทั่วไปยังคงต้องรอไปก่อน ทั้งที่ Argon เป็นโมเดลเรือธงรุ่นแรกของ Google นับตั้งแต่เปิดตัวตระกูล Gemini 3 เมื่อเดือนพฤศจิกายน 2025 อีกทั้งยังช่วยให้ Google กลับมาครองหัวตาราง Benchmark ได้อีกครั้ง โดยในชุดทดสอบ 18 รายการที่ Google เลือกนำมาเปิดเผยเอง Argon ทำคะแนนชนะคู่แข่งไปได้ถึง 12 รายการ และเสมอกับอันดับหนึ่งอีก 1 รายการ
สำหรับใครที่กำลังรอใช้งานโมเดลรุ่นใหม่อยู่ นอกจากเรื่องคะแนนทดสอบแล้ว อีกสองเรื่องสำคัญที่ต้องรู้คือ เมื่อไหร่จะถึงคิวของเรา และต้องเตรียมงบไว้เท่าไหร่
ทีมป้องกันภัยไซเบอร์ได้ Gemini 4 Argon แบบไม่มี Guardrail

Google ฝึกให้ Argon เก่งงานป้องกันภัยไซเบอร์ เพื่อช่วยให้ทีมป้องกันรับมือกับการโจมตียุคใหม่ได้ทัน โดย Google ระบุว่า ตัวโมเดลสามารถค้นหาช่องโหว่ร้ายแรงในซอฟต์แวร์ ตรวจสอบยืนยันปัญหา และเขียนโค้ดแก้ไขเพื่อปิดช่องโหว่ได้เองครบทั้ง 3 ขั้นตอน ทีมป้องกันที่ Google ไว้ใจจึงได้รุ่นที่ไม่มี Cyber Guardrail ไป เพื่อให้ใช้ความสามารถด้านนี้ได้เต็มที่
ตัวอย่างจริงที่ Google ยกมาคือ Wiz บริษัทความปลอดภัยไซเบอร์ที่นำ Argon ไปใช้ในโครงการ Scan for Good เพื่อช่วยปกป้องโครงสร้างพื้นฐานสาธารณะที่สำคัญโดยไม่มีค่าใช้จ่าย ในการทดสอบช่วงแรก Argon สามารถตรวจพบช่องโหว่ร้ายแรงในซอฟต์แวร์การแพทย์ที่โรงพยาบาลทั่วโลกใช้งานอยู่ ซึ่งเสี่ยงทำให้ข้อมูลส่วนตัวที่ละเอียดอ่อนรั่วไหล และเป็นจุดที่โมเดล AI แถวหน้ารุ่นก่อนๆ ตรวจไม่พบ
อย่างไรก็ตาม จุดสำคัญคือโมเดลเวอร์ชันที่ไม่มี Cyber Guardrail นี้ มีไว้ให้เฉพาะทีมป้องกันที่ Google ไว้วางใจกับทีมงานภายในของ Google เท่านั้น โดย Google จะนำผลการทดสอบและข้อเสนอแนะจากกลุ่มแรกไปปรับปรุงระบบความปลอดภัยให้รัดกุมยิ่งขึ้น ดังนั้นเมื่อถึงเวลาที่เปิดให้นักพัฒนาและผู้ใช้ทั่วไปได้เข้าถึง โมเดลที่ทุกคนจะได้ใช้จริงก็จะเป็นเวอร์ชันที่มี Guardrail คอยปฏิเสธคำสั่งที่เป็นอันตราย
คนทั่วไปยังต้องรอ เพราะความสามารถเดียวกันนี้ใช้โจมตีได้
ความสามารถในการหาช่องโหว่ได้เองถือเป็นดาบสองคม ในมือของทีมป้องกัน นี่คือเครื่องมือค้นหาและอุดช่องโหว่ชั้นดี แต่ถ้าตกไปอยู่ในมือคนร้าย ความสามารถเดียวกันนี้ก็กลายเป็นเครื่องมือเจาะระบบเพื่อโจมตีได้ทันที
Google ชี้แจงในบล็อกเปิดตัวว่า โมเดลที่มีความสามารถระดับนี้ต้องค่อยๆ ปล่อยทีละขั้นจึงจะปลอดภัย โดยระหว่างนี้ Google ได้เข้าร่วมกระบวนการส่งโมเดลให้รัฐบาลสหรัฐฯ ตรวจสอบล่วงหน้าตามความสมัครใจ และกำลังเสริมระบบความปลอดภัย 4 ด้านหลักก่อนเปิดให้คนทั่วไปใช้งาน:
- ป้องกันการนำไปใช้ในทางที่ผิด: ออกแบบให้ Argon ปฏิเสธคำสั่งที่ใช้โจมตีทางไซเบอร์ หรือคำสั่งที่เกี่ยวกับอาวุธเคมี ชีวภาพ รังสี และนิวเคลียร์ แต่ยังคงช่วยงานวิจัยทางวิทยาศาสตร์ที่ถูกต้องตามกฎหมายได้ นอกจากนี้ Google ยังคอยเฝ้าระวังการทำงานภายในโมเดลเพื่อตรวจจับการใช้งานที่ผิดปกติ พร้อมทั้งให้ทีมผู้เชี่ยวชาญทั้งภายในและภายนอกช่วยทดสอบเจาะระบบเพื่อหาจุดอ่อนของการป้องกัน
- ป้องกัน Indirect Prompt Injection: ป้องกันคำสั่งอันตรายที่แฝงมากับเนื้อหาที่โมเดลอ่าน เพื่อไม่ให้เข้ามาควบคุมหรือเบี่ยงเบนการทำงานของโมเดล
- ตรวจสอบไม่ให้โมเดลทำเกินคำสั่ง: มีระบบคอยติดตามทั้งกระบวนการคิดและการกระทำของ Argon เพื่อสั่งหยุดการทำงานได้ทันทีถ้าพบว่ากำลังทำเกินกว่าที่ผู้ใช้ตั้งใจ
- ปิดล็อกพื้นที่ทดสอบอย่างแน่นหนา: แยกและล็อกสภาพแวดล้อมจำลองอย่าง Sandbox ที่ใช้รันโมเดลไว้อย่างรัดกุม ก่อนเริ่มเทรนหรือทดสอบงานที่เสี่ยงสูง
ด้านที่มีตัวเลขวัดผลชัดเจนคือการป้องกัน Prompt Injection โดยผลการทดสอบจาก Gray Swan ซึ่งวัดอัตราการโจมตีสำเร็จ (ยิ่งตัวเลขต่ำยิ่งปลอดภัย) พบว่า Argon ถูกโจมตีสำเร็จเพียง 0.7% ขณะที่โมเดลคู่แข่งอย่าง Claude Opus 5.5 ของ Anthropic อยู่ที่ 1.0% และ GPT-6 Astra ของ OpenAI อยู่ที่ 8.5%
Argon ชนะ Benchmark 12 จาก 18 รายการ ในชุดที่ Google เลือกมาโชว์
จากชุดทดสอบทั้งหมด 18 รายการ นอกจาก 12 รายการที่ Argon ชนะขาดแล้ว อีก 6 รายการที่เหลือแบ่งเป็น Astra ชนะ 3 รายการ, Opus 5.5 ชนะ 2 รายการ และเสมอกันอีก 1 รายการ โดยรายการที่เสมอกันคือ CWE-bench v1 ซึ่งวัดความสามารถในการแก้ไขช่องโหว่ความปลอดภัย แม้จะเป็นด้านที่ Google ชูเป็นจุดเด่นของ Argon แต่คะแนนกลับออกมาเท่ากับคู่แข่งอย่าง Astra ที่ 68%
ตัวอย่างรายการที่ Argon ชนะ:
- DeepSWE v1.1 วัดความสามารถในการเขียนซอฟต์แวร์จริงแบบที่ต้องทำต่อเนื่องหลายขั้นตอน: Argon ทำได้ 77.9%, Opus 5.5 ได้ 74.2% และ Astra ได้ 74.1%
- AutomationBench ของ Zapier วัดการทำงานอัตโนมัติในกระบวนการธุรกิจหลักตั้งแต่ต้นจนจบ: Argon ทำได้ 51.3%, Opus 5.5 ได้ 42.5% และ Astra ได้ 41.4%
ส่วนรายการที่ Argon แพ้ห่างที่สุดมีสามรายการ คือแพ้ให้ Astra ในรายการ FrontierSWE v2 และ Terminal-Bench Science โดยตามหลังอยู่ 10.5 คะแนนทั้งสองรายการ และแพ้ให้ Opus 5.5 ในรายการ Terminal-bench 4.0 อยู่ 9 คะแนน
เมื่อนำผลทดสอบมาเทียบกัน จะเห็นว่าในรายการ DeepSWE ที่ Google นำมาโชว์ฝีมือด้านการเขียนโค้ด Argon นำ Opus 5.5 อยู่เพียง 3.7 คะแนน แต่ในรายการที่แพ้ห่างที่สุด คะแนนกลับตามหลังคู่แข่ง 9 ถึง 10.5 คะแนน ดังนั้น การดูแค่จำนวนรายการที่ชนะจึงบอกได้เพียงว่า Argon มีความสามารถรอบด้าน แต่ถ้าต้องการรู้ว่าโมเดลจะเหมาะกับงานของเราจริงหรือไม่ ทางที่ดีควรดูคะแนนในรายการทดสอบที่มีลักษณะใกล้เคียงกับงานที่เราจะนำไปใช้มากที่สุด
อย่างไรก็ดี ปัญหาในตอนนี้คือผู้ใช้และองค์กรส่วนใหญ่ยังไม่สามารถนำ Argon มาทดสอบกับงานจริงของตัวเองได้ เพราะยังต้องรอเปิดให้เข้าถึงผ่าน API ที่นักพัฒนาใช้เชื่อมต่อโมเดลเข้ากับระบบของตัวเอง
งานจริงที่ Argon ช่วยทำใน Google ระหว่างที่คนนอกยังต้องรอคิว
นอกจากคะแนนทดสอบแล้ว Google ยังเปิดเผยถึงการนำ Argon ไปใช้งานจริงภายในบริษัท โดยปัจจุบันมีพนักงาน Google หลายพันคนใช้งานโมเดลนี้แล้ว ทั้งงานเขียนโค้ดเฉพาะทาง งานวิจัยเชิงลึก และงานเขียนเอกสาร
หนึ่งในโปรเจกต์ใหญ่คือการแปลงโค้ดจากภาษา C/C++ ไปเป็น Rust ที่เด่นเรื่องความปลอดภัยในการจัดการหน่วยความจำ โดย Google ให้ AI Agent ของ Argon เข้ามาช่วยแปลงโค้ดทั่วทั้งบริษัท ตั้งแต่ไลบรารีสำคัญขนาดหลายหมื่นบรรทัดอย่าง re2 และตัวถอดรหัสวิดีโอ libgav1 ไปจนถึงงานชิ้นใหญ่อย่าง Zircon แกนกลางระบบปฏิบัติการ Fuchsia ของ Google ที่มีโค้ดยาวกว่า 800,000 บรรทัด
การเขียนโค้ดใหม่ในระดับนี้ต้องผ่านทั้งระบบตรวจสอบอัตโนมัติ การตรวจทานของทีมวิศวกร การทดสอบบนระบบจำลอง และการตรวจประเมินอย่างเข้มงวดก่อนขึ้นระบบจริง เพราะหลายระบบในนั้นสำคัญมาก
ตัวอย่างที่มีผลลัพธ์เป็นตัวเลขชัดเจนคือ libgav1 โปรเจกต์โอเพนซอร์สของ Google งานนี้เริ่มจากเวอร์ชันภาษา Rust ที่เคยแปลงเอาไว้ ซึ่งมีคำสั่งเร่งความเร็วอย่าง SIMD ที่สั่งให้ CPU ประมวลผลข้อมูลหลายชิ้นพร้อมกันอยู่ 32,000 บรรทัด ระบบ Agent ของ Argon ได้ทดลองปรับแก้โค้ดและวัดประสิทธิภาพซ้ำหลายรอบ จนสามารถแทนที่โค้ดเดิมทั้งหมดด้วยโค้ด Rust ที่ปลอดภัย และปล่อยให้คอมไพเลอร์แปลงเป็นคำสั่ง SIMD ให้อัตโนมัติ
ผลลัพธ์ที่ได้คือ ตัวถอดรหัสวิดีโอที่ปลอดภัยเรื่องหน่วยความจำนี้ ทำงานได้เร็วกว่าเวอร์ชัน Rust เดิมถึง 2.7 เท่า โดยภาพที่ถอดรหัสออกมายังคงเหมือนเดิมทุกประการ จุดที่ต้องเข้าใจตรงกันคือ ตัวเลข 2.7 เท่านี้เป็นการเทียบกับเวอร์ชัน Rust ที่แปลงไว้ก่อนหน้า ไม่ใช่เทียบกับต้นฉบับภาษา C++ แต่ก็ช่วยให้ประสิทธิภาพขยับเข้าไปใกล้เคียงกับ C++ ที่ผ่านการปรับแต่งมาอย่างดี
อีกงานหนึ่งคือการเพิ่มประสิทธิภาพการใช้หน่วยความจำในศูนย์ข้อมูล โดยระบบ Agent ของ Argon ได้วิเคราะห์ข้อมูลการใช้ทรัพยากรจริงของเซิร์ฟเวอร์ทั้งหมดในศูนย์ข้อมูลของ Google เพื่อมองหาจุดที่ประหยัดหน่วยความจำได้และปรับแก้ให้เอง ซึ่ง Google ระบุว่า เมื่อปรับแต่งเสร็จครบทุกระบบ จะสามารถคืนหน่วยความจำกลับมาได้มากกว่า 300 TiB (เทียบเท่ากับ RAM ขนาด 16GB ของโน้ตบุ๊กเกือบ 20,000 เครื่อง) และคาดว่าอาจช่วยประหยัดรวมได้ตั้งแต่ 500 TiB ไปจนถึง 1 PiB (1,024 TiB) เลยทีเดียว
เพื่อรองรับงานที่ยาวและซับซ้อนระดับนี้ Google ได้ขยายขีดจำกัดความยาวข้อความคำตอบ หรือ Output สูงสุดของ Argon จากเดิม 64,000 Token เพิ่มเป็น 1 ล้าน Token โดย Token คือหน่วยนับปริมาณข้อความของระบบ AI ซึ่งตัวเลขนี้เป็นความยาวของเนื้อหาที่ Argon เขียนตอบออกมาได้ในรอบเดียว ไม่ใช่ขนาดของข้อความขาเข้าอย่าง Context การขยายขีดจำกัดตรงนี้ช่วยให้โมเดลมีพื้นที่คิดวิเคราะห์และเขียนคำตอบต่อเนื่องได้หลายแสน Token จนจบโจทย์ยากๆ ได้ในรอบเดียว
คิวถัดไป และราคาเปิดตัวที่ยังไม่รู้ว่าจะหมดเมื่อไหร่

กลุ่มผู้ใช้ที่จะได้สิทธิ์ถัดจากทีมไซเบอร์ คือลูกค้า API แบบจ่ายเงิน และสมาชิก Google AI Ultra ซึ่งเป็นแพ็กเกจบริการของ Google ก่อนจะทยอยเปิดให้นักพัฒนา องค์กรธุรกิจ และผู้ใช้ทั่วไปในวงกว้าง โดย Google ระบุว่าจะเปิดให้เร็วที่สุดเท่าที่จะทำได้
ราคาช่วงเปิดตัวสำหรับการใช้งานผ่าน API กำหนดไว้ดังนี้:
- Input หรือข้อมูลคำสั่งที่ส่งเข้าไป: $2 ต่อ 1 ล้าน Token
- Output หรือข้อความคำตอบที่โมเดลเขียน: $10 ต่อ 1 ล้าน Token
- Cached Input หรือข้อมูลเดิมที่ระบบจำไว้จากการส่งก่อนหน้า: ลดราคา 95% จากราคา Input เหลือเพียง $0.10 ต่อ 1 ล้าน Token
ราคา $2/$10 นี้ เท่ากับคู่แข่งระดับกลางอย่าง GPT-6 Sol ของ OpenAI และ Claude Sonnet 5.5 ของ Anthropic พอดี แต่ราคาที่เท่ากันไม่ได้หมายความว่าจะทนทานต่อการโจมตีได้เท่ากัน เพราะในชุดทดสอบ Prompt Injection ของ Gray Swan ตัวเดียวกัน GPT-6 Sol ถูกโจมตีสำเร็จถึง 27.0% ขณะที่ Argon ถูกโจมตีสำเร็จเพียง 0.7%
ถ้าเทียบกับโมเดลรุ่นท็อปของคู่แข่ง ราคาเปิดตัวของ Argon ถูกกว่า GPT-6 Astra ($10/$50) ถึง 5 เท่า และเป็นเพียงครึ่งหนึ่งของ Claude Opus 5.5 ($4/$20)
อย่างไรก็ดี สำนักข่าวเทคโนโลยี VentureBeat รายงานว่า หลังจากหมดช่วงเปิดตัว ราคาจะปรับขึ้นเป็น 2 เท่า หรืออยู่ที่ $4/$20 ซึ่งจะเท่ากับ Opus 5.5 และยังคงถูกกว่า Astra แต่ Google ยังไม่ได้แจ้งว่าช่วงราคาเปิดตัวนี้จะสิ้นสุดเมื่อไหร่ รายงานชิ้นเดียวกันยังตั้งข้อสังเกตว่า ที่ผ่านมา ราคาช่วงเปิดตัวบางครั้งก็อาจกลายเป็นราคาปกติไปเลยก็ได้
ถ้าใครกำลังวางแผนงบประมาณสำหรับโปรเจกต์ที่จะใช้ Argon แนะนำให้คำนวณต้นทุนอิงจากราคา $4/$20 ไว้ล่วงหน้า เพราะถ้าคำนวณจากราคาเปิดตัว ค่าใช้จ่ายจะเพิ่มขึ้นเท่าตัวทันทีเมื่อหมดช่วงนี้ แต่ถ้าเราวางแผนเผื่อไว้ แล้วราคาเปิดตัวอยู่ยาวนานกว่าที่คิด ส่วนต่างตรงนี้ก็จะกลายเป็นงบประมาณสำรอง ไม่ใช่เจอปัญหางบไม่พอ
การเลือกทยอยเปิดให้ใช้ทีละกลุ่มเพื่อความปลอดภัยย่อมมีสิ่งที่ต้องแลก เพราะตราบใดที่คิวยังมาไม่ถึงเรา และเรายังไม่ได้นำโมเดลนี้มาทดสอบกับงานจริงด้วยตัวเอง ชัยชนะบนตาราง Benchmark ในวันนี้ก็ยังเป็นแค่คำกล่าวอ้างจากฝั่ง Google ฝ่ายเดียว
ที่มา:
- เอกสารทางการของ Gemini 4 Argon
- บทความ Google unveils Gemini 4 Argon, retaking benchmark lead over OpenAI and Anthropic — but in limited release จาก VentureBeat
ชอบเรื่องแนวนี้ มีอีบุ๊คฟรีให้อ่านต่อ
Local LLM ฉบับเข้าใจง่าย รัน AI ไว้ในเครื่องตัวเอง ติดตั้ง อัปเดต จัดการ ลบ ครบวงจรด้วย Ollama
กดสมัครแล้วเราจะส่งเทคนิค AI และของแจกใหม่ๆ ให้ทางอีเมล เลิกรับได้ตลอด
Claude Cowork · The Business Playbook

ฉบับภาษาไทย 15 บท เรียนรู้ผ่านโปรเจกต์จำลองต่อเนื่องทั้งเล่ม ตั้งแต่ตั้งค่า Workspace จัดการไฟล์ เชื่อมแอป ตั้งระบบอัตโนมัติ จนถึงสร้าง Plugin


