OpenAI ปล่อย 3 โมเดลเสียงใหม่ใน API แปลสด 70 ภาษา Zillow ทดสอบ call success rate ขึ้นจาก 69% เป็น 95%
OpenAI ปล่อย 3 โมเดลเสียงใหม่ผ่าน API วันที่ 7 พ.ค. 2026 ประกอบด้วย GPT-Realtime-2 ที่ใช้ reasoning ระดับ GPT-5 พร้อม GPT-Realtime-Translate รองรับ 70 ภาษาขาเข้า 13 ภาษาขาออก และ GPT-Realtime-Whisper สำหรับ transcription แบบ low-latency Zillow รายงาน call success rate เพิ่มจาก 69% เป็น 95% บน benchmark adversarial ที่ยากที่สุด

OpenAI เปิดตัวโมเดลเสียงรุ่นใหม่ 3 ตัวบนระบบ API เมื่อวันที่ 7 พฤษภาคม 2026 นำทัพโดย GPT-Realtime-2 ที่ผสานขีดความสามารถการคิดวิเคราะห์ขั้นสูง (Reasoning) ระดับ GPT-5 พร้อมด้วย GPT-Realtime-Translate ที่รองรับการแปลเสียงพูดแบบเรียลไทม์ถึง 70 ภาษาขาเข้า และ 13 ภาษาขาออก ปิดท้ายด้วย GPT-Realtime-Whisper สำหรับการถอดเสียงเป็นข้อความด้วยความหน่วงต่ำเป็นพิเศษ (Ultra-low Latency)
หนึ่งในไฮไลต์สำคัญคือผลการทดสอบจาก Zillow แพลตฟอร์มอสังหาริมทรัพย์ชั้นนำ ที่เผยว่าหลังจากนำ GPT-Realtime-2 มาใช้งาน อัตราความสำเร็จในการสนทนาทางเสียง (Call Success Rate) พุ่งสูงขึ้นจาก 69% บนโมเดลรุ่นเดิม เป็น 95% เมื่อทดสอบบนชุดทดสอบ Adversarial Benchmark ที่มีความซับซ้อนสูงสุดของบริษัท
สรุปรายละเอียดและอัตราค่าบริการของทั้ง 3 โมเดล
- GPT-Realtime-2: มาพร้อม Context Window ขนาด 32,000 Token รองรับการเรียกใช้ External Tools ภายนอกได้อย่างลื่นไหล เช่น การเชื่อมต่อกับปฏิทินนัดหมาย หรือระบบจองคิวอัตโนมัติ โดยคิดค่าบริการอยู่ที่ 32 ดอลลาร์ต่อ 1 ล้าน Audio Input Tokens (และ 0.40 ดอลลาร์สำหรับ Cached Input) พร้อมค่าประมวลผล Audio Output อยู่ที่ 64 ดอลลาร์ต่อ 1 ล้าน Tokens
- GPT-Realtime-Translate: ราคา 0.034 ดอลลาร์ต่อนาที ทำหน้าที่แปลเสียงสดแบบ Streaming ได้อย่างต่อเนื่องโดยที่ผู้พูดไม่ต้องหยุดรอจังหวะ ทำให้บทสนทนาข้ามภาษาเป็นไปอย่างลื่นไหลและเป็นธรรมชาติ
- GPT-Realtime-Whisper: ราคา 0.017 ดอลลาร์ต่อนาที ออกแบบมาสำหรับการถอดเสียงพูดเป็นตัวอักษรแบบสดๆ เหมาะกับงานถ่ายทอดสด การประชุมองค์กร การบันทึกคำให้การในชั้นศาล ตลอดจนงานด้าน Accessibility เพื่อผู้พิการ
ผลการทดสอบจากพาร์ตเนอร์ชั้นนำ
นอกจากตัวเลขของ Zillow แล้ว ทาง BolnaAI ยังรายงานว่า GPT-Realtime-Translate ช่วยลดอัตราความผิดพลาดในการรู้จำเสียง (Word Error Rate) สำหรับภาษาในภูมิภาคเอเชียใต้ เช่น ภาษาฮินดี ทมิฬ และเตลูกู ลงได้ถึง 12.5% เมื่อเทียบกับโมเดลรุ่นก่อนหน้า
ขณะเดียวกัน Deutsche Telekom ผู้ให้บริการโทรคมนาคมยักษ์ใหญ่ระบุว่า กำลังนำโมเดลชุดนี้ไปพัฒนาระบบ Customer Support ทางเสียงแบบสองภาษา ช่วยให้ลูกค้าสามารถพูดภาษาแม่ของตัวเอง แล้วระบบจะแปลเป็นภาษาที่เจ้าหน้าที่เข้าใจได้แบบสดๆ ทันที
ปลดล็อกมิติใหม่ของ Voice Agent
OpenAI ออกแบบโมเดลชุดนี้เพื่อเปิดประตูสู่การสร้าง Voice Application ยุคใหม่อย่างแท้จริง โดยแก้ปัญหาคอขวดของ AI ด้านเสียงในอดีตที่ผู้ใช้ต้องรอให้อีกฝ่ายพูดจบประโยคก่อนระบบถึงจะเริ่มคิดและตอบกลับ ทำให้บทสนทนาสามารถตอบโต้ ขัดจังหวะ และดำเนินต่อไปได้อย่างเป็นธรรมชาติเหมือนคุยกับมนุษย์จริง โดยโมเดลทั้ง 3 ตัวพร้อมเปิดให้นักพัฒนาเรียกใช้งานผ่าน OpenAI API ได้แล้ววันนี้
แหล่งข้อมูลอ้างอิง: 9to5Mac, The Next Web, The Tech Portal
ชอบเรื่องแนวนี้ มีอีบุ๊คฟรีให้อ่านต่อ
Local LLM ฉบับเข้าใจง่าย รัน AI ไว้ในเครื่องตัวเอง ติดตั้ง อัปเดต จัดการ ลบ ครบวงจรด้วย Ollama
กดสมัครแล้วเราจะส่งเทคนิค AI และของแจกใหม่ๆ ให้ทางอีเมล เลิกรับได้ตลอด
Claude Cowork · The Business Playbook

ฉบับภาษาไทย 15 บท เรียนรู้ผ่านโปรเจกต์จำลองต่อเนื่องทั้งเล่ม ตั้งแต่ตั้งค่า Workspace จัดการไฟล์ เชื่อมแอป ตั้งระบบอัตโนมัติ จนถึงสร้าง Plugin


