whisper.cpp v1.9.0 ถอดเสียงเป็นข้อความบนเครื่องตัวเองได้ฟรีแบบออฟไลน์ · แถมรองรับโมเดล NVIDIA Parakeet ที่แม่นระดับ WER 1.93%
whisper.cpp คือโปรแกรมถอดเสียงพูดเป็นข้อความที่รันบนเครื่องตัวเองได้ฟรีโดยไม่ต้องต่อเน็ต เวอร์ชัน v1.9.0 ที่เพิ่งออกเริ่มรองรับโมเดล NVIDIA Parakeet ที่เร็วและแม่นมาก แต่ยังไม่รองรับภาษาไทย

whisper.cpp คือเครื่องมือถอดเสียงพูดเป็นข้อความ (Speech-to-Text) ที่รันบนเครื่องคอมพิวเตอร์ของเราเองได้ทั้งหมด ไม่ต้องอัปโหลดไฟล์เสียงขึ้นคลาวด์ และไม่ต้องเชื่อมต่ออินเทอร์เน็ต ตัวโปรแกรมเป็นการนำสถาปัตยกรรม OpenAI Whisper มาเขียนใหม่ด้วยภาษา C/C++ ส่งผลให้ตัวโปรแกรมมีขนาดเล็ก ประสิทธิภาพสูง และไม่จำเป็นต้องพึ่งพาไลบรารีภายนอก ช่วยให้เราแปลงเสียงประชุม บทสัมภาษณ์ หรือบันทึกเสียงส่วนตัวเป็นข้อความได้สะดวกรวดเร็วบนเครื่องตัวเอง
การอัปเดตเวอร์ชัน v1.9.0 เพิ่มการรองรับโมเดลตัวใหม่อย่าง NVIDIA Parakeet ซึ่งมีจุดเด่นด้านความเร็วและความแม่นยำสูง แต่ก็มีข้อจำกัดสำคัญที่ผู้ใช้งานภาษาไทยควรรู้ บทความนี้สรุป 3 ประเด็นสำคัญ: ข้อดีของการถอดเสียงแบบ local, ความสามารถและข้อจำกัดของ Parakeet และขั้นตอนเริ่มต้นใช้งานแบบเข้าใจง่าย
ทำไมการถอดเสียงบนเครื่องตัวเองถึงตอบโจทย์
การส่งไฟล์เสียงขึ้นบริการคลาวด์ทั่วไป หมายความว่าข้อมูลบทสนทนาของเราจะถูกส่งไปยังเซิร์ฟเวอร์ภายนอก หากเป็นข้อมูลการประชุมลับ ข้อมูลลูกค้า หรือบันทึกส่วนตัว ย่อมมีความเสี่ยงเรื่องความเป็นส่วนตัว นอกจากนี้หลายบริการยังคิดค่าบริการตามความยาวของเสียง
whisper.cpp เข้ามาแก้ปัญหานี้ด้วยการประมวลผลบนเครื่อง 100% ไฟล์เสียงไม่รั่วไหลออกภายนอก ใช้งานได้ฟรีไม่จำกัดชั่วโมง และทำงานได้แม้ไม่มีสัญญาณอินเทอร์เน็ต โครงสร้างภาษา C/C++ ทำให้ตัวโปรแกรมรองรับฮาร์ดแวร์หลากหลาย ตั้งแต่ Mac ตระกูล Apple Silicon, พีซี Windows, เซิร์ฟเวอร์ Linux ไปจนถึงบอร์ด Raspberry Pi หรือแม้กระทั่งรันบนเว็บเบราว์เซอร์ผ่าน WebAssembly
นอกจากนี้ เรายังเลือกขนาดโมเดลให้เหมาะกับสเปกเครื่องได้ ตั้งแต่โมเดลขนาดเล็กอย่าง tiny (ขนาดประมาณ 75 MiB) สำหรับเน้นความเร็วและประหยัดแรม ไปจนถึง large (ขนาดประมาณ 2.9 GiB) สำหรับงานที่ต้องการความแม่นยำสูงสุด โดยมีขนาด base, small และ medium เป็นทางเลือกตรงกลาง
Parakeet โมเดลใหม่ใน v1.9.0 กับความแม่นยำสูง
ฟีเจอร์เด่นใน whisper.cpp v1.9.0 คือการเพิ่มการรองรับโมเดล Parakeet TDT 0.6b v3 ซึ่งเป็นโมเดลถอดเสียงจากค่าย NVIDIA ที่ออกแบบมาสำหรับการแปลงเสียงยาวๆ ด้วยความเร็วสูง ตัวโมเดลมีขนาด 600 ล้านพารามิเตอร์
ตัวชี้วัดความแม่นยำของโมเดลแปลงเสียงคือ WER (Word Error Rate) หรืออัตราคำที่ถอดผิด ซึ่งยิ่งตัวเลขต่ำยิ่งแสดงถึงความแม่นยำสูง Parakeet ทำคะแนน WER บนชุดทดสอบภาษาอังกฤษได้ถึง 1.93% ซึ่งหมายถึงอัตราผิดพลาดไม่ถึง 2 คำใน 100 คำ โดยโมเดลนี้เทรนด้วยข้อมูลเสียงกว่า 660,000 ชั่วโมง บนคลัสเตอร์ NVIDIA A100 จำนวน 128 ตัว
นอกเหนือจากความแม่นยำแล้ว โมเดลยังสามารถตรวจจับภาษาอัตโนมัติ พร้อมจัดวรรคตอนและตัวพิมพ์ใหญ่เล็กให้อย่างเหมาะสม ช่วยให้ข้อความที่ได้พร้อมนำไปใช้งานต่อได้ทันที
ข้อจำกัดสำคัญสำหรับภาษาไทย

จุดที่ต้องเน้นย้ำคือ Parakeet v3 รองรับทั้งหมด 25 ภาษา ซึ่งล้วนเป็นกลุ่มภาษายุโรป เช่น อังกฤษ ฝรั่งเศส เยอรมัน สเปน รัสเซีย และยูเครน ยังไม่มีการรองรับภาษาไทย ดังนั้นความแม่นยำระดับ 1.93% จึงยังไม่ครอบคลุมไฟล์เสียงภาษาไทย
อย่างไรก็ตาม การที่ Parakeet ยังไม่รองรับภาษาไทยไม่ได้หมายความว่า whisper.cpp จะใช้กับภาษาไทยไม่ได้ ตัวโปรแกรมยังคงรองรับโมเดล Whisper ดั้งเดิมแบบ multilingual ซึ่งรองรับภาษาไทยอยู่แล้ว การอัปเดต v1.9.0 จึงเป็นการเพิ่มตัวเลือกใหม่สำหรับงานภาษาอังกฤษและภาษายุโรป โดยที่ฟังก์ชันเดิมยังคงใช้งานได้ตามปกติ
ขั้นตอนเริ่มต้นใช้งานจริง
การเริ่มต้นใช้งาน whisper.cpp ทำได้ง่ายมาก หากต้องการทดสอบเบื้องต้น สามารถทำตาม 3 คำสั่งนี้:
git clone https://github.com/ggml-org/whisper.cpp.git
cd whisper.cpp
make base.enคำสั่ง make base.en จะดาวน์โหลดโมเดลขนาด base ภาษาอังกฤษ และรันการถอดเสียงไฟล์ตัวอย่างให้เห็นผลลัพธ์ทันที
สำหรับการนำไฟล์เสียงของเรามาถอดเสียงจริง มีขั้นตอนดังนี้:
- คอมไพล์โปรแกรมตัวเต็ม:
cmake -B build && cmake --build build -j --config Release- แปลงไฟล์เสียงให้อยู่ในฟอร์แมต WAV 16-bit Mono (16kHz) ซึ่งเป็นรูปแบบที่ whisper.cpp รองรับ:
ffmpeg -i input.mp3 -ar 16000 -ac 1 -c:a pcm_s16le output.wav- สั่งประมวลผลถอดเสียง:
./build/bin/whisper-cli -f output.wavนอกจากนี้ whisper.cpp ยังรองรับการถอดเสียงแบบ real-time ผ่านคำสั่ง whisper-stream, การสร้างคำบรรยายพร้อม timestamp ระดับคำสำหรับงานตัดต่อวิดีโอ และการแยกแยะผู้พูดในไฟล์เสียง
สรุปแนวทางการเลือกโมเดล

สรุปแนวทางการเลือกใช้งาน:
- เสียงภาษาไทย: เลือกใช้โมเดล Whisper Multilingual ขนาด
mediumหรือlargeเพื่อความถูกต้องในการสะกดคำ - เสียงภาษาอังกฤษหรือภาษายุโรป: เลือกใช้ NVIDIA Parakeet บน whisper.cpp v1.9.0 เพื่อความเร็วและความแม่นยำระดับแนวหน้า
- ทดสอบเริ่มต้น: ใช้คำสั่ง
make base.enเพื่อเช็กความพร้อมของระบบอย่างรวดเร็ว
whisper.cpp ช่วยให้การประมวลผล speech-to-text คุณภาพสูงเกิดขึ้นได้บนฮาร์ดแวร์ทั่วไปอย่างเป็นส่วนตัว และเมื่อโมเดลประมวลผลเร็วขึ้นเรื่อยๆ การถอดเสียงบนเครื่องตัวเองก็กลายเป็นมาตรฐานใหม่ที่พร้อมใช้งานจริงในชีวิตประจำวัน
ชอบเรื่องแนวนี้ มีอีบุ๊คฟรีให้อ่านต่อ
สร้าง Claude Skill แบบไม่ต้องรู้โค้ด คู่มือสร้าง Claude Skill ของคุณเองด้วยการคุยกับ Claude Code เป็นภาษาไทย
กดสมัครแล้วเราจะส่งเทคนิค AI และของแจกใหม่ๆ ให้ทางอีเมล เลิกรับได้ตลอด
Claude Cowork · The Business Playbook

ฉบับภาษาไทย 15 บท เรียนรู้ผ่านโปรเจกต์จำลองต่อเนื่องทั้งเล่ม ตั้งแต่ตั้งค่า Workspace จัดการไฟล์ เชื่อมแอป ตั้งระบบอัตโนมัติ จนถึงสร้าง Plugin


