ใส่เสียงบรรยายด้วย Gemini TTS | Prompt-First Video: สร้างวิดีโอด้วย HyperFrames + Claude Code | Vibe Coding Thailand
$ cat 08-add-gemini-tts-voice.md บทที่ 8
ใส่เสียงบรรยายด้วย Gemini TTS ถึงตอนนี้วิดีโอของคุณมีภาพ ข้อความ caption และลูกเล่นจาก catalog แล้ว
บทนี้เราจะเพิ่มเสียงบรรยาย
เป้าหมายคือให้ Claude สร้างเสียงจากข้อความภาษาไทย ใส่เสียงนั้นลงในวิดีโอ HyperFrames แล้วให้เรากด play ตรวจใน HTML preview ก่อน
เมื่อเสียงกับภาพตรงจังหวะแล้ว ค่อย render MP4 final
TTS คืออะไร
TTS ย่อมาจาก text-to-speech
แปลตรงตัวคือ “ข้อความเป็นเสียงพูด”
เราจะเขียนสคริปต์เสียงบรรยายเป็นภาษาไทย แล้วให้ Gemini TTS สร้างไฟล์เสียง จากนั้นให้ Claude ใส่ไฟล์เสียงเข้าไปในวิดีโอ
คุณไม่ต้องตัดเสียงเอง
ไม่ต้องลากไฟล์เข้า timeline
ไม่ต้อง sync ด้วยมือ
ให้ Claude ทำให้มากที่สุด แต่ยังใช้หลักเดิม: preview ก่อน render
เส้นทางที่แนะนำ: Google Cloud + gcloud
สำหรับงานในหนังสือเล่มนี้ เส้นทางที่เหมาะที่สุดคือใช้ Gemini TTS ผ่าน Google Cloud โดยให้ Claude จัดการผ่าน gcloud และ official docs
เหตุผลคือ:
ใช้กับโปรเจกต์จริงได้เป็นระบบกว่า
จัดการ project, billing, permission และ authentication ได้ชัดเจน
ไม่ต้องแปะ API key ลง prompt
ใช้ Application Default Credentials จาก gcloud ได้
Google Cloud มี Free Trial สำหรับผู้ใช้ใหม่ที่เข้าเงื่อนไข
จาก official Google Cloud Free Program: ผู้ใช้ใหม่ที่เข้าเงื่อนไขจะได้ Welcome credit $300 สำหรับใช้ภายใน 91 วัน และระหว่าง Free Trial จะไม่ถูก bill สำหรับ usage ในช่วง trial ตามเงื่อนไขของโปรแกรม
พูดแบบภาษาคนทั่วไป: ถ้าคุณยังไม่เคยใช้ Google Cloud แบบเสียเงินมาก่อน ให้สมัคร Google Cloud Free Trial ใส่วิธีชำระเงินเพื่อยืนยันตัวตน แล้วใช้เครดิตฟรีทดลองทำเสียงได้ก่อน
แต่ต้องรู้ 3 เรื่อง:
เครดิตฟรีมีวันหมดอายุ
หลังหมด trial หรือใช้เครดิตหมด ต้องดู billing ให้ดี
บริการและเงื่อนไขอาจเปลี่ยนได้ ให้ Claude ตรวจ official docs ล่าสุดก่อนเสมอ ในเล่มนี้เราจะไม่ให้คุณจำวิธีตั้งค่า Google Cloud เอง ให้สั่ง Claude ว่า “ช่วยพาฉันทำตาม official docs ทีละขั้น”
Screenshot: official Google Cloud docs สำหรับ Gemini TTS ภาพนี้ใช้ย้ำว่าเส้นทางในบทนี้อิง official Google Cloud docs และให้ Claude ตรวจข้อมูลล่าสุดก่อนเสมอ โดยเฉพาะเรื่อง billing, project, authentication และชื่อ model
เรื่องสำคัญ: ชื่อ model ต้องให้ Claude ตรวจจาก official docs คุณอาจเรียกติดปากว่า “Gemini 3 Flash TTS”
แต่ชื่อ model จริงใน official docs อาจเป็น gemini-3.1-flash-tts-preview, gemini-2.5-flash-tts หรือชื่ออื่นในอนาคต ขึ้นอยู่กับว่าคุณใช้ผ่าน Google AI API, Vertex AI API หรือ Cloud Text-to-Speech API
ดังนั้นอย่าให้หนังสือหรือคนอ่านเดาชื่อ model เอง
ให้ Claude ทำ 4 อย่างนี้:
อ่าน official Gemini TTS docs ล่าสุด
อ่าน Google Cloud Gemini-TTS docs ล่าสุด
เลือก Flash TTS model ที่ official docs รองรับจริงในตอนนั้น
ถ้าชื่อที่เราพูดไม่ตรงกับ docs ให้บอกตรงๆ แล้วใช้ชื่อ official ที่ถูกต้อง
กติกาคือ: อย่าเดา model name
Screenshot: official Gemini speech generation docs ถ้า Claude พบชื่อ model ใน official docs ไม่ตรงกับคำที่เราพูด ให้ใช้ชื่อใน docs เป็นหลัก ไม่ต้องฝืนใช้ชื่อที่จำกันมา
ตั้งค่า Google Cloud แบบให้ Claude พาเดิน ขั้นนี้คนอ่านอาจต้องกดในเว็บเอง เช่น สมัคร Google Cloud, ใส่บัตรหรือวิธีชำระเงิน, เปิด billing, สร้าง project หรือกด enable API
แต่ไม่ต้องรู้ทั้งหมดล่วงหน้า ให้ Claude เป็นคนบอกทีละขั้น
ใช้ prompt นี้ก่อนสร้างเสียง
Prompt ฉันต้องการใช้ Gemini Flash TTS ผ่าน Google Cloud/gcloud เพื่อสร้างเสียงบรรยายให้วิดีโอ HyperFrames
ช่วยพาฉันตั้งค่าตาม official docs แบบทีละขั้น สำหรับคนไม่รู้โค้ด
ให้คุณทำตามนี้:
1. อ่าน Google Cloud Free Trial official docs ว่าผู้ใช้ใหม่ได้เครดิตฟรีเท่าไร ใช้ได้นานเท่าไร และต้องระวัง billing อะไร
2. อ่าน official docs การติดตั้ง Google Cloud CLI/gcloud
3. อ่าน official docs ของ Gemini-TTS / Text-to-Speech / Vertex AI ที่เกี่ยวกับ Flash TTS
4. บอกฉันว่าต้องทำอะไรในเว็บ Google Cloud บ้าง เช่น สมัคร Free Trial, ใส่วิธีชำระเงิน, สร้าง project, เปิด billing, enable API
5. ถ้าเครื่องยังไม่มี gcloud ให้บอกวิธีติดตั้งจาก official docs ตามระบบปฏิบัติการของฉัน
6. หลังติดตั้งแล้ว ให้พาฉัน login ด้วย gcloud และตั้งค่า project
7. ใช้ authentication แบบปลอดภัย เช่น gcloud/Application Default Credentials ถ้าเหมาะสม
8. ห้ามให้ฉันแปะ API key ลง chat ถ้าไม่จำเป็น
สำคัญ:
- ถ้าชื่อ “Gemini 3 Flash TTS” ไม่ตรงกับ official model name ให้บอกตรงๆ และใช้ model Flash TTS ที่ official docs รองรับจริง
- ยังไม่ต้องสร้างเสียง ให้สรุป setup plan ก่อนแบบสั้นๆ
คัดลอก
ถ้า Claude ตอบยาวไป ให้สั่งว่า:
Prompt สรุปใหม่เป็น checklist สั้นๆ สำหรับมือใหม่ ว่าฉันต้องกดอะไรใน Google Cloud และคุณจะรันอะไรให้เองใน Claude Code
คัดลอก
ภาพตัวอย่าง workflow Gemini TTS ผ่าน Google Cloud/gcloud และตรวจเสียงใน preview ภาพนี้คือภาพรวมของบทนี้: ตั้งค่า Google Cloud อย่างปลอดภัย ตรวจ official docs ก่อนเลือก model สร้างเสียงไทย ใส่เสียงใน preview แล้วค่อย render MP4 พร้อมเสียงเมื่อพอใจ
เขียนสคริปต์เสียงให้พอดีกับวิดีโอ เสียงบรรยายต้องสั้นกว่าวิดีโอเล็กน้อย ไม่ควรพูดแน่นจนไม่มีจังหวะหายใจ
สำหรับวิดีโอ 12 วินาที สคริปต์ควรสั้นมาก ประมาณ 1–3 ประโยค
Prompt ช่วยเขียนสคริปต์เสียงบรรยายภาษาไทยสำหรับวิดีโอนี้
เงื่อนไข:
- ความยาววิดีโอ 12 วินาที
- เสียงต้องพูดจบภายในประมาณ 10–11 วินาที
- น้ำเสียงสดใส เข้าใจง่าย
- ใช้ภาษาคนทั่วไป ไม่เป็นทางการเกินไป
- ต้องเข้ากับข้อความบนจอเดิม
- ไม่ต้องพูดทุกคำบนจอซ้ำ ให้ช่วยเสริมความเข้าใจ
ขอ 3 เวอร์ชันให้เลือก:
1. เวอร์ชันกระชับ
2. เวอร์ชันสนุก
3. เวอร์ชันพรีเมียม
ยังไม่ต้องสร้างเสียง รอให้ฉันเลือกก่อน
คัดลอก
เลือกเวอร์ชันที่ชอบ หรือให้ Claude เลือกเอง
Prompt เลือกเวอร์ชันที่เหมาะที่สุดกับวิดีโอแนว TikTok/Reels สำหรับคนทั่วไป แล้วใช้เวอร์ชันนั้นสร้างเสียงต่อได้เลย
คัดลอก
สร้างไฟล์เสียงด้วย Gemini TTS เมื่อเลือกสคริปต์แล้ว ให้สั่งสร้างเสียง
Prompt ใช้สคริปต์เสียงบรรยายที่เลือกไว้ สร้างไฟล์เสียงด้วย Gemini TTS ผ่าน Google Cloud/gcloud ตาม official docs ล่าสุดที่คุณตรวจแล้ว
เงื่อนไข:
- ใช้ Google Cloud project ที่ตั้งค่าไว้
- ใช้ gcloud/Application Default Credentials หรือวิธี official ที่ปลอดภัย
- ใช้ Flash TTS model ที่ official docs รองรับจริงในตอนนี้
- ถ้ามี Gemini 3.x Flash TTS ใน official docs ให้ใช้ตัวนั้น
- ถ้าไม่มี ให้ใช้ Flash TTS model official ที่เหมาะที่สุด และบอกฉันสั้นๆ ว่าใช้ชื่อ model อะไร
- เลือกเสียงที่เหมาะกับวิดีโอสั้น สดใส และฟังชัด
- สร้างไฟล์เสียงไว้ในโฟลเดอร์ assets/audio หรือโฟลเดอร์ที่เหมาะสม
- ตั้งชื่อไฟล์ให้อ่านง่าย เช่น narration-v1.wav หรือ narration-v1.mp3
- ห้ามแสดง token, credential, API key หรือข้อมูลลับในคำตอบ
ถ้า setup ยังไม่ครบ ให้พาฉันทำทีละขั้นแบบคนไม่รู้โค้ด
คัดลอก
ถ้า Claude บอกว่าต้อง login หรือ enable API ให้ทำตามทีละขั้นที่ Claude บอก
ถ้า Claude สร้างเสียงสำเร็จ ให้ถาม path ไฟล์เสียง
Prompt ช่วยบอก path ของไฟล์เสียงที่สร้างเสร็จ และตรวจว่าไฟล์นั้นเปิดใช้งานได้จริงหรือไม่
คัดลอก
ใส่เสียงเข้าไปในวิดีโอ เมื่อมีไฟล์เสียงแล้ว ให้ Claude ใส่ลงใน HyperFrames composition
Prompt ช่วยใส่ไฟล์เสียงบรรยายล่าสุดลงในวิดีโอ HyperFrames เวอร์ชันล่าสุด
ให้คุณ:
1. ใช้ไฟล์เสียง narration ล่าสุดที่สร้างไว้
2. วางเสียงให้เริ่มพร้อมจังหวะเปิดวิดีโอ หรือหลังเปิดไม่เกิน 0.3 วินาที
3. ปรับความยาวภาพหรือ timing ถ้าจำเป็น เพื่อให้เสียงไม่โดนตัด
4. ถ้ามีเพลงหรือเสียงอื่น ให้ลด volume ไม่ให้ชนเสียงพูด
5. preview เพื่อตรวจ timing
6. เปิดหรืออัปเดต HTML preview ให้ฉันกด play ตรวจเสียงกับภาพ
7. ยังไม่ต้อง render MP4 จนกว่าฉันจะสั่งว่า “final render พร้อมเสียง”
ก่อนจบ ให้บอกว่าฉันต้องเปิด preview ที่ไหนเพื่อตรวจเสียง
คัดลอก
ถ้าวิดีโอเดิมไม่มีเพลงพื้นหลัง ให้ข้ามเรื่องเพลงไปได้
ถ้ามีเพลง ให้เสียงพูดต้องชัดกว่าเพลงเสมอ
ถ้าเสียงยาวเกินวิดีโอ Prompt เสียงบรรยายยาวเกินวิดีโอ ช่วยแก้ให้พอดี
เลือกวิธีที่เหมาะที่สุด:
- ย่อสคริปต์เสียงให้สั้นลง
- เพิ่มความยาววิดีโอเล็กน้อยถ้าไม่กระทบจังหวะ
- ปรับ timing ของ scene ให้รับกับเสียง
เป้าหมาย:
- เสียงต้องไม่โดนตัด
- วิดีโอไม่ควรยืดโดยไม่จำเป็น
- ข้อความบนจอยังอ่านทัน
สร้างเสียงใหม่ถ้าจำเป็น แล้วอัปเดต preview ให้ตรวจใหม่ ยังไม่ต้อง render MP4
คัดลอก
โดยทั่วไปวิดีโอสั้นควรย่อสคริปต์ก่อน ไม่ใช่ยืดวิดีโอทุกครั้ง
ถ้าเสียงฟังแข็งหรือไม่เข้ากับวิดีโอ Prompt เสียงบรรยายเวอร์ชันนี้ยังไม่เข้ากับวิดีโอ ช่วยสร้างใหม่
ปรับให้:
- เป็นธรรมชาติมากขึ้น
- สดใสแต่ไม่โอเวอร์
- พูดชัด ฟังง่าย
- จังหวะไม่รีบเกินไป
- เหมาะกับคนไทยทั่วไป
ถ้าต้องแก้ prompt สำหรับ Gemini TTS ให้แก้เองตาม official docs แล้วสร้างไฟล์เสียงเวอร์ชันใหม่
จากนั้นใส่ในวิดีโอและอัปเดต preview ให้ตรวจใหม่ ยังไม่ต้อง render MP4
คัดลอก
เสียงดีไม่ใช่แค่ “อ่านถูก” แต่ต้องเข้ากับ mood ของวิดีโอ
ตรวจวิดีโอพร้อมเสียงใน preview ก่อนจบบท ให้ Claude ตรวจงานเอง
Prompt ช่วยตรวจ preview วิดีโอพร้อมเสียงเวอร์ชันล่าสุด
Checklist:
- preview เปิดเล่นได้
- มีเสียงบรรยายจริง
- เสียงเริ่มถูกจังหวะ
- เสียงไม่โดนตัดท้าย
- เสียงพูดดังชัดกว่าเพลงหรือ effect
- ข้อความบนจอกับเสียงไม่ขัดกัน
- ความยาววิดีโอเหมาะสม
- ยังไม่ต้อง render MP4 จนกว่าฉันจะสั่ง final
ถ้ามีข้อไหนไม่ผ่าน ให้แก้ใน preview ก่อน ยังไม่ต้อง render MP4
คัดลอก
Final render พร้อมเสียง เมื่อดู preview แล้วเสียงกับภาพพอดี ค่อย render MP4 final
Prompt ตอนนี้ฉันพอใจกับ preview พร้อมเสียงแล้ว
ช่วย final render เป็น MP4 พร้อมเสียง
ให้คุณ:
1. ตรวจ preview ล่าสุดอีกครั้ง
2. render เป็นไฟล์ output-final-with-voice-v1.mp4
3. ถ้ามี error ตอน render ให้แก้เอง
4. ตรวจว่า MP4 เปิดได้และมีเสียง
5. บอก path ของไฟล์ final
ตอนนี้อนุญาตให้ render MP4 ได้
คัดลอก
บันทึกสถานะเสียงในโปรเจกต์ หลังได้ MP4 final พร้อมเสียง ให้บันทึกไว้
Prompt ช่วยอัปเดต PROJECT_BRIEF.md เกี่ยวกับเสียงบรรยาย
ให้บันทึกแบบสั้น:
- official Google Cloud / Gemini TTS docs ที่ใช้ตรวจ
- Google Cloud project ที่ใช้ โดยไม่เปิดเผยข้อมูลลับ
- model TTS ที่ใช้จริง
- path ไฟล์เสียงล่าสุด
- path preview พร้อมเสียงล่าสุด
- path MP4 final พร้อมเสียงล่าสุด ถ้า render แล้ว
- สคริปต์เสียงบรรยายเวอร์ชันสุดท้าย
- หมายเหตุเรื่อง authentication เช่น gcloud/ADC หรือ API key โดยไม่เปิดเผยค่า secret
คัดลอก
บทต่อไปเราจะใช้ทุกอย่างที่ทำมาเป็น template แล้วแตกออกเป็นวิดีโอ 5 แบบที่ใช้จริง
อัปเดตล่าสุด: 25 พ.ค. 2569
ความคิดเห็น
ยังไม่มีความคิดเห็น
เป็นคนแรกได้เลย