short-video-generator-AI ตัดคลิป YouTube ยาวเป็นคลิปสั้นแนวตั้ง 9:16 ได้หลายคลิป ทั้งใช้ฟรีและเป็นโอเพนซอร์ส
short-video-generator-AI เป็นโปรเจกต์โอเพนซอร์สที่ตัดคลิป YouTube ยาวเป็นคลิปสั้น 9:16 พร้อมนำไปโพสต์ เครื่องมือใช้ฟรี แต่ยังต้องมี API Key ของ LLM

short-video-generator-AI เป็นโปรเจกต์โอเพนซอร์สบน GitHub ที่เปิดให้ดาวน์โหลดมารันบนเครื่องตัวเองได้ฟรี เพียงแค่วางลิงก์ YouTube ลงไป โปรแกรมก็จะตัดคลิปยาวออกมาเป็นคลิปสั้นแนวตั้ง 9:16 ที่พร้อมโพสต์ให้ทีละหลายคลิป ตัวโปรเจกต์ชูจุดเด่นว่าไม่มีระบบเครดิตรายคลิป ไม่มีลายน้ำ และตั้งใจพัฒนาออกมาเป็นทางเลือกฟรีสำหรับคนที่ไม่อยากจ่ายรายเดือนให้กับบริการอย่าง OpusClip หรือ Vidyo.ai ปัจจุบันโปรเจกต์นี้มียอดกดดาวแล้วประมาณ 1,000 ดาว และมีคนนำโค้ดไปพัฒนาต่ออีก 155 ครั้ง
ครีเอเตอร์ที่มีคลิปยาวอยู่ในช่องเยอะๆ มักเจอปัญหานี้เป็นประจำ เช่น คลิปสัมภาษณ์ยาวหนึ่งชั่วโมง มักมีช่วงไฮไลต์ที่น่าสนใจอยู่หลายจุด แต่การมานั่งไล่ดูทีละนาทีแล้วตัดครอปเป็นแนวตั้งเองนั้นกินเวลามาก ส่วนเครื่องมือตัดคลิปอัตโนมัติก็มักจะต้องเสียค่าบริการรายเดือน แต่ก่อนจะนำเครื่องมือนี้ไปใช้ มีเรื่องสำคัญที่ควรรู้คือ ตัวโปรแกรมใช้วิธีไหนเลือกว่าจะตัดช่วงไหนออกมา เพราะระบบไม่ได้ตัดสินจากภาพในวิดีโอ ซึ่งถ้าเข้าใจหลักการนี้ จะช่วยให้ใช้งานได้ตรงจุดและได้ผลลัพธ์ที่ดีขึ้น
แค่ใส่ลิงก์เดียว ได้คลิปสั้นออกมาหลายคลิป
การใช้งานพื้นฐานง่ายๆ ด้วยคำสั่งเพียงบรรทัดเดียว แค่วางลิงก์คลิปยาวที่ต้องการแล้วกดรัน:
python main.py "https://www.youtube.com/watch?v=video_id"เมื่อประมวลผลเสร็จแล้ว ระบบจะบันทึกคลิปทั้งหมดไว้ในโฟลเดอร์ output โดยค่าเริ่มต้นจะตัดออกมาให้ 3 คลิปต่อการรันหนึ่งครั้ง นอกจากนี้ ถ้ามีไฟล์วิดีโอเก็บอยู่ในเครื่องอยู่แล้ว ก็สามารถใส่ที่อยู่ของไฟล์แทนลิงก์ YouTube ได้ทันที โดยไม่ต้องเสียเวลาอัปโหลดขึ้นเว็บก่อน
ผลลัพธ์ที่ได้จะเป็นคลิปแนวตั้งขนาด 9:16 พร้อมคำบรรยายในตัว ตัวอย่างที่โปรเจกต์นำมาแสดงเป็นคอนเทนต์ที่มีคนพูดเป็นหลัก ทั้งคลิปสุนทรพจน์และคลิปบรรยายบนเวที TED
AI ไม่ได้เลือกจากภาพ แต่เลือกจากสิ่งที่เราพูด

หลังจากดาวน์โหลดคลิปเสร็จแล้ว ขั้นตอนแรกคือการถอดเสียงพูดเป็นข้อความ ระบบจะใช้ Whisper ผ่านโมเดล faster-whisper ประมวลผลบนเครื่องของคุณเอง จึงไม่ต้องส่งไฟล์เสียงออกไปข้างนอก ผลลัพธ์คือบทพูดที่ระบุเวลาไว้ชัดเจนว่าแต่ละประโยคอยู่ตรงนาทีไหน
จากนั้น LLM โมเดลภาษาในกลุ่มเดียวกับ ChatGPT ที่คุณเลือกใช้ จะเข้ามาอ่านข้อความทั้งหมด เพื่อประเมินก่อนว่าคลิปนี้เป็นคอนเทนต์ประเภทไหน เช่น พอดแคสต์ สัมภาษณ์ คลิปสอน หรือ Vlog รวมถึงวิเคราะห์จังหวะการเล่าเรื่องว่าเร็วหรือช้า เพื่อปรับแนวทางการค้นหาไฮไลต์ให้เข้ากับสไตล์ของคลิปนั้นๆ
เมื่อรู้แนวทางแล้ว LLM จะสแกนข้อความอีกรอบด้วยชุดเกณฑ์ที่โปรเจกต์เรียกว่า Virality Framework เช่น ช่วงต้นคลิปที่ดึงความสนใจหรือ Hook, จุดที่อารมณ์พีก, ความคิดเห็นที่หนักแน่น, การเฉลยประเด็น, ความขัดแย้ง, ประโยคเด็ดที่ชวนแชร์ต่อ, จุดไคลแมกซ์ของเรื่องเล่า และเนื้อหาที่มีประโยชน์และนำไปใช้ได้จริง โดยช่วงเวลาที่ตรงกับเกณฑ์เหล่านี้จะได้คะแนนตั้งแต่ 0 ถึง 100
ถ้าบางช่วงที่ได้คะแนนมีเนื้อหาทับซ้อนกัน ระบบจะรวมช่วงเหล่านั้นแล้วเก็บช่วงที่ได้คะแนนสูงสุดไว้ จากนั้นจะดึงไฮไลต์ออกมาตามจำนวนคลิปที่เรากำหนดผ่านตัวเลือกคำสั่ง --n แล้วจึงเข้าสู่ขั้นตอนสุดท้าย คือการครอปวิดีโอเป็นแนวตั้งตามอัตราส่วนที่ต้องการ พร้อมใส่ประโยค Hook ที่ AI แต่งขึ้นมาไว้ที่ต้นคลิป
จุดที่ชวนเข้าใจผิดคือคำว่า "หาช่วงไวรัล" ฟังดูเหมือน AI นั่งดูภาพแล้วรู้เองว่าช่วงไหนน่าสนใจ แต่ตามขั้นตอนการทำงานที่โปรเจกต์วางไว้ ระบบจะเลือกช่วงจากบทพูด หมายความว่า คลิปที่เน้นภาพเป็นหลัก เช่น รีวิวสินค้า สอนทำอาหาร หรือการสาธิตหน้าจอ เครื่องมือนี้จะวิเคราะห์ได้ยากกว่าคลิปสัมภาษณ์หรือคลิปที่มีคนนั่งพูดคุยกัน ขั้นตอนการถอดเสียงจึงเป็นตัวกำหนดตั้งแต่แรกว่าจะมีเนื้อหาส่วนไหนให้เลือกตัดบ้าง ทั้งนี้ แนวคิดการทำงานเป็นขั้นตอนแบบนี้ไม่ได้มีแค่โปรเจกต์นี้ตัวเดียว เครื่องมืออย่าง AutoClip ก็ใช้กระบวนการ 7 ขั้นตอนในการตัดคลิปไฮไลต์เช่นกัน แต่เปิดให้ผู้ใช้ปรับแต่งรายละเอียดในแต่ละขั้นตอนได้มากกว่า
วิธีติดตั้งบนเครื่องและเลือกโมเดล AI
สิ่งที่คุณต้องเตรียมไว้ก่อนติดตั้งมี 2 อย่าง คือ Python เวอร์ชัน 3.10 ขึ้นไป และ API Key ของ LLM สำหรับเรียกใช้โมเดล AI
ขั้นตอนการติดตั้งทำได้โดยเปิดเทอร์มินัลแล้วพิมพ์คำสั่งตามนี้:
git clone https://github.com/pierrenade/short-video-generator-AI.git
cd short-video-generator-AI
python -m venv venv
pip install -r requirements.txt(หมายเหตุ: หลังจากรันคำสั่ง python -m venv venv ให้เปิดใช้งาน virtual environment ตามระบบปฏิบัติการของคุณก่อน แล้วค่อยรันคำสั่ง pip install)
จากนั้นสร้างและตั้งค่าไฟล์ .env สำหรับเก็บ API Key และกำหนดค่าการทำงานของ Whisper:
LLM_PROVIDER=gemini
GEMINI_API_KEY=your_gemini_key_here
LOCAL_WHISPER_MODEL=base
LOCAL_WHISPER_DEVICE=auto
ตัวเลือก LLM_PROVIDER ใช้กำหนดว่าจะให้ AI เจ้าไหนช่วยอ่านบทพูด แม้ตัวโปรเจกต์นี้จะเป็นโอเพนซอร์สที่ใช้งานได้ฟรี แต่ขั้นตอนการจัดอันดับไฮไลต์ยังต้องใช้โควตาหรือจ่ายค่าบริการให้กับผู้ให้บริการโมเดลอยู่ดี โดยโปรเจกต์รองรับ 3 เจ้าหลัก:
- Gemini: มีโควตาให้ใช้งานฟรีต่อวัน เหมาะกับคนที่ต้องการทดลองใช้งานโดยยังไม่อยากเสียเงิน ขอรับ API Key ได้ที่ Google AI Studio
- OpenAI: ไม่มีแพ็กเกจฟรี ต้องจ่ายเงินอย่างเดียว เหมาะสำหรับคนที่มีบัญชีอยู่แล้ว ขอรับ API Key ได้ที่ OpenAI Platform
- MuAPI: ไม่มีแพ็กเกจฟรีเช่นกัน แต่คิดเงินตามการใช้งานจริงโดยไม่ต้องสมัครสมาชิกรายเดือน เหมาะกับคนที่ตัดคลิปเป็นครั้งคราว ไม่ได้ทำทุกวัน ดูรายละเอียดได้ที่ MuAPI
สำหรับ LOCAL_WHISPER_MODEL คุณสามารถเลือกรุ่นโมเดลสำหรับถอดเสียงได้ตามต้องการ โดยค่าเริ่มต้นคือ base และไล่ขึ้นไปได้ถึง large-v3 ส่วน LOCAL_WHISPER_DEVICE เลือกได้ระหว่าง auto, cpu หรือการ์ดจอแยกอย่าง cuda ตามเครื่องที่ใช้
ตัวเลือกคำสั่งที่ควรรู้ก่อนกดรันจริง
เมื่อทดลองรันครั้งแรกผ่านแล้ว คุณสามารถปรับแต่งการทำงานเพิ่มเติมได้ด้วยตัวเลือกคำสั่ง 5 ตัวต่อไปนี้:
| Flag | ค่าเริ่มต้น | คำอธิบายการใช้งาน |
|---|---|---|
--n | 3 | จำนวนคลิปสั้นที่ต้องการตัดออกมาจากคลิปยาว |
--ratio | 9:16 | อัตราส่วนวิดีโอ เช่น 9:16 สำหรับ Reels หรือ TikTok และ 1:1 สำหรับโพสต์สี่เหลี่ยมจัตุรัส |
--resolution | 720 | ความละเอียดของคลิปต้นทางที่จะดาวน์โหลด (เลือกได้: 360 / 480 / 720 / 1080) |
--language | auto | กำหนดรหัสภาษาให้ Whisper ถอดเสียงโดยตรง (ในคู่มือยกตัวอย่าง en และ zh) |
--no-hook | - | ปิดการใส่ประโยค Hook ที่ AI เขียนให้ที่ต้นคลิป |
ตัวอย่างการรันคำสั่งพร้อมระบุตัวเลือก:
python main.py "https://www.youtube.com/watch?v=video_id" \
--n 3 \
--ratio 9:16 \
--resolution 1080ตัวเลือกคำสั่ง 2 ตัวที่ควรพิจารณาก่อนรันคือ:
--language: สำคัญมาก เพราะขั้นตอนทั้งหมดต้องพึ่งพาบทพูดที่ถอดเสียงออกมา หากปล่อยเป็นautoแล้วระบบจับภาษาเพี้ยน ไฮไลต์ที่ได้ก็จะผิดพลาดตามไปด้วย การระบุรหัสภาษาไปตรงๆ จึงเป็นจุดแรกที่ควรตรวจสอบหากผลลัพธ์ออกมาไม่ถูกต้อง--no-hook: ถ้าช่องของคุณมีสไตล์การเปิดคลิปของตัวเองอยู่แล้ว ใช้ตัวเลือกนี้ปิดประโยค Hook ที่ AI แต่งให้ แล้วเปิดคลิปด้วยเนื้อหาจริงเลยจะดูเป็นธรรมชาติกว่า
มีหน้าเว็บในเครื่องสำหรับคนไม่อยากพิมพ์คำสั่ง
ถ้าคุณไม่ถนัดพิมพ์คำสั่งในเทอร์มินัล ตัวโปรเจกต์ก็มีหน้าเว็บควบคุมในเครื่อง (Local UI) ให้ใช้งานได้เช่นกัน โดยต้องรันคำสั่งแยกกัน 2 ส่วน:
เริ่มจากรันเซิร์ฟเวอร์หลัก:
python3 server.pyจากนั้นเปิดอีกหน้าต่างเพื่อรันเซิร์ฟเวอร์หน้าเว็บ:
cd web
python3 -m http.server 8000เสร็จแล้วเปิดเบราว์เซอร์ไปที่ http://localhost:8000/shorts-generator-ui.html หน้านี้จะช่วยให้คุณวางลิงก์และปรับตั้งค่าตัวเลือกต่างๆ ผ่านหน้าเว็บได้สะดวกขึ้น
แต่หน้าเว็บนี้ช่วยเรื่องความสะดวกในการกดตัดคลิปทั่วไปเท่านั้น ส่วนการตั้งค่า API Key หรือเปลี่ยนผู้ให้บริการโมเดล ยังคงต้องเข้าไปแก้ไขในไฟล์ .env อยู่ดี ในขั้นตอนการติดตั้งครั้งแรกจึงยังต้องเปิดเทอร์มินัลมาตั้งค่าอยู่เหมือนเดิม
ข้อจำกัดและจุดที่ต้องรู้ก่อนใช้

- ฟีเจอร์พากย์เสียงและแปลภาษา: แม้หน้าโปรเจกต์จะระบุว่าทำได้ครบทั้งใส่ซับ แปลภาษา และพากย์เสียงในตัว แต่ขั้นตอนที่อธิบายไว้เป็นข้อๆ มีทั้งการดาวน์โหลด ถอดเสียง จัดอันดับไฮไลต์ และครอปวิดีโอเป็นแนวตั้ง ถ้าคุณตั้งใจจะนำมาใช้พากย์เสียงภาษาไทยเป็นหลัก แนะนำให้เข้าไปดูของจริงในหน้าโปรเจกต์ก่อน ไม่ควรตัดสินใจจากคำโปรยสรุปเพียงอย่างเดียว
- สถานะของโปรเจกต์: แม้จะมีคนกดดาวถึง 1,000 ดาว แต่ประวัติการพัฒนามีการอัปเดตโค้ดเพียง 12 ครั้งจากผู้พัฒนาคนเดียว ข้อดีคือโค้ดอยู่ในมือคุณ และหน้าโปรเจกต์เปิดให้นำโค้ดไปพัฒนาต่อในงานของตัวเองได้ภายใต้สัญญาอนุญาต MIT ซึ่งเป็นข้อตกลงใช้งานแบบโอเพนซอร์ส ข้อเสียคือไม่มีใครรับประกันว่าจะมีคนมาแก้บั๊กหรือพัฒนาต่อให้
- ต้นทุนที่ย้ายไปอยู่ส่วนอื่น: ค่าใช้จ่ายไม่ได้หายไปไหน แต่ย้ายจากค่าสมาชิกรายเดือนของบริการตัดคลิปมาเป็นค่า API ของ LLM ตามปริมาณการใช้งานจริง รวมถึงทรัพยากรเครื่องและเวลาที่ใช้ในการถอดเสียงและเรนเดอร์ สำหรับคนที่ต้องตัดคลิปทุกวันเป็นจำนวนมาก การจ่ายเหมาแบบรายเดือนอาจจะคุ้มกว่า แต่สำหรับคนที่ตัดคลิปยาวเพียงเดือนละไม่กี่คลิป การจ่ายตามการใช้งานจริงจะประหยัดกว่ามาก
คลิปที่ได้เป็นเพียงตัวช่วยคัดกรอง ไม่ใช่คำตอบสุดท้าย
เครื่องมือประเภทนี้ไม่ได้การันตีว่าคลิปที่ตัดออกมาจะกลายเป็นไวรัล ตัวโปรแกรมเพียงแค่ช่วยสแกนบทพูดทั้งหมดในคลิปยาว แล้วหาว่าช่วงไหนมีเนื้อหาเข้าเกณฑ์ที่กำหนดไว้มากที่สุด
คลิปที่ได้จึงเปรียบเสมือน "รายชื่อคลิปที่ผ่านเข้ารอบ" เท่านั้น สุดท้ายแล้วคนที่ต้องดูและตัดสินใจเลือกคลิปไปโพสต์จริงก็ยังเป็นคุณอยู่ดี เพียงแต่เครื่องมือนี้ช่วยย่นเวลา จากเดิมที่ต้องนั่งไล่ดูไทม์ไลน์ยาวเป็นชั่วโมง มาเป็นการเลือกจาก 3 คลิปที่คัดมาให้แล้วแทน
ที่มา: โปรเจกต์ short-video-generator-AI บน GitHub
ชอบเรื่องแนวนี้ มีอีบุ๊คฟรีให้อ่านต่อ
สร้าง Claude Skill แบบไม่ต้องรู้โค้ด คู่มือสร้าง Claude Skill ของคุณเองด้วยการคุยกับ Claude Code เป็นภาษาไทย
กดสมัครแล้วเราจะส่งเทคนิค AI และของแจกใหม่ๆ ให้ทางอีเมล เลิกรับได้ตลอด
สร้าง AI Automation Pipeline ทุกแบบ ด้วย Agents และ Skills

ปูจากพื้นฐาน prompt, context และ cost ไปจนปั้น Skill สั่ง Agent กับ Sub-agent แล้วต่อทุกอย่างเป็น pipeline อัตโนมัติที่ออกแบบเองได้ ดูฟรี 7 บทก่อนตัดสินใจ


