/watch: skill ฟรีที่ทำให้ Claude Code ดูวิดีโอความยาว 1 ชั่วโมงจบในไม่กี่นาที ด้วยต้นทุนราว $1
สรุปจากคลิปของช่อง Brad | AI & Automation ที่ปล่อย skill ฟรีบน GitHub ให้ Claude Code ดูวิดีโอ YouTube, Loom, Instagram Reels หรือไฟล์ MP4 ได้ทุกแหล่ง โดยใช้ ffmpeg + caption ฟรี + Whisper บน Groq จนต้นทุนต่อคลิปเหลือราว 1 ดอลลาร์

Claude Code สรุปวิดีโอความยาว 45 นาทีจาก Y Combinator ที่ Sam Altman เล่าวิธีปั้น startup จบได้ในเวลาไม่ถึง 2 นาที พร้อมแจกแจงโครงสร้างผู้พูด หัวข้อหลัก และสไลด์สำคัญบนหน้าจอครบถ้วน ทั้งหมดนี้ขับเคลื่อนด้วย skill ตัวเดียวชื่อ /watch จากช่อง Brad | AI & Automation ที่แจกฟรีบน GitHub เบื้องหลังการทำงานคือการผสานเครื่องมือสายโอเพนซอร์สอย่าง yt-dlp และ FFmpeg เข้ากับ subtitle ฟรีของ YouTube และ Whisper บน Groq ทำให้ต้นทุนวิเคราะห์คลิปเหลือเพียงประมาณ 1 ดอลลาร์ ไม่ว่าวิดีโอจะยาว 30 นาทีหรือ 1 ชั่วโมงเต็ม
เครื่องมือสรุปวิดีโอส่วนใหญ่มักเจอปัญหา 2 ด้าน คือถ้าไม่แพงเกินไป ก็มักอ่านเฉพาะ transcript จนพลาดสิ่งที่เกิดขึ้นบนหน้าจอไปเกือบหมด skill /watch จึงออกแบบมาให้ป้อนทั้ง เฟรมภาพและเสียงที่ถอดเป็นข้อความ ให้ Claude พร้อมกัน โมเดลจึง "มองเห็น" บริบทจริงบนหน้าจอ แทนที่จะเดาเอาจากคำพูดเพียงอย่างเดียว
สรุปภาพรวม: /watch skill ทำอะไรได้บ้าง
- พิมพ์
/watch <url>ใน Claude Code แล้วระบบจะดึง subtitle ฟรี ตัดเฟรมด้วย FFmpeg และส่งให้ Claude ประมวลผลรวดเดียวจบ - รองรับกว่า 1,000 เว็บไซต์ตามฐานข้อมูลของ yt-dlp ครอบคลุม YouTube, Loom, Instagram Reels ไปจนถึงไฟล์ MP4 ในเครื่อง
- จำกัดเพดานไว้ที่ 100 เฟรมสำหรับวิดีโอที่ยาวเกิน 30 นาที คุมต้นทุนให้อยู่ราว 1 ดอลลาร์ต่อคลิปเสมอ
- กรณีวิดีโอไม่มี subtitle ระบบจะสลับไปใช้ Whisper บน Groq อัตโนมัติ ซึ่งโควต้า free tier รองรับการถอดเสียงได้ถึง 2 ชั่วโมงต่อชั่วโมง ใช้งานประจำวันได้สบาย
- มี flag
start,endและzoomให้เจาะจงเฉพาะช่วงสั้นๆ เช่น 10 วินาทีในคลิป 2 ชั่วโมง ช่วยประหยัด context window
ทำไม Claude ถึงเข้าใจวิดีโอได้โดยไม่ต้องรอโมเดลใหม่
Anthropic ยังไม่มีโมเดลสำหรับประมวลผลวิดีโอโดยตรง ทางเลือกเดิมที่หลายคนใช้คือการยิง API ไปหา Google Gemini ซึ่งรับ video input ได้ แต่ก็แลกมาด้วยค่าใช้จ่ายต่อนาทีที่สูง และไม่ลื่นไหลเมื่อทำงานร่วมกับ Claude
แนวคิดของ /watch คือการมองวิดีโอตามความเป็นจริง วิดีโอหนึ่งคลิปประกอบด้วย 2 ส่วนหลัก นั่นคือ ลำดับภาพนิ่ง (เฟรม) กับ เสียงพูด (transcript) แทนที่จะส่งไฟล์วิดีโอดิบเข้าโมเดลราคาแพง เราสามารถแยกองค์ประกอบทั้งสองออกจากกัน แล้วป้อนให้ Claude ประมวลผลในรูปแบบที่เก่งที่สุดอยู่แล้ว นั่นคือรูปภาพควบคู่กับข้อความ
ข้อดีชัดเจนคือแก้จุดบอดของเครื่องมือที่พึ่งพา transcript เพียงอย่างเดียว ในหลายสถานการณ์ ข้อมูลสำคัญอยู่บนหน้าจอ เช่น กราฟ สไลด์ตัวเลข หรือการสาธิตโค้ด หากไม่อ่านภาพควบคู่ไปด้วย ข้อมูลสำคัญจะหายไปเกินครึ่ง
กลไกภายใน: yt-dlp + FFmpeg + Caption ฟรี + Whisper บน Groq
ความเรียบง่ายของสถาปัตยกรรมนี้คือไม่ต้องพึ่งพา MCP ซับซ้อน ไม่มี wrapper หนาเตอะ และไม่ผ่าน service ตัวกลางที่ไม่จำเป็น หัวใจหลักมีเพียงเครื่องมือระดับตำนาน 2 ตัว:
- yt-dlp ทำหน้าที่ดาวน์โหลดวิดีโอ รองรับมากกว่า 1,000 แพลตฟอร์ม
- FFmpeg ทำหน้าที่แยกวิดีโอออกเป็น 2 ส่วน คือจับภาพหน้าจอเป็นระยะตลอดทั้งคลิป และสกัดไฟล์เสียงสะอาดสำหรับส่งต่อให้ Whisper แปลงเป็นข้อความพร้อม timestamp
Claude จะได้รับข้อมูลพร้อมกันทั้งเฟรมภาพที่เรียงต่อกันเหมือน flipbook และ transcript ที่ระบุเวลาตรงกัน โมเดลจึงเชื่อมโยงได้ทันทีว่าช่วงที่พูดประโยคนี้ หน้าจอกำลังแสดงอะไร
สำหรับข้อความเสียง ระบบจะเลือกดึง caption ฟรีจาก YouTube ก่อนเสมอ หากเป็นคลิปที่ไม่มี subtitle เช่น ไฟล์อัดหน้าจอจาก Loom หรือ Instagram Reels ระบบจะ fallback ไปหา Whisper บน Groq ทันที ซึ่งทำงานได้รวดเร็วและอยู่ในโควต้าฟรี
ต้นทุนการใช้งาน: คุมงบได้ราว $1 ไม่ว่าคลิปจะยาวแค่ไหน
การป้อนทั้งภาพและข้อความเข้า LLM มักทำให้กังวลเรื่อง token budget แต่ /watch แก้เกมนี้ด้วยการปรับสเกลจำนวนเฟรมตามความยาวคลิป โดยกำหนดเพดานสูงสุดไว้ที่ 100 เฟรมสำหรับวิดีโอที่ยาวเกิน 30 นาที
ผลลัพธ์คือ วิดีโอความยาว 30 นาทีกับ 1 ชั่วโมงมีต้นทุน Claude usage ใกล้เคียงกัน อยู่ที่ประมาณ 1 ดอลลาร์ต่อรอบ จากการทดสอบรันซ้ำหลายรอบต่อเนื่องรวมความยาวคลิปกว่า 5 ชั่วโมง โควต้า session ยังถูกใช้ไปไม่ถึง 10%
สำหรับการถอดเสียง หากเป็นคลิป YouTube ระบบจะใช้ caption ฟรีโดยไม่ต้องเสียค่า API ส่วนกรณีไฟล์ไม่มี subtitle โควต้าของ Groq free tier ให้สิทธิ์ถอดเสียง 2 ชั่วโมงต่อชั่วโมงจริง ซึ่งเพียงพอสำหรับการใช้งานทั่วไปในแต่ละวัน
วิธีติดตั้งใน Claude Code ภายใน 5 นาที
- ดาวน์โหลด skill ฟรีจาก GitHub ตามลิงก์ในคำอธิบายคลิปต้นฉบับ
- รันคำสั่งติดตั้งตามคู่มือใน README
- Claude Code จะเรียก setup script เพื่อตรวจสอบและติดตั้ง dependency ที่จำเป็นอย่าง yt-dlp และ FFmpeg ให้อัตโนมัติ
- ใส่ API key เพื่อ authenticate กับ Groq สำหรับการถอดเสียงกรณีที่ไม่มี caption
- ใช้งานได้ทันทีด้วยคำสั่ง
/watch <url>
การใช้งานจริงทำได้สะดวกรวดเร็ว เพียงคัดลอก URL ของวิดีโอมาวางหลังคำสั่ง /watch ใน Claude Code ระบบจะจัดการดึง subtitle ตัดเฟรม และส่งให้ Claude วิเคราะห์โครงสร้างเนื้อหาออกมาเป็นสรุปให้อ่านได้ทันที
3 Use Case ในการทำงานจริง
1. ถอดโครงสร้าง Hook ของคลิป Viral เพื่อทำ Content Research
สำหรับสายคอนเทนต์ สามารถป้อนคลิปที่ทำยอดวิวได้ดีให้ Claude ช่วยแกะ visual setup ในช่วงเปิด คำพูดเปิดหัว จุดที่สร้าง pattern interrupt ไปจนถึงภาพที่โผล่ขึ้นมาบนจอในวินาทีที่ hook คนดู เปลี่ยนขั้นตอนการนั่งกดย้อนดูคลิปซ้ำๆ 10 นาที ให้จบในคำสั่งเดียว
2. ตรวจสอบ UI Bug จากไฟล์ Screen Recording
สำหรับนักพัฒนา เมื่อพบ UI bug ที่จำลองซ้ำได้ยาก สามารถอัดคลิปหน้าจอ 30 วินาทีแล้วส่งให้ Claude พร้อมคำสั่ง /watch เพื่อถามว่าเกิดอะไรขึ้นก่อนระบบจะ crash Claude จะไล่ดูเฟรมรอบจุดเกิดเหตุ ตรวจสอบ state change บนหน้าจอ และชี้เป้าวินาทีที่เริ่มแสดงอาการ ช่วยประหยัดเวลา debug ได้หลายชั่วโมง
3. เติมข้อมูลลง Second Brain ใน Obsidian อัตโนมัติ
สร้าง workflow ติดตามช่องที่สนใจ แล้วให้ Claude รัน /watch ดึงสาระสำคัญจากแต่ละคลิป แปลงเป็นบันทึกโครงสร้างเรียบร้อย แล้วบันทึกลง Obsidian โดยอัตโนมัติ ช่วยสร้างคลังความรู้ที่ค้นหาได้ง่ายโดยไม่ต้องเสียเวลานั่งดูคลิปทั้งหมดด้วยตัวเอง ยิ่งระบบวิเคราะห์คลิปมากขึ้น second brain ก็ยิ่งสะสม pattern ของคอนเทนต์ได้แน่นขึ้นตามไปด้วย
ข้อจำกัดที่ควรรู้ก่อนนำไปใช้
- การจำกัด 100 เฟรมในคลิปยาว อาจทำให้รายละเอียดที่เกิดขึ้นเพียงเสี้ยววินาทีตกหล่นได้ หากต้องการวิเคราะห์ช่วงเฉพาะเจาะจง ควรระบุ flag
start,endหรือzoomเสมอ - คุณภาพ subtitle ขึ้นอยู่กับต้นทาง หากคลิปใช้ auto caption ที่สะกดศัพท์เทคนิคผิด การสรุปอาจคลาดเคลื่อนได้ ควรตรวจสอบ transcript อีกครั้งก่อนนำไปใช้อ้างอิง
- ระบบพึ่งพา yt-dlp และ FFmpeg จึงควรอัปเดตเวอร์ชันสม่ำเสมอ เพื่อรองรับการเปลี่ยนแปลงของแต่ละแพลตฟอร์ม
- โควต้าฟรีของ Groq มีขีดจำกัด หากต้องการประมวลผลวิดีโอจำนวนมากพร้อมกันแบบ batch อาจจำเป็นต้องขยับไปใช้ paid plan
บทสรุป
skill /watch สะท้อนแนวคิดสำคัญในการสร้าง AI workflow คือเมื่อโมเดลเฉพาะทางยังไม่พร้อมหรือมีราคาแพง เราสามารถจัดโครงสร้าง input ใหม่ด้วยเครื่องมือพื้นฐานที่เสถียรอย่าง yt-dlp และ FFmpeg เพื่อแปลงข้อมูลให้อยู่ในฟอร์แมตที่โมเดลปัจจุบันถนัดที่สุด
สำหรับคนที่ใช้งาน Claude Code อยู่แล้ว /watch ช่วยเปลี่ยนมุมมองจากการใช้ AI เขียนโค้ดเพียงอย่างเดียว ให้กลายเป็นผู้ช่วยดูและย่อยคอนเทนต์สารพัดรูปแบบ ไม่ว่าจะเป็นงานวิจัยคอนเทนต์ ตรวจสอบ UI bug หรือจัดเก็บบันทึกความรู้ ด้วยต้นทุนเพียงไม่กี่ดอลลาร์ต่อสัปดาห์
ชอบเรื่องแนวนี้ มีอีบุ๊คฟรีให้อ่านต่อ
สร้าง Claude Skill แบบไม่ต้องรู้โค้ด คู่มือสร้าง Claude Skill ของคุณเองด้วยการคุยกับ Claude Code เป็นภาษาไทย
กดสมัครแล้วเราจะส่งเทคนิค AI และของแจกใหม่ๆ ให้ทางอีเมล เลิกรับได้ตลอด
สร้าง AI Automation Pipeline ทุกแบบ ด้วย Agents และ Skills

ปูจากพื้นฐาน prompt, context และ cost ไปจนปั้น Skill สั่ง Agent กับ Sub-agent แล้วต่อทุกอย่างเป็น pipeline อัตโนมัติที่ออกแบบเองได้ ดูฟรี 7 บทก่อนตัดสินใจ


