MiniMax H3 บน ComfyUI ปั้นคลิปพร้อมเสียงในรอบเดียว โหลดมารันเองได้ แลกกับพื้นที่ดิสก์ 42 GB
MiniMax H3 คือโมเดลสร้างวิดีโอที่ปั้นเสียงพูด เสียงประกอบฉาก และดนตรี ออกมาพร้อมภาพในรอบเดียว และ ComfyUI ก็รองรับให้โหลดมารันเองได้แล้ว ก่อนกดโหลดมีตัวเลขที่ต้องรู้ ชุดไฟล์เล็กที่สุดที่ยังทำงานได้ครบรวมกันราว 42 GB และบางส่วนของ H3 ยังต้องเรียกผ่าน API

MiniMax H3 สร้างคลิปวิดีโอออกมาพร้อมเสียงในไฟล์เดียว และตอนนี้ไฟล์โมเดลของมันก็เปิดให้ใครก็ได้โหลดไปเก็บไว้ในเครื่องแล้วกดรันเอง
การเปิดให้โหลดมารันเองตรงนี้ แปลว่าไม่มีใครมาเก็บเงินเราทุกเดือน ไม่ได้แปลว่าไม่ต้องจ่ายอะไรเลย ต้นทุนแค่ย้ายออกจากบิลรายเดือน ไปโผล่ที่เครื่องของเราแทน
ชุดไฟล์ที่เล็กที่สุดเท่าที่ยังทำงานได้ครบ รวมกันราว 42 GB และนั่นคือแค่ตอนวางลงดิสก์ ยังไม่นับตอนที่ต้องโหลดเข้าการ์ดจอเพื่อเรนเดอร์จริง ตัวเลขนี้เองที่ตัดสินว่าเครื่องตรงหน้าจะพาไปได้ถึงไหน
เสียงกับภาพออกมาจากรอบเดียวกัน
เสียงในคลิปของ H3 ไม่ได้ทำแยกแล้วเอามาวางทับตอนท้าย ทั้งเสียงพูดของตัวละคร เสียงประกอบฉาก และดนตรี เกิดขึ้นในรอบประมวลผลรอบเดียวกับภาพ ผลคือเสียงกับภาพตรงจังหวะกันมาตั้งแต่ในไฟล์ที่ได้ ไม่ต้องมานั่งไล่จับให้ตรงทีหลัง
หน้าข้อมูลโมเดลบน Hugging Face วางกรอบไว้ชัด คลิปหนึ่งยาวได้ 4 ถึง 15 วินาที ภาพเดินที่ 24 เฟรมต่อวินาที และเสียงออกมาเป็นสเตอริโอที่ 32 kHz ส่วนสัดส่วนภาพมีให้เลือกหลายแบบ ตั้งแต่ 21:9 · 16:9 · 4:3 · 1:1 · 3:4 ไปจนถึง 9:16 สำหรับคลิปแนวตั้ง
ตัวเลข 2K ที่เห็นตอนเปิดตัวเป็นของจริง แต่ไม่ได้มาจากไฟล์ชุดที่โหลดมารันเอง ไฟล์ที่เปิดให้โหลดปั้นภาพที่ด้านสั้น 768 พิกเซล ส่วนการยกขึ้นไป 2K เป็นงานของอีกส่วนหนึ่ง ที่ยังต้องยิงไปประมวลผลบนเซิร์ฟเวอร์ของ MiniMax
มีข้อจำกัดหนึ่งที่คนไทยต้องรู้ก่อนวางแผนงาน บทพูดที่ H3 ทำได้เสถียรมีอยู่ 11 ภาษา คืออาหรับ จีน อังกฤษ ฝรั่งเศส เยอรมัน อิตาลี ญี่ปุ่น เกาหลี โปรตุเกส รัสเซีย และสเปน ไทยไม่อยู่ในรายการนั้น
หน้าข้อมูลโมเดลบอกไว้ว่าภาษาอื่นที่ไม่อยู่ในรายการก็พูดได้ เพียงแต่ผลลัพธ์ไม่เท่ากันในแต่ละภาษา แปลว่าลองได้ แต่ยังไม่ควรรับงานที่ต้องพึ่งบทพูดภาษาไทยให้ตรงเป๊ะ
งานที่เคยต้องใช้โมเดลคนละตัว ยุบมาอยู่ในคำสั่งเดียว
ก่อนหน้านี้ งานสายภาพและเสียงเคยอยู่กันคนละโมเดล ฝั่งภาพนิ่งแยกเป็นตัวสร้างภาพจากข้อความ ตัวแก้ภาพ ตัวล็อกหน้าตัวละคร และตัวล็อกสไตล์
ฝั่งวิดีโอก็แตกออกไปอีก ทั้งทำคลิปจากข้อความล้วน ทำคลิปจากภาพนิ่ง ล็อกเฟรมแรกกับเฟรมสุดท้าย ไปจนถึงงานตัดต่อ ส่วนงานเสียง ไม่ว่าจะเสียงพูด เสียงประกอบ หรือดนตรี ก็เป็นคนละสายวิจัยกันมานาน
H3 ยุบงานพวกนี้มาอยู่ในระบบเดียว แล้วเปลี่ยนวิธีสั่งงานไปด้วย จากเดิมที่ต้องตั้งค่าทีละช่อง กลายเป็นเขียนบอกด้วยภาษาคนว่าไฟล์แต่ละชิ้นที่ป้อนเข้าไปรับบทอะไรในช็อต ในบล็อกตอนเปิดตัว ทาง MiniMax ยกตัวอย่างพรอมต์ที่สั่งงานสามไฟล์พร้อมกันไว้แบบนี้
Reference the Hitchcock camera movement from Video 1, have the character in Image 2 sing, with the vocals matching Audio 3.อ่านเป็นไทยคือ ขอมุมกล้องแบบฮิตช์ค็อกจากไฟล์วิดีโอชิ้นที่หนึ่ง ให้ตัวละครในไฟล์ภาพชิ้นที่สองร้องเพลง โดยใช้น้ำเสียงจากไฟล์เสียงชิ้นที่สาม ทั้งหมดนี้เขียนเป็นประโยคเดียว แทนที่จะไปไล่ตั้งค่าทีละช่อง
ส่วน H3 เป็นรุ่นที่สามในสายนี้ ต่อจาก Hailuo 01 และ Hailuo 02
สามขั้นแรกบน ComfyUI ตั้งแต่เวอร์ชัน 0.30.0
ComfyUI คือโปรแกรมต่อโหนดสำหรับงานสร้างภาพและวิดีโอที่รันบนเครื่องเราเอง และมันรองรับ H3 มาให้ในตัวตั้งแต่เวอร์ชัน 0.30.0 เป็นต้นไป ไม่ต้องหาปลั๊กอินเสริมมาลงก่อนถึงจะรันได้ คู่มือทางการสรุปการเริ่มต้นไว้เป็นสามขั้น
- อัปเดต ComfyUI ให้ขึ้นไปถึงเวอร์ชัน 0.30.0 หรือใหม่กว่านั้น
- เปิด Template Library ในโปรแกรม แล้วเลือกหมวด Video จะเจอเทมเพลตของ MiniMax H3 วางไว้ให้
- เปิดเทมเพลตที่เลือก จะมีหน้าต่างเด้งขึ้นมาไล่โหลดไฟล์โมเดลที่ต้องใช้ให้ครบ แล้วกดรันได้เลย
เทมเพลตที่วางไว้ให้ตอนนี้มีสามแบบ แยกตามวัตถุดิบที่เรามีอยู่ในมือ
- T2V สำหรับคนที่มีแค่ข้อความ พิมพ์บรรยายฉากลงไป แล้วให้โมเดลปั้นทั้งภาพและเสียงออกมาเอง
- I2V สำหรับคนที่มีภาพตั้งต้นอยู่แล้ว ใส่ภาพเข้าไปให้มันขยับ และจะล็อกเฟรมแรกกับเฟรมสุดท้ายเพิ่มด้วยก็ได้
- R2V สำหรับงานที่ต้องคุมให้เหมือนเดิมทุกคลิป ล็อกหน้าตัวละคร สไตล์ภาพ ท่าทาง มุมกล้อง หรือน้ำเสียง จากไฟล์อ้างอิงที่ป้อนเข้าไป
สามตัวนี้เป็นแค่ตัวอย่างที่วางไว้ให้เริ่มง่าย ไม่ใช่ทั้งหมดที่โมเดลทำได้ ใครอยากต่อโหนดเองก็หยิบ MiniMaxH3ImageToVideo กับ MiniMaxH3ReferenceToVideo ไปประกอบเวิร์กโฟลว์ของตัวเองได้
เคลียร์ดิสก์ก่อน ชุดเล็กสุดของ MiniMax H3 อยู่ที่ราว 42 GB

ไฟล์ที่หน้าต่างของ ComfyUI ไล่โหลดให้ ไม่ได้มีก้อนเดียว มันมีสี่ก้อน และแยกไปเก็บตามโฟลเดอร์ของมันเอง ทั้งหมดอยู่ในคลัง Comfy-Org/MiniMax-H3 บน Hugging Face ซึ่งเอาไฟล์ต้นฉบับมาแพ็กใหม่ให้ ComfyUI เรียกใช้ได้ตรงๆ
| ไฟล์ | หน้าที่ | ขนาด |
|---|---|---|
minimax_h3_fl2va_pruned_int8_convrot.safetensors | ตัวโมเดลหลักของเทมเพลต T2V และ I2V | 21 GB |
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | ตัวอ่านคำสั่ง ที่ ComfyUI เรียกว่า text encoder | 15.7 GB |
minimax_h3_video_vae_fp16.safetensors | แปลงข้อมูลกลับออกมาเป็นภาพ | 5.21 GB |
minimax_h3_audio_vae_fp32.safetensors | แปลงข้อมูลกลับออกมาเป็นเสียง | 605 MB |
บวกกันแล้วอยู่ที่ราว 42 GB ไฟล์พวกนี้ผ่านการบีบอัดมาแล้ว และเป็นชุดที่เทมเพลตมาตรฐานเลือกโหลดให้เอง
ถ้าอยากได้ไฟล์ต้นฉบับที่ยังไม่บีบอัด ตัวเลขจะเปลี่ยนไปคนละเรื่อง ตัวโมเดลหลักแบบ bf16 ไฟล์เดียวหนัก 66.3 GB ส่วนตัวอ่านคำสั่งแบบเดียวกันอีก 51.5 GB
และถ้าอยากเล่นโหมด R2V ด้วย ต้องเผื่อที่อีกก้อน เพราะมันใช้ตัวโมเดลหลักคนละไฟล์กับที่ T2V และ I2V ใช้ นั่นคือ 21 GB เพิ่มเข้ามาอีกชุด
โจทย์นี้ไม่ได้มีแค่ H3 โมเดลตัวอื่นที่เปิดไฟล์ให้โหลดก็เจอเรื่องเดียวกัน อย่าง DeepSeek-V4-Flash-0731 ที่ไฟล์เล็กที่สุดยังหนักถึง 82.5 GB เทียบกันแล้ว 42 GB ถือว่าเบากว่ามาก แต่ก็ยังเป็นตัวเลขที่ต้องไปเคลียร์ดิสก์กันจริงๆ
แตะสองปุ่มนี้ก่อน Resolution Selector กับ Sage Attention
ตัวช่วยแรกคือโหนดชื่อ Resolution Selector มันคำนวณความกว้างกับความสูงให้จากสามค่า คือสัดส่วนภาพ จำนวนเมกะพิกเซล และค่า Multiple แล้วส่งตัวเลขที่ได้เข้าโหนดของ H3 ตรงๆ ค่าที่ต้องระวังคือ Multiple ให้คาไว้ที่ 32 เพราะโมเดลทำงานบนกริดขนาดนั้น
H3 ถนัดภาพที่ด้านสั้น 768 พิกเซล เพดานอยู่ที่ 768x1344 พิกเซล และปัดเข้าเป็นจำนวนเท่าของ 32 เสมอ ถ้าดันค่าเมกะพิกเซลขึ้นไปราว 1.0 ที่สัดส่วน 16:9 จะได้ภาพประมาณ 1344x768
ช่องความยาวคลิปก็มีกริดของมันเหมือนกัน ที่ 24 เฟรมต่อวินาที ตัวเลขจะขยับไปลงล็อกทีละ 17 เฟรมตามบล็อกที่โมเดลใช้ ใส่ไปแล้วได้ไม่ตรงเป๊ะจึงเป็นเรื่องปกติ
ตัวช่วยที่สองคือ Sage Attention คู่มือทางการระบุว่าเปิดแล้วความเร็วขึ้นราวเท่าตัว โดยคุณภาพงานแทบไม่ต่าง ทางที่สั้นที่สุดคือสั่งเปิด ComfyUI พร้อมแฟล็ก --use-sage-attention ไปเลย
ถ้าอยากคุมเป็นรายเวิร์กโฟลว์แทน ต้องลงของสองอย่าง อย่างแรกคือแพ็กเกจ sageattention โหลด wheel ที่ตรงกับเวอร์ชัน PyTorch และ CUDA ในเครื่อง แล้วติดตั้งด้วย pip install <wheel-file>
อย่างที่สองคือชุดโหนดเสริม ComfyUI-KJNodes ซึ่งมีโหนด Patch Sage Attention KJ มาให้ เอามาต่อคั่นระหว่าง UNETLoader กับ BasicGuider แล้วตั้งค่า sage_attention เป็น auto
เขียนพรอมต์ให้ H3 ทั้งภาพและเสียงในก้อนเดียว
คู่มือทางการแนะนำให้เริ่มจากเล่าภาพรวมของฉากให้จบก่อน ว่าเป็นที่ไหน มีใครอยู่ตรงนั้น และกำลังเกิดอะไรขึ้น จากนั้นค่อยซอยออกเป็นช็อตย่อย พร้อมกำกับจังหวะเวลาของแต่ละช็อต
ในแต่ละช็อตให้เขียนทั้งสิ่งที่เห็น การขยับของกล้อง และเสียงที่ควรได้ยิน รวมไว้ในก้อนเดียวกัน ไม่ต้องแยกส่วนเสียงไปเขียนทีหลัง
โหมด R2V มีกติกาเพิ่มอีกชั้น ไฟล์อ้างอิงทุกชิ้นต้องเรียกด้วยแท็ก และเรียงตามลำดับสายที่ต่อเข้าโหนดจริงๆ เช่น <Picture 1> <Video 1> <Audio 1> จากนั้นต้องเขียนให้ชัดว่าไฟล์แต่ละชิ้นคุมอะไร ตัวตนของตัวละคร สไตล์ภาพ ท่าทาง มุมกล้อง หรือน้ำเสียง คู่มือย้ำว่าการบอกหน้าที่ตรงๆ ให้ผลดีกว่าปล่อยให้โมเดลเดาเองมาก
จำนวนไฟล์อ้างอิงมีเพดานอยู่ ภาพใส่ได้ถึง 9 ไฟล์ คลิปวิดีโอได้อีก 3 ไฟล์ และไฟล์เสียงอีก 3 ไฟล์
คลิปกับไฟล์เสียงแต่ละชิ้นยาวได้ 2 ถึง 15 วินาที และรวมกันไม่เกิน 15 วินาทีต่อประเภท นับทุกประเภทเข้าด้วยกันแล้วห้ามเกิน 12 ไฟล์ ส่วนไฟล์เสียงจะใส่มาเดี่ยวๆ ไม่ได้ ต้องมาคู่กับภาพหรือคลิปเสมอ
อีกสองค่าที่ขยับแล้วเห็นผล ค่าแรกคือ ref_image_size ถ้าตั้งเป็น match ระบบจะย่อภาพอ้างอิงลงมาเท่าความละเอียดที่จะสร้าง ทำให้เร็วขึ้น ถ้าตั้งเป็น max มันจะเก็บภาพไว้ที่ด้านสั้นได้ถึง 2048 พิกเซล ได้หน้าตาตัวละครที่เหมือนต้นฉบับกว่า แลกกับเวลาที่นานขึ้น
ค่าที่สองอยู่ที่ช่อง sampler กับ scheduler ซึ่งคุมวิธีที่โมเดลไล่ปั้นภาพออกมาทีละรอบ งานที่พึ่งไฟล์อ้างอิงเยอะ คู่มือบอกว่า res_multistep คู่กับ beta หรือ normal มักให้ผลดีกว่า simple
ถ้าเครื่องไม่ถึง หรืออยากได้ 2K จริงๆ

คำว่าเปิดให้โหลดของ H3 มีขอบเขตของมันอยู่ ระบบเต็มๆ ประกอบด้วยสามส่วน และเปิดออกมาแค่ส่วนเดียว
- H3-Context-IR ตัวรับคำสั่งกับไฟล์ที่ปนกันมาหลายแบบ แล้วจัดให้เป็นข้อมูลที่ตัวสร้างอ่านรู้เรื่อง ส่วนนี้ยังไม่เปิด ต้องเรียกผ่าน API
- H3-Base ตัวที่ปั้นภาพและเสียงออกมาที่ 768p นี่คือส่วนที่โหลดมารันเองได้
- H3-Regenerate-2K ส่วนที่ยกงาน 768p ขึ้นไปเป็น 2K ด้วยการส่งภาพเดิมกลับเข้าไปให้โมเดลปั้นซ้ำพร้อมบริบทเดิม ส่วนนี้ก็ยังไม่เปิดเช่นกัน
หน้าข้อมูลโมเดลแนะนำหนักแน่นว่าให้เอา H3-Context-IR เข้ามาอยู่ในขั้นตอนการสร้างงานด้วย หรือไม่ก็ต้องทำระบบจัดระเบียบคำสั่งของตัวเองขึ้นมาตามแนวทางที่เขาเขียนไว้ แปลว่าคนที่รันในเครื่องล้วนๆ ต้องรับงานส่วนนี้มาทำเองอีกต่อหนึ่ง
ในโปรแกรมเดียวกันนี้ยังมีอีกทางหนึ่ง เพราะ ComfyUI มี MiniMax อยู่ในรายการ Partner Nodes อยู่แล้ว เป็นชุดโหนดที่ยิงงานไปประมวลผลผ่าน API แทนการรันในเครื่อง ส่วนราคาต้องไปดูที่ แพลตฟอร์ม API ของ MiniMax เอง เพราะคู่มือฝั่ง ComfyUI ไม่ได้ระบุรูปแบบการคิดเงินไว้
และถ้าสุดท้ายคำตอบคือจ่ายรายเดือนแล้วสบายใจกว่า ฝั่งบริการสำเร็จรูปก็มีให้เทียบ อย่าง Gemini Omni ที่คนไทยเข้าถึงได้แล้ว โดยเริ่มที่ 189 บาทต่อเดือน
ที่จริง 42 GB ซื้อได้แค่ตัวโมเดล ส่วนที่เหลือคือหน้าที่ที่ต้องมารับเอง ตั้งแต่จัดคำสั่งให้เป็นระเบียบก่อนป้อนเข้าไป เลือกกริดความละเอียดให้ตรง ไปจนถึงจับคู่ sampler กับงานที่ทำ ของพวกนี้บริการรายเดือนเคยทำให้อยู่เงียบๆ พอโหลดมารันเอง มันก็เลื่อนมาอยู่ในมือเรา และเป็นของที่เคลียร์ดิสก์ให้เท่าไรก็ไม่ได้มา
ที่มา:
- บทความ MiniMax H3: An Open Model Breaking the Boundaries Between Tasks and Modalities จาก MiniMax
- เอกสารทางการของ MiniMaxAI/MiniMax-H3 · Hugging Face
- เอกสารทางการของ MiniMax H3: ComfyUI Workflow Examples จาก ComfyUI
- คลังไฟล์โมเดล Comfy-Org/MiniMax-H3 · Hugging Face จาก Comfy-Org
ชอบเรื่องแนวนี้ มีอีบุ๊คฟรีให้อ่านต่อ
Vibe Coding สำหรับคนไม่ใช่โปรแกรมเมอร์ ใช้ Claude Code สร้าง landing page, mini app และ prototype จริงโดยไม่ต้องเขียนโค้ด
กดสมัครแล้วเราจะส่งเทคนิค AI และของแจกใหม่ๆ ให้ทางอีเมล เลิกรับได้ตลอด
Vibecoding · The Developer's Playbook

ฉบับภาษาไทย 10 บท พา dev สร้าง Personal Finance Tracker (LINE OA + AI จัดหมวดอัตโนมัติ) ตั้งแต่โครงโปรเจกต์บรรทัดแรกจนแอปทำงานจริงบน server


