การตั้งค่าสามอย่างใน ComfyUI ที่ผู้ใช้ RTX 4070 รายงานว่าลดเวลาเรนเดอร์ MiniMax H3 เหลือราวหนึ่งในสาม
เมื่อเรนเดอร์วิดีโอบนเครื่องตัวเองช้าจนแทบอยากเลิกใช้ รายงานจากผู้ใช้หลายเครื่องในสัปดาห์เดียวกันชี้ว่าแก้ได้ด้วยการตั้งค่าสามอย่างบนการ์ดใบเดิม บทความนี้รวมทั้งลำดับที่ทำตามได้จริง อาการที่ใช้แยกว่าปัญหาอยู่ที่การตั้งค่าหรือ VRAM และข้อจำกัดที่ยังแก้ไม่หาย

MiniMax H3 เป็นโมเดลที่สร้างวิดีโอพร้อมเสียงในคราวเดียวและโหลดมารันบนเครื่องตัวเองได้ ด่านแรกที่คนรันจริงเจอคือเวลาต่อคลิปที่นานจนไม่อยากกดซ้ำ และในสัปดาห์เดียวกันก็มีรายงานจากผู้ใช้หลายเครื่องที่ชี้ไปทางเดียวกัน
เครื่องหนึ่งใช้ RTX 4070 เรนเดอร์คลิป image-to-video ยาว 10 วินาทีที่ความละเอียดราว 1MP จบใน 11 นาที 12 วินาที เจ้าของเครื่องเขียนว่าเหลือราวหนึ่งในสามของเวลาที่เคยใช้กับช็อตเดียวกัน ตัวเลขนี้นับเฉพาะเวลาเรนเดอร์ หลังจากนั้นเขายังนำผลลัพธ์ไปอัปสเกลและเพิ่มเฟรม แต่ไม่ได้บอกว่าสองขั้นตอนนี้ใช้เวลาเพิ่มอีกเท่าไร
สิ่งที่เขาเปลี่ยนมีสามอย่าง และทั้งสามอย่างก็ปรากฏซ้ำในรายงานจากเครื่องอื่นในสัปดาห์นั้น ได้แก่ Turbo LoRA · Sage Attention · และแฟล็ก --disable-smart-memory ที่ใส่ตอนสั่งเปิด ComfyUI
สามค่าที่ต้องตั้ง และแต่ละตัวทำอะไร

Turbo LoRA คือไฟล์เสริมที่แปะทับโมเดลหลักเพื่อลดจำนวน sampling step ที่ต้องคำนวณ เอกสารของโหนด ComfyUI-MiniMax-H3-Turbo ระบุว่ารัน MiniMax-H3 จบได้ใน 4 สเต็ป จากเดิมที่ใช้ราว 20 สเต็ป และไม่ได้มีให้เลือกเพียงตัวเดียว ผู้ใช้การ์ด 12GB รายหนึ่งเลือก Lightx2v แบบ 4 สเต็ป พร้อมเขียนว่ายังมีตัวอื่นให้เลือกตามความถนัด ทั้งเอกสารและรายงานจากผู้ใช้ตรงกันว่าเมื่อเพิ่มจาก 4 เป็น 6-8 สเต็ป ภาพจะดีขึ้น แต่ใช้เวลานานขึ้นตามไปด้วย
Sage Attention เป็นไลบรารีที่ช่วยเร่งการคำนวณ attention และปรากฏในรายงานจากผู้ใช้สามเครื่อง ผู้ใช้การ์ด 12GB เขียนสั้นๆ ว่าจำเป็นต้องใช้ ส่วนอีกสองเครื่องก็ใช้ Sage Attention เป็นตัวหลักในการลดเวลาเรนเดอร์
แฟล็ก --disable-smart-memory ต่างจากสองอย่างแรกตรงที่ไม่ได้ตั้งผ่านโหนดหรือหน้าจอ แต่ต้องใส่ในคำสั่งของไฟล์ .bat ที่ใช้เปิด ComfyUI เจ้าของเครื่อง RTX 3090 เครื่องหนึ่งเขียนไว้ชัดเจนว่า Sage Attention ไม่ทำงานเลยจนกว่าจะใส่แฟล็กนี้ ไม่ใช่แค่ทำงานช้าลงเล็กน้อย อีกจุดที่ต้องแยกให้ออกคือ smart memory กับ dynamic VRAM เป็นคนละสวิตช์กัน เพราะมีคนในเธรดเดียวกันอ่านแล้วสับสนจริง
ลำดับที่ทำจริง ตั้งแต่ติดตั้งจนเห็นว่ามันติด
ลำดับข้างล่างประกอบจากเอกสารของโหนดและรายงานเรื่องแฟล็ก เพราะไม่มีต้นทางไหนเขียนไว้ครบในที่เดียว
-
ติดตั้งโหนด Turbo ผ่าน ComfyUI-Manager ด้วยการค้นคำว่า MiniMax-H3 Turbo แล้วกดติดตั้ง หรือโคลนเองแล้วรีสตาร์ต ComfyUI
cd ComfyUI/custom_nodes git clone https://github.com/larryvrh/ComfyUI-MiniMax-H3-Turbo -
วางไฟล์ LoRA นามสกุล
.safetensorsไว้ที่ComfyUI/models/loras/ในเครื่องต้องมีโมเดลหลัก MiniMax-H3 · VAE · และ text encoder จากรีลีสทางการอยู่แล้วตาม เอกสารติดตั้งของ ComfyUI เช็กพอยต์ที่รีโปแนะนำสำหรับงานทั่วไปคือminimax_h3_turbo_v4_step600_ema.safetensors -
แก้เวิร์กโฟลว์ทางการสองจุด จุดแรกคือแทรกโหนด
MiniMax-H3 Turbo LoRAระหว่าง model loader กับ sampler จุดที่สองคือต่อโหนดMiniMax-H3 Turbo Samplerเข้ากับSamplerCustomAdvancedพร้อมตั้งBasicSchedulerเป็นsimpleและใช้ 4 สเต็ปขึ้นไป ส่วน conditioning · VAE decode · เอาต์พุตเสียง ไม่ต้องแตะ กราฟเดิมใช้ได้ทั้ง t2v และ i2v -
ติดตั้ง Sage Attention โดยใช้ wheels ของ SageAttention และ Triton ถ้าติดตั้งเองไม่ผ่าน มีคนแนะนำให้ลง ComfyUI ชุดใหม่ด้วย ComfyUI-Easy-Install ซึ่งมีปุ่มติดตั้งตัวเร่งเหล่านี้มาให้ แล้วค่อยย้ายไฟล์เดิมเข้ามา
-
เติมแฟล็ก
--disable-smart-memoryต่อท้ายคำสั่งในไฟล์ .bat ที่ใช้เปิด ComfyUI -
เช็กที่ log ตอนเปิด ว่ามีบรรทัด
using sage attentionขึ้นมา ถ้าไม่ขึ้น แปลว่าเครื่องยังไม่ได้ใช้มันจริง ต่อให้ติดตั้งไปแล้วก็ตาม
ค่าตั้งต้นที่รีโปแนะนำคือ strength ของ LoRA ที่ 1.0 และ scheduler แบบ simple จำนวนสเต็ปที่ใช้ได้จริงอยู่ในช่วง 4-8 โดย 6-8 สเต็ปให้ภาพดีกว่า 4 สเต็ปอย่างเห็นได้ชัด แต่เมื่อเกิน 8 สเต็ป คุณภาพจะไม่ดีขึ้นและเริ่มมีขอบที่คมเกินจริง ควรปรับ strength เฉพาะเมื่อคลิปมีอาการ ถ้าภาพเบลอเป็นเงาซ้อนให้ดันขึ้นไปที่ราว 1.05-1.2 แต่ถ้าเกรนคมเกินไปให้ลดลงมาที่ราว 0.8-0.95
อีกสวิตช์ในโหนดคือ low_vram ซึ่งปิดไว้เป็นค่าตั้งต้น การปิดจะให้ภาพคมที่สุด แต่กิน peak VRAM เพิ่มขึ้นเล็กน้อย ให้เปิดเมื่อเจอ out of memory เพราะระบบจะรวม LoRA เข้าไปในตัวน้ำหนัก ทำให้ peak VRAM ต่ำที่สุด การ์ดเล็กจึงรันได้ ทั้งยังรองรับคลิปที่ยาวขึ้นหรือมีความละเอียดสูงขึ้น แต่ต้องแลกกับภาพที่นุ่มลงเมื่อใช้โมเดลหลักที่ควอนไทซ์มา
อาการที่บอกว่ายังตั้งไม่ครบ ไม่ใช่การ์ดหมดแรง

เคสที่อธิบายอาการไว้ละเอียดที่สุดมาจากเครื่อง RTX 3090 ตัวเดียวกับที่พูดถึงข้างบน เจ้าของเครื่องสังเกตเห็นลำดับดังนี้ หลัง ComfyUI เตรียม video VAE สำหรับ dynamic VRAM loading เสร็จและ MiniMaxH3 เริ่มโหลด VRAM ก็ไต่ขึ้นไปเกือบเต็มที่ 23.5GB จาก 24GB จากนั้นไฟที่การ์ดใช้ลดจาก 230W เหลือราว 110W การ์ดยังทำงานอยู่ แต่ช้าลงอย่างเห็นได้ชัด
เมื่อเปิด ComfyUI ด้วยแฟล็กใหม่ ค่าต่างๆ ก็เปลี่ยนไป โดย VRAM ลดลงมาอยู่ที่ราว 18-20GB จาก 24GB และงานกลับมาวิ่งเร็วตามปกติ สำหรับคลิปความละเอียด 0.4MP ความยาว 15 วินาที Sage Attention ลดเวลาได้ 65-70% แต่จะทำได้ก็ต่อเมื่อปิด smart memory แล้วเท่านั้น ตัวเลข 65-70% จึงเป็นผลจาก Sage Attention โดยมีแฟล็กเป็นเงื่อนไขให้มันทำงาน ไม่ใช่ผลจากตัวแฟล็กเอง
เจ้าของเครื่องย้ำว่าคำอธิบายสาเหตุเป็นเพียงข้อสันนิษฐานของคนที่ไม่ได้รู้ลึก เขาคิดว่าระบบจัดการหน่วยความจำอาจโยนของไปไว้ใน RAM มากเกินไป จนถ่วงการ์ดทั้งที่ยังทำงานได้ และบอกด้วยว่าอาการนี้อาจเกิดเฉพาะกับเครื่องของเขา อย่างไรก็ตาม มีคนตอบในเธรดว่าใช้แฟล็กแล้วได้ผลเหมือนกัน ส่วนอีกรายที่ใช้การ์ด 4090 กับแรม 32GB บอกว่าแฟล็กนี้แก้อาการค้างตอนสลับไปทำ VAE ได้
เคสนี้ให้เกณฑ์สังเกตที่นำไปใช้ต่อได้ ถ้า VRAM ไต่จนเกือบเต็ม แล้วทั้งความเร็วและไฟที่การ์ดใช้ลดลง ให้สงสัยเรื่องการจัดการหน่วยความจำก่อนสรุปว่าการ์ดไม่พอ
ความละเอียดกับความยาวที่การ์ดแต่ละใบรับไหว
โมเดลเทรนมาที่ความละเอียดราว 1MP หรือ 1344x768 และรีโปยังกำหนดอีกว่าทั้งความกว้างและความสูงต้องเป็นพหุคูณของ 32 โดยปกติด้านสั้นจะอยู่ที่ 768 ส่วนจำนวนเฟรมให้นับที่ 24fps แล้วสแนปเข้ากริดของโมเดล 124 เฟรมจึงเท่ากับราว 5 วินาที และช่วงที่ผ่านการตรวจสอบแล้วอยู่ที่ราว 124-362 เฟรม
การเพิ่มความละเอียดเป็น 2MP ให้ผลที่เห็นได้ชัด ผู้ใช้การ์ด 12GB เขียนว่าสำหรับงาน image-to-video วิธีนี้แก้ปัญหาใบหน้าของคนที่อยู่ไกลในเฟรมได้เกือบหมด แต่ปัญหาคือจะทำอย่างไรให้การ์ดรันถึงระดับนั้นได้
| การ์ด | ความละเอียด · ความยาว | ผลที่รายงาน |
|---|---|---|
| RTX 3090 24GB | 0.4MP · 15 วินาที | Sage Attention ตัดเวลาลง 65-70% หลังปิด smart memory |
| RTX 4070 | ราว 1MP · 10 วินาที (i2v) | 11 นาที 12 วินาที ราวหนึ่งในสามของเวลาเดิม |
| RTX 3060 12GB (แรม 32GB · Windows 10) | 2MP · 5 วินาที · 16:9 | 25 นาที |
| RTX 3060 12GB (แรม 32GB · Windows 10) | ราว 1.4MP · 8 วินาที | เพดานที่ดันได้เมื่อยืดความยาวคลิป |
ผู้ใช้การ์ด 12GB จึงแนะนำให้ไล่ทำจากขั้นที่ใช้ทรัพยากรน้อยไปหามาก เริ่มจากเกลาพรอมป์ให้นิ่ง ทดสอบที่ความละเอียดต่ำจนพอใจ แล้วค่อยเพิ่มความละเอียดตอนเรนเดอร์จริง เพราะถ้าพรอมป์ดีพอ ภาพที่ได้ตอนเรนเดอร์จริงจะใกล้เคียงกับที่เห็นในรอบทดสอบความละเอียดต่ำ
อีกทางที่ใช้ได้เมื่อมีคลิปจำนวนมากคือเรนเดอร์ที่ 1344x768 ตรงตามที่โมเดลถนัด แล้วค่อยอัปเป็น 1080p ทีหลัง สองแนวทางนี้ตอบโจทย์คนละแบบ ไม่ได้ค้านกัน
การ์ด 16GB ไปได้ไกลแค่ไหน และต้องแลกด้วยเวลาเท่าไร
ตัวอย่างจากการ์ด 16GB ในรายงานชุดนี้คือสารคดีสั้นเรื่องประวัติศาสตร์กรีก ความยาว 2 นาที 47 วินาที ซึ่งประกอบจาก 36 คลิปใน 4 ฉาก ใช้ตัวละครหน้าตาเดิมตลอดเรื่อง มีเสียงพากย์ต่อเนื่อง และลิปซิงก์ตรง งานทั้งหมดเรนเดอร์บนเครื่องที่ใช้ RTX 5060 Ti 16GB จนจบ โดยสตรีมน้ำหนักโมเดลและใช้ VRAM สูงสุด 15.4 จาก 16GB
เคล็ดลับที่ช่วยซ่อนรอยต่อระหว่างคลิปคือใช้เฟรมสุดท้ายของคลิปก่อนหน้าเป็นเฟรมแรกของคลิปถัดไป โดยต้องเซฟเฟรมนั้นเป็นไฟล์ภาพตั้งแต่ตอนเรนเดอร์ ไม่ใช่ดึงจากไฟล์วิดีโอที่บีบอัดแล้ว เพราะการบีบอัดจะทำให้เฟรมอ้างอิงเสียหาย
ต้นทุนของงานระดับนี้คือเวลา เมื่อรวมงานแก้และการเรนเดอร์คลิปละสองเทคเพื่อเลือกเทคที่ดีกว่าแล้ว ใช้เวลาทั้งหมดราว 25-30 GPU-ชั่วโมง จึงไม่ใช่งานที่กดปุ่มครั้งเดียวแล้วได้หนังออกมา
สิ่งที่ตั้งค่ายังไงก็ยังไม่หาย
เสียงที่สร้างมาพร้อมวิดีโอยังไม่ดีพอสำหรับงานจริง ผู้ใช้ RTX 4070 บอกไว้สั้นๆ ว่าอย่าพึ่งพาเสียงนี้กับงานที่ต้องส่ง ส่วนเอกสารของโหนดให้รายละเอียดเพิ่มว่าโปรเจกต์ยังเป็น preview และกำลังปรับปรุงทั้ง audio กับการเคลื่อนไหวที่เร็วและแรง อาการเสียงเพี้ยนเมื่อใช้ 4 สเต็ปมีสาเหตุที่ทราบแล้วอย่างหนึ่ง คือ ComfyUI รุ่นเก่าที่ยังไม่มี ModelSamplingAV จะเดินสเต็ปของวิดีโอกับเสียงบนตารางเดียวกัน ทำให้คำนวณสเต็ปของเสียงเกินไป Turbo Sampler ของรีโปจึงตรวจเวอร์ชัน และถ้าเป็นบิลด์เก่าก็จะแยกตารางให้เอง ดังนั้นเสียงเพี้ยนบางส่วนจึงเป็นปัญหาเรื่องเวอร์ชันที่แก้ได้ ไม่ได้เกิดจากข้อจำกัดของโมเดลเพียงอย่างเดียว สำหรับงานยาว ทางออกคือแยกทำเสียง เช่น งานสารคดีข้างต้นใช้แทร็กบรรยายจาก TTS เส้นเดียวต่อเนื่อง แล้วตัดวิดีโอตามเสียง
ผู้ใช้ RTX 4070 ระบุจุดอ่อนไว้ว่า เมื่อใบหน้าของตัวละครเล็กลงในเฟรม รายละเอียดจะหยาบขึ้นหลังอัปสเกล ส่วนงานสารคดีระบุว่าใบหน้าของคนในฝูงชนที่กำลังเคลื่อนไหวยังเป็นปัญหาที่แก้ไม่ได้ และเป็นข้อจำกัดเชิงโครงสร้างของโมเดล วิธีรับมือที่งานสารคดีนี้ใช้คือใส่ shallow depth of field ในพรอมป์ แล้ววางใบหน้าที่สำคัญไว้ด้านหน้าสุด
ข้อสุดท้ายมาจากเจ้าของตัวเลข 11 นาที 12 วินาทีเอง เขาเขียนกำกับไว้ว่าตอนนี้มีคนพยายามเร่งความเร็วกันหลายทาง และวิธีที่ใช้ได้ผลเมื่อวานอาจตกยุคในวันนี้ การตั้งค่าสามอย่างชุดนี้จึงเป็นจุดที่ควรลองก่อนตัดสินใจเปลี่ยนการ์ด ไม่ใช่คำตอบสุดท้ายที่จะใช้ได้ตลอดไป
ที่มา: โปรเจกต์ ComfyUI-MiniMax-H3-Turbo บน GitHub
ชอบเรื่องแนวนี้ มีอีบุ๊คฟรีให้อ่านต่อ
Vibe Coding สำหรับคนไม่ใช่โปรแกรมเมอร์ ใช้ Claude Code สร้าง landing page, mini app และ prototype จริงโดยไม่ต้องเขียนโค้ด
กดสมัครแล้วเราจะส่งเทคนิค AI และของแจกใหม่ๆ ให้ทางอีเมล เลิกรับได้ตลอด
Vibecoding · The Developer's Playbook

ฉบับภาษาไทย 10 บท พา dev สร้าง Personal Finance Tracker (LINE OA + AI จัดหมวดอัตโนมัติ) ตั้งแต่โครงโปรเจกต์บรรทัดแรกจนแอปทำงานจริงบน server


