YuE2 เป็นโมเดลเพลง AI โอเพนซอร์สที่ทำคะแนน WildSongBench ไล่ทัน Suno แล้ว พร้อมให้แก้โน้ตและคอร์ดเองได้
YuE2 คือโมเดลสร้างเพลงโอเพนซอร์สที่ทำคะแนน WildSongBench ไล่ทัน Suno และมีโน้ตกับคอร์ดให้แก้เองได้ อ่านต่อเพื่อดูว่าต้องใช้สเปกอะไรถึงจะรันได้

คนทำคอนเทนต์ที่อยากได้เพลงประกอบคลิป หรืออยากทำเพลงสนุกๆ เล่นกับเพื่อน ที่ผ่านมามักเจอทางเลือกที่ไม่ค่อยลงตัว บริการสร้างเพลงด้วย AI แบบปิดอย่าง Suno ให้มาแค่ไฟล์เสียงสำเร็จรูปที่ปรับแต่งอะไรข้างในไม่ได้ ส่วนโมเดลแบบเปิดรุ่นก่อนหน้าที่ดาวน์โหลดมาใช้ฟรีได้ก็ยังทำคะแนนต่ำกว่ากลุ่มบนสุดในการทดสอบมาตรฐานเดียวกัน
แต่วันนี้ช่องว่างดังกล่าวแคบลงมาก เมื่อทีมผู้พัฒนา m-a-p ปล่อย YuE2 โมเดลสร้างเพลงแบบโอเพนซอร์สบน Hugging Face ผลการทดสอบของทีมพัฒนาพบว่า YuE2 ทำคะแนนเฉลี่ยขึ้นมาเทียบชั้นกับ Suno v5 และ Suno v6 ได้แล้ว และสิ่งที่พิเศษกว่าบริการแบบเสียเงิน คือโมเดลไม่ได้ให้แค่ไฟล์เสียงสำเร็จรูป แต่ในโหมดเริ่มต้นยังให้โครงสร้างโน้ตและคอร์ดเป็นไฟล์ข้อความ ทำให้เราเปิดแก้ไขท่อนต่างๆ แล้วสั่งสร้างเพลงใหม่ได้ทันที
อย่างไรก็ตาม สิ่งที่ต้องเตรียมในตอนนี้คือคอมพิวเตอร์ Linux ที่ใช้การ์ดจอ NVIDIA VRAM 24GB ขึ้นไป และตัวโมเดลยังติดสัญญาอนุญาตห้ามใช้ในเชิงพาณิชย์
YuE2 วางโครงสร้างโน้ตเพลงก่อน แล้วค่อยสร้างเป็นเพลงเต็ม

การสั่งงาน YuE2 ต้องใช้ข้อมูลหลัก 2 อย่าง ได้แก่ เนื้อเพลงและคำอธิบายสไตล์เพลง เช่น แนวเพลง อารมณ์เพลง ประเภทเครื่องดนตรี หรือลักษณะของเสียงร้อง
ในโหมดค่าเริ่มต้น YuE2 จะไม่แปลงข้อความเป็นเสียงทันที แต่ทำงานเป็น 2 ขั้นตอน ขั้นแรก โมเดลจะเขียนโครงสร้างทำนองและคอร์ดออกมาเป็นโน้ตเพลงแบบข้อความอย่าง ABC notation จากนั้นจึงนำโครงสร้างนี้ไปเรนเดอร์เป็นเพลงเต็มที่มีทั้งเสียงร้องและดนตรีประกอบ โดยให้คุณภาพเสียงระดับสเตอริโอ 48 kHz
ผู้ใช้สามารถกำหนดระดับการวางโครงสร้างเพลงได้ผ่านพารามิเตอร์ cot ซึ่งกำหนดกระบวนการคิดของโมเดลได้ 3 รูปแบบ:
full– ให้โมเดลคิดและเขียนทั้งทำนองและคอร์ด เป็นค่าเริ่มต้นที่เหมาะกับการสร้างเพลงใหม่melody– ให้โมเดลกำหนดเฉพาะทำนองหลัก แล้วปล่อยให้ระบบคิดดนตรีประกอบเอง โหมดนี้ทีมพัฒนาแนะนำให้ใช้สำหรับทำเพลงคัฟเวอร์off– สร้างเพลงโดยตรงจากเนื้อเพลงและสไตล์ทันที โดยไม่มีการร่างโครงสร้างโน้ตก่อน
สำหรับใครที่อยากรู้ว่าคุณภาพเสียงเป็นอย่างไร หน้าเดโมของโครงการ มีตัวอย่างเพลงที่สร้างจากเนื้อร้องและสไตล์ให้ลองฟัง เช่น Cyber Metal (ภาษาอังกฤษ ความยาว 5:00 นาที), 今晚不眠 (ภาษาจีนกลาง แนว funk / nu-disco ความยาว 3:24 นาที) และ Passion (ภาษาอังกฤษ แนว rock ความยาว 3:55 นาที)
YuE2 ทำคะแนน WildSongBench ขึ้นมาเทียบชั้น Suno

ตัวเลขที่ทำให้ YuE2 น่าจับตาคือผลจากชุดทดสอบคุณภาพเพลง WildSongBench ที่ทีมพัฒนาสร้างขึ้น ชุดทดสอบนี้มีโจทย์ทั้งหมด 192 ข้อ ทีมพัฒนานำระบบสร้างเพลง 17 ระบบมาประเมินร่วมกัน ทั้งโมเดลโอเพนซอร์สและบริการแบบปิด และประกาศผลเมื่อวันที่ 12 กันยายน 2026
ตารางผลการทดสอบแสดงผลของ YuE2 ไว้ 2 รูปแบบ:
รูปแบบแรกคือ YuE2 ด้วยวิธี Best-of-8 วิธีนี้ให้โมเดลสร้างเพลงตามโจทย์เดิม 8 ครั้ง แล้วคัดเลือกเพลงที่ระบบให้คะแนนดีที่สุดมาวัดผล คะแนนเฉลี่ยอยู่ที่ 6.9632 ซึ่งสูงที่สุดในบรรดา 17 ระบบ ชนะทั้ง Suno v5 ที่ได้ 6.8721 และ Suno v6 ที่ได้ 6.5562
รูปแบบที่สองคือ YuE2 แบบปกติ ซึ่งสร้างเพลง 2 ครั้งแล้วเลือกเพลงที่มีอัตราการออกเสียงผิด (PER) ต่ำกว่า โดยได้คะแนนเฉลี่ย 6.7316 ซึ่งยังคงสูงกว่า Suno v6 แม้จะน้อยกว่า Suno v5 เล็กน้อย
อย่างไรก็ตาม ตัวเลขในตารางนี้มีข้อควรระวังสำคัญ 2 ข้อที่ทีมพัฒนาระบุไว้เอง:
ข้อแรก ผลทั้งหมดมาจากการวัดแบบอัตโนมัติด้วยระบบของทีมพัฒนาเอง ไม่ใช่คะแนนจากคนฟังและประเมิน
ข้อที่สอง ทีมพัฒนาระบุชัดเจนว่า ส่วนต่างระหว่างคะแนนเฉลี่ยอันดับต้นๆ นั้นน้อยจนยังไม่มีนัยสำคัญทางสถิติ หรือพูดง่ายๆ คือค่าเฉลี่ยของกลุ่มบนสุดในตารางห่างกันน้อยเกินกว่าจะสรุปว่าใครเก่งกว่าใครอย่างแท้จริง
ดังนั้น สิ่งที่ตารางนี้บอกเราได้จริง ไม่ใช่ว่า YuE2 ทำเพลงเพราะกว่า Suno แต่พิสูจน์ว่า โมเดลโอเพนซอร์สที่เปิดให้ดาวน์โหลดไปรันเองได้ฟรี พัฒนาคุณภาพขึ้นมาอยู่ในกลุ่มเดียวกับบริการเสียเงินชั้นนำแล้ว
สิ่งที่ Suno ไม่มีคือไฟล์โน้ตเพลง ABC ที่แก้ไขได้ตามใจชอบ
เพลงที่สร้างจาก YuE2 ในโหมด full ไม่ได้มีแค่ไฟล์เสียงสำเร็จรูป แต่ยังมีโครงสร้างทำนองและคอร์ดในรูปแบบ ABC notation ซึ่งเปิดอ่านและแก้ไขได้ด้วยโปรแกรมแก้ไขข้อความทั่วไป

ขั้นตอนการใช้งานตามเอกสารของทีมพัฒนา คือเรียกคำสั่ง pipe.plan() เพื่อดึงโครงสร้างเพลงออกมาเป็นไฟล์ score.abc ก่อน จากนั้นเราสามารถแก้ไขไฟล์นั้นได้โดยตรง เช่น อยากเปลี่ยนคอร์ดในท่อนฮุก หรือยืดท่อนโซโล่ให้ยาวขึ้น ก็แก้ที่ตัวโน้ตแล้วสั่งให้ YuE2 สร้างเสียงใหม่จากโครงสร้างที่แก้ไขแล้วได้ทันที ส่วนการเปลี่ยนแนวเพลงจากป๊อปเป็นแจ๊ส ต้องแก้คำอธิบายสไตล์ควบคู่ไปกับไฟล์โน้ตด้วย
คนที่ไม่ถนัดอ่านโน้ตเพลงก็ยังใช้งานได้ เพราะในคลังโปรเจกต์เดียวกันมีไฟล์คำสั่ง SKILL.md ของชุดทักษะ yue2-music ไฟล์นี้ออกแบบมาให้ระบบผู้ช่วยอัตโนมัติอย่าง AI Agent เข้าใจขั้นตอนการสร้างเพลง ถอดเสียงดนตรี ทำเพลงคัฟเวอร์ แก้ไขโน้ต ABC ตรวจสอบความถูกต้องทางดนตรี และช่วยเปรียบเทียบเสียงที่ได้ ชุดทักษะนี้ใช้ได้กับ Agent ทุกตัวที่อ่านไฟล์ตามมาตรฐาน SKILL.md ผู้ใช้เพียงพิมพ์บอกความต้องการเป็นภาษาทั่วไปว่าอยากปรับเพลงอย่างไร แล้วปล่อยให้ Agent แก้ไขโน้ตแทน
ตัวอย่างบนหน้าเดโมแสดงให้เห็นในเพลง The Last Train ซึ่งผ่านการปรับแต่ง 9 ขั้นตอน รวมทั้งหมด 14 เวอร์ชัน เริ่มจากเพลงป๊อปภาษาจีนกลาง จนกลายมาเป็นเพลงแจ๊สภาษาอังกฤษที่เรียบเรียงเสียงประสานชุดใหม่ พร้อมท่อนโซโล่แซกโซโฟนที่นำทำนองเพลง Twinkle, Twinkle, Little Star มาร้อยเรียงซ้ำ 2 รอบเต็ม โดยหน้าเว็บเปิดให้ฟังเพลงและดูประวัติการแก้ไขโน้ตในแต่ละขั้นตอนได้ทั้งหมด
โหมด Cover ถอดโน้ตจากเพลงต้นฉบับ แล้วเรียบเรียงเป็นแนวใหม่
การทำงานผ่านโน้ตเพลงช่วยให้เรานำเพลงเดิมมารีมิกซ์และเรียบเรียงใหม่ข้ามแนวเพลงได้ทันทีโดยไม่ต้องเทรนโมเดลเพิ่มเติม หรือที่เรียกว่า Zero-shot Cover
กระบวนการทำเพลงคัฟเวอร์แบ่งออกเป็น 3 ขั้นตอน:
- ถอดทำนองเพลงต้นฉบับ: ใช้เครื่องมือแกะโน้ตของทีมพัฒนาอย่าง SheetSage2 แปลงไฟล์เสียงเพลงต้นทางเป็นโน้ตทำนองในรูปแบบ ABC ผลที่ได้มีเฉพาะทำนองหลัก ยังไม่รวมคอร์ด
- เตรียมเนื้อเพลง: หาเนื้อร้องของเพลงนั้น โดยอาจให้ AI Agent ค้นหาจากอินเทอร์เน็ต หรือใช้ระบบถอดเสียงพูดเป็นข้อความแบบ ASR เช่น Qwen3-ASR หรือ Gemini API เพื่อแปลงเสียงร้องเป็นข้อความ
- สั่งสร้างเพลงใหม่: ป้อนโน้ตทำนองและเนื้อเพลงเข้าสู่ YuE2 ผ่านโหมด
cot="melody"พร้อมระบุสไตล์เพลงใหม่ที่ต้องการ
ตัวอย่างที่ทีมงานสาธิตไว้ เช่น เพลง Auld Lang Syne ที่นำมาทำใหม่เป็นแนว jazz-funk ความยาว 3:10 นาที และเพลง Jingle Bells ที่กลายเป็นแนว heavy metal ความยาว 1:09 นาที ซึ่งสังเกตได้ว่าทีมพัฒนาเลือกใช้เพลงเก่าทั้งคู่
ทีมพัฒนายังได้ทดสอบประสิทธิภาพการทำเพลงคัฟเวอร์บนชุดข้อมูล SHS100K ด้วยการทดลองกับเพลง 948 เพลง ใน 2 สไตล์ และใช้ค่าสุ่มตั้งต้นอย่าง seed 2 แบบ รวมเป็น 3,792 เพลงต่อวิธี โดยวัดผลด้วย CLEWS mAP ดัชนีที่ประเมินว่าเพลงคัฟเวอร์ยังจับคู่กลับไปหาเพลงต้นทางได้หรือไม่ เมื่อป้อนโน้ตเพลงเข้าไปเต็มรูปแบบ YuE2 ทำได้ 0.647 แต่เมื่อไม่ใส่โน้ตเพลงเลย คะแนนกลับลดฮวบลงเหลือเพียง 0.006 ทั้งที่เป็นโมเดลตัวเดียวกันและไม่ได้เทรนเพิ่มเพื่องานคัฟเวอร์เลย ตัวเลขนี้บอกว่าโครงสร้างโน้ตเพลงคือส่วนที่ทำให้เพลงคัฟเวอร์ยังคงเป็นเพลงเดิมอยู่ ส่วนคุณภาพเสียงและความตรงตามสไตล์ ทีมพัฒนาระบุว่าต้องดูจากค่าอื่นประกอบกัน
สเปกเครื่องสำหรับรันใช้งาน ต้องใช้การ์ดจอ 24GB บน Linux
เอกสารของทีมพัฒนาระบุว่าต้องใช้การ์ดจอ NVIDIA ที่รองรับรูปแบบข้อมูล BF16 และมี VRAM อย่างน้อย 24GB โดยทำงานบนระบบปฏิบัติการ Linux
เมื่อใช้งานบนการ์ดจอระดับดังกล่าว ความเร็วในการประมวลผลถือว่าเร็วทีเดียว โดยการสร้างเพลงความยาว 3.6 นาที (214.85 วินาที) ในโหมด full ใช้เวลาสร้างประมาณ 71 วินาทีเท่านั้น บนการ์ดจอ RTX 4090 24GB
อย่างไรก็ตาม ข้อกำหนดนี้หมายความว่า ผู้ใช้ทั่วไปที่ใช้แล็ปท็อปหรือคอมพิวเตอร์ที่ไม่มีการ์ดจอ NVIDIA ขนาด 24GB จะยังรันโมเดลนี้เองไม่ได้ในตอนนี้ และทางทีมพัฒนาก็ยังไม่มีเว็บแอปพลิเคชันอย่างเป็นทางการให้ทดลองสร้างเพลงฟรี ส่วนหน้าเดโมที่มีอยู่ มีไว้สำหรับเปิดฟังตัวอย่างเพลงและดูขั้นตอนการแก้ไขโน้ตเท่านั้น ไม่ใช่หน้าเว็บสำหรับพิมพ์เนื้อเพลงแล้วกดสร้าง
ทางเลือกใหม่ที่กำลังตามมาคือโปรแกรมต่อบล็อกคำสั่งอย่าง ComfyUI ที่ใช้รันโมเดลภาพและเสียงบนเครื่องตัวเอง ล่าสุด comfyanonymous ผู้สร้าง ComfyUI ได้เปิด Pull Request #16250 เมื่อวันที่ 11 กันยายน 2026 เพื่อเพิ่มการรองรับ YuE2 เข้ามาในระบบ
ในช่องความคิดเห็นของ PR ดังกล่าว ได้แนบ ไฟล์โมเดลใน Comfy-Org พร้อมกับ Workflow ทดสอบ ให้ดาวน์โหลดไปลอง และ PR นี้ยังรองรับ SheetSage2 เพื่อใช้แปลงเสียงเป็นโน้ต ABC ในตัว ใครที่เคยตั้งค่าโมเดลเพลงอย่าง MiniMax Music 3 ใน ComfyUI มาก่อนก็น่าจะคุ้นเคยกับรูปแบบนี้ดี
แต่ถ้าดูสถานะจริง PR นี้ยังเปิดอยู่และยังไม่ได้รวมเข้าสู่ตัวโปรแกรมหลัก อีกทั้งบอทที่ตรวจโค้ดยังประเมินความเสี่ยงไว้ที่ระดับปานกลาง พร้อมชี้จุดที่ควรปรับปรุง เช่น ขั้นตอนการสร้างโน้ต ABC ที่อาจทำงานไม่สำเร็จ ทำให้ตอนนี้เรายังใช้งาน YuE2 ผ่าน ComfyUI โดยตรงไม่ได้ แต่ก็เป็นสัญญาณชัดเจนว่าผู้สร้างโปรแกรมกำลังลงมือพัฒนาด้วยตัวเอง
สัญญาอนุญาต CC BY-NC 4.0 ของ weights ห้ามใช้เชิงพาณิชย์
ข้อจำกัดที่สำคัญที่สุดสำหรับคนทำคอนเทนต์หารายได้คือเรื่องสัญญาอนุญาตการใช้งาน เนื่องจากตัวค่าน้ำหนักโมเดลหรือ weights ปล่อยออกมาภายใต้เงื่อนไข CC BY-NC 4.0 ซึ่งห้ามนำไปใช้ในเชิงพาณิชย์ สัญญาอนุญาตนี้กำกับตัว weights ที่คุณรัน ส่วนไฟล์เพลงที่ออกมาจะเอาไปใช้ในคลิปที่เปิดสร้างรายได้ หรือเอาไปขายได้หรือไม่ เอกสารของทีมไม่ได้เขียนแยกไว้ ถ้างานของคุณมีรายได้เข้ามาเกี่ยว นี่คือจุดที่ต้องอ่านเงื่อนไขห้ามใช้เชิงพาณิชย์ให้ครบก่อนตัดสินใจ ไม่ใช่มองข้ามไปเพราะเห็นคำว่าโอเพนซอร์ส
หลายคนอาจเข้าใจผิด เพราะโปรเจกต์เดียวกันใช้สัญญาอนุญาต 2 รูปแบบ ตัวซอร์สโค้ดของโปรเจกต์ใช้สัญญาอนุญาต Apache 2.0 ซึ่งนำไปใช้เชิงพาณิชย์ได้ แต่นั่นหมายถึงเฉพาะโค้ดของระบบ ไม่ใช่ตัวโมเดล ส่วนที่คุณรันเพื่อให้ได้เพลงคือ weights ซึ่งอยู่ภายใต้เงื่อนไข Non-Commercial ที่ห้ามใช้เชิงพาณิชย์
นอกจากนี้ ยังมีอีก 2 ข้อที่ควรรู้ก่อนตั้งความหวังไว้สูงเกินไป:
ข้อแรกคือเรื่องภาษา ทั้งหน้าสรุปข้อมูล Model Card และเอกสารแนะนำ README มีตัวอย่างเพลงเฉพาะภาษาอังกฤษและภาษาจีนกลาง โดยไม่ได้กล่าวถึงภาษาไทยเลย ใครที่อยากได้เพลงร้องภาษาไทยจึงต้องทดลองรันและฟังผลด้วยตัวเอง
ข้อที่สองคือรายงานทางเทคนิคของ YuE2 ยังไม่ออกมา ตัวเลขการทดสอบทั้งหมดที่มีในตอนนี้มาจากข้อมูลที่ทีมพัฒนาเผยแพร่เอง ได้แก่ Model Card บน Hugging Face ไฟล์ README บน GitHub และหน้าเดโม จึงยังไม่มีรายงานที่อธิบายวิธีวัดอย่างละเอียด ระหว่างนี้ ทีมพัฒนาแนะนำให้อ่านงานวิจัยของ YuE รุ่นแรกไปก่อน
สิ่งที่เริ่มทำได้ทันที
ถ้าคุณสนใจ สิ่งที่ทำได้ทันทีคือลองเปิดหน้าเดโม แล้วฟังเพลงตัวอย่าง 3 เพลงแรก ได้แก่ Cyber Metal, 今晚不眠 และ Passion เพื่อเทียบกับเพลงที่คุณเคยสร้างจาก Suno แล้วตัดสินด้วยหูของคุณเองว่าช่องว่างของคุณภาพเสียงเหลือมากน้อยแค่ไหน เพราะตัวเลขในตารางบอกได้เพียงว่าทั้งสองระบบอยู่ในระดับใกล้เคียงกัน แต่การใช้งานจริง หูของคุณจะให้คำตอบได้ดีที่สุด
ถ้าฟังแล้วถูกใจ และมีคอมพิวเตอร์ Linux ที่ติดตั้งการ์ดจอ NVIDIA VRAM 24GB ขึ้นไป ก็เข้าไปดูขั้นตอนในหัวข้อ Quick Start บน GitHub แล้วทำตามคำแนะนำของทีมพัฒนาได้ทันที แต่ถ้าฮาร์ดแวร์ยังไม่พร้อม แนะนำให้กดติดตาม Pull Request #16250 ไว้ แล้วรอให้ ComfyUI รวมฟังก์ชันนี้เข้าสู่ตัวหลัก
สิ่งที่ YuE2 เข้ามาเปลี่ยนวงการจริงๆ อาจไม่ใช่แค่เรื่องคะแนนทดสอบที่ไล่ทัน Suno แต่คือการเปลี่ยนให้เพลงจาก AI ไม่ใช่ไฟล์เสียงสำเร็จรูปที่คุณต้องรับมาทั้งก้อนโดยแก้ไขข้างในไม่ได้อีกต่อไป หากแต่กลายเป็นโครงสร้างโน้ตเพลงที่เปิดให้คุณเข้าไปดู และปรับเปลี่ยนรายละเอียดได้ทีละคอร์ดตามต้องการ
ที่มา:
- บทความ m-a-p/YuE2-3B · Hugging Face จาก m-a-p (Hugging Face)
- บทความ YuE2: frontier music generation with symbolic planning, zero-shot covers, and agentic music editing จาก multimodal-art-projection (GitHub)
- บทความ Support Yue2 music model · Pull Request #16250 · Comfy-Org/ComfyUI จาก comfyanonymous (Comfy-Org)
ชอบเรื่องแนวนี้ มีอีบุ๊คฟรีให้อ่านต่อ
Local LLM ฉบับเข้าใจง่าย รัน AI ไว้ในเครื่องตัวเอง ติดตั้ง อัปเดต จัดการ ลบ ครบวงจรด้วย Ollama
กดสมัครแล้วเราจะส่งเทคนิค AI และของแจกใหม่ๆ ให้ทางอีเมล เลิกรับได้ตลอด
Claude Cowork · The Business Playbook

ฉบับภาษาไทย 15 บท เรียนรู้ผ่านโปรเจกต์จำลองต่อเนื่องทั้งเล่ม ตั้งแต่ตั้งค่า Workspace จัดการไฟล์ เชื่อมแอป ตั้งระบบอัตโนมัติ จนถึงสร้าง Plugin


