MiniMax H3 + WanGP + ComfyUI: Seedance 2.5 Open Source Low VRAM Competitor Complete Easy Setup Guide
สรุปย่อ
ประเด็นสำคัญจากวิดีโอ
- **ช่อง:** DevsKingdom · **ความยาว:** ~8 นาที · **ลิงก์:** https://www.youtube.com/watch?v=lMq6FDhFHrA
# สรุป: MiniMax H3 + WanGP + ComfyUI: Seedance 2.5 Open Source Low VRAM Competitor Complete Easy Setup Guide - **ช่อง:** DevsKingdom · **ความยาว:** ~8 นาที · **ลิงก์:** https://www.youtube.com/watch?v=lMq6FDhFHrA ## ประเด็นหลัก - MiniMax H3 เป็นโมเดลวิดีโอ AI แบบโอเพนซอร์สที่เพิ่งเปิดตัว ประมาณหนึ่งถึงสองสัปดาห์ก่อนหน้านี้ มีคุณภาพสูง เทียบชั้นได้กับ Sora 2.0 และ Sora 2.5 - ทาง ComfyUI ก็ปล่อยเวิร์กโฟลว์พร้อมตัวอย่างวิดีโอจำนวนมาก แต่ทุกแพลตฟอร์มยังต้องดาวน์โหลดโมเดลซึ่งมีขนาดใหญ่มาก แม้แต่เวอร์ชัน compact (FP8) หรือเวอร์ชัน pruned ก็ยังใหญ่ - การทดลองใช้บนเครื่องสเปกต่ำทำได้ยากเพราะต้องใช้ฮาร์ดแวร์และ VRAM เยอะ วิธีแก้คือใช้ Kaggle ซึ่งรองรับ VRAM ต่ำกว่า 16 กิกะไบต์ได้ฟรี - เครื่องมือหลักคือ WanGP เฟรมเวิร์กสำหรับ GPU ความจำต่ำ ใช้สร้างวิดีโอ MiniMax H3 บน GPU ระดับล่างได้ผลลัพธ์ดี ใช้งานผ่านทั้งเว็บ UI และ SDK - บน UI ตั้งค่าได้หลากหลาย เช่น LoRA (รวมถึง first-step LoRA) โมเดล 33B และ pruned 20B การเพิ่มโมเดลของตัวเอง (checkpoint, text encoder, VAE) ด้วยการดาวน์โหลดจาก Hugging Face แล้วระบุพาธในโฟลเดอร์ temp ของ Kaggle - ตั้งค่าขนาด (เช่น 480) จำนวนเฟรม (5 หรือ 10 วินาที) และ inference steps ซึ่งค่าเริ่มต้นคือ 4 เพราะใช้ turbo LoRA จากนั้นกด generate ได้เลย - ขั้นตอนติดตั้งใน Kaggle notebooks: ดาวน์โหลด WanGP ลงโฟลเดอร์หลัก ลง dependencies ดาวน์โหลดโมเดลสามตัวลง temp/minimax H3 แล้วเปิดใช้งาน - ต้องใช้ Cloudflare tunnel (port 7860 ชี้ไป localhost) เพราะ Gradio หรือ ngrok ช้าเกินไปสำหรับการใช้งานผ่านเทอร์มินัล - การใช้ SDK: ระบุโฟลเดอร์ WanGP ตั้งค่าพารามิเตอร์และ exporter settings ซึ่งสำคัญมากสำหรับกำหนดโมเดล จากนั้นส่งงาน (submit task) และดาวน์โหลดวิดีโอจากโฟลเดอร์ output ## ความเห็นสรุป วิดีโอนี้เป็นคู่มือลงมือทำจริงที่ครบถ้วนสำหรับคนที่อยากลองโมเดลวิดีโอโอเพนซอร์สบนฮาร์ดแวร์จำกัด โดยไม่ต้องเสียเงินซื้อ GPU แรงๆ แม้คำบรรยายจะเป็นแบบอัตโนมัติและมีชื่อบางชื่อเพี้ยนไปบ้าง แต่เนื้อหาหลักคือแนวทางติดตั้งและใช้งาน WanGP บน Kaggle ยังเข้าใจได้ชัดเจน เหมาะสำหรับผู้ที่พอมีพื้นฐานการใช้ Kaggle และ ComfyUI อยู่บ้าง
คำแปลเต็ม
แปลตามบทสนทนาต้นฉบับ ปรับเป็นภาษาไทยธรรมชาติ
สวัสดีทุกคนครับ ยินดีต้อนรับสู่วิดีโอถัดไปของเรา ในบทช่วยสอนวันนี้ เราจะมาพูดถึง MiniMax H3 (โมเดลวิดีโอ AI ของ MiniMax) ที่เพิ่งเปิดตัวไปเมื่อประมาณหนึ่งถึงสองสัปดาห์ก่อนครับ
โมเดลนี้เป็นโมเดลวิดีโอที่ยอดเยี่ยมมากครับ เทียบชั้นได้กับ Sora 2.0 (โมเดลวิดีโอชื่อดัง) และแม้กระทั่ง Sora 2.5 เลยทีเดียว
มันสร้างวิดีโอคุณภาพสูงมากครับ อย่างที่เห็นได้จากเว็บไซต์เปิดตัวอย่างเป็นทางการ วิดีโอออกมาดูพรีเมียมมาก และเหมาะกับการใช้งานระดับโปรดักชันครับ
และถ้าดูที่ ComfyUI (เครื่องมือสร้างเวิร์กโฟลว์ AI) เขาก็ปล่อยเวิร์กโฟลว์ ComfyUI ออกมาด้วยเช่นกัน พร้อมกับตัวอย่างวิดีโอดีๆ จำนวนมากให้ดูครับ
ทุกตัวอย่างสุดยอดมากๆ ครับ แต่ปัญหาหนึ่งก็คือ ทุกแพลตฟอร์มที่ปล่อย MiniMax H3 ออกมา ยังต้องดาวน์โหลดโมเดลก่อนใช้งาน
ถึงแม้จะเป็นโอเพนซอร์ส แต่ตัวโมเดลใหญ่มากจริงๆ ครับ ถ้าดูที่รีโพ MiniMax H3 อย่างเป็นทางการ จะเห็นว่าโมเดลนี้ใหญ่โตมาก
และถ้าดูเวอร์ชัน compact (แบบกระชับ) ของทีม ComfyUI ซึ่งเป็นเวอร์ชัน FP8 (รูปแบบข้อมูลความแม่นยำต่ำ) รวมถึงเวอร์ชันอื่นๆ ที่เป็นเวอร์ชัน pruned (แบบตัดแต่งให้เล็กลง) ก็ยังใหญ่มากอยู่ดีครับ
ดังนั้นถ้าใครมีสเปกเครื่องระดับล่าง แล้วลองใช้ ComfyUI หรือโมเดลโอเพนซอร์ส ของ MiniMax เวอร์ชันทางการ ก็จะทดลองใช้งานได้ยากมากครับ
เพราะมันต้องการฮาร์ดแวร์และ VRAM (หน่วยความจำของการ์ดจอ) เยอะมากครับ ในบทช่วยสอนนี้ ผมจะพาทุกคนไปดูวิธีทำแบบนี้ได้ฟรีบน Kaggle
Kaggle เป็นแพลตฟอร์มทำโน้ตบุ๊ก AI ออนไลน์ ซึ่งรองรับ VRAM ต่ำ ที่น้อยกว่า 16 กิกะไบต์ครับ เอาล่ะ ถ้าอย่างนั้นเราไปเริ่มที่ Kaggle notebooks กันเลยครับ
เครื่องมือที่เราจะใช้กันวันนี้ชื่อว่า WanGP ครับ WanGP เป็นเฟรมเวิร์ก ที่ออกแบบมาสำหรับ GPU ความจำต่ำโดยเฉพาะ ดูรีโพ GitHub ได้เลยครับ
มันอยู่ภายใต้องค์กร Deep BiP MiP บน GitHub นะครับ โดย WanGP เป็นตัวสร้างวิดีโอ AI ที่เร็วสำหรับกลุ่ม GPU ระดับล่าง
ถ้าใครไม่มี GPU ระดับสูง ก็สามารถลองใช้ WanGP เพื่อรันบน GPU ระดับล่างได้ครับ ซึ่งก็ให้ผลลัพธ์ที่ดีมากเหมือนกัน
และที่เห็นอยู่นี้คือวิดีโอ MiniMax H3 ที่สร้างด้วย WanGP ครับ คุณภาพดีมากเลย และนี่คือเว็บ UI ของเครื่องมือ
เขายังมี SDK (ชุดเครื่องมือสำหรับนักพัฒนา) ให้ลองใช้ด้วย ซึ่งในวิดีโอนี้เราจะสาธิตวิธีใช้ SDK กันด้วยครับ
แต่ก่อนอื่น มาดูหน้าจอ UI แบบต่างๆ ของ WanGP กันก่อนครับ อย่างที่เห็น นี่คือวิดีโอที่สร้างจาก prompt (ข้อความคำสั่ง) แบบต่างๆ กัน
กดเล่นดูได้เลยครับ ว่าจะได้ผลลัพธ์แบบไหน "ถ้าคุณได้ยินผม ให้ส่งสัญญาณตามนี้" ครับ
เห็นไหมครับ วิดีโอนี้คุณภาพดีจริงๆ ลองเล่นอีกครั้งนะครับ "ถ้าคุณได้ยินผม ให้ส่งสัญญาณตามนี้"
จะเห็นว่าภาพลื่นไหลมากครับ ถึงแม้จะเป็นวิดีโอแค่ 5 วินาที แต่มันคือวิดีโอคุณภาพสูงจริงๆ
บน UI เราสามารถตั้งค่าพารามิเตอร์ต่างๆ ได้มากมายครับ เช่นลองใช้ LoRA (เทคนิคปรับแต่งโมเดล) ดูได้
ซึ่งตัวที่ว่าน่าจะเร็วที่สุดคือ first-step LoRA ครับ เรายังเลือกใช้โมเดลต่างๆ เพื่อปรับแต่งได้ด้วย เช่นโมเดล 33B และโมเดล pruned 20B
และยังเพิ่มโมเดลที่ปรับแต่งเองได้อีกด้วย ซึ่งเราทำไว้แล้วครับ แค่กดที่ไอคอนเพิ่ม แล้วใส่ checkpoint (จุดบันทึกโมเดล) หลัก รวมถึง text encoder (ตัวเข้ารหัสข้อความ) ลงไปครับ
ตรงนี้เขาปรับแต่งมาให้เรียบร้อยแล้ว เราไม่ต้องไปหาว่า ต้องดาวน์โหลดจากที่ไหนครับ
แค่ดาวน์โหลดจาก Hugging Face ตรงๆ แล้วใส่ไว้ในโฟลเดอร์ temp ของ Kaggle แล้ววางพาธตรงนี้ ซึ่งเป็นพาธในเครื่องของเราครับ
เราลองทั้งโมเดลหลัก text encoder และโมเดล VAE (ตัวเข้ารหัสอัตโนมัติ) ดูแล้วครับ ดาวน์โหลดทุกอย่างมาแล้ววางพาธไว้ตรงนี้ เรียบร้อยครับ
เราสามารถดาวน์โหลดโมเดลแล้ววางไว้ที่ไหนก็ได้บน WanGP มันจะโหลดได้โดยแค่ระบุพาธให้ถูกต้องเท่านั้นเองครับ
จากนั้นก็กำหนดขนาด (dimensions) ได้ครับ ในตัวอย่างนี้เราใช้ 480 คุณลองขนาดอื่นๆ ดูได้ และยังสลับจำนวนเฟรมสำหรับวิดีโอ 5 วินาทีได้ด้วย
หรือจะลอง 10 วินาทีก็ได้ครับ ถ้ามีเวลาหรือมี GPU ที่ดีกว่า แล้วก็เปลี่ยนจำนวน inference steps (รอบการสร้างภาพ) ได้
ค่าเริ่มต้นคือ 4 ครับ เพราะเราเลือกใช้ turbo LoRA (LoRA โหมดเร็ว) ไว้ แค่นั้นแหละครับ กด generate แล้วคุณจะได้วิดีโอสุดเจ๋งแบบนี้
อยากรู้วิธีติดตั้งทั้งหมดไหมครับ เราไปดูที่ Kaggle notebooks กันเลย
ใน Kaggle notebooks สิ่งที่ต้องทำก็แค่ดาวน์โหลด WanGP ไปไว้ในโฟลเดอร์หลัก ซึ่งก็คือโฟลเดอร์ทำงานของ Kaggle ที่เป็นโฟลเดอร์เริ่มต้นครับ
จากนั้นติดตั้ง dependencies (ไลบรารีที่ต้องใช้) ให้เรียบร้อย แล้วก็ดาวน์โหลดโมเดลไปไว้ที่ไหนก็ได้ตามต้องการครับ
พูดง่ายๆ คือดาวน์โหลดทุกอย่างลงในไดเรกทอรีภายในเครื่องครับ จะเห็นว่าอยู่ใต้โฟลเดอร์ temp/minimax H3
ซึ่งเป็นโมเดลทั้งสามตัวที่พูดถึงก่อนหน้านี้ครับ จากนั้นก็เปิดใช้งานได้เลย
สำคัญมากครับ ต้องรันบน Cloudflare เพราะเครื่องมืออื่นอย่าง Gradio หรือ ngrok นั้นช้ามากสำหรับการใช้งานผ่านเทอร์มินัล ส่วน Cloudflare นั้นทำงานได้ดีมาก
รันคำสั่งนี้เพื่อสตาร์ท WanGP ขึ้นที่แบ็กเอนด์ครับ ซึ่งจะรันอยู่บน port 7860 จากนั้นดาวน์โหลด Cloudflare tunnel แล้วเปิดอุโมงค์ชี้ไปที่ localhost 7860 ครับ
พอทุกอย่างรันเรียบร้อยแล้ว เราก็จะเห็นอินเทอร์เฟซแบบที่เห็นเมื่อกี้ และแค่ใส่ prompt ก็สร้างวิดีโอได้เลยครับ
ส่วนการใช้งาน SDK ตามที่พูดถึงก่อนหน้านี้ WanGP รองรับการพัฒนาแบบ Python SDK ครับ ทำได้ประมาณนี้
ก็คือระบุโฟลเดอร์ WanGP ของคุณก่อน จากนั้นก็ใส่พารามิเตอร์ต่างๆ ของ WanGP เข้าไป รวมถึง exporter settings ด้วยครับ
ส่วนนี้สำคัญมากครับ มันคือการตั้งค่าที่ใช้กำหนดโมเดล ตัวอย่างเช่น เราสามารถดาวน์โหลดโมเดลจาก export settings ตรงนี้ได้
แล้วส่งออกการตั้งค่านั้นไปยังเครื่อง local (เครื่องภายใน) แล้วใช้ SDK อ่านค่าการตั้งค่านั้นมาครับ
แค่นั้นแหละครับ จากนั้นก็ส่งงาน (submit task) ด้วยการตั้งค่านี้ แล้วก็เริ่มสร้างวิดีโอได้เลย
ดาวน์โหลดผลลัพธ์ได้จากโฟลเดอร์ output ครับ พอวิดีโอสร้างเสร็จ มันจะอยู่ในโฟลเดอร์ output และดูได้จาก video path ซึ่งก็คือชื่อไฟล์วิดีโอนั่นเองครับ
และนี่คือวิธีสร้างวิดีโอ MiniMax H3 ฟรีบนฮาร์ดแวร์ของ Kaggle ครับ
หวังว่าคลิปนี้จะเป็นประโยชน์นะครับ ถ้าชอบวิดีโอนี้ ช่วยกด subscribe กดไลก์ หรือคอมเมนต์กันด้วยนะครับ
ถ้ามีคำถามอะไรก็ถามได้เลยครับ ขอบคุณมากที่สนับสนุนช่อง และแล้วเจอกันใหม่ในวิดีโอหน้านะครับ
หมายเหตุการแปล
ความโปร่งใสเกี่ยวกับความไม่แน่นอนในต้นฉบับ
- ## จุดที่ ASR เพี้ยนและการตัดสินใจ (ไม่มี [ฟังไม่ชัด] ค้างอยู่ในบทแปล)
- | Deep BiP MiP organization | ชื่อองค์กรบน GitHub (ASR ไม่ชัด) | คงชื่อตามที่ได้ยินไว้ และระบุไว้ในอภิธานว่าไม่แน่ใจ |
- | Kaggle's LaViola hardware | ฮาร์ดแวร์ของ Kaggle (ASR ไม่ชัด) | แปลแบบกลางๆ เป็น "ฮาร์ดแวร์ของ Kaggle" โดยไม่เดาชื่อเฉพาะ |
- ## จุดที่ยังไม่ชัดเจน
อภิธานศัพท์เทคนิค
คำศัพท์และชื่อผลิตภัณฑ์ที่คงรูปภาษาอังกฤษ
| ศัพท์ | คำแปล / คำอธิบาย |
|---|---|
| MiniMax H3 | โมเดลวิดีโอ AI แบบโอเพนซอร์สของ MiniMax (ในคำบรรยายต้นฉบับ ASR อ่านเป็น "SD3" ในช่วงแรก) |
| Seedance 2.5 | โมเดลวิดีโอคู่แข่งที่กล่าวถึงในชื่อวิดีโอ |
| Sora 2.0 / Sora 2.5 | โมเดลวิดีโอที่ใช้เทียบเคียงคุณภาพ (ในคำบรรยาย ASR อ่านเป็น "Sit Down") |
| WanGP | เฟรมเวิร์กสำหรับ GPU ความจำต่ำ ใช้สร้างวิดีโอ AI บน GPU ระดับล่าง (ASR อ่านเป็น "1GP"/"1 2 GP"/"W GP") |
| ComfyUI | เครื่องมือสร้างเวิร์กโฟลว์ AI แบบโหนด |
| VRAM | หน่วยความจำของการ์ดจอ ใช้เก็บข้อมูลโมเดลระหว่างการประมวลผล |
| Kaggle | แพลตฟอร์มทำโน้ตบุ๊ก AI ออนไลน์ ให้ใช้ GPU ฟรี |
| FP8 | รูปแบบข้อมูลความแม่นยำต่ำ ใช้ลดขนาดโมเดล |
| pruned (version) | เวอร์ชันที่ตัดแต่งให้เล็กลง (ASR อ่านเป็น "prone") |
| compact version | เวอร์ชันกระชับ ขนาดไฟล์เล็กลง |
| open source | โอเพนซอร์ส ซอร์สโค้ดเปิดให้ใช้ฟรี |
| checkpoint | จุดบันทึกโมเดลที่เทรนไว้แล้ว |
| text encoder | ตัวเข้ารหัสข้อความ เปลี่ยน prompt เป็นค่าที่โมเดลเข้าใจ |
| VAE | ตัวเข้ารหัสอัตโนมัติ (Variational Autoencoder) |
| LoRA | เทคนิคปรับแต่งโมเดลโดยใช้ไฟล์ขนาดเล็ก |
| first-step LoRA | LoRA ที่ประมวลผลเร็วที่สุด ใช้ขั้นตอนน้อย |
| turbo LoRA | LoRA โหมดเร็ว ทำให้ใช้ inference steps เพียง 4 ขั้น (ASR อ่านเป็น "turbo learning") |
| inference steps | จำนวนรอบการสร้างภาพ ยิ่งมากยิ่งละเอียดแต่ช้าลง |
| prompt | ข้อความคำสั่งที่ใช้บอกโมเดลว่าต้องการวิดีโอแบบไหน |
| dimensions | ขนาดความละเอียดของวิดีโอ เช่น 480 |
| frame | เฟรม ภาพนิ่งหนึ่งภาพในวิดีโอ จำนวนเฟรมกำหนดความยาววิดีโอ |
| SDK | ชุดเครื่องมือสำหรับนักพัฒนา ใช้เขียนโค้ดควบคุม WanGP |
| UI | อินเทอร์เฟซผู้ใช้ หน้าจอสำหรับสั่งงาน |
| exporter settings | การตั้งค่าที่ใช้กำหนดโมเดลและส่งออกค่าให้ SDK อ่าน |
| submit task | การส่งงาน/คำสั่งให้โมเดลสร้างวิดีโอ |
| output folder | โฟลเดอร์เก็บผลลัพธ์วิดีโอที่สร้างเสร็จ |
| video path | พาธ/ตำแหน่งไฟล์วิดีโอที่สร้างเสร็จ |
| local path | พาธในเครื่องท้องถิ่น |
| Kaggle working folder | โฟลเดอร์ทำงานเริ่มต้นของ Kaggle |
| temp folder | โฟลเดอร์ชั่วคราว (ASR อ่านเป็น "time folder") ใช้เก็บโมเดลที่ดาวน์โหลด |
| dependencies | ไลบรารี/แพ็กเกจที่ต้องติดตั้งก่อนรัน |
| Hugging Face | แพลตฟอร์มโฮสต์โมเดล AI สำหรับดาวน์โหลดโมเดล |
| GitHub repo | ที่เก็บโค้ดบน GitHub |
| Deep BiP MiP | ชื่อองค์กรบน GitHub ที่โฮสต์ WanGP (ASR ไม่ชัด อาจเพี้ยนจากชื่อจริง) |
| Cloudflare tunnel | อุโมงค์เชื่อมต่อ Cloudflare ใช้เปิดหน้า UI สู่ภายนอก |
| ngrok | เครื่องมือทำ tunnel อีกตัว (ASR อ่านเป็น "Engrok") |
| Gradio | ไลบรารีสร้าง UI สำหรับโมเดล ML |
| localhost 7860 | ที่อยู่เครื่องตัวเอง พอร์ต 7860 ที่ WanGP รันอยู่ |
| terminal | เทอร์มินัล หน้าต่างคำสั่ง |
| backend | แบ็กเอนด์ ส่วนประมวลผลที่รันอยู่เบื้องหลัง |
| open source competitor | คู่แข่งโอเพนซอร์สของโมเดลเชิงพาณิชย์ |
| production usage | การใช้งานระดับโปรดักชัน/เชิงพาณิชย์จริง |
ซับไตเติ้ลภาษาไทย
ดาวน์โหลดหรือดูซับทั้งหมด
1 00:00:00,000 --> 00:00:01,335 สวัสดีทุกคนครับ 2 00:00:01,335 --> 00:00:04,182 ยินดีต้อนรับสู่วิดีโอถัดไปของเรา 3 00:00:04,182 --> 00:00:07,920 ในบทช่วยสอนวันนี้ เราจะมาพูดถึง MiniMax H3 4 00:00:07,920 --> 00:00:10,411 (โมเดลวิดีโอ AI ของ MiniMax)
เปิดดูซับไตเติ้ลทั้งหมด (145 segments)
1 00:00:00,000 --> 00:00:01,335 สวัสดีทุกคนครับ 2 00:00:01,335 --> 00:00:04,182 ยินดีต้อนรับสู่วิดีโอถัดไปของเรา 3 00:00:04,182 --> 00:00:07,920 ในบทช่วยสอนวันนี้ เราจะมาพูดถึง MiniMax H3 4 00:00:07,920 --> 00:00:10,411 (โมเดลวิดีโอ AI ของ MiniMax) 5 00:00:10,411 --> 00:00:15,216 ที่เพิ่งเปิดตัวไปเมื่อประมาณหนึ่งถึงสองสัปดาห์ก่อนครับ 6 00:00:15,216 --> 00:00:18,954 โมเดลนี้เป็นโมเดลวิดีโอที่ยอดเยี่ยมมากครับ 7 00:00:18,954 --> 00:00:22,958 เทียบชั้นได้กับ Sora 2.0 (โมเดลวิดีโอชื่อดัง) 8 00:00:22,958 --> 00:00:25,895 และแม้กระทั่ง Sora 2.5 เลยทีเดียว 9 00:00:25,895 --> 00:00:28,564 มันสร้างวิดีโอคุณภาพสูงมากครับ 10 00:00:28,564 --> 00:00:32,835 อย่างที่เห็นได้จากเว็บไซต์เปิดตัวอย่างเป็นทางการ 11 00:00:32,835 --> 00:00:34,971 วิดีโอออกมาดูพรีเมียมมาก 12 00:00:34,971 --> 00:00:38,352 และเหมาะกับการใช้งานระดับโปรดักชันครับ 13 00:00:38,352 --> 00:00:40,043 และถ้าดูที่ ComfyUI 14 00:00:40,043 --> 00:00:42,802 (เครื่องมือสร้างเวิร์กโฟลว์ AI) 15 00:00:42,802 --> 00:00:46,895 เขาก็ปล่อยเวิร์กโฟลว์ ComfyUI ออกมาด้วยเช่นกัน 16 00:00:46,895 --> 00:00:49,119 พร้อมกับตัวอย่างวิดีโอดีๆ 17 00:00:49,119 --> 00:00:53,035 จำนวนมากให้ดูครับ ทุกตัวอย่างสุดยอดมากๆ ครับ 18 00:00:53,035 --> 00:00:56,505 แต่ปัญหาหนึ่งก็คือ ทุกแพลตฟอร์มที่ปล่อย 19 00:00:56,505 --> 00:00:57,929 MiniMax H3 ออกมา 20 00:00:57,929 --> 00:01:00,687 ยังต้องดาวน์โหลดโมเดลก่อนใช้งาน 21 00:01:00,687 --> 00:01:04,781 ถึงแม้จะเป็นโอเพนซอร์ส แต่ตัวโมเดลใหญ่มากจริงๆ 22 00:01:04,781 --> 00:01:08,696 ครับ ถ้าดูที่รีโพ MiniMax H3 อย่างเป็นทางการ 23 00:01:08,696 --> 00:01:12,522 จะเห็นว่าโมเดลนี้ใหญ่โตมาก และถ้าดูเวอร์ชัน 24 00:01:12,522 --> 00:01:15,548 compact (แบบกระชับ) ของทีม ComfyUI 25 00:01:15,548 --> 00:01:17,328 ซึ่งเป็นเวอร์ชัน FP8 26 00:01:17,328 --> 00:01:19,730 (รูปแบบข้อมูลความแม่นยำต่ำ) 27 00:01:19,730 --> 00:01:23,468 รวมถึงเวอร์ชันอื่นๆ ที่เป็นเวอร์ชัน pruned 28 00:01:23,468 --> 00:01:27,383 (แบบตัดแต่งให้เล็กลง) ก็ยังใหญ่มากอยู่ดีครับ 29 00:01:27,383 --> 00:01:31,476 ดังนั้นถ้าใครมีสเปกเครื่องระดับล่าง แล้วลองใช้ 30 00:01:31,476 --> 00:01:34,947 ComfyUI หรือโมเดลโอเพนซอร์ส ของ MiniMax 31 00:01:34,947 --> 00:01:38,773 เวอร์ชันทางการ ก็จะทดลองใช้งานได้ยากมากครับ 32 00:01:38,773 --> 00:01:41,620 เพราะมันต้องการฮาร์ดแวร์และ VRAM 33 00:01:41,620 --> 00:01:44,735 (หน่วยความจำของการ์ดจอ) เยอะมากครับ 34 00:01:44,735 --> 00:01:45,981 ในบทช่วยสอนนี้ 35 00:01:45,981 --> 00:01:49,718 ผมจะพาทุกคนไปดูวิธีทำแบบนี้ได้ฟรีบน Kaggle 36 00:01:49,718 --> 00:01:53,366 Kaggle เป็นแพลตฟอร์มทำโน้ตบุ๊ก AI ออนไลน์ 37 00:01:53,366 --> 00:01:56,392 ซึ่งรองรับ VRAM ต่ำ ที่น้อยกว่า 16 38 00:01:56,392 --> 00:02:00,396 กิกะไบต์ครับ เอาล่ะ ถ้าอย่างนั้นเราไปเริ่มที่ 39 00:02:00,396 --> 00:02:02,799 Kaggle notebooks กันเลยครับ 40 00:02:02,799 --> 00:02:06,625 เครื่องมือที่เราจะใช้กันวันนี้ชื่อว่า WanGP 41 00:02:06,625 --> 00:02:10,451 ครับ WanGP เป็นเฟรมเวิร์ก ที่ออกแบบมาสำหรับ 42 00:02:10,451 --> 00:02:14,545 GPU ความจำต่ำโดยเฉพาะ ดูรีโพ GitHub ได้เลยครับ 43 00:02:14,545 --> 00:02:18,282 มันอยู่ภายใต้องค์กร Deep BiP MiP บน GitHub 44 00:02:18,282 --> 00:02:21,663 นะครับ โดย WanGP เป็นตัวสร้างวิดีโอ AI 45 00:02:21,663 --> 00:02:25,579 ที่เร็วสำหรับกลุ่ม GPU ระดับล่าง ถ้าใครไม่มี 46 00:02:25,579 --> 00:02:29,494 GPU ระดับสูง ก็สามารถลองใช้ WanGP เพื่อรันบน 47 00:02:29,494 --> 00:02:31,274 GPU ระดับล่างได้ครับ 48 00:02:31,274 --> 00:02:34,210 ซึ่งก็ให้ผลลัพธ์ที่ดีมากเหมือนกัน 49 00:02:34,210 --> 00:02:37,503 และที่เห็นอยู่นี้คือวิดีโอ MiniMax H3 50 00:02:37,503 --> 00:02:40,884 ที่สร้างด้วย WanGP ครับ คุณภาพดีมากเลย 51 00:02:40,884 --> 00:02:44,710 และนี่คือเว็บ UI ของเครื่องมือ เขายังมี SDK 52 00:02:44,710 --> 00:02:48,537 (ชุดเครื่องมือสำหรับนักพัฒนา) ให้ลองใช้ด้วย 53 00:02:48,537 --> 00:02:51,740 ซึ่งในวิดีโอนี้เราจะสาธิตวิธีใช้ SDK 54 00:02:51,740 --> 00:02:55,834 กันด้วยครับ แต่ก่อนอื่น มาดูหน้าจอ UI แบบต่างๆ 55 00:02:55,834 --> 00:03:03,842 ของ WanGP กันก่อนครับ อย่างที่เห็น นี่คือวิดีโอที่สร้างจาก prompt (ข้อความคำสั่ง) แบบต่างๆ 56 00:03:03,842 --> 00:03:07,757 กัน กดเล่นดูได้เลยครับ ว่าจะได้ผลลัพธ์แบบไหน 57 00:03:07,757 --> 00:03:11,317 "ถ้าคุณได้ยินผม ให้ส่งสัญญาณตามนี้" ครับ 58 00:03:11,317 --> 00:03:14,342 เห็นไหมครับ วิดีโอนี้คุณภาพดีจริงๆ 59 00:03:14,342 --> 00:03:17,635 ลองเล่นอีกครั้งนะครับ "ถ้าคุณได้ยินผม 60 00:03:17,635 --> 00:03:21,728 ให้ส่งสัญญาณตามนี้" จะเห็นว่าภาพลื่นไหลมากครับ 61 00:03:21,728 --> 00:03:24,398 ถึงแม้จะเป็นวิดีโอแค่ 5 วินาที 62 00:03:24,398 --> 00:03:26,978 แต่มันคือวิดีโอคุณภาพสูงจริงๆ 63 00:03:26,978 --> 00:03:30,360 บน UI เราสามารถตั้งค่าพารามิเตอร์ต่างๆ 64 00:03:30,360 --> 00:03:32,940 ได้มากมายครับ เช่นลองใช้ LoRA 65 00:03:32,940 --> 00:03:35,343 (เทคนิคปรับแต่งโมเดล) ดูได้ 66 00:03:35,343 --> 00:03:39,080 ซึ่งตัวที่ว่าน่าจะเร็วที่สุดคือ first-step 67 00:03:39,080 --> 00:03:42,105 LoRA ครับ เรายังเลือกใช้โมเดลต่างๆ 68 00:03:42,105 --> 00:03:45,932 เพื่อปรับแต่งได้ด้วย เช่นโมเดล 33B และโมเดล 69 00:03:45,932 --> 00:03:47,029 pruned 20B 70 00:03:47,029 --> 00:03:50,588 และยังเพิ่มโมเดลที่ปรับแต่งเองได้อีกด้วย 71 00:03:50,588 --> 00:03:54,059 ซึ่งเราทำไว้แล้วครับ แค่กดที่ไอคอนเพิ่ม 72 00:03:54,059 --> 00:03:57,618 แล้วใส่ checkpoint (จุดบันทึกโมเดล) หลัก 73 00:03:57,618 --> 00:04:01,177 รวมถึง text encoder (ตัวเข้ารหัสข้อความ) 74 00:04:01,177 --> 00:04:05,093 ลงไปครับ ตรงนี้เขาปรับแต่งมาให้เรียบร้อยแล้ว 75 00:04:05,093 --> 00:04:09,008 เราไม่ต้องไปหาว่า ต้องดาวน์โหลดจากที่ไหนครับ 76 00:04:09,008 --> 00:04:11,945 แค่ดาวน์โหลดจาก Hugging Face ตรงๆ 77 00:04:11,945 --> 00:04:15,148 แล้วใส่ไว้ในโฟลเดอร์ temp ของ Kaggle 78 00:04:15,148 --> 00:04:16,572 แล้ววางพาธตรงนี้ 79 00:04:16,572 --> 00:04:19,241 ซึ่งเป็นพาธในเครื่องของเราครับ 80 00:04:19,241 --> 00:04:23,246 เราลองทั้งโมเดลหลัก text encoder และโมเดล VAE 81 00:04:23,246 --> 00:04:26,182 (ตัวเข้ารหัสอัตโนมัติ) ดูแล้วครับ 82 00:04:26,182 --> 00:04:29,564 ดาวน์โหลดทุกอย่างมาแล้ววางพาธไว้ตรงนี้ 83 00:04:29,564 --> 00:04:30,720 เรียบร้อยครับ 84 00:04:30,720 --> 00:04:34,814 เราสามารถดาวน์โหลดโมเดลแล้ววางไว้ที่ไหนก็ได้บน 85 00:04:34,814 --> 00:04:35,911 WanGP 86 00:04:35,911 --> 00:04:40,360 มันจะโหลดได้โดยแค่ระบุพาธให้ถูกต้องเท่านั้นเองครับ 87 00:04:40,360 --> 00:04:43,830 จากนั้นก็กำหนดขนาด (dimensions) ได้ครับ 88 00:04:43,830 --> 00:04:47,835 ในตัวอย่างนี้เราใช้ 480 คุณลองขนาดอื่นๆ ดูได้ 89 00:04:47,835 --> 00:04:50,771 และยังสลับจำนวนเฟรมสำหรับวิดีโอ 5 90 00:04:50,771 --> 00:04:54,509 วินาทีได้ด้วย หรือจะลอง 10 วินาทีก็ได้ครับ 91 00:04:54,509 --> 00:04:57,089 ถ้ามีเวลาหรือมี GPU ที่ดีกว่า 92 00:04:57,089 --> 00:05:00,115 แล้วก็เปลี่ยนจำนวน inference steps 93 00:05:00,115 --> 00:05:03,852 (รอบการสร้างภาพ) ได้ ค่าเริ่มต้นคือ 4 ครับ 94 00:05:03,852 --> 00:05:07,678 เพราะเราเลือกใช้ turbo LoRA (LoRA โหมดเร็ว) 95 00:05:07,678 --> 00:05:10,437 ไว้ แค่นั้นแหละครับ กด generate 96 00:05:10,437 --> 00:05:13,195 แล้วคุณจะได้วิดีโอสุดเจ๋งแบบนี้ 97 00:05:13,195 --> 00:05:17,022 อยากรู้วิธีติดตั้งทั้งหมดไหมครับ เราไปดูที่ 98 00:05:17,022 --> 00:05:20,848 Kaggle notebooks กันเลย ใน Kaggle notebooks 99 00:05:20,848 --> 00:05:23,784 สิ่งที่ต้องทำก็แค่ดาวน์โหลด WanGP 100 00:05:23,784 --> 00:05:27,789 ไปไว้ในโฟลเดอร์หลัก ซึ่งก็คือโฟลเดอร์ทำงานของ 101 00:05:27,789 --> 00:05:30,814 Kaggle ที่เป็นโฟลเดอร์เริ่มต้นครับ 102 00:05:30,814 --> 00:05:33,217 จากนั้นติดตั้ง dependencies 103 00:05:33,217 --> 00:05:36,064 (ไลบรารีที่ต้องใช้) ให้เรียบร้อย 104 00:05:36,064 --> 00:05:40,514 แล้วก็ดาวน์โหลดโมเดลไปไว้ที่ไหนก็ได้ตามต้องการครับ 105 00:05:40,514 --> 00:05:41,611 พูดง่ายๆ 106 00:05:41,611 --> 00:05:45,971 คือดาวน์โหลดทุกอย่างลงในไดเรกทอรีภายในเครื่องครับ 107 00:05:45,971 --> 00:05:49,530 จะเห็นว่าอยู่ใต้โฟลเดอร์ temp/minimax H3 108 00:05:49,530 --> 00:05:53,713 ซึ่งเป็นโมเดลทั้งสามตัวที่พูดถึงก่อนหน้านี้ครับ 109 00:05:53,713 --> 00:05:57,094 จากนั้นก็เปิดใช้งานได้เลย สำคัญมากครับ 110 00:05:57,094 --> 00:06:01,098 ต้องรันบน Cloudflare เพราะเครื่องมืออื่นอย่าง 111 00:06:01,098 --> 00:06:02,611 Gradio หรือ ngrok 112 00:06:02,611 --> 00:06:06,526 นั้นช้ามากสำหรับการใช้งานผ่านเทอร์มินัล ส่วน 113 00:06:06,526 --> 00:06:09,018 Cloudflare นั้นทำงานได้ดีมาก 114 00:06:09,018 --> 00:06:11,598 รันคำสั่งนี้เพื่อสตาร์ท WanGP 115 00:06:11,598 --> 00:06:15,692 ขึ้นที่แบ็กเอนด์ครับ ซึ่งจะรันอยู่บน port 7860 116 00:06:15,692 --> 00:06:18,717 จากนั้นดาวน์โหลด Cloudflare tunnel 117 00:06:18,717 --> 00:06:22,544 แล้วเปิดอุโมงค์ชี้ไปที่ localhost 7860 ครับ 118 00:06:22,544 --> 00:06:24,857 พอทุกอย่างรันเรียบร้อยแล้ว 119 00:06:24,857 --> 00:06:28,417 เราก็จะเห็นอินเทอร์เฟซแบบที่เห็นเมื่อกี้ 120 00:06:28,417 --> 00:06:31,976 และแค่ใส่ prompt ก็สร้างวิดีโอได้เลยครับ 121 00:06:31,976 --> 00:06:35,624 ส่วนการใช้งาน SDK ตามที่พูดถึงก่อนหน้านี้ 122 00:06:35,624 --> 00:06:39,095 WanGP รองรับการพัฒนาแบบ Python SDK ครับ 123 00:06:39,095 --> 00:06:42,476 ทำได้ประมาณนี้ ก็คือระบุโฟลเดอร์ WanGP 124 00:06:42,476 --> 00:06:46,302 ของคุณก่อน จากนั้นก็ใส่พารามิเตอร์ต่างๆ ของ 125 00:06:46,302 --> 00:06:50,396 WanGP เข้าไป รวมถึง exporter settings ด้วยครับ 126 00:06:50,396 --> 00:06:52,086 ส่วนนี้สำคัญมากครับ 127 00:06:52,086 --> 00:06:56,091 มันคือการตั้งค่าที่ใช้กำหนดโมเดล ตัวอย่างเช่น 128 00:06:56,091 --> 00:06:59,828 เราสามารถดาวน์โหลดโมเดลจาก export settings 129 00:06:59,828 --> 00:07:03,921 ตรงนี้ได้ แล้วส่งออกการตั้งค่านั้นไปยังเครื่อง 130 00:07:03,921 --> 00:07:06,769 local (เครื่องภายใน) แล้วใช้ SDK 131 00:07:06,769 --> 00:07:10,595 อ่านค่าการตั้งค่านั้นมาครับ แค่นั้นแหละครับ 132 00:07:10,595 --> 00:07:13,176 จากนั้นก็ส่งงาน (submit task) 133 00:07:13,176 --> 00:07:17,269 ด้วยการตั้งค่านี้ แล้วก็เริ่มสร้างวิดีโอได้เลย 134 00:07:17,269 --> 00:07:21,006 ดาวน์โหลดผลลัพธ์ได้จากโฟลเดอร์ output ครับ 135 00:07:21,006 --> 00:07:25,011 พอวิดีโอสร้างเสร็จ มันจะอยู่ในโฟลเดอร์ output 136 00:07:25,011 --> 00:07:26,968 และดูได้จาก video path 137 00:07:26,968 --> 00:07:29,994 ซึ่งก็คือชื่อไฟล์วิดีโอนั่นเองครับ 138 00:07:29,994 --> 00:07:33,108 และนี่คือวิธีสร้างวิดีโอ MiniMax H3 139 00:07:33,108 --> 00:07:35,689 ฟรีบนฮาร์ดแวร์ของ Kaggle ครับ 140 00:07:35,689 --> 00:07:38,714 หวังว่าคลิปนี้จะเป็นประโยชน์นะครับ 141 00:07:38,714 --> 00:07:42,185 ถ้าชอบวิดีโอนี้ ช่วยกด subscribe กดไลก์ 142 00:07:42,185 --> 00:07:44,409 หรือคอมเมนต์กันด้วยนะครับ 143 00:07:44,409 --> 00:07:46,990 ถ้ามีคำถามอะไรก็ถามได้เลยครับ 144 00:07:46,990 --> 00:07:49,126 ขอบคุณมากที่สนับสนุนช่อง 145 00:07:49,126 --> 00:07:52,240 และแล้วเจอกันใหม่ในวิดีโอหน้านะครับ