▶SUBTHAIแปลไทย · ซับ · พากย์⚙
บทความแปลภาษาไทย · YouTube

MiniMax H3 + WanGP + ComfyUI: Seedance 2.5 Open Source Low VRAM Competitor Complete Easy Setup Guide

0:000:00
เล่นเสียงต้นฉบับของวิดีโอ พร้อมแสดงซับไทยซิงก์ตามเวลา
กำลังโหลดวิดีโอ…
01

สรุปย่อ

ประเด็นสำคัญจากวิดีโอ

- **ช่อง:** DevsKingdom · **ความยาว:** ~8 นาที · **ลิงก์:** https://www.youtube.com/watch?v=lMq6FDhFHrA

# สรุป: MiniMax H3 + WanGP + ComfyUI: Seedance 2.5 Open Source Low VRAM Competitor Complete Easy Setup Guide

- **ช่อง:** DevsKingdom · **ความยาว:** ~8 นาที · **ลิงก์:** https://www.youtube.com/watch?v=lMq6FDhFHrA

## ประเด็นหลัก

- MiniMax H3 เป็นโมเดลวิดีโอ AI แบบโอเพนซอร์สที่เพิ่งเปิดตัว ประมาณหนึ่งถึงสองสัปดาห์ก่อนหน้านี้ มีคุณภาพสูง เทียบชั้นได้กับ Sora 2.0 และ Sora 2.5
- ทาง ComfyUI ก็ปล่อยเวิร์กโฟลว์พร้อมตัวอย่างวิดีโอจำนวนมาก แต่ทุกแพลตฟอร์มยังต้องดาวน์โหลดโมเดลซึ่งมีขนาดใหญ่มาก แม้แต่เวอร์ชัน compact (FP8) หรือเวอร์ชัน pruned ก็ยังใหญ่
- การทดลองใช้บนเครื่องสเปกต่ำทำได้ยากเพราะต้องใช้ฮาร์ดแวร์และ VRAM เยอะ วิธีแก้คือใช้ Kaggle ซึ่งรองรับ VRAM ต่ำกว่า 16 กิกะไบต์ได้ฟรี
- เครื่องมือหลักคือ WanGP เฟรมเวิร์กสำหรับ GPU ความจำต่ำ ใช้สร้างวิดีโอ MiniMax H3 บน GPU ระดับล่างได้ผลลัพธ์ดี ใช้งานผ่านทั้งเว็บ UI และ SDK
- บน UI ตั้งค่าได้หลากหลาย เช่น LoRA (รวมถึง first-step LoRA) โมเดล 33B และ pruned 20B การเพิ่มโมเดลของตัวเอง (checkpoint, text encoder, VAE) ด้วยการดาวน์โหลดจาก Hugging Face แล้วระบุพาธในโฟลเดอร์ temp ของ Kaggle
- ตั้งค่าขนาด (เช่น 480) จำนวนเฟรม (5 หรือ 10 วินาที) และ inference steps ซึ่งค่าเริ่มต้นคือ 4 เพราะใช้ turbo LoRA จากนั้นกด generate ได้เลย
- ขั้นตอนติดตั้งใน Kaggle notebooks: ดาวน์โหลด WanGP ลงโฟลเดอร์หลัก ลง dependencies ดาวน์โหลดโมเดลสามตัวลง temp/minimax H3 แล้วเปิดใช้งาน
- ต้องใช้ Cloudflare tunnel (port 7860 ชี้ไป localhost) เพราะ Gradio หรือ ngrok ช้าเกินไปสำหรับการใช้งานผ่านเทอร์มินัล
- การใช้ SDK: ระบุโฟลเดอร์ WanGP ตั้งค่าพารามิเตอร์และ exporter settings ซึ่งสำคัญมากสำหรับกำหนดโมเดล จากนั้นส่งงาน (submit task) และดาวน์โหลดวิดีโอจากโฟลเดอร์ output

## ความเห็นสรุป

วิดีโอนี้เป็นคู่มือลงมือทำจริงที่ครบถ้วนสำหรับคนที่อยากลองโมเดลวิดีโอโอเพนซอร์สบนฮาร์ดแวร์จำกัด โดยไม่ต้องเสียเงินซื้อ GPU แรงๆ แม้คำบรรยายจะเป็นแบบอัตโนมัติและมีชื่อบางชื่อเพี้ยนไปบ้าง แต่เนื้อหาหลักคือแนวทางติดตั้งและใช้งาน WanGP บน Kaggle ยังเข้าใจได้ชัดเจน เหมาะสำหรับผู้ที่พอมีพื้นฐานการใช้ Kaggle และ ComfyUI อยู่บ้าง
02

คำแปลเต็ม

แปลตามบทสนทนาต้นฉบับ ปรับเป็นภาษาไทยธรรมชาติ

สวัสดีทุกคนครับ ยินดีต้อนรับสู่วิดีโอถัดไปของเรา ในบทช่วยสอนวันนี้ เราจะมาพูดถึง MiniMax H3 (โมเดลวิดีโอ AI ของ MiniMax) ที่เพิ่งเปิดตัวไปเมื่อประมาณหนึ่งถึงสองสัปดาห์ก่อนครับ

โมเดลนี้เป็นโมเดลวิดีโอที่ยอดเยี่ยมมากครับ เทียบชั้นได้กับ Sora 2.0 (โมเดลวิดีโอชื่อดัง) และแม้กระทั่ง Sora 2.5 เลยทีเดียว

มันสร้างวิดีโอคุณภาพสูงมากครับ อย่างที่เห็นได้จากเว็บไซต์เปิดตัวอย่างเป็นทางการ วิดีโอออกมาดูพรีเมียมมาก และเหมาะกับการใช้งานระดับโปรดักชันครับ

และถ้าดูที่ ComfyUI (เครื่องมือสร้างเวิร์กโฟลว์ AI) เขาก็ปล่อยเวิร์กโฟลว์ ComfyUI ออกมาด้วยเช่นกัน พร้อมกับตัวอย่างวิดีโอดีๆ จำนวนมากให้ดูครับ

ทุกตัวอย่างสุดยอดมากๆ ครับ แต่ปัญหาหนึ่งก็คือ ทุกแพลตฟอร์มที่ปล่อย MiniMax H3 ออกมา ยังต้องดาวน์โหลดโมเดลก่อนใช้งาน

ถึงแม้จะเป็นโอเพนซอร์ส แต่ตัวโมเดลใหญ่มากจริงๆ ครับ ถ้าดูที่รีโพ MiniMax H3 อย่างเป็นทางการ จะเห็นว่าโมเดลนี้ใหญ่โตมาก

และถ้าดูเวอร์ชัน compact (แบบกระชับ) ของทีม ComfyUI ซึ่งเป็นเวอร์ชัน FP8 (รูปแบบข้อมูลความแม่นยำต่ำ) รวมถึงเวอร์ชันอื่นๆ ที่เป็นเวอร์ชัน pruned (แบบตัดแต่งให้เล็กลง) ก็ยังใหญ่มากอยู่ดีครับ

ดังนั้นถ้าใครมีสเปกเครื่องระดับล่าง แล้วลองใช้ ComfyUI หรือโมเดลโอเพนซอร์ส ของ MiniMax เวอร์ชันทางการ ก็จะทดลองใช้งานได้ยากมากครับ

เพราะมันต้องการฮาร์ดแวร์และ VRAM (หน่วยความจำของการ์ดจอ) เยอะมากครับ ในบทช่วยสอนนี้ ผมจะพาทุกคนไปดูวิธีทำแบบนี้ได้ฟรีบน Kaggle

Kaggle เป็นแพลตฟอร์มทำโน้ตบุ๊ก AI ออนไลน์ ซึ่งรองรับ VRAM ต่ำ ที่น้อยกว่า 16 กิกะไบต์ครับ เอาล่ะ ถ้าอย่างนั้นเราไปเริ่มที่ Kaggle notebooks กันเลยครับ

เครื่องมือที่เราจะใช้กันวันนี้ชื่อว่า WanGP ครับ WanGP เป็นเฟรมเวิร์ก ที่ออกแบบมาสำหรับ GPU ความจำต่ำโดยเฉพาะ ดูรีโพ GitHub ได้เลยครับ

มันอยู่ภายใต้องค์กร Deep BiP MiP บน GitHub นะครับ โดย WanGP เป็นตัวสร้างวิดีโอ AI ที่เร็วสำหรับกลุ่ม GPU ระดับล่าง

ถ้าใครไม่มี GPU ระดับสูง ก็สามารถลองใช้ WanGP เพื่อรันบน GPU ระดับล่างได้ครับ ซึ่งก็ให้ผลลัพธ์ที่ดีมากเหมือนกัน

และที่เห็นอยู่นี้คือวิดีโอ MiniMax H3 ที่สร้างด้วย WanGP ครับ คุณภาพดีมากเลย และนี่คือเว็บ UI ของเครื่องมือ

เขายังมี SDK (ชุดเครื่องมือสำหรับนักพัฒนา) ให้ลองใช้ด้วย ซึ่งในวิดีโอนี้เราจะสาธิตวิธีใช้ SDK กันด้วยครับ

แต่ก่อนอื่น มาดูหน้าจอ UI แบบต่างๆ ของ WanGP กันก่อนครับ อย่างที่เห็น นี่คือวิดีโอที่สร้างจาก prompt (ข้อความคำสั่ง) แบบต่างๆ กัน

กดเล่นดูได้เลยครับ ว่าจะได้ผลลัพธ์แบบไหน "ถ้าคุณได้ยินผม ให้ส่งสัญญาณตามนี้" ครับ

เห็นไหมครับ วิดีโอนี้คุณภาพดีจริงๆ ลองเล่นอีกครั้งนะครับ "ถ้าคุณได้ยินผม ให้ส่งสัญญาณตามนี้"

จะเห็นว่าภาพลื่นไหลมากครับ ถึงแม้จะเป็นวิดีโอแค่ 5 วินาที แต่มันคือวิดีโอคุณภาพสูงจริงๆ

บน UI เราสามารถตั้งค่าพารามิเตอร์ต่างๆ ได้มากมายครับ เช่นลองใช้ LoRA (เทคนิคปรับแต่งโมเดล) ดูได้

ซึ่งตัวที่ว่าน่าจะเร็วที่สุดคือ first-step LoRA ครับ เรายังเลือกใช้โมเดลต่างๆ เพื่อปรับแต่งได้ด้วย เช่นโมเดล 33B และโมเดล pruned 20B

และยังเพิ่มโมเดลที่ปรับแต่งเองได้อีกด้วย ซึ่งเราทำไว้แล้วครับ แค่กดที่ไอคอนเพิ่ม แล้วใส่ checkpoint (จุดบันทึกโมเดล) หลัก รวมถึง text encoder (ตัวเข้ารหัสข้อความ) ลงไปครับ

ตรงนี้เขาปรับแต่งมาให้เรียบร้อยแล้ว เราไม่ต้องไปหาว่า ต้องดาวน์โหลดจากที่ไหนครับ

แค่ดาวน์โหลดจาก Hugging Face ตรงๆ แล้วใส่ไว้ในโฟลเดอร์ temp ของ Kaggle แล้ววางพาธตรงนี้ ซึ่งเป็นพาธในเครื่องของเราครับ

เราลองทั้งโมเดลหลัก text encoder และโมเดล VAE (ตัวเข้ารหัสอัตโนมัติ) ดูแล้วครับ ดาวน์โหลดทุกอย่างมาแล้ววางพาธไว้ตรงนี้ เรียบร้อยครับ

เราสามารถดาวน์โหลดโมเดลแล้ววางไว้ที่ไหนก็ได้บน WanGP มันจะโหลดได้โดยแค่ระบุพาธให้ถูกต้องเท่านั้นเองครับ

จากนั้นก็กำหนดขนาด (dimensions) ได้ครับ ในตัวอย่างนี้เราใช้ 480 คุณลองขนาดอื่นๆ ดูได้ และยังสลับจำนวนเฟรมสำหรับวิดีโอ 5 วินาทีได้ด้วย

หรือจะลอง 10 วินาทีก็ได้ครับ ถ้ามีเวลาหรือมี GPU ที่ดีกว่า แล้วก็เปลี่ยนจำนวน inference steps (รอบการสร้างภาพ) ได้

ค่าเริ่มต้นคือ 4 ครับ เพราะเราเลือกใช้ turbo LoRA (LoRA โหมดเร็ว) ไว้ แค่นั้นแหละครับ กด generate แล้วคุณจะได้วิดีโอสุดเจ๋งแบบนี้

อยากรู้วิธีติดตั้งทั้งหมดไหมครับ เราไปดูที่ Kaggle notebooks กันเลย

ใน Kaggle notebooks สิ่งที่ต้องทำก็แค่ดาวน์โหลด WanGP ไปไว้ในโฟลเดอร์หลัก ซึ่งก็คือโฟลเดอร์ทำงานของ Kaggle ที่เป็นโฟลเดอร์เริ่มต้นครับ

จากนั้นติดตั้ง dependencies (ไลบรารีที่ต้องใช้) ให้เรียบร้อย แล้วก็ดาวน์โหลดโมเดลไปไว้ที่ไหนก็ได้ตามต้องการครับ

พูดง่ายๆ คือดาวน์โหลดทุกอย่างลงในไดเรกทอรีภายในเครื่องครับ จะเห็นว่าอยู่ใต้โฟลเดอร์ temp/minimax H3

ซึ่งเป็นโมเดลทั้งสามตัวที่พูดถึงก่อนหน้านี้ครับ จากนั้นก็เปิดใช้งานได้เลย

สำคัญมากครับ ต้องรันบน Cloudflare เพราะเครื่องมืออื่นอย่าง Gradio หรือ ngrok นั้นช้ามากสำหรับการใช้งานผ่านเทอร์มินัล ส่วน Cloudflare นั้นทำงานได้ดีมาก

รันคำสั่งนี้เพื่อสตาร์ท WanGP ขึ้นที่แบ็กเอนด์ครับ ซึ่งจะรันอยู่บน port 7860 จากนั้นดาวน์โหลด Cloudflare tunnel แล้วเปิดอุโมงค์ชี้ไปที่ localhost 7860 ครับ

พอทุกอย่างรันเรียบร้อยแล้ว เราก็จะเห็นอินเทอร์เฟซแบบที่เห็นเมื่อกี้ และแค่ใส่ prompt ก็สร้างวิดีโอได้เลยครับ

ส่วนการใช้งาน SDK ตามที่พูดถึงก่อนหน้านี้ WanGP รองรับการพัฒนาแบบ Python SDK ครับ ทำได้ประมาณนี้

ก็คือระบุโฟลเดอร์ WanGP ของคุณก่อน จากนั้นก็ใส่พารามิเตอร์ต่างๆ ของ WanGP เข้าไป รวมถึง exporter settings ด้วยครับ

ส่วนนี้สำคัญมากครับ มันคือการตั้งค่าที่ใช้กำหนดโมเดล ตัวอย่างเช่น เราสามารถดาวน์โหลดโมเดลจาก export settings ตรงนี้ได้

แล้วส่งออกการตั้งค่านั้นไปยังเครื่อง local (เครื่องภายใน) แล้วใช้ SDK อ่านค่าการตั้งค่านั้นมาครับ

แค่นั้นแหละครับ จากนั้นก็ส่งงาน (submit task) ด้วยการตั้งค่านี้ แล้วก็เริ่มสร้างวิดีโอได้เลย

ดาวน์โหลดผลลัพธ์ได้จากโฟลเดอร์ output ครับ พอวิดีโอสร้างเสร็จ มันจะอยู่ในโฟลเดอร์ output และดูได้จาก video path ซึ่งก็คือชื่อไฟล์วิดีโอนั่นเองครับ

และนี่คือวิธีสร้างวิดีโอ MiniMax H3 ฟรีบนฮาร์ดแวร์ของ Kaggle ครับ

หวังว่าคลิปนี้จะเป็นประโยชน์นะครับ ถ้าชอบวิดีโอนี้ ช่วยกด subscribe กดไลก์ หรือคอมเมนต์กันด้วยนะครับ

ถ้ามีคำถามอะไรก็ถามได้เลยครับ ขอบคุณมากที่สนับสนุนช่อง และแล้วเจอกันใหม่ในวิดีโอหน้านะครับ

03

หมายเหตุการแปล

ความโปร่งใสเกี่ยวกับความไม่แน่นอนในต้นฉบับ

  • ## จุดที่ ASR เพี้ยนและการตัดสินใจ (ไม่มี [ฟังไม่ชัด] ค้างอยู่ในบทแปล)
  • | Deep BiP MiP organization | ชื่อองค์กรบน GitHub (ASR ไม่ชัด) | คงชื่อตามที่ได้ยินไว้ และระบุไว้ในอภิธานว่าไม่แน่ใจ |
  • | Kaggle's LaViola hardware | ฮาร์ดแวร์ของ Kaggle (ASR ไม่ชัด) | แปลแบบกลางๆ เป็น "ฮาร์ดแวร์ของ Kaggle" โดยไม่เดาชื่อเฉพาะ |
  • ## จุดที่ยังไม่ชัดเจน
04

อภิธานศัพท์เทคนิค

คำศัพท์และชื่อผลิตภัณฑ์ที่คงรูปภาษาอังกฤษ

ศัพท์คำแปล / คำอธิบาย
MiniMax H3โมเดลวิดีโอ AI แบบโอเพนซอร์สของ MiniMax (ในคำบรรยายต้นฉบับ ASR อ่านเป็น "SD3" ในช่วงแรก)
Seedance 2.5โมเดลวิดีโอคู่แข่งที่กล่าวถึงในชื่อวิดีโอ
Sora 2.0 / Sora 2.5โมเดลวิดีโอที่ใช้เทียบเคียงคุณภาพ (ในคำบรรยาย ASR อ่านเป็น "Sit Down")
WanGPเฟรมเวิร์กสำหรับ GPU ความจำต่ำ ใช้สร้างวิดีโอ AI บน GPU ระดับล่าง (ASR อ่านเป็น "1GP"/"1 2 GP"/"W GP")
ComfyUIเครื่องมือสร้างเวิร์กโฟลว์ AI แบบโหนด
VRAMหน่วยความจำของการ์ดจอ ใช้เก็บข้อมูลโมเดลระหว่างการประมวลผล
Kaggleแพลตฟอร์มทำโน้ตบุ๊ก AI ออนไลน์ ให้ใช้ GPU ฟรี
FP8รูปแบบข้อมูลความแม่นยำต่ำ ใช้ลดขนาดโมเดล
pruned (version)เวอร์ชันที่ตัดแต่งให้เล็กลง (ASR อ่านเป็น "prone")
compact versionเวอร์ชันกระชับ ขนาดไฟล์เล็กลง
open sourceโอเพนซอร์ส ซอร์สโค้ดเปิดให้ใช้ฟรี
checkpointจุดบันทึกโมเดลที่เทรนไว้แล้ว
text encoderตัวเข้ารหัสข้อความ เปลี่ยน prompt เป็นค่าที่โมเดลเข้าใจ
VAEตัวเข้ารหัสอัตโนมัติ (Variational Autoencoder)
LoRAเทคนิคปรับแต่งโมเดลโดยใช้ไฟล์ขนาดเล็ก
first-step LoRALoRA ที่ประมวลผลเร็วที่สุด ใช้ขั้นตอนน้อย
turbo LoRALoRA โหมดเร็ว ทำให้ใช้ inference steps เพียง 4 ขั้น (ASR อ่านเป็น "turbo learning")
inference stepsจำนวนรอบการสร้างภาพ ยิ่งมากยิ่งละเอียดแต่ช้าลง
promptข้อความคำสั่งที่ใช้บอกโมเดลว่าต้องการวิดีโอแบบไหน
dimensionsขนาดความละเอียดของวิดีโอ เช่น 480
frameเฟรม ภาพนิ่งหนึ่งภาพในวิดีโอ จำนวนเฟรมกำหนดความยาววิดีโอ
SDKชุดเครื่องมือสำหรับนักพัฒนา ใช้เขียนโค้ดควบคุม WanGP
UIอินเทอร์เฟซผู้ใช้ หน้าจอสำหรับสั่งงาน
exporter settingsการตั้งค่าที่ใช้กำหนดโมเดลและส่งออกค่าให้ SDK อ่าน
submit taskการส่งงาน/คำสั่งให้โมเดลสร้างวิดีโอ
output folderโฟลเดอร์เก็บผลลัพธ์วิดีโอที่สร้างเสร็จ
video pathพาธ/ตำแหน่งไฟล์วิดีโอที่สร้างเสร็จ
local pathพาธในเครื่องท้องถิ่น
Kaggle working folderโฟลเดอร์ทำงานเริ่มต้นของ Kaggle
temp folderโฟลเดอร์ชั่วคราว (ASR อ่านเป็น "time folder") ใช้เก็บโมเดลที่ดาวน์โหลด
dependenciesไลบรารี/แพ็กเกจที่ต้องติดตั้งก่อนรัน
Hugging Faceแพลตฟอร์มโฮสต์โมเดล AI สำหรับดาวน์โหลดโมเดล
GitHub repoที่เก็บโค้ดบน GitHub
Deep BiP MiPชื่อองค์กรบน GitHub ที่โฮสต์ WanGP (ASR ไม่ชัด อาจเพี้ยนจากชื่อจริง)
Cloudflare tunnelอุโมงค์เชื่อมต่อ Cloudflare ใช้เปิดหน้า UI สู่ภายนอก
ngrokเครื่องมือทำ tunnel อีกตัว (ASR อ่านเป็น "Engrok")
Gradioไลบรารีสร้าง UI สำหรับโมเดล ML
localhost 7860ที่อยู่เครื่องตัวเอง พอร์ต 7860 ที่ WanGP รันอยู่
terminalเทอร์มินัล หน้าต่างคำสั่ง
backendแบ็กเอนด์ ส่วนประมวลผลที่รันอยู่เบื้องหลัง
open source competitorคู่แข่งโอเพนซอร์สของโมเดลเชิงพาณิชย์
production usageการใช้งานระดับโปรดักชัน/เชิงพาณิชย์จริง
05

ซับไตเติ้ลภาษาไทย

ดาวน์โหลดหรือดูซับทั้งหมด

1
00:00:00,000 --> 00:00:01,335
สวัสดีทุกคนครับ

2
00:00:01,335 --> 00:00:04,182
ยินดีต้อนรับสู่วิดีโอถัดไปของเรา

3
00:00:04,182 --> 00:00:07,920
ในบทช่วยสอนวันนี้ เราจะมาพูดถึง MiniMax H3

4
00:00:07,920 --> 00:00:10,411
(โมเดลวิดีโอ AI ของ MiniMax)
thai-subtitles.srt
SubRip — ใช้กับเครื่องเล่นวิดีโอส่วนใหญ่
↓ ดาวน์โหลด
thai-subtitles.vtt
WebVTT — ใช้กับเว็บ / YouTube
↓ ดาวน์โหลด
เปิดดูซับไตเติ้ลทั้งหมด (145 segments)
1
00:00:00,000 --> 00:00:01,335
สวัสดีทุกคนครับ

2
00:00:01,335 --> 00:00:04,182
ยินดีต้อนรับสู่วิดีโอถัดไปของเรา

3
00:00:04,182 --> 00:00:07,920
ในบทช่วยสอนวันนี้ เราจะมาพูดถึง MiniMax H3

4
00:00:07,920 --> 00:00:10,411
(โมเดลวิดีโอ AI ของ MiniMax)

5
00:00:10,411 --> 00:00:15,216
ที่เพิ่งเปิดตัวไปเมื่อประมาณหนึ่งถึงสองสัปดาห์ก่อนครับ

6
00:00:15,216 --> 00:00:18,954
โมเดลนี้เป็นโมเดลวิดีโอที่ยอดเยี่ยมมากครับ

7
00:00:18,954 --> 00:00:22,958
เทียบชั้นได้กับ Sora 2.0 (โมเดลวิดีโอชื่อดัง)

8
00:00:22,958 --> 00:00:25,895
และแม้กระทั่ง Sora 2.5 เลยทีเดียว

9
00:00:25,895 --> 00:00:28,564
มันสร้างวิดีโอคุณภาพสูงมากครับ

10
00:00:28,564 --> 00:00:32,835
อย่างที่เห็นได้จากเว็บไซต์เปิดตัวอย่างเป็นทางการ

11
00:00:32,835 --> 00:00:34,971
วิดีโอออกมาดูพรีเมียมมาก

12
00:00:34,971 --> 00:00:38,352
และเหมาะกับการใช้งานระดับโปรดักชันครับ

13
00:00:38,352 --> 00:00:40,043
และถ้าดูที่ ComfyUI

14
00:00:40,043 --> 00:00:42,802
(เครื่องมือสร้างเวิร์กโฟลว์ AI)

15
00:00:42,802 --> 00:00:46,895
เขาก็ปล่อยเวิร์กโฟลว์ ComfyUI ออกมาด้วยเช่นกัน

16
00:00:46,895 --> 00:00:49,119
พร้อมกับตัวอย่างวิดีโอดีๆ

17
00:00:49,119 --> 00:00:53,035
จำนวนมากให้ดูครับ ทุกตัวอย่างสุดยอดมากๆ ครับ

18
00:00:53,035 --> 00:00:56,505
แต่ปัญหาหนึ่งก็คือ ทุกแพลตฟอร์มที่ปล่อย

19
00:00:56,505 --> 00:00:57,929
MiniMax H3 ออกมา

20
00:00:57,929 --> 00:01:00,687
ยังต้องดาวน์โหลดโมเดลก่อนใช้งาน

21
00:01:00,687 --> 00:01:04,781
ถึงแม้จะเป็นโอเพนซอร์ส แต่ตัวโมเดลใหญ่มากจริงๆ

22
00:01:04,781 --> 00:01:08,696
ครับ ถ้าดูที่รีโพ MiniMax H3 อย่างเป็นทางการ

23
00:01:08,696 --> 00:01:12,522
จะเห็นว่าโมเดลนี้ใหญ่โตมาก และถ้าดูเวอร์ชัน

24
00:01:12,522 --> 00:01:15,548
compact (แบบกระชับ) ของทีม ComfyUI

25
00:01:15,548 --> 00:01:17,328
ซึ่งเป็นเวอร์ชัน FP8

26
00:01:17,328 --> 00:01:19,730
(รูปแบบข้อมูลความแม่นยำต่ำ)

27
00:01:19,730 --> 00:01:23,468
รวมถึงเวอร์ชันอื่นๆ ที่เป็นเวอร์ชัน pruned

28
00:01:23,468 --> 00:01:27,383
(แบบตัดแต่งให้เล็กลง) ก็ยังใหญ่มากอยู่ดีครับ

29
00:01:27,383 --> 00:01:31,476
ดังนั้นถ้าใครมีสเปกเครื่องระดับล่าง แล้วลองใช้

30
00:01:31,476 --> 00:01:34,947
ComfyUI หรือโมเดลโอเพนซอร์ส ของ MiniMax

31
00:01:34,947 --> 00:01:38,773
เวอร์ชันทางการ ก็จะทดลองใช้งานได้ยากมากครับ

32
00:01:38,773 --> 00:01:41,620
เพราะมันต้องการฮาร์ดแวร์และ VRAM

33
00:01:41,620 --> 00:01:44,735
(หน่วยความจำของการ์ดจอ) เยอะมากครับ

34
00:01:44,735 --> 00:01:45,981
ในบทช่วยสอนนี้

35
00:01:45,981 --> 00:01:49,718
ผมจะพาทุกคนไปดูวิธีทำแบบนี้ได้ฟรีบน Kaggle

36
00:01:49,718 --> 00:01:53,366
Kaggle เป็นแพลตฟอร์มทำโน้ตบุ๊ก AI ออนไลน์

37
00:01:53,366 --> 00:01:56,392
ซึ่งรองรับ VRAM ต่ำ ที่น้อยกว่า 16

38
00:01:56,392 --> 00:02:00,396
กิกะไบต์ครับ เอาล่ะ ถ้าอย่างนั้นเราไปเริ่มที่

39
00:02:00,396 --> 00:02:02,799
Kaggle notebooks กันเลยครับ

40
00:02:02,799 --> 00:02:06,625
เครื่องมือที่เราจะใช้กันวันนี้ชื่อว่า WanGP

41
00:02:06,625 --> 00:02:10,451
ครับ WanGP เป็นเฟรมเวิร์ก ที่ออกแบบมาสำหรับ

42
00:02:10,451 --> 00:02:14,545
GPU ความจำต่ำโดยเฉพาะ ดูรีโพ GitHub ได้เลยครับ

43
00:02:14,545 --> 00:02:18,282
มันอยู่ภายใต้องค์กร Deep BiP MiP บน GitHub

44
00:02:18,282 --> 00:02:21,663
นะครับ โดย WanGP เป็นตัวสร้างวิดีโอ AI

45
00:02:21,663 --> 00:02:25,579
ที่เร็วสำหรับกลุ่ม GPU ระดับล่าง ถ้าใครไม่มี

46
00:02:25,579 --> 00:02:29,494
GPU ระดับสูง ก็สามารถลองใช้ WanGP เพื่อรันบน

47
00:02:29,494 --> 00:02:31,274
GPU ระดับล่างได้ครับ

48
00:02:31,274 --> 00:02:34,210
ซึ่งก็ให้ผลลัพธ์ที่ดีมากเหมือนกัน

49
00:02:34,210 --> 00:02:37,503
และที่เห็นอยู่นี้คือวิดีโอ MiniMax H3

50
00:02:37,503 --> 00:02:40,884
ที่สร้างด้วย WanGP ครับ คุณภาพดีมากเลย

51
00:02:40,884 --> 00:02:44,710
และนี่คือเว็บ UI ของเครื่องมือ เขายังมี SDK

52
00:02:44,710 --> 00:02:48,537
(ชุดเครื่องมือสำหรับนักพัฒนา) ให้ลองใช้ด้วย

53
00:02:48,537 --> 00:02:51,740
ซึ่งในวิดีโอนี้เราจะสาธิตวิธีใช้ SDK

54
00:02:51,740 --> 00:02:55,834
กันด้วยครับ แต่ก่อนอื่น มาดูหน้าจอ UI แบบต่างๆ

55
00:02:55,834 --> 00:03:03,842
ของ WanGP กันก่อนครับ อย่างที่เห็น นี่คือวิดีโอที่สร้างจาก prompt (ข้อความคำสั่ง) แบบต่างๆ

56
00:03:03,842 --> 00:03:07,757
กัน กดเล่นดูได้เลยครับ ว่าจะได้ผลลัพธ์แบบไหน

57
00:03:07,757 --> 00:03:11,317
"ถ้าคุณได้ยินผม ให้ส่งสัญญาณตามนี้" ครับ

58
00:03:11,317 --> 00:03:14,342
เห็นไหมครับ วิดีโอนี้คุณภาพดีจริงๆ

59
00:03:14,342 --> 00:03:17,635
ลองเล่นอีกครั้งนะครับ "ถ้าคุณได้ยินผม

60
00:03:17,635 --> 00:03:21,728
ให้ส่งสัญญาณตามนี้" จะเห็นว่าภาพลื่นไหลมากครับ

61
00:03:21,728 --> 00:03:24,398
ถึงแม้จะเป็นวิดีโอแค่ 5 วินาที

62
00:03:24,398 --> 00:03:26,978
แต่มันคือวิดีโอคุณภาพสูงจริงๆ

63
00:03:26,978 --> 00:03:30,360
บน UI เราสามารถตั้งค่าพารามิเตอร์ต่างๆ

64
00:03:30,360 --> 00:03:32,940
ได้มากมายครับ เช่นลองใช้ LoRA

65
00:03:32,940 --> 00:03:35,343
(เทคนิคปรับแต่งโมเดล) ดูได้

66
00:03:35,343 --> 00:03:39,080
ซึ่งตัวที่ว่าน่าจะเร็วที่สุดคือ first-step

67
00:03:39,080 --> 00:03:42,105
LoRA ครับ เรายังเลือกใช้โมเดลต่างๆ

68
00:03:42,105 --> 00:03:45,932
เพื่อปรับแต่งได้ด้วย เช่นโมเดล 33B และโมเดล

69
00:03:45,932 --> 00:03:47,029
pruned 20B

70
00:03:47,029 --> 00:03:50,588
และยังเพิ่มโมเดลที่ปรับแต่งเองได้อีกด้วย

71
00:03:50,588 --> 00:03:54,059
ซึ่งเราทำไว้แล้วครับ แค่กดที่ไอคอนเพิ่ม

72
00:03:54,059 --> 00:03:57,618
แล้วใส่ checkpoint (จุดบันทึกโมเดล) หลัก

73
00:03:57,618 --> 00:04:01,177
รวมถึง text encoder (ตัวเข้ารหัสข้อความ)

74
00:04:01,177 --> 00:04:05,093
ลงไปครับ ตรงนี้เขาปรับแต่งมาให้เรียบร้อยแล้ว

75
00:04:05,093 --> 00:04:09,008
เราไม่ต้องไปหาว่า ต้องดาวน์โหลดจากที่ไหนครับ

76
00:04:09,008 --> 00:04:11,945
แค่ดาวน์โหลดจาก Hugging Face ตรงๆ

77
00:04:11,945 --> 00:04:15,148
แล้วใส่ไว้ในโฟลเดอร์ temp ของ Kaggle

78
00:04:15,148 --> 00:04:16,572
แล้ววางพาธตรงนี้

79
00:04:16,572 --> 00:04:19,241
ซึ่งเป็นพาธในเครื่องของเราครับ

80
00:04:19,241 --> 00:04:23,246
เราลองทั้งโมเดลหลัก text encoder และโมเดล VAE

81
00:04:23,246 --> 00:04:26,182
(ตัวเข้ารหัสอัตโนมัติ) ดูแล้วครับ

82
00:04:26,182 --> 00:04:29,564
ดาวน์โหลดทุกอย่างมาแล้ววางพาธไว้ตรงนี้

83
00:04:29,564 --> 00:04:30,720
เรียบร้อยครับ

84
00:04:30,720 --> 00:04:34,814
เราสามารถดาวน์โหลดโมเดลแล้ววางไว้ที่ไหนก็ได้บน

85
00:04:34,814 --> 00:04:35,911
WanGP

86
00:04:35,911 --> 00:04:40,360
มันจะโหลดได้โดยแค่ระบุพาธให้ถูกต้องเท่านั้นเองครับ

87
00:04:40,360 --> 00:04:43,830
จากนั้นก็กำหนดขนาด (dimensions) ได้ครับ

88
00:04:43,830 --> 00:04:47,835
ในตัวอย่างนี้เราใช้ 480 คุณลองขนาดอื่นๆ ดูได้

89
00:04:47,835 --> 00:04:50,771
และยังสลับจำนวนเฟรมสำหรับวิดีโอ 5

90
00:04:50,771 --> 00:04:54,509
วินาทีได้ด้วย หรือจะลอง 10 วินาทีก็ได้ครับ

91
00:04:54,509 --> 00:04:57,089
ถ้ามีเวลาหรือมี GPU ที่ดีกว่า

92
00:04:57,089 --> 00:05:00,115
แล้วก็เปลี่ยนจำนวน inference steps

93
00:05:00,115 --> 00:05:03,852
(รอบการสร้างภาพ) ได้ ค่าเริ่มต้นคือ 4 ครับ

94
00:05:03,852 --> 00:05:07,678
เพราะเราเลือกใช้ turbo LoRA (LoRA โหมดเร็ว)

95
00:05:07,678 --> 00:05:10,437
ไว้ แค่นั้นแหละครับ กด generate

96
00:05:10,437 --> 00:05:13,195
แล้วคุณจะได้วิดีโอสุดเจ๋งแบบนี้

97
00:05:13,195 --> 00:05:17,022
อยากรู้วิธีติดตั้งทั้งหมดไหมครับ เราไปดูที่

98
00:05:17,022 --> 00:05:20,848
Kaggle notebooks กันเลย ใน Kaggle notebooks

99
00:05:20,848 --> 00:05:23,784
สิ่งที่ต้องทำก็แค่ดาวน์โหลด WanGP

100
00:05:23,784 --> 00:05:27,789
ไปไว้ในโฟลเดอร์หลัก ซึ่งก็คือโฟลเดอร์ทำงานของ

101
00:05:27,789 --> 00:05:30,814
Kaggle ที่เป็นโฟลเดอร์เริ่มต้นครับ

102
00:05:30,814 --> 00:05:33,217
จากนั้นติดตั้ง dependencies

103
00:05:33,217 --> 00:05:36,064
(ไลบรารีที่ต้องใช้) ให้เรียบร้อย

104
00:05:36,064 --> 00:05:40,514
แล้วก็ดาวน์โหลดโมเดลไปไว้ที่ไหนก็ได้ตามต้องการครับ

105
00:05:40,514 --> 00:05:41,611
พูดง่ายๆ

106
00:05:41,611 --> 00:05:45,971
คือดาวน์โหลดทุกอย่างลงในไดเรกทอรีภายในเครื่องครับ

107
00:05:45,971 --> 00:05:49,530
จะเห็นว่าอยู่ใต้โฟลเดอร์ temp/minimax H3

108
00:05:49,530 --> 00:05:53,713
ซึ่งเป็นโมเดลทั้งสามตัวที่พูดถึงก่อนหน้านี้ครับ

109
00:05:53,713 --> 00:05:57,094
จากนั้นก็เปิดใช้งานได้เลย สำคัญมากครับ

110
00:05:57,094 --> 00:06:01,098
ต้องรันบน Cloudflare เพราะเครื่องมืออื่นอย่าง

111
00:06:01,098 --> 00:06:02,611
Gradio หรือ ngrok

112
00:06:02,611 --> 00:06:06,526
นั้นช้ามากสำหรับการใช้งานผ่านเทอร์มินัล ส่วน

113
00:06:06,526 --> 00:06:09,018
Cloudflare นั้นทำงานได้ดีมาก

114
00:06:09,018 --> 00:06:11,598
รันคำสั่งนี้เพื่อสตาร์ท WanGP

115
00:06:11,598 --> 00:06:15,692
ขึ้นที่แบ็กเอนด์ครับ ซึ่งจะรันอยู่บน port 7860

116
00:06:15,692 --> 00:06:18,717
จากนั้นดาวน์โหลด Cloudflare tunnel

117
00:06:18,717 --> 00:06:22,544
แล้วเปิดอุโมงค์ชี้ไปที่ localhost 7860 ครับ

118
00:06:22,544 --> 00:06:24,857
พอทุกอย่างรันเรียบร้อยแล้ว

119
00:06:24,857 --> 00:06:28,417
เราก็จะเห็นอินเทอร์เฟซแบบที่เห็นเมื่อกี้

120
00:06:28,417 --> 00:06:31,976
และแค่ใส่ prompt ก็สร้างวิดีโอได้เลยครับ

121
00:06:31,976 --> 00:06:35,624
ส่วนการใช้งาน SDK ตามที่พูดถึงก่อนหน้านี้

122
00:06:35,624 --> 00:06:39,095
WanGP รองรับการพัฒนาแบบ Python SDK ครับ

123
00:06:39,095 --> 00:06:42,476
ทำได้ประมาณนี้ ก็คือระบุโฟลเดอร์ WanGP

124
00:06:42,476 --> 00:06:46,302
ของคุณก่อน จากนั้นก็ใส่พารามิเตอร์ต่างๆ ของ

125
00:06:46,302 --> 00:06:50,396
WanGP เข้าไป รวมถึง exporter settings ด้วยครับ

126
00:06:50,396 --> 00:06:52,086
ส่วนนี้สำคัญมากครับ

127
00:06:52,086 --> 00:06:56,091
มันคือการตั้งค่าที่ใช้กำหนดโมเดล ตัวอย่างเช่น

128
00:06:56,091 --> 00:06:59,828
เราสามารถดาวน์โหลดโมเดลจาก export settings

129
00:06:59,828 --> 00:07:03,921
ตรงนี้ได้ แล้วส่งออกการตั้งค่านั้นไปยังเครื่อง

130
00:07:03,921 --> 00:07:06,769
local (เครื่องภายใน) แล้วใช้ SDK

131
00:07:06,769 --> 00:07:10,595
อ่านค่าการตั้งค่านั้นมาครับ แค่นั้นแหละครับ

132
00:07:10,595 --> 00:07:13,176
จากนั้นก็ส่งงาน (submit task)

133
00:07:13,176 --> 00:07:17,269
ด้วยการตั้งค่านี้ แล้วก็เริ่มสร้างวิดีโอได้เลย

134
00:07:17,269 --> 00:07:21,006
ดาวน์โหลดผลลัพธ์ได้จากโฟลเดอร์ output ครับ

135
00:07:21,006 --> 00:07:25,011
พอวิดีโอสร้างเสร็จ มันจะอยู่ในโฟลเดอร์ output

136
00:07:25,011 --> 00:07:26,968
และดูได้จาก video path

137
00:07:26,968 --> 00:07:29,994
ซึ่งก็คือชื่อไฟล์วิดีโอนั่นเองครับ

138
00:07:29,994 --> 00:07:33,108
และนี่คือวิธีสร้างวิดีโอ MiniMax H3

139
00:07:33,108 --> 00:07:35,689
ฟรีบนฮาร์ดแวร์ของ Kaggle ครับ

140
00:07:35,689 --> 00:07:38,714
หวังว่าคลิปนี้จะเป็นประโยชน์นะครับ

141
00:07:38,714 --> 00:07:42,185
ถ้าชอบวิดีโอนี้ ช่วยกด subscribe กดไลก์

142
00:07:42,185 --> 00:07:44,409
หรือคอมเมนต์กันด้วยนะครับ

143
00:07:44,409 --> 00:07:46,990
ถ้ามีคำถามอะไรก็ถามได้เลยครับ

144
00:07:46,990 --> 00:07:49,126
ขอบคุณมากที่สนับสนุนช่อง

145
00:07:49,126 --> 00:07:52,240
และแล้วเจอกันใหม่ในวิดีโอหน้านะครับ