▶SUBTHAIแปลไทย · ซับ · พากย์⚙
บทความแปลภาษาไทย · YouTube

AI Royal Rumble: Part 2 (Kimi K3 v. Fable v. Sol v. Grok v. GLM)

0:000:00
เล่นเสียงต้นฉบับของวิดีโอ พร้อมแสดงซับไทยซิงก์ตามเวลา
กำลังโหลดวิดีโอ…
01

สรุปย่อ

ประเด็นสำคัญจากวิดีโอ

- **ช่อง:** Tonbi's AI Garage · **ความยาว:** ~38 นาที · **ลิงก์:** https://www.youtube.com/watch?v=J934tcOdTXg

# สรุป: AI Royal Rumble: Part 2 (Kimi K3 v. Fable v. Sol v. Grok v. GLM)

- **ช่อง:** Tonbi's AI Garage · **ความยาว:** ~38 นาที · **ลิงก์:** https://www.youtube.com/watch?v=J934tcOdTXg

## ประเด็นหลัก

- ภาคสองของการแข่งขัน AI Royal Rumble เดือนกรกฎาคม 2026 ครอบคลุมรอบที่สามและรอบชิงชนะเลิศ หลังจากรอบหนึ่งและรอบสองได้ตัด GLM 5.2 และ Grok 4.5 ออกไปแล้ว
- รอบที่สามเป็นการพัฒนาเกม โดยใช้ Hermes Agent รันโมเดลที่เหลือสามตัว (Fable, Sol, Kimi K3) ให้สร้างเกมจาก prompt เดียวกันแล้วนำมาเปรียบเทียบกัน
- ผลงานรอบสาม: Fable สร้างเกม Curtain Call ที่มีธีมการแสดงละคร Sol สร้างเกม Afterimage Station และ Kimi K3 สร้างเกม signal ที่มีกลไก sandbox และฟิวส์
- Kimi K3 ถูกคัดออกในรอบสาม เนื่องจากคุณภาพภาพดูต่ำกว่าเล็กน้อย และใช้เวลานานกว่า (3 ชั่วโมงเทียบกับ 22 นาทีของ Sol)
- รอบชิงชนะเลิศเป็นการแข่งขันระหว่าง Fable (Anthropic) กับ Sol (OpenAI) ในงานฝึก LoRA fine-tuning adapter สำหรับโมเดลวิดีโอ LTX 2.3 บนเครื่อง NVIDIA DGX Spark
- โจทย์รอบชิงคือให้โมเดลฝึก LoRA อิงจากภาพยนตร์ silent cinema ยุคแรกเริ่ม เช่น The Great Train Robbery และ A Trip Down Market Street ที่เป็น public domain
- Fable ใช้เวลาฝึก 4.37 ชั่วโมง ส่วน Sol เร็วกว่ามากที่ 2.5 ชั่วโมง
- มีการทดสอบผลลัพธ์ด้วย 3 prompt: คนเดินบนบอร์ดวอล์ก, เครื่องบินบินเหนือภูเขา, และการยิงปะทะกันในอวกาศ
- Fable สามารถถ่ายทอดสไตล์ silent cinema ได้ดีกว่า โดยเฉพาะเม็ดฟิล์ม การกระพริบของภาพ และรายละเอียดอย่างเครื่องบินใบพัดที่เป็นยุคนั้นจริง ๆ
- ผู้ชนะของ AI Royal Rumble เดือนกรกฎาคม 2026 คือ Fable 5 จาก Anthropic ครับ
- พิธีกรอาจจะจัดการแข่งขันอีกครั้งในปลายเดือนสิงหาคม หากมีโมเดลใหม่ ๆ ออกมา เช่น Grok รุ่นใหม่, GPT 6, Fable 5.1 หรือโมเดล open weights ใหม่ ๆ

## ความเห็นสรุป

เป็นการแข่งขันที่สนุกและเข้าถึงจุดที่ผู้ชนะตัวจริงคือโมเดลที่ความสามารถสูงระดับแนวหน้าอย่าง Fable จาก Anthropic โดยเฉพาะในงานยาก ๆ อย่างการฝึก LoRA สำหรับวิดีโอ Fable แม้จะช้ากว่า แต่คุณภาพการถ่ายทอดสไตล์และความเข้ากับยุคสมัยของภาพยนตร์ต้นฉบับนั้นอยู่ในระดับที่น่าประทับใจ ส่วน Sol ถือเป็นโมเดลที่น่าจับตามองสำหรับการใช้งานจริงเพราะเร็วและมีคุณภาพใกล้เคียง ผมรอติดตามการแข่งขันครั้งต่อไปในเดือนสิงหาคมครับ
02

คำแปลเต็ม

แปลตามบทสนทนาต้นฉบับ ปรับเป็นภาษาไทยธรรมชาติ

ยินดีต้อนรับกลับมาสู่ภาคสองของ AI Royal Rumble เดือนกรกฎาคม 2026 ที่เราจะมาตัดสินกันให้รู้แล้วรู้รอดว่าโมเดลระดับ frontier ตัวไหนคือที่สุด ถ้าใครดูภาคนี้ก่อน ก็อยากให้ย้อนไปดูภาคหนึ่งเพื่อดูว่าสองรอบแรกเกิดอะไรขึ้นบ้าง เพราะภาคนี้จะเป็นรอบที่สามและรอบที่สี่ก่อนที่เราจะมอบมงกุฎให้ผู้ชนะเด็ดขาดครับ

พอสรุปแล้ว รอบแรกเป็นโปรเจกต์ทำ landing page ที่ใช้ typography และ motion แบบเฉพาะตัว เป็น landing page ที่วิวัฒนาการไปเรื่อย ๆ ตอนที่เลื่อนจอลง ทุกโมเดลทำได้ดีมากแม้งานจะยาก แต่สุดท้ายผู้แพ้ของรอบแรกคือ GLM 5.2 ที่ถูกตัดออก เป็นโมเดลเดียวที่ output เพี้ยน คือไม่ทำงานเลยครับ

จากนั้นเราก็เข้าสู่รอบสอง เป็นการทดสอบเทรดดิ้งที่ agent ต้องค้นคว้า ออกแบบกลยุทธ์การเทรด และเขียน paper trader (โปรแกรมจำลองการเทรด) ให้ทำตามกลยุทธ์นั้นไปตามเวลา พอลองรันจริง โมเดลที่ทำได้แย่ที่สุดคือ Grok 4.5 จึงถูกตัดออกจากการแข่งขัน เจ้าตัวรับความเสี่ยงสูงที่สุด ทำการเทรดเยอะกว่าโมเดลอื่นเยอะมาก และก็เร็วกว่าด้วย แต่สุดท้ายผล P&L (กำไรขาดทุน) ติดลบประมาณ 12% ครับ Grok 4.5 จึงถูกคัดออกในรอบสอง

ถึงตรงนี้เราก็เข้าสู่รอบสาม และนี่คือสถานการณ์ปัจจุบัน โดยที่ Fable, GPT 5.6, Sol และ Kimi K3 เป็นสามโมเดลสุดท้ายที่ยังเหลืออยู่ รอบสามจะเป็นการพัฒนาเกม น่าจะสนุกและน่าสนใจดีครับ

จากนั้นในรอบชิงชนะเลิศ สองโมเดลสุดท้ายจะได้ทำงานฝึกโมเดล คือต้องฝึก fine-tuning adapter ที่เรียกว่า LoRA บนเครื่อง DGX Spark ของผมเอง สำหรับโมเดลสร้างวิดีโอ ซึ่งผมเองก็ไม่เคยทำมาก่อน จะทำได้หรือเปล่าก็ไม่รู้ แต่เราจะมาดูความเป็นไปได้ไปด้วยกันครับ เริ่มกันเลย

ถ้าใครเองก็รัน agent และอยากเข้าถึง LM wikis (คลังความรู้เกี่ยวกับโมเดลภาษา) ที่ผมใช้ค้นคว้าและสร้างวิดีโอเหล่านี้จริง ๆ ก็แวะดูโปรเจกต์ agentwikis.com ของผมได้เลยครับ ผมแชร์ทุกอย่างไว้ที่นั่น

## รอบสาม: การพัฒนาเกม — ผลงานของ Fable

และนั่นคือผลงานของ GPT 5.6 (Sol) ครับ ทีนี้มาดูการตีความของ Claude Fable กันบ้าง เกมนี้ชื่อว่า Take Four น่าสนใจดีครับ เริ่มด้วยคำว่า "Places, please" คล้าย ๆ จะไปทางคอนเซ็ปต์ละครหรือคอนเสิร์ต มี vibe แบบการแสดงบนเวที ลองกดตัด take ดูนะครับ เป็นการตีความที่น่าสนใจมาก

ลองเล่นดูครับ ตัวละครจะตัวเล็ก รอแป๊บ โอเค กระโดดขึ้นไปตรงนี้ได้ ยากกว่าที่คิดเยอะเลย ต้องรอให้ ghost ของเราเอาของไปก่อน แต่เสียเวลาไปเยอะพอสมควรเหมือนกัน ลอง reset แล้วเริ่มใหม่กัน มี take สอง และก็ take สาม ยังไม่แน่ใจว่าต้องทำยังไง แต่ลองเล่นดูอีกครั้ง ยังไม่ชัดเจนว่ามงกุฎทำหน้าที่อะไร แต่นี่คือ take สองของเรา take สาม ต้องกดค้างไว้นานพอสมควร โอเค ได้แล้ว ลองอีกที ได้แล้วครับ ใช้เวลาถึงห้า take ถึงจะผ่าน แต่ก็ทำได้

เกมนี้สนุกดีครับ มีองค์ประกอบทางธีมเยอะเลย แม้กราฟิกจะพื้นฐานมาก แต่กลไกของเกมทำงานได้จริง มีจุดเด่นเยอะเลยเช่นเรื่องมงกุฎ ยังไม่แน่ใจว่ามงกุฎมีไว้ทำอะไร แต่เก็บไอเทมและ props ต่าง ๆ ได้ เทียบกับผลงานของ Sol ที่ดูเป็นเกม generic แบบมาตรฐาน เกมของ Fable ตัวนี้มีเอกลักษณ์ชัดเจนกว่า คล้ายกำลังเล่นบทละครอยู่ ถือว่าทำได้ดีมาก และเราก็เล่นจนชนะครับ

## รอบสาม: ผลงานสุดท้ายของ Kimi K3

โอเค ตัวสุดท้ายจะเป็น Kimi K3 ครับ นี่คือสิ่งที่ได้ ตัวละครของเราอยู่ตรงนี้ คล้าย ๆ กับของ Sol ใช่ไหมครับ ลองอีกครั้งนะ ทำนองว่าต้องเคลื่อนที่ไปทางนี้ แล้วก็ rewind แล้วเคลื่อนที่ไปทางนี้ แล้วก็ rewind แล้วค่อยใช้ท่าทางแบบนี้ โอเค เข้าไปได้แล้ว ก็น่าจะชนะนะครับ เท่านี้เหรอ

พูดตรง ๆ ก็ต้องบอกว่าเกมนี้กราฟิกดูพื้นฐานมาก แต่มีองค์ประกอบที่น่าสนใจอยู่บ้างเหมือนกัน เช่นเรื่องของฟิวส์และสัญญาณ มี element ที่หลากหลายเหมือนเป็น sandbox (กล่องทดลอง) เป็นเหมือน trial ให้ผู้เล่นเรียนรู้วิธีกระโดดและอื่น ๆ ก็เลยเป็น sandbox แล้วก็มี FPS (เฟรมเรต) ที่ขึ้นตัว F บนหน้าจอให้ดูเฟรมเรตและสถานะต่าง ๆ ดังนั้นกลไกของเกมถือว่าทำได้ค่อนข้างดีเลยครับ แต่ผมเองยังเล่นไม่ชนะสักที ไม่แน่ใจว่าเป็นเพราะฝีมือผมเองหรือว่าเป็นข้อบกพร่องของตัวเกมกันแน่

แต่โดยรวมแล้ว นี่คือผลงานจาก Kimi K3 ครับ

## สรุปรอบสามและการคัดออก

สรุปรอบสามกันครับ จาก Sol เราได้เกม Afterimage Station จาก Fable เราได้เกม Curtain Call และจาก Kimi K3 เราได้เกม signal ตัวนี้

พอตัดสินทั้งหมดแล้ว ทุกโมเดลสร้างเกมออกมาได้ แต่เมื่อพิจารณาจากคุณภาพ ความสมบูรณ์ของเกม และความคิดสร้างสรรค์ ผมต้องตัดสินใจตัดหนึ่งเกมออก และก็ต้องตัด Kimi K3 ออกจากการแข่งขันด้วยความเสียดายครับ

Kimi K3 ทำได้ดีมากในงานที่ยากอย่างมาก และโดยรวมในการแข่งขันนี้ก็พิสูจน์ตัวเองได้ดี ข้อสังเกตคือใช้เวลานานกว่าโมเดลอื่นในการทำอะไรก็ตาม ส่วนคุณภาพจริง ๆ ของเกมนั้น ถือว่าอยู่ต่ำกว่า Sol และ Fable เล็กน้อย ทางด้านภาพก็ดูจะต่ำกว่าอีกสองโมเดลเล็กน้อยเช่นกัน เพราะอีกสองเกมดูมีสไตล์ที่โดดเด่นกว่า มีฟังก์ชันที่น่าสนใจกว่า

แต่โดยรวมแล้ว ถ้าให้เทียบกัน ผมว่า Sol ได้เปรียบกว่า แต่ Fable น่าจะทำได้ดีที่สุดในรอบนี้ เพราะเป็นเกมที่น่าสนใจที่สุด ผมจึงตัด Kimi K3 ออกจากการแข่งขันครับ

แต่ก็อย่างที่บอก Kimi K3 ไม่ควรอายเลย เพราะทำผลงานที่น่าประทับใจมากจริง ๆ ผมจะได้แจ้งให้ทาง Kimi K3 ทราบด้วย ตอนนี้ Kimi K3 ได้ถูกตัดออกจากการแข่งขันแล้ว

และก็อย่างที่บอกครับ คุณภาพของผลงานจาก Sol ดูจะดีกว่าเล็กน้อย และผมก็ต้องคำนึงถึงเวลาด้วย ขอบคุณที่มีความเป็นตัวของตัวเองเมื่อเทียบกับโมเดลอื่นนะครับ ขอบคุณที่ลงแข่งขันในรอบนี้ครับ จริง ๆ แล้วเกมเป็นสิ่งที่สร้างยากอยู่แล้ว ผมขอ kill server ก่อนนะครับ

เพราะผลงานจาก Sol นั้นคุณภาพดีกว่าจริง ๆ และใช้เวลาเพียง 22 นาทีเทียบกับ 3 ชั่วโมง และนี่จึงนำเราเข้าสู่การแข่งขันชิงชนะเลิศ ระหว่างสองตัวเต็งครับ ซึ่งก็ไม่น่าแปลกใจเท่าไหร่

## รอบชิงชนะเลิศ: Fable พบ Sol

รอบชิงจึงเป็นการพบกันระหว่าง Claude Fable 5 จาก Anthropic กับ GPT 5.6 Sol จาก OpenAI พอเข้าสู่รอบนี้ก็เป็นสองตัวเต็งอันดับหนึ่งอย่างที่บอกไป จึงไม่น่าแปลกใจ แต่ก็เป็นการเปิดฉากการแข่งขันชิงชนะเลิศที่น่าสนใจมากครับ

นี่คือโจทย์ของรอบสุดท้าย และมันยากจริง ๆ ครับ ผมเองยังไม่รู้ด้วยซ้ำว่ามันทำได้ไหม ไม่เคยทำมาก่อน แต่เราจะมาลองคิดดูไปด้วยกัน เป้าหมายหลักคือฝึก LoRA ซึ่งก็คือ fine-tuning adapter สำหรับโมเดลวิดีโอ LTX 2.3 บนเครื่อง DGX Spark ของผม และก็ต้องบอกโมเดลด้วยว่า DGX Spark คืออะไร

คอนเซ็ปต์คือเราจะฝึก LoRA โดยอิงจากภาพยนตร์ยุคแรกเริ่มแบบไม่มีเสียง (early silent cinema) ไม่ใช่แค่ภาพยนตร์ดูเก่า ๆ นะครับ แต่เป็นลักษณะเฉพาะของฟิล์มที่ใช้ก้านหมุนด้วยมือ (hand-cranked film) ถ้าใครเคยดูหนังยุคนั้นมาบ้างก็จะเข้าใจ มีสไตล์ภาพที่โดดเด่นมากและเป็นเอกลักษณ์

จะมี raw source footage (ฟุตเทจต้นฉบับดิบ) ที่เป็นภาพยนตร์ยุคแรกเริ่มที่เป็น public domain (สาธารณสมบัติ) ไม่ผ่านการประมวลผล และมีให้เลือกเยอะมากครับ ส่วนที่เหลือใน prompt ก็แค่อธิบาย environment ให้โมเดลรู้ว่าควรจะฝึกอย่างไร ส่วน deliverables ที่ต้องส่งมอบคือน้ำหนักของ LoRA ซึ่งก็คือน้ำหนักของ adapter ที่ถูก fine-tune แล้วนั่นเอง

เราจะมาทดสอบกันครับ ผมต้องทำทีละตัวเพราะการฝึกโมเดลใช้หน่วยความจำเยอะมาก แต่ละโมเดลจะได้ workspace แยกกันเพื่อไม่ให้มีการปนเปื้อนข้ามงาน แต่ละโมเดลจะมีชุดข้อมูลประมาณหนึ่งชั่วโมงของภาพยนตร์ silent cinema หลายเรื่อง

และนี่คือสไตล์ที่เรากำลังพูดถึง ภาพยนตร์เรื่องหนึ่งชื่อ The Great Train Robbery เป็นภาพยนตร์ที่อยู่ใน public domain ทั้งหมด เราก็จะดูว่า LoRA สามารถสร้างสไตล์นี้ออกมาได้ไหม ถ้าทำได้ก็คงจะดูเจ๋งมาก เพราะมีสไตล์ที่เป็นเอกลักษณ์ชัดเจนมากครับ

โอเค ผมวาง prompt ลงใน Fable แล้ว ตอนนี้ก็กำลังเริ่มทำงาน ตั้งโหมดอัตโนมัติไว้ ก็ปล่อยให้มันรันไปครับ น่าจะใช้เวลาสักพักใหญ่ ๆ เพราะการฝึกแบบนี้ใช้เวลาหลายชั่วโมง ผมจะปล่อยให้รันบน DGX แล้วค่อยกลับมาเช็กตอนที่เสร็จครับ

## ผลการฝึก LoRA — Fable

โอเค Fable เสร็จแล้วครับ รันมาทั้งคืน ใช้เวลาไป 4.37 ชั่วโมง ถือเป็นการรันที่ไม่สั้นเลย เป็นการรันที่ยาวนานมาก ช่วงแรกเจอปัญหาเรื่องหน่วยความจำบ้างเล็กน้อย แต่แก้ไขจนเรียบร้อยและได้รันที่สะอาดครับ

ดูได้ว่ามี element หลายอย่างที่โมเดลประเมินว่าทำได้ดี บางอย่างไม่สามารถ match กับ reference ได้ แต่เราจะมาดูผลลัพธ์กันเองครับ อย่างไรก็ตาม Fable สามารถฝึก LoRA adapter ได้สำเร็จ ผมจะเก็บผลลัพธ์ไว้ดูหลังจากที่ Sol ทำเสร็จด้วยครับ

## ผลการฝึก LoRA — Sol

ทีนี้ผมขอย้ายไปที่ Sol ก็วาง prompt ลงไป และก็กำลังจะเริ่มรันอีกประมาณ 4–5 ชั่วโมง อาจจะเร็วกว่านั้นนิดหน่อยเพราะ Sol ดูจะเร็วกว่า ขอเช็กอีกครั้งในอีกสองสามชั่วโมงนะครับ ตอนนี้กำลังฝึกอยู่แล้วและ loss ลดลงเรื่อย ๆ ซึ่งเป็นสัญญาณที่ดีครับ และเนื่องจากครั้งนี้ผมทำช่วงกลางวัน ก็เลยเห็นกระบวนการฝึก LoRA ได้ชัดเจนครับ

โอเค Sol ฝึกเสร็จแล้วครับ เสร็จเร็วกว่า Fable ตามที่คาดไว้ ใช้เวลาตั้งแต่ต้นจนจบประมาณ 2 ชั่วโมง 30 นาที เร็วกว่า Fable อย่างเห็นได้ชัด แต่สิ่งนี้เราก็รู้อยู่แล้วตั้งแต่สามรอบแรกครับ ว่า Sol ค่อนข้างเร็วเมื่อเทียบกับ Fable

## รอบชิงชนะเลิศ: ผลการตัดสินครั้งสุดท้าย

โอเค ถึงเวลาการแข่งขันชิงชนะเลิศแล้วครับ ผลการตัดสินครั้งสุดท้าย ขอบอกก่อนเลยว่าทั้งสองโมเดลสามารถสร้าง LoRA ออกมาได้สำเร็จ ดังนั้นนี่จึงเป็นการแข่งขันที่เป็นการแข่งขันกันเรื่องคุณภาพอย่างแท้จริงครับ

## เกณฑ์การตัดสินและชุดข้อมูลอ้างอิง

ผมจะตัดสินจากว่าแต่ละโมเดลปรับตัวเข้ากับสไตล์ silent cinema ต้นฉบับจากชุดข้อมูลได้ดีแค่ไหน รวมถึงคุณภาพโดยรวมด้วย ข้อควรระวังในการฝึก LoRA และ fine-tuning adapter คือถ้าฝึกกับชุดข้อมูลมากเกินไป คุณภาพจะตกลงครับ ส่วนโมเดล LTX ที่เราจะใช้คือ LTX 2.3 ถือว่าใหม่พอสมควร แต่เป็นโมเมลวิดีโอที่คุณภาพดีมาก โดยทั่วไปไม่ค่อยสร้างภาพ AI แปลก ๆ ออกมา ก็เลยเป็นจุดที่ต้องคอยสังเกตครับ

ขอแสดงตัวอย่างบางส่วนที่ใช้ฝึกและสไตล์ที่เราคาดหวังอีกครั้ง เรื่องนี้ชื่อ A Trip Down Market Street เป็นหนึ่งในภาพยนตร์ที่ให้ฝึก เรามองหาสไตล์แบบนี้ครับ ปี 1906 ภาพสั่นไหวนิดหน่อยใช่ไหมครับ อีกเรื่องที่ชื่อว่า Cops เกิดตอนหลังกว่านิดหน่อย เลยลื่นไหลกว่าเล็กน้อย แต่ก็สไตล์คล้ายกันนะครับ มีการ์ดข้อความด้วย อันนี้เป็นของ Buster Keaton นี่คือสไตล์ที่เรากำลังมองหาครับ

## Prompt ที่หนึ่ง: คนเดินบนบอร์ดวอล์ก

prompt แรกที่ให้กับทั้งคู่ และจะมีสาม prompt รวมเป็นสามรอบ คือ "people walking down a boardwalk" (คนเดินลงจากบอร์ดวอล์ก) ภาพแรกนี้คือผลจาก LTX ปกติเลยนะครับ ไม่มี LoRA ไม่ได้พูดถึง silent cinema เป็นแค่วิดีโอ 5 วินาทีของคนเดินลงจากบอร์ดวอล์ก ผลออกมาง่าย ๆ ตรงไปตรงมา

ภาพต่อมาคือสั่ง LTX ให้สร้างวิดีโอคนเดินบนบอร์ดวอล์กในสไตล์ silent cinema โดยใส่เป็นข้อความใน prompt เลย อันนี้ก็ยังไม่มี LoRA นะครับ เป็นเพียงการตั้ง baseline ให้เห็นพื้นฐานเท่านั้น ผลออกมาไม่เลวเลย แต่อาจจะไม่ค่อย grainy (มีเม็ดฟิล์ม) และอาจจะลื่นไหลเกินไปนิดหน่อย ส่วนใบหน้าคนก็มีความผิดเพี้ยนอยู่บ้าง

ทีนี้มาดูผลงานชิ้นแรกจาก Fable ครับ คือ "people walking down a boardwalk" โดยใช้ LoRA ที่เพิ่งฝึกจาก Fable ครับ วิดีโอ 5 วินาที จะเห็นว่ายังไม่สมบูรณ์ มีบางจุดที่ดูเหมือนถูกบีบอัดหรือผิดสัดส่วน แต่ก็ได้เม็ดฟิล์มแบบยุคนั้นมาบ้าง ขอบด้านข้างดูไหม้ ๆ เล็กน้อย ซึ่งทำให้ดู authentic สมจริงยิ่งขึ้นแม้ว่าตัวคนจะดูมัว ๆ ไปบ้างก็ตาม

ต่อมาเป็นผลงานของ GPT 5.6 Sol ใน prompt เดียวกันครับ คนเดินบนบอร์ดวอล์ก มาดูผลกัน ลื่นไหลกว่า สะอาดตากว่า ดูคล้ายกับผลจาก prompt ปกติที่ไม่มี LoRA มาก คุณภาพดูจะดีกว่านิดหน่อย แต่ผลก็ใกล้เคียงกันมากครับ

## Prompt ที่สอง: เครื่องบินบินเหนือภูเขา

เราจะทำอีกสอง prompt ครับ prompt ที่สองคือ "an airplane flying over the mountains" (เครื่องบินบินเหนือภูเขา) ผลงานจาก Fable คือ เข้ากับสไตล์ได้ดีมากครับ มีเครื่องบินอยู่ตรงนั้น ดูดีเลย และก็มีภูเขาอยู่ด้านหลัง ไม่แน่ใจว่าคนที่เดินอยู่รอบ ๆ รถพ่วงคืออะไร แต่สไตล์นั้นเข้าเป้าแน่นอนครับ ชอบเม็ดฟิล์มแบบหนังยุคแรก ๆ ของ Fable และบอกได้เลยว่ามันต่างจากการใส่ prompt เปล่า ๆ แน่นอน คือ LoRA มีผลจริง ๆ ครับ

ทีนี้มาดูของ GPT 5.6 Sol บ้าง มีเครื่องบินอยู่ครับ ถือว่าเป็นเครื่องบินที่บินเหนือภูเขาได้ถูกต้อง แต่เม็ดฟิล์มดูจะน้อยกว่า ลื่นไหลไปหน่อย จนเกือบจะลื่นไหลเกินไปด้วยซ้ำ เครื่องบินของ Sol เคลื่อนที่ลื่นไหลมาก เทียบกับของ Fable ที่สั่นไหวมากกว่า และที่ชอบของ Fable คือเครื่องบินนั้นเป็นแบบยุคนั้นจริง ๆ คือเครื่องบินในช่วงต้นศตวรรษที่ 20 ส่วนของ Sol เป็นเครื่องบินสมัยใหม่กว่า ไม่มีใบพัด ดูเหมือนเครื่องร่อนเสียมากกว่า ถือว่า Fable ได้แต้มนี้ไปครับ แม้ว่า Sol จะยึดตาม prompt มากกว่าก็ตาม

## Prompt ที่สาม: การปะทะกันในอวกาศ

สำหรับ prompt สุดท้าย ผมอยากทำอะไรที่บ้าน ๆ หน่อย คือ "a wild shootout between cops and robbers in space" (การยิงปะทะกันอย่างดุเดือดระหว่างตำรวจกับโจรในอวกาศ) ซึ่ง obviously ไม่มีวิดีโอไหนมีฉากอวกาศเลย แต่ก็มีบางเรื่องที่มีตำรวจกับโจรอยู่บ้าง

นี่คือผลงานของ Claude Fable ใน prompt นี้ครับ ดูจะวุ่นวายหน่อย คาดว่าน่าจะเป็นตำรวจกับโจรครับ ภาพคนผิดเพี้ยนมาก ถ้าไม่นับเรื่องความผิดเพี้ยนของตัวละครแล้ว สภาพแวดล้อมก็ไม่ได้อยู่ในอวกาศซึ่งเป็นปัญหา แต่คุณภาพของฟิล์มในแง่ของเม็ดฟิล์ม การเคลื่อนไหว และการกระพริบของภาพนั้นเลียนแบบสไตล์ได้ดีอยู่ครับ ทั้งนี้ก็ต้องยอมรับว่าเป็น prompt ที่ยากเพราะมีแอ็กชันเยอะและไม่มีข้อมูลอ้างอิงสำหรับฉากอวกาศในสไตล์นี้เลย

โอเค นี่คือผลของ GPT 5.6 Sol ใน prompt เดียวกันครับ มาดูกัน ก็ไม่รู้สิ คนดูจริงขึ้นกว่า แต่ก็ไม่มีการยิงปะทะกันจริง ๆ และก็ไม่ได้อยู่ในอวกาศเหมือนกัน ดูจะอยู่ในสำนักงานมากกว่า ทั้งสองชิ้นเอาฉากมาจากชุดข้อมูลที่ใช้ฝึกโดยตรงเลย เพราะโมเดลไม่มีข้อมูลอ้างอิงเรื่องอวกาศ จึงดึงฉากจากชุดข้อมูลภาพยนตร์มาใช้แทนครับ ดังนั้นทั้งคู่ต่างก็มีปัญหากับ prompt นี้เหมือนกัน

ขออีกครั้งกับผลงานของ Fable ครับ ใช่เลย prompt ยากจริง ๆ

## การเปรียบเทียบแบบเคียงข้างกัน

โอเค ขอให้ดูแบบเคียงข้างกันนะครับ ด้านซ้ายเป็น Fable และด้านขวาเป็น Sol เพื่อเทียบสไตล์ที่ต่างกัน รู้สึกว่าในเรื่องบอร์ดวอล์กนั้นทั้งคู่ใกล้เคียงกันมาก อาจจะมีสไตล์ที่หนักแน่นกว่านิดหน่อย แต่ก็ถือว่าใกล้เคียงกัน

ต่อมา prompt เครื่องบินครับ ซ้าย Fable ขวา Sol ในรอบนี้ผมว่า Fable ทำได้ดีกว่าในการถ่ายทอดคุณภาพของยุคนั้นออกมา โดยเฉพาะเครื่องบินที่เป็นแบบยุคนั้นชัดเจน คือเป็นเครื่องบินใบพัด ส่วนของ Sol นั้นเหมือนเครื่องบินเจ็ตเสียมากกว่า แม้ว่า Sol จะได้ภูเขามาถูกต้องก็ตาม เครื่องบินของ Fable กำลังบินขึ้น มีภูเขาเป็นฉากหลัง สังเกตขอบของวิดีโอ Fable จะเห็นว่าขอบมีการจาง ๆ ซึ่งเป็นลักษณะเฉพาะของฟิล์มยุคนั้น ในขณะที่ Sol ก็ทำได้ดีแต่พลาดรายละเอียดเล็ก ๆ น้อย ๆ เหล่านี้ไปครับ

สำหรับ prompt สุดท้าย การยิงปะทะกันในอวกาศ ทั้งคู่ต่างก็มีปัญหาเพราะไม่มีข้อมูลอ้างอิงในชุดข้อมูลเลย ขอให้ดูอีกครั้งครับ ซ้ายคือ Fable ขวาคือ Sol ดูติด ๆ กันได้ จะเห็นได้อีกครั้งว่า Fable ทำเรื่องการกระพริบของภาพและเนื้อสัมผัสของสไตล์นั้นได้ดีกว่า ส่วนของ Sol ดูจะขัดเกลาเกินไปนิดหน่อย แม้ทั้งคู่จะมีปัญหากับตัวละครและเนื้อเรื่องเหมือนกันก็ตาม และนี่อีกตัวอย่างครับของสไตล์จากชุดข้อมูลที่ต้องการแบบ grainy พร้อมการเคลื่อนไหวเป็นเอกลักษณ์ของยุคนั้น

## การตัดสินครั้งสุดท้าย

พูดตรง ๆ ว่าทั้งคู่ทำได้ดีพอสมควรเลยครับ เป็นการแข่งขันที่สูสีมาก การฝึก LoRA ไม่ใช่เรื่องง่ายครับ โดยเฉพาะกับเนื้อหาแบบวิดีโอเช่นนี้ เพราะนี่เป็นโมเดลสร้างวิดีโอ และชุดข้อมูลที่ให้ฝึกก็ค่อนข้างเล็กเมื่อเทียบกับที่ห้องปฏิบัติการ AI มืออาชีพใช้ฝึกโมเดล แต่ก็ต้องมีผู้ชนะเพียงคนเดียว และผลขึ้นอยู่กับการตัดสินของผมครับ อาจจะมีคนไม่เห็นด้วยกับการตัดสินของผม แต่นี่คือช่องของผม ผมก็เลยได้เป็นผู้มอบมงกุฎให้ผู้ชนะของ AI Royal Rumble เดือนกรกฎาคม 2026 ครับ

เป็นการแข่งขันที่ดีมากครับ ผมดีใจที่รอบสุดท้ายไม่ใช่การถล่มทลายทิ้งห่างกัน ขอใช้สัญชาตญาณจากการดูวิดีโอเหล่านี้หลายรอบ ว่าโมเดลไหนถ่ายทอดภาพยนตร์ต้นฉบับได้ดีกว่ากัน และโมเดลไหนที่ผมควรใช้จริง ๆ หากต้องการสร้าง fine-tuning adapter หรือ LoRA เพื่อสร้างวิดีโอสไตล์ early silent cinema ครับ

## ผู้ชนะ AI Royal Rumble เดือนกรกฎาคม 2026

ดังนั้น ผู้ชนะของ AI Royal Rumble เดือนกรกฎาคม 2026 คือ Fable ครับ นั่นคือ Fable 5 จาก Anthropic ซึ่งเป็นโมเดล frontier ระดับท็อปของ Claude ตั้งแต่เข้าสู่การแข่งขันมา Fable ก็เป็นตัวเต็งครับ เป็นโมเดลที่ผมส่วนตัวรู้สึกว่าเป็นโมเดลที่ดีที่สุดโดยรวมสำหรับงานหนัก ๆ แบบ long-horizon tasks (งานที่ใช้เวลานาน) โมเดลอื่น ๆ อาจจะเก่งเรื่องงานเฉพาะด้าน แต่โดยรวมแล้ว สำหรับงานลักษณะนี้ที่ใช้เวลาหลายชั่วโมงและยากจริง ๆ ผมรู้สึกมาตลอดว่า Fable ตั้งแต่ออกมานั้นเป็นโมเดลที่ดีที่สุดสำหรับงานแบบนี้ครับ ดังนั้น Fable 5 จึงคว้าเข็มขัดแชมป์ของการแข่งขันครั้งแรกนี้ไปครับ

ส่วน Sol ที่น่าสงสารตกเวทีไป ผมขอบอกว่าประทับใจกับความสมดุลระหว่างคุณภาพและความเร็วมากครับ เพราะเร็วกว่า Fable และเร็วกว่าอีกหลายโมเดลอย่างชัดเจน และผลงานก็แย่กว่าเพียงเล็กน้อยเท่านั้น แต่ในการแข่งขันครั้งนี้ คุณภาพคือสิ่งสำคัญที่สุด ไม่ใช่ความเร็วครับ อย่างไรก็ตาม ในงานจริง ถ้าใครต้องการทั้งคุณภาพสูงและความเร็ว Sol น่าจะเป็นตัวเลือกที่น่าประทับใจมากครับ แต่รอบนี้ Fable คว้าเข็มขัดแชมป์ประจำเดือนไปครับ

## แผนงานในอนาคตและปิดท้าย

ทุกเดือนมีโมเดล frontier ตัวใหม่ออกมาเสมอ และคนดูก็ชอบวิดีโอแนวนี้ครับ ก็น่าสนใจดี เพราะในช่องนี้ ผมมักทำคอนเทนต์สั้น ๆ เยอะ ผมทำวิดีโอ first look หลายชิ้นที่เป็นแบบจบในตัว one-shot แม้ในวิดีโออื่น ๆ ของผม ก็ไม่ได้ทำอะไรแบบนี้ที่ใช้เวลาหลายชั่วโมงนัก บางครั้งงานก็ใช้เวลาถึง 3–4 ชั่วโมง เวลาจับคู่โมเดลเปรียบเทียบกัน ผมบางครั้งก็ทำเป็นงาน ๆ แยกต่างหาก แต่ก็น่าสนใจดีครับ

เราจะดูกันตอนปลายเดือนสิงหาคมว่าคนดูชอบวิดีโอนี้หรือเปล่า และเดือนสิงหาคมก็จะมีโมเดลใหม่ ๆ เยอะแน่ ๆ ผมทราบว่าจะมีโมเดล Grok ใหม่ออกมา อาจจะมี GPT 6 (มีข่าวลือเรื่อง GPT 6) ข่าวลือเรื่อง Fable 5.1 ก็มีด้วย แล้วเจ้าตัวไหนจะออกมาจริงบ้าง เรามาดูกันครับ และแน่นอนว่าน่าจะมีโมเดล open weights ใหม่ ๆ ออกมาด้วย เช่นโมเดล Kimi K3 หรือพวก BLM ก็ต้องดูกันต่อไปครับ ถ้าโมเดลเหล่านั้นออกมาจริง ๆ ผมก็จะจัดการแข่งขันอีกครั้งในช่วงปลายเดือนสิงหาคมครับ แต่ตอนนี้ขอรอดูไปก่อน

สำหรับการแข่งขันครั้งนี้ ผู้ชนะอย่างเป็นทางการก็คือ Fable 5 อีกครั้งครับ ขอบคุณทุกท่านที่รับชมครับ ถ้าใครมีความคิดเห็นอะไร ก็คอมเมนต์กันเข้ามาได้เลยนะครับ ว่าคิดว่าใครจะชนะการแข่งขันนี้ ผมทราบดีว่ารอบสุดท้ายกับเรื่องวิดีโอนั้นเป็นเรื่อง subjective (ขึ้นกับมุมมองส่วนบุคคล) มาก เป็นความรู้สึกโดยรวมของผมเองว่าโมเดลไหนถ่ายทอดงานต้นฉบับได้ดีกว่ากัน แต่ก็คอมเมนต์มาได้เลยนะครับ แชร์ความคิดเห็นกันเข้ามา ถ้าใครไม่เห็นด้วยก็ไม่เป็นไรครับ แต่นี่ก็เป็นอันจบวิดีโอนี้ครับ ขอบคุณที่รับชมครับ

03

หมายเหตุการแปล

ความโปร่งใสเกี่ยวกับความไม่แน่นอนในต้นฉบับ

  • ## ส่วนที่ความหมายไม่ชัดเจน (Unclear Segments)
  • ไม่มีช่วงที่ต้องใส่ `[ฟังไม่ชัด]` เพราะแม้คำบรรยายจะมีข้อผิดพลาดเล็กน้อย แต่บริบทช่วยให้เข้าใจความหมายได้ตลอด
04

อภิธานศัพท์เทคนิค

คำศัพท์และชื่อผลิตภัณฑ์ที่คงรูปภาษาอังกฤษ

ศัพท์คำแปล / คำอธิบาย
AI Royal Rumbleการแข่งขันชื่อโมเดล AI เพื่อหาผู้ชนะ (จากช่อง Tonbi's AI Garage)
frontier modelโมเดล AI ระดับแนวหน้าที่มีความสามารถสูงสุดในยุคปัจจุบัน
Fableโมเดล frontier ของ Anthropic ในตระกูล Claude (Claude Fable 5)
Solโมเดล frontier ของ OpenAI ในตระกูล GPT (GPT 5.6 Sol)
Kimi K3โมเดลของ Moonshot AI
GLM 5.2โมเดลที่ถูกคัดออกในรอบที่หนึ่ง
Grok 4.5โมเดลที่ถูกคัดออกในรอบที่สอง
Hermes Agentแพลตฟอร์ม AI agent ของ Nous Research ที่ใช้ในการรันโมเดลในการแข่งขัน
LM wikisคลังความรู้เกี่ยวกับโมเดลภาษา (Large Language Model)
agentwikis.comโปรเจกต์คลังความรู้ของพิธีกร ให้เข้าถึงข้อมูลวิจัยโมเดล
landing pageหน้าเว็บเริ่มต้นที่ผู้ใช้พบเมื่อเข้าเว็บไซต์
typographyศิลปะการจัดวางและออกแบบตัวอักษร
motionองค์ประกอบการเคลื่อนไหวในการออกแบบ
paper traderโปรแกรมจำลองการเทรด (ไม่ใช้เงินจริง)
P&LProfit and Loss — กำไรขาดทุน
platformerประเภทเกมที่ตัวละครกระโดดข้ามอุปสรรคบนแท่นต่าง ๆ
LoRALow-Rank Adaptation — เทคนิค fine-tuning โมเดลโดยใช้ adapter ที่ฝึกเพิ่มเติม
fine-tuning adapterส่วนเสริมที่ฝึกเพิ่มเติมเพื่อปรับแต่งโมเดลให้เชี่ยวชาญด้านใดด้านหนึ่ง
NVIDIA DGX Sparkเครื่องคอมพิวเตอร์ประสิทธิภาพสูงสำหรับงาน AI ของ NVIDIA
LTX 2.3โมเดลสร้างวิดีโอที่ใช้เป็นฐานสำหรับการฝึก LoRA
early silent cinemaภาพยนตร์ยุคแรกเริ่มที่ไม่มีเสียง (ยุค 1900s)
hand-cranked filmฟิล์มที่ถ่ายด้วยกล้องที่ต้องหมุนก้านด้วยมือ (เป็นลักษณะเฉพาะของยุคแรก)
public domainสาธารณสมบัติ — ผลงานที่ไม่มีลิขสิทธิ์คุ้มครอง สามารถใช้ได้อย่างอิสระ
The Great Train Robberyภาพยนตร์ปี 1903 ที่ใช้เป็นข้อมูลฝึก
A Trip Down Market Streetภาพยนตร์ปี 1906 ที่ใช้เป็นข้อมูลฝึก
Copsภาพยนตร์ silent ของ Buster Keaton ที่ใช้เป็นข้อมูลฝึก
Buster Keatonดาราตลกยุคภาพยนตร์เงียบ
lossค่าความคลาดเคลื่อนที่ใช้วัดระหว่างการฝึกโมเดล (ค่าลดลง = ฝึกได้ดีขึ้น)
dataset / data setชุดข้อมูลที่ใช้ฝึกโมเดล
referenceข้อมูลหรือภาพอ้างอิงสำหรับเทียบผลลัพธ์
open weightsโมเดลที่เปิดเผยน้ำหนักให้ใช้งานได้อย่างอิสระ
long-horizon taskงานที่ใช้เวลานานและต้องทำหลายขั้นตอน
one-shotงานจบในครั้งเดียว ไม่ต้องทำต่อเนื่อง
first lookบทวิจารณ์หรือทดลองใช้งานครั้งแรก
sandboxกล่องทดลอง — สภาพแวดล้อมที่ทดลองได้อย่างอิสระ
FPSFrames Per Second — เฟรมต่อวินาที ใช้วัดความลื่นไหลของวิดีโอหรือเกม
grain / grainyเม็ดฟิล์ม — ลักษณะเฉพาะของฟิล์มยุคเก่า
clippingปัญหาที่วัตถุในเกมทะลุกัน
flickerการกระพริบของภาพ (เป็นลักษณะเฉพาะของฟิล์มยุคแรก)
blowoutการถล่มทลายทิ้งห่างกันมาก ๆ
05

ซับไตเติ้ลภาษาไทย

ดาวน์โหลดหรือดูซับทั้งหมด

1
00:00:00,000 --> 00:00:06,867
ยินดีต้อนรับกลับมาสู่ภาคสองของ AI Royal Rumble

2
00:00:06,867 --> 00:00:09,405
เดือนกรกฎาคม 2026

3
00:00:09,405 --> 00:00:16,570
ที่เราจะมาตัดสินกันให้รู้แล้วรู้รอดว่าโมเดลระดับ

4
00:00:16,570 --> 00:00:22,989
frontier ตัวไหนคือที่สุด ถ้าใครดูภาคนี้ก่อน
thai-subtitles.srt
SubRip — ใช้กับเครื่องเล่นวิดีโอส่วนใหญ่
↓ ดาวน์โหลด
thai-subtitles.vtt
WebVTT — ใช้กับเว็บ / YouTube
↓ ดาวน์โหลด
เปิดดูซับไตเติ้ลทั้งหมด (369 segments)
1
00:00:00,000 --> 00:00:06,867
ยินดีต้อนรับกลับมาสู่ภาคสองของ AI Royal Rumble

2
00:00:06,867 --> 00:00:09,405
เดือนกรกฎาคม 2026

3
00:00:09,405 --> 00:00:16,570
ที่เราจะมาตัดสินกันให้รู้แล้วรู้รอดว่าโมเดลระดับ

4
00:00:16,570 --> 00:00:22,989
frontier ตัวไหนคือที่สุด ถ้าใครดูภาคนี้ก่อน

5
00:00:22,989 --> 00:00:31,946
ก็อยากให้ย้อนไปดูภาคหนึ่งเพื่อดูว่าสองรอบแรกเกิดอะไรขึ้นบ้าง

6
00:00:31,946 --> 00:00:43,590
เพราะภาคนี้จะเป็นรอบที่สามและรอบที่สี่ก่อนที่เราจะมอบมงกุฎให้ผู้ชนะเด็ดขาดครับ

7
00:00:43,590 --> 00:00:50,158
พอสรุปแล้ว รอบแรกเป็นโปรเจกต์ทำ landing page

8
00:00:50,158 --> 00:00:56,876
ที่ใช้ typography และ motion แบบเฉพาะตัว เป็น

9
00:00:56,876 --> 00:01:02,250
landing page ที่วิวัฒนาการไปเรื่อย ๆ

10
00:01:02,250 --> 00:02:34,057
ตอนที่เลื่อนจอลง ทุกโมเดลทำได้ดีมากแม้งานจะยาก แต่สุดท้ายผู้แพ้ของรอบแรกคือ GLM 5.2 ที่ถูกตัดออก เป็นโมเดลเดียวที่ output เพี้ยน คือไม่ทำงานเลยครับ จากนั้นเราก็เข้าสู่รอบสอง เป็นการทดสอบเทรดดิ้งที่ agent ต้องค้นคว้า ออกแบบกลยุทธ์การเทรด และเขียน paper trader (โปรแกรมจำลองการเทรด) ให้ทำตามกลยุทธ์นั้นไปตามเวลา พอลองรันจริง โมเดลที่ทำได้แย่ที่สุดคือ Grok 4.5 จึงถูกตัดออกจากการแข่งขัน เจ้าตัวรับความเสี่ยงสูงที่สุด ทำการเทรดเยอะกว่าโมเดลอื่นเยอะมาก และก็เร็วกว่าด้วย แต่สุดท้ายผล P&L (กำไรขาดทุน) ติดลบประมาณ 12% ครับ Grok 4.5 จึงถูกคัดออกในรอบสอง ถึงตรงนี้เราก็เข้าสู่รอบสาม และนี่คือสถานการณ์ปัจจุบัน โดยที่ Fable,

11
00:02:34,057 --> 00:02:35,251
GPT 5.6,

12
00:02:35,251 --> 00:03:46,905
Sol และ Kimi K3 เป็นสามโมเดลสุดท้ายที่ยังเหลืออยู่ รอบสามจะเป็นการพัฒนาเกม น่าจะสนุกและน่าสนใจดีครับ จากนั้นในรอบชิงชนะเลิศ สองโมเดลสุดท้ายจะได้ทำงานฝึกโมเดล คือต้องฝึก fine-tuning adapter ที่เรียกว่า LoRA บนเครื่อง DGX Spark ของผมเอง สำหรับโมเดลสร้างวิดีโอ ซึ่งผมเองก็ไม่เคยทำมาก่อน จะทำได้หรือเปล่าก็ไม่รู้ แต่เราจะมาดูความเป็นไปได้ไปด้วยกันครับ เริ่มกันเลย ถ้าใครเองก็รัน agent และอยากเข้าถึง LM wikis (คลังความรู้เกี่ยวกับโมเดลภาษา) ที่ผมใช้ค้นคว้าและสร้างวิดีโอเหล่านี้จริง ๆ

13
00:03:46,905 --> 00:04:18,851
ก็แวะดูโปรเจกต์ agentwikis.com ของผมได้เลยครับ ผมแชร์ทุกอย่างไว้ที่นั่น และนั่นคือผลงานของ GPT 5.6 (Sol) ครับ ทีนี้มาดูการตีความของ Claude Fable กันบ้าง เกมนี้ชื่อว่า Take Four น่าสนใจดีครับ เริ่มด้วยคำว่า "Places,

14
00:04:18,851 --> 00:04:21,091
please" คล้าย ๆ

15
00:04:21,091 --> 00:04:27,211
จะไปทางคอนเซ็ปต์ละครหรือคอนเสิร์ต มี vibe

16
00:04:27,211 --> 00:04:33,033
แบบการแสดงบนเวที ลองกดตัด take ดูนะครับ

17
00:04:33,033 --> 00:04:39,004
เป็นการตีความที่น่าสนใจมาก ลองเล่นดูครับ

18
00:04:39,004 --> 00:04:43,184
ตัวละครจะตัวเล็ก รอแป๊บ โอเค

19
00:04:43,184 --> 00:04:49,454
กระโดดขึ้นไปตรงนี้ได้ ยากกว่าที่คิดเยอะเลย

20
00:04:49,454 --> 00:04:54,529
ต้องรอให้ ghost ของเราเอาของไปก่อน

21
00:04:54,529 --> 00:05:00,948
แต่เสียเวลาไปเยอะพอสมควรเหมือนกัน ลอง reset

22
00:05:00,948 --> 00:05:07,367
แล้วเริ่มใหม่กัน มี take สอง และก็ take สาม

23
00:05:07,367 --> 00:05:14,234
ยังไม่แน่ใจว่าต้องทำยังไง แต่ลองเล่นดูอีกครั้ง

24
00:05:14,234 --> 00:05:20,653
ยังไม่ชัดเจนว่ามงกุฎทำหน้าที่อะไร แต่นี่คือ

25
00:05:20,653 --> 00:05:24,087
take สองของเรา take สาม

26
00:05:24,087 --> 00:05:30,804
ต้องกดค้างไว้นานพอสมควร โอเค ได้แล้ว ลองอีกที

27
00:05:30,804 --> 00:05:36,775
ได้แล้วครับ ใช้เวลาถึงห้า take ถึงจะผ่าน

28
00:05:36,775 --> 00:05:40,806
แต่ก็ทำได้ เกมนี้สนุกดีครับ

29
00:05:40,806 --> 00:05:44,538
มีองค์ประกอบทางธีมเยอะเลย

30
00:05:44,538 --> 00:05:47,673
แม้กราฟิกจะพื้นฐานมาก

31
00:05:47,673 --> 00:05:51,405
แต่กลไกของเกมทำงานได้จริง

32
00:05:51,405 --> 00:05:56,033
มีจุดเด่นเยอะเลยเช่นเรื่องมงกุฎ

33
00:05:56,033 --> 00:06:02,899
ยังไม่แน่ใจว่ามงกุฎมีไว้ทำอะไร แต่เก็บไอเทมและ

34
00:06:02,899 --> 00:06:08,423
props ต่าง ๆ ได้ เทียบกับผลงานของ Sol

35
00:06:08,423 --> 00:06:14,991
ที่ดูเป็นเกม generic แบบมาตรฐาน เกมของ Fable

36
00:06:14,991 --> 00:06:19,022
ตัวนี้มีเอกลักษณ์ชัดเจนกว่า

37
00:06:19,022 --> 00:06:25,142
คล้ายกำลังเล่นบทละครอยู่ ถือว่าทำได้ดีมาก

38
00:06:25,142 --> 00:06:31,561
และเราก็เล่นจนชนะครับ โอเค ตัวสุดท้ายจะเป็น

39
00:06:31,561 --> 00:06:35,890
Kimi K3 ครับ นี่คือสิ่งที่ได้

40
00:06:35,890 --> 00:06:42,160
ตัวละครของเราอยู่ตรงนี้ คล้าย ๆ กับของ Sol

41
00:06:42,160 --> 00:06:45,743
ใช่ไหมครับ ลองอีกครั้งนะ

42
00:06:45,743 --> 00:06:52,311
ทำนองว่าต้องเคลื่อนที่ไปทางนี้ แล้วก็ rewind

43
00:06:52,311 --> 00:06:57,685
แล้วเคลื่อนที่ไปทางนี้ แล้วก็ rewind

44
00:06:57,685 --> 00:07:03,955
แล้วค่อยใช้ท่าทางแบบนี้ โอเค เข้าไปได้แล้ว

45
00:07:03,955 --> 00:07:09,478
ก็น่าจะชนะนะครับ เท่านี้เหรอ พูดตรง ๆ

46
00:07:09,478 --> 00:07:14,852
ก็ต้องบอกว่าเกมนี้กราฟิกดูพื้นฐานมาก

47
00:07:14,852 --> 00:07:21,122
แต่มีองค์ประกอบที่น่าสนใจอยู่บ้างเหมือนกัน

48
00:07:21,122 --> 00:07:26,795
เช่นเรื่องของฟิวส์และสัญญาณ มี element

49
00:07:26,795 --> 00:07:33,065
ที่หลากหลายเหมือนเป็น sandbox (กล่องทดลอง)

50
00:07:33,065 --> 00:07:35,453
เป็นเหมือน trial

51
00:07:35,453 --> 00:07:40,976
ให้ผู้เล่นเรียนรู้วิธีกระโดดและอื่น ๆ

52
00:07:40,976 --> 00:07:54,113
ก็เลยเป็น sandbox แล้วก็มี FPS (เฟรมเรต) ที่ขึ้นตัว F บนหน้าจอให้ดูเฟรมเรตและสถานะต่าง ๆ

53
00:07:54,113 --> 00:08:00,831
ดังนั้นกลไกของเกมถือว่าทำได้ค่อนข้างดีเลยครับ

54
00:08:00,831 --> 00:08:04,712
แต่ผมเองยังเล่นไม่ชนะสักที

55
00:08:04,712 --> 00:08:14,564
ไม่แน่ใจว่าเป็นเพราะฝีมือผมเองหรือว่าเป็นข้อบกพร่องของตัวเกมกันแน่

56
00:08:14,564 --> 00:08:20,685
แต่โดยรวมแล้ว นี่คือผลงานจาก Kimi K3 ครับ

57
00:08:20,685 --> 00:08:27,552
สรุปรอบสามกันครับ จาก Sol เราได้เกม Afterimage

58
00:08:27,552 --> 00:08:33,523
Station จาก Fable เราได้เกม Curtain Call

59
00:08:33,523 --> 00:08:39,196
และจาก Kimi K3 เราได้เกม signal ตัวนี้

60
00:08:39,196 --> 00:08:45,764
พอตัดสินทั้งหมดแล้ว ทุกโมเดลสร้างเกมออกมาได้

61
00:08:45,764 --> 00:08:52,034
แต่เมื่อพิจารณาจากคุณภาพ ความสมบูรณ์ของเกม

62
00:08:52,034 --> 00:08:55,019
และความคิดสร้างสรรค์

63
00:08:55,019 --> 00:09:01,886
ผมต้องตัดสินใจตัดหนึ่งเกมออก และก็ต้องตัด Kimi

64
00:09:01,886 --> 00:09:08,753
K3 ออกจากการแข่งขันด้วยความเสียดายครับ Kimi K3

65
00:09:08,753 --> 00:09:13,082
ทำได้ดีมากในงานที่ยากอย่างมาก

66
00:09:13,082 --> 00:09:19,650
และโดยรวมในการแข่งขันนี้ก็พิสูจน์ตัวเองได้ดี

67
00:09:19,650 --> 00:09:27,264
ข้อสังเกตคือใช้เวลานานกว่าโมเดลอื่นในการทำอะไรก็ตาม

68
00:09:27,264 --> 00:09:33,981
ส่วนคุณภาพจริง ๆ ของเกมนั้น ถือว่าอยู่ต่ำกว่า

69
00:09:33,981 --> 00:09:37,265
Sol และ Fable เล็กน้อย

70
00:09:37,265 --> 00:09:44,580
ทางด้านภาพก็ดูจะต่ำกว่าอีกสองโมเดลเล็กน้อยเช่นกัน

71
00:09:44,580 --> 00:09:50,104
เพราะอีกสองเกมดูมีสไตล์ที่โดดเด่นกว่า

72
00:09:50,104 --> 00:09:55,776
มีฟังก์ชันที่น่าสนใจกว่า แต่โดยรวมแล้ว

73
00:09:55,776 --> 00:10:02,046
ถ้าให้เทียบกัน ผมว่า Sol ได้เปรียบกว่า แต่

74
00:10:02,046 --> 00:10:06,823
Fable น่าจะทำได้ดีที่สุดในรอบนี้

75
00:10:06,823 --> 00:10:13,540
เพราะเป็นเกมที่น่าสนใจที่สุด ผมจึงตัด Kimi K3

76
00:10:13,540 --> 00:10:20,258
ออกจากการแข่งขันครับ แต่ก็อย่างที่บอก Kimi K3

77
00:10:20,258 --> 00:10:27,125
ไม่ควรอายเลย เพราะทำผลงานที่น่าประทับใจมากจริง

78
00:10:27,125 --> 00:10:33,544
ๆ ผมจะได้แจ้งให้ทาง Kimi K3 ทราบด้วย ตอนนี้

79
00:10:33,544 --> 00:10:39,067
Kimi K3 ได้ถูกตัดออกจากการแข่งขันแล้ว

80
00:10:39,067 --> 00:10:45,337
และก็อย่างที่บอกครับ คุณภาพของผลงานจาก Sol

81
00:10:45,337 --> 00:10:52,204
ดูจะดีกว่าเล็กน้อย และผมก็ต้องคำนึงถึงเวลาด้วย

82
00:10:52,204 --> 00:11:01,011
ขอบคุณที่มีความเป็นตัวของตัวเองเมื่อเทียบกับโมเดลอื่นนะครับ

83
00:11:01,011 --> 00:11:06,535
ขอบคุณที่ลงแข่งขันในรอบนี้ครับ จริง ๆ

84
00:11:06,535 --> 00:11:13,103
แล้วเกมเป็นสิ่งที่สร้างยากอยู่แล้ว ผมขอ kill

85
00:11:13,103 --> 00:11:18,328
server ก่อนนะครับ เพราะผลงานจาก Sol

86
00:11:18,328 --> 00:11:24,448
นั้นคุณภาพดีกว่าจริง ๆ และใช้เวลาเพียง 22

87
00:11:24,448 --> 00:11:27,733
นาทีเทียบกับ 3 ชั่วโมง

88
00:11:27,733 --> 00:11:33,853
และนี่จึงนำเราเข้าสู่การแข่งขันชิงชนะเลิศ

89
00:11:33,853 --> 00:11:36,988
ระหว่างสองตัวเต็งครับ

90
00:11:36,988 --> 00:11:40,869
ซึ่งก็ไม่น่าแปลกใจเท่าไหร่

91
00:11:40,869 --> 00:11:47,288
รอบชิงจึงเป็นการพบกันระหว่าง Claude Fable 5

92
00:11:47,288 --> 00:11:53,259
จาก Anthropic กับ GPT 5.6 Sol จาก OpenAI

93
00:11:53,259 --> 00:12:01,470
พอเข้าสู่รอบนี้ก็เป็นสองตัวเต็งอันดับหนึ่งอย่างที่บอกไป

94
00:12:01,470 --> 00:12:03,709
จึงไม่น่าแปลกใจ

95
00:12:03,709 --> 00:12:12,069
แต่ก็เป็นการเปิดฉากการแข่งขันชิงชนะเลิศที่น่าสนใจมากครับ

96
00:12:12,069 --> 00:12:18,786
นี่คือโจทย์ของรอบสุดท้าย และมันยากจริง ๆ ครับ

97
00:12:18,786 --> 00:12:24,011
ผมเองยังไม่รู้ด้วยซ้ำว่ามันทำได้ไหม

98
00:12:24,011 --> 00:12:30,281
ไม่เคยทำมาก่อน แต่เราจะมาลองคิดดูไปด้วยกัน

99
00:12:30,281 --> 00:12:36,998
เป้าหมายหลักคือฝึก LoRA ซึ่งก็คือ fine-tuning

100
00:12:36,998 --> 00:12:43,417
adapter สำหรับโมเดลวิดีโอ LTX 2.3 บนเครื่อง

101
00:12:43,417 --> 00:12:49,986
DGX Spark ของผม และก็ต้องบอกโมเดลด้วยว่า DGX

102
00:12:49,986 --> 00:12:55,808
Spark คืออะไร คอนเซ็ปต์คือเราจะฝึก LoRA

103
00:12:55,808 --> 00:13:01,928
โดยอิงจากภาพยนตร์ยุคแรกเริ่มแบบไม่มีเสียง

104
00:13:01,928 --> 00:13:08,646
(early silent cinema) ไม่ใช่แค่ภาพยนตร์ดูเก่า

105
00:13:08,646 --> 00:13:09,840
ๆ นะครับ

106
00:13:09,840 --> 00:13:16,856
แต่เป็นลักษณะเฉพาะของฟิล์มที่ใช้ก้านหมุนด้วยมือ

107
00:13:16,856 --> 00:13:19,693
(hand-cranked film)

108
00:13:19,693 --> 00:13:25,365
ถ้าใครเคยดูหนังยุคนั้นมาบ้างก็จะเข้าใจ

109
00:13:25,365 --> 00:13:31,933
มีสไตล์ภาพที่โดดเด่นมากและเป็นเอกลักษณ์ จะมี

110
00:13:31,933 --> 00:13:37,457
raw source footage (ฟุตเทจต้นฉบับดิบ)

111
00:13:37,457 --> 00:13:43,428
ที่เป็นภาพยนตร์ยุคแรกเริ่มที่เป็น public

112
00:13:43,428 --> 00:13:49,399
domain (สาธารณสมบัติ) ไม่ผ่านการประมวลผล

113
00:13:49,399 --> 00:13:56,266
และมีให้เลือกเยอะมากครับ ส่วนที่เหลือใน prompt

114
00:13:56,266 --> 00:13:59,700
ก็แค่อธิบาย environment

115
00:13:59,700 --> 00:14:04,775
ให้โมเดลรู้ว่าควรจะฝึกอย่างไร ส่วน

116
00:14:04,775 --> 00:14:11,343
deliverables ที่ต้องส่งมอบคือน้ำหนักของ LoRA

117
00:14:11,343 --> 00:14:17,912
ซึ่งก็คือน้ำหนักของ adapter ที่ถูก fine-tune

118
00:14:17,912 --> 00:14:22,539
แล้วนั่นเอง เราจะมาทดสอบกันครับ

119
00:14:22,539 --> 00:14:30,302
ผมต้องทำทีละตัวเพราะการฝึกโมเดลใช้หน่วยความจำเยอะมาก

120
00:14:30,302 --> 00:14:34,034
แต่ละโมเดลจะได้ workspace

121
00:14:34,034 --> 00:14:39,557
แยกกันเพื่อไม่ให้มีการปนเปื้อนข้ามงาน

122
00:14:39,557 --> 00:14:47,320
แต่ละโมเดลจะมีชุดข้อมูลประมาณหนึ่งชั่วโมงของภาพยนตร์

123
00:14:47,320 --> 00:14:50,903
silent cinema หลายเรื่อง

124
00:14:50,903 --> 00:14:55,530
และนี่คือสไตล์ที่เรากำลังพูดถึง

125
00:14:55,530 --> 00:15:01,352
ภาพยนตร์เรื่องหนึ่งชื่อ The Great Train

126
00:15:01,352 --> 00:15:07,771
Robbery เป็นภาพยนตร์ที่อยู่ใน public domain

127
00:15:07,771 --> 00:15:11,503
ทั้งหมด เราก็จะดูว่า LoRA

128
00:15:11,503 --> 00:15:15,982
สามารถสร้างสไตล์นี้ออกมาได้ไหม

129
00:15:15,982 --> 00:15:19,415
ถ้าทำได้ก็คงจะดูเจ๋งมาก

130
00:15:19,415 --> 00:15:26,282
เพราะมีสไตล์ที่เป็นเอกลักษณ์ชัดเจนมากครับ โอเค

131
00:15:26,282 --> 00:15:30,462
ผมวาง prompt ลงใน Fable แล้ว

132
00:15:30,462 --> 00:15:37,030
ตอนนี้ก็กำลังเริ่มทำงาน ตั้งโหมดอัตโนมัติไว้

133
00:15:37,030 --> 00:15:43,748
ก็ปล่อยให้มันรันไปครับ น่าจะใช้เวลาสักพักใหญ่

134
00:15:43,748 --> 00:15:49,271
ๆ เพราะการฝึกแบบนี้ใช้เวลาหลายชั่วโมง

135
00:15:49,271 --> 00:15:52,406
ผมจะปล่อยให้รันบน DGX

136
00:15:52,406 --> 00:15:58,974
แล้วค่อยกลับมาเช็กตอนที่เสร็จครับ โอเค Fable

137
00:15:58,974 --> 00:16:05,095
เสร็จแล้วครับ รันมาทั้งคืน ใช้เวลาไป 4.37

138
00:16:05,095 --> 00:16:10,170
ชั่วโมง ถือเป็นการรันที่ไม่สั้นเลย

139
00:16:10,170 --> 00:16:13,454
เป็นการรันที่ยาวนานมาก

140
00:16:13,454 --> 00:16:20,023
ช่วงแรกเจอปัญหาเรื่องหน่วยความจำบ้างเล็กน้อย

141
00:16:20,023 --> 00:16:25,994
แต่แก้ไขจนเรียบร้อยและได้รันที่สะอาดครับ

142
00:16:25,994 --> 00:16:28,681
ดูได้ว่ามี element

143
00:16:28,681 --> 00:16:33,756
หลายอย่างที่โมเดลประเมินว่าทำได้ดี

144
00:16:33,756 --> 00:16:39,877
บางอย่างไม่สามารถ match กับ reference ได้

145
00:16:39,877 --> 00:16:46,147
แต่เราจะมาดูผลลัพธ์กันเองครับ อย่างไรก็ตาม

146
00:16:46,147 --> 00:16:51,819
Fable สามารถฝึก LoRA adapter ได้สำเร็จ

147
00:16:51,819 --> 00:16:56,895
ผมจะเก็บผลลัพธ์ไว้ดูหลังจากที่ Sol

148
00:16:56,895 --> 00:17:03,463
ทำเสร็จด้วยครับ ทีนี้ผมขอย้ายไปที่ Sol ก็วาง

149
00:17:03,463 --> 00:17:10,181
prompt ลงไป และก็กำลังจะเริ่มรันอีกประมาณ 4–5

150
00:17:10,181 --> 00:17:16,450
ชั่วโมง อาจจะเร็วกว่านั้นนิดหน่อยเพราะ Sol

151
00:17:16,450 --> 00:17:18,242
ดูจะเร็วกว่า

152
00:17:18,242 --> 00:17:23,914
ขอเช็กอีกครั้งในอีกสองสามชั่วโมงนะครับ

153
00:17:23,914 --> 00:17:30,333
ตอนนี้กำลังฝึกอยู่แล้วและ loss ลดลงเรื่อย ๆ

154
00:17:30,333 --> 00:17:33,767
ซึ่งเป็นสัญญาณที่ดีครับ

155
00:17:33,767 --> 00:17:38,992
และเนื่องจากครั้งนี้ผมทำช่วงกลางวัน

156
00:17:38,992 --> 00:17:45,709
ก็เลยเห็นกระบวนการฝึก LoRA ได้ชัดเจนครับ โอเค

157
00:17:45,709 --> 00:17:51,681
Sol ฝึกเสร็จแล้วครับ เสร็จเร็วกว่า Fable

158
00:17:51,681 --> 00:17:57,950
ตามที่คาดไว้ ใช้เวลาตั้งแต่ต้นจนจบประมาณ 2

159
00:17:57,950 --> 00:18:04,817
ชั่วโมง 30 นาที เร็วกว่า Fable อย่างเห็นได้ชัด

160
00:18:04,817 --> 00:18:11,684
แต่สิ่งนี้เราก็รู้อยู่แล้วตั้งแต่สามรอบแรกครับ

161
00:18:11,684 --> 00:18:18,252
ว่า Sol ค่อนข้างเร็วเมื่อเทียบกับ Fable โอเค

162
00:18:18,252 --> 00:18:23,477
ถึงเวลาการแข่งขันชิงชนะเลิศแล้วครับ

163
00:18:23,477 --> 00:18:26,911
ผลการตัดสินครั้งสุดท้าย

164
00:18:26,911 --> 00:18:33,330
ขอบอกก่อนเลยว่าทั้งสองโมเดลสามารถสร้าง LoRA

165
00:18:33,330 --> 00:18:35,420
ออกมาได้สำเร็จ

166
00:18:35,420 --> 00:18:46,616
ดังนั้นนี่จึงเป็นการแข่งขันที่เป็นการแข่งขันกันเรื่องคุณภาพอย่างแท้จริงครับ

167
00:18:46,616 --> 00:18:53,333
ผมจะตัดสินจากว่าแต่ละโมเดลปรับตัวเข้ากับสไตล์

168
00:18:53,333 --> 00:18:59,901
silent cinema ต้นฉบับจากชุดข้อมูลได้ดีแค่ไหน

169
00:18:59,901 --> 00:19:06,171
รวมถึงคุณภาพโดยรวมด้วย ข้อควรระวังในการฝึก

170
00:19:06,171 --> 00:19:10,351
LoRA และ fine-tuning adapter

171
00:19:10,351 --> 00:19:14,829
คือถ้าฝึกกับชุดข้อมูลมากเกินไป

172
00:19:14,829 --> 00:19:21,547
คุณภาพจะตกลงครับ ส่วนโมเดล LTX ที่เราจะใช้คือ

173
00:19:21,547 --> 00:19:25,279
LTX 2.3 ถือว่าใหม่พอสมควร

174
00:19:25,279 --> 00:19:30,056
แต่เป็นโมเมลวิดีโอที่คุณภาพดีมาก

175
00:19:30,056 --> 00:19:36,027
โดยทั่วไปไม่ค่อยสร้างภาพ AI แปลก ๆ ออกมา

176
00:19:36,027 --> 00:19:40,804
ก็เลยเป็นจุดที่ต้องคอยสังเกตครับ

177
00:19:40,804 --> 00:19:49,612
ขอแสดงตัวอย่างบางส่วนที่ใช้ฝึกและสไตล์ที่เราคาดหวังอีกครั้ง

178
00:19:49,612 --> 00:19:55,434
เรื่องนี้ชื่อ A Trip Down Market Street

179
00:19:55,434 --> 00:19:59,613
เป็นหนึ่งในภาพยนตร์ที่ให้ฝึก

180
00:19:59,613 --> 00:20:04,241
เรามองหาสไตล์แบบนี้ครับ ปี 1906

181
00:20:04,241 --> 00:20:08,421
ภาพสั่นไหวนิดหน่อยใช่ไหมครับ

182
00:20:08,421 --> 00:20:12,004
อีกเรื่องที่ชื่อว่า Cops

183
00:20:12,004 --> 00:20:18,871
เกิดตอนหลังกว่านิดหน่อย เลยลื่นไหลกว่าเล็กน้อย

184
00:20:18,871 --> 00:20:25,290
แต่ก็สไตล์คล้ายกันนะครับ มีการ์ดข้อความด้วย

185
00:20:25,290 --> 00:20:29,320
อันนี้เป็นของ Buster Keaton

186
00:20:29,320 --> 00:20:34,993
นี่คือสไตล์ที่เรากำลังมองหาครับ prompt

187
00:20:34,993 --> 00:20:40,516
แรกที่ให้กับทั้งคู่ และจะมีสาม prompt

188
00:20:40,516 --> 00:20:46,487
รวมเป็นสามรอบ คือ "people walking down a

189
00:20:46,487 --> 00:20:51,563
boardwalk" (คนเดินลงจากบอร์ดวอล์ก)

190
00:20:51,563 --> 00:20:58,430
ภาพแรกนี้คือผลจาก LTX ปกติเลยนะครับ ไม่มี LoRA

191
00:20:58,430 --> 00:21:04,699
ไม่ได้พูดถึง silent cinema เป็นแค่วิดีโอ 5

192
00:21:04,699 --> 00:21:11,268
วินาทีของคนเดินลงจากบอร์ดวอล์ก ผลออกมาง่าย ๆ

193
00:21:11,268 --> 00:21:15,746
ตรงไปตรงมา ภาพต่อมาคือสั่ง LTX

194
00:21:15,746 --> 00:21:22,613
ให้สร้างวิดีโอคนเดินบนบอร์ดวอล์กในสไตล์ silent

195
00:21:22,613 --> 00:21:28,136
cinema โดยใส่เป็นข้อความใน prompt เลย

196
00:21:28,136 --> 00:21:34,854
อันนี้ก็ยังไม่มี LoRA นะครับ เป็นเพียงการตั้ง

197
00:21:34,854 --> 00:21:39,482
baseline ให้เห็นพื้นฐานเท่านั้น

198
00:21:39,482 --> 00:21:45,304
ผลออกมาไม่เลวเลย แต่อาจจะไม่ค่อย grainy

199
00:21:45,304 --> 00:21:51,723
(มีเม็ดฟิล์ม) และอาจจะลื่นไหลเกินไปนิดหน่อย

200
00:21:51,723 --> 00:21:57,246
ส่วนใบหน้าคนก็มีความผิดเพี้ยนอยู่บ้าง

201
00:21:57,246 --> 00:22:03,068
ทีนี้มาดูผลงานชิ้นแรกจาก Fable ครับ คือ

202
00:22:03,068 --> 00:22:09,785
"people walking down a boardwalk" โดยใช้ LoRA

203
00:22:09,785 --> 00:22:15,906
ที่เพิ่งฝึกจาก Fable ครับ วิดีโอ 5 วินาที

204
00:22:15,906 --> 00:22:19,190
จะเห็นว่ายังไม่สมบูรณ์

205
00:22:19,190 --> 00:22:25,460
มีบางจุดที่ดูเหมือนถูกบีบอัดหรือผิดสัดส่วน

206
00:22:25,460 --> 00:22:30,386
แต่ก็ได้เม็ดฟิล์มแบบยุคนั้นมาบ้าง

207
00:22:30,386 --> 00:22:33,222
ขอบด้านข้างดูไหม้ ๆ

208
00:22:33,222 --> 00:22:42,926
เล็กน้อย ซึ่งทำให้ดู authentic สมจริงยิ่งขึ้นแม้ว่าตัวคนจะดูมัว ๆ

209
00:22:42,926 --> 00:22:49,494
ไปบ้างก็ตาม ต่อมาเป็นผลงานของ GPT 5.6 Sol ใน

210
00:22:49,494 --> 00:22:55,167
prompt เดียวกันครับ คนเดินบนบอร์ดวอล์ก

211
00:22:55,167 --> 00:23:00,093
มาดูผลกัน ลื่นไหลกว่า สะอาดตากว่า

212
00:23:00,093 --> 00:23:06,661
ดูคล้ายกับผลจาก prompt ปกติที่ไม่มี LoRA มาก

213
00:23:06,661 --> 00:23:10,244
คุณภาพดูจะดีกว่านิดหน่อย

214
00:23:10,244 --> 00:23:16,215
แต่ผลก็ใกล้เคียงกันมากครับ เราจะทำอีกสอง

215
00:23:16,215 --> 00:23:22,336
prompt ครับ prompt ที่สองคือ "an airplane

216
00:23:22,336 --> 00:23:26,217
flying over the mountains"

217
00:23:26,217 --> 00:23:32,785
(เครื่องบินบินเหนือภูเขา) ผลงานจาก Fable คือ

218
00:23:32,785 --> 00:23:36,368
เข้ากับสไตล์ได้ดีมากครับ

219
00:23:36,368 --> 00:23:40,996
มีเครื่องบินอยู่ตรงนั้น ดูดีเลย

220
00:23:40,996 --> 00:23:44,578
และก็มีภูเขาอยู่ด้านหลัง

221
00:23:44,578 --> 00:23:48,907
ไม่แน่ใจว่าคนที่เดินอยู่รอบ ๆ

222
00:23:48,907 --> 00:23:59,656
รถพ่วงคืออะไร แต่สไตล์นั้นเข้าเป้าแน่นอนครับ ชอบเม็ดฟิล์มแบบหนังยุคแรก ๆ

223
00:23:59,656 --> 00:24:08,015
ของ Fable และบอกได้เลยว่ามันต่างจากการใส่ prompt เปล่า ๆ

224
00:24:08,015 --> 00:24:14,584
แน่นอน คือ LoRA มีผลจริง ๆ ครับ ทีนี้มาดูของ

225
00:24:14,584 --> 00:24:20,107
GPT 5.6 Sol บ้าง มีเครื่องบินอยู่ครับ

226
00:24:20,107 --> 00:24:26,974
ถือว่าเป็นเครื่องบินที่บินเหนือภูเขาได้ถูกต้อง

227
00:24:26,974 --> 00:24:32,796
แต่เม็ดฟิล์มดูจะน้อยกว่า ลื่นไหลไปหน่อย

228
00:24:32,796 --> 00:24:39,215
จนเกือบจะลื่นไหลเกินไปด้วยซ้ำ เครื่องบินของ

229
00:24:39,215 --> 00:24:45,484
Sol เคลื่อนที่ลื่นไหลมาก เทียบกับของ Fable

230
00:24:45,484 --> 00:24:50,859
ที่สั่นไหวมากกว่า และที่ชอบของ Fable

231
00:24:50,859 --> 00:24:56,382
คือเครื่องบินนั้นเป็นแบบยุคนั้นจริง ๆ

232
00:24:56,382 --> 00:25:03,249
คือเครื่องบินในช่วงต้นศตวรรษที่ 20 ส่วนของ Sol

233
00:25:03,249 --> 00:25:08,772
เป็นเครื่องบินสมัยใหม่กว่า ไม่มีใบพัด

234
00:25:08,772 --> 00:25:15,191
ดูเหมือนเครื่องร่อนเสียมากกว่า ถือว่า Fable

235
00:25:15,191 --> 00:25:21,610
ได้แต้มนี้ไปครับ แม้ว่า Sol จะยึดตาม prompt

236
00:25:21,610 --> 00:25:26,686
มากกว่าก็ตาม สำหรับ prompt สุดท้าย

237
00:25:26,686 --> 00:25:32,508
ผมอยากทำอะไรที่บ้าน ๆ หน่อย คือ "a wild

238
00:25:32,508 --> 00:25:38,927
shootout between cops and robbers in space"

239
00:25:38,927 --> 00:25:46,689
(การยิงปะทะกันอย่างดุเดือดระหว่างตำรวจกับโจรในอวกาศ)

240
00:25:46,689 --> 00:25:52,959
ซึ่ง obviously ไม่มีวิดีโอไหนมีฉากอวกาศเลย

241
00:25:52,959 --> 00:25:58,930
แต่ก็มีบางเรื่องที่มีตำรวจกับโจรอยู่บ้าง

242
00:25:58,930 --> 00:26:05,648
นี่คือผลงานของ Claude Fable ใน prompt นี้ครับ

243
00:26:05,648 --> 00:26:08,036
ดูจะวุ่นวายหน่อย

244
00:26:08,036 --> 00:26:12,515
คาดว่าน่าจะเป็นตำรวจกับโจรครับ

245
00:26:12,515 --> 00:26:15,052
ภาพคนผิดเพี้ยนมาก

246
00:26:15,052 --> 00:26:21,322
ถ้าไม่นับเรื่องความผิดเพี้ยนของตัวละครแล้ว

247
00:26:21,322 --> 00:26:27,741
สภาพแวดล้อมก็ไม่ได้อยู่ในอวกาศซึ่งเป็นปัญหา

248
00:26:27,741 --> 00:26:32,817
แต่คุณภาพของฟิล์มในแง่ของเม็ดฟิล์ม

249
00:26:32,817 --> 00:26:34,757
การเคลื่อนไหว

250
00:26:34,757 --> 00:26:42,072
และการกระพริบของภาพนั้นเลียนแบบสไตล์ได้ดีอยู่ครับ

251
00:26:42,072 --> 00:26:46,998
ทั้งนี้ก็ต้องยอมรับว่าเป็น prompt

252
00:26:46,998 --> 00:26:57,746
ที่ยากเพราะมีแอ็กชันเยอะและไม่มีข้อมูลอ้างอิงสำหรับฉากอวกาศในสไตล์นี้เลย

253
00:26:57,746 --> 00:27:03,419
โอเค นี่คือผลของ GPT 5.6 Sol ใน prompt

254
00:27:03,419 --> 00:27:08,047
เดียวกันครับ มาดูกัน ก็ไม่รู้สิ

255
00:27:08,047 --> 00:27:14,914
คนดูจริงขึ้นกว่า แต่ก็ไม่มีการยิงปะทะกันจริง ๆ

256
00:27:14,914 --> 00:27:19,541
และก็ไม่ได้อยู่ในอวกาศเหมือนกัน

257
00:27:19,541 --> 00:27:23,273
ดูจะอยู่ในสำนักงานมากกว่า

258
00:27:23,273 --> 00:27:30,588
ทั้งสองชิ้นเอาฉากมาจากชุดข้อมูลที่ใช้ฝึกโดยตรงเลย

259
00:27:30,588 --> 00:27:36,410
เพราะโมเดลไม่มีข้อมูลอ้างอิงเรื่องอวกาศ

260
00:27:36,410 --> 00:27:42,530
จึงดึงฉากจากชุดข้อมูลภาพยนตร์มาใช้แทนครับ

261
00:27:42,530 --> 00:27:48,054
ดังนั้นทั้งคู่ต่างก็มีปัญหากับ prompt

262
00:27:48,054 --> 00:27:54,771
นี้เหมือนกัน ขออีกครั้งกับผลงานของ Fable ครับ

263
00:27:54,771 --> 00:27:58,951
ใช่เลย prompt ยากจริง ๆ โอเค

264
00:27:58,951 --> 00:28:05,072
ขอให้ดูแบบเคียงข้างกันนะครับ ด้านซ้ายเป็น

265
00:28:05,072 --> 00:28:08,654
Fable และด้านขวาเป็น Sol

266
00:28:08,654 --> 00:28:12,386
เพื่อเทียบสไตล์ที่ต่างกัน

267
00:28:12,386 --> 00:28:20,298
รู้สึกว่าในเรื่องบอร์ดวอล์กนั้นทั้งคู่ใกล้เคียงกันมาก

268
00:28:20,298 --> 00:28:25,523
อาจจะมีสไตล์ที่หนักแน่นกว่านิดหน่อย

269
00:28:25,523 --> 00:28:30,897
แต่ก็ถือว่าใกล้เคียงกัน ต่อมา prompt

270
00:28:30,897 --> 00:28:35,823
เครื่องบินครับ ซ้าย Fable ขวา Sol

271
00:28:35,823 --> 00:28:38,660
ในรอบนี้ผมว่า Fable

272
00:28:38,660 --> 00:28:45,228
ทำได้ดีกว่าในการถ่ายทอดคุณภาพของยุคนั้นออกมา

273
00:28:45,228 --> 00:28:51,348
โดยเฉพาะเครื่องบินที่เป็นแบบยุคนั้นชัดเจน

274
00:28:51,348 --> 00:28:56,424
คือเป็นเครื่องบินใบพัด ส่วนของ Sol

275
00:28:56,424 --> 00:29:03,291
นั้นเหมือนเครื่องบินเจ็ตเสียมากกว่า แม้ว่า Sol

276
00:29:03,291 --> 00:29:09,859
จะได้ภูเขามาถูกต้องก็ตาม เครื่องบินของ Fable

277
00:29:09,859 --> 00:29:14,487
กำลังบินขึ้น มีภูเขาเป็นฉากหลัง

278
00:29:14,487 --> 00:29:21,204
สังเกตขอบของวิดีโอ Fable จะเห็นว่าขอบมีการจาง

279
00:29:21,204 --> 00:29:22,304
ๆ

280
00:29:22,304 --> 00:29:34,247
ซึ่งเป็นลักษณะเฉพาะของฟิล์มยุคนั้น ในขณะที่ Sol ก็ทำได้ดีแต่พลาดรายละเอียดเล็ก ๆ

281
00:29:34,247 --> 00:29:40,666
น้อย ๆ เหล่านี้ไปครับ สำหรับ prompt สุดท้าย

282
00:29:40,666 --> 00:29:43,651
การยิงปะทะกันในอวกาศ

283
00:29:43,651 --> 00:29:52,160
ทั้งคู่ต่างก็มีปัญหาเพราะไม่มีข้อมูลอ้างอิงในชุดข้อมูลเลย

284
00:29:52,160 --> 00:29:58,729
ขอให้ดูอีกครั้งครับ ซ้ายคือ Fable ขวาคือ Sol

285
00:29:58,729 --> 00:30:04,849
ดูติด ๆ กันได้ จะเห็นได้อีกครั้งว่า Fable

286
00:30:04,849 --> 00:30:13,657
ทำเรื่องการกระพริบของภาพและเนื้อสัมผัสของสไตล์นั้นได้ดีกว่า

287
00:30:13,657 --> 00:30:19,180
ส่วนของ Sol ดูจะขัดเกลาเกินไปนิดหน่อย

288
00:30:19,180 --> 00:30:27,689
แม้ทั้งคู่จะมีปัญหากับตัวละครและเนื้อเรื่องเหมือนกันก็ตาม

289
00:30:27,689 --> 00:30:35,750
และนี่อีกตัวอย่างครับของสไตล์จากชุดข้อมูลที่ต้องการแบบ

290
00:30:35,750 --> 00:30:36,850
grainy

291
00:30:36,850 --> 00:30:42,971
พร้อมการเคลื่อนไหวเป็นเอกลักษณ์ของยุคนั้น

292
00:30:42,971 --> 00:30:48,942
พูดตรง ๆ ว่าทั้งคู่ทำได้ดีพอสมควรเลยครับ

293
00:30:48,942 --> 00:30:54,316
เป็นการแข่งขันที่สูสีมาก การฝึก LoRA

294
00:30:54,316 --> 00:30:57,302
ไม่ใช่เรื่องง่ายครับ

295
00:30:57,302 --> 00:31:02,377
โดยเฉพาะกับเนื้อหาแบบวิดีโอเช่นนี้

296
00:31:02,377 --> 00:31:06,557
เพราะนี่เป็นโมเดลสร้างวิดีโอ

297
00:31:06,557 --> 00:31:16,260
และชุดข้อมูลที่ให้ฝึกก็ค่อนข้างเล็กเมื่อเทียบกับที่ห้องปฏิบัติการ

298
00:31:16,260 --> 00:31:19,544
AI มืออาชีพใช้ฝึกโมเดล

299
00:31:19,544 --> 00:31:23,873
แต่ก็ต้องมีผู้ชนะเพียงคนเดียว

300
00:31:23,873 --> 00:31:28,949
และผลขึ้นอยู่กับการตัดสินของผมครับ

301
00:31:28,949 --> 00:31:34,472
อาจจะมีคนไม่เห็นด้วยกับการตัดสินของผม

302
00:31:34,472 --> 00:31:37,159
แต่นี่คือช่องของผม

303
00:31:37,159 --> 00:31:44,026
ผมก็เลยได้เป็นผู้มอบมงกุฎให้ผู้ชนะของ AI Royal

304
00:31:44,026 --> 00:31:48,355
Rumble เดือนกรกฎาคม 2026 ครับ

305
00:31:48,355 --> 00:31:52,237
เป็นการแข่งขันที่ดีมากครับ

306
00:31:52,237 --> 00:31:59,253
ผมดีใจที่รอบสุดท้ายไม่ใช่การถล่มทลายทิ้งห่างกัน

307
00:31:59,253 --> 00:32:05,672
ขอใช้สัญชาตญาณจากการดูวิดีโอเหล่านี้หลายรอบ

308
00:32:05,672 --> 00:32:12,389
ว่าโมเดลไหนถ่ายทอดภาพยนตร์ต้นฉบับได้ดีกว่ากัน

309
00:32:12,389 --> 00:32:18,958
และโมเดลไหนที่ผมควรใช้จริง ๆ หากต้องการสร้าง

310
00:32:18,958 --> 00:32:23,287
fine-tuning adapter หรือ LoRA

311
00:32:23,287 --> 00:32:30,154
เพื่อสร้างวิดีโอสไตล์ early silent cinema ครับ

312
00:32:30,154 --> 00:32:37,021
ดังนั้น ผู้ชนะของ AI Royal Rumble เดือนกรกฎาคม

313
00:32:37,021 --> 00:32:42,842
2026 คือ Fable ครับ นั่นคือ Fable 5 จาก

314
00:32:42,842 --> 00:32:49,560
Anthropic ซึ่งเป็นโมเดล frontier ระดับท็อปของ

315
00:32:49,560 --> 00:32:55,382
Claude ตั้งแต่เข้าสู่การแข่งขันมา Fable

316
00:32:55,382 --> 00:32:57,920
ก็เป็นตัวเต็งครับ

317
00:32:57,920 --> 00:33:08,220
เป็นโมเดลที่ผมส่วนตัวรู้สึกว่าเป็นโมเดลที่ดีที่สุดโดยรวมสำหรับงานหนัก

318
00:33:08,220 --> 00:33:09,320
ๆ

319
00:33:09,320 --> 00:33:17,232
แบบ long-horizon tasks (งานที่ใช้เวลานาน) โมเดลอื่น ๆ

320
00:33:17,232 --> 00:33:31,115
อาจจะเก่งเรื่องงานเฉพาะด้าน แต่โดยรวมแล้ว สำหรับงานลักษณะนี้ที่ใช้เวลาหลายชั่วโมงและยากจริง ๆ

321
00:33:31,115 --> 00:33:34,548
ผมรู้สึกมาตลอดว่า Fable

322
00:33:34,548 --> 00:33:42,759
ตั้งแต่ออกมานั้นเป็นโมเดลที่ดีที่สุดสำหรับงานแบบนี้ครับ

323
00:33:42,759 --> 00:33:44,998
ดังนั้น Fable 5

324
00:33:44,998 --> 00:33:52,313
จึงคว้าเข็มขัดแชมป์ของการแข่งขันครั้งแรกนี้ไปครับ

325
00:33:52,313 --> 00:33:56,492
ส่วน Sol ที่น่าสงสารตกเวทีไป

326
00:33:56,492 --> 00:34:05,599
ผมขอบอกว่าประทับใจกับความสมดุลระหว่างคุณภาพและความเร็วมากครับ

327
00:34:05,599 --> 00:34:08,435
เพราะเร็วกว่า Fable

328
00:34:08,435 --> 00:34:13,510
และเร็วกว่าอีกหลายโมเดลอย่างชัดเจน

329
00:34:13,510 --> 00:34:19,183
และผลงานก็แย่กว่าเพียงเล็กน้อยเท่านั้น

330
00:34:19,183 --> 00:34:22,616
แต่ในการแข่งขันครั้งนี้

331
00:34:22,616 --> 00:34:29,035
คุณภาพคือสิ่งสำคัญที่สุด ไม่ใช่ความเร็วครับ

332
00:34:29,035 --> 00:34:32,320
อย่างไรก็ตาม ในงานจริง

333
00:34:32,320 --> 00:34:38,440
ถ้าใครต้องการทั้งคุณภาพสูงและความเร็ว Sol

334
00:34:38,440 --> 00:34:44,113
น่าจะเป็นตัวเลือกที่น่าประทับใจมากครับ

335
00:34:44,113 --> 00:34:46,352
แต่รอบนี้ Fable

336
00:34:46,352 --> 00:34:51,129
คว้าเข็มขัดแชมป์ประจำเดือนไปครับ

337
00:34:51,129 --> 00:34:57,249
ทุกเดือนมีโมเดล frontier ตัวใหม่ออกมาเสมอ

338
00:34:57,249 --> 00:35:03,221
และคนดูก็ชอบวิดีโอแนวนี้ครับ ก็น่าสนใจดี

339
00:35:03,221 --> 00:35:08,595
เพราะในช่องนี้ ผมมักทำคอนเทนต์สั้น ๆ

340
00:35:08,595 --> 00:35:20,388
เยอะ ผมทำวิดีโอ first look หลายชิ้นที่เป็นแบบจบในตัว one-shot แม้ในวิดีโออื่น ๆ

341
00:35:20,388 --> 00:35:21,488
ของผม

342
00:35:21,488 --> 00:35:28,056
ก็ไม่ได้ทำอะไรแบบนี้ที่ใช้เวลาหลายชั่วโมงนัก

343
00:35:28,056 --> 00:35:33,281
บางครั้งงานก็ใช้เวลาถึง 3–4 ชั่วโมง

344
00:35:33,281 --> 00:35:37,610
เวลาจับคู่โมเดลเปรียบเทียบกัน

345
00:35:37,610 --> 00:35:42,686
ผมบางครั้งก็ทำเป็นงาน ๆ แยกต่างหาก

346
00:35:42,686 --> 00:35:45,373
แต่ก็น่าสนใจดีครับ

347
00:35:45,373 --> 00:35:53,882
เราจะดูกันตอนปลายเดือนสิงหาคมว่าคนดูชอบวิดีโอนี้หรือเปล่า

348
00:35:53,882 --> 00:36:00,151
และเดือนสิงหาคมก็จะมีโมเดลใหม่ ๆ เยอะแน่ ๆ

349
00:36:00,151 --> 00:36:06,869
ผมทราบว่าจะมีโมเดล Grok ใหม่ออกมา อาจจะมี GPT

350
00:36:06,869 --> 00:36:13,586
6 (มีข่าวลือเรื่อง GPT 6) ข่าวลือเรื่อง Fable

351
00:36:13,586 --> 00:36:19,856
5.1 ก็มีด้วย แล้วเจ้าตัวไหนจะออกมาจริงบ้าง

352
00:36:19,856 --> 00:36:26,425
เรามาดูกันครับ และแน่นอนว่าน่าจะมีโมเดล open

353
00:36:26,425 --> 00:36:28,514
weights ใหม่ ๆ

354
00:36:28,514 --> 00:36:41,800
ออกมาด้วย เช่นโมเดล Kimi K3 หรือพวก BLM ก็ต้องดูกันต่อไปครับ ถ้าโมเดลเหล่านั้นออกมาจริง ๆ

355
00:36:41,800 --> 00:36:49,712
ผมก็จะจัดการแข่งขันอีกครั้งในช่วงปลายเดือนสิงหาคมครับ

356
00:36:49,712 --> 00:36:56,579
แต่ตอนนี้ขอรอดูไปก่อน สำหรับการแข่งขันครั้งนี้

357
00:36:56,579 --> 00:37:01,655
ผู้ชนะอย่างเป็นทางการก็คือ Fable 5

358
00:37:01,655 --> 00:37:07,327
อีกครั้งครับ ขอบคุณทุกท่านที่รับชมครับ

359
00:37:07,327 --> 00:37:10,761
ถ้าใครมีความคิดเห็นอะไร

360
00:37:10,761 --> 00:37:15,388
ก็คอมเมนต์กันเข้ามาได้เลยนะครับ

361
00:37:15,388 --> 00:37:19,867
ว่าคิดว่าใครจะชนะการแข่งขันนี้

362
00:37:19,867 --> 00:37:27,331
ผมทราบดีว่ารอบสุดท้ายกับเรื่องวิดีโอนั้นเป็นเรื่อง

363
00:37:27,331 --> 00:37:33,153
subjective (ขึ้นกับมุมมองส่วนบุคคล) มาก

364
00:37:33,153 --> 00:37:43,304
เป็นความรู้สึกโดยรวมของผมเองว่าโมเดลไหนถ่ายทอดงานต้นฉบับได้ดีกว่ากัน

365
00:37:43,304 --> 00:37:47,334
แต่ก็คอมเมนต์มาได้เลยนะครับ

366
00:37:47,334 --> 00:37:50,917
แชร์ความคิดเห็นกันเข้ามา

367
00:37:50,917 --> 00:37:55,694
ถ้าใครไม่เห็นด้วยก็ไม่เป็นไรครับ

368
00:37:55,694 --> 00:38:00,172
แต่นี่ก็เป็นอันจบวิดีโอนี้ครับ

369
00:38:00,172 --> 00:38:00,400
ขอบคุณที่รับชมครับ