AI Royal Rumble: Part 2 (Kimi K3 v. Fable v. Sol v. Grok v. GLM)
สรุปย่อ
ประเด็นสำคัญจากวิดีโอ
- **ช่อง:** Tonbi's AI Garage · **ความยาว:** ~38 นาที · **ลิงก์:** https://www.youtube.com/watch?v=J934tcOdTXg
# สรุป: AI Royal Rumble: Part 2 (Kimi K3 v. Fable v. Sol v. Grok v. GLM) - **ช่อง:** Tonbi's AI Garage · **ความยาว:** ~38 นาที · **ลิงก์:** https://www.youtube.com/watch?v=J934tcOdTXg ## ประเด็นหลัก - ภาคสองของการแข่งขัน AI Royal Rumble เดือนกรกฎาคม 2026 ครอบคลุมรอบที่สามและรอบชิงชนะเลิศ หลังจากรอบหนึ่งและรอบสองได้ตัด GLM 5.2 และ Grok 4.5 ออกไปแล้ว - รอบที่สามเป็นการพัฒนาเกม โดยใช้ Hermes Agent รันโมเดลที่เหลือสามตัว (Fable, Sol, Kimi K3) ให้สร้างเกมจาก prompt เดียวกันแล้วนำมาเปรียบเทียบกัน - ผลงานรอบสาม: Fable สร้างเกม Curtain Call ที่มีธีมการแสดงละคร Sol สร้างเกม Afterimage Station และ Kimi K3 สร้างเกม signal ที่มีกลไก sandbox และฟิวส์ - Kimi K3 ถูกคัดออกในรอบสาม เนื่องจากคุณภาพภาพดูต่ำกว่าเล็กน้อย และใช้เวลานานกว่า (3 ชั่วโมงเทียบกับ 22 นาทีของ Sol) - รอบชิงชนะเลิศเป็นการแข่งขันระหว่าง Fable (Anthropic) กับ Sol (OpenAI) ในงานฝึก LoRA fine-tuning adapter สำหรับโมเดลวิดีโอ LTX 2.3 บนเครื่อง NVIDIA DGX Spark - โจทย์รอบชิงคือให้โมเดลฝึก LoRA อิงจากภาพยนตร์ silent cinema ยุคแรกเริ่ม เช่น The Great Train Robbery และ A Trip Down Market Street ที่เป็น public domain - Fable ใช้เวลาฝึก 4.37 ชั่วโมง ส่วน Sol เร็วกว่ามากที่ 2.5 ชั่วโมง - มีการทดสอบผลลัพธ์ด้วย 3 prompt: คนเดินบนบอร์ดวอล์ก, เครื่องบินบินเหนือภูเขา, และการยิงปะทะกันในอวกาศ - Fable สามารถถ่ายทอดสไตล์ silent cinema ได้ดีกว่า โดยเฉพาะเม็ดฟิล์ม การกระพริบของภาพ และรายละเอียดอย่างเครื่องบินใบพัดที่เป็นยุคนั้นจริง ๆ - ผู้ชนะของ AI Royal Rumble เดือนกรกฎาคม 2026 คือ Fable 5 จาก Anthropic ครับ - พิธีกรอาจจะจัดการแข่งขันอีกครั้งในปลายเดือนสิงหาคม หากมีโมเดลใหม่ ๆ ออกมา เช่น Grok รุ่นใหม่, GPT 6, Fable 5.1 หรือโมเดล open weights ใหม่ ๆ ## ความเห็นสรุป เป็นการแข่งขันที่สนุกและเข้าถึงจุดที่ผู้ชนะตัวจริงคือโมเดลที่ความสามารถสูงระดับแนวหน้าอย่าง Fable จาก Anthropic โดยเฉพาะในงานยาก ๆ อย่างการฝึก LoRA สำหรับวิดีโอ Fable แม้จะช้ากว่า แต่คุณภาพการถ่ายทอดสไตล์และความเข้ากับยุคสมัยของภาพยนตร์ต้นฉบับนั้นอยู่ในระดับที่น่าประทับใจ ส่วน Sol ถือเป็นโมเดลที่น่าจับตามองสำหรับการใช้งานจริงเพราะเร็วและมีคุณภาพใกล้เคียง ผมรอติดตามการแข่งขันครั้งต่อไปในเดือนสิงหาคมครับ
คำแปลเต็ม
แปลตามบทสนทนาต้นฉบับ ปรับเป็นภาษาไทยธรรมชาติ
ยินดีต้อนรับกลับมาสู่ภาคสองของ AI Royal Rumble เดือนกรกฎาคม 2026 ที่เราจะมาตัดสินกันให้รู้แล้วรู้รอดว่าโมเดลระดับ frontier ตัวไหนคือที่สุด ถ้าใครดูภาคนี้ก่อน ก็อยากให้ย้อนไปดูภาคหนึ่งเพื่อดูว่าสองรอบแรกเกิดอะไรขึ้นบ้าง เพราะภาคนี้จะเป็นรอบที่สามและรอบที่สี่ก่อนที่เราจะมอบมงกุฎให้ผู้ชนะเด็ดขาดครับ
พอสรุปแล้ว รอบแรกเป็นโปรเจกต์ทำ landing page ที่ใช้ typography และ motion แบบเฉพาะตัว เป็น landing page ที่วิวัฒนาการไปเรื่อย ๆ ตอนที่เลื่อนจอลง ทุกโมเดลทำได้ดีมากแม้งานจะยาก แต่สุดท้ายผู้แพ้ของรอบแรกคือ GLM 5.2 ที่ถูกตัดออก เป็นโมเดลเดียวที่ output เพี้ยน คือไม่ทำงานเลยครับ
จากนั้นเราก็เข้าสู่รอบสอง เป็นการทดสอบเทรดดิ้งที่ agent ต้องค้นคว้า ออกแบบกลยุทธ์การเทรด และเขียน paper trader (โปรแกรมจำลองการเทรด) ให้ทำตามกลยุทธ์นั้นไปตามเวลา พอลองรันจริง โมเดลที่ทำได้แย่ที่สุดคือ Grok 4.5 จึงถูกตัดออกจากการแข่งขัน เจ้าตัวรับความเสี่ยงสูงที่สุด ทำการเทรดเยอะกว่าโมเดลอื่นเยอะมาก และก็เร็วกว่าด้วย แต่สุดท้ายผล P&L (กำไรขาดทุน) ติดลบประมาณ 12% ครับ Grok 4.5 จึงถูกคัดออกในรอบสอง
ถึงตรงนี้เราก็เข้าสู่รอบสาม และนี่คือสถานการณ์ปัจจุบัน โดยที่ Fable, GPT 5.6, Sol และ Kimi K3 เป็นสามโมเดลสุดท้ายที่ยังเหลืออยู่ รอบสามจะเป็นการพัฒนาเกม น่าจะสนุกและน่าสนใจดีครับ
จากนั้นในรอบชิงชนะเลิศ สองโมเดลสุดท้ายจะได้ทำงานฝึกโมเดล คือต้องฝึก fine-tuning adapter ที่เรียกว่า LoRA บนเครื่อง DGX Spark ของผมเอง สำหรับโมเดลสร้างวิดีโอ ซึ่งผมเองก็ไม่เคยทำมาก่อน จะทำได้หรือเปล่าก็ไม่รู้ แต่เราจะมาดูความเป็นไปได้ไปด้วยกันครับ เริ่มกันเลย
ถ้าใครเองก็รัน agent และอยากเข้าถึง LM wikis (คลังความรู้เกี่ยวกับโมเดลภาษา) ที่ผมใช้ค้นคว้าและสร้างวิดีโอเหล่านี้จริง ๆ ก็แวะดูโปรเจกต์ agentwikis.com ของผมได้เลยครับ ผมแชร์ทุกอย่างไว้ที่นั่น
## รอบสาม: การพัฒนาเกม — ผลงานของ Fable
และนั่นคือผลงานของ GPT 5.6 (Sol) ครับ ทีนี้มาดูการตีความของ Claude Fable กันบ้าง เกมนี้ชื่อว่า Take Four น่าสนใจดีครับ เริ่มด้วยคำว่า "Places, please" คล้าย ๆ จะไปทางคอนเซ็ปต์ละครหรือคอนเสิร์ต มี vibe แบบการแสดงบนเวที ลองกดตัด take ดูนะครับ เป็นการตีความที่น่าสนใจมาก
ลองเล่นดูครับ ตัวละครจะตัวเล็ก รอแป๊บ โอเค กระโดดขึ้นไปตรงนี้ได้ ยากกว่าที่คิดเยอะเลย ต้องรอให้ ghost ของเราเอาของไปก่อน แต่เสียเวลาไปเยอะพอสมควรเหมือนกัน ลอง reset แล้วเริ่มใหม่กัน มี take สอง และก็ take สาม ยังไม่แน่ใจว่าต้องทำยังไง แต่ลองเล่นดูอีกครั้ง ยังไม่ชัดเจนว่ามงกุฎทำหน้าที่อะไร แต่นี่คือ take สองของเรา take สาม ต้องกดค้างไว้นานพอสมควร โอเค ได้แล้ว ลองอีกที ได้แล้วครับ ใช้เวลาถึงห้า take ถึงจะผ่าน แต่ก็ทำได้
เกมนี้สนุกดีครับ มีองค์ประกอบทางธีมเยอะเลย แม้กราฟิกจะพื้นฐานมาก แต่กลไกของเกมทำงานได้จริง มีจุดเด่นเยอะเลยเช่นเรื่องมงกุฎ ยังไม่แน่ใจว่ามงกุฎมีไว้ทำอะไร แต่เก็บไอเทมและ props ต่าง ๆ ได้ เทียบกับผลงานของ Sol ที่ดูเป็นเกม generic แบบมาตรฐาน เกมของ Fable ตัวนี้มีเอกลักษณ์ชัดเจนกว่า คล้ายกำลังเล่นบทละครอยู่ ถือว่าทำได้ดีมาก และเราก็เล่นจนชนะครับ
## รอบสาม: ผลงานสุดท้ายของ Kimi K3
โอเค ตัวสุดท้ายจะเป็น Kimi K3 ครับ นี่คือสิ่งที่ได้ ตัวละครของเราอยู่ตรงนี้ คล้าย ๆ กับของ Sol ใช่ไหมครับ ลองอีกครั้งนะ ทำนองว่าต้องเคลื่อนที่ไปทางนี้ แล้วก็ rewind แล้วเคลื่อนที่ไปทางนี้ แล้วก็ rewind แล้วค่อยใช้ท่าทางแบบนี้ โอเค เข้าไปได้แล้ว ก็น่าจะชนะนะครับ เท่านี้เหรอ
พูดตรง ๆ ก็ต้องบอกว่าเกมนี้กราฟิกดูพื้นฐานมาก แต่มีองค์ประกอบที่น่าสนใจอยู่บ้างเหมือนกัน เช่นเรื่องของฟิวส์และสัญญาณ มี element ที่หลากหลายเหมือนเป็น sandbox (กล่องทดลอง) เป็นเหมือน trial ให้ผู้เล่นเรียนรู้วิธีกระโดดและอื่น ๆ ก็เลยเป็น sandbox แล้วก็มี FPS (เฟรมเรต) ที่ขึ้นตัว F บนหน้าจอให้ดูเฟรมเรตและสถานะต่าง ๆ ดังนั้นกลไกของเกมถือว่าทำได้ค่อนข้างดีเลยครับ แต่ผมเองยังเล่นไม่ชนะสักที ไม่แน่ใจว่าเป็นเพราะฝีมือผมเองหรือว่าเป็นข้อบกพร่องของตัวเกมกันแน่
แต่โดยรวมแล้ว นี่คือผลงานจาก Kimi K3 ครับ
## สรุปรอบสามและการคัดออก
สรุปรอบสามกันครับ จาก Sol เราได้เกม Afterimage Station จาก Fable เราได้เกม Curtain Call และจาก Kimi K3 เราได้เกม signal ตัวนี้
พอตัดสินทั้งหมดแล้ว ทุกโมเดลสร้างเกมออกมาได้ แต่เมื่อพิจารณาจากคุณภาพ ความสมบูรณ์ของเกม และความคิดสร้างสรรค์ ผมต้องตัดสินใจตัดหนึ่งเกมออก และก็ต้องตัด Kimi K3 ออกจากการแข่งขันด้วยความเสียดายครับ
Kimi K3 ทำได้ดีมากในงานที่ยากอย่างมาก และโดยรวมในการแข่งขันนี้ก็พิสูจน์ตัวเองได้ดี ข้อสังเกตคือใช้เวลานานกว่าโมเดลอื่นในการทำอะไรก็ตาม ส่วนคุณภาพจริง ๆ ของเกมนั้น ถือว่าอยู่ต่ำกว่า Sol และ Fable เล็กน้อย ทางด้านภาพก็ดูจะต่ำกว่าอีกสองโมเดลเล็กน้อยเช่นกัน เพราะอีกสองเกมดูมีสไตล์ที่โดดเด่นกว่า มีฟังก์ชันที่น่าสนใจกว่า
แต่โดยรวมแล้ว ถ้าให้เทียบกัน ผมว่า Sol ได้เปรียบกว่า แต่ Fable น่าจะทำได้ดีที่สุดในรอบนี้ เพราะเป็นเกมที่น่าสนใจที่สุด ผมจึงตัด Kimi K3 ออกจากการแข่งขันครับ
แต่ก็อย่างที่บอก Kimi K3 ไม่ควรอายเลย เพราะทำผลงานที่น่าประทับใจมากจริง ๆ ผมจะได้แจ้งให้ทาง Kimi K3 ทราบด้วย ตอนนี้ Kimi K3 ได้ถูกตัดออกจากการแข่งขันแล้ว
และก็อย่างที่บอกครับ คุณภาพของผลงานจาก Sol ดูจะดีกว่าเล็กน้อย และผมก็ต้องคำนึงถึงเวลาด้วย ขอบคุณที่มีความเป็นตัวของตัวเองเมื่อเทียบกับโมเดลอื่นนะครับ ขอบคุณที่ลงแข่งขันในรอบนี้ครับ จริง ๆ แล้วเกมเป็นสิ่งที่สร้างยากอยู่แล้ว ผมขอ kill server ก่อนนะครับ
เพราะผลงานจาก Sol นั้นคุณภาพดีกว่าจริง ๆ และใช้เวลาเพียง 22 นาทีเทียบกับ 3 ชั่วโมง และนี่จึงนำเราเข้าสู่การแข่งขันชิงชนะเลิศ ระหว่างสองตัวเต็งครับ ซึ่งก็ไม่น่าแปลกใจเท่าไหร่
## รอบชิงชนะเลิศ: Fable พบ Sol
รอบชิงจึงเป็นการพบกันระหว่าง Claude Fable 5 จาก Anthropic กับ GPT 5.6 Sol จาก OpenAI พอเข้าสู่รอบนี้ก็เป็นสองตัวเต็งอันดับหนึ่งอย่างที่บอกไป จึงไม่น่าแปลกใจ แต่ก็เป็นการเปิดฉากการแข่งขันชิงชนะเลิศที่น่าสนใจมากครับ
นี่คือโจทย์ของรอบสุดท้าย และมันยากจริง ๆ ครับ ผมเองยังไม่รู้ด้วยซ้ำว่ามันทำได้ไหม ไม่เคยทำมาก่อน แต่เราจะมาลองคิดดูไปด้วยกัน เป้าหมายหลักคือฝึก LoRA ซึ่งก็คือ fine-tuning adapter สำหรับโมเดลวิดีโอ LTX 2.3 บนเครื่อง DGX Spark ของผม และก็ต้องบอกโมเดลด้วยว่า DGX Spark คืออะไร
คอนเซ็ปต์คือเราจะฝึก LoRA โดยอิงจากภาพยนตร์ยุคแรกเริ่มแบบไม่มีเสียง (early silent cinema) ไม่ใช่แค่ภาพยนตร์ดูเก่า ๆ นะครับ แต่เป็นลักษณะเฉพาะของฟิล์มที่ใช้ก้านหมุนด้วยมือ (hand-cranked film) ถ้าใครเคยดูหนังยุคนั้นมาบ้างก็จะเข้าใจ มีสไตล์ภาพที่โดดเด่นมากและเป็นเอกลักษณ์
จะมี raw source footage (ฟุตเทจต้นฉบับดิบ) ที่เป็นภาพยนตร์ยุคแรกเริ่มที่เป็น public domain (สาธารณสมบัติ) ไม่ผ่านการประมวลผล และมีให้เลือกเยอะมากครับ ส่วนที่เหลือใน prompt ก็แค่อธิบาย environment ให้โมเดลรู้ว่าควรจะฝึกอย่างไร ส่วน deliverables ที่ต้องส่งมอบคือน้ำหนักของ LoRA ซึ่งก็คือน้ำหนักของ adapter ที่ถูก fine-tune แล้วนั่นเอง
เราจะมาทดสอบกันครับ ผมต้องทำทีละตัวเพราะการฝึกโมเดลใช้หน่วยความจำเยอะมาก แต่ละโมเดลจะได้ workspace แยกกันเพื่อไม่ให้มีการปนเปื้อนข้ามงาน แต่ละโมเดลจะมีชุดข้อมูลประมาณหนึ่งชั่วโมงของภาพยนตร์ silent cinema หลายเรื่อง
และนี่คือสไตล์ที่เรากำลังพูดถึง ภาพยนตร์เรื่องหนึ่งชื่อ The Great Train Robbery เป็นภาพยนตร์ที่อยู่ใน public domain ทั้งหมด เราก็จะดูว่า LoRA สามารถสร้างสไตล์นี้ออกมาได้ไหม ถ้าทำได้ก็คงจะดูเจ๋งมาก เพราะมีสไตล์ที่เป็นเอกลักษณ์ชัดเจนมากครับ
โอเค ผมวาง prompt ลงใน Fable แล้ว ตอนนี้ก็กำลังเริ่มทำงาน ตั้งโหมดอัตโนมัติไว้ ก็ปล่อยให้มันรันไปครับ น่าจะใช้เวลาสักพักใหญ่ ๆ เพราะการฝึกแบบนี้ใช้เวลาหลายชั่วโมง ผมจะปล่อยให้รันบน DGX แล้วค่อยกลับมาเช็กตอนที่เสร็จครับ
## ผลการฝึก LoRA — Fable
โอเค Fable เสร็จแล้วครับ รันมาทั้งคืน ใช้เวลาไป 4.37 ชั่วโมง ถือเป็นการรันที่ไม่สั้นเลย เป็นการรันที่ยาวนานมาก ช่วงแรกเจอปัญหาเรื่องหน่วยความจำบ้างเล็กน้อย แต่แก้ไขจนเรียบร้อยและได้รันที่สะอาดครับ
ดูได้ว่ามี element หลายอย่างที่โมเดลประเมินว่าทำได้ดี บางอย่างไม่สามารถ match กับ reference ได้ แต่เราจะมาดูผลลัพธ์กันเองครับ อย่างไรก็ตาม Fable สามารถฝึก LoRA adapter ได้สำเร็จ ผมจะเก็บผลลัพธ์ไว้ดูหลังจากที่ Sol ทำเสร็จด้วยครับ
## ผลการฝึก LoRA — Sol
ทีนี้ผมขอย้ายไปที่ Sol ก็วาง prompt ลงไป และก็กำลังจะเริ่มรันอีกประมาณ 4–5 ชั่วโมง อาจจะเร็วกว่านั้นนิดหน่อยเพราะ Sol ดูจะเร็วกว่า ขอเช็กอีกครั้งในอีกสองสามชั่วโมงนะครับ ตอนนี้กำลังฝึกอยู่แล้วและ loss ลดลงเรื่อย ๆ ซึ่งเป็นสัญญาณที่ดีครับ และเนื่องจากครั้งนี้ผมทำช่วงกลางวัน ก็เลยเห็นกระบวนการฝึก LoRA ได้ชัดเจนครับ
โอเค Sol ฝึกเสร็จแล้วครับ เสร็จเร็วกว่า Fable ตามที่คาดไว้ ใช้เวลาตั้งแต่ต้นจนจบประมาณ 2 ชั่วโมง 30 นาที เร็วกว่า Fable อย่างเห็นได้ชัด แต่สิ่งนี้เราก็รู้อยู่แล้วตั้งแต่สามรอบแรกครับ ว่า Sol ค่อนข้างเร็วเมื่อเทียบกับ Fable
## รอบชิงชนะเลิศ: ผลการตัดสินครั้งสุดท้าย
โอเค ถึงเวลาการแข่งขันชิงชนะเลิศแล้วครับ ผลการตัดสินครั้งสุดท้าย ขอบอกก่อนเลยว่าทั้งสองโมเดลสามารถสร้าง LoRA ออกมาได้สำเร็จ ดังนั้นนี่จึงเป็นการแข่งขันที่เป็นการแข่งขันกันเรื่องคุณภาพอย่างแท้จริงครับ
## เกณฑ์การตัดสินและชุดข้อมูลอ้างอิง
ผมจะตัดสินจากว่าแต่ละโมเดลปรับตัวเข้ากับสไตล์ silent cinema ต้นฉบับจากชุดข้อมูลได้ดีแค่ไหน รวมถึงคุณภาพโดยรวมด้วย ข้อควรระวังในการฝึก LoRA และ fine-tuning adapter คือถ้าฝึกกับชุดข้อมูลมากเกินไป คุณภาพจะตกลงครับ ส่วนโมเดล LTX ที่เราจะใช้คือ LTX 2.3 ถือว่าใหม่พอสมควร แต่เป็นโมเมลวิดีโอที่คุณภาพดีมาก โดยทั่วไปไม่ค่อยสร้างภาพ AI แปลก ๆ ออกมา ก็เลยเป็นจุดที่ต้องคอยสังเกตครับ
ขอแสดงตัวอย่างบางส่วนที่ใช้ฝึกและสไตล์ที่เราคาดหวังอีกครั้ง เรื่องนี้ชื่อ A Trip Down Market Street เป็นหนึ่งในภาพยนตร์ที่ให้ฝึก เรามองหาสไตล์แบบนี้ครับ ปี 1906 ภาพสั่นไหวนิดหน่อยใช่ไหมครับ อีกเรื่องที่ชื่อว่า Cops เกิดตอนหลังกว่านิดหน่อย เลยลื่นไหลกว่าเล็กน้อย แต่ก็สไตล์คล้ายกันนะครับ มีการ์ดข้อความด้วย อันนี้เป็นของ Buster Keaton นี่คือสไตล์ที่เรากำลังมองหาครับ
## Prompt ที่หนึ่ง: คนเดินบนบอร์ดวอล์ก
prompt แรกที่ให้กับทั้งคู่ และจะมีสาม prompt รวมเป็นสามรอบ คือ "people walking down a boardwalk" (คนเดินลงจากบอร์ดวอล์ก) ภาพแรกนี้คือผลจาก LTX ปกติเลยนะครับ ไม่มี LoRA ไม่ได้พูดถึง silent cinema เป็นแค่วิดีโอ 5 วินาทีของคนเดินลงจากบอร์ดวอล์ก ผลออกมาง่าย ๆ ตรงไปตรงมา
ภาพต่อมาคือสั่ง LTX ให้สร้างวิดีโอคนเดินบนบอร์ดวอล์กในสไตล์ silent cinema โดยใส่เป็นข้อความใน prompt เลย อันนี้ก็ยังไม่มี LoRA นะครับ เป็นเพียงการตั้ง baseline ให้เห็นพื้นฐานเท่านั้น ผลออกมาไม่เลวเลย แต่อาจจะไม่ค่อย grainy (มีเม็ดฟิล์ม) และอาจจะลื่นไหลเกินไปนิดหน่อย ส่วนใบหน้าคนก็มีความผิดเพี้ยนอยู่บ้าง
ทีนี้มาดูผลงานชิ้นแรกจาก Fable ครับ คือ "people walking down a boardwalk" โดยใช้ LoRA ที่เพิ่งฝึกจาก Fable ครับ วิดีโอ 5 วินาที จะเห็นว่ายังไม่สมบูรณ์ มีบางจุดที่ดูเหมือนถูกบีบอัดหรือผิดสัดส่วน แต่ก็ได้เม็ดฟิล์มแบบยุคนั้นมาบ้าง ขอบด้านข้างดูไหม้ ๆ เล็กน้อย ซึ่งทำให้ดู authentic สมจริงยิ่งขึ้นแม้ว่าตัวคนจะดูมัว ๆ ไปบ้างก็ตาม
ต่อมาเป็นผลงานของ GPT 5.6 Sol ใน prompt เดียวกันครับ คนเดินบนบอร์ดวอล์ก มาดูผลกัน ลื่นไหลกว่า สะอาดตากว่า ดูคล้ายกับผลจาก prompt ปกติที่ไม่มี LoRA มาก คุณภาพดูจะดีกว่านิดหน่อย แต่ผลก็ใกล้เคียงกันมากครับ
## Prompt ที่สอง: เครื่องบินบินเหนือภูเขา
เราจะทำอีกสอง prompt ครับ prompt ที่สองคือ "an airplane flying over the mountains" (เครื่องบินบินเหนือภูเขา) ผลงานจาก Fable คือ เข้ากับสไตล์ได้ดีมากครับ มีเครื่องบินอยู่ตรงนั้น ดูดีเลย และก็มีภูเขาอยู่ด้านหลัง ไม่แน่ใจว่าคนที่เดินอยู่รอบ ๆ รถพ่วงคืออะไร แต่สไตล์นั้นเข้าเป้าแน่นอนครับ ชอบเม็ดฟิล์มแบบหนังยุคแรก ๆ ของ Fable และบอกได้เลยว่ามันต่างจากการใส่ prompt เปล่า ๆ แน่นอน คือ LoRA มีผลจริง ๆ ครับ
ทีนี้มาดูของ GPT 5.6 Sol บ้าง มีเครื่องบินอยู่ครับ ถือว่าเป็นเครื่องบินที่บินเหนือภูเขาได้ถูกต้อง แต่เม็ดฟิล์มดูจะน้อยกว่า ลื่นไหลไปหน่อย จนเกือบจะลื่นไหลเกินไปด้วยซ้ำ เครื่องบินของ Sol เคลื่อนที่ลื่นไหลมาก เทียบกับของ Fable ที่สั่นไหวมากกว่า และที่ชอบของ Fable คือเครื่องบินนั้นเป็นแบบยุคนั้นจริง ๆ คือเครื่องบินในช่วงต้นศตวรรษที่ 20 ส่วนของ Sol เป็นเครื่องบินสมัยใหม่กว่า ไม่มีใบพัด ดูเหมือนเครื่องร่อนเสียมากกว่า ถือว่า Fable ได้แต้มนี้ไปครับ แม้ว่า Sol จะยึดตาม prompt มากกว่าก็ตาม
## Prompt ที่สาม: การปะทะกันในอวกาศ
สำหรับ prompt สุดท้าย ผมอยากทำอะไรที่บ้าน ๆ หน่อย คือ "a wild shootout between cops and robbers in space" (การยิงปะทะกันอย่างดุเดือดระหว่างตำรวจกับโจรในอวกาศ) ซึ่ง obviously ไม่มีวิดีโอไหนมีฉากอวกาศเลย แต่ก็มีบางเรื่องที่มีตำรวจกับโจรอยู่บ้าง
นี่คือผลงานของ Claude Fable ใน prompt นี้ครับ ดูจะวุ่นวายหน่อย คาดว่าน่าจะเป็นตำรวจกับโจรครับ ภาพคนผิดเพี้ยนมาก ถ้าไม่นับเรื่องความผิดเพี้ยนของตัวละครแล้ว สภาพแวดล้อมก็ไม่ได้อยู่ในอวกาศซึ่งเป็นปัญหา แต่คุณภาพของฟิล์มในแง่ของเม็ดฟิล์ม การเคลื่อนไหว และการกระพริบของภาพนั้นเลียนแบบสไตล์ได้ดีอยู่ครับ ทั้งนี้ก็ต้องยอมรับว่าเป็น prompt ที่ยากเพราะมีแอ็กชันเยอะและไม่มีข้อมูลอ้างอิงสำหรับฉากอวกาศในสไตล์นี้เลย
โอเค นี่คือผลของ GPT 5.6 Sol ใน prompt เดียวกันครับ มาดูกัน ก็ไม่รู้สิ คนดูจริงขึ้นกว่า แต่ก็ไม่มีการยิงปะทะกันจริง ๆ และก็ไม่ได้อยู่ในอวกาศเหมือนกัน ดูจะอยู่ในสำนักงานมากกว่า ทั้งสองชิ้นเอาฉากมาจากชุดข้อมูลที่ใช้ฝึกโดยตรงเลย เพราะโมเดลไม่มีข้อมูลอ้างอิงเรื่องอวกาศ จึงดึงฉากจากชุดข้อมูลภาพยนตร์มาใช้แทนครับ ดังนั้นทั้งคู่ต่างก็มีปัญหากับ prompt นี้เหมือนกัน
ขออีกครั้งกับผลงานของ Fable ครับ ใช่เลย prompt ยากจริง ๆ
## การเปรียบเทียบแบบเคียงข้างกัน
โอเค ขอให้ดูแบบเคียงข้างกันนะครับ ด้านซ้ายเป็น Fable และด้านขวาเป็น Sol เพื่อเทียบสไตล์ที่ต่างกัน รู้สึกว่าในเรื่องบอร์ดวอล์กนั้นทั้งคู่ใกล้เคียงกันมาก อาจจะมีสไตล์ที่หนักแน่นกว่านิดหน่อย แต่ก็ถือว่าใกล้เคียงกัน
ต่อมา prompt เครื่องบินครับ ซ้าย Fable ขวา Sol ในรอบนี้ผมว่า Fable ทำได้ดีกว่าในการถ่ายทอดคุณภาพของยุคนั้นออกมา โดยเฉพาะเครื่องบินที่เป็นแบบยุคนั้นชัดเจน คือเป็นเครื่องบินใบพัด ส่วนของ Sol นั้นเหมือนเครื่องบินเจ็ตเสียมากกว่า แม้ว่า Sol จะได้ภูเขามาถูกต้องก็ตาม เครื่องบินของ Fable กำลังบินขึ้น มีภูเขาเป็นฉากหลัง สังเกตขอบของวิดีโอ Fable จะเห็นว่าขอบมีการจาง ๆ ซึ่งเป็นลักษณะเฉพาะของฟิล์มยุคนั้น ในขณะที่ Sol ก็ทำได้ดีแต่พลาดรายละเอียดเล็ก ๆ น้อย ๆ เหล่านี้ไปครับ
สำหรับ prompt สุดท้าย การยิงปะทะกันในอวกาศ ทั้งคู่ต่างก็มีปัญหาเพราะไม่มีข้อมูลอ้างอิงในชุดข้อมูลเลย ขอให้ดูอีกครั้งครับ ซ้ายคือ Fable ขวาคือ Sol ดูติด ๆ กันได้ จะเห็นได้อีกครั้งว่า Fable ทำเรื่องการกระพริบของภาพและเนื้อสัมผัสของสไตล์นั้นได้ดีกว่า ส่วนของ Sol ดูจะขัดเกลาเกินไปนิดหน่อย แม้ทั้งคู่จะมีปัญหากับตัวละครและเนื้อเรื่องเหมือนกันก็ตาม และนี่อีกตัวอย่างครับของสไตล์จากชุดข้อมูลที่ต้องการแบบ grainy พร้อมการเคลื่อนไหวเป็นเอกลักษณ์ของยุคนั้น
## การตัดสินครั้งสุดท้าย
พูดตรง ๆ ว่าทั้งคู่ทำได้ดีพอสมควรเลยครับ เป็นการแข่งขันที่สูสีมาก การฝึก LoRA ไม่ใช่เรื่องง่ายครับ โดยเฉพาะกับเนื้อหาแบบวิดีโอเช่นนี้ เพราะนี่เป็นโมเดลสร้างวิดีโอ และชุดข้อมูลที่ให้ฝึกก็ค่อนข้างเล็กเมื่อเทียบกับที่ห้องปฏิบัติการ AI มืออาชีพใช้ฝึกโมเดล แต่ก็ต้องมีผู้ชนะเพียงคนเดียว และผลขึ้นอยู่กับการตัดสินของผมครับ อาจจะมีคนไม่เห็นด้วยกับการตัดสินของผม แต่นี่คือช่องของผม ผมก็เลยได้เป็นผู้มอบมงกุฎให้ผู้ชนะของ AI Royal Rumble เดือนกรกฎาคม 2026 ครับ
เป็นการแข่งขันที่ดีมากครับ ผมดีใจที่รอบสุดท้ายไม่ใช่การถล่มทลายทิ้งห่างกัน ขอใช้สัญชาตญาณจากการดูวิดีโอเหล่านี้หลายรอบ ว่าโมเดลไหนถ่ายทอดภาพยนตร์ต้นฉบับได้ดีกว่ากัน และโมเดลไหนที่ผมควรใช้จริง ๆ หากต้องการสร้าง fine-tuning adapter หรือ LoRA เพื่อสร้างวิดีโอสไตล์ early silent cinema ครับ
## ผู้ชนะ AI Royal Rumble เดือนกรกฎาคม 2026
ดังนั้น ผู้ชนะของ AI Royal Rumble เดือนกรกฎาคม 2026 คือ Fable ครับ นั่นคือ Fable 5 จาก Anthropic ซึ่งเป็นโมเดล frontier ระดับท็อปของ Claude ตั้งแต่เข้าสู่การแข่งขันมา Fable ก็เป็นตัวเต็งครับ เป็นโมเดลที่ผมส่วนตัวรู้สึกว่าเป็นโมเดลที่ดีที่สุดโดยรวมสำหรับงานหนัก ๆ แบบ long-horizon tasks (งานที่ใช้เวลานาน) โมเดลอื่น ๆ อาจจะเก่งเรื่องงานเฉพาะด้าน แต่โดยรวมแล้ว สำหรับงานลักษณะนี้ที่ใช้เวลาหลายชั่วโมงและยากจริง ๆ ผมรู้สึกมาตลอดว่า Fable ตั้งแต่ออกมานั้นเป็นโมเดลที่ดีที่สุดสำหรับงานแบบนี้ครับ ดังนั้น Fable 5 จึงคว้าเข็มขัดแชมป์ของการแข่งขันครั้งแรกนี้ไปครับ
ส่วน Sol ที่น่าสงสารตกเวทีไป ผมขอบอกว่าประทับใจกับความสมดุลระหว่างคุณภาพและความเร็วมากครับ เพราะเร็วกว่า Fable และเร็วกว่าอีกหลายโมเดลอย่างชัดเจน และผลงานก็แย่กว่าเพียงเล็กน้อยเท่านั้น แต่ในการแข่งขันครั้งนี้ คุณภาพคือสิ่งสำคัญที่สุด ไม่ใช่ความเร็วครับ อย่างไรก็ตาม ในงานจริง ถ้าใครต้องการทั้งคุณภาพสูงและความเร็ว Sol น่าจะเป็นตัวเลือกที่น่าประทับใจมากครับ แต่รอบนี้ Fable คว้าเข็มขัดแชมป์ประจำเดือนไปครับ
## แผนงานในอนาคตและปิดท้าย
ทุกเดือนมีโมเดล frontier ตัวใหม่ออกมาเสมอ และคนดูก็ชอบวิดีโอแนวนี้ครับ ก็น่าสนใจดี เพราะในช่องนี้ ผมมักทำคอนเทนต์สั้น ๆ เยอะ ผมทำวิดีโอ first look หลายชิ้นที่เป็นแบบจบในตัว one-shot แม้ในวิดีโออื่น ๆ ของผม ก็ไม่ได้ทำอะไรแบบนี้ที่ใช้เวลาหลายชั่วโมงนัก บางครั้งงานก็ใช้เวลาถึง 3–4 ชั่วโมง เวลาจับคู่โมเดลเปรียบเทียบกัน ผมบางครั้งก็ทำเป็นงาน ๆ แยกต่างหาก แต่ก็น่าสนใจดีครับ
เราจะดูกันตอนปลายเดือนสิงหาคมว่าคนดูชอบวิดีโอนี้หรือเปล่า และเดือนสิงหาคมก็จะมีโมเดลใหม่ ๆ เยอะแน่ ๆ ผมทราบว่าจะมีโมเดล Grok ใหม่ออกมา อาจจะมี GPT 6 (มีข่าวลือเรื่อง GPT 6) ข่าวลือเรื่อง Fable 5.1 ก็มีด้วย แล้วเจ้าตัวไหนจะออกมาจริงบ้าง เรามาดูกันครับ และแน่นอนว่าน่าจะมีโมเดล open weights ใหม่ ๆ ออกมาด้วย เช่นโมเดล Kimi K3 หรือพวก BLM ก็ต้องดูกันต่อไปครับ ถ้าโมเดลเหล่านั้นออกมาจริง ๆ ผมก็จะจัดการแข่งขันอีกครั้งในช่วงปลายเดือนสิงหาคมครับ แต่ตอนนี้ขอรอดูไปก่อน
สำหรับการแข่งขันครั้งนี้ ผู้ชนะอย่างเป็นทางการก็คือ Fable 5 อีกครั้งครับ ขอบคุณทุกท่านที่รับชมครับ ถ้าใครมีความคิดเห็นอะไร ก็คอมเมนต์กันเข้ามาได้เลยนะครับ ว่าคิดว่าใครจะชนะการแข่งขันนี้ ผมทราบดีว่ารอบสุดท้ายกับเรื่องวิดีโอนั้นเป็นเรื่อง subjective (ขึ้นกับมุมมองส่วนบุคคล) มาก เป็นความรู้สึกโดยรวมของผมเองว่าโมเดลไหนถ่ายทอดงานต้นฉบับได้ดีกว่ากัน แต่ก็คอมเมนต์มาได้เลยนะครับ แชร์ความคิดเห็นกันเข้ามา ถ้าใครไม่เห็นด้วยก็ไม่เป็นไรครับ แต่นี่ก็เป็นอันจบวิดีโอนี้ครับ ขอบคุณที่รับชมครับ
หมายเหตุการแปล
ความโปร่งใสเกี่ยวกับความไม่แน่นอนในต้นฉบับ
- ## ส่วนที่ความหมายไม่ชัดเจน (Unclear Segments)
- ไม่มีช่วงที่ต้องใส่ `[ฟังไม่ชัด]` เพราะแม้คำบรรยายจะมีข้อผิดพลาดเล็กน้อย แต่บริบทช่วยให้เข้าใจความหมายได้ตลอด
อภิธานศัพท์เทคนิค
คำศัพท์และชื่อผลิตภัณฑ์ที่คงรูปภาษาอังกฤษ
| ศัพท์ | คำแปล / คำอธิบาย |
|---|---|
| AI Royal Rumble | การแข่งขันชื่อโมเดล AI เพื่อหาผู้ชนะ (จากช่อง Tonbi's AI Garage) |
| frontier model | โมเดล AI ระดับแนวหน้าที่มีความสามารถสูงสุดในยุคปัจจุบัน |
| Fable | โมเดล frontier ของ Anthropic ในตระกูล Claude (Claude Fable 5) |
| Sol | โมเดล frontier ของ OpenAI ในตระกูล GPT (GPT 5.6 Sol) |
| Kimi K3 | โมเดลของ Moonshot AI |
| GLM 5.2 | โมเดลที่ถูกคัดออกในรอบที่หนึ่ง |
| Grok 4.5 | โมเดลที่ถูกคัดออกในรอบที่สอง |
| Hermes Agent | แพลตฟอร์ม AI agent ของ Nous Research ที่ใช้ในการรันโมเดลในการแข่งขัน |
| LM wikis | คลังความรู้เกี่ยวกับโมเดลภาษา (Large Language Model) |
| agentwikis.com | โปรเจกต์คลังความรู้ของพิธีกร ให้เข้าถึงข้อมูลวิจัยโมเดล |
| landing page | หน้าเว็บเริ่มต้นที่ผู้ใช้พบเมื่อเข้าเว็บไซต์ |
| typography | ศิลปะการจัดวางและออกแบบตัวอักษร |
| motion | องค์ประกอบการเคลื่อนไหวในการออกแบบ |
| paper trader | โปรแกรมจำลองการเทรด (ไม่ใช้เงินจริง) |
| P&L | Profit and Loss — กำไรขาดทุน |
| platformer | ประเภทเกมที่ตัวละครกระโดดข้ามอุปสรรคบนแท่นต่าง ๆ |
| LoRA | Low-Rank Adaptation — เทคนิค fine-tuning โมเดลโดยใช้ adapter ที่ฝึกเพิ่มเติม |
| fine-tuning adapter | ส่วนเสริมที่ฝึกเพิ่มเติมเพื่อปรับแต่งโมเดลให้เชี่ยวชาญด้านใดด้านหนึ่ง |
| NVIDIA DGX Spark | เครื่องคอมพิวเตอร์ประสิทธิภาพสูงสำหรับงาน AI ของ NVIDIA |
| LTX 2.3 | โมเดลสร้างวิดีโอที่ใช้เป็นฐานสำหรับการฝึก LoRA |
| early silent cinema | ภาพยนตร์ยุคแรกเริ่มที่ไม่มีเสียง (ยุค 1900s) |
| hand-cranked film | ฟิล์มที่ถ่ายด้วยกล้องที่ต้องหมุนก้านด้วยมือ (เป็นลักษณะเฉพาะของยุคแรก) |
| public domain | สาธารณสมบัติ — ผลงานที่ไม่มีลิขสิทธิ์คุ้มครอง สามารถใช้ได้อย่างอิสระ |
| The Great Train Robbery | ภาพยนตร์ปี 1903 ที่ใช้เป็นข้อมูลฝึก |
| A Trip Down Market Street | ภาพยนตร์ปี 1906 ที่ใช้เป็นข้อมูลฝึก |
| Cops | ภาพยนตร์ silent ของ Buster Keaton ที่ใช้เป็นข้อมูลฝึก |
| Buster Keaton | ดาราตลกยุคภาพยนตร์เงียบ |
| loss | ค่าความคลาดเคลื่อนที่ใช้วัดระหว่างการฝึกโมเดล (ค่าลดลง = ฝึกได้ดีขึ้น) |
| dataset / data set | ชุดข้อมูลที่ใช้ฝึกโมเดล |
| reference | ข้อมูลหรือภาพอ้างอิงสำหรับเทียบผลลัพธ์ |
| open weights | โมเดลที่เปิดเผยน้ำหนักให้ใช้งานได้อย่างอิสระ |
| long-horizon task | งานที่ใช้เวลานานและต้องทำหลายขั้นตอน |
| one-shot | งานจบในครั้งเดียว ไม่ต้องทำต่อเนื่อง |
| first look | บทวิจารณ์หรือทดลองใช้งานครั้งแรก |
| sandbox | กล่องทดลอง — สภาพแวดล้อมที่ทดลองได้อย่างอิสระ |
| FPS | Frames Per Second — เฟรมต่อวินาที ใช้วัดความลื่นไหลของวิดีโอหรือเกม |
| grain / grainy | เม็ดฟิล์ม — ลักษณะเฉพาะของฟิล์มยุคเก่า |
| clipping | ปัญหาที่วัตถุในเกมทะลุกัน |
| flicker | การกระพริบของภาพ (เป็นลักษณะเฉพาะของฟิล์มยุคแรก) |
| blowout | การถล่มทลายทิ้งห่างกันมาก ๆ |
ซับไตเติ้ลภาษาไทย
ดาวน์โหลดหรือดูซับทั้งหมด
1 00:00:00,000 --> 00:00:06,867 ยินดีต้อนรับกลับมาสู่ภาคสองของ AI Royal Rumble 2 00:00:06,867 --> 00:00:09,405 เดือนกรกฎาคม 2026 3 00:00:09,405 --> 00:00:16,570 ที่เราจะมาตัดสินกันให้รู้แล้วรู้รอดว่าโมเดลระดับ 4 00:00:16,570 --> 00:00:22,989 frontier ตัวไหนคือที่สุด ถ้าใครดูภาคนี้ก่อน
เปิดดูซับไตเติ้ลทั้งหมด (369 segments)
1 00:00:00,000 --> 00:00:06,867 ยินดีต้อนรับกลับมาสู่ภาคสองของ AI Royal Rumble 2 00:00:06,867 --> 00:00:09,405 เดือนกรกฎาคม 2026 3 00:00:09,405 --> 00:00:16,570 ที่เราจะมาตัดสินกันให้รู้แล้วรู้รอดว่าโมเดลระดับ 4 00:00:16,570 --> 00:00:22,989 frontier ตัวไหนคือที่สุด ถ้าใครดูภาคนี้ก่อน 5 00:00:22,989 --> 00:00:31,946 ก็อยากให้ย้อนไปดูภาคหนึ่งเพื่อดูว่าสองรอบแรกเกิดอะไรขึ้นบ้าง 6 00:00:31,946 --> 00:00:43,590 เพราะภาคนี้จะเป็นรอบที่สามและรอบที่สี่ก่อนที่เราจะมอบมงกุฎให้ผู้ชนะเด็ดขาดครับ 7 00:00:43,590 --> 00:00:50,158 พอสรุปแล้ว รอบแรกเป็นโปรเจกต์ทำ landing page 8 00:00:50,158 --> 00:00:56,876 ที่ใช้ typography และ motion แบบเฉพาะตัว เป็น 9 00:00:56,876 --> 00:01:02,250 landing page ที่วิวัฒนาการไปเรื่อย ๆ 10 00:01:02,250 --> 00:02:34,057 ตอนที่เลื่อนจอลง ทุกโมเดลทำได้ดีมากแม้งานจะยาก แต่สุดท้ายผู้แพ้ของรอบแรกคือ GLM 5.2 ที่ถูกตัดออก เป็นโมเดลเดียวที่ output เพี้ยน คือไม่ทำงานเลยครับ จากนั้นเราก็เข้าสู่รอบสอง เป็นการทดสอบเทรดดิ้งที่ agent ต้องค้นคว้า ออกแบบกลยุทธ์การเทรด และเขียน paper trader (โปรแกรมจำลองการเทรด) ให้ทำตามกลยุทธ์นั้นไปตามเวลา พอลองรันจริง โมเดลที่ทำได้แย่ที่สุดคือ Grok 4.5 จึงถูกตัดออกจากการแข่งขัน เจ้าตัวรับความเสี่ยงสูงที่สุด ทำการเทรดเยอะกว่าโมเดลอื่นเยอะมาก และก็เร็วกว่าด้วย แต่สุดท้ายผล P&L (กำไรขาดทุน) ติดลบประมาณ 12% ครับ Grok 4.5 จึงถูกคัดออกในรอบสอง ถึงตรงนี้เราก็เข้าสู่รอบสาม และนี่คือสถานการณ์ปัจจุบัน โดยที่ Fable, 11 00:02:34,057 --> 00:02:35,251 GPT 5.6, 12 00:02:35,251 --> 00:03:46,905 Sol และ Kimi K3 เป็นสามโมเดลสุดท้ายที่ยังเหลืออยู่ รอบสามจะเป็นการพัฒนาเกม น่าจะสนุกและน่าสนใจดีครับ จากนั้นในรอบชิงชนะเลิศ สองโมเดลสุดท้ายจะได้ทำงานฝึกโมเดล คือต้องฝึก fine-tuning adapter ที่เรียกว่า LoRA บนเครื่อง DGX Spark ของผมเอง สำหรับโมเดลสร้างวิดีโอ ซึ่งผมเองก็ไม่เคยทำมาก่อน จะทำได้หรือเปล่าก็ไม่รู้ แต่เราจะมาดูความเป็นไปได้ไปด้วยกันครับ เริ่มกันเลย ถ้าใครเองก็รัน agent และอยากเข้าถึง LM wikis (คลังความรู้เกี่ยวกับโมเดลภาษา) ที่ผมใช้ค้นคว้าและสร้างวิดีโอเหล่านี้จริง ๆ 13 00:03:46,905 --> 00:04:18,851 ก็แวะดูโปรเจกต์ agentwikis.com ของผมได้เลยครับ ผมแชร์ทุกอย่างไว้ที่นั่น และนั่นคือผลงานของ GPT 5.6 (Sol) ครับ ทีนี้มาดูการตีความของ Claude Fable กันบ้าง เกมนี้ชื่อว่า Take Four น่าสนใจดีครับ เริ่มด้วยคำว่า "Places, 14 00:04:18,851 --> 00:04:21,091 please" คล้าย ๆ 15 00:04:21,091 --> 00:04:27,211 จะไปทางคอนเซ็ปต์ละครหรือคอนเสิร์ต มี vibe 16 00:04:27,211 --> 00:04:33,033 แบบการแสดงบนเวที ลองกดตัด take ดูนะครับ 17 00:04:33,033 --> 00:04:39,004 เป็นการตีความที่น่าสนใจมาก ลองเล่นดูครับ 18 00:04:39,004 --> 00:04:43,184 ตัวละครจะตัวเล็ก รอแป๊บ โอเค 19 00:04:43,184 --> 00:04:49,454 กระโดดขึ้นไปตรงนี้ได้ ยากกว่าที่คิดเยอะเลย 20 00:04:49,454 --> 00:04:54,529 ต้องรอให้ ghost ของเราเอาของไปก่อน 21 00:04:54,529 --> 00:05:00,948 แต่เสียเวลาไปเยอะพอสมควรเหมือนกัน ลอง reset 22 00:05:00,948 --> 00:05:07,367 แล้วเริ่มใหม่กัน มี take สอง และก็ take สาม 23 00:05:07,367 --> 00:05:14,234 ยังไม่แน่ใจว่าต้องทำยังไง แต่ลองเล่นดูอีกครั้ง 24 00:05:14,234 --> 00:05:20,653 ยังไม่ชัดเจนว่ามงกุฎทำหน้าที่อะไร แต่นี่คือ 25 00:05:20,653 --> 00:05:24,087 take สองของเรา take สาม 26 00:05:24,087 --> 00:05:30,804 ต้องกดค้างไว้นานพอสมควร โอเค ได้แล้ว ลองอีกที 27 00:05:30,804 --> 00:05:36,775 ได้แล้วครับ ใช้เวลาถึงห้า take ถึงจะผ่าน 28 00:05:36,775 --> 00:05:40,806 แต่ก็ทำได้ เกมนี้สนุกดีครับ 29 00:05:40,806 --> 00:05:44,538 มีองค์ประกอบทางธีมเยอะเลย 30 00:05:44,538 --> 00:05:47,673 แม้กราฟิกจะพื้นฐานมาก 31 00:05:47,673 --> 00:05:51,405 แต่กลไกของเกมทำงานได้จริง 32 00:05:51,405 --> 00:05:56,033 มีจุดเด่นเยอะเลยเช่นเรื่องมงกุฎ 33 00:05:56,033 --> 00:06:02,899 ยังไม่แน่ใจว่ามงกุฎมีไว้ทำอะไร แต่เก็บไอเทมและ 34 00:06:02,899 --> 00:06:08,423 props ต่าง ๆ ได้ เทียบกับผลงานของ Sol 35 00:06:08,423 --> 00:06:14,991 ที่ดูเป็นเกม generic แบบมาตรฐาน เกมของ Fable 36 00:06:14,991 --> 00:06:19,022 ตัวนี้มีเอกลักษณ์ชัดเจนกว่า 37 00:06:19,022 --> 00:06:25,142 คล้ายกำลังเล่นบทละครอยู่ ถือว่าทำได้ดีมาก 38 00:06:25,142 --> 00:06:31,561 และเราก็เล่นจนชนะครับ โอเค ตัวสุดท้ายจะเป็น 39 00:06:31,561 --> 00:06:35,890 Kimi K3 ครับ นี่คือสิ่งที่ได้ 40 00:06:35,890 --> 00:06:42,160 ตัวละครของเราอยู่ตรงนี้ คล้าย ๆ กับของ Sol 41 00:06:42,160 --> 00:06:45,743 ใช่ไหมครับ ลองอีกครั้งนะ 42 00:06:45,743 --> 00:06:52,311 ทำนองว่าต้องเคลื่อนที่ไปทางนี้ แล้วก็ rewind 43 00:06:52,311 --> 00:06:57,685 แล้วเคลื่อนที่ไปทางนี้ แล้วก็ rewind 44 00:06:57,685 --> 00:07:03,955 แล้วค่อยใช้ท่าทางแบบนี้ โอเค เข้าไปได้แล้ว 45 00:07:03,955 --> 00:07:09,478 ก็น่าจะชนะนะครับ เท่านี้เหรอ พูดตรง ๆ 46 00:07:09,478 --> 00:07:14,852 ก็ต้องบอกว่าเกมนี้กราฟิกดูพื้นฐานมาก 47 00:07:14,852 --> 00:07:21,122 แต่มีองค์ประกอบที่น่าสนใจอยู่บ้างเหมือนกัน 48 00:07:21,122 --> 00:07:26,795 เช่นเรื่องของฟิวส์และสัญญาณ มี element 49 00:07:26,795 --> 00:07:33,065 ที่หลากหลายเหมือนเป็น sandbox (กล่องทดลอง) 50 00:07:33,065 --> 00:07:35,453 เป็นเหมือน trial 51 00:07:35,453 --> 00:07:40,976 ให้ผู้เล่นเรียนรู้วิธีกระโดดและอื่น ๆ 52 00:07:40,976 --> 00:07:54,113 ก็เลยเป็น sandbox แล้วก็มี FPS (เฟรมเรต) ที่ขึ้นตัว F บนหน้าจอให้ดูเฟรมเรตและสถานะต่าง ๆ 53 00:07:54,113 --> 00:08:00,831 ดังนั้นกลไกของเกมถือว่าทำได้ค่อนข้างดีเลยครับ 54 00:08:00,831 --> 00:08:04,712 แต่ผมเองยังเล่นไม่ชนะสักที 55 00:08:04,712 --> 00:08:14,564 ไม่แน่ใจว่าเป็นเพราะฝีมือผมเองหรือว่าเป็นข้อบกพร่องของตัวเกมกันแน่ 56 00:08:14,564 --> 00:08:20,685 แต่โดยรวมแล้ว นี่คือผลงานจาก Kimi K3 ครับ 57 00:08:20,685 --> 00:08:27,552 สรุปรอบสามกันครับ จาก Sol เราได้เกม Afterimage 58 00:08:27,552 --> 00:08:33,523 Station จาก Fable เราได้เกม Curtain Call 59 00:08:33,523 --> 00:08:39,196 และจาก Kimi K3 เราได้เกม signal ตัวนี้ 60 00:08:39,196 --> 00:08:45,764 พอตัดสินทั้งหมดแล้ว ทุกโมเดลสร้างเกมออกมาได้ 61 00:08:45,764 --> 00:08:52,034 แต่เมื่อพิจารณาจากคุณภาพ ความสมบูรณ์ของเกม 62 00:08:52,034 --> 00:08:55,019 และความคิดสร้างสรรค์ 63 00:08:55,019 --> 00:09:01,886 ผมต้องตัดสินใจตัดหนึ่งเกมออก และก็ต้องตัด Kimi 64 00:09:01,886 --> 00:09:08,753 K3 ออกจากการแข่งขันด้วยความเสียดายครับ Kimi K3 65 00:09:08,753 --> 00:09:13,082 ทำได้ดีมากในงานที่ยากอย่างมาก 66 00:09:13,082 --> 00:09:19,650 และโดยรวมในการแข่งขันนี้ก็พิสูจน์ตัวเองได้ดี 67 00:09:19,650 --> 00:09:27,264 ข้อสังเกตคือใช้เวลานานกว่าโมเดลอื่นในการทำอะไรก็ตาม 68 00:09:27,264 --> 00:09:33,981 ส่วนคุณภาพจริง ๆ ของเกมนั้น ถือว่าอยู่ต่ำกว่า 69 00:09:33,981 --> 00:09:37,265 Sol และ Fable เล็กน้อย 70 00:09:37,265 --> 00:09:44,580 ทางด้านภาพก็ดูจะต่ำกว่าอีกสองโมเดลเล็กน้อยเช่นกัน 71 00:09:44,580 --> 00:09:50,104 เพราะอีกสองเกมดูมีสไตล์ที่โดดเด่นกว่า 72 00:09:50,104 --> 00:09:55,776 มีฟังก์ชันที่น่าสนใจกว่า แต่โดยรวมแล้ว 73 00:09:55,776 --> 00:10:02,046 ถ้าให้เทียบกัน ผมว่า Sol ได้เปรียบกว่า แต่ 74 00:10:02,046 --> 00:10:06,823 Fable น่าจะทำได้ดีที่สุดในรอบนี้ 75 00:10:06,823 --> 00:10:13,540 เพราะเป็นเกมที่น่าสนใจที่สุด ผมจึงตัด Kimi K3 76 00:10:13,540 --> 00:10:20,258 ออกจากการแข่งขันครับ แต่ก็อย่างที่บอก Kimi K3 77 00:10:20,258 --> 00:10:27,125 ไม่ควรอายเลย เพราะทำผลงานที่น่าประทับใจมากจริง 78 00:10:27,125 --> 00:10:33,544 ๆ ผมจะได้แจ้งให้ทาง Kimi K3 ทราบด้วย ตอนนี้ 79 00:10:33,544 --> 00:10:39,067 Kimi K3 ได้ถูกตัดออกจากการแข่งขันแล้ว 80 00:10:39,067 --> 00:10:45,337 และก็อย่างที่บอกครับ คุณภาพของผลงานจาก Sol 81 00:10:45,337 --> 00:10:52,204 ดูจะดีกว่าเล็กน้อย และผมก็ต้องคำนึงถึงเวลาด้วย 82 00:10:52,204 --> 00:11:01,011 ขอบคุณที่มีความเป็นตัวของตัวเองเมื่อเทียบกับโมเดลอื่นนะครับ 83 00:11:01,011 --> 00:11:06,535 ขอบคุณที่ลงแข่งขันในรอบนี้ครับ จริง ๆ 84 00:11:06,535 --> 00:11:13,103 แล้วเกมเป็นสิ่งที่สร้างยากอยู่แล้ว ผมขอ kill 85 00:11:13,103 --> 00:11:18,328 server ก่อนนะครับ เพราะผลงานจาก Sol 86 00:11:18,328 --> 00:11:24,448 นั้นคุณภาพดีกว่าจริง ๆ และใช้เวลาเพียง 22 87 00:11:24,448 --> 00:11:27,733 นาทีเทียบกับ 3 ชั่วโมง 88 00:11:27,733 --> 00:11:33,853 และนี่จึงนำเราเข้าสู่การแข่งขันชิงชนะเลิศ 89 00:11:33,853 --> 00:11:36,988 ระหว่างสองตัวเต็งครับ 90 00:11:36,988 --> 00:11:40,869 ซึ่งก็ไม่น่าแปลกใจเท่าไหร่ 91 00:11:40,869 --> 00:11:47,288 รอบชิงจึงเป็นการพบกันระหว่าง Claude Fable 5 92 00:11:47,288 --> 00:11:53,259 จาก Anthropic กับ GPT 5.6 Sol จาก OpenAI 93 00:11:53,259 --> 00:12:01,470 พอเข้าสู่รอบนี้ก็เป็นสองตัวเต็งอันดับหนึ่งอย่างที่บอกไป 94 00:12:01,470 --> 00:12:03,709 จึงไม่น่าแปลกใจ 95 00:12:03,709 --> 00:12:12,069 แต่ก็เป็นการเปิดฉากการแข่งขันชิงชนะเลิศที่น่าสนใจมากครับ 96 00:12:12,069 --> 00:12:18,786 นี่คือโจทย์ของรอบสุดท้าย และมันยากจริง ๆ ครับ 97 00:12:18,786 --> 00:12:24,011 ผมเองยังไม่รู้ด้วยซ้ำว่ามันทำได้ไหม 98 00:12:24,011 --> 00:12:30,281 ไม่เคยทำมาก่อน แต่เราจะมาลองคิดดูไปด้วยกัน 99 00:12:30,281 --> 00:12:36,998 เป้าหมายหลักคือฝึก LoRA ซึ่งก็คือ fine-tuning 100 00:12:36,998 --> 00:12:43,417 adapter สำหรับโมเดลวิดีโอ LTX 2.3 บนเครื่อง 101 00:12:43,417 --> 00:12:49,986 DGX Spark ของผม และก็ต้องบอกโมเดลด้วยว่า DGX 102 00:12:49,986 --> 00:12:55,808 Spark คืออะไร คอนเซ็ปต์คือเราจะฝึก LoRA 103 00:12:55,808 --> 00:13:01,928 โดยอิงจากภาพยนตร์ยุคแรกเริ่มแบบไม่มีเสียง 104 00:13:01,928 --> 00:13:08,646 (early silent cinema) ไม่ใช่แค่ภาพยนตร์ดูเก่า 105 00:13:08,646 --> 00:13:09,840 ๆ นะครับ 106 00:13:09,840 --> 00:13:16,856 แต่เป็นลักษณะเฉพาะของฟิล์มที่ใช้ก้านหมุนด้วยมือ 107 00:13:16,856 --> 00:13:19,693 (hand-cranked film) 108 00:13:19,693 --> 00:13:25,365 ถ้าใครเคยดูหนังยุคนั้นมาบ้างก็จะเข้าใจ 109 00:13:25,365 --> 00:13:31,933 มีสไตล์ภาพที่โดดเด่นมากและเป็นเอกลักษณ์ จะมี 110 00:13:31,933 --> 00:13:37,457 raw source footage (ฟุตเทจต้นฉบับดิบ) 111 00:13:37,457 --> 00:13:43,428 ที่เป็นภาพยนตร์ยุคแรกเริ่มที่เป็น public 112 00:13:43,428 --> 00:13:49,399 domain (สาธารณสมบัติ) ไม่ผ่านการประมวลผล 113 00:13:49,399 --> 00:13:56,266 และมีให้เลือกเยอะมากครับ ส่วนที่เหลือใน prompt 114 00:13:56,266 --> 00:13:59,700 ก็แค่อธิบาย environment 115 00:13:59,700 --> 00:14:04,775 ให้โมเดลรู้ว่าควรจะฝึกอย่างไร ส่วน 116 00:14:04,775 --> 00:14:11,343 deliverables ที่ต้องส่งมอบคือน้ำหนักของ LoRA 117 00:14:11,343 --> 00:14:17,912 ซึ่งก็คือน้ำหนักของ adapter ที่ถูก fine-tune 118 00:14:17,912 --> 00:14:22,539 แล้วนั่นเอง เราจะมาทดสอบกันครับ 119 00:14:22,539 --> 00:14:30,302 ผมต้องทำทีละตัวเพราะการฝึกโมเดลใช้หน่วยความจำเยอะมาก 120 00:14:30,302 --> 00:14:34,034 แต่ละโมเดลจะได้ workspace 121 00:14:34,034 --> 00:14:39,557 แยกกันเพื่อไม่ให้มีการปนเปื้อนข้ามงาน 122 00:14:39,557 --> 00:14:47,320 แต่ละโมเดลจะมีชุดข้อมูลประมาณหนึ่งชั่วโมงของภาพยนตร์ 123 00:14:47,320 --> 00:14:50,903 silent cinema หลายเรื่อง 124 00:14:50,903 --> 00:14:55,530 และนี่คือสไตล์ที่เรากำลังพูดถึง 125 00:14:55,530 --> 00:15:01,352 ภาพยนตร์เรื่องหนึ่งชื่อ The Great Train 126 00:15:01,352 --> 00:15:07,771 Robbery เป็นภาพยนตร์ที่อยู่ใน public domain 127 00:15:07,771 --> 00:15:11,503 ทั้งหมด เราก็จะดูว่า LoRA 128 00:15:11,503 --> 00:15:15,982 สามารถสร้างสไตล์นี้ออกมาได้ไหม 129 00:15:15,982 --> 00:15:19,415 ถ้าทำได้ก็คงจะดูเจ๋งมาก 130 00:15:19,415 --> 00:15:26,282 เพราะมีสไตล์ที่เป็นเอกลักษณ์ชัดเจนมากครับ โอเค 131 00:15:26,282 --> 00:15:30,462 ผมวาง prompt ลงใน Fable แล้ว 132 00:15:30,462 --> 00:15:37,030 ตอนนี้ก็กำลังเริ่มทำงาน ตั้งโหมดอัตโนมัติไว้ 133 00:15:37,030 --> 00:15:43,748 ก็ปล่อยให้มันรันไปครับ น่าจะใช้เวลาสักพักใหญ่ 134 00:15:43,748 --> 00:15:49,271 ๆ เพราะการฝึกแบบนี้ใช้เวลาหลายชั่วโมง 135 00:15:49,271 --> 00:15:52,406 ผมจะปล่อยให้รันบน DGX 136 00:15:52,406 --> 00:15:58,974 แล้วค่อยกลับมาเช็กตอนที่เสร็จครับ โอเค Fable 137 00:15:58,974 --> 00:16:05,095 เสร็จแล้วครับ รันมาทั้งคืน ใช้เวลาไป 4.37 138 00:16:05,095 --> 00:16:10,170 ชั่วโมง ถือเป็นการรันที่ไม่สั้นเลย 139 00:16:10,170 --> 00:16:13,454 เป็นการรันที่ยาวนานมาก 140 00:16:13,454 --> 00:16:20,023 ช่วงแรกเจอปัญหาเรื่องหน่วยความจำบ้างเล็กน้อย 141 00:16:20,023 --> 00:16:25,994 แต่แก้ไขจนเรียบร้อยและได้รันที่สะอาดครับ 142 00:16:25,994 --> 00:16:28,681 ดูได้ว่ามี element 143 00:16:28,681 --> 00:16:33,756 หลายอย่างที่โมเดลประเมินว่าทำได้ดี 144 00:16:33,756 --> 00:16:39,877 บางอย่างไม่สามารถ match กับ reference ได้ 145 00:16:39,877 --> 00:16:46,147 แต่เราจะมาดูผลลัพธ์กันเองครับ อย่างไรก็ตาม 146 00:16:46,147 --> 00:16:51,819 Fable สามารถฝึก LoRA adapter ได้สำเร็จ 147 00:16:51,819 --> 00:16:56,895 ผมจะเก็บผลลัพธ์ไว้ดูหลังจากที่ Sol 148 00:16:56,895 --> 00:17:03,463 ทำเสร็จด้วยครับ ทีนี้ผมขอย้ายไปที่ Sol ก็วาง 149 00:17:03,463 --> 00:17:10,181 prompt ลงไป และก็กำลังจะเริ่มรันอีกประมาณ 4–5 150 00:17:10,181 --> 00:17:16,450 ชั่วโมง อาจจะเร็วกว่านั้นนิดหน่อยเพราะ Sol 151 00:17:16,450 --> 00:17:18,242 ดูจะเร็วกว่า 152 00:17:18,242 --> 00:17:23,914 ขอเช็กอีกครั้งในอีกสองสามชั่วโมงนะครับ 153 00:17:23,914 --> 00:17:30,333 ตอนนี้กำลังฝึกอยู่แล้วและ loss ลดลงเรื่อย ๆ 154 00:17:30,333 --> 00:17:33,767 ซึ่งเป็นสัญญาณที่ดีครับ 155 00:17:33,767 --> 00:17:38,992 และเนื่องจากครั้งนี้ผมทำช่วงกลางวัน 156 00:17:38,992 --> 00:17:45,709 ก็เลยเห็นกระบวนการฝึก LoRA ได้ชัดเจนครับ โอเค 157 00:17:45,709 --> 00:17:51,681 Sol ฝึกเสร็จแล้วครับ เสร็จเร็วกว่า Fable 158 00:17:51,681 --> 00:17:57,950 ตามที่คาดไว้ ใช้เวลาตั้งแต่ต้นจนจบประมาณ 2 159 00:17:57,950 --> 00:18:04,817 ชั่วโมง 30 นาที เร็วกว่า Fable อย่างเห็นได้ชัด 160 00:18:04,817 --> 00:18:11,684 แต่สิ่งนี้เราก็รู้อยู่แล้วตั้งแต่สามรอบแรกครับ 161 00:18:11,684 --> 00:18:18,252 ว่า Sol ค่อนข้างเร็วเมื่อเทียบกับ Fable โอเค 162 00:18:18,252 --> 00:18:23,477 ถึงเวลาการแข่งขันชิงชนะเลิศแล้วครับ 163 00:18:23,477 --> 00:18:26,911 ผลการตัดสินครั้งสุดท้าย 164 00:18:26,911 --> 00:18:33,330 ขอบอกก่อนเลยว่าทั้งสองโมเดลสามารถสร้าง LoRA 165 00:18:33,330 --> 00:18:35,420 ออกมาได้สำเร็จ 166 00:18:35,420 --> 00:18:46,616 ดังนั้นนี่จึงเป็นการแข่งขันที่เป็นการแข่งขันกันเรื่องคุณภาพอย่างแท้จริงครับ 167 00:18:46,616 --> 00:18:53,333 ผมจะตัดสินจากว่าแต่ละโมเดลปรับตัวเข้ากับสไตล์ 168 00:18:53,333 --> 00:18:59,901 silent cinema ต้นฉบับจากชุดข้อมูลได้ดีแค่ไหน 169 00:18:59,901 --> 00:19:06,171 รวมถึงคุณภาพโดยรวมด้วย ข้อควรระวังในการฝึก 170 00:19:06,171 --> 00:19:10,351 LoRA และ fine-tuning adapter 171 00:19:10,351 --> 00:19:14,829 คือถ้าฝึกกับชุดข้อมูลมากเกินไป 172 00:19:14,829 --> 00:19:21,547 คุณภาพจะตกลงครับ ส่วนโมเดล LTX ที่เราจะใช้คือ 173 00:19:21,547 --> 00:19:25,279 LTX 2.3 ถือว่าใหม่พอสมควร 174 00:19:25,279 --> 00:19:30,056 แต่เป็นโมเมลวิดีโอที่คุณภาพดีมาก 175 00:19:30,056 --> 00:19:36,027 โดยทั่วไปไม่ค่อยสร้างภาพ AI แปลก ๆ ออกมา 176 00:19:36,027 --> 00:19:40,804 ก็เลยเป็นจุดที่ต้องคอยสังเกตครับ 177 00:19:40,804 --> 00:19:49,612 ขอแสดงตัวอย่างบางส่วนที่ใช้ฝึกและสไตล์ที่เราคาดหวังอีกครั้ง 178 00:19:49,612 --> 00:19:55,434 เรื่องนี้ชื่อ A Trip Down Market Street 179 00:19:55,434 --> 00:19:59,613 เป็นหนึ่งในภาพยนตร์ที่ให้ฝึก 180 00:19:59,613 --> 00:20:04,241 เรามองหาสไตล์แบบนี้ครับ ปี 1906 181 00:20:04,241 --> 00:20:08,421 ภาพสั่นไหวนิดหน่อยใช่ไหมครับ 182 00:20:08,421 --> 00:20:12,004 อีกเรื่องที่ชื่อว่า Cops 183 00:20:12,004 --> 00:20:18,871 เกิดตอนหลังกว่านิดหน่อย เลยลื่นไหลกว่าเล็กน้อย 184 00:20:18,871 --> 00:20:25,290 แต่ก็สไตล์คล้ายกันนะครับ มีการ์ดข้อความด้วย 185 00:20:25,290 --> 00:20:29,320 อันนี้เป็นของ Buster Keaton 186 00:20:29,320 --> 00:20:34,993 นี่คือสไตล์ที่เรากำลังมองหาครับ prompt 187 00:20:34,993 --> 00:20:40,516 แรกที่ให้กับทั้งคู่ และจะมีสาม prompt 188 00:20:40,516 --> 00:20:46,487 รวมเป็นสามรอบ คือ "people walking down a 189 00:20:46,487 --> 00:20:51,563 boardwalk" (คนเดินลงจากบอร์ดวอล์ก) 190 00:20:51,563 --> 00:20:58,430 ภาพแรกนี้คือผลจาก LTX ปกติเลยนะครับ ไม่มี LoRA 191 00:20:58,430 --> 00:21:04,699 ไม่ได้พูดถึง silent cinema เป็นแค่วิดีโอ 5 192 00:21:04,699 --> 00:21:11,268 วินาทีของคนเดินลงจากบอร์ดวอล์ก ผลออกมาง่าย ๆ 193 00:21:11,268 --> 00:21:15,746 ตรงไปตรงมา ภาพต่อมาคือสั่ง LTX 194 00:21:15,746 --> 00:21:22,613 ให้สร้างวิดีโอคนเดินบนบอร์ดวอล์กในสไตล์ silent 195 00:21:22,613 --> 00:21:28,136 cinema โดยใส่เป็นข้อความใน prompt เลย 196 00:21:28,136 --> 00:21:34,854 อันนี้ก็ยังไม่มี LoRA นะครับ เป็นเพียงการตั้ง 197 00:21:34,854 --> 00:21:39,482 baseline ให้เห็นพื้นฐานเท่านั้น 198 00:21:39,482 --> 00:21:45,304 ผลออกมาไม่เลวเลย แต่อาจจะไม่ค่อย grainy 199 00:21:45,304 --> 00:21:51,723 (มีเม็ดฟิล์ม) และอาจจะลื่นไหลเกินไปนิดหน่อย 200 00:21:51,723 --> 00:21:57,246 ส่วนใบหน้าคนก็มีความผิดเพี้ยนอยู่บ้าง 201 00:21:57,246 --> 00:22:03,068 ทีนี้มาดูผลงานชิ้นแรกจาก Fable ครับ คือ 202 00:22:03,068 --> 00:22:09,785 "people walking down a boardwalk" โดยใช้ LoRA 203 00:22:09,785 --> 00:22:15,906 ที่เพิ่งฝึกจาก Fable ครับ วิดีโอ 5 วินาที 204 00:22:15,906 --> 00:22:19,190 จะเห็นว่ายังไม่สมบูรณ์ 205 00:22:19,190 --> 00:22:25,460 มีบางจุดที่ดูเหมือนถูกบีบอัดหรือผิดสัดส่วน 206 00:22:25,460 --> 00:22:30,386 แต่ก็ได้เม็ดฟิล์มแบบยุคนั้นมาบ้าง 207 00:22:30,386 --> 00:22:33,222 ขอบด้านข้างดูไหม้ ๆ 208 00:22:33,222 --> 00:22:42,926 เล็กน้อย ซึ่งทำให้ดู authentic สมจริงยิ่งขึ้นแม้ว่าตัวคนจะดูมัว ๆ 209 00:22:42,926 --> 00:22:49,494 ไปบ้างก็ตาม ต่อมาเป็นผลงานของ GPT 5.6 Sol ใน 210 00:22:49,494 --> 00:22:55,167 prompt เดียวกันครับ คนเดินบนบอร์ดวอล์ก 211 00:22:55,167 --> 00:23:00,093 มาดูผลกัน ลื่นไหลกว่า สะอาดตากว่า 212 00:23:00,093 --> 00:23:06,661 ดูคล้ายกับผลจาก prompt ปกติที่ไม่มี LoRA มาก 213 00:23:06,661 --> 00:23:10,244 คุณภาพดูจะดีกว่านิดหน่อย 214 00:23:10,244 --> 00:23:16,215 แต่ผลก็ใกล้เคียงกันมากครับ เราจะทำอีกสอง 215 00:23:16,215 --> 00:23:22,336 prompt ครับ prompt ที่สองคือ "an airplane 216 00:23:22,336 --> 00:23:26,217 flying over the mountains" 217 00:23:26,217 --> 00:23:32,785 (เครื่องบินบินเหนือภูเขา) ผลงานจาก Fable คือ 218 00:23:32,785 --> 00:23:36,368 เข้ากับสไตล์ได้ดีมากครับ 219 00:23:36,368 --> 00:23:40,996 มีเครื่องบินอยู่ตรงนั้น ดูดีเลย 220 00:23:40,996 --> 00:23:44,578 และก็มีภูเขาอยู่ด้านหลัง 221 00:23:44,578 --> 00:23:48,907 ไม่แน่ใจว่าคนที่เดินอยู่รอบ ๆ 222 00:23:48,907 --> 00:23:59,656 รถพ่วงคืออะไร แต่สไตล์นั้นเข้าเป้าแน่นอนครับ ชอบเม็ดฟิล์มแบบหนังยุคแรก ๆ 223 00:23:59,656 --> 00:24:08,015 ของ Fable และบอกได้เลยว่ามันต่างจากการใส่ prompt เปล่า ๆ 224 00:24:08,015 --> 00:24:14,584 แน่นอน คือ LoRA มีผลจริง ๆ ครับ ทีนี้มาดูของ 225 00:24:14,584 --> 00:24:20,107 GPT 5.6 Sol บ้าง มีเครื่องบินอยู่ครับ 226 00:24:20,107 --> 00:24:26,974 ถือว่าเป็นเครื่องบินที่บินเหนือภูเขาได้ถูกต้อง 227 00:24:26,974 --> 00:24:32,796 แต่เม็ดฟิล์มดูจะน้อยกว่า ลื่นไหลไปหน่อย 228 00:24:32,796 --> 00:24:39,215 จนเกือบจะลื่นไหลเกินไปด้วยซ้ำ เครื่องบินของ 229 00:24:39,215 --> 00:24:45,484 Sol เคลื่อนที่ลื่นไหลมาก เทียบกับของ Fable 230 00:24:45,484 --> 00:24:50,859 ที่สั่นไหวมากกว่า และที่ชอบของ Fable 231 00:24:50,859 --> 00:24:56,382 คือเครื่องบินนั้นเป็นแบบยุคนั้นจริง ๆ 232 00:24:56,382 --> 00:25:03,249 คือเครื่องบินในช่วงต้นศตวรรษที่ 20 ส่วนของ Sol 233 00:25:03,249 --> 00:25:08,772 เป็นเครื่องบินสมัยใหม่กว่า ไม่มีใบพัด 234 00:25:08,772 --> 00:25:15,191 ดูเหมือนเครื่องร่อนเสียมากกว่า ถือว่า Fable 235 00:25:15,191 --> 00:25:21,610 ได้แต้มนี้ไปครับ แม้ว่า Sol จะยึดตาม prompt 236 00:25:21,610 --> 00:25:26,686 มากกว่าก็ตาม สำหรับ prompt สุดท้าย 237 00:25:26,686 --> 00:25:32,508 ผมอยากทำอะไรที่บ้าน ๆ หน่อย คือ "a wild 238 00:25:32,508 --> 00:25:38,927 shootout between cops and robbers in space" 239 00:25:38,927 --> 00:25:46,689 (การยิงปะทะกันอย่างดุเดือดระหว่างตำรวจกับโจรในอวกาศ) 240 00:25:46,689 --> 00:25:52,959 ซึ่ง obviously ไม่มีวิดีโอไหนมีฉากอวกาศเลย 241 00:25:52,959 --> 00:25:58,930 แต่ก็มีบางเรื่องที่มีตำรวจกับโจรอยู่บ้าง 242 00:25:58,930 --> 00:26:05,648 นี่คือผลงานของ Claude Fable ใน prompt นี้ครับ 243 00:26:05,648 --> 00:26:08,036 ดูจะวุ่นวายหน่อย 244 00:26:08,036 --> 00:26:12,515 คาดว่าน่าจะเป็นตำรวจกับโจรครับ 245 00:26:12,515 --> 00:26:15,052 ภาพคนผิดเพี้ยนมาก 246 00:26:15,052 --> 00:26:21,322 ถ้าไม่นับเรื่องความผิดเพี้ยนของตัวละครแล้ว 247 00:26:21,322 --> 00:26:27,741 สภาพแวดล้อมก็ไม่ได้อยู่ในอวกาศซึ่งเป็นปัญหา 248 00:26:27,741 --> 00:26:32,817 แต่คุณภาพของฟิล์มในแง่ของเม็ดฟิล์ม 249 00:26:32,817 --> 00:26:34,757 การเคลื่อนไหว 250 00:26:34,757 --> 00:26:42,072 และการกระพริบของภาพนั้นเลียนแบบสไตล์ได้ดีอยู่ครับ 251 00:26:42,072 --> 00:26:46,998 ทั้งนี้ก็ต้องยอมรับว่าเป็น prompt 252 00:26:46,998 --> 00:26:57,746 ที่ยากเพราะมีแอ็กชันเยอะและไม่มีข้อมูลอ้างอิงสำหรับฉากอวกาศในสไตล์นี้เลย 253 00:26:57,746 --> 00:27:03,419 โอเค นี่คือผลของ GPT 5.6 Sol ใน prompt 254 00:27:03,419 --> 00:27:08,047 เดียวกันครับ มาดูกัน ก็ไม่รู้สิ 255 00:27:08,047 --> 00:27:14,914 คนดูจริงขึ้นกว่า แต่ก็ไม่มีการยิงปะทะกันจริง ๆ 256 00:27:14,914 --> 00:27:19,541 และก็ไม่ได้อยู่ในอวกาศเหมือนกัน 257 00:27:19,541 --> 00:27:23,273 ดูจะอยู่ในสำนักงานมากกว่า 258 00:27:23,273 --> 00:27:30,588 ทั้งสองชิ้นเอาฉากมาจากชุดข้อมูลที่ใช้ฝึกโดยตรงเลย 259 00:27:30,588 --> 00:27:36,410 เพราะโมเดลไม่มีข้อมูลอ้างอิงเรื่องอวกาศ 260 00:27:36,410 --> 00:27:42,530 จึงดึงฉากจากชุดข้อมูลภาพยนตร์มาใช้แทนครับ 261 00:27:42,530 --> 00:27:48,054 ดังนั้นทั้งคู่ต่างก็มีปัญหากับ prompt 262 00:27:48,054 --> 00:27:54,771 นี้เหมือนกัน ขออีกครั้งกับผลงานของ Fable ครับ 263 00:27:54,771 --> 00:27:58,951 ใช่เลย prompt ยากจริง ๆ โอเค 264 00:27:58,951 --> 00:28:05,072 ขอให้ดูแบบเคียงข้างกันนะครับ ด้านซ้ายเป็น 265 00:28:05,072 --> 00:28:08,654 Fable และด้านขวาเป็น Sol 266 00:28:08,654 --> 00:28:12,386 เพื่อเทียบสไตล์ที่ต่างกัน 267 00:28:12,386 --> 00:28:20,298 รู้สึกว่าในเรื่องบอร์ดวอล์กนั้นทั้งคู่ใกล้เคียงกันมาก 268 00:28:20,298 --> 00:28:25,523 อาจจะมีสไตล์ที่หนักแน่นกว่านิดหน่อย 269 00:28:25,523 --> 00:28:30,897 แต่ก็ถือว่าใกล้เคียงกัน ต่อมา prompt 270 00:28:30,897 --> 00:28:35,823 เครื่องบินครับ ซ้าย Fable ขวา Sol 271 00:28:35,823 --> 00:28:38,660 ในรอบนี้ผมว่า Fable 272 00:28:38,660 --> 00:28:45,228 ทำได้ดีกว่าในการถ่ายทอดคุณภาพของยุคนั้นออกมา 273 00:28:45,228 --> 00:28:51,348 โดยเฉพาะเครื่องบินที่เป็นแบบยุคนั้นชัดเจน 274 00:28:51,348 --> 00:28:56,424 คือเป็นเครื่องบินใบพัด ส่วนของ Sol 275 00:28:56,424 --> 00:29:03,291 นั้นเหมือนเครื่องบินเจ็ตเสียมากกว่า แม้ว่า Sol 276 00:29:03,291 --> 00:29:09,859 จะได้ภูเขามาถูกต้องก็ตาม เครื่องบินของ Fable 277 00:29:09,859 --> 00:29:14,487 กำลังบินขึ้น มีภูเขาเป็นฉากหลัง 278 00:29:14,487 --> 00:29:21,204 สังเกตขอบของวิดีโอ Fable จะเห็นว่าขอบมีการจาง 279 00:29:21,204 --> 00:29:22,304 ๆ 280 00:29:22,304 --> 00:29:34,247 ซึ่งเป็นลักษณะเฉพาะของฟิล์มยุคนั้น ในขณะที่ Sol ก็ทำได้ดีแต่พลาดรายละเอียดเล็ก ๆ 281 00:29:34,247 --> 00:29:40,666 น้อย ๆ เหล่านี้ไปครับ สำหรับ prompt สุดท้าย 282 00:29:40,666 --> 00:29:43,651 การยิงปะทะกันในอวกาศ 283 00:29:43,651 --> 00:29:52,160 ทั้งคู่ต่างก็มีปัญหาเพราะไม่มีข้อมูลอ้างอิงในชุดข้อมูลเลย 284 00:29:52,160 --> 00:29:58,729 ขอให้ดูอีกครั้งครับ ซ้ายคือ Fable ขวาคือ Sol 285 00:29:58,729 --> 00:30:04,849 ดูติด ๆ กันได้ จะเห็นได้อีกครั้งว่า Fable 286 00:30:04,849 --> 00:30:13,657 ทำเรื่องการกระพริบของภาพและเนื้อสัมผัสของสไตล์นั้นได้ดีกว่า 287 00:30:13,657 --> 00:30:19,180 ส่วนของ Sol ดูจะขัดเกลาเกินไปนิดหน่อย 288 00:30:19,180 --> 00:30:27,689 แม้ทั้งคู่จะมีปัญหากับตัวละครและเนื้อเรื่องเหมือนกันก็ตาม 289 00:30:27,689 --> 00:30:35,750 และนี่อีกตัวอย่างครับของสไตล์จากชุดข้อมูลที่ต้องการแบบ 290 00:30:35,750 --> 00:30:36,850 grainy 291 00:30:36,850 --> 00:30:42,971 พร้อมการเคลื่อนไหวเป็นเอกลักษณ์ของยุคนั้น 292 00:30:42,971 --> 00:30:48,942 พูดตรง ๆ ว่าทั้งคู่ทำได้ดีพอสมควรเลยครับ 293 00:30:48,942 --> 00:30:54,316 เป็นการแข่งขันที่สูสีมาก การฝึก LoRA 294 00:30:54,316 --> 00:30:57,302 ไม่ใช่เรื่องง่ายครับ 295 00:30:57,302 --> 00:31:02,377 โดยเฉพาะกับเนื้อหาแบบวิดีโอเช่นนี้ 296 00:31:02,377 --> 00:31:06,557 เพราะนี่เป็นโมเดลสร้างวิดีโอ 297 00:31:06,557 --> 00:31:16,260 และชุดข้อมูลที่ให้ฝึกก็ค่อนข้างเล็กเมื่อเทียบกับที่ห้องปฏิบัติการ 298 00:31:16,260 --> 00:31:19,544 AI มืออาชีพใช้ฝึกโมเดล 299 00:31:19,544 --> 00:31:23,873 แต่ก็ต้องมีผู้ชนะเพียงคนเดียว 300 00:31:23,873 --> 00:31:28,949 และผลขึ้นอยู่กับการตัดสินของผมครับ 301 00:31:28,949 --> 00:31:34,472 อาจจะมีคนไม่เห็นด้วยกับการตัดสินของผม 302 00:31:34,472 --> 00:31:37,159 แต่นี่คือช่องของผม 303 00:31:37,159 --> 00:31:44,026 ผมก็เลยได้เป็นผู้มอบมงกุฎให้ผู้ชนะของ AI Royal 304 00:31:44,026 --> 00:31:48,355 Rumble เดือนกรกฎาคม 2026 ครับ 305 00:31:48,355 --> 00:31:52,237 เป็นการแข่งขันที่ดีมากครับ 306 00:31:52,237 --> 00:31:59,253 ผมดีใจที่รอบสุดท้ายไม่ใช่การถล่มทลายทิ้งห่างกัน 307 00:31:59,253 --> 00:32:05,672 ขอใช้สัญชาตญาณจากการดูวิดีโอเหล่านี้หลายรอบ 308 00:32:05,672 --> 00:32:12,389 ว่าโมเดลไหนถ่ายทอดภาพยนตร์ต้นฉบับได้ดีกว่ากัน 309 00:32:12,389 --> 00:32:18,958 และโมเดลไหนที่ผมควรใช้จริง ๆ หากต้องการสร้าง 310 00:32:18,958 --> 00:32:23,287 fine-tuning adapter หรือ LoRA 311 00:32:23,287 --> 00:32:30,154 เพื่อสร้างวิดีโอสไตล์ early silent cinema ครับ 312 00:32:30,154 --> 00:32:37,021 ดังนั้น ผู้ชนะของ AI Royal Rumble เดือนกรกฎาคม 313 00:32:37,021 --> 00:32:42,842 2026 คือ Fable ครับ นั่นคือ Fable 5 จาก 314 00:32:42,842 --> 00:32:49,560 Anthropic ซึ่งเป็นโมเดล frontier ระดับท็อปของ 315 00:32:49,560 --> 00:32:55,382 Claude ตั้งแต่เข้าสู่การแข่งขันมา Fable 316 00:32:55,382 --> 00:32:57,920 ก็เป็นตัวเต็งครับ 317 00:32:57,920 --> 00:33:08,220 เป็นโมเดลที่ผมส่วนตัวรู้สึกว่าเป็นโมเดลที่ดีที่สุดโดยรวมสำหรับงานหนัก 318 00:33:08,220 --> 00:33:09,320 ๆ 319 00:33:09,320 --> 00:33:17,232 แบบ long-horizon tasks (งานที่ใช้เวลานาน) โมเดลอื่น ๆ 320 00:33:17,232 --> 00:33:31,115 อาจจะเก่งเรื่องงานเฉพาะด้าน แต่โดยรวมแล้ว สำหรับงานลักษณะนี้ที่ใช้เวลาหลายชั่วโมงและยากจริง ๆ 321 00:33:31,115 --> 00:33:34,548 ผมรู้สึกมาตลอดว่า Fable 322 00:33:34,548 --> 00:33:42,759 ตั้งแต่ออกมานั้นเป็นโมเดลที่ดีที่สุดสำหรับงานแบบนี้ครับ 323 00:33:42,759 --> 00:33:44,998 ดังนั้น Fable 5 324 00:33:44,998 --> 00:33:52,313 จึงคว้าเข็มขัดแชมป์ของการแข่งขันครั้งแรกนี้ไปครับ 325 00:33:52,313 --> 00:33:56,492 ส่วน Sol ที่น่าสงสารตกเวทีไป 326 00:33:56,492 --> 00:34:05,599 ผมขอบอกว่าประทับใจกับความสมดุลระหว่างคุณภาพและความเร็วมากครับ 327 00:34:05,599 --> 00:34:08,435 เพราะเร็วกว่า Fable 328 00:34:08,435 --> 00:34:13,510 และเร็วกว่าอีกหลายโมเดลอย่างชัดเจน 329 00:34:13,510 --> 00:34:19,183 และผลงานก็แย่กว่าเพียงเล็กน้อยเท่านั้น 330 00:34:19,183 --> 00:34:22,616 แต่ในการแข่งขันครั้งนี้ 331 00:34:22,616 --> 00:34:29,035 คุณภาพคือสิ่งสำคัญที่สุด ไม่ใช่ความเร็วครับ 332 00:34:29,035 --> 00:34:32,320 อย่างไรก็ตาม ในงานจริง 333 00:34:32,320 --> 00:34:38,440 ถ้าใครต้องการทั้งคุณภาพสูงและความเร็ว Sol 334 00:34:38,440 --> 00:34:44,113 น่าจะเป็นตัวเลือกที่น่าประทับใจมากครับ 335 00:34:44,113 --> 00:34:46,352 แต่รอบนี้ Fable 336 00:34:46,352 --> 00:34:51,129 คว้าเข็มขัดแชมป์ประจำเดือนไปครับ 337 00:34:51,129 --> 00:34:57,249 ทุกเดือนมีโมเดล frontier ตัวใหม่ออกมาเสมอ 338 00:34:57,249 --> 00:35:03,221 และคนดูก็ชอบวิดีโอแนวนี้ครับ ก็น่าสนใจดี 339 00:35:03,221 --> 00:35:08,595 เพราะในช่องนี้ ผมมักทำคอนเทนต์สั้น ๆ 340 00:35:08,595 --> 00:35:20,388 เยอะ ผมทำวิดีโอ first look หลายชิ้นที่เป็นแบบจบในตัว one-shot แม้ในวิดีโออื่น ๆ 341 00:35:20,388 --> 00:35:21,488 ของผม 342 00:35:21,488 --> 00:35:28,056 ก็ไม่ได้ทำอะไรแบบนี้ที่ใช้เวลาหลายชั่วโมงนัก 343 00:35:28,056 --> 00:35:33,281 บางครั้งงานก็ใช้เวลาถึง 3–4 ชั่วโมง 344 00:35:33,281 --> 00:35:37,610 เวลาจับคู่โมเดลเปรียบเทียบกัน 345 00:35:37,610 --> 00:35:42,686 ผมบางครั้งก็ทำเป็นงาน ๆ แยกต่างหาก 346 00:35:42,686 --> 00:35:45,373 แต่ก็น่าสนใจดีครับ 347 00:35:45,373 --> 00:35:53,882 เราจะดูกันตอนปลายเดือนสิงหาคมว่าคนดูชอบวิดีโอนี้หรือเปล่า 348 00:35:53,882 --> 00:36:00,151 และเดือนสิงหาคมก็จะมีโมเดลใหม่ ๆ เยอะแน่ ๆ 349 00:36:00,151 --> 00:36:06,869 ผมทราบว่าจะมีโมเดล Grok ใหม่ออกมา อาจจะมี GPT 350 00:36:06,869 --> 00:36:13,586 6 (มีข่าวลือเรื่อง GPT 6) ข่าวลือเรื่อง Fable 351 00:36:13,586 --> 00:36:19,856 5.1 ก็มีด้วย แล้วเจ้าตัวไหนจะออกมาจริงบ้าง 352 00:36:19,856 --> 00:36:26,425 เรามาดูกันครับ และแน่นอนว่าน่าจะมีโมเดล open 353 00:36:26,425 --> 00:36:28,514 weights ใหม่ ๆ 354 00:36:28,514 --> 00:36:41,800 ออกมาด้วย เช่นโมเดล Kimi K3 หรือพวก BLM ก็ต้องดูกันต่อไปครับ ถ้าโมเดลเหล่านั้นออกมาจริง ๆ 355 00:36:41,800 --> 00:36:49,712 ผมก็จะจัดการแข่งขันอีกครั้งในช่วงปลายเดือนสิงหาคมครับ 356 00:36:49,712 --> 00:36:56,579 แต่ตอนนี้ขอรอดูไปก่อน สำหรับการแข่งขันครั้งนี้ 357 00:36:56,579 --> 00:37:01,655 ผู้ชนะอย่างเป็นทางการก็คือ Fable 5 358 00:37:01,655 --> 00:37:07,327 อีกครั้งครับ ขอบคุณทุกท่านที่รับชมครับ 359 00:37:07,327 --> 00:37:10,761 ถ้าใครมีความคิดเห็นอะไร 360 00:37:10,761 --> 00:37:15,388 ก็คอมเมนต์กันเข้ามาได้เลยนะครับ 361 00:37:15,388 --> 00:37:19,867 ว่าคิดว่าใครจะชนะการแข่งขันนี้ 362 00:37:19,867 --> 00:37:27,331 ผมทราบดีว่ารอบสุดท้ายกับเรื่องวิดีโอนั้นเป็นเรื่อง 363 00:37:27,331 --> 00:37:33,153 subjective (ขึ้นกับมุมมองส่วนบุคคล) มาก 364 00:37:33,153 --> 00:37:43,304 เป็นความรู้สึกโดยรวมของผมเองว่าโมเดลไหนถ่ายทอดงานต้นฉบับได้ดีกว่ากัน 365 00:37:43,304 --> 00:37:47,334 แต่ก็คอมเมนต์มาได้เลยนะครับ 366 00:37:47,334 --> 00:37:50,917 แชร์ความคิดเห็นกันเข้ามา 367 00:37:50,917 --> 00:37:55,694 ถ้าใครไม่เห็นด้วยก็ไม่เป็นไรครับ 368 00:37:55,694 --> 00:38:00,172 แต่นี่ก็เป็นอันจบวิดีโอนี้ครับ 369 00:38:00,172 --> 00:38:00,400 ขอบคุณที่รับชมครับ