AI Royal Rumble: Part 1 (Kimi K3 v. Fable v. Sol v. Grok v. GLM)
สรุปย่อ
ประเด็นสำคัญจากวิดีโอ
- **ช่อง:** Tonbi's AI Garage · **ความยาว:** ~31 นาที · **ลิงก์:** https://www.youtube.com/watch?v=vYi5Sab1RFc
# สรุป: AI Royal Rumble: Part 1 (Kimi K3 v. Fable v. Sol v. Grok v. GLM) - **ช่อง:** Tonbi's AI Garage · **ความยาว:** ~31 นาที · **ลิงก์:** https://www.youtube.com/watch?v=vYi5Sab1RFc ## ประเด็นหลัก - **รูปแบบการแข่งขัน:** โมเดล AI แนวหน้า 5 ตัว (Fable, Sol, Grok 4.5, Kimi K3, GLM 5.2) ทำภารกิจเดียวกัน 4 รอบ ทุกรอบคัดออกทีละตัวจนเหลือแชมป์หนึ่งเดียว โดยทำงานโดยไม่มีการแจ้งเตือนเพิ่มเติม ห้ามถามคำถามขอความชัดเจน - **เกณฑ์การตัดสิน:** ความสามารถในการทำตามคำสั่ง คุณภาพงาน ความคิดสร้างสรรค์ และใช้ความเร็วเป็นเกณฑ์ตัดสินเมื่อคะแนนใกล้เคียงกัน - **4 ภารกิจ:** (1) สร้าง landing page พร้อม scroll animation (2) ระบบเทรดจำลอง (paper trader) (3) พัฒนาเกมปริศนาแนว time loop (4) เทรน LoRA สไตล์ silent cinema - **รอบที่ 1 — Landing Page:** Grok 4.5 เสร็จเร็วที่สุด (19 นาที) แต่งานพื้นฐาน Sol มีสไตล์ดี มีไดนามิก GLM 5.2 พัง (scroll ไม่ทำงาน) Fable ทำได้ดีที่สุดโดยรวม Kimi K3 ใช้เวลาเกือบ 2 ชั่วโมงแต่ผลงานแข็งแกร่ง - **ผู้ถูกคัดออกรอบแรก:** GLM 5.2 — งานพัง การเลื่อนหน้าไม่ทำงาน - **รอบที่ 2 — Paper Trading:** ทุกโมเดลเลือกกลยุทธ์ trend following breakout แบบ Donchian โดยอิสระ ใช้สัญลักษณ์ใกล้เคียงกัน (Bitcoin, ETH, SOL, ทองคำ) รันบน Hyperliquid perpetuals - **ผลการเทรด:** Fable ทำกำไรเล็กน้อย (+0.26%) Kimi K3 ขาดทุนเล็กน้อย Sol ขาดทุนมากขึ้น Grok 4.5 ขาดทุนหนักที่สุด (-12%) เพราะเทรดถี่เกินไป (144 ครั้ง) - **ผู้ถูกคัดออกรอบสอง:** Grok 4.5 — เร็วที่สุดแต่ไม่ตรวจสอบและทดสอบย้อนหลังให้ละเอียด จึงเทรดถี่เกินไปและขาดทุนหนัก - **ความเร็วไม่ใช่ทุกอย่าง:** Grok เสร็จเร็วที่สุดทั้งสองรอบ แต่ผลงานตามหลังคู่แข่งเสมอ — ความเร็วที่ไร้การตรวจสอบกลับเป็นจุดอ่อน - **ความคาดหวังภาคสอง:** เหลือ Fable, Sol, Kimi K3 ตัวสุดท้าย จะแข่งพัฒนาเกม time loop และเทรน LoRA บนเครื่อง NVIDIA DGX Spark - **ค่าใช้จ่าย:** Kimi K3 มีส่วนลด ~20% ทำให้ใช้เวลานานเกือบ 2 ชั่วโมงแต่ค่าใช้จ่ายต่ำ (ต่ำกว่า $6 ต่อภารกิจ) ## ความเห็นสรุป การแข่งขันนี้แสดงให้เห็นชัดว่า benchmark ไม่ใช่ตัวบ่งชี้เดียวที่บอกว่าโมเดลไหนดีที่สุด การนำไปใช้จริงในงานที่ซับซ้อนเปิดเผยจุดเด่นและจุดอ่อนที่ตัวเลขไม่สะท้อน เช่น Grok เร็วสุดแต่พลาดเรื่องคุณภาพและการตรวจสอบ ขณะที่ Fable สมดุลทั้งคุณภาพและความเร็ว และ Kimi K3 ใช้เวลามากแต่ผลงานคุ้มค่า น่าติดตามต่อในภาคสองว่าสามตัวสุดท้ายจะทำงานที่ซับซ้อนยิ่งขึ้นอย่างเกมและการเทรนโมเดลได้อย่างไร
คำแปลเต็ม
แปลตามบทสนทนาต้นฉบับ ปรับเป็นภาษาไทยธรรมชาติ
ยินดีต้อนรับสู่ AI Royal Rumble เดือนกรกฎาคม 2026 ครับ โมเดลแนวหน้า (Frontier models) ห้าตัวจะเข้าร่วมการแข่งขัน และจะมีเพียงตัวเดียวเท่านั้นที่ได้รับการสวมมงกุฎเป็นแชมป์ มาดูกันครับว่ามันทำงานกันอย่างไร ผมจะให้โมเดลแนวหน้าทั้งห้าตัวทำภารกิจเดียวกัน ใช้เครื่องมือเดียวกัน และไม่มีความช่วยเหลือใด ๆ ภารกิจที่ผมมอบหมายให้จะตั้งใจให้ยากพอสมควร แต่ก็ยังเป็นไปได้ที่จะทำให้สำเร็จด้วยเครื่องมือที่ให้ไว้ โมเดลแต่ละตัวต้องทำงานคนเดียวโดยไม่มีการแจ้งเตือนเพิ่มเติม ห้ามถามคำถามเพื่อขอความชัดเจน ห้ามมาเช็คอิน และห้ามเสนอตัวเลือกให้เลือก พร็อมต์ค่อนข้างละเอียดมาก ดังนั้นโมเดลจะมีทุกอย่างที่จำเป็นต่อการทำภารกิจนี้ให้สำเร็จ
เมื่อจบแต่ละรอบ โมเดลที่อ่อนที่สุดจะถูกคัดออก การแข่งขันจะมีทั้งหมดสี่รอบ ดังนั้นเราจะเริ่มจากห้าตัว แล้วแต่ละรอบจะตัดออกทีละตัวจนเหลือรอบชิงชนะเลิศที่จะมีสองตัวเผชิญหน้ากัน เพื่อหาว่าใครคือแชมป์ โมเดลแนวหน้าที่แข็งแกร่งที่สุดในตอนนี้ของปลายเดือนกรกฎาคม 2026 คือตัวไหน? ผมรู้ว่ามี benchmark (เกณฑ์วัดประสิทธิภาพ) อยู่เยอะแยะ มีตัวเลขมากมาย มีการอ้างสิทธิ์ต่าง ๆ นานา แต่นี่คือการท้าทายที่เด็ดขาดสำหรับ Tonbi's AI Garage ครับ
และถ้าใครรัน agent (เอเจนต์) เองแล้วอยากเข้าถึง LM wiki (วิกิฐานความรู้สำหรับโมเดลภาษา) ที่ผมใช้สำหรับค้นคว้าและสร้างวิดีโอเหล่านี้ ไปดูโปรเจกต์ agentwiks.com ของผมได้เลยครับ ผมให้วิกิเหล่านี้ทั้งหมดฟรีในหลากหลายหัวข้อ และคุณยังสามารถสมัครบัญชี pro ในราคา 9.99 ดอลลาร์ต่อเดือนได้ ซึ่งจะทำให้คุณเข้าถึงวิกิขนาดใหญ่พิเศษที่มีหน้ามากกว่าและรายละเอียดมากกว่าในแต่ละหัวข้อ
ทีนี้กลับมาที่วิดีโอกันครับ นี่คือกฎเกณฑ์ต่าง ๆ และเป็นส่วนหนึ่งของพร็อมต์ที่จะใช้กับทุก ๆ ภารกิจ โมเดลจะต้องตัดสินใจด้วยตัวเอง ไม่สามารถถามคำถามเพื่อขอความชัดเจนได้ ส่วนที่กำกวมต้องแก้ด้วยตัวเอง ข้อกำหนดต่าง ๆ จงใจปล่อยให้เปิดกว้าง โมเดลต้องเลือกแนวทางการตีความหนึ่ง เขียนมันลงไป แล้วลงมือสร้าง โมเดลต้องทำให้เสร็จ หรือไม่ก็บอกว่าทำไม่ได้ ถ้าติดขัดที่จุดใด ต้องทำส่วนอื่นให้ครบทั้งหมด แล้วระบุชัดว่าส่วนใดที่ทำไม่ได้ ห้ามจำลองการทำงานหรืออ้างว่าเสร็จแล้วถ้ายังไม่เสร็จจริง ห้ามอ้างว่ารันแล้วในสิ่งที่ไม่ได้รัน เราต้องการรายงานที่ซื่อสัตย์ของงานที่มีข้อบกพร่อง ซึ่งจะได้คะแนนสูงกว่ารายงานที่มั่นใจว่าทำได้สมบูรณ์แต่จริง ๆ พัง และโมเดลเองจะเป็นผู้ตัดสินใจว่าเมื่อไรถึงเสร็จ ผมจะไม่ใช้คำสั่ง /goal หรือ agentic loop (วงจรการทำงานอัตโนมัติของเอเจนต์) ใด ๆ เหล่านี้เป็นโมเดลแนวหน้าระดับท็อปของตลาด พวกมันเก่งมากในการสร้าง ตรวจสอบ แล้ววนซ้ำพัฒนาต่อไปได้ด้วยตัวเองทั้งหมด ไม่ต้องใช้คำสั่งกำหนดเองหรืออะไรแบบนั้น
งั้นผมตัดสินพวกมันอย่างไร? ผมจะตัดสินจากเกณฑ์ประมาณนี้ครับ เรื่องโครงสร้างและการทำตามคำสั่ง พวกมันทำตามข้อกำหนดในพร็อมต์หรือไม่? งานจริงออกมาเป็นอย่างไร? เป็นงานคุณภาพหรือขยะ? พวกมันใช้ความคิดสร้างสรรค์แบบไหนในการตัดสินใจและในผลงานที่ออกมา? และสุดท้าย ถ้าทุกอย่างพอ ๆ กัน ผมจะนำความเร็วและประสิทธิภาพมาพิจารณาด้วย อย่างไรก็ตาม นี่ไม่ใช่ปัจจัยตัดสินหลัก ผมจะให้ความสำคัญกับคุณภาพมากกว่าความเร็ว แต่ถ้ามีโมเดลสองตัวที่ผลงานใกล้เคียงกัน ผมจะใช้ความเร็วเป็นเกณฑ์ตัดสิน
ทีนี้มาดูภารกิจกันครับ ผมจะอธิบายรายละเอียดของแต่ละภารกิจมากขึ้นเมื่อถึงคราวของมัน แต่ภาพรวมจะเป็นสี่รอบดังนี้ รอบที่หนึ่งจะเป็นการสร้างอินเทอร์เฟซ เว็บไซต์ launch (เปิดตัว) พร้อม scroll control (การควบคุมการเลื่อนหน้า) ที่สร้างจากระบบภาพที่โมเดลออกแบบเองและต้องยึดตามนั้น รอบที่สองจะเป็นการท้าทายการเทรด โมเดลต้องพัฒนา paper trader (ระบบเทรดจำลอง) แบบเรียลไทม์จากการวิจัยของตัวเอง ต้องคิดอัลกอริทึมของตัวเอง แล้วเราจะรันมันเป็นเวลาสองวันเพื่อดูว่าโมเดลไหนทำเงินได้มากที่สุด รอบที่สามคือการพัฒนาเกม โมเดลต้องสร้างเกมปริศนาแพลตฟอร์มแนว time loop (วนลูปเวลา) ที่ผู้เล่นต้องร่วมมือกับ "ตัวตนในอดีต" ของตัวเองที่บันทึกไว้ เป็นระบบเกมที่ก้าวหน้ามาก แต่ผมเชื่อว่าโมเดลเหล่านี้ทำได้ และรอบสุดท้าย โมเดลจะต้องเทรน LoRA (อะแดปเตอร์สำหรับ fine-tuning หรือการปรับแต่งโมเดล) โดยเฉพาะการเทรน video LoRA สไตล์ silent cinema (ภาพยนตร์เงียบ) บนเครื่องเซิร์ฟเวอร์จริงที่ไม่ได้เตรียมไว้สำหรับสิ่งนี้เลย กล่าวคือ โมเดลจะได้รับโมเดลสร้างวิดีโอหนึ่งตัว แล้วต้องสร้าง LoRA นี้ขึ้นมาเพื่อให้ตรงกับสไตล์ silent cinema
งั้นใครคือผู้เข้าแข่งขันบ้าง? อันดับแรกจาก Anthropic จากซานฟรานซิสโกในสหรัฐอเมริกา คือ Claude Fable ซึ่ง Fable เป็นตัวเต็งของบ้านเลยก็ว่าได้ครับ รู้จักกันอีกชื่อในนาม Mythos แต่มี guardrail (ข้อจำกัดเพื่อความปลอดภัย) มากกว่า ถ้า Fable ชน guardrail ระหว่างการแข่งขัน จะถูกดาวน์เกรดเป็น Opus 5 หรืออาจจะเป็น Opus 4.8 แล้วต้องทำงานต่อจากตรงนั้น ผมจะไม่ทำพร็อมต์ใหม่ ถ้าชน guardrail ก็ช่างมันไปครับ
ผู้เข้าแข่งขันอันดับที่สองจาก OpenAI ในซานฟรานซิสโก สหรัฐอเมริกา คือ GPT-5.6 Sol โมเดลแนวหน้าตัวล่าสุดจาก OpenAI ได้ benchmark ที่ยอดเยี่ยม รีวิวดีมาก คนบอกว่าคล้ายกับ Fable เยอะมาก งั้นมาดูกันครับว่าจะเป็นอย่างไร
อันดับที่สาม Grok 4.5 และนี่คือม้ามืด ไม่ใช่ตัวที่ผมคาดว่าจะเพิ่มเข้ามาใน AI Royal Rumble เดือนนี้ แต่มันเป็น coding agent (เอเจนต์เขียนโค้ด) ที่เด็ดขาด จึงสมควรได้รับตำแหน่งนี้ มาจาก xAI ในสหรัฐอเมริกา และผมอยากรู้มากว่ามันจะทำได้ดีแค่ไหน
อันดับที่สี่ Kimi K3 เริ่มเข้าสู่เหล่า open weights (น้ำหนักโมเดลที่เปิดให้ใช้) แล้วครับ ตัวนี้จาก Moonshot AI เป็นโมเดลจากห้องแลป AI ของจีน พวกเขาเพิ่งปล่อย open weights ออกมาเมื่อวันนี้เอง แต่ก็ถือเป็นโมเดลแนวหน้าที่น่าเกรงขามอย่างแน่นอน
สุดท้าย GLM 5.2 อีกหนึ่งโมเดล open weights ม้ามืดอีกตัวจากจีนโดย Zhipu AI และเป็นโมเดลที่คนนำไปเปรียบเทียบกับโมเดลแนวหน้าท็อป ๆ จากห้องแลปปิดอยู่เลย
นี่คือผู้เข้าแข่งขันทั้งห้าตัวครับ ทุกรอบจะคัดออกทีละตัวเพื่อหาว่าใครคือแชมป์ตัวจริงและเป็นโมเดลแนวหน้าที่ดีที่สุด ห้าโมเดลเข้าประชัน เหลือเพียงหนึ่งเดียวที่จะออกมาพร้อมมงกุฎแห่งชัยชนะ เราทำสิ่งนี้ในสัปดาห์สุดท้ายของเดือนกรกฎาคม และความคิดก็คือ ถ้าคนชอบรูปแบบนี้ ผมอาจจะทำทุกเดือนหรือทุกสองเดือน ขึ้นอยู่กับว่ามีโมเดลใหม่ออกมาเท่าไร แต่เราจะให้ภารกิจที่ท้าทายมาก ๆ แล้วดูว่าพวกมันจะทำได้แค่ไหน
ทีนี้ แต่ละโมเดลจะอยู่ใน agent harness (สภาพแวดล้อมการรันเอเจนต์) คนละแบบกัน Claude ก็จะอยู่ใน Claude Code อย่างเห็นได้ชัด ทุกตัวจะตั้งค่า high effort (ความพยายามสูง) ถ้ามีส่วนของการใช้เหตุผล GPT-5.6 จะอยู่ใน Codex ส่วน Grok จะอยู่ใน Grok Build แล้วสำหรับโมเดล GLM และ Kimi ทั้งสองตัวจะอยู่ใน Hermes Agent โดยผมได้สร้างโปรไฟล์เปล่าขึ้นมา ดังนั้นพวกมันจะไม่ได้ประโยชน์จาก Hermes Agent มาตรฐานของผมที่มี skill (ทักษะ) ต่าง ๆ มากมาย เป็นโปรไฟล์เปล่าโดยสมบูรณ์ แต่พวกมันยังคงเข้าถึงเครื่องมือต่าง ๆ ได้ เพื่อให้เป็นการแข่งขันที่ยุติธรรมระหว่างกัน เริ่มกันเลยครับ
รอบที่หนึ่ง หน้า Landing Page และนี่คือพร็อมต์ ผมจะแชร์พร็อมต์ทั้งหมดนี้ให้ครับ น่าจะเอาไว้ใน GitHub ให้ไปดูกันได้ ภารกิจคือ "สร้างเว็บไซต์ launch คุณภาพระดับ production สำหรับ AI Royal Rumble โดยใช้ Next.js, React, TypeScript, GSAP ScrollTrigger และ Lenis smooth scrolling แบบควบคุม" โดยมีแนวทางเพิ่มเติมว่าต้องทำอะไรบ้าง เรื่องทิศทางการออกแบบ ดีไซน์เป็นของโมเดลเอง ทุก scene (ฉาก) ต้องเกิดจากการเปลี่ยนรูปจากเรขาคณิตที่มีอยู่แล้วบนหน้าจอ เราจะได้เห็นอะไรที่เจ๋ง ๆ นี่ไม่ใช่แค่ทำ landing page ธรรมดานะครับ เป็นภารกิจที่ค่อนข้างยาก ต้องประกาศระบบของตัวเอง โมเดลต้องสร้าง storyboard (สตอรีบอร์ด) ออกมาก่อน และเนื้อหาที่จำเป็น ไม่ได้กำหนดข้อกำหนดเยอะมาก แต่ต้องเป็น landing page สำหรับโปรเจกต์ Royal Rumble นี้ เรื่อง motion (การเคลื่อนไหว) และวิศวกรรม นี่คือกฎเกณฑ์บางส่วนเกี่ยวกับการเคลื่อนไหว เช่น หลีกเลี่ยง gradient (การไล่สี) และ gradient text, neon blob (ก้อนแสงนีออน) ฯลฯ นี่คือสิ่งที่ต้องส่งมอบ แต่สิ่งส่งมอบหลักคือเว็บไซต์ที่ใช้งานได้จริง นี่คือพร็อมต์ และผมจะให้กับทุกตัว แล้วลุยกันเลยครับ
โอเค ผมวางพร็อมต์ลงไปแล้ว เริ่มกันเลย ปล่อยให้พวกมันรันไป Codex เริ่ม! Grok เริ่ม! GLM เริ่ม! และ Kimi เริ่ม!
หมายเหตุการแปล
ความโปร่งใสเกี่ยวกับความไม่แน่นอนในต้นฉบับ
- ## ช่วงที่ความหมายไม่ชัดเจน
- ไม่มีช่วงที่ต้องใช้ `[ฟังไม่ชัด]` ความหมายทั้งหมดสามารถเข้าใจได้จากบริบท แม้ว่าคำบรรยายอัตโนมัติจะสะกดผิดในบางจุดก็ตาม
อภิธานศัพท์เทคนิค
คำศัพท์และชื่อผลิตภัณฑ์ที่คงรูปภาษาอังกฤษ
| ศัพท์ | คำแปล / คำอธิบาย |
|---|---|
| Frontier model | โมเดลแนวหน้า — โมเดล AI ที่ทันสมัยและทรงพลังที่สุดในขณะนั้น |
| Guardrail | ข้อจำกัดเพื่อความปลอดภัย — กลไกที่ป้องกันไม่ให้โมเดลตอบหรือทำสิ่งที่ไม่พึงประสงค์ |
| Open weights | น้ำหนักโมเดลที่เปิดเผย — โมเดลที่เปิดให้ดาวน์โหลดและใช้งานได้ฟรี |
| Agent harness | สภาพแวดล้อมการรันเอเจนต์ — โปรแกรมที่โมเดลใช้ทำงานและเข้าถึงเครื่องมือต่าง ๆ |
| Agentic loop | วงจรการทำงานอัตโนมัติของเอเจนต์ — การวนซ้ำของโมเดลในการคิด ตัดสินใจ และลงมือทำ |
| Iterative loop | วงจรการทำซ้ำ — กระบวนการสร้าง ตรวจสอบ แล้วปรับปรุงซ้ำจนกว่าจะน่าพอใจ |
| Coding agent | เอเจนต์เขียนโค้ด — โมเดล AI ที่ทำหน้าที่เขียนและแก้ไขโค้ดได้ |
| Skill | ทักษะ — หน่วยความรู้/คำสั่งที่เพิ่มความสามารถให้ Hermes Agent |
| Landing page | หน้าเปิดตัวเว็บไซต์ — หน้าแรกที่ออกแบบมาเพื่อแนะนำโปรเจกต์หรือผลิตภัณฑ์ |
| Scroll control | การควบคุมการเลื่อนหน้า — การออกแบบให้การเลื่อนเพจก่อให้เกิดเอฟเฟกต์ภาพ |
| ScrollTrigger (GSAP) | ไลบรารีที่กระตุ้นแอนิเมชันเมื่อผู้ใช้เลื่อนหน้าเว็บ |
| Lenis smooth scrolling | ไลบรารีที่ทำให้การเลื่อนหน้าเว็บลื่นไหลขึ้น |
| Storyboard | สตอรีบอร์ด — ภาพร่างลำดับเหตุการณ์ที่ใช้วางแผนการออกแบบ |
| Gradient | การไล่สี — เอฟเฟกต์สีที่ค่อย ๆ เปลี่ยนไปทีละขั้น |
| Motion | การเคลื่อนไหว — เอฟเฟกต์ภาพเคลื่อนไหวในเว็บไซต์ |
| Paper trader | ระบบเทรดจำลอง — โปรแกรมจำลองการซื้อขายโดยไม่ใช้เงินจริง |
| Back testing | การทดสอบย้อนหลัง — ทดสอบกลยุทธ์กับข้อมูลตลาดในอดีต |
| Deterministic replay | การเล่นซ้ำแบบผลลัพธ์คงที่ — รันซ้ำแล้วได้ผลลัพธ์เดิมเสมอ |
| Overfit | ปรับให้เข้ากับข้อมูลเฉพาะเกินไป — กลยุทธ์ทำงานได้ดีกับข้อมูลที่เคยเห็นแต่แย่กับข้อมูลใหม่ |
| Hyperliquid perpetuals | สัญญาเทรดตลอดกาลบนแพลตฟอร์ม Hyperliquid — สัญญาอนุพันธ์ที่ไม่มีวันหมดอายุ |
| Trend following breakout | กลยุทธ์ติดตามเทรนด์และทะลุกรอบราคา |
| Donchian breakout | กลยุทธ์ที่ใช้กรอบราคาสูง-ต่ำในช่วงเวลาที่กำหนดเพื่อหาจุดเข้าเทรด |
| Moving average filter | ตัวกรองค่าเฉลี่ยเคลื่อนที่ — ใช้กรองสัญญาณรบกวนเพื่อระบุทิศทางตลาด |
| ATR stop | การตั้งจุดหยุดขาดทุนโดยอิงจาก ATR (Average True Range) |
| Range-bound chop | ตลาดที่ราคาแกว่งในกรอบแคบโดยไม่มีทิศทางชัดเจน |
| EMA bias | ค่าเฉลี่ยเคลื่อนที่แบบเอ็กโพเนนเชียล — ชี้ทิศทางแนวโน้ม |
| Rate of change momentum | โมเมนตัมอัตราการเปลี่ยนแปลง — วัดความเร็วในการเปลี่ยนราคา |
| P&L | กำไรและขาดทุน (Profit and Loss) |
| Time loop | วนลูปเวลา — กลไกเกมที่ผู้เล่นกลับไปเริ่มใหม่และร่วมมือกับตัวเองในอดีต |
| LoRA | Low-Rank Adaptation — เทคนิค fine-tuning โมเดล AI ที่ปรับแต่งบางส่วนแทนทั้งโมเดล |
| Fine-tuning | การปรับแต่งโมเดล — ฝึกโมเดลที่มีอยู่ให้เชี่ยวชาญเฉพาะด้าน |
| Silent cinema | ภาพยนตร์เงียบ — สไตล์ภาพยนตร์ยุคแรกที่ไม่มีเสียงพูด |
| NVIDIA DGX Spark | เครื่องเซิร์ฟเวอร์ AI ประสิทธิภาพสูงของ NVIDIA |
| Benchmark | เกณฑ์วัดประสิทธิภาพ — การทดสอบมาตรฐานเพื่อเปรียบเทียบความสามารถของโมเดล |
| Claude Code | เครื่องมือ coding agent ของ Anthropic สำหรับโมเดล Claude |
| Codex | เครื่องมือ coding agent ของ OpenAI สำหรับโมเดล GPT |
| Grok Build | เครื่องมือ coding agent ของ xAI สำหรับโมเดล Grok |
| Hermes Agent | แพลตฟอร์มเอเจนต์ของ Nous Research |
| High effort | ความพยายามสูง — การตั้งค่าให้โมเดลใช้เวลาคิดและทำมากขึ้น |
| agentwiks.com | โปรเจกต์วิกิฐานความรู้ LM wiki ของผู้จัดทำวิดีโอ |
| LM wiki | วิกิฐานความรู้สำหรับโมเดลภาษา — แหล่งรวมข้อมูลวิจัย AI |
| Attrition | การลดจำนวนทีละน้อย — ในที่นี้คือการคัดออกทีละตัว |
| Elimination | การคัดออก — ตัดผู้แข่งขันที่ทำได้แย่ที่สุดออกจากการแข่งขัน |
ซับไตเติ้ลภาษาไทย
ดาวน์โหลดหรือดูซับทั้งหมด
1 00:00:00,000 --> 00:00:13,069 ยินดีต้อนรับสู่ AI Royal Rumble เดือนกรกฎาคม 2026 2 00:00:13,069 --> 00:00:29,604 ครับ โมเดลแนวหน้า (Frontier models) ห้าตัวจะเข้าร่วมการแข่งขัน 3 00:00:29,604 --> 00:00:44,806 และจะมีเพียงตัวเดียวเท่านั้นที่ได้รับการสวมมงกุฎเป็นแชมป์ 4 00:00:44,806 --> 00:01:05,609 มาดูกันครับว่ามันทำงานกันอย่างไร ผมจะให้โมเดลแนวหน้าทั้งห้าตัวทำภารกิจเดียวกัน
เปิดดูซับไตเติ้ลทั้งหมด (114 segments)
1 00:00:00,000 --> 00:00:13,069 ยินดีต้อนรับสู่ AI Royal Rumble เดือนกรกฎาคม 2026 2 00:00:13,069 --> 00:00:29,604 ครับ โมเดลแนวหน้า (Frontier models) ห้าตัวจะเข้าร่วมการแข่งขัน 3 00:00:29,604 --> 00:00:44,806 และจะมีเพียงตัวเดียวเท่านั้นที่ได้รับการสวมมงกุฎเป็นแชมป์ 4 00:00:44,806 --> 00:01:05,609 มาดูกันครับว่ามันทำงานกันอย่างไร ผมจะให้โมเดลแนวหน้าทั้งห้าตัวทำภารกิจเดียวกัน 5 00:01:05,609 --> 00:01:18,145 ใช้เครื่องมือเดียวกัน และไม่มีความช่วยเหลือใด ๆ 6 00:01:18,145 --> 00:01:44,548 ภารกิจที่ผมมอบหมายให้จะตั้งใจให้ยากพอสมควร แต่ก็ยังเป็นไปได้ที่จะทำให้สำเร็จด้วยเครื่องมือที่ให้ไว้ 7 00:01:44,548 --> 00:02:00,017 โมเดลแต่ละตัวต้องทำงานคนเดียวโดยไม่มีการแจ้งเตือนเพิ่มเติม 8 00:02:00,017 --> 00:02:18,953 ห้ามถามคำถามเพื่อขอความชัดเจน ห้ามมาเช็คอิน และห้ามเสนอตัวเลือกให้เลือก 9 00:02:18,953 --> 00:02:41,623 พร็อมต์ค่อนข้างละเอียดมาก ดังนั้นโมเดลจะมีทุกอย่างที่จำเป็นต่อการทำภารกิจนี้ให้สำเร็จ 10 00:02:41,623 --> 00:03:01,093 เมื่อจบแต่ละรอบ โมเดลที่อ่อนที่สุดจะถูกคัดออก การแข่งขันจะมีทั้งหมดสี่รอบ 11 00:03:01,093 --> 00:03:27,496 ดังนั้นเราจะเริ่มจากห้าตัว แล้วแต่ละรอบจะตัดออกทีละตัวจนเหลือรอบชิงชนะเลิศที่จะมีสองตัวเผชิญหน้ากัน 12 00:03:27,496 --> 00:03:48,566 เพื่อหาว่าใครคือแชมป์ โมเดลแนวหน้าที่แข็งแกร่งที่สุดในตอนนี้ของปลายเดือนกรกฎาคม 13 00:03:48,566 --> 00:04:04,035 2026 คือตัวไหน? ผมรู้ว่ามี benchmark (เกณฑ์วัดประสิทธิภาพ) 14 00:04:04,035 --> 00:04:16,837 อยู่เยอะแยะ มีตัวเลขมากมาย มีการอ้างสิทธิ์ต่าง ๆ 15 00:04:16,837 --> 00:04:29,372 นานา แต่นี่คือการท้าทายที่เด็ดขาดสำหรับ Tonbi's 16 00:04:29,372 --> 00:04:45,908 AI Garage ครับ และถ้าใครรัน agent (เอเจนต์) เองแล้วอยากเข้าถึง 17 00:04:45,908 --> 00:05:08,044 LM wiki (วิกิฐานความรู้สำหรับโมเดลภาษา) ที่ผมใช้สำหรับค้นคว้าและสร้างวิดีโอเหล่านี้ 18 00:05:08,044 --> 00:05:30,981 ไปดูโปรเจกต์ agentwiks.com ของผมได้เลยครับ ผมให้วิกิเหล่านี้ทั้งหมดฟรีในหลากหลายหัวข้อ 19 00:05:30,981 --> 00:05:46,983 และคุณยังสามารถสมัครบัญชี pro ในราคา 9.99 ดอลลาร์ต่อเดือนได้ 20 00:05:46,983 --> 00:06:10,187 ซึ่งจะทำให้คุณเข้าถึงวิกิขนาดใหญ่พิเศษที่มีหน้ามากกว่าและรายละเอียดมากกว่าในแต่ละหัวข้อ 21 00:06:10,187 --> 00:06:22,722 ทีนี้กลับมาที่วิดีโอกันครับ นี่คือกฎเกณฑ์ต่าง ๆ 22 00:06:22,722 --> 00:06:35,790 และเป็นส่วนหนึ่งของพร็อมต์ที่จะใช้กับทุก ๆ ภารกิจ 23 00:06:35,790 --> 00:06:53,659 โมเดลจะต้องตัดสินใจด้วยตัวเอง ไม่สามารถถามคำถามเพื่อขอความชัดเจนได้ 24 00:06:53,659 --> 00:07:11,262 ส่วนที่กำกวมต้องแก้ด้วยตัวเอง ข้อกำหนดต่าง ๆ จงใจปล่อยให้เปิดกว้าง 25 00:07:11,262 --> 00:07:23,797 โมเดลต้องเลือกแนวทางการตีความหนึ่ง เขียนมันลงไป 26 00:07:23,797 --> 00:07:39,266 แล้วลงมือสร้าง โมเดลต้องทำให้เสร็จ หรือไม่ก็บอกว่าทำไม่ได้ 27 00:07:39,266 --> 00:07:59,802 ถ้าติดขัดที่จุดใด ต้องทำส่วนอื่นให้ครบทั้งหมด แล้วระบุชัดว่าส่วนใดที่ทำไม่ได้ 28 00:07:59,802 --> 00:08:14,471 ห้ามจำลองการทำงานหรืออ้างว่าเสร็จแล้วถ้ายังไม่เสร็จจริง 29 00:08:14,471 --> 00:08:37,408 ห้ามอ้างว่ารันแล้วในสิ่งที่ไม่ได้รัน เราต้องการรายงานที่ซื่อสัตย์ของงานที่มีข้อบกพร่อง 30 00:08:37,408 --> 00:08:52,877 ซึ่งจะได้คะแนนสูงกว่ารายงานที่มั่นใจว่าทำได้สมบูรณ์แต่จริง 31 00:08:52,877 --> 00:09:06,745 ๆ พัง และโมเดลเองจะเป็นผู้ตัดสินใจว่าเมื่อไรถึงเสร็จ 32 00:09:06,745 --> 00:09:26,481 ผมจะไม่ใช้คำสั่ง /goal หรือ agentic loop (วงจรการทำงานอัตโนมัติของเอเจนต์) 33 00:09:26,481 --> 00:09:44,884 ใด ๆ เหล่านี้เป็นโมเดลแนวหน้าระดับท็อปของตลาด พวกมันเก่งมากในการสร้าง 34 00:09:44,884 --> 00:09:57,419 ตรวจสอบ แล้ววนซ้ำพัฒนาต่อไปได้ด้วยตัวเองทั้งหมด 35 00:09:57,419 --> 00:10:15,022 ไม่ต้องใช้คำสั่งกำหนดเองหรืออะไรแบบนั้น งั้นผมตัดสินพวกมันอย่างไร? 36 00:10:15,022 --> 00:10:32,091 ผมจะตัดสินจากเกณฑ์ประมาณนี้ครับ เรื่องโครงสร้างและการทำตามคำสั่ง 37 00:10:32,091 --> 00:10:48,360 พวกมันทำตามข้อกำหนดในพร็อมต์หรือไม่? งานจริงออกมาเป็นอย่างไร? 38 00:10:48,360 --> 00:11:11,296 เป็นงานคุณภาพหรือขยะ? พวกมันใช้ความคิดสร้างสรรค์แบบไหนในการตัดสินใจและในผลงานที่ออกมา? 39 00:11:11,296 --> 00:11:30,499 และสุดท้าย ถ้าทุกอย่างพอ ๆ กัน ผมจะนำความเร็วและประสิทธิภาพมาพิจารณาด้วย 40 00:11:30,499 --> 00:11:51,569 อย่างไรก็ตาม นี่ไม่ใช่ปัจจัยตัดสินหลัก ผมจะให้ความสำคัญกับคุณภาพมากกว่าความเร็ว 41 00:11:51,569 --> 00:12:10,238 แต่ถ้ามีโมเดลสองตัวที่ผลงานใกล้เคียงกัน ผมจะใช้ความเร็วเป็นเกณฑ์ตัดสิน 42 00:12:10,238 --> 00:12:32,108 ทีนี้มาดูภารกิจกันครับ ผมจะอธิบายรายละเอียดของแต่ละภารกิจมากขึ้นเมื่อถึงคราวของมัน 43 00:12:32,108 --> 00:12:49,177 แต่ภาพรวมจะเป็นสี่รอบดังนี้ รอบที่หนึ่งจะเป็นการสร้างอินเทอร์เฟซ 44 00:12:49,177 --> 00:13:08,113 เว็บไซต์ launch (เปิดตัว) พร้อม scroll control (การควบคุมการเลื่อนหน้า) 45 00:13:08,113 --> 00:13:21,982 ที่สร้างจากระบบภาพที่โมเดลออกแบบเองและต้องยึดตามนั้น 46 00:13:21,982 --> 00:13:35,851 รอบที่สองจะเป็นการท้าทายการเทรด โมเดลต้องพัฒนา paper 47 00:13:35,851 --> 00:13:50,519 trader (ระบบเทรดจำลอง) แบบเรียลไทม์จากการวิจัยของตัวเอง 48 00:13:50,519 --> 00:14:15,056 ต้องคิดอัลกอริทึมของตัวเอง แล้วเราจะรันมันเป็นเวลาสองวันเพื่อดูว่าโมเดลไหนทำเงินได้มากที่สุด 49 00:14:15,056 --> 00:14:30,792 รอบที่สามคือการพัฒนาเกม โมเดลต้องสร้างเกมปริศนาแพลตฟอร์มแนว 50 00:14:30,792 --> 00:14:46,794 time loop (วนลูปเวลา) ที่ผู้เล่นต้องร่วมมือกับ "ตัวตนในอดีต" 51 00:14:46,794 --> 00:14:59,329 ของตัวเองที่บันทึกไว้ เป็นระบบเกมที่ก้าวหน้ามาก 52 00:14:59,329 --> 00:15:15,598 แต่ผมเชื่อว่าโมเดลเหล่านี้ทำได้ และรอบสุดท้าย โมเดลจะต้องเทรน 53 00:15:15,598 --> 00:15:30,534 LoRA (อะแดปเตอร์สำหรับ fine-tuning หรือการปรับแต่งโมเดล) 54 00:15:30,534 --> 00:15:47,069 โดยเฉพาะการเทรน video LoRA สไตล์ silent cinema (ภาพยนตร์เงียบ) 55 00:15:47,069 --> 00:16:02,538 บนเครื่องเซิร์ฟเวอร์จริงที่ไม่ได้เตรียมไว้สำหรับสิ่งนี้เลย 56 00:16:02,538 --> 00:16:18,541 กล่าวคือ โมเดลจะได้รับโมเดลสร้างวิดีโอหนึ่งตัว แล้วต้องสร้าง 57 00:16:18,541 --> 00:16:31,076 LoRA นี้ขึ้นมาเพื่อให้ตรงกับสไตล์ silent cinema 58 00:16:31,076 --> 00:16:44,944 งั้นใครคือผู้เข้าแข่งขันบ้าง? อันดับแรกจาก Anthropic 59 00:16:44,944 --> 00:16:58,546 จากซานฟรานซิสโกในสหรัฐอเมริกา คือ Claude Fable ซึ่ง 60 00:16:58,546 --> 00:17:14,815 Fable เป็นตัวเต็งของบ้านเลยก็ว่าได้ครับ รู้จักกันอีกชื่อในนาม 61 00:17:14,815 --> 00:17:27,884 Mythos แต่มี guardrail (ข้อจำกัดเพื่อความปลอดภัย) 62 00:17:27,884 --> 00:17:40,686 มากกว่า ถ้า Fable ชน guardrail ระหว่างการแข่งขัน 63 00:17:40,686 --> 00:17:53,488 จะถูกดาวน์เกรดเป็น Opus 5 หรืออาจจะเป็น Opus 4.8 64 00:17:53,488 --> 00:18:06,023 แล้วต้องทำงานต่อจากตรงนั้น ผมจะไม่ทำพร็อมต์ใหม่ 65 00:18:06,023 --> 00:18:22,292 ถ้าชน guardrail ก็ช่างมันไปครับ ผู้เข้าแข่งขันอันดับที่สองจาก 66 00:18:22,292 --> 00:18:35,627 OpenAI ในซานฟรานซิสโก สหรัฐอเมริกา คือ GPT-5.6 Sol 67 00:18:35,627 --> 00:18:51,096 โมเดลแนวหน้าตัวล่าสุดจาก OpenAI ได้ benchmark ที่ยอดเยี่ยม 68 00:18:51,096 --> 00:19:10,565 รีวิวดีมาก คนบอกว่าคล้ายกับ Fable เยอะมาก งั้นมาดูกันครับว่าจะเป็นอย่างไร 69 00:19:10,565 --> 00:19:30,035 อันดับที่สาม Grok 4.5 และนี่คือม้ามืด ไม่ใช่ตัวที่ผมคาดว่าจะเพิ่มเข้ามาใน 70 00:19:30,035 --> 00:19:42,837 AI Royal Rumble เดือนนี้ แต่มันเป็น coding agent 71 00:19:42,837 --> 00:19:57,239 (เอเจนต์เขียนโค้ด) ที่เด็ดขาด จึงสมควรได้รับตำแหน่งนี้ 72 00:19:57,239 --> 00:20:13,508 มาจาก xAI ในสหรัฐอเมริกา และผมอยากรู้มากว่ามันจะทำได้ดีแค่ไหน 73 00:20:13,508 --> 00:20:27,110 อันดับที่สี่ Kimi K3 เริ่มเข้าสู่เหล่า open weights 74 00:20:27,110 --> 00:20:41,778 (น้ำหนักโมเดลที่เปิดให้ใช้) แล้วครับ ตัวนี้จาก Moonshot 75 00:20:41,778 --> 00:20:54,847 AI เป็นโมเดลจากห้องแลป AI ของจีน พวกเขาเพิ่งปล่อย 76 00:20:54,847 --> 00:21:16,450 open weights ออกมาเมื่อวันนี้เอง แต่ก็ถือเป็นโมเดลแนวหน้าที่น่าเกรงขามอย่างแน่นอน 77 00:21:16,450 --> 00:21:33,519 สุดท้าย GLM 5.2 อีกหนึ่งโมเดล open weights ม้ามืดอีกตัวจากจีนโดย 78 00:21:33,519 --> 00:21:49,521 Zhipu AI และเป็นโมเดลที่คนนำไปเปรียบเทียบกับโมเดลแนวหน้าท็อป 79 00:21:49,521 --> 00:22:04,724 ๆ จากห้องแลปปิดอยู่เลย นี่คือผู้เข้าแข่งขันทั้งห้าตัวครับ 80 00:22:04,724 --> 00:22:25,793 ทุกรอบจะคัดออกทีละตัวเพื่อหาว่าใครคือแชมป์ตัวจริงและเป็นโมเดลแนวหน้าที่ดีที่สุด 81 00:22:25,793 --> 00:22:44,196 ห้าโมเดลเข้าประชัน เหลือเพียงหนึ่งเดียวที่จะออกมาพร้อมมงกุฎแห่งชัยชนะ 82 00:22:44,196 --> 00:22:59,932 เราทำสิ่งนี้ในสัปดาห์สุดท้ายของเดือนกรกฎาคม และความคิดก็คือ 83 00:22:59,932 --> 00:23:13,267 ถ้าคนชอบรูปแบบนี้ ผมอาจจะทำทุกเดือนหรือทุกสองเดือน 84 00:23:13,267 --> 00:23:30,869 ขึ้นอยู่กับว่ามีโมเดลใหม่ออกมาเท่าไร แต่เราจะให้ภารกิจที่ท้าทายมาก 85 00:23:30,869 --> 00:23:45,538 ๆ แล้วดูว่าพวกมันจะทำได้แค่ไหน ทีนี้ แต่ละโมเดลจะอยู่ใน 86 00:23:45,538 --> 00:23:59,140 agent harness (สภาพแวดล้อมการรันเอเจนต์) คนละแบบกัน 87 00:23:59,140 --> 00:24:15,409 Claude ก็จะอยู่ใน Claude Code อย่างเห็นได้ชัด ทุกตัวจะตั้งค่า 88 00:24:15,409 --> 00:24:29,278 high effort (ความพยายามสูง) ถ้ามีส่วนของการใช้เหตุผล 89 00:24:29,278 --> 00:24:43,146 GPT-5.6 จะอยู่ใน Codex ส่วน Grok จะอยู่ใน Grok Build 90 00:24:43,146 --> 00:24:55,682 แล้วสำหรับโมเดล GLM และ Kimi ทั้งสองตัวจะอยู่ใน 91 00:24:55,682 --> 00:25:16,218 Hermes Agent โดยผมได้สร้างโปรไฟล์เปล่าขึ้นมา ดังนั้นพวกมันจะไม่ได้ประโยชน์จาก 92 00:25:16,218 --> 00:25:29,286 Hermes Agent มาตรฐานของผมที่มี skill (ทักษะ) ต่าง 93 00:25:29,286 --> 00:25:48,222 ๆ มากมาย เป็นโปรไฟล์เปล่าโดยสมบูรณ์ แต่พวกมันยังคงเข้าถึงเครื่องมือต่าง 94 00:25:48,222 --> 00:26:01,291 ๆ ได้ เพื่อให้เป็นการแข่งขันที่ยุติธรรมระหว่างกัน 95 00:26:01,291 --> 00:26:17,827 เริ่มกันเลยครับ รอบที่หนึ่ง หน้า Landing Page และนี่คือพร็อมต์ 96 00:26:17,827 --> 00:26:31,962 ผมจะแชร์พร็อมต์ทั้งหมดนี้ให้ครับ น่าจะเอาไว้ใน GitHub 97 00:26:31,962 --> 00:26:47,164 ให้ไปดูกันได้ ภารกิจคือ "สร้างเว็บไซต์ launch คุณภาพระดับ 98 00:26:47,164 --> 00:27:00,233 production สำหรับ AI Royal Rumble โดยใช้ Next.js, 99 00:27:00,233 --> 00:27:12,768 React, TypeScript, GSAP ScrollTrigger และ Lenis 100 00:27:12,768 --> 00:27:30,104 smooth scrolling แบบควบคุม" โดยมีแนวทางเพิ่มเติมว่าต้องทำอะไรบ้าง 101 00:27:30,104 --> 00:27:42,639 เรื่องทิศทางการออกแบบ ดีไซน์เป็นของโมเดลเอง ทุก 102 00:27:42,639 --> 00:28:00,775 scene (ฉาก) ต้องเกิดจากการเปลี่ยนรูปจากเรขาคณิตที่มีอยู่แล้วบนหน้าจอ 103 00:28:00,775 --> 00:28:13,577 เราจะได้เห็นอะไรที่เจ๋ง ๆ นี่ไม่ใช่แค่ทำ landing 104 00:28:13,577 --> 00:28:31,179 page ธรรมดานะครับ เป็นภารกิจที่ค่อนข้างยาก ต้องประกาศระบบของตัวเอง 105 00:28:31,179 --> 00:28:43,981 โมเดลต้องสร้าง storyboard (สตอรีบอร์ด) ออกมาก่อน 106 00:28:43,981 --> 00:28:59,450 และเนื้อหาที่จำเป็น ไม่ได้กำหนดข้อกำหนดเยอะมาก แต่ต้องเป็น 107 00:28:59,450 --> 00:29:13,052 landing page สำหรับโปรเจกต์ Royal Rumble นี้ เรื่อง 108 00:29:13,052 --> 00:29:33,588 motion (การเคลื่อนไหว) และวิศวกรรม นี่คือกฎเกณฑ์บางส่วนเกี่ยวกับการเคลื่อนไหว 109 00:29:33,588 --> 00:29:46,390 เช่น หลีกเลี่ยง gradient (การไล่สี) และ gradient 110 00:29:46,390 --> 00:30:01,859 text, neon blob (ก้อนแสงนีออน) ฯลฯ นี่คือสิ่งที่ต้องส่งมอบ 111 00:30:01,859 --> 00:30:17,328 แต่สิ่งส่งมอบหลักคือเว็บไซต์ที่ใช้งานได้จริง นี่คือพร็อมต์ 112 00:30:17,328 --> 00:30:34,130 และผมจะให้กับทุกตัว แล้วลุยกันเลยครับ โอเค ผมวางพร็อมต์ลงไปแล้ว 113 00:30:34,130 --> 00:30:47,199 เริ่มกันเลย ปล่อยให้พวกมันรันไป Codex เริ่ม! Grok 114 00:30:47,199 --> 00:30:56,000 เริ่ม! GLM เริ่ม! และ Kimi เริ่ม!