▶SUBTHAIแปลไทย · ซับ · พากย์⚙
บทความแปลภาษาไทย · YouTube

AI Royal Rumble: Part 1 (Kimi K3 v. Fable v. Sol v. Grok v. GLM)

0:000:00
เล่นเสียงต้นฉบับของวิดีโอ พร้อมแสดงซับไทยซิงก์ตามเวลา
กำลังโหลดวิดีโอ…
01

สรุปย่อ

ประเด็นสำคัญจากวิดีโอ

- **ช่อง:** Tonbi's AI Garage · **ความยาว:** ~31 นาที · **ลิงก์:** https://www.youtube.com/watch?v=vYi5Sab1RFc

# สรุป: AI Royal Rumble: Part 1 (Kimi K3 v. Fable v. Sol v. Grok v. GLM)

- **ช่อง:** Tonbi's AI Garage · **ความยาว:** ~31 นาที · **ลิงก์:** https://www.youtube.com/watch?v=vYi5Sab1RFc

## ประเด็นหลัก

- **รูปแบบการแข่งขัน:** โมเดล AI แนวหน้า 5 ตัว (Fable, Sol, Grok 4.5, Kimi K3, GLM 5.2) ทำภารกิจเดียวกัน 4 รอบ ทุกรอบคัดออกทีละตัวจนเหลือแชมป์หนึ่งเดียว โดยทำงานโดยไม่มีการแจ้งเตือนเพิ่มเติม ห้ามถามคำถามขอความชัดเจน
- **เกณฑ์การตัดสิน:** ความสามารถในการทำตามคำสั่ง คุณภาพงาน ความคิดสร้างสรรค์ และใช้ความเร็วเป็นเกณฑ์ตัดสินเมื่อคะแนนใกล้เคียงกัน
- **4 ภารกิจ:** (1) สร้าง landing page พร้อม scroll animation (2) ระบบเทรดจำลอง (paper trader) (3) พัฒนาเกมปริศนาแนว time loop (4) เทรน LoRA สไตล์ silent cinema
- **รอบที่ 1 — Landing Page:** Grok 4.5 เสร็จเร็วที่สุด (19 นาที) แต่งานพื้นฐาน Sol มีสไตล์ดี มีไดนามิก GLM 5.2 พัง (scroll ไม่ทำงาน) Fable ทำได้ดีที่สุดโดยรวม Kimi K3 ใช้เวลาเกือบ 2 ชั่วโมงแต่ผลงานแข็งแกร่ง
- **ผู้ถูกคัดออกรอบแรก:** GLM 5.2 — งานพัง การเลื่อนหน้าไม่ทำงาน
- **รอบที่ 2 — Paper Trading:** ทุกโมเดลเลือกกลยุทธ์ trend following breakout แบบ Donchian โดยอิสระ ใช้สัญลักษณ์ใกล้เคียงกัน (Bitcoin, ETH, SOL, ทองคำ) รันบน Hyperliquid perpetuals
- **ผลการเทรด:** Fable ทำกำไรเล็กน้อย (+0.26%) Kimi K3 ขาดทุนเล็กน้อย Sol ขาดทุนมากขึ้น Grok 4.5 ขาดทุนหนักที่สุด (-12%) เพราะเทรดถี่เกินไป (144 ครั้ง)
- **ผู้ถูกคัดออกรอบสอง:** Grok 4.5 — เร็วที่สุดแต่ไม่ตรวจสอบและทดสอบย้อนหลังให้ละเอียด จึงเทรดถี่เกินไปและขาดทุนหนัก
- **ความเร็วไม่ใช่ทุกอย่าง:** Grok เสร็จเร็วที่สุดทั้งสองรอบ แต่ผลงานตามหลังคู่แข่งเสมอ — ความเร็วที่ไร้การตรวจสอบกลับเป็นจุดอ่อน
- **ความคาดหวังภาคสอง:** เหลือ Fable, Sol, Kimi K3 ตัวสุดท้าย จะแข่งพัฒนาเกม time loop และเทรน LoRA บนเครื่อง NVIDIA DGX Spark
- **ค่าใช้จ่าย:** Kimi K3 มีส่วนลด ~20% ทำให้ใช้เวลานานเกือบ 2 ชั่วโมงแต่ค่าใช้จ่ายต่ำ (ต่ำกว่า $6 ต่อภารกิจ)

## ความเห็นสรุป

การแข่งขันนี้แสดงให้เห็นชัดว่า benchmark ไม่ใช่ตัวบ่งชี้เดียวที่บอกว่าโมเดลไหนดีที่สุด การนำไปใช้จริงในงานที่ซับซ้อนเปิดเผยจุดเด่นและจุดอ่อนที่ตัวเลขไม่สะท้อน เช่น Grok เร็วสุดแต่พลาดเรื่องคุณภาพและการตรวจสอบ ขณะที่ Fable สมดุลทั้งคุณภาพและความเร็ว และ Kimi K3 ใช้เวลามากแต่ผลงานคุ้มค่า น่าติดตามต่อในภาคสองว่าสามตัวสุดท้ายจะทำงานที่ซับซ้อนยิ่งขึ้นอย่างเกมและการเทรนโมเดลได้อย่างไร
02

คำแปลเต็ม

แปลตามบทสนทนาต้นฉบับ ปรับเป็นภาษาไทยธรรมชาติ

ยินดีต้อนรับสู่ AI Royal Rumble เดือนกรกฎาคม 2026 ครับ โมเดลแนวหน้า (Frontier models) ห้าตัวจะเข้าร่วมการแข่งขัน และจะมีเพียงตัวเดียวเท่านั้นที่ได้รับการสวมมงกุฎเป็นแชมป์ มาดูกันครับว่ามันทำงานกันอย่างไร ผมจะให้โมเดลแนวหน้าทั้งห้าตัวทำภารกิจเดียวกัน ใช้เครื่องมือเดียวกัน และไม่มีความช่วยเหลือใด ๆ ภารกิจที่ผมมอบหมายให้จะตั้งใจให้ยากพอสมควร แต่ก็ยังเป็นไปได้ที่จะทำให้สำเร็จด้วยเครื่องมือที่ให้ไว้ โมเดลแต่ละตัวต้องทำงานคนเดียวโดยไม่มีการแจ้งเตือนเพิ่มเติม ห้ามถามคำถามเพื่อขอความชัดเจน ห้ามมาเช็คอิน และห้ามเสนอตัวเลือกให้เลือก พร็อมต์ค่อนข้างละเอียดมาก ดังนั้นโมเดลจะมีทุกอย่างที่จำเป็นต่อการทำภารกิจนี้ให้สำเร็จ

เมื่อจบแต่ละรอบ โมเดลที่อ่อนที่สุดจะถูกคัดออก การแข่งขันจะมีทั้งหมดสี่รอบ ดังนั้นเราจะเริ่มจากห้าตัว แล้วแต่ละรอบจะตัดออกทีละตัวจนเหลือรอบชิงชนะเลิศที่จะมีสองตัวเผชิญหน้ากัน เพื่อหาว่าใครคือแชมป์ โมเดลแนวหน้าที่แข็งแกร่งที่สุดในตอนนี้ของปลายเดือนกรกฎาคม 2026 คือตัวไหน? ผมรู้ว่ามี benchmark (เกณฑ์วัดประสิทธิภาพ) อยู่เยอะแยะ มีตัวเลขมากมาย มีการอ้างสิทธิ์ต่าง ๆ นานา แต่นี่คือการท้าทายที่เด็ดขาดสำหรับ Tonbi's AI Garage ครับ

และถ้าใครรัน agent (เอเจนต์) เองแล้วอยากเข้าถึง LM wiki (วิกิฐานความรู้สำหรับโมเดลภาษา) ที่ผมใช้สำหรับค้นคว้าและสร้างวิดีโอเหล่านี้ ไปดูโปรเจกต์ agentwiks.com ของผมได้เลยครับ ผมให้วิกิเหล่านี้ทั้งหมดฟรีในหลากหลายหัวข้อ และคุณยังสามารถสมัครบัญชี pro ในราคา 9.99 ดอลลาร์ต่อเดือนได้ ซึ่งจะทำให้คุณเข้าถึงวิกิขนาดใหญ่พิเศษที่มีหน้ามากกว่าและรายละเอียดมากกว่าในแต่ละหัวข้อ

ทีนี้กลับมาที่วิดีโอกันครับ นี่คือกฎเกณฑ์ต่าง ๆ และเป็นส่วนหนึ่งของพร็อมต์ที่จะใช้กับทุก ๆ ภารกิจ โมเดลจะต้องตัดสินใจด้วยตัวเอง ไม่สามารถถามคำถามเพื่อขอความชัดเจนได้ ส่วนที่กำกวมต้องแก้ด้วยตัวเอง ข้อกำหนดต่าง ๆ จงใจปล่อยให้เปิดกว้าง โมเดลต้องเลือกแนวทางการตีความหนึ่ง เขียนมันลงไป แล้วลงมือสร้าง โมเดลต้องทำให้เสร็จ หรือไม่ก็บอกว่าทำไม่ได้ ถ้าติดขัดที่จุดใด ต้องทำส่วนอื่นให้ครบทั้งหมด แล้วระบุชัดว่าส่วนใดที่ทำไม่ได้ ห้ามจำลองการทำงานหรืออ้างว่าเสร็จแล้วถ้ายังไม่เสร็จจริง ห้ามอ้างว่ารันแล้วในสิ่งที่ไม่ได้รัน เราต้องการรายงานที่ซื่อสัตย์ของงานที่มีข้อบกพร่อง ซึ่งจะได้คะแนนสูงกว่ารายงานที่มั่นใจว่าทำได้สมบูรณ์แต่จริง ๆ พัง และโมเดลเองจะเป็นผู้ตัดสินใจว่าเมื่อไรถึงเสร็จ ผมจะไม่ใช้คำสั่ง /goal หรือ agentic loop (วงจรการทำงานอัตโนมัติของเอเจนต์) ใด ๆ เหล่านี้เป็นโมเดลแนวหน้าระดับท็อปของตลาด พวกมันเก่งมากในการสร้าง ตรวจสอบ แล้ววนซ้ำพัฒนาต่อไปได้ด้วยตัวเองทั้งหมด ไม่ต้องใช้คำสั่งกำหนดเองหรืออะไรแบบนั้น

งั้นผมตัดสินพวกมันอย่างไร? ผมจะตัดสินจากเกณฑ์ประมาณนี้ครับ เรื่องโครงสร้างและการทำตามคำสั่ง พวกมันทำตามข้อกำหนดในพร็อมต์หรือไม่? งานจริงออกมาเป็นอย่างไร? เป็นงานคุณภาพหรือขยะ? พวกมันใช้ความคิดสร้างสรรค์แบบไหนในการตัดสินใจและในผลงานที่ออกมา? และสุดท้าย ถ้าทุกอย่างพอ ๆ กัน ผมจะนำความเร็วและประสิทธิภาพมาพิจารณาด้วย อย่างไรก็ตาม นี่ไม่ใช่ปัจจัยตัดสินหลัก ผมจะให้ความสำคัญกับคุณภาพมากกว่าความเร็ว แต่ถ้ามีโมเดลสองตัวที่ผลงานใกล้เคียงกัน ผมจะใช้ความเร็วเป็นเกณฑ์ตัดสิน

ทีนี้มาดูภารกิจกันครับ ผมจะอธิบายรายละเอียดของแต่ละภารกิจมากขึ้นเมื่อถึงคราวของมัน แต่ภาพรวมจะเป็นสี่รอบดังนี้ รอบที่หนึ่งจะเป็นการสร้างอินเทอร์เฟซ เว็บไซต์ launch (เปิดตัว) พร้อม scroll control (การควบคุมการเลื่อนหน้า) ที่สร้างจากระบบภาพที่โมเดลออกแบบเองและต้องยึดตามนั้น รอบที่สองจะเป็นการท้าทายการเทรด โมเดลต้องพัฒนา paper trader (ระบบเทรดจำลอง) แบบเรียลไทม์จากการวิจัยของตัวเอง ต้องคิดอัลกอริทึมของตัวเอง แล้วเราจะรันมันเป็นเวลาสองวันเพื่อดูว่าโมเดลไหนทำเงินได้มากที่สุด รอบที่สามคือการพัฒนาเกม โมเดลต้องสร้างเกมปริศนาแพลตฟอร์มแนว time loop (วนลูปเวลา) ที่ผู้เล่นต้องร่วมมือกับ "ตัวตนในอดีต" ของตัวเองที่บันทึกไว้ เป็นระบบเกมที่ก้าวหน้ามาก แต่ผมเชื่อว่าโมเดลเหล่านี้ทำได้ และรอบสุดท้าย โมเดลจะต้องเทรน LoRA (อะแดปเตอร์สำหรับ fine-tuning หรือการปรับแต่งโมเดล) โดยเฉพาะการเทรน video LoRA สไตล์ silent cinema (ภาพยนตร์เงียบ) บนเครื่องเซิร์ฟเวอร์จริงที่ไม่ได้เตรียมไว้สำหรับสิ่งนี้เลย กล่าวคือ โมเดลจะได้รับโมเดลสร้างวิดีโอหนึ่งตัว แล้วต้องสร้าง LoRA นี้ขึ้นมาเพื่อให้ตรงกับสไตล์ silent cinema

งั้นใครคือผู้เข้าแข่งขันบ้าง? อันดับแรกจาก Anthropic จากซานฟรานซิสโกในสหรัฐอเมริกา คือ Claude Fable ซึ่ง Fable เป็นตัวเต็งของบ้านเลยก็ว่าได้ครับ รู้จักกันอีกชื่อในนาม Mythos แต่มี guardrail (ข้อจำกัดเพื่อความปลอดภัย) มากกว่า ถ้า Fable ชน guardrail ระหว่างการแข่งขัน จะถูกดาวน์เกรดเป็น Opus 5 หรืออาจจะเป็น Opus 4.8 แล้วต้องทำงานต่อจากตรงนั้น ผมจะไม่ทำพร็อมต์ใหม่ ถ้าชน guardrail ก็ช่างมันไปครับ

ผู้เข้าแข่งขันอันดับที่สองจาก OpenAI ในซานฟรานซิสโก สหรัฐอเมริกา คือ GPT-5.6 Sol โมเดลแนวหน้าตัวล่าสุดจาก OpenAI ได้ benchmark ที่ยอดเยี่ยม รีวิวดีมาก คนบอกว่าคล้ายกับ Fable เยอะมาก งั้นมาดูกันครับว่าจะเป็นอย่างไร

อันดับที่สาม Grok 4.5 และนี่คือม้ามืด ไม่ใช่ตัวที่ผมคาดว่าจะเพิ่มเข้ามาใน AI Royal Rumble เดือนนี้ แต่มันเป็น coding agent (เอเจนต์เขียนโค้ด) ที่เด็ดขาด จึงสมควรได้รับตำแหน่งนี้ มาจาก xAI ในสหรัฐอเมริกา และผมอยากรู้มากว่ามันจะทำได้ดีแค่ไหน

อันดับที่สี่ Kimi K3 เริ่มเข้าสู่เหล่า open weights (น้ำหนักโมเดลที่เปิดให้ใช้) แล้วครับ ตัวนี้จาก Moonshot AI เป็นโมเดลจากห้องแลป AI ของจีน พวกเขาเพิ่งปล่อย open weights ออกมาเมื่อวันนี้เอง แต่ก็ถือเป็นโมเดลแนวหน้าที่น่าเกรงขามอย่างแน่นอน

สุดท้าย GLM 5.2 อีกหนึ่งโมเดล open weights ม้ามืดอีกตัวจากจีนโดย Zhipu AI และเป็นโมเดลที่คนนำไปเปรียบเทียบกับโมเดลแนวหน้าท็อป ๆ จากห้องแลปปิดอยู่เลย

นี่คือผู้เข้าแข่งขันทั้งห้าตัวครับ ทุกรอบจะคัดออกทีละตัวเพื่อหาว่าใครคือแชมป์ตัวจริงและเป็นโมเดลแนวหน้าที่ดีที่สุด ห้าโมเดลเข้าประชัน เหลือเพียงหนึ่งเดียวที่จะออกมาพร้อมมงกุฎแห่งชัยชนะ เราทำสิ่งนี้ในสัปดาห์สุดท้ายของเดือนกรกฎาคม และความคิดก็คือ ถ้าคนชอบรูปแบบนี้ ผมอาจจะทำทุกเดือนหรือทุกสองเดือน ขึ้นอยู่กับว่ามีโมเดลใหม่ออกมาเท่าไร แต่เราจะให้ภารกิจที่ท้าทายมาก ๆ แล้วดูว่าพวกมันจะทำได้แค่ไหน

ทีนี้ แต่ละโมเดลจะอยู่ใน agent harness (สภาพแวดล้อมการรันเอเจนต์) คนละแบบกัน Claude ก็จะอยู่ใน Claude Code อย่างเห็นได้ชัด ทุกตัวจะตั้งค่า high effort (ความพยายามสูง) ถ้ามีส่วนของการใช้เหตุผล GPT-5.6 จะอยู่ใน Codex ส่วน Grok จะอยู่ใน Grok Build แล้วสำหรับโมเดล GLM และ Kimi ทั้งสองตัวจะอยู่ใน Hermes Agent โดยผมได้สร้างโปรไฟล์เปล่าขึ้นมา ดังนั้นพวกมันจะไม่ได้ประโยชน์จาก Hermes Agent มาตรฐานของผมที่มี skill (ทักษะ) ต่าง ๆ มากมาย เป็นโปรไฟล์เปล่าโดยสมบูรณ์ แต่พวกมันยังคงเข้าถึงเครื่องมือต่าง ๆ ได้ เพื่อให้เป็นการแข่งขันที่ยุติธรรมระหว่างกัน เริ่มกันเลยครับ

รอบที่หนึ่ง หน้า Landing Page และนี่คือพร็อมต์ ผมจะแชร์พร็อมต์ทั้งหมดนี้ให้ครับ น่าจะเอาไว้ใน GitHub ให้ไปดูกันได้ ภารกิจคือ "สร้างเว็บไซต์ launch คุณภาพระดับ production สำหรับ AI Royal Rumble โดยใช้ Next.js, React, TypeScript, GSAP ScrollTrigger และ Lenis smooth scrolling แบบควบคุม" โดยมีแนวทางเพิ่มเติมว่าต้องทำอะไรบ้าง เรื่องทิศทางการออกแบบ ดีไซน์เป็นของโมเดลเอง ทุก scene (ฉาก) ต้องเกิดจากการเปลี่ยนรูปจากเรขาคณิตที่มีอยู่แล้วบนหน้าจอ เราจะได้เห็นอะไรที่เจ๋ง ๆ นี่ไม่ใช่แค่ทำ landing page ธรรมดานะครับ เป็นภารกิจที่ค่อนข้างยาก ต้องประกาศระบบของตัวเอง โมเดลต้องสร้าง storyboard (สตอรีบอร์ด) ออกมาก่อน และเนื้อหาที่จำเป็น ไม่ได้กำหนดข้อกำหนดเยอะมาก แต่ต้องเป็น landing page สำหรับโปรเจกต์ Royal Rumble นี้ เรื่อง motion (การเคลื่อนไหว) และวิศวกรรม นี่คือกฎเกณฑ์บางส่วนเกี่ยวกับการเคลื่อนไหว เช่น หลีกเลี่ยง gradient (การไล่สี) และ gradient text, neon blob (ก้อนแสงนีออน) ฯลฯ นี่คือสิ่งที่ต้องส่งมอบ แต่สิ่งส่งมอบหลักคือเว็บไซต์ที่ใช้งานได้จริง นี่คือพร็อมต์ และผมจะให้กับทุกตัว แล้วลุยกันเลยครับ

โอเค ผมวางพร็อมต์ลงไปแล้ว เริ่มกันเลย ปล่อยให้พวกมันรันไป Codex เริ่ม! Grok เริ่ม! GLM เริ่ม! และ Kimi เริ่ม!

03

หมายเหตุการแปล

ความโปร่งใสเกี่ยวกับความไม่แน่นอนในต้นฉบับ

  • ## ช่วงที่ความหมายไม่ชัดเจน
  • ไม่มีช่วงที่ต้องใช้ `[ฟังไม่ชัด]` ความหมายทั้งหมดสามารถเข้าใจได้จากบริบท แม้ว่าคำบรรยายอัตโนมัติจะสะกดผิดในบางจุดก็ตาม
04

อภิธานศัพท์เทคนิค

คำศัพท์และชื่อผลิตภัณฑ์ที่คงรูปภาษาอังกฤษ

ศัพท์คำแปล / คำอธิบาย
Frontier modelโมเดลแนวหน้า — โมเดล AI ที่ทันสมัยและทรงพลังที่สุดในขณะนั้น
Guardrailข้อจำกัดเพื่อความปลอดภัย — กลไกที่ป้องกันไม่ให้โมเดลตอบหรือทำสิ่งที่ไม่พึงประสงค์
Open weightsน้ำหนักโมเดลที่เปิดเผย — โมเดลที่เปิดให้ดาวน์โหลดและใช้งานได้ฟรี
Agent harnessสภาพแวดล้อมการรันเอเจนต์ — โปรแกรมที่โมเดลใช้ทำงานและเข้าถึงเครื่องมือต่าง ๆ
Agentic loopวงจรการทำงานอัตโนมัติของเอเจนต์ — การวนซ้ำของโมเดลในการคิด ตัดสินใจ และลงมือทำ
Iterative loopวงจรการทำซ้ำ — กระบวนการสร้าง ตรวจสอบ แล้วปรับปรุงซ้ำจนกว่าจะน่าพอใจ
Coding agentเอเจนต์เขียนโค้ด — โมเดล AI ที่ทำหน้าที่เขียนและแก้ไขโค้ดได้
Skillทักษะ — หน่วยความรู้/คำสั่งที่เพิ่มความสามารถให้ Hermes Agent
Landing pageหน้าเปิดตัวเว็บไซต์ — หน้าแรกที่ออกแบบมาเพื่อแนะนำโปรเจกต์หรือผลิตภัณฑ์
Scroll controlการควบคุมการเลื่อนหน้า — การออกแบบให้การเลื่อนเพจก่อให้เกิดเอฟเฟกต์ภาพ
ScrollTrigger (GSAP)ไลบรารีที่กระตุ้นแอนิเมชันเมื่อผู้ใช้เลื่อนหน้าเว็บ
Lenis smooth scrollingไลบรารีที่ทำให้การเลื่อนหน้าเว็บลื่นไหลขึ้น
Storyboardสตอรีบอร์ด — ภาพร่างลำดับเหตุการณ์ที่ใช้วางแผนการออกแบบ
Gradientการไล่สี — เอฟเฟกต์สีที่ค่อย ๆ เปลี่ยนไปทีละขั้น
Motionการเคลื่อนไหว — เอฟเฟกต์ภาพเคลื่อนไหวในเว็บไซต์
Paper traderระบบเทรดจำลอง — โปรแกรมจำลองการซื้อขายโดยไม่ใช้เงินจริง
Back testingการทดสอบย้อนหลัง — ทดสอบกลยุทธ์กับข้อมูลตลาดในอดีต
Deterministic replayการเล่นซ้ำแบบผลลัพธ์คงที่ — รันซ้ำแล้วได้ผลลัพธ์เดิมเสมอ
Overfitปรับให้เข้ากับข้อมูลเฉพาะเกินไป — กลยุทธ์ทำงานได้ดีกับข้อมูลที่เคยเห็นแต่แย่กับข้อมูลใหม่
Hyperliquid perpetualsสัญญาเทรดตลอดกาลบนแพลตฟอร์ม Hyperliquid — สัญญาอนุพันธ์ที่ไม่มีวันหมดอายุ
Trend following breakoutกลยุทธ์ติดตามเทรนด์และทะลุกรอบราคา
Donchian breakoutกลยุทธ์ที่ใช้กรอบราคาสูง-ต่ำในช่วงเวลาที่กำหนดเพื่อหาจุดเข้าเทรด
Moving average filterตัวกรองค่าเฉลี่ยเคลื่อนที่ — ใช้กรองสัญญาณรบกวนเพื่อระบุทิศทางตลาด
ATR stopการตั้งจุดหยุดขาดทุนโดยอิงจาก ATR (Average True Range)
Range-bound chopตลาดที่ราคาแกว่งในกรอบแคบโดยไม่มีทิศทางชัดเจน
EMA biasค่าเฉลี่ยเคลื่อนที่แบบเอ็กโพเนนเชียล — ชี้ทิศทางแนวโน้ม
Rate of change momentumโมเมนตัมอัตราการเปลี่ยนแปลง — วัดความเร็วในการเปลี่ยนราคา
P&Lกำไรและขาดทุน (Profit and Loss)
Time loopวนลูปเวลา — กลไกเกมที่ผู้เล่นกลับไปเริ่มใหม่และร่วมมือกับตัวเองในอดีต
LoRALow-Rank Adaptation — เทคนิค fine-tuning โมเดล AI ที่ปรับแต่งบางส่วนแทนทั้งโมเดล
Fine-tuningการปรับแต่งโมเดล — ฝึกโมเดลที่มีอยู่ให้เชี่ยวชาญเฉพาะด้าน
Silent cinemaภาพยนตร์เงียบ — สไตล์ภาพยนตร์ยุคแรกที่ไม่มีเสียงพูด
NVIDIA DGX Sparkเครื่องเซิร์ฟเวอร์ AI ประสิทธิภาพสูงของ NVIDIA
Benchmarkเกณฑ์วัดประสิทธิภาพ — การทดสอบมาตรฐานเพื่อเปรียบเทียบความสามารถของโมเดล
Claude Codeเครื่องมือ coding agent ของ Anthropic สำหรับโมเดล Claude
Codexเครื่องมือ coding agent ของ OpenAI สำหรับโมเดล GPT
Grok Buildเครื่องมือ coding agent ของ xAI สำหรับโมเดล Grok
Hermes Agentแพลตฟอร์มเอเจนต์ของ Nous Research
High effortความพยายามสูง — การตั้งค่าให้โมเดลใช้เวลาคิดและทำมากขึ้น
agentwiks.comโปรเจกต์วิกิฐานความรู้ LM wiki ของผู้จัดทำวิดีโอ
LM wikiวิกิฐานความรู้สำหรับโมเดลภาษา — แหล่งรวมข้อมูลวิจัย AI
Attritionการลดจำนวนทีละน้อย — ในที่นี้คือการคัดออกทีละตัว
Eliminationการคัดออก — ตัดผู้แข่งขันที่ทำได้แย่ที่สุดออกจากการแข่งขัน
05

ซับไตเติ้ลภาษาไทย

ดาวน์โหลดหรือดูซับทั้งหมด

1
00:00:00,000 --> 00:00:13,069
ยินดีต้อนรับสู่ AI Royal Rumble เดือนกรกฎาคม 2026

2
00:00:13,069 --> 00:00:29,604
ครับ โมเดลแนวหน้า (Frontier models) ห้าตัวจะเข้าร่วมการแข่งขัน

3
00:00:29,604 --> 00:00:44,806
และจะมีเพียงตัวเดียวเท่านั้นที่ได้รับการสวมมงกุฎเป็นแชมป์

4
00:00:44,806 --> 00:01:05,609
มาดูกันครับว่ามันทำงานกันอย่างไร ผมจะให้โมเดลแนวหน้าทั้งห้าตัวทำภารกิจเดียวกัน
thai-subtitles.srt
SubRip — ใช้กับเครื่องเล่นวิดีโอส่วนใหญ่
↓ ดาวน์โหลด
thai-subtitles.vtt
WebVTT — ใช้กับเว็บ / YouTube
↓ ดาวน์โหลด
เปิดดูซับไตเติ้ลทั้งหมด (114 segments)
1
00:00:00,000 --> 00:00:13,069
ยินดีต้อนรับสู่ AI Royal Rumble เดือนกรกฎาคม 2026

2
00:00:13,069 --> 00:00:29,604
ครับ โมเดลแนวหน้า (Frontier models) ห้าตัวจะเข้าร่วมการแข่งขัน

3
00:00:29,604 --> 00:00:44,806
และจะมีเพียงตัวเดียวเท่านั้นที่ได้รับการสวมมงกุฎเป็นแชมป์

4
00:00:44,806 --> 00:01:05,609
มาดูกันครับว่ามันทำงานกันอย่างไร ผมจะให้โมเดลแนวหน้าทั้งห้าตัวทำภารกิจเดียวกัน

5
00:01:05,609 --> 00:01:18,145
ใช้เครื่องมือเดียวกัน และไม่มีความช่วยเหลือใด ๆ

6
00:01:18,145 --> 00:01:44,548
ภารกิจที่ผมมอบหมายให้จะตั้งใจให้ยากพอสมควร แต่ก็ยังเป็นไปได้ที่จะทำให้สำเร็จด้วยเครื่องมือที่ให้ไว้

7
00:01:44,548 --> 00:02:00,017
โมเดลแต่ละตัวต้องทำงานคนเดียวโดยไม่มีการแจ้งเตือนเพิ่มเติม

8
00:02:00,017 --> 00:02:18,953
ห้ามถามคำถามเพื่อขอความชัดเจน ห้ามมาเช็คอิน และห้ามเสนอตัวเลือกให้เลือก

9
00:02:18,953 --> 00:02:41,623
พร็อมต์ค่อนข้างละเอียดมาก ดังนั้นโมเดลจะมีทุกอย่างที่จำเป็นต่อการทำภารกิจนี้ให้สำเร็จ

10
00:02:41,623 --> 00:03:01,093
เมื่อจบแต่ละรอบ โมเดลที่อ่อนที่สุดจะถูกคัดออก การแข่งขันจะมีทั้งหมดสี่รอบ

11
00:03:01,093 --> 00:03:27,496
ดังนั้นเราจะเริ่มจากห้าตัว แล้วแต่ละรอบจะตัดออกทีละตัวจนเหลือรอบชิงชนะเลิศที่จะมีสองตัวเผชิญหน้ากัน

12
00:03:27,496 --> 00:03:48,566
เพื่อหาว่าใครคือแชมป์ โมเดลแนวหน้าที่แข็งแกร่งที่สุดในตอนนี้ของปลายเดือนกรกฎาคม

13
00:03:48,566 --> 00:04:04,035
2026 คือตัวไหน? ผมรู้ว่ามี benchmark (เกณฑ์วัดประสิทธิภาพ)

14
00:04:04,035 --> 00:04:16,837
อยู่เยอะแยะ มีตัวเลขมากมาย มีการอ้างสิทธิ์ต่าง ๆ

15
00:04:16,837 --> 00:04:29,372
นานา แต่นี่คือการท้าทายที่เด็ดขาดสำหรับ Tonbi's

16
00:04:29,372 --> 00:04:45,908
AI Garage ครับ และถ้าใครรัน agent (เอเจนต์) เองแล้วอยากเข้าถึง

17
00:04:45,908 --> 00:05:08,044
LM wiki (วิกิฐานความรู้สำหรับโมเดลภาษา) ที่ผมใช้สำหรับค้นคว้าและสร้างวิดีโอเหล่านี้

18
00:05:08,044 --> 00:05:30,981
ไปดูโปรเจกต์ agentwiks.com ของผมได้เลยครับ ผมให้วิกิเหล่านี้ทั้งหมดฟรีในหลากหลายหัวข้อ

19
00:05:30,981 --> 00:05:46,983
และคุณยังสามารถสมัครบัญชี pro ในราคา 9.99 ดอลลาร์ต่อเดือนได้

20
00:05:46,983 --> 00:06:10,187
ซึ่งจะทำให้คุณเข้าถึงวิกิขนาดใหญ่พิเศษที่มีหน้ามากกว่าและรายละเอียดมากกว่าในแต่ละหัวข้อ

21
00:06:10,187 --> 00:06:22,722
ทีนี้กลับมาที่วิดีโอกันครับ นี่คือกฎเกณฑ์ต่าง ๆ

22
00:06:22,722 --> 00:06:35,790
และเป็นส่วนหนึ่งของพร็อมต์ที่จะใช้กับทุก ๆ ภารกิจ

23
00:06:35,790 --> 00:06:53,659
โมเดลจะต้องตัดสินใจด้วยตัวเอง ไม่สามารถถามคำถามเพื่อขอความชัดเจนได้

24
00:06:53,659 --> 00:07:11,262
ส่วนที่กำกวมต้องแก้ด้วยตัวเอง ข้อกำหนดต่าง ๆ จงใจปล่อยให้เปิดกว้าง

25
00:07:11,262 --> 00:07:23,797
โมเดลต้องเลือกแนวทางการตีความหนึ่ง เขียนมันลงไป

26
00:07:23,797 --> 00:07:39,266
แล้วลงมือสร้าง โมเดลต้องทำให้เสร็จ หรือไม่ก็บอกว่าทำไม่ได้

27
00:07:39,266 --> 00:07:59,802
ถ้าติดขัดที่จุดใด ต้องทำส่วนอื่นให้ครบทั้งหมด แล้วระบุชัดว่าส่วนใดที่ทำไม่ได้

28
00:07:59,802 --> 00:08:14,471
ห้ามจำลองการทำงานหรืออ้างว่าเสร็จแล้วถ้ายังไม่เสร็จจริง

29
00:08:14,471 --> 00:08:37,408
ห้ามอ้างว่ารันแล้วในสิ่งที่ไม่ได้รัน เราต้องการรายงานที่ซื่อสัตย์ของงานที่มีข้อบกพร่อง

30
00:08:37,408 --> 00:08:52,877
ซึ่งจะได้คะแนนสูงกว่ารายงานที่มั่นใจว่าทำได้สมบูรณ์แต่จริง

31
00:08:52,877 --> 00:09:06,745
ๆ พัง และโมเดลเองจะเป็นผู้ตัดสินใจว่าเมื่อไรถึงเสร็จ

32
00:09:06,745 --> 00:09:26,481
ผมจะไม่ใช้คำสั่ง /goal หรือ agentic loop (วงจรการทำงานอัตโนมัติของเอเจนต์)

33
00:09:26,481 --> 00:09:44,884
ใด ๆ เหล่านี้เป็นโมเดลแนวหน้าระดับท็อปของตลาด พวกมันเก่งมากในการสร้าง

34
00:09:44,884 --> 00:09:57,419
ตรวจสอบ แล้ววนซ้ำพัฒนาต่อไปได้ด้วยตัวเองทั้งหมด

35
00:09:57,419 --> 00:10:15,022
ไม่ต้องใช้คำสั่งกำหนดเองหรืออะไรแบบนั้น งั้นผมตัดสินพวกมันอย่างไร?

36
00:10:15,022 --> 00:10:32,091
ผมจะตัดสินจากเกณฑ์ประมาณนี้ครับ เรื่องโครงสร้างและการทำตามคำสั่ง

37
00:10:32,091 --> 00:10:48,360
พวกมันทำตามข้อกำหนดในพร็อมต์หรือไม่? งานจริงออกมาเป็นอย่างไร?

38
00:10:48,360 --> 00:11:11,296
เป็นงานคุณภาพหรือขยะ? พวกมันใช้ความคิดสร้างสรรค์แบบไหนในการตัดสินใจและในผลงานที่ออกมา?

39
00:11:11,296 --> 00:11:30,499
และสุดท้าย ถ้าทุกอย่างพอ ๆ กัน ผมจะนำความเร็วและประสิทธิภาพมาพิจารณาด้วย

40
00:11:30,499 --> 00:11:51,569
อย่างไรก็ตาม นี่ไม่ใช่ปัจจัยตัดสินหลัก ผมจะให้ความสำคัญกับคุณภาพมากกว่าความเร็ว

41
00:11:51,569 --> 00:12:10,238
แต่ถ้ามีโมเดลสองตัวที่ผลงานใกล้เคียงกัน ผมจะใช้ความเร็วเป็นเกณฑ์ตัดสิน

42
00:12:10,238 --> 00:12:32,108
ทีนี้มาดูภารกิจกันครับ ผมจะอธิบายรายละเอียดของแต่ละภารกิจมากขึ้นเมื่อถึงคราวของมัน

43
00:12:32,108 --> 00:12:49,177
แต่ภาพรวมจะเป็นสี่รอบดังนี้ รอบที่หนึ่งจะเป็นการสร้างอินเทอร์เฟซ

44
00:12:49,177 --> 00:13:08,113
เว็บไซต์ launch (เปิดตัว) พร้อม scroll control (การควบคุมการเลื่อนหน้า)

45
00:13:08,113 --> 00:13:21,982
ที่สร้างจากระบบภาพที่โมเดลออกแบบเองและต้องยึดตามนั้น

46
00:13:21,982 --> 00:13:35,851
รอบที่สองจะเป็นการท้าทายการเทรด โมเดลต้องพัฒนา paper

47
00:13:35,851 --> 00:13:50,519
trader (ระบบเทรดจำลอง) แบบเรียลไทม์จากการวิจัยของตัวเอง

48
00:13:50,519 --> 00:14:15,056
ต้องคิดอัลกอริทึมของตัวเอง แล้วเราจะรันมันเป็นเวลาสองวันเพื่อดูว่าโมเดลไหนทำเงินได้มากที่สุด

49
00:14:15,056 --> 00:14:30,792
รอบที่สามคือการพัฒนาเกม โมเดลต้องสร้างเกมปริศนาแพลตฟอร์มแนว

50
00:14:30,792 --> 00:14:46,794
time loop (วนลูปเวลา) ที่ผู้เล่นต้องร่วมมือกับ "ตัวตนในอดีต"

51
00:14:46,794 --> 00:14:59,329
ของตัวเองที่บันทึกไว้ เป็นระบบเกมที่ก้าวหน้ามาก

52
00:14:59,329 --> 00:15:15,598
แต่ผมเชื่อว่าโมเดลเหล่านี้ทำได้ และรอบสุดท้าย โมเดลจะต้องเทรน

53
00:15:15,598 --> 00:15:30,534
LoRA (อะแดปเตอร์สำหรับ fine-tuning หรือการปรับแต่งโมเดล)

54
00:15:30,534 --> 00:15:47,069
โดยเฉพาะการเทรน video LoRA สไตล์ silent cinema (ภาพยนตร์เงียบ)

55
00:15:47,069 --> 00:16:02,538
บนเครื่องเซิร์ฟเวอร์จริงที่ไม่ได้เตรียมไว้สำหรับสิ่งนี้เลย

56
00:16:02,538 --> 00:16:18,541
กล่าวคือ โมเดลจะได้รับโมเดลสร้างวิดีโอหนึ่งตัว แล้วต้องสร้าง

57
00:16:18,541 --> 00:16:31,076
LoRA นี้ขึ้นมาเพื่อให้ตรงกับสไตล์ silent cinema

58
00:16:31,076 --> 00:16:44,944
งั้นใครคือผู้เข้าแข่งขันบ้าง? อันดับแรกจาก Anthropic

59
00:16:44,944 --> 00:16:58,546
จากซานฟรานซิสโกในสหรัฐอเมริกา คือ Claude Fable ซึ่ง

60
00:16:58,546 --> 00:17:14,815
Fable เป็นตัวเต็งของบ้านเลยก็ว่าได้ครับ รู้จักกันอีกชื่อในนาม

61
00:17:14,815 --> 00:17:27,884
Mythos แต่มี guardrail (ข้อจำกัดเพื่อความปลอดภัย)

62
00:17:27,884 --> 00:17:40,686
มากกว่า ถ้า Fable ชน guardrail ระหว่างการแข่งขัน

63
00:17:40,686 --> 00:17:53,488
จะถูกดาวน์เกรดเป็น Opus 5 หรืออาจจะเป็น Opus 4.8

64
00:17:53,488 --> 00:18:06,023
แล้วต้องทำงานต่อจากตรงนั้น ผมจะไม่ทำพร็อมต์ใหม่

65
00:18:06,023 --> 00:18:22,292
ถ้าชน guardrail ก็ช่างมันไปครับ ผู้เข้าแข่งขันอันดับที่สองจาก

66
00:18:22,292 --> 00:18:35,627
OpenAI ในซานฟรานซิสโก สหรัฐอเมริกา คือ GPT-5.6 Sol

67
00:18:35,627 --> 00:18:51,096
โมเดลแนวหน้าตัวล่าสุดจาก OpenAI ได้ benchmark ที่ยอดเยี่ยม

68
00:18:51,096 --> 00:19:10,565
รีวิวดีมาก คนบอกว่าคล้ายกับ Fable เยอะมาก งั้นมาดูกันครับว่าจะเป็นอย่างไร

69
00:19:10,565 --> 00:19:30,035
อันดับที่สาม Grok 4.5 และนี่คือม้ามืด ไม่ใช่ตัวที่ผมคาดว่าจะเพิ่มเข้ามาใน

70
00:19:30,035 --> 00:19:42,837
AI Royal Rumble เดือนนี้ แต่มันเป็น coding agent

71
00:19:42,837 --> 00:19:57,239
(เอเจนต์เขียนโค้ด) ที่เด็ดขาด จึงสมควรได้รับตำแหน่งนี้

72
00:19:57,239 --> 00:20:13,508
มาจาก xAI ในสหรัฐอเมริกา และผมอยากรู้มากว่ามันจะทำได้ดีแค่ไหน

73
00:20:13,508 --> 00:20:27,110
อันดับที่สี่ Kimi K3 เริ่มเข้าสู่เหล่า open weights

74
00:20:27,110 --> 00:20:41,778
(น้ำหนักโมเดลที่เปิดให้ใช้) แล้วครับ ตัวนี้จาก Moonshot

75
00:20:41,778 --> 00:20:54,847
AI เป็นโมเดลจากห้องแลป AI ของจีน พวกเขาเพิ่งปล่อย

76
00:20:54,847 --> 00:21:16,450
open weights ออกมาเมื่อวันนี้เอง แต่ก็ถือเป็นโมเดลแนวหน้าที่น่าเกรงขามอย่างแน่นอน

77
00:21:16,450 --> 00:21:33,519
สุดท้าย GLM 5.2 อีกหนึ่งโมเดล open weights ม้ามืดอีกตัวจากจีนโดย

78
00:21:33,519 --> 00:21:49,521
Zhipu AI และเป็นโมเดลที่คนนำไปเปรียบเทียบกับโมเดลแนวหน้าท็อป

79
00:21:49,521 --> 00:22:04,724
ๆ จากห้องแลปปิดอยู่เลย นี่คือผู้เข้าแข่งขันทั้งห้าตัวครับ

80
00:22:04,724 --> 00:22:25,793
ทุกรอบจะคัดออกทีละตัวเพื่อหาว่าใครคือแชมป์ตัวจริงและเป็นโมเดลแนวหน้าที่ดีที่สุด

81
00:22:25,793 --> 00:22:44,196
ห้าโมเดลเข้าประชัน เหลือเพียงหนึ่งเดียวที่จะออกมาพร้อมมงกุฎแห่งชัยชนะ

82
00:22:44,196 --> 00:22:59,932
เราทำสิ่งนี้ในสัปดาห์สุดท้ายของเดือนกรกฎาคม และความคิดก็คือ

83
00:22:59,932 --> 00:23:13,267
ถ้าคนชอบรูปแบบนี้ ผมอาจจะทำทุกเดือนหรือทุกสองเดือน

84
00:23:13,267 --> 00:23:30,869
ขึ้นอยู่กับว่ามีโมเดลใหม่ออกมาเท่าไร แต่เราจะให้ภารกิจที่ท้าทายมาก

85
00:23:30,869 --> 00:23:45,538
ๆ แล้วดูว่าพวกมันจะทำได้แค่ไหน ทีนี้ แต่ละโมเดลจะอยู่ใน

86
00:23:45,538 --> 00:23:59,140
agent harness (สภาพแวดล้อมการรันเอเจนต์) คนละแบบกัน

87
00:23:59,140 --> 00:24:15,409
Claude ก็จะอยู่ใน Claude Code อย่างเห็นได้ชัด ทุกตัวจะตั้งค่า

88
00:24:15,409 --> 00:24:29,278
high effort (ความพยายามสูง) ถ้ามีส่วนของการใช้เหตุผล

89
00:24:29,278 --> 00:24:43,146
GPT-5.6 จะอยู่ใน Codex ส่วน Grok จะอยู่ใน Grok Build

90
00:24:43,146 --> 00:24:55,682
แล้วสำหรับโมเดล GLM และ Kimi ทั้งสองตัวจะอยู่ใน

91
00:24:55,682 --> 00:25:16,218
Hermes Agent โดยผมได้สร้างโปรไฟล์เปล่าขึ้นมา ดังนั้นพวกมันจะไม่ได้ประโยชน์จาก

92
00:25:16,218 --> 00:25:29,286
Hermes Agent มาตรฐานของผมที่มี skill (ทักษะ) ต่าง

93
00:25:29,286 --> 00:25:48,222
ๆ มากมาย เป็นโปรไฟล์เปล่าโดยสมบูรณ์ แต่พวกมันยังคงเข้าถึงเครื่องมือต่าง

94
00:25:48,222 --> 00:26:01,291
ๆ ได้ เพื่อให้เป็นการแข่งขันที่ยุติธรรมระหว่างกัน

95
00:26:01,291 --> 00:26:17,827
เริ่มกันเลยครับ รอบที่หนึ่ง หน้า Landing Page และนี่คือพร็อมต์

96
00:26:17,827 --> 00:26:31,962
ผมจะแชร์พร็อมต์ทั้งหมดนี้ให้ครับ น่าจะเอาไว้ใน GitHub

97
00:26:31,962 --> 00:26:47,164
ให้ไปดูกันได้ ภารกิจคือ "สร้างเว็บไซต์ launch คุณภาพระดับ

98
00:26:47,164 --> 00:27:00,233
production สำหรับ AI Royal Rumble โดยใช้ Next.js,

99
00:27:00,233 --> 00:27:12,768
React, TypeScript, GSAP ScrollTrigger และ Lenis

100
00:27:12,768 --> 00:27:30,104
smooth scrolling แบบควบคุม" โดยมีแนวทางเพิ่มเติมว่าต้องทำอะไรบ้าง

101
00:27:30,104 --> 00:27:42,639
เรื่องทิศทางการออกแบบ ดีไซน์เป็นของโมเดลเอง ทุก

102
00:27:42,639 --> 00:28:00,775
scene (ฉาก) ต้องเกิดจากการเปลี่ยนรูปจากเรขาคณิตที่มีอยู่แล้วบนหน้าจอ

103
00:28:00,775 --> 00:28:13,577
เราจะได้เห็นอะไรที่เจ๋ง ๆ นี่ไม่ใช่แค่ทำ landing

104
00:28:13,577 --> 00:28:31,179
page ธรรมดานะครับ เป็นภารกิจที่ค่อนข้างยาก ต้องประกาศระบบของตัวเอง

105
00:28:31,179 --> 00:28:43,981
โมเดลต้องสร้าง storyboard (สตอรีบอร์ด) ออกมาก่อน

106
00:28:43,981 --> 00:28:59,450
และเนื้อหาที่จำเป็น ไม่ได้กำหนดข้อกำหนดเยอะมาก แต่ต้องเป็น

107
00:28:59,450 --> 00:29:13,052
landing page สำหรับโปรเจกต์ Royal Rumble นี้ เรื่อง

108
00:29:13,052 --> 00:29:33,588
motion (การเคลื่อนไหว) และวิศวกรรม นี่คือกฎเกณฑ์บางส่วนเกี่ยวกับการเคลื่อนไหว

109
00:29:33,588 --> 00:29:46,390
เช่น หลีกเลี่ยง gradient (การไล่สี) และ gradient

110
00:29:46,390 --> 00:30:01,859
text, neon blob (ก้อนแสงนีออน) ฯลฯ นี่คือสิ่งที่ต้องส่งมอบ

111
00:30:01,859 --> 00:30:17,328
แต่สิ่งส่งมอบหลักคือเว็บไซต์ที่ใช้งานได้จริง นี่คือพร็อมต์

112
00:30:17,328 --> 00:30:34,130
และผมจะให้กับทุกตัว แล้วลุยกันเลยครับ โอเค ผมวางพร็อมต์ลงไปแล้ว

113
00:30:34,130 --> 00:30:47,199
เริ่มกันเลย ปล่อยให้พวกมันรันไป Codex เริ่ม! Grok

114
00:30:47,199 --> 00:30:56,000
เริ่ม! GLM เริ่ม! และ Kimi เริ่ม!