Unraveling the Ox Alpha Mystery: How It Performs & Identify Investigation
สรุปย่อ
ประเด็นสำคัญจากวิดีโอ
> **ที่มา:** [YouTube — Tonbi's AI Garage](https://www.youtube.com/watch?v=uiZzgp69alA) · เผยแพร่ 22 ส.ค. 2026 · ~23:38 นาที
# สรุปภาษาไทย — Unraveling the Ox Alpha Mystery > **ที่มา:** [YouTube — Tonbi's AI Garage](https://www.youtube.com/watch?v=uiZzgp69alA) · เผยแพร่ 22 ส.ค. 2026 · ~23:38 นาที > *สรุปโดยอัตโนมัติ — เนื้อหาต้นฉบับ © Tonbi's AI Garage* ## วิดีโอนี้เกี่ยวกับอะไร Tonbi เทสต์ **Ox Alpha** โมเดล stealth ปริศนาบน OpenRouter (ใช้ฟรี 1 สัปดาห์ อ้าง capacity วันละ 1 quadrillion token) แล้วให้เอเจนต์นักสืบเทียบพฤติกรรมกับ session เทสต์เก่าๆ เพื่อหาว่าห้องแล็บไหนปล่อยมา ## ประเด็นหลัก 1. **Ox Alpha คืออะไร (ตอนนั้น):** โมเดลนิรนาม stealth 1 สัปดาห์ ใช้ฟรีผ่าน News Portal · คาดว่าห้องแล็บจีน open weights · ข่าวลือ: GLM-5.3 vision / Xiaomi Mimo / อื่นๆ 2. **เทสต์ออกแบบเว็บ (Star Wars × One Piece):** sphere สวย shading ดี stagger effect ครบ — ผ่าน (ติแค่หดแล้วหลุดเฟรมบ้าง) 3. **เทสต์มินิเกม Force Pirate:** เล่นได้ control ดี effect ดาเมจดี แต่ไม่มี orb กลางจอ — ด้อยกว่า GLM-5.3 ที่ orb สวยกว่า 4. **เทสต์ landing Royal Rumble:** fade/transition ดี ไม่ซ้อนกัน จัดระเบียบดีกว่า GLM-5.3 (แต่เปลี่ยนสีน้อยกว่า) — คล้าย GBT-5.6 Soul อาจดีกว่า Kimi K3 นิดๆ 5. **เทสต์ three.js Lord of the Rings:** โลก rich กว่า GLM-5.21 มีฉากปาร์ตี้ + firework ที่ GLM ไม่มี — ชนะขาด 6. **เทสต์เกมแข่งรถ:** ภาพพัง (แทร็กหาย) แต่รันลื่น control นุ่ม · มี vision + context 1 ล้าน · ทีม bot ในคลิป bot mode ทำได้ดีกว่า 7. **เทสต์ Blender MCP (มือถือลอย):** navigate MCP ได้ ทำงานจบ มือถือหมุนได้ — แต่เหลี่ยมๆ ไม่สวยเท่า Codex · โน้ตสำคัญ: มันกล้าทำทรง iPhone ชัดๆ ไม่กลัว IP แบบ Codex → กลิ่นโมเดลจีน 8. **สไตล์คุย:** กระชับ เข้าประเด็น ไม่เวิ่นเว้อแบบ frontier รุ่นใหม่ — คล้ายโมเดล Memo 9. **ระดับฝีมือ:** ไม่ใช่ frontier แถวหน้า (Fable/Soul) — อยู่ tier สองกับ GLM-5.3, Kimi K3, DeepSeek, Quen 3.8 · ออกแบบเว็บเก่ง งาน 3D/เกมอ่อนกว่า 10. **ผลสืบสวน (ไฮไลต์):** เอเจนต์เทียบ 4 วิธีอิสระ (reasoning/tool sequence/error/correction) + 22 ฟีเจอร์พฤติกรรมใน 459 window จาก 8 session — **ผู้ต้องสงสัยอันดับ 1: GLM ของ ZAI (ท่วมท้น)** · workflow เกือบเดียวกับ GLM-5.3 ใน prompt เดียวกัน · โค้ด Force Pirate คล้ายกันสูง · สัดส่วน blank tool turn/preamble/parallel call ใกล้ผิดปกติ · ตีความว่าคือ GLM-5.3V/5.5 multimodal checkpoint ที่ยังไม่ปล่อย (ผสม 5.3 + 5.7 Turbo) · อันดับ 2 Kimi K3 (คล้ายแต่ไม่มี fingerprint เฉพาะ) · อันดับ 3 DeepSeek V4 (พฤติกรรมแฝดแต่ reasoning เวิ่นเว้อกว่าเยอะ) · หลักฐาน local เลือก GLM ก่อนเห็นหลักฐาน tokenizerสาธารณะ — แล้วหลักฐานนั้นยิ่งยืนยัน ## ใครควรดู คนชอบทั้งรีวิวโมเดลและงานสืบสวน — วิธีใช้เอเจนต์เทียบพฤติกรรมข้าม session เพื่อ de-anonymize โมเดล stealth เอาไปประยุกต์ได้เอง --- *Attribution: Unraveling the Ox Alpha Mystery — Tonbi's AI Garage (youtube.com/watch?v=uiZzgp69alA), เผยแพร่ 22 ส.ค. 2026*
คำแปลเต็ม
แปลตามบทสนทนาต้นฉบับ ปรับเป็นภาษาไทยธรรมชาติ
เมื่อวานมีโมเดล stealth ตัวใหม่โผล่บน OpenRouter ดึงความสนใจเพราะทำได้ดีจริง แถมเขาบอกว่ามี capacity ระดับแสนล้านล้าน token ในแง่ compute อ้างแรงมาก วันนี้ News Research ปล่อยลง News Portal บอกมี capacity วันละหนึ่ง quadrillion token พูดง่ายๆ คือไม่จำกัด ยุคนี้อ้างแบบนี้แรงมาก คนเลยสงสัย Ox Alpha คืออะไร โมเดลพวกนี้มักมาจากห้องแล็บจีน โมเดล open weights สุดท้ายมักเป็นแบบนั้น แต่ตัวนี้จะ stealth หนึ่งสัปดาห์ นับจากวันนี้อีกหกวัน แถมใช้ฟรี นี่คือเรื่องใหญ่ สมัครบัญชี News Portal ตอนนี้ลองฟรีได้เลย ผมเลยอยากลอง เอาไปผ่าน task ประจำที่ผมใช้เทสต์โมเดล ทำผ่าน Hermes Agent คลิปนี้จะโชว์ output ของ prompt พวกนั้นว่าโมเดลทำได้แค่ไหน แล้วจะสืบสวนหน่อย เพราะผมเทสต์โมเดลมาตั้งแต่กุมภาพันธ์ที่เปิดช่อง ส่วนใหญ่ผ่าน Hermes Agent มี session เทสต์เป็นสิบๆ session โมเดลหลายห้องแล็บหลายภูมิภาค ผมจะให้เอเจนต์ตัวหนึ่งไล่ดู tool call กับ output ทั้งหมดจาก session ที่ใช้ Ox Alpha แล้วเทียบกับ session เก่าของโมเดลอื่น ดูว่ามี pattern อะไรไหม ว่า Ox Alpha คืออะไร หรืออย่างน้อยห้องแล็บไหนปล่อยมา ข่าวลือวันนี้เยอะ มีลือว่าเป็น GLM-5.3 แบบ vision หรือ multimodal ผมไม่แน่ใจ GLM-5.3 เพิ่งออกสัปดาห์ก่อน เขาปล่อยระวังมาก ปล่อยแค่ terminal ตัวเองกับพาร์ตเนอร์เล็กๆ จนปล่อย API ต้นสัปดาห์นี้ ไม่รู้จะเอาตัวฟรีไม่จำกัดลง OpenRouter ตอนนี้ไหม มีลือว่ามาจาก Xiaomi บริษัทที่ทำโมเดล Mimo ห่างหายจากรีลีสใหญ่มานาน เขาเคยใช้โมเดล stealth เทสต์ Mimo 2.5 มาก่อน มีลือห้องแล็บอื่นอีก ดูเหมือนน่าจะห้องแล็บจีนจากคำตอบคำถามภูมิรัฐศาสตร์ ก็น่าจะใช่ แต่มาดูกัน มาเริ่มเลย ถ้าอยากยกระดับเอเจนต์ของตัวเอง ลองดูโปรเจกต์ Agent Wikis ของผม ที่นั่นมี knowledge base ที่ผมใช้ทุกวันทั้งค้นคว้าทำคลิปและสร้างโปรเจกต์ หัวข้อมี Hermes agent กับ hyperframes กับเครื่องมือ local AI และอีกเพียบ wiki มาตรฐานเปิดให้ใช้ฟรีทั้งหมด แต่ถ้าสมัคร Agent Wikis Pro จะได้ Excel wiki ด้วย รวมถึง custom skill ที่ผมพัฒนาร่วมกับเอเจนต์มาตลอดหลายเดือน Pro เดือนละ 9.99 ดอลลาร์เท่านั้น สมัครตอนนี้ล็อกเรทราคานี้ตลอดชีพ ตอนนี้ผมกำลังทำโปรไฟล์เอเจนต์เฉพาะทางกับเทมเพลตเวิร์กโฟลว์อัตโนมัติ พอของพวกนี้ออก ราคา Pro จะขึ้น เลยแนะนำให้สมัครวันนี้ที่ agentwikis.com ขอบคุณทุกคนที่สนับสนุนครับ กลับเข้าวิดีโอกันต่อ เข้า task กันเลย บางอันยังรันอยู่ แต่ทำไปสองสามอันเมื่อวาน นี่คือ prompt ประจำทำ landing page วิดีโอเกม Star Wars ผสม One Piece ต้องสร้าง sphere แบบนี้ scroll ลงแล้วหดเล็กลงจางหายไป มี headline แบบ stagger ใช้ element หน้าเว็บเยอะ ยากหน่อย แต่ตอนนี้ sphere ดูดีมาก Grand Line Odyssey shading ไม่มีอะไรแปลก sphere สวย หมุนดี ดาวรอบๆ สวย ลอง scroll ลง เห็นไหมหดลงนิด แม้หลุดเฟรมบ้าง แต่หดจริง มี stagger effect สวยๆ ให้ดูอีกที นี่ไงตอนลงมา Nine pirates one rebellion เท่ Chapter three ทำได้หลายรอบด้วย ดีเลย ครบทุกอย่างที่สั่ง ทุกอย่างดูดี ถ้าจะจิกคือหดแล้วหลุดเฟรมไปหน่อย แต่รวมๆ ดี งานนี้ผ่าน ต่อไปคือมินิเกมที่เคยทำหลายรอบ Horse pirates training arena น่าสนใจเพราะเพิ่งทำคลิป GLM-5.3 ไปเมื่อเช้า เทียบกันง่าย มาดูกัน นี่ยานผม ต้องเก็บ enemy fragment มี drone ไล่ ควรมี orb ตรงกลาง มีแค่เงาๆ เห็นไหม โอ๊ยโดนดาเมจ แต่ไม่มี orb เต็มๆ effect ดาเมจดี control ใช้ได้หมด ไอคอนเรียบง่ายแต่ดูดี รวมๆ ดี เทียบกับของ GLM นี่คือของ GLM-5.3 effect สดกว่า คล้ายกันบ้าง แต่ orb ตรงกลางของ GLM ทำได้ดีกว่า อ่านลงไป เห็นไหมนี่ Ox Alpha 1 prompt เดียวกันเลยคล้ายกันหน่อย ผมว่า orb ตรงกลางของ GLM-5.3 ทำได้ดีกว่าเขา โอเค งานต่อไป นี่คือรอบแรกของ AI Royal Rumble จำได้ landing page ที่ text ต้องเปลี่ยนเข้าหากันสไตล์ cinema งานนี้ GLM-5.2 ทำพัง ส่วน GLM-5.3 ทำดีมาก นี่คือที่ Ox Alpha ทำ ผมจะ scroll ลง ควรเห็น element เปลี่ยน มาแล้ว ดีเลย fade in ลงมา the interface part two the market part three the game เห็นไหมมันนับว่าใครแพ้จริงเพราะมันรู้ข้อมูลแล้ว มาแล้ว eliminated the game กราฟิกน่ารัก 5 4 3 2 1 Five enters one leaves Quad Fable survives ดูดี คล้าย GBT-5.6 Soul ผมว่า อาจดีกว่า Kimmy K3 นิดๆ ให้ดูที่ GLM ทำ นี่ของ GLM-5.3 ทำดี มีซ้อนกันบ้าง แต่ transition สีดี ผมว่าทำได้ดีกว่าอันนี้เพราะจัดฟอร์แมต ไม่มีซ้อนกันเลย คล้ายกัน prompt เดียวกัน อันนี้เปลี่ยนสีน้อยกว่า จุดเปลี่ยนสีมีแค่ตรงนี้ แต่จัดระเบียบดีกว่า ไม่ซ้อนกันเลย ผมว่า จบ landing page ต่อไปคือ three.js Lord of the Rings ให้ย่อหน้าแรกของ Lord of the Rings แล้วขอให้สร้างหนังใน three.js ผมลง Twitter ไปแล้ว อาจเคยเห็น หน้าตาดี ผมว่าผมทำกับหลายโมเดลแล้ว อันนี้อาจดีกว่า GLM-5.21 เมื่อวานนิดๆ โลกดู rich กว่า โดยเฉพาะตอนท้าย ข้ามไปดู เห็นไหม landscape ทำดีกว่า ฉากปาร์ตี้ทำดีมาก GLM-5.21 ไม่มี นี่คือชัยชนะใหญ่ของ Ox Alpha มี firework เท่ๆ effect ดี ต่อไปคือเกมแข่งรถ เคยทำมาก่อน นี่ของ Ox Alpha สร้างหลักๆ ใน three.js ผมขอให้ทำเกมแข่งรถจากภาพอ้างอิงสมัยเกมตู้ Thunder เก่า มีของพังเยอะ แต่ส่วนดีก็มี อีกงาน three.js เพี้ยนเยอะ แถมเยอะด้วย แทร็กหายไปตรงนี้ แต่ตัวเกมรันดี ไม่รู้รู้สึกไหม control ลื่นมาก เป็นแค่เรื่องภาพ มี vision capability ในโมเดลนี้ กับ context window หนึ่งล้าน นั่นคือเกมแข่งรถ ไม่ดีเท่าไร ทีม bot ของผมถ้าดูคลิป bot mode ทำได้ดีกว่า แต่ produce เกมที่เล่นได้ออกมา แม้ภาพไม่ดี พระอาทิตย์ทำสวยจริง โอเค จบเกมแข่งรถ ต่อไป อันนี้ยังรันอยู่ อยากได้มือถือลอยสไตล์ iPhone พื้นหลังดำ ทำ animation มือถือหมุน เป็น Blender ใช้ Blender MCP เห็นไหมเริ่มทำแล้ว มือถือหมุนช้าๆ มีข้อความ ox ปรากฏ ห้ามใช้ resource ปัจจุบันใน directory ต้อง original แต่ดูภาพอ้างอิงได้ ผมมีภาพอ้างอิงมือถือ ถ้าจำได้ นานแล้ว นี่คือที่ Codex ทำ GPT-5.6 Soul ไม่ใช่ one shot ทำสองสามรอบ เห็นไหมคลิปโปรโมตวิธีทำ นั่นคือผลงานสุดท้าย ดูดีเลย พอเสร็จจะให้เทียบ output ทุกงานที่ให้มันทำ กับ session พวกนั้น ดูหลักๆ ที่ tool calling กับ reasoning แล้วก็ output ให้ตัดสินว่าโมเดลนี้คืออะไร รอบแรกไม่ดี ผมเลยให้อีกรอบ อย่างหนึ่งที่สังเกต เห็นบรรทัดข้างหลังไหม ตอนนี้อ่านชัดว่าเป็น iPhone ตอนทำกับ Codex จำได้ว่ามันระวังมาก ไม่ยอมทำ iPhone ต้องทำของที่เหมือน iPhone เพราะกลัวเรื่อง IP อันนี้ไม่กลัวเลย ทำให้คิดว่านี่คือโมเดลจีนที่ไม่กังวลเรื่อง IP กับกฎหมายเท่าไร โน้ตน่าสนใจ ไว้ดูภาพสุดท้าย นี่คือที่ได้จาก Blender ไม่สวยเท่า Codex แต่ดูเป็นมือถือ ลองเล่น หมุนอยู่ กล้องเหลี่ยมๆ ทุกอย่างเหลี่ยมๆ ไม่สวยเท่า Codex แต่ navigate Blender MCP ได้ สร้างของได้ ลอยสวย ไม่สวยมาก แต่ทำงานจบ อย่างน้อยก็เสร็จ นั่นคืองานสุดท้าย ตอนนี้ถึงเวลาหาว่าโมเดลมาจากไหน ผมบอก detective agent ว่า ช่วยดู session ทั้งหมดที่ใช้ Ox Alpha หน่อย นี่คือโมเดลปริศนา อยากให้เทียบ reasoning, tool call, การตัดสินใจ กับ output ทุก session กับโมเดลอื่นจาก session อื่น หาว่าโมเดลไหนใกล้เคียงสุด ไม่ต้องตัวเดียวกัน แต่น่าจะมาจากห้องแล็บเดียวกัน จัดมาสามผู้ต้องสงสัยพร้อมเหตุผล ใช้เวลาได้ ละเอียดๆ เห็นไหม Soul รับคดีแล้ว Soul กำลังค้นหาตัวตน มาดูว่าได้อะไร ลองใช้เอง คุยดี ผมชอบวิธีคุย ไม่เวิ่นเว้อเท่า frontier รุ่นใหม่ เข้าประเด็นเลย สไตล์คุยดี ทำงานด้วยเพลิน ทำให้สงสัยว่าเป็นโมเดล Memo เพราะผมชอบคุยกับพวกนั้น รู้สึกสไตล์คุยดี แต่รอดูผล อย่าง performance จริง ไม่ใช่ Fable หรือ Soul อะไรแบบนั้น ไม่ใช่ frontier แถวหน้า น่าจะ tier สองเดียวกับ GLM-5.3, Kimi K3, DeepSeek รุ่นใหม่, Quinn 3.8 ประมาณนั้น บางงานดีกว่า บางงานแย่กว่า ออกแบบหน้าเว็บเก่งมาก ใน Twitter คนก็บอกว่าออกแบบหน้าเว็บเก่ง มีปัญหากับภาพ 3 มิติ เห็น three.js หลายตัว Lord of the Rings ดูดีมาก แต่เกมรถไม่ดี เกม dev อาจอ่อนกว่า มินิเกมแรกไม่ดีเท่า GLM-5.3 งาน 3 มิติ handle MCP ได้ งานมือถืออันนี้ แต่ output ไม่ดี งาน 3 มิติอาจไม่แข็ง แต่ออกแบบหน้าเว็บกับ skill เก่ง ขึ้นกับราคา ตอนนี้ฟรีเลยดี ถ้าถูกมากก็น่าใช้ ถ้าราคาเท่า Kim E 3 ไม่แน่ใจจะเลือกเหนือ Kim ไหม ปล่อยให้สืบต่อไป เดี๋ยวมาดู สืบเสร็จแล้ว รายงานละเอียดมาก ไม่เล่าทั้งหมด ดู session พวกนี้ เทียบสี่วิธีอิสระ รีวิวเชิงคุณภาพทั้ง reasoning, tool sequence, error, correction เทียบพฤติกรรม 22 ฟีเจอร์ใน 459 window จากแปด session มี task control ตรงกันเป๊ะ นี่คือ fingerprint พฤติกรรมของ Ox วางแผนเป็นชิ้นสั้นๆ รันได้ โหลด skill ที่เกี่ยว เขียน HTML ตรวจ headless แล้วซ่อมจริง นี่คือ reasoning แบบนั้น workflow หลักคือเขียนกว้างๆ รอบแรก รัน ดู screenshot ตั้งสมมติฐานแคบๆ patch รันใหม่ จุดแข็งจุดอ่อนตรงนี้ profile คล้ายโมเดลโค้ดจีนที่ฝึก agent มาหนัก มากกว่า GPT, Claude หรือ Rock มีผลราย session ทุกงานที่ให้ทำ เทียบเชิงคุณภาพ นี่คือ centroid พฤติกรรมรวม ใกล้สุดคือ GLM-5.3 ทิ้งห่างพอสมควร อันดับสอง Grok แล้ว Kimi ดูความคล้าย reasoning กับ artifact ตรงๆ GLM สองอันบนคล้ายกว่า Kimi K3 ดูส่วนต่าง workflow รวม Ox กระชับกว่ากลุ่มเทียบ แต่ patch หนักกว่ารอบแรก น่าสนใจ tool call ต่อ session น้อยกว่า control ที่ prompt เดียวกันเป๊ะ ผู้ต้องสงสัย อันดับหนึ่งคือโมเดล GLM ของ ZAI คำตัดสิน ผู้ต้องสงสัยแข็งสุดท่วมท้น ในวงคุยทั่วไปก็มองว่าเป็นตัวเต็ง สาย Hermes ของเราก็เจอแบบนี้ หลักฐาน local บอก GLM-5.3 คือ centroid พฤติกรรมใกล้ Ox สุด Ox กับ GLM-5.3 ทำ workflow เกือบเดียวกันใน prompt เดียวกัน น่าสนใจ artifact Force Pirate มีความคล้ายโค้ด task ตรงๆ สูงมาก พวกนี้คนละ profile กันด้วย บอกไว้ก่อน ผมเทสต์โมเดลแยก profile แยก session แยก directory สะอาดเสมอ สัดส่วน blank tool turn, visible preamble, parallel call ใกล้กันผิดปกติ fit ความสามารถ AUX เหมือน GLM สองสายรวมกัน GLM-5.3 บวก GLM-5.7 Turbo รุ่น multimodal ก่อนหน้า น่าสนใจ อาจเป็น fusion แบบนี้ ตีความผม AUX น่าจะประมาณ GLM-5.3V ที่ยังไม่ปล่อย หรือ GLM-5.5 GLM-5.3 flash checkpoint สาย multimodal agent ชื่อเป๊ะรู้ไม่ได้ แต่สาย GLM มีโอกาสสูงมาก มันสรุปแบบนี้เอง ผมไม่ได้บอก ทฤษฎีทั่วไปตอนนี้ก็ว่าโมเดล GLM แต่มันสรุปตรงกัน อันดับสอง Moonshot AI ตระกูล Kimi K3 ตัวเลือกนอก GLM ที่ดีสุด ที่ยังที่สองเพราะหลักฐาน tokenizer สาธารณะกับ video encoder ชี้ GLM โดยเฉพาะ คล้าย Kimi ทั้งพฤติกรรมทั้งความสามารถ แต่ไม่มี fingerprint เฉพาะ Kimi ตระกูล DeepSeek V4 คู่แฝดพฤติกรรมแรงสุด แต่ตัวจริงไม่น่าใช่ คล้ายกัน ทั้งสองใช้ recursive hypothesize, test, inspect, revise เลยที่สาม เพราะ reasoning ของ DeepSeek เวิ่นเว้อกว่ามาก แถมไม่มีหลักฐาน tokenizer หรือ multimodal encoder ชี้ DeepSeek ที่คล้ายน่าจะฝึก agent จีนมาบรรจบกันบวก environment Hermes เดียวกัน ที่อันดับต่ำกว่า Mimo session memo local ใช้ let me หนักกว่ามาก coding agent คล้ายบ้าง Grok ไม่มี clue เทคนิคชี้ XAI GBT กับ Claude ไม่น่าแน่ๆ MiniMax artifact เดี่ยวคล้าย docs แต่ reasoning ที่เก็บของ MiniMax M3 เวิ่นเว้อกว่าเป็นสิบเท่า คำตัดสินสุดท้ายจาก Hermes ว่า Ox Alpha คือ derivative multimodal ของ ZAI สาย GLM ที่ยังไม่ปล่อย ประเด็นสำคัญคือหลักฐาน Hermes local เลือก GLM ก่อนพิจารณาหลักฐาน fingerprint สาธารณะ รายงาน tokenizer กับ video encoder ทำให้สมมติฐาน GLM แข็งขึ้นมาก Kimi คือทางเลือกเดียว นั่นคือส่วนหนึ่งของรายงานฉบับเต็ม พอมันสืบเองเสร็จ มันไปสืบ Reddit ต่อ นั่นคือวิเคราะห์อิสระ nuance หลักคือ telemetry อย่างเดียวไม่เสถียร transcript behavior กับ technical fingerprint นิ่งกว่า เลย GLM เป็นผู้ต้องสงสัยชัดสุด เรียบร้อย รายงานยาวมากถ้าอยากอ่าน นั่นคือจบการสืบสวน สรุปว่ามีโอกาสสูงเป็นโมเดล GLM เท่ดี คล้าย GLM หลายจุด ได้โมเดล GLM multimodal คงดี โดยเฉพาะ GLM มัก open weights ถ้าได้ open weights เยี่ยมเลย จบคลิป การสืบสวนเล็กๆ กับการเทสต์ prompt พวกนี้ของ Ox Alpha อยากรู้ว่าจะเปิดเผยเมื่อไร รอติดตาม จะใช้ต่อ ดูดีอยู่ อยากลองงานหน้าเว็บเพิ่ม ออกแบบดี รอติดตาม คอมเมนต์บอกหน่อยว่าทฤษฎีคุณคืออะไร คิดว่าคืออะไร มีหลักฐานไหม อยากฟัง จบคลิปนี้ ขอบคุณที่รับชมครับ
อภิธานศัพท์เทคนิค
คำศัพท์และชื่อผลิตภัณฑ์ที่คงรูปภาษาอังกฤษ
| ศัพท์ | คำแปล / คำอธิบาย |
|---|---|
| Ox Alpha (Aux/AUX) | Ox Alpha |
| stealth model (1 week) | stealth model |
| OpenRouter | OpenRouter |
| News Research / News Portal | News Portal |
| capacity (quadrillion/day) | capacity |
| compute token | compute token |
| open weights | open weights |
| free to use | free to use |
| session / profile / clean directory | session |
| tool call / output / reasoning | tool call |
| tool sequence / error / correction | tool sequence |
| behavioral centroid | behavioral centroid |
| fingerprint (behavioral) | fingerprint |
| window (459 windows) | window |
| task control (exact prompt) | task control |
| first pass / patch / rerun | patch |
| screenshot / headless / verify | headless |
| blank tool turn / preamble | preamble |
| parallel call | parallel call |
| hypothesize/test/inspect/revise | recursive loop |
| verbose | verbose |
| tokenizer / video encoder | tokenizer |
| telemetry | telemetry |
| transcript behavior | transcript behavior |
| technical fingerprint | technical fingerprint |
| suspect / verdict / top three | suspect |
| GLM-5.3V / 5.5 / flash | GLM-5.3V |
| GLM-5.7 Turbo (multimodal) | GLM-5.7 Turbo |
| derivative / checkpoint / fusion | derivative |
| Kimi K3 / Moonshot AI | Kimi K3 |
| DeepSeek V4 | DeepSeek V4 |
| Xiaomi / Mimo 2.5 | Mimo |
| MiniMax M3 | MiniMax M3 |
| Grok / XAI | Grok |
| GBT-5.6 Soul / Soul | Soul |
| Fable | Fable |
| Codex / GPT-5.6 | Codex |
| Quen 3.8 | Quen 3.8 |
| Claude / GPT / Rock | Claude |
| Star Wars × One Piece | Star Wars |
| Grand Line Odyssey | Grand Line Odyssey |
| stagger headline / sphere / shading | stagger |
| Force Pirate training arena | Force Pirate |
| drone / enemy fragment / orb | orb |
| damage effect | damage effect |
| Royal Rumble (cinema style) | Royal Rumble |
| fade in / transition / countdown | transition |
| Five enters one leaves | Five enters one leaves |
| three.js / Lord of the Rings | three.js |
| party scene / firework / landscape | firework |
| Thunder (arcade) | Thunder |
| Blender MCP | Blender MCP |
| iPhone-like (IP issue) | iPhone-like |
| spin / animation / reference image | spin |
| original (no current resources) | original |
| detective agent | detective agent |
| de-anonymize (stealth) | de-anonymize |
| geopolitical question | geopolitical question |
| vision capability | vision |
| context window (1M) | context window |
| front-end design | front-end design |
| game dev / 3D work | game dev |
| Agent Wikis / Pro $9.99 | Agent Wikis |
| Hyperframes | Hyperframes |
ซับไตเติ้ลภาษาไทย
ดาวน์โหลดหรือดูซับทั้งหมด
1 00:00:00,000 --> 00:00:05,144 เมื่อวานมีโมเดล stealth ตัวใหม่โผล่บน 2 00:00:05,144 --> 00:00:10,426 OpenRouter ดึงความสนใจเพราะทำได้ดีจริง 3 00:00:10,426 --> 00:00:16,821 แถมเขาบอกว่ามี capacity ระดับแสนล้านล้าน token 4 00:00:16,821 --> 00:00:23,077 ในแง่ compute อ้างแรงมาก วันนี้ News Research
เปิดดูซับไตเติ้ลทั้งหมด (254 segments)
1 00:00:00,000 --> 00:00:05,144 เมื่อวานมีโมเดล stealth ตัวใหม่โผล่บน 2 00:00:05,144 --> 00:00:10,426 OpenRouter ดึงความสนใจเพราะทำได้ดีจริง 3 00:00:10,426 --> 00:00:16,821 แถมเขาบอกว่ามี capacity ระดับแสนล้านล้าน token 4 00:00:16,821 --> 00:00:23,077 ในแง่ compute อ้างแรงมาก วันนี้ News Research 5 00:00:23,077 --> 00:00:29,333 ปล่อยลง News Portal บอกมี capacity วันละหนึ่ง 6 00:00:29,333 --> 00:00:34,616 quadrillion token พูดง่ายๆ คือไม่จำกัด 7 00:00:34,616 --> 00:00:40,454 ยุคนี้อ้างแบบนี้แรงมาก คนเลยสงสัย Ox Alpha 8 00:00:40,454 --> 00:00:46,571 คืออะไร โมเดลพวกนี้มักมาจากห้องแล็บจีน โมเดล 9 00:00:46,571 --> 00:00:52,966 open weights สุดท้ายมักเป็นแบบนั้น แต่ตัวนี้จะ 10 00:00:52,966 --> 00:00:58,666 stealth หนึ่งสัปดาห์ นับจากวันนี้อีกหกวัน 11 00:00:58,666 --> 00:01:04,505 แถมใช้ฟรี นี่คือเรื่องใหญ่ สมัครบัญชี News 12 00:01:04,505 --> 00:01:09,787 Portal ตอนนี้ลองฟรีได้เลย ผมเลยอยากลอง 13 00:01:09,787 --> 00:01:16,043 เอาไปผ่าน task ประจำที่ผมใช้เทสต์โมเดล ทำผ่าน 14 00:01:16,043 --> 00:01:22,160 Hermes Agent คลิปนี้จะโชว์ output ของ prompt 15 00:01:22,160 --> 00:01:28,277 พวกนั้นว่าโมเดลทำได้แค่ไหน แล้วจะสืบสวนหน่อย 16 00:01:28,277 --> 00:01:34,811 เพราะผมเทสต์โมเดลมาตั้งแต่กุมภาพันธ์ที่เปิดช่อง 17 00:01:34,811 --> 00:01:39,815 ส่วนใหญ่ผ่าน Hermes Agent มี session 18 00:01:39,815 --> 00:01:42,735 เทสต์เป็นสิบๆ session 19 00:01:42,735 --> 00:01:46,627 โมเดลหลายห้องแล็บหลายภูมิภาค 20 00:01:46,627 --> 00:01:52,327 ผมจะให้เอเจนต์ตัวหนึ่งไล่ดู tool call กับ 21 00:01:52,327 --> 00:01:58,027 output ทั้งหมดจาก session ที่ใช้ Ox Alpha 22 00:01:58,027 --> 00:02:04,282 แล้วเทียบกับ session เก่าของโมเดลอื่น ดูว่ามี 23 00:02:04,282 --> 00:02:09,287 pattern อะไรไหม ว่า Ox Alpha คืออะไร 24 00:02:09,287 --> 00:02:13,597 หรืออย่างน้อยห้องแล็บไหนปล่อยมา 25 00:02:13,597 --> 00:02:19,435 ข่าวลือวันนี้เยอะ มีลือว่าเป็น GLM-5.3 แบบ 26 00:02:19,435 --> 00:02:25,135 vision หรือ multimodal ผมไม่แน่ใจ GLM-5.3 27 00:02:25,135 --> 00:02:31,391 เพิ่งออกสัปดาห์ก่อน เขาปล่อยระวังมาก ปล่อยแค่ 28 00:02:31,391 --> 00:02:37,647 terminal ตัวเองกับพาร์ตเนอร์เล็กๆ จนปล่อย API 29 00:02:37,647 --> 00:02:43,347 ต้นสัปดาห์นี้ ไม่รู้จะเอาตัวฟรีไม่จำกัดลง 30 00:02:43,347 --> 00:02:49,046 OpenRouter ตอนนี้ไหม มีลือว่ามาจาก Xiaomi 31 00:02:49,046 --> 00:02:55,441 บริษัทที่ทำโมเดล Mimo ห่างหายจากรีลีสใหญ่มานาน 32 00:02:55,441 --> 00:03:01,558 เขาเคยใช้โมเดล stealth เทสต์ Mimo 2.5 มาก่อน 33 00:03:01,558 --> 00:03:04,338 มีลือห้องแล็บอื่นอีก 34 00:03:04,338 --> 00:03:11,289 ดูเหมือนน่าจะห้องแล็บจีนจากคำตอบคำถามภูมิรัฐศาสตร์ 35 00:03:11,289 --> 00:03:15,738 ก็น่าจะใช่ แต่มาดูกัน มาเริ่มเลย 36 00:03:15,738 --> 00:03:21,855 ถ้าอยากยกระดับเอเจนต์ของตัวเอง ลองดูโปรเจกต์ 37 00:03:21,855 --> 00:03:27,694 Agent Wikis ของผม ที่นั่นมี knowledge base 38 00:03:27,694 --> 00:03:34,227 ที่ผมใช้ทุกวันทั้งค้นคว้าทำคลิปและสร้างโปรเจกต์ 39 00:03:34,227 --> 00:03:39,371 หัวข้อมี Hermes agent กับ hyperframes 40 00:03:39,371 --> 00:03:44,793 กับเครื่องมือ local AI และอีกเพียบ wiki 41 00:03:44,793 --> 00:03:51,049 มาตรฐานเปิดให้ใช้ฟรีทั้งหมด แต่ถ้าสมัคร Agent 42 00:03:51,049 --> 00:03:57,304 Wikis Pro จะได้ Excel wiki ด้วย รวมถึง custom 43 00:03:57,304 --> 00:04:03,560 skill ที่ผมพัฒนาร่วมกับเอเจนต์มาตลอดหลายเดือน 44 00:04:03,560 --> 00:04:08,009 Pro เดือนละ 9.99 ดอลลาร์เท่านั้น 45 00:04:08,009 --> 00:04:12,457 สมัครตอนนี้ล็อกเรทราคานี้ตลอดชีพ 46 00:04:12,457 --> 00:04:21,772 ตอนนี้ผมกำลังทำโปรไฟล์เอเจนต์เฉพาะทางกับเทมเพลตเวิร์กโฟลว์อัตโนมัติ 47 00:04:21,772 --> 00:04:25,942 พอของพวกนี้ออก ราคา Pro จะขึ้น 48 00:04:25,942 --> 00:04:31,503 เลยแนะนำให้สมัครวันนี้ที่ agentwikis.com 49 00:04:31,503 --> 00:04:35,117 ขอบคุณทุกคนที่สนับสนุนครับ 50 00:04:35,117 --> 00:04:40,261 กลับเข้าวิดีโอกันต่อ เข้า task กันเลย 51 00:04:40,261 --> 00:04:45,961 บางอันยังรันอยู่ แต่ทำไปสองสามอันเมื่อวาน 52 00:04:45,961 --> 00:04:52,078 นี่คือ prompt ประจำทำ landing page วิดีโอเกม 53 00:04:52,078 --> 00:04:57,638 Star Wars ผสม One Piece ต้องสร้าง sphere 54 00:04:57,638 --> 00:05:03,060 แบบนี้ scroll ลงแล้วหดเล็กลงจางหายไป มี 55 00:05:03,060 --> 00:05:09,316 headline แบบ stagger ใช้ element หน้าเว็บเยอะ 56 00:05:09,316 --> 00:05:15,433 ยากหน่อย แต่ตอนนี้ sphere ดูดีมาก Grand Line 57 00:05:15,433 --> 00:05:20,994 Odyssey shading ไม่มีอะไรแปลก sphere สวย 58 00:05:20,994 --> 00:05:22,940 หมุนดี ดาวรอบๆ 59 00:05:22,940 --> 00:05:34,200 สวย ลอง scroll ลง เห็นไหมหดลงนิด แม้หลุดเฟรมบ้าง แต่หดจริง มี stagger effect สวยๆ 60 00:05:34,200 --> 00:05:39,761 ให้ดูอีกที นี่ไงตอนลงมา Nine pirates one 61 00:05:39,761 --> 00:05:45,878 rebellion เท่ Chapter three ทำได้หลายรอบด้วย 62 00:05:45,878 --> 00:05:51,022 ดีเลย ครบทุกอย่างที่สั่ง ทุกอย่างดูดี 63 00:05:51,022 --> 00:05:56,999 ถ้าจะจิกคือหดแล้วหลุดเฟรมไปหน่อย แต่รวมๆ ดี 64 00:05:56,999 --> 00:06:02,699 งานนี้ผ่าน ต่อไปคือมินิเกมที่เคยทำหลายรอบ 65 00:06:02,699 --> 00:06:06,592 Horse pirates training arena 66 00:06:06,592 --> 00:06:12,569 น่าสนใจเพราะเพิ่งทำคลิป GLM-5.3 ไปเมื่อเช้า 67 00:06:12,569 --> 00:06:18,686 เทียบกันง่าย มาดูกัน นี่ยานผม ต้องเก็บ enemy 68 00:06:18,686 --> 00:06:24,108 fragment มี drone ไล่ ควรมี orb ตรงกลาง 69 00:06:24,108 --> 00:06:25,359 มีแค่เงาๆ 70 00:06:25,359 --> 00:06:30,781 เห็นไหม โอ๊ยโดนดาเมจ แต่ไม่มี orb เต็มๆ 71 00:06:30,781 --> 00:06:38,983 effect ดาเมจดี control ใช้ได้หมด ไอคอนเรียบง่ายแต่ดูดี รวมๆ 72 00:06:38,983 --> 00:06:44,961 ดี เทียบกับของ GLM นี่คือของ GLM-5.3 effect 73 00:06:44,961 --> 00:06:50,799 สดกว่า คล้ายกันบ้าง แต่ orb ตรงกลางของ GLM 74 00:06:50,799 --> 00:06:56,638 ทำได้ดีกว่า อ่านลงไป เห็นไหมนี่ Ox Alpha 1 75 00:06:56,638 --> 00:07:02,338 prompt เดียวกันเลยคล้ายกันหน่อย ผมว่า orb 76 00:07:02,338 --> 00:07:07,621 ตรงกลางของ GLM-5.3 ทำได้ดีกว่าเขา โอเค 77 00:07:07,621 --> 00:07:14,016 งานต่อไป นี่คือรอบแรกของ AI Royal Rumble จำได้ 78 00:07:14,016 --> 00:07:16,935 landing page ที่ text 79 00:07:16,935 --> 00:07:22,357 ต้องเปลี่ยนเข้าหากันสไตล์ cinema งานนี้ 80 00:07:22,357 --> 00:07:28,473 GLM-5.2 ทำพัง ส่วน GLM-5.3 ทำดีมาก นี่คือที่ 81 00:07:28,473 --> 00:07:34,312 Ox Alpha ทำ ผมจะ scroll ลง ควรเห็น element 82 00:07:34,312 --> 00:07:39,456 เปลี่ยน มาแล้ว ดีเลย fade in ลงมา the 83 00:07:39,456 --> 00:07:45,573 interface part two the market part three the 84 00:07:45,573 --> 00:07:46,672 game 85 00:07:46,672 --> 00:07:53,206 เห็นไหมมันนับว่าใครแพ้จริงเพราะมันรู้ข้อมูลแล้ว 86 00:07:53,206 --> 00:07:59,462 มาแล้ว eliminated the game กราฟิกน่ารัก 5 4 3 87 00:07:59,462 --> 00:08:05,856 2 1 Five enters one leaves Quad Fable survives 88 00:08:05,856 --> 00:08:12,112 ดูดี คล้าย GBT-5.6 Soul ผมว่า อาจดีกว่า Kimmy 89 00:08:12,112 --> 00:08:18,090 K3 นิดๆ ให้ดูที่ GLM ทำ นี่ของ GLM-5.3 ทำดี 90 00:08:18,090 --> 00:08:22,678 มีซ้อนกันบ้าง แต่ transition สีดี 91 00:08:22,678 --> 00:08:27,821 ผมว่าทำได้ดีกว่าอันนี้เพราะจัดฟอร์แมต 92 00:08:27,821 --> 00:08:33,382 ไม่มีซ้อนกันเลย คล้ายกัน prompt เดียวกัน 93 00:08:33,382 --> 00:08:36,579 อันนี้เปลี่ยนสีน้อยกว่า 94 00:08:36,579 --> 00:08:42,557 จุดเปลี่ยนสีมีแค่ตรงนี้ แต่จัดระเบียบดีกว่า 95 00:08:42,557 --> 00:08:48,674 ไม่ซ้อนกันเลย ผมว่า จบ landing page ต่อไปคือ 96 00:08:48,674 --> 00:08:54,652 three.js Lord of the Rings ให้ย่อหน้าแรกของ 97 00:08:54,652 --> 00:08:59,935 Lord of the Rings แล้วขอให้สร้างหนังใน 98 00:08:59,935 --> 00:09:05,356 three.js ผมลง Twitter ไปแล้ว อาจเคยเห็น 99 00:09:05,356 --> 00:09:10,083 หน้าตาดี ผมว่าผมทำกับหลายโมเดลแล้ว 100 00:09:10,083 --> 00:09:16,061 อันนี้อาจดีกว่า GLM-5.21 เมื่อวานนิดๆ โลกดู 101 00:09:16,061 --> 00:09:21,899 rich กว่า โดยเฉพาะตอนท้าย ข้ามไปดู เห็นไหม 102 00:09:21,899 --> 00:09:28,155 landscape ทำดีกว่า ฉากปาร์ตี้ทำดีมาก GLM-5.21 103 00:09:28,155 --> 00:09:34,550 ไม่มี นี่คือชัยชนะใหญ่ของ Ox Alpha มี firework 104 00:09:34,550 --> 00:09:35,649 เท่ๆ 105 00:09:35,649 --> 00:09:44,825 effect ดี ต่อไปคือเกมแข่งรถ เคยทำมาก่อน นี่ของ Ox Alpha สร้างหลักๆ 106 00:09:44,825 --> 00:09:46,354 ใน three.js 107 00:09:46,354 --> 00:09:52,053 ผมขอให้ทำเกมแข่งรถจากภาพอ้างอิงสมัยเกมตู้ 108 00:09:52,053 --> 00:09:58,448 Thunder เก่า มีของพังเยอะ แต่ส่วนดีก็มี อีกงาน 109 00:09:58,448 --> 00:10:02,758 three.js เพี้ยนเยอะ แถมเยอะด้วย 110 00:10:02,758 --> 00:10:07,067 แทร็กหายไปตรงนี้ แต่ตัวเกมรันดี 111 00:10:07,067 --> 00:10:11,377 ไม่รู้รู้สึกไหม control ลื่นมาก 112 00:10:11,377 --> 00:10:16,521 เป็นแค่เรื่องภาพ มี vision capability 113 00:10:16,521 --> 00:10:21,942 ในโมเดลนี้ กับ context window หนึ่งล้าน 114 00:10:21,942 --> 00:10:26,947 นั่นคือเกมแข่งรถ ไม่ดีเท่าไร ทีม bot 115 00:10:26,947 --> 00:10:32,369 ของผมถ้าดูคลิป bot mode ทำได้ดีกว่า แต่ 116 00:10:32,369 --> 00:10:37,652 produce เกมที่เล่นได้ออกมา แม้ภาพไม่ดี 117 00:10:37,652 --> 00:10:43,490 พระอาทิตย์ทำสวยจริง โอเค จบเกมแข่งรถ ต่อไป 118 00:10:43,490 --> 00:10:49,746 อันนี้ยังรันอยู่ อยากได้มือถือลอยสไตล์ iPhone 119 00:10:49,746 --> 00:10:55,168 พื้นหลังดำ ทำ animation มือถือหมุน เป็น 120 00:10:55,168 --> 00:11:01,007 Blender ใช้ Blender MCP เห็นไหมเริ่มทำแล้ว 121 00:11:01,007 --> 00:11:06,706 มือถือหมุนช้าๆ มีข้อความ ox ปรากฏ ห้ามใช้ 122 00:11:06,706 --> 00:11:12,684 resource ปัจจุบันใน directory ต้อง original 123 00:11:12,684 --> 00:11:18,106 แต่ดูภาพอ้างอิงได้ ผมมีภาพอ้างอิงมือถือ 124 00:11:18,106 --> 00:11:24,084 ถ้าจำได้ นานแล้ว นี่คือที่ Codex ทำ GPT-5.6 125 00:11:24,084 --> 00:11:28,532 Soul ไม่ใช่ one shot ทำสองสามรอบ 126 00:11:28,532 --> 00:11:34,510 เห็นไหมคลิปโปรโมตวิธีทำ นั่นคือผลงานสุดท้าย 127 00:11:34,510 --> 00:11:38,959 ดูดีเลย พอเสร็จจะให้เทียบ output 128 00:11:38,959 --> 00:11:45,214 ทุกงานที่ให้มันทำ กับ session พวกนั้น ดูหลักๆ 129 00:11:45,214 --> 00:11:51,331 ที่ tool calling กับ reasoning แล้วก็ output 130 00:11:51,331 --> 00:11:56,753 ให้ตัดสินว่าโมเดลนี้คืออะไร รอบแรกไม่ดี 131 00:11:56,753 --> 00:12:01,480 ผมเลยให้อีกรอบ อย่างหนึ่งที่สังเกต 132 00:12:01,480 --> 00:12:07,318 เห็นบรรทัดข้างหลังไหม ตอนนี้อ่านชัดว่าเป็น 133 00:12:07,318 --> 00:12:13,018 iPhone ตอนทำกับ Codex จำได้ว่ามันระวังมาก 134 00:12:13,018 --> 00:12:18,718 ไม่ยอมทำ iPhone ต้องทำของที่เหมือน iPhone 135 00:12:18,718 --> 00:12:23,584 เพราะกลัวเรื่อง IP อันนี้ไม่กลัวเลย 136 00:12:23,584 --> 00:12:29,839 ทำให้คิดว่านี่คือโมเดลจีนที่ไม่กังวลเรื่อง IP 137 00:12:29,839 --> 00:12:35,817 กับกฎหมายเท่าไร โน้ตน่าสนใจ ไว้ดูภาพสุดท้าย 138 00:12:35,817 --> 00:12:41,378 นี่คือที่ได้จาก Blender ไม่สวยเท่า Codex 139 00:12:41,378 --> 00:12:47,773 แต่ดูเป็นมือถือ ลองเล่น หมุนอยู่ กล้องเหลี่ยมๆ 140 00:12:47,773 --> 00:12:54,168 ทุกอย่างเหลี่ยมๆ ไม่สวยเท่า Codex แต่ navigate 141 00:12:54,168 --> 00:13:00,284 Blender MCP ได้ สร้างของได้ ลอยสวย ไม่สวยมาก 142 00:13:00,284 --> 00:13:06,540 แต่ทำงานจบ อย่างน้อยก็เสร็จ นั่นคืองานสุดท้าย 143 00:13:06,540 --> 00:13:11,684 ตอนนี้ถึงเวลาหาว่าโมเดลมาจากไหน ผมบอก 144 00:13:11,684 --> 00:13:16,411 detective agent ว่า ช่วยดู session 145 00:13:16,411 --> 00:13:22,805 ทั้งหมดที่ใช้ Ox Alpha หน่อย นี่คือโมเดลปริศนา 146 00:13:22,805 --> 00:13:29,200 อยากให้เทียบ reasoning, tool call, การตัดสินใจ 147 00:13:29,200 --> 00:13:35,595 กับ output ทุก session กับโมเดลอื่นจาก session 148 00:13:35,595 --> 00:13:39,766 อื่น หาว่าโมเดลไหนใกล้เคียงสุด 149 00:13:39,766 --> 00:13:42,268 ไม่ต้องตัวเดียวกัน 150 00:13:42,268 --> 00:13:46,300 แต่น่าจะมาจากห้องแล็บเดียวกัน 151 00:13:46,300 --> 00:13:52,138 จัดมาสามผู้ต้องสงสัยพร้อมเหตุผล ใช้เวลาได้ 152 00:13:52,138 --> 00:13:57,282 ละเอียดๆ เห็นไหม Soul รับคดีแล้ว Soul 153 00:13:57,282 --> 00:14:03,677 กำลังค้นหาตัวตน มาดูว่าได้อะไร ลองใช้เอง คุยดี 154 00:14:03,677 --> 00:14:08,960 ผมชอบวิธีคุย ไม่เวิ่นเว้อเท่า frontier 155 00:14:08,960 --> 00:14:13,686 รุ่นใหม่ เข้าประเด็นเลย สไตล์คุยดี 156 00:14:13,686 --> 00:14:19,525 ทำงานด้วยเพลิน ทำให้สงสัยว่าเป็นโมเดล Memo 157 00:14:19,525 --> 00:14:25,086 เพราะผมชอบคุยกับพวกนั้น รู้สึกสไตล์คุยดี 158 00:14:25,086 --> 00:14:31,342 แต่รอดูผล อย่าง performance จริง ไม่ใช่ Fable 159 00:14:31,342 --> 00:14:37,597 หรือ Soul อะไรแบบนั้น ไม่ใช่ frontier แถวหน้า 160 00:14:37,597 --> 00:14:43,158 น่าจะ tier สองเดียวกับ GLM-5.3, Kimi K3, 161 00:14:43,158 --> 00:14:48,580 DeepSeek รุ่นใหม่, Quinn 3.8 ประมาณนั้น 162 00:14:48,580 --> 00:14:52,194 บางงานดีกว่า บางงานแย่กว่า 163 00:14:52,194 --> 00:14:56,643 ออกแบบหน้าเว็บเก่งมาก ใน Twitter 164 00:14:56,643 --> 00:15:02,760 คนก็บอกว่าออกแบบหน้าเว็บเก่ง มีปัญหากับภาพ 3 165 00:15:02,760 --> 00:15:08,876 มิติ เห็น three.js หลายตัว Lord of the Rings 166 00:15:08,876 --> 00:15:14,576 ดูดีมาก แต่เกมรถไม่ดี เกม dev อาจอ่อนกว่า 167 00:15:14,576 --> 00:15:20,832 มินิเกมแรกไม่ดีเท่า GLM-5.3 งาน 3 มิติ handle 168 00:15:20,832 --> 00:15:27,227 MCP ได้ งานมือถืออันนี้ แต่ output ไม่ดี งาน 3 169 00:15:27,227 --> 00:15:33,622 มิติอาจไม่แข็ง แต่ออกแบบหน้าเว็บกับ skill เก่ง 170 00:15:33,622 --> 00:15:39,739 ขึ้นกับราคา ตอนนี้ฟรีเลยดี ถ้าถูกมากก็น่าใช้ 171 00:15:39,739 --> 00:15:45,855 ถ้าราคาเท่า Kim E 3 ไม่แน่ใจจะเลือกเหนือ Kim 172 00:15:45,855 --> 00:15:51,972 ไหม ปล่อยให้สืบต่อไป เดี๋ยวมาดู สืบเสร็จแล้ว 173 00:15:51,972 --> 00:15:57,811 รายงานละเอียดมาก ไม่เล่าทั้งหมด ดู session 174 00:15:57,811 --> 00:16:03,928 พวกนี้ เทียบสี่วิธีอิสระ รีวิวเชิงคุณภาพทั้ง 175 00:16:03,928 --> 00:16:09,906 reasoning, tool sequence, error, correction 176 00:16:09,906 --> 00:16:16,022 เทียบพฤติกรรม 22 ฟีเจอร์ใน 459 window จากแปด 177 00:16:16,022 --> 00:16:21,722 session มี task control ตรงกันเป๊ะ นี่คือ 178 00:16:21,722 --> 00:16:28,117 fingerprint พฤติกรรมของ Ox วางแผนเป็นชิ้นสั้นๆ 179 00:16:28,117 --> 00:16:34,095 รันได้ โหลด skill ที่เกี่ยว เขียน HTML ตรวจ 180 00:16:34,095 --> 00:16:40,490 headless แล้วซ่อมจริง นี่คือ reasoning แบบนั้น 181 00:16:40,490 --> 00:16:44,243 workflow หลักคือเขียนกว้างๆ 182 00:16:44,243 --> 00:16:49,943 รอบแรก รัน ดู screenshot ตั้งสมมติฐานแคบๆ 183 00:16:49,943 --> 00:17:02,733 patch รันใหม่ จุดแข็งจุดอ่อนตรงนี้ profile คล้ายโมเดลโค้ดจีนที่ฝึก agent มาหนัก มากกว่า GPT, 184 00:17:02,733 --> 00:17:07,181 Claude หรือ Rock มีผลราย session 185 00:17:07,181 --> 00:17:13,576 ทุกงานที่ให้ทำ เทียบเชิงคุณภาพ นี่คือ centroid 186 00:17:13,576 --> 00:17:19,971 พฤติกรรมรวม ใกล้สุดคือ GLM-5.3 ทิ้งห่างพอสมควร 187 00:17:19,971 --> 00:17:26,366 อันดับสอง Grok แล้ว Kimi ดูความคล้าย reasoning 188 00:17:26,366 --> 00:17:32,483 กับ artifact ตรงๆ GLM สองอันบนคล้ายกว่า Kimi 189 00:17:32,483 --> 00:17:36,514 K3 ดูส่วนต่าง workflow รวม Ox 190 00:17:36,514 --> 00:17:42,770 กระชับกว่ากลุ่มเทียบ แต่ patch หนักกว่ารอบแรก 191 00:17:42,770 --> 00:17:49,165 น่าสนใจ tool call ต่อ session น้อยกว่า control 192 00:17:49,165 --> 00:17:54,169 ที่ prompt เดียวกันเป๊ะ ผู้ต้องสงสัย 193 00:17:54,169 --> 00:17:59,730 อันดับหนึ่งคือโมเดล GLM ของ ZAI คำตัดสิน 194 00:17:59,730 --> 00:18:03,345 ผู้ต้องสงสัยแข็งสุดท่วมท้น 195 00:18:03,345 --> 00:18:09,322 ในวงคุยทั่วไปก็มองว่าเป็นตัวเต็ง สาย Hermes 196 00:18:09,322 --> 00:18:15,300 ของเราก็เจอแบบนี้ หลักฐาน local บอก GLM-5.3 197 00:18:15,300 --> 00:18:20,722 คือ centroid พฤติกรรมใกล้ Ox สุด Ox กับ 198 00:18:20,722 --> 00:18:26,561 GLM-5.3 ทำ workflow เกือบเดียวกันใน prompt 199 00:18:26,561 --> 00:18:31,843 เดียวกัน น่าสนใจ artifact Force Pirate 200 00:18:31,843 --> 00:18:37,821 มีความคล้ายโค้ด task ตรงๆ สูงมาก พวกนี้คนละ 201 00:18:37,821 --> 00:18:43,660 profile กันด้วย บอกไว้ก่อน ผมเทสต์โมเดลแยก 202 00:18:43,660 --> 00:18:49,638 profile แยก session แยก directory สะอาดเสมอ 203 00:18:49,638 --> 00:18:55,477 สัดส่วน blank tool turn, visible preamble, 204 00:18:55,477 --> 00:19:01,454 parallel call ใกล้กันผิดปกติ fit ความสามารถ 205 00:19:01,454 --> 00:19:06,876 AUX เหมือน GLM สองสายรวมกัน GLM-5.3 บวก 206 00:19:06,876 --> 00:19:13,271 GLM-5.7 Turbo รุ่น multimodal ก่อนหน้า น่าสนใจ 207 00:19:13,271 --> 00:19:19,666 อาจเป็น fusion แบบนี้ ตีความผม AUX น่าจะประมาณ 208 00:19:19,666 --> 00:19:25,783 GLM-5.3V ที่ยังไม่ปล่อย หรือ GLM-5.5 GLM-5.3 209 00:19:25,783 --> 00:19:30,926 flash checkpoint สาย multimodal agent 210 00:19:30,926 --> 00:19:36,765 ชื่อเป๊ะรู้ไม่ได้ แต่สาย GLM มีโอกาสสูงมาก 211 00:19:36,765 --> 00:19:40,658 มันสรุปแบบนี้เอง ผมไม่ได้บอก 212 00:19:40,658 --> 00:19:44,967 ทฤษฎีทั่วไปตอนนี้ก็ว่าโมเดล GLM 213 00:19:44,967 --> 00:19:51,223 แต่มันสรุปตรงกัน อันดับสอง Moonshot AI ตระกูล 214 00:19:51,223 --> 00:19:55,672 Kimi K3 ตัวเลือกนอก GLM ที่ดีสุด 215 00:19:55,672 --> 00:20:01,927 ที่ยังที่สองเพราะหลักฐาน tokenizer สาธารณะกับ 216 00:20:01,927 --> 00:20:07,627 video encoder ชี้ GLM โดยเฉพาะ คล้าย Kimi 217 00:20:07,627 --> 00:20:12,493 ทั้งพฤติกรรมทั้งความสามารถ แต่ไม่มี 218 00:20:12,493 --> 00:20:18,192 fingerprint เฉพาะ Kimi ตระกูล DeepSeek V4 219 00:20:18,192 --> 00:20:23,753 คู่แฝดพฤติกรรมแรงสุด แต่ตัวจริงไม่น่าใช่ 220 00:20:23,753 --> 00:20:29,592 คล้ายกัน ทั้งสองใช้ recursive hypothesize, 221 00:20:29,592 --> 00:20:34,736 test, inspect, revise เลยที่สาม เพราะ 222 00:20:34,736 --> 00:20:40,157 reasoning ของ DeepSeek เวิ่นเว้อกว่ามาก 223 00:20:40,157 --> 00:20:45,857 แถมไม่มีหลักฐาน tokenizer หรือ multimodal 224 00:20:45,857 --> 00:20:51,835 encoder ชี้ DeepSeek ที่คล้ายน่าจะฝึก agent 225 00:20:51,835 --> 00:20:57,952 จีนมาบรรจบกันบวก environment Hermes เดียวกัน 226 00:20:57,952 --> 00:21:04,069 ที่อันดับต่ำกว่า Mimo session memo local ใช้ 227 00:21:04,069 --> 00:21:10,463 let me หนักกว่ามาก coding agent คล้ายบ้าง Grok 228 00:21:10,463 --> 00:21:15,885 ไม่มี clue เทคนิคชี้ XAI GBT กับ Claude 229 00:21:15,885 --> 00:21:22,002 ไม่น่าแน่ๆ MiniMax artifact เดี่ยวคล้าย docs 230 00:21:22,002 --> 00:21:26,868 แต่ reasoning ที่เก็บของ MiniMax M3 231 00:21:26,868 --> 00:21:32,845 เวิ่นเว้อกว่าเป็นสิบเท่า คำตัดสินสุดท้ายจาก 232 00:21:32,845 --> 00:21:39,101 Hermes ว่า Ox Alpha คือ derivative multimodal 233 00:21:39,101 --> 00:21:43,272 ของ ZAI สาย GLM ที่ยังไม่ปล่อย 234 00:21:43,272 --> 00:21:49,528 ประเด็นสำคัญคือหลักฐาน Hermes local เลือก GLM 235 00:21:49,528 --> 00:21:55,783 ก่อนพิจารณาหลักฐาน fingerprint สาธารณะ รายงาน 236 00:21:55,783 --> 00:22:02,039 tokenizer กับ video encoder ทำให้สมมติฐาน GLM 237 00:22:02,039 --> 00:22:06,627 แข็งขึ้นมาก Kimi คือทางเลือกเดียว 238 00:22:06,627 --> 00:22:11,214 นั่นคือส่วนหนึ่งของรายงานฉบับเต็ม 239 00:22:11,214 --> 00:22:16,219 พอมันสืบเองเสร็จ มันไปสืบ Reddit ต่อ 240 00:22:16,219 --> 00:22:22,614 นั่นคือวิเคราะห์อิสระ nuance หลักคือ telemetry 241 00:22:22,614 --> 00:22:28,592 อย่างเดียวไม่เสถียร transcript behavior กับ 242 00:22:28,592 --> 00:22:33,874 technical fingerprint นิ่งกว่า เลย GLM 243 00:22:33,874 --> 00:22:38,323 เป็นผู้ต้องสงสัยชัดสุด เรียบร้อย 244 00:22:38,323 --> 00:22:44,162 รายงานยาวมากถ้าอยากอ่าน นั่นคือจบการสืบสวน 245 00:22:44,162 --> 00:22:50,557 สรุปว่ามีโอกาสสูงเป็นโมเดล GLM เท่ดี คล้าย GLM 246 00:22:50,557 --> 00:22:56,813 หลายจุด ได้โมเดล GLM multimodal คงดี โดยเฉพาะ 247 00:22:56,813 --> 00:23:02,373 GLM มัก open weights ถ้าได้ open weights 248 00:23:02,373 --> 00:23:08,351 เยี่ยมเลย จบคลิป การสืบสวนเล็กๆ กับการเทสต์ 249 00:23:08,351 --> 00:23:11,826 prompt พวกนี้ของ Ox Alpha 250 00:23:11,826 --> 00:23:17,943 อยากรู้ว่าจะเปิดเผยเมื่อไร รอติดตาม จะใช้ต่อ 251 00:23:17,943 --> 00:23:23,643 ดูดีอยู่ อยากลองงานหน้าเว็บเพิ่ม ออกแบบดี 252 00:23:23,643 --> 00:23:29,621 รอติดตาม คอมเมนต์บอกหน่อยว่าทฤษฎีคุณคืออะไร 253 00:23:29,621 --> 00:23:35,738 คิดว่าคืออะไร มีหลักฐานไหม อยากฟัง จบคลิปนี้ 254 00:23:35,738 --> 00:23:38,240 ขอบคุณที่รับชมครับ