First Look at Grok 4.5: Grok's First True Frontier Model?
สรุปย่อ
ประเด็นสำคัญจากวิดีโอ
- **ช่อง:** Tonbi's AI Garage · **ความยาว:** ~16 นาที · **ลิงก์:** https://www.youtube.com/watch?v=2f9_RAFbz1s
# สรุป: First Look at Grok 4.5: Grok's First True Frontier Model? - **ช่อง:** Tonbi's AI Garage · **ความยาว:** ~16 นาที · **ลิงก์:** https://www.youtube.com/watch?v=2f9_RAFbz1s ## ประเด็นหลัก - xAI ประกาศ Grok 4.5 ซึ่งถูกฝึกด้วยข้อมูลจาก Cursor เป็นครั้งแรก ทำให้มีความสามารถด้าน coding ที่เหนือกว่า Grok รุ่นก่อนๆ อย่างชัดเจน - Grok 4.5 ถูกวางตำแหน่งเป็น generalist agent ไม่ใช่แค่ coding model — รองรับหลายโดเมน: data science, การเงิน, งานกฎหมาย, knowledge work - สถาปัตยกรรมเป็น Mixture of Experts (MoE) พร้อม RL training ใน environment ที่ยากจน frontier model ปัจจุบันยังทำไม่ได้ - บน Terminal Bench ทำคะแนนสูงกว่า Opus 4.8 และใกล้เคียง GPT 5.5 แต่ยังตามหลัง Fable 5 - ราคาถูกกว่าคู่แข่งทุกตัว: $2/M input, $6/M output — ถูกกว่า Sonnet 5 ที่ $2/M in และ $10/M out - งานทดสอบ front-end (เกม One Piece meets Star Wars) ทำ one-shot สำเร็จใน 2 นาที — รองจาก Fable เท่านั้นที่ทำได้ ชนะ Opus 4.8 และ GPT 5.5 ที่ทำ headline stagger ไม่สำเร็จ - งานวิจัย RAG systems ทำได้ดี จัดระเบียบกระชับ อ่านง่ายกว่า GPT 5.5 ที่มักยืดยาวเกินไป - งาน coding ที่สอง (anime multiverse dashboard) ทำเสร็จใน 3 นาที 38 วินาที — เร็วกว่า GPT ที่ใช้ 5-6 นาที คุณภาพในระดับเดียวกัน - มี context window 500,000 token ซึ่งใหญ่กว่า GPT 5.5 (270,000 token) ทำให้ไม่ต้องเข้า compaction บ่อย - Grok 4.5 แสดงความเป็น self-aware โดยสำรวจ directory ก่อนเริ่มทำงาน — พฤติกรรมที่คล้าย Claude ## ความเห็นสรุป Grok 4.5 เป็น generalist agent ที่ทั้งเร็วและคุณภาพดีในระดับ frontier แม้ไม่ได้ครอง benchmark เลยสักตัว แต่เป็น all-rounder ที่แข็งแกร่งในราคาที่ถูกกว่าคู่แข่งอย่างชัดเจน ความประทับใจแรกคือน่าประทับใจมาก โดยเฉพาะความเร็วและความสามารถในการ one-shot งาน front-end ที่ยาก น่าจะเป็นตัวเลือกที่น่าสนใจสำหรับการใช้ใน Hermes Agent ในระยะยาว
คำแปลเต็ม
แปลตามบทสนทนาต้นฉบับ ปรับเป็นภาษาไทยธรรมชาติ
วันนี้ xAI ประกาศตัว Grok 4.5 ซึ่งเป็นโมเดลล่าสุด และถูกฝึกฝนมาพร้อมกับ Cursor ซึ่งจะเห็นได้ว่าโมเดลนี้เน้นไปทางด้าน coding มากกว่า Grok รุ่นก่อนๆ พวกเขาบอกว่ามันถูกสร้างมาเพื่องานวิศวกรรมในโลกจริงจริงๆ ผมมักจะใช้โมเดล Grok ใน Hermes Agent อยู่แล้ว แต่ก็เคยลองใน Grok Build ด้วย พูดตรงๆ ว่าพวกมันไม่ได้เก่งเรื่อง coding เท่าไหร่ แต่นั่นคือรุ่นเก่าๆ นะครับ ส่วนรุ่นใหม่นี้ผมสนใจอยากดูว่าจะทำได้แค่ไหน
วิดีโอนี้จะเป็น first look ของผมกับ Grok 4.5 แล้วเราจะลองใช้มันใน Hermes Agent ผมจะเจาะ benchmark และคุณสมบัติที่น่าสนใจ แล้วก็จะให้งานมันทำสักสองชิ้นเพื่อดูว่าทำได้ดีแค่ไหน เริ่มกันเลยครับ
สำหรับใครที่รัน agent เองและอยากเข้าถึง LM wikis ที่ผมใช้ทำวิจัยและสร้างวิดีโอพวกนี้ ลองแวะไปดูโปรเจกต์ของผมที่ agentwiks.com ได้นะครับ ผมให้ wikis ทั้งหมดใช้ฟรีในหัวข้อต่างๆ มากมาย แต่ถ้าอยากสมัคร pro account ราคา $9.99 ต่อเดือน จะได้เข้าถึง wikis ขนาดใหญ่พิเศษที่มีหน้ามากกว่าและรายละเอียดลึกกว่าในแต่ละหัวข้อครับ
กลับมาที่วิดีโอกัน นี่คือเฟรมมิ่งนะครับ Grok 4.5 ถูกขายในฐานะโมเดล generalist (โมเดลรอบด้าน) ไม่ใช่แค่ coding model โดยเฉพาะ มันไปไกลกว่านั้น ทำงาน agent ในงานหนักที่รันยาวนานได้ สืบสวนปัญหา ใช้ tool จริงๆ เก็บตัวเองได้เมื่อทำพลาด แล้วยัง verify งานของตัวเองได้อีกด้วย
โดเมนที่พวกเขาเอ่ยถึงในบล็อกบอกอะไรหลายอย่าง ไม่ใช่แค่ software engineering แต่ยังพูดถึง data science, การเงิน, งานกฎหมาย และ knowledge work พูดอีกแบบคือ "ทุกอย่างที่คุณทำบนคอมพิวเตอร์" xAI อยากให้เรามองว่านี่คือ generalist agent ที่บังเอิญเก่งโค้ดมาก ไม่ใช่ coding model ที่เพิ่มฟีเจอร์เติมมาภายหลัง จะเป็นจริงตามนั้นหรือเปล่า เดี๋ยวเราดูกัน แต่นั่นคือสิ่งที่พวกเขาอ้างในบล็อกครับ
ดูใต้ประทุนนิดหน่อย มันเป็นโมเดลแบบ Mixture of Experts (การผสมผู้เชี่ยวชาญหลายตัว) ซึ่ง route ความสามารถต่อโทเคน ทำให้เก็บความรู้ได้เยอะโดยไม่ต้องจ่ายค่าใช้จ่ายแบบ dense model เต็มรูปแบบในทุกๆ รอบ ส่วนเรื่องการฝึกก็น่าสนใจ ใช้ข้อมูล trillions of tokens จาก developer จริงๆ และถูกฝึกบนข้อมูล Cursor ที่เก็บการโต้ตอบของ developer agent แบบเรียลไทม์ แล้วก็นำเข้างาน STEM, งานวิจัย และ knowledge work มาอย่างตั้งใจ นี่คือโมเดลแรกที่มีข้อมูล Cursor ทั้งหมดอยู่ในการฝึก เดี๋ยวน่าจะเห็นความต่างได้ชัดเจน
จากนั้นมี Reinforcement Learning (RL - การเรียนรู้แบบเสริมแรง) ใน environment จริงที่ตั้งใจทำให้ยาก ยากจนโมเดล frontier ปัจจุบันยังทำไม่ได้ และ environment เหล่านี้ถูกสร้างขึ้นในสเกลใหญ่โดยระบบ agent แบบกระจายตัว ดังนั้น pipeline การฝึกตัวมันเองก็เป็นแบบ agentic คือ agent สร้าง gym ขึ้นมาเพื่อฝึก agent นั่นเองครับ
เอาล่ะ มาดู benchmark กัน ซึ่งเรามักจะอยากเห็นเสมอ และผลออกมาน่าประทับใจพอสมควร บน Terminal Bench มันทำคะแนนสูงกว่า Opus 4.8 ซึ่งผมถือว่าเป็นโมเดลที่แข็งแกร่งมาก และอยู่ในระดับใกล้เคียง GPT 5.5 ต่ำกว่า Fable 5 อยู่บ้าง แต่ก็น่าประทับใจมาก ส่วน benchmark ด้าน software engineering อื่นๆ ก็อยู่ในระดับเดียวกับ Opus 4.8 หรือ GPT 5.5 ครับ
สรุปๆ แล้ว Grok 4.5 ชนะ Opus และ GPT 5.5 ในบาง benchmark เหนือกว่า Composer 2.5 ในทุกตัว ข้อควรจำคือมันทำบน high effort ไม่ใช่ max แน่นอนว่ายังตามหลัง Fable 5 ซึ่งก็พอจะคาดได้ มันไม่ใช่ผู้ชนะในเชิง benchmark เลยสักตัว แต่เป็น all-rounder ที่แข็งแกร่ง ไม่ใช่ coding king จุดขายจริงๆ ของมันคือความกว้าง ไม่ใช่การครอง benchmark
นี่คือโฟกัสของพวกเขาจริงๆ คือสร้างมาให้ "ลงมือทำ" ไม่ใช่แค่ "ตอบคำถาม" จุดแข็งที่ขายไม่ใช่คะแนนเดียว แต่คือความสามารถในการใช้ tool ในระยะยาวแบบอิสระข้ามโดเมน มี core loop สี่ขั้น: investigate, use tools, recover from mistakes, verify ในห้าโดเมนเป้าหมายขึ้นไป พร้อมสถาปัตยกรรม MoE เป็นพื้นฐาน โมเดลเก่าจะตอบ prompt แล้วจบ แต่ Grok 4.5 ถูกฝึกให้รัน task จนจบ — วางแผน, คว้า tool, ชนกำแพงก็ถอยออกมาลองใหม่ แล้วค่อยตรวจสอบงานตัวเองก่อนส่งให้คุณ ผมคิดว่ามันถูกออกแบบมาเพื่อใช้ใน agent โดยเฉพาะครับ
สุดท้าย ด้านค่าใช้จ่าย ราคาอยู่ที่ $2 ต่อล้าน input token และ $6 ต่อล้าน output token ถูกกว่า Opus 4.8 มาก ถูกกว่า Fable มาก ถูกกว่า GPT 5.5 ด้วย และใกล้เคียงกับ Sonnet 5 ซึ่ง Sonnet ราคา $2 in และ $10 out ดังนั้น Grok 4.5 ยังถูกกว่า Sonnet 5 อีก ในบล็อกเปิดตัวพวกเขาพูดถึงมันว่าเป็นมากกว่า coding model เป็น generalist agent ที่สู้ได้ในระดับ frontier ทั้งเรื่องโค้ดและอื่นๆ อีกมากมาย
แต่พูดมากพอแล้ว มาทดสอบจริงกันเถอะครับ
ทีนี้เรามีมันอยู่ใน Hermes Agent ที่นี่ — Grok 4.5 ซึ่งเป็น tool ที่ผมใช้ทดสอบโมเดลส่วนใหญ่ งานแรกคืองาน front-end ที่ผมให้โมเดลอื่นทำบ่อยๆ แล้ว prompt คือ: สร้างไฟล์ HTML เดียวไม่ต้องมี build step สำหรับเกม One Piece meets Star Wars มี full screen hero section พื้นหลังสีเข้ม มีทรงกลม 3D หมุนได้ใน Three.js พร้อม custom GLSL fragment shader ที่ทำให้มันดูเหมือนดาวเคราะห์เรืองแสง ทรงกลมค่อยๆ หมุนรอบแกน X ตอน scroll ลง GSAP จะ animate ทรงกลมให้เล็กลงและจางหายไปพร้อมกับข้อความ headline ที่ค่อยๆ โผล่ขึ้นมา แบบ Framer Motion stagger entrance ทำงานใน Chrome ได้ ใช้ CDN imports เท่านั้น ไม่ต้องมี npm
คุณอาจเบื่อ prompt นี้แล้ว แต่ผมว่ามันดีนะ ยังไม่มีโมเดลไหนทำได้ดีจริงๆ มี Fable เป็นโมเดลเดียวที่ทำได้ แม้แต่ Opus 4.8 หรือ GPT 5.5 ก็ยังทำไม่ได้ เพราะมันมีหลายองค์ประกอบที่ขัดแย้งกัน การทำให้สำเร็จในครั้งเดียวยากมาก ผมเลยว่ามันเป็น prompt ทดสอบ coding ที่ดี มาดูกันว่า Grok จะทำออกมาเป็นยังไง ผมอยากรู้เสมอว่า Grok จะจัดการเรื่อง front-end หรือ style ได้แค่ไหน เพราะ Grok มี personality มากกว่าโมเดล GPT หรือแม้แต่ Claude นิดหน่อย เลยอยากเห็นว่ามันจะรับมือยังไง
ผมส่ง prompt ไปแล้ว และผมคิดว่ามันน่าจะเร็วกว่า frontier model อื่นๆ จากประสบการณ์ กับ Grok 4.3 ใน Hermes Agent มันเร็วมาก ถ้ารวมความเร็วของ Grok เข้ากับความสามารถที่มากขึ้นได้ ก็จะยอดเยี่ยมมาก มาดูผลกัน
ผมต้องเริ่ม session ใหม่ เพราะมันไปอ่านไฟล์ใน directory จากการรันครั้งก่อนของโมเดลอื่นๆ ซึ่งน่าสนใจในตัวมันเอง เพราะผมไม่เคยเจอปัญหานี้มาก่อน แสดงว่ามัน self-aware (รับรู้สภาพแวดล้อม) มากกว่า ผมเลยต้องหยุดและย้ายไฟล์เหล่านั้นไปก่อน แล้วสร้าง session ใหม่ที่นี่ ค่อนข้างน่าสนใจนะครับ มัน self-aware มากขึ้น ซึ่งปกติจะเห็นในโมเดลแบบ Claude มันไม่ได้รีบเขียนออกมาทันที แต่จะสำรวจ directory ที่มันอยู่ก่อน
โอเค ค่อนข้างเร็ว 2 นาที นี่คือสิ่งที่มันออกแบบมา ดูดีพอสมควร อาจจะมองไม่ชัด แต่มันมี style มากกว่าที่เคยเห็นจากโมเดลอื่นมาก่อน ลอง scroll ลงดู โอ้โว มันออกมาเป๊ะเลย มันควรจะ fade out และเล็กลง แล้วมีข้อความโผล่ขึ้นมา — "Set sail for the stars" นี่เลย นี่เป็นหนึ่งในผลงานที่ดีที่สุดสำหรับงานนี้ที่ผมเคยเห็น โมเดลอื่นๆ มักทำ headline แบบ stagger นี้พังตลอด ดังนั้นนี่น่าประทับใจมาก นี่คือแบบที่ Fable ทำ ซึ่งแน่นอนว่าดีกว่าอยู่แล้ว
อันนี้ก็ทำได้เป๊ะเหมือนกัน แถมน่าประทับใจกว่าอีก แต่ของเจ้านี้เป็นของ Opus 4.8 ซึ่งต้องลองสามครั้งถึงจะทำ headline ได้สำเร็จ และจริงๆ ก็ยังไม่ดีเท่าไหร่ มันกระตุกอยู่ด้านล่างตรงจุดที่หน้าจอควรจะอยู่ ส่วนของ Grok นั้นง่ายกว่า Fable อยู่แล้ว แต่ execute prompt ได้ดีมาก ผมน่าประทับใจจริงๆ เพราะผมทดสอบโมเดลมาเยอะแล้วกับ prompt นี้ และอย่างที่บอก นอกจาก Fable แล้ว ผมว่านี่เป็นอันดับสองที่ดีที่สุด แถม one-shot สำเร็จใน 2 นาที นี่น่าประทับใจมากครับ
ทีนี้ผมจะให้มันทำงานวิจัย ซึ่งจะเป็นงาน research รวมถึง reasoning และ planning ด้วย งานที่ให้คือ: วิจัย paper ล่าสุดเกี่ยวกับ innovative RAG (Retrieval-Augmented Generation) systems และ agents ในช่วงหกเดือนที่ผ่านมา คัดเลือก 10 paper ที่น่าเชื่อถือและน่าสนใจที่สุด แล้วจัดอันดับจากที่ทำซ้ำบน RTX 3060 ได้ง่ายที่สุดไปหายากที่สุด จากนั้นวางแผนการ reproduce สำหรับอันดับสูงสุด ใน prompt เดียวนี้มีหลายอย่างเลยนะครับ ทั้ง research, reasoning และ planning ผมตั้งใจทำให้มันค่อนข้างกำกวมด้วย — innovative RAG systems ก็ไม่ได้ให้ prompt หรือหัวข้อที่เจาะจงมากนัก ผมอยากรู้ว่ามันจะตีความแบบกว้างๆ นี้ได้ดีแค่ไหน
อีกอย่างที่น่าจดจำใน Hermes Agent คือมันมี context window 500,000 token ซึ่งดีมาก ผมมักจะใช้ GPT 5.5 ซึ่งมีแค่ 270,000 token ก็ค่อนข้างน่ารำคาญ ต้องเข้า compaction บ่อยๆ ตอนทำงาน coding ระยะยาว
โอเค ใช้เวลาไปนิดกว่า 5 นาที ไม่ยากเกินไป นี่คือผลลัพธ์ เห็น tool JSON เทียบกับ compressed schemas น่าสนใจดี paper อันดับหนึ่งที่มันเลือกคือ "Dissecting Agentic RAG" ซึ่งพูดถึงว่า agentic knobs ช่วยอะไรได้บ้างภายใต้ local budget เสียงน่าสนใจดี มันจัดระเบียบทุกอย่างมาให้แล้วอย่างเฉพาะเจาะจง พร้อมระดับความยากและให้ดาวให้คะแนนด้วย paper ทุกเล่มก็อยู่ในหัวข้อทั่วไปเกี่ยวกับ RAG และระบบ retrieval ประเภทต่างๆ รวมถึง agentic search functions ด้วย
ส่วน methods ที่น่าสนใจก็ synthesize ข้อมูลทั้งหมดเกี่ยวกับ methods เฉพาะที่ผมควรดูไว้ให้ และแผน reproduction อันดับหนึ่งก็เป็นของ paper "Dissecting Agentic RAG" — reproduce findings, โดยพบว่า agentic loop สำคัญกว่า single pass dense, fixed hybrid RF สำคัญกว่า adaptive entity BM25 router ผมคงต้องอ่าน paper จริงๆ เพื่อเข้าใจ thesis แต่ในฐานะแผนมันดูดีมาก มี schedule ให้ด้วย ผมว่ามันทำงานวิจัยนี้ได้ดีทีเดียว ไม่มีอะไรดูแปลกๆ ทุกอย่างถูกจัดระเบียบมาอย่างดี กระชับและอ่านง่าย ซึ่งเป็นปัญหาของ GPT 5.5 บางทีคือมันยืดยาวไปไม่รู้จบ แต่ของ Grok ข้อมูลที่ต้องการอยู่ตรงนี้หมด อ่านง่ายกว่าเยอะ เรียกว่าทำได้สำเร็จครับ
สุดท้าย ตอนนี้เราอยู่ใน session มาสักพักแล้ว ผมอยากลองงาน coding อีกชิ้นเพื่อดูว่ามันจัดการได้ดีแค่ไหนเมื่อ context window ไม่ได้สดใหม่แล้ว ไม่ได้ลึกมาก แต่ก็พอที่จะทดสอบได้ งานสุดท้ายคือ: สร้างไฟล์ HTML แบบ self-contained สำหรับ anime multiverse tactical dashboard และถ้าใครดูวิดีโอ MOA (Mixture of Agents) ของผมมาก่อน ก็จะเคยเห็นงานนี้ นี่คือสิ่งที่ GPT 5.5 ทำออกมา เป็น node เล็กๆ มากมาย แล้วก็มีทรงกลมเรืองแสงใหญ่ ถ้า click เข้าไปก็จะมีข้อมูลต่างๆ แสดงขึ้นมา ส่วนนี่คือเวอร์ชัน MOA ที่ก้าวหน้ากว่าเล็กน้อย ใช้ GPT เป็น aggregator แต่มี Grok โมเดลอื่นอีกสามตัวเป็น reference models ผมเลยอยากเห็นการเปรียบเทียบโดยตรงระหว่าง Grok รุ่นก่อนกับรุ่นใหม่ว่าทำได้แค่ไหน ทดสอบนี้จะไม่ใช้ MOA แต่เราจะดูว่ามันทำอะไรคล้ายๆ กันหรือเจ๋งกว่านั้นได้ไหม
ผมประทับใจกับความเร็วมาก ผลลัพธ์ก็ดีตลอดมา โอเค เสร็จแล้ว อีกครั้งที่รวดเร็วมาก 3 นาที 38 วินาที จำได้ว่า GPT ใช้เวลากว่าห้านาที อาจจะถึงหกนาทีด้วยซ้ำ และนี่คือสิ่งที่ได้ออกมา ดูเจ๋งดีนะ มี ring วงแหวนแล้วก็มีลูปเรืองแสงลงมา click ที่ node ต่างๆ ได้ ดูสิ — ขยับได้บ้างเลยด้วย ถ้า click "focus active node" มันจะทำงาน อันนี้ก่อนหน้านี้เป็นอัตโนมัติ แต่จะเห็นว่าถ้า click ที่ชื่อต่างๆ เช่น Nami แล้วมันจะ drift แต่ละ node มีชื่อตามซีรีส์อนิเมะต่างๆ ดูดีมาก และมันทำตาม task ครบทุกข้อ
จำไว้นะว่านี่คือเวอร์ชัน GPT ส่วนของ Grok ผมว่าทรงกลมกับ ring ของมันดูดีกว่านะ ของ GPT ก็มี ring บางๆ แต่ไม่เท่าหรูหรา ring ของ Grok เจ๋งกว่า มี animation มากกว่า รู้สึกมีการเคลื่อนไหวเยอะกว่า เอาล่ะ ก็จบแล้วครับ
ความเร็วและคุณภาพอยู่ในระดับเดียวกับ GPT ผมว่าอาจจะมี texture บนทรงกลมน้อยกว่านิดหน่อย แต่โดยรวมผลลัพธ์ดีมาก ทำตามคำสั่งครบทุกข้อ มีหลายองค์ประกอบในงานนี้แต่ก็จัดการได้ไม่มีปัญหา แถมทำได้เร็วกว่าอย่างชัดเจน ซึ่งก็สำคัญเหมือนกัน
เอาล่ะ จบแล้วครับ first look ของผมกับ Grok 4.5 ความประทับใจแรกคือน่าประทับใจพอสมควร จากงาน coding สองชิ้นที่เราให้ทำ มันทำได้ดีมาก อยู่ในระดับเดียวกับหรืออาจจะดีกว่า frontier model บางตัวด้วยซ้ำ โดยเฉพาะเรื่องการ one-shot headline นั้น ผมว่าเป็นเรื่องเล็กแต่น่าประทับใจมาก เพราะ Opus 4.8 ทำไม่ได้และ GPT 5.5 ก็เช่นกัน นี่เป็นแค่ first look ครับ ทดสอบไม่กี่ task แต่ผมจะใช้ Grok 4.5 ต่อไปแน่ๆ ส่วนใหญ่ใน Hermes Agent แล้วเดี๋ยวจะมาอัปเดตผลตามการใช้งานจริงในระยะยาวนะครับ แต่ความประทับใจแรกคือน่าประทับใจจริงๆ
ก็จบแล้วสำหรับวิดีโอนี้ครับ ฝากคอมเมนต์แชร์ประสบการณ์ของคุณกับ Grok 4.5 ด้วยนะครับ ถ้าชอบวิดีโอฝาก subscribe ฝาก like ด้วยครับ แล้วเจอกันใหม่วิดีโอหน้า ขอบคุณที่รับชมครับ
หมายเหตุการแปล
ความโปร่งใสเกี่ยวกับความไม่แน่นอนในต้นฉบับ
- ## ช่วงที่ความหมายไม่ชัดเจน
- ไม่มีช่วงที่ต้องใส่ `[ฟังไม่ชัด]` — ทุกช่วงแปลได้ครบถ้วน
- การแปลเสร็จสมบูรณ์ ไม่มีปัญหาเรื่องความไม่ชัดเจน มีเพียงการ normalize ชื่อแบรนด์ที่ auto-captions สะกดผิด ซึ่งเป็นเรื่องปกติของ auto-generated captions
อภิธานศัพท์เทคนิค
คำศัพท์และชื่อผลิตภัณฑ์ที่คงรูปภาษาอังกฤษ
| ศัพท์ | คำแปล / คำอธิบาย |
|---|---|
| Grok 4.5 | โมเดล AI ล่าสุดจาก xAI |
| xAI | บริษัท AI ของ Elon Musk ผู้พัฒนา Grok |
| Cursor | IDE ที่ผสม AI สำหรับนักพัฒนา |
| Hermes Agent | AI agent framework ที่โฮสต์ใช้ทดสอบโมเดล |
| generalist model | โมเดลรอบด้านที่ทำงานหลายประเภทได้ ไม่เฉพาะทาง |
| agent work | งานที่ต้องใช้ agent วน loop: investigate, use tools, recover, verify |
| Mixture of Experts (MoE) | สถาปัตยกรรมที่ผสมผู้เชี่ยวชาญหลายตัว โดย route ต่อ token |
| dense model | โมเดลแบบหนาแน่นเต็มรูปแบบ (เทียบกับ MoE ที่ประหยัดกว่า) |
| Reinforcement Learning (RL) | การเรียนรู้แบบเสริมแรง |
| Terminal Bench | benchmark สำหรับวัดความสามารถของโมเดลในงานจริง |
| Opus 4.8 | โมเดล frontier จาก Anthropic ที่ใช้เปรียบเทียบ |
| GPT 5.5 | โมเดล frontier จาก OpenAI ที่ใช้เปรียบเทียบ |
| Fable 5 | โมเดล frontier ที่ทำงาน front-end ได้ดีที่สุด |
| Sonnet 5 | โมเดลจาก Anthropic ที่ใช้เปรียบเทียบราคา |
| Composer 2.5 | โมเดลที่ Grok 4.5 ชนะในทุก benchmark |
| frontier model | โมเดลระดับแนวหน้าของโลก |
| all-rounder | ผู้ที่เก่งรอบด้าน ไม่มีจุดอ่อนชัดเจน |
| long-horizon | งานที่ต้องดำเนินการในระยะยาว หลายขั้นตอน |
| high effort | ระดับความพยายามในการ inference (ต่ำกว่า max) |
| Three.js | ไลบรารี JavaScript สำหรับ 3D บนเว็บ |
| GLSL fragment shader | ภาษา shader สำหรับกำหนดสี/พิกเซลบน GPU |
| GSAP | ไลบรารี animation สำหรับ JavaScript |
| Framer Motion | ไลบรารี animation สำหรับ React |
| stagger entrance | เอฟเฟกต์ที่ข้อความ/องค์ประกอบโผล่ทีละส่วนตามลำดับ |
| one-shot | ทำสำเร็จในครั้งเดียวโดยไม่ต้องแก้ |
| RAG (Retrieval-Augmented Generation) | เทคนิคเสริม LLM ด้วยการค้นคืนข้อมูลจากแหล่งภายนอก |
| agentic RAG | RAG ที่ใช้ agent loop ในการตัดสินใจค้นคืน |
| context window | ขนาดข้อความที่โมเดลรับได้ในครั้งเดียว (Grok 4.5 = 500K tokens) |
| compaction | การบีบอัดบริบทเมื่อเกิน context window |
| MOA (Mixture of Agents) | การรวมหลายโมเดลเข้าด้วยกันเพื่อให้ผลลัพธ์ที่ดีขึ้น |
| aggregator | โมเดลที่รวบรวมผลจาก reference models |
| reference model | โมเดลที่ให้คำตอบอ้างอิงในระบบ MOA |
| self-aware | รับรู้สภาพแวดล้อมรอบตัว (ในที่นี้คือ directory/file structure) |
| agentwiks.com | โปรเจกต์ wiki ฟรีของโฮสต์สำหรับการวิจัย agent |
| LM wikis | คลังความรู้ wiki สำหรับ LM/agent research |
| RTX 3060 | การ์ดจอ NVIDIA ระดับกลางที่ใช้ในการทดสอบ reproduce |
| STEM | วิทยาศาสตร์ เทคโนโลยี วิศวกรรม คณิตศาสตร์ |
| knowledge work | งานทางปัญญา/ความรู้ (เช่น การวิเคราะห์ การเขียน) |
ซับไตเติ้ลภาษาไทย
ดาวน์โหลดหรือดูซับทั้งหมด
1 00:00:00,000 --> 00:00:04,464 วันนี้ xAI ประกาศตัว Grok 4.5 ซึ่งเป็นโมเดลล่าสุด 2 00:00:04,464 --> 00:00:10,477 และถูกฝึกฝนมาพร้อมกับ Cursor ซึ่งจะเห็นได้ว่าโมเดลนี้เน้นไปทางด้าน 3 00:00:10,477 --> 00:00:18,221 coding มากกว่า Grok รุ่นก่อนๆ พวกเขาบอกว่ามันถูกสร้างมาเพื่องานวิศวกรรมในโลกจริงจริงๆ 4 00:00:18,221 --> 00:00:23,596 ผมมักจะใช้โมเดล Grok ใน Hermes Agent อยู่แล้ว แต่ก็เคยลองใน
เปิดดูซับไตเติ้ลทั้งหมด (184 segments)
1 00:00:00,000 --> 00:00:04,464 วันนี้ xAI ประกาศตัว Grok 4.5 ซึ่งเป็นโมเดลล่าสุด 2 00:00:04,464 --> 00:00:10,477 และถูกฝึกฝนมาพร้อมกับ Cursor ซึ่งจะเห็นได้ว่าโมเดลนี้เน้นไปทางด้าน 3 00:00:10,477 --> 00:00:18,221 coding มากกว่า Grok รุ่นก่อนๆ พวกเขาบอกว่ามันถูกสร้างมาเพื่องานวิศวกรรมในโลกจริงจริงๆ 4 00:00:18,221 --> 00:00:23,596 ผมมักจะใช้โมเดล Grok ใน Hermes Agent อยู่แล้ว แต่ก็เคยลองใน 5 00:00:23,596 --> 00:00:28,060 Grok Build ด้วย พูดตรงๆ ว่าพวกมันไม่ได้เก่งเรื่อง 6 00:00:28,060 --> 00:00:35,895 coding เท่าไหร่ แต่นั่นคือรุ่นเก่าๆ นะครับ ส่วนรุ่นใหม่นี้ผมสนใจอยากดูว่าจะทำได้แค่ไหน 7 00:00:35,895 --> 00:00:41,816 วิดีโอนี้จะเป็น first look ของผมกับ Grok 4.5 แล้วเราจะลองใช้มันใน 8 00:00:41,816 --> 00:00:46,736 Hermes Agent ผมจะเจาะ benchmark และคุณสมบัติที่น่าสนใจ 9 00:00:46,736 --> 00:00:51,473 แล้วก็จะให้งานมันทำสักสองชิ้นเพื่อดูว่าทำได้ดีแค่ไหน 10 00:00:51,473 --> 00:00:56,484 เริ่มกันเลยครับ สำหรับใครที่รัน agent เองและอยากเข้าถึง 11 00:00:56,484 --> 00:01:02,952 LM wikis ที่ผมใช้ทำวิจัยและสร้างวิดีโอพวกนี้ ลองแวะไปดูโปรเจกต์ของผมที่ 12 00:01:02,952 --> 00:01:08,601 agentwiks.com ได้นะครับ ผมให้ wikis ทั้งหมดใช้ฟรีในหัวข้อต่างๆ 13 00:01:08,601 --> 00:01:13,520 มากมาย แต่ถ้าอยากสมัคร pro account ราคา $9.99 ต่อเดือน 14 00:01:13,520 --> 00:01:21,264 จะได้เข้าถึง wikis ขนาดใหญ่พิเศษที่มีหน้ามากกว่าและรายละเอียดลึกกว่าในแต่ละหัวข้อครับ 15 00:01:21,264 --> 00:01:25,637 กลับมาที่วิดีโอกัน นี่คือเฟรมมิ่งนะครับ Grok 4.5 16 00:01:25,637 --> 00:01:30,466 ถูกขายในฐานะโมเดล generalist (โมเดลรอบด้าน) ไม่ใช่แค่ 17 00:01:30,466 --> 00:01:35,021 coding model โดยเฉพาะ มันไปไกลกว่านั้น ทำงาน agent 18 00:01:35,021 --> 00:01:39,667 ในงานหนักที่รันยาวนานได้ สืบสวนปัญหา ใช้ tool จริงๆ 19 00:01:39,667 --> 00:01:45,315 เก็บตัวเองได้เมื่อทำพลาด แล้วยัง verify งานของตัวเองได้อีกด้วย 20 00:01:45,315 --> 00:01:50,235 โดเมนที่พวกเขาเอ่ยถึงในบล็อกบอกอะไรหลายอย่าง ไม่ใช่แค่ 21 00:01:50,235 --> 00:01:54,517 software engineering แต่ยังพูดถึง data science, 22 00:01:54,517 --> 00:01:59,072 การเงิน, งานกฎหมาย และ knowledge work พูดอีกแบบคือ 23 00:01:59,072 --> 00:02:04,356 "ทุกอย่างที่คุณทำบนคอมพิวเตอร์" xAI อยากให้เรามองว่านี่คือ 24 00:02:04,356 --> 00:02:09,093 generalist agent ที่บังเอิญเก่งโค้ดมาก ไม่ใช่ coding 25 00:02:09,093 --> 00:02:14,651 model ที่เพิ่มฟีเจอร์เติมมาภายหลัง จะเป็นจริงตามนั้นหรือเปล่า 26 00:02:14,651 --> 00:02:19,479 เดี๋ยวเราดูกัน แต่นั่นคือสิ่งที่พวกเขาอ้างในบล็อกครับ 27 00:02:19,479 --> 00:02:24,399 ดูใต้ประทุนนิดหน่อย มันเป็นโมเดลแบบ Mixture of Experts 28 00:02:24,399 --> 00:02:29,592 (การผสมผู้เชี่ยวชาญหลายตัว) ซึ่ง route ความสามารถต่อโทเคน 29 00:02:29,592 --> 00:02:34,147 ทำให้เก็บความรู้ได้เยอะโดยไม่ต้องจ่ายค่าใช้จ่ายแบบ 30 00:02:34,147 --> 00:02:39,431 dense model เต็มรูปแบบในทุกๆ รอบ ส่วนเรื่องการฝึกก็น่าสนใจ 31 00:02:39,431 --> 00:02:43,895 ใช้ข้อมูล trillions of tokens จาก developer จริงๆ 32 00:02:43,895 --> 00:02:48,814 และถูกฝึกบนข้อมูล Cursor ที่เก็บการโต้ตอบของ developer 33 00:02:48,814 --> 00:02:53,278 agent แบบเรียลไทม์ แล้วก็นำเข้างาน STEM, งานวิจัย 34 00:02:53,278 --> 00:02:58,562 และ knowledge work มาอย่างตั้งใจ นี่คือโมเดลแรกที่มีข้อมูล 35 00:02:58,562 --> 00:03:03,938 Cursor ทั้งหมดอยู่ในการฝึก เดี๋ยวน่าจะเห็นความต่างได้ชัดเจน 36 00:03:03,938 --> 00:03:09,586 จากนั้นมี Reinforcement Learning (RL - การเรียนรู้แบบเสริมแรง) 37 00:03:09,586 --> 00:03:13,868 ใน environment จริงที่ตั้งใจทำให้ยาก ยากจนโมเดล 38 00:03:13,868 --> 00:03:21,338 frontier ปัจจุบันยังทำไม่ได้ และ environment เหล่านี้ถูกสร้างขึ้นในสเกลใหญ่โดยระบบ 39 00:03:21,338 --> 00:03:26,804 agent แบบกระจายตัว ดังนั้น pipeline การฝึกตัวมันเองก็เป็นแบบ 40 00:03:26,804 --> 00:03:31,177 agentic คือ agent สร้าง gym ขึ้นมาเพื่อฝึก agent 41 00:03:31,177 --> 00:03:36,826 นั่นเองครับ เอาล่ะ มาดู benchmark กัน ซึ่งเรามักจะอยากเห็นเสมอ 42 00:03:36,826 --> 00:03:42,656 และผลออกมาน่าประทับใจพอสมควร บน Terminal Bench มันทำคะแนนสูงกว่า 43 00:03:42,656 --> 00:03:48,943 Opus 4.8 ซึ่งผมถือว่าเป็นโมเดลที่แข็งแกร่งมาก และอยู่ในระดับใกล้เคียง 44 00:03:48,943 --> 00:03:53,680 GPT 5.5 ต่ำกว่า Fable 5 อยู่บ้าง แต่ก็น่าประทับใจมาก 45 00:03:53,680 --> 00:03:59,875 ส่วน benchmark ด้าน software engineering อื่นๆ ก็อยู่ในระดับเดียวกับ 46 00:03:59,875 --> 00:04:04,430 Opus 4.8 หรือ GPT 5.5 ครับ สรุปๆ แล้ว Grok 4.5 ชนะ 47 00:04:04,430 --> 00:04:09,076 Opus และ GPT 5.5 ในบาง benchmark เหนือกว่า Composer 48 00:04:09,076 --> 00:04:13,632 2.5 ในทุกตัว ข้อควรจำคือมันทำบน high effort ไม่ใช่ 49 00:04:13,632 --> 00:04:18,005 max แน่นอนว่ายังตามหลัง Fable 5 ซึ่งก็พอจะคาดได้ 50 00:04:18,005 --> 00:04:22,469 มันไม่ใช่ผู้ชนะในเชิง benchmark เลยสักตัว แต่เป็น 51 00:04:22,469 --> 00:04:27,479 all-rounder ที่แข็งแกร่ง ไม่ใช่ coding king จุดขายจริงๆ 52 00:04:27,479 --> 00:04:33,674 ของมันคือความกว้าง ไม่ใช่การครอง benchmark นี่คือโฟกัสของพวกเขาจริงๆ 53 00:04:33,674 --> 00:04:40,416 คือสร้างมาให้ "ลงมือทำ" ไม่ใช่แค่ "ตอบคำถาม" จุดแข็งที่ขายไม่ใช่คะแนนเดียว 54 00:04:40,416 --> 00:04:45,518 แต่คือความสามารถในการใช้ tool ในระยะยาวแบบอิสระข้ามโดเมน 55 00:04:45,518 --> 00:04:50,346 มี core loop สี่ขั้น: investigate, use tools, recover 56 00:04:50,346 --> 00:04:56,086 from mistakes, verify ในห้าโดเมนเป้าหมายขึ้นไป พร้อมสถาปัตยกรรม 57 00:04:56,086 --> 00:05:00,459 MoE เป็นพื้นฐาน โมเดลเก่าจะตอบ prompt แล้วจบ แต่ 58 00:05:00,459 --> 00:05:05,196 Grok 4.5 ถูกฝึกให้รัน task จนจบ — วางแผน, คว้า tool, 59 00:05:05,196 --> 00:05:10,844 ชนกำแพงก็ถอยออกมาลองใหม่ แล้วค่อยตรวจสอบงานตัวเองก่อนส่งให้คุณ 60 00:05:10,844 --> 00:05:15,491 ผมคิดว่ามันถูกออกแบบมาเพื่อใช้ใน agent โดยเฉพาะครับ 61 00:05:15,491 --> 00:05:20,137 สุดท้าย ด้านค่าใช้จ่าย ราคาอยู่ที่ $2 ต่อล้าน input 62 00:05:20,137 --> 00:05:24,692 token และ $6 ต่อล้าน output token ถูกกว่า Opus 4.8 63 00:05:24,692 --> 00:05:29,976 มาก ถูกกว่า Fable มาก ถูกกว่า GPT 5.5 ด้วย และใกล้เคียงกับ 64 00:05:29,976 --> 00:05:34,622 Sonnet 5 ซึ่ง Sonnet ราคา $2 in และ $10 out ดังนั้น 65 00:05:34,622 --> 00:05:41,546 Grok 4.5 ยังถูกกว่า Sonnet 5 อีก ในบล็อกเปิดตัวพวกเขาพูดถึงมันว่าเป็นมากกว่า 66 00:05:41,546 --> 00:05:46,192 coding model เป็น generalist agent ที่สู้ได้ในระดับ 67 00:05:46,192 --> 00:05:51,385 frontier ทั้งเรื่องโค้ดและอื่นๆ อีกมากมาย แต่พูดมากพอแล้ว 68 00:05:51,385 --> 00:05:55,849 มาทดสอบจริงกันเถอะครับ ทีนี้เรามีมันอยู่ใน Hermes 69 00:05:55,849 --> 00:06:01,680 Agent ที่นี่ — Grok 4.5 ซึ่งเป็น tool ที่ผมใช้ทดสอบโมเดลส่วนใหญ่ 70 00:06:01,680 --> 00:06:05,962 งานแรกคืองาน front-end ที่ผมให้โมเดลอื่นทำบ่อยๆ 71 00:06:05,962 --> 00:06:10,699 แล้ว prompt คือ: สร้างไฟล์ HTML เดียวไม่ต้องมี build 72 00:06:10,699 --> 00:06:15,072 step สำหรับเกม One Piece meets Star Wars มี full 73 00:06:15,072 --> 00:06:20,174 screen hero section พื้นหลังสีเข้ม มีทรงกลม 3D หมุนได้ใน 74 00:06:20,174 --> 00:06:27,462 Three.js พร้อม custom GLSL fragment shader ที่ทำให้มันดูเหมือนดาวเคราะห์เรืองแสง 75 00:06:27,462 --> 00:06:32,382 ทรงกลมค่อยๆ หมุนรอบแกน X ตอน scroll ลง GSAP จะ animate 76 00:06:32,382 --> 00:06:36,937 ทรงกลมให้เล็กลงและจางหายไปพร้อมกับข้อความ headline 77 00:06:36,937 --> 00:06:41,857 ที่ค่อยๆ โผล่ขึ้นมา แบบ Framer Motion stagger entrance 78 00:06:41,857 --> 00:06:46,685 ทำงานใน Chrome ได้ ใช้ CDN imports เท่านั้น ไม่ต้องมี 79 00:06:46,685 --> 00:06:53,518 npm คุณอาจเบื่อ prompt นี้แล้ว แต่ผมว่ามันดีนะ ยังไม่มีโมเดลไหนทำได้ดีจริงๆ 80 00:06:53,518 --> 00:06:57,800 มี Fable เป็นโมเดลเดียวที่ทำได้ แม้แต่ Opus 4.8 81 00:06:57,800 --> 00:07:03,630 หรือ GPT 5.5 ก็ยังทำไม่ได้ เพราะมันมีหลายองค์ประกอบที่ขัดแย้งกัน 82 00:07:03,630 --> 00:07:08,003 การทำให้สำเร็จในครั้งเดียวยากมาก ผมเลยว่ามันเป็น 83 00:07:08,003 --> 00:07:13,469 prompt ทดสอบ coding ที่ดี มาดูกันว่า Grok จะทำออกมาเป็นยังไง 84 00:07:13,469 --> 00:07:18,116 ผมอยากรู้เสมอว่า Grok จะจัดการเรื่อง front-end หรือ 85 00:07:18,116 --> 00:07:23,035 style ได้แค่ไหน เพราะ Grok มี personality มากกว่าโมเดล 86 00:07:23,035 --> 00:07:28,593 GPT หรือแม้แต่ Claude นิดหน่อย เลยอยากเห็นว่ามันจะรับมือยังไง 87 00:07:28,593 --> 00:07:32,874 ผมส่ง prompt ไปแล้ว และผมคิดว่ามันน่าจะเร็วกว่า 88 00:07:32,874 --> 00:07:37,156 frontier model อื่นๆ จากประสบการณ์ กับ Grok 4.3 89 00:07:37,156 --> 00:07:41,620 ใน Hermes Agent มันเร็วมาก ถ้ารวมความเร็วของ Grok 90 00:07:41,620 --> 00:07:45,902 เข้ากับความสามารถที่มากขึ้นได้ ก็จะยอดเยี่ยมมาก 91 00:07:45,902 --> 00:07:50,913 มาดูผลกัน ผมต้องเริ่ม session ใหม่ เพราะมันไปอ่านไฟล์ใน 92 00:07:50,913 --> 00:07:56,743 directory จากการรันครั้งก่อนของโมเดลอื่นๆ ซึ่งน่าสนใจในตัวมันเอง 93 00:07:56,743 --> 00:08:01,481 เพราะผมไม่เคยเจอปัญหานี้มาก่อน แสดงว่ามัน self-aware 94 00:08:01,481 --> 00:08:07,585 (รับรู้สภาพแวดล้อม) มากกว่า ผมเลยต้องหยุดและย้ายไฟล์เหล่านั้นไปก่อน 95 00:08:07,585 --> 00:08:12,140 แล้วสร้าง session ใหม่ที่นี่ ค่อนข้างน่าสนใจนะครับ 96 00:08:12,140 --> 00:08:16,422 มัน self-aware มากขึ้น ซึ่งปกติจะเห็นในโมเดลแบบ 97 00:08:16,422 --> 00:08:21,432 Claude มันไม่ได้รีบเขียนออกมาทันที แต่จะสำรวจ directory 98 00:08:21,432 --> 00:08:27,263 ที่มันอยู่ก่อน โอเค ค่อนข้างเร็ว 2 นาที นี่คือสิ่งที่มันออกแบบมา 99 00:08:27,263 --> 00:08:34,278 ดูดีพอสมควร อาจจะมองไม่ชัด แต่มันมี style มากกว่าที่เคยเห็นจากโมเดลอื่นมาก่อน 100 00:08:34,278 --> 00:08:38,924 ลอง scroll ลงดู โอ้โว มันออกมาเป๊ะเลย มันควรจะ fade 101 00:08:38,924 --> 00:08:43,388 out และเล็กลง แล้วมีข้อความโผล่ขึ้นมา — "Set sail 102 00:08:43,388 --> 00:08:50,312 for the stars" นี่เลย นี่เป็นหนึ่งในผลงานที่ดีที่สุดสำหรับงานนี้ที่ผมเคยเห็น 103 00:08:50,312 --> 00:08:54,685 โมเดลอื่นๆ มักทำ headline แบบ stagger นี้พังตลอด 104 00:08:54,685 --> 00:09:01,427 ดังนั้นนี่น่าประทับใจมาก นี่คือแบบที่ Fable ทำ ซึ่งแน่นอนว่าดีกว่าอยู่แล้ว 105 00:09:01,427 --> 00:09:05,800 อันนี้ก็ทำได้เป๊ะเหมือนกัน แถมน่าประทับใจกว่าอีก 106 00:09:05,800 --> 00:09:10,902 แต่ของเจ้านี้เป็นของ Opus 4.8 ซึ่งต้องลองสามครั้งถึงจะทำ 107 00:09:10,902 --> 00:09:19,283 headline ได้สำเร็จ และจริงๆ ก็ยังไม่ดีเท่าไหร่ มันกระตุกอยู่ด้านล่างตรงจุดที่หน้าจอควรจะอยู่ 108 00:09:19,283 --> 00:09:24,020 ส่วนของ Grok นั้นง่ายกว่า Fable อยู่แล้ว แต่ execute 109 00:09:24,020 --> 00:09:29,942 prompt ได้ดีมาก ผมน่าประทับใจจริงๆ เพราะผมทดสอบโมเดลมาเยอะแล้วกับ 110 00:09:29,942 --> 00:09:36,866 prompt นี้ และอย่างที่บอก นอกจาก Fable แล้ว ผมว่านี่เป็นอันดับสองที่ดีที่สุด 111 00:09:36,866 --> 00:09:41,421 แถม one-shot สำเร็จใน 2 นาที นี่น่าประทับใจมากครับ 112 00:09:41,421 --> 00:09:45,794 ทีนี้ผมจะให้มันทำงานวิจัย ซึ่งจะเป็นงาน research 113 00:09:45,794 --> 00:09:50,167 รวมถึง reasoning และ planning ด้วย งานที่ให้คือ: 114 00:09:50,167 --> 00:09:55,907 วิจัย paper ล่าสุดเกี่ยวกับ innovative RAG (Retrieval-Augmented 115 00:09:55,907 --> 00:10:00,735 Generation) systems และ agents ในช่วงหกเดือนที่ผ่านมา 116 00:10:00,735 --> 00:10:05,108 คัดเลือก 10 paper ที่น่าเชื่อถือและน่าสนใจที่สุด 117 00:10:05,108 --> 00:10:10,756 แล้วจัดอันดับจากที่ทำซ้ำบน RTX 3060 ได้ง่ายที่สุดไปหายากที่สุด 118 00:10:10,756 --> 00:10:15,129 จากนั้นวางแผนการ reproduce สำหรับอันดับสูงสุด ใน 119 00:10:15,129 --> 00:10:19,685 prompt เดียวนี้มีหลายอย่างเลยนะครับ ทั้ง research, 120 00:10:19,685 --> 00:10:24,786 reasoning และ planning ผมตั้งใจทำให้มันค่อนข้างกำกวมด้วย 121 00:10:24,786 --> 00:10:31,072 — innovative RAG systems ก็ไม่ได้ให้ prompt หรือหัวข้อที่เจาะจงมากนัก 122 00:10:31,072 --> 00:10:35,354 ผมอยากรู้ว่ามันจะตีความแบบกว้างๆ นี้ได้ดีแค่ไหน 123 00:10:35,354 --> 00:10:39,909 อีกอย่างที่น่าจดจำใน Hermes Agent คือมันมี context 124 00:10:39,909 --> 00:10:44,374 window 500,000 token ซึ่งดีมาก ผมมักจะใช้ GPT 5.5 125 00:10:44,374 --> 00:10:49,020 ซึ่งมีแค่ 270,000 token ก็ค่อนข้างน่ารำคาญ ต้องเข้า 126 00:10:49,020 --> 00:10:54,668 compaction บ่อยๆ ตอนทำงาน coding ระยะยาว โอเค ใช้เวลาไปนิดกว่า 127 00:10:54,668 --> 00:10:59,041 5 นาที ไม่ยากเกินไป นี่คือผลลัพธ์ เห็น tool JSON 128 00:10:59,041 --> 00:11:05,327 เทียบกับ compressed schemas น่าสนใจดี paper อันดับหนึ่งที่มันเลือกคือ 129 00:11:05,327 --> 00:11:10,065 "Dissecting Agentic RAG" ซึ่งพูดถึงว่า agentic knobs 130 00:11:10,065 --> 00:11:14,529 ช่วยอะไรได้บ้างภายใต้ local budget เสียงน่าสนใจดี 131 00:11:14,529 --> 00:11:22,272 มันจัดระเบียบทุกอย่างมาให้แล้วอย่างเฉพาะเจาะจง พร้อมระดับความยากและให้ดาวให้คะแนนด้วย 132 00:11:22,272 --> 00:11:27,192 paper ทุกเล่มก็อยู่ในหัวข้อทั่วไปเกี่ยวกับ RAG และระบบ 133 00:11:27,192 --> 00:11:32,021 retrieval ประเภทต่างๆ รวมถึง agentic search functions 134 00:11:32,021 --> 00:11:37,851 ด้วย ส่วน methods ที่น่าสนใจก็ synthesize ข้อมูลทั้งหมดเกี่ยวกับ 135 00:11:37,851 --> 00:11:42,315 methods เฉพาะที่ผมควรดูไว้ให้ และแผน reproduction 136 00:11:42,315 --> 00:11:46,961 อันดับหนึ่งก็เป็นของ paper "Dissecting Agentic RAG" 137 00:11:46,961 --> 00:11:51,790 — reproduce findings, โดยพบว่า agentic loop สำคัญกว่า 138 00:11:51,790 --> 00:11:56,618 single pass dense, fixed hybrid RF สำคัญกว่า adaptive 139 00:11:56,618 --> 00:12:01,629 entity BM25 router ผมคงต้องอ่าน paper จริงๆ เพื่อเข้าใจ 140 00:12:01,629 --> 00:12:06,093 thesis แต่ในฐานะแผนมันดูดีมาก มี schedule ให้ด้วย 141 00:12:06,093 --> 00:12:10,648 ผมว่ามันทำงานวิจัยนี้ได้ดีทีเดียว ไม่มีอะไรดูแปลกๆ 142 00:12:10,648 --> 00:12:15,021 ทุกอย่างถูกจัดระเบียบมาอย่างดี กระชับและอ่านง่าย 143 00:12:15,021 --> 00:12:19,759 ซึ่งเป็นปัญหาของ GPT 5.5 บางทีคือมันยืดยาวไปไม่รู้จบ 144 00:12:19,759 --> 00:12:25,043 แต่ของ Grok ข้อมูลที่ต้องการอยู่ตรงนี้หมด อ่านง่ายกว่าเยอะ 145 00:12:25,043 --> 00:12:29,325 เรียกว่าทำได้สำเร็จครับ สุดท้าย ตอนนี้เราอยู่ใน 146 00:12:29,325 --> 00:12:36,886 session มาสักพักแล้ว ผมอยากลองงาน coding อีกชิ้นเพื่อดูว่ามันจัดการได้ดีแค่ไหนเมื่อ 147 00:12:36,886 --> 00:12:42,808 context window ไม่ได้สดใหม่แล้ว ไม่ได้ลึกมาก แต่ก็พอที่จะทดสอบได้ 148 00:12:42,808 --> 00:12:47,181 งานสุดท้ายคือ: สร้างไฟล์ HTML แบบ self-contained 149 00:12:47,181 --> 00:12:52,647 สำหรับ anime multiverse tactical dashboard และถ้าใครดูวิดีโอ 150 00:12:52,647 --> 00:12:57,475 MOA (Mixture of Agents) ของผมมาก่อน ก็จะเคยเห็นงานนี้ 151 00:12:57,475 --> 00:13:02,213 นี่คือสิ่งที่ GPT 5.5 ทำออกมา เป็น node เล็กๆ มากมาย 152 00:13:02,213 --> 00:13:07,679 แล้วก็มีทรงกลมเรืองแสงใหญ่ ถ้า click เข้าไปก็จะมีข้อมูลต่างๆ 153 00:13:07,679 --> 00:13:12,872 แสดงขึ้นมา ส่วนนี่คือเวอร์ชัน MOA ที่ก้าวหน้ากว่าเล็กน้อย 154 00:13:12,872 --> 00:13:18,065 ใช้ GPT เป็น aggregator แต่มี Grok โมเดลอื่นอีกสามตัวเป็น 155 00:13:18,065 --> 00:13:23,258 reference models ผมเลยอยากเห็นการเปรียบเทียบโดยตรงระหว่าง 156 00:13:23,258 --> 00:13:28,268 Grok รุ่นก่อนกับรุ่นใหม่ว่าทำได้แค่ไหน ทดสอบนี้จะไม่ใช้ 157 00:13:28,268 --> 00:13:33,552 MOA แต่เราจะดูว่ามันทำอะไรคล้ายๆ กันหรือเจ๋งกว่านั้นได้ไหม 158 00:13:33,552 --> 00:13:37,834 ผมประทับใจกับความเร็วมาก ผลลัพธ์ก็ดีตลอดมา โอเค 159 00:13:37,834 --> 00:13:42,207 เสร็จแล้ว อีกครั้งที่รวดเร็วมาก 3 นาที 38 วินาที 160 00:13:42,207 --> 00:13:47,036 จำได้ว่า GPT ใช้เวลากว่าห้านาที อาจจะถึงหกนาทีด้วยซ้ำ 161 00:13:47,036 --> 00:13:53,686 และนี่คือสิ่งที่ได้ออกมา ดูเจ๋งดีนะ มี ring วงแหวนแล้วก็มีลูปเรืองแสงลงมา 162 00:13:53,686 --> 00:13:58,241 click ที่ node ต่างๆ ได้ ดูสิ — ขยับได้บ้างเลยด้วย 163 00:13:58,241 --> 00:14:04,710 ถ้า click "focus active node" มันจะทำงาน อันนี้ก่อนหน้านี้เป็นอัตโนมัติ 164 00:14:04,710 --> 00:14:09,629 แต่จะเห็นว่าถ้า click ที่ชื่อต่างๆ เช่น Nami แล้วมันจะ 165 00:14:09,629 --> 00:14:14,275 drift แต่ละ node มีชื่อตามซีรีส์อนิเมะต่างๆ ดูดีมาก 166 00:14:14,275 --> 00:14:18,922 และมันทำตาม task ครบทุกข้อ จำไว้นะว่านี่คือเวอร์ชัน 167 00:14:18,922 --> 00:14:23,750 GPT ส่วนของ Grok ผมว่าทรงกลมกับ ring ของมันดูดีกว่านะ 168 00:14:23,750 --> 00:14:28,123 ของ GPT ก็มี ring บางๆ แต่ไม่เท่าหรูหรา ring ของ 169 00:14:28,123 --> 00:14:33,954 Grok เจ๋งกว่า มี animation มากกว่า รู้สึกมีการเคลื่อนไหวเยอะกว่า 170 00:14:33,954 --> 00:14:39,056 เอาล่ะ ก็จบแล้วครับ ความเร็วและคุณภาพอยู่ในระดับเดียวกับ 171 00:14:39,056 --> 00:14:43,520 GPT ผมว่าอาจจะมี texture บนทรงกลมน้อยกว่านิดหน่อย 172 00:14:43,520 --> 00:14:51,810 แต่โดยรวมผลลัพธ์ดีมาก ทำตามคำสั่งครบทุกข้อ มีหลายองค์ประกอบในงานนี้แต่ก็จัดการได้ไม่มีปัญหา 173 00:14:51,810 --> 00:14:56,183 แถมทำได้เร็วกว่าอย่างชัดเจน ซึ่งก็สำคัญเหมือนกัน 174 00:14:56,183 --> 00:15:03,745 เอาล่ะ จบแล้วครับ first look ของผมกับ Grok 4.5 ความประทับใจแรกคือน่าประทับใจพอสมควร 175 00:15:03,745 --> 00:15:11,124 จากงาน coding สองชิ้นที่เราให้ทำ มันทำได้ดีมาก อยู่ในระดับเดียวกับหรืออาจจะดีกว่า 176 00:15:11,124 --> 00:15:16,135 frontier model บางตัวด้วยซ้ำ โดยเฉพาะเรื่องการ one-shot 177 00:15:16,135 --> 00:15:20,690 headline นั้น ผมว่าเป็นเรื่องเล็กแต่น่าประทับใจมาก 178 00:15:20,690 --> 00:15:25,700 เพราะ Opus 4.8 ทำไม่ได้และ GPT 5.5 ก็เช่นกัน นี่เป็นแค่ 179 00:15:25,700 --> 00:15:30,073 first look ครับ ทดสอบไม่กี่ task แต่ผมจะใช้ Grok 180 00:15:30,073 --> 00:15:38,364 4.5 ต่อไปแน่ๆ ส่วนใหญ่ใน Hermes Agent แล้วเดี๋ยวจะมาอัปเดตผลตามการใช้งานจริงในระยะยาวนะครับ 181 00:15:38,364 --> 00:15:44,286 แต่ความประทับใจแรกคือน่าประทับใจจริงๆ ก็จบแล้วสำหรับวิดีโอนี้ครับ 182 00:15:44,286 --> 00:15:49,205 ฝากคอมเมนต์แชร์ประสบการณ์ของคุณกับ Grok 4.5 ด้วยนะครับ 183 00:15:49,205 --> 00:15:55,400 ถ้าชอบวิดีโอฝาก subscribe ฝาก like ด้วยครับ แล้วเจอกันใหม่วิดีโอหน้า 184 00:15:55,400 --> 00:15:57,040 ขอบคุณที่รับชมครับ