▶SUBTHAIแปลไทย · ซับ · พากย์⚙
บทความแปลภาษาไทย · YouTube

First Look at Grok 4.5: Grok's First True Frontier Model?

0:000:00
เล่นเสียงต้นฉบับของวิดีโอ พร้อมแสดงซับไทยซิงก์ตามเวลา
กำลังโหลดวิดีโอ…
01

สรุปย่อ

ประเด็นสำคัญจากวิดีโอ

- **ช่อง:** Tonbi's AI Garage · **ความยาว:** ~16 นาที · **ลิงก์:** https://www.youtube.com/watch?v=2f9_RAFbz1s

# สรุป: First Look at Grok 4.5: Grok's First True Frontier Model?

- **ช่อง:** Tonbi's AI Garage · **ความยาว:** ~16 นาที · **ลิงก์:** https://www.youtube.com/watch?v=2f9_RAFbz1s

## ประเด็นหลัก

- xAI ประกาศ Grok 4.5 ซึ่งถูกฝึกด้วยข้อมูลจาก Cursor เป็นครั้งแรก ทำให้มีความสามารถด้าน coding ที่เหนือกว่า Grok รุ่นก่อนๆ อย่างชัดเจน
- Grok 4.5 ถูกวางตำแหน่งเป็น generalist agent ไม่ใช่แค่ coding model — รองรับหลายโดเมน: data science, การเงิน, งานกฎหมาย, knowledge work
- สถาปัตยกรรมเป็น Mixture of Experts (MoE) พร้อม RL training ใน environment ที่ยากจน frontier model ปัจจุบันยังทำไม่ได้
- บน Terminal Bench ทำคะแนนสูงกว่า Opus 4.8 และใกล้เคียง GPT 5.5 แต่ยังตามหลัง Fable 5
- ราคาถูกกว่าคู่แข่งทุกตัว: $2/M input, $6/M output — ถูกกว่า Sonnet 5 ที่ $2/M in และ $10/M out
- งานทดสอบ front-end (เกม One Piece meets Star Wars) ทำ one-shot สำเร็จใน 2 นาที — รองจาก Fable เท่านั้นที่ทำได้ ชนะ Opus 4.8 และ GPT 5.5 ที่ทำ headline stagger ไม่สำเร็จ
- งานวิจัย RAG systems ทำได้ดี จัดระเบียบกระชับ อ่านง่ายกว่า GPT 5.5 ที่มักยืดยาวเกินไป
- งาน coding ที่สอง (anime multiverse dashboard) ทำเสร็จใน 3 นาที 38 วินาที — เร็วกว่า GPT ที่ใช้ 5-6 นาที คุณภาพในระดับเดียวกัน
- มี context window 500,000 token ซึ่งใหญ่กว่า GPT 5.5 (270,000 token) ทำให้ไม่ต้องเข้า compaction บ่อย
- Grok 4.5 แสดงความเป็น self-aware โดยสำรวจ directory ก่อนเริ่มทำงาน — พฤติกรรมที่คล้าย Claude

## ความเห็นสรุป

Grok 4.5 เป็น generalist agent ที่ทั้งเร็วและคุณภาพดีในระดับ frontier แม้ไม่ได้ครอง benchmark เลยสักตัว แต่เป็น all-rounder ที่แข็งแกร่งในราคาที่ถูกกว่าคู่แข่งอย่างชัดเจน ความประทับใจแรกคือน่าประทับใจมาก โดยเฉพาะความเร็วและความสามารถในการ one-shot งาน front-end ที่ยาก น่าจะเป็นตัวเลือกที่น่าสนใจสำหรับการใช้ใน Hermes Agent ในระยะยาว
02

คำแปลเต็ม

แปลตามบทสนทนาต้นฉบับ ปรับเป็นภาษาไทยธรรมชาติ

วันนี้ xAI ประกาศตัว Grok 4.5 ซึ่งเป็นโมเดลล่าสุด และถูกฝึกฝนมาพร้อมกับ Cursor ซึ่งจะเห็นได้ว่าโมเดลนี้เน้นไปทางด้าน coding มากกว่า Grok รุ่นก่อนๆ พวกเขาบอกว่ามันถูกสร้างมาเพื่องานวิศวกรรมในโลกจริงจริงๆ ผมมักจะใช้โมเดล Grok ใน Hermes Agent อยู่แล้ว แต่ก็เคยลองใน Grok Build ด้วย พูดตรงๆ ว่าพวกมันไม่ได้เก่งเรื่อง coding เท่าไหร่ แต่นั่นคือรุ่นเก่าๆ นะครับ ส่วนรุ่นใหม่นี้ผมสนใจอยากดูว่าจะทำได้แค่ไหน

วิดีโอนี้จะเป็น first look ของผมกับ Grok 4.5 แล้วเราจะลองใช้มันใน Hermes Agent ผมจะเจาะ benchmark และคุณสมบัติที่น่าสนใจ แล้วก็จะให้งานมันทำสักสองชิ้นเพื่อดูว่าทำได้ดีแค่ไหน เริ่มกันเลยครับ

สำหรับใครที่รัน agent เองและอยากเข้าถึง LM wikis ที่ผมใช้ทำวิจัยและสร้างวิดีโอพวกนี้ ลองแวะไปดูโปรเจกต์ของผมที่ agentwiks.com ได้นะครับ ผมให้ wikis ทั้งหมดใช้ฟรีในหัวข้อต่างๆ มากมาย แต่ถ้าอยากสมัคร pro account ราคา $9.99 ต่อเดือน จะได้เข้าถึง wikis ขนาดใหญ่พิเศษที่มีหน้ามากกว่าและรายละเอียดลึกกว่าในแต่ละหัวข้อครับ

กลับมาที่วิดีโอกัน นี่คือเฟรมมิ่งนะครับ Grok 4.5 ถูกขายในฐานะโมเดล generalist (โมเดลรอบด้าน) ไม่ใช่แค่ coding model โดยเฉพาะ มันไปไกลกว่านั้น ทำงาน agent ในงานหนักที่รันยาวนานได้ สืบสวนปัญหา ใช้ tool จริงๆ เก็บตัวเองได้เมื่อทำพลาด แล้วยัง verify งานของตัวเองได้อีกด้วย

โดเมนที่พวกเขาเอ่ยถึงในบล็อกบอกอะไรหลายอย่าง ไม่ใช่แค่ software engineering แต่ยังพูดถึง data science, การเงิน, งานกฎหมาย และ knowledge work พูดอีกแบบคือ "ทุกอย่างที่คุณทำบนคอมพิวเตอร์" xAI อยากให้เรามองว่านี่คือ generalist agent ที่บังเอิญเก่งโค้ดมาก ไม่ใช่ coding model ที่เพิ่มฟีเจอร์เติมมาภายหลัง จะเป็นจริงตามนั้นหรือเปล่า เดี๋ยวเราดูกัน แต่นั่นคือสิ่งที่พวกเขาอ้างในบล็อกครับ

ดูใต้ประทุนนิดหน่อย มันเป็นโมเดลแบบ Mixture of Experts (การผสมผู้เชี่ยวชาญหลายตัว) ซึ่ง route ความสามารถต่อโทเคน ทำให้เก็บความรู้ได้เยอะโดยไม่ต้องจ่ายค่าใช้จ่ายแบบ dense model เต็มรูปแบบในทุกๆ รอบ ส่วนเรื่องการฝึกก็น่าสนใจ ใช้ข้อมูล trillions of tokens จาก developer จริงๆ และถูกฝึกบนข้อมูล Cursor ที่เก็บการโต้ตอบของ developer agent แบบเรียลไทม์ แล้วก็นำเข้างาน STEM, งานวิจัย และ knowledge work มาอย่างตั้งใจ นี่คือโมเดลแรกที่มีข้อมูล Cursor ทั้งหมดอยู่ในการฝึก เดี๋ยวน่าจะเห็นความต่างได้ชัดเจน

จากนั้นมี Reinforcement Learning (RL - การเรียนรู้แบบเสริมแรง) ใน environment จริงที่ตั้งใจทำให้ยาก ยากจนโมเดล frontier ปัจจุบันยังทำไม่ได้ และ environment เหล่านี้ถูกสร้างขึ้นในสเกลใหญ่โดยระบบ agent แบบกระจายตัว ดังนั้น pipeline การฝึกตัวมันเองก็เป็นแบบ agentic คือ agent สร้าง gym ขึ้นมาเพื่อฝึก agent นั่นเองครับ

เอาล่ะ มาดู benchmark กัน ซึ่งเรามักจะอยากเห็นเสมอ และผลออกมาน่าประทับใจพอสมควร บน Terminal Bench มันทำคะแนนสูงกว่า Opus 4.8 ซึ่งผมถือว่าเป็นโมเดลที่แข็งแกร่งมาก และอยู่ในระดับใกล้เคียง GPT 5.5 ต่ำกว่า Fable 5 อยู่บ้าง แต่ก็น่าประทับใจมาก ส่วน benchmark ด้าน software engineering อื่นๆ ก็อยู่ในระดับเดียวกับ Opus 4.8 หรือ GPT 5.5 ครับ

สรุปๆ แล้ว Grok 4.5 ชนะ Opus และ GPT 5.5 ในบาง benchmark เหนือกว่า Composer 2.5 ในทุกตัว ข้อควรจำคือมันทำบน high effort ไม่ใช่ max แน่นอนว่ายังตามหลัง Fable 5 ซึ่งก็พอจะคาดได้ มันไม่ใช่ผู้ชนะในเชิง benchmark เลยสักตัว แต่เป็น all-rounder ที่แข็งแกร่ง ไม่ใช่ coding king จุดขายจริงๆ ของมันคือความกว้าง ไม่ใช่การครอง benchmark

นี่คือโฟกัสของพวกเขาจริงๆ คือสร้างมาให้ "ลงมือทำ" ไม่ใช่แค่ "ตอบคำถาม" จุดแข็งที่ขายไม่ใช่คะแนนเดียว แต่คือความสามารถในการใช้ tool ในระยะยาวแบบอิสระข้ามโดเมน มี core loop สี่ขั้น: investigate, use tools, recover from mistakes, verify ในห้าโดเมนเป้าหมายขึ้นไป พร้อมสถาปัตยกรรม MoE เป็นพื้นฐาน โมเดลเก่าจะตอบ prompt แล้วจบ แต่ Grok 4.5 ถูกฝึกให้รัน task จนจบ — วางแผน, คว้า tool, ชนกำแพงก็ถอยออกมาลองใหม่ แล้วค่อยตรวจสอบงานตัวเองก่อนส่งให้คุณ ผมคิดว่ามันถูกออกแบบมาเพื่อใช้ใน agent โดยเฉพาะครับ

สุดท้าย ด้านค่าใช้จ่าย ราคาอยู่ที่ $2 ต่อล้าน input token และ $6 ต่อล้าน output token ถูกกว่า Opus 4.8 มาก ถูกกว่า Fable มาก ถูกกว่า GPT 5.5 ด้วย และใกล้เคียงกับ Sonnet 5 ซึ่ง Sonnet ราคา $2 in และ $10 out ดังนั้น Grok 4.5 ยังถูกกว่า Sonnet 5 อีก ในบล็อกเปิดตัวพวกเขาพูดถึงมันว่าเป็นมากกว่า coding model เป็น generalist agent ที่สู้ได้ในระดับ frontier ทั้งเรื่องโค้ดและอื่นๆ อีกมากมาย

แต่พูดมากพอแล้ว มาทดสอบจริงกันเถอะครับ

ทีนี้เรามีมันอยู่ใน Hermes Agent ที่นี่ — Grok 4.5 ซึ่งเป็น tool ที่ผมใช้ทดสอบโมเดลส่วนใหญ่ งานแรกคืองาน front-end ที่ผมให้โมเดลอื่นทำบ่อยๆ แล้ว prompt คือ: สร้างไฟล์ HTML เดียวไม่ต้องมี build step สำหรับเกม One Piece meets Star Wars มี full screen hero section พื้นหลังสีเข้ม มีทรงกลม 3D หมุนได้ใน Three.js พร้อม custom GLSL fragment shader ที่ทำให้มันดูเหมือนดาวเคราะห์เรืองแสง ทรงกลมค่อยๆ หมุนรอบแกน X ตอน scroll ลง GSAP จะ animate ทรงกลมให้เล็กลงและจางหายไปพร้อมกับข้อความ headline ที่ค่อยๆ โผล่ขึ้นมา แบบ Framer Motion stagger entrance ทำงานใน Chrome ได้ ใช้ CDN imports เท่านั้น ไม่ต้องมี npm

คุณอาจเบื่อ prompt นี้แล้ว แต่ผมว่ามันดีนะ ยังไม่มีโมเดลไหนทำได้ดีจริงๆ มี Fable เป็นโมเดลเดียวที่ทำได้ แม้แต่ Opus 4.8 หรือ GPT 5.5 ก็ยังทำไม่ได้ เพราะมันมีหลายองค์ประกอบที่ขัดแย้งกัน การทำให้สำเร็จในครั้งเดียวยากมาก ผมเลยว่ามันเป็น prompt ทดสอบ coding ที่ดี มาดูกันว่า Grok จะทำออกมาเป็นยังไง ผมอยากรู้เสมอว่า Grok จะจัดการเรื่อง front-end หรือ style ได้แค่ไหน เพราะ Grok มี personality มากกว่าโมเดล GPT หรือแม้แต่ Claude นิดหน่อย เลยอยากเห็นว่ามันจะรับมือยังไง

ผมส่ง prompt ไปแล้ว และผมคิดว่ามันน่าจะเร็วกว่า frontier model อื่นๆ จากประสบการณ์ กับ Grok 4.3 ใน Hermes Agent มันเร็วมาก ถ้ารวมความเร็วของ Grok เข้ากับความสามารถที่มากขึ้นได้ ก็จะยอดเยี่ยมมาก มาดูผลกัน

ผมต้องเริ่ม session ใหม่ เพราะมันไปอ่านไฟล์ใน directory จากการรันครั้งก่อนของโมเดลอื่นๆ ซึ่งน่าสนใจในตัวมันเอง เพราะผมไม่เคยเจอปัญหานี้มาก่อน แสดงว่ามัน self-aware (รับรู้สภาพแวดล้อม) มากกว่า ผมเลยต้องหยุดและย้ายไฟล์เหล่านั้นไปก่อน แล้วสร้าง session ใหม่ที่นี่ ค่อนข้างน่าสนใจนะครับ มัน self-aware มากขึ้น ซึ่งปกติจะเห็นในโมเดลแบบ Claude มันไม่ได้รีบเขียนออกมาทันที แต่จะสำรวจ directory ที่มันอยู่ก่อน

โอเค ค่อนข้างเร็ว 2 นาที นี่คือสิ่งที่มันออกแบบมา ดูดีพอสมควร อาจจะมองไม่ชัด แต่มันมี style มากกว่าที่เคยเห็นจากโมเดลอื่นมาก่อน ลอง scroll ลงดู โอ้โว มันออกมาเป๊ะเลย มันควรจะ fade out และเล็กลง แล้วมีข้อความโผล่ขึ้นมา — "Set sail for the stars" นี่เลย นี่เป็นหนึ่งในผลงานที่ดีที่สุดสำหรับงานนี้ที่ผมเคยเห็น โมเดลอื่นๆ มักทำ headline แบบ stagger นี้พังตลอด ดังนั้นนี่น่าประทับใจมาก นี่คือแบบที่ Fable ทำ ซึ่งแน่นอนว่าดีกว่าอยู่แล้ว

อันนี้ก็ทำได้เป๊ะเหมือนกัน แถมน่าประทับใจกว่าอีก แต่ของเจ้านี้เป็นของ Opus 4.8 ซึ่งต้องลองสามครั้งถึงจะทำ headline ได้สำเร็จ และจริงๆ ก็ยังไม่ดีเท่าไหร่ มันกระตุกอยู่ด้านล่างตรงจุดที่หน้าจอควรจะอยู่ ส่วนของ Grok นั้นง่ายกว่า Fable อยู่แล้ว แต่ execute prompt ได้ดีมาก ผมน่าประทับใจจริงๆ เพราะผมทดสอบโมเดลมาเยอะแล้วกับ prompt นี้ และอย่างที่บอก นอกจาก Fable แล้ว ผมว่านี่เป็นอันดับสองที่ดีที่สุด แถม one-shot สำเร็จใน 2 นาที นี่น่าประทับใจมากครับ

ทีนี้ผมจะให้มันทำงานวิจัย ซึ่งจะเป็นงาน research รวมถึง reasoning และ planning ด้วย งานที่ให้คือ: วิจัย paper ล่าสุดเกี่ยวกับ innovative RAG (Retrieval-Augmented Generation) systems และ agents ในช่วงหกเดือนที่ผ่านมา คัดเลือก 10 paper ที่น่าเชื่อถือและน่าสนใจที่สุด แล้วจัดอันดับจากที่ทำซ้ำบน RTX 3060 ได้ง่ายที่สุดไปหายากที่สุด จากนั้นวางแผนการ reproduce สำหรับอันดับสูงสุด ใน prompt เดียวนี้มีหลายอย่างเลยนะครับ ทั้ง research, reasoning และ planning ผมตั้งใจทำให้มันค่อนข้างกำกวมด้วย — innovative RAG systems ก็ไม่ได้ให้ prompt หรือหัวข้อที่เจาะจงมากนัก ผมอยากรู้ว่ามันจะตีความแบบกว้างๆ นี้ได้ดีแค่ไหน

อีกอย่างที่น่าจดจำใน Hermes Agent คือมันมี context window 500,000 token ซึ่งดีมาก ผมมักจะใช้ GPT 5.5 ซึ่งมีแค่ 270,000 token ก็ค่อนข้างน่ารำคาญ ต้องเข้า compaction บ่อยๆ ตอนทำงาน coding ระยะยาว

โอเค ใช้เวลาไปนิดกว่า 5 นาที ไม่ยากเกินไป นี่คือผลลัพธ์ เห็น tool JSON เทียบกับ compressed schemas น่าสนใจดี paper อันดับหนึ่งที่มันเลือกคือ "Dissecting Agentic RAG" ซึ่งพูดถึงว่า agentic knobs ช่วยอะไรได้บ้างภายใต้ local budget เสียงน่าสนใจดี มันจัดระเบียบทุกอย่างมาให้แล้วอย่างเฉพาะเจาะจง พร้อมระดับความยากและให้ดาวให้คะแนนด้วย paper ทุกเล่มก็อยู่ในหัวข้อทั่วไปเกี่ยวกับ RAG และระบบ retrieval ประเภทต่างๆ รวมถึง agentic search functions ด้วย

ส่วน methods ที่น่าสนใจก็ synthesize ข้อมูลทั้งหมดเกี่ยวกับ methods เฉพาะที่ผมควรดูไว้ให้ และแผน reproduction อันดับหนึ่งก็เป็นของ paper "Dissecting Agentic RAG" — reproduce findings, โดยพบว่า agentic loop สำคัญกว่า single pass dense, fixed hybrid RF สำคัญกว่า adaptive entity BM25 router ผมคงต้องอ่าน paper จริงๆ เพื่อเข้าใจ thesis แต่ในฐานะแผนมันดูดีมาก มี schedule ให้ด้วย ผมว่ามันทำงานวิจัยนี้ได้ดีทีเดียว ไม่มีอะไรดูแปลกๆ ทุกอย่างถูกจัดระเบียบมาอย่างดี กระชับและอ่านง่าย ซึ่งเป็นปัญหาของ GPT 5.5 บางทีคือมันยืดยาวไปไม่รู้จบ แต่ของ Grok ข้อมูลที่ต้องการอยู่ตรงนี้หมด อ่านง่ายกว่าเยอะ เรียกว่าทำได้สำเร็จครับ

สุดท้าย ตอนนี้เราอยู่ใน session มาสักพักแล้ว ผมอยากลองงาน coding อีกชิ้นเพื่อดูว่ามันจัดการได้ดีแค่ไหนเมื่อ context window ไม่ได้สดใหม่แล้ว ไม่ได้ลึกมาก แต่ก็พอที่จะทดสอบได้ งานสุดท้ายคือ: สร้างไฟล์ HTML แบบ self-contained สำหรับ anime multiverse tactical dashboard และถ้าใครดูวิดีโอ MOA (Mixture of Agents) ของผมมาก่อน ก็จะเคยเห็นงานนี้ นี่คือสิ่งที่ GPT 5.5 ทำออกมา เป็น node เล็กๆ มากมาย แล้วก็มีทรงกลมเรืองแสงใหญ่ ถ้า click เข้าไปก็จะมีข้อมูลต่างๆ แสดงขึ้นมา ส่วนนี่คือเวอร์ชัน MOA ที่ก้าวหน้ากว่าเล็กน้อย ใช้ GPT เป็น aggregator แต่มี Grok โมเดลอื่นอีกสามตัวเป็น reference models ผมเลยอยากเห็นการเปรียบเทียบโดยตรงระหว่าง Grok รุ่นก่อนกับรุ่นใหม่ว่าทำได้แค่ไหน ทดสอบนี้จะไม่ใช้ MOA แต่เราจะดูว่ามันทำอะไรคล้ายๆ กันหรือเจ๋งกว่านั้นได้ไหม

ผมประทับใจกับความเร็วมาก ผลลัพธ์ก็ดีตลอดมา โอเค เสร็จแล้ว อีกครั้งที่รวดเร็วมาก 3 นาที 38 วินาที จำได้ว่า GPT ใช้เวลากว่าห้านาที อาจจะถึงหกนาทีด้วยซ้ำ และนี่คือสิ่งที่ได้ออกมา ดูเจ๋งดีนะ มี ring วงแหวนแล้วก็มีลูปเรืองแสงลงมา click ที่ node ต่างๆ ได้ ดูสิ — ขยับได้บ้างเลยด้วย ถ้า click "focus active node" มันจะทำงาน อันนี้ก่อนหน้านี้เป็นอัตโนมัติ แต่จะเห็นว่าถ้า click ที่ชื่อต่างๆ เช่น Nami แล้วมันจะ drift แต่ละ node มีชื่อตามซีรีส์อนิเมะต่างๆ ดูดีมาก และมันทำตาม task ครบทุกข้อ

จำไว้นะว่านี่คือเวอร์ชัน GPT ส่วนของ Grok ผมว่าทรงกลมกับ ring ของมันดูดีกว่านะ ของ GPT ก็มี ring บางๆ แต่ไม่เท่าหรูหรา ring ของ Grok เจ๋งกว่า มี animation มากกว่า รู้สึกมีการเคลื่อนไหวเยอะกว่า เอาล่ะ ก็จบแล้วครับ

ความเร็วและคุณภาพอยู่ในระดับเดียวกับ GPT ผมว่าอาจจะมี texture บนทรงกลมน้อยกว่านิดหน่อย แต่โดยรวมผลลัพธ์ดีมาก ทำตามคำสั่งครบทุกข้อ มีหลายองค์ประกอบในงานนี้แต่ก็จัดการได้ไม่มีปัญหา แถมทำได้เร็วกว่าอย่างชัดเจน ซึ่งก็สำคัญเหมือนกัน

เอาล่ะ จบแล้วครับ first look ของผมกับ Grok 4.5 ความประทับใจแรกคือน่าประทับใจพอสมควร จากงาน coding สองชิ้นที่เราให้ทำ มันทำได้ดีมาก อยู่ในระดับเดียวกับหรืออาจจะดีกว่า frontier model บางตัวด้วยซ้ำ โดยเฉพาะเรื่องการ one-shot headline นั้น ผมว่าเป็นเรื่องเล็กแต่น่าประทับใจมาก เพราะ Opus 4.8 ทำไม่ได้และ GPT 5.5 ก็เช่นกัน นี่เป็นแค่ first look ครับ ทดสอบไม่กี่ task แต่ผมจะใช้ Grok 4.5 ต่อไปแน่ๆ ส่วนใหญ่ใน Hermes Agent แล้วเดี๋ยวจะมาอัปเดตผลตามการใช้งานจริงในระยะยาวนะครับ แต่ความประทับใจแรกคือน่าประทับใจจริงๆ

ก็จบแล้วสำหรับวิดีโอนี้ครับ ฝากคอมเมนต์แชร์ประสบการณ์ของคุณกับ Grok 4.5 ด้วยนะครับ ถ้าชอบวิดีโอฝาก subscribe ฝาก like ด้วยครับ แล้วเจอกันใหม่วิดีโอหน้า ขอบคุณที่รับชมครับ

03

หมายเหตุการแปล

ความโปร่งใสเกี่ยวกับความไม่แน่นอนในต้นฉบับ

  • ## ช่วงที่ความหมายไม่ชัดเจน
  • ไม่มีช่วงที่ต้องใส่ `[ฟังไม่ชัด]` — ทุกช่วงแปลได้ครบถ้วน
  • การแปลเสร็จสมบูรณ์ ไม่มีปัญหาเรื่องความไม่ชัดเจน มีเพียงการ normalize ชื่อแบรนด์ที่ auto-captions สะกดผิด ซึ่งเป็นเรื่องปกติของ auto-generated captions
04

อภิธานศัพท์เทคนิค

คำศัพท์และชื่อผลิตภัณฑ์ที่คงรูปภาษาอังกฤษ

ศัพท์คำแปล / คำอธิบาย
Grok 4.5โมเดล AI ล่าสุดจาก xAI
xAIบริษัท AI ของ Elon Musk ผู้พัฒนา Grok
CursorIDE ที่ผสม AI สำหรับนักพัฒนา
Hermes AgentAI agent framework ที่โฮสต์ใช้ทดสอบโมเดล
generalist modelโมเดลรอบด้านที่ทำงานหลายประเภทได้ ไม่เฉพาะทาง
agent workงานที่ต้องใช้ agent วน loop: investigate, use tools, recover, verify
Mixture of Experts (MoE)สถาปัตยกรรมที่ผสมผู้เชี่ยวชาญหลายตัว โดย route ต่อ token
dense modelโมเดลแบบหนาแน่นเต็มรูปแบบ (เทียบกับ MoE ที่ประหยัดกว่า)
Reinforcement Learning (RL)การเรียนรู้แบบเสริมแรง
Terminal Benchbenchmark สำหรับวัดความสามารถของโมเดลในงานจริง
Opus 4.8โมเดล frontier จาก Anthropic ที่ใช้เปรียบเทียบ
GPT 5.5โมเดล frontier จาก OpenAI ที่ใช้เปรียบเทียบ
Fable 5โมเดล frontier ที่ทำงาน front-end ได้ดีที่สุด
Sonnet 5โมเดลจาก Anthropic ที่ใช้เปรียบเทียบราคา
Composer 2.5โมเดลที่ Grok 4.5 ชนะในทุก benchmark
frontier modelโมเดลระดับแนวหน้าของโลก
all-rounderผู้ที่เก่งรอบด้าน ไม่มีจุดอ่อนชัดเจน
long-horizonงานที่ต้องดำเนินการในระยะยาว หลายขั้นตอน
high effortระดับความพยายามในการ inference (ต่ำกว่า max)
Three.jsไลบรารี JavaScript สำหรับ 3D บนเว็บ
GLSL fragment shaderภาษา shader สำหรับกำหนดสี/พิกเซลบน GPU
GSAPไลบรารี animation สำหรับ JavaScript
Framer Motionไลบรารี animation สำหรับ React
stagger entranceเอฟเฟกต์ที่ข้อความ/องค์ประกอบโผล่ทีละส่วนตามลำดับ
one-shotทำสำเร็จในครั้งเดียวโดยไม่ต้องแก้
RAG (Retrieval-Augmented Generation)เทคนิคเสริม LLM ด้วยการค้นคืนข้อมูลจากแหล่งภายนอก
agentic RAGRAG ที่ใช้ agent loop ในการตัดสินใจค้นคืน
context windowขนาดข้อความที่โมเดลรับได้ในครั้งเดียว (Grok 4.5 = 500K tokens)
compactionการบีบอัดบริบทเมื่อเกิน context window
MOA (Mixture of Agents)การรวมหลายโมเดลเข้าด้วยกันเพื่อให้ผลลัพธ์ที่ดีขึ้น
aggregatorโมเดลที่รวบรวมผลจาก reference models
reference modelโมเดลที่ให้คำตอบอ้างอิงในระบบ MOA
self-awareรับรู้สภาพแวดล้อมรอบตัว (ในที่นี้คือ directory/file structure)
agentwiks.comโปรเจกต์ wiki ฟรีของโฮสต์สำหรับการวิจัย agent
LM wikisคลังความรู้ wiki สำหรับ LM/agent research
RTX 3060การ์ดจอ NVIDIA ระดับกลางที่ใช้ในการทดสอบ reproduce
STEMวิทยาศาสตร์ เทคโนโลยี วิศวกรรม คณิตศาสตร์
knowledge workงานทางปัญญา/ความรู้ (เช่น การวิเคราะห์ การเขียน)
05

ซับไตเติ้ลภาษาไทย

ดาวน์โหลดหรือดูซับทั้งหมด

1
00:00:00,000 --> 00:00:04,464
วันนี้ xAI ประกาศตัว Grok 4.5 ซึ่งเป็นโมเดลล่าสุด

2
00:00:04,464 --> 00:00:10,477
และถูกฝึกฝนมาพร้อมกับ Cursor ซึ่งจะเห็นได้ว่าโมเดลนี้เน้นไปทางด้าน

3
00:00:10,477 --> 00:00:18,221
coding มากกว่า Grok รุ่นก่อนๆ พวกเขาบอกว่ามันถูกสร้างมาเพื่องานวิศวกรรมในโลกจริงจริงๆ

4
00:00:18,221 --> 00:00:23,596
ผมมักจะใช้โมเดล Grok ใน Hermes Agent อยู่แล้ว แต่ก็เคยลองใน
thai-subtitles.srt
SubRip — ใช้กับเครื่องเล่นวิดีโอส่วนใหญ่
↓ ดาวน์โหลด
thai-subtitles.vtt
WebVTT — ใช้กับเว็บ / YouTube
↓ ดาวน์โหลด
เปิดดูซับไตเติ้ลทั้งหมด (184 segments)
1
00:00:00,000 --> 00:00:04,464
วันนี้ xAI ประกาศตัว Grok 4.5 ซึ่งเป็นโมเดลล่าสุด

2
00:00:04,464 --> 00:00:10,477
และถูกฝึกฝนมาพร้อมกับ Cursor ซึ่งจะเห็นได้ว่าโมเดลนี้เน้นไปทางด้าน

3
00:00:10,477 --> 00:00:18,221
coding มากกว่า Grok รุ่นก่อนๆ พวกเขาบอกว่ามันถูกสร้างมาเพื่องานวิศวกรรมในโลกจริงจริงๆ

4
00:00:18,221 --> 00:00:23,596
ผมมักจะใช้โมเดล Grok ใน Hermes Agent อยู่แล้ว แต่ก็เคยลองใน

5
00:00:23,596 --> 00:00:28,060
Grok Build ด้วย พูดตรงๆ ว่าพวกมันไม่ได้เก่งเรื่อง

6
00:00:28,060 --> 00:00:35,895
coding เท่าไหร่ แต่นั่นคือรุ่นเก่าๆ นะครับ ส่วนรุ่นใหม่นี้ผมสนใจอยากดูว่าจะทำได้แค่ไหน

7
00:00:35,895 --> 00:00:41,816
วิดีโอนี้จะเป็น first look ของผมกับ Grok 4.5 แล้วเราจะลองใช้มันใน

8
00:00:41,816 --> 00:00:46,736
Hermes Agent ผมจะเจาะ benchmark และคุณสมบัติที่น่าสนใจ

9
00:00:46,736 --> 00:00:51,473
แล้วก็จะให้งานมันทำสักสองชิ้นเพื่อดูว่าทำได้ดีแค่ไหน

10
00:00:51,473 --> 00:00:56,484
เริ่มกันเลยครับ สำหรับใครที่รัน agent เองและอยากเข้าถึง

11
00:00:56,484 --> 00:01:02,952
LM wikis ที่ผมใช้ทำวิจัยและสร้างวิดีโอพวกนี้ ลองแวะไปดูโปรเจกต์ของผมที่

12
00:01:02,952 --> 00:01:08,601
agentwiks.com ได้นะครับ ผมให้ wikis ทั้งหมดใช้ฟรีในหัวข้อต่างๆ

13
00:01:08,601 --> 00:01:13,520
มากมาย แต่ถ้าอยากสมัคร pro account ราคา $9.99 ต่อเดือน

14
00:01:13,520 --> 00:01:21,264
จะได้เข้าถึง wikis ขนาดใหญ่พิเศษที่มีหน้ามากกว่าและรายละเอียดลึกกว่าในแต่ละหัวข้อครับ

15
00:01:21,264 --> 00:01:25,637
กลับมาที่วิดีโอกัน นี่คือเฟรมมิ่งนะครับ Grok 4.5

16
00:01:25,637 --> 00:01:30,466
ถูกขายในฐานะโมเดล generalist (โมเดลรอบด้าน) ไม่ใช่แค่

17
00:01:30,466 --> 00:01:35,021
coding model โดยเฉพาะ มันไปไกลกว่านั้น ทำงาน agent

18
00:01:35,021 --> 00:01:39,667
ในงานหนักที่รันยาวนานได้ สืบสวนปัญหา ใช้ tool จริงๆ

19
00:01:39,667 --> 00:01:45,315
เก็บตัวเองได้เมื่อทำพลาด แล้วยัง verify งานของตัวเองได้อีกด้วย

20
00:01:45,315 --> 00:01:50,235
โดเมนที่พวกเขาเอ่ยถึงในบล็อกบอกอะไรหลายอย่าง ไม่ใช่แค่

21
00:01:50,235 --> 00:01:54,517
software engineering แต่ยังพูดถึง data science,

22
00:01:54,517 --> 00:01:59,072
การเงิน, งานกฎหมาย และ knowledge work พูดอีกแบบคือ

23
00:01:59,072 --> 00:02:04,356
"ทุกอย่างที่คุณทำบนคอมพิวเตอร์" xAI อยากให้เรามองว่านี่คือ

24
00:02:04,356 --> 00:02:09,093
generalist agent ที่บังเอิญเก่งโค้ดมาก ไม่ใช่ coding

25
00:02:09,093 --> 00:02:14,651
model ที่เพิ่มฟีเจอร์เติมมาภายหลัง จะเป็นจริงตามนั้นหรือเปล่า

26
00:02:14,651 --> 00:02:19,479
เดี๋ยวเราดูกัน แต่นั่นคือสิ่งที่พวกเขาอ้างในบล็อกครับ

27
00:02:19,479 --> 00:02:24,399
ดูใต้ประทุนนิดหน่อย มันเป็นโมเดลแบบ Mixture of Experts

28
00:02:24,399 --> 00:02:29,592
(การผสมผู้เชี่ยวชาญหลายตัว) ซึ่ง route ความสามารถต่อโทเคน

29
00:02:29,592 --> 00:02:34,147
ทำให้เก็บความรู้ได้เยอะโดยไม่ต้องจ่ายค่าใช้จ่ายแบบ

30
00:02:34,147 --> 00:02:39,431
dense model เต็มรูปแบบในทุกๆ รอบ ส่วนเรื่องการฝึกก็น่าสนใจ

31
00:02:39,431 --> 00:02:43,895
ใช้ข้อมูล trillions of tokens จาก developer จริงๆ

32
00:02:43,895 --> 00:02:48,814
และถูกฝึกบนข้อมูล Cursor ที่เก็บการโต้ตอบของ developer

33
00:02:48,814 --> 00:02:53,278
agent แบบเรียลไทม์ แล้วก็นำเข้างาน STEM, งานวิจัย

34
00:02:53,278 --> 00:02:58,562
และ knowledge work มาอย่างตั้งใจ นี่คือโมเดลแรกที่มีข้อมูล

35
00:02:58,562 --> 00:03:03,938
Cursor ทั้งหมดอยู่ในการฝึก เดี๋ยวน่าจะเห็นความต่างได้ชัดเจน

36
00:03:03,938 --> 00:03:09,586
จากนั้นมี Reinforcement Learning (RL - การเรียนรู้แบบเสริมแรง)

37
00:03:09,586 --> 00:03:13,868
ใน environment จริงที่ตั้งใจทำให้ยาก ยากจนโมเดล

38
00:03:13,868 --> 00:03:21,338
frontier ปัจจุบันยังทำไม่ได้ และ environment เหล่านี้ถูกสร้างขึ้นในสเกลใหญ่โดยระบบ

39
00:03:21,338 --> 00:03:26,804
agent แบบกระจายตัว ดังนั้น pipeline การฝึกตัวมันเองก็เป็นแบบ

40
00:03:26,804 --> 00:03:31,177
agentic คือ agent สร้าง gym ขึ้นมาเพื่อฝึก agent

41
00:03:31,177 --> 00:03:36,826
นั่นเองครับ เอาล่ะ มาดู benchmark กัน ซึ่งเรามักจะอยากเห็นเสมอ

42
00:03:36,826 --> 00:03:42,656
และผลออกมาน่าประทับใจพอสมควร บน Terminal Bench มันทำคะแนนสูงกว่า

43
00:03:42,656 --> 00:03:48,943
Opus 4.8 ซึ่งผมถือว่าเป็นโมเดลที่แข็งแกร่งมาก และอยู่ในระดับใกล้เคียง

44
00:03:48,943 --> 00:03:53,680
GPT 5.5 ต่ำกว่า Fable 5 อยู่บ้าง แต่ก็น่าประทับใจมาก

45
00:03:53,680 --> 00:03:59,875
ส่วน benchmark ด้าน software engineering อื่นๆ ก็อยู่ในระดับเดียวกับ

46
00:03:59,875 --> 00:04:04,430
Opus 4.8 หรือ GPT 5.5 ครับ สรุปๆ แล้ว Grok 4.5 ชนะ

47
00:04:04,430 --> 00:04:09,076
Opus และ GPT 5.5 ในบาง benchmark เหนือกว่า Composer

48
00:04:09,076 --> 00:04:13,632
2.5 ในทุกตัว ข้อควรจำคือมันทำบน high effort ไม่ใช่

49
00:04:13,632 --> 00:04:18,005
max แน่นอนว่ายังตามหลัง Fable 5 ซึ่งก็พอจะคาดได้

50
00:04:18,005 --> 00:04:22,469
มันไม่ใช่ผู้ชนะในเชิง benchmark เลยสักตัว แต่เป็น

51
00:04:22,469 --> 00:04:27,479
all-rounder ที่แข็งแกร่ง ไม่ใช่ coding king จุดขายจริงๆ

52
00:04:27,479 --> 00:04:33,674
ของมันคือความกว้าง ไม่ใช่การครอง benchmark นี่คือโฟกัสของพวกเขาจริงๆ

53
00:04:33,674 --> 00:04:40,416
คือสร้างมาให้ "ลงมือทำ" ไม่ใช่แค่ "ตอบคำถาม" จุดแข็งที่ขายไม่ใช่คะแนนเดียว

54
00:04:40,416 --> 00:04:45,518
แต่คือความสามารถในการใช้ tool ในระยะยาวแบบอิสระข้ามโดเมน

55
00:04:45,518 --> 00:04:50,346
มี core loop สี่ขั้น: investigate, use tools, recover

56
00:04:50,346 --> 00:04:56,086
from mistakes, verify ในห้าโดเมนเป้าหมายขึ้นไป พร้อมสถาปัตยกรรม

57
00:04:56,086 --> 00:05:00,459
MoE เป็นพื้นฐาน โมเดลเก่าจะตอบ prompt แล้วจบ แต่

58
00:05:00,459 --> 00:05:05,196
Grok 4.5 ถูกฝึกให้รัน task จนจบ — วางแผน, คว้า tool,

59
00:05:05,196 --> 00:05:10,844
ชนกำแพงก็ถอยออกมาลองใหม่ แล้วค่อยตรวจสอบงานตัวเองก่อนส่งให้คุณ

60
00:05:10,844 --> 00:05:15,491
ผมคิดว่ามันถูกออกแบบมาเพื่อใช้ใน agent โดยเฉพาะครับ

61
00:05:15,491 --> 00:05:20,137
สุดท้าย ด้านค่าใช้จ่าย ราคาอยู่ที่ $2 ต่อล้าน input

62
00:05:20,137 --> 00:05:24,692
token และ $6 ต่อล้าน output token ถูกกว่า Opus 4.8

63
00:05:24,692 --> 00:05:29,976
มาก ถูกกว่า Fable มาก ถูกกว่า GPT 5.5 ด้วย และใกล้เคียงกับ

64
00:05:29,976 --> 00:05:34,622
Sonnet 5 ซึ่ง Sonnet ราคา $2 in และ $10 out ดังนั้น

65
00:05:34,622 --> 00:05:41,546
Grok 4.5 ยังถูกกว่า Sonnet 5 อีก ในบล็อกเปิดตัวพวกเขาพูดถึงมันว่าเป็นมากกว่า

66
00:05:41,546 --> 00:05:46,192
coding model เป็น generalist agent ที่สู้ได้ในระดับ

67
00:05:46,192 --> 00:05:51,385
frontier ทั้งเรื่องโค้ดและอื่นๆ อีกมากมาย แต่พูดมากพอแล้ว

68
00:05:51,385 --> 00:05:55,849
มาทดสอบจริงกันเถอะครับ ทีนี้เรามีมันอยู่ใน Hermes

69
00:05:55,849 --> 00:06:01,680
Agent ที่นี่ — Grok 4.5 ซึ่งเป็น tool ที่ผมใช้ทดสอบโมเดลส่วนใหญ่

70
00:06:01,680 --> 00:06:05,962
งานแรกคืองาน front-end ที่ผมให้โมเดลอื่นทำบ่อยๆ

71
00:06:05,962 --> 00:06:10,699
แล้ว prompt คือ: สร้างไฟล์ HTML เดียวไม่ต้องมี build

72
00:06:10,699 --> 00:06:15,072
step สำหรับเกม One Piece meets Star Wars มี full

73
00:06:15,072 --> 00:06:20,174
screen hero section พื้นหลังสีเข้ม มีทรงกลม 3D หมุนได้ใน

74
00:06:20,174 --> 00:06:27,462
Three.js พร้อม custom GLSL fragment shader ที่ทำให้มันดูเหมือนดาวเคราะห์เรืองแสง

75
00:06:27,462 --> 00:06:32,382
ทรงกลมค่อยๆ หมุนรอบแกน X ตอน scroll ลง GSAP จะ animate

76
00:06:32,382 --> 00:06:36,937
ทรงกลมให้เล็กลงและจางหายไปพร้อมกับข้อความ headline

77
00:06:36,937 --> 00:06:41,857
ที่ค่อยๆ โผล่ขึ้นมา แบบ Framer Motion stagger entrance

78
00:06:41,857 --> 00:06:46,685
ทำงานใน Chrome ได้ ใช้ CDN imports เท่านั้น ไม่ต้องมี

79
00:06:46,685 --> 00:06:53,518
npm คุณอาจเบื่อ prompt นี้แล้ว แต่ผมว่ามันดีนะ ยังไม่มีโมเดลไหนทำได้ดีจริงๆ

80
00:06:53,518 --> 00:06:57,800
มี Fable เป็นโมเดลเดียวที่ทำได้ แม้แต่ Opus 4.8

81
00:06:57,800 --> 00:07:03,630
หรือ GPT 5.5 ก็ยังทำไม่ได้ เพราะมันมีหลายองค์ประกอบที่ขัดแย้งกัน

82
00:07:03,630 --> 00:07:08,003
การทำให้สำเร็จในครั้งเดียวยากมาก ผมเลยว่ามันเป็น

83
00:07:08,003 --> 00:07:13,469
prompt ทดสอบ coding ที่ดี มาดูกันว่า Grok จะทำออกมาเป็นยังไง

84
00:07:13,469 --> 00:07:18,116
ผมอยากรู้เสมอว่า Grok จะจัดการเรื่อง front-end หรือ

85
00:07:18,116 --> 00:07:23,035
style ได้แค่ไหน เพราะ Grok มี personality มากกว่าโมเดล

86
00:07:23,035 --> 00:07:28,593
GPT หรือแม้แต่ Claude นิดหน่อย เลยอยากเห็นว่ามันจะรับมือยังไง

87
00:07:28,593 --> 00:07:32,874
ผมส่ง prompt ไปแล้ว และผมคิดว่ามันน่าจะเร็วกว่า

88
00:07:32,874 --> 00:07:37,156
frontier model อื่นๆ จากประสบการณ์ กับ Grok 4.3

89
00:07:37,156 --> 00:07:41,620
ใน Hermes Agent มันเร็วมาก ถ้ารวมความเร็วของ Grok

90
00:07:41,620 --> 00:07:45,902
เข้ากับความสามารถที่มากขึ้นได้ ก็จะยอดเยี่ยมมาก

91
00:07:45,902 --> 00:07:50,913
มาดูผลกัน ผมต้องเริ่ม session ใหม่ เพราะมันไปอ่านไฟล์ใน

92
00:07:50,913 --> 00:07:56,743
directory จากการรันครั้งก่อนของโมเดลอื่นๆ ซึ่งน่าสนใจในตัวมันเอง

93
00:07:56,743 --> 00:08:01,481
เพราะผมไม่เคยเจอปัญหานี้มาก่อน แสดงว่ามัน self-aware

94
00:08:01,481 --> 00:08:07,585
(รับรู้สภาพแวดล้อม) มากกว่า ผมเลยต้องหยุดและย้ายไฟล์เหล่านั้นไปก่อน

95
00:08:07,585 --> 00:08:12,140
แล้วสร้าง session ใหม่ที่นี่ ค่อนข้างน่าสนใจนะครับ

96
00:08:12,140 --> 00:08:16,422
มัน self-aware มากขึ้น ซึ่งปกติจะเห็นในโมเดลแบบ

97
00:08:16,422 --> 00:08:21,432
Claude มันไม่ได้รีบเขียนออกมาทันที แต่จะสำรวจ directory

98
00:08:21,432 --> 00:08:27,263
ที่มันอยู่ก่อน โอเค ค่อนข้างเร็ว 2 นาที นี่คือสิ่งที่มันออกแบบมา

99
00:08:27,263 --> 00:08:34,278
ดูดีพอสมควร อาจจะมองไม่ชัด แต่มันมี style มากกว่าที่เคยเห็นจากโมเดลอื่นมาก่อน

100
00:08:34,278 --> 00:08:38,924
ลอง scroll ลงดู โอ้โว มันออกมาเป๊ะเลย มันควรจะ fade

101
00:08:38,924 --> 00:08:43,388
out และเล็กลง แล้วมีข้อความโผล่ขึ้นมา — "Set sail

102
00:08:43,388 --> 00:08:50,312
for the stars" นี่เลย นี่เป็นหนึ่งในผลงานที่ดีที่สุดสำหรับงานนี้ที่ผมเคยเห็น

103
00:08:50,312 --> 00:08:54,685
โมเดลอื่นๆ มักทำ headline แบบ stagger นี้พังตลอด

104
00:08:54,685 --> 00:09:01,427
ดังนั้นนี่น่าประทับใจมาก นี่คือแบบที่ Fable ทำ ซึ่งแน่นอนว่าดีกว่าอยู่แล้ว

105
00:09:01,427 --> 00:09:05,800
อันนี้ก็ทำได้เป๊ะเหมือนกัน แถมน่าประทับใจกว่าอีก

106
00:09:05,800 --> 00:09:10,902
แต่ของเจ้านี้เป็นของ Opus 4.8 ซึ่งต้องลองสามครั้งถึงจะทำ

107
00:09:10,902 --> 00:09:19,283
headline ได้สำเร็จ และจริงๆ ก็ยังไม่ดีเท่าไหร่ มันกระตุกอยู่ด้านล่างตรงจุดที่หน้าจอควรจะอยู่

108
00:09:19,283 --> 00:09:24,020
ส่วนของ Grok นั้นง่ายกว่า Fable อยู่แล้ว แต่ execute

109
00:09:24,020 --> 00:09:29,942
prompt ได้ดีมาก ผมน่าประทับใจจริงๆ เพราะผมทดสอบโมเดลมาเยอะแล้วกับ

110
00:09:29,942 --> 00:09:36,866
prompt นี้ และอย่างที่บอก นอกจาก Fable แล้ว ผมว่านี่เป็นอันดับสองที่ดีที่สุด

111
00:09:36,866 --> 00:09:41,421
แถม one-shot สำเร็จใน 2 นาที นี่น่าประทับใจมากครับ

112
00:09:41,421 --> 00:09:45,794
ทีนี้ผมจะให้มันทำงานวิจัย ซึ่งจะเป็นงาน research

113
00:09:45,794 --> 00:09:50,167
รวมถึง reasoning และ planning ด้วย งานที่ให้คือ:

114
00:09:50,167 --> 00:09:55,907
วิจัย paper ล่าสุดเกี่ยวกับ innovative RAG (Retrieval-Augmented

115
00:09:55,907 --> 00:10:00,735
Generation) systems และ agents ในช่วงหกเดือนที่ผ่านมา

116
00:10:00,735 --> 00:10:05,108
คัดเลือก 10 paper ที่น่าเชื่อถือและน่าสนใจที่สุด

117
00:10:05,108 --> 00:10:10,756
แล้วจัดอันดับจากที่ทำซ้ำบน RTX 3060 ได้ง่ายที่สุดไปหายากที่สุด

118
00:10:10,756 --> 00:10:15,129
จากนั้นวางแผนการ reproduce สำหรับอันดับสูงสุด ใน

119
00:10:15,129 --> 00:10:19,685
prompt เดียวนี้มีหลายอย่างเลยนะครับ ทั้ง research,

120
00:10:19,685 --> 00:10:24,786
reasoning และ planning ผมตั้งใจทำให้มันค่อนข้างกำกวมด้วย

121
00:10:24,786 --> 00:10:31,072
— innovative RAG systems ก็ไม่ได้ให้ prompt หรือหัวข้อที่เจาะจงมากนัก

122
00:10:31,072 --> 00:10:35,354
ผมอยากรู้ว่ามันจะตีความแบบกว้างๆ นี้ได้ดีแค่ไหน

123
00:10:35,354 --> 00:10:39,909
อีกอย่างที่น่าจดจำใน Hermes Agent คือมันมี context

124
00:10:39,909 --> 00:10:44,374
window 500,000 token ซึ่งดีมาก ผมมักจะใช้ GPT 5.5

125
00:10:44,374 --> 00:10:49,020
ซึ่งมีแค่ 270,000 token ก็ค่อนข้างน่ารำคาญ ต้องเข้า

126
00:10:49,020 --> 00:10:54,668
compaction บ่อยๆ ตอนทำงาน coding ระยะยาว โอเค ใช้เวลาไปนิดกว่า

127
00:10:54,668 --> 00:10:59,041
5 นาที ไม่ยากเกินไป นี่คือผลลัพธ์ เห็น tool JSON

128
00:10:59,041 --> 00:11:05,327
เทียบกับ compressed schemas น่าสนใจดี paper อันดับหนึ่งที่มันเลือกคือ

129
00:11:05,327 --> 00:11:10,065
"Dissecting Agentic RAG" ซึ่งพูดถึงว่า agentic knobs

130
00:11:10,065 --> 00:11:14,529
ช่วยอะไรได้บ้างภายใต้ local budget เสียงน่าสนใจดี

131
00:11:14,529 --> 00:11:22,272
มันจัดระเบียบทุกอย่างมาให้แล้วอย่างเฉพาะเจาะจง พร้อมระดับความยากและให้ดาวให้คะแนนด้วย

132
00:11:22,272 --> 00:11:27,192
paper ทุกเล่มก็อยู่ในหัวข้อทั่วไปเกี่ยวกับ RAG และระบบ

133
00:11:27,192 --> 00:11:32,021
retrieval ประเภทต่างๆ รวมถึง agentic search functions

134
00:11:32,021 --> 00:11:37,851
ด้วย ส่วน methods ที่น่าสนใจก็ synthesize ข้อมูลทั้งหมดเกี่ยวกับ

135
00:11:37,851 --> 00:11:42,315
methods เฉพาะที่ผมควรดูไว้ให้ และแผน reproduction

136
00:11:42,315 --> 00:11:46,961
อันดับหนึ่งก็เป็นของ paper "Dissecting Agentic RAG"

137
00:11:46,961 --> 00:11:51,790
— reproduce findings, โดยพบว่า agentic loop สำคัญกว่า

138
00:11:51,790 --> 00:11:56,618
single pass dense, fixed hybrid RF สำคัญกว่า adaptive

139
00:11:56,618 --> 00:12:01,629
entity BM25 router ผมคงต้องอ่าน paper จริงๆ เพื่อเข้าใจ

140
00:12:01,629 --> 00:12:06,093
thesis แต่ในฐานะแผนมันดูดีมาก มี schedule ให้ด้วย

141
00:12:06,093 --> 00:12:10,648
ผมว่ามันทำงานวิจัยนี้ได้ดีทีเดียว ไม่มีอะไรดูแปลกๆ

142
00:12:10,648 --> 00:12:15,021
ทุกอย่างถูกจัดระเบียบมาอย่างดี กระชับและอ่านง่าย

143
00:12:15,021 --> 00:12:19,759
ซึ่งเป็นปัญหาของ GPT 5.5 บางทีคือมันยืดยาวไปไม่รู้จบ

144
00:12:19,759 --> 00:12:25,043
แต่ของ Grok ข้อมูลที่ต้องการอยู่ตรงนี้หมด อ่านง่ายกว่าเยอะ

145
00:12:25,043 --> 00:12:29,325
เรียกว่าทำได้สำเร็จครับ สุดท้าย ตอนนี้เราอยู่ใน

146
00:12:29,325 --> 00:12:36,886
session มาสักพักแล้ว ผมอยากลองงาน coding อีกชิ้นเพื่อดูว่ามันจัดการได้ดีแค่ไหนเมื่อ

147
00:12:36,886 --> 00:12:42,808
context window ไม่ได้สดใหม่แล้ว ไม่ได้ลึกมาก แต่ก็พอที่จะทดสอบได้

148
00:12:42,808 --> 00:12:47,181
งานสุดท้ายคือ: สร้างไฟล์ HTML แบบ self-contained

149
00:12:47,181 --> 00:12:52,647
สำหรับ anime multiverse tactical dashboard และถ้าใครดูวิดีโอ

150
00:12:52,647 --> 00:12:57,475
MOA (Mixture of Agents) ของผมมาก่อน ก็จะเคยเห็นงานนี้

151
00:12:57,475 --> 00:13:02,213
นี่คือสิ่งที่ GPT 5.5 ทำออกมา เป็น node เล็กๆ มากมาย

152
00:13:02,213 --> 00:13:07,679
แล้วก็มีทรงกลมเรืองแสงใหญ่ ถ้า click เข้าไปก็จะมีข้อมูลต่างๆ

153
00:13:07,679 --> 00:13:12,872
แสดงขึ้นมา ส่วนนี่คือเวอร์ชัน MOA ที่ก้าวหน้ากว่าเล็กน้อย

154
00:13:12,872 --> 00:13:18,065
ใช้ GPT เป็น aggregator แต่มี Grok โมเดลอื่นอีกสามตัวเป็น

155
00:13:18,065 --> 00:13:23,258
reference models ผมเลยอยากเห็นการเปรียบเทียบโดยตรงระหว่าง

156
00:13:23,258 --> 00:13:28,268
Grok รุ่นก่อนกับรุ่นใหม่ว่าทำได้แค่ไหน ทดสอบนี้จะไม่ใช้

157
00:13:28,268 --> 00:13:33,552
MOA แต่เราจะดูว่ามันทำอะไรคล้ายๆ กันหรือเจ๋งกว่านั้นได้ไหม

158
00:13:33,552 --> 00:13:37,834
ผมประทับใจกับความเร็วมาก ผลลัพธ์ก็ดีตลอดมา โอเค

159
00:13:37,834 --> 00:13:42,207
เสร็จแล้ว อีกครั้งที่รวดเร็วมาก 3 นาที 38 วินาที

160
00:13:42,207 --> 00:13:47,036
จำได้ว่า GPT ใช้เวลากว่าห้านาที อาจจะถึงหกนาทีด้วยซ้ำ

161
00:13:47,036 --> 00:13:53,686
และนี่คือสิ่งที่ได้ออกมา ดูเจ๋งดีนะ มี ring วงแหวนแล้วก็มีลูปเรืองแสงลงมา

162
00:13:53,686 --> 00:13:58,241
click ที่ node ต่างๆ ได้ ดูสิ — ขยับได้บ้างเลยด้วย

163
00:13:58,241 --> 00:14:04,710
ถ้า click "focus active node" มันจะทำงาน อันนี้ก่อนหน้านี้เป็นอัตโนมัติ

164
00:14:04,710 --> 00:14:09,629
แต่จะเห็นว่าถ้า click ที่ชื่อต่างๆ เช่น Nami แล้วมันจะ

165
00:14:09,629 --> 00:14:14,275
drift แต่ละ node มีชื่อตามซีรีส์อนิเมะต่างๆ ดูดีมาก

166
00:14:14,275 --> 00:14:18,922
และมันทำตาม task ครบทุกข้อ จำไว้นะว่านี่คือเวอร์ชัน

167
00:14:18,922 --> 00:14:23,750
GPT ส่วนของ Grok ผมว่าทรงกลมกับ ring ของมันดูดีกว่านะ

168
00:14:23,750 --> 00:14:28,123
ของ GPT ก็มี ring บางๆ แต่ไม่เท่าหรูหรา ring ของ

169
00:14:28,123 --> 00:14:33,954
Grok เจ๋งกว่า มี animation มากกว่า รู้สึกมีการเคลื่อนไหวเยอะกว่า

170
00:14:33,954 --> 00:14:39,056
เอาล่ะ ก็จบแล้วครับ ความเร็วและคุณภาพอยู่ในระดับเดียวกับ

171
00:14:39,056 --> 00:14:43,520
GPT ผมว่าอาจจะมี texture บนทรงกลมน้อยกว่านิดหน่อย

172
00:14:43,520 --> 00:14:51,810
แต่โดยรวมผลลัพธ์ดีมาก ทำตามคำสั่งครบทุกข้อ มีหลายองค์ประกอบในงานนี้แต่ก็จัดการได้ไม่มีปัญหา

173
00:14:51,810 --> 00:14:56,183
แถมทำได้เร็วกว่าอย่างชัดเจน ซึ่งก็สำคัญเหมือนกัน

174
00:14:56,183 --> 00:15:03,745
เอาล่ะ จบแล้วครับ first look ของผมกับ Grok 4.5 ความประทับใจแรกคือน่าประทับใจพอสมควร

175
00:15:03,745 --> 00:15:11,124
จากงาน coding สองชิ้นที่เราให้ทำ มันทำได้ดีมาก อยู่ในระดับเดียวกับหรืออาจจะดีกว่า

176
00:15:11,124 --> 00:15:16,135
frontier model บางตัวด้วยซ้ำ โดยเฉพาะเรื่องการ one-shot

177
00:15:16,135 --> 00:15:20,690
headline นั้น ผมว่าเป็นเรื่องเล็กแต่น่าประทับใจมาก

178
00:15:20,690 --> 00:15:25,700
เพราะ Opus 4.8 ทำไม่ได้และ GPT 5.5 ก็เช่นกัน นี่เป็นแค่

179
00:15:25,700 --> 00:15:30,073
first look ครับ ทดสอบไม่กี่ task แต่ผมจะใช้ Grok

180
00:15:30,073 --> 00:15:38,364
4.5 ต่อไปแน่ๆ ส่วนใหญ่ใน Hermes Agent แล้วเดี๋ยวจะมาอัปเดตผลตามการใช้งานจริงในระยะยาวนะครับ

181
00:15:38,364 --> 00:15:44,286
แต่ความประทับใจแรกคือน่าประทับใจจริงๆ ก็จบแล้วสำหรับวิดีโอนี้ครับ

182
00:15:44,286 --> 00:15:49,205
ฝากคอมเมนต์แชร์ประสบการณ์ของคุณกับ Grok 4.5 ด้วยนะครับ

183
00:15:49,205 --> 00:15:55,400
ถ้าชอบวิดีโอฝาก subscribe ฝาก like ด้วยครับ แล้วเจอกันใหม่วิดีโอหน้า

184
00:15:55,400 --> 00:15:57,040
ขอบคุณที่รับชมครับ