▶SUBTHAIแปลไทย · ซับ · พากย์⚙
บทความแปลภาษาไทย · YouTube

First Look at Claude Opus 5: Fable-Tier AI for Half the Cost?

0:000:00
เล่นเสียงต้นฉบับของวิดีโอ พร้อมแสดงซับไทยซิงก์ตามเวลา
กำลังโหลดวิดีโอ…
01

สรุปย่อ

ประเด็นสำคัญจากวิดีโอ

- **ช่อง:** Tonbi's AI Garage · **ความยาว:** ~18.5 นาที · **ลิงก์:** https://www.youtube.com/watch?v=jUrBBkWhTHg

# สรุป: First Look at Claude Opus 5: Fable-Tier AI for Half the Cost?

- **ช่อง:** Tonbi's AI Garage · **ความยาว:** ~18.5 นาที · **ลิงก์:** https://www.youtube.com/watch?v=jUrBBkWhTHg

## ประเด็นหลัก
- Claude Opus 5 เป็นโมเดลใหม่ล่าสุดของ Anthropic ปิดโผโมเดลห้ารุ่น (รวม Sonnet และ Fable 5)
- ไฮไลต์: ศักยภาพเทียบเท่า Fable 5 แต่ราคาถูกกว่าครึ่ง ($5 input / $25 output เท่า Opus 4.8)
- guardrails น้อยกว่ามาก (แทรกแซงน้อยกว่า Fable 5 ราว 85%) เน้นที่ความปลอดภัยไซเบอร์ ซึ่งแก้ปัญหาอาการ "โดนสะดุด" ตอนเขียนโค้ดทั่วไปของ Fable
- โมเดลแบบ _thoughtful and proactive_ — วางแผน, ตรวจสอบงานตัวเอง (self-verify), แล้วผลักดันให้งานเสร็จ
- ทดสอบภาคสนาม 1: สร้างเกม side-scroller สไตล์ Mario จาก asset เกมเก่า → Opus 5 ใช้เวลา 44 นาที ทำเกม "Hex Run" ที่สมบูรณ์กว่าของ Fable 5 อย่างชัดเจน
- benchmark: ชนะ Opus 4.8 และ Fable 5 ในเกือบทุกตัว คะแนน Frontier bench สูงกว่า Opus 4.8 เป็น 2 เท่า; สูงกว่าโมเดลอันดับสองถึง 3 เท่าใน Arc-AGI 3 (เฉพาะ Agentic Coding ที่ GPT 5.6 ชนะขาดลอย)
- จุดเด่น: mid-conversation tool changes โดย prompt cache ไม่เสีย → ประหยัดต้นทุน/latency สำหรับ agent run ยาว ๆ; 4 effort levels (low/high/extra high/max)
- ทดสอบภาคสนาม 2: ออดิต "Tom's Bench" (benchmark ส่วนตัว) → พบ 14 ข้อ critical–medium; ส่งกลับให้ GPT 5.6 Sol ตรวจสอบ ยืนยัน 12 ข้อจริงเต็ม + 8 ข้อจริงบางส่วน, 0 ข้อเท็จ (Sol วิจารณ์ว่าโทนของ Opus แรงไป แต่ข้อเท็จจริงถูกต้อง)
- ทดสอบภาคสนาม 3: สร้างโลกแฟนตาซี 3D ใน Three.js → "The Hollow of Ember Watch" ใช้เวลา 19 นาที ดีกว่าผลงานเดิมของ GLM 5.2, Opus 4.8 และ Kimi K3 อย่างชัดเจน
- เป็นโมเดลที่ _align_ ดีที่สุดของ Anthropic จนถึงปัจจุบัน (คะแนน misaligned behavior ต่ำสุด)
- เป็น default ใหม่บน Claude Max; วางจำหน่ายแล้ววันนี้ทุกช่องทาง

## ความเห็นสรุป
Opus 5 มอบศักยภาพระดับ Fable 5 ในราคาที่ใช้งานจริงได้ทุกวัน ประกอบกับ guardrails ที่ผ่อนปรนลงอย่างมาก ทำให้แก้ปัญหาอาการ "ใช้งานไม่ได้ครึ่งเวลา" ของ Fable ได้ จากการทดสอบทั้งสาม task (เกม, ดีบักโค้ด, โลก 3D) ผลออกมาน่าประทับใจและเหนือกว่าโมเดลที่เคยลองมาทั้งหมด — น่าจะกลายเป็นโมเดล default ประจำวันของผู้รีวิวได้เลย
02

คำแปลเต็ม

แปลตามบทสนทนาต้นฉบับ ปรับเป็นภาษาไทยธรรมชาติ

วันนี้ Anthropic ประกาศตัว Claude Opus 5 โมเดลล่าสุดในสาย Opus นะครับ ซึ่งถือว่าเป็นการปิดฉากการปล่อยโมเดลทั้งห้ารุ่นของพวกเขา ที่มีทั้ง Sonnet และ Fable 5 ด้วย พูดถึงไฮไลต์จากโพสต์ประกาศและสิ่งที่ผมเห็นออนไลน์ ก็คือ Opus 5 มีศักยภาพเทียบเท่า Fable 5 ในงานส่วนใหญ่ แต่มี guardrails (กลไกป้องกันการใช้งานผิดวัตถุประสงค์) ที่น้อยกว่า ซึ่งน่าจะเป็นเรื่องดีครับ ปัญหาหลักของผมกับ Fable คือมันเป็นโมเดลที่เยี่ยมมาก แต่ guardrails นี่น่ารำคาญจริง ๆ ผมโดนสะดุดบ่อยมากแม้แค่ทำงานเขียนโค้ดปกติ แค่นั้นอย่างเดียวก็ทำให้ผมค่อนข้างหวังกับ Opus 5 แล้วครับ เพราะเขาบอกว่ามันจะมี guardrails ระดับใกล้เคียง Opus 4.8 ส่วนใหญ่อยู่บริเวณ cybersecurity (ความมั่นคงปลอดภัยไซเบอร์) ซึ่งผมก็ไม่ได้ทำงานในแวดวงนั้น ก็น่าจะไม่มีปัญหา

ดังนั้นไฮไลต์ก็ตามที่ว่า คือมันเก่งเทียบเท่า Fable 5 แต่ราคาถูกกว่าครึ่ง ซึ่งก็เป็นเรื่องที่ดีแน่นอนครับ ในวิดีโอนี้จะเป็นแบบ _first look_ ครั้งแรก ๆ นะครับ เราจะลองสั่งงานทันทีเลย และเป็นงานที่ผมเคยทำกับ Fable 5 มาแล้วด้วย จะได้เทียบกันตรง ๆ แล้วผมจะเจาะ benchmarks (มาตรฐานวัดผล) และฟีเจอร์เด่น ๆ ของมัน พร้อมความเปลี่ยนแปลงทางเทคนิค แล้วปิดท้ายด้วยอีกไม่กี่ task ครับ เริ่มกันเลย

และถ้าชอบวิดีโอนี้ ฝากติดตามผมบน X ที่บัญชี Tommy Studio ด้วยนะครับ ผมมักจะโพสต์คลิปสั้น ๆ เกี่ยวกับข่าว AI และฟีเจอร์ต่าง ๆ ของ agent บ่อย ๆ รวมถึงบทความที่เจาะลึกขึ้นด้วย และอย่าลืมสมัครรับจดหมายข่าวฟรีประจำสัปดาห์ของผม ที่ผมเขียนด้วยมือและออกทุกวันศุกร์ คอลัมน์นี้คุณจะได้อ่านความเห็นตรง ๆ ของผมเกี่ยวกับข่าว AI, โมเดล, งานวิจัยล่าสุด พร้อมเผยโฉมโปรเจกต์ใหม่ ๆ ที่ผมกำลังทำอยู่ก่อนใคร สมัครได้ที่ onchainaigarage.com ลิงก์อยู่ในคำอธิบายครับ

ทีนี้คุณอาจจะจำได้จากตอนที่ Fable ออกใหม่ ๆ ว่า task ที่ผมให้มันทำคือเอา asset เกมเก่า ๆ จำนวนหนึ่งจากเกมแนว strategy สไตล์ Civilization ที่ผมเคยทำไว้ — หน้าตาประมาณนี้ครับ สนุกมากตอนทำ แต่ task ที่ให้ Fable ทำคือลองเอามาสร้างใหม่ในรูปแบบเกม side-scroller สไตล์ Super Mario และนี่คือสิ่งที่มันทำได้ ซึ่งผมก็ประทับใจพอสมควร ทีนี้เราจะเอา task นี้ตรง ๆ ไปให้ Opus 5 ทำ แล้วดูว่ามันจะได้อะไรออกมา เราจะให้ asset ชุดเดียวกันเป๊ะ แล้วดูว่าดีไซน์จะคล้ายกันหรืออาจจะดีกว่าด้วยซ้ำ

ทีนี้อย่างที่เห็น เราอยู่ใน Claude Code ที่ใช้ Opus 5 แล้วก็ ผมจะใส่ prompt ลงไป ผมบอกมันว่า “เช็ค asset ในโฟลเดอร์นั้นด้วย คุณต้องทำเกม side-scrolling สไตล์ Mario แค่หนึ่งด่านเป็น demo โดยใช้ asset เหล่านี้ อย่าไปอ้างอิงไฟล์หรือโฟลเดอร์อื่นในไดเรกทอรีนี้ ต้องเป็นของคุณเอง คุณตัดสินใจเชิงสร้างสรรค์ได้ตามสมควร และอย่าถามคำถามเพิ่ม” นี่เป็นครั้งแรกที่ผมใช้ Opus 5 จริง ๆ ก็ลองดูสิว่าจะได้อะไรบ้าง

เสร็จแล้วครับ ใช้เวลาสักพักเหมือนกัน ใช้ไป 44 นาทีเลยนะ แสดงว่าเป็นโมเดลที่อดทนมากจริง ๆ มาดูผลงานกัน นี่ไง “Hex Run” หน้าเมนูชื่อเกมนี่ดูดีเลยทีเดียว กด Enter เพื่อเริ่มเลย เอาล่ะ เล่นกัน

โอ้โว้ นี่เป็นเกมที่สมบูรณ์จริง ๆ เลยนะ ปิดเสียงก่อนได้ไหม ที่แล้ว ๆ ต้องเลือกเสียงนั้นเสียงนี้ ลองเลือกตัวละครลิงดู — โอ้ ดูนั่นสิ ทำฉากได้ดีมาก ๆ เขาเอา hex tile พวกนั้น — คุณเห็น hex ของเกมใช่ไหม — มาขยายใหญ่ทำเป็นฉาก ซึ่งเจ๋งมาก ภาพอาจจะกระตุกนิดหน่อย แต่กราฟิกดูดีกว่าเดิมแน่นอน โอ้ ได้ดาบด้วย นี่เป็นเกมที่สมบูรณ์กว่าที่ผมขอไปเยอะเลยนะ ซึ่งผมขอแค่เกมสไตล์ Super Mario มีลูกไฟยิงใส่ผม มีแท่นลอย ๆ อยู่ด้วย ฉากทุกอย่างใช้ asset ชุดนั้นหมดเลย เอาล่ะ เช็กพอยต์ ส่วนของ Fable นั้นมันสร้างเป็นชุด ๆ โอ้ ผมตายแล้ว เก่งจริง ๆ ครับ ส่วนตัวผมวางอันนี้ไว้เหนือของ Fable แน่นอน เป็นเกมที่สมบูรณ์กว่ามาก น่าสนใจมาก ๆ สำหรับ prompt ง่าย ๆ แค่นี้ ผมไม่ได้ให้แผนละเอียดเลยนะ เป็นแค่ prompt สองบรรทัดแต่ได้ผลงานขนาดนี้มา น่าประทับใจมากครับ

ทีนี้ผมขอทำ task เล็ก ๆ นี้ให้จบก่อน แล้วเราจะเข้าสู่ช่วงนำเสนอที่ผมจะอธิบาย benchmarks และทำงานเพิ่มอีกนะครับ

เราเห็นแล้วว่ามันทำอะไรได้บ้าง ทีนี้มาคุยกันเรื่อง Claude Opus 5 กันสักหน่อย _Near frontier intelligence at half the frontier price_ (เกือบเท่าระดับ frontier ในราคาครึ่งหนึ่ง) และเป็น default ใหม่บน Claude Max นี่คือไฮไลต์เลยใช่ไหมครับ เขาบอกว่ามีความเฉียบขาดเทียบเท่า Fable 5 แต่ราคาถูกกว่าครึ่ง Anthropic เรียกมันว่าเป็น _thoughtful and proactive model_ (โมเดลที่รอบคอบและชิงคิดชิงทำ) น่าสนใจตรงที่ใช้คำว่า proactive หลายครั้งเลย มันถูกออกแบบมาให้ self-verify (ตรวจสอบตัวเอง) และ iterate (วนทำซ้ำ) คือมันจะวางแผน ตรวจงานของตัวเอง แล้วผลักดันจนงานเสร็จ ราคาเท่ากับ Opus 4.8 นะครับ คือ $5 input, $25 output ซึ่งก็เป็นมาตรฐานของโมเดลระดับ frontier และวางจำหน่ายแล้ววันนี้ทุกที่เลย

ทีนี้ตำแหน่งบน benchmarks นี่ก็น่าสนใจดี กราฟนี้แสดงให้เห็นว่า Opus 5 ทำได้ดีมากเทียบกับโมเดลอื่น ๆ ชนะ Opus 4.8 แน่นอน ชนะ Fable 5 ในเกือบทุกตัว แม้จะน้อยก็ตามก็ยังชนะ มีอยู่ตัวเดียวคือ Agentic Coding ที่ GPT 5.6 ชนะขาดลอย ส่วนผลรวมแล้วคะแนนสูงกว่า Opus 4.8 เป็นสองเท่าบน Frontier bench ซึ่งผมว่า Opus 4.8 เป็นโมเดลที่ดีมากอยู่แล้วในแบบของมัน ก็เป็นเครื่องการันตีที่ดี อย่างที่บอก ไม่ต่างจาก Fable 5 มากใน benchmarks เหล่านี้ โดยเฉพาะ cursor bench ครองอันดับหนึ่งใน AI coding agent index แบบรวม ความก้าวกระโดดที่ใหญ่ที่สุดอยู่ที่ benchmarks ด้านการเขียนโค้ด ทั้งเรื่อง reasoning (การให้เหตุผล) และ computer use (การควบคุมคอมพิวเตอร์) คะแนนสูงกว่าโมเดลอันดับสองถึงสามเท่าใน Arc-AGI 3 ซึ่งบ้ามาก มี pass rate สูงกว่าโมเดลอันดับสองถึง 1.5 เท่าใน Zapier automation bench ซึ่งน่าสนใจสำหรับงานอัตโนมัติทางธุรกิจประจำวัน น่าจะเป็นตัวเลือกที่ดี โดยเฉพาะราคาถูกกว่า Fable แม้รวม ๆ แล้วจะยังแพงอยู่ แต่ก็ถูกกว่า Fable อยู่ดี

ตัวเด่นคือมันตรวจสอบงานของตัวเอง นี่คือจุดแข็งที่เขาพูดถึง มันไปถึงระดับประสิทธิภาพของ Fable โดยใช้ต้นทุนครึ่งหนึ่ง โดยเฉพาะจุดแข็งเรื่องการดีบักที่ยากและการวิเคราะห์หา root cause (สาเหตุหลัก) เดี๋ยวเราจะลองทดสอบดูบ้าง แต่นั่นคือสิ่งที่เขาบอก มี self-verification loops (ลูปตรวจสอบตัวเอง) ซึ่งสำคัญมาก และมันสร้าง tooling (เครื่องมือ) ของตัวเองได้ด้วย ซึ่งเจ๋งมาก มันเคยสาธิตการเขียน computer vision pipeline บน Frontier bench เพื่อแก้ task หนึ่ง นี่คือการใช้เครื่องมือแบบสร้างสรรค์ ไม่ใช่แค่เรียกใช้ tool ธรรมดานะครับ และมี visual output ที่ดีขึ้นมาก artifacts, แอนิเมชัน, เกม และงาน 3D ดีขึ้นอย่างเห็นได้ชัด เดี๋ยวเราจะลองงาน 3D ท้ายวิดีโอด้วย ว่ามันทำได้แค่ไหน ซึ่งก็เป็นสัญญาณที่ดี

อีกสองไวน์ที่เงียบ ๆ สำหรับ agent bench ไม่ได้แฟลชซ่า แต่เป็นของจริงครับ มันรองรับ _mid-conversation tool changes_ คือคุณสามารถสลับว่า Claude จะใช้ tool ตัวไหนได้กลางบทสนทนาโดยที่ prompt cache ไม่เสีย และนี่คือที่มาของการประหยัดค่าใช้จ่าย เพราะก่อนหน้านี้การเปลี่ยนรายการ tool จะเป็นการทำลาย cache prefix ทั้งหมดทันที อย่างที่บอก นี่เป็นการประหยัดต้นทุนและลด latency ไปพร้อมกันสำหรับ agent run ที่ยาวนาน ซึ่งเป็นสิ่งที่ผมอยากเห็นมาก ๆ มี 4 effort levels (ระดับความพยายาม) คือ low, high, extra high และ max คาดว่าน่าจะใช้ high เป็น default เป็นหลัก และมีโปรแกรม cyber verification ที่ขยายการเข้าถึงสำหรับงานวิจัยความมั่นคงปลอดภัยที่สมควร โดยมีการแทรกแซงน้อยกว่า Fable 5 ราว 85% เลยนะครับ

นั่นก็เป็นสิ่งที่ผมอยากเห็นครับ คือ guardrails ที่น้อยลง และปล่อยให้ผมทำอะไรได้มากขึ้น ที่สำคัญนะครับ มันเป็นโมเดลที่มีการ _align_ (ปรับให้เข้ากับเป้าหมายและค่านิยม) ดีที่สุดเท่าที่เขาเคยทำมา มีคะแนนต่ำสุดในเรื่องพฤติกรรมที่ _misaligned_ (คลาดเคลื่อนจากเป้าหมาย) เมื่อเทียบกับโมเดลรุ่นล่าสุดหลาย ๆ ตัว และอันดับหนึ่งในการยึดมั่นตามหลักการตามรัฐธรรมนูญของ Claude ถ้าคุณสนใจเรื่องนี้นะครับ แต่อย่างไรก็ตามมันก็ถูกจำกัดไว้โดยเจตนาในสองด้าน คือเรื่องการ _vulnerability exploitation_ (การใช้ประโยชน์จากช่องโหว่) แสดงว่าเขายังระมัดระวังเรื่องที่มันจะทำอะไรได้อยู่ดี

ทีนี้เรื่องราคา นี่ก็เป็นประเด็นใหญ่เหมือนกันนะครับ _Frontier adjacent at Opus prices_ อยู่ในระดับใกล้ frontier ในราคาระดับ Opus มีราคามาตรฐาน $5 input, $25 output ตามที่บอกไปแล้ว เทียบกับ Fable ที่เป็นสองเท่าของราคานี้ ก็คือมีเรื่องให้คุยครับ เขาเรียกมันว่าเป็น _value model_ ที่ไม่ใช่การลดทอนคุณภาพจริง ๆ แล้วตามที่บอก มันเทียบเท่ากันในแง่ของ benchmarks นี้แทบจะทุกบรรทัด และเอาชนะ Fable ได้ในบางตัวด้วยซ้ำ และพอจะเล่าตามที่เห็นคนพูดกันบน Twitter ก็คือมันได้รับการตอบรับที่ดีมาก คนบอกว่าผลลัพธ์ใกล้เคียงกับ Fable แต่เอาล่ะครับ เรามาลองให้มันทำ task อีกสักหน่อยแล้วดูว่ามันจะเทียบเท่าจริงไหม

ทีนี้เราอยู่ใน Opus แล้ว task ต่อไปที่ผมจะให้มันทำคือ — ผมเคยสร้างสิ่งนี้ขึ้นมาเอง เรียกมันว่า “Tom's Bench” ครับ คือผมเอาข้อมูล session ทั้งหมดจาก Claude Code, Codex และ Hermes Agent มาสร้างเป็น benchmark ของตัวเอง โดยอิงจากวิธีที่ผมใช้ AI และ agent นั่นคือแนวคิดตั้งต้น ผมว่ามันเป็นไอเดียที่ดีนะ ผมออกวิดีโอไปครึ่งทาง แต่ทำต่อไม่ไหวเพราะต้องรันบน local models (โมเดลที่รันบนเครื่อง) แล้วเจอปัญหาเพียบเลย คือมันไม่ค่อยได้ผลตามที่คาดหวังเท่าไหร่ สรุปคือการทำ benchmark ที่เหมาะสมจริง ๆ มันยากกว่าที่คิด แต่ผมสร้างมันขึ้นมาด้วย Fable เป็นหลักก่อน แล้วจึงส่งต่อให้ทีมถัดไป จากนั้นผมเอาให้ Sol — คือ GPT 5.6 Sol — มาออดิต แล้วลองสั่งให้ execute ผ่าน Hermes Agent และอย่างที่บอก มันมีปัญหาเยอะมาก ผมเลยสงสัยว่า Opus 5 จะสามารถออดิตสิ่งนี้ได้ไหม เพราะโมเดลก่อนหน้าบอกว่าเสร็จแล้ว บอกว่าไม่มีบั๊ก ผมเลยอยากได้ความเห็นที่สองจาก Opus 5 หน่อย

ผมเลยถามว่า “คุณช่วยออดิต Tom's Bench เพื่อหาบั๊กและจุดบกพร่องได้ไหม ตัวนี้ตั้งใจให้เป็น benchmark รันบน DGX Spark สำหรับ local models โดยอิงจากข้อมูล session ของผมเอง” ทีนี้ออดิตกลับมาแล้วครับ และมันค่อนข้าง _damning_ (รุนแรง) เลยทีเดียว โดยรวมแล้ววิศวกรรมการสร้างระบบถือว่าทำมาอย่างระมัดระวังจริง ๆ แต่ปัญหาหนักอยู่ที่ _measurement validity_ (ความถูกต้องของการวัด) ไม่ใช่ที่การอิมพลีเมนต์ แต่มี critical errors (ข้อผิดพลาดร้ายแรง) อยู่หลายจุด หนึ่งในสามของชุดทดสอบเป็นของเกะกะ ตรงที่ 18 จาก 55 รายการไม่เคยได้คะแนนเกินศูนย์เลย ซึ่งเป็นปัญหา — อีกเก้ารายการ fork items (รายการแตกสาขา) เป็นไปไม่ได้เลยที่จะผ่าน ส่วนที่เหลือของ fork track ถูกจำกัดคะแนนสูงสุดไว้ที่ 0.5 และ text contract เป็นแบบ all-or-nothing (ผ่านหรือตกอย่างเดียว) ตัว judge (ผู้ตัดสิน) อิ่มตัวแล้ว และไม่มีข้อมูลสำหรับจัดอันดับด้วย นี่คือปัญหาจริง ๆ ครับ

แล้วก็มี _high_ ที่เป็นบั๊กโค้ดจริง ๆ ด้วย บางอย่างนะครับ ผมก็ไม่ได้คาดหวังว่า Sol จะเห็นเลย แต่บั๊กโค้ดจริงนั้น ผมคาดว่าน่าจะเห็นแน่นอน เช่น web search ไม่มี limit parameter, ส่วน code identity นั้นเปราะบาง, read path ถูก reject ตลอด นี่เป็นปัญหาหนักจริง ๆ สรุปแล้วเจอ critical ถึง medium ทั้งหมด 14 ข้อ และมีแผนที่น่าจะแก้ก่อนอยู่ด้วย ทีนี้สิ่งที่ผมจะทำคือคัดลอกผลการประเมินนี้ ส่งกลับไปให้ Sol แล้วดูว่ามันจะบอกว่าอะไร

ผมเลยบอกว่า ผมมีออดิตอยู่ ตอนนี้ผมอยู่ใน Hermes Agent โดยใช้ GPT 5.6 Sol — “รีวิวและยืนยันข้อค้นพบเหล่านี้ บอกผมว่าข้อไหนจริงหรือเท็จ อย่าสมมติว่าทุกข้อเป็นจริงนะ เพราะบางข้ออาจจะเป็นเท็จ ให้ผมการตัดสินด้วยว่ามีข้อค้นพบที่ถูกต้องกี่ข้อ” มันจะแบ่งเป็น sub-agent หลายตัวเลยทีเดียว

ทีนี้ Sol ก็ _push back_ (ผลักกลับ/โต้กลับ) นิดหน่อย โดยบอกว่า headline ที่ว่า benchmark ไม่สามารถแยกแยะความแตกต่างระหว่างโมเดลได้นั้น มันแรงเกินไปและไม่ได้รับการพิสูจน์ แต่อย่างไรก็ตาม มันก็มีข้อบกพร่องร้ายแรงเหมือนกัน ตามจำนวนเข้มข้นจริงจากทั้ง 14 หัวข้อ 12 ข้อเป็นจริงโดยสมบูรณ์ และอีก 8 ข้อเป็นจริงบางส่วน และศูนย์ข้อเป็นเท็จทั้งหมด ดังนั้นถึงแม้มันจะพยายามโต้นิดหน่อย แต่สุดท้ายแล้วข้อค้นพบเหล่านี้ส่วนใหญ่ก็เป็นจริงนะครับ ข้อค้นพบ _critical_ ที่เป็นจริงบางส่วนและเป็นจริงโดยสมบูรณ์ ก็เป็นปัญหาจริง ๆ บั๊กเหล่านี้เป็นจริง และเป็นจริงบางส่วน มันยืนยันคำติชมไว้หลายข้อมาก แต่ผมพบว่าบางคำกล่าวอ้างที่ Opus ทำขึ้นนั้นไม่มีข้อมูลสนับสนุน เช่นที่ว่า benchmark ไม่มีความสามารถในการแยกแยะเลย แต่บั๊กและปัญหาจริง ๆ นั้นได้รับการยืนยันแล้ว

ตลกดีครับ Sol คอยติเตียนอยู่ตลอดว่า ภาษาของ Opus นั้นแรงกว่าหลักฐานที่มีอยู่เสมอ มันจึงเป็นปัญหาเรื่องโทนมากกว่าเรื่องข้อเท็จจริง อย่างไรก็ตาม สิ่งนี้แสดงว่า — ผมคิดว่า — Opus 5 ทำงานดีบักได้ดีมากจริง ๆ ทีนี้ผมจะทำ Tom's Bench ต่อ และถ้าได้ผลดีก็จะปล่อยออกไปให้ดูนะครับ

ทีนี้ task สุดท้ายคือการสร้างโลก 3D และนี่เป็นอันที่ผมเคยทำมาก่อนแล้ว นี่คือ prompt ของมัน: “คุณอยู่ในไดเรกทอรีเปล่าที่เพิ่งสร้างใหม่ คุณต้องสร้างโลกแฟนตาซี 3D ใน Three.js โดยมีของให้แค่โฟลเดอร์ asset เล็ก ๆ ที่มีรูปอ้างอิงอยู่บ้าง มีพวก texture อยู่บ้าง ประมาณนี้” และนี่เป็น task ที่ผมเคยทำกับ GLM 5.2 เคยทำกับ Kimi K3 และเคยทำกับ Opus 4.8 ด้วย ก็จะได้เป็นการเทียบผลที่ดีอีกครั้ง ถ้าจำได้ นี่คือสิ่งที่ Opus — Opus 4.8 นะครับ — ทำขึ้นมา ผมว่าหน้าตาดีทีเดียว และนี่คือสิ่งที่ GLM 5.2 ทำขึ้น ผมว่าไม่ค่อยประณีตเท่าไหร่ แต่ก็ยัง execute ได้อยู่ดี มีตัวละครโบกมือด้วย และนี่คือสิ่งที่ Kimi K3 ทำได้ ซึ่งครั้งที่แล้วผมว่าเป็นอันที่ดีที่สุดในสามตัวจนถึงตอนนั้น แต่มาดูกันว่า Opus 5 จะทำได้แค่ไหน มีเอฟเฟกต์แสงที่ดี ต้นไม้ทำได้ดีมากสำหรับข้อมูลที่ให้ไป เสร็จแล้วครับ ใช้เวลาไป 19 นาทีทั้งหมด แต่มาดูผลงานกัน

“The Hollow of Ember Watch” มาเข้า _Hollow_ นี้กัน มีเอฟเฟกต์ fade in ที่น่าสนใจดี ว้าว นี่มันบ้าจริง ๆ ครับ ประทับใจมาก เมื่อกี้ผมเพิ่งโชว์ให้ดูผลงานครั้งก่อน ๆ นี่มันคนละระดับเลย เขาสร้าง landmark (จุดสังเกต) นี้ขึ้นมาด้วย กดเข้าไปได้ด้วย — “จะเอาไม้มาจากไหน?” — ครับ มันต่างจากที่เคยเห็นมาก่อนอย่างเห็นได้ชัด เห็นไหมครับ แม้จะยังไม่สมบูรณ์แบบเรื่องพวกนี้ก็ตาม แต่มันรู้สึกเหมือนเป็นโลกที่อุดมสมบูรณ์จริง ๆ มี texture มีมิติที่ต่างกัน เขาสร้างเนินเขาเล็ก ๆ ขึ้นมาด้วย มี _traveler's fire_ (กองไฟนักเดินทาง) ตัวละครต่าง ๆ อยู่ครบหมด วิธีที่เขาสร้างมันขึ้นมานี่รู้สึกเหมือนเป็นโลกที่สมจริงกว่ามาก และมีบ่อน้ำเล็ก ๆ อยู่ตรงนี้ด้วย ทุกอย่างมาประกอบกันได้ดี เส้นทางนี้ก็ดูเป็นธรรมชาติ กระโดดได้ไหม? กระโดดลงน้ำได้ไหม? อาจจะไม่ได้นะ บ่อน้ำนี่ดูดีเลย ว้าว ครับ ผมว่านี่ชัดเจนว่าดีกว่าของ Opus 4.8 แน่นอน หรือแม้แต่ของ Kimi K3 ซึ่งผมว่าทำได้ดีอยู่แล้ว แต่อันนี้พาขึ้นไปอีกระดับเลย ประทับใจกับความสามารถในการสร้างโลก 3D ของเขามากครับ

ทีนี้ก็คงจะมีแค่นี้ครับ แค่ _first look_ ครั้งแรกสำหรับ Opus 5 น่าจะได้ใช้งานบ่อยพอสมควร ผมยังชอบโมเดลของ Claude อยู่มากนะครับ Fable เป็นโมเดลที่ยอดเยี่ยม แต่มีปัญหาเรื่อง guardrail เยอะ หลายครั้งผมเลยข้ามไปใช้ 4.8 แทน แต่ตอนนี้ผมใช้ Opus 5 ได้แล้ว

ทีนี้ก็เป็นอันจบ _first look_ ของ Claude Opus 5 ครับ คงได้เห็นผมใช้งานบ่อย ๆ ผมทราบว่าคนมีความเห็นที่หนักแน่นเกี่ยวกับโมเดลของ Claude แต่ผมยังคิดว่ามันเป็นโมเดลที่มีความสามารถสูงมาก Fable เป็นโมเดลที่ยอดเยี่ยม แต่ปัญหาเดียวคือคุณใช้งานได้แค่ครึ่งเดียวเพราะปัญหา guardrail ซึ่งดูเหมือนว่า Opus 5 จะผ่อนปรนเรื่องนี้มากกว่า คุณคงได้เห็นผมใช้ Opus 5 บ่อย ๆ นะครับ แต่นี่เป็นแค่ _first look_ ของโมเดล และจนถึงตอนนี้ผมค่อนข้างประทับใจ เข้าใจแล้วว่าทำไมคนถึงมีปฏิกิริยาตอบรับที่แรงขนาดนี้ แต่ฝากคอมเมนต์ด้วยนะครับ บอกได้เลยว่าคุณได้ลองใช้ Opus 5 แล้วเป็นอย่างไรบ้าง ความเห็นของคุณเป็นอย่างไร แล้วเจอกันใหม่ในวิดีโอหน้าครับ ขอบคุณที่รับชมครับ

03

หมายเหตุการแปล

ความโปร่งใสเกี่ยวกับความไม่แน่นอนในต้นฉบับ

  • ไม่มีช่วงที่ต้องใส่ `[ฟังไม่ชัด]` — ทุกประโยคแปลได้ครบถ้วน
04

อภิธานศัพท์เทคนิค

คำศัพท์และชื่อผลิตภัณฑ์ที่คงรูปภาษาอังกฤษ

ศัพท์คำแปล / คำอธิบาย
Claude Opus 5โมเดลใหม่ล่าสุดในสาย Opus ของ Anthropic ศักยภาพระดับ Fable 5 ในราคาครึ่งหนึ่ง
Anthropicบริษัทผู้พัฒนาตระกูลโมเดล Claude
Fable 5 / Fableโมเดลระดับสูงสุดของ Anthropic ก่อนหน้า Opus 5 — เก่งมากแต่ guardrail เข้มงวดจนใช้งานยาก
Sonnetอีกหนึ่งโมเดลในตระกูล Claude
Opus 4.8โมเดลรุ่นก่อนของ Opus 5 ที่ Opus 5 เทียบราคาและเปรียบเทียบผล
GPT 5.6 / GPT 5.6 Solโมเดลของค่ายอื่น ใช้เป็นตัวเทียบใน benchmarks และเป็นตัว audit Tom's Bench
Kimi K3โมเดลของ Moonshot ใช้เป็นตัวเทียบในงานสร้างโลก 3D
GLM 5.2โมเดลของ Zhipu ใช้เป็นตัวเทียบในงานสร้างโลก 3D
Hermes Agentแพลตฟอร์ม agent ที่ใช้สั่ง execute Tom's Bench ผ่าน GPT 5.6 Sol
Claude CodeCLI สำหรับสั่งงาน Claude เช่น ทำเกม Mario-like
CodexCLI ของ OpenAI ที่ให้ข้อมูล session สำหรับ Tom's Bench
guardrailsกลไกป้องกัน/จำกัดการใช้งานที่อาจเป็นปัญหา — จุดเจ็บหลักของ Fable
cyber verification programโปรแกรมยืนยันตัวตนสำหรับนักวิจัยความมั่นคงปลอดภัยที่สมควร
self-verify / iterateความสามารถในการตรวจสอบงานตัวเองและวนทำซ้ำจนสำเร็จ
root cause analysisการวิเคราะห์หาสาเหตุหลักของปัญหา
benchmarksมาตรฐานวัดผลเพื่อเปรียบเทียบความสามารถของโมเดล
Frontier benchbenchmark ระดับหน้าขอบเขตความสามารถ
Arc-AGI 3benchmark ที่ Opus 5 ทำคะแนนสูงกว่าอันดับสองถึง 3 เท่า
Zapier automation benchbenchmark ด้านการทำงานอัตโนมัติทางธุรกิจ
Agentic Codingหมวดเดียวที่ GPT 5.6 ชนะขาดลอย
cursor bench / AI coding agent indexbenchmark ด้านการเขียนโค้ดโดยใช้ agent
prompt cacheแคชของบทสนทนาเพื่อลดต้นทุน/เวลา — Opus 5 รองรับการเปลี่ยน tool โดยไม่ทำลายแคช
mid-conversation tool changesการสลับ tool กลางบทสนทนา
effort levels (low/high/extra high/max)ระดับความพยายาม 4 ระดับในการทำงาน
computer vision pipelineชุดกระบวนการประมวลผลภาพ — ตัวอย่างการสร้าง tool เองของ Opus 5
Tom's Benchbenchmark ส่วนตัวที่ผู้รีวิวสร้างจาก session จริง
DGX Sparkเครื่องรัน local models ของ NVIDIA ที่ Tom's Bench ตั้งใจจะรันบน
measurement validityความถูกต้องของการวัด — ปัญหาหลักที่ Opus 5 พบใน Tom's Bench
sub-agentตัว agent ย่อยที่ Sol แบ่งออกมาตรวจสอบออดิต
Three.jsไลบรารี JavaScript สำหรับสร้างกราฟิก 3D บนเว็บ
Claude Maxแพ็กเกจสมัครสมาชิกระดับสูงของ Claude ที่ Opus 5 เป็น default
align / alignedการปรับให้โมเดลทำงานสอดคล้องกับเป้าหมาย/ค่านิยมที่ตั้งไว้
misaligned behaviorพฤติกรรมที่คลาดเคลื่อนจากเป้าหมาย — Opus 5 มีคะแนนต่ำสุด
onchainaigarage.comเว็บไซต์จดหมายข่าวประจำสัปดาห์ของช่อง
@Tommy Studioบัญชี X (Twitter) ของผู้รีวิว
05

ซับไตเติ้ลภาษาไทย

ดาวน์โหลดหรือดูซับทั้งหมด

1
00:00:00,000 --> 00:00:04,807
วันนี้ Anthropic ประกาศตัว Claude Opus 5 โมเดลล่าสุดในสาย

2
00:00:04,807 --> 00:00:10,542
Opus นะครับ ซึ่งถือว่าเป็นการปิดฉากการปล่อยโมเดลทั้งห้ารุ่นของพวกเขา

3
00:00:10,542 --> 00:00:17,541
ที่มีทั้ง Sonnet และ Fable 5 ด้วย พูดถึงไฮไลต์จากโพสต์ประกาศและสิ่งที่ผมเห็นออนไลน์

4
00:00:17,541 --> 00:00:22,011
ก็คือ Opus 5 มีศักยภาพเทียบเท่า Fable 5 ในงานส่วนใหญ่
thai-subtitles.srt
SubRip — ใช้กับเครื่องเล่นวิดีโอส่วนใหญ่
↓ ดาวน์โหลด
thai-subtitles.vtt
WebVTT — ใช้กับเว็บ / YouTube
↓ ดาวน์โหลด
เปิดดูซับไตเติ้ลทั้งหมด (233 segments)
1
00:00:00,000 --> 00:00:04,807
วันนี้ Anthropic ประกาศตัว Claude Opus 5 โมเดลล่าสุดในสาย

2
00:00:04,807 --> 00:00:10,542
Opus นะครับ ซึ่งถือว่าเป็นการปิดฉากการปล่อยโมเดลทั้งห้ารุ่นของพวกเขา

3
00:00:10,542 --> 00:00:17,541
ที่มีทั้ง Sonnet และ Fable 5 ด้วย พูดถึงไฮไลต์จากโพสต์ประกาศและสิ่งที่ผมเห็นออนไลน์

4
00:00:17,541 --> 00:00:22,011
ก็คือ Opus 5 มีศักยภาพเทียบเท่า Fable 5 ในงานส่วนใหญ่

5
00:00:22,011 --> 00:00:26,565
แต่มี guardrails (กลไกป้องกันการใช้งานผิดวัตถุประสงค์)

6
00:00:26,565 --> 00:00:31,203
ที่น้อยกว่า ซึ่งน่าจะเป็นเรื่องดีครับ ปัญหาหลักของผมกับ

7
00:00:31,203 --> 00:00:35,251
Fable คือมันเป็นโมเดลที่เยี่ยมมาก แต่ guardrails

8
00:00:35,251 --> 00:00:40,227
นี่น่ารำคาญจริง ๆ ผมโดนสะดุดบ่อยมากแม้แค่ทำงานเขียนโค้ดปกติ

9
00:00:40,227 --> 00:00:44,275
แค่นั้นอย่างเดียวก็ทำให้ผมค่อนข้างหวังกับ Opus 5

10
00:00:44,275 --> 00:00:48,998
แล้วครับ เพราะเขาบอกว่ามันจะมี guardrails ระดับใกล้เคียง

11
00:00:48,998 --> 00:00:54,732
Opus 4.8 ส่วนใหญ่อยู่บริเวณ cybersecurity (ความมั่นคงปลอดภัยไซเบอร์)

12
00:00:54,732 --> 00:00:58,780
ซึ่งผมก็ไม่ได้ทำงานในแวดวงนั้น ก็น่าจะไม่มีปัญหา

13
00:00:58,780 --> 00:01:02,997
ดังนั้นไฮไลต์ก็ตามที่ว่า คือมันเก่งเทียบเท่า Fable

14
00:01:02,997 --> 00:01:07,467
5 แต่ราคาถูกกว่าครึ่ง ซึ่งก็เป็นเรื่องที่ดีแน่นอนครับ

15
00:01:07,467 --> 00:01:11,768
ในวิดีโอนี้จะเป็นแบบ _first look_ ครั้งแรก ๆ นะครับ

16
00:01:11,768 --> 00:01:15,731
เราจะลองสั่งงานทันทีเลย และเป็นงานที่ผมเคยทำกับ

17
00:01:15,731 --> 00:01:19,948
Fable 5 มาแล้วด้วย จะได้เทียบกันตรง ๆ แล้วผมจะเจาะ

18
00:01:19,948 --> 00:01:24,081
benchmarks (มาตรฐานวัดผล) และฟีเจอร์เด่น ๆ ของมัน

19
00:01:24,081 --> 00:01:28,635
พร้อมความเปลี่ยนแปลงทางเทคนิค แล้วปิดท้ายด้วยอีกไม่กี่

20
00:01:28,635 --> 00:01:33,189
task ครับ เริ่มกันเลย และถ้าชอบวิดีโอนี้ ฝากติดตามผมบน

21
00:01:33,189 --> 00:01:37,827
X ที่บัญชี Tommy Studio ด้วยนะครับ ผมมักจะโพสต์คลิปสั้น

22
00:01:37,827 --> 00:01:42,044
ๆ เกี่ยวกับข่าว AI และฟีเจอร์ต่าง ๆ ของ agent บ่อย

23
00:01:42,044 --> 00:01:48,875
ๆ รวมถึงบทความที่เจาะลึกขึ้นด้วย และอย่าลืมสมัครรับจดหมายข่าวฟรีประจำสัปดาห์ของผม

24
00:01:48,875 --> 00:01:54,609
ที่ผมเขียนด้วยมือและออกทุกวันศุกร์ คอลัมน์นี้คุณจะได้อ่านความเห็นตรง

25
00:01:54,609 --> 00:02:00,513
ๆ ของผมเกี่ยวกับข่าว AI, โมเดล, งานวิจัยล่าสุด พร้อมเผยโฉมโปรเจกต์ใหม่

26
00:02:00,513 --> 00:02:05,320
ๆ ที่ผมกำลังทำอยู่ก่อนใคร สมัครได้ที่ onchainaigarage.com

27
00:02:05,320 --> 00:02:09,621
ลิงก์อยู่ในคำอธิบายครับ ทีนี้คุณอาจจะจำได้จากตอนที่

28
00:02:09,621 --> 00:02:13,837
Fable ออกใหม่ ๆ ว่า task ที่ผมให้มันทำคือเอา asset

29
00:02:13,837 --> 00:02:18,644
เกมเก่า ๆ จำนวนหนึ่งจากเกมแนว strategy สไตล์ Civilization

30
00:02:18,644 --> 00:02:22,692
ที่ผมเคยทำไว้ — หน้าตาประมาณนี้ครับ สนุกมากตอนทำ

31
00:02:22,692 --> 00:02:27,331
แต่ task ที่ให้ Fable ทำคือลองเอามาสร้างใหม่ในรูปแบบเกม

32
00:02:27,331 --> 00:02:32,053
side-scroller สไตล์ Super Mario และนี่คือสิ่งที่มันทำได้

33
00:02:32,053 --> 00:02:36,186
ซึ่งผมก็ประทับใจพอสมควร ทีนี้เราจะเอา task นี้ตรง

34
00:02:36,186 --> 00:02:40,655
ๆ ไปให้ Opus 5 ทำ แล้วดูว่ามันจะได้อะไรออกมา เราจะให้

35
00:02:40,655 --> 00:02:46,474
asset ชุดเดียวกันเป๊ะ แล้วดูว่าดีไซน์จะคล้ายกันหรืออาจจะดีกว่าด้วยซ้ำ

36
00:02:46,474 --> 00:02:50,775
ทีนี้อย่างที่เห็น เราอยู่ใน Claude Code ที่ใช้ Opus

37
00:02:50,775 --> 00:02:55,161
5 แล้วก็ ผมจะใส่ prompt ลงไป ผมบอกมันว่า “เช็ค asset

38
00:02:55,161 --> 00:02:59,546
ในโฟลเดอร์นั้นด้วย คุณต้องทำเกม side-scrolling สไตล์

39
00:02:59,546 --> 00:03:03,678
Mario แค่หนึ่งด่านเป็น demo โดยใช้ asset เหล่านี้

40
00:03:03,678 --> 00:03:07,642
อย่าไปอ้างอิงไฟล์หรือโฟลเดอร์อื่นในไดเรกทอรีนี้

41
00:03:07,642 --> 00:03:12,196
ต้องเป็นของคุณเอง คุณตัดสินใจเชิงสร้างสรรค์ได้ตามสมควร

42
00:03:12,196 --> 00:03:16,413
และอย่าถามคำถามเพิ่ม” นี่เป็นครั้งแรกที่ผมใช้ Opus

43
00:03:16,413 --> 00:03:20,461
5 จริง ๆ ก็ลองดูสิว่าจะได้อะไรบ้าง เสร็จแล้วครับ

44
00:03:20,461 --> 00:03:26,533
ใช้เวลาสักพักเหมือนกัน ใช้ไป 44 นาทีเลยนะ แสดงว่าเป็นโมเดลที่อดทนมากจริง

45
00:03:26,533 --> 00:03:31,846
ๆ มาดูผลงานกัน นี่ไง “Hex Run” หน้าเมนูชื่อเกมนี่ดูดีเลยทีเดียว

46
00:03:31,846 --> 00:03:37,665
กด Enter เพื่อเริ่มเลย เอาล่ะ เล่นกัน โอ้โว้ นี่เป็นเกมที่สมบูรณ์จริง

47
00:03:37,665 --> 00:03:42,978
ๆ เลยนะ ปิดเสียงก่อนได้ไหม ที่แล้ว ๆ ต้องเลือกเสียงนั้นเสียงนี้

48
00:03:42,978 --> 00:03:47,110
ลองเลือกตัวละครลิงดู — โอ้ ดูนั่นสิ ทำฉากได้ดีมาก

49
00:03:47,110 --> 00:03:51,495
ๆ เขาเอา hex tile พวกนั้น — คุณเห็น hex ของเกมใช่ไหม

50
00:03:51,495 --> 00:03:56,218
— มาขยายใหญ่ทำเป็นฉาก ซึ่งเจ๋งมาก ภาพอาจจะกระตุกนิดหน่อย

51
00:03:56,218 --> 00:04:03,387
แต่กราฟิกดูดีกว่าเดิมแน่นอน โอ้ ได้ดาบด้วย นี่เป็นเกมที่สมบูรณ์กว่าที่ผมขอไปเยอะเลยนะ

52
00:04:03,387 --> 00:04:07,350
ซึ่งผมขอแค่เกมสไตล์ Super Mario มีลูกไฟยิงใส่ผม

53
00:04:07,350 --> 00:04:11,989
มีแท่นลอย ๆ อยู่ด้วย ฉากทุกอย่างใช้ asset ชุดนั้นหมดเลย

54
00:04:11,989 --> 00:04:16,205
เอาล่ะ เช็กพอยต์ ส่วนของ Fable นั้นมันสร้างเป็นชุด

55
00:04:16,205 --> 00:04:21,350
ๆ โอ้ ผมตายแล้ว เก่งจริง ๆ ครับ ส่วนตัวผมวางอันนี้ไว้เหนือของ

56
00:04:21,350 --> 00:04:25,398
Fable แน่นอน เป็นเกมที่สมบูรณ์กว่ามาก น่าสนใจมาก

57
00:04:25,398 --> 00:04:30,120
ๆ สำหรับ prompt ง่าย ๆ แค่นี้ ผมไม่ได้ให้แผนละเอียดเลยนะ

58
00:04:30,120 --> 00:04:35,433
เป็นแค่ prompt สองบรรทัดแต่ได้ผลงานขนาดนี้มา น่าประทับใจมากครับ

59
00:04:35,433 --> 00:04:41,843
ทีนี้ผมขอทำ task เล็ก ๆ นี้ให้จบก่อน แล้วเราจะเข้าสู่ช่วงนำเสนอที่ผมจะอธิบาย

60
00:04:41,843 --> 00:04:47,240
benchmarks และทำงานเพิ่มอีกนะครับ เราเห็นแล้วว่ามันทำอะไรได้บ้าง

61
00:04:47,240 --> 00:04:51,541
ทีนี้มาคุยกันเรื่อง Claude Opus 5 กันสักหน่อย _Near

62
00:04:51,541 --> 00:04:55,673
frontier intelligence at half the frontier price_

63
00:04:55,673 --> 00:04:59,890
(เกือบเท่าระดับ frontier ในราคาครึ่งหนึ่ง) และเป็น

64
00:04:59,890 --> 00:05:04,191
default ใหม่บน Claude Max นี่คือไฮไลต์เลยใช่ไหมครับ

65
00:05:04,191 --> 00:05:09,251
เขาบอกว่ามีความเฉียบขาดเทียบเท่า Fable 5 แต่ราคาถูกกว่าครึ่ง

66
00:05:09,251 --> 00:05:13,552
Anthropic เรียกมันว่าเป็น _thoughtful and proactive

67
00:05:13,552 --> 00:05:18,528
model_ (โมเดลที่รอบคอบและชิงคิดชิงทำ) น่าสนใจตรงที่ใช้คำว่า

68
00:05:18,528 --> 00:05:22,913
proactive หลายครั้งเลย มันถูกออกแบบมาให้ self-verify

69
00:05:22,913 --> 00:05:27,298
(ตรวจสอบตัวเอง) และ iterate (วนทำซ้ำ) คือมันจะวางแผน

70
00:05:27,298 --> 00:05:31,515
ตรวจงานของตัวเอง แล้วผลักดันจนงานเสร็จ ราคาเท่ากับ

71
00:05:31,515 --> 00:05:37,503
Opus 4.8 นะครับ คือ $5 input, $25 output ซึ่งก็เป็นมาตรฐานของโมเดลระดับ

72
00:05:37,503 --> 00:05:42,225
frontier และวางจำหน่ายแล้ววันนี้ทุกที่เลย ทีนี้ตำแหน่งบน

73
00:05:42,225 --> 00:05:46,189
benchmarks นี่ก็น่าสนใจดี กราฟนี้แสดงให้เห็นว่า

74
00:05:46,189 --> 00:05:50,321
Opus 5 ทำได้ดีมากเทียบกับโมเดลอื่น ๆ ชนะ Opus 4.8

75
00:05:50,321 --> 00:05:54,960
แน่นอน ชนะ Fable 5 ในเกือบทุกตัว แม้จะน้อยก็ตามก็ยังชนะ

76
00:05:54,960 --> 00:05:59,514
มีอยู่ตัวเดียวคือ Agentic Coding ที่ GPT 5.6 ชนะขาดลอย

77
00:05:59,514 --> 00:06:03,562
ส่วนผลรวมแล้วคะแนนสูงกว่า Opus 4.8 เป็นสองเท่าบน

78
00:06:03,562 --> 00:06:09,465
Frontier bench ซึ่งผมว่า Opus 4.8 เป็นโมเดลที่ดีมากอยู่แล้วในแบบของมัน

79
00:06:09,465 --> 00:06:13,513
ก็เป็นเครื่องการันตีที่ดี อย่างที่บอก ไม่ต่างจาก

80
00:06:13,513 --> 00:06:17,645
Fable 5 มากใน benchmarks เหล่านี้ โดยเฉพาะ cursor

81
00:06:17,645 --> 00:06:22,031
bench ครองอันดับหนึ่งใน AI coding agent index แบบรวม

82
00:06:22,031 --> 00:06:27,259
ความก้าวกระโดดที่ใหญ่ที่สุดอยู่ที่ benchmarks ด้านการเขียนโค้ด

83
00:06:27,259 --> 00:06:31,307
ทั้งเรื่อง reasoning (การให้เหตุผล) และ computer

84
00:06:31,307 --> 00:06:36,789
use (การควบคุมคอมพิวเตอร์) คะแนนสูงกว่าโมเดลอันดับสองถึงสามเท่าใน

85
00:06:36,789 --> 00:06:41,681
Arc-AGI 3 ซึ่งบ้ามาก มี pass rate สูงกว่าโมเดลอันดับสองถึง

86
00:06:41,681 --> 00:06:48,512
1.5 เท่าใน Zapier automation bench ซึ่งน่าสนใจสำหรับงานอัตโนมัติทางธุรกิจประจำวัน

87
00:06:48,512 --> 00:06:52,560
น่าจะเป็นตัวเลือกที่ดี โดยเฉพาะราคาถูกกว่า Fable

88
00:06:52,560 --> 00:06:56,861
แม้รวม ๆ แล้วจะยังแพงอยู่ แต่ก็ถูกกว่า Fable อยู่ดี

89
00:06:56,861 --> 00:07:01,752
ตัวเด่นคือมันตรวจสอบงานของตัวเอง นี่คือจุดแข็งที่เขาพูดถึง

90
00:07:01,752 --> 00:07:06,475
มันไปถึงระดับประสิทธิภาพของ Fable โดยใช้ต้นทุนครึ่งหนึ่ง

91
00:07:06,475 --> 00:07:10,860
โดยเฉพาะจุดแข็งเรื่องการดีบักที่ยากและการวิเคราะห์หา

92
00:07:10,860 --> 00:07:14,992
root cause (สาเหตุหลัก) เดี๋ยวเราจะลองทดสอบดูบ้าง

93
00:07:14,992 --> 00:07:19,209
แต่นั่นคือสิ่งที่เขาบอก มี self-verification loops

94
00:07:19,209 --> 00:07:23,510
(ลูปตรวจสอบตัวเอง) ซึ่งสำคัญมาก และมันสร้าง tooling

95
00:07:23,510 --> 00:07:28,654
(เครื่องมือ) ของตัวเองได้ด้วย ซึ่งเจ๋งมาก มันเคยสาธิตการเขียน

96
00:07:28,654 --> 00:07:32,955
computer vision pipeline บน Frontier bench เพื่อแก้

97
00:07:32,955 --> 00:07:38,353
task หนึ่ง นี่คือการใช้เครื่องมือแบบสร้างสรรค์ ไม่ใช่แค่เรียกใช้

98
00:07:38,353 --> 00:07:42,569
tool ธรรมดานะครับ และมี visual output ที่ดีขึ้นมาก

99
00:07:42,569 --> 00:07:47,376
artifacts, แอนิเมชัน, เกม และงาน 3D ดีขึ้นอย่างเห็นได้ชัด

100
00:07:47,376 --> 00:07:51,846
เดี๋ยวเราจะลองงาน 3D ท้ายวิดีโอด้วย ว่ามันทำได้แค่ไหน

101
00:07:51,846 --> 00:07:55,978
ซึ่งก็เป็นสัญญาณที่ดี อีกสองไวน์ที่เงียบ ๆ สำหรับ

102
00:07:55,978 --> 00:08:00,532
agent bench ไม่ได้แฟลชซ่า แต่เป็นของจริงครับ มันรองรับ

103
00:08:00,532 --> 00:08:04,833
_mid-conversation tool changes_ คือคุณสามารถสลับว่า

104
00:08:04,833 --> 00:08:09,134
Claude จะใช้ tool ตัวไหนได้กลางบทสนทนาโดยที่ prompt

105
00:08:09,134 --> 00:08:13,435
cache ไม่เสีย และนี่คือที่มาของการประหยัดค่าใช้จ่าย

106
00:08:13,435 --> 00:08:17,821
เพราะก่อนหน้านี้การเปลี่ยนรายการ tool จะเป็นการทำลาย

107
00:08:17,821 --> 00:08:23,387
cache prefix ทั้งหมดทันที อย่างที่บอก นี่เป็นการประหยัดต้นทุนและลด

108
00:08:23,387 --> 00:08:29,543
latency ไปพร้อมกันสำหรับ agent run ที่ยาวนาน ซึ่งเป็นสิ่งที่ผมอยากเห็นมาก

109
00:08:29,543 --> 00:08:33,507
ๆ มี 4 effort levels (ระดับความพยายาม) คือ low,

110
00:08:33,507 --> 00:08:37,639
high, extra high และ max คาดว่าน่าจะใช้ high เป็น

111
00:08:37,639 --> 00:08:41,687
default เป็นหลัก และมีโปรแกรม cyber verification

112
00:08:41,687 --> 00:08:46,410
ที่ขยายการเข้าถึงสำหรับงานวิจัยความมั่นคงปลอดภัยที่สมควร

113
00:08:46,410 --> 00:08:50,542
โดยมีการแทรกแซงน้อยกว่า Fable 5 ราว 85% เลยนะครับ

114
00:08:50,542 --> 00:08:55,265
นั่นก็เป็นสิ่งที่ผมอยากเห็นครับ คือ guardrails ที่น้อยลง

115
00:08:55,265 --> 00:09:00,746
และปล่อยให้ผมทำอะไรได้มากขึ้น ที่สำคัญนะครับ มันเป็นโมเดลที่มีการ

116
00:09:00,746 --> 00:09:06,481
_align_ (ปรับให้เข้ากับเป้าหมายและค่านิยม) ดีที่สุดเท่าที่เขาเคยทำมา

117
00:09:06,481 --> 00:09:12,384
มีคะแนนต่ำสุดในเรื่องพฤติกรรมที่ _misaligned_ (คลาดเคลื่อนจากเป้าหมาย)

118
00:09:12,384 --> 00:09:20,059
เมื่อเทียบกับโมเดลรุ่นล่าสุดหลาย ๆ ตัว และอันดับหนึ่งในการยึดมั่นตามหลักการตามรัฐธรรมนูญของ

119
00:09:20,059 --> 00:09:26,890
Claude ถ้าคุณสนใจเรื่องนี้นะครับ แต่อย่างไรก็ตามมันก็ถูกจำกัดไว้โดยเจตนาในสองด้าน

120
00:09:26,890 --> 00:09:32,709
คือเรื่องการ _vulnerability exploitation_ (การใช้ประโยชน์จากช่องโหว่)

121
00:09:32,709 --> 00:09:37,094
แสดงว่าเขายังระมัดระวังเรื่องที่มันจะทำอะไรได้อยู่ดี

122
00:09:37,094 --> 00:09:41,395
ทีนี้เรื่องราคา นี่ก็เป็นประเด็นใหญ่เหมือนกันนะครับ

123
00:09:41,395 --> 00:09:45,612
_Frontier adjacent at Opus prices_ อยู่ในระดับใกล้

124
00:09:45,612 --> 00:09:49,744
frontier ในราคาระดับ Opus มีราคามาตรฐาน $5 input,

125
00:09:49,744 --> 00:09:55,310
$25 output ตามที่บอกไปแล้ว เทียบกับ Fable ที่เป็นสองเท่าของราคานี้

126
00:09:55,310 --> 00:09:59,443
ก็คือมีเรื่องให้คุยครับ เขาเรียกมันว่าเป็น _value

127
00:09:59,443 --> 00:10:03,659
model_ ที่ไม่ใช่การลดทอนคุณภาพจริง ๆ แล้วตามที่บอก

128
00:10:03,659 --> 00:10:08,045
มันเทียบเท่ากันในแง่ของ benchmarks นี้แทบจะทุกบรรทัด

129
00:10:08,045 --> 00:10:13,611
และเอาชนะ Fable ได้ในบางตัวด้วยซ้ำ และพอจะเล่าตามที่เห็นคนพูดกันบน

130
00:10:13,611 --> 00:10:19,261
Twitter ก็คือมันได้รับการตอบรับที่ดีมาก คนบอกว่าผลลัพธ์ใกล้เคียงกับ

131
00:10:19,261 --> 00:10:26,261
Fable แต่เอาล่ะครับ เรามาลองให้มันทำ task อีกสักหน่อยแล้วดูว่ามันจะเทียบเท่าจริงไหม

132
00:10:26,261 --> 00:10:30,730
ทีนี้เราอยู่ใน Opus แล้ว task ต่อไปที่ผมจะให้มันทำคือ

133
00:10:30,730 --> 00:10:34,694
— ผมเคยสร้างสิ่งนี้ขึ้นมาเอง เรียกมันว่า “Tom's

134
00:10:34,694 --> 00:10:39,079
Bench” ครับ คือผมเอาข้อมูล session ทั้งหมดจาก Claude

135
00:10:39,079 --> 00:10:43,296
Code, Codex และ Hermes Agent มาสร้างเป็น benchmark

136
00:10:43,296 --> 00:10:48,778
ของตัวเอง โดยอิงจากวิธีที่ผมใช้ AI และ agent นั่นคือแนวคิดตั้งต้น

137
00:10:48,778 --> 00:10:52,741
ผมว่ามันเป็นไอเดียที่ดีนะ ผมออกวิดีโอไปครึ่งทาง

138
00:10:52,741 --> 00:10:58,139
แต่ทำต่อไม่ไหวเพราะต้องรันบน local models (โมเดลที่รันบนเครื่อง)

139
00:10:58,139 --> 00:11:03,199
แล้วเจอปัญหาเพียบเลย คือมันไม่ค่อยได้ผลตามที่คาดหวังเท่าไหร่

140
00:11:03,199 --> 00:11:07,921
สรุปคือการทำ benchmark ที่เหมาะสมจริง ๆ มันยากกว่าที่คิด

141
00:11:07,921 --> 00:11:13,572
แต่ผมสร้างมันขึ้นมาด้วย Fable เป็นหลักก่อน แล้วจึงส่งต่อให้ทีมถัดไป

142
00:11:13,572 --> 00:11:17,535
จากนั้นผมเอาให้ Sol — คือ GPT 5.6 Sol — มาออดิต

143
00:11:17,535 --> 00:11:22,174
แล้วลองสั่งให้ execute ผ่าน Hermes Agent และอย่างที่บอก

144
00:11:22,174 --> 00:11:27,655
มันมีปัญหาเยอะมาก ผมเลยสงสัยว่า Opus 5 จะสามารถออดิตสิ่งนี้ได้ไหม

145
00:11:27,655 --> 00:11:31,788
เพราะโมเดลก่อนหน้าบอกว่าเสร็จแล้ว บอกว่าไม่มีบั๊ก

146
00:11:31,788 --> 00:11:36,342
ผมเลยอยากได้ความเห็นที่สองจาก Opus 5 หน่อย ผมเลยถามว่า

147
00:11:36,342 --> 00:11:41,064
“คุณช่วยออดิต Tom's Bench เพื่อหาบั๊กและจุดบกพร่องได้ไหม

148
00:11:41,064 --> 00:11:45,450
ตัวนี้ตั้งใจให้เป็น benchmark รันบน DGX Spark สำหรับ

149
00:11:45,450 --> 00:11:51,437
local models โดยอิงจากข้อมูล session ของผมเอง” ทีนี้ออดิตกลับมาแล้วครับ

150
00:11:51,437 --> 00:12:00,208
และมันค่อนข้าง _damning_ (รุนแรง) เลยทีเดียว โดยรวมแล้ววิศวกรรมการสร้างระบบถือว่าทำมาอย่างระมัดระวังจริง

151
00:12:00,208 --> 00:12:05,859
ๆ แต่ปัญหาหนักอยู่ที่ _measurement validity_ (ความถูกต้องของการวัด)

152
00:12:05,859 --> 00:12:11,340
ไม่ใช่ที่การอิมพลีเมนต์ แต่มี critical errors (ข้อผิดพลาดร้ายแรง)

153
00:12:11,340 --> 00:12:15,726
อยู่หลายจุด หนึ่งในสามของชุดทดสอบเป็นของเกะกะ ตรงที่

154
00:12:15,726 --> 00:12:20,448
18 จาก 55 รายการไม่เคยได้คะแนนเกินศูนย์เลย ซึ่งเป็นปัญหา

155
00:12:20,448 --> 00:12:26,099
— อีกเก้ารายการ fork items (รายการแตกสาขา) เป็นไปไม่ได้เลยที่จะผ่าน

156
00:12:26,099 --> 00:12:30,484
ส่วนที่เหลือของ fork track ถูกจำกัดคะแนนสูงสุดไว้ที่

157
00:12:30,484 --> 00:12:36,134
0.5 และ text contract เป็นแบบ all-or-nothing (ผ่านหรือตกอย่างเดียว)

158
00:12:36,134 --> 00:12:41,785
ตัว judge (ผู้ตัดสิน) อิ่มตัวแล้ว และไม่มีข้อมูลสำหรับจัดอันดับด้วย

159
00:12:41,785 --> 00:12:46,676
นี่คือปัญหาจริง ๆ ครับ แล้วก็มี _high_ ที่เป็นบั๊กโค้ดจริง

160
00:12:46,676 --> 00:12:51,399
ๆ ด้วย บางอย่างนะครับ ผมก็ไม่ได้คาดหวังว่า Sol จะเห็นเลย

161
00:12:51,399 --> 00:12:55,447
แต่บั๊กโค้ดจริงนั้น ผมคาดว่าน่าจะเห็นแน่นอน เช่น

162
00:12:55,447 --> 00:12:59,832
web search ไม่มี limit parameter, ส่วน code identity

163
00:12:59,832 --> 00:13:04,892
นั้นเปราะบาง, read path ถูก reject ตลอด นี่เป็นปัญหาหนักจริง

164
00:13:04,892 --> 00:13:08,940
ๆ สรุปแล้วเจอ critical ถึง medium ทั้งหมด 14 ข้อ

165
00:13:08,940 --> 00:13:15,181
และมีแผนที่น่าจะแก้ก่อนอยู่ด้วย ทีนี้สิ่งที่ผมจะทำคือคัดลอกผลการประเมินนี้

166
00:13:15,181 --> 00:13:19,650
ส่งกลับไปให้ Sol แล้วดูว่ามันจะบอกว่าอะไร ผมเลยบอกว่า

167
00:13:19,650 --> 00:13:23,698
ผมมีออดิตอยู่ ตอนนี้ผมอยู่ใน Hermes Agent โดยใช้

168
00:13:23,698 --> 00:13:29,770
GPT 5.6 Sol — “รีวิวและยืนยันข้อค้นพบเหล่านี้ บอกผมว่าข้อไหนจริงหรือเท็จ

169
00:13:29,770 --> 00:13:34,240
อย่าสมมติว่าทุกข้อเป็นจริงนะ เพราะบางข้ออาจจะเป็นเท็จ

170
00:13:34,240 --> 00:13:38,288
ให้ผมการตัดสินด้วยว่ามีข้อค้นพบที่ถูกต้องกี่ข้อ”

171
00:13:38,288 --> 00:13:42,252
มันจะแบ่งเป็น sub-agent หลายตัวเลยทีเดียว ทีนี้

172
00:13:42,252 --> 00:13:46,974
Sol ก็ _push back_ (ผลักกลับ/โต้กลับ) นิดหน่อย โดยบอกว่า

173
00:13:46,974 --> 00:13:52,962
headline ที่ว่า benchmark ไม่สามารถแยกแยะความแตกต่างระหว่างโมเดลได้นั้น

174
00:13:52,962 --> 00:13:57,179
มันแรงเกินไปและไม่ได้รับการพิสูจน์ แต่อย่างไรก็ตาม

175
00:13:57,179 --> 00:14:02,239
มันก็มีข้อบกพร่องร้ายแรงเหมือนกัน ตามจำนวนเข้มข้นจริงจากทั้ง

176
00:14:02,239 --> 00:14:07,467
14 หัวข้อ 12 ข้อเป็นจริงโดยสมบูรณ์ และอีก 8 ข้อเป็นจริงบางส่วน

177
00:14:07,467 --> 00:14:12,696
และศูนย์ข้อเป็นเท็จทั้งหมด ดังนั้นถึงแม้มันจะพยายามโต้นิดหน่อย

178
00:14:12,696 --> 00:14:17,250
แต่สุดท้ายแล้วข้อค้นพบเหล่านี้ส่วนใหญ่ก็เป็นจริงนะครับ

179
00:14:17,250 --> 00:14:22,226
ข้อค้นพบ _critical_ ที่เป็นจริงบางส่วนและเป็นจริงโดยสมบูรณ์

180
00:14:22,226 --> 00:14:27,033
ก็เป็นปัญหาจริง ๆ บั๊กเหล่านี้เป็นจริง และเป็นจริงบางส่วน

181
00:14:27,033 --> 00:14:31,755
มันยืนยันคำติชมไว้หลายข้อมาก แต่ผมพบว่าบางคำกล่าวอ้างที่

182
00:14:31,755 --> 00:14:36,394
Opus ทำขึ้นนั้นไม่มีข้อมูลสนับสนุน เช่นที่ว่า benchmark

183
00:14:36,394 --> 00:14:40,526
ไม่มีความสามารถในการแยกแยะเลย แต่บั๊กและปัญหาจริง

184
00:14:40,526 --> 00:14:45,671
ๆ นั้นได้รับการยืนยันแล้ว ตลกดีครับ Sol คอยติเตียนอยู่ตลอดว่า

185
00:14:45,671 --> 00:14:53,514
ภาษาของ Opus นั้นแรงกว่าหลักฐานที่มีอยู่เสมอ มันจึงเป็นปัญหาเรื่องโทนมากกว่าเรื่องข้อเท็จจริง

186
00:14:53,514 --> 00:14:57,477
อย่างไรก็ตาม สิ่งนี้แสดงว่า — ผมคิดว่า — Opus 5

187
00:14:57,477 --> 00:15:01,525
ทำงานดีบักได้ดีมากจริง ๆ ทีนี้ผมจะทำ Tom's Bench

188
00:15:01,525 --> 00:15:05,573
ต่อ และถ้าได้ผลดีก็จะปล่อยออกไปให้ดูนะครับ ทีนี้

189
00:15:05,573 --> 00:15:10,886
task สุดท้ายคือการสร้างโลก 3D และนี่เป็นอันที่ผมเคยทำมาก่อนแล้ว

190
00:15:10,886 --> 00:15:16,199
นี่คือ prompt ของมัน: “คุณอยู่ในไดเรกทอรีเปล่าที่เพิ่งสร้างใหม่

191
00:15:16,199 --> 00:15:21,259
คุณต้องสร้างโลกแฟนตาซี 3D ใน Three.js โดยมีของให้แค่โฟลเดอร์

192
00:15:21,259 --> 00:15:25,476
asset เล็ก ๆ ที่มีรูปอ้างอิงอยู่บ้าง มีพวก texture

193
00:15:25,476 --> 00:15:29,608
อยู่บ้าง ประมาณนี้” และนี่เป็น task ที่ผมเคยทำกับ

194
00:15:29,608 --> 00:15:33,825
GLM 5.2 เคยทำกับ Kimi K3 และเคยทำกับ Opus 4.8 ด้วย

195
00:15:33,825 --> 00:15:38,632
ก็จะได้เป็นการเทียบผลที่ดีอีกครั้ง ถ้าจำได้ นี่คือสิ่งที่

196
00:15:38,632 --> 00:15:43,186
Opus — Opus 4.8 นะครับ — ทำขึ้นมา ผมว่าหน้าตาดีทีเดียว

197
00:15:43,186 --> 00:15:48,077
และนี่คือสิ่งที่ GLM 5.2 ทำขึ้น ผมว่าไม่ค่อยประณีตเท่าไหร่

198
00:15:48,077 --> 00:15:53,390
แต่ก็ยัง execute ได้อยู่ดี มีตัวละครโบกมือด้วย และนี่คือสิ่งที่

199
00:15:53,390 --> 00:15:59,547
Kimi K3 ทำได้ ซึ่งครั้งที่แล้วผมว่าเป็นอันที่ดีที่สุดในสามตัวจนถึงตอนนั้น

200
00:15:59,547 --> 00:16:04,016
แต่มาดูกันว่า Opus 5 จะทำได้แค่ไหน มีเอฟเฟกต์แสงที่ดี

201
00:16:04,016 --> 00:16:08,233
ต้นไม้ทำได้ดีมากสำหรับข้อมูลที่ให้ไป เสร็จแล้วครับ

202
00:16:08,233 --> 00:16:12,618
ใช้เวลาไป 19 นาทีทั้งหมด แต่มาดูผลงานกัน “The Hollow

203
00:16:12,618 --> 00:16:16,751
of Ember Watch” มาเข้า _Hollow_ นี้กัน มีเอฟเฟกต์

204
00:16:16,751 --> 00:16:21,642
fade in ที่น่าสนใจดี ว้าว นี่มันบ้าจริง ๆ ครับ ประทับใจมาก

205
00:16:21,642 --> 00:16:26,618
เมื่อกี้ผมเพิ่งโชว์ให้ดูผลงานครั้งก่อน ๆ นี่มันคนละระดับเลย

206
00:16:26,618 --> 00:16:31,593
เขาสร้าง landmark (จุดสังเกต) นี้ขึ้นมาด้วย กดเข้าไปได้ด้วย

207
00:16:31,593 --> 00:16:37,497
— “จะเอาไม้มาจากไหน?” — ครับ มันต่างจากที่เคยเห็นมาก่อนอย่างเห็นได้ชัด

208
00:16:37,497 --> 00:16:41,713
เห็นไหมครับ แม้จะยังไม่สมบูรณ์แบบเรื่องพวกนี้ก็ตาม

209
00:16:41,713 --> 00:16:45,761
แต่มันรู้สึกเหมือนเป็นโลกที่อุดมสมบูรณ์จริง ๆ มี

210
00:16:45,761 --> 00:16:50,568
texture มีมิติที่ต่างกัน เขาสร้างเนินเขาเล็ก ๆ ขึ้นมาด้วย

211
00:16:50,568 --> 00:16:54,785
มี _traveler's fire_ (กองไฟนักเดินทาง) ตัวละครต่าง

212
00:16:54,785 --> 00:17:01,110
ๆ อยู่ครบหมด วิธีที่เขาสร้างมันขึ้นมานี่รู้สึกเหมือนเป็นโลกที่สมจริงกว่ามาก

213
00:17:01,110 --> 00:17:05,917
และมีบ่อน้ำเล็ก ๆ อยู่ตรงนี้ด้วย ทุกอย่างมาประกอบกันได้ดี

214
00:17:05,917 --> 00:17:10,893
เส้นทางนี้ก็ดูเป็นธรรมชาติ กระโดดได้ไหม? กระโดดลงน้ำได้ไหม?

215
00:17:10,893 --> 00:17:16,543
อาจจะไม่ได้นะ บ่อน้ำนี่ดูดีเลย ว้าว ครับ ผมว่านี่ชัดเจนว่าดีกว่าของ

216
00:17:16,543 --> 00:17:21,772
Opus 4.8 แน่นอน หรือแม้แต่ของ Kimi K3 ซึ่งผมว่าทำได้ดีอยู่แล้ว

217
00:17:21,772 --> 00:17:27,085
แต่อันนี้พาขึ้นไปอีกระดับเลย ประทับใจกับความสามารถในการสร้างโลก

218
00:17:27,085 --> 00:17:31,386
3D ของเขามากครับ ทีนี้ก็คงจะมีแค่นี้ครับ แค่ _first

219
00:17:31,386 --> 00:17:35,856
look_ ครั้งแรกสำหรับ Opus 5 น่าจะได้ใช้งานบ่อยพอสมควร

220
00:17:35,856 --> 00:17:41,337
ผมยังชอบโมเดลของ Claude อยู่มากนะครับ Fable เป็นโมเดลที่ยอดเยี่ยม

221
00:17:41,337 --> 00:17:45,976
แต่มีปัญหาเรื่อง guardrail เยอะ หลายครั้งผมเลยข้ามไปใช้

222
00:17:45,976 --> 00:17:50,530
4.8 แทน แต่ตอนนี้ผมใช้ Opus 5 ได้แล้ว ทีนี้ก็เป็นอันจบ

223
00:17:50,530 --> 00:17:55,337
_first look_ ของ Claude Opus 5 ครับ คงได้เห็นผมใช้งานบ่อย

224
00:17:55,337 --> 00:17:59,638
ๆ ผมทราบว่าคนมีความเห็นที่หนักแน่นเกี่ยวกับโมเดลของ

225
00:17:59,638 --> 00:18:04,192
Claude แต่ผมยังคิดว่ามันเป็นโมเดลที่มีความสามารถสูงมาก

226
00:18:04,192 --> 00:18:10,854
Fable เป็นโมเดลที่ยอดเยี่ยม แต่ปัญหาเดียวคือคุณใช้งานได้แค่ครึ่งเดียวเพราะปัญหา

227
00:18:10,854 --> 00:18:15,745
guardrail ซึ่งดูเหมือนว่า Opus 5 จะผ่อนปรนเรื่องนี้มากกว่า

228
00:18:15,745 --> 00:18:20,131
คุณคงได้เห็นผมใช้ Opus 5 บ่อย ๆ นะครับ แต่นี่เป็นแค่

229
00:18:20,131 --> 00:18:24,685
_first look_ ของโมเดล และจนถึงตอนนี้ผมค่อนข้างประทับใจ

230
00:18:24,685 --> 00:18:29,070
เข้าใจแล้วว่าทำไมคนถึงมีปฏิกิริยาตอบรับที่แรงขนาดนี้

231
00:18:29,070 --> 00:18:33,202
แต่ฝากคอมเมนต์ด้วยนะครับ บอกได้เลยว่าคุณได้ลองใช้

232
00:18:33,202 --> 00:18:37,588
Opus 5 แล้วเป็นอย่างไรบ้าง ความเห็นของคุณเป็นอย่างไร

233
00:18:37,588 --> 00:18:41,720
แล้วเจอกันใหม่ในวิดีโอหน้าครับ ขอบคุณที่รับชมครับ