First Look at Claude Opus 5: Fable-Tier AI for Half the Cost?
สรุปย่อ
ประเด็นสำคัญจากวิดีโอ
- **ช่อง:** Tonbi's AI Garage · **ความยาว:** ~18.5 นาที · **ลิงก์:** https://www.youtube.com/watch?v=jUrBBkWhTHg
# สรุป: First Look at Claude Opus 5: Fable-Tier AI for Half the Cost? - **ช่อง:** Tonbi's AI Garage · **ความยาว:** ~18.5 นาที · **ลิงก์:** https://www.youtube.com/watch?v=jUrBBkWhTHg ## ประเด็นหลัก - Claude Opus 5 เป็นโมเดลใหม่ล่าสุดของ Anthropic ปิดโผโมเดลห้ารุ่น (รวม Sonnet และ Fable 5) - ไฮไลต์: ศักยภาพเทียบเท่า Fable 5 แต่ราคาถูกกว่าครึ่ง ($5 input / $25 output เท่า Opus 4.8) - guardrails น้อยกว่ามาก (แทรกแซงน้อยกว่า Fable 5 ราว 85%) เน้นที่ความปลอดภัยไซเบอร์ ซึ่งแก้ปัญหาอาการ "โดนสะดุด" ตอนเขียนโค้ดทั่วไปของ Fable - โมเดลแบบ _thoughtful and proactive_ — วางแผน, ตรวจสอบงานตัวเอง (self-verify), แล้วผลักดันให้งานเสร็จ - ทดสอบภาคสนาม 1: สร้างเกม side-scroller สไตล์ Mario จาก asset เกมเก่า → Opus 5 ใช้เวลา 44 นาที ทำเกม "Hex Run" ที่สมบูรณ์กว่าของ Fable 5 อย่างชัดเจน - benchmark: ชนะ Opus 4.8 และ Fable 5 ในเกือบทุกตัว คะแนน Frontier bench สูงกว่า Opus 4.8 เป็น 2 เท่า; สูงกว่าโมเดลอันดับสองถึง 3 เท่าใน Arc-AGI 3 (เฉพาะ Agentic Coding ที่ GPT 5.6 ชนะขาดลอย) - จุดเด่น: mid-conversation tool changes โดย prompt cache ไม่เสีย → ประหยัดต้นทุน/latency สำหรับ agent run ยาว ๆ; 4 effort levels (low/high/extra high/max) - ทดสอบภาคสนาม 2: ออดิต "Tom's Bench" (benchmark ส่วนตัว) → พบ 14 ข้อ critical–medium; ส่งกลับให้ GPT 5.6 Sol ตรวจสอบ ยืนยัน 12 ข้อจริงเต็ม + 8 ข้อจริงบางส่วน, 0 ข้อเท็จ (Sol วิจารณ์ว่าโทนของ Opus แรงไป แต่ข้อเท็จจริงถูกต้อง) - ทดสอบภาคสนาม 3: สร้างโลกแฟนตาซี 3D ใน Three.js → "The Hollow of Ember Watch" ใช้เวลา 19 นาที ดีกว่าผลงานเดิมของ GLM 5.2, Opus 4.8 และ Kimi K3 อย่างชัดเจน - เป็นโมเดลที่ _align_ ดีที่สุดของ Anthropic จนถึงปัจจุบัน (คะแนน misaligned behavior ต่ำสุด) - เป็น default ใหม่บน Claude Max; วางจำหน่ายแล้ววันนี้ทุกช่องทาง ## ความเห็นสรุป Opus 5 มอบศักยภาพระดับ Fable 5 ในราคาที่ใช้งานจริงได้ทุกวัน ประกอบกับ guardrails ที่ผ่อนปรนลงอย่างมาก ทำให้แก้ปัญหาอาการ "ใช้งานไม่ได้ครึ่งเวลา" ของ Fable ได้ จากการทดสอบทั้งสาม task (เกม, ดีบักโค้ด, โลก 3D) ผลออกมาน่าประทับใจและเหนือกว่าโมเดลที่เคยลองมาทั้งหมด — น่าจะกลายเป็นโมเดล default ประจำวันของผู้รีวิวได้เลย
คำแปลเต็ม
แปลตามบทสนทนาต้นฉบับ ปรับเป็นภาษาไทยธรรมชาติ
วันนี้ Anthropic ประกาศตัว Claude Opus 5 โมเดลล่าสุดในสาย Opus นะครับ ซึ่งถือว่าเป็นการปิดฉากการปล่อยโมเดลทั้งห้ารุ่นของพวกเขา ที่มีทั้ง Sonnet และ Fable 5 ด้วย พูดถึงไฮไลต์จากโพสต์ประกาศและสิ่งที่ผมเห็นออนไลน์ ก็คือ Opus 5 มีศักยภาพเทียบเท่า Fable 5 ในงานส่วนใหญ่ แต่มี guardrails (กลไกป้องกันการใช้งานผิดวัตถุประสงค์) ที่น้อยกว่า ซึ่งน่าจะเป็นเรื่องดีครับ ปัญหาหลักของผมกับ Fable คือมันเป็นโมเดลที่เยี่ยมมาก แต่ guardrails นี่น่ารำคาญจริง ๆ ผมโดนสะดุดบ่อยมากแม้แค่ทำงานเขียนโค้ดปกติ แค่นั้นอย่างเดียวก็ทำให้ผมค่อนข้างหวังกับ Opus 5 แล้วครับ เพราะเขาบอกว่ามันจะมี guardrails ระดับใกล้เคียง Opus 4.8 ส่วนใหญ่อยู่บริเวณ cybersecurity (ความมั่นคงปลอดภัยไซเบอร์) ซึ่งผมก็ไม่ได้ทำงานในแวดวงนั้น ก็น่าจะไม่มีปัญหา
ดังนั้นไฮไลต์ก็ตามที่ว่า คือมันเก่งเทียบเท่า Fable 5 แต่ราคาถูกกว่าครึ่ง ซึ่งก็เป็นเรื่องที่ดีแน่นอนครับ ในวิดีโอนี้จะเป็นแบบ _first look_ ครั้งแรก ๆ นะครับ เราจะลองสั่งงานทันทีเลย และเป็นงานที่ผมเคยทำกับ Fable 5 มาแล้วด้วย จะได้เทียบกันตรง ๆ แล้วผมจะเจาะ benchmarks (มาตรฐานวัดผล) และฟีเจอร์เด่น ๆ ของมัน พร้อมความเปลี่ยนแปลงทางเทคนิค แล้วปิดท้ายด้วยอีกไม่กี่ task ครับ เริ่มกันเลย
และถ้าชอบวิดีโอนี้ ฝากติดตามผมบน X ที่บัญชี Tommy Studio ด้วยนะครับ ผมมักจะโพสต์คลิปสั้น ๆ เกี่ยวกับข่าว AI และฟีเจอร์ต่าง ๆ ของ agent บ่อย ๆ รวมถึงบทความที่เจาะลึกขึ้นด้วย และอย่าลืมสมัครรับจดหมายข่าวฟรีประจำสัปดาห์ของผม ที่ผมเขียนด้วยมือและออกทุกวันศุกร์ คอลัมน์นี้คุณจะได้อ่านความเห็นตรง ๆ ของผมเกี่ยวกับข่าว AI, โมเดล, งานวิจัยล่าสุด พร้อมเผยโฉมโปรเจกต์ใหม่ ๆ ที่ผมกำลังทำอยู่ก่อนใคร สมัครได้ที่ onchainaigarage.com ลิงก์อยู่ในคำอธิบายครับ
ทีนี้คุณอาจจะจำได้จากตอนที่ Fable ออกใหม่ ๆ ว่า task ที่ผมให้มันทำคือเอา asset เกมเก่า ๆ จำนวนหนึ่งจากเกมแนว strategy สไตล์ Civilization ที่ผมเคยทำไว้ — หน้าตาประมาณนี้ครับ สนุกมากตอนทำ แต่ task ที่ให้ Fable ทำคือลองเอามาสร้างใหม่ในรูปแบบเกม side-scroller สไตล์ Super Mario และนี่คือสิ่งที่มันทำได้ ซึ่งผมก็ประทับใจพอสมควร ทีนี้เราจะเอา task นี้ตรง ๆ ไปให้ Opus 5 ทำ แล้วดูว่ามันจะได้อะไรออกมา เราจะให้ asset ชุดเดียวกันเป๊ะ แล้วดูว่าดีไซน์จะคล้ายกันหรืออาจจะดีกว่าด้วยซ้ำ
ทีนี้อย่างที่เห็น เราอยู่ใน Claude Code ที่ใช้ Opus 5 แล้วก็ ผมจะใส่ prompt ลงไป ผมบอกมันว่า “เช็ค asset ในโฟลเดอร์นั้นด้วย คุณต้องทำเกม side-scrolling สไตล์ Mario แค่หนึ่งด่านเป็น demo โดยใช้ asset เหล่านี้ อย่าไปอ้างอิงไฟล์หรือโฟลเดอร์อื่นในไดเรกทอรีนี้ ต้องเป็นของคุณเอง คุณตัดสินใจเชิงสร้างสรรค์ได้ตามสมควร และอย่าถามคำถามเพิ่ม” นี่เป็นครั้งแรกที่ผมใช้ Opus 5 จริง ๆ ก็ลองดูสิว่าจะได้อะไรบ้าง
เสร็จแล้วครับ ใช้เวลาสักพักเหมือนกัน ใช้ไป 44 นาทีเลยนะ แสดงว่าเป็นโมเดลที่อดทนมากจริง ๆ มาดูผลงานกัน นี่ไง “Hex Run” หน้าเมนูชื่อเกมนี่ดูดีเลยทีเดียว กด Enter เพื่อเริ่มเลย เอาล่ะ เล่นกัน
โอ้โว้ นี่เป็นเกมที่สมบูรณ์จริง ๆ เลยนะ ปิดเสียงก่อนได้ไหม ที่แล้ว ๆ ต้องเลือกเสียงนั้นเสียงนี้ ลองเลือกตัวละครลิงดู — โอ้ ดูนั่นสิ ทำฉากได้ดีมาก ๆ เขาเอา hex tile พวกนั้น — คุณเห็น hex ของเกมใช่ไหม — มาขยายใหญ่ทำเป็นฉาก ซึ่งเจ๋งมาก ภาพอาจจะกระตุกนิดหน่อย แต่กราฟิกดูดีกว่าเดิมแน่นอน โอ้ ได้ดาบด้วย นี่เป็นเกมที่สมบูรณ์กว่าที่ผมขอไปเยอะเลยนะ ซึ่งผมขอแค่เกมสไตล์ Super Mario มีลูกไฟยิงใส่ผม มีแท่นลอย ๆ อยู่ด้วย ฉากทุกอย่างใช้ asset ชุดนั้นหมดเลย เอาล่ะ เช็กพอยต์ ส่วนของ Fable นั้นมันสร้างเป็นชุด ๆ โอ้ ผมตายแล้ว เก่งจริง ๆ ครับ ส่วนตัวผมวางอันนี้ไว้เหนือของ Fable แน่นอน เป็นเกมที่สมบูรณ์กว่ามาก น่าสนใจมาก ๆ สำหรับ prompt ง่าย ๆ แค่นี้ ผมไม่ได้ให้แผนละเอียดเลยนะ เป็นแค่ prompt สองบรรทัดแต่ได้ผลงานขนาดนี้มา น่าประทับใจมากครับ
ทีนี้ผมขอทำ task เล็ก ๆ นี้ให้จบก่อน แล้วเราจะเข้าสู่ช่วงนำเสนอที่ผมจะอธิบาย benchmarks และทำงานเพิ่มอีกนะครับ
เราเห็นแล้วว่ามันทำอะไรได้บ้าง ทีนี้มาคุยกันเรื่อง Claude Opus 5 กันสักหน่อย _Near frontier intelligence at half the frontier price_ (เกือบเท่าระดับ frontier ในราคาครึ่งหนึ่ง) และเป็น default ใหม่บน Claude Max นี่คือไฮไลต์เลยใช่ไหมครับ เขาบอกว่ามีความเฉียบขาดเทียบเท่า Fable 5 แต่ราคาถูกกว่าครึ่ง Anthropic เรียกมันว่าเป็น _thoughtful and proactive model_ (โมเดลที่รอบคอบและชิงคิดชิงทำ) น่าสนใจตรงที่ใช้คำว่า proactive หลายครั้งเลย มันถูกออกแบบมาให้ self-verify (ตรวจสอบตัวเอง) และ iterate (วนทำซ้ำ) คือมันจะวางแผน ตรวจงานของตัวเอง แล้วผลักดันจนงานเสร็จ ราคาเท่ากับ Opus 4.8 นะครับ คือ $5 input, $25 output ซึ่งก็เป็นมาตรฐานของโมเดลระดับ frontier และวางจำหน่ายแล้ววันนี้ทุกที่เลย
ทีนี้ตำแหน่งบน benchmarks นี่ก็น่าสนใจดี กราฟนี้แสดงให้เห็นว่า Opus 5 ทำได้ดีมากเทียบกับโมเดลอื่น ๆ ชนะ Opus 4.8 แน่นอน ชนะ Fable 5 ในเกือบทุกตัว แม้จะน้อยก็ตามก็ยังชนะ มีอยู่ตัวเดียวคือ Agentic Coding ที่ GPT 5.6 ชนะขาดลอย ส่วนผลรวมแล้วคะแนนสูงกว่า Opus 4.8 เป็นสองเท่าบน Frontier bench ซึ่งผมว่า Opus 4.8 เป็นโมเดลที่ดีมากอยู่แล้วในแบบของมัน ก็เป็นเครื่องการันตีที่ดี อย่างที่บอก ไม่ต่างจาก Fable 5 มากใน benchmarks เหล่านี้ โดยเฉพาะ cursor bench ครองอันดับหนึ่งใน AI coding agent index แบบรวม ความก้าวกระโดดที่ใหญ่ที่สุดอยู่ที่ benchmarks ด้านการเขียนโค้ด ทั้งเรื่อง reasoning (การให้เหตุผล) และ computer use (การควบคุมคอมพิวเตอร์) คะแนนสูงกว่าโมเดลอันดับสองถึงสามเท่าใน Arc-AGI 3 ซึ่งบ้ามาก มี pass rate สูงกว่าโมเดลอันดับสองถึง 1.5 เท่าใน Zapier automation bench ซึ่งน่าสนใจสำหรับงานอัตโนมัติทางธุรกิจประจำวัน น่าจะเป็นตัวเลือกที่ดี โดยเฉพาะราคาถูกกว่า Fable แม้รวม ๆ แล้วจะยังแพงอยู่ แต่ก็ถูกกว่า Fable อยู่ดี
ตัวเด่นคือมันตรวจสอบงานของตัวเอง นี่คือจุดแข็งที่เขาพูดถึง มันไปถึงระดับประสิทธิภาพของ Fable โดยใช้ต้นทุนครึ่งหนึ่ง โดยเฉพาะจุดแข็งเรื่องการดีบักที่ยากและการวิเคราะห์หา root cause (สาเหตุหลัก) เดี๋ยวเราจะลองทดสอบดูบ้าง แต่นั่นคือสิ่งที่เขาบอก มี self-verification loops (ลูปตรวจสอบตัวเอง) ซึ่งสำคัญมาก และมันสร้าง tooling (เครื่องมือ) ของตัวเองได้ด้วย ซึ่งเจ๋งมาก มันเคยสาธิตการเขียน computer vision pipeline บน Frontier bench เพื่อแก้ task หนึ่ง นี่คือการใช้เครื่องมือแบบสร้างสรรค์ ไม่ใช่แค่เรียกใช้ tool ธรรมดานะครับ และมี visual output ที่ดีขึ้นมาก artifacts, แอนิเมชัน, เกม และงาน 3D ดีขึ้นอย่างเห็นได้ชัด เดี๋ยวเราจะลองงาน 3D ท้ายวิดีโอด้วย ว่ามันทำได้แค่ไหน ซึ่งก็เป็นสัญญาณที่ดี
อีกสองไวน์ที่เงียบ ๆ สำหรับ agent bench ไม่ได้แฟลชซ่า แต่เป็นของจริงครับ มันรองรับ _mid-conversation tool changes_ คือคุณสามารถสลับว่า Claude จะใช้ tool ตัวไหนได้กลางบทสนทนาโดยที่ prompt cache ไม่เสีย และนี่คือที่มาของการประหยัดค่าใช้จ่าย เพราะก่อนหน้านี้การเปลี่ยนรายการ tool จะเป็นการทำลาย cache prefix ทั้งหมดทันที อย่างที่บอก นี่เป็นการประหยัดต้นทุนและลด latency ไปพร้อมกันสำหรับ agent run ที่ยาวนาน ซึ่งเป็นสิ่งที่ผมอยากเห็นมาก ๆ มี 4 effort levels (ระดับความพยายาม) คือ low, high, extra high และ max คาดว่าน่าจะใช้ high เป็น default เป็นหลัก และมีโปรแกรม cyber verification ที่ขยายการเข้าถึงสำหรับงานวิจัยความมั่นคงปลอดภัยที่สมควร โดยมีการแทรกแซงน้อยกว่า Fable 5 ราว 85% เลยนะครับ
นั่นก็เป็นสิ่งที่ผมอยากเห็นครับ คือ guardrails ที่น้อยลง และปล่อยให้ผมทำอะไรได้มากขึ้น ที่สำคัญนะครับ มันเป็นโมเดลที่มีการ _align_ (ปรับให้เข้ากับเป้าหมายและค่านิยม) ดีที่สุดเท่าที่เขาเคยทำมา มีคะแนนต่ำสุดในเรื่องพฤติกรรมที่ _misaligned_ (คลาดเคลื่อนจากเป้าหมาย) เมื่อเทียบกับโมเดลรุ่นล่าสุดหลาย ๆ ตัว และอันดับหนึ่งในการยึดมั่นตามหลักการตามรัฐธรรมนูญของ Claude ถ้าคุณสนใจเรื่องนี้นะครับ แต่อย่างไรก็ตามมันก็ถูกจำกัดไว้โดยเจตนาในสองด้าน คือเรื่องการ _vulnerability exploitation_ (การใช้ประโยชน์จากช่องโหว่) แสดงว่าเขายังระมัดระวังเรื่องที่มันจะทำอะไรได้อยู่ดี
ทีนี้เรื่องราคา นี่ก็เป็นประเด็นใหญ่เหมือนกันนะครับ _Frontier adjacent at Opus prices_ อยู่ในระดับใกล้ frontier ในราคาระดับ Opus มีราคามาตรฐาน $5 input, $25 output ตามที่บอกไปแล้ว เทียบกับ Fable ที่เป็นสองเท่าของราคานี้ ก็คือมีเรื่องให้คุยครับ เขาเรียกมันว่าเป็น _value model_ ที่ไม่ใช่การลดทอนคุณภาพจริง ๆ แล้วตามที่บอก มันเทียบเท่ากันในแง่ของ benchmarks นี้แทบจะทุกบรรทัด และเอาชนะ Fable ได้ในบางตัวด้วยซ้ำ และพอจะเล่าตามที่เห็นคนพูดกันบน Twitter ก็คือมันได้รับการตอบรับที่ดีมาก คนบอกว่าผลลัพธ์ใกล้เคียงกับ Fable แต่เอาล่ะครับ เรามาลองให้มันทำ task อีกสักหน่อยแล้วดูว่ามันจะเทียบเท่าจริงไหม
ทีนี้เราอยู่ใน Opus แล้ว task ต่อไปที่ผมจะให้มันทำคือ — ผมเคยสร้างสิ่งนี้ขึ้นมาเอง เรียกมันว่า “Tom's Bench” ครับ คือผมเอาข้อมูล session ทั้งหมดจาก Claude Code, Codex และ Hermes Agent มาสร้างเป็น benchmark ของตัวเอง โดยอิงจากวิธีที่ผมใช้ AI และ agent นั่นคือแนวคิดตั้งต้น ผมว่ามันเป็นไอเดียที่ดีนะ ผมออกวิดีโอไปครึ่งทาง แต่ทำต่อไม่ไหวเพราะต้องรันบน local models (โมเดลที่รันบนเครื่อง) แล้วเจอปัญหาเพียบเลย คือมันไม่ค่อยได้ผลตามที่คาดหวังเท่าไหร่ สรุปคือการทำ benchmark ที่เหมาะสมจริง ๆ มันยากกว่าที่คิด แต่ผมสร้างมันขึ้นมาด้วย Fable เป็นหลักก่อน แล้วจึงส่งต่อให้ทีมถัดไป จากนั้นผมเอาให้ Sol — คือ GPT 5.6 Sol — มาออดิต แล้วลองสั่งให้ execute ผ่าน Hermes Agent และอย่างที่บอก มันมีปัญหาเยอะมาก ผมเลยสงสัยว่า Opus 5 จะสามารถออดิตสิ่งนี้ได้ไหม เพราะโมเดลก่อนหน้าบอกว่าเสร็จแล้ว บอกว่าไม่มีบั๊ก ผมเลยอยากได้ความเห็นที่สองจาก Opus 5 หน่อย
ผมเลยถามว่า “คุณช่วยออดิต Tom's Bench เพื่อหาบั๊กและจุดบกพร่องได้ไหม ตัวนี้ตั้งใจให้เป็น benchmark รันบน DGX Spark สำหรับ local models โดยอิงจากข้อมูล session ของผมเอง” ทีนี้ออดิตกลับมาแล้วครับ และมันค่อนข้าง _damning_ (รุนแรง) เลยทีเดียว โดยรวมแล้ววิศวกรรมการสร้างระบบถือว่าทำมาอย่างระมัดระวังจริง ๆ แต่ปัญหาหนักอยู่ที่ _measurement validity_ (ความถูกต้องของการวัด) ไม่ใช่ที่การอิมพลีเมนต์ แต่มี critical errors (ข้อผิดพลาดร้ายแรง) อยู่หลายจุด หนึ่งในสามของชุดทดสอบเป็นของเกะกะ ตรงที่ 18 จาก 55 รายการไม่เคยได้คะแนนเกินศูนย์เลย ซึ่งเป็นปัญหา — อีกเก้ารายการ fork items (รายการแตกสาขา) เป็นไปไม่ได้เลยที่จะผ่าน ส่วนที่เหลือของ fork track ถูกจำกัดคะแนนสูงสุดไว้ที่ 0.5 และ text contract เป็นแบบ all-or-nothing (ผ่านหรือตกอย่างเดียว) ตัว judge (ผู้ตัดสิน) อิ่มตัวแล้ว และไม่มีข้อมูลสำหรับจัดอันดับด้วย นี่คือปัญหาจริง ๆ ครับ
แล้วก็มี _high_ ที่เป็นบั๊กโค้ดจริง ๆ ด้วย บางอย่างนะครับ ผมก็ไม่ได้คาดหวังว่า Sol จะเห็นเลย แต่บั๊กโค้ดจริงนั้น ผมคาดว่าน่าจะเห็นแน่นอน เช่น web search ไม่มี limit parameter, ส่วน code identity นั้นเปราะบาง, read path ถูก reject ตลอด นี่เป็นปัญหาหนักจริง ๆ สรุปแล้วเจอ critical ถึง medium ทั้งหมด 14 ข้อ และมีแผนที่น่าจะแก้ก่อนอยู่ด้วย ทีนี้สิ่งที่ผมจะทำคือคัดลอกผลการประเมินนี้ ส่งกลับไปให้ Sol แล้วดูว่ามันจะบอกว่าอะไร
ผมเลยบอกว่า ผมมีออดิตอยู่ ตอนนี้ผมอยู่ใน Hermes Agent โดยใช้ GPT 5.6 Sol — “รีวิวและยืนยันข้อค้นพบเหล่านี้ บอกผมว่าข้อไหนจริงหรือเท็จ อย่าสมมติว่าทุกข้อเป็นจริงนะ เพราะบางข้ออาจจะเป็นเท็จ ให้ผมการตัดสินด้วยว่ามีข้อค้นพบที่ถูกต้องกี่ข้อ” มันจะแบ่งเป็น sub-agent หลายตัวเลยทีเดียว
ทีนี้ Sol ก็ _push back_ (ผลักกลับ/โต้กลับ) นิดหน่อย โดยบอกว่า headline ที่ว่า benchmark ไม่สามารถแยกแยะความแตกต่างระหว่างโมเดลได้นั้น มันแรงเกินไปและไม่ได้รับการพิสูจน์ แต่อย่างไรก็ตาม มันก็มีข้อบกพร่องร้ายแรงเหมือนกัน ตามจำนวนเข้มข้นจริงจากทั้ง 14 หัวข้อ 12 ข้อเป็นจริงโดยสมบูรณ์ และอีก 8 ข้อเป็นจริงบางส่วน และศูนย์ข้อเป็นเท็จทั้งหมด ดังนั้นถึงแม้มันจะพยายามโต้นิดหน่อย แต่สุดท้ายแล้วข้อค้นพบเหล่านี้ส่วนใหญ่ก็เป็นจริงนะครับ ข้อค้นพบ _critical_ ที่เป็นจริงบางส่วนและเป็นจริงโดยสมบูรณ์ ก็เป็นปัญหาจริง ๆ บั๊กเหล่านี้เป็นจริง และเป็นจริงบางส่วน มันยืนยันคำติชมไว้หลายข้อมาก แต่ผมพบว่าบางคำกล่าวอ้างที่ Opus ทำขึ้นนั้นไม่มีข้อมูลสนับสนุน เช่นที่ว่า benchmark ไม่มีความสามารถในการแยกแยะเลย แต่บั๊กและปัญหาจริง ๆ นั้นได้รับการยืนยันแล้ว
ตลกดีครับ Sol คอยติเตียนอยู่ตลอดว่า ภาษาของ Opus นั้นแรงกว่าหลักฐานที่มีอยู่เสมอ มันจึงเป็นปัญหาเรื่องโทนมากกว่าเรื่องข้อเท็จจริง อย่างไรก็ตาม สิ่งนี้แสดงว่า — ผมคิดว่า — Opus 5 ทำงานดีบักได้ดีมากจริง ๆ ทีนี้ผมจะทำ Tom's Bench ต่อ และถ้าได้ผลดีก็จะปล่อยออกไปให้ดูนะครับ
ทีนี้ task สุดท้ายคือการสร้างโลก 3D และนี่เป็นอันที่ผมเคยทำมาก่อนแล้ว นี่คือ prompt ของมัน: “คุณอยู่ในไดเรกทอรีเปล่าที่เพิ่งสร้างใหม่ คุณต้องสร้างโลกแฟนตาซี 3D ใน Three.js โดยมีของให้แค่โฟลเดอร์ asset เล็ก ๆ ที่มีรูปอ้างอิงอยู่บ้าง มีพวก texture อยู่บ้าง ประมาณนี้” และนี่เป็น task ที่ผมเคยทำกับ GLM 5.2 เคยทำกับ Kimi K3 และเคยทำกับ Opus 4.8 ด้วย ก็จะได้เป็นการเทียบผลที่ดีอีกครั้ง ถ้าจำได้ นี่คือสิ่งที่ Opus — Opus 4.8 นะครับ — ทำขึ้นมา ผมว่าหน้าตาดีทีเดียว และนี่คือสิ่งที่ GLM 5.2 ทำขึ้น ผมว่าไม่ค่อยประณีตเท่าไหร่ แต่ก็ยัง execute ได้อยู่ดี มีตัวละครโบกมือด้วย และนี่คือสิ่งที่ Kimi K3 ทำได้ ซึ่งครั้งที่แล้วผมว่าเป็นอันที่ดีที่สุดในสามตัวจนถึงตอนนั้น แต่มาดูกันว่า Opus 5 จะทำได้แค่ไหน มีเอฟเฟกต์แสงที่ดี ต้นไม้ทำได้ดีมากสำหรับข้อมูลที่ให้ไป เสร็จแล้วครับ ใช้เวลาไป 19 นาทีทั้งหมด แต่มาดูผลงานกัน
“The Hollow of Ember Watch” มาเข้า _Hollow_ นี้กัน มีเอฟเฟกต์ fade in ที่น่าสนใจดี ว้าว นี่มันบ้าจริง ๆ ครับ ประทับใจมาก เมื่อกี้ผมเพิ่งโชว์ให้ดูผลงานครั้งก่อน ๆ นี่มันคนละระดับเลย เขาสร้าง landmark (จุดสังเกต) นี้ขึ้นมาด้วย กดเข้าไปได้ด้วย — “จะเอาไม้มาจากไหน?” — ครับ มันต่างจากที่เคยเห็นมาก่อนอย่างเห็นได้ชัด เห็นไหมครับ แม้จะยังไม่สมบูรณ์แบบเรื่องพวกนี้ก็ตาม แต่มันรู้สึกเหมือนเป็นโลกที่อุดมสมบูรณ์จริง ๆ มี texture มีมิติที่ต่างกัน เขาสร้างเนินเขาเล็ก ๆ ขึ้นมาด้วย มี _traveler's fire_ (กองไฟนักเดินทาง) ตัวละครต่าง ๆ อยู่ครบหมด วิธีที่เขาสร้างมันขึ้นมานี่รู้สึกเหมือนเป็นโลกที่สมจริงกว่ามาก และมีบ่อน้ำเล็ก ๆ อยู่ตรงนี้ด้วย ทุกอย่างมาประกอบกันได้ดี เส้นทางนี้ก็ดูเป็นธรรมชาติ กระโดดได้ไหม? กระโดดลงน้ำได้ไหม? อาจจะไม่ได้นะ บ่อน้ำนี่ดูดีเลย ว้าว ครับ ผมว่านี่ชัดเจนว่าดีกว่าของ Opus 4.8 แน่นอน หรือแม้แต่ของ Kimi K3 ซึ่งผมว่าทำได้ดีอยู่แล้ว แต่อันนี้พาขึ้นไปอีกระดับเลย ประทับใจกับความสามารถในการสร้างโลก 3D ของเขามากครับ
ทีนี้ก็คงจะมีแค่นี้ครับ แค่ _first look_ ครั้งแรกสำหรับ Opus 5 น่าจะได้ใช้งานบ่อยพอสมควร ผมยังชอบโมเดลของ Claude อยู่มากนะครับ Fable เป็นโมเดลที่ยอดเยี่ยม แต่มีปัญหาเรื่อง guardrail เยอะ หลายครั้งผมเลยข้ามไปใช้ 4.8 แทน แต่ตอนนี้ผมใช้ Opus 5 ได้แล้ว
ทีนี้ก็เป็นอันจบ _first look_ ของ Claude Opus 5 ครับ คงได้เห็นผมใช้งานบ่อย ๆ ผมทราบว่าคนมีความเห็นที่หนักแน่นเกี่ยวกับโมเดลของ Claude แต่ผมยังคิดว่ามันเป็นโมเดลที่มีความสามารถสูงมาก Fable เป็นโมเดลที่ยอดเยี่ยม แต่ปัญหาเดียวคือคุณใช้งานได้แค่ครึ่งเดียวเพราะปัญหา guardrail ซึ่งดูเหมือนว่า Opus 5 จะผ่อนปรนเรื่องนี้มากกว่า คุณคงได้เห็นผมใช้ Opus 5 บ่อย ๆ นะครับ แต่นี่เป็นแค่ _first look_ ของโมเดล และจนถึงตอนนี้ผมค่อนข้างประทับใจ เข้าใจแล้วว่าทำไมคนถึงมีปฏิกิริยาตอบรับที่แรงขนาดนี้ แต่ฝากคอมเมนต์ด้วยนะครับ บอกได้เลยว่าคุณได้ลองใช้ Opus 5 แล้วเป็นอย่างไรบ้าง ความเห็นของคุณเป็นอย่างไร แล้วเจอกันใหม่ในวิดีโอหน้าครับ ขอบคุณที่รับชมครับ
หมายเหตุการแปล
ความโปร่งใสเกี่ยวกับความไม่แน่นอนในต้นฉบับ
- ไม่มีช่วงที่ต้องใส่ `[ฟังไม่ชัด]` — ทุกประโยคแปลได้ครบถ้วน
อภิธานศัพท์เทคนิค
คำศัพท์และชื่อผลิตภัณฑ์ที่คงรูปภาษาอังกฤษ
| ศัพท์ | คำแปล / คำอธิบาย |
|---|---|
| Claude Opus 5 | โมเดลใหม่ล่าสุดในสาย Opus ของ Anthropic ศักยภาพระดับ Fable 5 ในราคาครึ่งหนึ่ง |
| Anthropic | บริษัทผู้พัฒนาตระกูลโมเดล Claude |
| Fable 5 / Fable | โมเดลระดับสูงสุดของ Anthropic ก่อนหน้า Opus 5 — เก่งมากแต่ guardrail เข้มงวดจนใช้งานยาก |
| Sonnet | อีกหนึ่งโมเดลในตระกูล Claude |
| Opus 4.8 | โมเดลรุ่นก่อนของ Opus 5 ที่ Opus 5 เทียบราคาและเปรียบเทียบผล |
| GPT 5.6 / GPT 5.6 Sol | โมเดลของค่ายอื่น ใช้เป็นตัวเทียบใน benchmarks และเป็นตัว audit Tom's Bench |
| Kimi K3 | โมเดลของ Moonshot ใช้เป็นตัวเทียบในงานสร้างโลก 3D |
| GLM 5.2 | โมเดลของ Zhipu ใช้เป็นตัวเทียบในงานสร้างโลก 3D |
| Hermes Agent | แพลตฟอร์ม agent ที่ใช้สั่ง execute Tom's Bench ผ่าน GPT 5.6 Sol |
| Claude Code | CLI สำหรับสั่งงาน Claude เช่น ทำเกม Mario-like |
| Codex | CLI ของ OpenAI ที่ให้ข้อมูล session สำหรับ Tom's Bench |
| guardrails | กลไกป้องกัน/จำกัดการใช้งานที่อาจเป็นปัญหา — จุดเจ็บหลักของ Fable |
| cyber verification program | โปรแกรมยืนยันตัวตนสำหรับนักวิจัยความมั่นคงปลอดภัยที่สมควร |
| self-verify / iterate | ความสามารถในการตรวจสอบงานตัวเองและวนทำซ้ำจนสำเร็จ |
| root cause analysis | การวิเคราะห์หาสาเหตุหลักของปัญหา |
| benchmarks | มาตรฐานวัดผลเพื่อเปรียบเทียบความสามารถของโมเดล |
| Frontier bench | benchmark ระดับหน้าขอบเขตความสามารถ |
| Arc-AGI 3 | benchmark ที่ Opus 5 ทำคะแนนสูงกว่าอันดับสองถึง 3 เท่า |
| Zapier automation bench | benchmark ด้านการทำงานอัตโนมัติทางธุรกิจ |
| Agentic Coding | หมวดเดียวที่ GPT 5.6 ชนะขาดลอย |
| cursor bench / AI coding agent index | benchmark ด้านการเขียนโค้ดโดยใช้ agent |
| prompt cache | แคชของบทสนทนาเพื่อลดต้นทุน/เวลา — Opus 5 รองรับการเปลี่ยน tool โดยไม่ทำลายแคช |
| mid-conversation tool changes | การสลับ tool กลางบทสนทนา |
| effort levels (low/high/extra high/max) | ระดับความพยายาม 4 ระดับในการทำงาน |
| computer vision pipeline | ชุดกระบวนการประมวลผลภาพ — ตัวอย่างการสร้าง tool เองของ Opus 5 |
| Tom's Bench | benchmark ส่วนตัวที่ผู้รีวิวสร้างจาก session จริง |
| DGX Spark | เครื่องรัน local models ของ NVIDIA ที่ Tom's Bench ตั้งใจจะรันบน |
| measurement validity | ความถูกต้องของการวัด — ปัญหาหลักที่ Opus 5 พบใน Tom's Bench |
| sub-agent | ตัว agent ย่อยที่ Sol แบ่งออกมาตรวจสอบออดิต |
| Three.js | ไลบรารี JavaScript สำหรับสร้างกราฟิก 3D บนเว็บ |
| Claude Max | แพ็กเกจสมัครสมาชิกระดับสูงของ Claude ที่ Opus 5 เป็น default |
| align / aligned | การปรับให้โมเดลทำงานสอดคล้องกับเป้าหมาย/ค่านิยมที่ตั้งไว้ |
| misaligned behavior | พฤติกรรมที่คลาดเคลื่อนจากเป้าหมาย — Opus 5 มีคะแนนต่ำสุด |
| onchainaigarage.com | เว็บไซต์จดหมายข่าวประจำสัปดาห์ของช่อง |
| @Tommy Studio | บัญชี X (Twitter) ของผู้รีวิว |
ซับไตเติ้ลภาษาไทย
ดาวน์โหลดหรือดูซับทั้งหมด
1 00:00:00,000 --> 00:00:04,807 วันนี้ Anthropic ประกาศตัว Claude Opus 5 โมเดลล่าสุดในสาย 2 00:00:04,807 --> 00:00:10,542 Opus นะครับ ซึ่งถือว่าเป็นการปิดฉากการปล่อยโมเดลทั้งห้ารุ่นของพวกเขา 3 00:00:10,542 --> 00:00:17,541 ที่มีทั้ง Sonnet และ Fable 5 ด้วย พูดถึงไฮไลต์จากโพสต์ประกาศและสิ่งที่ผมเห็นออนไลน์ 4 00:00:17,541 --> 00:00:22,011 ก็คือ Opus 5 มีศักยภาพเทียบเท่า Fable 5 ในงานส่วนใหญ่
เปิดดูซับไตเติ้ลทั้งหมด (233 segments)
1 00:00:00,000 --> 00:00:04,807 วันนี้ Anthropic ประกาศตัว Claude Opus 5 โมเดลล่าสุดในสาย 2 00:00:04,807 --> 00:00:10,542 Opus นะครับ ซึ่งถือว่าเป็นการปิดฉากการปล่อยโมเดลทั้งห้ารุ่นของพวกเขา 3 00:00:10,542 --> 00:00:17,541 ที่มีทั้ง Sonnet และ Fable 5 ด้วย พูดถึงไฮไลต์จากโพสต์ประกาศและสิ่งที่ผมเห็นออนไลน์ 4 00:00:17,541 --> 00:00:22,011 ก็คือ Opus 5 มีศักยภาพเทียบเท่า Fable 5 ในงานส่วนใหญ่ 5 00:00:22,011 --> 00:00:26,565 แต่มี guardrails (กลไกป้องกันการใช้งานผิดวัตถุประสงค์) 6 00:00:26,565 --> 00:00:31,203 ที่น้อยกว่า ซึ่งน่าจะเป็นเรื่องดีครับ ปัญหาหลักของผมกับ 7 00:00:31,203 --> 00:00:35,251 Fable คือมันเป็นโมเดลที่เยี่ยมมาก แต่ guardrails 8 00:00:35,251 --> 00:00:40,227 นี่น่ารำคาญจริง ๆ ผมโดนสะดุดบ่อยมากแม้แค่ทำงานเขียนโค้ดปกติ 9 00:00:40,227 --> 00:00:44,275 แค่นั้นอย่างเดียวก็ทำให้ผมค่อนข้างหวังกับ Opus 5 10 00:00:44,275 --> 00:00:48,998 แล้วครับ เพราะเขาบอกว่ามันจะมี guardrails ระดับใกล้เคียง 11 00:00:48,998 --> 00:00:54,732 Opus 4.8 ส่วนใหญ่อยู่บริเวณ cybersecurity (ความมั่นคงปลอดภัยไซเบอร์) 12 00:00:54,732 --> 00:00:58,780 ซึ่งผมก็ไม่ได้ทำงานในแวดวงนั้น ก็น่าจะไม่มีปัญหา 13 00:00:58,780 --> 00:01:02,997 ดังนั้นไฮไลต์ก็ตามที่ว่า คือมันเก่งเทียบเท่า Fable 14 00:01:02,997 --> 00:01:07,467 5 แต่ราคาถูกกว่าครึ่ง ซึ่งก็เป็นเรื่องที่ดีแน่นอนครับ 15 00:01:07,467 --> 00:01:11,768 ในวิดีโอนี้จะเป็นแบบ _first look_ ครั้งแรก ๆ นะครับ 16 00:01:11,768 --> 00:01:15,731 เราจะลองสั่งงานทันทีเลย และเป็นงานที่ผมเคยทำกับ 17 00:01:15,731 --> 00:01:19,948 Fable 5 มาแล้วด้วย จะได้เทียบกันตรง ๆ แล้วผมจะเจาะ 18 00:01:19,948 --> 00:01:24,081 benchmarks (มาตรฐานวัดผล) และฟีเจอร์เด่น ๆ ของมัน 19 00:01:24,081 --> 00:01:28,635 พร้อมความเปลี่ยนแปลงทางเทคนิค แล้วปิดท้ายด้วยอีกไม่กี่ 20 00:01:28,635 --> 00:01:33,189 task ครับ เริ่มกันเลย และถ้าชอบวิดีโอนี้ ฝากติดตามผมบน 21 00:01:33,189 --> 00:01:37,827 X ที่บัญชี Tommy Studio ด้วยนะครับ ผมมักจะโพสต์คลิปสั้น 22 00:01:37,827 --> 00:01:42,044 ๆ เกี่ยวกับข่าว AI และฟีเจอร์ต่าง ๆ ของ agent บ่อย 23 00:01:42,044 --> 00:01:48,875 ๆ รวมถึงบทความที่เจาะลึกขึ้นด้วย และอย่าลืมสมัครรับจดหมายข่าวฟรีประจำสัปดาห์ของผม 24 00:01:48,875 --> 00:01:54,609 ที่ผมเขียนด้วยมือและออกทุกวันศุกร์ คอลัมน์นี้คุณจะได้อ่านความเห็นตรง 25 00:01:54,609 --> 00:02:00,513 ๆ ของผมเกี่ยวกับข่าว AI, โมเดล, งานวิจัยล่าสุด พร้อมเผยโฉมโปรเจกต์ใหม่ 26 00:02:00,513 --> 00:02:05,320 ๆ ที่ผมกำลังทำอยู่ก่อนใคร สมัครได้ที่ onchainaigarage.com 27 00:02:05,320 --> 00:02:09,621 ลิงก์อยู่ในคำอธิบายครับ ทีนี้คุณอาจจะจำได้จากตอนที่ 28 00:02:09,621 --> 00:02:13,837 Fable ออกใหม่ ๆ ว่า task ที่ผมให้มันทำคือเอา asset 29 00:02:13,837 --> 00:02:18,644 เกมเก่า ๆ จำนวนหนึ่งจากเกมแนว strategy สไตล์ Civilization 30 00:02:18,644 --> 00:02:22,692 ที่ผมเคยทำไว้ — หน้าตาประมาณนี้ครับ สนุกมากตอนทำ 31 00:02:22,692 --> 00:02:27,331 แต่ task ที่ให้ Fable ทำคือลองเอามาสร้างใหม่ในรูปแบบเกม 32 00:02:27,331 --> 00:02:32,053 side-scroller สไตล์ Super Mario และนี่คือสิ่งที่มันทำได้ 33 00:02:32,053 --> 00:02:36,186 ซึ่งผมก็ประทับใจพอสมควร ทีนี้เราจะเอา task นี้ตรง 34 00:02:36,186 --> 00:02:40,655 ๆ ไปให้ Opus 5 ทำ แล้วดูว่ามันจะได้อะไรออกมา เราจะให้ 35 00:02:40,655 --> 00:02:46,474 asset ชุดเดียวกันเป๊ะ แล้วดูว่าดีไซน์จะคล้ายกันหรืออาจจะดีกว่าด้วยซ้ำ 36 00:02:46,474 --> 00:02:50,775 ทีนี้อย่างที่เห็น เราอยู่ใน Claude Code ที่ใช้ Opus 37 00:02:50,775 --> 00:02:55,161 5 แล้วก็ ผมจะใส่ prompt ลงไป ผมบอกมันว่า “เช็ค asset 38 00:02:55,161 --> 00:02:59,546 ในโฟลเดอร์นั้นด้วย คุณต้องทำเกม side-scrolling สไตล์ 39 00:02:59,546 --> 00:03:03,678 Mario แค่หนึ่งด่านเป็น demo โดยใช้ asset เหล่านี้ 40 00:03:03,678 --> 00:03:07,642 อย่าไปอ้างอิงไฟล์หรือโฟลเดอร์อื่นในไดเรกทอรีนี้ 41 00:03:07,642 --> 00:03:12,196 ต้องเป็นของคุณเอง คุณตัดสินใจเชิงสร้างสรรค์ได้ตามสมควร 42 00:03:12,196 --> 00:03:16,413 และอย่าถามคำถามเพิ่ม” นี่เป็นครั้งแรกที่ผมใช้ Opus 43 00:03:16,413 --> 00:03:20,461 5 จริง ๆ ก็ลองดูสิว่าจะได้อะไรบ้าง เสร็จแล้วครับ 44 00:03:20,461 --> 00:03:26,533 ใช้เวลาสักพักเหมือนกัน ใช้ไป 44 นาทีเลยนะ แสดงว่าเป็นโมเดลที่อดทนมากจริง 45 00:03:26,533 --> 00:03:31,846 ๆ มาดูผลงานกัน นี่ไง “Hex Run” หน้าเมนูชื่อเกมนี่ดูดีเลยทีเดียว 46 00:03:31,846 --> 00:03:37,665 กด Enter เพื่อเริ่มเลย เอาล่ะ เล่นกัน โอ้โว้ นี่เป็นเกมที่สมบูรณ์จริง 47 00:03:37,665 --> 00:03:42,978 ๆ เลยนะ ปิดเสียงก่อนได้ไหม ที่แล้ว ๆ ต้องเลือกเสียงนั้นเสียงนี้ 48 00:03:42,978 --> 00:03:47,110 ลองเลือกตัวละครลิงดู — โอ้ ดูนั่นสิ ทำฉากได้ดีมาก 49 00:03:47,110 --> 00:03:51,495 ๆ เขาเอา hex tile พวกนั้น — คุณเห็น hex ของเกมใช่ไหม 50 00:03:51,495 --> 00:03:56,218 — มาขยายใหญ่ทำเป็นฉาก ซึ่งเจ๋งมาก ภาพอาจจะกระตุกนิดหน่อย 51 00:03:56,218 --> 00:04:03,387 แต่กราฟิกดูดีกว่าเดิมแน่นอน โอ้ ได้ดาบด้วย นี่เป็นเกมที่สมบูรณ์กว่าที่ผมขอไปเยอะเลยนะ 52 00:04:03,387 --> 00:04:07,350 ซึ่งผมขอแค่เกมสไตล์ Super Mario มีลูกไฟยิงใส่ผม 53 00:04:07,350 --> 00:04:11,989 มีแท่นลอย ๆ อยู่ด้วย ฉากทุกอย่างใช้ asset ชุดนั้นหมดเลย 54 00:04:11,989 --> 00:04:16,205 เอาล่ะ เช็กพอยต์ ส่วนของ Fable นั้นมันสร้างเป็นชุด 55 00:04:16,205 --> 00:04:21,350 ๆ โอ้ ผมตายแล้ว เก่งจริง ๆ ครับ ส่วนตัวผมวางอันนี้ไว้เหนือของ 56 00:04:21,350 --> 00:04:25,398 Fable แน่นอน เป็นเกมที่สมบูรณ์กว่ามาก น่าสนใจมาก 57 00:04:25,398 --> 00:04:30,120 ๆ สำหรับ prompt ง่าย ๆ แค่นี้ ผมไม่ได้ให้แผนละเอียดเลยนะ 58 00:04:30,120 --> 00:04:35,433 เป็นแค่ prompt สองบรรทัดแต่ได้ผลงานขนาดนี้มา น่าประทับใจมากครับ 59 00:04:35,433 --> 00:04:41,843 ทีนี้ผมขอทำ task เล็ก ๆ นี้ให้จบก่อน แล้วเราจะเข้าสู่ช่วงนำเสนอที่ผมจะอธิบาย 60 00:04:41,843 --> 00:04:47,240 benchmarks และทำงานเพิ่มอีกนะครับ เราเห็นแล้วว่ามันทำอะไรได้บ้าง 61 00:04:47,240 --> 00:04:51,541 ทีนี้มาคุยกันเรื่อง Claude Opus 5 กันสักหน่อย _Near 62 00:04:51,541 --> 00:04:55,673 frontier intelligence at half the frontier price_ 63 00:04:55,673 --> 00:04:59,890 (เกือบเท่าระดับ frontier ในราคาครึ่งหนึ่ง) และเป็น 64 00:04:59,890 --> 00:05:04,191 default ใหม่บน Claude Max นี่คือไฮไลต์เลยใช่ไหมครับ 65 00:05:04,191 --> 00:05:09,251 เขาบอกว่ามีความเฉียบขาดเทียบเท่า Fable 5 แต่ราคาถูกกว่าครึ่ง 66 00:05:09,251 --> 00:05:13,552 Anthropic เรียกมันว่าเป็น _thoughtful and proactive 67 00:05:13,552 --> 00:05:18,528 model_ (โมเดลที่รอบคอบและชิงคิดชิงทำ) น่าสนใจตรงที่ใช้คำว่า 68 00:05:18,528 --> 00:05:22,913 proactive หลายครั้งเลย มันถูกออกแบบมาให้ self-verify 69 00:05:22,913 --> 00:05:27,298 (ตรวจสอบตัวเอง) และ iterate (วนทำซ้ำ) คือมันจะวางแผน 70 00:05:27,298 --> 00:05:31,515 ตรวจงานของตัวเอง แล้วผลักดันจนงานเสร็จ ราคาเท่ากับ 71 00:05:31,515 --> 00:05:37,503 Opus 4.8 นะครับ คือ $5 input, $25 output ซึ่งก็เป็นมาตรฐานของโมเดลระดับ 72 00:05:37,503 --> 00:05:42,225 frontier และวางจำหน่ายแล้ววันนี้ทุกที่เลย ทีนี้ตำแหน่งบน 73 00:05:42,225 --> 00:05:46,189 benchmarks นี่ก็น่าสนใจดี กราฟนี้แสดงให้เห็นว่า 74 00:05:46,189 --> 00:05:50,321 Opus 5 ทำได้ดีมากเทียบกับโมเดลอื่น ๆ ชนะ Opus 4.8 75 00:05:50,321 --> 00:05:54,960 แน่นอน ชนะ Fable 5 ในเกือบทุกตัว แม้จะน้อยก็ตามก็ยังชนะ 76 00:05:54,960 --> 00:05:59,514 มีอยู่ตัวเดียวคือ Agentic Coding ที่ GPT 5.6 ชนะขาดลอย 77 00:05:59,514 --> 00:06:03,562 ส่วนผลรวมแล้วคะแนนสูงกว่า Opus 4.8 เป็นสองเท่าบน 78 00:06:03,562 --> 00:06:09,465 Frontier bench ซึ่งผมว่า Opus 4.8 เป็นโมเดลที่ดีมากอยู่แล้วในแบบของมัน 79 00:06:09,465 --> 00:06:13,513 ก็เป็นเครื่องการันตีที่ดี อย่างที่บอก ไม่ต่างจาก 80 00:06:13,513 --> 00:06:17,645 Fable 5 มากใน benchmarks เหล่านี้ โดยเฉพาะ cursor 81 00:06:17,645 --> 00:06:22,031 bench ครองอันดับหนึ่งใน AI coding agent index แบบรวม 82 00:06:22,031 --> 00:06:27,259 ความก้าวกระโดดที่ใหญ่ที่สุดอยู่ที่ benchmarks ด้านการเขียนโค้ด 83 00:06:27,259 --> 00:06:31,307 ทั้งเรื่อง reasoning (การให้เหตุผล) และ computer 84 00:06:31,307 --> 00:06:36,789 use (การควบคุมคอมพิวเตอร์) คะแนนสูงกว่าโมเดลอันดับสองถึงสามเท่าใน 85 00:06:36,789 --> 00:06:41,681 Arc-AGI 3 ซึ่งบ้ามาก มี pass rate สูงกว่าโมเดลอันดับสองถึง 86 00:06:41,681 --> 00:06:48,512 1.5 เท่าใน Zapier automation bench ซึ่งน่าสนใจสำหรับงานอัตโนมัติทางธุรกิจประจำวัน 87 00:06:48,512 --> 00:06:52,560 น่าจะเป็นตัวเลือกที่ดี โดยเฉพาะราคาถูกกว่า Fable 88 00:06:52,560 --> 00:06:56,861 แม้รวม ๆ แล้วจะยังแพงอยู่ แต่ก็ถูกกว่า Fable อยู่ดี 89 00:06:56,861 --> 00:07:01,752 ตัวเด่นคือมันตรวจสอบงานของตัวเอง นี่คือจุดแข็งที่เขาพูดถึง 90 00:07:01,752 --> 00:07:06,475 มันไปถึงระดับประสิทธิภาพของ Fable โดยใช้ต้นทุนครึ่งหนึ่ง 91 00:07:06,475 --> 00:07:10,860 โดยเฉพาะจุดแข็งเรื่องการดีบักที่ยากและการวิเคราะห์หา 92 00:07:10,860 --> 00:07:14,992 root cause (สาเหตุหลัก) เดี๋ยวเราจะลองทดสอบดูบ้าง 93 00:07:14,992 --> 00:07:19,209 แต่นั่นคือสิ่งที่เขาบอก มี self-verification loops 94 00:07:19,209 --> 00:07:23,510 (ลูปตรวจสอบตัวเอง) ซึ่งสำคัญมาก และมันสร้าง tooling 95 00:07:23,510 --> 00:07:28,654 (เครื่องมือ) ของตัวเองได้ด้วย ซึ่งเจ๋งมาก มันเคยสาธิตการเขียน 96 00:07:28,654 --> 00:07:32,955 computer vision pipeline บน Frontier bench เพื่อแก้ 97 00:07:32,955 --> 00:07:38,353 task หนึ่ง นี่คือการใช้เครื่องมือแบบสร้างสรรค์ ไม่ใช่แค่เรียกใช้ 98 00:07:38,353 --> 00:07:42,569 tool ธรรมดานะครับ และมี visual output ที่ดีขึ้นมาก 99 00:07:42,569 --> 00:07:47,376 artifacts, แอนิเมชัน, เกม และงาน 3D ดีขึ้นอย่างเห็นได้ชัด 100 00:07:47,376 --> 00:07:51,846 เดี๋ยวเราจะลองงาน 3D ท้ายวิดีโอด้วย ว่ามันทำได้แค่ไหน 101 00:07:51,846 --> 00:07:55,978 ซึ่งก็เป็นสัญญาณที่ดี อีกสองไวน์ที่เงียบ ๆ สำหรับ 102 00:07:55,978 --> 00:08:00,532 agent bench ไม่ได้แฟลชซ่า แต่เป็นของจริงครับ มันรองรับ 103 00:08:00,532 --> 00:08:04,833 _mid-conversation tool changes_ คือคุณสามารถสลับว่า 104 00:08:04,833 --> 00:08:09,134 Claude จะใช้ tool ตัวไหนได้กลางบทสนทนาโดยที่ prompt 105 00:08:09,134 --> 00:08:13,435 cache ไม่เสีย และนี่คือที่มาของการประหยัดค่าใช้จ่าย 106 00:08:13,435 --> 00:08:17,821 เพราะก่อนหน้านี้การเปลี่ยนรายการ tool จะเป็นการทำลาย 107 00:08:17,821 --> 00:08:23,387 cache prefix ทั้งหมดทันที อย่างที่บอก นี่เป็นการประหยัดต้นทุนและลด 108 00:08:23,387 --> 00:08:29,543 latency ไปพร้อมกันสำหรับ agent run ที่ยาวนาน ซึ่งเป็นสิ่งที่ผมอยากเห็นมาก 109 00:08:29,543 --> 00:08:33,507 ๆ มี 4 effort levels (ระดับความพยายาม) คือ low, 110 00:08:33,507 --> 00:08:37,639 high, extra high และ max คาดว่าน่าจะใช้ high เป็น 111 00:08:37,639 --> 00:08:41,687 default เป็นหลัก และมีโปรแกรม cyber verification 112 00:08:41,687 --> 00:08:46,410 ที่ขยายการเข้าถึงสำหรับงานวิจัยความมั่นคงปลอดภัยที่สมควร 113 00:08:46,410 --> 00:08:50,542 โดยมีการแทรกแซงน้อยกว่า Fable 5 ราว 85% เลยนะครับ 114 00:08:50,542 --> 00:08:55,265 นั่นก็เป็นสิ่งที่ผมอยากเห็นครับ คือ guardrails ที่น้อยลง 115 00:08:55,265 --> 00:09:00,746 และปล่อยให้ผมทำอะไรได้มากขึ้น ที่สำคัญนะครับ มันเป็นโมเดลที่มีการ 116 00:09:00,746 --> 00:09:06,481 _align_ (ปรับให้เข้ากับเป้าหมายและค่านิยม) ดีที่สุดเท่าที่เขาเคยทำมา 117 00:09:06,481 --> 00:09:12,384 มีคะแนนต่ำสุดในเรื่องพฤติกรรมที่ _misaligned_ (คลาดเคลื่อนจากเป้าหมาย) 118 00:09:12,384 --> 00:09:20,059 เมื่อเทียบกับโมเดลรุ่นล่าสุดหลาย ๆ ตัว และอันดับหนึ่งในการยึดมั่นตามหลักการตามรัฐธรรมนูญของ 119 00:09:20,059 --> 00:09:26,890 Claude ถ้าคุณสนใจเรื่องนี้นะครับ แต่อย่างไรก็ตามมันก็ถูกจำกัดไว้โดยเจตนาในสองด้าน 120 00:09:26,890 --> 00:09:32,709 คือเรื่องการ _vulnerability exploitation_ (การใช้ประโยชน์จากช่องโหว่) 121 00:09:32,709 --> 00:09:37,094 แสดงว่าเขายังระมัดระวังเรื่องที่มันจะทำอะไรได้อยู่ดี 122 00:09:37,094 --> 00:09:41,395 ทีนี้เรื่องราคา นี่ก็เป็นประเด็นใหญ่เหมือนกันนะครับ 123 00:09:41,395 --> 00:09:45,612 _Frontier adjacent at Opus prices_ อยู่ในระดับใกล้ 124 00:09:45,612 --> 00:09:49,744 frontier ในราคาระดับ Opus มีราคามาตรฐาน $5 input, 125 00:09:49,744 --> 00:09:55,310 $25 output ตามที่บอกไปแล้ว เทียบกับ Fable ที่เป็นสองเท่าของราคานี้ 126 00:09:55,310 --> 00:09:59,443 ก็คือมีเรื่องให้คุยครับ เขาเรียกมันว่าเป็น _value 127 00:09:59,443 --> 00:10:03,659 model_ ที่ไม่ใช่การลดทอนคุณภาพจริง ๆ แล้วตามที่บอก 128 00:10:03,659 --> 00:10:08,045 มันเทียบเท่ากันในแง่ของ benchmarks นี้แทบจะทุกบรรทัด 129 00:10:08,045 --> 00:10:13,611 และเอาชนะ Fable ได้ในบางตัวด้วยซ้ำ และพอจะเล่าตามที่เห็นคนพูดกันบน 130 00:10:13,611 --> 00:10:19,261 Twitter ก็คือมันได้รับการตอบรับที่ดีมาก คนบอกว่าผลลัพธ์ใกล้เคียงกับ 131 00:10:19,261 --> 00:10:26,261 Fable แต่เอาล่ะครับ เรามาลองให้มันทำ task อีกสักหน่อยแล้วดูว่ามันจะเทียบเท่าจริงไหม 132 00:10:26,261 --> 00:10:30,730 ทีนี้เราอยู่ใน Opus แล้ว task ต่อไปที่ผมจะให้มันทำคือ 133 00:10:30,730 --> 00:10:34,694 — ผมเคยสร้างสิ่งนี้ขึ้นมาเอง เรียกมันว่า “Tom's 134 00:10:34,694 --> 00:10:39,079 Bench” ครับ คือผมเอาข้อมูล session ทั้งหมดจาก Claude 135 00:10:39,079 --> 00:10:43,296 Code, Codex และ Hermes Agent มาสร้างเป็น benchmark 136 00:10:43,296 --> 00:10:48,778 ของตัวเอง โดยอิงจากวิธีที่ผมใช้ AI และ agent นั่นคือแนวคิดตั้งต้น 137 00:10:48,778 --> 00:10:52,741 ผมว่ามันเป็นไอเดียที่ดีนะ ผมออกวิดีโอไปครึ่งทาง 138 00:10:52,741 --> 00:10:58,139 แต่ทำต่อไม่ไหวเพราะต้องรันบน local models (โมเดลที่รันบนเครื่อง) 139 00:10:58,139 --> 00:11:03,199 แล้วเจอปัญหาเพียบเลย คือมันไม่ค่อยได้ผลตามที่คาดหวังเท่าไหร่ 140 00:11:03,199 --> 00:11:07,921 สรุปคือการทำ benchmark ที่เหมาะสมจริง ๆ มันยากกว่าที่คิด 141 00:11:07,921 --> 00:11:13,572 แต่ผมสร้างมันขึ้นมาด้วย Fable เป็นหลักก่อน แล้วจึงส่งต่อให้ทีมถัดไป 142 00:11:13,572 --> 00:11:17,535 จากนั้นผมเอาให้ Sol — คือ GPT 5.6 Sol — มาออดิต 143 00:11:17,535 --> 00:11:22,174 แล้วลองสั่งให้ execute ผ่าน Hermes Agent และอย่างที่บอก 144 00:11:22,174 --> 00:11:27,655 มันมีปัญหาเยอะมาก ผมเลยสงสัยว่า Opus 5 จะสามารถออดิตสิ่งนี้ได้ไหม 145 00:11:27,655 --> 00:11:31,788 เพราะโมเดลก่อนหน้าบอกว่าเสร็จแล้ว บอกว่าไม่มีบั๊ก 146 00:11:31,788 --> 00:11:36,342 ผมเลยอยากได้ความเห็นที่สองจาก Opus 5 หน่อย ผมเลยถามว่า 147 00:11:36,342 --> 00:11:41,064 “คุณช่วยออดิต Tom's Bench เพื่อหาบั๊กและจุดบกพร่องได้ไหม 148 00:11:41,064 --> 00:11:45,450 ตัวนี้ตั้งใจให้เป็น benchmark รันบน DGX Spark สำหรับ 149 00:11:45,450 --> 00:11:51,437 local models โดยอิงจากข้อมูล session ของผมเอง” ทีนี้ออดิตกลับมาแล้วครับ 150 00:11:51,437 --> 00:12:00,208 และมันค่อนข้าง _damning_ (รุนแรง) เลยทีเดียว โดยรวมแล้ววิศวกรรมการสร้างระบบถือว่าทำมาอย่างระมัดระวังจริง 151 00:12:00,208 --> 00:12:05,859 ๆ แต่ปัญหาหนักอยู่ที่ _measurement validity_ (ความถูกต้องของการวัด) 152 00:12:05,859 --> 00:12:11,340 ไม่ใช่ที่การอิมพลีเมนต์ แต่มี critical errors (ข้อผิดพลาดร้ายแรง) 153 00:12:11,340 --> 00:12:15,726 อยู่หลายจุด หนึ่งในสามของชุดทดสอบเป็นของเกะกะ ตรงที่ 154 00:12:15,726 --> 00:12:20,448 18 จาก 55 รายการไม่เคยได้คะแนนเกินศูนย์เลย ซึ่งเป็นปัญหา 155 00:12:20,448 --> 00:12:26,099 — อีกเก้ารายการ fork items (รายการแตกสาขา) เป็นไปไม่ได้เลยที่จะผ่าน 156 00:12:26,099 --> 00:12:30,484 ส่วนที่เหลือของ fork track ถูกจำกัดคะแนนสูงสุดไว้ที่ 157 00:12:30,484 --> 00:12:36,134 0.5 และ text contract เป็นแบบ all-or-nothing (ผ่านหรือตกอย่างเดียว) 158 00:12:36,134 --> 00:12:41,785 ตัว judge (ผู้ตัดสิน) อิ่มตัวแล้ว และไม่มีข้อมูลสำหรับจัดอันดับด้วย 159 00:12:41,785 --> 00:12:46,676 นี่คือปัญหาจริง ๆ ครับ แล้วก็มี _high_ ที่เป็นบั๊กโค้ดจริง 160 00:12:46,676 --> 00:12:51,399 ๆ ด้วย บางอย่างนะครับ ผมก็ไม่ได้คาดหวังว่า Sol จะเห็นเลย 161 00:12:51,399 --> 00:12:55,447 แต่บั๊กโค้ดจริงนั้น ผมคาดว่าน่าจะเห็นแน่นอน เช่น 162 00:12:55,447 --> 00:12:59,832 web search ไม่มี limit parameter, ส่วน code identity 163 00:12:59,832 --> 00:13:04,892 นั้นเปราะบาง, read path ถูก reject ตลอด นี่เป็นปัญหาหนักจริง 164 00:13:04,892 --> 00:13:08,940 ๆ สรุปแล้วเจอ critical ถึง medium ทั้งหมด 14 ข้อ 165 00:13:08,940 --> 00:13:15,181 และมีแผนที่น่าจะแก้ก่อนอยู่ด้วย ทีนี้สิ่งที่ผมจะทำคือคัดลอกผลการประเมินนี้ 166 00:13:15,181 --> 00:13:19,650 ส่งกลับไปให้ Sol แล้วดูว่ามันจะบอกว่าอะไร ผมเลยบอกว่า 167 00:13:19,650 --> 00:13:23,698 ผมมีออดิตอยู่ ตอนนี้ผมอยู่ใน Hermes Agent โดยใช้ 168 00:13:23,698 --> 00:13:29,770 GPT 5.6 Sol — “รีวิวและยืนยันข้อค้นพบเหล่านี้ บอกผมว่าข้อไหนจริงหรือเท็จ 169 00:13:29,770 --> 00:13:34,240 อย่าสมมติว่าทุกข้อเป็นจริงนะ เพราะบางข้ออาจจะเป็นเท็จ 170 00:13:34,240 --> 00:13:38,288 ให้ผมการตัดสินด้วยว่ามีข้อค้นพบที่ถูกต้องกี่ข้อ” 171 00:13:38,288 --> 00:13:42,252 มันจะแบ่งเป็น sub-agent หลายตัวเลยทีเดียว ทีนี้ 172 00:13:42,252 --> 00:13:46,974 Sol ก็ _push back_ (ผลักกลับ/โต้กลับ) นิดหน่อย โดยบอกว่า 173 00:13:46,974 --> 00:13:52,962 headline ที่ว่า benchmark ไม่สามารถแยกแยะความแตกต่างระหว่างโมเดลได้นั้น 174 00:13:52,962 --> 00:13:57,179 มันแรงเกินไปและไม่ได้รับการพิสูจน์ แต่อย่างไรก็ตาม 175 00:13:57,179 --> 00:14:02,239 มันก็มีข้อบกพร่องร้ายแรงเหมือนกัน ตามจำนวนเข้มข้นจริงจากทั้ง 176 00:14:02,239 --> 00:14:07,467 14 หัวข้อ 12 ข้อเป็นจริงโดยสมบูรณ์ และอีก 8 ข้อเป็นจริงบางส่วน 177 00:14:07,467 --> 00:14:12,696 และศูนย์ข้อเป็นเท็จทั้งหมด ดังนั้นถึงแม้มันจะพยายามโต้นิดหน่อย 178 00:14:12,696 --> 00:14:17,250 แต่สุดท้ายแล้วข้อค้นพบเหล่านี้ส่วนใหญ่ก็เป็นจริงนะครับ 179 00:14:17,250 --> 00:14:22,226 ข้อค้นพบ _critical_ ที่เป็นจริงบางส่วนและเป็นจริงโดยสมบูรณ์ 180 00:14:22,226 --> 00:14:27,033 ก็เป็นปัญหาจริง ๆ บั๊กเหล่านี้เป็นจริง และเป็นจริงบางส่วน 181 00:14:27,033 --> 00:14:31,755 มันยืนยันคำติชมไว้หลายข้อมาก แต่ผมพบว่าบางคำกล่าวอ้างที่ 182 00:14:31,755 --> 00:14:36,394 Opus ทำขึ้นนั้นไม่มีข้อมูลสนับสนุน เช่นที่ว่า benchmark 183 00:14:36,394 --> 00:14:40,526 ไม่มีความสามารถในการแยกแยะเลย แต่บั๊กและปัญหาจริง 184 00:14:40,526 --> 00:14:45,671 ๆ นั้นได้รับการยืนยันแล้ว ตลกดีครับ Sol คอยติเตียนอยู่ตลอดว่า 185 00:14:45,671 --> 00:14:53,514 ภาษาของ Opus นั้นแรงกว่าหลักฐานที่มีอยู่เสมอ มันจึงเป็นปัญหาเรื่องโทนมากกว่าเรื่องข้อเท็จจริง 186 00:14:53,514 --> 00:14:57,477 อย่างไรก็ตาม สิ่งนี้แสดงว่า — ผมคิดว่า — Opus 5 187 00:14:57,477 --> 00:15:01,525 ทำงานดีบักได้ดีมากจริง ๆ ทีนี้ผมจะทำ Tom's Bench 188 00:15:01,525 --> 00:15:05,573 ต่อ และถ้าได้ผลดีก็จะปล่อยออกไปให้ดูนะครับ ทีนี้ 189 00:15:05,573 --> 00:15:10,886 task สุดท้ายคือการสร้างโลก 3D และนี่เป็นอันที่ผมเคยทำมาก่อนแล้ว 190 00:15:10,886 --> 00:15:16,199 นี่คือ prompt ของมัน: “คุณอยู่ในไดเรกทอรีเปล่าที่เพิ่งสร้างใหม่ 191 00:15:16,199 --> 00:15:21,259 คุณต้องสร้างโลกแฟนตาซี 3D ใน Three.js โดยมีของให้แค่โฟลเดอร์ 192 00:15:21,259 --> 00:15:25,476 asset เล็ก ๆ ที่มีรูปอ้างอิงอยู่บ้าง มีพวก texture 193 00:15:25,476 --> 00:15:29,608 อยู่บ้าง ประมาณนี้” และนี่เป็น task ที่ผมเคยทำกับ 194 00:15:29,608 --> 00:15:33,825 GLM 5.2 เคยทำกับ Kimi K3 และเคยทำกับ Opus 4.8 ด้วย 195 00:15:33,825 --> 00:15:38,632 ก็จะได้เป็นการเทียบผลที่ดีอีกครั้ง ถ้าจำได้ นี่คือสิ่งที่ 196 00:15:38,632 --> 00:15:43,186 Opus — Opus 4.8 นะครับ — ทำขึ้นมา ผมว่าหน้าตาดีทีเดียว 197 00:15:43,186 --> 00:15:48,077 และนี่คือสิ่งที่ GLM 5.2 ทำขึ้น ผมว่าไม่ค่อยประณีตเท่าไหร่ 198 00:15:48,077 --> 00:15:53,390 แต่ก็ยัง execute ได้อยู่ดี มีตัวละครโบกมือด้วย และนี่คือสิ่งที่ 199 00:15:53,390 --> 00:15:59,547 Kimi K3 ทำได้ ซึ่งครั้งที่แล้วผมว่าเป็นอันที่ดีที่สุดในสามตัวจนถึงตอนนั้น 200 00:15:59,547 --> 00:16:04,016 แต่มาดูกันว่า Opus 5 จะทำได้แค่ไหน มีเอฟเฟกต์แสงที่ดี 201 00:16:04,016 --> 00:16:08,233 ต้นไม้ทำได้ดีมากสำหรับข้อมูลที่ให้ไป เสร็จแล้วครับ 202 00:16:08,233 --> 00:16:12,618 ใช้เวลาไป 19 นาทีทั้งหมด แต่มาดูผลงานกัน “The Hollow 203 00:16:12,618 --> 00:16:16,751 of Ember Watch” มาเข้า _Hollow_ นี้กัน มีเอฟเฟกต์ 204 00:16:16,751 --> 00:16:21,642 fade in ที่น่าสนใจดี ว้าว นี่มันบ้าจริง ๆ ครับ ประทับใจมาก 205 00:16:21,642 --> 00:16:26,618 เมื่อกี้ผมเพิ่งโชว์ให้ดูผลงานครั้งก่อน ๆ นี่มันคนละระดับเลย 206 00:16:26,618 --> 00:16:31,593 เขาสร้าง landmark (จุดสังเกต) นี้ขึ้นมาด้วย กดเข้าไปได้ด้วย 207 00:16:31,593 --> 00:16:37,497 — “จะเอาไม้มาจากไหน?” — ครับ มันต่างจากที่เคยเห็นมาก่อนอย่างเห็นได้ชัด 208 00:16:37,497 --> 00:16:41,713 เห็นไหมครับ แม้จะยังไม่สมบูรณ์แบบเรื่องพวกนี้ก็ตาม 209 00:16:41,713 --> 00:16:45,761 แต่มันรู้สึกเหมือนเป็นโลกที่อุดมสมบูรณ์จริง ๆ มี 210 00:16:45,761 --> 00:16:50,568 texture มีมิติที่ต่างกัน เขาสร้างเนินเขาเล็ก ๆ ขึ้นมาด้วย 211 00:16:50,568 --> 00:16:54,785 มี _traveler's fire_ (กองไฟนักเดินทาง) ตัวละครต่าง 212 00:16:54,785 --> 00:17:01,110 ๆ อยู่ครบหมด วิธีที่เขาสร้างมันขึ้นมานี่รู้สึกเหมือนเป็นโลกที่สมจริงกว่ามาก 213 00:17:01,110 --> 00:17:05,917 และมีบ่อน้ำเล็ก ๆ อยู่ตรงนี้ด้วย ทุกอย่างมาประกอบกันได้ดี 214 00:17:05,917 --> 00:17:10,893 เส้นทางนี้ก็ดูเป็นธรรมชาติ กระโดดได้ไหม? กระโดดลงน้ำได้ไหม? 215 00:17:10,893 --> 00:17:16,543 อาจจะไม่ได้นะ บ่อน้ำนี่ดูดีเลย ว้าว ครับ ผมว่านี่ชัดเจนว่าดีกว่าของ 216 00:17:16,543 --> 00:17:21,772 Opus 4.8 แน่นอน หรือแม้แต่ของ Kimi K3 ซึ่งผมว่าทำได้ดีอยู่แล้ว 217 00:17:21,772 --> 00:17:27,085 แต่อันนี้พาขึ้นไปอีกระดับเลย ประทับใจกับความสามารถในการสร้างโลก 218 00:17:27,085 --> 00:17:31,386 3D ของเขามากครับ ทีนี้ก็คงจะมีแค่นี้ครับ แค่ _first 219 00:17:31,386 --> 00:17:35,856 look_ ครั้งแรกสำหรับ Opus 5 น่าจะได้ใช้งานบ่อยพอสมควร 220 00:17:35,856 --> 00:17:41,337 ผมยังชอบโมเดลของ Claude อยู่มากนะครับ Fable เป็นโมเดลที่ยอดเยี่ยม 221 00:17:41,337 --> 00:17:45,976 แต่มีปัญหาเรื่อง guardrail เยอะ หลายครั้งผมเลยข้ามไปใช้ 222 00:17:45,976 --> 00:17:50,530 4.8 แทน แต่ตอนนี้ผมใช้ Opus 5 ได้แล้ว ทีนี้ก็เป็นอันจบ 223 00:17:50,530 --> 00:17:55,337 _first look_ ของ Claude Opus 5 ครับ คงได้เห็นผมใช้งานบ่อย 224 00:17:55,337 --> 00:17:59,638 ๆ ผมทราบว่าคนมีความเห็นที่หนักแน่นเกี่ยวกับโมเดลของ 225 00:17:59,638 --> 00:18:04,192 Claude แต่ผมยังคิดว่ามันเป็นโมเดลที่มีความสามารถสูงมาก 226 00:18:04,192 --> 00:18:10,854 Fable เป็นโมเดลที่ยอดเยี่ยม แต่ปัญหาเดียวคือคุณใช้งานได้แค่ครึ่งเดียวเพราะปัญหา 227 00:18:10,854 --> 00:18:15,745 guardrail ซึ่งดูเหมือนว่า Opus 5 จะผ่อนปรนเรื่องนี้มากกว่า 228 00:18:15,745 --> 00:18:20,131 คุณคงได้เห็นผมใช้ Opus 5 บ่อย ๆ นะครับ แต่นี่เป็นแค่ 229 00:18:20,131 --> 00:18:24,685 _first look_ ของโมเดล และจนถึงตอนนี้ผมค่อนข้างประทับใจ 230 00:18:24,685 --> 00:18:29,070 เข้าใจแล้วว่าทำไมคนถึงมีปฏิกิริยาตอบรับที่แรงขนาดนี้ 231 00:18:29,070 --> 00:18:33,202 แต่ฝากคอมเมนต์ด้วยนะครับ บอกได้เลยว่าคุณได้ลองใช้ 232 00:18:33,202 --> 00:18:37,588 Opus 5 แล้วเป็นอย่างไรบ้าง ความเห็นของคุณเป็นอย่างไร 233 00:18:37,588 --> 00:18:41,720 แล้วเจอกันใหม่ในวิดีโอหน้าครับ ขอบคุณที่รับชมครับ