First Look at GPT-5.6: The Ultimate Hermes Agent Driver?
สรุปย่อ
ประเด็นสำคัญจากวิดีโอ
- **ช่อง:** Tonbi's AI Garage · **ความยาว:** ~17 นาที · **ลิงก์:** https://www.youtube.com/watch?v=OHaYGPiZQ3g
# สรุป: First Look at GPT-5.6: The Ultimate Hermes Agent Driver? - **ช่อง:** Tonbi's AI Garage · **ความยาว:** ~17 นาที · **ลิงก์:** https://www.youtube.com/watch?v=OHaYGPiZQ3g ## ประเด็นหลัก - OpenAI เปิดตัว GPT-5.6 อย่างเป็นทางการ โดยมีโมเดลย่อยสามตัว: Sol (flagship), Terra (สมดุลสำหรับงานประจำวัน), Luna (ประหยัดต้นทุน) - มีโหมดเสริม compute สองแบบ: max (ให้โมเดลเดียว reason นานขึ้น) และ ultra (แบ่งงานออกเป็น agent ขนาน — research, implementation, testing, critique) - ในเบนช์มาร์ก Agents' Last Exam ได้ 53.6 คะแนน สูงกว่า Fable ถึง 13.1 คะแนนบน AI Intelligence Index ขณะที่เร็วกว่า 61% และต้นทุนครึ่งหนึ่ง - คุณสมบัติเด่นคือ programmatic tool calling — เขียนและรันโปรแกรมใน memory เพื่อประสาน tool ทำให้ลด model round-trip และ prompt token - ด้าน coding นำใน agentic coding และงาน terminal แบบกว้าง แต่ Fable ยังเหนือกว่าใน SWE-bench แบบหลายไฟล์ยาก ๆ - ด้านความปลอดภัยไซเบอร์กระโดดขึ้นมาก (ExploitBench จาก 47.9% เป็น 73.5%) แต่มี guardrail ที่เข้มงวดกว่า - ราคา Sol: $5 input / $30 output; Terra & Luna: $1 input / $6 output (ใกล้เคียง Haiku) - ทดสอบ one-shot สร้างเกม One Piece x Star Wars ใน Hermes Agent: ผลออกมาดีมาก สไตล์ต่างจากโมเดลอื่น มีรายละเอียดมาก อยู่ในระดับเทียบเท่าหรือดีกว่า Fable แม้ headline stagger จะยังไม่สมบูรณ์ - ทดสอบ audit codebase โปรเจกต์ Shovels Terminal ด้วย ultra ใน Codex: พบ bug high severity 4 ตัว - นำ bug ที่พบไปให้ Fable verify — ผลคือทั้ง 14 รายการเป็นจริงตามข้อเท็จจริง และ 12 รายการเป็นการพบที่ถูกต้อง - บาง bug เป็นโค้ดที่ Fable เขียนเองแล้วไม่รู้ตัวว่ามี bug — แสดงให้เห็นคุณค่าของการมี auditor คนที่สอง - context window ใน Hermes Agent เพิ่มจาก 270K เป็น 372K token ช่วยในงาน coding ระยะยาว ## ความเห็นสรุป GPT-5.6 ผลิตงาน front-end ได้น่าประทับใจมากในการลองครั้งแรก และในฐานะ code auditor มันสามารถจับ bug ที่แม้แต่โมเดลระดับสูงอย่าง Fable ก็พลาดได้ ผู้จัดจะใช้มันเป็น driver หลักใน Hermes Agent ต่อไป และเน้นย้ำว่าการมี auditor สองชั้นจำเป็นมากเพราะแม้โมเดลเก่งสุดก็ยังเขียน bug โดยไม่รู้ตัว ทั้งหมดนี้เป็นแค่การลองครั้งแรก ผลลัพธ์จะต้องติดตามกันต่อไปในการใช้งานจริง
คำแปลเต็ม
แปลตามบทสนทนาต้นฉบับ ปรับเป็นภาษาไทยธรรมชาติ
วันนี้ OpenAI ประกาศตัว GPT-5.6 ซึ่งเป็นโมเดล GPT รุ่นใหม่ล่าสุดที่ทุกคนรอคอยกันมานาน จริง ๆ แล้วมันได้อยู่ในช่วงพรีวิวให้พาร์ตเนอร์บางรายทดลองใช้มาสักพักแล้ว แต่ตอนนี้เราเข้าถึงมันได้แล้ว และนี่น่าตื่นเต้นมาก โดยเฉพาะเพราะผมสามารถใช้โมเดล GPT ใน Hermes Agent ของผมได้ ซึ่งน่าตื่นเต้นยิ่งกว่าการเปิดตัวโมเดล Claude ด้วยซ้ำ เพราะมันคือโมเดลเดียวแต่เทคนิคแล้วมีสามแบบ รุ่น flagship คือ Sol จากนั้นมี Terra ซึ่งเป็นโมเดลที่สมดุลกว่าสำหรับงานประจำวัน แล้วก็ Luna ซึ่งเป็นโมเดลที่ประหยัดต้นทุนกว่า ก็คือมีสามขนาดและสามราคาที่ต่างกัน แต่ตัวหลักที่เราจะใช้และพูดถึงกันในที่นี้คือ Sol นะครับ
นี่จะเป็นการลองใช้ GPT-5.6 ครั้งแรกของผม และถ้าใครสังเกตเห็น ผมใช้ GPT-5.6 สร้างสไลด์โชว์ชุดนี้จริง ๆ ด้วย ก็ลองตัดสินจากตรงนั้นได้เลย ข้อเรียกร้องหลักของ GPT-5.6 ไม่ใช่แค่ว่ามันฉลาดขึ้นเฉย ๆ แต่คือทุกระดับจะได้ผลงานที่มีประโยชน์มากขึ้นจากทุก token ทุกดอลลาร์ และทุกนาที ในวิดีโอนี้ผมจะเล่าสรุปว่า GPT-5.6 คืออะไร เบนช์มาร์กเป็นอย่างไร แล้วเราจะลองให้มันทำงานจริงเพื่อดูว่ามันทำได้จริงและทนทานแค่ไหน เริ่มกันเลยครับ
สำหรับใครที่รัน agent เองแล้วอยากเข้าถึง Agent Wikis ที่ผมใช้ทำวิดีโอเหล่านี้เพื่อค้นคว้าและสร้างเนื้อหาจริง ๆ ลองแวะดูโปรเจกต์ของผมได้ที่ agentwiks.com นะครับ ผมให้ wikis เหล่านี้ฟรีทุกชุดในหลากหลายหัวข้อ และถ้าสมัครบัญชี Pro ในราคา $9.99 ต่อเดือน ก็จะได้เข้าถึง wikis ขนาดใหญ่พิเศษที่มีหน้ามากกว่าและรายละเอียดลึกกว่าในแต่ละหัวข้อ กลับมาที่วิดีโอกันต่อครับ
GPT-5.6 ให้สองทางเลือกในการใช้ compute มากขึ้น ทางแรกคือใช้ max ซึ่งจะให้โมเดลเดียว reason นานขึ้น โดยสำรวจทางเลือกอื่น ๆ รันการตรวจสอบ และแก้ไขงานของมันเอง ส่วนอีกทางคือ ultra ซึ่งเปลี่ยนโครงสร้างของงานไปเลย มันจะประสานงาน agent แบบขนานโดย default แบ่งงานออกเป็นส่วนค้นคว้า ส่วน implement ส่วนทดสอบ และส่วนวิจารณ์ เป็น architecture หรือ workflow ใหม่ที่น่าสนใจกับโมเดลตัวเดียว
ในเบนช์มาร์ก Agents' Last Exam มันได้ 53.6 คะแนน ซึ่งสูงกว่า Fable ถึง 13.1 คะแนนบน AI Intelligence Index เวอร์ชัน max reasoning ของ Sol เข้าใกล้ Fable ภายในหนึ่งคะแนน ขณะที่ทำงานเร็วกว่า 61% และต้นทุนประมาณครึ่งหนึ่ง นี่คือสิ่งที่เขาอยากเน้นย้ำ ไม่ใช่แค่ว่ามันเทียบเท่า Fable แต่คือมันถูกกว่าและเร็วกว่ามาก
การเปลี่ยนแปลง workflow ที่ใหญ่ที่สุดคือ programmatic tool calling ซึ่ง GPT-5.6 สามารถเขียนและรันโปรแกรมเบา ๆ ใน memory เพื่อประสาน tool กรองผลลัพธ์ระหว่างทาง ติดตามความคืบหน้า และเลือกว่าจะทำอะไรต่อไป นั่นหมายถึงการเรียกโมเดลรอบน้อยลงและ prompt token ที่ลดลงในงานที่ใช้ tool เยอะ นอกจากนี้มันยังออกแบบมาให้ตรวจสอบงานที่ render แล้ว ไม่ใช่แค่สร้าง source code เท่านั้น OpenAI อ้างว่า interface ที่แข็งแกร่งขึ้น เช่น presentation แบบที่เห็นนี้ เอกสาร สเปรดชีต โดยมีผล 92.2% บน BrowseComp Ultra และถ้าดูจากสายตา นี่คือการสร้างครั้งเดียว (one-shot) โดยผมไม่ได้กำหนด format เฉพาะเลย ในอดีต presentation ที่ผมทำกับโมเดล GPT จะเรียบ ๆ กว่านี้มาก แต่อันนี้กลับใกล้เคียงกับสิ่งที่ผมมักได้จากโมเดล Claude ซึ่งเป็นสิ่งที่ผมใช้ทำ presentation อยู่เป็นประจำ ผมอาจลองใช้ GPT-5.6 บ่อยขึ้น เพราะนี่ดูดีจริง ๆ
มาดูเบนช์มาร์กด้าน coding กันบ้าง ซึ่งเป็นจุดที่เรื่องประสิทธิภาพชัดเจนมาก อย่างที่บอกไป บน AI Coding Index มันได้คะแนนสูงกว่า Fable แต่ก็ไม่ได้กวาดทุกเบนช์มาร์กนะครับ บน SWE-bench นั้น Fable ยังนำอยู่ 15.7 คะแนน สรุปก็คือ GPT-5.6 นำในด้าน agentic coding และงาน terminal แบบกว้าง ๆ แต่ Fable ยังได้เปรียบมากใน software benchmark แบบหลายไฟล์ที่ยาก แต่ท้ายที่สุดนี่ก็แค่เบนช์มาร์ก เรายังไม่รู้ว่าในการใช้งานจริงจะเป็นอย่างไร
ด้านความปลอดภัยไซเบอร์เป็นจุดที่กระโดดขึ้นมาก ExploitBench พุ่งจาก 47.9% มาที่ 73.5% และเบนช์มาร์กความปลอดภัยอื่น ๆ ก็เพิ่มขึ้นแบบเดียวกัน OpenAI ระบุว่า GPT-5.6 ยังอยู่ต่ำกว่าเกณฑ์วิกฤตในด้าน cyber และ biology แต่การเข้าถึงจะถูกควบคุมมากขึ้น การเปิดตัวมี trusted access, การตรวจสอบแบบ real-time, reasoning monitor และมาตรการป้องกันที่บล็อกกิจกรรมไซเบอร์ที่อาจเป็นอันตรายได้มากกว่าโมเดลก่อนหน้าประมาณสิบเท่า ไม่แน่ว่าสิ่งนี้จะสร้างความไม่สะดวกมากแค่ไหน เพราะเมื่อสัปดาห์ที่ผ่านมาที่ผมใช้ Fable มันน่ารำคาญพอสมควรเลยครับ ตอนทำโปรเจกต์ coding ธรรมดา ๆ ไม่ว่าจะเกมหรือแอปอะไรสักอย่าง แล้วไปเปิด guardrail ของ Fable ขึ้นมา ผมก็ใช้งานต่อไม่ได้แล้ว และพอ trigger ขึ้นมาครั้งนึง มันจะเป็นปัญหาต่อไปตลอดในโปรเจกต์นั้น แม้จะกลับไปแก้ prompt แล้วก็ตาม มันน่ารำคาญมาก ก็หวังว่าทางนี้จะไม่เป็นแค่นั้น
เรื่องราคาก็มีหลายระดับนะครับ Sol อยู่ที่ $5 input และ $30 output ส่วนโมเดลที่ถูกกว่าอย่าง Terra และ Luna อยู่ที่ $1 input และ $6 output ซึ่งใกล้เคียงกับราคา Haiku ก็พอจะมองภาพได้ว่านี่เปรียบเหมือน Opus, Sonnet และ Haiku ของ OpenAI เลย แม้จะไม่ตรงเป๊ะ 100% แต่ก็พอให้ภาพจำได้
ก็คงเล่าพอที มาลองใช้จริงกันเลยครับ
อันดับแรกคืองาน coding ที่หลายคนอาจเริ่มเบื่อแล้ว แต่ผมว่ามันดีเพราะผมมีการเปรียบเทียบมากพอสมควร และเป็นงานที่ค่อนข้างยาก นั่นคือการสร้างไฟล์ HTML ไฟล์เดียวสำหรับเกม One Piece x Star Wars ที่มี hero section เต็มจอพื้นหลังสีเข้ม มีทรงกลม 3D หมุนได้ด้วย Three.js พร้อม custom GLSL fragment shader ที่ทำให้มันดูเหมือนดาวเคราะห์เรืองแสง ทรงกลมจะค่อย ๆ หมุนรอบแกน X หรือ Y เมื่อ scroll, GSAP จะ animate การย่อและจางหายของทรงกลมพร้อมกับให้ headline ค่อย ๆ ปรากฏ ส่วน headline จะมี stagger entrance สไตล์ framer motion และต้องรันได้ใน Chrome ห้ามใช้ npm ให้ใช้ CDN imports เท่านั้น หลายคนคงเคยเห็นงานนี้มาแล้ว แต่ผมมีงานเปรียบเทียบจาก Grok 4.5 ที่เพิ่งทำไปเมื่อวาน รวมถึงจาก Opus และ Fable ก็เลยดูเปรียบเทียบกันแบบ apples-to-apples ได้เลย
ตอนนี้เราจะสลับมาใช้ GPT-5.6 Sol ใน Hermes Agent เพราะนี่คือที่ที่ผมจะใช้มันเป็นหลัก ผมอาจใช้ใน Codex บ้าง แต่หลัก ๆ จะอยู่ใน Hermes Agent สิ่งที่ดีก็คือเราได้ context window ที่ใหญ่ขึ้นมาเล็กน้อย ข้อจำกัดจริง ๆ ของ GPT-5.5 ใน Hermes คือมี context window แค่ประมาณ 270,000 token แต่ตอนนี้เราได้เพิ่มเป็น 372,000 แล้ว ซึ่งช่วยได้มากสำหรับงาน coding ที่ต้องทนยาวได้ ผมก็จะให้ task นี้กับมันแล้วดูกันว่าเป็นยังไง
เพื่อให้เห็นการเปรียบเทียบ นี่คือผลงานของ Fable ซึ่งดูดีมาก น่าจะเป็นอันที่ดีที่สุดเลย ส่วนอันที่เพิ่งทำเมื่อวานนี้จาก Grok 4.5 ก็ทำตามคำสั่งครบ แต่สไตล์ออกจะน้อยกว่านิดหน่อย อย่างไรก็ตามมันทำได้ในครั้งเดียว (one-shot) ตรงตามคำสั่ง และนี่คือผลงานของ Opus 4.8 ซึ่งก็ใช้ได้ แต่น่าจะต้องลองประมาณสามรอบถึงจะออกมาได้ และจะเห็นว่าแม้ตอนทำได้แล้ว headline แบบ stagger ก็ยังขึ้นมาใต้ตำแหน่งที่ scroll อยู่ คือมันไม่ทำงานถูกต้องนะ แต่ดีเรื่องรูปลักษณ์ ทรงกลมก็ดูดี งั้นมาดูกันว่า GPT-5.6 จะทำได้แค่ไหน
โอเค ทำเสร็จแล้ว มาดูกัน เรียบร้อย GPT ทำเสร็จแล้วและดูดีมาก ดู orb ตรงนี้สิ สไตล์ต่างจากอันอื่น ๆ ที่เห็นชัดเจน เป็นการตีความที่แตกต่าง อ้อ จริง ๆ ถ้าขยับเมาส์ — ไม่รู้ว่ากล้องจะเห็นไหมนะ มันจุกจิกนิดหน่อย — แต่ถ้าขยับเมาส์ไปรอบ ๆ พื้นหลังจะขยับเล็กน้อยตามไปด้วย ค่อนข้างเจ๋งเลยครับ ดูดีจริง ๆ งั้นมาลอง scroll กันบ้าง ซึ่งเป็นส่วนสำคัญที่สุด
ถ้า scroll ลงมันก็จะ — เจ๋งจริง ๆ — เข้ามาตรงกลาง "The Grand Line runs through the stars" ได้ปกติ ทุก element อื่นก็ดูดี มีปัญหาอยู่อย่างเดียวคือคล้ายกับที่เจอในเวอร์ชันของ Opus คือมันทำ stagger ตรงนี้ได้ไม่ค่อยดีนัก ไม่รู้ว่าจะมองเห็นไหมนะ แต่มันจะขึ้นมานิดเดียวมาก ถ้า scroll เร็วพอจะเห็นว่ามันเกือบจะขึ้นมาใต้จอไปเลย แต่นอกนั้นดูดีมากครับ คือถ้าเทียบกับ Fable นะ ผมว่าผมชอบอันนี้มากกว่าด้วยซ้ำ รู้สึกว่ามีรายละเอียดในการสร้างทรงกลมมากกว่าเยอะเลย ผมว่านี่อยู่ในระดับเท่ากันเป็นอย่างน้อย ปัญหาเดียวก็คือเรื่อง headline ที่ยังทำงานได้ไม่สมบูรณ์ แต่นอกนั้นดูดีมาก สรุปก็คือเป็นการกระโดดครั้งใหญ่จากโมเดลก่อนหน้าในแง่ style point และงาน front-end นี่เป็นผลลัพธ์ที่แข็งแรงมากครับ
งานถัดไปเป็นโปรเจกต์ขั้นสูงมากที่ผมกำลังทำอยู่ ตอนนี้เสร็จไปประมาณ 70% แล้ว คร่าว ๆ มันชื่อ Shovels Terminal ซึ่งเป็นแผนที่ของ AI supply chain ทั้งหมด แสดงว่าองค์ประกอบต่าง ๆ เชื่อมโยงกันอย่างไร แล้วบริษัทจดทะเบียนใดบ้างที่ได้รับผลกระทบจากคลื่นผลกระทบของ supply chain เหล่านี้ พอมีเวลาเสร็จก็คงได้ดูกัน เป็นโปรเจกต์ที่ซับซ้อนมากเพราะมีองค์ประกอบด้านภาพเยอะ และมีส่วนประกอบเชื่อมโยงกันเยอะมากเช่นกัน
นี่คือผลการ audit ที่ Fable เพิ่งทำไป ผมขอให้มันตรวจหา bug งานถัดไปที่ผมจะให้ GPT-5.6 ทำก็คือ audit แบบเดียวกันนี้ และเราจะเปิดใช้ ultra เต็มที่เลย ซึ่งการใช้ ultra จะต้องทำใน Codex ตรง ๆ เลย ไม่ใช่ใน Hermes Agent ผมก็จะสั่ง "audit this codebase and report any bugs" เพื่อดูว่าผล audit จาก GPT-5.6 เทียบกับของ Fable จะเป็นอย่างไร
อ้อ ถือโอกาสเผยโฉมนิดหน่อยนะครับ ตามที่บอกโปรเจกต์นี้เสร็ย 70% นี่คือหน้าเว็บ Shovels Terminal และนี่คือแผนที่ ยังต้องทำต่่ออีกพอสมควร แต่จะเห็นว่ามีองค์ประกอบต่าง ๆ เชื่อมโยงกันอยู่ และทุกการเชื่อมโยงนั้นมาจากงานค้นคว้าจริง ส่วน UI ยังดูแปลก ๆ อยู่บ้างนะครับ แต่ก็คือคอนเซ็ปต์นั้นแหละ และอย่างที่จินตนาการได้มันค่อนข้างซับซ้อน ถ้าทำเสร็ยจริง ๆ ผมว่าน่าจะเจ๋งมาก จะเห็นว่ามันแสดงบริษัทที่โดนกระทบมากที่สุดเป็นอันดับต้น ๆ ในแต่ละด้านได้ด้วย
โอเค Ultra รันกลับมาในเวลา 16 นาที พบ bug ระดับ high severity อยู่หลายตัวเลยทีเดียว มีจุดเล็ก ๆ ที่ผมชอบก็คือใน Codex มักจะออกแนวยืดยาวเวิ่นเว้อ จากที่ใช้อยู่ทั้งวันนี้ รู้สึกว่ามันกระชับข้อมูลดีขึ้น นั่นคือเหตุผลที่ผมมักใช้ Claude Opus หรือ Fable สำหรับโปรเจกต์ระยะยาวมากกว่า เพราะนำเสนอข้อมูลได้ดีกว่า แต่ GPT-5.6 นี่กระชับขึ้นมาก เข้าเป็นสาระเลย ก่อนหน้านี้มันออกจะ verbose มาก เรามาดูปัญหาที่มันพบกันบ้าง พบ bug ระดับ high severity สี่ตัว ระดับ medium หลายตัว และ bug ระดับ low severity เพิ่มเติมอีก
สิ่งที่ผมจะทำคือเอา bug เหล่านี้ไปให้ Fable ตรวจสอบว่าเป็น bug จริงไหม แล้วให้มันอธิบายว่าทำไมตอนแรกมันถึงไม่พบ นี่คือสิ่งที่ผมกำลังรันใน Fable อยู่ ผมสั่งว่า "I ran another audit with a different model. Please review the findings, verify them, do not assume they are true. Give me a report of the legitimate findings and try to explain the best you can why you did not find them. Do not actually fix anything. Just verify the report." แล้วก็วางผลที่พบเข้าไป มาดูกันว่า Fable จะตอบอะไร
ก็บอกได้เลยว่าดูจากผลคร่าว ๆ ก็เห็นว่า GPT-5.6 พบได้มากกว่า Fable พบ critical issue จริง ๆ แค่อันเดียวที่เกี่ยวกับ shockwave engine ส่วนของ GPT-5.6 จะหลากหลายกว่า มี issue หลายประเภทกว่า มาดูกันว่า Fable จะตอบว่าอย่างไร
ผลออกมาน่าสนใจมากครับ Fable ตอบกลับมา — ใช้เวลาไปสักพัก — มัน verify ทุกรายการเทียบกับโค้ดและ installed library sources สรุปก็คือทั้ง 14 รายการเป็นจริงตามข้อเท็จจริง และ 12 รายการเป็นการพบที่ถูกต้อง สองรายการเป็นสิ่งที่มันเคยรายงานไปก่อนหน้านี้แล้ว รายการที่ร้ายแรงที่สุดอยู่ในโค้ดที่มันเขียนเอง นี่... น่าอายพอสมควรเลยครับ นี่คือรายละเอียดและ postmortem ที่ซื่อสัตย์
เรื่อง findings ก็คือรายการเหล่านี้เป็นจริงทั้งหมด อันนี้ยืนยันเป็น high severity และเป็น bug ของ Fable เอง แต่อย่างน้อย Fable ก็รับผิดได้นะครับ มันบอกว่ามันปล่อยส่วนนี้ไว้โดยไม่ guard ซึ่งเป็น bug class เดียวกับที่มันกำลังแก้อยู่ที่อื่นในไฟล์เดียวกัน อีกรายการคือ missing claims — กุญแจสำคัญลบ claims ทิ้งหมดเงียบ ๆ ซึ่งเป็นปัญหาค่อนข้างร้ายแรงสำหรับโปรเจกต์นี้ จริง ๆ แล้วนี่เป็น bug ที่ผมเคยติดอยู่ก่อนหน้านี้แล้ว เคยมีปัญหากับมันมาแล้ว เป็น high UX issue ที่ไม่มี movement threshold อยู่เลย นั่นก็เป็นสิ่งที่ผมเคยต่อสู้อยู่ ก็ดีใจที่มันหาเจอในที่สุด
ก็คือทุกอย่างเช็กได้หมดเลย เหตุผลตรง ๆ จาก Fable ว่าทำไมถึงเป็นแบบนี้ — มันบอกว่ามัน anchor การตรวจสอบไว้กับประวัติ bug ที่รู้จักของผลิตภัณฑ์ การแก้ไขของมันเองไม่เคยเข้าสู่ adversarial loop อีกเลย รายการที่สองร้ายแรงที่สุด — มันเขียน import script ใหม่เพื่อแก้ปัญหา แต่ไฟล์ที่เขียนใหม่กลับมี issue เดียวกัน มัน verify data cleanliness แล้วสับสนคิดว่าเป็น invariant enforcement บางรายการก็เป็นข้อจำกัดมากกว่าที่จะเป็น bug จริง แต่ก็มี bug ระดับสูงอยู่หลายตัวเหมือนกัน นี่เป็น findings ที่น่าสนใจมากครับ
สรุปก็คือเรามี GPT-5.6 แก้โค้ดที่ Fable เขียน และ Fable ก็ยอมรับและตระหนักว่าตัวเองเขียนโค้ดที่มี bug ออกมา นี่ไม่ได้แปลว่า GPT-5.6 จะดีกว่าเสมอไปนะครับ เพราะผมรันบน Sol พร้อม ultra ซึ่งน่าจะแพงกว่าเวอร์ชันปกติ แต่มันก็แสดงให้เห็นว่ามันเก่งพอสมควร เพราะหา bug ที่ Fable ไม่พบและยังเป็นโค้ดที่ Fable เขียนเองได้อีกด้วย สำหรับโปรเจกต์แบบนี้ ผมอยากให้มีอย่างน้อยหนึ่งในสองตัวทำหน้าที่เป็น auditor ผมจะใช้ workflow นี้ต่อไป เพราะจะเห็นว่าแม้แต่โมเดลตารางระดับสูงสุดก็ยังเขียน bug ออกมาโดยไม่รู้ตัวว่าตัวเองเขียน นั่นคือเหตุผลที่คุณต้องมีอะไรสักอย่างอย่าง GPT-5.6 มาช่วยจับ
ก็คงมีแค่นี้ครับสำหรับ First Look at GPT-5.6 ทำไปแค่ไม่กี่ task เล็ก ๆ เพราะผมจะใช้มันอยู่บ่อย ๆ และคุณจะเห็นผมใช้ในชีวิตประจำวันในโปรเจกต์ต่าง ๆ มันจะกลายเป็น driver หลักใน Hermes Agent ของผม ผมก็เลยอยากเห็นว่ามันทำได้ดีแค่ไหน จากแค่ไม่กี่ task นี้ ผมประทับใจพอสมควร ก็หวังว่ามันจะอยู่ได้ต่อไปนะครับ แค่นี้แหละสำหรับวิดีโอนี้ ฝากคอมเมนต์ด้วยนะครับ ประสบการณ์ของคุณกับ GPT-5.6 เป็นอย่างไรบ้าง? ฝาก subscribe ฝาก like ด้วยนะครับ แล้วเจอกันใหม่ในวิดีโอหน้า ขอบคุณที่รับชมครับ
หมายเหตุการแปล
ความโปร่งใสเกี่ยวกับความไม่แน่นอนในต้นฉบับ
- ## ส่วนที่ฟังไม่ชัด `[ฟังไม่ชัด]`
- ไม่มี — ไม่มีช่วงใดที่ความหมายเลือนลางถึงขั้นต้องใส่เครื่องหมาย `[ฟังไม่ชัด]` แม้บางช่วงจะมีคำพูดตะกุกตะกัก แต่สามารถเข้าใจใจความได้จากบริบท
อภิธานศัพท์เทคนิค
คำศัพท์และชื่อผลิตภัณฑ์ที่คงรูปภาษาอังกฤษ
| ศัพท์ | คำแปล / คำอธิบาย |
|---|---|
| GPT-5.6 | โมเดลภาษาตัวใหม่ล่าสุดของ OpenAI มีสามรุ่นย่อย: Sol, Terra, Luna |
| Sol | รุ่น flagship ของ GPT-5.6 ตัวหลักที่ใช้ในวิดีโอ |
| Terra | รุ่นสมดุลของ GPT-5.6 สำหรับงานประจำวัน |
| Luna | รุ่นประหยัดต้นทุนของ GPT-5.6 |
| OpenAI | บริษัทผู้พัฒนา GPT |
| Hermes Agent | เวิร์กโฟลว์/ระบบ agent หลักที่ผู้จัดใช้ทำงาน |
| Fable | โมเดลภาษาฝั่ง Anthropic ที่ใช้เปรียบเทียบ (น่าจะหมายถึงรุ่นในตระกูล Claude) |
| Claude / Claude Opus | โมเดลของ Anthropic |
| Grok 4.5 | โมเดลของ xAI ที่นำมาเปรียบเทียบ |
| Codex | เครื่องมือ/CLI สำหรับ coding ของ OpenAI |
| max (โหมด) | โหมดที่ให้โมเดล reason นานขึ้น สำรวจทางเลือกและตรวจสอบงาน |
| ultra (โหมด) | โหมดที่เปลี่ยนโครงสร้างงาน ประสาน agent แบบขนาน (research, implementation, testing, critique) |
| programmatic tool calling | ความสามารถในการเขียน/รันโปรแกรมใน memory เพื่อประสาน tool ต่าง ๆ |
| Agents' Last Exam | เบนช์มาร์กวัดความสามารถ agent |
| AI Intelligence Index | ดัชนีวัดปัญญา AI |
| BrowseComp Ultra | เบนช์มาร์กวัดความสามารถในการเรียกดู/โบรว์ซ |
| SWE-bench | เบนช์มาร์ก software engineering แบบหลายไฟล์ |
| ExploitBench | เบนช์มาร์กด้านความปลอดภัยไซเบอร์ |
| context window | ขนาดหน่วยความจำตามบริบทที่โมเดลรับได้ในครั้งเดียว |
| one-shot | การสร้างผลลัพธ์ในครั้งเดียวโดยไม่ต้องแก้หลายรอบ |
| token | หน่วยย่อยของข้อความที่โมเดลประมวลผล |
| agent | โปรแกรม AI ที่ทำงานอัตโนมัติเป็นขั้นตอน |
| guardrail | ระบบป้องกันความปลอดภัยที่บล็อกเนื้อหา/การกระทำที่เป็นอันตราย |
| audit | การตรวจสอบโค้ดเพื่อหา bug |
| Three.js | ไลบรารี JavaScript สำหรับกราฟิก 3D |
| GLSL fragment shader | โปรแกรมเฉพาะที่ควบคุมสี/แสงของพิกเซลบน GPU |
| GSAP | ไลบรารี JavaScript สำหรับ animation |
| framer motion | ไลบรารี animation สำหรับ React |
| Shovels Terminal | โปรเจกต์ส่วนตัวของผู้จัด เป็นแผนที่ AI supply chain |
| supply chain | ห่วงโซ่อุปทาน |
| npm / CDN | ระบบจัดการแพ็กเกจ / เครือข่ายกระจายเนื้อหา |
| Agent Wikis / agentwiks.com | โปรเจกต์คลังความรู้ของผู้จัด ให้บริการฟรีและระดับ Pro |
ซับไตเติ้ลภาษาไทย
ดาวน์โหลดหรือดูซับทั้งหมด
1 00:00:00,000 --> 00:00:04,197 วันนี้ OpenAI ประกาศตัว GPT-5.6 ซึ่งเป็นโมเดล GPT 2 00:00:04,197 --> 00:00:13,447 รุ่นใหม่ล่าสุดที่ทุกคนรอคอยกันมานาน จริง ๆ แล้วมันได้อยู่ในช่วงพรีวิวให้พาร์ตเนอร์บางรายทดลองใช้มาสักพักแล้ว 3 00:00:13,447 --> 00:00:17,730 แต่ตอนนี้เราเข้าถึงมันได้แล้ว และนี่น่าตื่นเต้นมาก 4 00:00:17,730 --> 00:00:21,927 โดยเฉพาะเพราะผมสามารถใช้โมเดล GPT ใน Hermes Agent
เปิดดูซับไตเติ้ลทั้งหมด (204 segments)
1 00:00:00,000 --> 00:00:04,197 วันนี้ OpenAI ประกาศตัว GPT-5.6 ซึ่งเป็นโมเดล GPT 2 00:00:04,197 --> 00:00:13,447 รุ่นใหม่ล่าสุดที่ทุกคนรอคอยกันมานาน จริง ๆ แล้วมันได้อยู่ในช่วงพรีวิวให้พาร์ตเนอร์บางรายทดลองใช้มาสักพักแล้ว 3 00:00:13,447 --> 00:00:17,730 แต่ตอนนี้เราเข้าถึงมันได้แล้ว และนี่น่าตื่นเต้นมาก 4 00:00:17,730 --> 00:00:21,927 โดยเฉพาะเพราะผมสามารถใช้โมเดล GPT ใน Hermes Agent 5 00:00:21,927 --> 00:00:25,953 ของผมได้ ซึ่งน่าตื่นเต้นยิ่งกว่าการเปิดตัวโมเดล 6 00:00:25,953 --> 00:00:30,835 Claude ด้วยซ้ำ เพราะมันคือโมเดลเดียวแต่เทคนิคแล้วมีสามแบบ 7 00:00:30,835 --> 00:00:37,687 รุ่น flagship คือ Sol จากนั้นมี Terra ซึ่งเป็นโมเดลที่สมดุลกว่าสำหรับงานประจำวัน 8 00:00:37,687 --> 00:00:44,539 แล้วก็ Luna ซึ่งเป็นโมเดลที่ประหยัดต้นทุนกว่า ก็คือมีสามขนาดและสามราคาที่ต่างกัน 9 00:00:44,539 --> 00:00:48,651 แต่ตัวหลักที่เราจะใช้และพูดถึงกันในที่นี้คือ Sol 10 00:00:48,651 --> 00:00:52,676 นะครับ นี่จะเป็นการลองใช้ GPT-5.6 ครั้งแรกของผม 11 00:00:52,676 --> 00:00:57,644 และถ้าใครสังเกตเห็น ผมใช้ GPT-5.6 สร้างสไลด์โชว์ชุดนี้จริง 12 00:00:57,644 --> 00:01:02,269 ๆ ด้วย ก็ลองตัดสินจากตรงนั้นได้เลย ข้อเรียกร้องหลักของ 13 00:01:02,269 --> 00:01:09,721 GPT-5.6 ไม่ใช่แค่ว่ามันฉลาดขึ้นเฉย ๆ แต่คือทุกระดับจะได้ผลงานที่มีประโยชน์มากขึ้นจากทุก 14 00:01:09,721 --> 00:01:14,346 token ทุกดอลลาร์ และทุกนาที ในวิดีโอนี้ผมจะเล่าสรุปว่า 15 00:01:14,346 --> 00:01:22,997 GPT-5.6 คืออะไร เบนช์มาร์กเป็นอย่างไร แล้วเราจะลองให้มันทำงานจริงเพื่อดูว่ามันทำได้จริงและทนทานแค่ไหน 16 00:01:22,997 --> 00:01:27,794 เริ่มกันเลยครับ สำหรับใครที่รัน agent เองแล้วอยากเข้าถึง 17 00:01:27,794 --> 00:01:33,533 Agent Wikis ที่ผมใช้ทำวิดีโอเหล่านี้เพื่อค้นคว้าและสร้างเนื้อหาจริง 18 00:01:33,533 --> 00:01:37,815 ๆ ลองแวะดูโปรเจกต์ของผมได้ที่ agentwiks.com นะครับ 19 00:01:37,815 --> 00:01:43,126 ผมให้ wikis เหล่านี้ฟรีทุกชุดในหลากหลายหัวข้อ และถ้าสมัครบัญชี 20 00:01:43,126 --> 00:01:52,462 Pro ในราคา $9.99 ต่อเดือน ก็จะได้เข้าถึง wikis ขนาดใหญ่พิเศษที่มีหน้ามากกว่าและรายละเอียดลึกกว่าในแต่ละหัวข้อ 21 00:01:52,462 --> 00:01:57,258 กลับมาที่วิดีโอกันต่อครับ GPT-5.6 ให้สองทางเลือกในการใช้ 22 00:01:57,258 --> 00:02:01,712 compute มากขึ้น ทางแรกคือใช้ max ซึ่งจะให้โมเดลเดียว 23 00:02:01,712 --> 00:02:06,081 reason นานขึ้น โดยสำรวจทางเลือกอื่น ๆ รันการตรวจสอบ 24 00:02:06,081 --> 00:02:12,248 และแก้ไขงานของมันเอง ส่วนอีกทางคือ ultra ซึ่งเปลี่ยนโครงสร้างของงานไปเลย 25 00:02:12,248 --> 00:02:17,815 มันจะประสานงาน agent แบบขนานโดย default แบ่งงานออกเป็นส่วนค้นคว้า 26 00:02:17,815 --> 00:02:22,697 ส่วน implement ส่วนทดสอบ และส่วนวิจารณ์ เป็น architecture 27 00:02:22,697 --> 00:02:27,579 หรือ workflow ใหม่ที่น่าสนใจกับโมเดลตัวเดียว ในเบนช์มาร์ก 28 00:02:27,579 --> 00:02:31,605 Agents' Last Exam มันได้ 53.6 คะแนน ซึ่งสูงกว่า 29 00:02:31,605 --> 00:02:36,145 Fable ถึง 13.1 คะแนนบน AI Intelligence Index เวอร์ชัน 30 00:02:36,145 --> 00:02:40,599 max reasoning ของ Sol เข้าใกล้ Fable ภายในหนึ่งคะแนน 31 00:02:40,599 --> 00:02:44,795 ขณะที่ทำงานเร็วกว่า 61% และต้นทุนประมาณครึ่งหนึ่ง 32 00:02:44,795 --> 00:02:49,249 นี่คือสิ่งที่เขาอยากเน้นย้ำ ไม่ใช่แค่ว่ามันเทียบเท่า 33 00:02:49,249 --> 00:02:53,618 Fable แต่คือมันถูกกว่าและเร็วกว่ามาก การเปลี่ยนแปลง 34 00:02:53,618 --> 00:02:57,986 workflow ที่ใหญ่ที่สุดคือ programmatic tool calling 35 00:02:57,986 --> 00:03:02,440 ซึ่ง GPT-5.6 สามารถเขียนและรันโปรแกรมเบา ๆ ใน memory 36 00:03:02,440 --> 00:03:07,236 เพื่อประสาน tool กรองผลลัพธ์ระหว่างทาง ติดตามความคืบหน้า 37 00:03:07,236 --> 00:03:12,461 และเลือกว่าจะทำอะไรต่อไป นั่นหมายถึงการเรียกโมเดลรอบน้อยลงและ 38 00:03:12,461 --> 00:03:19,399 prompt token ที่ลดลงในงานที่ใช้ tool เยอะ นอกจากนี้มันยังออกแบบมาให้ตรวจสอบงานที่ 39 00:03:19,399 --> 00:03:23,425 render แล้ว ไม่ใช่แค่สร้าง source code เท่านั้น 40 00:03:23,425 --> 00:03:28,478 OpenAI อ้างว่า interface ที่แข็งแกร่งขึ้น เช่น presentation 41 00:03:28,478 --> 00:03:33,360 แบบที่เห็นนี้ เอกสาร สเปรดชีต โดยมีผล 92.2% บน BrowseComp 42 00:03:33,360 --> 00:03:37,386 Ultra และถ้าดูจากสายตา นี่คือการสร้างครั้งเดียว 43 00:03:37,386 --> 00:03:41,669 (one-shot) โดยผมไม่ได้กำหนด format เฉพาะเลย ในอดีต 44 00:03:41,669 --> 00:03:46,208 presentation ที่ผมทำกับโมเดล GPT จะเรียบ ๆ กว่านี้มาก 45 00:03:46,208 --> 00:03:50,320 แต่อันนี้กลับใกล้เคียงกับสิ่งที่ผมมักได้จากโมเดล 46 00:03:50,320 --> 00:03:55,116 Claude ซึ่งเป็นสิ่งที่ผมใช้ทำ presentation อยู่เป็นประจำ 47 00:03:55,116 --> 00:03:59,142 ผมอาจลองใช้ GPT-5.6 บ่อยขึ้น เพราะนี่ดูดีจริง ๆ 48 00:03:59,142 --> 00:04:05,480 มาดูเบนช์มาร์กด้าน coding กันบ้าง ซึ่งเป็นจุดที่เรื่องประสิทธิภาพชัดเจนมาก 49 00:04:05,480 --> 00:04:09,848 อย่างที่บอกไป บน AI Coding Index มันได้คะแนนสูงกว่า 50 00:04:09,848 --> 00:04:14,388 Fable แต่ก็ไม่ได้กวาดทุกเบนช์มาร์กนะครับ บน SWE-bench 51 00:04:14,388 --> 00:04:18,585 นั้น Fable ยังนำอยู่ 15.7 คะแนน สรุปก็คือ GPT-5.6 52 00:04:18,585 --> 00:04:22,696 นำในด้าน agentic coding และงาน terminal แบบกว้าง 53 00:04:22,696 --> 00:04:26,808 ๆ แต่ Fable ยังได้เปรียบมากใน software benchmark 54 00:04:26,808 --> 00:04:31,005 แบบหลายไฟล์ที่ยาก แต่ท้ายที่สุดนี่ก็แค่เบนช์มาร์ก 55 00:04:31,005 --> 00:04:38,628 เรายังไม่รู้ว่าในการใช้งานจริงจะเป็นอย่างไร ด้านความปลอดภัยไซเบอร์เป็นจุดที่กระโดดขึ้นมาก 56 00:04:38,628 --> 00:04:44,366 ExploitBench พุ่งจาก 47.9% มาที่ 73.5% และเบนช์มาร์กความปลอดภัยอื่น 57 00:04:44,366 --> 00:04:48,392 ๆ ก็เพิ่มขึ้นแบบเดียวกัน OpenAI ระบุว่า GPT-5.6 58 00:04:48,392 --> 00:04:52,503 ยังอยู่ต่ำกว่าเกณฑ์วิกฤตในด้าน cyber และ biology 59 00:04:52,503 --> 00:04:56,957 แต่การเข้าถึงจะถูกควบคุมมากขึ้น การเปิดตัวมี trusted 60 00:04:56,957 --> 00:05:01,240 access, การตรวจสอบแบบ real-time, reasoning monitor 61 00:05:01,240 --> 00:05:09,120 และมาตรการป้องกันที่บล็อกกิจกรรมไซเบอร์ที่อาจเป็นอันตรายได้มากกว่าโมเดลก่อนหน้าประมาณสิบเท่า 62 00:05:09,120 --> 00:05:15,887 ไม่แน่ว่าสิ่งนี้จะสร้างความไม่สะดวกมากแค่ไหน เพราะเมื่อสัปดาห์ที่ผ่านมาที่ผมใช้ 63 00:05:15,887 --> 00:05:20,341 Fable มันน่ารำคาญพอสมควรเลยครับ ตอนทำโปรเจกต์ coding 64 00:05:20,341 --> 00:05:24,623 ธรรมดา ๆ ไม่ว่าจะเกมหรือแอปอะไรสักอย่าง แล้วไปเปิด 65 00:05:24,623 --> 00:05:28,906 guardrail ของ Fable ขึ้นมา ผมก็ใช้งานต่อไม่ได้แล้ว 66 00:05:28,906 --> 00:05:34,559 และพอ trigger ขึ้นมาครั้งนึง มันจะเป็นปัญหาต่อไปตลอดในโปรเจกต์นั้น 67 00:05:34,559 --> 00:05:41,240 แม้จะกลับไปแก้ prompt แล้วก็ตาม มันน่ารำคาญมาก ก็หวังว่าทางนี้จะไม่เป็นแค่นั้น 68 00:05:41,240 --> 00:05:45,522 เรื่องราคาก็มีหลายระดับนะครับ Sol อยู่ที่ $5 input 69 00:05:45,522 --> 00:05:49,719 และ $30 output ส่วนโมเดลที่ถูกกว่าอย่าง Terra และ 70 00:05:49,719 --> 00:05:54,516 Luna อยู่ที่ $1 input และ $6 output ซึ่งใกล้เคียงกับราคา 71 00:05:54,516 --> 00:05:58,970 Haiku ก็พอจะมองภาพได้ว่านี่เปรียบเหมือน Opus, Sonnet 72 00:05:58,970 --> 00:06:04,452 และ Haiku ของ OpenAI เลย แม้จะไม่ตรงเป๊ะ 100% แต่ก็พอให้ภาพจำได้ 73 00:06:04,452 --> 00:06:08,820 ก็คงเล่าพอที มาลองใช้จริงกันเลยครับ อันดับแรกคืองาน 74 00:06:08,820 --> 00:06:15,672 coding ที่หลายคนอาจเริ่มเบื่อแล้ว แต่ผมว่ามันดีเพราะผมมีการเปรียบเทียบมากพอสมควร 75 00:06:15,672 --> 00:06:19,869 และเป็นงานที่ค่อนข้างยาก นั่นคือการสร้างไฟล์ HTML 76 00:06:19,869 --> 00:06:24,237 ไฟล์เดียวสำหรับเกม One Piece x Star Wars ที่มี hero 77 00:06:24,237 --> 00:06:28,691 section เต็มจอพื้นหลังสีเข้ม มีทรงกลม 3D หมุนได้ด้วย 78 00:06:28,691 --> 00:06:35,543 Three.js พร้อม custom GLSL fragment shader ที่ทำให้มันดูเหมือนดาวเคราะห์เรืองแสง 79 00:06:35,543 --> 00:06:39,655 ทรงกลมจะค่อย ๆ หมุนรอบแกน X หรือ Y เมื่อ scroll, 80 00:06:39,655 --> 00:06:44,023 GSAP จะ animate การย่อและจางหายของทรงกลมพร้อมกับให้ 81 00:06:44,023 --> 00:06:48,134 headline ค่อย ๆ ปรากฏ ส่วน headline จะมี stagger 82 00:06:48,134 --> 00:06:52,503 entrance สไตล์ framer motion และต้องรันได้ใน Chrome 83 00:06:52,503 --> 00:06:58,241 ห้ามใช้ npm ให้ใช้ CDN imports เท่านั้น หลายคนคงเคยเห็นงานนี้มาแล้ว 84 00:06:58,241 --> 00:07:02,867 แต่ผมมีงานเปรียบเทียบจาก Grok 4.5 ที่เพิ่งทำไปเมื่อวาน 85 00:07:02,867 --> 00:07:07,064 รวมถึงจาก Opus และ Fable ก็เลยดูเปรียบเทียบกันแบบ 86 00:07:07,064 --> 00:07:11,518 apples-to-apples ได้เลย ตอนนี้เราจะสลับมาใช้ GPT-5.6 87 00:07:11,518 --> 00:07:16,228 Sol ใน Hermes Agent เพราะนี่คือที่ที่ผมจะใช้มันเป็นหลัก 88 00:07:16,228 --> 00:07:20,254 ผมอาจใช้ใน Codex บ้าง แต่หลัก ๆ จะอยู่ใน Hermes 89 00:07:20,254 --> 00:07:25,650 Agent สิ่งที่ดีก็คือเราได้ context window ที่ใหญ่ขึ้นมาเล็กน้อย 90 00:07:25,650 --> 00:07:29,933 ข้อจำกัดจริง ๆ ของ GPT-5.5 ใน Hermes คือมี context 91 00:07:29,933 --> 00:07:34,644 window แค่ประมาณ 270,000 token แต่ตอนนี้เราได้เพิ่มเป็น 92 00:07:34,644 --> 00:07:39,697 372,000 แล้ว ซึ่งช่วยได้มากสำหรับงาน coding ที่ต้องทนยาวได้ 93 00:07:39,697 --> 00:07:45,864 ผมก็จะให้ task นี้กับมันแล้วดูกันว่าเป็นยังไง เพื่อให้เห็นการเปรียบเทียบ 94 00:07:45,864 --> 00:07:50,918 นี่คือผลงานของ Fable ซึ่งดูดีมาก น่าจะเป็นอันที่ดีที่สุดเลย 95 00:07:50,918 --> 00:07:55,800 ส่วนอันที่เพิ่งทำเมื่อวานนี้จาก Grok 4.5 ก็ทำตามคำสั่งครบ 96 00:07:55,800 --> 00:08:01,110 แต่สไตล์ออกจะน้อยกว่านิดหน่อย อย่างไรก็ตามมันทำได้ในครั้งเดียว 97 00:08:01,110 --> 00:08:05,393 (one-shot) ตรงตามคำสั่ง และนี่คือผลงานของ Opus 4.8 98 00:08:05,393 --> 00:08:09,933 ซึ่งก็ใช้ได้ แต่น่าจะต้องลองประมาณสามรอบถึงจะออกมาได้ 99 00:08:09,933 --> 00:08:14,044 และจะเห็นว่าแม้ตอนทำได้แล้ว headline แบบ stagger 100 00:08:14,044 --> 00:08:19,183 ก็ยังขึ้นมาใต้ตำแหน่งที่ scroll อยู่ คือมันไม่ทำงานถูกต้องนะ 101 00:08:19,183 --> 00:08:23,294 แต่ดีเรื่องรูปลักษณ์ ทรงกลมก็ดูดี งั้นมาดูกันว่า 102 00:08:23,294 --> 00:08:28,091 GPT-5.6 จะทำได้แค่ไหน โอเค ทำเสร็จแล้ว มาดูกัน เรียบร้อย 103 00:08:28,091 --> 00:08:33,316 GPT ทำเสร็จแล้วและดูดีมาก ดู orb ตรงนี้สิ สไตล์ต่างจากอันอื่น 104 00:08:33,316 --> 00:08:37,427 ๆ ที่เห็นชัดเจน เป็นการตีความที่แตกต่าง อ้อ จริง 105 00:08:37,427 --> 00:08:42,566 ๆ ถ้าขยับเมาส์ — ไม่รู้ว่ากล้องจะเห็นไหมนะ มันจุกจิกนิดหน่อย 106 00:08:42,566 --> 00:08:47,363 — แต่ถ้าขยับเมาส์ไปรอบ ๆ พื้นหลังจะขยับเล็กน้อยตามไปด้วย 107 00:08:47,363 --> 00:08:51,388 ค่อนข้างเจ๋งเลยครับ ดูดีจริง ๆ งั้นมาลอง scroll 108 00:08:51,388 --> 00:08:55,842 กันบ้าง ซึ่งเป็นส่วนสำคัญที่สุด ถ้า scroll ลงมันก็จะ 109 00:08:55,842 --> 00:09:00,039 — เจ๋งจริง ๆ — เข้ามาตรงกลาง "The Grand Line runs 110 00:09:00,039 --> 00:09:04,236 through the stars" ได้ปกติ ทุก element อื่นก็ดูดี 111 00:09:04,236 --> 00:09:08,605 มีปัญหาอยู่อย่างเดียวคือคล้ายกับที่เจอในเวอร์ชันของ 112 00:09:08,605 --> 00:09:14,343 Opus คือมันทำ stagger ตรงนี้ได้ไม่ค่อยดีนัก ไม่รู้ว่าจะมองเห็นไหมนะ 113 00:09:14,343 --> 00:09:21,024 แต่มันจะขึ้นมานิดเดียวมาก ถ้า scroll เร็วพอจะเห็นว่ามันเกือบจะขึ้นมาใต้จอไปเลย 114 00:09:21,024 --> 00:09:27,534 แต่นอกนั้นดูดีมากครับ คือถ้าเทียบกับ Fable นะ ผมว่าผมชอบอันนี้มากกว่าด้วยซ้ำ 115 00:09:27,534 --> 00:09:31,902 รู้สึกว่ามีรายละเอียดในการสร้างทรงกลมมากกว่าเยอะเลย 116 00:09:31,902 --> 00:09:37,127 ผมว่านี่อยู่ในระดับเท่ากันเป็นอย่างน้อย ปัญหาเดียวก็คือเรื่อง 117 00:09:37,127 --> 00:09:41,495 headline ที่ยังทำงานได้ไม่สมบูรณ์ แต่นอกนั้นดูดีมาก 118 00:09:41,495 --> 00:09:45,949 สรุปก็คือเป็นการกระโดดครั้งใหญ่จากโมเดลก่อนหน้าในแง่ 119 00:09:45,949 --> 00:09:51,088 style point และงาน front-end นี่เป็นผลลัพธ์ที่แข็งแรงมากครับ 120 00:09:51,088 --> 00:09:56,741 งานถัดไปเป็นโปรเจกต์ขั้นสูงมากที่ผมกำลังทำอยู่ ตอนนี้เสร็จไปประมาณ 121 00:09:56,741 --> 00:10:01,795 70% แล้ว คร่าว ๆ มันชื่อ Shovels Terminal ซึ่งเป็นแผนที่ของ 122 00:10:01,795 --> 00:10:05,820 AI supply chain ทั้งหมด แสดงว่าองค์ประกอบต่าง ๆ 123 00:10:05,820 --> 00:10:12,587 เชื่อมโยงกันอย่างไร แล้วบริษัทจดทะเบียนใดบ้างที่ได้รับผลกระทบจากคลื่นผลกระทบของ 124 00:10:12,587 --> 00:10:16,613 supply chain เหล่านี้ พอมีเวลาเสร็จก็คงได้ดูกัน 125 00:10:16,613 --> 00:10:21,152 เป็นโปรเจกต์ที่ซับซ้อนมากเพราะมีองค์ประกอบด้านภาพเยอะ 126 00:10:21,152 --> 00:10:25,692 และมีส่วนประกอบเชื่อมโยงกันเยอะมากเช่นกัน นี่คือผลการ 127 00:10:25,692 --> 00:10:31,259 audit ที่ Fable เพิ่งทำไป ผมขอให้มันตรวจหา bug งานถัดไปที่ผมจะให้ 128 00:10:31,259 --> 00:10:35,713 GPT-5.6 ทำก็คือ audit แบบเดียวกันนี้ และเราจะเปิดใช้ 129 00:10:35,713 --> 00:10:39,996 ultra เต็มที่เลย ซึ่งการใช้ ultra จะต้องทำใน Codex 130 00:10:39,996 --> 00:10:44,193 ตรง ๆ เลย ไม่ใช่ใน Hermes Agent ผมก็จะสั่ง "audit 131 00:10:44,193 --> 00:10:48,218 this codebase and report any bugs" เพื่อดูว่าผล 132 00:10:48,218 --> 00:10:52,415 audit จาก GPT-5.6 เทียบกับของ Fable จะเป็นอย่างไร 133 00:10:52,415 --> 00:10:57,383 อ้อ ถือโอกาสเผยโฉมนิดหน่อยนะครับ ตามที่บอกโปรเจกต์นี้เสร็ย 134 00:10:57,383 --> 00:11:01,752 70% นี่คือหน้าเว็บ Shovels Terminal และนี่คือแผนที่ 135 00:11:01,752 --> 00:11:06,206 ยังต้องทำต่่ออีกพอสมควร แต่จะเห็นว่ามีองค์ประกอบต่าง 136 00:11:06,206 --> 00:11:11,345 ๆ เชื่อมโยงกันอยู่ และทุกการเชื่อมโยงนั้นมาจากงานค้นคว้าจริง 137 00:11:11,345 --> 00:11:16,484 ส่วน UI ยังดูแปลก ๆ อยู่บ้างนะครับ แต่ก็คือคอนเซ็ปต์นั้นแหละ 138 00:11:16,484 --> 00:11:21,280 และอย่างที่จินตนาการได้มันค่อนข้างซับซ้อน ถ้าทำเสร็ยจริง 139 00:11:21,280 --> 00:11:27,704 ๆ ผมว่าน่าจะเจ๋งมาก จะเห็นว่ามันแสดงบริษัทที่โดนกระทบมากที่สุดเป็นอันดับต้น 140 00:11:27,704 --> 00:11:31,730 ๆ ในแต่ละด้านได้ด้วย โอเค Ultra รันกลับมาในเวลา 141 00:11:31,730 --> 00:11:36,527 16 นาที พบ bug ระดับ high severity อยู่หลายตัวเลยทีเดียว 142 00:11:36,527 --> 00:11:41,666 มีจุดเล็ก ๆ ที่ผมชอบก็คือใน Codex มักจะออกแนวยืดยาวเวิ่นเว้อ 143 00:11:41,666 --> 00:11:46,291 จากที่ใช้อยู่ทั้งวันนี้ รู้สึกว่ามันกระชับข้อมูลดีขึ้น 144 00:11:46,291 --> 00:11:50,317 นั่นคือเหตุผลที่ผมมักใช้ Claude Opus หรือ Fable 145 00:11:50,317 --> 00:11:55,027 สำหรับโปรเจกต์ระยะยาวมากกว่า เพราะนำเสนอข้อมูลได้ดีกว่า 146 00:11:55,027 --> 00:12:00,509 แต่ GPT-5.6 นี่กระชับขึ้นมาก เข้าเป็นสาระเลย ก่อนหน้านี้มันออกจะ 147 00:12:00,509 --> 00:12:04,963 verbose มาก เรามาดูปัญหาที่มันพบกันบ้าง พบ bug ระดับ 148 00:12:04,963 --> 00:12:09,160 high severity สี่ตัว ระดับ medium หลายตัว และ bug 149 00:12:09,160 --> 00:12:13,528 ระดับ low severity เพิ่มเติมอีก สิ่งที่ผมจะทำคือเอา 150 00:12:13,528 --> 00:12:17,811 bug เหล่านี้ไปให้ Fable ตรวจสอบว่าเป็น bug จริงไหม 151 00:12:17,811 --> 00:12:23,464 แล้วให้มันอธิบายว่าทำไมตอนแรกมันถึงไม่พบ นี่คือสิ่งที่ผมกำลังรันใน 152 00:12:23,464 --> 00:12:27,575 Fable อยู่ ผมสั่งว่า "I ran another audit with a 153 00:12:27,575 --> 00:12:31,944 different model. Please review the findings, verify 154 00:12:31,944 --> 00:12:36,312 them, do not assume they are true. Give me a report 155 00:12:36,312 --> 00:12:40,509 of the legitimate findings and try to explain the 156 00:12:40,509 --> 00:12:45,220 best you can why you did not find them. Do not actually 157 00:12:45,220 --> 00:12:50,445 fix anything. Just verify the report." แล้วก็วางผลที่พบเข้าไป 158 00:12:50,445 --> 00:12:54,984 มาดูกันว่า Fable จะตอบอะไร ก็บอกได้เลยว่าดูจากผลคร่าว 159 00:12:54,984 --> 00:12:59,267 ๆ ก็เห็นว่า GPT-5.6 พบได้มากกว่า Fable พบ critical 160 00:12:59,267 --> 00:13:03,806 issue จริง ๆ แค่อันเดียวที่เกี่ยวกับ shockwave engine 161 00:13:03,806 --> 00:13:08,432 ส่วนของ GPT-5.6 จะหลากหลายกว่า มี issue หลายประเภทกว่า 162 00:13:08,432 --> 00:13:13,057 มาดูกันว่า Fable จะตอบว่าอย่างไร ผลออกมาน่าสนใจมากครับ 163 00:13:13,057 --> 00:13:19,138 Fable ตอบกลับมา — ใช้เวลาไปสักพัก — มัน verify ทุกรายการเทียบกับโค้ดและ 164 00:13:19,138 --> 00:13:25,220 installed library sources สรุปก็คือทั้ง 14 รายการเป็นจริงตามข้อเท็จจริง 165 00:13:25,220 --> 00:13:32,243 และ 12 รายการเป็นการพบที่ถูกต้อง สองรายการเป็นสิ่งที่มันเคยรายงานไปก่อนหน้านี้แล้ว 166 00:13:32,243 --> 00:13:36,783 รายการที่ร้ายแรงที่สุดอยู่ในโค้ดที่มันเขียนเอง นี่... 167 00:13:36,783 --> 00:13:41,151 น่าอายพอสมควรเลยครับ นี่คือรายละเอียดและ postmortem 168 00:13:41,151 --> 00:13:46,547 ที่ซื่อสัตย์ เรื่อง findings ก็คือรายการเหล่านี้เป็นจริงทั้งหมด 169 00:13:46,547 --> 00:13:51,001 อันนี้ยืนยันเป็น high severity และเป็น bug ของ Fable 170 00:13:51,001 --> 00:13:57,339 เอง แต่อย่างน้อย Fable ก็รับผิดได้นะครับ มันบอกว่ามันปล่อยส่วนนี้ไว้โดยไม่ 171 00:13:57,339 --> 00:14:03,506 guard ซึ่งเป็น bug class เดียวกับที่มันกำลังแก้อยู่ที่อื่นในไฟล์เดียวกัน 172 00:14:03,506 --> 00:14:07,703 อีกรายการคือ missing claims — กุญแจสำคัญลบ claims 173 00:14:07,703 --> 00:14:12,842 ทิ้งหมดเงียบ ๆ ซึ่งเป็นปัญหาค่อนข้างร้ายแรงสำหรับโปรเจกต์นี้ 174 00:14:12,842 --> 00:14:17,382 จริง ๆ แล้วนี่เป็น bug ที่ผมเคยติดอยู่ก่อนหน้านี้แล้ว 175 00:14:17,382 --> 00:14:21,665 เคยมีปัญหากับมันมาแล้ว เป็น high UX issue ที่ไม่มี 176 00:14:21,665 --> 00:14:26,718 movement threshold อยู่เลย นั่นก็เป็นสิ่งที่ผมเคยต่อสู้อยู่ 177 00:14:26,718 --> 00:14:31,172 ก็ดีใจที่มันหาเจอในที่สุด ก็คือทุกอย่างเช็กได้หมดเลย 178 00:14:31,172 --> 00:14:36,054 เหตุผลตรง ๆ จาก Fable ว่าทำไมถึงเป็นแบบนี้ — มันบอกว่ามัน 179 00:14:36,054 --> 00:14:40,851 anchor การตรวจสอบไว้กับประวัติ bug ที่รู้จักของผลิตภัณฑ์ 180 00:14:40,851 --> 00:14:44,876 การแก้ไขของมันเองไม่เคยเข้าสู่ adversarial loop 181 00:14:44,876 --> 00:14:49,159 อีกเลย รายการที่สองร้ายแรงที่สุด — มันเขียน import 182 00:14:49,159 --> 00:14:53,442 script ใหม่เพื่อแก้ปัญหา แต่ไฟล์ที่เขียนใหม่กลับมี 183 00:14:53,442 --> 00:14:58,752 issue เดียวกัน มัน verify data cleanliness แล้วสับสนคิดว่าเป็น 184 00:14:58,752 --> 00:15:03,977 invariant enforcement บางรายการก็เป็นข้อจำกัดมากกว่าที่จะเป็น 185 00:15:03,977 --> 00:15:08,174 bug จริง แต่ก็มี bug ระดับสูงอยู่หลายตัวเหมือนกัน 186 00:15:08,174 --> 00:15:12,371 นี่เป็น findings ที่น่าสนใจมากครับ สรุปก็คือเรามี 187 00:15:12,371 --> 00:15:19,394 GPT-5.6 แก้โค้ดที่ Fable เขียน และ Fable ก็ยอมรับและตระหนักว่าตัวเองเขียนโค้ดที่มี 188 00:15:19,394 --> 00:15:24,020 bug ออกมา นี่ไม่ได้แปลว่า GPT-5.6 จะดีกว่าเสมอไปนะครับ 189 00:15:24,020 --> 00:15:28,902 เพราะผมรันบน Sol พร้อม ultra ซึ่งน่าจะแพงกว่าเวอร์ชันปกติ 190 00:15:28,902 --> 00:15:33,013 แต่มันก็แสดงให้เห็นว่ามันเก่งพอสมควร เพราะหา bug 191 00:15:33,013 --> 00:15:37,895 ที่ Fable ไม่พบและยังเป็นโค้ดที่ Fable เขียนเองได้อีกด้วย 192 00:15:37,895 --> 00:15:43,634 สำหรับโปรเจกต์แบบนี้ ผมอยากให้มีอย่างน้อยหนึ่งในสองตัวทำหน้าที่เป็น 193 00:15:43,634 --> 00:15:50,915 auditor ผมจะใช้ workflow นี้ต่อไป เพราะจะเห็นว่าแม้แต่โมเดลตารางระดับสูงสุดก็ยังเขียน 194 00:15:50,915 --> 00:15:57,595 bug ออกมาโดยไม่รู้ตัวว่าตัวเองเขียน นั่นคือเหตุผลที่คุณต้องมีอะไรสักอย่างอย่าง 195 00:15:57,595 --> 00:16:01,964 GPT-5.6 มาช่วยจับ ก็คงมีแค่นี้ครับสำหรับ First Look 196 00:16:01,964 --> 00:16:07,103 at GPT-5.6 ทำไปแค่ไม่กี่ task เล็ก ๆ เพราะผมจะใช้มันอยู่บ่อย 197 00:16:07,103 --> 00:16:11,214 ๆ และคุณจะเห็นผมใช้ในชีวิตประจำวันในโปรเจกต์ต่าง 198 00:16:11,214 --> 00:16:15,326 ๆ มันจะกลายเป็น driver หลักใน Hermes Agent ของผม 199 00:16:15,326 --> 00:16:19,351 ผมก็เลยอยากเห็นว่ามันทำได้ดีแค่ไหน จากแค่ไม่กี่ 200 00:16:19,351 --> 00:16:24,405 task นี้ ผมประทับใจพอสมควร ก็หวังว่ามันจะอยู่ได้ต่อไปนะครับ 201 00:16:24,405 --> 00:16:28,430 แค่นี้แหละสำหรับวิดีโอนี้ ฝากคอมเมนต์ด้วยนะครับ 202 00:16:28,430 --> 00:16:32,542 ประสบการณ์ของคุณกับ GPT-5.6 เป็นอย่างไรบ้าง? ฝาก 203 00:16:32,542 --> 00:16:37,338 subscribe ฝาก like ด้วยนะครับ แล้วเจอกันใหม่ในวิดีโอหน้า 204 00:16:37,338 --> 00:16:38,880 ขอบคุณที่รับชมครับ