▶SUBTHAIแปลไทย · ซับ · พากย์⚙
บทความแปลภาษาไทย · YouTube

First Look at GPT-5.6: The Ultimate Hermes Agent Driver?

0:000:00
เล่นเสียงต้นฉบับของวิดีโอ พร้อมแสดงซับไทยซิงก์ตามเวลา
กำลังโหลดวิดีโอ…
01

สรุปย่อ

ประเด็นสำคัญจากวิดีโอ

- **ช่อง:** Tonbi's AI Garage · **ความยาว:** ~17 นาที · **ลิงก์:** https://www.youtube.com/watch?v=OHaYGPiZQ3g

# สรุป: First Look at GPT-5.6: The Ultimate Hermes Agent Driver?

- **ช่อง:** Tonbi's AI Garage · **ความยาว:** ~17 นาที · **ลิงก์:** https://www.youtube.com/watch?v=OHaYGPiZQ3g

## ประเด็นหลัก

- OpenAI เปิดตัว GPT-5.6 อย่างเป็นทางการ โดยมีโมเดลย่อยสามตัว: Sol (flagship), Terra (สมดุลสำหรับงานประจำวัน), Luna (ประหยัดต้นทุน)
- มีโหมดเสริม compute สองแบบ: max (ให้โมเดลเดียว reason นานขึ้น) และ ultra (แบ่งงานออกเป็น agent ขนาน — research, implementation, testing, critique)
- ในเบนช์มาร์ก Agents' Last Exam ได้ 53.6 คะแนน สูงกว่า Fable ถึง 13.1 คะแนนบน AI Intelligence Index ขณะที่เร็วกว่า 61% และต้นทุนครึ่งหนึ่ง
- คุณสมบัติเด่นคือ programmatic tool calling — เขียนและรันโปรแกรมใน memory เพื่อประสาน tool ทำให้ลด model round-trip และ prompt token
- ด้าน coding นำใน agentic coding และงาน terminal แบบกว้าง แต่ Fable ยังเหนือกว่าใน SWE-bench แบบหลายไฟล์ยาก ๆ
- ด้านความปลอดภัยไซเบอร์กระโดดขึ้นมาก (ExploitBench จาก 47.9% เป็น 73.5%) แต่มี guardrail ที่เข้มงวดกว่า
- ราคา Sol: $5 input / $30 output; Terra & Luna: $1 input / $6 output (ใกล้เคียง Haiku)
- ทดสอบ one-shot สร้างเกม One Piece x Star Wars ใน Hermes Agent: ผลออกมาดีมาก สไตล์ต่างจากโมเดลอื่น มีรายละเอียดมาก อยู่ในระดับเทียบเท่าหรือดีกว่า Fable แม้ headline stagger จะยังไม่สมบูรณ์
- ทดสอบ audit codebase โปรเจกต์ Shovels Terminal ด้วย ultra ใน Codex: พบ bug high severity 4 ตัว
- นำ bug ที่พบไปให้ Fable verify — ผลคือทั้ง 14 รายการเป็นจริงตามข้อเท็จจริง และ 12 รายการเป็นการพบที่ถูกต้อง
- บาง bug เป็นโค้ดที่ Fable เขียนเองแล้วไม่รู้ตัวว่ามี bug — แสดงให้เห็นคุณค่าของการมี auditor คนที่สอง
- context window ใน Hermes Agent เพิ่มจาก 270K เป็น 372K token ช่วยในงาน coding ระยะยาว

## ความเห็นสรุป

GPT-5.6 ผลิตงาน front-end ได้น่าประทับใจมากในการลองครั้งแรก และในฐานะ code auditor มันสามารถจับ bug ที่แม้แต่โมเดลระดับสูงอย่าง Fable ก็พลาดได้ ผู้จัดจะใช้มันเป็น driver หลักใน Hermes Agent ต่อไป และเน้นย้ำว่าการมี auditor สองชั้นจำเป็นมากเพราะแม้โมเดลเก่งสุดก็ยังเขียน bug โดยไม่รู้ตัว ทั้งหมดนี้เป็นแค่การลองครั้งแรก ผลลัพธ์จะต้องติดตามกันต่อไปในการใช้งานจริง
02

คำแปลเต็ม

แปลตามบทสนทนาต้นฉบับ ปรับเป็นภาษาไทยธรรมชาติ

วันนี้ OpenAI ประกาศตัว GPT-5.6 ซึ่งเป็นโมเดล GPT รุ่นใหม่ล่าสุดที่ทุกคนรอคอยกันมานาน จริง ๆ แล้วมันได้อยู่ในช่วงพรีวิวให้พาร์ตเนอร์บางรายทดลองใช้มาสักพักแล้ว แต่ตอนนี้เราเข้าถึงมันได้แล้ว และนี่น่าตื่นเต้นมาก โดยเฉพาะเพราะผมสามารถใช้โมเดล GPT ใน Hermes Agent ของผมได้ ซึ่งน่าตื่นเต้นยิ่งกว่าการเปิดตัวโมเดล Claude ด้วยซ้ำ เพราะมันคือโมเดลเดียวแต่เทคนิคแล้วมีสามแบบ รุ่น flagship คือ Sol จากนั้นมี Terra ซึ่งเป็นโมเดลที่สมดุลกว่าสำหรับงานประจำวัน แล้วก็ Luna ซึ่งเป็นโมเดลที่ประหยัดต้นทุนกว่า ก็คือมีสามขนาดและสามราคาที่ต่างกัน แต่ตัวหลักที่เราจะใช้และพูดถึงกันในที่นี้คือ Sol นะครับ

นี่จะเป็นการลองใช้ GPT-5.6 ครั้งแรกของผม และถ้าใครสังเกตเห็น ผมใช้ GPT-5.6 สร้างสไลด์โชว์ชุดนี้จริง ๆ ด้วย ก็ลองตัดสินจากตรงนั้นได้เลย ข้อเรียกร้องหลักของ GPT-5.6 ไม่ใช่แค่ว่ามันฉลาดขึ้นเฉย ๆ แต่คือทุกระดับจะได้ผลงานที่มีประโยชน์มากขึ้นจากทุก token ทุกดอลลาร์ และทุกนาที ในวิดีโอนี้ผมจะเล่าสรุปว่า GPT-5.6 คืออะไร เบนช์มาร์กเป็นอย่างไร แล้วเราจะลองให้มันทำงานจริงเพื่อดูว่ามันทำได้จริงและทนทานแค่ไหน เริ่มกันเลยครับ

สำหรับใครที่รัน agent เองแล้วอยากเข้าถึง Agent Wikis ที่ผมใช้ทำวิดีโอเหล่านี้เพื่อค้นคว้าและสร้างเนื้อหาจริง ๆ ลองแวะดูโปรเจกต์ของผมได้ที่ agentwiks.com นะครับ ผมให้ wikis เหล่านี้ฟรีทุกชุดในหลากหลายหัวข้อ และถ้าสมัครบัญชี Pro ในราคา $9.99 ต่อเดือน ก็จะได้เข้าถึง wikis ขนาดใหญ่พิเศษที่มีหน้ามากกว่าและรายละเอียดลึกกว่าในแต่ละหัวข้อ กลับมาที่วิดีโอกันต่อครับ

GPT-5.6 ให้สองทางเลือกในการใช้ compute มากขึ้น ทางแรกคือใช้ max ซึ่งจะให้โมเดลเดียว reason นานขึ้น โดยสำรวจทางเลือกอื่น ๆ รันการตรวจสอบ และแก้ไขงานของมันเอง ส่วนอีกทางคือ ultra ซึ่งเปลี่ยนโครงสร้างของงานไปเลย มันจะประสานงาน agent แบบขนานโดย default แบ่งงานออกเป็นส่วนค้นคว้า ส่วน implement ส่วนทดสอบ และส่วนวิจารณ์ เป็น architecture หรือ workflow ใหม่ที่น่าสนใจกับโมเดลตัวเดียว

ในเบนช์มาร์ก Agents' Last Exam มันได้ 53.6 คะแนน ซึ่งสูงกว่า Fable ถึง 13.1 คะแนนบน AI Intelligence Index เวอร์ชัน max reasoning ของ Sol เข้าใกล้ Fable ภายในหนึ่งคะแนน ขณะที่ทำงานเร็วกว่า 61% และต้นทุนประมาณครึ่งหนึ่ง นี่คือสิ่งที่เขาอยากเน้นย้ำ ไม่ใช่แค่ว่ามันเทียบเท่า Fable แต่คือมันถูกกว่าและเร็วกว่ามาก

การเปลี่ยนแปลง workflow ที่ใหญ่ที่สุดคือ programmatic tool calling ซึ่ง GPT-5.6 สามารถเขียนและรันโปรแกรมเบา ๆ ใน memory เพื่อประสาน tool กรองผลลัพธ์ระหว่างทาง ติดตามความคืบหน้า และเลือกว่าจะทำอะไรต่อไป นั่นหมายถึงการเรียกโมเดลรอบน้อยลงและ prompt token ที่ลดลงในงานที่ใช้ tool เยอะ นอกจากนี้มันยังออกแบบมาให้ตรวจสอบงานที่ render แล้ว ไม่ใช่แค่สร้าง source code เท่านั้น OpenAI อ้างว่า interface ที่แข็งแกร่งขึ้น เช่น presentation แบบที่เห็นนี้ เอกสาร สเปรดชีต โดยมีผล 92.2% บน BrowseComp Ultra และถ้าดูจากสายตา นี่คือการสร้างครั้งเดียว (one-shot) โดยผมไม่ได้กำหนด format เฉพาะเลย ในอดีต presentation ที่ผมทำกับโมเดล GPT จะเรียบ ๆ กว่านี้มาก แต่อันนี้กลับใกล้เคียงกับสิ่งที่ผมมักได้จากโมเดล Claude ซึ่งเป็นสิ่งที่ผมใช้ทำ presentation อยู่เป็นประจำ ผมอาจลองใช้ GPT-5.6 บ่อยขึ้น เพราะนี่ดูดีจริง ๆ

มาดูเบนช์มาร์กด้าน coding กันบ้าง ซึ่งเป็นจุดที่เรื่องประสิทธิภาพชัดเจนมาก อย่างที่บอกไป บน AI Coding Index มันได้คะแนนสูงกว่า Fable แต่ก็ไม่ได้กวาดทุกเบนช์มาร์กนะครับ บน SWE-bench นั้น Fable ยังนำอยู่ 15.7 คะแนน สรุปก็คือ GPT-5.6 นำในด้าน agentic coding และงาน terminal แบบกว้าง ๆ แต่ Fable ยังได้เปรียบมากใน software benchmark แบบหลายไฟล์ที่ยาก แต่ท้ายที่สุดนี่ก็แค่เบนช์มาร์ก เรายังไม่รู้ว่าในการใช้งานจริงจะเป็นอย่างไร

ด้านความปลอดภัยไซเบอร์เป็นจุดที่กระโดดขึ้นมาก ExploitBench พุ่งจาก 47.9% มาที่ 73.5% และเบนช์มาร์กความปลอดภัยอื่น ๆ ก็เพิ่มขึ้นแบบเดียวกัน OpenAI ระบุว่า GPT-5.6 ยังอยู่ต่ำกว่าเกณฑ์วิกฤตในด้าน cyber และ biology แต่การเข้าถึงจะถูกควบคุมมากขึ้น การเปิดตัวมี trusted access, การตรวจสอบแบบ real-time, reasoning monitor และมาตรการป้องกันที่บล็อกกิจกรรมไซเบอร์ที่อาจเป็นอันตรายได้มากกว่าโมเดลก่อนหน้าประมาณสิบเท่า ไม่แน่ว่าสิ่งนี้จะสร้างความไม่สะดวกมากแค่ไหน เพราะเมื่อสัปดาห์ที่ผ่านมาที่ผมใช้ Fable มันน่ารำคาญพอสมควรเลยครับ ตอนทำโปรเจกต์ coding ธรรมดา ๆ ไม่ว่าจะเกมหรือแอปอะไรสักอย่าง แล้วไปเปิด guardrail ของ Fable ขึ้นมา ผมก็ใช้งานต่อไม่ได้แล้ว และพอ trigger ขึ้นมาครั้งนึง มันจะเป็นปัญหาต่อไปตลอดในโปรเจกต์นั้น แม้จะกลับไปแก้ prompt แล้วก็ตาม มันน่ารำคาญมาก ก็หวังว่าทางนี้จะไม่เป็นแค่นั้น

เรื่องราคาก็มีหลายระดับนะครับ Sol อยู่ที่ $5 input และ $30 output ส่วนโมเดลที่ถูกกว่าอย่าง Terra และ Luna อยู่ที่ $1 input และ $6 output ซึ่งใกล้เคียงกับราคา Haiku ก็พอจะมองภาพได้ว่านี่เปรียบเหมือน Opus, Sonnet และ Haiku ของ OpenAI เลย แม้จะไม่ตรงเป๊ะ 100% แต่ก็พอให้ภาพจำได้

ก็คงเล่าพอที มาลองใช้จริงกันเลยครับ

อันดับแรกคืองาน coding ที่หลายคนอาจเริ่มเบื่อแล้ว แต่ผมว่ามันดีเพราะผมมีการเปรียบเทียบมากพอสมควร และเป็นงานที่ค่อนข้างยาก นั่นคือการสร้างไฟล์ HTML ไฟล์เดียวสำหรับเกม One Piece x Star Wars ที่มี hero section เต็มจอพื้นหลังสีเข้ม มีทรงกลม 3D หมุนได้ด้วย Three.js พร้อม custom GLSL fragment shader ที่ทำให้มันดูเหมือนดาวเคราะห์เรืองแสง ทรงกลมจะค่อย ๆ หมุนรอบแกน X หรือ Y เมื่อ scroll, GSAP จะ animate การย่อและจางหายของทรงกลมพร้อมกับให้ headline ค่อย ๆ ปรากฏ ส่วน headline จะมี stagger entrance สไตล์ framer motion และต้องรันได้ใน Chrome ห้ามใช้ npm ให้ใช้ CDN imports เท่านั้น หลายคนคงเคยเห็นงานนี้มาแล้ว แต่ผมมีงานเปรียบเทียบจาก Grok 4.5 ที่เพิ่งทำไปเมื่อวาน รวมถึงจาก Opus และ Fable ก็เลยดูเปรียบเทียบกันแบบ apples-to-apples ได้เลย

ตอนนี้เราจะสลับมาใช้ GPT-5.6 Sol ใน Hermes Agent เพราะนี่คือที่ที่ผมจะใช้มันเป็นหลัก ผมอาจใช้ใน Codex บ้าง แต่หลัก ๆ จะอยู่ใน Hermes Agent สิ่งที่ดีก็คือเราได้ context window ที่ใหญ่ขึ้นมาเล็กน้อย ข้อจำกัดจริง ๆ ของ GPT-5.5 ใน Hermes คือมี context window แค่ประมาณ 270,000 token แต่ตอนนี้เราได้เพิ่มเป็น 372,000 แล้ว ซึ่งช่วยได้มากสำหรับงาน coding ที่ต้องทนยาวได้ ผมก็จะให้ task นี้กับมันแล้วดูกันว่าเป็นยังไง

เพื่อให้เห็นการเปรียบเทียบ นี่คือผลงานของ Fable ซึ่งดูดีมาก น่าจะเป็นอันที่ดีที่สุดเลย ส่วนอันที่เพิ่งทำเมื่อวานนี้จาก Grok 4.5 ก็ทำตามคำสั่งครบ แต่สไตล์ออกจะน้อยกว่านิดหน่อย อย่างไรก็ตามมันทำได้ในครั้งเดียว (one-shot) ตรงตามคำสั่ง และนี่คือผลงานของ Opus 4.8 ซึ่งก็ใช้ได้ แต่น่าจะต้องลองประมาณสามรอบถึงจะออกมาได้ และจะเห็นว่าแม้ตอนทำได้แล้ว headline แบบ stagger ก็ยังขึ้นมาใต้ตำแหน่งที่ scroll อยู่ คือมันไม่ทำงานถูกต้องนะ แต่ดีเรื่องรูปลักษณ์ ทรงกลมก็ดูดี งั้นมาดูกันว่า GPT-5.6 จะทำได้แค่ไหน

โอเค ทำเสร็จแล้ว มาดูกัน เรียบร้อย GPT ทำเสร็จแล้วและดูดีมาก ดู orb ตรงนี้สิ สไตล์ต่างจากอันอื่น ๆ ที่เห็นชัดเจน เป็นการตีความที่แตกต่าง อ้อ จริง ๆ ถ้าขยับเมาส์ — ไม่รู้ว่ากล้องจะเห็นไหมนะ มันจุกจิกนิดหน่อย — แต่ถ้าขยับเมาส์ไปรอบ ๆ พื้นหลังจะขยับเล็กน้อยตามไปด้วย ค่อนข้างเจ๋งเลยครับ ดูดีจริง ๆ งั้นมาลอง scroll กันบ้าง ซึ่งเป็นส่วนสำคัญที่สุด

ถ้า scroll ลงมันก็จะ — เจ๋งจริง ๆ — เข้ามาตรงกลาง "The Grand Line runs through the stars" ได้ปกติ ทุก element อื่นก็ดูดี มีปัญหาอยู่อย่างเดียวคือคล้ายกับที่เจอในเวอร์ชันของ Opus คือมันทำ stagger ตรงนี้ได้ไม่ค่อยดีนัก ไม่รู้ว่าจะมองเห็นไหมนะ แต่มันจะขึ้นมานิดเดียวมาก ถ้า scroll เร็วพอจะเห็นว่ามันเกือบจะขึ้นมาใต้จอไปเลย แต่นอกนั้นดูดีมากครับ คือถ้าเทียบกับ Fable นะ ผมว่าผมชอบอันนี้มากกว่าด้วยซ้ำ รู้สึกว่ามีรายละเอียดในการสร้างทรงกลมมากกว่าเยอะเลย ผมว่านี่อยู่ในระดับเท่ากันเป็นอย่างน้อย ปัญหาเดียวก็คือเรื่อง headline ที่ยังทำงานได้ไม่สมบูรณ์ แต่นอกนั้นดูดีมาก สรุปก็คือเป็นการกระโดดครั้งใหญ่จากโมเดลก่อนหน้าในแง่ style point และงาน front-end นี่เป็นผลลัพธ์ที่แข็งแรงมากครับ

งานถัดไปเป็นโปรเจกต์ขั้นสูงมากที่ผมกำลังทำอยู่ ตอนนี้เสร็จไปประมาณ 70% แล้ว คร่าว ๆ มันชื่อ Shovels Terminal ซึ่งเป็นแผนที่ของ AI supply chain ทั้งหมด แสดงว่าองค์ประกอบต่าง ๆ เชื่อมโยงกันอย่างไร แล้วบริษัทจดทะเบียนใดบ้างที่ได้รับผลกระทบจากคลื่นผลกระทบของ supply chain เหล่านี้ พอมีเวลาเสร็จก็คงได้ดูกัน เป็นโปรเจกต์ที่ซับซ้อนมากเพราะมีองค์ประกอบด้านภาพเยอะ และมีส่วนประกอบเชื่อมโยงกันเยอะมากเช่นกัน

นี่คือผลการ audit ที่ Fable เพิ่งทำไป ผมขอให้มันตรวจหา bug งานถัดไปที่ผมจะให้ GPT-5.6 ทำก็คือ audit แบบเดียวกันนี้ และเราจะเปิดใช้ ultra เต็มที่เลย ซึ่งการใช้ ultra จะต้องทำใน Codex ตรง ๆ เลย ไม่ใช่ใน Hermes Agent ผมก็จะสั่ง "audit this codebase and report any bugs" เพื่อดูว่าผล audit จาก GPT-5.6 เทียบกับของ Fable จะเป็นอย่างไร

อ้อ ถือโอกาสเผยโฉมนิดหน่อยนะครับ ตามที่บอกโปรเจกต์นี้เสร็ย 70% นี่คือหน้าเว็บ Shovels Terminal และนี่คือแผนที่ ยังต้องทำต่่ออีกพอสมควร แต่จะเห็นว่ามีองค์ประกอบต่าง ๆ เชื่อมโยงกันอยู่ และทุกการเชื่อมโยงนั้นมาจากงานค้นคว้าจริง ส่วน UI ยังดูแปลก ๆ อยู่บ้างนะครับ แต่ก็คือคอนเซ็ปต์นั้นแหละ และอย่างที่จินตนาการได้มันค่อนข้างซับซ้อน ถ้าทำเสร็ยจริง ๆ ผมว่าน่าจะเจ๋งมาก จะเห็นว่ามันแสดงบริษัทที่โดนกระทบมากที่สุดเป็นอันดับต้น ๆ ในแต่ละด้านได้ด้วย

โอเค Ultra รันกลับมาในเวลา 16 นาที พบ bug ระดับ high severity อยู่หลายตัวเลยทีเดียว มีจุดเล็ก ๆ ที่ผมชอบก็คือใน Codex มักจะออกแนวยืดยาวเวิ่นเว้อ จากที่ใช้อยู่ทั้งวันนี้ รู้สึกว่ามันกระชับข้อมูลดีขึ้น นั่นคือเหตุผลที่ผมมักใช้ Claude Opus หรือ Fable สำหรับโปรเจกต์ระยะยาวมากกว่า เพราะนำเสนอข้อมูลได้ดีกว่า แต่ GPT-5.6 นี่กระชับขึ้นมาก เข้าเป็นสาระเลย ก่อนหน้านี้มันออกจะ verbose มาก เรามาดูปัญหาที่มันพบกันบ้าง พบ bug ระดับ high severity สี่ตัว ระดับ medium หลายตัว และ bug ระดับ low severity เพิ่มเติมอีก

สิ่งที่ผมจะทำคือเอา bug เหล่านี้ไปให้ Fable ตรวจสอบว่าเป็น bug จริงไหม แล้วให้มันอธิบายว่าทำไมตอนแรกมันถึงไม่พบ นี่คือสิ่งที่ผมกำลังรันใน Fable อยู่ ผมสั่งว่า "I ran another audit with a different model. Please review the findings, verify them, do not assume they are true. Give me a report of the legitimate findings and try to explain the best you can why you did not find them. Do not actually fix anything. Just verify the report." แล้วก็วางผลที่พบเข้าไป มาดูกันว่า Fable จะตอบอะไร

ก็บอกได้เลยว่าดูจากผลคร่าว ๆ ก็เห็นว่า GPT-5.6 พบได้มากกว่า Fable พบ critical issue จริง ๆ แค่อันเดียวที่เกี่ยวกับ shockwave engine ส่วนของ GPT-5.6 จะหลากหลายกว่า มี issue หลายประเภทกว่า มาดูกันว่า Fable จะตอบว่าอย่างไร

ผลออกมาน่าสนใจมากครับ Fable ตอบกลับมา — ใช้เวลาไปสักพัก — มัน verify ทุกรายการเทียบกับโค้ดและ installed library sources สรุปก็คือทั้ง 14 รายการเป็นจริงตามข้อเท็จจริง และ 12 รายการเป็นการพบที่ถูกต้อง สองรายการเป็นสิ่งที่มันเคยรายงานไปก่อนหน้านี้แล้ว รายการที่ร้ายแรงที่สุดอยู่ในโค้ดที่มันเขียนเอง นี่... น่าอายพอสมควรเลยครับ นี่คือรายละเอียดและ postmortem ที่ซื่อสัตย์

เรื่อง findings ก็คือรายการเหล่านี้เป็นจริงทั้งหมด อันนี้ยืนยันเป็น high severity และเป็น bug ของ Fable เอง แต่อย่างน้อย Fable ก็รับผิดได้นะครับ มันบอกว่ามันปล่อยส่วนนี้ไว้โดยไม่ guard ซึ่งเป็น bug class เดียวกับที่มันกำลังแก้อยู่ที่อื่นในไฟล์เดียวกัน อีกรายการคือ missing claims — กุญแจสำคัญลบ claims ทิ้งหมดเงียบ ๆ ซึ่งเป็นปัญหาค่อนข้างร้ายแรงสำหรับโปรเจกต์นี้ จริง ๆ แล้วนี่เป็น bug ที่ผมเคยติดอยู่ก่อนหน้านี้แล้ว เคยมีปัญหากับมันมาแล้ว เป็น high UX issue ที่ไม่มี movement threshold อยู่เลย นั่นก็เป็นสิ่งที่ผมเคยต่อสู้อยู่ ก็ดีใจที่มันหาเจอในที่สุด

ก็คือทุกอย่างเช็กได้หมดเลย เหตุผลตรง ๆ จาก Fable ว่าทำไมถึงเป็นแบบนี้ — มันบอกว่ามัน anchor การตรวจสอบไว้กับประวัติ bug ที่รู้จักของผลิตภัณฑ์ การแก้ไขของมันเองไม่เคยเข้าสู่ adversarial loop อีกเลย รายการที่สองร้ายแรงที่สุด — มันเขียน import script ใหม่เพื่อแก้ปัญหา แต่ไฟล์ที่เขียนใหม่กลับมี issue เดียวกัน มัน verify data cleanliness แล้วสับสนคิดว่าเป็น invariant enforcement บางรายการก็เป็นข้อจำกัดมากกว่าที่จะเป็น bug จริง แต่ก็มี bug ระดับสูงอยู่หลายตัวเหมือนกัน นี่เป็น findings ที่น่าสนใจมากครับ

สรุปก็คือเรามี GPT-5.6 แก้โค้ดที่ Fable เขียน และ Fable ก็ยอมรับและตระหนักว่าตัวเองเขียนโค้ดที่มี bug ออกมา นี่ไม่ได้แปลว่า GPT-5.6 จะดีกว่าเสมอไปนะครับ เพราะผมรันบน Sol พร้อม ultra ซึ่งน่าจะแพงกว่าเวอร์ชันปกติ แต่มันก็แสดงให้เห็นว่ามันเก่งพอสมควร เพราะหา bug ที่ Fable ไม่พบและยังเป็นโค้ดที่ Fable เขียนเองได้อีกด้วย สำหรับโปรเจกต์แบบนี้ ผมอยากให้มีอย่างน้อยหนึ่งในสองตัวทำหน้าที่เป็น auditor ผมจะใช้ workflow นี้ต่อไป เพราะจะเห็นว่าแม้แต่โมเดลตารางระดับสูงสุดก็ยังเขียน bug ออกมาโดยไม่รู้ตัวว่าตัวเองเขียน นั่นคือเหตุผลที่คุณต้องมีอะไรสักอย่างอย่าง GPT-5.6 มาช่วยจับ

ก็คงมีแค่นี้ครับสำหรับ First Look at GPT-5.6 ทำไปแค่ไม่กี่ task เล็ก ๆ เพราะผมจะใช้มันอยู่บ่อย ๆ และคุณจะเห็นผมใช้ในชีวิตประจำวันในโปรเจกต์ต่าง ๆ มันจะกลายเป็น driver หลักใน Hermes Agent ของผม ผมก็เลยอยากเห็นว่ามันทำได้ดีแค่ไหน จากแค่ไม่กี่ task นี้ ผมประทับใจพอสมควร ก็หวังว่ามันจะอยู่ได้ต่อไปนะครับ แค่นี้แหละสำหรับวิดีโอนี้ ฝากคอมเมนต์ด้วยนะครับ ประสบการณ์ของคุณกับ GPT-5.6 เป็นอย่างไรบ้าง? ฝาก subscribe ฝาก like ด้วยนะครับ แล้วเจอกันใหม่ในวิดีโอหน้า ขอบคุณที่รับชมครับ

03

หมายเหตุการแปล

ความโปร่งใสเกี่ยวกับความไม่แน่นอนในต้นฉบับ

  • ## ส่วนที่ฟังไม่ชัด `[ฟังไม่ชัด]`
  • ไม่มี — ไม่มีช่วงใดที่ความหมายเลือนลางถึงขั้นต้องใส่เครื่องหมาย `[ฟังไม่ชัด]` แม้บางช่วงจะมีคำพูดตะกุกตะกัก แต่สามารถเข้าใจใจความได้จากบริบท
04

อภิธานศัพท์เทคนิค

คำศัพท์และชื่อผลิตภัณฑ์ที่คงรูปภาษาอังกฤษ

ศัพท์คำแปล / คำอธิบาย
GPT-5.6โมเดลภาษาตัวใหม่ล่าสุดของ OpenAI มีสามรุ่นย่อย: Sol, Terra, Luna
Solรุ่น flagship ของ GPT-5.6 ตัวหลักที่ใช้ในวิดีโอ
Terraรุ่นสมดุลของ GPT-5.6 สำหรับงานประจำวัน
Lunaรุ่นประหยัดต้นทุนของ GPT-5.6
OpenAIบริษัทผู้พัฒนา GPT
Hermes Agentเวิร์กโฟลว์/ระบบ agent หลักที่ผู้จัดใช้ทำงาน
Fableโมเดลภาษาฝั่ง Anthropic ที่ใช้เปรียบเทียบ (น่าจะหมายถึงรุ่นในตระกูล Claude)
Claude / Claude Opusโมเดลของ Anthropic
Grok 4.5โมเดลของ xAI ที่นำมาเปรียบเทียบ
Codexเครื่องมือ/CLI สำหรับ coding ของ OpenAI
max (โหมด)โหมดที่ให้โมเดล reason นานขึ้น สำรวจทางเลือกและตรวจสอบงาน
ultra (โหมด)โหมดที่เปลี่ยนโครงสร้างงาน ประสาน agent แบบขนาน (research, implementation, testing, critique)
programmatic tool callingความสามารถในการเขียน/รันโปรแกรมใน memory เพื่อประสาน tool ต่าง ๆ
Agents' Last Examเบนช์มาร์กวัดความสามารถ agent
AI Intelligence Indexดัชนีวัดปัญญา AI
BrowseComp Ultraเบนช์มาร์กวัดความสามารถในการเรียกดู/โบรว์ซ
SWE-benchเบนช์มาร์ก software engineering แบบหลายไฟล์
ExploitBenchเบนช์มาร์กด้านความปลอดภัยไซเบอร์
context windowขนาดหน่วยความจำตามบริบทที่โมเดลรับได้ในครั้งเดียว
one-shotการสร้างผลลัพธ์ในครั้งเดียวโดยไม่ต้องแก้หลายรอบ
tokenหน่วยย่อยของข้อความที่โมเดลประมวลผล
agentโปรแกรม AI ที่ทำงานอัตโนมัติเป็นขั้นตอน
guardrailระบบป้องกันความปลอดภัยที่บล็อกเนื้อหา/การกระทำที่เป็นอันตราย
auditการตรวจสอบโค้ดเพื่อหา bug
Three.jsไลบรารี JavaScript สำหรับกราฟิก 3D
GLSL fragment shaderโปรแกรมเฉพาะที่ควบคุมสี/แสงของพิกเซลบน GPU
GSAPไลบรารี JavaScript สำหรับ animation
framer motionไลบรารี animation สำหรับ React
Shovels Terminalโปรเจกต์ส่วนตัวของผู้จัด เป็นแผนที่ AI supply chain
supply chainห่วงโซ่อุปทาน
npm / CDNระบบจัดการแพ็กเกจ / เครือข่ายกระจายเนื้อหา
Agent Wikis / agentwiks.comโปรเจกต์คลังความรู้ของผู้จัด ให้บริการฟรีและระดับ Pro
05

ซับไตเติ้ลภาษาไทย

ดาวน์โหลดหรือดูซับทั้งหมด

1
00:00:00,000 --> 00:00:04,197
วันนี้ OpenAI ประกาศตัว GPT-5.6 ซึ่งเป็นโมเดล GPT

2
00:00:04,197 --> 00:00:13,447
รุ่นใหม่ล่าสุดที่ทุกคนรอคอยกันมานาน จริง ๆ แล้วมันได้อยู่ในช่วงพรีวิวให้พาร์ตเนอร์บางรายทดลองใช้มาสักพักแล้ว

3
00:00:13,447 --> 00:00:17,730
แต่ตอนนี้เราเข้าถึงมันได้แล้ว และนี่น่าตื่นเต้นมาก

4
00:00:17,730 --> 00:00:21,927
โดยเฉพาะเพราะผมสามารถใช้โมเดล GPT ใน Hermes Agent
thai-subtitles.srt
SubRip — ใช้กับเครื่องเล่นวิดีโอส่วนใหญ่
↓ ดาวน์โหลด
thai-subtitles.vtt
WebVTT — ใช้กับเว็บ / YouTube
↓ ดาวน์โหลด
เปิดดูซับไตเติ้ลทั้งหมด (204 segments)
1
00:00:00,000 --> 00:00:04,197
วันนี้ OpenAI ประกาศตัว GPT-5.6 ซึ่งเป็นโมเดล GPT

2
00:00:04,197 --> 00:00:13,447
รุ่นใหม่ล่าสุดที่ทุกคนรอคอยกันมานาน จริง ๆ แล้วมันได้อยู่ในช่วงพรีวิวให้พาร์ตเนอร์บางรายทดลองใช้มาสักพักแล้ว

3
00:00:13,447 --> 00:00:17,730
แต่ตอนนี้เราเข้าถึงมันได้แล้ว และนี่น่าตื่นเต้นมาก

4
00:00:17,730 --> 00:00:21,927
โดยเฉพาะเพราะผมสามารถใช้โมเดล GPT ใน Hermes Agent

5
00:00:21,927 --> 00:00:25,953
ของผมได้ ซึ่งน่าตื่นเต้นยิ่งกว่าการเปิดตัวโมเดล

6
00:00:25,953 --> 00:00:30,835
Claude ด้วยซ้ำ เพราะมันคือโมเดลเดียวแต่เทคนิคแล้วมีสามแบบ

7
00:00:30,835 --> 00:00:37,687
รุ่น flagship คือ Sol จากนั้นมี Terra ซึ่งเป็นโมเดลที่สมดุลกว่าสำหรับงานประจำวัน

8
00:00:37,687 --> 00:00:44,539
แล้วก็ Luna ซึ่งเป็นโมเดลที่ประหยัดต้นทุนกว่า ก็คือมีสามขนาดและสามราคาที่ต่างกัน

9
00:00:44,539 --> 00:00:48,651
แต่ตัวหลักที่เราจะใช้และพูดถึงกันในที่นี้คือ Sol

10
00:00:48,651 --> 00:00:52,676
นะครับ นี่จะเป็นการลองใช้ GPT-5.6 ครั้งแรกของผม

11
00:00:52,676 --> 00:00:57,644
และถ้าใครสังเกตเห็น ผมใช้ GPT-5.6 สร้างสไลด์โชว์ชุดนี้จริง

12
00:00:57,644 --> 00:01:02,269
ๆ ด้วย ก็ลองตัดสินจากตรงนั้นได้เลย ข้อเรียกร้องหลักของ

13
00:01:02,269 --> 00:01:09,721
GPT-5.6 ไม่ใช่แค่ว่ามันฉลาดขึ้นเฉย ๆ แต่คือทุกระดับจะได้ผลงานที่มีประโยชน์มากขึ้นจากทุก

14
00:01:09,721 --> 00:01:14,346
token ทุกดอลลาร์ และทุกนาที ในวิดีโอนี้ผมจะเล่าสรุปว่า

15
00:01:14,346 --> 00:01:22,997
GPT-5.6 คืออะไร เบนช์มาร์กเป็นอย่างไร แล้วเราจะลองให้มันทำงานจริงเพื่อดูว่ามันทำได้จริงและทนทานแค่ไหน

16
00:01:22,997 --> 00:01:27,794
เริ่มกันเลยครับ สำหรับใครที่รัน agent เองแล้วอยากเข้าถึง

17
00:01:27,794 --> 00:01:33,533
Agent Wikis ที่ผมใช้ทำวิดีโอเหล่านี้เพื่อค้นคว้าและสร้างเนื้อหาจริง

18
00:01:33,533 --> 00:01:37,815
ๆ ลองแวะดูโปรเจกต์ของผมได้ที่ agentwiks.com นะครับ

19
00:01:37,815 --> 00:01:43,126
ผมให้ wikis เหล่านี้ฟรีทุกชุดในหลากหลายหัวข้อ และถ้าสมัครบัญชี

20
00:01:43,126 --> 00:01:52,462
Pro ในราคา $9.99 ต่อเดือน ก็จะได้เข้าถึง wikis ขนาดใหญ่พิเศษที่มีหน้ามากกว่าและรายละเอียดลึกกว่าในแต่ละหัวข้อ

21
00:01:52,462 --> 00:01:57,258
กลับมาที่วิดีโอกันต่อครับ GPT-5.6 ให้สองทางเลือกในการใช้

22
00:01:57,258 --> 00:02:01,712
compute มากขึ้น ทางแรกคือใช้ max ซึ่งจะให้โมเดลเดียว

23
00:02:01,712 --> 00:02:06,081
reason นานขึ้น โดยสำรวจทางเลือกอื่น ๆ รันการตรวจสอบ

24
00:02:06,081 --> 00:02:12,248
และแก้ไขงานของมันเอง ส่วนอีกทางคือ ultra ซึ่งเปลี่ยนโครงสร้างของงานไปเลย

25
00:02:12,248 --> 00:02:17,815
มันจะประสานงาน agent แบบขนานโดย default แบ่งงานออกเป็นส่วนค้นคว้า

26
00:02:17,815 --> 00:02:22,697
ส่วน implement ส่วนทดสอบ และส่วนวิจารณ์ เป็น architecture

27
00:02:22,697 --> 00:02:27,579
หรือ workflow ใหม่ที่น่าสนใจกับโมเดลตัวเดียว ในเบนช์มาร์ก

28
00:02:27,579 --> 00:02:31,605
Agents' Last Exam มันได้ 53.6 คะแนน ซึ่งสูงกว่า

29
00:02:31,605 --> 00:02:36,145
Fable ถึง 13.1 คะแนนบน AI Intelligence Index เวอร์ชัน

30
00:02:36,145 --> 00:02:40,599
max reasoning ของ Sol เข้าใกล้ Fable ภายในหนึ่งคะแนน

31
00:02:40,599 --> 00:02:44,795
ขณะที่ทำงานเร็วกว่า 61% และต้นทุนประมาณครึ่งหนึ่ง

32
00:02:44,795 --> 00:02:49,249
นี่คือสิ่งที่เขาอยากเน้นย้ำ ไม่ใช่แค่ว่ามันเทียบเท่า

33
00:02:49,249 --> 00:02:53,618
Fable แต่คือมันถูกกว่าและเร็วกว่ามาก การเปลี่ยนแปลง

34
00:02:53,618 --> 00:02:57,986
workflow ที่ใหญ่ที่สุดคือ programmatic tool calling

35
00:02:57,986 --> 00:03:02,440
ซึ่ง GPT-5.6 สามารถเขียนและรันโปรแกรมเบา ๆ ใน memory

36
00:03:02,440 --> 00:03:07,236
เพื่อประสาน tool กรองผลลัพธ์ระหว่างทาง ติดตามความคืบหน้า

37
00:03:07,236 --> 00:03:12,461
และเลือกว่าจะทำอะไรต่อไป นั่นหมายถึงการเรียกโมเดลรอบน้อยลงและ

38
00:03:12,461 --> 00:03:19,399
prompt token ที่ลดลงในงานที่ใช้ tool เยอะ นอกจากนี้มันยังออกแบบมาให้ตรวจสอบงานที่

39
00:03:19,399 --> 00:03:23,425
render แล้ว ไม่ใช่แค่สร้าง source code เท่านั้น

40
00:03:23,425 --> 00:03:28,478
OpenAI อ้างว่า interface ที่แข็งแกร่งขึ้น เช่น presentation

41
00:03:28,478 --> 00:03:33,360
แบบที่เห็นนี้ เอกสาร สเปรดชีต โดยมีผล 92.2% บน BrowseComp

42
00:03:33,360 --> 00:03:37,386
Ultra และถ้าดูจากสายตา นี่คือการสร้างครั้งเดียว

43
00:03:37,386 --> 00:03:41,669
(one-shot) โดยผมไม่ได้กำหนด format เฉพาะเลย ในอดีต

44
00:03:41,669 --> 00:03:46,208
presentation ที่ผมทำกับโมเดล GPT จะเรียบ ๆ กว่านี้มาก

45
00:03:46,208 --> 00:03:50,320
แต่อันนี้กลับใกล้เคียงกับสิ่งที่ผมมักได้จากโมเดล

46
00:03:50,320 --> 00:03:55,116
Claude ซึ่งเป็นสิ่งที่ผมใช้ทำ presentation อยู่เป็นประจำ

47
00:03:55,116 --> 00:03:59,142
ผมอาจลองใช้ GPT-5.6 บ่อยขึ้น เพราะนี่ดูดีจริง ๆ

48
00:03:59,142 --> 00:04:05,480
มาดูเบนช์มาร์กด้าน coding กันบ้าง ซึ่งเป็นจุดที่เรื่องประสิทธิภาพชัดเจนมาก

49
00:04:05,480 --> 00:04:09,848
อย่างที่บอกไป บน AI Coding Index มันได้คะแนนสูงกว่า

50
00:04:09,848 --> 00:04:14,388
Fable แต่ก็ไม่ได้กวาดทุกเบนช์มาร์กนะครับ บน SWE-bench

51
00:04:14,388 --> 00:04:18,585
นั้น Fable ยังนำอยู่ 15.7 คะแนน สรุปก็คือ GPT-5.6

52
00:04:18,585 --> 00:04:22,696
นำในด้าน agentic coding และงาน terminal แบบกว้าง

53
00:04:22,696 --> 00:04:26,808
ๆ แต่ Fable ยังได้เปรียบมากใน software benchmark

54
00:04:26,808 --> 00:04:31,005
แบบหลายไฟล์ที่ยาก แต่ท้ายที่สุดนี่ก็แค่เบนช์มาร์ก

55
00:04:31,005 --> 00:04:38,628
เรายังไม่รู้ว่าในการใช้งานจริงจะเป็นอย่างไร ด้านความปลอดภัยไซเบอร์เป็นจุดที่กระโดดขึ้นมาก

56
00:04:38,628 --> 00:04:44,366
ExploitBench พุ่งจาก 47.9% มาที่ 73.5% และเบนช์มาร์กความปลอดภัยอื่น

57
00:04:44,366 --> 00:04:48,392
ๆ ก็เพิ่มขึ้นแบบเดียวกัน OpenAI ระบุว่า GPT-5.6

58
00:04:48,392 --> 00:04:52,503
ยังอยู่ต่ำกว่าเกณฑ์วิกฤตในด้าน cyber และ biology

59
00:04:52,503 --> 00:04:56,957
แต่การเข้าถึงจะถูกควบคุมมากขึ้น การเปิดตัวมี trusted

60
00:04:56,957 --> 00:05:01,240
access, การตรวจสอบแบบ real-time, reasoning monitor

61
00:05:01,240 --> 00:05:09,120
และมาตรการป้องกันที่บล็อกกิจกรรมไซเบอร์ที่อาจเป็นอันตรายได้มากกว่าโมเดลก่อนหน้าประมาณสิบเท่า

62
00:05:09,120 --> 00:05:15,887
ไม่แน่ว่าสิ่งนี้จะสร้างความไม่สะดวกมากแค่ไหน เพราะเมื่อสัปดาห์ที่ผ่านมาที่ผมใช้

63
00:05:15,887 --> 00:05:20,341
Fable มันน่ารำคาญพอสมควรเลยครับ ตอนทำโปรเจกต์ coding

64
00:05:20,341 --> 00:05:24,623
ธรรมดา ๆ ไม่ว่าจะเกมหรือแอปอะไรสักอย่าง แล้วไปเปิด

65
00:05:24,623 --> 00:05:28,906
guardrail ของ Fable ขึ้นมา ผมก็ใช้งานต่อไม่ได้แล้ว

66
00:05:28,906 --> 00:05:34,559
และพอ trigger ขึ้นมาครั้งนึง มันจะเป็นปัญหาต่อไปตลอดในโปรเจกต์นั้น

67
00:05:34,559 --> 00:05:41,240
แม้จะกลับไปแก้ prompt แล้วก็ตาม มันน่ารำคาญมาก ก็หวังว่าทางนี้จะไม่เป็นแค่นั้น

68
00:05:41,240 --> 00:05:45,522
เรื่องราคาก็มีหลายระดับนะครับ Sol อยู่ที่ $5 input

69
00:05:45,522 --> 00:05:49,719
และ $30 output ส่วนโมเดลที่ถูกกว่าอย่าง Terra และ

70
00:05:49,719 --> 00:05:54,516
Luna อยู่ที่ $1 input และ $6 output ซึ่งใกล้เคียงกับราคา

71
00:05:54,516 --> 00:05:58,970
Haiku ก็พอจะมองภาพได้ว่านี่เปรียบเหมือน Opus, Sonnet

72
00:05:58,970 --> 00:06:04,452
และ Haiku ของ OpenAI เลย แม้จะไม่ตรงเป๊ะ 100% แต่ก็พอให้ภาพจำได้

73
00:06:04,452 --> 00:06:08,820
ก็คงเล่าพอที มาลองใช้จริงกันเลยครับ อันดับแรกคืองาน

74
00:06:08,820 --> 00:06:15,672
coding ที่หลายคนอาจเริ่มเบื่อแล้ว แต่ผมว่ามันดีเพราะผมมีการเปรียบเทียบมากพอสมควร

75
00:06:15,672 --> 00:06:19,869
และเป็นงานที่ค่อนข้างยาก นั่นคือการสร้างไฟล์ HTML

76
00:06:19,869 --> 00:06:24,237
ไฟล์เดียวสำหรับเกม One Piece x Star Wars ที่มี hero

77
00:06:24,237 --> 00:06:28,691
section เต็มจอพื้นหลังสีเข้ม มีทรงกลม 3D หมุนได้ด้วย

78
00:06:28,691 --> 00:06:35,543
Three.js พร้อม custom GLSL fragment shader ที่ทำให้มันดูเหมือนดาวเคราะห์เรืองแสง

79
00:06:35,543 --> 00:06:39,655
ทรงกลมจะค่อย ๆ หมุนรอบแกน X หรือ Y เมื่อ scroll,

80
00:06:39,655 --> 00:06:44,023
GSAP จะ animate การย่อและจางหายของทรงกลมพร้อมกับให้

81
00:06:44,023 --> 00:06:48,134
headline ค่อย ๆ ปรากฏ ส่วน headline จะมี stagger

82
00:06:48,134 --> 00:06:52,503
entrance สไตล์ framer motion และต้องรันได้ใน Chrome

83
00:06:52,503 --> 00:06:58,241
ห้ามใช้ npm ให้ใช้ CDN imports เท่านั้น หลายคนคงเคยเห็นงานนี้มาแล้ว

84
00:06:58,241 --> 00:07:02,867
แต่ผมมีงานเปรียบเทียบจาก Grok 4.5 ที่เพิ่งทำไปเมื่อวาน

85
00:07:02,867 --> 00:07:07,064
รวมถึงจาก Opus และ Fable ก็เลยดูเปรียบเทียบกันแบบ

86
00:07:07,064 --> 00:07:11,518
apples-to-apples ได้เลย ตอนนี้เราจะสลับมาใช้ GPT-5.6

87
00:07:11,518 --> 00:07:16,228
Sol ใน Hermes Agent เพราะนี่คือที่ที่ผมจะใช้มันเป็นหลัก

88
00:07:16,228 --> 00:07:20,254
ผมอาจใช้ใน Codex บ้าง แต่หลัก ๆ จะอยู่ใน Hermes

89
00:07:20,254 --> 00:07:25,650
Agent สิ่งที่ดีก็คือเราได้ context window ที่ใหญ่ขึ้นมาเล็กน้อย

90
00:07:25,650 --> 00:07:29,933
ข้อจำกัดจริง ๆ ของ GPT-5.5 ใน Hermes คือมี context

91
00:07:29,933 --> 00:07:34,644
window แค่ประมาณ 270,000 token แต่ตอนนี้เราได้เพิ่มเป็น

92
00:07:34,644 --> 00:07:39,697
372,000 แล้ว ซึ่งช่วยได้มากสำหรับงาน coding ที่ต้องทนยาวได้

93
00:07:39,697 --> 00:07:45,864
ผมก็จะให้ task นี้กับมันแล้วดูกันว่าเป็นยังไง เพื่อให้เห็นการเปรียบเทียบ

94
00:07:45,864 --> 00:07:50,918
นี่คือผลงานของ Fable ซึ่งดูดีมาก น่าจะเป็นอันที่ดีที่สุดเลย

95
00:07:50,918 --> 00:07:55,800
ส่วนอันที่เพิ่งทำเมื่อวานนี้จาก Grok 4.5 ก็ทำตามคำสั่งครบ

96
00:07:55,800 --> 00:08:01,110
แต่สไตล์ออกจะน้อยกว่านิดหน่อย อย่างไรก็ตามมันทำได้ในครั้งเดียว

97
00:08:01,110 --> 00:08:05,393
(one-shot) ตรงตามคำสั่ง และนี่คือผลงานของ Opus 4.8

98
00:08:05,393 --> 00:08:09,933
ซึ่งก็ใช้ได้ แต่น่าจะต้องลองประมาณสามรอบถึงจะออกมาได้

99
00:08:09,933 --> 00:08:14,044
และจะเห็นว่าแม้ตอนทำได้แล้ว headline แบบ stagger

100
00:08:14,044 --> 00:08:19,183
ก็ยังขึ้นมาใต้ตำแหน่งที่ scroll อยู่ คือมันไม่ทำงานถูกต้องนะ

101
00:08:19,183 --> 00:08:23,294
แต่ดีเรื่องรูปลักษณ์ ทรงกลมก็ดูดี งั้นมาดูกันว่า

102
00:08:23,294 --> 00:08:28,091
GPT-5.6 จะทำได้แค่ไหน โอเค ทำเสร็จแล้ว มาดูกัน เรียบร้อย

103
00:08:28,091 --> 00:08:33,316
GPT ทำเสร็จแล้วและดูดีมาก ดู orb ตรงนี้สิ สไตล์ต่างจากอันอื่น

104
00:08:33,316 --> 00:08:37,427
ๆ ที่เห็นชัดเจน เป็นการตีความที่แตกต่าง อ้อ จริง

105
00:08:37,427 --> 00:08:42,566
ๆ ถ้าขยับเมาส์ — ไม่รู้ว่ากล้องจะเห็นไหมนะ มันจุกจิกนิดหน่อย

106
00:08:42,566 --> 00:08:47,363
— แต่ถ้าขยับเมาส์ไปรอบ ๆ พื้นหลังจะขยับเล็กน้อยตามไปด้วย

107
00:08:47,363 --> 00:08:51,388
ค่อนข้างเจ๋งเลยครับ ดูดีจริง ๆ งั้นมาลอง scroll

108
00:08:51,388 --> 00:08:55,842
กันบ้าง ซึ่งเป็นส่วนสำคัญที่สุด ถ้า scroll ลงมันก็จะ

109
00:08:55,842 --> 00:09:00,039
— เจ๋งจริง ๆ — เข้ามาตรงกลาง "The Grand Line runs

110
00:09:00,039 --> 00:09:04,236
through the stars" ได้ปกติ ทุก element อื่นก็ดูดี

111
00:09:04,236 --> 00:09:08,605
มีปัญหาอยู่อย่างเดียวคือคล้ายกับที่เจอในเวอร์ชันของ

112
00:09:08,605 --> 00:09:14,343
Opus คือมันทำ stagger ตรงนี้ได้ไม่ค่อยดีนัก ไม่รู้ว่าจะมองเห็นไหมนะ

113
00:09:14,343 --> 00:09:21,024
แต่มันจะขึ้นมานิดเดียวมาก ถ้า scroll เร็วพอจะเห็นว่ามันเกือบจะขึ้นมาใต้จอไปเลย

114
00:09:21,024 --> 00:09:27,534
แต่นอกนั้นดูดีมากครับ คือถ้าเทียบกับ Fable นะ ผมว่าผมชอบอันนี้มากกว่าด้วยซ้ำ

115
00:09:27,534 --> 00:09:31,902
รู้สึกว่ามีรายละเอียดในการสร้างทรงกลมมากกว่าเยอะเลย

116
00:09:31,902 --> 00:09:37,127
ผมว่านี่อยู่ในระดับเท่ากันเป็นอย่างน้อย ปัญหาเดียวก็คือเรื่อง

117
00:09:37,127 --> 00:09:41,495
headline ที่ยังทำงานได้ไม่สมบูรณ์ แต่นอกนั้นดูดีมาก

118
00:09:41,495 --> 00:09:45,949
สรุปก็คือเป็นการกระโดดครั้งใหญ่จากโมเดลก่อนหน้าในแง่

119
00:09:45,949 --> 00:09:51,088
style point และงาน front-end นี่เป็นผลลัพธ์ที่แข็งแรงมากครับ

120
00:09:51,088 --> 00:09:56,741
งานถัดไปเป็นโปรเจกต์ขั้นสูงมากที่ผมกำลังทำอยู่ ตอนนี้เสร็จไปประมาณ

121
00:09:56,741 --> 00:10:01,795
70% แล้ว คร่าว ๆ มันชื่อ Shovels Terminal ซึ่งเป็นแผนที่ของ

122
00:10:01,795 --> 00:10:05,820
AI supply chain ทั้งหมด แสดงว่าองค์ประกอบต่าง ๆ

123
00:10:05,820 --> 00:10:12,587
เชื่อมโยงกันอย่างไร แล้วบริษัทจดทะเบียนใดบ้างที่ได้รับผลกระทบจากคลื่นผลกระทบของ

124
00:10:12,587 --> 00:10:16,613
supply chain เหล่านี้ พอมีเวลาเสร็จก็คงได้ดูกัน

125
00:10:16,613 --> 00:10:21,152
เป็นโปรเจกต์ที่ซับซ้อนมากเพราะมีองค์ประกอบด้านภาพเยอะ

126
00:10:21,152 --> 00:10:25,692
และมีส่วนประกอบเชื่อมโยงกันเยอะมากเช่นกัน นี่คือผลการ

127
00:10:25,692 --> 00:10:31,259
audit ที่ Fable เพิ่งทำไป ผมขอให้มันตรวจหา bug งานถัดไปที่ผมจะให้

128
00:10:31,259 --> 00:10:35,713
GPT-5.6 ทำก็คือ audit แบบเดียวกันนี้ และเราจะเปิดใช้

129
00:10:35,713 --> 00:10:39,996
ultra เต็มที่เลย ซึ่งการใช้ ultra จะต้องทำใน Codex

130
00:10:39,996 --> 00:10:44,193
ตรง ๆ เลย ไม่ใช่ใน Hermes Agent ผมก็จะสั่ง "audit

131
00:10:44,193 --> 00:10:48,218
this codebase and report any bugs" เพื่อดูว่าผล

132
00:10:48,218 --> 00:10:52,415
audit จาก GPT-5.6 เทียบกับของ Fable จะเป็นอย่างไร

133
00:10:52,415 --> 00:10:57,383
อ้อ ถือโอกาสเผยโฉมนิดหน่อยนะครับ ตามที่บอกโปรเจกต์นี้เสร็ย

134
00:10:57,383 --> 00:11:01,752
70% นี่คือหน้าเว็บ Shovels Terminal และนี่คือแผนที่

135
00:11:01,752 --> 00:11:06,206
ยังต้องทำต่่ออีกพอสมควร แต่จะเห็นว่ามีองค์ประกอบต่าง

136
00:11:06,206 --> 00:11:11,345
ๆ เชื่อมโยงกันอยู่ และทุกการเชื่อมโยงนั้นมาจากงานค้นคว้าจริง

137
00:11:11,345 --> 00:11:16,484
ส่วน UI ยังดูแปลก ๆ อยู่บ้างนะครับ แต่ก็คือคอนเซ็ปต์นั้นแหละ

138
00:11:16,484 --> 00:11:21,280
และอย่างที่จินตนาการได้มันค่อนข้างซับซ้อน ถ้าทำเสร็ยจริง

139
00:11:21,280 --> 00:11:27,704
ๆ ผมว่าน่าจะเจ๋งมาก จะเห็นว่ามันแสดงบริษัทที่โดนกระทบมากที่สุดเป็นอันดับต้น

140
00:11:27,704 --> 00:11:31,730
ๆ ในแต่ละด้านได้ด้วย โอเค Ultra รันกลับมาในเวลา

141
00:11:31,730 --> 00:11:36,527
16 นาที พบ bug ระดับ high severity อยู่หลายตัวเลยทีเดียว

142
00:11:36,527 --> 00:11:41,666
มีจุดเล็ก ๆ ที่ผมชอบก็คือใน Codex มักจะออกแนวยืดยาวเวิ่นเว้อ

143
00:11:41,666 --> 00:11:46,291
จากที่ใช้อยู่ทั้งวันนี้ รู้สึกว่ามันกระชับข้อมูลดีขึ้น

144
00:11:46,291 --> 00:11:50,317
นั่นคือเหตุผลที่ผมมักใช้ Claude Opus หรือ Fable

145
00:11:50,317 --> 00:11:55,027
สำหรับโปรเจกต์ระยะยาวมากกว่า เพราะนำเสนอข้อมูลได้ดีกว่า

146
00:11:55,027 --> 00:12:00,509
แต่ GPT-5.6 นี่กระชับขึ้นมาก เข้าเป็นสาระเลย ก่อนหน้านี้มันออกจะ

147
00:12:00,509 --> 00:12:04,963
verbose มาก เรามาดูปัญหาที่มันพบกันบ้าง พบ bug ระดับ

148
00:12:04,963 --> 00:12:09,160
high severity สี่ตัว ระดับ medium หลายตัว และ bug

149
00:12:09,160 --> 00:12:13,528
ระดับ low severity เพิ่มเติมอีก สิ่งที่ผมจะทำคือเอา

150
00:12:13,528 --> 00:12:17,811
bug เหล่านี้ไปให้ Fable ตรวจสอบว่าเป็น bug จริงไหม

151
00:12:17,811 --> 00:12:23,464
แล้วให้มันอธิบายว่าทำไมตอนแรกมันถึงไม่พบ นี่คือสิ่งที่ผมกำลังรันใน

152
00:12:23,464 --> 00:12:27,575
Fable อยู่ ผมสั่งว่า "I ran another audit with a

153
00:12:27,575 --> 00:12:31,944
different model. Please review the findings, verify

154
00:12:31,944 --> 00:12:36,312
them, do not assume they are true. Give me a report

155
00:12:36,312 --> 00:12:40,509
of the legitimate findings and try to explain the

156
00:12:40,509 --> 00:12:45,220
best you can why you did not find them. Do not actually

157
00:12:45,220 --> 00:12:50,445
fix anything. Just verify the report." แล้วก็วางผลที่พบเข้าไป

158
00:12:50,445 --> 00:12:54,984
มาดูกันว่า Fable จะตอบอะไร ก็บอกได้เลยว่าดูจากผลคร่าว

159
00:12:54,984 --> 00:12:59,267
ๆ ก็เห็นว่า GPT-5.6 พบได้มากกว่า Fable พบ critical

160
00:12:59,267 --> 00:13:03,806
issue จริง ๆ แค่อันเดียวที่เกี่ยวกับ shockwave engine

161
00:13:03,806 --> 00:13:08,432
ส่วนของ GPT-5.6 จะหลากหลายกว่า มี issue หลายประเภทกว่า

162
00:13:08,432 --> 00:13:13,057
มาดูกันว่า Fable จะตอบว่าอย่างไร ผลออกมาน่าสนใจมากครับ

163
00:13:13,057 --> 00:13:19,138
Fable ตอบกลับมา — ใช้เวลาไปสักพัก — มัน verify ทุกรายการเทียบกับโค้ดและ

164
00:13:19,138 --> 00:13:25,220
installed library sources สรุปก็คือทั้ง 14 รายการเป็นจริงตามข้อเท็จจริง

165
00:13:25,220 --> 00:13:32,243
และ 12 รายการเป็นการพบที่ถูกต้อง สองรายการเป็นสิ่งที่มันเคยรายงานไปก่อนหน้านี้แล้ว

166
00:13:32,243 --> 00:13:36,783
รายการที่ร้ายแรงที่สุดอยู่ในโค้ดที่มันเขียนเอง นี่...

167
00:13:36,783 --> 00:13:41,151
น่าอายพอสมควรเลยครับ นี่คือรายละเอียดและ postmortem

168
00:13:41,151 --> 00:13:46,547
ที่ซื่อสัตย์ เรื่อง findings ก็คือรายการเหล่านี้เป็นจริงทั้งหมด

169
00:13:46,547 --> 00:13:51,001
อันนี้ยืนยันเป็น high severity และเป็น bug ของ Fable

170
00:13:51,001 --> 00:13:57,339
เอง แต่อย่างน้อย Fable ก็รับผิดได้นะครับ มันบอกว่ามันปล่อยส่วนนี้ไว้โดยไม่

171
00:13:57,339 --> 00:14:03,506
guard ซึ่งเป็น bug class เดียวกับที่มันกำลังแก้อยู่ที่อื่นในไฟล์เดียวกัน

172
00:14:03,506 --> 00:14:07,703
อีกรายการคือ missing claims — กุญแจสำคัญลบ claims

173
00:14:07,703 --> 00:14:12,842
ทิ้งหมดเงียบ ๆ ซึ่งเป็นปัญหาค่อนข้างร้ายแรงสำหรับโปรเจกต์นี้

174
00:14:12,842 --> 00:14:17,382
จริง ๆ แล้วนี่เป็น bug ที่ผมเคยติดอยู่ก่อนหน้านี้แล้ว

175
00:14:17,382 --> 00:14:21,665
เคยมีปัญหากับมันมาแล้ว เป็น high UX issue ที่ไม่มี

176
00:14:21,665 --> 00:14:26,718
movement threshold อยู่เลย นั่นก็เป็นสิ่งที่ผมเคยต่อสู้อยู่

177
00:14:26,718 --> 00:14:31,172
ก็ดีใจที่มันหาเจอในที่สุด ก็คือทุกอย่างเช็กได้หมดเลย

178
00:14:31,172 --> 00:14:36,054
เหตุผลตรง ๆ จาก Fable ว่าทำไมถึงเป็นแบบนี้ — มันบอกว่ามัน

179
00:14:36,054 --> 00:14:40,851
anchor การตรวจสอบไว้กับประวัติ bug ที่รู้จักของผลิตภัณฑ์

180
00:14:40,851 --> 00:14:44,876
การแก้ไขของมันเองไม่เคยเข้าสู่ adversarial loop

181
00:14:44,876 --> 00:14:49,159
อีกเลย รายการที่สองร้ายแรงที่สุด — มันเขียน import

182
00:14:49,159 --> 00:14:53,442
script ใหม่เพื่อแก้ปัญหา แต่ไฟล์ที่เขียนใหม่กลับมี

183
00:14:53,442 --> 00:14:58,752
issue เดียวกัน มัน verify data cleanliness แล้วสับสนคิดว่าเป็น

184
00:14:58,752 --> 00:15:03,977
invariant enforcement บางรายการก็เป็นข้อจำกัดมากกว่าที่จะเป็น

185
00:15:03,977 --> 00:15:08,174
bug จริง แต่ก็มี bug ระดับสูงอยู่หลายตัวเหมือนกัน

186
00:15:08,174 --> 00:15:12,371
นี่เป็น findings ที่น่าสนใจมากครับ สรุปก็คือเรามี

187
00:15:12,371 --> 00:15:19,394
GPT-5.6 แก้โค้ดที่ Fable เขียน และ Fable ก็ยอมรับและตระหนักว่าตัวเองเขียนโค้ดที่มี

188
00:15:19,394 --> 00:15:24,020
bug ออกมา นี่ไม่ได้แปลว่า GPT-5.6 จะดีกว่าเสมอไปนะครับ

189
00:15:24,020 --> 00:15:28,902
เพราะผมรันบน Sol พร้อม ultra ซึ่งน่าจะแพงกว่าเวอร์ชันปกติ

190
00:15:28,902 --> 00:15:33,013
แต่มันก็แสดงให้เห็นว่ามันเก่งพอสมควร เพราะหา bug

191
00:15:33,013 --> 00:15:37,895
ที่ Fable ไม่พบและยังเป็นโค้ดที่ Fable เขียนเองได้อีกด้วย

192
00:15:37,895 --> 00:15:43,634
สำหรับโปรเจกต์แบบนี้ ผมอยากให้มีอย่างน้อยหนึ่งในสองตัวทำหน้าที่เป็น

193
00:15:43,634 --> 00:15:50,915
auditor ผมจะใช้ workflow นี้ต่อไป เพราะจะเห็นว่าแม้แต่โมเดลตารางระดับสูงสุดก็ยังเขียน

194
00:15:50,915 --> 00:15:57,595
bug ออกมาโดยไม่รู้ตัวว่าตัวเองเขียน นั่นคือเหตุผลที่คุณต้องมีอะไรสักอย่างอย่าง

195
00:15:57,595 --> 00:16:01,964
GPT-5.6 มาช่วยจับ ก็คงมีแค่นี้ครับสำหรับ First Look

196
00:16:01,964 --> 00:16:07,103
at GPT-5.6 ทำไปแค่ไม่กี่ task เล็ก ๆ เพราะผมจะใช้มันอยู่บ่อย

197
00:16:07,103 --> 00:16:11,214
ๆ และคุณจะเห็นผมใช้ในชีวิตประจำวันในโปรเจกต์ต่าง

198
00:16:11,214 --> 00:16:15,326
ๆ มันจะกลายเป็น driver หลักใน Hermes Agent ของผม

199
00:16:15,326 --> 00:16:19,351
ผมก็เลยอยากเห็นว่ามันทำได้ดีแค่ไหน จากแค่ไม่กี่

200
00:16:19,351 --> 00:16:24,405
task นี้ ผมประทับใจพอสมควร ก็หวังว่ามันจะอยู่ได้ต่อไปนะครับ

201
00:16:24,405 --> 00:16:28,430
แค่นี้แหละสำหรับวิดีโอนี้ ฝากคอมเมนต์ด้วยนะครับ

202
00:16:28,430 --> 00:16:32,542
ประสบการณ์ของคุณกับ GPT-5.6 เป็นอย่างไรบ้าง? ฝาก

203
00:16:32,542 --> 00:16:37,338
subscribe ฝาก like ด้วยนะครับ แล้วเจอกันใหม่ในวิดีโอหน้า

204
00:16:37,338 --> 00:16:38,880
ขอบคุณที่รับชมครับ