▶SUBTHAIแปลไทย · ซับ · พากย์⚙
บทความแปลภาษาไทย · YouTube

First Look at Kimi K3: The Biggest, Smartest Open Weights Model Ever?

0:000:00
เล่นเสียงต้นฉบับของวิดีโอ พร้อมแสดงซับไทยซิงก์ตามเวลา
กำลังโหลดวิดีโอ…
01

สรุปย่อ

ประเด็นสำคัญจากวิดีโอ

- **ช่อง:** Tonbi's AI Garage · **ความยาว:** ~18.5 นาที · **ลิงก์:** https://www.youtube.com/watch?v=Oqk2n3t-CXU

# สรุป: First Look at Kimi K3: The Biggest, Smartest Open Weights Model Ever?

- **ช่อง:** Tonbi's AI Garage · **ความยาว:** ~18.5 นาที · **ลิงก์:** https://www.youtube.com/watch?v=Oqk2n3t-CXU

## ประเด็นหลัก

- **Moonshot AI ปล่อย Kimi K3** — โมเดล open weights ระดับ 2.8 ล้านล้านพารามิเตอร์ (2.8T) ถือเป็นโมเดล open ระดับสามล้านล้านพารามิเตอร์ตัวแรกของโลก
- **สเปคเด่น:** context window 1 ล้านโทเคน, สถาปัตยกรรม attention ใหม่ (Kimi Delta Attention + attention residuals + stable lean MoE ที่มี 896 expert แต่ active เพียง 16 ต่อ token)
- **ประสิทธิภาพ scaling** ดีกว่า K2 ประมาณ 2.5 เท่า — คำกล่าวอ้างเรื่อง efficiency สำคัญกว่าขนาดพารามิเตอร์
- **ราคา:** $3 input (cache miss) / $15 output — ใกล้เคียง GPT-5.6 Terra ระดับกลางของ OpenAI ถือว่าแพงแต่เป็น open weights
- **Benchmark:** อยู่ใกล้ด้านบนใน coding/agent benchmark แม้แพ้ Fable และ GPT-5.6 Sol ในบางตัว แต่บางหมวดก็นำ — cost efficiency ดีกว่าคู่แข่งชัดเจน
- **การทดสอบที่ 1 — Front-end coding:** prompt เดิม (One Piece × Star Wars) K3 ทำได้ดีกว่า K2.6 เดิมอย่างชัดเจน — ทรงกลม 3D สมจริงขึ้น, แอนิเมชันครบ, ขัดเกลากว่า
- **การทดสอบที่ 2 — Procedural 3D open world:** สร้างเมืองแฟนตาซี 3D ใน Three.js ได้สวยงาม มีระบบคลิก, texture, แสง ครบ — เทียบได้กับหรือดีกว่าของ Opus 4.8 ในแง่ความครบครัน
- **การทดสอบที่ 3 — Orchestrator + sub-agents:** spawn sub-agent 3 ตัวทำวิจัย paper, สังเคราะห์เป็น top-5 report — มีการ spot-check ความถูกต้องของ paper เอง, ทำงานเสร็จใน <10 นาที, ทำหน้าที่ orchestrator ได้ดี
- **จุดอ่อน:** ยังเป็นรอง Claude 5 และ GPT-5.6 Sol ในภาพรวม, ด้อยกว่าในบาง reasoning/multimodal test — Moonshot เองก็ยอมรับ
- **ข้อจำกัด:** แม้เป็น open weights ก็ไม่สามารถรันบนเครื่องส่วนบุคคลได้ เนื่องจากขนาดใหญ่เกินไป
- **เป้าหมายการออกแบบ:** เน้นงาน long-horizon ที่รันนานเป็นชั่วโมงหรือวัน, รับผิดชอบโปรเจกต์ยากทั้งโปรเจกต์โดยแทบไม่ต้องกำกับ

## ความเห็นสรุป

Kimi K3 เป็นโมเดล open weights ที่สำคัญที่สุดตัวหนึ่งของปี — ไม่ใช่แค่เรื่องขนาด แต่เป็นการผสมผสานระหว่างสถาปัตยกรรม attention แบบใหม่, context window ยักษ์ และการออกแบบเพื่องาน long-horizon แม้จะยังเป็นรองโมเดลปิดท็อปอยู่บ้าง แต่ผลลัพธ์ benchmark และการทดสอบจริงทั้งสามงานแสดงให้เห็นว่ามันเข้าใกล้โมเดลท็อปมากขึ้นเรื่อย ๆ ครับ
02

คำแปลเต็ม

แปลตามบทสนทนาต้นฉบับ ปรับเป็นภาษาไทยธรรมชาติ

Moonshot AI เพิ่งปล่อย Kimi K3 ออกมา โดยเรียกมันว่า open frontier intelligence ตัวนี้จะเป็นโมเดลแบบ open weights และเป็น flagship model ล่าสุดในสายผลิตภัณฑ์ Kimi ที่ได้รับความนิยมมากครับ หลายคนน่าจะจำได้ว่าผมเคยรีวิว Kimi K2.6 ไปแล้ว และตอนนั้นมันทำผลงานได้ดีมากสำหรับโมเดล open weights ครับ ผมเลยค่อนข้างตื่นเต้นที่จะเห็นว่า Kimi K3 จะทำได้แค่ไหน

เราจะเริ่มจากการลองให้มันทำงานเปิดตัวสักงานก่อนเลย แล้วค่อยกลับมาเล่าให้ฟังถึงสเปคทางเทคนิค พร้อมกับ benchmark ต่าง ๆ แล้วค่อยให้มันทำงานเพิ่มอีกสองสามชิ้นในช่วงท้าย แต่ผมว่าเรามาเริ่มลองเล่นของจริงกันก่อนดีกว่า จะได้ไม่ต้องมานั่งดูสไลด์กันก่อนนะครับ

พอดีเห็น Hermes กำลัง update อยู่เบื้องหลัง แต่นี่คือ prompt ที่เราจะให้ และเป็น prompt ที่หลายคนเคยเห็นมาแล้วหลายครั้งแล้วครับ prompt คือให้สร้างไฟล์ HTML ไฟล์เดียวสำหรับเกม One Piece meets Star Wars โดยมี hero section แบบเต็มจอ พื้นหลังสีเข้ม มีทรงกลม 3D หมุนอยู่ใน Three.js พร้อม GLSL fragment shader แบบกำหนดเอง ทำให้มันดูเหมือนดาวเคราะห์ที่เรืองแสง ทรงกลมจะค่อย ๆ หมุนรอบแกน Y เมื่อ scroll ลง GSAP จะเล่นแอนิเมชันให้ทรงกลมเล็กลงและจางหายไป พร้อมกับให้ headline ค่อย ๆ โผล่ขึ้นมาแบบ stagger entrance ของ framer-motion ทำงานบน Chrome ไม่ต้องใช้ NPM ใช้ CDN imports เท่านั้นครับ

หลายคนอาจจำได้ว่านี่คือผลงานที่ Kimi K2.6 ทำได้ตอนนั้น ซึ่งดูดีมาก และในเวลานั้นมันเป็นผลงานที่ดีที่สุดจาก prompt นี้เลย ตอนนั้น Fable ยังไม่ได้ออกมาทำได้ดีกว่า และล่าสุด ChatGPT 5.6 Sol ก็ทำได้ดีเช่นกัน แต่ตอนที่ปล่อยครั้งแรกมันทำได้ดีมากจริง ๆ โดยที่โมเดล frontier ตัวอื่น ๆ ในยุคนั้นทำไม่ได้ เช่น Opus หรือ GPT รุ่นตอนนั้นก็ทำไม่ได้ครับ

แต่มาดูกันว่า Kimi K3 จะทำยังไงกับ prompt นี้ สักสองสามเดือนก่อน prompt นี้ถือว่ายากมาก แต่โมเดลรุ่นใหม่ ๆ ส่วนใหญ่ก็เริ่มทำได้ดีแล้ว ผมอาจจะต้องหา prompt ที่ยากกว่านี้มาใช้แล้วล่ะ ถ้าโมเดลทุกตัวเริ่มจัดการ prompt นี้ได้หมดแล้ว

ทีนี้เรามาเลือกโมเดลกัน เลื่อนลงไปที่ Moonshot Kimi K3 ในพอร์ทัลใหม่ สังเกตราคาได้เลยครับ ตอนนี้อยู่ที่ $3 สำหรับ input และ $15 สำหรับ output ซึ่งถือว่าอยู่ในระดับใกล้เคียงกับ GPT-5.6 Terra ของ OpenAI คือเป็นโมเดลระดับกลางของ OpenAI ดังนั้นมันไม่ใช่ของถูกเลยนะครับ แพงอยู่ แต่ก็เป็น open weights ด้วยเช่นกัน และพร้อมใช้งานแล้วตอนนี้

ทีนี้มาที่หน้าแชทของ Hermes กันบ้าง ผมจะวาง prompt นี้ลงไปเลยนะครับ โอเค คุณจะเห็น Kimi K3 อยู่ตรงนี้ นี่คือสิ่งที่ได้กลับมา เห็นชื่อว่า Grandline Prime ขนานนามว่า One Piece Star Wars Outer Rim

ตัวทรงกลมเองดูดีมากครับ นี่เป็นหนึ่งในเวอร์ชันที่ดีกว่าเดิมเยอะเลย ดูมีความสมจริงมากขึ้น ดูคล้ายโลกเลย เหมือนมีเมฆลอยอยู่ข้างใต้ ทำได้ดีมากจริง ๆ สำหรับตัวทรงกลม ทีนี้ลอง scroll ลงไปดูกัน นี่คือบททดสอบของจริง มันค่อย ๆ เล็กลง ค่อย ๆ จางหายไป สวยงามมาก และก็มี stagger entrance ของ headline ขึ้นมาพอดี "Set sail for the stars, become the pirate king of the galaxy" — ออกเดินทางสู่ดวงดาว กลายเป็นราชาโจรสลัดแห่งกาแล็กซี ผมว่ามันทำได้ดีมากครับ ทางสายตาดูดีกว่าที่เวอร์ชันก่อนหน้าทำได้เยอะเลย ดูสะอาดตาและขัดเกลาขึ้นมาก และมันก็ทำครบทุกข้อที่ผมกำหนดไว้ในแง่ของข้อกำหนดทางเทคนิคด้วย ถือว่าเป็นงานที่ดีมากครับ

ผมคงต้องเปลี่ยน prompt ประจำที่ใช้อยู่แล้วล่ะ เพราะโมเดลสองสามตัวล่าสุดทำ prompt นี้ได้ดีมาก ผมคงต้องไปหางาน front-end coding ที่ยากกว่านี้มาลองบ้างแล้ว

โอเค งานแรกเสร็จแล้ว ทีนี้กลับมาคุยเรื่องตัวโมเดลกันบ้าง Kimi K3 เป็นโมเดลขนาด 2.8 ล้านล้านพารามิเตอร์ (2.8 trillion parameters) เป็นโมเดล open weights ระดับสามล้านล้านพารามิเตอร์ตัวแรกที่ถูกปล่อยออกมา มี context window 1 ล้านโทเคน ซึ่งเพิ่งเห็นกันไปแล้ว และมีสถาปัตยกรรมใหม่ที่ออกแบบมาเพื่อการทำงานด้าน coding research และงานความรู้ที่ต้องรันนาน ๆ โดยเฉพาะ

แต่กรอบความจริงก็สำคัญนะครับ Moonshot ไม่ได้กล่าวอ้างว่า K3 จะเอาชนะโมเดลปิดทุกตัว ในประกาศของบริษัทเองก็บอกตรง ๆ ว่า K3 ยังเป็นรอง Claude 5 และ GPT 5.6 Sol ในภาพรวมอยู่

คำถามที่น่าสนใจไม่ใช่ว่านี่เป็นโมเดล open ที่ใหญ่ที่สุดหรือไม่ เพราะมันชัดเจนอยู่แล้วว่าใช่ แต่คือคุณไม่สามารถรันโมเดลนี้บนเครื่องท้อคัดได้ แม้จะเป็น open weights แต่มันก็ไม่ใช่เรื่องที่เป็นไปได้ แม้คุณจะมีเครื่องที่ทรงพลังมากพร้อม GPU ของเก่ง ๆ ก็ตาม คำถามจริง ๆ คือ ขนาดที่ใหญ่ขนาดนี้จะแปลงเป็นงานสำเร็จที่ดีกว่าจริงหรือไม่

มาเจาะกันต่อเลย Kimi K3 ไม่ใช่แค่ Kimi K2 ที่เอา expert มาเพิ่มขึ้นเฉย ๆ ส่วนใหม่แรกคือ Kimi Delta Attention หรือเรียกสั้น ๆ ว่า KDA นี่เป็นสถาปัตยกรรม attention แบบประหยัดทรัพยากรของ Kimi สำหรับจัดการ sequence ที่ยาวมาก ๆ โดยไม่ต้องเสียค่าใช้จ่ายของ attention แบบมาตรฐานกับทุก token

จากนั้นก็มี attention residuals แทนที่จะให้แต่ละเลเยอร์สะสมข้อมูลจากเลเยอร์ก่อนหน้าทั้งหมด โมเดลสามารถเลือกดึง representation ที่มีประโยชน์จากความลึกที่แตกต่างกันได้

ภายใต้สิ่งนี้คือ stable lean MoE — K3 มี expert ถึง 896 ตัว แต่มีเพียง 16 ตัวเท่านั้นที่ active ในแต่ละ token นี่คือเหตุผลที่ขนาดโมเดลรวมใหญ่มาก แต่เส้นทางการทำงานจริงยังคง sparse อยู่

Moonshot ระบุว่า การผสมผสานของสถาปัตยกรรม การ routing การ train และข้อมูล ทำให้ scaling efficiency (ประสิทธิภาพการขยายตัว) โดยรวมดีขึ้นประมาณ 2.5 เท่าเมื่อเทียบกับ K2 ดังนั้นคำกล่าวอ้างเรื่องประสิทธิภาพนี้สำคัญกว่าจำนวนพารามิเตอร์เสียอีก เพราะโมเดลยักษ์จะมีประโยชน์ก็ต่อเมื่อคุณสามารถ train และ serve มันได้โดยที่ต้นทุนไม่บานปลาย

จุดขายหลักของ K3 คืองานที่ต้องทำต่อเนื่องยาวนานสามารถทำได้โดยแทบไม่ต้องมีมนุษย์คอยกำกับ Moonshot ระบุว่ามันสามารถอ่าน repository ขนาดใหญ่มาก ๆ ประสานงานกับเครื่องมือ terminal คงสภาพ session งานวิศวกรรม และใช้ screenshot เป็นส่วนหนึ่งของวงจรการเขียนโค้ดได้ คือมันสามารถสร้างบางสิ่งขึ้นมา ดูผลลัพธ์ที่ render แล้วนั้น จากนั้นปรับปรุงมันแทนที่จะหยุดแค่ตอนเขียน source code เสร็จ

พวกเขายังทดสอบ GPU kernel optimization โดยให้รันต่อหนึ่งครั้งได้นานถึง 24 ชั่วโมงเลยทีเดียว ในช่วงพัฒนา K3 เอง เวอร์ชันแรก ๆ มีรายงานว่ารับผิดชอบงาน kernel optimization ของทีมได้เกือบทั้งหมด

จะเห็นแนวโน้มกว้างขึ้นที่ครอบคลุมทั้งการปล่อยตัวนี้ — คือเน้นการ "รับผิดชอบโปรเจกต์ที่ยากทั้งโปรเจกต์แล้วรันต่อเนื่องจนจบ" พวกเขาพูดถึง case study สุดมหัศจรรย์หลายตัว ผมจะไม่ลงรายละเอียดทั้งหมดนะครับ สามารถไปอ่านเพิ่มเติมได้ที่ tech blog ซึ่งน่าสนใจมาก อย่างเช่นการสร้าง mini Triton GPU compiler, ชิปที่ถูกออกแบบโดยโมเดล, โลก 3D แบบ procedural open world โดยใช้ Three.js และ WebGPU พร้อม asset อื่น ๆ อีกมาก และงาน computational astrophysics โมเดลสามารถทำงานวิจัยและทุกอย่างที่จำเป็นได้ โดยทำงานที่ปกติต้องใช้เวลาสองสัปดาห์ให้เสร็จในสองชั่วโมง

ทีนี้มาดู benchmark กันบ้าง เพราะหลายคนอยากเห็นส่วนนี้แน่นอน ใน blog มีอยู่หลายตัวเลย ดู coding benchmark ได้เลย K3 อยู่ใกล้ด้านบนในเกือบทุกตัวเลย มีสองสามตัวที่แพ้ GPT-5.6 Sol สองสามตัวแพ้ Fable แต่บางตัวก็ขึ้นนำ คือเอาชนะ Sol และ Fable ได้ ซึ่งน่าทึ่งมาก

ส่วน agent benchmark ก็คล้าย ๆ กันครับ แพ้ Fable และ Sol อยู่บางตัว แต่บางตัวก็สูงกว่า เช่น automation bench, browse comp, spreadsheet bench และ visual agent ด้วย อยู่สูงกว่า Sol เล็กน้อย แต่ต่ำกว่า Fable นิดหน่อย ดังนั้นมันไม่ใช่โมเดลที่ดีที่สุดในตลาด แต่ก็ใกล้เคียงกับโมเดลท็อปที่เราเข้าถึงได้มาก และเมื่อพิจารณาว่า Fable 5 ถูกมองว่าเป็นภัยคุกคามระดับชาติที่ต้องกักไม่ให้ประชาชนทั่วไปเข้าถึง สิ่งที่ K3 ทำได้ถือว่าน่าทึ่งมากครับ

และอย่างที่เห็นตรงนี้ cost efficiency ก็เป็นปัจจัยสำคัญเช่นกัน ค่าใช้จ่ายต่องาน K3 ที่ทำเครื่องหมายดาวแดงไว้ตรงนี้ จะเห็นว่ามันมีประสิทธิภาพเรื่องต้นทุนดีกว่าอย่างชัดเจน

ดังนั้นนี่คือมุมมองตรงไปตรงมาของผม — K3 ดูแข็งแกร่งมากในแง่ของ benchmark ครับ

ความสำเร็จใหญ่ ๆ ใน coding benchmark และ agent benchmark, ผลลัพธ์ด้าน spreadsheet และ document understanding ที่แข็งแกร่ง, การเขียนโค้ดด้าน visual และ long context ล้วนเป็นความสามารถหลักที่มีประโยชน์มาก แต่อาจจะไม่แข็งแกร่งมากนักในงาน software engineering ที่ยากจริง ๆ ส่วน GPT 5.6 ยังนำอยู่ในการทดสอบ reasoning และ multimodal หลายตัว ซึ่ง Moonshot เองก็ยอมรับว่ามีช่องว่างด้าน UX เมื่อเทียบกับโมเดลท็อปเหล่านี้ แต่ถึงกระนั้นก็ถือว่าน่าประทับใจมากครับ

อย่างที่ผมพูดไปก่อนหน้านี้ เรื่องราคาและการเข้าถึง — อยู่ที่ 30 เซนต์สำหรับ cache hit input, $3 สำหรับ cache miss input ปกติ และ $15 สำหรับ output อย่างที่บอก ราคาใกล้เคียงกับ GPT 5.6 Terra ซึ่งเป็นรุ่นระดับกลางของ OpenAI นี่คือข้อเท็จจริงของตัวโมเดลเอง

สรุปแล้ว Kimi K3 ไม่ได้เป็นโมเดลที่ดีที่สุดโดยอัตโนมัติเพียงเพราะมีพารามิเตอร์มากที่สุด สิ่งที่ทำให้มันน่าสนใจจริง ๆ คือการผสมผสานระหว่างการเป็นโมเดล open ระดับสามล้านล้านพารามิเตอร์, context window หนึ่งล้านโทเคน, และสถาปัตยกรรม attention ที่เป็นนวัตกรรมใหม่จริง ๆ พร้อมความสามารถ multimodal แบบ native และการโฟกัสไปที่งานที่สามารถรันได้นานเป็นชั่วโมงหรือเป็นวัน

เราทำงานไปแล้วหนึ่งงาน ทีนี้มาทำอีกงานกันบ้างครับ งานต่อไปที่ผมจะให้จะเป็นงานที่อิงจากสิ่งที่เราเห็นในสไลด์นั่นแหละครับ นั่นคือ procedural 3D open world ผมอยากลองให้สร้าง open world ขึ้นมาดู เพราะก่อนหน้านี้ผมเคยให้ Opus และ GLM 5.2 ทำงานนี้ โดยให้สร้าง open world ใน Three.js โดยใช้ asset พื้นฐานบางตัว

ผมมี prompt อยู่ โดยระบุว่า "คุณอยู่ใน directory เปล่า วัสดุเพียงอย่างเดียวที่ให้คือโฟลเดอร์ assets ที่มี fantasy และ game assets" ซึ่งก็คือพวกนี้เลยครับ มีบางอย่าง — คุณอาจจะอ่านไม่ออก แต่พวกนี้เป็นไฟล์ Three.js และรูปอ้างอิงบางส่วน ซึ่งเดิมทีเป็นของสำหรับเกม One Piece ที่ผมพยายามจะทำอยู่ และน่าจะเป็นส่วนที่มีประโยชน์มากที่สุดสำหรับโมเดล เพราะมี texture ครบครันที่สามารถเอาไปใช้กับอาคารหรือพื้นดินได้เลย มี asset ให้ใช้ได้เพียบเลยครับ

ก็คือไอเดียคือให้สร้างโลกแฟนตาซี 3D ขึ้นมาโดยใช้ Three.js เป็นหลัก โดยมีข้อกำหนดอยู่สองสามข้อด้วยกัน — ระบบควบคุมการเคลื่อนไหว, จุดสนใจ (points of interest) สามจุด, องค์ประกอบแอนิเมชันหนึ่งตัว และให้ผู้ใช้สามารถคลิกหรือตรวจสอบวัตถุได้อย่างน้อยหนึ่งชิ้น นี่คือ prompt ที่ผมจะให้มัน เรามาดูกันว่าจะสร้างอะไรได้บ้างและจะดีกว่าของ Opus 4.8 และ GLM 5.2 หรือเปล่า

โอเค อีกครั้งใน Hermes นะครับ ผมจะวาง prompt ลงไป ตอนนี้เราอยู่ใน directory ที่ถูกต้องแล้ว เป็น directory เปล่ายกเว้นโฟลเดอร์ assets นั่นแหละ มาดูกันว่ามันจะทำยังไง

โอเค เสร็จแล้วครับ ใช้เวลาประมาณ 7 นาทีทั้งหมด ผมมีปัญหาเรื่องการเชื่อมต่ออยู่บ้าง คิดว่าน่าจะมีคนใช้งานเยอะมากวันนี้ แต่ก็ทำเสร็จได้ มาดูกันว่าได้อะไรกลับมาบ้าง

โอเค มาดูกันเลย Amber Fallvale คลิกเพื่อเข้าสู่เกม หน้าตาดูดีมากครับ นี่คือเมืองแฟนตาซีเล็ก ๆ ของเรา ทำ texture ได้ดีมากเลย มีบ่อน้ำอยู่ด้วย ผมคลิกดู — "The old well" บ่อน้ำโบราณ ชื่อไม่ค่อยสร้างสรรค์เท่าไหร่ แต่เอาเป็นว่ามาดูต่อกัน — "The fallen star crystal" คริสตัลดวงดาวตก แล้วนี่ใครนะ — "The hooded adventurer" นักผจญภัยหน้ากาก น่าสนใจดีครับ ทำแสงได้ดีมาก ชอบเอฟเฟกต์แสงนี้เลย รู้ว่าดูเหมือนจะไม่ใช่อะไรมาก แต่ว่ามันดีมาก แสงมาจากดวงอาทิตย์ การที่มันถ่วงลักษณะแสงออกมาได้ขนาดนี้ถือว่าดีมากครับ ดูดีเลย มีปราสาทเล็ก ๆ อยู่ตรงนี้ด้วย สำหรับการทำแบบ one-shot ถือว่าทำได้ดีมากครับ แน่นอน ถ้าจะสร้างโลก 3D จริงจัง ก็สามารถขัดเกลาเพิ่มเติมได้ แต่มันมีครบทุกองค์ประกอบที่ผมกำหนดไว้ คลิกที่อะไรก็ได้แล้วมันจะบอกชื่อให้ ก็มีครบแล้วครับ

และถ้าใครจำไม่ได้ นี่คือเวอร์ชันที่ Opus 4.8 ทำไว้ มีตัวละครมากกว่า แต่ไม่รู้สิ ผมรู้สึกว่าบ้านไม่ค่อยสวยเท่า ส่วนน้ำนี่ทำได้ดีกว่า แต่นี่คือเวอร์ชันของ Opus 4.8 ดังนั้นก็ไม่รู้ว่าจะถือว่ามันดีกว่าที่เราเพิ่งเห็นไหม ส่วนตัวผมไม่ขอรับรองนะว่า K3 จะดีกว่านะครับ เพราะเวอร์ชันใหม่นี่รู้สึกว่าจะครบครันกว่า มี texture ใช้เยอะกว่าด้วย แบบนี้น่ะครับ

ทีนี้ส่วนสุดท้าย เรามาอยู่ในแอป desktop กันบ้าง ผมอยากลองอันนี้เพราะอยากทดสอบกับ sub-agent พวกเขาบอกว่า Kimi K3 เป็น orchestrator model ที่ดีมาก ผมเลยอยากให้มันเป็นฝ่ายประสานงานที่ต้องใช้ sub-agent ดูสิว่ามันจะสังเคราะห์ข้อมูลได้ดีแค่ไหน

นี่คืองานที่ให้ครับ ผมบอกว่า "Spawn three sub-agents เพื่อทำวิจัยเกี่ยวกับหัวข้อดังต่อไปนี้ — หนึ่ง: agent memory, สอง: agent tool use, สาม: agent skills จากนั้นให้สังเคราะห์ข้อมูลจาก sub-agent ทั้งสามเป็นรายงานที่เข้ากัน โดยให้หา 5 paper ที่สำคัญที่สุดจัดอันดับตามความน่าเชื่อถือ ความใหม่ และผลกระทบต่อสายงาน agent"

มาดูกันว่ามันจะจัดการบทบาท orchestrator นี้ได้ดีแค่ไหน ผมทำในแอป desktop เพราะเราน่าจะเห็นการทำงานแบบเรียลไทม์ได้ มันจะโหลด research skill ขึ้นมาก่อนเพื่อเป็นแนวทาง workflow ที่เหมาะสม จากนั้นจะเรียก sub-agent ทั้งสามตัวขึ้นมาทำงานควบคู่กันไป (parallel) เราจะได้เห็นพวกมันทำงานอยู่ตรงนี้ ซึ่งแน่นอนว่าใช้ delegate task เป็นเครื่องมือ

มาดูกัน เรามี worker สามตัวแล้ว นี่คือเป้าหมายที่ orchestrator มอบหมายให้พวกมัน จะเห็นว่ามันให้ context ที่ละเอียดมาก อย่างเช่นเรื่อง agent tool use จะเห็นว่ามันระบุชัดเจนมากว่าต้องการ paper เกี่ยวกับ tool learning, function calling, MCP, และ tool use benchmark มันให้คำสั่งที่เข้มงวดมากว่า "ห้ามแต่ง paper หรือไอเดียขึ้นมมาเด็ดขาด" ซึ่งสำคัญมากใช่มั้ยครับ

ทีนี้ถือว่าเริ่มต้นได้ดี มาดูกันว่าจะได้อะไรกลับมา โอเค กำลังทำงานอยู่ครับ sub-agent ทั้งหมดเพิ่งทำงานเสร็จแล้ว ตอนนี้มันจะรีวิวสิ่งที่ได้กลับมา จะเห็นว่ามันกำลังคิดอยู่ตรงนี้ ได้ paper กลับมาประมาณแปดเรื่องจากแต่ละตัว เจ็ดเรื่องจาก agent skills ตอนนี้มันจะสังเคราะห์และคัดเลือก paper ที่น่าสนใจที่สุด 5 เรื่องออกมา

น่าสนใกมากที่ได้เห็นกระบวนการคิดของมัน จัดอันดับโดยความน่าเชื่อถือ ความใหม่ และผลกระทบ น่าสนใจมากครับ ทีนี้มันกำลัง spot check เรื่องที่ติดอันดับท็อป 5 อยู่ เพราะจากที่มันคิดไว้ มันบอกว่าไม่สามารถยืนยันหรือไม่ไว้วางใจสิ่งที่ sub-agent รายงานมาได้เท่าที่ควร และคิดว่าค่อนข้างคุ้มค่าที่จะยืนยันข้อเท็จจริงสำคัญของ 5 paper ที่มันเลือกไว้ ดังนั้นมันกำลังทำงานเพิ่มเติมและคิดทบทวนกระบวนการนี้อย่างรอบคอบขึ้น และนี่ยังเป็นการคิดแค่ระดับ medium thinking เท่านั้นนะครับ

โอเค มันยืนยันความถูกต้องของ top 5 ที่คัดเลือกไว้แล้ว เป็น paper จริงทั้งหมด ข้อมูลตรงกันหมด นี่คือรายงานสังเคราะห์ที่มันเขียนให้ผมครับ อันดับหนึ่งคือ OSWorld computer use agents on long horizon real world tasks อันดับสองคือ agent memory characterization and system implications จาก Stanford ต่อมาคือ MR agent skill composer และจากนั้นคือ reward hacking benchmark

มันทำหน้าที่สังเคราะห์ข้อมูลได้ดีมากครับ มันให้คะแนนด้วย ให้เหตุผลประกอบด้วย มีสรุปสั้น ๆ ที่เขียนขึ้นมาสวยงามสำหรับแต่ละเรื่อง และมีส่วนวิเคราะห์แนวโน้มระดับ field (field-level trends) ที่สอดคล้องกันทั้งสามสายงาน เช่น "Evaluation shifted from 'can it' to 'should it'" (การประเมินเปลี่ยนจาก 'ทำได้ไหม' เป็น 'ควรทำไหม'), "Memory is becoming infrastructure" (หน่วยความจำกำลังกลายเป็น infrastructure), และ "Scale research is answering its skeptics" (งานวิจัยด้าน scale กำลังตอบโต้ผู้สงสัยได้แล้ว)

มันจัดการงานนี้ได้ดีมากครับ ไม่มีปัญหาอะไร และค่อนข้างเร็วด้วย ใช้เวลาไม่ถึง 10 นาทีทั้งหมด ถือว่าทำหน้าที่เป็น orchestrator agent ได้ดีมากครับ การทดสอบต่อไปคงจะเป็น multi-agent workflow ที่ซับซ้อนกว่านี้ แต่สำหรับงานวิจัยง่าย ๆ แบบนี้ ผมว่าทำได้ดีมากครับ

นี่แหละครับคือ First Look ของ Kimi K3 — เป็นโมเดลที่สำคัญมาก เป็น open weights model ที่ใหญ่ที่สุดที่เราเคยมีมา และเป็นโมเดลที่ทำคะแนน benchmark ได้ดีที่สุดด้วย ผมก็เลยอยากรู้เหมือนกันว่าเมื่อไหร่ที่พวกเขาปล่อย weights ออกมาจริง ๆ เราจะเก็บเกี่ยวข้อมูลอะไรได้บ้าง แต่จากความประทับใจแรก ถือว่าดีมากครับ

ถึงแม้ว่าจะรู้สึกได้ว่ามันอยู่ในระดับโมเดล frontier ท็อปในแง่ของประสิทธิภาพจริง แต่ผมก็ต้องใช้งานมันเพิ่มเติมอีกจึงจะรู้ได้แน่ชัด แต่สำหรับคลิปนี้คงมีแค่นี้ก่อนนะครับ ฝากคอมเมนต์ด้วยนะครับ บอกผมได้เลยว่าประสบการณ์ของคุณกับ Kimi K3 เป็นยังไงบ้าง แล้วเจอกันใหม่ในคลิปหน้าครับ ขอบคุณที่รับชมครับ

03

หมายเหตุการแปล

ความโปร่งใสเกี่ยวกับความไม่แน่นอนในต้นฉบับ

  • ## ส่วนที่ฟังไม่ชัด
  • ไม่มี — ไม่มี `[ฟังไม่ชัด]` ใด ๆ ในคำแปล
04

อภิธานศัพท์เทคนิค

คำศัพท์และชื่อผลิตภัณฑ์ที่คงรูปภาษาอังกฤษ

ศัพท์คำแปล / คำอธิบาย
Kimi K3โมเดล flagship ตัวใหม่ล่าสุดของ Moonshot AI เป็น open weights model
Moonshot AIบริษัทผูพัฒนาโมเดล Kimi
open weightsโมเดลที่ปล่อยน้ำหนัก (weights) ให้ใช้งานได้แบบเปิด
open frontier intelligenceคำกล่าวอ้างของ Moonshot สำหรับ Kimi K3 หมายถึง open weights ระดับ frontier
flagship modelโมเดลธงรุ่นหลักของสายผลิตภัณฑ์
Hermes / Hermes Agentแพลตฟอร์ม AI agent ที่โฮสต์ใช้ทดสอบโมเดลในคลิป
sub-agentagent ย่อยที่ถูกเรียกโดย orchestrator
orchestratorโมเดลหลักที่ทำหน้าที่ประสานงาน agent อื่น ๆ
parameterพารามิเตอร์ — หน่วยนับขนาดของโมเดล (K3 = 2.8 ล้านล้าน)
context windowหน้าต่างบริบท — จำนวน token ที่โมเดลรับได้ในครั้งเดียว (K3 = 1 ล้าน)
2.8 trillion parameters2.8 ล้านล้านพารามิเตอร์
tokenหน่วยย่อยของข้อความที่โมเดลประมวลผล
Kimi Delta Attention (KDA)สถาปัตยกรรม attention แบบประหยัดสำหรับ sequence ยาว ๆ ของ Kimi
attention residualsกลไกที่ให้แต่ละเลเยอร์เลือกดึง representation จากความลึกต่าง ๆ ได้
stable lean MoEสถาปัตยกรรม Mixture of Experts แบบ sparse ของ K3
Mixture of Experts (MoE)เทคนิคที่มี expert หลายตัวแต่เลือก active เพียงส่วนน้อยต่อ token
expertโมดูลย่อยใน MoE ที่รับผิดชอบเฉพาะส่วน (K3 มี 896 ตัว, active 16 ต่อ token)
routingกลไกการเลือก expert ที่จะ active ในแต่ละ token
scaling efficiencyประสิทธิภาพการขยายขนาดโมเดล
long-horizon workงานที่ต้องดำเนินต่อเนื่องยาวนาน (ชั่วโมง–วัน)
kernel optimizationการเพิ่มประสิทธิภาพ GPU kernel
Three.jsไลบรารี JavaScript สำหรับสร้างกราฟิก 3D บนเว็บ
GLSL fragment shaderโค้ด shader สำหรับควบคุมสี/แสงของพิกเซลใน 3D
GSAPไลบรารีแอนิเมชัน JavaScript
framer-motionไลบรารีแอนิเมชันสำหรับ React
stagger entranceแอนิเมชันที่ทยอยโผล่ทีละส่วน
NPM / CDN importsระบบจัดการแพ็กเกจ / การโหลดไลบรารีผ่าน CDN
procedural 3D open worldโลก 3D ที่สร้างขึ้นแบบอัตโนมัติด้วยอัลกอริทึม
WebGPUAPI กราฟิกสมัยใหม่สำหรับเว็บเบราว์เซอร์
benchmarkการทดสอบเปรียบเทียบประสิทธิภาพโมเดล
Fableโมเดล AI คู่แข่ง (สื่อเรียกว่าเป็นภัยคุกคามระดับชาติ)
GPT-5.6 Solโมเดล top ของ OpenAI ในเวลานั้น
GPT-5.6 Terraโมเดลระดับกลางของ OpenAI ราคาใกล้เคียง K3
Claude 5 / Opusโมเดลของ Anthropic ที่เป็นคู่แข่งสำคัญ
GLM 5.2โมเดล AI คู่แข่งอีกตัวที่โฮสต์เคยทดสอบ
multimodalความสามารถรับข้อมูลหลายรูปแบบ (ข้อความ ภาพ เสียง)
reasoningความสามารถในการให้เหตุผล
cache hit / cache missการเข้าถึง input ที่แคชไว้แล้ว (ถูก) vs. ไม่มีในแคช (พลาด)
delegate taskเครื่องมือสั่งงาน sub-agent
research skillskill สำหรับ workflow วิจัยใน Hermes
repositoryที่เก็บโค้ด
GPUหน่วยประมวลผลกราฟิก ใช้ train และรันโมเดล AI
05

ซับไตเติ้ลภาษาไทย

ดาวน์โหลดหรือดูซับทั้งหมด

1
00:00:00,000 --> 00:00:04,035
Moonshot AI เพิ่งปล่อย Kimi K3 ออกมา โดยเรียกมันว่า

2
00:00:04,035 --> 00:00:07,754
open frontier intelligence ตัวนี้จะเป็นโมเดลแบบ

3
00:00:07,754 --> 00:00:12,185
open weights และเป็น flagship model ล่าสุดในสายผลิตภัณฑ์

4
00:00:12,185 --> 00:00:16,854
Kimi ที่ได้รับความนิยมมากครับ หลายคนน่าจะจำได้ว่าผมเคยรีวิว
thai-subtitles.srt
SubRip — ใช้กับเครื่องเล่นวิดีโอส่วนใหญ่
↓ ดาวน์โหลด
thai-subtitles.vtt
WebVTT — ใช้กับเว็บ / YouTube
↓ ดาวน์โหลด
เปิดดูซับไตเติ้ลทั้งหมด (239 segments)
1
00:00:00,000 --> 00:00:04,035
Moonshot AI เพิ่งปล่อย Kimi K3 ออกมา โดยเรียกมันว่า

2
00:00:04,035 --> 00:00:07,754
open frontier intelligence ตัวนี้จะเป็นโมเดลแบบ

3
00:00:07,754 --> 00:00:12,185
open weights และเป็น flagship model ล่าสุดในสายผลิตภัณฑ์

4
00:00:12,185 --> 00:00:16,854
Kimi ที่ได้รับความนิยมมากครับ หลายคนน่าจะจำได้ว่าผมเคยรีวิว

5
00:00:16,854 --> 00:00:21,285
Kimi K2.6 ไปแล้ว และตอนนั้นมันทำผลงานได้ดีมากสำหรับโมเดล

6
00:00:21,285 --> 00:00:25,320
open weights ครับ ผมเลยค่อนข้างตื่นเต้นที่จะเห็นว่า

7
00:00:25,320 --> 00:00:31,018
Kimi K3 จะทำได้แค่ไหน เราจะเริ่มจากการลองให้มันทำงานเปิดตัวสักงานก่อนเลย

8
00:00:31,018 --> 00:00:34,895
แล้วค่อยกลับมาเล่าให้ฟังถึงสเปคทางเทคนิค พร้อมกับ

9
00:00:34,895 --> 00:00:39,959
benchmark ต่าง ๆ แล้วค่อยให้มันทำงานเพิ่มอีกสองสามชิ้นในช่วงท้าย

10
00:00:39,959 --> 00:00:46,605
แต่ผมว่าเรามาเริ่มลองเล่นของจริงกันก่อนดีกว่า จะได้ไม่ต้องมานั่งดูสไลด์กันก่อนนะครับ

11
00:00:46,605 --> 00:00:50,799
พอดีเห็น Hermes กำลัง update อยู่เบื้องหลัง แต่นี่คือ

12
00:00:50,799 --> 00:00:56,575
prompt ที่เราจะให้ และเป็น prompt ที่หลายคนเคยเห็นมาแล้วหลายครั้งแล้วครับ

13
00:00:56,575 --> 00:01:00,532
prompt คือให้สร้างไฟล์ HTML ไฟล์เดียวสำหรับเกม One

14
00:01:00,532 --> 00:01:04,488
Piece meets Star Wars โดยมี hero section แบบเต็มจอ

15
00:01:04,488 --> 00:01:08,603
พื้นหลังสีเข้ม มีทรงกลม 3D หมุนอยู่ใน Three.js พร้อม

16
00:01:08,603 --> 00:01:14,141
GLSL fragment shader แบบกำหนดเอง ทำให้มันดูเหมือนดาวเคราะห์ที่เรืองแสง

17
00:01:14,141 --> 00:01:17,939
ทรงกลมจะค่อย ๆ หมุนรอบแกน Y เมื่อ scroll ลง GSAP

18
00:01:17,939 --> 00:01:22,133
จะเล่นแอนิเมชันให้ทรงกลมเล็กลงและจางหายไป พร้อมกับให้

19
00:01:22,133 --> 00:01:26,090
headline ค่อย ๆ โผล่ขึ้นมาแบบ stagger entrance ของ

20
00:01:26,090 --> 00:01:29,808
framer-motion ทำงานบน Chrome ไม่ต้องใช้ NPM ใช้

21
00:01:29,808 --> 00:01:34,240
CDN imports เท่านั้นครับ หลายคนอาจจำได้ว่านี่คือผลงานที่

22
00:01:34,240 --> 00:01:40,095
Kimi K2.6 ทำได้ตอนนั้น ซึ่งดูดีมาก และในเวลานั้นมันเป็นผลงานที่ดีที่สุดจาก

23
00:01:40,095 --> 00:01:44,289
prompt นี้เลย ตอนนั้น Fable ยังไม่ได้ออกมาทำได้ดีกว่า

24
00:01:44,289 --> 00:01:50,777
และล่าสุด ChatGPT 5.6 Sol ก็ทำได้ดีเช่นกัน แต่ตอนที่ปล่อยครั้งแรกมันทำได้ดีมากจริง

25
00:01:50,777 --> 00:01:54,733
ๆ โดยที่โมเดล frontier ตัวอื่น ๆ ในยุคนั้นทำไม่ได้

26
00:01:54,733 --> 00:01:59,323
เช่น Opus หรือ GPT รุ่นตอนนั้นก็ทำไม่ได้ครับ แต่มาดูกันว่า

27
00:01:59,323 --> 00:02:03,279
Kimi K3 จะทำยังไงกับ prompt นี้ สักสองสามเดือนก่อน

28
00:02:03,279 --> 00:02:08,660
prompt นี้ถือว่ายากมาก แต่โมเดลรุ่นใหม่ ๆ ส่วนใหญ่ก็เริ่มทำได้ดีแล้ว

29
00:02:08,660 --> 00:02:14,357
ผมอาจจะต้องหา prompt ที่ยากกว่านี้มาใช้แล้วล่ะ ถ้าโมเดลทุกตัวเริ่มจัดการ

30
00:02:14,357 --> 00:02:18,946
prompt นี้ได้หมดแล้ว ทีนี้เรามาเลือกโมเดลกัน เลื่อนลงไปที่

31
00:02:18,946 --> 00:02:22,981
Moonshot Kimi K3 ในพอร์ทัลใหม่ สังเกตราคาได้เลยครับ

32
00:02:22,981 --> 00:02:27,017
ตอนนี้อยู่ที่ $3 สำหรับ input และ $15 สำหรับ output

33
00:02:27,017 --> 00:02:30,736
ซึ่งถือว่าอยู่ในระดับใกล้เคียงกับ GPT-5.6 Terra

34
00:02:30,736 --> 00:02:36,591
ของ OpenAI คือเป็นโมเดลระดับกลางของ OpenAI ดังนั้นมันไม่ใช่ของถูกเลยนะครับ

35
00:02:36,591 --> 00:02:41,893
แพงอยู่ แต่ก็เป็น open weights ด้วยเช่นกัน และพร้อมใช้งานแล้วตอนนี้

36
00:02:41,893 --> 00:02:45,849
ทีนี้มาที่หน้าแชทของ Hermes กันบ้าง ผมจะวาง prompt

37
00:02:45,849 --> 00:02:49,805
นี้ลงไปเลยนะครับ โอเค คุณจะเห็น Kimi K3 อยู่ตรงนี้

38
00:02:49,805 --> 00:02:53,762
นี่คือสิ่งที่ได้กลับมา เห็นชื่อว่า Grandline Prime

39
00:02:53,762 --> 00:02:58,826
ขนานนามว่า One Piece Star Wars Outer Rim ตัวทรงกลมเองดูดีมากครับ

40
00:02:58,826 --> 00:03:03,890
นี่เป็นหนึ่งในเวอร์ชันที่ดีกว่าเดิมเยอะเลย ดูมีความสมจริงมากขึ้น

41
00:03:03,890 --> 00:03:08,163
ดูคล้ายโลกเลย เหมือนมีเมฆลอยอยู่ข้างใต้ ทำได้ดีมากจริง

42
00:03:08,163 --> 00:03:13,227
ๆ สำหรับตัวทรงกลม ทีนี้ลอง scroll ลงไปดูกัน นี่คือบททดสอบของจริง

43
00:03:13,227 --> 00:03:17,183
มันค่อย ๆ เล็กลง ค่อย ๆ จางหายไป สวยงามมาก และก็มี

44
00:03:17,183 --> 00:03:21,139
stagger entrance ของ headline ขึ้นมาพอดี "Set sail

45
00:03:21,139 --> 00:03:25,254
for the stars, become the pirate king of the galaxy"

46
00:03:25,254 --> 00:03:29,448
— ออกเดินทางสู่ดวงดาว กลายเป็นราชาโจรสลัดแห่งกาแล็กซี

47
00:03:29,448 --> 00:03:34,986
ผมว่ามันทำได้ดีมากครับ ทางสายตาดูดีกว่าที่เวอร์ชันก่อนหน้าทำได้เยอะเลย

48
00:03:34,986 --> 00:03:41,950
ดูสะอาดตาและขัดเกลาขึ้นมาก และมันก็ทำครบทุกข้อที่ผมกำหนดไว้ในแง่ของข้อกำหนดทางเทคนิคด้วย

49
00:03:41,950 --> 00:03:45,748
ถือว่าเป็นงานที่ดีมากครับ ผมคงต้องเปลี่ยน prompt

50
00:03:45,748 --> 00:03:49,704
ประจำที่ใช้อยู่แล้วล่ะ เพราะโมเดลสองสามตัวล่าสุดทำ

51
00:03:49,704 --> 00:03:53,739
prompt นี้ได้ดีมาก ผมคงต้องไปหางาน front-end coding

52
00:03:53,739 --> 00:03:57,458
ที่ยากกว่านี้มาลองบ้างแล้ว โอเค งานแรกเสร็จแล้ว

53
00:03:57,458 --> 00:04:01,968
ทีนี้กลับมาคุยเรื่องตัวโมเดลกันบ้าง Kimi K3 เป็นโมเดลขนาด

54
00:04:01,968 --> 00:04:05,846
2.8 ล้านล้านพารามิเตอร์ (2.8 trillion parameters)

55
00:04:05,846 --> 00:04:11,543
เป็นโมเดล open weights ระดับสามล้านล้านพารามิเตอร์ตัวแรกที่ถูกปล่อยออกมา

56
00:04:11,543 --> 00:04:15,657
มี context window 1 ล้านโทเคน ซึ่งเพิ่งเห็นกันไปแล้ว

57
00:04:15,657 --> 00:04:19,455
และมีสถาปัตยกรรมใหม่ที่ออกแบบมาเพื่อการทำงานด้าน

58
00:04:19,455 --> 00:04:23,649
coding research และงานความรู้ที่ต้องรันนาน ๆ โดยเฉพาะ

59
00:04:23,649 --> 00:04:28,080
แต่กรอบความจริงก็สำคัญนะครับ Moonshot ไม่ได้กล่าวอ้างว่า

60
00:04:28,080 --> 00:04:32,353
K3 จะเอาชนะโมเดลปิดทุกตัว ในประกาศของบริษัทเองก็บอกตรง

61
00:04:32,353 --> 00:04:36,863
ๆ ว่า K3 ยังเป็นรอง Claude 5 และ GPT 5.6 Sol ในภาพรวมอยู่

62
00:04:36,863 --> 00:04:41,769
คำถามที่น่าสนใจไม่ใช่ว่านี่เป็นโมเดล open ที่ใหญ่ที่สุดหรือไม่

63
00:04:41,769 --> 00:04:47,783
เพราะมันชัดเจนอยู่แล้วว่าใช่ แต่คือคุณไม่สามารถรันโมเดลนี้บนเครื่องท้อคัดได้

64
00:04:47,783 --> 00:04:52,135
แม้จะเป็น open weights แต่มันก็ไม่ใช่เรื่องที่เป็นไปได้

65
00:04:52,135 --> 00:04:55,854
แม้คุณจะมีเครื่องที่ทรงพลังมากพร้อม GPU ของเก่ง

66
00:04:55,854 --> 00:05:02,263
ๆ ก็ตาม คำถามจริง ๆ คือ ขนาดที่ใหญ่ขนาดนี้จะแปลงเป็นงานสำเร็จที่ดีกว่าจริงหรือไม่

67
00:05:02,263 --> 00:05:06,061
มาเจาะกันต่อเลย Kimi K3 ไม่ใช่แค่ Kimi K2 ที่เอา

68
00:05:06,061 --> 00:05:09,938
expert มาเพิ่มขึ้นเฉย ๆ ส่วนใหม่แรกคือ Kimi Delta

69
00:05:09,938 --> 00:05:14,053
Attention หรือเรียกสั้น ๆ ว่า KDA นี่เป็นสถาปัตยกรรม

70
00:05:14,053 --> 00:05:17,930
attention แบบประหยัดทรัพยากรของ Kimi สำหรับจัดการ

71
00:05:17,930 --> 00:05:21,728
sequence ที่ยาวมาก ๆ โดยไม่ต้องเสียค่าใช้จ่ายของ

72
00:05:21,728 --> 00:05:26,001
attention แบบมาตรฐานกับทุก token จากนั้นก็มี attention

73
00:05:26,001 --> 00:05:31,381
residuals แทนที่จะให้แต่ละเลเยอร์สะสมข้อมูลจากเลเยอร์ก่อนหน้าทั้งหมด

74
00:05:31,381 --> 00:05:37,237
โมเดลสามารถเลือกดึง representation ที่มีประโยชน์จากความลึกที่แตกต่างกันได้

75
00:05:37,237 --> 00:05:40,956
ภายใต้สิ่งนี้คือ stable lean MoE — K3 มี expert

76
00:05:40,956 --> 00:05:44,675
ถึง 896 ตัว แต่มีเพียง 16 ตัวเท่านั้นที่ active

77
00:05:44,675 --> 00:05:48,473
ในแต่ละ token นี่คือเหตุผลที่ขนาดโมเดลรวมใหญ่มาก

78
00:05:48,473 --> 00:05:52,271
แต่เส้นทางการทำงานจริงยังคง sparse อยู่ Moonshot

79
00:05:52,271 --> 00:05:56,069
ระบุว่า การผสมผสานของสถาปัตยกรรม การ routing การ

80
00:05:56,069 --> 00:06:01,133
train และข้อมูล ทำให้ scaling efficiency (ประสิทธิภาพการขยายตัว)

81
00:06:01,133 --> 00:06:10,153
โดยรวมดีขึ้นประมาณ 2.5 เท่าเมื่อเทียบกับ K2 ดังนั้นคำกล่าวอ้างเรื่องประสิทธิภาพนี้สำคัญกว่าจำนวนพารามิเตอร์เสียอีก

82
00:06:10,153 --> 00:06:14,268
เพราะโมเดลยักษ์จะมีประโยชน์ก็ต่อเมื่อคุณสามารถ train

83
00:06:14,268 --> 00:06:18,382
และ serve มันได้โดยที่ต้นทุนไม่บานปลาย จุดขายหลักของ

84
00:06:18,382 --> 00:06:24,159
K3 คืองานที่ต้องทำต่อเนื่องยาวนานสามารถทำได้โดยแทบไม่ต้องมีมนุษย์คอยกำกับ

85
00:06:24,159 --> 00:06:28,273
Moonshot ระบุว่ามันสามารถอ่าน repository ขนาดใหญ่มาก

86
00:06:28,273 --> 00:06:32,071
ๆ ประสานงานกับเครื่องมือ terminal คงสภาพ session

87
00:06:32,071 --> 00:06:37,214
งานวิศวกรรม และใช้ screenshot เป็นส่วนหนึ่งของวงจรการเขียนโค้ดได้

88
00:06:37,214 --> 00:06:41,171
คือมันสามารถสร้างบางสิ่งขึ้นมา ดูผลลัพธ์ที่ render

89
00:06:41,171 --> 00:06:45,127
แล้วนั้น จากนั้นปรับปรุงมันแทนที่จะหยุดแค่ตอนเขียน

90
00:06:45,127 --> 00:06:49,558
source code เสร็จ พวกเขายังทดสอบ GPU kernel optimization

91
00:06:49,558 --> 00:06:53,673
โดยให้รันต่อหนึ่งครั้งได้นานถึง 24 ชั่วโมงเลยทีเดียว

92
00:06:53,673 --> 00:06:58,104
ในช่วงพัฒนา K3 เอง เวอร์ชันแรก ๆ มีรายงานว่ารับผิดชอบงาน

93
00:06:58,104 --> 00:07:05,463
kernel optimization ของทีมได้เกือบทั้งหมด จะเห็นแนวโน้มกว้างขึ้นที่ครอบคลุมทั้งการปล่อยตัวนี้

94
00:07:05,463 --> 00:07:11,001
— คือเน้นการ "รับผิดชอบโปรเจกต์ที่ยากทั้งโปรเจกต์แล้วรันต่อเนื่องจนจบ"

95
00:07:11,001 --> 00:07:17,015
พวกเขาพูดถึง case study สุดมหัศจรรย์หลายตัว ผมจะไม่ลงรายละเอียดทั้งหมดนะครับ

96
00:07:17,015 --> 00:07:21,130
สามารถไปอ่านเพิ่มเติมได้ที่ tech blog ซึ่งน่าสนใจมาก

97
00:07:21,130 --> 00:07:26,510
อย่างเช่นการสร้าง mini Triton GPU compiler, ชิปที่ถูกออกแบบโดยโมเดล,

98
00:07:26,510 --> 00:07:30,308
โลก 3D แบบ procedural open world โดยใช้ Three.js

99
00:07:30,308 --> 00:07:34,818
และ WebGPU พร้อม asset อื่น ๆ อีกมาก และงาน computational

100
00:07:34,818 --> 00:07:39,329
astrophysics โมเดลสามารถทำงานวิจัยและทุกอย่างที่จำเป็นได้

101
00:07:39,329 --> 00:07:43,760
โดยทำงานที่ปกติต้องใช้เวลาสองสัปดาห์ให้เสร็จในสองชั่วโมง

102
00:07:43,760 --> 00:07:48,507
ทีนี้มาดู benchmark กันบ้าง เพราะหลายคนอยากเห็นส่วนนี้แน่นอน

103
00:07:48,507 --> 00:07:52,543
ใน blog มีอยู่หลายตัวเลย ดู coding benchmark ได้เลย

104
00:07:52,543 --> 00:07:56,578
K3 อยู่ใกล้ด้านบนในเกือบทุกตัวเลย มีสองสามตัวที่แพ้

105
00:07:56,578 --> 00:08:00,376
GPT-5.6 Sol สองสามตัวแพ้ Fable แต่บางตัวก็ขึ้นนำ

106
00:08:00,376 --> 00:08:04,095
คือเอาชนะ Sol และ Fable ได้ ซึ่งน่าทึ่งมาก ส่วน

107
00:08:04,095 --> 00:08:07,814
agent benchmark ก็คล้าย ๆ กันครับ แพ้ Fable และ

108
00:08:07,814 --> 00:08:11,691
Sol อยู่บางตัว แต่บางตัวก็สูงกว่า เช่น automation

109
00:08:11,691 --> 00:08:15,489
bench, browse comp, spreadsheet bench และ visual

110
00:08:15,489 --> 00:08:19,604
agent ด้วย อยู่สูงกว่า Sol เล็กน้อย แต่ต่ำกว่า Fable

111
00:08:19,604 --> 00:08:23,323
นิดหน่อย ดังนั้นมันไม่ใช่โมเดลที่ดีที่สุดในตลาด

112
00:08:23,323 --> 00:08:28,387
แต่ก็ใกล้เคียงกับโมเดลท็อปที่เราเข้าถึงได้มาก และเมื่อพิจารณาว่า

113
00:08:28,387 --> 00:08:34,322
Fable 5 ถูกมองว่าเป็นภัยคุกคามระดับชาติที่ต้องกักไม่ให้ประชาชนทั่วไปเข้าถึง

114
00:08:34,322 --> 00:08:38,911
สิ่งที่ K3 ทำได้ถือว่าน่าทึ่งมากครับ และอย่างที่เห็นตรงนี้

115
00:08:38,911 --> 00:08:43,421
cost efficiency ก็เป็นปัจจัยสำคัญเช่นกัน ค่าใช้จ่ายต่องาน

116
00:08:43,421 --> 00:08:50,463
K3 ที่ทำเครื่องหมายดาวแดงไว้ตรงนี้ จะเห็นว่ามันมีประสิทธิภาพเรื่องต้นทุนดีกว่าอย่างชัดเจน

117
00:08:50,463 --> 00:08:55,369
ดังนั้นนี่คือมุมมองตรงไปตรงมาของผม — K3 ดูแข็งแกร่งมากในแง่ของ

118
00:08:55,369 --> 00:08:59,405
benchmark ครับ ความสำเร็จใหญ่ ๆ ใน coding benchmark

119
00:08:59,405 --> 00:09:03,203
และ agent benchmark, ผลลัพธ์ด้าน spreadsheet และ

120
00:09:03,203 --> 00:09:07,396
document understanding ที่แข็งแกร่ง, การเขียนโค้ดด้าน

121
00:09:07,396 --> 00:09:12,302
visual และ long context ล้วนเป็นความสามารถหลักที่มีประโยชน์มาก

122
00:09:12,302 --> 00:09:16,417
แต่อาจจะไม่แข็งแกร่งมากนักในงาน software engineering

123
00:09:16,417 --> 00:09:20,769
ที่ยากจริง ๆ ส่วน GPT 5.6 ยังนำอยู่ในการทดสอบ reasoning

124
00:09:20,769 --> 00:09:25,912
และ multimodal หลายตัว ซึ่ง Moonshot เองก็ยอมรับว่ามีช่องว่างด้าน

125
00:09:25,912 --> 00:09:31,688
UX เมื่อเทียบกับโมเดลท็อปเหล่านี้ แต่ถึงกระนั้นก็ถือว่าน่าประทับใจมากครับ

126
00:09:31,688 --> 00:09:35,644
อย่างที่ผมพูดไปก่อนหน้านี้ เรื่องราคาและการเข้าถึง

127
00:09:35,644 --> 00:09:39,680
— อยู่ที่ 30 เซนต์สำหรับ cache hit input, $3 สำหรับ

128
00:09:39,680 --> 00:09:44,032
cache miss input ปกติ และ $15 สำหรับ output อย่างที่บอก

129
00:09:44,032 --> 00:09:48,384
ราคาใกล้เคียงกับ GPT 5.6 Terra ซึ่งเป็นรุ่นระดับกลางของ

130
00:09:48,384 --> 00:09:52,103
OpenAI นี่คือข้อเท็จจริงของตัวโมเดลเอง สรุปแล้ว

131
00:09:52,103 --> 00:09:58,275
Kimi K3 ไม่ได้เป็นโมเดลที่ดีที่สุดโดยอัตโนมัติเพียงเพราะมีพารามิเตอร์มากที่สุด

132
00:09:58,275 --> 00:10:03,101
สิ่งที่ทำให้มันน่าสนใจจริง ๆ คือการผสมผสานระหว่างการเป็นโมเดล

133
00:10:03,101 --> 00:10:06,899
open ระดับสามล้านล้านพารามิเตอร์, context window

134
00:10:06,899 --> 00:10:11,963
หนึ่งล้านโทเคน, และสถาปัตยกรรม attention ที่เป็นนวัตกรรมใหม่จริง

135
00:10:11,963 --> 00:10:19,797
ๆ พร้อมความสามารถ multimodal แบบ native และการโฟกัสไปที่งานที่สามารถรันได้นานเป็นชั่วโมงหรือเป็นวัน

136
00:10:19,797 --> 00:10:23,674
เราทำงานไปแล้วหนึ่งงาน ทีนี้มาทำอีกงานกันบ้างครับ

137
00:10:23,674 --> 00:10:29,134
งานต่อไปที่ผมจะให้จะเป็นงานที่อิงจากสิ่งที่เราเห็นในสไลด์นั่นแหละครับ

138
00:10:29,134 --> 00:10:33,090
นั่นคือ procedural 3D open world ผมอยากลองให้สร้าง

139
00:10:33,090 --> 00:10:36,967
open world ขึ้นมาดู เพราะก่อนหน้านี้ผมเคยให้ Opus

140
00:10:36,967 --> 00:10:41,319
และ GLM 5.2 ทำงานนี้ โดยให้สร้าง open world ใน Three.js

141
00:10:41,319 --> 00:10:45,592
โดยใช้ asset พื้นฐานบางตัว ผมมี prompt อยู่ โดยระบุว่า

142
00:10:45,592 --> 00:10:50,656
"คุณอยู่ใน directory เปล่า วัสดุเพียงอย่างเดียวที่ให้คือโฟลเดอร์

143
00:10:50,656 --> 00:10:55,404
assets ที่มี fantasy และ game assets" ซึ่งก็คือพวกนี้เลยครับ

144
00:10:55,404 --> 00:10:59,281
มีบางอย่าง — คุณอาจจะอ่านไม่ออก แต่พวกนี้เป็นไฟล์

145
00:10:59,281 --> 00:11:03,712
Three.js และรูปอ้างอิงบางส่วน ซึ่งเดิมทีเป็นของสำหรับเกม

146
00:11:03,712 --> 00:11:09,963
One Piece ที่ผมพยายามจะทำอยู่ และน่าจะเป็นส่วนที่มีประโยชน์มากที่สุดสำหรับโมเดล

147
00:11:09,963 --> 00:11:15,106
เพราะมี texture ครบครันที่สามารถเอาไปใช้กับอาคารหรือพื้นดินได้เลย

148
00:11:15,106 --> 00:11:20,091
มี asset ให้ใช้ได้เพียบเลยครับ ก็คือไอเดียคือให้สร้างโลกแฟนตาซี

149
00:11:20,091 --> 00:11:25,393
3D ขึ้นมาโดยใช้ Three.js เป็นหลัก โดยมีข้อกำหนดอยู่สองสามข้อด้วยกัน

150
00:11:25,393 --> 00:11:29,745
— ระบบควบคุมการเคลื่อนไหว, จุดสนใจ (points of interest)

151
00:11:29,745 --> 00:11:37,262
สามจุด, องค์ประกอบแอนิเมชันหนึ่งตัว และให้ผู้ใช้สามารถคลิกหรือตรวจสอบวัตถุได้อย่างน้อยหนึ่งชิ้น

152
00:11:37,262 --> 00:11:43,038
นี่คือ prompt ที่ผมจะให้มัน เรามาดูกันว่าจะสร้างอะไรได้บ้างและจะดีกว่าของ

153
00:11:43,038 --> 00:11:47,232
Opus 4.8 และ GLM 5.2 หรือเปล่า โอเค อีกครั้งใน Hermes

154
00:11:47,232 --> 00:11:51,346
นะครับ ผมจะวาง prompt ลงไป ตอนนี้เราอยู่ใน directory

155
00:11:51,346 --> 00:11:55,223
ที่ถูกต้องแล้ว เป็น directory เปล่ายกเว้นโฟลเดอร์

156
00:11:55,223 --> 00:11:59,734
assets นั่นแหละ มาดูกันว่ามันจะทำยังไง โอเค เสร็จแล้วครับ

157
00:11:59,734 --> 00:12:04,719
ใช้เวลาประมาณ 7 นาทีทั้งหมด ผมมีปัญหาเรื่องการเชื่อมต่ออยู่บ้าง

158
00:12:04,719 --> 00:12:08,675
คิดว่าน่าจะมีคนใช้งานเยอะมากวันนี้ แต่ก็ทำเสร็จได้

159
00:12:08,675 --> 00:12:12,552
มาดูกันว่าได้อะไรกลับมาบ้าง โอเค มาดูกันเลย Amber

160
00:12:12,552 --> 00:12:18,012
Fallvale คลิกเพื่อเข้าสู่เกม หน้าตาดูดีมากครับ นี่คือเมืองแฟนตาซีเล็ก

161
00:12:18,012 --> 00:12:21,810
ๆ ของเรา ทำ texture ได้ดีมากเลย มีบ่อน้ำอยู่ด้วย

162
00:12:21,810 --> 00:12:27,111
ผมคลิกดู — "The old well" บ่อน้ำโบราณ ชื่อไม่ค่อยสร้างสรรค์เท่าไหร่

163
00:12:27,111 --> 00:12:31,147
แต่เอาเป็นว่ามาดูต่อกัน — "The fallen star crystal"

164
00:12:31,147 --> 00:12:35,420
คริสตัลดวงดาวตก แล้วนี่ใครนะ — "The hooded adventurer"

165
00:12:35,420 --> 00:12:40,563
นักผจญภัยหน้ากาก น่าสนใจดีครับ ทำแสงได้ดีมาก ชอบเอฟเฟกต์แสงนี้เลย

166
00:12:40,563 --> 00:12:45,548
รู้ว่าดูเหมือนจะไม่ใช่อะไรมาก แต่ว่ามันดีมาก แสงมาจากดวงอาทิตย์

167
00:12:45,548 --> 00:12:49,662
การที่มันถ่วงลักษณะแสงออกมาได้ขนาดนี้ถือว่าดีมากครับ

168
00:12:49,662 --> 00:12:53,777
ดูดีเลย มีปราสาทเล็ก ๆ อยู่ตรงนี้ด้วย สำหรับการทำแบบ

169
00:12:53,777 --> 00:12:57,733
one-shot ถือว่าทำได้ดีมากครับ แน่นอน ถ้าจะสร้างโลก

170
00:12:57,733 --> 00:13:03,747
3D จริงจัง ก็สามารถขัดเกลาเพิ่มเติมได้ แต่มันมีครบทุกองค์ประกอบที่ผมกำหนดไว้

171
00:13:03,747 --> 00:13:07,782
คลิกที่อะไรก็ได้แล้วมันจะบอกชื่อให้ ก็มีครบแล้วครับ

172
00:13:07,782 --> 00:13:11,739
และถ้าใครจำไม่ได้ นี่คือเวอร์ชันที่ Opus 4.8 ทำไว้

173
00:13:11,739 --> 00:13:16,328
มีตัวละครมากกว่า แต่ไม่รู้สิ ผมรู้สึกว่าบ้านไม่ค่อยสวยเท่า

174
00:13:16,328 --> 00:13:20,047
ส่วนน้ำนี่ทำได้ดีกว่า แต่นี่คือเวอร์ชันของ Opus

175
00:13:20,047 --> 00:13:24,557
4.8 ดังนั้นก็ไม่รู้ว่าจะถือว่ามันดีกว่าที่เราเพิ่งเห็นไหม

176
00:13:24,557 --> 00:13:31,362
ส่วนตัวผมไม่ขอรับรองนะว่า K3 จะดีกว่านะครับ เพราะเวอร์ชันใหม่นี่รู้สึกว่าจะครบครันกว่า

177
00:13:31,362 --> 00:13:35,872
มี texture ใช้เยอะกว่าด้วย แบบนี้น่ะครับ ทีนี้ส่วนสุดท้าย

178
00:13:35,872 --> 00:13:40,857
เรามาอยู่ในแอป desktop กันบ้าง ผมอยากลองอันนี้เพราะอยากทดสอบกับ

179
00:13:40,857 --> 00:13:44,655
sub-agent พวกเขาบอกว่า Kimi K3 เป็น orchestrator

180
00:13:44,655 --> 00:13:49,165
model ที่ดีมาก ผมเลยอยากให้มันเป็นฝ่ายประสานงานที่ต้องใช้

181
00:13:49,165 --> 00:13:53,043
sub-agent ดูสิว่ามันจะสังเคราะห์ข้อมูลได้ดีแค่ไหน

182
00:13:53,043 --> 00:13:57,157
นี่คืองานที่ให้ครับ ผมบอกว่า "Spawn three sub-agents

183
00:13:57,157 --> 00:14:00,876
เพื่อทำวิจัยเกี่ยวกับหัวข้อดังต่อไปนี้ — หนึ่ง:

184
00:14:00,876 --> 00:14:04,991
agent memory, สอง: agent tool use, สาม: agent skills

185
00:14:04,991 --> 00:14:10,292
จากนั้นให้สังเคราะห์ข้อมูลจาก sub-agent ทั้งสามเป็นรายงานที่เข้ากัน

186
00:14:10,292 --> 00:14:14,881
โดยให้หา 5 paper ที่สำคัญที่สุดจัดอันดับตามความน่าเชื่อถือ

187
00:14:14,881 --> 00:14:19,787
ความใหม่ และผลกระทบต่อสายงาน agent" มาดูกันว่ามันจะจัดการบทบาท

188
00:14:19,787 --> 00:14:26,592
orchestrator นี้ได้ดีแค่ไหน ผมทำในแอป desktop เพราะเราน่าจะเห็นการทำงานแบบเรียลไทม์ได้

189
00:14:26,592 --> 00:14:30,549
มันจะโหลด research skill ขึ้นมาก่อนเพื่อเป็นแนวทาง

190
00:14:30,549 --> 00:14:36,641
workflow ที่เหมาะสม จากนั้นจะเรียก sub-agent ทั้งสามตัวขึ้นมาทำงานควบคู่กันไป

191
00:14:36,641 --> 00:14:41,468
(parallel) เราจะได้เห็นพวกมันทำงานอยู่ตรงนี้ ซึ่งแน่นอนว่าใช้

192
00:14:41,468 --> 00:14:45,345
delegate task เป็นเครื่องมือ มาดูกัน เรามี worker

193
00:14:45,345 --> 00:14:49,934
สามตัวแล้ว นี่คือเป้าหมายที่ orchestrator มอบหมายให้พวกมัน

194
00:14:49,934 --> 00:14:54,128
จะเห็นว่ามันให้ context ที่ละเอียดมาก อย่างเช่นเรื่อง

195
00:14:54,128 --> 00:14:58,084
agent tool use จะเห็นว่ามันระบุชัดเจนมากว่าต้องการ

196
00:14:58,084 --> 00:15:01,883
paper เกี่ยวกับ tool learning, function calling,

197
00:15:01,883 --> 00:15:06,314
MCP, และ tool use benchmark มันให้คำสั่งที่เข้มงวดมากว่า

198
00:15:06,314 --> 00:15:11,457
"ห้ามแต่ง paper หรือไอเดียขึ้นมมาเด็ดขาด" ซึ่งสำคัญมากใช่มั้ยครับ

199
00:15:11,457 --> 00:15:15,413
ทีนี้ถือว่าเริ่มต้นได้ดี มาดูกันว่าจะได้อะไรกลับมา

200
00:15:15,413 --> 00:15:20,161
โอเค กำลังทำงานอยู่ครับ sub-agent ทั้งหมดเพิ่งทำงานเสร็จแล้ว

201
00:15:20,161 --> 00:15:25,146
ตอนนี้มันจะรีวิวสิ่งที่ได้กลับมา จะเห็นว่ามันกำลังคิดอยู่ตรงนี้

202
00:15:25,146 --> 00:15:29,577
ได้ paper กลับมาประมาณแปดเรื่องจากแต่ละตัว เจ็ดเรื่องจาก

203
00:15:29,577 --> 00:15:33,612
agent skills ตอนนี้มันจะสังเคราะห์และคัดเลือก paper

204
00:15:33,612 --> 00:15:39,072
ที่น่าสนใจที่สุด 5 เรื่องออกมา น่าสนใกมากที่ได้เห็นกระบวนการคิดของมัน

205
00:15:39,072 --> 00:15:42,791
จัดอันดับโดยความน่าเชื่อถือ ความใหม่ และผลกระทบ

206
00:15:42,791 --> 00:15:47,697
น่าสนใจมากครับ ทีนี้มันกำลัง spot check เรื่องที่ติดอันดับท็อป

207
00:15:47,697 --> 00:15:53,552
5 อยู่ เพราะจากที่มันคิดไว้ มันบอกว่าไม่สามารถยืนยันหรือไม่ไว้วางใจสิ่งที่

208
00:15:53,552 --> 00:16:00,357
sub-agent รายงานมาได้เท่าที่ควร และคิดว่าค่อนข้างคุ้มค่าที่จะยืนยันข้อเท็จจริงสำคัญของ

209
00:16:00,357 --> 00:16:07,478
5 paper ที่มันเลือกไว้ ดังนั้นมันกำลังทำงานเพิ่มเติมและคิดทบทวนกระบวนการนี้อย่างรอบคอบขึ้น

210
00:16:07,478 --> 00:16:12,068
และนี่ยังเป็นการคิดแค่ระดับ medium thinking เท่านั้นนะครับ

211
00:16:12,068 --> 00:16:16,261
โอเค มันยืนยันความถูกต้องของ top 5 ที่คัดเลือกไว้แล้ว

212
00:16:16,261 --> 00:16:22,671
เป็น paper จริงทั้งหมด ข้อมูลตรงกันหมด นี่คือรายงานสังเคราะห์ที่มันเขียนให้ผมครับ

213
00:16:22,671 --> 00:16:26,627
อันดับหนึ่งคือ OSWorld computer use agents on long

214
00:16:26,627 --> 00:16:30,583
horizon real world tasks อันดับสองคือ agent memory

215
00:16:30,583 --> 00:16:34,777
characterization and system implications จาก Stanford

216
00:16:34,777 --> 00:16:38,971
ต่อมาคือ MR agent skill composer และจากนั้นคือ reward

217
00:16:38,971 --> 00:16:43,560
hacking benchmark มันทำหน้าที่สังเคราะห์ข้อมูลได้ดีมากครับ

218
00:16:43,560 --> 00:16:47,358
มันให้คะแนนด้วย ให้เหตุผลประกอบด้วย มีสรุปสั้น ๆ

219
00:16:47,358 --> 00:16:52,739
ที่เขียนขึ้นมาสวยงามสำหรับแต่ละเรื่อง และมีส่วนวิเคราะห์แนวโน้มระดับ

220
00:16:52,739 --> 00:16:57,011
field (field-level trends) ที่สอดคล้องกันทั้งสามสายงาน

221
00:16:57,011 --> 00:17:00,889
เช่น "Evaluation shifted from 'can it' to 'should

222
00:17:00,889 --> 00:17:05,241
it'" (การประเมินเปลี่ยนจาก 'ทำได้ไหม' เป็น 'ควรทำไหม'),

223
00:17:05,241 --> 00:17:10,067
"Memory is becoming infrastructure" (หน่วยความจำกำลังกลายเป็น

224
00:17:10,067 --> 00:17:13,945
infrastructure), และ "Scale research is answering

225
00:17:13,945 --> 00:17:18,771
its skeptics" (งานวิจัยด้าน scale กำลังตอบโต้ผู้สงสัยได้แล้ว)

226
00:17:18,771 --> 00:17:23,677
มันจัดการงานนี้ได้ดีมากครับ ไม่มีปัญหาอะไร และค่อนข้างเร็วด้วย

227
00:17:23,677 --> 00:17:27,475
ใช้เวลาไม่ถึง 10 นาทีทั้งหมด ถือว่าทำหน้าที่เป็น

228
00:17:27,475 --> 00:17:31,669
orchestrator agent ได้ดีมากครับ การทดสอบต่อไปคงจะเป็น

229
00:17:31,669 --> 00:17:36,416
multi-agent workflow ที่ซับซ้อนกว่านี้ แต่สำหรับงานวิจัยง่าย

230
00:17:36,416 --> 00:17:40,294
ๆ แบบนี้ ผมว่าทำได้ดีมากครับ นี่แหละครับคือ First

231
00:17:40,294 --> 00:17:44,171
Look ของ Kimi K3 — เป็นโมเดลที่สำคัญมาก เป็น open

232
00:17:44,171 --> 00:17:49,156
weights model ที่ใหญ่ที่สุดที่เราเคยมีมา และเป็นโมเดลที่ทำคะแนน

233
00:17:49,156 --> 00:17:55,090
benchmark ได้ดีที่สุดด้วย ผมก็เลยอยากรู้เหมือนกันว่าเมื่อไหร่ที่พวกเขาปล่อย

234
00:17:55,090 --> 00:17:59,205
weights ออกมาจริง ๆ เราจะเก็บเกี่ยวข้อมูลอะไรได้บ้าง

235
00:17:59,205 --> 00:18:05,535
แต่จากความประทับใจแรก ถือว่าดีมากครับ ถึงแม้ว่าจะรู้สึกได้ว่ามันอยู่ในระดับโมเดล

236
00:18:05,535 --> 00:18:12,340
frontier ท็อปในแง่ของประสิทธิภาพจริง แต่ผมก็ต้องใช้งานมันเพิ่มเติมอีกจึงจะรู้ได้แน่ชัด

237
00:18:12,340 --> 00:18:16,929
แต่สำหรับคลิปนี้คงมีแค่นี้ก่อนนะครับ ฝากคอมเมนต์ด้วยนะครับ

238
00:18:16,929 --> 00:18:21,281
บอกผมได้เลยว่าประสบการณ์ของคุณกับ Kimi K3 เป็นยังไงบ้าง

239
00:18:21,281 --> 00:18:25,000
แล้วเจอกันใหม่ในคลิปหน้าครับ ขอบคุณที่รับชมครับ