First Look at Kimi K3: The Biggest, Smartest Open Weights Model Ever?
สรุปย่อ
ประเด็นสำคัญจากวิดีโอ
- **ช่อง:** Tonbi's AI Garage · **ความยาว:** ~18.5 นาที · **ลิงก์:** https://www.youtube.com/watch?v=Oqk2n3t-CXU
# สรุป: First Look at Kimi K3: The Biggest, Smartest Open Weights Model Ever? - **ช่อง:** Tonbi's AI Garage · **ความยาว:** ~18.5 นาที · **ลิงก์:** https://www.youtube.com/watch?v=Oqk2n3t-CXU ## ประเด็นหลัก - **Moonshot AI ปล่อย Kimi K3** — โมเดล open weights ระดับ 2.8 ล้านล้านพารามิเตอร์ (2.8T) ถือเป็นโมเดล open ระดับสามล้านล้านพารามิเตอร์ตัวแรกของโลก - **สเปคเด่น:** context window 1 ล้านโทเคน, สถาปัตยกรรม attention ใหม่ (Kimi Delta Attention + attention residuals + stable lean MoE ที่มี 896 expert แต่ active เพียง 16 ต่อ token) - **ประสิทธิภาพ scaling** ดีกว่า K2 ประมาณ 2.5 เท่า — คำกล่าวอ้างเรื่อง efficiency สำคัญกว่าขนาดพารามิเตอร์ - **ราคา:** $3 input (cache miss) / $15 output — ใกล้เคียง GPT-5.6 Terra ระดับกลางของ OpenAI ถือว่าแพงแต่เป็น open weights - **Benchmark:** อยู่ใกล้ด้านบนใน coding/agent benchmark แม้แพ้ Fable และ GPT-5.6 Sol ในบางตัว แต่บางหมวดก็นำ — cost efficiency ดีกว่าคู่แข่งชัดเจน - **การทดสอบที่ 1 — Front-end coding:** prompt เดิม (One Piece × Star Wars) K3 ทำได้ดีกว่า K2.6 เดิมอย่างชัดเจน — ทรงกลม 3D สมจริงขึ้น, แอนิเมชันครบ, ขัดเกลากว่า - **การทดสอบที่ 2 — Procedural 3D open world:** สร้างเมืองแฟนตาซี 3D ใน Three.js ได้สวยงาม มีระบบคลิก, texture, แสง ครบ — เทียบได้กับหรือดีกว่าของ Opus 4.8 ในแง่ความครบครัน - **การทดสอบที่ 3 — Orchestrator + sub-agents:** spawn sub-agent 3 ตัวทำวิจัย paper, สังเคราะห์เป็น top-5 report — มีการ spot-check ความถูกต้องของ paper เอง, ทำงานเสร็จใน <10 นาที, ทำหน้าที่ orchestrator ได้ดี - **จุดอ่อน:** ยังเป็นรอง Claude 5 และ GPT-5.6 Sol ในภาพรวม, ด้อยกว่าในบาง reasoning/multimodal test — Moonshot เองก็ยอมรับ - **ข้อจำกัด:** แม้เป็น open weights ก็ไม่สามารถรันบนเครื่องส่วนบุคคลได้ เนื่องจากขนาดใหญ่เกินไป - **เป้าหมายการออกแบบ:** เน้นงาน long-horizon ที่รันนานเป็นชั่วโมงหรือวัน, รับผิดชอบโปรเจกต์ยากทั้งโปรเจกต์โดยแทบไม่ต้องกำกับ ## ความเห็นสรุป Kimi K3 เป็นโมเดล open weights ที่สำคัญที่สุดตัวหนึ่งของปี — ไม่ใช่แค่เรื่องขนาด แต่เป็นการผสมผสานระหว่างสถาปัตยกรรม attention แบบใหม่, context window ยักษ์ และการออกแบบเพื่องาน long-horizon แม้จะยังเป็นรองโมเดลปิดท็อปอยู่บ้าง แต่ผลลัพธ์ benchmark และการทดสอบจริงทั้งสามงานแสดงให้เห็นว่ามันเข้าใกล้โมเดลท็อปมากขึ้นเรื่อย ๆ ครับ
คำแปลเต็ม
แปลตามบทสนทนาต้นฉบับ ปรับเป็นภาษาไทยธรรมชาติ
Moonshot AI เพิ่งปล่อย Kimi K3 ออกมา โดยเรียกมันว่า open frontier intelligence ตัวนี้จะเป็นโมเดลแบบ open weights และเป็น flagship model ล่าสุดในสายผลิตภัณฑ์ Kimi ที่ได้รับความนิยมมากครับ หลายคนน่าจะจำได้ว่าผมเคยรีวิว Kimi K2.6 ไปแล้ว และตอนนั้นมันทำผลงานได้ดีมากสำหรับโมเดล open weights ครับ ผมเลยค่อนข้างตื่นเต้นที่จะเห็นว่า Kimi K3 จะทำได้แค่ไหน
เราจะเริ่มจากการลองให้มันทำงานเปิดตัวสักงานก่อนเลย แล้วค่อยกลับมาเล่าให้ฟังถึงสเปคทางเทคนิค พร้อมกับ benchmark ต่าง ๆ แล้วค่อยให้มันทำงานเพิ่มอีกสองสามชิ้นในช่วงท้าย แต่ผมว่าเรามาเริ่มลองเล่นของจริงกันก่อนดีกว่า จะได้ไม่ต้องมานั่งดูสไลด์กันก่อนนะครับ
พอดีเห็น Hermes กำลัง update อยู่เบื้องหลัง แต่นี่คือ prompt ที่เราจะให้ และเป็น prompt ที่หลายคนเคยเห็นมาแล้วหลายครั้งแล้วครับ prompt คือให้สร้างไฟล์ HTML ไฟล์เดียวสำหรับเกม One Piece meets Star Wars โดยมี hero section แบบเต็มจอ พื้นหลังสีเข้ม มีทรงกลม 3D หมุนอยู่ใน Three.js พร้อม GLSL fragment shader แบบกำหนดเอง ทำให้มันดูเหมือนดาวเคราะห์ที่เรืองแสง ทรงกลมจะค่อย ๆ หมุนรอบแกน Y เมื่อ scroll ลง GSAP จะเล่นแอนิเมชันให้ทรงกลมเล็กลงและจางหายไป พร้อมกับให้ headline ค่อย ๆ โผล่ขึ้นมาแบบ stagger entrance ของ framer-motion ทำงานบน Chrome ไม่ต้องใช้ NPM ใช้ CDN imports เท่านั้นครับ
หลายคนอาจจำได้ว่านี่คือผลงานที่ Kimi K2.6 ทำได้ตอนนั้น ซึ่งดูดีมาก และในเวลานั้นมันเป็นผลงานที่ดีที่สุดจาก prompt นี้เลย ตอนนั้น Fable ยังไม่ได้ออกมาทำได้ดีกว่า และล่าสุด ChatGPT 5.6 Sol ก็ทำได้ดีเช่นกัน แต่ตอนที่ปล่อยครั้งแรกมันทำได้ดีมากจริง ๆ โดยที่โมเดล frontier ตัวอื่น ๆ ในยุคนั้นทำไม่ได้ เช่น Opus หรือ GPT รุ่นตอนนั้นก็ทำไม่ได้ครับ
แต่มาดูกันว่า Kimi K3 จะทำยังไงกับ prompt นี้ สักสองสามเดือนก่อน prompt นี้ถือว่ายากมาก แต่โมเดลรุ่นใหม่ ๆ ส่วนใหญ่ก็เริ่มทำได้ดีแล้ว ผมอาจจะต้องหา prompt ที่ยากกว่านี้มาใช้แล้วล่ะ ถ้าโมเดลทุกตัวเริ่มจัดการ prompt นี้ได้หมดแล้ว
ทีนี้เรามาเลือกโมเดลกัน เลื่อนลงไปที่ Moonshot Kimi K3 ในพอร์ทัลใหม่ สังเกตราคาได้เลยครับ ตอนนี้อยู่ที่ $3 สำหรับ input และ $15 สำหรับ output ซึ่งถือว่าอยู่ในระดับใกล้เคียงกับ GPT-5.6 Terra ของ OpenAI คือเป็นโมเดลระดับกลางของ OpenAI ดังนั้นมันไม่ใช่ของถูกเลยนะครับ แพงอยู่ แต่ก็เป็น open weights ด้วยเช่นกัน และพร้อมใช้งานแล้วตอนนี้
ทีนี้มาที่หน้าแชทของ Hermes กันบ้าง ผมจะวาง prompt นี้ลงไปเลยนะครับ โอเค คุณจะเห็น Kimi K3 อยู่ตรงนี้ นี่คือสิ่งที่ได้กลับมา เห็นชื่อว่า Grandline Prime ขนานนามว่า One Piece Star Wars Outer Rim
ตัวทรงกลมเองดูดีมากครับ นี่เป็นหนึ่งในเวอร์ชันที่ดีกว่าเดิมเยอะเลย ดูมีความสมจริงมากขึ้น ดูคล้ายโลกเลย เหมือนมีเมฆลอยอยู่ข้างใต้ ทำได้ดีมากจริง ๆ สำหรับตัวทรงกลม ทีนี้ลอง scroll ลงไปดูกัน นี่คือบททดสอบของจริง มันค่อย ๆ เล็กลง ค่อย ๆ จางหายไป สวยงามมาก และก็มี stagger entrance ของ headline ขึ้นมาพอดี "Set sail for the stars, become the pirate king of the galaxy" — ออกเดินทางสู่ดวงดาว กลายเป็นราชาโจรสลัดแห่งกาแล็กซี ผมว่ามันทำได้ดีมากครับ ทางสายตาดูดีกว่าที่เวอร์ชันก่อนหน้าทำได้เยอะเลย ดูสะอาดตาและขัดเกลาขึ้นมาก และมันก็ทำครบทุกข้อที่ผมกำหนดไว้ในแง่ของข้อกำหนดทางเทคนิคด้วย ถือว่าเป็นงานที่ดีมากครับ
ผมคงต้องเปลี่ยน prompt ประจำที่ใช้อยู่แล้วล่ะ เพราะโมเดลสองสามตัวล่าสุดทำ prompt นี้ได้ดีมาก ผมคงต้องไปหางาน front-end coding ที่ยากกว่านี้มาลองบ้างแล้ว
โอเค งานแรกเสร็จแล้ว ทีนี้กลับมาคุยเรื่องตัวโมเดลกันบ้าง Kimi K3 เป็นโมเดลขนาด 2.8 ล้านล้านพารามิเตอร์ (2.8 trillion parameters) เป็นโมเดล open weights ระดับสามล้านล้านพารามิเตอร์ตัวแรกที่ถูกปล่อยออกมา มี context window 1 ล้านโทเคน ซึ่งเพิ่งเห็นกันไปแล้ว และมีสถาปัตยกรรมใหม่ที่ออกแบบมาเพื่อการทำงานด้าน coding research และงานความรู้ที่ต้องรันนาน ๆ โดยเฉพาะ
แต่กรอบความจริงก็สำคัญนะครับ Moonshot ไม่ได้กล่าวอ้างว่า K3 จะเอาชนะโมเดลปิดทุกตัว ในประกาศของบริษัทเองก็บอกตรง ๆ ว่า K3 ยังเป็นรอง Claude 5 และ GPT 5.6 Sol ในภาพรวมอยู่
คำถามที่น่าสนใจไม่ใช่ว่านี่เป็นโมเดล open ที่ใหญ่ที่สุดหรือไม่ เพราะมันชัดเจนอยู่แล้วว่าใช่ แต่คือคุณไม่สามารถรันโมเดลนี้บนเครื่องท้อคัดได้ แม้จะเป็น open weights แต่มันก็ไม่ใช่เรื่องที่เป็นไปได้ แม้คุณจะมีเครื่องที่ทรงพลังมากพร้อม GPU ของเก่ง ๆ ก็ตาม คำถามจริง ๆ คือ ขนาดที่ใหญ่ขนาดนี้จะแปลงเป็นงานสำเร็จที่ดีกว่าจริงหรือไม่
มาเจาะกันต่อเลย Kimi K3 ไม่ใช่แค่ Kimi K2 ที่เอา expert มาเพิ่มขึ้นเฉย ๆ ส่วนใหม่แรกคือ Kimi Delta Attention หรือเรียกสั้น ๆ ว่า KDA นี่เป็นสถาปัตยกรรม attention แบบประหยัดทรัพยากรของ Kimi สำหรับจัดการ sequence ที่ยาวมาก ๆ โดยไม่ต้องเสียค่าใช้จ่ายของ attention แบบมาตรฐานกับทุก token
จากนั้นก็มี attention residuals แทนที่จะให้แต่ละเลเยอร์สะสมข้อมูลจากเลเยอร์ก่อนหน้าทั้งหมด โมเดลสามารถเลือกดึง representation ที่มีประโยชน์จากความลึกที่แตกต่างกันได้
ภายใต้สิ่งนี้คือ stable lean MoE — K3 มี expert ถึง 896 ตัว แต่มีเพียง 16 ตัวเท่านั้นที่ active ในแต่ละ token นี่คือเหตุผลที่ขนาดโมเดลรวมใหญ่มาก แต่เส้นทางการทำงานจริงยังคง sparse อยู่
Moonshot ระบุว่า การผสมผสานของสถาปัตยกรรม การ routing การ train และข้อมูล ทำให้ scaling efficiency (ประสิทธิภาพการขยายตัว) โดยรวมดีขึ้นประมาณ 2.5 เท่าเมื่อเทียบกับ K2 ดังนั้นคำกล่าวอ้างเรื่องประสิทธิภาพนี้สำคัญกว่าจำนวนพารามิเตอร์เสียอีก เพราะโมเดลยักษ์จะมีประโยชน์ก็ต่อเมื่อคุณสามารถ train และ serve มันได้โดยที่ต้นทุนไม่บานปลาย
จุดขายหลักของ K3 คืองานที่ต้องทำต่อเนื่องยาวนานสามารถทำได้โดยแทบไม่ต้องมีมนุษย์คอยกำกับ Moonshot ระบุว่ามันสามารถอ่าน repository ขนาดใหญ่มาก ๆ ประสานงานกับเครื่องมือ terminal คงสภาพ session งานวิศวกรรม และใช้ screenshot เป็นส่วนหนึ่งของวงจรการเขียนโค้ดได้ คือมันสามารถสร้างบางสิ่งขึ้นมา ดูผลลัพธ์ที่ render แล้วนั้น จากนั้นปรับปรุงมันแทนที่จะหยุดแค่ตอนเขียน source code เสร็จ
พวกเขายังทดสอบ GPU kernel optimization โดยให้รันต่อหนึ่งครั้งได้นานถึง 24 ชั่วโมงเลยทีเดียว ในช่วงพัฒนา K3 เอง เวอร์ชันแรก ๆ มีรายงานว่ารับผิดชอบงาน kernel optimization ของทีมได้เกือบทั้งหมด
จะเห็นแนวโน้มกว้างขึ้นที่ครอบคลุมทั้งการปล่อยตัวนี้ — คือเน้นการ "รับผิดชอบโปรเจกต์ที่ยากทั้งโปรเจกต์แล้วรันต่อเนื่องจนจบ" พวกเขาพูดถึง case study สุดมหัศจรรย์หลายตัว ผมจะไม่ลงรายละเอียดทั้งหมดนะครับ สามารถไปอ่านเพิ่มเติมได้ที่ tech blog ซึ่งน่าสนใจมาก อย่างเช่นการสร้าง mini Triton GPU compiler, ชิปที่ถูกออกแบบโดยโมเดล, โลก 3D แบบ procedural open world โดยใช้ Three.js และ WebGPU พร้อม asset อื่น ๆ อีกมาก และงาน computational astrophysics โมเดลสามารถทำงานวิจัยและทุกอย่างที่จำเป็นได้ โดยทำงานที่ปกติต้องใช้เวลาสองสัปดาห์ให้เสร็จในสองชั่วโมง
ทีนี้มาดู benchmark กันบ้าง เพราะหลายคนอยากเห็นส่วนนี้แน่นอน ใน blog มีอยู่หลายตัวเลย ดู coding benchmark ได้เลย K3 อยู่ใกล้ด้านบนในเกือบทุกตัวเลย มีสองสามตัวที่แพ้ GPT-5.6 Sol สองสามตัวแพ้ Fable แต่บางตัวก็ขึ้นนำ คือเอาชนะ Sol และ Fable ได้ ซึ่งน่าทึ่งมาก
ส่วน agent benchmark ก็คล้าย ๆ กันครับ แพ้ Fable และ Sol อยู่บางตัว แต่บางตัวก็สูงกว่า เช่น automation bench, browse comp, spreadsheet bench และ visual agent ด้วย อยู่สูงกว่า Sol เล็กน้อย แต่ต่ำกว่า Fable นิดหน่อย ดังนั้นมันไม่ใช่โมเดลที่ดีที่สุดในตลาด แต่ก็ใกล้เคียงกับโมเดลท็อปที่เราเข้าถึงได้มาก และเมื่อพิจารณาว่า Fable 5 ถูกมองว่าเป็นภัยคุกคามระดับชาติที่ต้องกักไม่ให้ประชาชนทั่วไปเข้าถึง สิ่งที่ K3 ทำได้ถือว่าน่าทึ่งมากครับ
และอย่างที่เห็นตรงนี้ cost efficiency ก็เป็นปัจจัยสำคัญเช่นกัน ค่าใช้จ่ายต่องาน K3 ที่ทำเครื่องหมายดาวแดงไว้ตรงนี้ จะเห็นว่ามันมีประสิทธิภาพเรื่องต้นทุนดีกว่าอย่างชัดเจน
ดังนั้นนี่คือมุมมองตรงไปตรงมาของผม — K3 ดูแข็งแกร่งมากในแง่ของ benchmark ครับ
ความสำเร็จใหญ่ ๆ ใน coding benchmark และ agent benchmark, ผลลัพธ์ด้าน spreadsheet และ document understanding ที่แข็งแกร่ง, การเขียนโค้ดด้าน visual และ long context ล้วนเป็นความสามารถหลักที่มีประโยชน์มาก แต่อาจจะไม่แข็งแกร่งมากนักในงาน software engineering ที่ยากจริง ๆ ส่วน GPT 5.6 ยังนำอยู่ในการทดสอบ reasoning และ multimodal หลายตัว ซึ่ง Moonshot เองก็ยอมรับว่ามีช่องว่างด้าน UX เมื่อเทียบกับโมเดลท็อปเหล่านี้ แต่ถึงกระนั้นก็ถือว่าน่าประทับใจมากครับ
อย่างที่ผมพูดไปก่อนหน้านี้ เรื่องราคาและการเข้าถึง — อยู่ที่ 30 เซนต์สำหรับ cache hit input, $3 สำหรับ cache miss input ปกติ และ $15 สำหรับ output อย่างที่บอก ราคาใกล้เคียงกับ GPT 5.6 Terra ซึ่งเป็นรุ่นระดับกลางของ OpenAI นี่คือข้อเท็จจริงของตัวโมเดลเอง
สรุปแล้ว Kimi K3 ไม่ได้เป็นโมเดลที่ดีที่สุดโดยอัตโนมัติเพียงเพราะมีพารามิเตอร์มากที่สุด สิ่งที่ทำให้มันน่าสนใจจริง ๆ คือการผสมผสานระหว่างการเป็นโมเดล open ระดับสามล้านล้านพารามิเตอร์, context window หนึ่งล้านโทเคน, และสถาปัตยกรรม attention ที่เป็นนวัตกรรมใหม่จริง ๆ พร้อมความสามารถ multimodal แบบ native และการโฟกัสไปที่งานที่สามารถรันได้นานเป็นชั่วโมงหรือเป็นวัน
เราทำงานไปแล้วหนึ่งงาน ทีนี้มาทำอีกงานกันบ้างครับ งานต่อไปที่ผมจะให้จะเป็นงานที่อิงจากสิ่งที่เราเห็นในสไลด์นั่นแหละครับ นั่นคือ procedural 3D open world ผมอยากลองให้สร้าง open world ขึ้นมาดู เพราะก่อนหน้านี้ผมเคยให้ Opus และ GLM 5.2 ทำงานนี้ โดยให้สร้าง open world ใน Three.js โดยใช้ asset พื้นฐานบางตัว
ผมมี prompt อยู่ โดยระบุว่า "คุณอยู่ใน directory เปล่า วัสดุเพียงอย่างเดียวที่ให้คือโฟลเดอร์ assets ที่มี fantasy และ game assets" ซึ่งก็คือพวกนี้เลยครับ มีบางอย่าง — คุณอาจจะอ่านไม่ออก แต่พวกนี้เป็นไฟล์ Three.js และรูปอ้างอิงบางส่วน ซึ่งเดิมทีเป็นของสำหรับเกม One Piece ที่ผมพยายามจะทำอยู่ และน่าจะเป็นส่วนที่มีประโยชน์มากที่สุดสำหรับโมเดล เพราะมี texture ครบครันที่สามารถเอาไปใช้กับอาคารหรือพื้นดินได้เลย มี asset ให้ใช้ได้เพียบเลยครับ
ก็คือไอเดียคือให้สร้างโลกแฟนตาซี 3D ขึ้นมาโดยใช้ Three.js เป็นหลัก โดยมีข้อกำหนดอยู่สองสามข้อด้วยกัน — ระบบควบคุมการเคลื่อนไหว, จุดสนใจ (points of interest) สามจุด, องค์ประกอบแอนิเมชันหนึ่งตัว และให้ผู้ใช้สามารถคลิกหรือตรวจสอบวัตถุได้อย่างน้อยหนึ่งชิ้น นี่คือ prompt ที่ผมจะให้มัน เรามาดูกันว่าจะสร้างอะไรได้บ้างและจะดีกว่าของ Opus 4.8 และ GLM 5.2 หรือเปล่า
โอเค อีกครั้งใน Hermes นะครับ ผมจะวาง prompt ลงไป ตอนนี้เราอยู่ใน directory ที่ถูกต้องแล้ว เป็น directory เปล่ายกเว้นโฟลเดอร์ assets นั่นแหละ มาดูกันว่ามันจะทำยังไง
โอเค เสร็จแล้วครับ ใช้เวลาประมาณ 7 นาทีทั้งหมด ผมมีปัญหาเรื่องการเชื่อมต่ออยู่บ้าง คิดว่าน่าจะมีคนใช้งานเยอะมากวันนี้ แต่ก็ทำเสร็จได้ มาดูกันว่าได้อะไรกลับมาบ้าง
โอเค มาดูกันเลย Amber Fallvale คลิกเพื่อเข้าสู่เกม หน้าตาดูดีมากครับ นี่คือเมืองแฟนตาซีเล็ก ๆ ของเรา ทำ texture ได้ดีมากเลย มีบ่อน้ำอยู่ด้วย ผมคลิกดู — "The old well" บ่อน้ำโบราณ ชื่อไม่ค่อยสร้างสรรค์เท่าไหร่ แต่เอาเป็นว่ามาดูต่อกัน — "The fallen star crystal" คริสตัลดวงดาวตก แล้วนี่ใครนะ — "The hooded adventurer" นักผจญภัยหน้ากาก น่าสนใจดีครับ ทำแสงได้ดีมาก ชอบเอฟเฟกต์แสงนี้เลย รู้ว่าดูเหมือนจะไม่ใช่อะไรมาก แต่ว่ามันดีมาก แสงมาจากดวงอาทิตย์ การที่มันถ่วงลักษณะแสงออกมาได้ขนาดนี้ถือว่าดีมากครับ ดูดีเลย มีปราสาทเล็ก ๆ อยู่ตรงนี้ด้วย สำหรับการทำแบบ one-shot ถือว่าทำได้ดีมากครับ แน่นอน ถ้าจะสร้างโลก 3D จริงจัง ก็สามารถขัดเกลาเพิ่มเติมได้ แต่มันมีครบทุกองค์ประกอบที่ผมกำหนดไว้ คลิกที่อะไรก็ได้แล้วมันจะบอกชื่อให้ ก็มีครบแล้วครับ
และถ้าใครจำไม่ได้ นี่คือเวอร์ชันที่ Opus 4.8 ทำไว้ มีตัวละครมากกว่า แต่ไม่รู้สิ ผมรู้สึกว่าบ้านไม่ค่อยสวยเท่า ส่วนน้ำนี่ทำได้ดีกว่า แต่นี่คือเวอร์ชันของ Opus 4.8 ดังนั้นก็ไม่รู้ว่าจะถือว่ามันดีกว่าที่เราเพิ่งเห็นไหม ส่วนตัวผมไม่ขอรับรองนะว่า K3 จะดีกว่านะครับ เพราะเวอร์ชันใหม่นี่รู้สึกว่าจะครบครันกว่า มี texture ใช้เยอะกว่าด้วย แบบนี้น่ะครับ
ทีนี้ส่วนสุดท้าย เรามาอยู่ในแอป desktop กันบ้าง ผมอยากลองอันนี้เพราะอยากทดสอบกับ sub-agent พวกเขาบอกว่า Kimi K3 เป็น orchestrator model ที่ดีมาก ผมเลยอยากให้มันเป็นฝ่ายประสานงานที่ต้องใช้ sub-agent ดูสิว่ามันจะสังเคราะห์ข้อมูลได้ดีแค่ไหน
นี่คืองานที่ให้ครับ ผมบอกว่า "Spawn three sub-agents เพื่อทำวิจัยเกี่ยวกับหัวข้อดังต่อไปนี้ — หนึ่ง: agent memory, สอง: agent tool use, สาม: agent skills จากนั้นให้สังเคราะห์ข้อมูลจาก sub-agent ทั้งสามเป็นรายงานที่เข้ากัน โดยให้หา 5 paper ที่สำคัญที่สุดจัดอันดับตามความน่าเชื่อถือ ความใหม่ และผลกระทบต่อสายงาน agent"
มาดูกันว่ามันจะจัดการบทบาท orchestrator นี้ได้ดีแค่ไหน ผมทำในแอป desktop เพราะเราน่าจะเห็นการทำงานแบบเรียลไทม์ได้ มันจะโหลด research skill ขึ้นมาก่อนเพื่อเป็นแนวทาง workflow ที่เหมาะสม จากนั้นจะเรียก sub-agent ทั้งสามตัวขึ้นมาทำงานควบคู่กันไป (parallel) เราจะได้เห็นพวกมันทำงานอยู่ตรงนี้ ซึ่งแน่นอนว่าใช้ delegate task เป็นเครื่องมือ
มาดูกัน เรามี worker สามตัวแล้ว นี่คือเป้าหมายที่ orchestrator มอบหมายให้พวกมัน จะเห็นว่ามันให้ context ที่ละเอียดมาก อย่างเช่นเรื่อง agent tool use จะเห็นว่ามันระบุชัดเจนมากว่าต้องการ paper เกี่ยวกับ tool learning, function calling, MCP, และ tool use benchmark มันให้คำสั่งที่เข้มงวดมากว่า "ห้ามแต่ง paper หรือไอเดียขึ้นมมาเด็ดขาด" ซึ่งสำคัญมากใช่มั้ยครับ
ทีนี้ถือว่าเริ่มต้นได้ดี มาดูกันว่าจะได้อะไรกลับมา โอเค กำลังทำงานอยู่ครับ sub-agent ทั้งหมดเพิ่งทำงานเสร็จแล้ว ตอนนี้มันจะรีวิวสิ่งที่ได้กลับมา จะเห็นว่ามันกำลังคิดอยู่ตรงนี้ ได้ paper กลับมาประมาณแปดเรื่องจากแต่ละตัว เจ็ดเรื่องจาก agent skills ตอนนี้มันจะสังเคราะห์และคัดเลือก paper ที่น่าสนใจที่สุด 5 เรื่องออกมา
น่าสนใกมากที่ได้เห็นกระบวนการคิดของมัน จัดอันดับโดยความน่าเชื่อถือ ความใหม่ และผลกระทบ น่าสนใจมากครับ ทีนี้มันกำลัง spot check เรื่องที่ติดอันดับท็อป 5 อยู่ เพราะจากที่มันคิดไว้ มันบอกว่าไม่สามารถยืนยันหรือไม่ไว้วางใจสิ่งที่ sub-agent รายงานมาได้เท่าที่ควร และคิดว่าค่อนข้างคุ้มค่าที่จะยืนยันข้อเท็จจริงสำคัญของ 5 paper ที่มันเลือกไว้ ดังนั้นมันกำลังทำงานเพิ่มเติมและคิดทบทวนกระบวนการนี้อย่างรอบคอบขึ้น และนี่ยังเป็นการคิดแค่ระดับ medium thinking เท่านั้นนะครับ
โอเค มันยืนยันความถูกต้องของ top 5 ที่คัดเลือกไว้แล้ว เป็น paper จริงทั้งหมด ข้อมูลตรงกันหมด นี่คือรายงานสังเคราะห์ที่มันเขียนให้ผมครับ อันดับหนึ่งคือ OSWorld computer use agents on long horizon real world tasks อันดับสองคือ agent memory characterization and system implications จาก Stanford ต่อมาคือ MR agent skill composer และจากนั้นคือ reward hacking benchmark
มันทำหน้าที่สังเคราะห์ข้อมูลได้ดีมากครับ มันให้คะแนนด้วย ให้เหตุผลประกอบด้วย มีสรุปสั้น ๆ ที่เขียนขึ้นมาสวยงามสำหรับแต่ละเรื่อง และมีส่วนวิเคราะห์แนวโน้มระดับ field (field-level trends) ที่สอดคล้องกันทั้งสามสายงาน เช่น "Evaluation shifted from 'can it' to 'should it'" (การประเมินเปลี่ยนจาก 'ทำได้ไหม' เป็น 'ควรทำไหม'), "Memory is becoming infrastructure" (หน่วยความจำกำลังกลายเป็น infrastructure), และ "Scale research is answering its skeptics" (งานวิจัยด้าน scale กำลังตอบโต้ผู้สงสัยได้แล้ว)
มันจัดการงานนี้ได้ดีมากครับ ไม่มีปัญหาอะไร และค่อนข้างเร็วด้วย ใช้เวลาไม่ถึง 10 นาทีทั้งหมด ถือว่าทำหน้าที่เป็น orchestrator agent ได้ดีมากครับ การทดสอบต่อไปคงจะเป็น multi-agent workflow ที่ซับซ้อนกว่านี้ แต่สำหรับงานวิจัยง่าย ๆ แบบนี้ ผมว่าทำได้ดีมากครับ
นี่แหละครับคือ First Look ของ Kimi K3 — เป็นโมเดลที่สำคัญมาก เป็น open weights model ที่ใหญ่ที่สุดที่เราเคยมีมา และเป็นโมเดลที่ทำคะแนน benchmark ได้ดีที่สุดด้วย ผมก็เลยอยากรู้เหมือนกันว่าเมื่อไหร่ที่พวกเขาปล่อย weights ออกมาจริง ๆ เราจะเก็บเกี่ยวข้อมูลอะไรได้บ้าง แต่จากความประทับใจแรก ถือว่าดีมากครับ
ถึงแม้ว่าจะรู้สึกได้ว่ามันอยู่ในระดับโมเดล frontier ท็อปในแง่ของประสิทธิภาพจริง แต่ผมก็ต้องใช้งานมันเพิ่มเติมอีกจึงจะรู้ได้แน่ชัด แต่สำหรับคลิปนี้คงมีแค่นี้ก่อนนะครับ ฝากคอมเมนต์ด้วยนะครับ บอกผมได้เลยว่าประสบการณ์ของคุณกับ Kimi K3 เป็นยังไงบ้าง แล้วเจอกันใหม่ในคลิปหน้าครับ ขอบคุณที่รับชมครับ
หมายเหตุการแปล
ความโปร่งใสเกี่ยวกับความไม่แน่นอนในต้นฉบับ
- ## ส่วนที่ฟังไม่ชัด
- ไม่มี — ไม่มี `[ฟังไม่ชัด]` ใด ๆ ในคำแปล
อภิธานศัพท์เทคนิค
คำศัพท์และชื่อผลิตภัณฑ์ที่คงรูปภาษาอังกฤษ
| ศัพท์ | คำแปล / คำอธิบาย |
|---|---|
| Kimi K3 | โมเดล flagship ตัวใหม่ล่าสุดของ Moonshot AI เป็น open weights model |
| Moonshot AI | บริษัทผูพัฒนาโมเดล Kimi |
| open weights | โมเดลที่ปล่อยน้ำหนัก (weights) ให้ใช้งานได้แบบเปิด |
| open frontier intelligence | คำกล่าวอ้างของ Moonshot สำหรับ Kimi K3 หมายถึง open weights ระดับ frontier |
| flagship model | โมเดลธงรุ่นหลักของสายผลิตภัณฑ์ |
| Hermes / Hermes Agent | แพลตฟอร์ม AI agent ที่โฮสต์ใช้ทดสอบโมเดลในคลิป |
| sub-agent | agent ย่อยที่ถูกเรียกโดย orchestrator |
| orchestrator | โมเดลหลักที่ทำหน้าที่ประสานงาน agent อื่น ๆ |
| parameter | พารามิเตอร์ — หน่วยนับขนาดของโมเดล (K3 = 2.8 ล้านล้าน) |
| context window | หน้าต่างบริบท — จำนวน token ที่โมเดลรับได้ในครั้งเดียว (K3 = 1 ล้าน) |
| 2.8 trillion parameters | 2.8 ล้านล้านพารามิเตอร์ |
| token | หน่วยย่อยของข้อความที่โมเดลประมวลผล |
| Kimi Delta Attention (KDA) | สถาปัตยกรรม attention แบบประหยัดสำหรับ sequence ยาว ๆ ของ Kimi |
| attention residuals | กลไกที่ให้แต่ละเลเยอร์เลือกดึง representation จากความลึกต่าง ๆ ได้ |
| stable lean MoE | สถาปัตยกรรม Mixture of Experts แบบ sparse ของ K3 |
| Mixture of Experts (MoE) | เทคนิคที่มี expert หลายตัวแต่เลือก active เพียงส่วนน้อยต่อ token |
| expert | โมดูลย่อยใน MoE ที่รับผิดชอบเฉพาะส่วน (K3 มี 896 ตัว, active 16 ต่อ token) |
| routing | กลไกการเลือก expert ที่จะ active ในแต่ละ token |
| scaling efficiency | ประสิทธิภาพการขยายขนาดโมเดล |
| long-horizon work | งานที่ต้องดำเนินต่อเนื่องยาวนาน (ชั่วโมง–วัน) |
| kernel optimization | การเพิ่มประสิทธิภาพ GPU kernel |
| Three.js | ไลบรารี JavaScript สำหรับสร้างกราฟิก 3D บนเว็บ |
| GLSL fragment shader | โค้ด shader สำหรับควบคุมสี/แสงของพิกเซลใน 3D |
| GSAP | ไลบรารีแอนิเมชัน JavaScript |
| framer-motion | ไลบรารีแอนิเมชันสำหรับ React |
| stagger entrance | แอนิเมชันที่ทยอยโผล่ทีละส่วน |
| NPM / CDN imports | ระบบจัดการแพ็กเกจ / การโหลดไลบรารีผ่าน CDN |
| procedural 3D open world | โลก 3D ที่สร้างขึ้นแบบอัตโนมัติด้วยอัลกอริทึม |
| WebGPU | API กราฟิกสมัยใหม่สำหรับเว็บเบราว์เซอร์ |
| benchmark | การทดสอบเปรียบเทียบประสิทธิภาพโมเดล |
| Fable | โมเดล AI คู่แข่ง (สื่อเรียกว่าเป็นภัยคุกคามระดับชาติ) |
| GPT-5.6 Sol | โมเดล top ของ OpenAI ในเวลานั้น |
| GPT-5.6 Terra | โมเดลระดับกลางของ OpenAI ราคาใกล้เคียง K3 |
| Claude 5 / Opus | โมเดลของ Anthropic ที่เป็นคู่แข่งสำคัญ |
| GLM 5.2 | โมเดล AI คู่แข่งอีกตัวที่โฮสต์เคยทดสอบ |
| multimodal | ความสามารถรับข้อมูลหลายรูปแบบ (ข้อความ ภาพ เสียง) |
| reasoning | ความสามารถในการให้เหตุผล |
| cache hit / cache miss | การเข้าถึง input ที่แคชไว้แล้ว (ถูก) vs. ไม่มีในแคช (พลาด) |
| delegate task | เครื่องมือสั่งงาน sub-agent |
| research skill | skill สำหรับ workflow วิจัยใน Hermes |
| repository | ที่เก็บโค้ด |
| GPU | หน่วยประมวลผลกราฟิก ใช้ train และรันโมเดล AI |
ซับไตเติ้ลภาษาไทย
ดาวน์โหลดหรือดูซับทั้งหมด
1 00:00:00,000 --> 00:00:04,035 Moonshot AI เพิ่งปล่อย Kimi K3 ออกมา โดยเรียกมันว่า 2 00:00:04,035 --> 00:00:07,754 open frontier intelligence ตัวนี้จะเป็นโมเดลแบบ 3 00:00:07,754 --> 00:00:12,185 open weights และเป็น flagship model ล่าสุดในสายผลิตภัณฑ์ 4 00:00:12,185 --> 00:00:16,854 Kimi ที่ได้รับความนิยมมากครับ หลายคนน่าจะจำได้ว่าผมเคยรีวิว
เปิดดูซับไตเติ้ลทั้งหมด (239 segments)
1 00:00:00,000 --> 00:00:04,035 Moonshot AI เพิ่งปล่อย Kimi K3 ออกมา โดยเรียกมันว่า 2 00:00:04,035 --> 00:00:07,754 open frontier intelligence ตัวนี้จะเป็นโมเดลแบบ 3 00:00:07,754 --> 00:00:12,185 open weights และเป็น flagship model ล่าสุดในสายผลิตภัณฑ์ 4 00:00:12,185 --> 00:00:16,854 Kimi ที่ได้รับความนิยมมากครับ หลายคนน่าจะจำได้ว่าผมเคยรีวิว 5 00:00:16,854 --> 00:00:21,285 Kimi K2.6 ไปแล้ว และตอนนั้นมันทำผลงานได้ดีมากสำหรับโมเดล 6 00:00:21,285 --> 00:00:25,320 open weights ครับ ผมเลยค่อนข้างตื่นเต้นที่จะเห็นว่า 7 00:00:25,320 --> 00:00:31,018 Kimi K3 จะทำได้แค่ไหน เราจะเริ่มจากการลองให้มันทำงานเปิดตัวสักงานก่อนเลย 8 00:00:31,018 --> 00:00:34,895 แล้วค่อยกลับมาเล่าให้ฟังถึงสเปคทางเทคนิค พร้อมกับ 9 00:00:34,895 --> 00:00:39,959 benchmark ต่าง ๆ แล้วค่อยให้มันทำงานเพิ่มอีกสองสามชิ้นในช่วงท้าย 10 00:00:39,959 --> 00:00:46,605 แต่ผมว่าเรามาเริ่มลองเล่นของจริงกันก่อนดีกว่า จะได้ไม่ต้องมานั่งดูสไลด์กันก่อนนะครับ 11 00:00:46,605 --> 00:00:50,799 พอดีเห็น Hermes กำลัง update อยู่เบื้องหลัง แต่นี่คือ 12 00:00:50,799 --> 00:00:56,575 prompt ที่เราจะให้ และเป็น prompt ที่หลายคนเคยเห็นมาแล้วหลายครั้งแล้วครับ 13 00:00:56,575 --> 00:01:00,532 prompt คือให้สร้างไฟล์ HTML ไฟล์เดียวสำหรับเกม One 14 00:01:00,532 --> 00:01:04,488 Piece meets Star Wars โดยมี hero section แบบเต็มจอ 15 00:01:04,488 --> 00:01:08,603 พื้นหลังสีเข้ม มีทรงกลม 3D หมุนอยู่ใน Three.js พร้อม 16 00:01:08,603 --> 00:01:14,141 GLSL fragment shader แบบกำหนดเอง ทำให้มันดูเหมือนดาวเคราะห์ที่เรืองแสง 17 00:01:14,141 --> 00:01:17,939 ทรงกลมจะค่อย ๆ หมุนรอบแกน Y เมื่อ scroll ลง GSAP 18 00:01:17,939 --> 00:01:22,133 จะเล่นแอนิเมชันให้ทรงกลมเล็กลงและจางหายไป พร้อมกับให้ 19 00:01:22,133 --> 00:01:26,090 headline ค่อย ๆ โผล่ขึ้นมาแบบ stagger entrance ของ 20 00:01:26,090 --> 00:01:29,808 framer-motion ทำงานบน Chrome ไม่ต้องใช้ NPM ใช้ 21 00:01:29,808 --> 00:01:34,240 CDN imports เท่านั้นครับ หลายคนอาจจำได้ว่านี่คือผลงานที่ 22 00:01:34,240 --> 00:01:40,095 Kimi K2.6 ทำได้ตอนนั้น ซึ่งดูดีมาก และในเวลานั้นมันเป็นผลงานที่ดีที่สุดจาก 23 00:01:40,095 --> 00:01:44,289 prompt นี้เลย ตอนนั้น Fable ยังไม่ได้ออกมาทำได้ดีกว่า 24 00:01:44,289 --> 00:01:50,777 และล่าสุด ChatGPT 5.6 Sol ก็ทำได้ดีเช่นกัน แต่ตอนที่ปล่อยครั้งแรกมันทำได้ดีมากจริง 25 00:01:50,777 --> 00:01:54,733 ๆ โดยที่โมเดล frontier ตัวอื่น ๆ ในยุคนั้นทำไม่ได้ 26 00:01:54,733 --> 00:01:59,323 เช่น Opus หรือ GPT รุ่นตอนนั้นก็ทำไม่ได้ครับ แต่มาดูกันว่า 27 00:01:59,323 --> 00:02:03,279 Kimi K3 จะทำยังไงกับ prompt นี้ สักสองสามเดือนก่อน 28 00:02:03,279 --> 00:02:08,660 prompt นี้ถือว่ายากมาก แต่โมเดลรุ่นใหม่ ๆ ส่วนใหญ่ก็เริ่มทำได้ดีแล้ว 29 00:02:08,660 --> 00:02:14,357 ผมอาจจะต้องหา prompt ที่ยากกว่านี้มาใช้แล้วล่ะ ถ้าโมเดลทุกตัวเริ่มจัดการ 30 00:02:14,357 --> 00:02:18,946 prompt นี้ได้หมดแล้ว ทีนี้เรามาเลือกโมเดลกัน เลื่อนลงไปที่ 31 00:02:18,946 --> 00:02:22,981 Moonshot Kimi K3 ในพอร์ทัลใหม่ สังเกตราคาได้เลยครับ 32 00:02:22,981 --> 00:02:27,017 ตอนนี้อยู่ที่ $3 สำหรับ input และ $15 สำหรับ output 33 00:02:27,017 --> 00:02:30,736 ซึ่งถือว่าอยู่ในระดับใกล้เคียงกับ GPT-5.6 Terra 34 00:02:30,736 --> 00:02:36,591 ของ OpenAI คือเป็นโมเดลระดับกลางของ OpenAI ดังนั้นมันไม่ใช่ของถูกเลยนะครับ 35 00:02:36,591 --> 00:02:41,893 แพงอยู่ แต่ก็เป็น open weights ด้วยเช่นกัน และพร้อมใช้งานแล้วตอนนี้ 36 00:02:41,893 --> 00:02:45,849 ทีนี้มาที่หน้าแชทของ Hermes กันบ้าง ผมจะวาง prompt 37 00:02:45,849 --> 00:02:49,805 นี้ลงไปเลยนะครับ โอเค คุณจะเห็น Kimi K3 อยู่ตรงนี้ 38 00:02:49,805 --> 00:02:53,762 นี่คือสิ่งที่ได้กลับมา เห็นชื่อว่า Grandline Prime 39 00:02:53,762 --> 00:02:58,826 ขนานนามว่า One Piece Star Wars Outer Rim ตัวทรงกลมเองดูดีมากครับ 40 00:02:58,826 --> 00:03:03,890 นี่เป็นหนึ่งในเวอร์ชันที่ดีกว่าเดิมเยอะเลย ดูมีความสมจริงมากขึ้น 41 00:03:03,890 --> 00:03:08,163 ดูคล้ายโลกเลย เหมือนมีเมฆลอยอยู่ข้างใต้ ทำได้ดีมากจริง 42 00:03:08,163 --> 00:03:13,227 ๆ สำหรับตัวทรงกลม ทีนี้ลอง scroll ลงไปดูกัน นี่คือบททดสอบของจริง 43 00:03:13,227 --> 00:03:17,183 มันค่อย ๆ เล็กลง ค่อย ๆ จางหายไป สวยงามมาก และก็มี 44 00:03:17,183 --> 00:03:21,139 stagger entrance ของ headline ขึ้นมาพอดี "Set sail 45 00:03:21,139 --> 00:03:25,254 for the stars, become the pirate king of the galaxy" 46 00:03:25,254 --> 00:03:29,448 — ออกเดินทางสู่ดวงดาว กลายเป็นราชาโจรสลัดแห่งกาแล็กซี 47 00:03:29,448 --> 00:03:34,986 ผมว่ามันทำได้ดีมากครับ ทางสายตาดูดีกว่าที่เวอร์ชันก่อนหน้าทำได้เยอะเลย 48 00:03:34,986 --> 00:03:41,950 ดูสะอาดตาและขัดเกลาขึ้นมาก และมันก็ทำครบทุกข้อที่ผมกำหนดไว้ในแง่ของข้อกำหนดทางเทคนิคด้วย 49 00:03:41,950 --> 00:03:45,748 ถือว่าเป็นงานที่ดีมากครับ ผมคงต้องเปลี่ยน prompt 50 00:03:45,748 --> 00:03:49,704 ประจำที่ใช้อยู่แล้วล่ะ เพราะโมเดลสองสามตัวล่าสุดทำ 51 00:03:49,704 --> 00:03:53,739 prompt นี้ได้ดีมาก ผมคงต้องไปหางาน front-end coding 52 00:03:53,739 --> 00:03:57,458 ที่ยากกว่านี้มาลองบ้างแล้ว โอเค งานแรกเสร็จแล้ว 53 00:03:57,458 --> 00:04:01,968 ทีนี้กลับมาคุยเรื่องตัวโมเดลกันบ้าง Kimi K3 เป็นโมเดลขนาด 54 00:04:01,968 --> 00:04:05,846 2.8 ล้านล้านพารามิเตอร์ (2.8 trillion parameters) 55 00:04:05,846 --> 00:04:11,543 เป็นโมเดล open weights ระดับสามล้านล้านพารามิเตอร์ตัวแรกที่ถูกปล่อยออกมา 56 00:04:11,543 --> 00:04:15,657 มี context window 1 ล้านโทเคน ซึ่งเพิ่งเห็นกันไปแล้ว 57 00:04:15,657 --> 00:04:19,455 และมีสถาปัตยกรรมใหม่ที่ออกแบบมาเพื่อการทำงานด้าน 58 00:04:19,455 --> 00:04:23,649 coding research และงานความรู้ที่ต้องรันนาน ๆ โดยเฉพาะ 59 00:04:23,649 --> 00:04:28,080 แต่กรอบความจริงก็สำคัญนะครับ Moonshot ไม่ได้กล่าวอ้างว่า 60 00:04:28,080 --> 00:04:32,353 K3 จะเอาชนะโมเดลปิดทุกตัว ในประกาศของบริษัทเองก็บอกตรง 61 00:04:32,353 --> 00:04:36,863 ๆ ว่า K3 ยังเป็นรอง Claude 5 และ GPT 5.6 Sol ในภาพรวมอยู่ 62 00:04:36,863 --> 00:04:41,769 คำถามที่น่าสนใจไม่ใช่ว่านี่เป็นโมเดล open ที่ใหญ่ที่สุดหรือไม่ 63 00:04:41,769 --> 00:04:47,783 เพราะมันชัดเจนอยู่แล้วว่าใช่ แต่คือคุณไม่สามารถรันโมเดลนี้บนเครื่องท้อคัดได้ 64 00:04:47,783 --> 00:04:52,135 แม้จะเป็น open weights แต่มันก็ไม่ใช่เรื่องที่เป็นไปได้ 65 00:04:52,135 --> 00:04:55,854 แม้คุณจะมีเครื่องที่ทรงพลังมากพร้อม GPU ของเก่ง 66 00:04:55,854 --> 00:05:02,263 ๆ ก็ตาม คำถามจริง ๆ คือ ขนาดที่ใหญ่ขนาดนี้จะแปลงเป็นงานสำเร็จที่ดีกว่าจริงหรือไม่ 67 00:05:02,263 --> 00:05:06,061 มาเจาะกันต่อเลย Kimi K3 ไม่ใช่แค่ Kimi K2 ที่เอา 68 00:05:06,061 --> 00:05:09,938 expert มาเพิ่มขึ้นเฉย ๆ ส่วนใหม่แรกคือ Kimi Delta 69 00:05:09,938 --> 00:05:14,053 Attention หรือเรียกสั้น ๆ ว่า KDA นี่เป็นสถาปัตยกรรม 70 00:05:14,053 --> 00:05:17,930 attention แบบประหยัดทรัพยากรของ Kimi สำหรับจัดการ 71 00:05:17,930 --> 00:05:21,728 sequence ที่ยาวมาก ๆ โดยไม่ต้องเสียค่าใช้จ่ายของ 72 00:05:21,728 --> 00:05:26,001 attention แบบมาตรฐานกับทุก token จากนั้นก็มี attention 73 00:05:26,001 --> 00:05:31,381 residuals แทนที่จะให้แต่ละเลเยอร์สะสมข้อมูลจากเลเยอร์ก่อนหน้าทั้งหมด 74 00:05:31,381 --> 00:05:37,237 โมเดลสามารถเลือกดึง representation ที่มีประโยชน์จากความลึกที่แตกต่างกันได้ 75 00:05:37,237 --> 00:05:40,956 ภายใต้สิ่งนี้คือ stable lean MoE — K3 มี expert 76 00:05:40,956 --> 00:05:44,675 ถึง 896 ตัว แต่มีเพียง 16 ตัวเท่านั้นที่ active 77 00:05:44,675 --> 00:05:48,473 ในแต่ละ token นี่คือเหตุผลที่ขนาดโมเดลรวมใหญ่มาก 78 00:05:48,473 --> 00:05:52,271 แต่เส้นทางการทำงานจริงยังคง sparse อยู่ Moonshot 79 00:05:52,271 --> 00:05:56,069 ระบุว่า การผสมผสานของสถาปัตยกรรม การ routing การ 80 00:05:56,069 --> 00:06:01,133 train และข้อมูล ทำให้ scaling efficiency (ประสิทธิภาพการขยายตัว) 81 00:06:01,133 --> 00:06:10,153 โดยรวมดีขึ้นประมาณ 2.5 เท่าเมื่อเทียบกับ K2 ดังนั้นคำกล่าวอ้างเรื่องประสิทธิภาพนี้สำคัญกว่าจำนวนพารามิเตอร์เสียอีก 82 00:06:10,153 --> 00:06:14,268 เพราะโมเดลยักษ์จะมีประโยชน์ก็ต่อเมื่อคุณสามารถ train 83 00:06:14,268 --> 00:06:18,382 และ serve มันได้โดยที่ต้นทุนไม่บานปลาย จุดขายหลักของ 84 00:06:18,382 --> 00:06:24,159 K3 คืองานที่ต้องทำต่อเนื่องยาวนานสามารถทำได้โดยแทบไม่ต้องมีมนุษย์คอยกำกับ 85 00:06:24,159 --> 00:06:28,273 Moonshot ระบุว่ามันสามารถอ่าน repository ขนาดใหญ่มาก 86 00:06:28,273 --> 00:06:32,071 ๆ ประสานงานกับเครื่องมือ terminal คงสภาพ session 87 00:06:32,071 --> 00:06:37,214 งานวิศวกรรม และใช้ screenshot เป็นส่วนหนึ่งของวงจรการเขียนโค้ดได้ 88 00:06:37,214 --> 00:06:41,171 คือมันสามารถสร้างบางสิ่งขึ้นมา ดูผลลัพธ์ที่ render 89 00:06:41,171 --> 00:06:45,127 แล้วนั้น จากนั้นปรับปรุงมันแทนที่จะหยุดแค่ตอนเขียน 90 00:06:45,127 --> 00:06:49,558 source code เสร็จ พวกเขายังทดสอบ GPU kernel optimization 91 00:06:49,558 --> 00:06:53,673 โดยให้รันต่อหนึ่งครั้งได้นานถึง 24 ชั่วโมงเลยทีเดียว 92 00:06:53,673 --> 00:06:58,104 ในช่วงพัฒนา K3 เอง เวอร์ชันแรก ๆ มีรายงานว่ารับผิดชอบงาน 93 00:06:58,104 --> 00:07:05,463 kernel optimization ของทีมได้เกือบทั้งหมด จะเห็นแนวโน้มกว้างขึ้นที่ครอบคลุมทั้งการปล่อยตัวนี้ 94 00:07:05,463 --> 00:07:11,001 — คือเน้นการ "รับผิดชอบโปรเจกต์ที่ยากทั้งโปรเจกต์แล้วรันต่อเนื่องจนจบ" 95 00:07:11,001 --> 00:07:17,015 พวกเขาพูดถึง case study สุดมหัศจรรย์หลายตัว ผมจะไม่ลงรายละเอียดทั้งหมดนะครับ 96 00:07:17,015 --> 00:07:21,130 สามารถไปอ่านเพิ่มเติมได้ที่ tech blog ซึ่งน่าสนใจมาก 97 00:07:21,130 --> 00:07:26,510 อย่างเช่นการสร้าง mini Triton GPU compiler, ชิปที่ถูกออกแบบโดยโมเดล, 98 00:07:26,510 --> 00:07:30,308 โลก 3D แบบ procedural open world โดยใช้ Three.js 99 00:07:30,308 --> 00:07:34,818 และ WebGPU พร้อม asset อื่น ๆ อีกมาก และงาน computational 100 00:07:34,818 --> 00:07:39,329 astrophysics โมเดลสามารถทำงานวิจัยและทุกอย่างที่จำเป็นได้ 101 00:07:39,329 --> 00:07:43,760 โดยทำงานที่ปกติต้องใช้เวลาสองสัปดาห์ให้เสร็จในสองชั่วโมง 102 00:07:43,760 --> 00:07:48,507 ทีนี้มาดู benchmark กันบ้าง เพราะหลายคนอยากเห็นส่วนนี้แน่นอน 103 00:07:48,507 --> 00:07:52,543 ใน blog มีอยู่หลายตัวเลย ดู coding benchmark ได้เลย 104 00:07:52,543 --> 00:07:56,578 K3 อยู่ใกล้ด้านบนในเกือบทุกตัวเลย มีสองสามตัวที่แพ้ 105 00:07:56,578 --> 00:08:00,376 GPT-5.6 Sol สองสามตัวแพ้ Fable แต่บางตัวก็ขึ้นนำ 106 00:08:00,376 --> 00:08:04,095 คือเอาชนะ Sol และ Fable ได้ ซึ่งน่าทึ่งมาก ส่วน 107 00:08:04,095 --> 00:08:07,814 agent benchmark ก็คล้าย ๆ กันครับ แพ้ Fable และ 108 00:08:07,814 --> 00:08:11,691 Sol อยู่บางตัว แต่บางตัวก็สูงกว่า เช่น automation 109 00:08:11,691 --> 00:08:15,489 bench, browse comp, spreadsheet bench และ visual 110 00:08:15,489 --> 00:08:19,604 agent ด้วย อยู่สูงกว่า Sol เล็กน้อย แต่ต่ำกว่า Fable 111 00:08:19,604 --> 00:08:23,323 นิดหน่อย ดังนั้นมันไม่ใช่โมเดลที่ดีที่สุดในตลาด 112 00:08:23,323 --> 00:08:28,387 แต่ก็ใกล้เคียงกับโมเดลท็อปที่เราเข้าถึงได้มาก และเมื่อพิจารณาว่า 113 00:08:28,387 --> 00:08:34,322 Fable 5 ถูกมองว่าเป็นภัยคุกคามระดับชาติที่ต้องกักไม่ให้ประชาชนทั่วไปเข้าถึง 114 00:08:34,322 --> 00:08:38,911 สิ่งที่ K3 ทำได้ถือว่าน่าทึ่งมากครับ และอย่างที่เห็นตรงนี้ 115 00:08:38,911 --> 00:08:43,421 cost efficiency ก็เป็นปัจจัยสำคัญเช่นกัน ค่าใช้จ่ายต่องาน 116 00:08:43,421 --> 00:08:50,463 K3 ที่ทำเครื่องหมายดาวแดงไว้ตรงนี้ จะเห็นว่ามันมีประสิทธิภาพเรื่องต้นทุนดีกว่าอย่างชัดเจน 117 00:08:50,463 --> 00:08:55,369 ดังนั้นนี่คือมุมมองตรงไปตรงมาของผม — K3 ดูแข็งแกร่งมากในแง่ของ 118 00:08:55,369 --> 00:08:59,405 benchmark ครับ ความสำเร็จใหญ่ ๆ ใน coding benchmark 119 00:08:59,405 --> 00:09:03,203 และ agent benchmark, ผลลัพธ์ด้าน spreadsheet และ 120 00:09:03,203 --> 00:09:07,396 document understanding ที่แข็งแกร่ง, การเขียนโค้ดด้าน 121 00:09:07,396 --> 00:09:12,302 visual และ long context ล้วนเป็นความสามารถหลักที่มีประโยชน์มาก 122 00:09:12,302 --> 00:09:16,417 แต่อาจจะไม่แข็งแกร่งมากนักในงาน software engineering 123 00:09:16,417 --> 00:09:20,769 ที่ยากจริง ๆ ส่วน GPT 5.6 ยังนำอยู่ในการทดสอบ reasoning 124 00:09:20,769 --> 00:09:25,912 และ multimodal หลายตัว ซึ่ง Moonshot เองก็ยอมรับว่ามีช่องว่างด้าน 125 00:09:25,912 --> 00:09:31,688 UX เมื่อเทียบกับโมเดลท็อปเหล่านี้ แต่ถึงกระนั้นก็ถือว่าน่าประทับใจมากครับ 126 00:09:31,688 --> 00:09:35,644 อย่างที่ผมพูดไปก่อนหน้านี้ เรื่องราคาและการเข้าถึง 127 00:09:35,644 --> 00:09:39,680 — อยู่ที่ 30 เซนต์สำหรับ cache hit input, $3 สำหรับ 128 00:09:39,680 --> 00:09:44,032 cache miss input ปกติ และ $15 สำหรับ output อย่างที่บอก 129 00:09:44,032 --> 00:09:48,384 ราคาใกล้เคียงกับ GPT 5.6 Terra ซึ่งเป็นรุ่นระดับกลางของ 130 00:09:48,384 --> 00:09:52,103 OpenAI นี่คือข้อเท็จจริงของตัวโมเดลเอง สรุปแล้ว 131 00:09:52,103 --> 00:09:58,275 Kimi K3 ไม่ได้เป็นโมเดลที่ดีที่สุดโดยอัตโนมัติเพียงเพราะมีพารามิเตอร์มากที่สุด 132 00:09:58,275 --> 00:10:03,101 สิ่งที่ทำให้มันน่าสนใจจริง ๆ คือการผสมผสานระหว่างการเป็นโมเดล 133 00:10:03,101 --> 00:10:06,899 open ระดับสามล้านล้านพารามิเตอร์, context window 134 00:10:06,899 --> 00:10:11,963 หนึ่งล้านโทเคน, และสถาปัตยกรรม attention ที่เป็นนวัตกรรมใหม่จริง 135 00:10:11,963 --> 00:10:19,797 ๆ พร้อมความสามารถ multimodal แบบ native และการโฟกัสไปที่งานที่สามารถรันได้นานเป็นชั่วโมงหรือเป็นวัน 136 00:10:19,797 --> 00:10:23,674 เราทำงานไปแล้วหนึ่งงาน ทีนี้มาทำอีกงานกันบ้างครับ 137 00:10:23,674 --> 00:10:29,134 งานต่อไปที่ผมจะให้จะเป็นงานที่อิงจากสิ่งที่เราเห็นในสไลด์นั่นแหละครับ 138 00:10:29,134 --> 00:10:33,090 นั่นคือ procedural 3D open world ผมอยากลองให้สร้าง 139 00:10:33,090 --> 00:10:36,967 open world ขึ้นมาดู เพราะก่อนหน้านี้ผมเคยให้ Opus 140 00:10:36,967 --> 00:10:41,319 และ GLM 5.2 ทำงานนี้ โดยให้สร้าง open world ใน Three.js 141 00:10:41,319 --> 00:10:45,592 โดยใช้ asset พื้นฐานบางตัว ผมมี prompt อยู่ โดยระบุว่า 142 00:10:45,592 --> 00:10:50,656 "คุณอยู่ใน directory เปล่า วัสดุเพียงอย่างเดียวที่ให้คือโฟลเดอร์ 143 00:10:50,656 --> 00:10:55,404 assets ที่มี fantasy และ game assets" ซึ่งก็คือพวกนี้เลยครับ 144 00:10:55,404 --> 00:10:59,281 มีบางอย่าง — คุณอาจจะอ่านไม่ออก แต่พวกนี้เป็นไฟล์ 145 00:10:59,281 --> 00:11:03,712 Three.js และรูปอ้างอิงบางส่วน ซึ่งเดิมทีเป็นของสำหรับเกม 146 00:11:03,712 --> 00:11:09,963 One Piece ที่ผมพยายามจะทำอยู่ และน่าจะเป็นส่วนที่มีประโยชน์มากที่สุดสำหรับโมเดล 147 00:11:09,963 --> 00:11:15,106 เพราะมี texture ครบครันที่สามารถเอาไปใช้กับอาคารหรือพื้นดินได้เลย 148 00:11:15,106 --> 00:11:20,091 มี asset ให้ใช้ได้เพียบเลยครับ ก็คือไอเดียคือให้สร้างโลกแฟนตาซี 149 00:11:20,091 --> 00:11:25,393 3D ขึ้นมาโดยใช้ Three.js เป็นหลัก โดยมีข้อกำหนดอยู่สองสามข้อด้วยกัน 150 00:11:25,393 --> 00:11:29,745 — ระบบควบคุมการเคลื่อนไหว, จุดสนใจ (points of interest) 151 00:11:29,745 --> 00:11:37,262 สามจุด, องค์ประกอบแอนิเมชันหนึ่งตัว และให้ผู้ใช้สามารถคลิกหรือตรวจสอบวัตถุได้อย่างน้อยหนึ่งชิ้น 152 00:11:37,262 --> 00:11:43,038 นี่คือ prompt ที่ผมจะให้มัน เรามาดูกันว่าจะสร้างอะไรได้บ้างและจะดีกว่าของ 153 00:11:43,038 --> 00:11:47,232 Opus 4.8 และ GLM 5.2 หรือเปล่า โอเค อีกครั้งใน Hermes 154 00:11:47,232 --> 00:11:51,346 นะครับ ผมจะวาง prompt ลงไป ตอนนี้เราอยู่ใน directory 155 00:11:51,346 --> 00:11:55,223 ที่ถูกต้องแล้ว เป็น directory เปล่ายกเว้นโฟลเดอร์ 156 00:11:55,223 --> 00:11:59,734 assets นั่นแหละ มาดูกันว่ามันจะทำยังไง โอเค เสร็จแล้วครับ 157 00:11:59,734 --> 00:12:04,719 ใช้เวลาประมาณ 7 นาทีทั้งหมด ผมมีปัญหาเรื่องการเชื่อมต่ออยู่บ้าง 158 00:12:04,719 --> 00:12:08,675 คิดว่าน่าจะมีคนใช้งานเยอะมากวันนี้ แต่ก็ทำเสร็จได้ 159 00:12:08,675 --> 00:12:12,552 มาดูกันว่าได้อะไรกลับมาบ้าง โอเค มาดูกันเลย Amber 160 00:12:12,552 --> 00:12:18,012 Fallvale คลิกเพื่อเข้าสู่เกม หน้าตาดูดีมากครับ นี่คือเมืองแฟนตาซีเล็ก 161 00:12:18,012 --> 00:12:21,810 ๆ ของเรา ทำ texture ได้ดีมากเลย มีบ่อน้ำอยู่ด้วย 162 00:12:21,810 --> 00:12:27,111 ผมคลิกดู — "The old well" บ่อน้ำโบราณ ชื่อไม่ค่อยสร้างสรรค์เท่าไหร่ 163 00:12:27,111 --> 00:12:31,147 แต่เอาเป็นว่ามาดูต่อกัน — "The fallen star crystal" 164 00:12:31,147 --> 00:12:35,420 คริสตัลดวงดาวตก แล้วนี่ใครนะ — "The hooded adventurer" 165 00:12:35,420 --> 00:12:40,563 นักผจญภัยหน้ากาก น่าสนใจดีครับ ทำแสงได้ดีมาก ชอบเอฟเฟกต์แสงนี้เลย 166 00:12:40,563 --> 00:12:45,548 รู้ว่าดูเหมือนจะไม่ใช่อะไรมาก แต่ว่ามันดีมาก แสงมาจากดวงอาทิตย์ 167 00:12:45,548 --> 00:12:49,662 การที่มันถ่วงลักษณะแสงออกมาได้ขนาดนี้ถือว่าดีมากครับ 168 00:12:49,662 --> 00:12:53,777 ดูดีเลย มีปราสาทเล็ก ๆ อยู่ตรงนี้ด้วย สำหรับการทำแบบ 169 00:12:53,777 --> 00:12:57,733 one-shot ถือว่าทำได้ดีมากครับ แน่นอน ถ้าจะสร้างโลก 170 00:12:57,733 --> 00:13:03,747 3D จริงจัง ก็สามารถขัดเกลาเพิ่มเติมได้ แต่มันมีครบทุกองค์ประกอบที่ผมกำหนดไว้ 171 00:13:03,747 --> 00:13:07,782 คลิกที่อะไรก็ได้แล้วมันจะบอกชื่อให้ ก็มีครบแล้วครับ 172 00:13:07,782 --> 00:13:11,739 และถ้าใครจำไม่ได้ นี่คือเวอร์ชันที่ Opus 4.8 ทำไว้ 173 00:13:11,739 --> 00:13:16,328 มีตัวละครมากกว่า แต่ไม่รู้สิ ผมรู้สึกว่าบ้านไม่ค่อยสวยเท่า 174 00:13:16,328 --> 00:13:20,047 ส่วนน้ำนี่ทำได้ดีกว่า แต่นี่คือเวอร์ชันของ Opus 175 00:13:20,047 --> 00:13:24,557 4.8 ดังนั้นก็ไม่รู้ว่าจะถือว่ามันดีกว่าที่เราเพิ่งเห็นไหม 176 00:13:24,557 --> 00:13:31,362 ส่วนตัวผมไม่ขอรับรองนะว่า K3 จะดีกว่านะครับ เพราะเวอร์ชันใหม่นี่รู้สึกว่าจะครบครันกว่า 177 00:13:31,362 --> 00:13:35,872 มี texture ใช้เยอะกว่าด้วย แบบนี้น่ะครับ ทีนี้ส่วนสุดท้าย 178 00:13:35,872 --> 00:13:40,857 เรามาอยู่ในแอป desktop กันบ้าง ผมอยากลองอันนี้เพราะอยากทดสอบกับ 179 00:13:40,857 --> 00:13:44,655 sub-agent พวกเขาบอกว่า Kimi K3 เป็น orchestrator 180 00:13:44,655 --> 00:13:49,165 model ที่ดีมาก ผมเลยอยากให้มันเป็นฝ่ายประสานงานที่ต้องใช้ 181 00:13:49,165 --> 00:13:53,043 sub-agent ดูสิว่ามันจะสังเคราะห์ข้อมูลได้ดีแค่ไหน 182 00:13:53,043 --> 00:13:57,157 นี่คืองานที่ให้ครับ ผมบอกว่า "Spawn three sub-agents 183 00:13:57,157 --> 00:14:00,876 เพื่อทำวิจัยเกี่ยวกับหัวข้อดังต่อไปนี้ — หนึ่ง: 184 00:14:00,876 --> 00:14:04,991 agent memory, สอง: agent tool use, สาม: agent skills 185 00:14:04,991 --> 00:14:10,292 จากนั้นให้สังเคราะห์ข้อมูลจาก sub-agent ทั้งสามเป็นรายงานที่เข้ากัน 186 00:14:10,292 --> 00:14:14,881 โดยให้หา 5 paper ที่สำคัญที่สุดจัดอันดับตามความน่าเชื่อถือ 187 00:14:14,881 --> 00:14:19,787 ความใหม่ และผลกระทบต่อสายงาน agent" มาดูกันว่ามันจะจัดการบทบาท 188 00:14:19,787 --> 00:14:26,592 orchestrator นี้ได้ดีแค่ไหน ผมทำในแอป desktop เพราะเราน่าจะเห็นการทำงานแบบเรียลไทม์ได้ 189 00:14:26,592 --> 00:14:30,549 มันจะโหลด research skill ขึ้นมาก่อนเพื่อเป็นแนวทาง 190 00:14:30,549 --> 00:14:36,641 workflow ที่เหมาะสม จากนั้นจะเรียก sub-agent ทั้งสามตัวขึ้นมาทำงานควบคู่กันไป 191 00:14:36,641 --> 00:14:41,468 (parallel) เราจะได้เห็นพวกมันทำงานอยู่ตรงนี้ ซึ่งแน่นอนว่าใช้ 192 00:14:41,468 --> 00:14:45,345 delegate task เป็นเครื่องมือ มาดูกัน เรามี worker 193 00:14:45,345 --> 00:14:49,934 สามตัวแล้ว นี่คือเป้าหมายที่ orchestrator มอบหมายให้พวกมัน 194 00:14:49,934 --> 00:14:54,128 จะเห็นว่ามันให้ context ที่ละเอียดมาก อย่างเช่นเรื่อง 195 00:14:54,128 --> 00:14:58,084 agent tool use จะเห็นว่ามันระบุชัดเจนมากว่าต้องการ 196 00:14:58,084 --> 00:15:01,883 paper เกี่ยวกับ tool learning, function calling, 197 00:15:01,883 --> 00:15:06,314 MCP, และ tool use benchmark มันให้คำสั่งที่เข้มงวดมากว่า 198 00:15:06,314 --> 00:15:11,457 "ห้ามแต่ง paper หรือไอเดียขึ้นมมาเด็ดขาด" ซึ่งสำคัญมากใช่มั้ยครับ 199 00:15:11,457 --> 00:15:15,413 ทีนี้ถือว่าเริ่มต้นได้ดี มาดูกันว่าจะได้อะไรกลับมา 200 00:15:15,413 --> 00:15:20,161 โอเค กำลังทำงานอยู่ครับ sub-agent ทั้งหมดเพิ่งทำงานเสร็จแล้ว 201 00:15:20,161 --> 00:15:25,146 ตอนนี้มันจะรีวิวสิ่งที่ได้กลับมา จะเห็นว่ามันกำลังคิดอยู่ตรงนี้ 202 00:15:25,146 --> 00:15:29,577 ได้ paper กลับมาประมาณแปดเรื่องจากแต่ละตัว เจ็ดเรื่องจาก 203 00:15:29,577 --> 00:15:33,612 agent skills ตอนนี้มันจะสังเคราะห์และคัดเลือก paper 204 00:15:33,612 --> 00:15:39,072 ที่น่าสนใจที่สุด 5 เรื่องออกมา น่าสนใกมากที่ได้เห็นกระบวนการคิดของมัน 205 00:15:39,072 --> 00:15:42,791 จัดอันดับโดยความน่าเชื่อถือ ความใหม่ และผลกระทบ 206 00:15:42,791 --> 00:15:47,697 น่าสนใจมากครับ ทีนี้มันกำลัง spot check เรื่องที่ติดอันดับท็อป 207 00:15:47,697 --> 00:15:53,552 5 อยู่ เพราะจากที่มันคิดไว้ มันบอกว่าไม่สามารถยืนยันหรือไม่ไว้วางใจสิ่งที่ 208 00:15:53,552 --> 00:16:00,357 sub-agent รายงานมาได้เท่าที่ควร และคิดว่าค่อนข้างคุ้มค่าที่จะยืนยันข้อเท็จจริงสำคัญของ 209 00:16:00,357 --> 00:16:07,478 5 paper ที่มันเลือกไว้ ดังนั้นมันกำลังทำงานเพิ่มเติมและคิดทบทวนกระบวนการนี้อย่างรอบคอบขึ้น 210 00:16:07,478 --> 00:16:12,068 และนี่ยังเป็นการคิดแค่ระดับ medium thinking เท่านั้นนะครับ 211 00:16:12,068 --> 00:16:16,261 โอเค มันยืนยันความถูกต้องของ top 5 ที่คัดเลือกไว้แล้ว 212 00:16:16,261 --> 00:16:22,671 เป็น paper จริงทั้งหมด ข้อมูลตรงกันหมด นี่คือรายงานสังเคราะห์ที่มันเขียนให้ผมครับ 213 00:16:22,671 --> 00:16:26,627 อันดับหนึ่งคือ OSWorld computer use agents on long 214 00:16:26,627 --> 00:16:30,583 horizon real world tasks อันดับสองคือ agent memory 215 00:16:30,583 --> 00:16:34,777 characterization and system implications จาก Stanford 216 00:16:34,777 --> 00:16:38,971 ต่อมาคือ MR agent skill composer และจากนั้นคือ reward 217 00:16:38,971 --> 00:16:43,560 hacking benchmark มันทำหน้าที่สังเคราะห์ข้อมูลได้ดีมากครับ 218 00:16:43,560 --> 00:16:47,358 มันให้คะแนนด้วย ให้เหตุผลประกอบด้วย มีสรุปสั้น ๆ 219 00:16:47,358 --> 00:16:52,739 ที่เขียนขึ้นมาสวยงามสำหรับแต่ละเรื่อง และมีส่วนวิเคราะห์แนวโน้มระดับ 220 00:16:52,739 --> 00:16:57,011 field (field-level trends) ที่สอดคล้องกันทั้งสามสายงาน 221 00:16:57,011 --> 00:17:00,889 เช่น "Evaluation shifted from 'can it' to 'should 222 00:17:00,889 --> 00:17:05,241 it'" (การประเมินเปลี่ยนจาก 'ทำได้ไหม' เป็น 'ควรทำไหม'), 223 00:17:05,241 --> 00:17:10,067 "Memory is becoming infrastructure" (หน่วยความจำกำลังกลายเป็น 224 00:17:10,067 --> 00:17:13,945 infrastructure), และ "Scale research is answering 225 00:17:13,945 --> 00:17:18,771 its skeptics" (งานวิจัยด้าน scale กำลังตอบโต้ผู้สงสัยได้แล้ว) 226 00:17:18,771 --> 00:17:23,677 มันจัดการงานนี้ได้ดีมากครับ ไม่มีปัญหาอะไร และค่อนข้างเร็วด้วย 227 00:17:23,677 --> 00:17:27,475 ใช้เวลาไม่ถึง 10 นาทีทั้งหมด ถือว่าทำหน้าที่เป็น 228 00:17:27,475 --> 00:17:31,669 orchestrator agent ได้ดีมากครับ การทดสอบต่อไปคงจะเป็น 229 00:17:31,669 --> 00:17:36,416 multi-agent workflow ที่ซับซ้อนกว่านี้ แต่สำหรับงานวิจัยง่าย 230 00:17:36,416 --> 00:17:40,294 ๆ แบบนี้ ผมว่าทำได้ดีมากครับ นี่แหละครับคือ First 231 00:17:40,294 --> 00:17:44,171 Look ของ Kimi K3 — เป็นโมเดลที่สำคัญมาก เป็น open 232 00:17:44,171 --> 00:17:49,156 weights model ที่ใหญ่ที่สุดที่เราเคยมีมา และเป็นโมเดลที่ทำคะแนน 233 00:17:49,156 --> 00:17:55,090 benchmark ได้ดีที่สุดด้วย ผมก็เลยอยากรู้เหมือนกันว่าเมื่อไหร่ที่พวกเขาปล่อย 234 00:17:55,090 --> 00:17:59,205 weights ออกมาจริง ๆ เราจะเก็บเกี่ยวข้อมูลอะไรได้บ้าง 235 00:17:59,205 --> 00:18:05,535 แต่จากความประทับใจแรก ถือว่าดีมากครับ ถึงแม้ว่าจะรู้สึกได้ว่ามันอยู่ในระดับโมเดล 236 00:18:05,535 --> 00:18:12,340 frontier ท็อปในแง่ของประสิทธิภาพจริง แต่ผมก็ต้องใช้งานมันเพิ่มเติมอีกจึงจะรู้ได้แน่ชัด 237 00:18:12,340 --> 00:18:16,929 แต่สำหรับคลิปนี้คงมีแค่นี้ก่อนนะครับ ฝากคอมเมนต์ด้วยนะครับ 238 00:18:16,929 --> 00:18:21,281 บอกผมได้เลยว่าประสบการณ์ของคุณกับ Kimi K3 เป็นยังไงบ้าง 239 00:18:21,281 --> 00:18:25,000 แล้วเจอกันใหม่ในคลิปหน้าครับ ขอบคุณที่รับชมครับ