How DeepSeek-V4-Flash 0731 REALLY Handles Challenging Tasks
สรุปย่อ
ประเด็นสำคัญจากวิดีโอ
- **ช่อง:** Tonbi's AI Garage · **ความยาว:** ~35 นาที · **ลิงก์:** https://www.youtube.com/watch?v=y9-ILYAhsJk
# สรุป: How DeepSeek-V4-Flash 0731 REALLY Handles Challenging Tasks - **ช่อง:** Tonbi's AI Garage · **ความยาว:** ~35 นาที · **ลิงก์:** https://www.youtube.com/watch?v=y9-ILYAhsJk ## ประเด็นหลัก - โทนบิทดสอบ DeepSeek-V4-Flash 0731 อย่างเข้มข้นทั้งสามเวอร์ชัน: คลาวด์, API อย่างเป็นทางการ, และเวอร์ชันในเครื่องบน DGX Spark (Q2 quantized) - โจทย์แรก: สร้าง launch website คุณภาพระดับ production — เวอร์ชันคลาวด์ทำได้ในระดับเดียวกับ Kimi K3, ส่วนเวอร์ชันในเครื่องสร้าง landing page ที่ใช้งานได้แม้จะมีบั๊กเล็กน้อย - โจทย์ที่สอง: สร้างโลก Three.js แบบ cinematic จากย่อหน้าแรกของ The Lord of the Rings — เวอร์ชันคลาวด์ทำได้ดีและมีบรรยากาศตอนกลางคืนที่สวยงาม ส่วนเวอร์ชันในเครื่องสร้างฉากได้แต่มีปัญหากล้องสั่น - โจทย์สุดท้าย: สร้าง time loop puzzle platformer — เวอร์ชันคลาวด์สร้างเกมที่สร้างสรรค์และซับซ้อนกว่าของ Sol และ Kimi K3 ในขณะที่เวอร์ชันในเครื่องก็ทำกลไกหลักได้สำเร็จ - DeepSeek มีขนาดเพียง 284 พันล้านพารามิเตอร์ (เทียบกับ Kimi K3 ที่ 2.8 ล้านล้าน) แต่ทำผลงานได้ใกล้เคียงหรือบางโจทย์ดีกว่า - ราคาต่อหน่วยต่ำมาก: input 9 เซ็นต์ / output 18 เซ็นต์ (เทียบกับ Kimi K3 ที่ input 2.9 / output 14) - ค่าใช้จ่ายรวมในการทดสอบ DeepSeek ทั้งหมดเพียง 53 เซ็นต์ เทียบกับเกมเดียวของ Kimi K3 ที่ 25 ดอลลาร์ - เวอร์ชันในเครื่องรันบน DGX Spark เครื่องเดียว ได้ความเร็ว prefill ~1,000 tokens/วิ และ 59 tokens/วิ สำหรับ multi-agent - ข้อดีของการรันในเครื่อง: ความเป็นส่วนตัว ไม่มีปัญหาการเชื่อมต่อ, สนุกที่ได้ปรับแต่ง — แม้จะไม่มีข้อได้เปรียบทางเศรษฐกิจในขณะนี้ - โทนบิวางแผนจะทดสอบ Qwen 3.8 สัปดาห์หน้า โดยเฉพาะเวอร์ชัน 27 พันล้านที่สามารถรันในเครื่องได้ ## ความเห็นสรุป DeepSeek-V4-Flash 0731 เป็นโมเดลที่น่าทึ่งในระดับราคาและขนาดของมัน แม้จะเล็กกว่าคู่แข่งอย่าง Kimi K3 ถึงสิบเท่า แต่ก็สามารถรับมือกับโจทย์ท้าทายได้อย่างใกล้เคียงหรือดีกว่าในบางด้าน โดยเฉพาะในด้านความคุ้มค่าแล้ว มันเป็นตัวเลือกที่น่าสนใจมาก สำหรับการรันในเครื่อง แม้จะไม่เหมาะกับงาน coding หนัก ๆ แต่ก็เป็น workhorse ที่ดีสำหรับงานวิจัยและงานที่ใช้เวลานานได้ครับ
คำแปลเต็ม
แปลตามบทสนทนาต้นฉบับ ปรับเป็นภาษาไทยธรรมชาติ
ถ้าเพื่อน ๆ เคยดูวิดีโอแนะนำโมเดลของผมมาก่อน ก็คงจะคุ้นเคยกับ prompt นี้นะครับ ผมได้ขอให้โมเดลสร้างเว็บไซต์ หน้า landing page สำหรับเกมส์ที่ผสมผสานระหว่าง Star Wars กับ One Piece และขอให้มีลูกโลกที่เรืองแสง ซึ่งนี่คือสิ่งที่โมเดลสร้างมาให้ครับ จะเห็นว่ามันโต้ตอบได้ดีมาก พอเอาเมาส์ไปวางเหนือลูกโลก ลูกโลกก็จะหมุนเอง ซึ่งเป็นเรื่องที่ผมไม่เคยเห็นมาก่อนเลย และตอนนี้พอเลื่อนลงมาด้านล่าง มันจะต้องมี headline โผล่ขึ้นมาในสไตล์ที่เหมือนกระตุก ๆ ลองมาดูกันว่าจะทำงานได้ไหมนะครับ จะเห็นว่าลูกโลกเริ่มจางหายไป แล้วก็มี headline แบบกระตุก ๆ โผล่ขึ้นมา "The Odyssey for One Piece begins" ก็ถือว่าโมเดลนี้ทำได้ดีมากครับ พอเลื่อนขึ้นมาก็จะกลับมาเหมือนเดิม ตัวลูกโลกเองดูดีมาก มันมีองค์ประกอบแบบโต้ตอบได้ซึ่งโมเดลก่อน ๆ ไม่เคยทำได้ และเอฟเฟกต์ headline แบบกระตุกก็ทำได้ดีสวยด้วย ก็ถือว่าโมเดลนี้ทำได้ยอดเยี่ยมครับ และอย่างที่เพื่อน ๆ คาดไว้ ถ้าดูจากชื่อวิดีโอนี้ สิ่งที่เห็นถูกสร้างโดยโมเดล DeepSeek-V4-Flash 0731 ครับ ซึ่งนี่เป็นโจทย์ที่ค่อนข้างง่าย แต่ในวิดีโอวันนี้เราจะมาลองจัดโมเดลนี้ให้สุด ทั้งเวอร์ชันคลาวด์ เวอร์ชัน API อย่างเป็นทางการ และเวอร์ชันที่รันอยู่บนเครื่องของผมเองเลย เริ่มกันเลยครับ
สำหรับเพื่อน ๆ ที่รัน Agent Swarm เอง และอยากเข้าถึง LLM wikis ที่ผมใช้ทำวิดีโอเหล่านี้เพื่อศึกษาข้อมูลและสร้างเนื้อหาจริง ๆ ลองแวะดูโปรเจกต์ของผมที่ agentwikis.com นะครับ ผมแชร์ wikis เหล่านี้ทั้งหมดฟรี ในหัวข้อต่าง ๆ มากมาย และก็มีบัญชี pro ให้สมัครในราคา 9.99 ดอลลาร์ต่อเดือน ซึ่งจะให้สิทธิ์เข้าถึง wikis ขนาดใหญ่พิเศษ ที่มีหน้ามากกว่าและรายละเอียดลึกขึ้นในแต่ละหัวข้อครับ
กลับมาที่วิดีโอกันต่อ สัปดาห์ที่แล้ว DeepSeek ก็ออกโมเดล DeepSeek-V4-Flash 0731 อย่างกะทันหัน เป็นเวอร์ชันใหม่ของโมเดล DeepSeek รุ่นก่อน ซึ่งจาก benchmark ที่เห็นตรงนี้ แสดงให้เห็นถึงการปรับปรุงที่ดีขึ้นอย่างมาก และพวกเขาก็ปล่อย open weights ออกมาพร้อมกันด้วย ก็ถือว่าเป็นการปล่อยที่ค่อนข้างน่าตื่นเต้นครับ หลายคนรีบไปทดลองทันที เพราะเรายังไม่เคยเห็นโมเดลที่ทำงานได้ขนาดนี้แต่รันบนแค่สอง spark เลย และผลลัพธ์บางส่วนก็น่าประทับใจมาก เช่นคนคนนี้ Mosh Aib ทำสิ่งนี้ใน Hermes Agent ในราคาแค่ 7 เซ็นต์เท่านั้น สร้างเกมนี้ออกมาได้เลย ก็เป็นฟังก์ชันที่น่าประทับใจมาก แต่ที่สำคัญกว่าคือต้นทุน มันถูกมาก ๆ และก็เร็วมากด้วยครับ
ส่วนตัวผมคิดว่าอาจจะไม่ได้ทดลอง เพราะผมมี DGX Spark แค่เครื่องเดียว แต่ Blaze Goodson ได้ทำงานไปมากพอสมควร และตอนนี้มันรันบนหนึ่ง spark ได้เต็มที่แล้ว เขาได้ความเร็วประมาณ 1,000 tokens ต่อวินาทีในการ prefill และ 59 tokens ต่อวินาทีสำหรับการรัน multi-agent serving ซึ่งผมก็ได้ลองรันบน DGX Spark ของผมเองและได้ตัวเลขที่ใกล้เคียงกันครับ นี่คือคำอธิบายคร่าว ๆ ของเวอร์ชันที่ผมสามารถรันในเครื่องได้ จะเห็นว่าความแตกต่างหลักคือมันถูก quantize อย่างหนักสำหรับ routed experts ซึ่งพวกนี้แหละคือส่วนที่จะกินพื้นที่หน่วยความจำมากที่สุดและกิน activation มากที่สุด จะเห็นว่าตรงนี้เป็น Q2 ครับ
ถ้าเพื่อน ๆ ยังไม่รู้จักเรื่อง quantization (การลดขนาดของโมเดล) ผมมีวิดีโออธิบายเรื่องนี้โดยละเอียดอยู่ แต่สรุปง่าย ๆ ก็คือเป็นวิธีลดขนาดน้ำหนักของโมเดลเพื่อให้สามารถรันโมเดลที่ใหญ่กว่าบน GPU หรือฮาร์ดแวร์ที่เล็กลงได้ และเวลาที่คนพูดถึง dense weights มักจะหมายถึงขนาด 16-bit ครับ 16-bit มักถูกมองว่าเป็นขนาดเต็มใช่ไหมครับ การลดลงไปที่ 8-bit ก็เห็นได้ชัดว่าเป็นครึ่งหนึ่ง และวิธี quantization สมัยใหม่สามารถลดลงไปที่ 8-bit ได้ง่ายมากโดยแทบไม่สูญเสียคุณภาพเลย แม้แต่ที่ 4-bit จากนวัตกรรมล่าสุดในเรื่อง quantization ก็ไม่ได้เห็นความลดลงของคุณภาพมากนัก แต่พอต่ำกว่า 4-bit ไป เรื่องก็จะเริ่มยากขึ้น ทำได้นะครับ แต่จะเจอปัญหาเรื่องความเร็วและคุณภาพบ้าง ดังนั้นการลดลงไปที่ 2-bit ตรงนี้ถือเป็นการ quantize อย่างก้าวร้าวมาก แต่มันก็ยังใช้งานได้ และยังเขียนโค้ดได้ในระดับหนึ่งครับ
ในวิดีโอวันนี้ผมแค่อยากทดลองดู ไม่ได้เป็นการแนะนำแบบ first look นะครับ first look ปกติผมมักจะใช้โจทย์ที่ทำได้รวดเร็ว แต่ครั้งนี้ผมอยากจะทดสอบให้หนัก ให้โจทย์ที่ท้าทายจริง ๆ ผมจะใช้โจทย์บางส่วนจาก AI Royal Rumble (การแข่งขัน AI แบบเจาะลึก) ซึ่งเป็นโจทย์ที่ยาวนานหลายชั่วโมงในบางกรณี ผมจะส่งให้ทั้งเวอร์ชันเต็มที่รันผ่าน API บนคลาวด์ ซึ่งเราจะทำผ่าน Hermes Agent และก็จะใช้โมเดลในเครื่องรันโจทย์เดียวกันทุกประการครับ หวังว่าเพื่อน ๆ จะได้เห็นว่า DeepSeek-V4-Flash โมเดลใหม่นี้ทำได้แค่ไหน รวมถึงความแตกต่างระหว่างเวอร์ชันเต็มบนคลาวด์กับเวอร์ชันที่ถูก quantize อย่างหนักในเครื่องด้วย น่าจะน่าสนใจดีนะครับ เริ่มกันเลย
เอาล่ะ เพื่อน ๆ อาจจะจำได้ นี่มาจาก AI Royal Rumble และอันนี้เฉพาะเจาะจงเป็น Claude Fable ที่สร้างสิ่งนี้แบบโต้ตอบได้ มันเป็นเว็บไซต์นะครับ ผมแค่เลื่อนดู มันมีองค์ประกอบโต้ตอบต่าง ๆ ผมได้ใช้โจทย์นี้กับโมเดลต่าง ๆ ห้าตัว และได้ผลลัพธ์ที่น่าสนใจจากทุกตัวเลย บางตัวก็ทำได้ดีกว่ากัน แต่ทุกตัวก็สามารถสร้างอะไรบางอย่างออกมาได้ ดังนั้นเราจะทำโจทย์เดียวกันทุกประการครับ ผมจะเปลี่ยนหัวข้อ เพื่อไม่ให้มันเป็นการโปรโมต AI Royal Rumble แต่จะให้โปรโมตตัว DeepSeek เอง แต่ส่วนที่ยากคือมันมีเยอะมาก นี่เป็นแค่องค์ประกอบแบบเลื่อนได้ ไม่มีวิดีโออะไรจริง ๆ ดังนั้นโมเดลต้องสร้างช่วง moment ช่วงเปลี่ยนฉากเหล่านี้ขึ้นมาเอง ซึ่งเป็นเรื่องที่ยากมากสำหรับโมเดล แต่เราจะมาดูกันว่า DeepSeek จะทำได้ไหม ด้วย prompt ที่เหมือนกันทุกประการที่ผมให้กับโมเดลเหล่านั้นครับ
เอาล่ะ เราจะทำในแอป desktop เลย จะเห็นว่าเรามี DeepSeek-V4-Flash ที่นี่ โอเค เราต้องการเวอร์ชัน 0731 นะครับ มีสองสามเวอร์ชันให้เลือก ต้องแน่ใจว่าเปิดอันนี้อยู่ มันกำลังเริ่ม session ใหม่ แล้วผมจะใส่ prompt ให้ นี่คือสิ่งที่ผมให้กับโมเดลอื่น ๆ ทุกประการ นี่จะเป็นแบบ one-shot นะครับ ต้องทำงานอัตโนมัติ ถามคำถามไม่ได้ แต่โจทย์คือ... นี่คือ brief ครับ สร้าง launch website คุณภาพระดับ production สำหรับ DeepSeek V4/0731 แล้วก็มีรายละเอียดทั้งหมดว่าต้องทำอะไรบ้าง แต่ทางเลือกด้านการออกแบบจะเป็นการตัดสินใจของโมเดลเอง ผมจะส่ง prompt นี้ให้เวอร์ชันคลาวด์ใน Hermes Agent แล้วมาดูกันว่ามันทำงานได้อย่างไรครับ
ตอนนี้ผมจะทำแบบเดียวกันกับเวอร์ชันในเครื่องด้วย เวอร์ชันในเครื่องอยู่บน Spark ของผม ซึ่งกำลังรันอยู่ตอนนี้ จะเห็นว่าผมสร้าง Hermes profile พิเศษให้มันแล้ว เรียกว่า DS4 และจะเห็น DeepSeek chat ซึ่งก็คือโมเดลที่รันในเครื่อง ลองดูกันว่ามันจะทำงานได้ไหม ผมสังเกตว่าตอนนี้มันเร็วมากและตอบกลับมาเร็วมาก ผมจะวาง prompt นี้ลงไปแล้วดูว่าโมเดลในเครื่องจะทำได้แค่ไหน และผมจะบอกความจริงว่ามันล้มเหลวหรือสำเร็จครับ อย่างที่บอก นี่เป็นโจทย์ที่ท้าทายมาก ไม่ใช่แค่สร้าง landing page ธรรมดา ๆ นะครับ แต่เป็นโจทย์ออกแบบ front-end ที่ซับซ้อน ดังนั้นถ้ามันล้มเหลว ก็อาจจะล้มเหลวได้ อย่าเพิ่งโทษโมเดลเลยครับ เพราะนี่เป็นเวอร์ชันที่ถูก quantize อย่างหนัก และถ้ามันสร้างอะไรออกมาได้ก็ถือว่าน่าประทับใจมากแล้ว น่าจะน่าสนใจที่จะดูความเร็วของมันด้วยนะครับ จะเห็นว่ามันกำลังทำงานไปได้ด้วยความเร็วที่ไม่เลวเลย และก็จะเห็นว่าเวอร์ชันคลาวด์ก็ยังคงรันอยู่เช่นกันครับ
หมายเหตุการแปล
ความโปร่งใสเกี่ยวกับความไม่แน่นอนในต้นฉบับ
- ## [ฟังไม่ชัด] Segments
- ## Uncertain Segments
อภิธานศัพท์เทคนิค
คำศัพท์และชื่อผลิตภัณฑ์ที่คงรูปภาษาอังกฤษ
| ศัพท์ | คำแปล / คำอธิบาย |
|---|---|
| DeepSeek-V4-Flash 0731 | โมเดล AI ตัวใหม่จาก DeepSeek ที่ถูกทดสอบในวิดีโอ |
| Hermes Agent | แพลตฟอร์ม agent ที่ใช้รันโจทย์ต่าง ๆ ในการทดสอบ |
| DGX Spark | ฮาร์ดแวร์ AI ของ NVIDIA ที่ใช้รันโมเดลในเครื่อง |
| quantization (Q2/Q4/Q8) | การลดขนาดน้ำหนักโมเดลเพื่อให้รันบนฮาร์ดแวร์เล็กลงได้ (16-bit = full, 8-bit = ครึ่งหนึ่ง, 2-bit = อย่างก้าวร้าว) |
| routed experts | ส่วนของโมเดลที่กินหน่วยความจำและ activation มากที่สุด |
| dense weights | น้ำหนักโมเดลขนาดเต็ม โดยทั่วไปคือ 16-bit |
| prefill | ขั้นตอนประมวลผล input ก่อนสร้าง output |
| multi-agent serving | การให้บริการหลาย agent พร้อมกัน |
| context window | ขนาดบริบทสูงสุดที่โมเดลรับได้ (เช่น 100K, 240K, 500K) |
| Agent Swarm | การรัน agent หลายตัวพร้อมกันแบบฝูง |
| AI Royal Rumble | การแข่งขันทดสอบโมเดล AI หลายตัวกับโจทย์เดียวกัน |
| one-shot | การทำโจทย์ครั้งเดียวจบ โดยไม่มีการแก้ไขหรือถามคำถาม |
| two-shot | การทำโจทย์สองครั้ง (มีการแก้ไขหนึ่งครั้ง) |
| landing page | หน้าเว็บหลักสำหรับโปรโมตสินค้าหรือบริการ |
| Three.js | ไลบรารี JavaScript สำหรับสร้างกราฟิก 3D บนเว็บ |
| Mixture of Experts (MoE) | สถาปัตยกรรมโมเดลที่ใช้ผู้เชี่ยวชาญย่อยหลายตัว |
| time loop puzzle platformer | เกมแพลตฟอร์มเมอร์ปริศนาที่มีกลไกวนลูปเวลา ผู้เล่นร่วมมือกับตัวเองในอดีต |
| frontier model | โมเดลระดับแนวหน้าที่ทันสมัยที่สุด |
| workhorse | ม้างาน — โมเดลที่ใช้ทำงานทั่วไปได้อย่างน่าเชื่อถือ |
| long horizon tasks | งานที่ใช้เวลานานและมีหลายขั้นตอน |
| open weights | การปล่อยน้ำหนักโมเดลให้ใช้งานได้ฟรี |
| OpenRouter | แพลตฟอร์มรวม API ของโมเดลต่าง ๆ |
| fine-tuning | การปรับแต่งโมเดลเพิ่มเติมให้เชี่ยวชาญเฉพาะด้าน |
| Kimi K3 | โมเดล AI ขนาดใหญ่จาก Moonshot (2.8T พารามิเตอร์) |
| Fable | โมเดล AI หนึ่งในผู้เข้าแข่งขัน AI Royal Rumble |
| Sol (GPT Sol) | โมเดล AI หนึ่งในผู้เข้าแข่งขัน AI Royal Rumble |
| Opus 5 | โมเดลของ Anthropic ที่ Andrej Karpathy ใช้สร้าง Three.js world |
| GLM 5.2 | โมเดล AI ที่ไม่สามารถสร้าง landing page ได้ในการทดสอบก่อนหน้า |
| Qwen 3.8 | โมเดล AI ที่จะออกในสัปดาห์หน้า (เวอร์ชัน 27B และ Max) |
| Andrej Karpathy | ผู้เชี่ยวชาญ AI ที่โพสต์ทวีตเกี่ยวกับการสร้าง Three.js world |
| parameters | พารามิเตอร์ — ตัวเลขที่กำหนดความสามารถของโมเดล (DeepSeek 284B vs Kimi K3 2.8T) |
| agentwikis.com | โปรเจกต์ LLM wikis ฟรีของโทนบิ |
| new portal | แพลตฟอร์มที่ให้บริการ DeepSeek (มีโปรโมชันลด 90%) |
ซับไตเติ้ลภาษาไทย
ดาวน์โหลดหรือดูซับทั้งหมด
1 00:00:00,000 --> 00:00:15,265 ถ้าเพื่อน ๆ เคยดูวิดีโอแนะนำโมเดลของผมมาก่อน 2 00:00:15,265 --> 00:00:26,714 ก็คงจะคุ้นเคยกับ prompt นี้นะครับ 3 00:00:26,714 --> 00:00:42,674 ผมได้ขอให้โมเดลสร้างเว็บไซต์ หน้า landing page 4 00:00:42,674 --> 00:00:58,633 สำหรับเกมส์ที่ผสมผสานระหว่าง Star Wars กับ One
เปิดดูซับไตเติ้ลทั้งหมด (160 segments)
1 00:00:00,000 --> 00:00:15,265 ถ้าเพื่อน ๆ เคยดูวิดีโอแนะนำโมเดลของผมมาก่อน 2 00:00:15,265 --> 00:00:26,714 ก็คงจะคุ้นเคยกับ prompt นี้นะครับ 3 00:00:26,714 --> 00:00:42,674 ผมได้ขอให้โมเดลสร้างเว็บไซต์ หน้า landing page 4 00:00:42,674 --> 00:00:58,633 สำหรับเกมส์ที่ผสมผสานระหว่าง Star Wars กับ One 5 00:00:58,633 --> 00:01:10,082 Piece และขอให้มีลูกโลกที่เรืองแสง 6 00:01:10,082 --> 00:01:22,572 ซึ่งนี่คือสิ่งที่โมเดลสร้างมาให้ครับ 7 00:01:22,572 --> 00:01:31,593 จะเห็นว่ามันโต้ตอบได้ดีมาก 8 00:01:31,593 --> 00:01:46,858 พอเอาเมาส์ไปวางเหนือลูกโลก ลูกโลกก็จะหมุนเอง 9 00:01:46,858 --> 00:02:00,042 ซึ่งเป็นเรื่องที่ผมไม่เคยเห็นมาก่อนเลย 10 00:02:00,042 --> 00:02:14,266 และตอนนี้พอเลื่อนลงมาด้านล่าง มันจะต้องมี 11 00:02:14,266 --> 00:02:29,185 headline โผล่ขึ้นมาในสไตล์ที่เหมือนกระตุก ๆ 12 00:02:29,185 --> 00:03:00,756 ลองมาดูกันว่าจะทำงานได้ไหมนะครับ จะเห็นว่าลูกโลกเริ่มจางหายไป แล้วก็มี headline แบบกระตุก ๆ 13 00:03:00,756 --> 00:03:16,369 โผล่ขึ้นมา "The Odyssey for One Piece begins" 14 00:03:16,369 --> 00:03:26,777 ก็ถือว่าโมเดลนี้ทำได้ดีมากครับ 15 00:03:26,777 --> 00:03:38,573 พอเลื่อนขึ้นมาก็จะกลับมาเหมือนเดิม 16 00:03:38,573 --> 00:03:45,165 ตัวลูกโลกเองดูดีมาก 17 00:03:45,165 --> 00:03:59,736 มันมีองค์ประกอบแบบโต้ตอบได้ซึ่งโมเดลก่อน ๆ 18 00:03:59,736 --> 00:04:10,839 ไม่เคยทำได้ และเอฟเฟกต์ headline 19 00:04:10,839 --> 00:04:19,512 แบบกระตุกก็ทำได้ดีสวยด้วย 20 00:04:19,512 --> 00:04:31,308 ก็ถือว่าโมเดลนี้ทำได้ยอดเยี่ยมครับ 21 00:04:31,308 --> 00:04:40,329 และอย่างที่เพื่อน ๆ คาดไว้ 22 00:04:40,329 --> 00:04:47,614 ถ้าดูจากชื่อวิดีโอนี้ 23 00:04:47,614 --> 00:05:03,227 สิ่งที่เห็นถูกสร้างโดยโมเดล DeepSeek-V4-Flash 24 00:05:03,227 --> 00:05:17,451 0731 ครับ ซึ่งนี่เป็นโจทย์ที่ค่อนข้างง่าย 25 00:05:17,451 --> 00:05:32,717 แต่ในวิดีโอวันนี้เราจะมาลองจัดโมเดลนี้ให้สุด 26 00:05:32,717 --> 00:05:43,472 ทั้งเวอร์ชันคลาวด์ เวอร์ชัน API 27 00:05:43,472 --> 00:05:48,676 อย่างเป็นทางการ 28 00:05:48,676 --> 00:06:02,901 และเวอร์ชันที่รันอยู่บนเครื่องของผมเองเลย 29 00:06:02,901 --> 00:06:17,819 เริ่มกันเลยครับ สำหรับเพื่อน ๆ ที่รัน Agent 30 00:06:17,819 --> 00:06:29,615 Swarm เอง และอยากเข้าถึง LLM wikis 31 00:06:29,615 --> 00:06:50,085 ที่ผมใช้ทำวิดีโอเหล่านี้เพื่อศึกษาข้อมูลและสร้างเนื้อหาจริง 32 00:06:50,085 --> 00:06:51,185 ๆ 33 00:06:51,185 --> 00:07:23,450 ลองแวะดูโปรเจกต์ของผมที่ agentwikis.com นะครับ ผมแชร์ wikis เหล่านี้ทั้งหมดฟรี ในหัวข้อต่าง ๆ 34 00:07:23,450 --> 00:07:38,369 มากมาย และก็มีบัญชี pro ให้สมัครในราคา 9.99 35 00:07:38,369 --> 00:07:53,634 ดอลลาร์ต่อเดือน ซึ่งจะให้สิทธิ์เข้าถึง wikis 36 00:07:53,634 --> 00:07:58,144 ขนาดใหญ่พิเศษ 37 00:07:58,144 --> 00:08:16,532 ที่มีหน้ามากกว่าและรายละเอียดลึกขึ้นในแต่ละหัวข้อครับ 38 00:08:16,532 --> 00:08:32,145 กลับมาที่วิดีโอกันต่อ สัปดาห์ที่แล้ว DeepSeek 39 00:08:32,145 --> 00:08:43,594 ก็ออกโมเดล DeepSeek-V4-Flash 0731 40 00:08:43,594 --> 00:08:56,777 อย่างกะทันหัน เป็นเวอร์ชันใหม่ของโมเดล 41 00:08:56,777 --> 00:09:08,920 DeepSeek รุ่นก่อน ซึ่งจาก benchmark 42 00:09:08,920 --> 00:09:13,431 ที่เห็นตรงนี้ 43 00:09:13,431 --> 00:09:28,002 แสดงให้เห็นถึงการปรับปรุงที่ดีขึ้นอย่างมาก 44 00:09:28,002 --> 00:09:38,063 และพวกเขาก็ปล่อย open weights 45 00:09:38,063 --> 00:09:43,961 ออกมาพร้อมกันด้วย 46 00:09:43,961 --> 00:09:59,921 ก็ถือว่าเป็นการปล่อยที่ค่อนข้างน่าตื่นเต้นครับ 47 00:09:59,921 --> 00:10:07,207 หลายคนรีบไปทดลองทันที 48 00:10:07,207 --> 00:10:27,329 เพราะเรายังไม่เคยเห็นโมเดลที่ทำงานได้ขนาดนี้แต่รันบนแค่สอง 49 00:10:27,329 --> 00:10:42,248 spark เลย และผลลัพธ์บางส่วนก็น่าประทับใจมาก 50 00:10:42,248 --> 00:10:57,860 เช่นคนคนนี้ Mosh Aib ทำสิ่งนี้ใน Hermes Agent 51 00:10:57,860 --> 00:11:06,880 ในราคาแค่ 7 เซ็นต์เท่านั้น 52 00:11:06,880 --> 00:11:14,513 สร้างเกมนี้ออกมาได้เลย 53 00:11:14,513 --> 00:11:25,268 ก็เป็นฟังก์ชันที่น่าประทับใจมาก 54 00:11:25,268 --> 00:11:37,758 แต่ที่สำคัญกว่าคือต้นทุน มันถูกมาก ๆ 55 00:11:37,758 --> 00:11:44,697 และก็เร็วมากด้วยครับ 56 00:11:44,697 --> 00:12:00,309 ส่วนตัวผมคิดว่าอาจจะไม่ได้ทดลอง เพราะผมมี DGX 57 00:12:00,309 --> 00:12:13,840 Spark แค่เครื่องเดียว แต่ Blaze Goodson 58 00:12:13,840 --> 00:12:28,759 ได้ทำงานไปมากพอสมควร และตอนนี้มันรันบนหนึ่ง 59 00:12:28,759 --> 00:12:42,983 spark ได้เต็มที่แล้ว เขาได้ความเร็วประมาณ 60 00:12:42,983 --> 00:12:57,555 1,000 tokens ต่อวินาทีในการ prefill และ 59 61 00:12:57,555 --> 00:13:11,432 tokens ต่อวินาทีสำหรับการรัน multi-agent 62 00:13:11,432 --> 00:13:24,269 serving ซึ่งผมก็ได้ลองรันบน DGX Spark 63 00:13:24,269 --> 00:13:37,800 ของผมเองและได้ตัวเลขที่ใกล้เคียงกันครับ 64 00:13:37,800 --> 00:13:45,086 นี่คือคำอธิบายคร่าว ๆ 65 00:13:45,086 --> 00:13:57,922 ของเวอร์ชันที่ผมสามารถรันในเครื่องได้ 66 00:13:57,922 --> 00:14:12,494 จะเห็นว่าความแตกต่างหลักคือมันถูก quantize 67 00:14:12,494 --> 00:14:22,902 อย่างหนักสำหรับ routed experts 68 00:14:22,902 --> 00:14:44,413 ซึ่งพวกนี้แหละคือส่วนที่จะกินพื้นที่หน่วยความจำมากที่สุดและกิน 69 00:14:44,413 --> 00:14:59,331 activation มากที่สุด จะเห็นว่าตรงนี้เป็น Q2 70 00:14:59,331 --> 00:15:11,474 ครับ ถ้าเพื่อน ๆ ยังไม่รู้จักเรื่อง 71 00:15:11,474 --> 00:15:22,576 quantization (การลดขนาดของโมเดล) 72 00:15:22,576 --> 00:15:36,107 ผมมีวิดีโออธิบายเรื่องนี้โดยละเอียดอยู่ 73 00:15:36,107 --> 00:15:40,617 แต่สรุปง่าย ๆ 74 00:15:40,617 --> 00:16:04,556 ก็คือเป็นวิธีลดขนาดน้ำหนักของโมเดลเพื่อให้สามารถรันโมเดลที่ใหญ่กว่าบน 75 00:16:04,556 --> 00:16:14,617 GPU หรือฮาร์ดแวร์ที่เล็กลงได้ 76 00:16:14,617 --> 00:16:25,719 และเวลาที่คนพูดถึง dense weights 77 00:16:25,719 --> 00:16:37,862 มักจะหมายถึงขนาด 16-bit ครับ 16-bit 78 00:16:37,862 --> 00:16:49,658 มักถูกมองว่าเป็นขนาดเต็มใช่ไหมครับ 79 00:16:49,658 --> 00:16:55,903 การลดลงไปที่ 8-bit 80 00:16:55,903 --> 00:17:08,740 ก็เห็นได้ชัดว่าเป็นครึ่งหนึ่ง และวิธี 81 00:17:08,740 --> 00:17:23,312 quantization สมัยใหม่สามารถลดลงไปที่ 8-bit 82 00:17:23,312 --> 00:17:38,924 ได้ง่ายมากโดยแทบไม่สูญเสียคุณภาพเลย แม้แต่ที่ 83 00:17:38,924 --> 00:17:54,190 4-bit จากนวัตกรรมล่าสุดในเรื่อง quantization 84 00:17:54,190 --> 00:18:06,332 ก็ไม่ได้เห็นความลดลงของคุณภาพมากนัก 85 00:18:06,332 --> 00:18:21,598 แต่พอต่ำกว่า 4-bit ไป เรื่องก็จะเริ่มยากขึ้น 86 00:18:21,598 --> 00:18:25,414 ทำได้นะครับ 87 00:18:25,414 --> 00:18:39,292 แต่จะเจอปัญหาเรื่องความเร็วและคุณภาพบ้าง 88 00:18:39,292 --> 00:18:53,863 ดังนั้นการลดลงไปที่ 2-bit ตรงนี้ถือเป็นการ 89 00:18:53,863 --> 00:19:09,823 quantize อย่างก้าวร้าวมาก แต่มันก็ยังใช้งานได้ 90 00:19:09,823 --> 00:19:21,619 และยังเขียนโค้ดได้ในระดับหนึ่งครับ 91 00:19:21,619 --> 00:19:32,027 ในวิดีโอวันนี้ผมแค่อยากทดลองดู 92 00:19:32,027 --> 00:19:47,639 ไม่ได้เป็นการแนะนำแบบ first look นะครับ first 93 00:19:47,639 --> 00:20:01,170 look ปกติผมมักจะใช้โจทย์ที่ทำได้รวดเร็ว 94 00:20:01,170 --> 00:20:11,925 แต่ครั้งนี้ผมอยากจะทดสอบให้หนัก 95 00:20:11,925 --> 00:20:27,885 ให้โจทย์ที่ท้าทายจริง ๆ ผมจะใช้โจทย์บางส่วนจาก 96 00:20:27,885 --> 00:20:42,456 AI Royal Rumble (การแข่งขัน AI แบบเจาะลึก) 97 00:20:42,456 --> 00:20:57,028 ซึ่งเป็นโจทย์ที่ยาวนานหลายชั่วโมงในบางกรณี 98 00:20:57,028 --> 00:21:10,905 ผมจะส่งให้ทั้งเวอร์ชันเต็มที่รันผ่าน API 99 00:21:10,905 --> 00:21:23,742 บนคลาวด์ ซึ่งเราจะทำผ่าน Hermes Agent 100 00:21:23,742 --> 00:21:42,130 และก็จะใช้โมเดลในเครื่องรันโจทย์เดียวกันทุกประการครับ 101 00:21:42,130 --> 00:21:58,089 หวังว่าเพื่อน ๆ จะได้เห็นว่า DeepSeek-V4-Flash 102 00:21:58,089 --> 00:22:06,069 โมเดลใหม่นี้ทำได้แค่ไหน 103 00:22:06,069 --> 00:22:27,232 รวมถึงความแตกต่างระหว่างเวอร์ชันเต็มบนคลาวด์กับเวอร์ชันที่ถูก 104 00:22:27,232 --> 00:22:37,988 quantize อย่างหนักในเครื่องด้วย 105 00:22:37,988 --> 00:22:53,947 น่าจะน่าสนใจดีนะครับ เริ่มกันเลย เอาล่ะ เพื่อน 106 00:22:53,947 --> 00:23:06,784 ๆ อาจจะจำได้ นี่มาจาก AI Royal Rumble 107 00:23:06,784 --> 00:23:19,621 และอันนี้เฉพาะเจาะจงเป็น Claude Fable 108 00:23:19,621 --> 00:23:28,988 ที่สร้างสิ่งนี้แบบโต้ตอบได้ 109 00:23:28,988 --> 00:23:41,131 มันเป็นเว็บไซต์นะครับ ผมแค่เลื่อนดู 110 00:23:41,131 --> 00:23:50,498 มันมีองค์ประกอบโต้ตอบต่าง ๆ 111 00:23:50,498 --> 00:24:03,335 ผมได้ใช้โจทย์นี้กับโมเดลต่าง ๆ ห้าตัว 112 00:24:03,335 --> 00:24:15,478 และได้ผลลัพธ์ที่น่าสนใจจากทุกตัวเลย 113 00:24:15,478 --> 00:24:23,111 บางตัวก็ทำได้ดีกว่ากัน 114 00:24:23,111 --> 00:24:37,682 แต่ทุกตัวก็สามารถสร้างอะไรบางอย่างออกมาได้ 115 00:24:37,682 --> 00:24:51,560 ดังนั้นเราจะทำโจทย์เดียวกันทุกประการครับ 116 00:24:51,560 --> 00:25:07,172 ผมจะเปลี่ยนหัวข้อ เพื่อไม่ให้มันเป็นการโปรโมต 117 00:25:07,172 --> 00:25:23,132 AI Royal Rumble แต่จะให้โปรโมตตัว DeepSeek เอง 118 00:25:23,132 --> 00:25:32,846 แต่ส่วนที่ยากคือมันมีเยอะมาก 119 00:25:32,846 --> 00:25:43,948 นี่เป็นแค่องค์ประกอบแบบเลื่อนได้ 120 00:25:43,948 --> 00:25:51,234 ไม่มีวิดีโออะไรจริง ๆ 121 00:25:51,234 --> 00:26:02,336 ดังนั้นโมเดลต้องสร้างช่วง moment 122 00:26:02,336 --> 00:26:13,091 ช่วงเปลี่ยนฉากเหล่านี้ขึ้นมาเอง 123 00:26:13,091 --> 00:26:24,887 ซึ่งเป็นเรื่องที่ยากมากสำหรับโมเดล 124 00:26:24,887 --> 00:26:39,806 แต่เราจะมาดูกันว่า DeepSeek จะทำได้ไหม ด้วย 125 00:26:39,806 --> 00:26:41,887 prompt 126 00:26:41,887 --> 00:26:59,234 ที่เหมือนกันทุกประการที่ผมให้กับโมเดลเหล่านั้นครับ 127 00:26:59,234 --> 00:27:15,194 เอาล่ะ เราจะทำในแอป desktop เลย จะเห็นว่าเรามี 128 00:27:15,194 --> 00:27:25,255 DeepSeek-V4-Flash ที่นี่ โอเค 129 00:27:25,255 --> 00:27:35,663 เราต้องการเวอร์ชัน 0731 นะครับ 130 00:27:35,663 --> 00:27:43,990 มีสองสามเวอร์ชันให้เลือก 131 00:27:43,990 --> 00:27:57,867 ต้องแน่ใจว่าเปิดอันนี้อยู่ มันกำลังเริ่ม 132 00:27:57,867 --> 00:28:10,010 session ใหม่ แล้วผมจะใส่ prompt ให้ 133 00:28:10,010 --> 00:28:21,113 นี่คือสิ่งที่ผมให้กับโมเดลอื่น ๆ 134 00:28:21,113 --> 00:28:51,296 ทุกประการ นี่จะเป็นแบบ one-shot นะครับ ต้องทำงานอัตโนมัติ ถามคำถามไม่ได้ แต่โจทย์คือ... 135 00:28:51,296 --> 00:29:04,480 นี่คือ brief ครับ สร้าง launch website 136 00:29:04,480 --> 00:29:20,439 คุณภาพระดับ production สำหรับ DeepSeek V4/0731 137 00:29:20,439 --> 00:29:35,011 แล้วก็มีรายละเอียดทั้งหมดว่าต้องทำอะไรบ้าง 138 00:29:35,011 --> 00:29:53,052 แต่ทางเลือกด้านการออกแบบจะเป็นการตัดสินใจของโมเดลเอง 139 00:29:53,052 --> 00:30:08,317 ผมจะส่ง prompt นี้ให้เวอร์ชันคลาวด์ใน Hermes 140 00:30:08,317 --> 00:30:22,889 Agent แล้วมาดูกันว่ามันทำงานได้อย่างไรครับ 141 00:30:22,889 --> 00:30:39,195 ตอนนี้ผมจะทำแบบเดียวกันกับเวอร์ชันในเครื่องด้วย 142 00:30:39,195 --> 00:30:51,338 เวอร์ชันในเครื่องอยู่บน Spark ของผม 143 00:30:51,338 --> 00:31:07,297 ซึ่งกำลังรันอยู่ตอนนี้ จะเห็นว่าผมสร้าง Hermes 144 00:31:07,297 --> 00:31:23,257 profile พิเศษให้มันแล้ว เรียกว่า DS4 และจะเห็น 145 00:31:23,257 --> 00:31:38,175 DeepSeek chat ซึ่งก็คือโมเดลที่รันในเครื่อง 146 00:31:38,175 --> 00:31:47,543 ลองดูกันว่ามันจะทำงานได้ไหม 147 00:31:47,543 --> 00:32:03,502 ผมสังเกตว่าตอนนี้มันเร็วมากและตอบกลับมาเร็วมาก 148 00:32:03,502 --> 00:32:08,359 ผมจะวาง prompt 149 00:32:08,359 --> 00:32:23,278 นี้ลงไปแล้วดูว่าโมเดลในเครื่องจะทำได้แค่ไหน 150 00:32:23,278 --> 00:32:38,890 และผมจะบอกความจริงว่ามันล้มเหลวหรือสำเร็จครับ 151 00:32:38,890 --> 00:32:51,380 อย่างที่บอก นี่เป็นโจทย์ที่ท้าทายมาก 152 00:32:51,380 --> 00:33:06,298 ไม่ใช่แค่สร้าง landing page ธรรมดา ๆ นะครับ 153 00:33:06,298 --> 00:33:19,829 แต่เป็นโจทย์ออกแบบ front-end ที่ซับซ้อน 154 00:33:19,829 --> 00:33:33,013 ดังนั้นถ้ามันล้มเหลว ก็อาจจะล้มเหลวได้ 155 00:33:33,013 --> 00:33:41,339 อย่าเพิ่งโทษโมเดลเลยครับ 156 00:33:41,339 --> 00:33:56,952 เพราะนี่เป็นเวอร์ชันที่ถูก quantize อย่างหนัก 157 00:33:56,952 --> 00:34:14,993 และถ้ามันสร้างอะไรออกมาได้ก็ถือว่าน่าประทับใจมากแล้ว 158 00:34:14,993 --> 00:34:29,911 น่าจะน่าสนใจที่จะดูความเร็วของมันด้วยนะครับ 159 00:34:29,911 --> 00:34:47,605 จะเห็นว่ามันกำลังทำงานไปได้ด้วยความเร็วที่ไม่เลวเลย 160 00:34:47,605 --> 00:35:05,240 และก็จะเห็นว่าเวอร์ชันคลาวด์ก็ยังคงรันอยู่เช่นกันครับ