▶SUBTHAIแปลไทย · ซับ · พากย์⚙
บทความแปลภาษาไทย · YouTube

How DeepSeek-V4-Flash 0731 REALLY Handles Challenging Tasks

0:000:00
เล่นเสียงต้นฉบับของวิดีโอ พร้อมแสดงซับไทยซิงก์ตามเวลา
กำลังโหลดวิดีโอ…
01

สรุปย่อ

ประเด็นสำคัญจากวิดีโอ

- **ช่อง:** Tonbi's AI Garage · **ความยาว:** ~35 นาที · **ลิงก์:** https://www.youtube.com/watch?v=y9-ILYAhsJk

# สรุป: How DeepSeek-V4-Flash 0731 REALLY Handles Challenging Tasks

- **ช่อง:** Tonbi's AI Garage · **ความยาว:** ~35 นาที · **ลิงก์:** https://www.youtube.com/watch?v=y9-ILYAhsJk

## ประเด็นหลัก

- โทนบิทดสอบ DeepSeek-V4-Flash 0731 อย่างเข้มข้นทั้งสามเวอร์ชัน: คลาวด์, API อย่างเป็นทางการ, และเวอร์ชันในเครื่องบน DGX Spark (Q2 quantized)
- โจทย์แรก: สร้าง launch website คุณภาพระดับ production — เวอร์ชันคลาวด์ทำได้ในระดับเดียวกับ Kimi K3, ส่วนเวอร์ชันในเครื่องสร้าง landing page ที่ใช้งานได้แม้จะมีบั๊กเล็กน้อย
- โจทย์ที่สอง: สร้างโลก Three.js แบบ cinematic จากย่อหน้าแรกของ The Lord of the Rings — เวอร์ชันคลาวด์ทำได้ดีและมีบรรยากาศตอนกลางคืนที่สวยงาม ส่วนเวอร์ชันในเครื่องสร้างฉากได้แต่มีปัญหากล้องสั่น
- โจทย์สุดท้าย: สร้าง time loop puzzle platformer — เวอร์ชันคลาวด์สร้างเกมที่สร้างสรรค์และซับซ้อนกว่าของ Sol และ Kimi K3 ในขณะที่เวอร์ชันในเครื่องก็ทำกลไกหลักได้สำเร็จ
- DeepSeek มีขนาดเพียง 284 พันล้านพารามิเตอร์ (เทียบกับ Kimi K3 ที่ 2.8 ล้านล้าน) แต่ทำผลงานได้ใกล้เคียงหรือบางโจทย์ดีกว่า
- ราคาต่อหน่วยต่ำมาก: input 9 เซ็นต์ / output 18 เซ็นต์ (เทียบกับ Kimi K3 ที่ input 2.9 / output 14)
- ค่าใช้จ่ายรวมในการทดสอบ DeepSeek ทั้งหมดเพียง 53 เซ็นต์ เทียบกับเกมเดียวของ Kimi K3 ที่ 25 ดอลลาร์
- เวอร์ชันในเครื่องรันบน DGX Spark เครื่องเดียว ได้ความเร็ว prefill ~1,000 tokens/วิ และ 59 tokens/วิ สำหรับ multi-agent
- ข้อดีของการรันในเครื่อง: ความเป็นส่วนตัว ไม่มีปัญหาการเชื่อมต่อ, สนุกที่ได้ปรับแต่ง — แม้จะไม่มีข้อได้เปรียบทางเศรษฐกิจในขณะนี้
- โทนบิวางแผนจะทดสอบ Qwen 3.8 สัปดาห์หน้า โดยเฉพาะเวอร์ชัน 27 พันล้านที่สามารถรันในเครื่องได้

## ความเห็นสรุป

DeepSeek-V4-Flash 0731 เป็นโมเดลที่น่าทึ่งในระดับราคาและขนาดของมัน แม้จะเล็กกว่าคู่แข่งอย่าง Kimi K3 ถึงสิบเท่า แต่ก็สามารถรับมือกับโจทย์ท้าทายได้อย่างใกล้เคียงหรือดีกว่าในบางด้าน โดยเฉพาะในด้านความคุ้มค่าแล้ว มันเป็นตัวเลือกที่น่าสนใจมาก สำหรับการรันในเครื่อง แม้จะไม่เหมาะกับงาน coding หนัก ๆ แต่ก็เป็น workhorse ที่ดีสำหรับงานวิจัยและงานที่ใช้เวลานานได้ครับ
02

คำแปลเต็ม

แปลตามบทสนทนาต้นฉบับ ปรับเป็นภาษาไทยธรรมชาติ

ถ้าเพื่อน ๆ เคยดูวิดีโอแนะนำโมเดลของผมมาก่อน ก็คงจะคุ้นเคยกับ prompt นี้นะครับ ผมได้ขอให้โมเดลสร้างเว็บไซต์ หน้า landing page สำหรับเกมส์ที่ผสมผสานระหว่าง Star Wars กับ One Piece และขอให้มีลูกโลกที่เรืองแสง ซึ่งนี่คือสิ่งที่โมเดลสร้างมาให้ครับ จะเห็นว่ามันโต้ตอบได้ดีมาก พอเอาเมาส์ไปวางเหนือลูกโลก ลูกโลกก็จะหมุนเอง ซึ่งเป็นเรื่องที่ผมไม่เคยเห็นมาก่อนเลย และตอนนี้พอเลื่อนลงมาด้านล่าง มันจะต้องมี headline โผล่ขึ้นมาในสไตล์ที่เหมือนกระตุก ๆ ลองมาดูกันว่าจะทำงานได้ไหมนะครับ จะเห็นว่าลูกโลกเริ่มจางหายไป แล้วก็มี headline แบบกระตุก ๆ โผล่ขึ้นมา "The Odyssey for One Piece begins" ก็ถือว่าโมเดลนี้ทำได้ดีมากครับ พอเลื่อนขึ้นมาก็จะกลับมาเหมือนเดิม ตัวลูกโลกเองดูดีมาก มันมีองค์ประกอบแบบโต้ตอบได้ซึ่งโมเดลก่อน ๆ ไม่เคยทำได้ และเอฟเฟกต์ headline แบบกระตุกก็ทำได้ดีสวยด้วย ก็ถือว่าโมเดลนี้ทำได้ยอดเยี่ยมครับ และอย่างที่เพื่อน ๆ คาดไว้ ถ้าดูจากชื่อวิดีโอนี้ สิ่งที่เห็นถูกสร้างโดยโมเดล DeepSeek-V4-Flash 0731 ครับ ซึ่งนี่เป็นโจทย์ที่ค่อนข้างง่าย แต่ในวิดีโอวันนี้เราจะมาลองจัดโมเดลนี้ให้สุด ทั้งเวอร์ชันคลาวด์ เวอร์ชัน API อย่างเป็นทางการ และเวอร์ชันที่รันอยู่บนเครื่องของผมเองเลย เริ่มกันเลยครับ

สำหรับเพื่อน ๆ ที่รัน Agent Swarm เอง และอยากเข้าถึง LLM wikis ที่ผมใช้ทำวิดีโอเหล่านี้เพื่อศึกษาข้อมูลและสร้างเนื้อหาจริง ๆ ลองแวะดูโปรเจกต์ของผมที่ agentwikis.com นะครับ ผมแชร์ wikis เหล่านี้ทั้งหมดฟรี ในหัวข้อต่าง ๆ มากมาย และก็มีบัญชี pro ให้สมัครในราคา 9.99 ดอลลาร์ต่อเดือน ซึ่งจะให้สิทธิ์เข้าถึง wikis ขนาดใหญ่พิเศษ ที่มีหน้ามากกว่าและรายละเอียดลึกขึ้นในแต่ละหัวข้อครับ

กลับมาที่วิดีโอกันต่อ สัปดาห์ที่แล้ว DeepSeek ก็ออกโมเดล DeepSeek-V4-Flash 0731 อย่างกะทันหัน เป็นเวอร์ชันใหม่ของโมเดล DeepSeek รุ่นก่อน ซึ่งจาก benchmark ที่เห็นตรงนี้ แสดงให้เห็นถึงการปรับปรุงที่ดีขึ้นอย่างมาก และพวกเขาก็ปล่อย open weights ออกมาพร้อมกันด้วย ก็ถือว่าเป็นการปล่อยที่ค่อนข้างน่าตื่นเต้นครับ หลายคนรีบไปทดลองทันที เพราะเรายังไม่เคยเห็นโมเดลที่ทำงานได้ขนาดนี้แต่รันบนแค่สอง spark เลย และผลลัพธ์บางส่วนก็น่าประทับใจมาก เช่นคนคนนี้ Mosh Aib ทำสิ่งนี้ใน Hermes Agent ในราคาแค่ 7 เซ็นต์เท่านั้น สร้างเกมนี้ออกมาได้เลย ก็เป็นฟังก์ชันที่น่าประทับใจมาก แต่ที่สำคัญกว่าคือต้นทุน มันถูกมาก ๆ และก็เร็วมากด้วยครับ

ส่วนตัวผมคิดว่าอาจจะไม่ได้ทดลอง เพราะผมมี DGX Spark แค่เครื่องเดียว แต่ Blaze Goodson ได้ทำงานไปมากพอสมควร และตอนนี้มันรันบนหนึ่ง spark ได้เต็มที่แล้ว เขาได้ความเร็วประมาณ 1,000 tokens ต่อวินาทีในการ prefill และ 59 tokens ต่อวินาทีสำหรับการรัน multi-agent serving ซึ่งผมก็ได้ลองรันบน DGX Spark ของผมเองและได้ตัวเลขที่ใกล้เคียงกันครับ นี่คือคำอธิบายคร่าว ๆ ของเวอร์ชันที่ผมสามารถรันในเครื่องได้ จะเห็นว่าความแตกต่างหลักคือมันถูก quantize อย่างหนักสำหรับ routed experts ซึ่งพวกนี้แหละคือส่วนที่จะกินพื้นที่หน่วยความจำมากที่สุดและกิน activation มากที่สุด จะเห็นว่าตรงนี้เป็น Q2 ครับ

ถ้าเพื่อน ๆ ยังไม่รู้จักเรื่อง quantization (การลดขนาดของโมเดล) ผมมีวิดีโออธิบายเรื่องนี้โดยละเอียดอยู่ แต่สรุปง่าย ๆ ก็คือเป็นวิธีลดขนาดน้ำหนักของโมเดลเพื่อให้สามารถรันโมเดลที่ใหญ่กว่าบน GPU หรือฮาร์ดแวร์ที่เล็กลงได้ และเวลาที่คนพูดถึง dense weights มักจะหมายถึงขนาด 16-bit ครับ 16-bit มักถูกมองว่าเป็นขนาดเต็มใช่ไหมครับ การลดลงไปที่ 8-bit ก็เห็นได้ชัดว่าเป็นครึ่งหนึ่ง และวิธี quantization สมัยใหม่สามารถลดลงไปที่ 8-bit ได้ง่ายมากโดยแทบไม่สูญเสียคุณภาพเลย แม้แต่ที่ 4-bit จากนวัตกรรมล่าสุดในเรื่อง quantization ก็ไม่ได้เห็นความลดลงของคุณภาพมากนัก แต่พอต่ำกว่า 4-bit ไป เรื่องก็จะเริ่มยากขึ้น ทำได้นะครับ แต่จะเจอปัญหาเรื่องความเร็วและคุณภาพบ้าง ดังนั้นการลดลงไปที่ 2-bit ตรงนี้ถือเป็นการ quantize อย่างก้าวร้าวมาก แต่มันก็ยังใช้งานได้ และยังเขียนโค้ดได้ในระดับหนึ่งครับ

ในวิดีโอวันนี้ผมแค่อยากทดลองดู ไม่ได้เป็นการแนะนำแบบ first look นะครับ first look ปกติผมมักจะใช้โจทย์ที่ทำได้รวดเร็ว แต่ครั้งนี้ผมอยากจะทดสอบให้หนัก ให้โจทย์ที่ท้าทายจริง ๆ ผมจะใช้โจทย์บางส่วนจาก AI Royal Rumble (การแข่งขัน AI แบบเจาะลึก) ซึ่งเป็นโจทย์ที่ยาวนานหลายชั่วโมงในบางกรณี ผมจะส่งให้ทั้งเวอร์ชันเต็มที่รันผ่าน API บนคลาวด์ ซึ่งเราจะทำผ่าน Hermes Agent และก็จะใช้โมเดลในเครื่องรันโจทย์เดียวกันทุกประการครับ หวังว่าเพื่อน ๆ จะได้เห็นว่า DeepSeek-V4-Flash โมเดลใหม่นี้ทำได้แค่ไหน รวมถึงความแตกต่างระหว่างเวอร์ชันเต็มบนคลาวด์กับเวอร์ชันที่ถูก quantize อย่างหนักในเครื่องด้วย น่าจะน่าสนใจดีนะครับ เริ่มกันเลย

เอาล่ะ เพื่อน ๆ อาจจะจำได้ นี่มาจาก AI Royal Rumble และอันนี้เฉพาะเจาะจงเป็น Claude Fable ที่สร้างสิ่งนี้แบบโต้ตอบได้ มันเป็นเว็บไซต์นะครับ ผมแค่เลื่อนดู มันมีองค์ประกอบโต้ตอบต่าง ๆ ผมได้ใช้โจทย์นี้กับโมเดลต่าง ๆ ห้าตัว และได้ผลลัพธ์ที่น่าสนใจจากทุกตัวเลย บางตัวก็ทำได้ดีกว่ากัน แต่ทุกตัวก็สามารถสร้างอะไรบางอย่างออกมาได้ ดังนั้นเราจะทำโจทย์เดียวกันทุกประการครับ ผมจะเปลี่ยนหัวข้อ เพื่อไม่ให้มันเป็นการโปรโมต AI Royal Rumble แต่จะให้โปรโมตตัว DeepSeek เอง แต่ส่วนที่ยากคือมันมีเยอะมาก นี่เป็นแค่องค์ประกอบแบบเลื่อนได้ ไม่มีวิดีโออะไรจริง ๆ ดังนั้นโมเดลต้องสร้างช่วง moment ช่วงเปลี่ยนฉากเหล่านี้ขึ้นมาเอง ซึ่งเป็นเรื่องที่ยากมากสำหรับโมเดล แต่เราจะมาดูกันว่า DeepSeek จะทำได้ไหม ด้วย prompt ที่เหมือนกันทุกประการที่ผมให้กับโมเดลเหล่านั้นครับ

เอาล่ะ เราจะทำในแอป desktop เลย จะเห็นว่าเรามี DeepSeek-V4-Flash ที่นี่ โอเค เราต้องการเวอร์ชัน 0731 นะครับ มีสองสามเวอร์ชันให้เลือก ต้องแน่ใจว่าเปิดอันนี้อยู่ มันกำลังเริ่ม session ใหม่ แล้วผมจะใส่ prompt ให้ นี่คือสิ่งที่ผมให้กับโมเดลอื่น ๆ ทุกประการ นี่จะเป็นแบบ one-shot นะครับ ต้องทำงานอัตโนมัติ ถามคำถามไม่ได้ แต่โจทย์คือ... นี่คือ brief ครับ สร้าง launch website คุณภาพระดับ production สำหรับ DeepSeek V4/0731 แล้วก็มีรายละเอียดทั้งหมดว่าต้องทำอะไรบ้าง แต่ทางเลือกด้านการออกแบบจะเป็นการตัดสินใจของโมเดลเอง ผมจะส่ง prompt นี้ให้เวอร์ชันคลาวด์ใน Hermes Agent แล้วมาดูกันว่ามันทำงานได้อย่างไรครับ

ตอนนี้ผมจะทำแบบเดียวกันกับเวอร์ชันในเครื่องด้วย เวอร์ชันในเครื่องอยู่บน Spark ของผม ซึ่งกำลังรันอยู่ตอนนี้ จะเห็นว่าผมสร้าง Hermes profile พิเศษให้มันแล้ว เรียกว่า DS4 และจะเห็น DeepSeek chat ซึ่งก็คือโมเดลที่รันในเครื่อง ลองดูกันว่ามันจะทำงานได้ไหม ผมสังเกตว่าตอนนี้มันเร็วมากและตอบกลับมาเร็วมาก ผมจะวาง prompt นี้ลงไปแล้วดูว่าโมเดลในเครื่องจะทำได้แค่ไหน และผมจะบอกความจริงว่ามันล้มเหลวหรือสำเร็จครับ อย่างที่บอก นี่เป็นโจทย์ที่ท้าทายมาก ไม่ใช่แค่สร้าง landing page ธรรมดา ๆ นะครับ แต่เป็นโจทย์ออกแบบ front-end ที่ซับซ้อน ดังนั้นถ้ามันล้มเหลว ก็อาจจะล้มเหลวได้ อย่าเพิ่งโทษโมเดลเลยครับ เพราะนี่เป็นเวอร์ชันที่ถูก quantize อย่างหนัก และถ้ามันสร้างอะไรออกมาได้ก็ถือว่าน่าประทับใจมากแล้ว น่าจะน่าสนใจที่จะดูความเร็วของมันด้วยนะครับ จะเห็นว่ามันกำลังทำงานไปได้ด้วยความเร็วที่ไม่เลวเลย และก็จะเห็นว่าเวอร์ชันคลาวด์ก็ยังคงรันอยู่เช่นกันครับ

03

หมายเหตุการแปล

ความโปร่งใสเกี่ยวกับความไม่แน่นอนในต้นฉบับ

  • ## [ฟังไม่ชัด] Segments
  • ## Uncertain Segments
04

อภิธานศัพท์เทคนิค

คำศัพท์และชื่อผลิตภัณฑ์ที่คงรูปภาษาอังกฤษ

ศัพท์คำแปล / คำอธิบาย
DeepSeek-V4-Flash 0731โมเดล AI ตัวใหม่จาก DeepSeek ที่ถูกทดสอบในวิดีโอ
Hermes Agentแพลตฟอร์ม agent ที่ใช้รันโจทย์ต่าง ๆ ในการทดสอบ
DGX Sparkฮาร์ดแวร์ AI ของ NVIDIA ที่ใช้รันโมเดลในเครื่อง
quantization (Q2/Q4/Q8)การลดขนาดน้ำหนักโมเดลเพื่อให้รันบนฮาร์ดแวร์เล็กลงได้ (16-bit = full, 8-bit = ครึ่งหนึ่ง, 2-bit = อย่างก้าวร้าว)
routed expertsส่วนของโมเดลที่กินหน่วยความจำและ activation มากที่สุด
dense weightsน้ำหนักโมเดลขนาดเต็ม โดยทั่วไปคือ 16-bit
prefillขั้นตอนประมวลผล input ก่อนสร้าง output
multi-agent servingการให้บริการหลาย agent พร้อมกัน
context windowขนาดบริบทสูงสุดที่โมเดลรับได้ (เช่น 100K, 240K, 500K)
Agent Swarmการรัน agent หลายตัวพร้อมกันแบบฝูง
AI Royal Rumbleการแข่งขันทดสอบโมเดล AI หลายตัวกับโจทย์เดียวกัน
one-shotการทำโจทย์ครั้งเดียวจบ โดยไม่มีการแก้ไขหรือถามคำถาม
two-shotการทำโจทย์สองครั้ง (มีการแก้ไขหนึ่งครั้ง)
landing pageหน้าเว็บหลักสำหรับโปรโมตสินค้าหรือบริการ
Three.jsไลบรารี JavaScript สำหรับสร้างกราฟิก 3D บนเว็บ
Mixture of Experts (MoE)สถาปัตยกรรมโมเดลที่ใช้ผู้เชี่ยวชาญย่อยหลายตัว
time loop puzzle platformerเกมแพลตฟอร์มเมอร์ปริศนาที่มีกลไกวนลูปเวลา ผู้เล่นร่วมมือกับตัวเองในอดีต
frontier modelโมเดลระดับแนวหน้าที่ทันสมัยที่สุด
workhorseม้างาน — โมเดลที่ใช้ทำงานทั่วไปได้อย่างน่าเชื่อถือ
long horizon tasksงานที่ใช้เวลานานและมีหลายขั้นตอน
open weightsการปล่อยน้ำหนักโมเดลให้ใช้งานได้ฟรี
OpenRouterแพลตฟอร์มรวม API ของโมเดลต่าง ๆ
fine-tuningการปรับแต่งโมเดลเพิ่มเติมให้เชี่ยวชาญเฉพาะด้าน
Kimi K3โมเดล AI ขนาดใหญ่จาก Moonshot (2.8T พารามิเตอร์)
Fableโมเดล AI หนึ่งในผู้เข้าแข่งขัน AI Royal Rumble
Sol (GPT Sol)โมเดล AI หนึ่งในผู้เข้าแข่งขัน AI Royal Rumble
Opus 5โมเดลของ Anthropic ที่ Andrej Karpathy ใช้สร้าง Three.js world
GLM 5.2โมเดล AI ที่ไม่สามารถสร้าง landing page ได้ในการทดสอบก่อนหน้า
Qwen 3.8โมเดล AI ที่จะออกในสัปดาห์หน้า (เวอร์ชัน 27B และ Max)
Andrej Karpathyผู้เชี่ยวชาญ AI ที่โพสต์ทวีตเกี่ยวกับการสร้าง Three.js world
parametersพารามิเตอร์ — ตัวเลขที่กำหนดความสามารถของโมเดล (DeepSeek 284B vs Kimi K3 2.8T)
agentwikis.comโปรเจกต์ LLM wikis ฟรีของโทนบิ
new portalแพลตฟอร์มที่ให้บริการ DeepSeek (มีโปรโมชันลด 90%)
05

ซับไตเติ้ลภาษาไทย

ดาวน์โหลดหรือดูซับทั้งหมด

1
00:00:00,000 --> 00:00:15,265
ถ้าเพื่อน ๆ เคยดูวิดีโอแนะนำโมเดลของผมมาก่อน

2
00:00:15,265 --> 00:00:26,714
ก็คงจะคุ้นเคยกับ prompt นี้นะครับ

3
00:00:26,714 --> 00:00:42,674
ผมได้ขอให้โมเดลสร้างเว็บไซต์ หน้า landing page

4
00:00:42,674 --> 00:00:58,633
สำหรับเกมส์ที่ผสมผสานระหว่าง Star Wars กับ One
thai-subtitles.srt
SubRip — ใช้กับเครื่องเล่นวิดีโอส่วนใหญ่
↓ ดาวน์โหลด
thai-subtitles.vtt
WebVTT — ใช้กับเว็บ / YouTube
↓ ดาวน์โหลด
เปิดดูซับไตเติ้ลทั้งหมด (160 segments)
1
00:00:00,000 --> 00:00:15,265
ถ้าเพื่อน ๆ เคยดูวิดีโอแนะนำโมเดลของผมมาก่อน

2
00:00:15,265 --> 00:00:26,714
ก็คงจะคุ้นเคยกับ prompt นี้นะครับ

3
00:00:26,714 --> 00:00:42,674
ผมได้ขอให้โมเดลสร้างเว็บไซต์ หน้า landing page

4
00:00:42,674 --> 00:00:58,633
สำหรับเกมส์ที่ผสมผสานระหว่าง Star Wars กับ One

5
00:00:58,633 --> 00:01:10,082
Piece และขอให้มีลูกโลกที่เรืองแสง

6
00:01:10,082 --> 00:01:22,572
ซึ่งนี่คือสิ่งที่โมเดลสร้างมาให้ครับ

7
00:01:22,572 --> 00:01:31,593
จะเห็นว่ามันโต้ตอบได้ดีมาก

8
00:01:31,593 --> 00:01:46,858
พอเอาเมาส์ไปวางเหนือลูกโลก ลูกโลกก็จะหมุนเอง

9
00:01:46,858 --> 00:02:00,042
ซึ่งเป็นเรื่องที่ผมไม่เคยเห็นมาก่อนเลย

10
00:02:00,042 --> 00:02:14,266
และตอนนี้พอเลื่อนลงมาด้านล่าง มันจะต้องมี

11
00:02:14,266 --> 00:02:29,185
headline โผล่ขึ้นมาในสไตล์ที่เหมือนกระตุก ๆ

12
00:02:29,185 --> 00:03:00,756
ลองมาดูกันว่าจะทำงานได้ไหมนะครับ จะเห็นว่าลูกโลกเริ่มจางหายไป แล้วก็มี headline แบบกระตุก ๆ

13
00:03:00,756 --> 00:03:16,369
โผล่ขึ้นมา "The Odyssey for One Piece begins"

14
00:03:16,369 --> 00:03:26,777
ก็ถือว่าโมเดลนี้ทำได้ดีมากครับ

15
00:03:26,777 --> 00:03:38,573
พอเลื่อนขึ้นมาก็จะกลับมาเหมือนเดิม

16
00:03:38,573 --> 00:03:45,165
ตัวลูกโลกเองดูดีมาก

17
00:03:45,165 --> 00:03:59,736
มันมีองค์ประกอบแบบโต้ตอบได้ซึ่งโมเดลก่อน ๆ

18
00:03:59,736 --> 00:04:10,839
ไม่เคยทำได้ และเอฟเฟกต์ headline

19
00:04:10,839 --> 00:04:19,512
แบบกระตุกก็ทำได้ดีสวยด้วย

20
00:04:19,512 --> 00:04:31,308
ก็ถือว่าโมเดลนี้ทำได้ยอดเยี่ยมครับ

21
00:04:31,308 --> 00:04:40,329
และอย่างที่เพื่อน ๆ คาดไว้

22
00:04:40,329 --> 00:04:47,614
ถ้าดูจากชื่อวิดีโอนี้

23
00:04:47,614 --> 00:05:03,227
สิ่งที่เห็นถูกสร้างโดยโมเดล DeepSeek-V4-Flash

24
00:05:03,227 --> 00:05:17,451
0731 ครับ ซึ่งนี่เป็นโจทย์ที่ค่อนข้างง่าย

25
00:05:17,451 --> 00:05:32,717
แต่ในวิดีโอวันนี้เราจะมาลองจัดโมเดลนี้ให้สุด

26
00:05:32,717 --> 00:05:43,472
ทั้งเวอร์ชันคลาวด์ เวอร์ชัน API

27
00:05:43,472 --> 00:05:48,676
อย่างเป็นทางการ

28
00:05:48,676 --> 00:06:02,901
และเวอร์ชันที่รันอยู่บนเครื่องของผมเองเลย

29
00:06:02,901 --> 00:06:17,819
เริ่มกันเลยครับ สำหรับเพื่อน ๆ ที่รัน Agent

30
00:06:17,819 --> 00:06:29,615
Swarm เอง และอยากเข้าถึง LLM wikis

31
00:06:29,615 --> 00:06:50,085
ที่ผมใช้ทำวิดีโอเหล่านี้เพื่อศึกษาข้อมูลและสร้างเนื้อหาจริง

32
00:06:50,085 --> 00:06:51,185
ๆ

33
00:06:51,185 --> 00:07:23,450
ลองแวะดูโปรเจกต์ของผมที่ agentwikis.com นะครับ ผมแชร์ wikis เหล่านี้ทั้งหมดฟรี ในหัวข้อต่าง ๆ

34
00:07:23,450 --> 00:07:38,369
มากมาย และก็มีบัญชี pro ให้สมัครในราคา 9.99

35
00:07:38,369 --> 00:07:53,634
ดอลลาร์ต่อเดือน ซึ่งจะให้สิทธิ์เข้าถึง wikis

36
00:07:53,634 --> 00:07:58,144
ขนาดใหญ่พิเศษ

37
00:07:58,144 --> 00:08:16,532
ที่มีหน้ามากกว่าและรายละเอียดลึกขึ้นในแต่ละหัวข้อครับ

38
00:08:16,532 --> 00:08:32,145
กลับมาที่วิดีโอกันต่อ สัปดาห์ที่แล้ว DeepSeek

39
00:08:32,145 --> 00:08:43,594
ก็ออกโมเดล DeepSeek-V4-Flash 0731

40
00:08:43,594 --> 00:08:56,777
อย่างกะทันหัน เป็นเวอร์ชันใหม่ของโมเดล

41
00:08:56,777 --> 00:09:08,920
DeepSeek รุ่นก่อน ซึ่งจาก benchmark

42
00:09:08,920 --> 00:09:13,431
ที่เห็นตรงนี้

43
00:09:13,431 --> 00:09:28,002
แสดงให้เห็นถึงการปรับปรุงที่ดีขึ้นอย่างมาก

44
00:09:28,002 --> 00:09:38,063
และพวกเขาก็ปล่อย open weights

45
00:09:38,063 --> 00:09:43,961
ออกมาพร้อมกันด้วย

46
00:09:43,961 --> 00:09:59,921
ก็ถือว่าเป็นการปล่อยที่ค่อนข้างน่าตื่นเต้นครับ

47
00:09:59,921 --> 00:10:07,207
หลายคนรีบไปทดลองทันที

48
00:10:07,207 --> 00:10:27,329
เพราะเรายังไม่เคยเห็นโมเดลที่ทำงานได้ขนาดนี้แต่รันบนแค่สอง

49
00:10:27,329 --> 00:10:42,248
spark เลย และผลลัพธ์บางส่วนก็น่าประทับใจมาก

50
00:10:42,248 --> 00:10:57,860
เช่นคนคนนี้ Mosh Aib ทำสิ่งนี้ใน Hermes Agent

51
00:10:57,860 --> 00:11:06,880
ในราคาแค่ 7 เซ็นต์เท่านั้น

52
00:11:06,880 --> 00:11:14,513
สร้างเกมนี้ออกมาได้เลย

53
00:11:14,513 --> 00:11:25,268
ก็เป็นฟังก์ชันที่น่าประทับใจมาก

54
00:11:25,268 --> 00:11:37,758
แต่ที่สำคัญกว่าคือต้นทุน มันถูกมาก ๆ

55
00:11:37,758 --> 00:11:44,697
และก็เร็วมากด้วยครับ

56
00:11:44,697 --> 00:12:00,309
ส่วนตัวผมคิดว่าอาจจะไม่ได้ทดลอง เพราะผมมี DGX

57
00:12:00,309 --> 00:12:13,840
Spark แค่เครื่องเดียว แต่ Blaze Goodson

58
00:12:13,840 --> 00:12:28,759
ได้ทำงานไปมากพอสมควร และตอนนี้มันรันบนหนึ่ง

59
00:12:28,759 --> 00:12:42,983
spark ได้เต็มที่แล้ว เขาได้ความเร็วประมาณ

60
00:12:42,983 --> 00:12:57,555
1,000 tokens ต่อวินาทีในการ prefill และ 59

61
00:12:57,555 --> 00:13:11,432
tokens ต่อวินาทีสำหรับการรัน multi-agent

62
00:13:11,432 --> 00:13:24,269
serving ซึ่งผมก็ได้ลองรันบน DGX Spark

63
00:13:24,269 --> 00:13:37,800
ของผมเองและได้ตัวเลขที่ใกล้เคียงกันครับ

64
00:13:37,800 --> 00:13:45,086
นี่คือคำอธิบายคร่าว ๆ

65
00:13:45,086 --> 00:13:57,922
ของเวอร์ชันที่ผมสามารถรันในเครื่องได้

66
00:13:57,922 --> 00:14:12,494
จะเห็นว่าความแตกต่างหลักคือมันถูก quantize

67
00:14:12,494 --> 00:14:22,902
อย่างหนักสำหรับ routed experts

68
00:14:22,902 --> 00:14:44,413
ซึ่งพวกนี้แหละคือส่วนที่จะกินพื้นที่หน่วยความจำมากที่สุดและกิน

69
00:14:44,413 --> 00:14:59,331
activation มากที่สุด จะเห็นว่าตรงนี้เป็น Q2

70
00:14:59,331 --> 00:15:11,474
ครับ ถ้าเพื่อน ๆ ยังไม่รู้จักเรื่อง

71
00:15:11,474 --> 00:15:22,576
quantization (การลดขนาดของโมเดล)

72
00:15:22,576 --> 00:15:36,107
ผมมีวิดีโออธิบายเรื่องนี้โดยละเอียดอยู่

73
00:15:36,107 --> 00:15:40,617
แต่สรุปง่าย ๆ

74
00:15:40,617 --> 00:16:04,556
ก็คือเป็นวิธีลดขนาดน้ำหนักของโมเดลเพื่อให้สามารถรันโมเดลที่ใหญ่กว่าบน

75
00:16:04,556 --> 00:16:14,617
GPU หรือฮาร์ดแวร์ที่เล็กลงได้

76
00:16:14,617 --> 00:16:25,719
และเวลาที่คนพูดถึง dense weights

77
00:16:25,719 --> 00:16:37,862
มักจะหมายถึงขนาด 16-bit ครับ 16-bit

78
00:16:37,862 --> 00:16:49,658
มักถูกมองว่าเป็นขนาดเต็มใช่ไหมครับ

79
00:16:49,658 --> 00:16:55,903
การลดลงไปที่ 8-bit

80
00:16:55,903 --> 00:17:08,740
ก็เห็นได้ชัดว่าเป็นครึ่งหนึ่ง และวิธี

81
00:17:08,740 --> 00:17:23,312
quantization สมัยใหม่สามารถลดลงไปที่ 8-bit

82
00:17:23,312 --> 00:17:38,924
ได้ง่ายมากโดยแทบไม่สูญเสียคุณภาพเลย แม้แต่ที่

83
00:17:38,924 --> 00:17:54,190
4-bit จากนวัตกรรมล่าสุดในเรื่อง quantization

84
00:17:54,190 --> 00:18:06,332
ก็ไม่ได้เห็นความลดลงของคุณภาพมากนัก

85
00:18:06,332 --> 00:18:21,598
แต่พอต่ำกว่า 4-bit ไป เรื่องก็จะเริ่มยากขึ้น

86
00:18:21,598 --> 00:18:25,414
ทำได้นะครับ

87
00:18:25,414 --> 00:18:39,292
แต่จะเจอปัญหาเรื่องความเร็วและคุณภาพบ้าง

88
00:18:39,292 --> 00:18:53,863
ดังนั้นการลดลงไปที่ 2-bit ตรงนี้ถือเป็นการ

89
00:18:53,863 --> 00:19:09,823
quantize อย่างก้าวร้าวมาก แต่มันก็ยังใช้งานได้

90
00:19:09,823 --> 00:19:21,619
และยังเขียนโค้ดได้ในระดับหนึ่งครับ

91
00:19:21,619 --> 00:19:32,027
ในวิดีโอวันนี้ผมแค่อยากทดลองดู

92
00:19:32,027 --> 00:19:47,639
ไม่ได้เป็นการแนะนำแบบ first look นะครับ first

93
00:19:47,639 --> 00:20:01,170
look ปกติผมมักจะใช้โจทย์ที่ทำได้รวดเร็ว

94
00:20:01,170 --> 00:20:11,925
แต่ครั้งนี้ผมอยากจะทดสอบให้หนัก

95
00:20:11,925 --> 00:20:27,885
ให้โจทย์ที่ท้าทายจริง ๆ ผมจะใช้โจทย์บางส่วนจาก

96
00:20:27,885 --> 00:20:42,456
AI Royal Rumble (การแข่งขัน AI แบบเจาะลึก)

97
00:20:42,456 --> 00:20:57,028
ซึ่งเป็นโจทย์ที่ยาวนานหลายชั่วโมงในบางกรณี

98
00:20:57,028 --> 00:21:10,905
ผมจะส่งให้ทั้งเวอร์ชันเต็มที่รันผ่าน API

99
00:21:10,905 --> 00:21:23,742
บนคลาวด์ ซึ่งเราจะทำผ่าน Hermes Agent

100
00:21:23,742 --> 00:21:42,130
และก็จะใช้โมเดลในเครื่องรันโจทย์เดียวกันทุกประการครับ

101
00:21:42,130 --> 00:21:58,089
หวังว่าเพื่อน ๆ จะได้เห็นว่า DeepSeek-V4-Flash

102
00:21:58,089 --> 00:22:06,069
โมเดลใหม่นี้ทำได้แค่ไหน

103
00:22:06,069 --> 00:22:27,232
รวมถึงความแตกต่างระหว่างเวอร์ชันเต็มบนคลาวด์กับเวอร์ชันที่ถูก

104
00:22:27,232 --> 00:22:37,988
quantize อย่างหนักในเครื่องด้วย

105
00:22:37,988 --> 00:22:53,947
น่าจะน่าสนใจดีนะครับ เริ่มกันเลย เอาล่ะ เพื่อน

106
00:22:53,947 --> 00:23:06,784
ๆ อาจจะจำได้ นี่มาจาก AI Royal Rumble

107
00:23:06,784 --> 00:23:19,621
และอันนี้เฉพาะเจาะจงเป็น Claude Fable

108
00:23:19,621 --> 00:23:28,988
ที่สร้างสิ่งนี้แบบโต้ตอบได้

109
00:23:28,988 --> 00:23:41,131
มันเป็นเว็บไซต์นะครับ ผมแค่เลื่อนดู

110
00:23:41,131 --> 00:23:50,498
มันมีองค์ประกอบโต้ตอบต่าง ๆ

111
00:23:50,498 --> 00:24:03,335
ผมได้ใช้โจทย์นี้กับโมเดลต่าง ๆ ห้าตัว

112
00:24:03,335 --> 00:24:15,478
และได้ผลลัพธ์ที่น่าสนใจจากทุกตัวเลย

113
00:24:15,478 --> 00:24:23,111
บางตัวก็ทำได้ดีกว่ากัน

114
00:24:23,111 --> 00:24:37,682
แต่ทุกตัวก็สามารถสร้างอะไรบางอย่างออกมาได้

115
00:24:37,682 --> 00:24:51,560
ดังนั้นเราจะทำโจทย์เดียวกันทุกประการครับ

116
00:24:51,560 --> 00:25:07,172
ผมจะเปลี่ยนหัวข้อ เพื่อไม่ให้มันเป็นการโปรโมต

117
00:25:07,172 --> 00:25:23,132
AI Royal Rumble แต่จะให้โปรโมตตัว DeepSeek เอง

118
00:25:23,132 --> 00:25:32,846
แต่ส่วนที่ยากคือมันมีเยอะมาก

119
00:25:32,846 --> 00:25:43,948
นี่เป็นแค่องค์ประกอบแบบเลื่อนได้

120
00:25:43,948 --> 00:25:51,234
ไม่มีวิดีโออะไรจริง ๆ

121
00:25:51,234 --> 00:26:02,336
ดังนั้นโมเดลต้องสร้างช่วง moment

122
00:26:02,336 --> 00:26:13,091
ช่วงเปลี่ยนฉากเหล่านี้ขึ้นมาเอง

123
00:26:13,091 --> 00:26:24,887
ซึ่งเป็นเรื่องที่ยากมากสำหรับโมเดล

124
00:26:24,887 --> 00:26:39,806
แต่เราจะมาดูกันว่า DeepSeek จะทำได้ไหม ด้วย

125
00:26:39,806 --> 00:26:41,887
prompt

126
00:26:41,887 --> 00:26:59,234
ที่เหมือนกันทุกประการที่ผมให้กับโมเดลเหล่านั้นครับ

127
00:26:59,234 --> 00:27:15,194
เอาล่ะ เราจะทำในแอป desktop เลย จะเห็นว่าเรามี

128
00:27:15,194 --> 00:27:25,255
DeepSeek-V4-Flash ที่นี่ โอเค

129
00:27:25,255 --> 00:27:35,663
เราต้องการเวอร์ชัน 0731 นะครับ

130
00:27:35,663 --> 00:27:43,990
มีสองสามเวอร์ชันให้เลือก

131
00:27:43,990 --> 00:27:57,867
ต้องแน่ใจว่าเปิดอันนี้อยู่ มันกำลังเริ่ม

132
00:27:57,867 --> 00:28:10,010
session ใหม่ แล้วผมจะใส่ prompt ให้

133
00:28:10,010 --> 00:28:21,113
นี่คือสิ่งที่ผมให้กับโมเดลอื่น ๆ

134
00:28:21,113 --> 00:28:51,296
ทุกประการ นี่จะเป็นแบบ one-shot นะครับ ต้องทำงานอัตโนมัติ ถามคำถามไม่ได้ แต่โจทย์คือ...

135
00:28:51,296 --> 00:29:04,480
นี่คือ brief ครับ สร้าง launch website

136
00:29:04,480 --> 00:29:20,439
คุณภาพระดับ production สำหรับ DeepSeek V4/0731

137
00:29:20,439 --> 00:29:35,011
แล้วก็มีรายละเอียดทั้งหมดว่าต้องทำอะไรบ้าง

138
00:29:35,011 --> 00:29:53,052
แต่ทางเลือกด้านการออกแบบจะเป็นการตัดสินใจของโมเดลเอง

139
00:29:53,052 --> 00:30:08,317
ผมจะส่ง prompt นี้ให้เวอร์ชันคลาวด์ใน Hermes

140
00:30:08,317 --> 00:30:22,889
Agent แล้วมาดูกันว่ามันทำงานได้อย่างไรครับ

141
00:30:22,889 --> 00:30:39,195
ตอนนี้ผมจะทำแบบเดียวกันกับเวอร์ชันในเครื่องด้วย

142
00:30:39,195 --> 00:30:51,338
เวอร์ชันในเครื่องอยู่บน Spark ของผม

143
00:30:51,338 --> 00:31:07,297
ซึ่งกำลังรันอยู่ตอนนี้ จะเห็นว่าผมสร้าง Hermes

144
00:31:07,297 --> 00:31:23,257
profile พิเศษให้มันแล้ว เรียกว่า DS4 และจะเห็น

145
00:31:23,257 --> 00:31:38,175
DeepSeek chat ซึ่งก็คือโมเดลที่รันในเครื่อง

146
00:31:38,175 --> 00:31:47,543
ลองดูกันว่ามันจะทำงานได้ไหม

147
00:31:47,543 --> 00:32:03,502
ผมสังเกตว่าตอนนี้มันเร็วมากและตอบกลับมาเร็วมาก

148
00:32:03,502 --> 00:32:08,359
ผมจะวาง prompt

149
00:32:08,359 --> 00:32:23,278
นี้ลงไปแล้วดูว่าโมเดลในเครื่องจะทำได้แค่ไหน

150
00:32:23,278 --> 00:32:38,890
และผมจะบอกความจริงว่ามันล้มเหลวหรือสำเร็จครับ

151
00:32:38,890 --> 00:32:51,380
อย่างที่บอก นี่เป็นโจทย์ที่ท้าทายมาก

152
00:32:51,380 --> 00:33:06,298
ไม่ใช่แค่สร้าง landing page ธรรมดา ๆ นะครับ

153
00:33:06,298 --> 00:33:19,829
แต่เป็นโจทย์ออกแบบ front-end ที่ซับซ้อน

154
00:33:19,829 --> 00:33:33,013
ดังนั้นถ้ามันล้มเหลว ก็อาจจะล้มเหลวได้

155
00:33:33,013 --> 00:33:41,339
อย่าเพิ่งโทษโมเดลเลยครับ

156
00:33:41,339 --> 00:33:56,952
เพราะนี่เป็นเวอร์ชันที่ถูก quantize อย่างหนัก

157
00:33:56,952 --> 00:34:14,993
และถ้ามันสร้างอะไรออกมาได้ก็ถือว่าน่าประทับใจมากแล้ว

158
00:34:14,993 --> 00:34:29,911
น่าจะน่าสนใจที่จะดูความเร็วของมันด้วยนะครับ

159
00:34:29,911 --> 00:34:47,605
จะเห็นว่ามันกำลังทำงานไปได้ด้วยความเร็วที่ไม่เลวเลย

160
00:34:47,605 --> 00:35:05,240
และก็จะเห็นว่าเวอร์ชันคลาวด์ก็ยังคงรันอยู่เช่นกันครับ