▶SUBTHAIแปลไทย · ซับ · พากย์⚙
บทความแปลภาษาไทย · YouTube

NEW NVIDIA Nemotron 3.5 Lightning is ABSURD!! 🤯

0:000:00
เล่นเสียงต้นฉบับของวิดีโอ พร้อมแสดงซับไทยซิงก์ตามเวลา
กำลังโหลดวิดีโอ…
01

สรุปย่อ

ประเด็นสำคัญจากวิดีโอ

- NVIDIA เปิดตัว Nemotron 3.5 Lightning โมเดล AI ที่มีพารามิเตอร์รวม 30 พันล้าน

# สรุปวิดีโอ: NEW NVIDIA Nemotron 3.5 Lightning is ABSURD!! 🤯

- NVIDIA เปิดตัว Nemotron 3.5 Lightning โมเดล AI ที่มีพารามิเตอร์รวม 30 พันล้าน
  แต่ใช้จริงเพียง 3 พันล้านต่อโทเคน (token) ด้วยสถาปัตยกรรมแบบ Mixture of Experts (MoE)
- โมเดลมี router (ตัวจัดเส้นทาง) ในตัว คอยตัดสินใจว่าแต่ละงานควรให้ "ผู้เชี่ยวชาญ"
  กลุ่มไหนจัดการ ทำให้เหลือทรัพยากรส่วนใหญ่ไม่ต้องทำงานทุกครั้ง
- NVIDIA อ้างว่าโมเดลนี้ให้ความเร็ว output มากกว่าโมเดลระดับเดียวกันถึง 4 เท่า
  และทำงานแบบ agentic tasks เสร็จไวขึ้น 30% โดยความแม่นยำลดลงเล็กน้อย
- AI agents ที่ทำงานยาวๆ ใช้เวลาส่วนใหญ่กับงานซ้ำๆ เช่น เรียกใช้ tools ตรวจสอบผลลัพธ์
  และมอบหมายงานย่อย ซึ่ง Lightning ถูกออกแบบมาเพื่องานแบบนี้โดยเฉพาะ
- โมเดลเป็นแบบ open source เต็มรูปแบบ เผยแพร่ weights, ชุดข้อมูลเทรน และสูตรการฝึก
  ภายใต้สัญญาอนุญาตแบบเปิด (Open Model License 1.1)
- NVIDIA ยังปล่อย NeMo Switchyard ไลบรารีจัดเส้นทางโมเดลแบบ open source สำหรับ AI agents
  ที่ส่งแต่ละพรอมต์ไปยังโมเดลที่เหมาะสมที่สุดโดยไม่ต้องเขียนแอปใหม่
- Nemotron 3.5 Lightning ได้คะแนน 24 บนดัชนี Artificial Analysis Intelligence Index
  สูงขึ้น 9 คะแนนจากรุ่นก่อนอย่าง Nemotron 3 Nano
- โมเดลรันบน GPU สำหรับผู้บริโภคเครื่องเดียวได้ เช่น NVIDIA RTX PC หรือ DGX Spark
  ไม่ต้องมี data center หรือ cloud credits และมีให้ deploy บน Hugging Face, ModelScope,
  OpenRouter และ build.nvidia.com
- สถาปัตยกรรมแบบ hybrid: Mamba 2 + MoE + attention บวก speculative decoding
  ที่ใช้โมเดลร่างเดาโทเคนล่วงหน้าเพื่อสร้างผลลัพธ์เร็วขึ้น
- ภาพรวมใหญ่: NVIDIA กำลังปล่อยทั้ง "สแตก" Lightning (ผู้ทำงานเร็ว) + Switchyard
  (ตัวควบคุม) และมีข่าวว่าเตรียมเปิดตัว Nemotron 4 ตระกูลโมเดลพารามิเตอร์ล้านล้าน

**คำตัดสิน (Verdict):** วิดีโอนี้เป็นการรีวิว/โปรโมตโมเดลใหม่ของ NVIDIA ที่ให้ข้อมูล
เชิงเทคนิคเข้าใจง่าย (พารามิเตอร์, MoE, speculative decoding, ระบบนิเวศโมเดล)
แต่มีส่วนโปรโมตช่อง AI Profit Boardroom และ AI Success Lab ของผู้พูดแทรกอยู่เป็นระยะ
จึงเหมาะสำหรับคนที่อยากอัปเดตข่าว AI และสนใจนำโมเดลไปใช้ในธุรกิจ ควรแยกเนื้อหาความรู้
ออกจากเนื้อหาโปรโมตให้ดีครับ
02

คำแปลเต็ม

แปลตามบทสนทนาต้นฉบับ ปรับเป็นภาษาไทยธรรมชาติ

โมเดลใหม่อย่าง Nemotron 3.5 Lightning (โมเดล AI ของ NVIDIA) เพิ่งเปิดตัว และสิ่งที่ NVIDIA ทำในครั้งนี้โคตรจะสุดจริงๆ ครับ เรื่องมันเป็นแบบนี้ โมเดล AI ส่วนใหญ่เวลารัน มันจะใช้ทรัพยากรทุกอย่างที่มี พารามิเตอร์ทุกตัวทำงานหมด และพอเป็นโมเดลใหญ่ มันก็ใช้เวลานาน ทำให้ทุกอย่างช้าลง

NVIDIA มองเห็นปัญหานี้แล้วก็คิดว่า "แล้วถ้าเราไม่ทำแบบนั้นล่ะ? ถ้าเราสร้างโมเดลที่มีพารามิเตอร์ 30 พันล้าน แต่ให้มันใช้จริงๆ แค่ประมาณ 3 พันล้านต่อครั้งล่ะ?" นั่นแหละคือ Nemotron 3.5 Lightning พารามิเตอร์รวม 30 พันล้าน แต่ใช้จริงแค่ 3 พันล้านต่อโทเคน (token) และการตัดสินใจเพียงข้อเดียวนี้แหละ ที่ทำให้การปล่อยเวอร์ชันนี้น่าจับตามอง

ผมจะอธิบายว่าทำไมมันถึงสำคัญ ลองคิดแบบนี้นะครับ สมมติว่าคุณมีทีม 30 คน เป็นคนเก่ง เป็นผู้เชี่ยวชาญ แต่สำหรับงานส่วนใหญ่ คุณต้องการแค่ 3 คน ทำไมต้องให้ทั้ง 30 คนมาทำงานทุกครั้งล่ะ? มันเสียเวลา ทำให้ทุกอย่างช้าลง Nemotron 3.5 Lightning มี router (ตัวจัดเส้นทาง) ในตัว พองานเข้ามา router ก็ดูว่างานนี้ผู้เชี่ยวชาญกลุ่มไหนต้องจัดการจริงๆ กลุ่มเล็กๆ ก็ตื่นขึ้นมาทำงาน ที่เหลือก็นิ่งเฉย คุณได้คำตอบที่เร็ว แล้วก็ทำแบบนี้ซ้ำแล้วซ้ำเล่า

นั่นคือเหตุผลที่ NVIDIA อ้างว่าโมเดลนี้ให้ความเร็ว output (ผลลัพธ์) มากกว่าโมเดลอื่นในระดับเดียวกันถึง 4 เท่า และทำงานแบบ agentic tasks (งานที่ AI ดำเนินการเอง) เสร็จไวขึ้น 30% โดยที่ความแม่นยำลดลงไม่มากนัก

ถ้ายังไม่เคยรู้จักกัน ผมคือ digital avatar (อวตารดิจิทัล) ของ Julian Goldie ซีอีโอของ Goldie Agency เอเจนซี่ด้าน SEO ระหว่างที่เขาช่วยลูกค้าหาลีดและลูกค้าเพิ่ม ผมอยู่ตรงนี้เพื่ออัปเดตข่าว AI ล่าสุดให้คุณครับ

แล้วทำไมความเร็วถึงสำคัญต่อ AI automation ในธุรกิจของคุณ? เพราะ AI agents (เอเจนต์ AI) ไม่ได้ตอบคำถามหนึ่งคำถามแล้วจบ พวกมันทำงานเป็นลูป เรียกใช้เครื่องมือ ตรวจสอบผลลัพธ์ มอบหมายงาน และรันคำสั่งซ้ำแล้วซ้ำเล่า และถ้าทุกขั้นตอนช้า เวิร์กโฟลว์ทั้งหมดของคุณก็ช้าตามไปด้วย AI agents ที่ทำงานยาวๆ ใช้เวลาส่วนใหญ่ไปกับงานที่ต้องทำซ้ำๆ ในปริมาณมาก ไม่ว่าจะเป็นการเรียกใช้ tools การตรวจสอบผลลัพธ์ หรือการมอบหมายงานให้ sub-agents (เอเจนต์ย่อย) และ Lightning ถูกสร้างมาเพื่อเรื่องนี้โดยเฉพาะ คืองานที่ต้องทำซ้ำๆ อย่างรวดเร็ว

ลองคิดดูว่ามันหมายถึงอะไรกับการทำ lead follow-up (ติดตามลูกค้าเป้าหมาย) แบบอัตโนมัติ การรัน content pipelines (สายพานคอนเทนต์) การจัดการขั้นตอน onboarding (การต้อนรับสมาชิกใหม่) การดูแลการมีส่วนร่วมของสมาชิก อะไรก็ตามที่เอเจนต์ต้องทำงานแบบเดิมซ้ำเป็นร้อยๆ ครั้ง ด้วยโมเดลที่เร็วขนาดนี้ เวิร์กโฟลว์พวกนี้ไม่ใช่แค่รันได้ แต่รันแบบพุ่งปรี๊ดเลยล่ะครับ

และโมเดลนี้เป็นแบบเปิด เต็มรูปแบบ NVIDIA เผยแพร่ weights (ค่าน้ำหนัก) ชุดข้อมูลเทรน และสูตรการฝึก ภายใต้สัญญาอนุญาตแบบเปิด (Open Model License 1.1) คุณดาวน์โหลดไปใช้ ปรับแต่ง (fine-tune) ด้วยข้อมูลของคุณเอง และ deploy ไปที่ไหนก็ได้ตามต้องการ

ตอนนี้ภายใน AI Profit Boardroom เรากำลังสร้างระบบ AI automation แบบครบวงจร โดยเฉพาะกับโมเดลอย่าง NeMo Megatron 3.5 Lightning เรากำลังวางแผนวิธีตั้งค่าเวิร์กโฟลว์แบบ agentic ความเร็วสูง ที่จะขยาย pipeline ของคุณ ทำให้การเลี้ยงลีด (lead nurturing) เป็นอัตโนมัติ จัดการ onboarding สมาชิก และยกภาระงานซ้ำซากออกจากตัวคุณไปเลย

ทุกสัปดาห์เราจัดคอลให้คำปรึกษาสด 4 ครั้ง ซึ่งคุณสามารถถามคำถามเกี่ยวกับการตั้งค่าของคุณโดยตรงและได้คำตอบจริง มีบทช่วยสอนแบบทีละขั้นตอนสำหรับทุกเครื่องมือที่ปล่อยออกมา รวมถึงตัวนี้ด้วย มีแผน 30 วันเพื่อให้รู้ว่าควรสร้างอะไรก่อน มีคลังพรอมต์ (prompt library) และเจ้าของธุรกิจ 3,700 คนที่กำลังใช้เวิร์กโฟลว์เหล่านี้อยู่ตอนนี้ พวกเขาเป็นคนที่คลุกคลีกับเรื่องนี้จริงๆ และพร้อมให้ความช่วยเหลือ 24 ชั่วโมง

ถ้าคุณอยากนำ NeMo Megatron 3.5 Lightning ไปใช้ในธุรกิจอย่างถูกวิธี นี่คือที่ที่คุณควรมาครับ ลิงก์อยู่ในคำอธิบายวิดีโอ หรือเข้าไปที่ AIprofitboardroom.com

ต่อไปนี้คือจุดที่ยิ่งน่าสนใจกว่าเดิม NVIDIA ปล่อยอะไรอีกอย่างออกมาพร้อมกับ Lightning และมันอาจเป็นข่าวที่ใหญ่ที่สุดด้วยซ้ำ มันชื่อว่า NeMo Switchyard ซึ่งเป็นไลบรารีจัดเส้นทางโมเดลแบบ open source สำหรับ AI agents Switchyard จะส่งแต่ละพรอมต์ในเวิร์กโฟลว์ของเอเจนต์ ไปยังโมเดลที่เก่งและมีประสิทธิภาพที่สุดสำหรับขั้นตอนนั้นๆ โดยเลือกจากทั้งโมเดล open source โมเดล proprietary และโมเดลของ NVIDIA โดยไม่ต้องเขียนแอปพลิเคชันใหม่

ลองนึกภาพตามนะครับ เอเจนต์ AI ของคุณได้รับงานที่ซับซ้อน ทั้งวางแผน คิดเชิงเหตุผล วางกลยุทธ์ งานพวกนั้นส่งไปให้โมเดล frontier (โมเดลระดับแนวหน้า) ตัวใหญ่ แล้วพอวางแผนเสร็จ งานลงมือทำทั้งหมด ไม่ว่าจะรันนี่ เช็คนั่น ตรวจสอบนี่ จัดรูปแบบนั่น ทำซ้ำ ก็จะถูกส่งไปที่ NeMo Megatron 3.5 Lightning ซึ่งเร็ว มีประสิทธิภาพ และเชี่ยวชาญเฉพาะทาง หนึ่ง router สองโมเดล ให้ประสิทธิภาพดีกว่าการใช้โมเดลเดียวทำทุกอย่างหลายเท่า

Nemotron 3.5 Lightning ได้คะแนน 24 บนดัชนี Artificial Analysis Intelligence Index ซึ่งพุ่งขึ้น 9 คะแนนเมื่อเทียบกับโมเดลรุ่นก่อนอย่าง Nemotron 3 Nano ดังนั้นคุณไม่ได้แค่ได้โมเดลที่เร็วขึ้น แต่ได้โมเดลที่ฉลาดขึ้นด้วย

มาพูดถึงกันว่าโมเดลตัวนี้รันได้ที่ไหนบ้าง เพราะส่วนนี้เซอร์ไพรส์จริงๆ โมเดลนี้รันบน GPU สำหรับผู้บริโภคเพียงตัวเดียว รวมถึง GPU ในเครื่อง NVIDIA RTX PC หรือระบบ DGX Spark ของบริษัท คุณไม่ต้องมี data center (ศูนย์ข้อมูล) ไม่ต้องมี cloud credits (เครดิตคลาวด์) คุณสามารถรันโมเดล 30 พันล้านพารามิเตอร์ ซึ่งเทียบชั้นกับโมเดลที่ใหญ่กว่า 4 เท่า บน GPU ตั้งโต๊ะเครื่องเดียว

สำหรับเจ้าของธุรกิจที่อยากเก็บเวิร์กโฟลว์ไว้ในเครื่อง เก็บข้อมูลเป็นส่วนตัว และไม่พึ่งพา external APIs (API ภายนอก) สำหรับทุกอย่าง สิ่งนี้ทำให้เป็นไปได้ คุณเป็นเจ้าของระบบทั้งหมด และถ้าอยาก deploy ขึ้นคลาวด์ Nemotron 3.5 Lightning มีให้ใช้งานบน Hugging Face, ModelScope, OpenRouter และ build.nvidia.com ในรูปแบบ NVIDIA NIM microservice รวมถึงแพลตฟอร์มคลาวด์อีกหลากหลาย จะ local จะคลาวด์ จะทั้งสองแบบผสมกันก็ได้

มาพูดถึงสถาปัตยกรรมกัน เพราะนี่คือสิ่งที่ทำให้มันเร็วจริงๆ Nemotron 3.5 Lightning ใช้สถาปัตยกรรมแบบ hybrid ระหว่าง Mamba 2 บวก MoE (Mixture of Experts การผสมผู้เชี่ยวชาญ) บวก attention ชั้น Mamba จัดการการสร้างเนื้อหาโดยไม่ต้องสะสม memory cache (แคชหน่วยความจำ) ก้อนใหญ่ที่ทำให้ช้าลงเมื่องานยาวขึ้น ชั้น MoE จะเปิดใช้งานเฉพาะผู้เชี่ยวชาญที่คุณต้องการ ส่วน selective attention (การใส่ใจแบบเลือกเฉพาะ) ทำให้การให้เหตุผลเฉียบคม ทั้งสามทำงานร่วมกัน แล้ว NVIDIA ก็เพิ่ม speculative decoding (การถอดรหัสแบบคาดเดาล่วงหน้า) ขึ้นไปอีกชั้น

NVIDIA ส่งโมเดล draft (โมเดลร่าง) มาให้สองตัว คือ DSparc สำหรับการอนุมานบน DGX Spark และงาน data center ที่มีการทำงานพร้อมกันต่ำ กับอีกตัวคือ DFlasher นี่คือวิธีทำงานของ speculative decoding แบบเข้าใจง่าย แทนที่จะสร้างทีละโทเคน โมเดลร่างขนาดเล็กกว่าจะเดาคร่าวๆ ว่าโทเคนสองสามตัวถัดไปน่าจะเป็นอะไร จากนั้นโมเดลหลักก็ตรวจสอบ ถ้าถูก ซึ่งมักจะถูกสำหรับงานซ้ำๆ โมเดลก็จะรับหลายโทเคนในขั้นตอนเดียว ทำให้สร้างผลลัพธ์ได้เร็วขึ้น

สำหรับเอเจนต์ที่ทำงานแบบเดิมซ้ำๆ ตลอดเวลา นี่คือจุดที่ speculative decoding ช่วยได้มากที่สุด วิดีโอระบุว่าโมเดลมาพร้อม checkpoint แบบ NVFP4 และ BF16 ที่ใช้ kernel NVFP4 ชุดเดียวกับที่ขับเคลื่อน Nemotron 3 Ultra บน GPU ตระกูล NVIDIA Blackwell, Hopper และ Ampere ไฟล์เดียวกันใช้ได้ทั้งใน data center และบน DGX Spark บนโต๊ะทำงาน โมเดลเดียวกัน น้ำหนักเดียวกัน ไฟล์เดียวกัน คุณเลือกเองว่าจะรันที่ไหน

ทีนี้ขอซูมออกมามองภาพรวม เพราะมันมีเรื่องใหญ่กว่านี้ NVIDIA ไม่ได้แค่ปล่อยโมเดลตัวเดียว แต่ปล่อยทั้งสแตก (stack) Lightning คือตัวทำงานที่เร็ว Switchyard คือตัวควบคุมจราจร และ Reuters รายงานเมื่อวันที่ 11 สิงหาคมว่า NVIDIA กำลังพัฒนา Nemotron 4 ซึ่งเป็นตระกูลโมเดลพารามิเตอร์ล้านล้าน (trillion) โดยมีกลยุทธ์คือขับเคลื่อนทั้งระบบนิเวศผ่านการกระจายโมเดล (model proliferation)

คุณจึงได้ผู้เชี่ยวชาญตัวเล็กที่เร็ว router ที่คอยตัดสินว่าใครควรทำอะไร และโมเดล reasoning แนวหน้าในอนาคตที่จัดการงานคิดยากที่สุด ระบบนิเวศเดียว โมเดลเฉพาะทางหลายตัว แต่ละตัวทำงานที่มันถูกสร้างมา NVIDIA เพิ่งมอบโมเดลทำงานที่เร็ว เปิดกว้าง และเชี่ยวชาญเฉพาะทาง พร้อมระบบจัดเส้นทางให้กับคนที่สร้าง AI automation คำถามเดียวคือคุณจะเริ่มใช้มันเร็วแค่ไหน

ภายใน AI Profit Boardroom เราวางแผนวิธีผสาน Nemotron 3.5 Lightning เข้ากับเวิร์กโฟลว์ธุรกิจจริงไว้แล้ว วิธีตั้งค่าร่วมกับ Switchyard เพื่อให้เอเจนต์ของคุณจัดเส้นทางงานไปยังโมเดลที่ถูกต้อง วิธี fine-tune ด้วยข้อมูลของคุณเอง วิธีสร้าง pipeline แบบทำงานตลอดเวลาที่จัดการการเลี้ยงลีด การมีส่วนร่วมของสมาชิก และการกระจายคอนเทนต์ของคุณโดยอัตโนมัติ

เราจัดคอลให้คำปรึกษาสัปดาห์ละ 4 ครั้ง ซึ่งคุณสามารถนำระบบของคุณมาและรับฟีดแบ็กสดได้ มีบทช่วยสอนรายวันพาคุณผ่านทุกขั้นตอน มีแผน 30 วันเต็มสำหรับสร้างระบบ AI automation ของคุณตั้งแต่ศูนย์ มีคลังพรอมต์ที่สร้างรอบเวิร์กโฟลว์แบบ agentic และเจ้าของธุรกิจ 3,700 คนในนั้น หลายคนกำลังสร้างด้วยระบบนิเวศโมเดลของ NVIDIA อยู่แล้ว และพร้อมให้ความช่วยเหลือ 24/7

ถ้าอยากสร้างอย่างจริงจังและได้ผลลัพธ์จริง มาร่วมกับเราได้ครับ ลิงก์อยู่ในคำอธิบายวิดีโอ หรือไปที่ aiprofitboardroom.com และถ้าอยากได้ SOPs เต็มรูปแบบ เวิร์กโฟลว์ และกรณีการใช้งาน AI กว่า 100 กรณี รวมถึงการตั้งค่า Nemotron 3.5 Lightning ที่นำไปต่อเข้ากับธุรกิจของคุณได้ทันที เข้าร่วม AI Success Lab ได้เลย ฟรีครับ มีสมาชิก 87,000 คน โน้ตทั้งหมดจากวิดีโอนี้อยู่ในนั้น พร้อมคำแนะนำทีละขั้นตอนสำหรับทุกอย่างที่เราครอบคลุมวันนี้ ลิงก์อยู่ในคอมเมนต์และคำอธิบายวิดีโอครับ

03

หมายเหตุการแปล

ความโปร่งใสเกี่ยวกับความไม่แน่นอนในต้นฉบับ

  • ## จุดที่ไม่ชัดเจน (Unclear Segments)
  • ไม่มี segment ใดที่ฟังไม่ชัดจนต้องใช้ [ฟังไม่ชัด]
04

อภิธานศัพท์เทคนิค

คำศัพท์และชื่อผลิตภัณฑ์ที่คงรูปภาษาอังกฤษ

ศัพท์คำแปล / คำอธิบาย
English termThai meaning
Nemotron 3.5 Lightningโมเดล AI ของ NVIDIA ที่ใช้พารามิเตอร์เพียง 3 พันล้านจากทั้งหมด 30 พันล้านต่อโทเคน
parameterพารามิเตอร์ ค่าภายในโมเดลที่ใช้ประมวลผลข้อมูล
tokenโทเคน หน่วยย่อยของข้อความที่โมเดลประมวลผลทีละหน่วย
routerตัวจัดเส้นทาง/ตัวตัดสินใจว่างานไหนควรใช้ผู้เชี่ยวชาญตัวใด
expertผู้เชี่ยวชาญ (ในบริบท MoE คือส่วนย่อยของโมเดลที่เชี่ยวชาญเฉพาะด้าน)
outputผลลัพธ์ที่โมเดลสร้างออกมา
agentic taskงานที่ AI agent ดำเนินการด้วยตนเองแบบมีเป้าหมาย
AI agentเอเจนต์ AI โปรแกรม AI ที่ทำงานเป็นขั้นตอนเพื่อให้บรรลุเป้าหมาย
sub-agentเอเจนต์ย่อยที่รับงานต่อจากเอเจนต์หลัก
tool / toolsเครื่องมือที่เอเจนต์เรียกใช้เพื่อทำงาน
workflowเวิร์กโฟลว์ ลำดับขั้นตอนการทำงานอัตโนมัติ
lead follow-upการติดตามลูกค้าเป้าหมาย (lead)
lead nurturingการเลี้ยงลีด/ดูแลลูกค้าเป้าหมายอย่างต่อเนื่อง
content pipelineสายพานการผลิตและเผยแพร่คอนเทนต์อัตโนมัติ
onboardingขั้นตอนต้อนรับ/ปูทางให้สมาชิกหรือผู้ใช้ใหม่เริ่มใช้งาน
member engagementการสร้างการมีส่วนร่วมของสมาชิก
weightsค่าน้ำหนักของโมเดลที่ผ่านการฝึกแล้ว
fine-tuneปรับแต่งโมเดลเพิ่มด้วยข้อมูลเฉพาะของตัวเอง
deployนำโมเดลไปติดตั้ง/ใช้งานจริง
open sourceโอเพนซอร์ส ซอฟต์แวร์ที่เปิดเผยโค้ด/ทรัพยากรให้ใช้ได้อิสระ
Open Model Licenseสัญญาอนุญาตแบบเปิดสำหรับโมเดล
NeMo Megatron 3.5 Lightningชื่อโมเดลที่ผู้พูดใช้เรียก (ตามคำบรรยายอัตโนมัติ)
NeMo Switchyardไลบรารีจัดเส้นทางโมเดลแบบ open source สำหรับ AI agents ของ NVIDIA
frontier modelโมเดล AI ระดับแนวหน้าที่เก่งที่สุดในยุคปัจจุบัน
reasoningการให้เหตุผล/การคิดเชิงตรรกะของโมเดล
Artificial Analysis Intelligence Indexดัชนีวัดความสามารถ AI ของ Artificial Analysis
GPUหน่วยประมวลผลกราฟิก
consumer GPUGPU สำหรับผู้บริโภคทั่วไป (ไม่ใช่ระดับ data center)
RTX PCคอมพิวเตอร์ที่ใช้การ์ดจอ NVIDIA RTX
DGX Sparkคอมพิวเตอร์ AI บนโต๊ะทำงานของ NVIDIA
data centerศูนย์ข้อมูล
cloud creditsเครดิตสำหรับใช้บริการคลาวด์
external APIAPI ภายนอกที่ต้องเรียกใช้บริการจากภายนอก
APIอินเทอร์เฟซสำหรับเชื่อมต่อโปรแกรมเข้าด้วยกัน
microserviceไมโครเซอร์วิส บริการย่อยที่เรียกใช้แยกกันได้
Hugging Faceแพลตฟอร์มโฮสต์โมเดล AI ยอดนิยม
ModelScopeแพลตฟอร์มโฮสต์โมเดล AI ของอาลีบาบา
OpenRouterบริการรวม API โมเดล AI หลายตัวในที่เดียว
NIM (NVIDIA NIM)ชุดไมโครเซอร์วิสสำหรับรันโมเดล AI ของ NVIDIA
architectureสถาปัตยกรรม โครงสร้างการออกแบบของโมเดล
Mamba 2สถาปัตยกรรมโมเดลแบบหนึ่งที่จัดการหน่วยความจำได้มีประสิทธิภาพ
MoE (Mixture of Experts)การผสมผู้เชี่ยวชาญ เปิดใช้เฉพาะส่วนย่อยที่จำเป็นของโมเดล
attentionกลไกการใส่ใจที่ช่วยให้โมเดลให้เหตุผลได้แม่นยำ
selective attentionการใส่ใจแบบเลือกเฉพาะจุดที่เกี่ยวข้อง
speculative decodingการถอดรหัสแบบคาดเดาล่วงหน้าเพื่อเพิ่มความเร็วในการสร้างข้อความ
draft modelโมเดลร่างขนาดเล็กที่เดาโทเคนถัดไปล่วงหน้า
checkpointไฟล์บันทึกสถานะ/ค่าน้ำหนักของโมเดลที่พร้อมใช้งาน
NVFP4 / BF16รูปแบบความแม่นยำตัวเลขที่ใช้เก็บค่าน้ำหนักโมเดล
kernelโปรแกรมย่อยที่รันบน GPU สำหรับคำนวณเฉพาะทาง
Blackwell / Hopper / Ampereสถาปัตยกรรม GPU รุ่นต่างๆ ของ NVIDIA
stackสแตก ชุดเทคโนโลยีที่ทำงานร่วมกันเป็นระบบ
model proliferationการกระจายโมเดลหลายรุ่นให้แพร่หลายในระบบนิเวศ
promptพรอมต์ คำสั่ง/คำถามที่ป้อนให้โมเดล
prompt libraryคลังรวมพรอมต์สำเร็จรูปสำหรับใช้งานต่างๆ
pipelineท่อส่งงาน/กระบวนการอัตโนมัติต่อเนื่อง
automationระบบอัตโนมัติ
AI automationการนำ AI มาทำงานอัตโนมัติในธุรกิจ
avatarอวตาร ตัวแทนดิจิทัล
SOPขั้นตอนการปฏิบัติงานมาตรฐาน (Standard Operating Procedure)
coaching callคอลให้คำปรึกษาแบบตัวต่อตัว/กลุ่ม
roadmapแผนเส้นทาง/แผนปฏิบัติงานตามช่วงเวลา
24/7ตลอด 24 ชั่วโมงทุกวัน
05

ซับไตเติ้ลภาษาไทย

ดาวน์โหลดหรือดูซับทั้งหมด

1
00:00:00,000 --> 00:00:02,610
โมเดลใหม่อย่าง Nemotron 3.5 Lightning (โมเดล

2
00:00:02,610 --> 00:00:05,280
AI ของ NVIDIA) เพิ่งเปิดตัว และสิ่งที่ NVIDIA

3
00:00:05,280 --> 00:00:07,119
ทำในครั้งนี้โคตรจะสุดจริงๆ ครับ

4
00:00:07,119 --> 00:00:09,729
เรื่องมันเป็นแบบนี้ โมเดล AI ส่วนใหญ่เวลารัน
thai-subtitles.srt
SubRip — ใช้กับเครื่องเล่นวิดีโอส่วนใหญ่
↓ ดาวน์โหลด
thai-subtitles.vtt
WebVTT — ใช้กับเว็บ / YouTube
↓ ดาวน์โหลด
เปิดดูซับไตเติ้ลทั้งหมด (222 segments)
1
00:00:00,000 --> 00:00:02,610
โมเดลใหม่อย่าง Nemotron 3.5 Lightning (โมเดล

2
00:00:02,610 --> 00:00:05,280
AI ของ NVIDIA) เพิ่งเปิดตัว และสิ่งที่ NVIDIA

3
00:00:05,280 --> 00:00:07,119
ทำในครั้งนี้โคตรจะสุดจริงๆ ครับ

4
00:00:07,119 --> 00:00:09,729
เรื่องมันเป็นแบบนี้ โมเดล AI ส่วนใหญ่เวลารัน

5
00:00:09,729 --> 00:00:11,450
มันจะใช้ทรัพยากรทุกอย่างที่มี

6
00:00:11,450 --> 00:00:14,060
พารามิเตอร์ทุกตัวทำงานหมด และพอเป็นโมเดลใหญ่

7
00:00:14,060 --> 00:00:16,492
มันก็ใช้เวลานาน ทำให้ทุกอย่างช้าลง NVIDIA

8
00:00:16,492 --> 00:00:18,094
มองเห็นปัญหานี้แล้วก็คิดว่า

9
00:00:18,094 --> 00:00:19,696
"แล้วถ้าเราไม่ทำแบบนั้นล่ะ?

10
00:00:19,696 --> 00:00:23,315
ถ้าเราสร้างโมเดลที่มีพารามิเตอร์ 30 พันล้าน แต่ให้มันใช้จริงๆ

11
00:00:23,315 --> 00:00:25,925
แค่ประมาณ 3 พันล้านต่อครั้งล่ะ?" นั่นแหละคือ

12
00:00:25,925 --> 00:00:28,298
Nemotron 3.5 Lightning พารามิเตอร์รวม 30

13
00:00:28,298 --> 00:00:30,612
พันล้าน แต่ใช้จริงแค่ 3 พันล้านต่อโทเคน

14
00:00:30,612 --> 00:00:33,103
(token) และการตัดสินใจเพียงข้อเดียวนี้แหละ

15
00:00:33,103 --> 00:00:35,358
ที่ทำให้การปล่อยเวอร์ชันนี้น่าจับตามอง

16
00:00:35,358 --> 00:00:37,019
ผมจะอธิบายว่าทำไมมันถึงสำคัญ

17
00:00:37,019 --> 00:00:39,451
ลองคิดแบบนี้นะครับ สมมติว่าคุณมีทีม 30 คน

18
00:00:39,451 --> 00:00:41,053
เป็นคนเก่ง เป็นผู้เชี่ยวชาญ

19
00:00:41,053 --> 00:00:43,366
แต่สำหรับงานส่วนใหญ่ คุณต้องการแค่ 3 คน

20
00:00:43,366 --> 00:00:45,739
ทำไมต้องให้ทั้ง 30 คนมาทำงานทุกครั้งล่ะ?

21
00:00:45,739 --> 00:00:48,290
มันเสียเวลา ทำให้ทุกอย่างช้าลง Nemotron 3.5

22
00:00:48,290 --> 00:00:50,723
Lightning มี router (ตัวจัดเส้นทาง) ในตัว

23
00:00:50,723 --> 00:00:51,817
พองานเข้ามา router

24
00:00:51,817 --> 00:00:54,664
ก็ดูว่างานนี้ผู้เชี่ยวชาญกลุ่มไหนต้องจัดการจริงๆ

25
00:00:54,664 --> 00:00:57,393
กลุ่มเล็กๆ ก็ตื่นขึ้นมาทำงาน ที่เหลือก็นิ่งเฉย

26
00:00:57,393 --> 00:00:58,487
คุณได้คำตอบที่เร็ว

27
00:00:58,487 --> 00:01:01,156
แล้วก็ทำแบบนี้ซ้ำแล้วซ้ำเล่า นั่นคือเหตุผลที่

28
00:01:01,156 --> 00:01:03,529
NVIDIA อ้างว่าโมเดลนี้ให้ความเร็ว output

29
00:01:03,529 --> 00:01:06,258
(ผลลัพธ์) มากกว่าโมเดลอื่นในระดับเดียวกันถึง 4

30
00:01:06,258 --> 00:01:08,691
เท่า และทำงานแบบ agentic tasks (งานที่ AI

31
00:01:08,691 --> 00:01:10,411
ดำเนินการเอง) เสร็จไวขึ้น 30%

32
00:01:10,411 --> 00:01:12,132
โดยที่ความแม่นยำลดลงไม่มากนัก

33
00:01:12,132 --> 00:01:14,623
ถ้ายังไม่เคยรู้จักกัน ผมคือ digital avatar

34
00:01:14,623 --> 00:01:17,115
(อวตารดิจิทัล) ของ Julian Goldie ซีอีโอของ

35
00:01:17,115 --> 00:01:18,895
Goldie Agency เอเจนซี่ด้าน SEO

36
00:01:18,895 --> 00:01:21,386
ระหว่างที่เขาช่วยลูกค้าหาลีดและลูกค้าเพิ่ม

37
00:01:21,386 --> 00:01:23,166
ผมอยู่ตรงนี้เพื่ออัปเดตข่าว AI

38
00:01:23,166 --> 00:01:25,776
ล่าสุดให้คุณครับ แล้วทำไมความเร็วถึงสำคัญต่อ

39
00:01:25,776 --> 00:01:28,446
AI automation ในธุรกิจของคุณ? เพราะ AI agents

40
00:01:28,446 --> 00:01:30,997
(เอเจนต์ AI) ไม่ได้ตอบคำถามหนึ่งคำถามแล้วจบ

41
00:01:30,997 --> 00:01:33,192
พวกมันทำงานเป็นลูป เรียกใช้เครื่องมือ

42
00:01:33,192 --> 00:01:34,675
ตรวจสอบผลลัพธ์ มอบหมายงาน

43
00:01:34,675 --> 00:01:37,404
และรันคำสั่งซ้ำแล้วซ้ำเล่า และถ้าทุกขั้นตอนช้า

44
00:01:37,404 --> 00:01:39,836
เวิร์กโฟลว์ทั้งหมดของคุณก็ช้าตามไปด้วย AI

45
00:01:39,836 --> 00:01:40,963
agents ที่ทำงานยาวๆ

46
00:01:40,963 --> 00:01:43,099
ใช้เวลาส่วนใหญ่ไปกับงานที่ต้องทำซ้ำๆ

47
00:01:43,099 --> 00:01:45,531
ในปริมาณมาก ไม่ว่าจะเป็นการเรียกใช้ tools

48
00:01:45,531 --> 00:01:47,786
การตรวจสอบผลลัพธ์ หรือการมอบหมายงานให้

49
00:01:47,786 --> 00:01:50,040
sub-agents (เอเจนต์ย่อย) และ Lightning

50
00:01:50,040 --> 00:01:51,938
ถูกสร้างมาเพื่อเรื่องนี้โดยเฉพาะ

51
00:01:51,938 --> 00:01:53,837
คืองานที่ต้องทำซ้ำๆ อย่างรวดเร็ว

52
00:01:53,837 --> 00:01:56,091
ลองคิดดูว่ามันหมายถึงอะไรกับการทำ lead

53
00:01:56,091 --> 00:01:58,761
follow-up (ติดตามลูกค้าเป้าหมาย) แบบอัตโนมัติ

54
00:01:58,761 --> 00:02:01,193
การรัน content pipelines (สายพานคอนเทนต์)

55
00:02:01,193 --> 00:02:02,795
การจัดการขั้นตอน onboarding

56
00:02:02,795 --> 00:02:04,100
(การต้อนรับสมาชิกใหม่)

57
00:02:04,100 --> 00:02:05,820
การดูแลการมีส่วนร่วมของสมาชิก

58
00:02:05,820 --> 00:02:08,609
อะไรก็ตามที่เอเจนต์ต้องทำงานแบบเดิมซ้ำเป็นร้อยๆ

59
00:02:08,609 --> 00:02:10,329
ครั้ง ด้วยโมเดลที่เร็วขนาดนี้

60
00:02:10,329 --> 00:02:12,228
เวิร์กโฟลว์พวกนี้ไม่ใช่แค่รันได้

61
00:02:12,228 --> 00:02:13,889
แต่รันแบบพุ่งปรี๊ดเลยล่ะครับ

62
00:02:13,889 --> 00:02:16,262
และโมเดลนี้เป็นแบบเปิด เต็มรูปแบบ NVIDIA

63
00:02:16,262 --> 00:02:18,753
เผยแพร่ weights (ค่าน้ำหนัก) ชุดข้อมูลเทรน

64
00:02:18,753 --> 00:02:21,364
และสูตรการฝึก ภายใต้สัญญาอนุญาตแบบเปิด (Open

65
00:02:21,364 --> 00:02:24,033
Model License 1.1) คุณดาวน์โหลดไปใช้ ปรับแต่ง

66
00:02:24,033 --> 00:02:26,525
(fine-tune) ด้วยข้อมูลของคุณเอง และ deploy

67
00:02:26,525 --> 00:02:29,194
ไปที่ไหนก็ได้ตามต้องการ ตอนนี้ภายใน AI Profit

68
00:02:29,194 --> 00:02:31,627
Boardroom เรากำลังสร้างระบบ AI automation

69
00:02:31,627 --> 00:02:34,356
แบบครบวงจร โดยเฉพาะกับโมเดลอย่าง NeMo Megatron

70
00:02:34,356 --> 00:02:35,450
3.5 Lightning

71
00:02:35,450 --> 00:02:37,763
เรากำลังวางแผนวิธีตั้งค่าเวิร์กโฟลว์แบบ

72
00:02:37,763 --> 00:02:40,433
agentic ความเร็วสูง ที่จะขยาย pipeline ของคุณ

73
00:02:40,433 --> 00:02:42,450
ทำให้การเลี้ยงลีด (lead nurturing)

74
00:02:42,450 --> 00:02:44,704
เป็นอัตโนมัติ จัดการ onboarding สมาชิก

75
00:02:44,704 --> 00:02:46,781
และยกภาระงานซ้ำซากออกจากตัวคุณไปเลย

76
00:02:46,781 --> 00:02:49,154
ทุกสัปดาห์เราจัดคอลให้คำปรึกษาสด 4 ครั้ง

77
00:02:49,154 --> 00:02:53,128
ซึ่งคุณสามารถถามคำถามเกี่ยวกับการตั้งค่าของคุณโดยตรงและได้คำตอบจริง

78
00:02:53,128 --> 00:02:56,510
มีบทช่วยสอนแบบทีละขั้นตอนสำหรับทุกเครื่องมือที่ปล่อยออกมา

79
00:02:56,510 --> 00:02:57,993
รวมถึงตัวนี้ด้วย มีแผน 30

80
00:02:57,993 --> 00:03:00,722
วันเพื่อให้รู้ว่าควรสร้างอะไรก่อน มีคลังพรอมต์

81
00:03:00,722 --> 00:03:03,036
(prompt library) และเจ้าของธุรกิจ 3,700

82
00:03:03,036 --> 00:03:05,527
คนที่กำลังใช้เวิร์กโฟลว์เหล่านี้อยู่ตอนนี้

83
00:03:05,527 --> 00:03:07,841
พวกเขาเป็นคนที่คลุกคลีกับเรื่องนี้จริงๆ

84
00:03:07,841 --> 00:03:09,917
และพร้อมให้ความช่วยเหลือ 24 ชั่วโมง

85
00:03:09,917 --> 00:03:12,290
ถ้าคุณอยากนำ NeMo Megatron 3.5 Lightning

86
00:03:12,290 --> 00:03:13,773
ไปใช้ในธุรกิจอย่างถูกวิธี

87
00:03:13,773 --> 00:03:15,197
นี่คือที่ที่คุณควรมาครับ

88
00:03:15,197 --> 00:03:17,511
ลิงก์อยู่ในคำอธิบายวิดีโอ หรือเข้าไปที่

89
00:03:17,511 --> 00:03:18,757
AIprofitboardroom.com

90
00:03:18,757 --> 00:03:21,308
ต่อไปนี้คือจุดที่ยิ่งน่าสนใจกว่าเดิม NVIDIA

91
00:03:21,308 --> 00:03:23,681
ปล่อยอะไรอีกอย่างออกมาพร้อมกับ Lightning

92
00:03:23,681 --> 00:03:25,876
และมันอาจเป็นข่าวที่ใหญ่ที่สุดด้วยซ้ำ

93
00:03:25,876 --> 00:03:27,418
มันชื่อว่า NeMo Switchyard

94
00:03:27,418 --> 00:03:30,088
ซึ่งเป็นไลบรารีจัดเส้นทางโมเดลแบบ open source

95
00:03:30,088 --> 00:03:31,689
สำหรับ AI agents Switchyard

96
00:03:31,689 --> 00:03:34,003
จะส่งแต่ละพรอมต์ในเวิร์กโฟลว์ของเอเจนต์

97
00:03:34,003 --> 00:03:37,385
ไปยังโมเดลที่เก่งและมีประสิทธิภาพที่สุดสำหรับขั้นตอนนั้นๆ

98
00:03:37,385 --> 00:03:39,639
โดยเลือกจากทั้งโมเดล open source โมเดล

99
00:03:39,639 --> 00:03:41,419
proprietary และโมเดลของ NVIDIA

100
00:03:41,419 --> 00:03:43,198
โดยไม่ต้องเขียนแอปพลิเคชันใหม่

101
00:03:43,198 --> 00:03:44,919
ลองนึกภาพตามนะครับ เอเจนต์ AI

102
00:03:44,919 --> 00:03:47,055
ของคุณได้รับงานที่ซับซ้อน ทั้งวางแผน

103
00:03:47,055 --> 00:03:48,478
คิดเชิงเหตุผล วางกลยุทธ์

104
00:03:48,478 --> 00:03:50,377
งานพวกนั้นส่งไปให้โมเดล frontier

105
00:03:50,377 --> 00:03:53,046
(โมเดลระดับแนวหน้า) ตัวใหญ่ แล้วพอวางแผนเสร็จ

106
00:03:53,046 --> 00:03:55,479
งานลงมือทำทั้งหมด ไม่ว่าจะรันนี่ เช็คนั่น

107
00:03:55,479 --> 00:03:58,208
ตรวจสอบนี่ จัดรูปแบบนั่น ทำซ้ำ ก็จะถูกส่งไปที่

108
00:03:58,208 --> 00:04:00,343
NeMo Megatron 3.5 Lightning ซึ่งเร็ว

109
00:04:00,343 --> 00:04:02,716
มีประสิทธิภาพ และเชี่ยวชาญเฉพาะทาง หนึ่ง

110
00:04:02,716 --> 00:04:03,810
router สองโมเดล

111
00:04:03,810 --> 00:04:07,014
ให้ประสิทธิภาพดีกว่าการใช้โมเดลเดียวทำทุกอย่างหลายเท่า

112
00:04:07,014 --> 00:04:09,505
Nemotron 3.5 Lightning ได้คะแนน 24 บนดัชนี

113
00:04:09,505 --> 00:04:11,760
Artificial Analysis Intelligence Index

114
00:04:11,760 --> 00:04:12,853
ซึ่งพุ่งขึ้น 9

115
00:04:12,853 --> 00:04:15,523
คะแนนเมื่อเทียบกับโมเดลรุ่นก่อนอย่าง Nemotron

116
00:04:15,523 --> 00:04:18,193
3 Nano ดังนั้นคุณไม่ได้แค่ได้โมเดลที่เร็วขึ้น

117
00:04:18,193 --> 00:04:19,735
แต่ได้โมเดลที่ฉลาดขึ้นด้วย

118
00:04:19,735 --> 00:04:22,167
มาพูดถึงกันว่าโมเดลตัวนี้รันได้ที่ไหนบ้าง

119
00:04:22,167 --> 00:04:24,837
เพราะส่วนนี้เซอร์ไพรส์จริงๆ โมเดลนี้รันบน GPU

120
00:04:24,837 --> 00:04:27,151
สำหรับผู้บริโภคเพียงตัวเดียว รวมถึง GPU

121
00:04:27,151 --> 00:04:29,642
ในเครื่อง NVIDIA RTX PC หรือระบบ DGX Spark

122
00:04:29,642 --> 00:04:31,659
ของบริษัท คุณไม่ต้องมี data center

123
00:04:31,659 --> 00:04:33,854
(ศูนย์ข้อมูล) ไม่ต้องมี cloud credits

124
00:04:33,854 --> 00:04:35,931
(เครดิตคลาวด์) คุณสามารถรันโมเดล 30

125
00:04:35,931 --> 00:04:37,025
พันล้านพารามิเตอร์

126
00:04:37,025 --> 00:04:39,754
ซึ่งเทียบชั้นกับโมเดลที่ใหญ่กว่า 4 เท่า บน GPU

127
00:04:39,754 --> 00:04:40,940
ตั้งโต๊ะเครื่องเดียว

128
00:04:40,940 --> 00:04:44,084
สำหรับเจ้าของธุรกิจที่อยากเก็บเวิร์กโฟลว์ไว้ในเครื่อง

129
00:04:44,084 --> 00:04:46,635
เก็บข้อมูลเป็นส่วนตัว และไม่พึ่งพา external

130
00:04:46,635 --> 00:04:48,534
APIs (API ภายนอก) สำหรับทุกอย่าง

131
00:04:48,534 --> 00:04:49,779
สิ่งนี้ทำให้เป็นไปได้

132
00:04:49,779 --> 00:04:52,330
คุณเป็นเจ้าของระบบทั้งหมด และถ้าอยาก deploy

133
00:04:52,330 --> 00:04:54,288
ขึ้นคลาวด์ Nemotron 3.5 Lightning

134
00:04:54,288 --> 00:04:56,602
มีให้ใช้งานบน Hugging Face, ModelScope,

135
00:04:56,602 --> 00:04:58,975
OpenRouter และ build.nvidia.com ในรูปแบบ

136
00:04:58,975 --> 00:05:00,339
NVIDIA NIM microservice

137
00:05:00,339 --> 00:05:02,772
รวมถึงแพลตฟอร์มคลาวด์อีกหลากหลาย จะ local

138
00:05:02,772 --> 00:05:04,670
จะคลาวด์ จะทั้งสองแบบผสมกันก็ได้

139
00:05:04,670 --> 00:05:05,975
มาพูดถึงสถาปัตยกรรมกัน

140
00:05:05,975 --> 00:05:08,585
เพราะนี่คือสิ่งที่ทำให้มันเร็วจริงๆ Nemotron

141
00:05:08,585 --> 00:05:11,314
3.5 Lightning ใช้สถาปัตยกรรมแบบ hybrid ระหว่าง

142
00:05:11,314 --> 00:05:13,391
Mamba 2 บวก MoE (Mixture of Experts

143
00:05:13,391 --> 00:05:16,001
การผสมผู้เชี่ยวชาญ) บวก attention ชั้น Mamba

144
00:05:16,001 --> 00:05:18,493
จัดการการสร้างเนื้อหาโดยไม่ต้องสะสม memory

145
00:05:18,493 --> 00:05:19,798
cache (แคชหน่วยความจำ)

146
00:05:19,798 --> 00:05:22,467
ก้อนใหญ่ที่ทำให้ช้าลงเมื่องานยาวขึ้น ชั้น MoE

147
00:05:22,467 --> 00:05:24,959
จะเปิดใช้งานเฉพาะผู้เชี่ยวชาญที่คุณต้องการ

148
00:05:24,959 --> 00:05:26,383
ส่วน selective attention

149
00:05:26,383 --> 00:05:27,747
(การใส่ใจแบบเลือกเฉพาะ)

150
00:05:27,747 --> 00:05:30,358
ทำให้การให้เหตุผลเฉียบคม ทั้งสามทำงานร่วมกัน

151
00:05:30,358 --> 00:05:32,731
แล้ว NVIDIA ก็เพิ่ม speculative decoding

152
00:05:32,731 --> 00:05:35,282
(การถอดรหัสแบบคาดเดาล่วงหน้า) ขึ้นไปอีกชั้น

153
00:05:35,282 --> 00:05:37,951
NVIDIA ส่งโมเดล draft (โมเดลร่าง) มาให้สองตัว

154
00:05:37,951 --> 00:05:40,621
คือ DSparc สำหรับการอนุมานบน DGX Spark และงาน

155
00:05:40,621 --> 00:05:42,756
data center ที่มีการทำงานพร้อมกันต่ำ

156
00:05:42,756 --> 00:05:45,129
กับอีกตัวคือ DFlasher นี่คือวิธีทำงานของ

157
00:05:45,129 --> 00:05:47,146
speculative decoding แบบเข้าใจง่าย

158
00:05:47,146 --> 00:05:48,452
แทนที่จะสร้างทีละโทเคน

159
00:05:48,452 --> 00:05:50,350
โมเดลร่างขนาดเล็กกว่าจะเดาคร่าวๆ

160
00:05:50,350 --> 00:05:55,927
ว่าโทเคนสองสามตัวถัดไปน่าจะเป็นอะไร จากนั้นโมเดลหลักก็ตรวจสอบ ถ้าถูก ซึ่งมักจะถูกสำหรับงานซ้ำๆ

161
00:05:55,927 --> 00:05:58,003
โมเดลก็จะรับหลายโทเคนในขั้นตอนเดียว

162
00:05:58,003 --> 00:05:59,664
ทำให้สร้างผลลัพธ์ได้เร็วขึ้น

163
00:05:59,664 --> 00:06:02,096
สำหรับเอเจนต์ที่ทำงานแบบเดิมซ้ำๆ ตลอดเวลา

164
00:06:02,096 --> 00:06:04,054
นี่คือจุดที่ speculative decoding

165
00:06:04,054 --> 00:06:06,546
ช่วยได้มากที่สุด วิดีโอระบุว่าโมเดลมาพร้อม

166
00:06:06,546 --> 00:06:09,097
checkpoint แบบ NVFP4 และ BF16 ที่ใช้ kernel

167
00:06:09,097 --> 00:06:11,529
NVFP4 ชุดเดียวกับที่ขับเคลื่อน Nemotron 3

168
00:06:11,529 --> 00:06:14,139
Ultra บน GPU ตระกูล NVIDIA Blackwell, Hopper

169
00:06:14,139 --> 00:06:16,512
และ Ampere ไฟล์เดียวกันใช้ได้ทั้งใน data

170
00:06:16,512 --> 00:06:18,529
center และบน DGX Spark บนโต๊ะทำงาน

171
00:06:18,529 --> 00:06:21,021
โมเดลเดียวกัน น้ำหนักเดียวกัน ไฟล์เดียวกัน

172
00:06:21,021 --> 00:06:22,504
คุณเลือกเองว่าจะรันที่ไหน

173
00:06:22,504 --> 00:06:23,928
ทีนี้ขอซูมออกมามองภาพรวม

174
00:06:23,928 --> 00:06:25,945
เพราะมันมีเรื่องใหญ่กว่านี้ NVIDIA

175
00:06:25,945 --> 00:06:28,555
ไม่ได้แค่ปล่อยโมเดลตัวเดียว แต่ปล่อยทั้งสแตก

176
00:06:28,555 --> 00:06:30,691
(stack) Lightning คือตัวทำงานที่เร็ว

177
00:06:30,691 --> 00:06:33,064
Switchyard คือตัวควบคุมจราจร และ Reuters

178
00:06:33,064 --> 00:06:35,318
รายงานเมื่อวันที่ 11 สิงหาคมว่า NVIDIA

179
00:06:35,318 --> 00:06:36,564
กำลังพัฒนา Nemotron 4

180
00:06:36,564 --> 00:06:38,818
ซึ่งเป็นตระกูลโมเดลพารามิเตอร์ล้านล้าน

181
00:06:38,818 --> 00:06:39,912
(trillion)

182
00:06:39,912 --> 00:06:43,234
โดยมีกลยุทธ์คือขับเคลื่อนทั้งระบบนิเวศผ่านการกระจายโมเดล

183
00:06:43,234 --> 00:06:44,480
(model proliferation)

184
00:06:44,480 --> 00:06:46,972
คุณจึงได้ผู้เชี่ยวชาญตัวเล็กที่เร็ว router

185
00:06:46,972 --> 00:06:49,701
ที่คอยตัดสินว่าใครควรทำอะไร และโมเดล reasoning

186
00:06:49,701 --> 00:06:51,955
แนวหน้าในอนาคตที่จัดการงานคิดยากที่สุด

187
00:06:51,955 --> 00:06:54,031
ระบบนิเวศเดียว โมเดลเฉพาะทางหลายตัว

188
00:06:54,031 --> 00:06:56,167
แต่ละตัวทำงานที่มันถูกสร้างมา NVIDIA

189
00:06:56,167 --> 00:06:58,244
เพิ่งมอบโมเดลทำงานที่เร็ว เปิดกว้าง

190
00:06:58,244 --> 00:06:59,430
และเชี่ยวชาญเฉพาะทาง

191
00:06:59,430 --> 00:07:01,684
พร้อมระบบจัดเส้นทางให้กับคนที่สร้าง AI

192
00:07:01,684 --> 00:07:02,778
automation

193
00:07:02,778 --> 00:07:05,448
คำถามเดียวคือคุณจะเริ่มใช้มันเร็วแค่ไหน ภายใน

194
00:07:05,448 --> 00:07:08,177
AI Profit Boardroom เราวางแผนวิธีผสาน Nemotron

195
00:07:08,177 --> 00:07:09,271
3.5 Lightning

196
00:07:09,271 --> 00:07:11,347
เข้ากับเวิร์กโฟลว์ธุรกิจจริงไว้แล้ว

197
00:07:11,347 --> 00:07:13,067
วิธีตั้งค่าร่วมกับ Switchyard

198
00:07:13,067 --> 00:07:16,271
เพื่อให้เอเจนต์ของคุณจัดเส้นทางงานไปยังโมเดลที่ถูกต้อง

199
00:07:16,271 --> 00:07:18,881
วิธี fine-tune ด้วยข้อมูลของคุณเอง วิธีสร้าง

200
00:07:18,881 --> 00:07:21,610
pipeline แบบทำงานตลอดเวลาที่จัดการการเลี้ยงลีด

201
00:07:21,610 --> 00:07:22,915
การมีส่วนร่วมของสมาชิก

202
00:07:22,915 --> 00:07:25,170
และการกระจายคอนเทนต์ของคุณโดยอัตโนมัติ

203
00:07:25,170 --> 00:07:27,365
เราจัดคอลให้คำปรึกษาสัปดาห์ละ 4 ครั้ง

204
00:07:27,365 --> 00:07:30,034
ซึ่งคุณสามารถนำระบบของคุณมาและรับฟีดแบ็กสดได้

205
00:07:30,034 --> 00:07:32,704
มีบทช่วยสอนรายวันพาคุณผ่านทุกขั้นตอน มีแผน 30

206
00:07:32,704 --> 00:07:34,840
วันเต็มสำหรับสร้างระบบ AI automation

207
00:07:34,840 --> 00:07:35,933
ของคุณตั้งแต่ศูนย์

208
00:07:35,933 --> 00:07:38,603
มีคลังพรอมต์ที่สร้างรอบเวิร์กโฟลว์แบบ agentic

209
00:07:38,603 --> 00:07:40,442
และเจ้าของธุรกิจ 3,700 คนในนั้น

210
00:07:40,442 --> 00:07:43,052
หลายคนกำลังสร้างด้วยระบบนิเวศโมเดลของ NVIDIA

211
00:07:43,052 --> 00:07:45,307
อยู่แล้ว และพร้อมให้ความช่วยเหลือ 24/7

212
00:07:45,307 --> 00:07:47,739
ถ้าอยากสร้างอย่างจริงจังและได้ผลลัพธ์จริง

213
00:07:47,739 --> 00:07:50,409
มาร่วมกับเราได้ครับ ลิงก์อยู่ในคำอธิบายวิดีโอ

214
00:07:50,409 --> 00:07:53,078
หรือไปที่ aiprofitboardroom.com และถ้าอยากได้

215
00:07:53,078 --> 00:07:55,689
SOPs เต็มรูปแบบ เวิร์กโฟลว์ และกรณีการใช้งาน

216
00:07:55,689 --> 00:07:58,417
AI กว่า 100 กรณี รวมถึงการตั้งค่า Nemotron 3.5

217
00:07:58,417 --> 00:07:59,511
Lightning

218
00:07:59,511 --> 00:08:02,240
ที่นำไปต่อเข้ากับธุรกิจของคุณได้ทันที เข้าร่วม

219
00:08:02,240 --> 00:08:04,910
AI Success Lab ได้เลย ฟรีครับ มีสมาชิก 87,000

220
00:08:04,910 --> 00:08:07,045
คน โน้ตทั้งหมดจากวิดีโอนี้อยู่ในนั้น

221
00:08:07,045 --> 00:08:10,427
พร้อมคำแนะนำทีละขั้นตอนสำหรับทุกอย่างที่เราครอบคลุมวันนี้

222
00:08:10,427 --> 00:08:12,800
ลิงก์อยู่ในคอมเมนต์และคำอธิบายวิดีโอครับ