NEW NVIDIA Nemotron 3.5 Lightning is ABSURD!! 🤯
สรุปย่อ
ประเด็นสำคัญจากวิดีโอ
- NVIDIA เปิดตัว Nemotron 3.5 Lightning โมเดล AI ที่มีพารามิเตอร์รวม 30 พันล้าน
# สรุปวิดีโอ: NEW NVIDIA Nemotron 3.5 Lightning is ABSURD!! 🤯 - NVIDIA เปิดตัว Nemotron 3.5 Lightning โมเดล AI ที่มีพารามิเตอร์รวม 30 พันล้าน แต่ใช้จริงเพียง 3 พันล้านต่อโทเคน (token) ด้วยสถาปัตยกรรมแบบ Mixture of Experts (MoE) - โมเดลมี router (ตัวจัดเส้นทาง) ในตัว คอยตัดสินใจว่าแต่ละงานควรให้ "ผู้เชี่ยวชาญ" กลุ่มไหนจัดการ ทำให้เหลือทรัพยากรส่วนใหญ่ไม่ต้องทำงานทุกครั้ง - NVIDIA อ้างว่าโมเดลนี้ให้ความเร็ว output มากกว่าโมเดลระดับเดียวกันถึง 4 เท่า และทำงานแบบ agentic tasks เสร็จไวขึ้น 30% โดยความแม่นยำลดลงเล็กน้อย - AI agents ที่ทำงานยาวๆ ใช้เวลาส่วนใหญ่กับงานซ้ำๆ เช่น เรียกใช้ tools ตรวจสอบผลลัพธ์ และมอบหมายงานย่อย ซึ่ง Lightning ถูกออกแบบมาเพื่องานแบบนี้โดยเฉพาะ - โมเดลเป็นแบบ open source เต็มรูปแบบ เผยแพร่ weights, ชุดข้อมูลเทรน และสูตรการฝึก ภายใต้สัญญาอนุญาตแบบเปิด (Open Model License 1.1) - NVIDIA ยังปล่อย NeMo Switchyard ไลบรารีจัดเส้นทางโมเดลแบบ open source สำหรับ AI agents ที่ส่งแต่ละพรอมต์ไปยังโมเดลที่เหมาะสมที่สุดโดยไม่ต้องเขียนแอปใหม่ - Nemotron 3.5 Lightning ได้คะแนน 24 บนดัชนี Artificial Analysis Intelligence Index สูงขึ้น 9 คะแนนจากรุ่นก่อนอย่าง Nemotron 3 Nano - โมเดลรันบน GPU สำหรับผู้บริโภคเครื่องเดียวได้ เช่น NVIDIA RTX PC หรือ DGX Spark ไม่ต้องมี data center หรือ cloud credits และมีให้ deploy บน Hugging Face, ModelScope, OpenRouter และ build.nvidia.com - สถาปัตยกรรมแบบ hybrid: Mamba 2 + MoE + attention บวก speculative decoding ที่ใช้โมเดลร่างเดาโทเคนล่วงหน้าเพื่อสร้างผลลัพธ์เร็วขึ้น - ภาพรวมใหญ่: NVIDIA กำลังปล่อยทั้ง "สแตก" Lightning (ผู้ทำงานเร็ว) + Switchyard (ตัวควบคุม) และมีข่าวว่าเตรียมเปิดตัว Nemotron 4 ตระกูลโมเดลพารามิเตอร์ล้านล้าน **คำตัดสิน (Verdict):** วิดีโอนี้เป็นการรีวิว/โปรโมตโมเดลใหม่ของ NVIDIA ที่ให้ข้อมูล เชิงเทคนิคเข้าใจง่าย (พารามิเตอร์, MoE, speculative decoding, ระบบนิเวศโมเดล) แต่มีส่วนโปรโมตช่อง AI Profit Boardroom และ AI Success Lab ของผู้พูดแทรกอยู่เป็นระยะ จึงเหมาะสำหรับคนที่อยากอัปเดตข่าว AI และสนใจนำโมเดลไปใช้ในธุรกิจ ควรแยกเนื้อหาความรู้ ออกจากเนื้อหาโปรโมตให้ดีครับ
คำแปลเต็ม
แปลตามบทสนทนาต้นฉบับ ปรับเป็นภาษาไทยธรรมชาติ
โมเดลใหม่อย่าง Nemotron 3.5 Lightning (โมเดล AI ของ NVIDIA) เพิ่งเปิดตัว และสิ่งที่ NVIDIA ทำในครั้งนี้โคตรจะสุดจริงๆ ครับ เรื่องมันเป็นแบบนี้ โมเดล AI ส่วนใหญ่เวลารัน มันจะใช้ทรัพยากรทุกอย่างที่มี พารามิเตอร์ทุกตัวทำงานหมด และพอเป็นโมเดลใหญ่ มันก็ใช้เวลานาน ทำให้ทุกอย่างช้าลง
NVIDIA มองเห็นปัญหานี้แล้วก็คิดว่า "แล้วถ้าเราไม่ทำแบบนั้นล่ะ? ถ้าเราสร้างโมเดลที่มีพารามิเตอร์ 30 พันล้าน แต่ให้มันใช้จริงๆ แค่ประมาณ 3 พันล้านต่อครั้งล่ะ?" นั่นแหละคือ Nemotron 3.5 Lightning พารามิเตอร์รวม 30 พันล้าน แต่ใช้จริงแค่ 3 พันล้านต่อโทเคน (token) และการตัดสินใจเพียงข้อเดียวนี้แหละ ที่ทำให้การปล่อยเวอร์ชันนี้น่าจับตามอง
ผมจะอธิบายว่าทำไมมันถึงสำคัญ ลองคิดแบบนี้นะครับ สมมติว่าคุณมีทีม 30 คน เป็นคนเก่ง เป็นผู้เชี่ยวชาญ แต่สำหรับงานส่วนใหญ่ คุณต้องการแค่ 3 คน ทำไมต้องให้ทั้ง 30 คนมาทำงานทุกครั้งล่ะ? มันเสียเวลา ทำให้ทุกอย่างช้าลง Nemotron 3.5 Lightning มี router (ตัวจัดเส้นทาง) ในตัว พองานเข้ามา router ก็ดูว่างานนี้ผู้เชี่ยวชาญกลุ่มไหนต้องจัดการจริงๆ กลุ่มเล็กๆ ก็ตื่นขึ้นมาทำงาน ที่เหลือก็นิ่งเฉย คุณได้คำตอบที่เร็ว แล้วก็ทำแบบนี้ซ้ำแล้วซ้ำเล่า
นั่นคือเหตุผลที่ NVIDIA อ้างว่าโมเดลนี้ให้ความเร็ว output (ผลลัพธ์) มากกว่าโมเดลอื่นในระดับเดียวกันถึง 4 เท่า และทำงานแบบ agentic tasks (งานที่ AI ดำเนินการเอง) เสร็จไวขึ้น 30% โดยที่ความแม่นยำลดลงไม่มากนัก
ถ้ายังไม่เคยรู้จักกัน ผมคือ digital avatar (อวตารดิจิทัล) ของ Julian Goldie ซีอีโอของ Goldie Agency เอเจนซี่ด้าน SEO ระหว่างที่เขาช่วยลูกค้าหาลีดและลูกค้าเพิ่ม ผมอยู่ตรงนี้เพื่ออัปเดตข่าว AI ล่าสุดให้คุณครับ
แล้วทำไมความเร็วถึงสำคัญต่อ AI automation ในธุรกิจของคุณ? เพราะ AI agents (เอเจนต์ AI) ไม่ได้ตอบคำถามหนึ่งคำถามแล้วจบ พวกมันทำงานเป็นลูป เรียกใช้เครื่องมือ ตรวจสอบผลลัพธ์ มอบหมายงาน และรันคำสั่งซ้ำแล้วซ้ำเล่า และถ้าทุกขั้นตอนช้า เวิร์กโฟลว์ทั้งหมดของคุณก็ช้าตามไปด้วย AI agents ที่ทำงานยาวๆ ใช้เวลาส่วนใหญ่ไปกับงานที่ต้องทำซ้ำๆ ในปริมาณมาก ไม่ว่าจะเป็นการเรียกใช้ tools การตรวจสอบผลลัพธ์ หรือการมอบหมายงานให้ sub-agents (เอเจนต์ย่อย) และ Lightning ถูกสร้างมาเพื่อเรื่องนี้โดยเฉพาะ คืองานที่ต้องทำซ้ำๆ อย่างรวดเร็ว
ลองคิดดูว่ามันหมายถึงอะไรกับการทำ lead follow-up (ติดตามลูกค้าเป้าหมาย) แบบอัตโนมัติ การรัน content pipelines (สายพานคอนเทนต์) การจัดการขั้นตอน onboarding (การต้อนรับสมาชิกใหม่) การดูแลการมีส่วนร่วมของสมาชิก อะไรก็ตามที่เอเจนต์ต้องทำงานแบบเดิมซ้ำเป็นร้อยๆ ครั้ง ด้วยโมเดลที่เร็วขนาดนี้ เวิร์กโฟลว์พวกนี้ไม่ใช่แค่รันได้ แต่รันแบบพุ่งปรี๊ดเลยล่ะครับ
และโมเดลนี้เป็นแบบเปิด เต็มรูปแบบ NVIDIA เผยแพร่ weights (ค่าน้ำหนัก) ชุดข้อมูลเทรน และสูตรการฝึก ภายใต้สัญญาอนุญาตแบบเปิด (Open Model License 1.1) คุณดาวน์โหลดไปใช้ ปรับแต่ง (fine-tune) ด้วยข้อมูลของคุณเอง และ deploy ไปที่ไหนก็ได้ตามต้องการ
ตอนนี้ภายใน AI Profit Boardroom เรากำลังสร้างระบบ AI automation แบบครบวงจร โดยเฉพาะกับโมเดลอย่าง NeMo Megatron 3.5 Lightning เรากำลังวางแผนวิธีตั้งค่าเวิร์กโฟลว์แบบ agentic ความเร็วสูง ที่จะขยาย pipeline ของคุณ ทำให้การเลี้ยงลีด (lead nurturing) เป็นอัตโนมัติ จัดการ onboarding สมาชิก และยกภาระงานซ้ำซากออกจากตัวคุณไปเลย
ทุกสัปดาห์เราจัดคอลให้คำปรึกษาสด 4 ครั้ง ซึ่งคุณสามารถถามคำถามเกี่ยวกับการตั้งค่าของคุณโดยตรงและได้คำตอบจริง มีบทช่วยสอนแบบทีละขั้นตอนสำหรับทุกเครื่องมือที่ปล่อยออกมา รวมถึงตัวนี้ด้วย มีแผน 30 วันเพื่อให้รู้ว่าควรสร้างอะไรก่อน มีคลังพรอมต์ (prompt library) และเจ้าของธุรกิจ 3,700 คนที่กำลังใช้เวิร์กโฟลว์เหล่านี้อยู่ตอนนี้ พวกเขาเป็นคนที่คลุกคลีกับเรื่องนี้จริงๆ และพร้อมให้ความช่วยเหลือ 24 ชั่วโมง
ถ้าคุณอยากนำ NeMo Megatron 3.5 Lightning ไปใช้ในธุรกิจอย่างถูกวิธี นี่คือที่ที่คุณควรมาครับ ลิงก์อยู่ในคำอธิบายวิดีโอ หรือเข้าไปที่ AIprofitboardroom.com
ต่อไปนี้คือจุดที่ยิ่งน่าสนใจกว่าเดิม NVIDIA ปล่อยอะไรอีกอย่างออกมาพร้อมกับ Lightning และมันอาจเป็นข่าวที่ใหญ่ที่สุดด้วยซ้ำ มันชื่อว่า NeMo Switchyard ซึ่งเป็นไลบรารีจัดเส้นทางโมเดลแบบ open source สำหรับ AI agents Switchyard จะส่งแต่ละพรอมต์ในเวิร์กโฟลว์ของเอเจนต์ ไปยังโมเดลที่เก่งและมีประสิทธิภาพที่สุดสำหรับขั้นตอนนั้นๆ โดยเลือกจากทั้งโมเดล open source โมเดล proprietary และโมเดลของ NVIDIA โดยไม่ต้องเขียนแอปพลิเคชันใหม่
ลองนึกภาพตามนะครับ เอเจนต์ AI ของคุณได้รับงานที่ซับซ้อน ทั้งวางแผน คิดเชิงเหตุผล วางกลยุทธ์ งานพวกนั้นส่งไปให้โมเดล frontier (โมเดลระดับแนวหน้า) ตัวใหญ่ แล้วพอวางแผนเสร็จ งานลงมือทำทั้งหมด ไม่ว่าจะรันนี่ เช็คนั่น ตรวจสอบนี่ จัดรูปแบบนั่น ทำซ้ำ ก็จะถูกส่งไปที่ NeMo Megatron 3.5 Lightning ซึ่งเร็ว มีประสิทธิภาพ และเชี่ยวชาญเฉพาะทาง หนึ่ง router สองโมเดล ให้ประสิทธิภาพดีกว่าการใช้โมเดลเดียวทำทุกอย่างหลายเท่า
Nemotron 3.5 Lightning ได้คะแนน 24 บนดัชนี Artificial Analysis Intelligence Index ซึ่งพุ่งขึ้น 9 คะแนนเมื่อเทียบกับโมเดลรุ่นก่อนอย่าง Nemotron 3 Nano ดังนั้นคุณไม่ได้แค่ได้โมเดลที่เร็วขึ้น แต่ได้โมเดลที่ฉลาดขึ้นด้วย
มาพูดถึงกันว่าโมเดลตัวนี้รันได้ที่ไหนบ้าง เพราะส่วนนี้เซอร์ไพรส์จริงๆ โมเดลนี้รันบน GPU สำหรับผู้บริโภคเพียงตัวเดียว รวมถึง GPU ในเครื่อง NVIDIA RTX PC หรือระบบ DGX Spark ของบริษัท คุณไม่ต้องมี data center (ศูนย์ข้อมูล) ไม่ต้องมี cloud credits (เครดิตคลาวด์) คุณสามารถรันโมเดล 30 พันล้านพารามิเตอร์ ซึ่งเทียบชั้นกับโมเดลที่ใหญ่กว่า 4 เท่า บน GPU ตั้งโต๊ะเครื่องเดียว
สำหรับเจ้าของธุรกิจที่อยากเก็บเวิร์กโฟลว์ไว้ในเครื่อง เก็บข้อมูลเป็นส่วนตัว และไม่พึ่งพา external APIs (API ภายนอก) สำหรับทุกอย่าง สิ่งนี้ทำให้เป็นไปได้ คุณเป็นเจ้าของระบบทั้งหมด และถ้าอยาก deploy ขึ้นคลาวด์ Nemotron 3.5 Lightning มีให้ใช้งานบน Hugging Face, ModelScope, OpenRouter และ build.nvidia.com ในรูปแบบ NVIDIA NIM microservice รวมถึงแพลตฟอร์มคลาวด์อีกหลากหลาย จะ local จะคลาวด์ จะทั้งสองแบบผสมกันก็ได้
มาพูดถึงสถาปัตยกรรมกัน เพราะนี่คือสิ่งที่ทำให้มันเร็วจริงๆ Nemotron 3.5 Lightning ใช้สถาปัตยกรรมแบบ hybrid ระหว่าง Mamba 2 บวก MoE (Mixture of Experts การผสมผู้เชี่ยวชาญ) บวก attention ชั้น Mamba จัดการการสร้างเนื้อหาโดยไม่ต้องสะสม memory cache (แคชหน่วยความจำ) ก้อนใหญ่ที่ทำให้ช้าลงเมื่องานยาวขึ้น ชั้น MoE จะเปิดใช้งานเฉพาะผู้เชี่ยวชาญที่คุณต้องการ ส่วน selective attention (การใส่ใจแบบเลือกเฉพาะ) ทำให้การให้เหตุผลเฉียบคม ทั้งสามทำงานร่วมกัน แล้ว NVIDIA ก็เพิ่ม speculative decoding (การถอดรหัสแบบคาดเดาล่วงหน้า) ขึ้นไปอีกชั้น
NVIDIA ส่งโมเดล draft (โมเดลร่าง) มาให้สองตัว คือ DSparc สำหรับการอนุมานบน DGX Spark และงาน data center ที่มีการทำงานพร้อมกันต่ำ กับอีกตัวคือ DFlasher นี่คือวิธีทำงานของ speculative decoding แบบเข้าใจง่าย แทนที่จะสร้างทีละโทเคน โมเดลร่างขนาดเล็กกว่าจะเดาคร่าวๆ ว่าโทเคนสองสามตัวถัดไปน่าจะเป็นอะไร จากนั้นโมเดลหลักก็ตรวจสอบ ถ้าถูก ซึ่งมักจะถูกสำหรับงานซ้ำๆ โมเดลก็จะรับหลายโทเคนในขั้นตอนเดียว ทำให้สร้างผลลัพธ์ได้เร็วขึ้น
สำหรับเอเจนต์ที่ทำงานแบบเดิมซ้ำๆ ตลอดเวลา นี่คือจุดที่ speculative decoding ช่วยได้มากที่สุด วิดีโอระบุว่าโมเดลมาพร้อม checkpoint แบบ NVFP4 และ BF16 ที่ใช้ kernel NVFP4 ชุดเดียวกับที่ขับเคลื่อน Nemotron 3 Ultra บน GPU ตระกูล NVIDIA Blackwell, Hopper และ Ampere ไฟล์เดียวกันใช้ได้ทั้งใน data center และบน DGX Spark บนโต๊ะทำงาน โมเดลเดียวกัน น้ำหนักเดียวกัน ไฟล์เดียวกัน คุณเลือกเองว่าจะรันที่ไหน
ทีนี้ขอซูมออกมามองภาพรวม เพราะมันมีเรื่องใหญ่กว่านี้ NVIDIA ไม่ได้แค่ปล่อยโมเดลตัวเดียว แต่ปล่อยทั้งสแตก (stack) Lightning คือตัวทำงานที่เร็ว Switchyard คือตัวควบคุมจราจร และ Reuters รายงานเมื่อวันที่ 11 สิงหาคมว่า NVIDIA กำลังพัฒนา Nemotron 4 ซึ่งเป็นตระกูลโมเดลพารามิเตอร์ล้านล้าน (trillion) โดยมีกลยุทธ์คือขับเคลื่อนทั้งระบบนิเวศผ่านการกระจายโมเดล (model proliferation)
คุณจึงได้ผู้เชี่ยวชาญตัวเล็กที่เร็ว router ที่คอยตัดสินว่าใครควรทำอะไร และโมเดล reasoning แนวหน้าในอนาคตที่จัดการงานคิดยากที่สุด ระบบนิเวศเดียว โมเดลเฉพาะทางหลายตัว แต่ละตัวทำงานที่มันถูกสร้างมา NVIDIA เพิ่งมอบโมเดลทำงานที่เร็ว เปิดกว้าง และเชี่ยวชาญเฉพาะทาง พร้อมระบบจัดเส้นทางให้กับคนที่สร้าง AI automation คำถามเดียวคือคุณจะเริ่มใช้มันเร็วแค่ไหน
ภายใน AI Profit Boardroom เราวางแผนวิธีผสาน Nemotron 3.5 Lightning เข้ากับเวิร์กโฟลว์ธุรกิจจริงไว้แล้ว วิธีตั้งค่าร่วมกับ Switchyard เพื่อให้เอเจนต์ของคุณจัดเส้นทางงานไปยังโมเดลที่ถูกต้อง วิธี fine-tune ด้วยข้อมูลของคุณเอง วิธีสร้าง pipeline แบบทำงานตลอดเวลาที่จัดการการเลี้ยงลีด การมีส่วนร่วมของสมาชิก และการกระจายคอนเทนต์ของคุณโดยอัตโนมัติ
เราจัดคอลให้คำปรึกษาสัปดาห์ละ 4 ครั้ง ซึ่งคุณสามารถนำระบบของคุณมาและรับฟีดแบ็กสดได้ มีบทช่วยสอนรายวันพาคุณผ่านทุกขั้นตอน มีแผน 30 วันเต็มสำหรับสร้างระบบ AI automation ของคุณตั้งแต่ศูนย์ มีคลังพรอมต์ที่สร้างรอบเวิร์กโฟลว์แบบ agentic และเจ้าของธุรกิจ 3,700 คนในนั้น หลายคนกำลังสร้างด้วยระบบนิเวศโมเดลของ NVIDIA อยู่แล้ว และพร้อมให้ความช่วยเหลือ 24/7
ถ้าอยากสร้างอย่างจริงจังและได้ผลลัพธ์จริง มาร่วมกับเราได้ครับ ลิงก์อยู่ในคำอธิบายวิดีโอ หรือไปที่ aiprofitboardroom.com และถ้าอยากได้ SOPs เต็มรูปแบบ เวิร์กโฟลว์ และกรณีการใช้งาน AI กว่า 100 กรณี รวมถึงการตั้งค่า Nemotron 3.5 Lightning ที่นำไปต่อเข้ากับธุรกิจของคุณได้ทันที เข้าร่วม AI Success Lab ได้เลย ฟรีครับ มีสมาชิก 87,000 คน โน้ตทั้งหมดจากวิดีโอนี้อยู่ในนั้น พร้อมคำแนะนำทีละขั้นตอนสำหรับทุกอย่างที่เราครอบคลุมวันนี้ ลิงก์อยู่ในคอมเมนต์และคำอธิบายวิดีโอครับ
หมายเหตุการแปล
ความโปร่งใสเกี่ยวกับความไม่แน่นอนในต้นฉบับ
- ## จุดที่ไม่ชัดเจน (Unclear Segments)
- ไม่มี segment ใดที่ฟังไม่ชัดจนต้องใช้ [ฟังไม่ชัด]
อภิธานศัพท์เทคนิค
คำศัพท์และชื่อผลิตภัณฑ์ที่คงรูปภาษาอังกฤษ
| ศัพท์ | คำแปล / คำอธิบาย |
|---|---|
| English term | Thai meaning |
| Nemotron 3.5 Lightning | โมเดล AI ของ NVIDIA ที่ใช้พารามิเตอร์เพียง 3 พันล้านจากทั้งหมด 30 พันล้านต่อโทเคน |
| parameter | พารามิเตอร์ ค่าภายในโมเดลที่ใช้ประมวลผลข้อมูล |
| token | โทเคน หน่วยย่อยของข้อความที่โมเดลประมวลผลทีละหน่วย |
| router | ตัวจัดเส้นทาง/ตัวตัดสินใจว่างานไหนควรใช้ผู้เชี่ยวชาญตัวใด |
| expert | ผู้เชี่ยวชาญ (ในบริบท MoE คือส่วนย่อยของโมเดลที่เชี่ยวชาญเฉพาะด้าน) |
| output | ผลลัพธ์ที่โมเดลสร้างออกมา |
| agentic task | งานที่ AI agent ดำเนินการด้วยตนเองแบบมีเป้าหมาย |
| AI agent | เอเจนต์ AI โปรแกรม AI ที่ทำงานเป็นขั้นตอนเพื่อให้บรรลุเป้าหมาย |
| sub-agent | เอเจนต์ย่อยที่รับงานต่อจากเอเจนต์หลัก |
| tool / tools | เครื่องมือที่เอเจนต์เรียกใช้เพื่อทำงาน |
| workflow | เวิร์กโฟลว์ ลำดับขั้นตอนการทำงานอัตโนมัติ |
| lead follow-up | การติดตามลูกค้าเป้าหมาย (lead) |
| lead nurturing | การเลี้ยงลีด/ดูแลลูกค้าเป้าหมายอย่างต่อเนื่อง |
| content pipeline | สายพานการผลิตและเผยแพร่คอนเทนต์อัตโนมัติ |
| onboarding | ขั้นตอนต้อนรับ/ปูทางให้สมาชิกหรือผู้ใช้ใหม่เริ่มใช้งาน |
| member engagement | การสร้างการมีส่วนร่วมของสมาชิก |
| weights | ค่าน้ำหนักของโมเดลที่ผ่านการฝึกแล้ว |
| fine-tune | ปรับแต่งโมเดลเพิ่มด้วยข้อมูลเฉพาะของตัวเอง |
| deploy | นำโมเดลไปติดตั้ง/ใช้งานจริง |
| open source | โอเพนซอร์ส ซอฟต์แวร์ที่เปิดเผยโค้ด/ทรัพยากรให้ใช้ได้อิสระ |
| Open Model License | สัญญาอนุญาตแบบเปิดสำหรับโมเดล |
| NeMo Megatron 3.5 Lightning | ชื่อโมเดลที่ผู้พูดใช้เรียก (ตามคำบรรยายอัตโนมัติ) |
| NeMo Switchyard | ไลบรารีจัดเส้นทางโมเดลแบบ open source สำหรับ AI agents ของ NVIDIA |
| frontier model | โมเดล AI ระดับแนวหน้าที่เก่งที่สุดในยุคปัจจุบัน |
| reasoning | การให้เหตุผล/การคิดเชิงตรรกะของโมเดล |
| Artificial Analysis Intelligence Index | ดัชนีวัดความสามารถ AI ของ Artificial Analysis |
| GPU | หน่วยประมวลผลกราฟิก |
| consumer GPU | GPU สำหรับผู้บริโภคทั่วไป (ไม่ใช่ระดับ data center) |
| RTX PC | คอมพิวเตอร์ที่ใช้การ์ดจอ NVIDIA RTX |
| DGX Spark | คอมพิวเตอร์ AI บนโต๊ะทำงานของ NVIDIA |
| data center | ศูนย์ข้อมูล |
| cloud credits | เครดิตสำหรับใช้บริการคลาวด์ |
| external API | API ภายนอกที่ต้องเรียกใช้บริการจากภายนอก |
| API | อินเทอร์เฟซสำหรับเชื่อมต่อโปรแกรมเข้าด้วยกัน |
| microservice | ไมโครเซอร์วิส บริการย่อยที่เรียกใช้แยกกันได้ |
| Hugging Face | แพลตฟอร์มโฮสต์โมเดล AI ยอดนิยม |
| ModelScope | แพลตฟอร์มโฮสต์โมเดล AI ของอาลีบาบา |
| OpenRouter | บริการรวม API โมเดล AI หลายตัวในที่เดียว |
| NIM (NVIDIA NIM) | ชุดไมโครเซอร์วิสสำหรับรันโมเดล AI ของ NVIDIA |
| architecture | สถาปัตยกรรม โครงสร้างการออกแบบของโมเดล |
| Mamba 2 | สถาปัตยกรรมโมเดลแบบหนึ่งที่จัดการหน่วยความจำได้มีประสิทธิภาพ |
| MoE (Mixture of Experts) | การผสมผู้เชี่ยวชาญ เปิดใช้เฉพาะส่วนย่อยที่จำเป็นของโมเดล |
| attention | กลไกการใส่ใจที่ช่วยให้โมเดลให้เหตุผลได้แม่นยำ |
| selective attention | การใส่ใจแบบเลือกเฉพาะจุดที่เกี่ยวข้อง |
| speculative decoding | การถอดรหัสแบบคาดเดาล่วงหน้าเพื่อเพิ่มความเร็วในการสร้างข้อความ |
| draft model | โมเดลร่างขนาดเล็กที่เดาโทเคนถัดไปล่วงหน้า |
| checkpoint | ไฟล์บันทึกสถานะ/ค่าน้ำหนักของโมเดลที่พร้อมใช้งาน |
| NVFP4 / BF16 | รูปแบบความแม่นยำตัวเลขที่ใช้เก็บค่าน้ำหนักโมเดล |
| kernel | โปรแกรมย่อยที่รันบน GPU สำหรับคำนวณเฉพาะทาง |
| Blackwell / Hopper / Ampere | สถาปัตยกรรม GPU รุ่นต่างๆ ของ NVIDIA |
| stack | สแตก ชุดเทคโนโลยีที่ทำงานร่วมกันเป็นระบบ |
| model proliferation | การกระจายโมเดลหลายรุ่นให้แพร่หลายในระบบนิเวศ |
| prompt | พรอมต์ คำสั่ง/คำถามที่ป้อนให้โมเดล |
| prompt library | คลังรวมพรอมต์สำเร็จรูปสำหรับใช้งานต่างๆ |
| pipeline | ท่อส่งงาน/กระบวนการอัตโนมัติต่อเนื่อง |
| automation | ระบบอัตโนมัติ |
| AI automation | การนำ AI มาทำงานอัตโนมัติในธุรกิจ |
| avatar | อวตาร ตัวแทนดิจิทัล |
| SOP | ขั้นตอนการปฏิบัติงานมาตรฐาน (Standard Operating Procedure) |
| coaching call | คอลให้คำปรึกษาแบบตัวต่อตัว/กลุ่ม |
| roadmap | แผนเส้นทาง/แผนปฏิบัติงานตามช่วงเวลา |
| 24/7 | ตลอด 24 ชั่วโมงทุกวัน |
ซับไตเติ้ลภาษาไทย
ดาวน์โหลดหรือดูซับทั้งหมด
1 00:00:00,000 --> 00:00:02,610 โมเดลใหม่อย่าง Nemotron 3.5 Lightning (โมเดล 2 00:00:02,610 --> 00:00:05,280 AI ของ NVIDIA) เพิ่งเปิดตัว และสิ่งที่ NVIDIA 3 00:00:05,280 --> 00:00:07,119 ทำในครั้งนี้โคตรจะสุดจริงๆ ครับ 4 00:00:07,119 --> 00:00:09,729 เรื่องมันเป็นแบบนี้ โมเดล AI ส่วนใหญ่เวลารัน
เปิดดูซับไตเติ้ลทั้งหมด (222 segments)
1 00:00:00,000 --> 00:00:02,610 โมเดลใหม่อย่าง Nemotron 3.5 Lightning (โมเดล 2 00:00:02,610 --> 00:00:05,280 AI ของ NVIDIA) เพิ่งเปิดตัว และสิ่งที่ NVIDIA 3 00:00:05,280 --> 00:00:07,119 ทำในครั้งนี้โคตรจะสุดจริงๆ ครับ 4 00:00:07,119 --> 00:00:09,729 เรื่องมันเป็นแบบนี้ โมเดล AI ส่วนใหญ่เวลารัน 5 00:00:09,729 --> 00:00:11,450 มันจะใช้ทรัพยากรทุกอย่างที่มี 6 00:00:11,450 --> 00:00:14,060 พารามิเตอร์ทุกตัวทำงานหมด และพอเป็นโมเดลใหญ่ 7 00:00:14,060 --> 00:00:16,492 มันก็ใช้เวลานาน ทำให้ทุกอย่างช้าลง NVIDIA 8 00:00:16,492 --> 00:00:18,094 มองเห็นปัญหานี้แล้วก็คิดว่า 9 00:00:18,094 --> 00:00:19,696 "แล้วถ้าเราไม่ทำแบบนั้นล่ะ? 10 00:00:19,696 --> 00:00:23,315 ถ้าเราสร้างโมเดลที่มีพารามิเตอร์ 30 พันล้าน แต่ให้มันใช้จริงๆ 11 00:00:23,315 --> 00:00:25,925 แค่ประมาณ 3 พันล้านต่อครั้งล่ะ?" นั่นแหละคือ 12 00:00:25,925 --> 00:00:28,298 Nemotron 3.5 Lightning พารามิเตอร์รวม 30 13 00:00:28,298 --> 00:00:30,612 พันล้าน แต่ใช้จริงแค่ 3 พันล้านต่อโทเคน 14 00:00:30,612 --> 00:00:33,103 (token) และการตัดสินใจเพียงข้อเดียวนี้แหละ 15 00:00:33,103 --> 00:00:35,358 ที่ทำให้การปล่อยเวอร์ชันนี้น่าจับตามอง 16 00:00:35,358 --> 00:00:37,019 ผมจะอธิบายว่าทำไมมันถึงสำคัญ 17 00:00:37,019 --> 00:00:39,451 ลองคิดแบบนี้นะครับ สมมติว่าคุณมีทีม 30 คน 18 00:00:39,451 --> 00:00:41,053 เป็นคนเก่ง เป็นผู้เชี่ยวชาญ 19 00:00:41,053 --> 00:00:43,366 แต่สำหรับงานส่วนใหญ่ คุณต้องการแค่ 3 คน 20 00:00:43,366 --> 00:00:45,739 ทำไมต้องให้ทั้ง 30 คนมาทำงานทุกครั้งล่ะ? 21 00:00:45,739 --> 00:00:48,290 มันเสียเวลา ทำให้ทุกอย่างช้าลง Nemotron 3.5 22 00:00:48,290 --> 00:00:50,723 Lightning มี router (ตัวจัดเส้นทาง) ในตัว 23 00:00:50,723 --> 00:00:51,817 พองานเข้ามา router 24 00:00:51,817 --> 00:00:54,664 ก็ดูว่างานนี้ผู้เชี่ยวชาญกลุ่มไหนต้องจัดการจริงๆ 25 00:00:54,664 --> 00:00:57,393 กลุ่มเล็กๆ ก็ตื่นขึ้นมาทำงาน ที่เหลือก็นิ่งเฉย 26 00:00:57,393 --> 00:00:58,487 คุณได้คำตอบที่เร็ว 27 00:00:58,487 --> 00:01:01,156 แล้วก็ทำแบบนี้ซ้ำแล้วซ้ำเล่า นั่นคือเหตุผลที่ 28 00:01:01,156 --> 00:01:03,529 NVIDIA อ้างว่าโมเดลนี้ให้ความเร็ว output 29 00:01:03,529 --> 00:01:06,258 (ผลลัพธ์) มากกว่าโมเดลอื่นในระดับเดียวกันถึง 4 30 00:01:06,258 --> 00:01:08,691 เท่า และทำงานแบบ agentic tasks (งานที่ AI 31 00:01:08,691 --> 00:01:10,411 ดำเนินการเอง) เสร็จไวขึ้น 30% 32 00:01:10,411 --> 00:01:12,132 โดยที่ความแม่นยำลดลงไม่มากนัก 33 00:01:12,132 --> 00:01:14,623 ถ้ายังไม่เคยรู้จักกัน ผมคือ digital avatar 34 00:01:14,623 --> 00:01:17,115 (อวตารดิจิทัล) ของ Julian Goldie ซีอีโอของ 35 00:01:17,115 --> 00:01:18,895 Goldie Agency เอเจนซี่ด้าน SEO 36 00:01:18,895 --> 00:01:21,386 ระหว่างที่เขาช่วยลูกค้าหาลีดและลูกค้าเพิ่ม 37 00:01:21,386 --> 00:01:23,166 ผมอยู่ตรงนี้เพื่ออัปเดตข่าว AI 38 00:01:23,166 --> 00:01:25,776 ล่าสุดให้คุณครับ แล้วทำไมความเร็วถึงสำคัญต่อ 39 00:01:25,776 --> 00:01:28,446 AI automation ในธุรกิจของคุณ? เพราะ AI agents 40 00:01:28,446 --> 00:01:30,997 (เอเจนต์ AI) ไม่ได้ตอบคำถามหนึ่งคำถามแล้วจบ 41 00:01:30,997 --> 00:01:33,192 พวกมันทำงานเป็นลูป เรียกใช้เครื่องมือ 42 00:01:33,192 --> 00:01:34,675 ตรวจสอบผลลัพธ์ มอบหมายงาน 43 00:01:34,675 --> 00:01:37,404 และรันคำสั่งซ้ำแล้วซ้ำเล่า และถ้าทุกขั้นตอนช้า 44 00:01:37,404 --> 00:01:39,836 เวิร์กโฟลว์ทั้งหมดของคุณก็ช้าตามไปด้วย AI 45 00:01:39,836 --> 00:01:40,963 agents ที่ทำงานยาวๆ 46 00:01:40,963 --> 00:01:43,099 ใช้เวลาส่วนใหญ่ไปกับงานที่ต้องทำซ้ำๆ 47 00:01:43,099 --> 00:01:45,531 ในปริมาณมาก ไม่ว่าจะเป็นการเรียกใช้ tools 48 00:01:45,531 --> 00:01:47,786 การตรวจสอบผลลัพธ์ หรือการมอบหมายงานให้ 49 00:01:47,786 --> 00:01:50,040 sub-agents (เอเจนต์ย่อย) และ Lightning 50 00:01:50,040 --> 00:01:51,938 ถูกสร้างมาเพื่อเรื่องนี้โดยเฉพาะ 51 00:01:51,938 --> 00:01:53,837 คืองานที่ต้องทำซ้ำๆ อย่างรวดเร็ว 52 00:01:53,837 --> 00:01:56,091 ลองคิดดูว่ามันหมายถึงอะไรกับการทำ lead 53 00:01:56,091 --> 00:01:58,761 follow-up (ติดตามลูกค้าเป้าหมาย) แบบอัตโนมัติ 54 00:01:58,761 --> 00:02:01,193 การรัน content pipelines (สายพานคอนเทนต์) 55 00:02:01,193 --> 00:02:02,795 การจัดการขั้นตอน onboarding 56 00:02:02,795 --> 00:02:04,100 (การต้อนรับสมาชิกใหม่) 57 00:02:04,100 --> 00:02:05,820 การดูแลการมีส่วนร่วมของสมาชิก 58 00:02:05,820 --> 00:02:08,609 อะไรก็ตามที่เอเจนต์ต้องทำงานแบบเดิมซ้ำเป็นร้อยๆ 59 00:02:08,609 --> 00:02:10,329 ครั้ง ด้วยโมเดลที่เร็วขนาดนี้ 60 00:02:10,329 --> 00:02:12,228 เวิร์กโฟลว์พวกนี้ไม่ใช่แค่รันได้ 61 00:02:12,228 --> 00:02:13,889 แต่รันแบบพุ่งปรี๊ดเลยล่ะครับ 62 00:02:13,889 --> 00:02:16,262 และโมเดลนี้เป็นแบบเปิด เต็มรูปแบบ NVIDIA 63 00:02:16,262 --> 00:02:18,753 เผยแพร่ weights (ค่าน้ำหนัก) ชุดข้อมูลเทรน 64 00:02:18,753 --> 00:02:21,364 และสูตรการฝึก ภายใต้สัญญาอนุญาตแบบเปิด (Open 65 00:02:21,364 --> 00:02:24,033 Model License 1.1) คุณดาวน์โหลดไปใช้ ปรับแต่ง 66 00:02:24,033 --> 00:02:26,525 (fine-tune) ด้วยข้อมูลของคุณเอง และ deploy 67 00:02:26,525 --> 00:02:29,194 ไปที่ไหนก็ได้ตามต้องการ ตอนนี้ภายใน AI Profit 68 00:02:29,194 --> 00:02:31,627 Boardroom เรากำลังสร้างระบบ AI automation 69 00:02:31,627 --> 00:02:34,356 แบบครบวงจร โดยเฉพาะกับโมเดลอย่าง NeMo Megatron 70 00:02:34,356 --> 00:02:35,450 3.5 Lightning 71 00:02:35,450 --> 00:02:37,763 เรากำลังวางแผนวิธีตั้งค่าเวิร์กโฟลว์แบบ 72 00:02:37,763 --> 00:02:40,433 agentic ความเร็วสูง ที่จะขยาย pipeline ของคุณ 73 00:02:40,433 --> 00:02:42,450 ทำให้การเลี้ยงลีด (lead nurturing) 74 00:02:42,450 --> 00:02:44,704 เป็นอัตโนมัติ จัดการ onboarding สมาชิก 75 00:02:44,704 --> 00:02:46,781 และยกภาระงานซ้ำซากออกจากตัวคุณไปเลย 76 00:02:46,781 --> 00:02:49,154 ทุกสัปดาห์เราจัดคอลให้คำปรึกษาสด 4 ครั้ง 77 00:02:49,154 --> 00:02:53,128 ซึ่งคุณสามารถถามคำถามเกี่ยวกับการตั้งค่าของคุณโดยตรงและได้คำตอบจริง 78 00:02:53,128 --> 00:02:56,510 มีบทช่วยสอนแบบทีละขั้นตอนสำหรับทุกเครื่องมือที่ปล่อยออกมา 79 00:02:56,510 --> 00:02:57,993 รวมถึงตัวนี้ด้วย มีแผน 30 80 00:02:57,993 --> 00:03:00,722 วันเพื่อให้รู้ว่าควรสร้างอะไรก่อน มีคลังพรอมต์ 81 00:03:00,722 --> 00:03:03,036 (prompt library) และเจ้าของธุรกิจ 3,700 82 00:03:03,036 --> 00:03:05,527 คนที่กำลังใช้เวิร์กโฟลว์เหล่านี้อยู่ตอนนี้ 83 00:03:05,527 --> 00:03:07,841 พวกเขาเป็นคนที่คลุกคลีกับเรื่องนี้จริงๆ 84 00:03:07,841 --> 00:03:09,917 และพร้อมให้ความช่วยเหลือ 24 ชั่วโมง 85 00:03:09,917 --> 00:03:12,290 ถ้าคุณอยากนำ NeMo Megatron 3.5 Lightning 86 00:03:12,290 --> 00:03:13,773 ไปใช้ในธุรกิจอย่างถูกวิธี 87 00:03:13,773 --> 00:03:15,197 นี่คือที่ที่คุณควรมาครับ 88 00:03:15,197 --> 00:03:17,511 ลิงก์อยู่ในคำอธิบายวิดีโอ หรือเข้าไปที่ 89 00:03:17,511 --> 00:03:18,757 AIprofitboardroom.com 90 00:03:18,757 --> 00:03:21,308 ต่อไปนี้คือจุดที่ยิ่งน่าสนใจกว่าเดิม NVIDIA 91 00:03:21,308 --> 00:03:23,681 ปล่อยอะไรอีกอย่างออกมาพร้อมกับ Lightning 92 00:03:23,681 --> 00:03:25,876 และมันอาจเป็นข่าวที่ใหญ่ที่สุดด้วยซ้ำ 93 00:03:25,876 --> 00:03:27,418 มันชื่อว่า NeMo Switchyard 94 00:03:27,418 --> 00:03:30,088 ซึ่งเป็นไลบรารีจัดเส้นทางโมเดลแบบ open source 95 00:03:30,088 --> 00:03:31,689 สำหรับ AI agents Switchyard 96 00:03:31,689 --> 00:03:34,003 จะส่งแต่ละพรอมต์ในเวิร์กโฟลว์ของเอเจนต์ 97 00:03:34,003 --> 00:03:37,385 ไปยังโมเดลที่เก่งและมีประสิทธิภาพที่สุดสำหรับขั้นตอนนั้นๆ 98 00:03:37,385 --> 00:03:39,639 โดยเลือกจากทั้งโมเดล open source โมเดล 99 00:03:39,639 --> 00:03:41,419 proprietary และโมเดลของ NVIDIA 100 00:03:41,419 --> 00:03:43,198 โดยไม่ต้องเขียนแอปพลิเคชันใหม่ 101 00:03:43,198 --> 00:03:44,919 ลองนึกภาพตามนะครับ เอเจนต์ AI 102 00:03:44,919 --> 00:03:47,055 ของคุณได้รับงานที่ซับซ้อน ทั้งวางแผน 103 00:03:47,055 --> 00:03:48,478 คิดเชิงเหตุผล วางกลยุทธ์ 104 00:03:48,478 --> 00:03:50,377 งานพวกนั้นส่งไปให้โมเดล frontier 105 00:03:50,377 --> 00:03:53,046 (โมเดลระดับแนวหน้า) ตัวใหญ่ แล้วพอวางแผนเสร็จ 106 00:03:53,046 --> 00:03:55,479 งานลงมือทำทั้งหมด ไม่ว่าจะรันนี่ เช็คนั่น 107 00:03:55,479 --> 00:03:58,208 ตรวจสอบนี่ จัดรูปแบบนั่น ทำซ้ำ ก็จะถูกส่งไปที่ 108 00:03:58,208 --> 00:04:00,343 NeMo Megatron 3.5 Lightning ซึ่งเร็ว 109 00:04:00,343 --> 00:04:02,716 มีประสิทธิภาพ และเชี่ยวชาญเฉพาะทาง หนึ่ง 110 00:04:02,716 --> 00:04:03,810 router สองโมเดล 111 00:04:03,810 --> 00:04:07,014 ให้ประสิทธิภาพดีกว่าการใช้โมเดลเดียวทำทุกอย่างหลายเท่า 112 00:04:07,014 --> 00:04:09,505 Nemotron 3.5 Lightning ได้คะแนน 24 บนดัชนี 113 00:04:09,505 --> 00:04:11,760 Artificial Analysis Intelligence Index 114 00:04:11,760 --> 00:04:12,853 ซึ่งพุ่งขึ้น 9 115 00:04:12,853 --> 00:04:15,523 คะแนนเมื่อเทียบกับโมเดลรุ่นก่อนอย่าง Nemotron 116 00:04:15,523 --> 00:04:18,193 3 Nano ดังนั้นคุณไม่ได้แค่ได้โมเดลที่เร็วขึ้น 117 00:04:18,193 --> 00:04:19,735 แต่ได้โมเดลที่ฉลาดขึ้นด้วย 118 00:04:19,735 --> 00:04:22,167 มาพูดถึงกันว่าโมเดลตัวนี้รันได้ที่ไหนบ้าง 119 00:04:22,167 --> 00:04:24,837 เพราะส่วนนี้เซอร์ไพรส์จริงๆ โมเดลนี้รันบน GPU 120 00:04:24,837 --> 00:04:27,151 สำหรับผู้บริโภคเพียงตัวเดียว รวมถึง GPU 121 00:04:27,151 --> 00:04:29,642 ในเครื่อง NVIDIA RTX PC หรือระบบ DGX Spark 122 00:04:29,642 --> 00:04:31,659 ของบริษัท คุณไม่ต้องมี data center 123 00:04:31,659 --> 00:04:33,854 (ศูนย์ข้อมูล) ไม่ต้องมี cloud credits 124 00:04:33,854 --> 00:04:35,931 (เครดิตคลาวด์) คุณสามารถรันโมเดล 30 125 00:04:35,931 --> 00:04:37,025 พันล้านพารามิเตอร์ 126 00:04:37,025 --> 00:04:39,754 ซึ่งเทียบชั้นกับโมเดลที่ใหญ่กว่า 4 เท่า บน GPU 127 00:04:39,754 --> 00:04:40,940 ตั้งโต๊ะเครื่องเดียว 128 00:04:40,940 --> 00:04:44,084 สำหรับเจ้าของธุรกิจที่อยากเก็บเวิร์กโฟลว์ไว้ในเครื่อง 129 00:04:44,084 --> 00:04:46,635 เก็บข้อมูลเป็นส่วนตัว และไม่พึ่งพา external 130 00:04:46,635 --> 00:04:48,534 APIs (API ภายนอก) สำหรับทุกอย่าง 131 00:04:48,534 --> 00:04:49,779 สิ่งนี้ทำให้เป็นไปได้ 132 00:04:49,779 --> 00:04:52,330 คุณเป็นเจ้าของระบบทั้งหมด และถ้าอยาก deploy 133 00:04:52,330 --> 00:04:54,288 ขึ้นคลาวด์ Nemotron 3.5 Lightning 134 00:04:54,288 --> 00:04:56,602 มีให้ใช้งานบน Hugging Face, ModelScope, 135 00:04:56,602 --> 00:04:58,975 OpenRouter และ build.nvidia.com ในรูปแบบ 136 00:04:58,975 --> 00:05:00,339 NVIDIA NIM microservice 137 00:05:00,339 --> 00:05:02,772 รวมถึงแพลตฟอร์มคลาวด์อีกหลากหลาย จะ local 138 00:05:02,772 --> 00:05:04,670 จะคลาวด์ จะทั้งสองแบบผสมกันก็ได้ 139 00:05:04,670 --> 00:05:05,975 มาพูดถึงสถาปัตยกรรมกัน 140 00:05:05,975 --> 00:05:08,585 เพราะนี่คือสิ่งที่ทำให้มันเร็วจริงๆ Nemotron 141 00:05:08,585 --> 00:05:11,314 3.5 Lightning ใช้สถาปัตยกรรมแบบ hybrid ระหว่าง 142 00:05:11,314 --> 00:05:13,391 Mamba 2 บวก MoE (Mixture of Experts 143 00:05:13,391 --> 00:05:16,001 การผสมผู้เชี่ยวชาญ) บวก attention ชั้น Mamba 144 00:05:16,001 --> 00:05:18,493 จัดการการสร้างเนื้อหาโดยไม่ต้องสะสม memory 145 00:05:18,493 --> 00:05:19,798 cache (แคชหน่วยความจำ) 146 00:05:19,798 --> 00:05:22,467 ก้อนใหญ่ที่ทำให้ช้าลงเมื่องานยาวขึ้น ชั้น MoE 147 00:05:22,467 --> 00:05:24,959 จะเปิดใช้งานเฉพาะผู้เชี่ยวชาญที่คุณต้องการ 148 00:05:24,959 --> 00:05:26,383 ส่วน selective attention 149 00:05:26,383 --> 00:05:27,747 (การใส่ใจแบบเลือกเฉพาะ) 150 00:05:27,747 --> 00:05:30,358 ทำให้การให้เหตุผลเฉียบคม ทั้งสามทำงานร่วมกัน 151 00:05:30,358 --> 00:05:32,731 แล้ว NVIDIA ก็เพิ่ม speculative decoding 152 00:05:32,731 --> 00:05:35,282 (การถอดรหัสแบบคาดเดาล่วงหน้า) ขึ้นไปอีกชั้น 153 00:05:35,282 --> 00:05:37,951 NVIDIA ส่งโมเดล draft (โมเดลร่าง) มาให้สองตัว 154 00:05:37,951 --> 00:05:40,621 คือ DSparc สำหรับการอนุมานบน DGX Spark และงาน 155 00:05:40,621 --> 00:05:42,756 data center ที่มีการทำงานพร้อมกันต่ำ 156 00:05:42,756 --> 00:05:45,129 กับอีกตัวคือ DFlasher นี่คือวิธีทำงานของ 157 00:05:45,129 --> 00:05:47,146 speculative decoding แบบเข้าใจง่าย 158 00:05:47,146 --> 00:05:48,452 แทนที่จะสร้างทีละโทเคน 159 00:05:48,452 --> 00:05:50,350 โมเดลร่างขนาดเล็กกว่าจะเดาคร่าวๆ 160 00:05:50,350 --> 00:05:55,927 ว่าโทเคนสองสามตัวถัดไปน่าจะเป็นอะไร จากนั้นโมเดลหลักก็ตรวจสอบ ถ้าถูก ซึ่งมักจะถูกสำหรับงานซ้ำๆ 161 00:05:55,927 --> 00:05:58,003 โมเดลก็จะรับหลายโทเคนในขั้นตอนเดียว 162 00:05:58,003 --> 00:05:59,664 ทำให้สร้างผลลัพธ์ได้เร็วขึ้น 163 00:05:59,664 --> 00:06:02,096 สำหรับเอเจนต์ที่ทำงานแบบเดิมซ้ำๆ ตลอดเวลา 164 00:06:02,096 --> 00:06:04,054 นี่คือจุดที่ speculative decoding 165 00:06:04,054 --> 00:06:06,546 ช่วยได้มากที่สุด วิดีโอระบุว่าโมเดลมาพร้อม 166 00:06:06,546 --> 00:06:09,097 checkpoint แบบ NVFP4 และ BF16 ที่ใช้ kernel 167 00:06:09,097 --> 00:06:11,529 NVFP4 ชุดเดียวกับที่ขับเคลื่อน Nemotron 3 168 00:06:11,529 --> 00:06:14,139 Ultra บน GPU ตระกูล NVIDIA Blackwell, Hopper 169 00:06:14,139 --> 00:06:16,512 และ Ampere ไฟล์เดียวกันใช้ได้ทั้งใน data 170 00:06:16,512 --> 00:06:18,529 center และบน DGX Spark บนโต๊ะทำงาน 171 00:06:18,529 --> 00:06:21,021 โมเดลเดียวกัน น้ำหนักเดียวกัน ไฟล์เดียวกัน 172 00:06:21,021 --> 00:06:22,504 คุณเลือกเองว่าจะรันที่ไหน 173 00:06:22,504 --> 00:06:23,928 ทีนี้ขอซูมออกมามองภาพรวม 174 00:06:23,928 --> 00:06:25,945 เพราะมันมีเรื่องใหญ่กว่านี้ NVIDIA 175 00:06:25,945 --> 00:06:28,555 ไม่ได้แค่ปล่อยโมเดลตัวเดียว แต่ปล่อยทั้งสแตก 176 00:06:28,555 --> 00:06:30,691 (stack) Lightning คือตัวทำงานที่เร็ว 177 00:06:30,691 --> 00:06:33,064 Switchyard คือตัวควบคุมจราจร และ Reuters 178 00:06:33,064 --> 00:06:35,318 รายงานเมื่อวันที่ 11 สิงหาคมว่า NVIDIA 179 00:06:35,318 --> 00:06:36,564 กำลังพัฒนา Nemotron 4 180 00:06:36,564 --> 00:06:38,818 ซึ่งเป็นตระกูลโมเดลพารามิเตอร์ล้านล้าน 181 00:06:38,818 --> 00:06:39,912 (trillion) 182 00:06:39,912 --> 00:06:43,234 โดยมีกลยุทธ์คือขับเคลื่อนทั้งระบบนิเวศผ่านการกระจายโมเดล 183 00:06:43,234 --> 00:06:44,480 (model proliferation) 184 00:06:44,480 --> 00:06:46,972 คุณจึงได้ผู้เชี่ยวชาญตัวเล็กที่เร็ว router 185 00:06:46,972 --> 00:06:49,701 ที่คอยตัดสินว่าใครควรทำอะไร และโมเดล reasoning 186 00:06:49,701 --> 00:06:51,955 แนวหน้าในอนาคตที่จัดการงานคิดยากที่สุด 187 00:06:51,955 --> 00:06:54,031 ระบบนิเวศเดียว โมเดลเฉพาะทางหลายตัว 188 00:06:54,031 --> 00:06:56,167 แต่ละตัวทำงานที่มันถูกสร้างมา NVIDIA 189 00:06:56,167 --> 00:06:58,244 เพิ่งมอบโมเดลทำงานที่เร็ว เปิดกว้าง 190 00:06:58,244 --> 00:06:59,430 และเชี่ยวชาญเฉพาะทาง 191 00:06:59,430 --> 00:07:01,684 พร้อมระบบจัดเส้นทางให้กับคนที่สร้าง AI 192 00:07:01,684 --> 00:07:02,778 automation 193 00:07:02,778 --> 00:07:05,448 คำถามเดียวคือคุณจะเริ่มใช้มันเร็วแค่ไหน ภายใน 194 00:07:05,448 --> 00:07:08,177 AI Profit Boardroom เราวางแผนวิธีผสาน Nemotron 195 00:07:08,177 --> 00:07:09,271 3.5 Lightning 196 00:07:09,271 --> 00:07:11,347 เข้ากับเวิร์กโฟลว์ธุรกิจจริงไว้แล้ว 197 00:07:11,347 --> 00:07:13,067 วิธีตั้งค่าร่วมกับ Switchyard 198 00:07:13,067 --> 00:07:16,271 เพื่อให้เอเจนต์ของคุณจัดเส้นทางงานไปยังโมเดลที่ถูกต้อง 199 00:07:16,271 --> 00:07:18,881 วิธี fine-tune ด้วยข้อมูลของคุณเอง วิธีสร้าง 200 00:07:18,881 --> 00:07:21,610 pipeline แบบทำงานตลอดเวลาที่จัดการการเลี้ยงลีด 201 00:07:21,610 --> 00:07:22,915 การมีส่วนร่วมของสมาชิก 202 00:07:22,915 --> 00:07:25,170 และการกระจายคอนเทนต์ของคุณโดยอัตโนมัติ 203 00:07:25,170 --> 00:07:27,365 เราจัดคอลให้คำปรึกษาสัปดาห์ละ 4 ครั้ง 204 00:07:27,365 --> 00:07:30,034 ซึ่งคุณสามารถนำระบบของคุณมาและรับฟีดแบ็กสดได้ 205 00:07:30,034 --> 00:07:32,704 มีบทช่วยสอนรายวันพาคุณผ่านทุกขั้นตอน มีแผน 30 206 00:07:32,704 --> 00:07:34,840 วันเต็มสำหรับสร้างระบบ AI automation 207 00:07:34,840 --> 00:07:35,933 ของคุณตั้งแต่ศูนย์ 208 00:07:35,933 --> 00:07:38,603 มีคลังพรอมต์ที่สร้างรอบเวิร์กโฟลว์แบบ agentic 209 00:07:38,603 --> 00:07:40,442 และเจ้าของธุรกิจ 3,700 คนในนั้น 210 00:07:40,442 --> 00:07:43,052 หลายคนกำลังสร้างด้วยระบบนิเวศโมเดลของ NVIDIA 211 00:07:43,052 --> 00:07:45,307 อยู่แล้ว และพร้อมให้ความช่วยเหลือ 24/7 212 00:07:45,307 --> 00:07:47,739 ถ้าอยากสร้างอย่างจริงจังและได้ผลลัพธ์จริง 213 00:07:47,739 --> 00:07:50,409 มาร่วมกับเราได้ครับ ลิงก์อยู่ในคำอธิบายวิดีโอ 214 00:07:50,409 --> 00:07:53,078 หรือไปที่ aiprofitboardroom.com และถ้าอยากได้ 215 00:07:53,078 --> 00:07:55,689 SOPs เต็มรูปแบบ เวิร์กโฟลว์ และกรณีการใช้งาน 216 00:07:55,689 --> 00:07:58,417 AI กว่า 100 กรณี รวมถึงการตั้งค่า Nemotron 3.5 217 00:07:58,417 --> 00:07:59,511 Lightning 218 00:07:59,511 --> 00:08:02,240 ที่นำไปต่อเข้ากับธุรกิจของคุณได้ทันที เข้าร่วม 219 00:08:02,240 --> 00:08:04,910 AI Success Lab ได้เลย ฟรีครับ มีสมาชิก 87,000 220 00:08:04,910 --> 00:08:07,045 คน โน้ตทั้งหมดจากวิดีโอนี้อยู่ในนั้น 221 00:08:07,045 --> 00:08:10,427 พร้อมคำแนะนำทีละขั้นตอนสำหรับทุกอย่างที่เราครอบคลุมวันนี้ 222 00:08:10,427 --> 00:08:12,800 ลิงก์อยู่ในคอมเมนต์และคำอธิบายวิดีโอครับ