▶SUBTHAIแปลไทย · ซับ · พากย์⚙
บทความแปลภาษาไทย · YouTube

NVIDIA’s 30B AI Model Is Faster Than You Think

0:000:00
เล่นเสียงต้นฉบับของวิดีโอ พร้อมแสดงซับไทยซิงก์ตามเวลา
กำลังโหลดวิดีโอ…
01

สรุปย่อ

ประเด็นสำคัญจากวิดีโอ

- ช่อง: Julian Goldie SEO

# สรุป: NVIDIA's 30B AI Model Is Faster Than You Think

- ช่อง: Julian Goldie SEO
- ความยาว: 8 นาที 29 วินาที (509 วินาที)
- ลิงก์: https://www.youtube.com/watch?v=tYHYGM60hSg

## ประเด็นหลัก

- NVIDIA เปิดตัวโมเดล Nemotron 3.5 Lightning ซึ่งเป็นโมเดล open source ขนาด 30B แบบ mixture of experts มี active parameters เพียง 3B แต่ให้ความเร็ว output สูงกว่าโมเดลขนาดใกล้เคียงกันถึง 4 เท่า
- โมเดลถูกออกแบบมาสำหรับ execution layer คืองานซ้ำๆ เบื้องหลัง agent เช่น เรียกใช้ tool ตรวจสอบผลลัพธ์ จัดรูปแบบข้อมูล แทนที่จะส่งงานเล็กๆ เหล่านั้นไปให้โมเดลใหญ่ยักษ์
- รองรับ context window สูงสุด 1 ล้าน token รันได้ทั้งในเครื่อง (RTX PC, DGX, Spark, Jetson) และบนคลาวด์ ผ่าน Ollama, LM Studio, llama.cpp และ Unsloth
- ผล benchmark จาก Pinch Bench: ทำ accuracy 86% และทำงาน 10,000 งานเสร็จเร็วกว่า Qwen 3.6 35B ถึง 30% ที่ความแม่นยำใกล้เคียงกัน
- เทคนิคความเร็วหลักสองอย่าง: speculative decoding (เดาคำล่วงหน้าหลายคำ) และ quantization (เวอร์ชันบีบอัด NVFP4 เทียบกับ BF16 เต็มความแม่นยำ) รวมถึง harness optimized training
- ดีไซน์ hybrid ระหว่างชั้น Mamba 2, mixture of experts และ select attention ผ่านการ pre-train ด้วยข้อมูลกว่า 20 ล้านล้าน token
- Nemo Switchyard ไลบรารีจัดเส้นทาง open source ที่ส่งงานวางแผนไปหาโมเดลใหญ่ และส่งงานปฏิบัติการลงมาให้ Lightning
- เคล็ดลับมือใหม่: ลองผ่าน build.nvidia.com หรือ OpenRouter ก่อนติดตั้ง อย่าทดสอบแบบ chatbot ให้โฟกัสงานหลายขั้นตอนซ้ำๆ เลือกเวอร์ชันให้เหมาะ (NVFP4 เพื่อความเร็ว, BF16 เพื่อ post training)
- ใช้เป็น worker ไม่ใช่ boss และระวังขีดจำกัด context บนเส้นทางแบบโฮสต์ ก่อนจะโทษโมเดล
- โมเดลเปิดเต็มรูปแบบ: ปล่อย weights, ข้อมูลฝึก และ recipes ภายใต้สัญญาอนุญาต OpenMDW 1.1 พร้อมชุดข้อมูล agentic RL สำหรับ fine-tune งานเฉพาะ

## ความเห็นสรุป

วิดีโอนี้สื่อสารประเด็นที่ตรงไปตรงมา: โมเดลใหญ่ไม่จำเป็นต้องดีที่สุดสำหรับทุกงาน และการแยกงานวางแผนกับงานปฏิบัติการด้วยระบบหลายโมเดลคือแนวทางที่ควรจับตามอง เนื้อหามีตัวอย่างและตัวเลขชัดเจน เหมาะสำหรับผู้ที่สนใจสร้าง AI agent ที่มีประสิทธิภาพ แม้ช่วงท้ายจะเน้นการโปรโมตคอร์สและคอมมูนิตี้ของช่องเองก็ตาม
02

คำแปลเต็ม

แปลตามบทสนทนาต้นฉบับ ปรับเป็นภาษาไทยธรรมชาติ

โมเดล AI ขนาด 30B ของ NVIDIA เร็วกว่าที่คุณคิด. จะเป็นอย่างไรถ้าโมเดลที่ฉลาดที่สุดไม่ใช่โมเดลที่คุณต้องการจริงๆ? ทุกคนไล่ตามโมเดล AI ที่ใหญ่ที่สุดเท่าที่จะหาได้ แต่พลังส่วนใหญ่กลับถูกใช้ไปกับขั้นตอนเล็กๆ ที่น่าเบื่อ. NVIDIA เพิ่งปล่อยโมเดล open source ขนาดเล็กที่ทำงานได้เร็วกว่าถึงสี่เท่า. แทบไม่มีใครตั้งค่า workflow (ขั้นตอนการทำงาน) ของตัวเองให้ใช้มันเลย. ผมจะให้ดูว่าอะไรเปลี่ยนไป.

ผมคือ digital avatar (อวตารดิจิทัล) ของ Julian Goldie. ผมช่วยให้คนเรียนรู้เครื่องมือ AI และนำไปใช้งานจริง. ไม่ใช่ทฤษฎี ไม่ใช่กระแสเกินจริง แต่เป็นสิ่งที่คุณลองทำได้เลยวันนี้. ในวิดีโอนี้ ผมจะอธิบายว่า NVIDIA เพิ่งเปิดตัวอะไร. ทำไมความเร็วจึงสำคัญกว่าที่คุณคิด. และมันเปลี่ยนวิธีสร้าง AI agent ของคุณอย่างไร. ช่วงท้าย ผมจะให้เคล็ดลับสำหรับมือใหม่ที่ช่วยลดความปวดหัวได้มากเวลาลองทำเอง. หนึ่งในนั้นคือสาเหตุที่คนส่วนใหญ่ทดสอบโมเดลนี้ผิดวิธีตั้งแต่วันแรก. เอาละ เริ่มจากว่าจริงๆ แล้วเจ้านี่คืออะไรครับ?

วันที่ 11 สิงหาคม NVIDIA ประกาศโมเดล Nemotron 3.5 Lightning. นี่คือข้อความที่พวกเขาประกาศแบบตรงตัว. เป็นโมเดล open source แบบ mixture of experts (ระบบผสมผู้เชี่ยวชาญ) ขนาด 30 พันล้านพารามิเตอร์. มี active parameters (พารามิเตอร์ที่ทำงานจริง) 3 พันล้าน. ถูกสร้างมาให้ agent ที่ทำงานตลอดเวลาทำงานเฉพาะทางปริมาณมากให้เสร็จเร็วขึ้น. และให้ความเร็ว output (ผลลัพธ์) สูงกว่าโมเดลขนาดใกล้เคียงกันถึงสี่เท่า.

ฟังดูเป็นศัพท์เทคนิคเยอะไปหน่อยนะครับ. ขออธิบายให้เข้าใจง่ายๆ. Mixture of experts หมายความว่าโมเดลถูกแบ่งออกเป็นผู้เชี่ยวชาญเฉพาะทางเล็กๆ จำนวนมาก. เมื่อคุณส่งคำหนึ่งคำเข้าไป router (ตัวจัดเส้นทาง) จะเลือกผู้เชี่ยวชาญเพียงไม่กี่ตัวมาดูแล. โมเดลจึงมีความจุถึง 30 พันล้านพารามิเตอร์. แต่ในแต่ละ token (หน่วยย่อยของข้อความ) จะมีเพียงประมาณ 3 พันล้านตัวที่ทำงาน. ลองนึกถึงออฟฟิศใหญ่ที่มีคน 100 คนในอาคาร แต่เมื่อมีคำถามเข้ามา มีเพียงสามคนที่ลุกขึ้นตอบ. ความจุใหญ่ แต่ภาระงานต่อขั้นตอนน้อย.

NVIDIA ชัดเจนว่าโมเดลนี้สร้างมาเพื่อใคร. มันไม่ใช่โมเดลที่เขียนกลยุทธ์ให้คุณ แต่เป็นโมเดลที่ทำงานเบื้องหลังกลยุทธ์นั้น. มีเรื่องหนึ่งเกี่ยวกับ AI agent ที่ไม่มีใครพูดถึง. agent ที่ทำงานยาวๆ ใช้เวลาส่วนใหญ่ไปกับงานซ้ำๆ เช่น เรียกใช้ tool (เครื่องมือ). ตรวจสอบว่า tool ทำงานสำเร็จไหม. จัดรูปแบบผลลัพธ์ แล้วส่งต่องานให้ agent ตัวอื่น.

NVIDIA กล่าวว่าโมเดลเล็กๆ เหล่านี้ได้เหรียญกล้าหาญในสนามรบ. พวกมันจัดการงานอย่าง Git pull (การดึงโค้ดจาก Git). ตรวจสอบผลลัพธ์จาก tool และการเรียกใช้งานประจำที่ประกอบเป็นงานส่วนใหญ่ของ agent ที่ทำงานยาว. ถ้าส่งทุกขั้นตอนแบบนั้นไปให้ frontier model (โมเดลระดับแนวหน้า) ขนาดยักษ์. คุณก็จะคอยรอให้อะไรที่ใหญ่โตมาตอบคำถามเล็กๆ น้อยๆ.

แล้วคุณจะใช้โมเดลแบบนี้ทำอะไรได้บ้างครับ? NVIDIA บอกว่ามันถูกสร้างมาสำหรับ execution layer (ชั้นปฏิบัติการ). เช่น อ่านไฟล์ เรียกใช้ tool เรียงผลลัพธ์ หรือลองทำใหม่เมื่อบางอย่างล้มเหลว.

มันรองรับ context length (ความยาวบริบท) สูงสุด 1 ล้าน token. จึงเก็บประวัติการใช้งาน tool ที่ยาวข้ามหลายรอบการสนทนาได้. และยังรองรับภาษาเขียนโค้ดหลายภาษา รวมถึงภาษาสเปน ฝรั่งเศส เยอรมัน อิตาลี และญี่ปุ่น.

แล้วมันรันได้ที่ไหนบ้างครับ? NVIDIA บอกว่า Nemotron 3.5 Lightning รันในเครื่องได้บน RTX PC, DGX, Spark และ Jetson. และขยายได้จนถึง RTX PRO workstation, DGX Station, ศูนย์ข้อมูล และ cloud (คลาวด์). คุณยังรันผ่าน Ollama, LM Studio, llama.cpp และ Unsloth ได้ด้วย.

ทีนี้ ถ้าฟังดูมีประโยชน์ แต่คุณไม่รู้จะเริ่มต้นกับการตั้งค่า agent ยังไง. นั่นคือช่องว่างที่เราทำงานกันใน AI Profit Boardroom พอดี. เราเปิดคอลโค้ชชิ่งสดให้คุณนำการตั้งค่า agent ของตัวเองมาถามได้. เพื่อที่คุณจะได้ไม่ต้องเดาว่าโมเดลไหนควรทำงานไหน.

เรามีวอล์กทรูวิธีรันโมเดลในเครื่องและเชื่อมต่อเข้ากับ workflow ของ agent. รวมถึง prompt (คำสั่ง) และ roadmap (แผนเส้นทาง) ที่แสดงลำดับการสร้าง. ถ้าคุณคิดจะทดสอบโมเดล open source อย่าง Lightning. เพื่อใช้เป็น worker (ตัวทำงาน) ใน stack (ชุดเครื่องมือ) ของคุณ. นั่นคือสิ่งที่เราช่วยสมาชิกวางแผนทีละขั้นตอน. แทนที่คุณจะเสียสุดสัปดาห์ไปกับปัญหาการติดตั้ง. ลิงก์อยู่ในคำอธิบายและคอมเมนต์.

ทีนี้มาพูดเรื่องความเร็วกัน. เพราะนั่นคือสิ่งที่คนกำลังพูดถึง. ในคอมเมนต์ใต้โพสต์ประกาศ NVIDIA แชร์ผล benchmark (การวัดประสิทธิภาพ) จาก Pinch Bench.

Nemotron 3.5 Lightning ทำ accuracy (ความแม่นยำ) ได้ 86%. ขณะทำงาน 10,000 งานเสร็จเร็วกว่า Qwen 3.6 35B ถึง 30%. ด้วยความแม่นยำใกล้เคียงกัน. ความแม่นยำใกล้เคียงกัน แต่ใช้เวลาน้อยลง 30%. นั่นคือตัวเลขที่สำคัญสำหรับ agent. ไม่ใช่ว่ามันพิมพ์เร็วแค่ไหน แต่คือทำงานเสร็จเร็วแค่ไหน. NVIDIA ยังบอกอีกว่าโมเดลนี้ชนะเส้นทางด้านความแม่นยำเทียบกับความเร็ว. บน artificial analysis intelligence index (ดัชนีวัดความฉลาด). ซึ่งรวมการประเมิน 9 รายการ ครอบคลุมงานเขียนโค้ด การให้เหตุผล. และงานแบบ agentic (ที่เอเจนต์เป็นคนทำ). สรุปคือมันเร็วและยังแม่นยำสำหรับขนาดของมัน. แล้วพวกเขาทำได้ยังไงครับ?

อย่างแรกคือ speculative decoding (การถอดรหัสแบบคาดเดาล่วงหน้า). พูดง่ายๆ คือโมเดลเดาคำหลายคำล่วงหน้า. แทนที่จะเขียนทีละคำ แล้วค่อยตรวจสอบคำที่เดาไว้อย่างรวดเร็ว. NVIDIA ฝัง multi-token prediction (การคาดการณ์หลายโทเคน) ไว้ในขั้นตอนการฝึกที่จัดไว้เฉพาะ. และยังแถม draft model (โมเดลร่าง) สองตัวชื่อ D-Flash และ D-Spark. ให้เลือกตั้งค่าให้เหมาะกับวิธีที่คุณรัน.

อย่างที่สองคือ quantization (การลดขนาดโมเดล). มันมาพร้อมเวอร์ชันบีบอัดแบบ NVFP4 และเวอร์ชันความแม่นยำเต็มแบบ BF16.

ยังมีสิ่งที่เรียกว่า harness optimized training (การฝึกที่ปรับให้เหมาะกับเฟรมเวิร์กเอเจนต์). NVIDIA ฝึกโมเดลนี้ให้เหมาะกับ agent harness (เฟรมเวิร์กสำหรับเอเจนต์). มันเป็นเฟรมเวิร์กยอดนิยมที่นักพัฒนาใช้อยู่แล้ว. ทำให้ agent ทำงานได้แม่นยำขึ้นและหน่วงน้อยลงในงานปริมาณมาก. ข้างในลึกๆ มันคือดีไซน์แบบ hybrid (ลูกผสม). ที่ผสมชั้น Mamba 2 เข้ากับชั้น mixture of experts. และชั้น select attention (กลไกความสนใจแบบคัดเลือก).

มันถูก pre-train (ฝึกเบื้องต้น) ด้วยข้อมูลมากกว่า 20 ล้านล้าน token. และเป็นสมาชิกที่เล็กที่สุดของตระกูล Nemotron 3. การรันมันในเครื่องยังหมายถึงข้อมูลของคุณอยู่บนอุปกรณ์ของคุณเอง. ยังมีอีกชิ้นหนึ่งที่ NVIDIA ปล่อยมาพร้อมกัน. ชื่อ Nemo Switchyard. มันคือไลบรารีจัดเส้นทางแบบ open source. ที่มองแต่ละขั้นตอนใน workflow ของ agent แล้วส่งไปยังโมเดลที่เหมาะที่สุดสำหรับงานนั้น.

งานวางแผนส่งขึ้นไปหา frontier model. งานปฏิบัติการส่งลงมาให้ Lightning. เลิกใช้โมเดลเดียวทำทุกอย่างได้แล้ว. หันมาสร้างระบบของโมเดลหลายตัวที่แต่ละตัวทำในสิ่งที่ตัวเองถนัด.

เคล็ดลับสำหรับมือใหม่. ข้อหนึ่ง ลองก่อนติดตั้งอะไร. NVIDIA ให้ลองใช้ได้ที่ build.nvidia.com และยังมีบน OpenRouter ด้วย. ลองเล่นในเบราว์เซอร์ก่อน. ข้อสอง อย่าตัดสินมันแบบ chatbot (แชตบอต). นี่คือความผิดพลาดที่เกือบทุกคนทำในวันเปิดตัว.

พวกเขาถามคำถามเปิดกว้างมหึมากับโมเดลปฏิบัติการขนาดเล็ก. ได้คำตอบธรรมดาๆ แล้วสรุปว่าโมเดลอ่อน. แต่นั่นไม่ใช่สิ่งที่มันถูกสร้างมาเพื่อทำ. ให้ทดสอบกับงานหลายขั้นตอนที่ซ้ำๆ. ให้ tool มันเรียกใช้. ให้ผลลัพธ์มันตรวจสอบ. นั่นแหละคือจุดที่มันเปล่งประกายครับ.

ข้อสาม เลือกเวอร์ชันให้ถูก. ถ้าอยากได้ความเร็ว ใช้เวอร์ชัน NVFP4. ถ้าอยากฝึกมันด้วยตัวอย่างของคุณเอง ให้เริ่มจากเวอร์ชัน BF16. เพราะ NVIDIA บอกว่านั่นคือเวอร์ชันอ้างอิงที่ตั้งใจไว้สำหรับ post training (การฝึกต่อยอด).

ข้อสี่ ใช้มันเป็นคนทำงาน ไม่ใช่เจ้านาย. เก็บโมเดลใหญ่ไว้วางแผน แล้วให้ Lightning รับมือกับปริมาณงาน. นั่นคือสิ่งที่ SwitchYard ถูกออกแบบมาให้ทำ. และคุณโหลดได้จาก GitHub ของ NVIDIA.

ข้อห้า ระวังการตั้งค่า context (บริบท). โมเดลรองรับ context window (หน้าต่างบริบท) สูงสุด 1 ล้าน token. แต่บางเส้นทางแบบโฮสต์จำกัดปริมาณที่มันสร้างได้ในครั้งเดียว. ตรวจสอบขีดจำกัดก่อนจะโทษโมเดล.

ข้อหก มันเปิดกว้างเต็มรูปแบบ. NVIDIA ปล่อย weights (ค่าน้ำหนัก) ข้อมูลฝึก และ recipes (สูตรการฝึก). ภายใต้สัญญาอนุญาต OpenMDW 1.1. พวกเขายังปล่อยชุดข้อมูล agentic reinforcement learning (การเรียนรู้แบบเสริมกำลังสำหรับเอเจนต์). ชื่อ Nemo Tron RL agentic terminal pivot. ใช้ฝึกทักษะด้าน coding agent (เอเจนต์เขียนโค้ด) บางส่วน.

คุณจึงสามารถ fine-tune (ปรับแต่ง) มันสำหรับงานเฉพาะอย่างหนึ่ง. แล้วรันเวอร์ชันเฉพาะของคุณเองได้. โมเดลเล็กๆ ปรับแต่งได้เร็วกว่า และใช้ฮาร์ดแวร์ที่เรียบง่ายกว่ามากเมื่อเทียบกับโมเดลใหญ่. โอกาสที่แท้จริงจึงไม่ใช่แค่ใช้ Lightning ตามสภาพที่มันมา. แต่คือการปรับแต่งมันให้เข้ากับวิธีทำงานของคุณเอง.

ถ้าอยากได้กระบวนการเต็มรูปแบบ SOP (มาตรฐานการปฏิบัติงาน). และกรณีการใช้งาน AI กว่า 100 กรณีแบบนี้. เข้าร่วม AI Success Lab ได้เลย. ลิงก์อยู่ในคอมเมนต์และคำอธิบาย.

คุณจะได้โน้ตทั้งหมดของวิดีโอจากที่นั่น. พร้อมการเข้าถึงคอมมูนิตี้สมาชิก 85,000 คนที่กำลังประสบความสำเร็จกับ AI. และเมื่อคุณไปลองทำจริง นี่คือสิ่งที่เกิดขึ้น. คุณจะรันโมเดลได้ แล้วคำถามจริงๆ ก็จะถาโถมเข้ามา.

ขั้นตอนไหนควรส่งให้ Lightning? ขั้นตอนไหนควรส่งขึ้นไปหาโมเดลใหญ่? จะตั้งค่า routing (การจัดเส้นทาง) ยังไงไม่ให้ agent พัง? ควรติดตั้งเวอร์ชันไหนสำหรับฮาร์ดแวร์ของคุณ? จะ fine-tune ด้วยตัวอย่างของตัวเองยังไงไม่ให้เสียเวลาเป็นวัน?

นั่นคือจุดที่คนส่วนใหญ่ติดอยู่ แล้วเงียบๆ กลับไปใช้โมเดลเดียวทำทุกอย่าง. นั่นคือสิ่งที่ AI Profit Boardroom สร้างขึ้นมาเพื่อแก้. คุณจะได้คอลโค้ชชิ่งสดที่ถามเรื่องการตั้งค่าของคุณโดยเฉพาะ. บทเรียนเกี่ยวกับโมเดลในเครื่องและ agent harness. roadmap ที่บอกว่าควรสร้างอะไรก่อน และ prompt ที่ใช้ได้ทันที. แทนที่จะทดสอบแบบมั่วๆ หลายสัปดาห์ คุณจะได้ทางลัดและคนให้ถามเมื่อติดขัด. มาร่วมกับเราที่ aiprofitboardroom.com.

03

หมายเหตุการแปล

ความโปร่งใสเกี่ยวกับความไม่แน่นอนในต้นฉบับ

  • ## ข้อความที่ฟังไม่ชัด ([ฟังไม่ชัด])
  • ไม่มี — ไม่พบช่วงที่เสียงไม่ชัดเจนจนต้องใช้เครื่องหมาย [ฟังไม่ชัด]
  • ไม่มีการใช้เครื่องหมาย [ฟังไม่ชัด] เนื่องจากไม่พบช่วงที่ฟังไม่ชัดจริง
04

อภิธานศัพท์เทคนิค

คำศัพท์และชื่อผลิตภัณฑ์ที่คงรูปภาษาอังกฤษ

ศัพท์คำแปล / คำอธิบาย
open sourceโอเพนซอร์ส — ซอฟต์แวร์ที่เปิดเผยโค้ด/น้ำหนักโมเดลให้ใช้ฟรี
mixture of experts (MoE)ระบบผสมผู้เชี่ยวชาญ — โมเดลที่แบ่งเป็นผู้เชี่ยวชาญย่อยหลายตัว และเลือกใช้เพียงบางตัวต่อ token
parametersพารามิเตอร์ — ค่าน้ำหนักภายในโมเดลที่กำหนดความสามารถ
active parametersพารามิเตอร์ที่ทำงานจริงในแต่ละ token
tokenหน่วยย่อยของข้อความที่โมเดลประมวลผล
routerตัวจัดเส้นทาง — กลไกที่เลือกผู้เชี่ยวชาญย่อยให้ทำงาน
AI agentเอเจนต์ AI — โปรแกรมอัตโนมัติที่ทำงานตามขั้นตอนที่กำหนด
workflowขั้นตอนการทำงานที่เชื่อมโยงเครื่องมือและโมเดลเข้าด้วยกัน
digital avatarอวตารดิจิทัล
toolเครื่องมือที่ agent เรียกใช้เพื่อทำงาน
Git pullคำสั่งดึงข้อมูล/โค้ดจาก Git
frontier modelโมเดลระดับแนวหน้าที่ใหญ่และเก่งที่สุด
execution layerชั้นปฏิบัติการ — งานที่ต้องลงมือทำซ้ำๆ เบื้องหลัง
context length / context windowความยาวบริบท / หน้าต่างบริบท — จำนวน token สูงสุดที่โมเดมจำได้ในรอบการสนทนา
benchmarkการวัดประสิทธิภาพเปรียบเทียบ
accuracyความแม่นยำ
speculative decodingการถอดรหัสแบบคาดเดาล่วงหน้า — เดาคำหลายคำก่อนแล้วตรวจสอบทีหลัง
multi-token predictionการคาดการณ์หลายโทเคนล่วงหน้า
draft modelโมเดลร่าง — โมเดลขนาดเล็กที่เดาคำล่วงหน้าให้โมเดลหลัก
quantizationการลดขนาด/บีบอัดโมเดลให้เล็กลงและเร็วขึ้น
NVFP4รูปแบบความแม่นยำต่ำแบบบีบอัดของ NVIDIA
BF16รูปแบบความแม่นยำเต็ม (bfloat16)
harness optimized trainingการฝึกที่ปรับให้เหมาะกับเฟรมเวิร์กเอเจนต์
agent harnessเฟรมเวิร์ก/โครงสร้างที่ใช้สร้างและรัน agent
Mamba 2สถาปัตยกรรมโมเดลแบบ state space
select attentionกลไกความสนใจแบบคัดเลือก
pre-trainการฝึกเบื้องต้นด้วยข้อมูลมหาศาล
post trainingการฝึกต่อยอดหลังการฝึกหลัก
fine-tuneการปรับแต่งโมเดลด้วยข้อมูลเฉพาะงาน
routingการจัดเส้นทางงานไปยังโมเดลที่เหมาะสม
promptคำสั่ง/ข้อความที่ใช้สั่งโมเดล
weightsค่าน้ำหนักของโมเดล
recipesสูตร/ชุดขั้นตอนการฝึกโมเดล
agentic reinforcement learning (RL)การเรียนรู้แบบเสริมกำลังสำหรับเอเจนต์
coding agentเอเจนต์ที่เขียนโค้ด
chatbotแชตบอต — โปรแกรมสนทนาอัตโนมัติ
SOP (Standard Operating Procedure)มาตรฐานการปฏิบัติงาน
stackชุดเครื่องมือ/เทคโนโลยีที่ใช้ร่วมกัน
workerตัวทำงาน — โมเดลที่รับงานปริมาณมากซ้ำๆ
OpenRouterบริการที่ให้รันโมเดลหลายตัวผ่าน API เดียว
cloudคลาวด์ — การประมวลผลผ่านเซิร์ฟเวอร์ระยะไกล
benchmark (Pinch Bench)การวัดประสิทธิภาพ (ชื่อชุดทดสอบตามต้นฉบับ)
05

ซับไตเติ้ลภาษาไทย

ดาวน์โหลดหรือดูซับทั้งหมด

1
00:00:00,000 --> 00:00:02,832
โมเดล AI ขนาด 30B ของ NVIDIA เร็วกว่าที่คุณคิด.

2
00:00:02,832 --> 00:00:06,688
จะเป็นอย่างไรถ้าโมเดลที่ฉลาดที่สุดไม่ใช่โมเดลที่คุณต้องการจริงๆ?

3
00:00:06,688 --> 00:00:12,111
ทุกคนไล่ตามโมเดล AI ที่ใหญ่ที่สุดเท่าที่จะหาได้ แต่พลังส่วนใหญ่กลับถูกใช้ไปกับขั้นตอนเล็กๆ

4
00:00:12,111 --> 00:00:13,207
ที่น่าเบื่อ.
thai-subtitles.srt
SubRip — ใช้กับเครื่องเล่นวิดีโอส่วนใหญ่
↓ ดาวน์โหลด
thai-subtitles.vtt
WebVTT — ใช้กับเว็บ / YouTube
↓ ดาวน์โหลด
เปิดดูซับไตเติ้ลทั้งหมด (165 segments)
1
00:00:00,000 --> 00:00:02,832
โมเดล AI ขนาด 30B ของ NVIDIA เร็วกว่าที่คุณคิด.

2
00:00:02,832 --> 00:00:06,688
จะเป็นอย่างไรถ้าโมเดลที่ฉลาดที่สุดไม่ใช่โมเดลที่คุณต้องการจริงๆ?

3
00:00:06,688 --> 00:00:12,111
ทุกคนไล่ตามโมเดล AI ที่ใหญ่ที่สุดเท่าที่จะหาได้ แต่พลังส่วนใหญ่กลับถูกใช้ไปกับขั้นตอนเล็กๆ

4
00:00:12,111 --> 00:00:13,207
ที่น่าเบื่อ.

5
00:00:13,207 --> 00:00:17,606
NVIDIA เพิ่งปล่อยโมเดล open source ขนาดเล็กที่ทำงานได้เร็วกว่าถึงสี่เท่า.

6
00:00:17,606 --> 00:00:21,703
แทบไม่มีใครตั้งค่า workflow (ขั้นตอนการทำงาน) ของตัวเองให้ใช้มันเลย.

7
00:00:21,703 --> 00:00:23,270
ผมจะให้ดูว่าอะไรเปลี่ยนไป.

8
00:00:23,270 --> 00:00:26,524
ผมคือ digital avatar (อวตารดิจิทัล) ของ Julian Goldie.

9
00:00:26,524 --> 00:00:29,597
ผมช่วยให้คนเรียนรู้เครื่องมือ AI และนำไปใช้งานจริง.

10
00:00:29,597 --> 00:00:33,634
ไม่ใช่ทฤษฎี ไม่ใช่กระแสเกินจริง แต่เป็นสิ่งที่คุณลองทำได้เลยวันนี้.

11
00:00:33,634 --> 00:00:36,646
ในวิดีโอนี้ ผมจะอธิบายว่า NVIDIA เพิ่งเปิดตัวอะไร.

12
00:00:36,646 --> 00:00:38,695
ทำไมความเร็วจึงสำคัญกว่าที่คุณคิด.

13
00:00:38,695 --> 00:00:41,467
และมันเปลี่ยนวิธีสร้าง AI agent ของคุณอย่างไร.

14
00:00:41,467 --> 00:00:45,986
ช่วงท้าย ผมจะให้เคล็ดลับสำหรับมือใหม่ที่ช่วยลดความปวดหัวได้มากเวลาลองทำเอง.

15
00:00:45,986 --> 00:00:50,023
หนึ่งในนั้นคือสาเหตุที่คนส่วนใหญ่ทดสอบโมเดลนี้ผิดวิธีตั้งแต่วันแรก.

16
00:00:50,023 --> 00:00:52,795
เอาละ เริ่มจากว่าจริงๆ แล้วเจ้านี่คืออะไรครับ?

17
00:00:52,795 --> 00:00:56,410
วันที่ 11 สิงหาคม NVIDIA ประกาศโมเดล Nemotron 3.5 Lightning.

18
00:00:56,410 --> 00:00:58,700
นี่คือข้อความที่พวกเขาประกาศแบบตรงตัว.

19
00:00:58,700 --> 00:01:04,364
เป็นโมเดล open source แบบ mixture of experts (ระบบผสมผู้เชี่ยวชาญ) ขนาด 30 พันล้านพารามิเตอร์.

20
00:01:04,364 --> 00:01:07,798
มี active parameters (พารามิเตอร์ที่ทำงานจริง) 3 พันล้าน.

21
00:01:07,798 --> 00:01:12,317
ถูกสร้างมาให้ agent ที่ทำงานตลอดเวลาทำงานเฉพาะทางปริมาณมากให้เสร็จเร็วขึ้น.

22
00:01:12,317 --> 00:01:16,595
และให้ความเร็ว output (ผลลัพธ์) สูงกว่าโมเดลขนาดใกล้เคียงกันถึงสี่เท่า.

23
00:01:16,595 --> 00:01:18,885
ฟังดูเป็นศัพท์เทคนิคเยอะไปหน่อยนะครับ.

24
00:01:18,885 --> 00:01:20,271
ขออธิบายให้เข้าใจง่ายๆ.

25
00:01:20,271 --> 00:01:24,730
Mixture of experts หมายความว่าโมเดลถูกแบ่งออกเป็นผู้เชี่ยวชาญเฉพาะทางเล็กๆ

26
00:01:24,730 --> 00:01:25,826
จำนวนมาก.

27
00:01:25,826 --> 00:01:31,249
เมื่อคุณส่งคำหนึ่งคำเข้าไป router (ตัวจัดเส้นทาง) จะเลือกผู้เชี่ยวชาญเพียงไม่กี่ตัวมาดูแล.

28
00:01:31,249 --> 00:01:33,780
โมเดลจึงมีความจุถึง 30 พันล้านพารามิเตอร์.

29
00:01:33,780 --> 00:01:38,359
แต่ในแต่ละ token (หน่วยย่อยของข้อความ) จะมีเพียงประมาณ 3 พันล้านตัวที่ทำงาน.

30
00:01:38,359 --> 00:01:43,722
ลองนึกถึงออฟฟิศใหญ่ที่มีคน 100 คนในอาคาร แต่เมื่อมีคำถามเข้ามา มีเพียงสามคนที่ลุกขึ้นตอบ.

31
00:01:43,722 --> 00:01:45,891
ความจุใหญ่ แต่ภาระงานต่อขั้นตอนน้อย.

32
00:01:45,891 --> 00:01:48,301
NVIDIA ชัดเจนว่าโมเดลนี้สร้างมาเพื่อใคร.

33
00:01:48,301 --> 00:01:53,001
มันไม่ใช่โมเดลที่เขียนกลยุทธ์ให้คุณ แต่เป็นโมเดลที่ทำงานเบื้องหลังกลยุทธ์นั้น.

34
00:01:53,001 --> 00:01:56,014
มีเรื่องหนึ่งเกี่ยวกับ AI agent ที่ไม่มีใครพูดถึง.

35
00:01:56,014 --> 00:01:58,785
agent ที่ทำงานยาวๆ ใช้เวลาส่วนใหญ่ไปกับงานซ้ำๆ

36
00:01:58,785 --> 00:02:00,714
เช่น เรียกใช้ tool (เครื่องมือ).

37
00:02:00,714 --> 00:02:02,581
ตรวจสอบว่า tool ทำงานสำเร็จไหม.

38
00:02:02,581 --> 00:02:05,474
จัดรูปแบบผลลัพธ์ แล้วส่งต่องานให้ agent ตัวอื่น.

39
00:02:05,474 --> 00:02:06,980
NVIDIA กล่าวว่าโมเดลเล็กๆ

40
00:02:06,980 --> 00:02:08,968
เหล่านี้ได้เหรียญกล้าหาญในสนามรบ.

41
00:02:08,968 --> 00:02:11,981
พวกมันจัดการงานอย่าง Git pull (การดึงโค้ดจาก Git).

42
00:02:11,981 --> 00:02:17,464
ตรวจสอบผลลัพธ์จาก tool และการเรียกใช้งานประจำที่ประกอบเป็นงานส่วนใหญ่ของ agent ที่ทำงานยาว.

43
00:02:17,464 --> 00:02:21,923
ถ้าส่งทุกขั้นตอนแบบนั้นไปให้ frontier model (โมเดลระดับแนวหน้า) ขนาดยักษ์.

44
00:02:21,923 --> 00:02:24,514
คุณก็จะคอยรอให้อะไรที่ใหญ่โตมาตอบคำถามเล็กๆ

45
00:02:24,514 --> 00:02:25,610
น้อยๆ.

46
00:02:25,610 --> 00:02:28,081
แล้วคุณจะใช้โมเดลแบบนี้ทำอะไรได้บ้างครับ?

47
00:02:28,081 --> 00:02:32,058
NVIDIA บอกว่ามันถูกสร้างมาสำหรับ execution layer (ชั้นปฏิบัติการ).

48
00:02:32,058 --> 00:02:36,577
เช่น อ่านไฟล์ เรียกใช้ tool เรียงผลลัพธ์ หรือลองทำใหม่เมื่อบางอย่างล้มเหลว.

49
00:02:36,577 --> 00:02:40,192
มันรองรับ context length (ความยาวบริบท) สูงสุด 1 ล้าน token.

50
00:02:40,192 --> 00:02:43,687
จึงเก็บประวัติการใช้งาน tool ที่ยาวข้ามหลายรอบการสนทนาได้.

51
00:02:43,687 --> 00:02:48,748
และยังรองรับภาษาเขียนโค้ดหลายภาษา รวมถึงภาษาสเปน ฝรั่งเศส เยอรมัน อิตาลี และญี่ปุ่น.

52
00:02:48,748 --> 00:02:50,435
แล้วมันรันได้ที่ไหนบ้างครับ?

53
00:02:50,435 --> 00:02:55,557
NVIDIA บอกว่า Nemotron 3.5 Lightning รันในเครื่องได้บน RTX PC, DGX, Spark และ Jetson.

54
00:02:55,557 --> 00:03:00,438
และขยายได้จนถึง RTX PRO workstation, DGX Station, ศูนย์ข้อมูล และ cloud (คลาวด์).

55
00:03:00,438 --> 00:03:04,234
คุณยังรันผ่าน Ollama, LM Studio, llama.cpp และ Unsloth ได้ด้วย.

56
00:03:04,234 --> 00:03:08,632
ทีนี้ ถ้าฟังดูมีประโยชน์ แต่คุณไม่รู้จะเริ่มต้นกับการตั้งค่า agent ยังไง.

57
00:03:08,632 --> 00:03:12,067
นั่นคือช่องว่างที่เราทำงานกันใน AI Profit Boardroom พอดี.

58
00:03:12,067 --> 00:03:15,863
เราเปิดคอลโค้ชชิ่งสดให้คุณนำการตั้งค่า agent ของตัวเองมาถามได้.

59
00:03:15,863 --> 00:03:18,815
เพื่อที่คุณจะได้ไม่ต้องเดาว่าโมเดลไหนควรทำงานไหน.

60
00:03:18,815 --> 00:03:23,214
เรามีวอล์กทรูวิธีรันโมเดลในเครื่องและเชื่อมต่อเข้ากับ workflow ของ agent.

61
00:03:23,214 --> 00:03:27,371
รวมถึง prompt (คำสั่ง) และ roadmap (แผนเส้นทาง) ที่แสดงลำดับการสร้าง.

62
00:03:27,371 --> 00:03:30,384
ถ้าคุณคิดจะทดสอบโมเดล open source อย่าง Lightning.

63
00:03:30,384 --> 00:03:34,180
เพื่อใช้เป็น worker (ตัวทำงาน) ใน stack (ชุดเครื่องมือ) ของคุณ.

64
00:03:34,180 --> 00:03:36,892
นั่นคือสิ่งที่เราช่วยสมาชิกวางแผนทีละขั้นตอน.

65
00:03:36,892 --> 00:03:39,663
แทนที่คุณจะเสียสุดสัปดาห์ไปกับปัญหาการติดตั้ง.

66
00:03:39,663 --> 00:03:41,531
ลิงก์อยู่ในคำอธิบายและคอมเมนต์.

67
00:03:41,531 --> 00:03:43,219
ทีนี้มาพูดเรื่องความเร็วกัน.

68
00:03:43,219 --> 00:03:45,207
เพราะนั่นคือสิ่งที่คนกำลังพูดถึง.

69
00:03:45,207 --> 00:03:50,329
ในคอมเมนต์ใต้โพสต์ประกาศ NVIDIA แชร์ผล benchmark (การวัดประสิทธิภาพ) จาก Pinch Bench.

70
00:03:50,329 --> 00:03:53,703
Nemotron 3.5 Lightning ทำ accuracy (ความแม่นยำ) ได้ 86%.

71
00:03:53,703 --> 00:03:56,957
ขณะทำงาน 10,000 งานเสร็จเร็วกว่า Qwen 3.6 35B ถึง 30%.

72
00:03:56,957 --> 00:03:58,583
ด้วยความแม่นยำใกล้เคียงกัน.

73
00:03:58,583 --> 00:04:01,235
ความแม่นยำใกล้เคียงกัน แต่ใช้เวลาน้อยลง 30%.

74
00:04:01,235 --> 00:04:03,283
นั่นคือตัวเลขที่สำคัญสำหรับ agent.

75
00:04:03,283 --> 00:04:06,597
ไม่ใช่ว่ามันพิมพ์เร็วแค่ไหน แต่คือทำงานเสร็จเร็วแค่ไหน.

76
00:04:06,597 --> 00:04:10,695
NVIDIA ยังบอกอีกว่าโมเดลนี้ชนะเส้นทางด้านความแม่นยำเทียบกับความเร็ว.

77
00:04:10,695 --> 00:04:14,370
บน artificial analysis intelligence index (ดัชนีวัดความฉลาด).

78
00:04:14,370 --> 00:04:18,046
ซึ่งรวมการประเมิน 9 รายการ ครอบคลุมงานเขียนโค้ด การให้เหตุผล.

79
00:04:18,046 --> 00:04:20,396
และงานแบบ agentic (ที่เอเจนต์เป็นคนทำ).

80
00:04:20,396 --> 00:04:22,987
สรุปคือมันเร็วและยังแม่นยำสำหรับขนาดของมัน.

81
00:04:22,987 --> 00:04:24,493
แล้วพวกเขาทำได้ยังไงครับ?

82
00:04:24,493 --> 00:04:28,289
อย่างแรกคือ speculative decoding (การถอดรหัสแบบคาดเดาล่วงหน้า).

83
00:04:28,289 --> 00:04:30,519
พูดง่ายๆ คือโมเดลเดาคำหลายคำล่วงหน้า.

84
00:04:30,519 --> 00:04:34,074
แทนที่จะเขียนทีละคำ แล้วค่อยตรวจสอบคำที่เดาไว้อย่างรวดเร็ว.

85
00:04:34,074 --> 00:04:39,497
NVIDIA ฝัง multi-token prediction (การคาดการณ์หลายโทเคน) ไว้ในขั้นตอนการฝึกที่จัดไว้เฉพาะ.

86
00:04:39,497 --> 00:04:43,413
และยังแถม draft model (โมเดลร่าง) สองตัวชื่อ D-Flash และ D-Spark.

87
00:04:43,413 --> 00:04:45,823
ให้เลือกตั้งค่าให้เหมาะกับวิธีที่คุณรัน.

88
00:04:45,823 --> 00:04:48,535
อย่างที่สองคือ quantization (การลดขนาดโมเดล).

89
00:04:48,535 --> 00:04:52,632
มันมาพร้อมเวอร์ชันบีบอัดแบบ NVFP4 และเวอร์ชันความแม่นยำเต็มแบบ BF16.

90
00:04:52,632 --> 00:04:58,176
ยังมีสิ่งที่เรียกว่า harness optimized training (การฝึกที่ปรับให้เหมาะกับเฟรมเวิร์กเอเจนต์).

91
00:04:58,176 --> 00:05:02,393
NVIDIA ฝึกโมเดลนี้ให้เหมาะกับ agent harness (เฟรมเวิร์กสำหรับเอเจนต์).

92
00:05:02,393 --> 00:05:05,225
มันเป็นเฟรมเวิร์กยอดนิยมที่นักพัฒนาใช้อยู่แล้ว.

93
00:05:05,225 --> 00:05:08,780
ทำให้ agent ทำงานได้แม่นยำขึ้นและหน่วงน้อยลงในงานปริมาณมาก.

94
00:05:08,780 --> 00:05:11,371
ข้างในลึกๆ มันคือดีไซน์แบบ hybrid (ลูกผสม).

95
00:05:11,371 --> 00:05:14,384
ที่ผสมชั้น Mamba 2 เข้ากับชั้น mixture of experts.

96
00:05:14,384 --> 00:05:17,457
และชั้น select attention (กลไกความสนใจแบบคัดเลือก).

97
00:05:17,457 --> 00:05:21,554
มันถูก pre-train (ฝึกเบื้องต้น) ด้วยข้อมูลมากกว่า 20 ล้านล้าน token.

98
00:05:21,554 --> 00:05:24,386
และเป็นสมาชิกที่เล็กที่สุดของตระกูล Nemotron 3.

99
00:05:24,386 --> 00:05:28,182
การรันมันในเครื่องยังหมายถึงข้อมูลของคุณอยู่บนอุปกรณ์ของคุณเอง.

100
00:05:28,182 --> 00:05:30,834
ยังมีอีกชิ้นหนึ่งที่ NVIDIA ปล่อยมาพร้อมกัน.

101
00:05:30,834 --> 00:05:32,099
ชื่อ Nemo Switchyard.

102
00:05:32,099 --> 00:05:34,449
มันคือไลบรารีจัดเส้นทางแบบ open source.

103
00:05:34,449 --> 00:05:39,571
ที่มองแต่ละขั้นตอนใน workflow ของ agent แล้วส่งไปยังโมเดลที่เหมาะที่สุดสำหรับงานนั้น.

104
00:05:39,571 --> 00:05:41,740
งานวางแผนส่งขึ้นไปหา frontier model.

105
00:05:41,740 --> 00:05:43,788
งานปฏิบัติการส่งลงมาให้ Lightning.

106
00:05:43,788 --> 00:05:45,897
เลิกใช้โมเดลเดียวทำทุกอย่างได้แล้ว.

107
00:05:45,897 --> 00:05:49,633
หันมาสร้างระบบของโมเดลหลายตัวที่แต่ละตัวทำในสิ่งที่ตัวเองถนัด.

108
00:05:49,633 --> 00:05:50,959
เคล็ดลับสำหรับมือใหม่.

109
00:05:50,959 --> 00:05:52,646
ข้อหนึ่ง ลองก่อนติดตั้งอะไร.

110
00:05:52,646 --> 00:05:56,683
NVIDIA ให้ลองใช้ได้ที่ build.nvidia.com และยังมีบน OpenRouter ด้วย.

111
00:05:56,683 --> 00:05:58,189
ลองเล่นในเบราว์เซอร์ก่อน.

112
00:05:58,189 --> 00:06:00,660
ข้อสอง อย่าตัดสินมันแบบ chatbot (แชตบอต).

113
00:06:00,660 --> 00:06:03,371
นี่คือความผิดพลาดที่เกือบทุกคนทำในวันเปิดตัว.

114
00:06:03,371 --> 00:06:06,685
พวกเขาถามคำถามเปิดกว้างมหึมากับโมเดลปฏิบัติการขนาดเล็ก.

115
00:06:06,685 --> 00:06:08,915
ได้คำตอบธรรมดาๆ แล้วสรุปว่าโมเดลอ่อน.

116
00:06:08,915 --> 00:06:11,385
แต่นั่นไม่ใช่สิ่งที่มันถูกสร้างมาเพื่อทำ.

117
00:06:11,385 --> 00:06:13,374
ให้ทดสอบกับงานหลายขั้นตอนที่ซ้ำๆ.

118
00:06:13,374 --> 00:06:15,965
ให้ tool มันเรียกใช้. ให้ผลลัพธ์มันตรวจสอบ.

119
00:06:15,965 --> 00:06:18,134
นั่นแหละคือจุดที่มันเปล่งประกายครับ.

120
00:06:18,134 --> 00:06:19,761
ข้อสาม เลือกเวอร์ชันให้ถูก.

121
00:06:19,761 --> 00:06:21,990
ถ้าอยากได้ความเร็ว ใช้เวอร์ชัน NVFP4.

122
00:06:21,990 --> 00:06:25,605
ถ้าอยากฝึกมันด้วยตัวอย่างของคุณเอง ให้เริ่มจากเวอร์ชัน BF16.

123
00:06:25,605 --> 00:06:30,968
เพราะ NVIDIA บอกว่านั่นคือเวอร์ชันอ้างอิงที่ตั้งใจไว้สำหรับ post training (การฝึกต่อยอด).

124
00:06:30,968 --> 00:06:33,318
ข้อสี่ ใช้มันเป็นคนทำงาน ไม่ใช่เจ้านาย.

125
00:06:33,318 --> 00:06:36,933
เก็บโมเดลใหญ่ไว้วางแผน แล้วให้ Lightning รับมือกับปริมาณงาน.

126
00:06:36,933 --> 00:06:39,524
นั่นคือสิ่งที่ SwitchYard ถูกออกแบบมาให้ทำ.

127
00:06:39,524 --> 00:06:41,633
และคุณโหลดได้จาก GitHub ของ NVIDIA.

128
00:06:41,633 --> 00:06:43,983
ข้อห้า ระวังการตั้งค่า context (บริบท).

129
00:06:43,983 --> 00:06:47,779
โมเดลรองรับ context window (หน้าต่างบริบท) สูงสุด 1 ล้าน token.

130
00:06:47,779 --> 00:06:51,334
แต่บางเส้นทางแบบโฮสต์จำกัดปริมาณที่มันสร้างได้ในครั้งเดียว.

131
00:06:51,334 --> 00:06:53,142
ตรวจสอบขีดจำกัดก่อนจะโทษโมเดล.

132
00:06:53,142 --> 00:06:54,889
ข้อหก มันเปิดกว้างเต็มรูปแบบ.

133
00:06:54,889 --> 00:06:59,047
NVIDIA ปล่อย weights (ค่าน้ำหนัก) ข้อมูลฝึก และ recipes (สูตรการฝึก).

134
00:06:59,047 --> 00:07:00,854
ภายใต้สัญญาอนุญาต OpenMDW 1.1.

135
00:07:00,854 --> 00:07:06,579
พวกเขายังปล่อยชุดข้อมูล agentic reinforcement learning (การเรียนรู้แบบเสริมกำลังสำหรับเอเจนต์).

136
00:07:06,579 --> 00:07:09,049
ชื่อ Nemo Tron RL agentic terminal pivot.

137
00:07:09,049 --> 00:07:12,423
ใช้ฝึกทักษะด้าน coding agent (เอเจนต์เขียนโค้ด) บางส่วน.

138
00:07:12,423 --> 00:07:16,159
คุณจึงสามารถ fine-tune (ปรับแต่ง) มันสำหรับงานเฉพาะอย่างหนึ่ง.

139
00:07:16,159 --> 00:07:18,810
แล้วรันเวอร์ชันเฉพาะของคุณเองได้. โมเดลเล็กๆ

140
00:07:18,810 --> 00:07:23,450
ปรับแต่งได้เร็วกว่า และใช้ฮาร์ดแวร์ที่เรียบง่ายกว่ามากเมื่อเทียบกับโมเดลใหญ่.

141
00:07:23,450 --> 00:07:26,884
โอกาสที่แท้จริงจึงไม่ใช่แค่ใช้ Lightning ตามสภาพที่มันมา.

142
00:07:26,884 --> 00:07:29,837
แต่คือการปรับแต่งมันให้เข้ากับวิธีทำงานของคุณเอง.

143
00:07:29,837 --> 00:07:33,271
ถ้าอยากได้กระบวนการเต็มรูปแบบ SOP (มาตรฐานการปฏิบัติงาน).

144
00:07:33,271 --> 00:07:35,682
และกรณีการใช้งาน AI กว่า 100 กรณีแบบนี้.

145
00:07:35,682 --> 00:07:37,550
เข้าร่วม AI Success Lab ได้เลย.

146
00:07:37,550 --> 00:07:39,417
ลิงก์อยู่ในคอมเมนต์และคำอธิบาย.

147
00:07:39,417 --> 00:07:41,767
คุณจะได้โน้ตทั้งหมดของวิดีโอจากที่นั่น.

148
00:07:41,767 --> 00:07:46,045
พร้อมการเข้าถึงคอมมูนิตี้สมาชิก 85,000 คนที่กำลังประสบความสำเร็จกับ AI.

149
00:07:46,045 --> 00:07:48,757
และเมื่อคุณไปลองทำจริง นี่คือสิ่งที่เกิดขึ้น.

150
00:07:48,757 --> 00:07:50,625
คุณจะรันโมเดลได้ แล้วคำถามจริงๆ

151
00:07:50,625 --> 00:07:51,721
ก็จะถาโถมเข้ามา.

152
00:07:51,721 --> 00:07:53,529
ขั้นตอนไหนควรส่งให้ Lightning?

153
00:07:53,529 --> 00:07:55,577
ขั้นตอนไหนควรส่งขึ้นไปหาโมเดลใหญ่?

154
00:07:55,577 --> 00:07:58,952
จะตั้งค่า routing (การจัดเส้นทาง) ยังไงไม่ให้ agent พัง?

155
00:07:58,952 --> 00:08:01,543
ควรติดตั้งเวอร์ชันไหนสำหรับฮาร์ดแวร์ของคุณ?

156
00:08:01,543 --> 00:08:05,218
จะ fine-tune ด้วยตัวอย่างของตัวเองยังไงไม่ให้เสียเวลาเป็นวัน?

157
00:08:05,218 --> 00:08:07,689
นั่นคือจุดที่คนส่วนใหญ่ติดอยู่ แล้วเงียบๆ

158
00:08:07,689 --> 00:08:09,496
กลับไปใช้โมเดลเดียวทำทุกอย่าง.

159
00:08:09,496 --> 00:08:12,810
นั่นคือสิ่งที่ AI Profit Boardroom สร้างขึ้นมาเพื่อแก้.

160
00:08:12,810 --> 00:08:16,305
คุณจะได้คอลโค้ชชิ่งสดที่ถามเรื่องการตั้งค่าของคุณโดยเฉพาะ.

161
00:08:16,305 --> 00:08:19,197
บทเรียนเกี่ยวกับโมเดลในเครื่องและ agent harness.

162
00:08:19,197 --> 00:08:22,812
roadmap ที่บอกว่าควรสร้างอะไรก่อน และ prompt ที่ใช้ได้ทันที.

163
00:08:22,812 --> 00:08:24,078
แทนที่จะทดสอบแบบมั่วๆ

164
00:08:24,078 --> 00:08:27,030
หลายสัปดาห์ คุณจะได้ทางลัดและคนให้ถามเมื่อติดขัด.

165
00:08:27,030 --> 00:08:29,320
มาร่วมกับเราที่ aiprofitboardroom.com.