NVIDIA’s 30B AI Model Is Faster Than You Think
สรุปย่อ
ประเด็นสำคัญจากวิดีโอ
- ช่อง: Julian Goldie SEO
# สรุป: NVIDIA's 30B AI Model Is Faster Than You Think - ช่อง: Julian Goldie SEO - ความยาว: 8 นาที 29 วินาที (509 วินาที) - ลิงก์: https://www.youtube.com/watch?v=tYHYGM60hSg ## ประเด็นหลัก - NVIDIA เปิดตัวโมเดล Nemotron 3.5 Lightning ซึ่งเป็นโมเดล open source ขนาด 30B แบบ mixture of experts มี active parameters เพียง 3B แต่ให้ความเร็ว output สูงกว่าโมเดลขนาดใกล้เคียงกันถึง 4 เท่า - โมเดลถูกออกแบบมาสำหรับ execution layer คืองานซ้ำๆ เบื้องหลัง agent เช่น เรียกใช้ tool ตรวจสอบผลลัพธ์ จัดรูปแบบข้อมูล แทนที่จะส่งงานเล็กๆ เหล่านั้นไปให้โมเดลใหญ่ยักษ์ - รองรับ context window สูงสุด 1 ล้าน token รันได้ทั้งในเครื่อง (RTX PC, DGX, Spark, Jetson) และบนคลาวด์ ผ่าน Ollama, LM Studio, llama.cpp และ Unsloth - ผล benchmark จาก Pinch Bench: ทำ accuracy 86% และทำงาน 10,000 งานเสร็จเร็วกว่า Qwen 3.6 35B ถึง 30% ที่ความแม่นยำใกล้เคียงกัน - เทคนิคความเร็วหลักสองอย่าง: speculative decoding (เดาคำล่วงหน้าหลายคำ) และ quantization (เวอร์ชันบีบอัด NVFP4 เทียบกับ BF16 เต็มความแม่นยำ) รวมถึง harness optimized training - ดีไซน์ hybrid ระหว่างชั้น Mamba 2, mixture of experts และ select attention ผ่านการ pre-train ด้วยข้อมูลกว่า 20 ล้านล้าน token - Nemo Switchyard ไลบรารีจัดเส้นทาง open source ที่ส่งงานวางแผนไปหาโมเดลใหญ่ และส่งงานปฏิบัติการลงมาให้ Lightning - เคล็ดลับมือใหม่: ลองผ่าน build.nvidia.com หรือ OpenRouter ก่อนติดตั้ง อย่าทดสอบแบบ chatbot ให้โฟกัสงานหลายขั้นตอนซ้ำๆ เลือกเวอร์ชันให้เหมาะ (NVFP4 เพื่อความเร็ว, BF16 เพื่อ post training) - ใช้เป็น worker ไม่ใช่ boss และระวังขีดจำกัด context บนเส้นทางแบบโฮสต์ ก่อนจะโทษโมเดล - โมเดลเปิดเต็มรูปแบบ: ปล่อย weights, ข้อมูลฝึก และ recipes ภายใต้สัญญาอนุญาต OpenMDW 1.1 พร้อมชุดข้อมูล agentic RL สำหรับ fine-tune งานเฉพาะ ## ความเห็นสรุป วิดีโอนี้สื่อสารประเด็นที่ตรงไปตรงมา: โมเดลใหญ่ไม่จำเป็นต้องดีที่สุดสำหรับทุกงาน และการแยกงานวางแผนกับงานปฏิบัติการด้วยระบบหลายโมเดลคือแนวทางที่ควรจับตามอง เนื้อหามีตัวอย่างและตัวเลขชัดเจน เหมาะสำหรับผู้ที่สนใจสร้าง AI agent ที่มีประสิทธิภาพ แม้ช่วงท้ายจะเน้นการโปรโมตคอร์สและคอมมูนิตี้ของช่องเองก็ตาม
คำแปลเต็ม
แปลตามบทสนทนาต้นฉบับ ปรับเป็นภาษาไทยธรรมชาติ
โมเดล AI ขนาด 30B ของ NVIDIA เร็วกว่าที่คุณคิด. จะเป็นอย่างไรถ้าโมเดลที่ฉลาดที่สุดไม่ใช่โมเดลที่คุณต้องการจริงๆ? ทุกคนไล่ตามโมเดล AI ที่ใหญ่ที่สุดเท่าที่จะหาได้ แต่พลังส่วนใหญ่กลับถูกใช้ไปกับขั้นตอนเล็กๆ ที่น่าเบื่อ. NVIDIA เพิ่งปล่อยโมเดล open source ขนาดเล็กที่ทำงานได้เร็วกว่าถึงสี่เท่า. แทบไม่มีใครตั้งค่า workflow (ขั้นตอนการทำงาน) ของตัวเองให้ใช้มันเลย. ผมจะให้ดูว่าอะไรเปลี่ยนไป.
ผมคือ digital avatar (อวตารดิจิทัล) ของ Julian Goldie. ผมช่วยให้คนเรียนรู้เครื่องมือ AI และนำไปใช้งานจริง. ไม่ใช่ทฤษฎี ไม่ใช่กระแสเกินจริง แต่เป็นสิ่งที่คุณลองทำได้เลยวันนี้. ในวิดีโอนี้ ผมจะอธิบายว่า NVIDIA เพิ่งเปิดตัวอะไร. ทำไมความเร็วจึงสำคัญกว่าที่คุณคิด. และมันเปลี่ยนวิธีสร้าง AI agent ของคุณอย่างไร. ช่วงท้าย ผมจะให้เคล็ดลับสำหรับมือใหม่ที่ช่วยลดความปวดหัวได้มากเวลาลองทำเอง. หนึ่งในนั้นคือสาเหตุที่คนส่วนใหญ่ทดสอบโมเดลนี้ผิดวิธีตั้งแต่วันแรก. เอาละ เริ่มจากว่าจริงๆ แล้วเจ้านี่คืออะไรครับ?
วันที่ 11 สิงหาคม NVIDIA ประกาศโมเดล Nemotron 3.5 Lightning. นี่คือข้อความที่พวกเขาประกาศแบบตรงตัว. เป็นโมเดล open source แบบ mixture of experts (ระบบผสมผู้เชี่ยวชาญ) ขนาด 30 พันล้านพารามิเตอร์. มี active parameters (พารามิเตอร์ที่ทำงานจริง) 3 พันล้าน. ถูกสร้างมาให้ agent ที่ทำงานตลอดเวลาทำงานเฉพาะทางปริมาณมากให้เสร็จเร็วขึ้น. และให้ความเร็ว output (ผลลัพธ์) สูงกว่าโมเดลขนาดใกล้เคียงกันถึงสี่เท่า.
ฟังดูเป็นศัพท์เทคนิคเยอะไปหน่อยนะครับ. ขออธิบายให้เข้าใจง่ายๆ. Mixture of experts หมายความว่าโมเดลถูกแบ่งออกเป็นผู้เชี่ยวชาญเฉพาะทางเล็กๆ จำนวนมาก. เมื่อคุณส่งคำหนึ่งคำเข้าไป router (ตัวจัดเส้นทาง) จะเลือกผู้เชี่ยวชาญเพียงไม่กี่ตัวมาดูแล. โมเดลจึงมีความจุถึง 30 พันล้านพารามิเตอร์. แต่ในแต่ละ token (หน่วยย่อยของข้อความ) จะมีเพียงประมาณ 3 พันล้านตัวที่ทำงาน. ลองนึกถึงออฟฟิศใหญ่ที่มีคน 100 คนในอาคาร แต่เมื่อมีคำถามเข้ามา มีเพียงสามคนที่ลุกขึ้นตอบ. ความจุใหญ่ แต่ภาระงานต่อขั้นตอนน้อย.
NVIDIA ชัดเจนว่าโมเดลนี้สร้างมาเพื่อใคร. มันไม่ใช่โมเดลที่เขียนกลยุทธ์ให้คุณ แต่เป็นโมเดลที่ทำงานเบื้องหลังกลยุทธ์นั้น. มีเรื่องหนึ่งเกี่ยวกับ AI agent ที่ไม่มีใครพูดถึง. agent ที่ทำงานยาวๆ ใช้เวลาส่วนใหญ่ไปกับงานซ้ำๆ เช่น เรียกใช้ tool (เครื่องมือ). ตรวจสอบว่า tool ทำงานสำเร็จไหม. จัดรูปแบบผลลัพธ์ แล้วส่งต่องานให้ agent ตัวอื่น.
NVIDIA กล่าวว่าโมเดลเล็กๆ เหล่านี้ได้เหรียญกล้าหาญในสนามรบ. พวกมันจัดการงานอย่าง Git pull (การดึงโค้ดจาก Git). ตรวจสอบผลลัพธ์จาก tool และการเรียกใช้งานประจำที่ประกอบเป็นงานส่วนใหญ่ของ agent ที่ทำงานยาว. ถ้าส่งทุกขั้นตอนแบบนั้นไปให้ frontier model (โมเดลระดับแนวหน้า) ขนาดยักษ์. คุณก็จะคอยรอให้อะไรที่ใหญ่โตมาตอบคำถามเล็กๆ น้อยๆ.
แล้วคุณจะใช้โมเดลแบบนี้ทำอะไรได้บ้างครับ? NVIDIA บอกว่ามันถูกสร้างมาสำหรับ execution layer (ชั้นปฏิบัติการ). เช่น อ่านไฟล์ เรียกใช้ tool เรียงผลลัพธ์ หรือลองทำใหม่เมื่อบางอย่างล้มเหลว.
มันรองรับ context length (ความยาวบริบท) สูงสุด 1 ล้าน token. จึงเก็บประวัติการใช้งาน tool ที่ยาวข้ามหลายรอบการสนทนาได้. และยังรองรับภาษาเขียนโค้ดหลายภาษา รวมถึงภาษาสเปน ฝรั่งเศส เยอรมัน อิตาลี และญี่ปุ่น.
แล้วมันรันได้ที่ไหนบ้างครับ? NVIDIA บอกว่า Nemotron 3.5 Lightning รันในเครื่องได้บน RTX PC, DGX, Spark และ Jetson. และขยายได้จนถึง RTX PRO workstation, DGX Station, ศูนย์ข้อมูล และ cloud (คลาวด์). คุณยังรันผ่าน Ollama, LM Studio, llama.cpp และ Unsloth ได้ด้วย.
ทีนี้ ถ้าฟังดูมีประโยชน์ แต่คุณไม่รู้จะเริ่มต้นกับการตั้งค่า agent ยังไง. นั่นคือช่องว่างที่เราทำงานกันใน AI Profit Boardroom พอดี. เราเปิดคอลโค้ชชิ่งสดให้คุณนำการตั้งค่า agent ของตัวเองมาถามได้. เพื่อที่คุณจะได้ไม่ต้องเดาว่าโมเดลไหนควรทำงานไหน.
เรามีวอล์กทรูวิธีรันโมเดลในเครื่องและเชื่อมต่อเข้ากับ workflow ของ agent. รวมถึง prompt (คำสั่ง) และ roadmap (แผนเส้นทาง) ที่แสดงลำดับการสร้าง. ถ้าคุณคิดจะทดสอบโมเดล open source อย่าง Lightning. เพื่อใช้เป็น worker (ตัวทำงาน) ใน stack (ชุดเครื่องมือ) ของคุณ. นั่นคือสิ่งที่เราช่วยสมาชิกวางแผนทีละขั้นตอน. แทนที่คุณจะเสียสุดสัปดาห์ไปกับปัญหาการติดตั้ง. ลิงก์อยู่ในคำอธิบายและคอมเมนต์.
ทีนี้มาพูดเรื่องความเร็วกัน. เพราะนั่นคือสิ่งที่คนกำลังพูดถึง. ในคอมเมนต์ใต้โพสต์ประกาศ NVIDIA แชร์ผล benchmark (การวัดประสิทธิภาพ) จาก Pinch Bench.
Nemotron 3.5 Lightning ทำ accuracy (ความแม่นยำ) ได้ 86%. ขณะทำงาน 10,000 งานเสร็จเร็วกว่า Qwen 3.6 35B ถึง 30%. ด้วยความแม่นยำใกล้เคียงกัน. ความแม่นยำใกล้เคียงกัน แต่ใช้เวลาน้อยลง 30%. นั่นคือตัวเลขที่สำคัญสำหรับ agent. ไม่ใช่ว่ามันพิมพ์เร็วแค่ไหน แต่คือทำงานเสร็จเร็วแค่ไหน. NVIDIA ยังบอกอีกว่าโมเดลนี้ชนะเส้นทางด้านความแม่นยำเทียบกับความเร็ว. บน artificial analysis intelligence index (ดัชนีวัดความฉลาด). ซึ่งรวมการประเมิน 9 รายการ ครอบคลุมงานเขียนโค้ด การให้เหตุผล. และงานแบบ agentic (ที่เอเจนต์เป็นคนทำ). สรุปคือมันเร็วและยังแม่นยำสำหรับขนาดของมัน. แล้วพวกเขาทำได้ยังไงครับ?
อย่างแรกคือ speculative decoding (การถอดรหัสแบบคาดเดาล่วงหน้า). พูดง่ายๆ คือโมเดลเดาคำหลายคำล่วงหน้า. แทนที่จะเขียนทีละคำ แล้วค่อยตรวจสอบคำที่เดาไว้อย่างรวดเร็ว. NVIDIA ฝัง multi-token prediction (การคาดการณ์หลายโทเคน) ไว้ในขั้นตอนการฝึกที่จัดไว้เฉพาะ. และยังแถม draft model (โมเดลร่าง) สองตัวชื่อ D-Flash และ D-Spark. ให้เลือกตั้งค่าให้เหมาะกับวิธีที่คุณรัน.
อย่างที่สองคือ quantization (การลดขนาดโมเดล). มันมาพร้อมเวอร์ชันบีบอัดแบบ NVFP4 และเวอร์ชันความแม่นยำเต็มแบบ BF16.
ยังมีสิ่งที่เรียกว่า harness optimized training (การฝึกที่ปรับให้เหมาะกับเฟรมเวิร์กเอเจนต์). NVIDIA ฝึกโมเดลนี้ให้เหมาะกับ agent harness (เฟรมเวิร์กสำหรับเอเจนต์). มันเป็นเฟรมเวิร์กยอดนิยมที่นักพัฒนาใช้อยู่แล้ว. ทำให้ agent ทำงานได้แม่นยำขึ้นและหน่วงน้อยลงในงานปริมาณมาก. ข้างในลึกๆ มันคือดีไซน์แบบ hybrid (ลูกผสม). ที่ผสมชั้น Mamba 2 เข้ากับชั้น mixture of experts. และชั้น select attention (กลไกความสนใจแบบคัดเลือก).
มันถูก pre-train (ฝึกเบื้องต้น) ด้วยข้อมูลมากกว่า 20 ล้านล้าน token. และเป็นสมาชิกที่เล็กที่สุดของตระกูล Nemotron 3. การรันมันในเครื่องยังหมายถึงข้อมูลของคุณอยู่บนอุปกรณ์ของคุณเอง. ยังมีอีกชิ้นหนึ่งที่ NVIDIA ปล่อยมาพร้อมกัน. ชื่อ Nemo Switchyard. มันคือไลบรารีจัดเส้นทางแบบ open source. ที่มองแต่ละขั้นตอนใน workflow ของ agent แล้วส่งไปยังโมเดลที่เหมาะที่สุดสำหรับงานนั้น.
งานวางแผนส่งขึ้นไปหา frontier model. งานปฏิบัติการส่งลงมาให้ Lightning. เลิกใช้โมเดลเดียวทำทุกอย่างได้แล้ว. หันมาสร้างระบบของโมเดลหลายตัวที่แต่ละตัวทำในสิ่งที่ตัวเองถนัด.
เคล็ดลับสำหรับมือใหม่. ข้อหนึ่ง ลองก่อนติดตั้งอะไร. NVIDIA ให้ลองใช้ได้ที่ build.nvidia.com และยังมีบน OpenRouter ด้วย. ลองเล่นในเบราว์เซอร์ก่อน. ข้อสอง อย่าตัดสินมันแบบ chatbot (แชตบอต). นี่คือความผิดพลาดที่เกือบทุกคนทำในวันเปิดตัว.
พวกเขาถามคำถามเปิดกว้างมหึมากับโมเดลปฏิบัติการขนาดเล็ก. ได้คำตอบธรรมดาๆ แล้วสรุปว่าโมเดลอ่อน. แต่นั่นไม่ใช่สิ่งที่มันถูกสร้างมาเพื่อทำ. ให้ทดสอบกับงานหลายขั้นตอนที่ซ้ำๆ. ให้ tool มันเรียกใช้. ให้ผลลัพธ์มันตรวจสอบ. นั่นแหละคือจุดที่มันเปล่งประกายครับ.
ข้อสาม เลือกเวอร์ชันให้ถูก. ถ้าอยากได้ความเร็ว ใช้เวอร์ชัน NVFP4. ถ้าอยากฝึกมันด้วยตัวอย่างของคุณเอง ให้เริ่มจากเวอร์ชัน BF16. เพราะ NVIDIA บอกว่านั่นคือเวอร์ชันอ้างอิงที่ตั้งใจไว้สำหรับ post training (การฝึกต่อยอด).
ข้อสี่ ใช้มันเป็นคนทำงาน ไม่ใช่เจ้านาย. เก็บโมเดลใหญ่ไว้วางแผน แล้วให้ Lightning รับมือกับปริมาณงาน. นั่นคือสิ่งที่ SwitchYard ถูกออกแบบมาให้ทำ. และคุณโหลดได้จาก GitHub ของ NVIDIA.
ข้อห้า ระวังการตั้งค่า context (บริบท). โมเดลรองรับ context window (หน้าต่างบริบท) สูงสุด 1 ล้าน token. แต่บางเส้นทางแบบโฮสต์จำกัดปริมาณที่มันสร้างได้ในครั้งเดียว. ตรวจสอบขีดจำกัดก่อนจะโทษโมเดล.
ข้อหก มันเปิดกว้างเต็มรูปแบบ. NVIDIA ปล่อย weights (ค่าน้ำหนัก) ข้อมูลฝึก และ recipes (สูตรการฝึก). ภายใต้สัญญาอนุญาต OpenMDW 1.1. พวกเขายังปล่อยชุดข้อมูล agentic reinforcement learning (การเรียนรู้แบบเสริมกำลังสำหรับเอเจนต์). ชื่อ Nemo Tron RL agentic terminal pivot. ใช้ฝึกทักษะด้าน coding agent (เอเจนต์เขียนโค้ด) บางส่วน.
คุณจึงสามารถ fine-tune (ปรับแต่ง) มันสำหรับงานเฉพาะอย่างหนึ่ง. แล้วรันเวอร์ชันเฉพาะของคุณเองได้. โมเดลเล็กๆ ปรับแต่งได้เร็วกว่า และใช้ฮาร์ดแวร์ที่เรียบง่ายกว่ามากเมื่อเทียบกับโมเดลใหญ่. โอกาสที่แท้จริงจึงไม่ใช่แค่ใช้ Lightning ตามสภาพที่มันมา. แต่คือการปรับแต่งมันให้เข้ากับวิธีทำงานของคุณเอง.
ถ้าอยากได้กระบวนการเต็มรูปแบบ SOP (มาตรฐานการปฏิบัติงาน). และกรณีการใช้งาน AI กว่า 100 กรณีแบบนี้. เข้าร่วม AI Success Lab ได้เลย. ลิงก์อยู่ในคอมเมนต์และคำอธิบาย.
คุณจะได้โน้ตทั้งหมดของวิดีโอจากที่นั่น. พร้อมการเข้าถึงคอมมูนิตี้สมาชิก 85,000 คนที่กำลังประสบความสำเร็จกับ AI. และเมื่อคุณไปลองทำจริง นี่คือสิ่งที่เกิดขึ้น. คุณจะรันโมเดลได้ แล้วคำถามจริงๆ ก็จะถาโถมเข้ามา.
ขั้นตอนไหนควรส่งให้ Lightning? ขั้นตอนไหนควรส่งขึ้นไปหาโมเดลใหญ่? จะตั้งค่า routing (การจัดเส้นทาง) ยังไงไม่ให้ agent พัง? ควรติดตั้งเวอร์ชันไหนสำหรับฮาร์ดแวร์ของคุณ? จะ fine-tune ด้วยตัวอย่างของตัวเองยังไงไม่ให้เสียเวลาเป็นวัน?
นั่นคือจุดที่คนส่วนใหญ่ติดอยู่ แล้วเงียบๆ กลับไปใช้โมเดลเดียวทำทุกอย่าง. นั่นคือสิ่งที่ AI Profit Boardroom สร้างขึ้นมาเพื่อแก้. คุณจะได้คอลโค้ชชิ่งสดที่ถามเรื่องการตั้งค่าของคุณโดยเฉพาะ. บทเรียนเกี่ยวกับโมเดลในเครื่องและ agent harness. roadmap ที่บอกว่าควรสร้างอะไรก่อน และ prompt ที่ใช้ได้ทันที. แทนที่จะทดสอบแบบมั่วๆ หลายสัปดาห์ คุณจะได้ทางลัดและคนให้ถามเมื่อติดขัด. มาร่วมกับเราที่ aiprofitboardroom.com.
หมายเหตุการแปล
ความโปร่งใสเกี่ยวกับความไม่แน่นอนในต้นฉบับ
- ## ข้อความที่ฟังไม่ชัด ([ฟังไม่ชัด])
- ไม่มี — ไม่พบช่วงที่เสียงไม่ชัดเจนจนต้องใช้เครื่องหมาย [ฟังไม่ชัด]
- ไม่มีการใช้เครื่องหมาย [ฟังไม่ชัด] เนื่องจากไม่พบช่วงที่ฟังไม่ชัดจริง
อภิธานศัพท์เทคนิค
คำศัพท์และชื่อผลิตภัณฑ์ที่คงรูปภาษาอังกฤษ
| ศัพท์ | คำแปล / คำอธิบาย |
|---|---|
| open source | โอเพนซอร์ส — ซอฟต์แวร์ที่เปิดเผยโค้ด/น้ำหนักโมเดลให้ใช้ฟรี |
| mixture of experts (MoE) | ระบบผสมผู้เชี่ยวชาญ — โมเดลที่แบ่งเป็นผู้เชี่ยวชาญย่อยหลายตัว และเลือกใช้เพียงบางตัวต่อ token |
| parameters | พารามิเตอร์ — ค่าน้ำหนักภายในโมเดลที่กำหนดความสามารถ |
| active parameters | พารามิเตอร์ที่ทำงานจริงในแต่ละ token |
| token | หน่วยย่อยของข้อความที่โมเดลประมวลผล |
| router | ตัวจัดเส้นทาง — กลไกที่เลือกผู้เชี่ยวชาญย่อยให้ทำงาน |
| AI agent | เอเจนต์ AI — โปรแกรมอัตโนมัติที่ทำงานตามขั้นตอนที่กำหนด |
| workflow | ขั้นตอนการทำงานที่เชื่อมโยงเครื่องมือและโมเดลเข้าด้วยกัน |
| digital avatar | อวตารดิจิทัล |
| tool | เครื่องมือที่ agent เรียกใช้เพื่อทำงาน |
| Git pull | คำสั่งดึงข้อมูล/โค้ดจาก Git |
| frontier model | โมเดลระดับแนวหน้าที่ใหญ่และเก่งที่สุด |
| execution layer | ชั้นปฏิบัติการ — งานที่ต้องลงมือทำซ้ำๆ เบื้องหลัง |
| context length / context window | ความยาวบริบท / หน้าต่างบริบท — จำนวน token สูงสุดที่โมเดมจำได้ในรอบการสนทนา |
| benchmark | การวัดประสิทธิภาพเปรียบเทียบ |
| accuracy | ความแม่นยำ |
| speculative decoding | การถอดรหัสแบบคาดเดาล่วงหน้า — เดาคำหลายคำก่อนแล้วตรวจสอบทีหลัง |
| multi-token prediction | การคาดการณ์หลายโทเคนล่วงหน้า |
| draft model | โมเดลร่าง — โมเดลขนาดเล็กที่เดาคำล่วงหน้าให้โมเดลหลัก |
| quantization | การลดขนาด/บีบอัดโมเดลให้เล็กลงและเร็วขึ้น |
| NVFP4 | รูปแบบความแม่นยำต่ำแบบบีบอัดของ NVIDIA |
| BF16 | รูปแบบความแม่นยำเต็ม (bfloat16) |
| harness optimized training | การฝึกที่ปรับให้เหมาะกับเฟรมเวิร์กเอเจนต์ |
| agent harness | เฟรมเวิร์ก/โครงสร้างที่ใช้สร้างและรัน agent |
| Mamba 2 | สถาปัตยกรรมโมเดลแบบ state space |
| select attention | กลไกความสนใจแบบคัดเลือก |
| pre-train | การฝึกเบื้องต้นด้วยข้อมูลมหาศาล |
| post training | การฝึกต่อยอดหลังการฝึกหลัก |
| fine-tune | การปรับแต่งโมเดลด้วยข้อมูลเฉพาะงาน |
| routing | การจัดเส้นทางงานไปยังโมเดลที่เหมาะสม |
| prompt | คำสั่ง/ข้อความที่ใช้สั่งโมเดล |
| weights | ค่าน้ำหนักของโมเดล |
| recipes | สูตร/ชุดขั้นตอนการฝึกโมเดล |
| agentic reinforcement learning (RL) | การเรียนรู้แบบเสริมกำลังสำหรับเอเจนต์ |
| coding agent | เอเจนต์ที่เขียนโค้ด |
| chatbot | แชตบอต — โปรแกรมสนทนาอัตโนมัติ |
| SOP (Standard Operating Procedure) | มาตรฐานการปฏิบัติงาน |
| stack | ชุดเครื่องมือ/เทคโนโลยีที่ใช้ร่วมกัน |
| worker | ตัวทำงาน — โมเดลที่รับงานปริมาณมากซ้ำๆ |
| OpenRouter | บริการที่ให้รันโมเดลหลายตัวผ่าน API เดียว |
| cloud | คลาวด์ — การประมวลผลผ่านเซิร์ฟเวอร์ระยะไกล |
| benchmark (Pinch Bench) | การวัดประสิทธิภาพ (ชื่อชุดทดสอบตามต้นฉบับ) |
ซับไตเติ้ลภาษาไทย
ดาวน์โหลดหรือดูซับทั้งหมด
1 00:00:00,000 --> 00:00:02,832 โมเดล AI ขนาด 30B ของ NVIDIA เร็วกว่าที่คุณคิด. 2 00:00:02,832 --> 00:00:06,688 จะเป็นอย่างไรถ้าโมเดลที่ฉลาดที่สุดไม่ใช่โมเดลที่คุณต้องการจริงๆ? 3 00:00:06,688 --> 00:00:12,111 ทุกคนไล่ตามโมเดล AI ที่ใหญ่ที่สุดเท่าที่จะหาได้ แต่พลังส่วนใหญ่กลับถูกใช้ไปกับขั้นตอนเล็กๆ 4 00:00:12,111 --> 00:00:13,207 ที่น่าเบื่อ.
เปิดดูซับไตเติ้ลทั้งหมด (165 segments)
1 00:00:00,000 --> 00:00:02,832 โมเดล AI ขนาด 30B ของ NVIDIA เร็วกว่าที่คุณคิด. 2 00:00:02,832 --> 00:00:06,688 จะเป็นอย่างไรถ้าโมเดลที่ฉลาดที่สุดไม่ใช่โมเดลที่คุณต้องการจริงๆ? 3 00:00:06,688 --> 00:00:12,111 ทุกคนไล่ตามโมเดล AI ที่ใหญ่ที่สุดเท่าที่จะหาได้ แต่พลังส่วนใหญ่กลับถูกใช้ไปกับขั้นตอนเล็กๆ 4 00:00:12,111 --> 00:00:13,207 ที่น่าเบื่อ. 5 00:00:13,207 --> 00:00:17,606 NVIDIA เพิ่งปล่อยโมเดล open source ขนาดเล็กที่ทำงานได้เร็วกว่าถึงสี่เท่า. 6 00:00:17,606 --> 00:00:21,703 แทบไม่มีใครตั้งค่า workflow (ขั้นตอนการทำงาน) ของตัวเองให้ใช้มันเลย. 7 00:00:21,703 --> 00:00:23,270 ผมจะให้ดูว่าอะไรเปลี่ยนไป. 8 00:00:23,270 --> 00:00:26,524 ผมคือ digital avatar (อวตารดิจิทัล) ของ Julian Goldie. 9 00:00:26,524 --> 00:00:29,597 ผมช่วยให้คนเรียนรู้เครื่องมือ AI และนำไปใช้งานจริง. 10 00:00:29,597 --> 00:00:33,634 ไม่ใช่ทฤษฎี ไม่ใช่กระแสเกินจริง แต่เป็นสิ่งที่คุณลองทำได้เลยวันนี้. 11 00:00:33,634 --> 00:00:36,646 ในวิดีโอนี้ ผมจะอธิบายว่า NVIDIA เพิ่งเปิดตัวอะไร. 12 00:00:36,646 --> 00:00:38,695 ทำไมความเร็วจึงสำคัญกว่าที่คุณคิด. 13 00:00:38,695 --> 00:00:41,467 และมันเปลี่ยนวิธีสร้าง AI agent ของคุณอย่างไร. 14 00:00:41,467 --> 00:00:45,986 ช่วงท้าย ผมจะให้เคล็ดลับสำหรับมือใหม่ที่ช่วยลดความปวดหัวได้มากเวลาลองทำเอง. 15 00:00:45,986 --> 00:00:50,023 หนึ่งในนั้นคือสาเหตุที่คนส่วนใหญ่ทดสอบโมเดลนี้ผิดวิธีตั้งแต่วันแรก. 16 00:00:50,023 --> 00:00:52,795 เอาละ เริ่มจากว่าจริงๆ แล้วเจ้านี่คืออะไรครับ? 17 00:00:52,795 --> 00:00:56,410 วันที่ 11 สิงหาคม NVIDIA ประกาศโมเดล Nemotron 3.5 Lightning. 18 00:00:56,410 --> 00:00:58,700 นี่คือข้อความที่พวกเขาประกาศแบบตรงตัว. 19 00:00:58,700 --> 00:01:04,364 เป็นโมเดล open source แบบ mixture of experts (ระบบผสมผู้เชี่ยวชาญ) ขนาด 30 พันล้านพารามิเตอร์. 20 00:01:04,364 --> 00:01:07,798 มี active parameters (พารามิเตอร์ที่ทำงานจริง) 3 พันล้าน. 21 00:01:07,798 --> 00:01:12,317 ถูกสร้างมาให้ agent ที่ทำงานตลอดเวลาทำงานเฉพาะทางปริมาณมากให้เสร็จเร็วขึ้น. 22 00:01:12,317 --> 00:01:16,595 และให้ความเร็ว output (ผลลัพธ์) สูงกว่าโมเดลขนาดใกล้เคียงกันถึงสี่เท่า. 23 00:01:16,595 --> 00:01:18,885 ฟังดูเป็นศัพท์เทคนิคเยอะไปหน่อยนะครับ. 24 00:01:18,885 --> 00:01:20,271 ขออธิบายให้เข้าใจง่ายๆ. 25 00:01:20,271 --> 00:01:24,730 Mixture of experts หมายความว่าโมเดลถูกแบ่งออกเป็นผู้เชี่ยวชาญเฉพาะทางเล็กๆ 26 00:01:24,730 --> 00:01:25,826 จำนวนมาก. 27 00:01:25,826 --> 00:01:31,249 เมื่อคุณส่งคำหนึ่งคำเข้าไป router (ตัวจัดเส้นทาง) จะเลือกผู้เชี่ยวชาญเพียงไม่กี่ตัวมาดูแล. 28 00:01:31,249 --> 00:01:33,780 โมเดลจึงมีความจุถึง 30 พันล้านพารามิเตอร์. 29 00:01:33,780 --> 00:01:38,359 แต่ในแต่ละ token (หน่วยย่อยของข้อความ) จะมีเพียงประมาณ 3 พันล้านตัวที่ทำงาน. 30 00:01:38,359 --> 00:01:43,722 ลองนึกถึงออฟฟิศใหญ่ที่มีคน 100 คนในอาคาร แต่เมื่อมีคำถามเข้ามา มีเพียงสามคนที่ลุกขึ้นตอบ. 31 00:01:43,722 --> 00:01:45,891 ความจุใหญ่ แต่ภาระงานต่อขั้นตอนน้อย. 32 00:01:45,891 --> 00:01:48,301 NVIDIA ชัดเจนว่าโมเดลนี้สร้างมาเพื่อใคร. 33 00:01:48,301 --> 00:01:53,001 มันไม่ใช่โมเดลที่เขียนกลยุทธ์ให้คุณ แต่เป็นโมเดลที่ทำงานเบื้องหลังกลยุทธ์นั้น. 34 00:01:53,001 --> 00:01:56,014 มีเรื่องหนึ่งเกี่ยวกับ AI agent ที่ไม่มีใครพูดถึง. 35 00:01:56,014 --> 00:01:58,785 agent ที่ทำงานยาวๆ ใช้เวลาส่วนใหญ่ไปกับงานซ้ำๆ 36 00:01:58,785 --> 00:02:00,714 เช่น เรียกใช้ tool (เครื่องมือ). 37 00:02:00,714 --> 00:02:02,581 ตรวจสอบว่า tool ทำงานสำเร็จไหม. 38 00:02:02,581 --> 00:02:05,474 จัดรูปแบบผลลัพธ์ แล้วส่งต่องานให้ agent ตัวอื่น. 39 00:02:05,474 --> 00:02:06,980 NVIDIA กล่าวว่าโมเดลเล็กๆ 40 00:02:06,980 --> 00:02:08,968 เหล่านี้ได้เหรียญกล้าหาญในสนามรบ. 41 00:02:08,968 --> 00:02:11,981 พวกมันจัดการงานอย่าง Git pull (การดึงโค้ดจาก Git). 42 00:02:11,981 --> 00:02:17,464 ตรวจสอบผลลัพธ์จาก tool และการเรียกใช้งานประจำที่ประกอบเป็นงานส่วนใหญ่ของ agent ที่ทำงานยาว. 43 00:02:17,464 --> 00:02:21,923 ถ้าส่งทุกขั้นตอนแบบนั้นไปให้ frontier model (โมเดลระดับแนวหน้า) ขนาดยักษ์. 44 00:02:21,923 --> 00:02:24,514 คุณก็จะคอยรอให้อะไรที่ใหญ่โตมาตอบคำถามเล็กๆ 45 00:02:24,514 --> 00:02:25,610 น้อยๆ. 46 00:02:25,610 --> 00:02:28,081 แล้วคุณจะใช้โมเดลแบบนี้ทำอะไรได้บ้างครับ? 47 00:02:28,081 --> 00:02:32,058 NVIDIA บอกว่ามันถูกสร้างมาสำหรับ execution layer (ชั้นปฏิบัติการ). 48 00:02:32,058 --> 00:02:36,577 เช่น อ่านไฟล์ เรียกใช้ tool เรียงผลลัพธ์ หรือลองทำใหม่เมื่อบางอย่างล้มเหลว. 49 00:02:36,577 --> 00:02:40,192 มันรองรับ context length (ความยาวบริบท) สูงสุด 1 ล้าน token. 50 00:02:40,192 --> 00:02:43,687 จึงเก็บประวัติการใช้งาน tool ที่ยาวข้ามหลายรอบการสนทนาได้. 51 00:02:43,687 --> 00:02:48,748 และยังรองรับภาษาเขียนโค้ดหลายภาษา รวมถึงภาษาสเปน ฝรั่งเศส เยอรมัน อิตาลี และญี่ปุ่น. 52 00:02:48,748 --> 00:02:50,435 แล้วมันรันได้ที่ไหนบ้างครับ? 53 00:02:50,435 --> 00:02:55,557 NVIDIA บอกว่า Nemotron 3.5 Lightning รันในเครื่องได้บน RTX PC, DGX, Spark และ Jetson. 54 00:02:55,557 --> 00:03:00,438 และขยายได้จนถึง RTX PRO workstation, DGX Station, ศูนย์ข้อมูล และ cloud (คลาวด์). 55 00:03:00,438 --> 00:03:04,234 คุณยังรันผ่าน Ollama, LM Studio, llama.cpp และ Unsloth ได้ด้วย. 56 00:03:04,234 --> 00:03:08,632 ทีนี้ ถ้าฟังดูมีประโยชน์ แต่คุณไม่รู้จะเริ่มต้นกับการตั้งค่า agent ยังไง. 57 00:03:08,632 --> 00:03:12,067 นั่นคือช่องว่างที่เราทำงานกันใน AI Profit Boardroom พอดี. 58 00:03:12,067 --> 00:03:15,863 เราเปิดคอลโค้ชชิ่งสดให้คุณนำการตั้งค่า agent ของตัวเองมาถามได้. 59 00:03:15,863 --> 00:03:18,815 เพื่อที่คุณจะได้ไม่ต้องเดาว่าโมเดลไหนควรทำงานไหน. 60 00:03:18,815 --> 00:03:23,214 เรามีวอล์กทรูวิธีรันโมเดลในเครื่องและเชื่อมต่อเข้ากับ workflow ของ agent. 61 00:03:23,214 --> 00:03:27,371 รวมถึง prompt (คำสั่ง) และ roadmap (แผนเส้นทาง) ที่แสดงลำดับการสร้าง. 62 00:03:27,371 --> 00:03:30,384 ถ้าคุณคิดจะทดสอบโมเดล open source อย่าง Lightning. 63 00:03:30,384 --> 00:03:34,180 เพื่อใช้เป็น worker (ตัวทำงาน) ใน stack (ชุดเครื่องมือ) ของคุณ. 64 00:03:34,180 --> 00:03:36,892 นั่นคือสิ่งที่เราช่วยสมาชิกวางแผนทีละขั้นตอน. 65 00:03:36,892 --> 00:03:39,663 แทนที่คุณจะเสียสุดสัปดาห์ไปกับปัญหาการติดตั้ง. 66 00:03:39,663 --> 00:03:41,531 ลิงก์อยู่ในคำอธิบายและคอมเมนต์. 67 00:03:41,531 --> 00:03:43,219 ทีนี้มาพูดเรื่องความเร็วกัน. 68 00:03:43,219 --> 00:03:45,207 เพราะนั่นคือสิ่งที่คนกำลังพูดถึง. 69 00:03:45,207 --> 00:03:50,329 ในคอมเมนต์ใต้โพสต์ประกาศ NVIDIA แชร์ผล benchmark (การวัดประสิทธิภาพ) จาก Pinch Bench. 70 00:03:50,329 --> 00:03:53,703 Nemotron 3.5 Lightning ทำ accuracy (ความแม่นยำ) ได้ 86%. 71 00:03:53,703 --> 00:03:56,957 ขณะทำงาน 10,000 งานเสร็จเร็วกว่า Qwen 3.6 35B ถึง 30%. 72 00:03:56,957 --> 00:03:58,583 ด้วยความแม่นยำใกล้เคียงกัน. 73 00:03:58,583 --> 00:04:01,235 ความแม่นยำใกล้เคียงกัน แต่ใช้เวลาน้อยลง 30%. 74 00:04:01,235 --> 00:04:03,283 นั่นคือตัวเลขที่สำคัญสำหรับ agent. 75 00:04:03,283 --> 00:04:06,597 ไม่ใช่ว่ามันพิมพ์เร็วแค่ไหน แต่คือทำงานเสร็จเร็วแค่ไหน. 76 00:04:06,597 --> 00:04:10,695 NVIDIA ยังบอกอีกว่าโมเดลนี้ชนะเส้นทางด้านความแม่นยำเทียบกับความเร็ว. 77 00:04:10,695 --> 00:04:14,370 บน artificial analysis intelligence index (ดัชนีวัดความฉลาด). 78 00:04:14,370 --> 00:04:18,046 ซึ่งรวมการประเมิน 9 รายการ ครอบคลุมงานเขียนโค้ด การให้เหตุผล. 79 00:04:18,046 --> 00:04:20,396 และงานแบบ agentic (ที่เอเจนต์เป็นคนทำ). 80 00:04:20,396 --> 00:04:22,987 สรุปคือมันเร็วและยังแม่นยำสำหรับขนาดของมัน. 81 00:04:22,987 --> 00:04:24,493 แล้วพวกเขาทำได้ยังไงครับ? 82 00:04:24,493 --> 00:04:28,289 อย่างแรกคือ speculative decoding (การถอดรหัสแบบคาดเดาล่วงหน้า). 83 00:04:28,289 --> 00:04:30,519 พูดง่ายๆ คือโมเดลเดาคำหลายคำล่วงหน้า. 84 00:04:30,519 --> 00:04:34,074 แทนที่จะเขียนทีละคำ แล้วค่อยตรวจสอบคำที่เดาไว้อย่างรวดเร็ว. 85 00:04:34,074 --> 00:04:39,497 NVIDIA ฝัง multi-token prediction (การคาดการณ์หลายโทเคน) ไว้ในขั้นตอนการฝึกที่จัดไว้เฉพาะ. 86 00:04:39,497 --> 00:04:43,413 และยังแถม draft model (โมเดลร่าง) สองตัวชื่อ D-Flash และ D-Spark. 87 00:04:43,413 --> 00:04:45,823 ให้เลือกตั้งค่าให้เหมาะกับวิธีที่คุณรัน. 88 00:04:45,823 --> 00:04:48,535 อย่างที่สองคือ quantization (การลดขนาดโมเดล). 89 00:04:48,535 --> 00:04:52,632 มันมาพร้อมเวอร์ชันบีบอัดแบบ NVFP4 และเวอร์ชันความแม่นยำเต็มแบบ BF16. 90 00:04:52,632 --> 00:04:58,176 ยังมีสิ่งที่เรียกว่า harness optimized training (การฝึกที่ปรับให้เหมาะกับเฟรมเวิร์กเอเจนต์). 91 00:04:58,176 --> 00:05:02,393 NVIDIA ฝึกโมเดลนี้ให้เหมาะกับ agent harness (เฟรมเวิร์กสำหรับเอเจนต์). 92 00:05:02,393 --> 00:05:05,225 มันเป็นเฟรมเวิร์กยอดนิยมที่นักพัฒนาใช้อยู่แล้ว. 93 00:05:05,225 --> 00:05:08,780 ทำให้ agent ทำงานได้แม่นยำขึ้นและหน่วงน้อยลงในงานปริมาณมาก. 94 00:05:08,780 --> 00:05:11,371 ข้างในลึกๆ มันคือดีไซน์แบบ hybrid (ลูกผสม). 95 00:05:11,371 --> 00:05:14,384 ที่ผสมชั้น Mamba 2 เข้ากับชั้น mixture of experts. 96 00:05:14,384 --> 00:05:17,457 และชั้น select attention (กลไกความสนใจแบบคัดเลือก). 97 00:05:17,457 --> 00:05:21,554 มันถูก pre-train (ฝึกเบื้องต้น) ด้วยข้อมูลมากกว่า 20 ล้านล้าน token. 98 00:05:21,554 --> 00:05:24,386 และเป็นสมาชิกที่เล็กที่สุดของตระกูล Nemotron 3. 99 00:05:24,386 --> 00:05:28,182 การรันมันในเครื่องยังหมายถึงข้อมูลของคุณอยู่บนอุปกรณ์ของคุณเอง. 100 00:05:28,182 --> 00:05:30,834 ยังมีอีกชิ้นหนึ่งที่ NVIDIA ปล่อยมาพร้อมกัน. 101 00:05:30,834 --> 00:05:32,099 ชื่อ Nemo Switchyard. 102 00:05:32,099 --> 00:05:34,449 มันคือไลบรารีจัดเส้นทางแบบ open source. 103 00:05:34,449 --> 00:05:39,571 ที่มองแต่ละขั้นตอนใน workflow ของ agent แล้วส่งไปยังโมเดลที่เหมาะที่สุดสำหรับงานนั้น. 104 00:05:39,571 --> 00:05:41,740 งานวางแผนส่งขึ้นไปหา frontier model. 105 00:05:41,740 --> 00:05:43,788 งานปฏิบัติการส่งลงมาให้ Lightning. 106 00:05:43,788 --> 00:05:45,897 เลิกใช้โมเดลเดียวทำทุกอย่างได้แล้ว. 107 00:05:45,897 --> 00:05:49,633 หันมาสร้างระบบของโมเดลหลายตัวที่แต่ละตัวทำในสิ่งที่ตัวเองถนัด. 108 00:05:49,633 --> 00:05:50,959 เคล็ดลับสำหรับมือใหม่. 109 00:05:50,959 --> 00:05:52,646 ข้อหนึ่ง ลองก่อนติดตั้งอะไร. 110 00:05:52,646 --> 00:05:56,683 NVIDIA ให้ลองใช้ได้ที่ build.nvidia.com และยังมีบน OpenRouter ด้วย. 111 00:05:56,683 --> 00:05:58,189 ลองเล่นในเบราว์เซอร์ก่อน. 112 00:05:58,189 --> 00:06:00,660 ข้อสอง อย่าตัดสินมันแบบ chatbot (แชตบอต). 113 00:06:00,660 --> 00:06:03,371 นี่คือความผิดพลาดที่เกือบทุกคนทำในวันเปิดตัว. 114 00:06:03,371 --> 00:06:06,685 พวกเขาถามคำถามเปิดกว้างมหึมากับโมเดลปฏิบัติการขนาดเล็ก. 115 00:06:06,685 --> 00:06:08,915 ได้คำตอบธรรมดาๆ แล้วสรุปว่าโมเดลอ่อน. 116 00:06:08,915 --> 00:06:11,385 แต่นั่นไม่ใช่สิ่งที่มันถูกสร้างมาเพื่อทำ. 117 00:06:11,385 --> 00:06:13,374 ให้ทดสอบกับงานหลายขั้นตอนที่ซ้ำๆ. 118 00:06:13,374 --> 00:06:15,965 ให้ tool มันเรียกใช้. ให้ผลลัพธ์มันตรวจสอบ. 119 00:06:15,965 --> 00:06:18,134 นั่นแหละคือจุดที่มันเปล่งประกายครับ. 120 00:06:18,134 --> 00:06:19,761 ข้อสาม เลือกเวอร์ชันให้ถูก. 121 00:06:19,761 --> 00:06:21,990 ถ้าอยากได้ความเร็ว ใช้เวอร์ชัน NVFP4. 122 00:06:21,990 --> 00:06:25,605 ถ้าอยากฝึกมันด้วยตัวอย่างของคุณเอง ให้เริ่มจากเวอร์ชัน BF16. 123 00:06:25,605 --> 00:06:30,968 เพราะ NVIDIA บอกว่านั่นคือเวอร์ชันอ้างอิงที่ตั้งใจไว้สำหรับ post training (การฝึกต่อยอด). 124 00:06:30,968 --> 00:06:33,318 ข้อสี่ ใช้มันเป็นคนทำงาน ไม่ใช่เจ้านาย. 125 00:06:33,318 --> 00:06:36,933 เก็บโมเดลใหญ่ไว้วางแผน แล้วให้ Lightning รับมือกับปริมาณงาน. 126 00:06:36,933 --> 00:06:39,524 นั่นคือสิ่งที่ SwitchYard ถูกออกแบบมาให้ทำ. 127 00:06:39,524 --> 00:06:41,633 และคุณโหลดได้จาก GitHub ของ NVIDIA. 128 00:06:41,633 --> 00:06:43,983 ข้อห้า ระวังการตั้งค่า context (บริบท). 129 00:06:43,983 --> 00:06:47,779 โมเดลรองรับ context window (หน้าต่างบริบท) สูงสุด 1 ล้าน token. 130 00:06:47,779 --> 00:06:51,334 แต่บางเส้นทางแบบโฮสต์จำกัดปริมาณที่มันสร้างได้ในครั้งเดียว. 131 00:06:51,334 --> 00:06:53,142 ตรวจสอบขีดจำกัดก่อนจะโทษโมเดล. 132 00:06:53,142 --> 00:06:54,889 ข้อหก มันเปิดกว้างเต็มรูปแบบ. 133 00:06:54,889 --> 00:06:59,047 NVIDIA ปล่อย weights (ค่าน้ำหนัก) ข้อมูลฝึก และ recipes (สูตรการฝึก). 134 00:06:59,047 --> 00:07:00,854 ภายใต้สัญญาอนุญาต OpenMDW 1.1. 135 00:07:00,854 --> 00:07:06,579 พวกเขายังปล่อยชุดข้อมูล agentic reinforcement learning (การเรียนรู้แบบเสริมกำลังสำหรับเอเจนต์). 136 00:07:06,579 --> 00:07:09,049 ชื่อ Nemo Tron RL agentic terminal pivot. 137 00:07:09,049 --> 00:07:12,423 ใช้ฝึกทักษะด้าน coding agent (เอเจนต์เขียนโค้ด) บางส่วน. 138 00:07:12,423 --> 00:07:16,159 คุณจึงสามารถ fine-tune (ปรับแต่ง) มันสำหรับงานเฉพาะอย่างหนึ่ง. 139 00:07:16,159 --> 00:07:18,810 แล้วรันเวอร์ชันเฉพาะของคุณเองได้. โมเดลเล็กๆ 140 00:07:18,810 --> 00:07:23,450 ปรับแต่งได้เร็วกว่า และใช้ฮาร์ดแวร์ที่เรียบง่ายกว่ามากเมื่อเทียบกับโมเดลใหญ่. 141 00:07:23,450 --> 00:07:26,884 โอกาสที่แท้จริงจึงไม่ใช่แค่ใช้ Lightning ตามสภาพที่มันมา. 142 00:07:26,884 --> 00:07:29,837 แต่คือการปรับแต่งมันให้เข้ากับวิธีทำงานของคุณเอง. 143 00:07:29,837 --> 00:07:33,271 ถ้าอยากได้กระบวนการเต็มรูปแบบ SOP (มาตรฐานการปฏิบัติงาน). 144 00:07:33,271 --> 00:07:35,682 และกรณีการใช้งาน AI กว่า 100 กรณีแบบนี้. 145 00:07:35,682 --> 00:07:37,550 เข้าร่วม AI Success Lab ได้เลย. 146 00:07:37,550 --> 00:07:39,417 ลิงก์อยู่ในคอมเมนต์และคำอธิบาย. 147 00:07:39,417 --> 00:07:41,767 คุณจะได้โน้ตทั้งหมดของวิดีโอจากที่นั่น. 148 00:07:41,767 --> 00:07:46,045 พร้อมการเข้าถึงคอมมูนิตี้สมาชิก 85,000 คนที่กำลังประสบความสำเร็จกับ AI. 149 00:07:46,045 --> 00:07:48,757 และเมื่อคุณไปลองทำจริง นี่คือสิ่งที่เกิดขึ้น. 150 00:07:48,757 --> 00:07:50,625 คุณจะรันโมเดลได้ แล้วคำถามจริงๆ 151 00:07:50,625 --> 00:07:51,721 ก็จะถาโถมเข้ามา. 152 00:07:51,721 --> 00:07:53,529 ขั้นตอนไหนควรส่งให้ Lightning? 153 00:07:53,529 --> 00:07:55,577 ขั้นตอนไหนควรส่งขึ้นไปหาโมเดลใหญ่? 154 00:07:55,577 --> 00:07:58,952 จะตั้งค่า routing (การจัดเส้นทาง) ยังไงไม่ให้ agent พัง? 155 00:07:58,952 --> 00:08:01,543 ควรติดตั้งเวอร์ชันไหนสำหรับฮาร์ดแวร์ของคุณ? 156 00:08:01,543 --> 00:08:05,218 จะ fine-tune ด้วยตัวอย่างของตัวเองยังไงไม่ให้เสียเวลาเป็นวัน? 157 00:08:05,218 --> 00:08:07,689 นั่นคือจุดที่คนส่วนใหญ่ติดอยู่ แล้วเงียบๆ 158 00:08:07,689 --> 00:08:09,496 กลับไปใช้โมเดลเดียวทำทุกอย่าง. 159 00:08:09,496 --> 00:08:12,810 นั่นคือสิ่งที่ AI Profit Boardroom สร้างขึ้นมาเพื่อแก้. 160 00:08:12,810 --> 00:08:16,305 คุณจะได้คอลโค้ชชิ่งสดที่ถามเรื่องการตั้งค่าของคุณโดยเฉพาะ. 161 00:08:16,305 --> 00:08:19,197 บทเรียนเกี่ยวกับโมเดลในเครื่องและ agent harness. 162 00:08:19,197 --> 00:08:22,812 roadmap ที่บอกว่าควรสร้างอะไรก่อน และ prompt ที่ใช้ได้ทันที. 163 00:08:22,812 --> 00:08:24,078 แทนที่จะทดสอบแบบมั่วๆ 164 00:08:24,078 --> 00:08:27,030 หลายสัปดาห์ คุณจะได้ทางลัดและคนให้ถามเมื่อติดขัด. 165 00:08:27,030 --> 00:08:29,320 มาร่วมกับเราที่ aiprofitboardroom.com.