Which Local LLM Performs Autoresearch the Best?
สรุปย่อ
ประเด็นสำคัญจากวิดีโอ
> **ที่มา:** [YouTube — Tonbi's AI Garage](https://www.youtube.com/watch?v=jCNeVZJAYGM) · เผยแพร่ 31 ส.ค. 2026 · ~32:17 นาที
# สรุปภาษาไทย — Which Local LLM Performs Autoresearch the Best? > **ที่มา:** [YouTube — Tonbi's AI Garage](https://www.youtube.com/watch?v=jCNeVZJAYGM) · เผยแพร่ 31 ส.ค. 2026 · ~32:17 นาที > *สรุปโดยอัตโนมัติ — เนื้อหาต้นฉบับ © Tonbi's AI Garage* ## วิดีโอนี้เกี่ยวกับอะไร Tonbi จับโมเดล local 4 ตัวมาแข่ง **Auto Research** ต้นตำรับ Karpathy (repo Carpathy/auto) — ให้แต่ละตัวเป็น autonomous research controller ปรับสูตรฝึกมินิโมเดลเองบน DGX Spark เครื่องเดียว เป้าหมายลด validation BPB ให้ต่ำสุด ## ประเด็นหลัก 1. **โจทย์:** AI ปรับปรุงสูตรฝึกตัวเองได้ไหม · แก้ได้ไฟล์เดียว train.py · metric คือ validation BPB (ยิ่งต่ำยิ่งดี = แปลกใจกับ token ถัดไปน้อยลง) · ข้อมูล Climix 400B shuffle (ตัวอย่างเล็กกว่า Karpathy ที่ใช้ H100) · loop: ตั้งสมมติฐาน → แก้ train.py → ฝึกภายใต้ guard → evaluate → keep/discard → วนใหม่ 2. **ผู้เข้าแข่ง 4 ตัว (ไซส์ใกล้กัน):** Ornith 1.5 35B A3B (สายโค้ด/auto research ห้องแล็บเล็ก ม้านอก) · Muse Glimmer (Meta, broad agent) · Neatron 3.5 Lightning 30B (Nvidia, workhorse แบบ sparse) · Quen 3.8 27B (แชมป์เก่า local ที่ validate แล้ว) 3. **Ornith (6 ชม. 33 ทดลอง 2 keep):** baseline 1.19 → keep สองอันคือแตะ weight เบาลง (matrix LR step เล็กลง + weight decay เบามาก) · คิดนาน ฟื้นหลัง compaction ช้า · กลางๆ streaming เร็วแต่ไม่ฉลาดสุด 4. **Neotron (ข้ามคืน 43 ทดลอง valid):** เร็วสมชื่อ lightning · keep หลายอัน (ลด weight decay, ลด unembed/matrix LR) · ไม้เด็ดคือเพิ่ม batch 32→64 (lesson ต่ออัปเดตเท่าเดิม 65K token แต่แพ็กเป็นคำใหญ่คำเดียว overhead น้อยกว่า) ทำคะแนนดิ่ง · Grock รับบท orchestrator โหลดโมเดล setup เปิด campaign เองหมด 5. **Muse Glimmer (น่าผิดหวัง บ๊วย):** ปัญหา instruction following — ทดลองเสร็จแล้วนั่ง idle ไม่ยอมวน loop เอง ต้องให้ Grock คอยดัน (do not stop at the prompt...) · สุดท้าย keep 2 อัน (unembed LR → 0.005 บวก 25% + ลด weight decay) แต่จบก่อนครบ 6 ชม. ทดลองน้อย คิด hypothesis ไม่คม 6. **Quen 3.8 (แชมป์ 21 ทดลอง):** เปิด thinking ไว้เลยคิดนาน ทดลองน้อยสุด (น้อยกว่า Neotron ครึ่ง) แต่คิดคุ้ม — เจอ batch 32→64 เหมือน Neotron (val BPB ลง 1.16) บวกไม้เด็ดเพิ่ม warm-up 5% (15 วิแรกของรัน 5 นาที ค่อยๆ เข้า step เต็ม ช่วย stabilize) · **ชนะที่ 1.142 เฉือน Neotron 1.143 แค่เศษเสี้ยว** 7. **สรุป+คำแนะนำ:** อยากทำ ML training กับโมเดล local → Quen 3.8 27B (แม่นสุด) หรือ Neotron Lightning (เร็วสุด รันเยอะสุด) · ทดลองนี้กินเวลา 3 วัน ## ใครควรดู สาย local AI ที่ใช้โมเดล local ฝึกโมเดลต่อ — เห็นทั้งวิธี setup การแข่ง กลยุทธ์ของแต่ละตัว และคำตอบว่าแชมป์คือใคร --- *Attribution: Which Local LLM Performs Autoresearch — Tonbi's AI Garage (youtube.com/watch?v=jCNeVZJAYGM), เผยแพร่ 31 ส.ค. 2026*
คำแปลเต็ม
แปลตามบทสนทนาต้นฉบับ ปรับเป็นภาษาไทยธรรมชาติ
ช่องนี้ผมชอบเทสต์โมเดลเทียบกัน ดูว่าแต่ละตัวต่างกันยังไง บางทีโมเดล cloud มาตรฐาน บางทีโมเดล local แต่เทสต์พวกนั้นมักมีภาพ ออกแบบหน้าเว็บหรือสร้างเกมอะไรที่มองเห็นได้ หนึ่งเพราะผมวิเคราะห์ง่าย เห็นเว็บก็รู้เลยว่าดีไม่ดี สองเพราะในวิดีโอมันน่าสนใจกว่าเห็นเกมเห็นเว็บแทนตัวหนังสือใน terminal แต่อยากเทสต์โมเดล local บน DGX Spark แบบไม่มีภาพ กับ Auto Research แบบต้นตำรับของ Karpathy จาก repo ทางการของเขา น่าสนใจว่าโมเดล local จะทำได้แค่ไหน แถมสร้างมินิโมเดลอีกตัว ก่อนหน้านี้ตอนทำ auto research มักใช้โมเดล claw ตัวล่าสุดหรือโมเดล GBT ตัวล่าสุด เลยอยากรู้ว่าโมเดล local รับมือแบบนี้ไหวไหม เพราะรู้ว่าคนในชุมชน local AI ใช้โมเดล local tinkering ฝึกโมเดลตัวเองหรือ fine-tuning adapter กันเยอะ นั่นคือคลิปวันนี้ เอาสี่โมเดลมาให้โจทย์ auto research เดียวกัน ดูว่าตัวไหนเก่งสุด มาเริ่มกัน ถ้าอยากยกระดับเอเจนต์ของตัวเอง ลองดูโปรเจกต์ Agent Wikis ของผม ที่นั่นมี knowledge base ที่ผมใช้ทุกวันทั้งค้นคว้าทำคลิปและสร้างโปรเจกต์ หัวข้อมี Hermes Agent กับ Hyperframes กับเครื่องมือ local AI และอีกเพียบ wiki มาตรฐานเปิดให้ใช้ฟรีทั้งหมด แต่ถ้าสมัคร Agent Wikis Pro จะได้ Excel wiki ด้วย รวมถึง custom skill ที่ผมพัฒนาร่วมกับเอเจนต์มาตลอดหลายเดือน Pro เดือนละ 9.99 ดอลลาร์เท่านั้น สมัครตอนนี้ล็อกเรทราคานี้ตลอดชีพ ตอนนี้ผมกำลังทำโปรไฟล์เอเจนต์เฉพาะทางกับเทมเพลตเวิร์กโฟลว์อัตโนมัติ พอของพวกนี้ออก ราคา Pro จะขึ้น เลยแนะนำให้สมัครวันนี้ที่ agentwikis.com ขอบคุณทุกคนที่สนับสนุนครับ กลับเข้าวิดีโอกันต่อ เล่าแผนทดลองเร็วๆ แล้วเข้าเลย คำถามคือ AI ปรับปรุงสูตรฝึกตัวเองได้ไหม มีโมเดล local สี่ตัวแข่งกันเป็น autonomous research controller รันเองอัตโนมัติหลังผม setup กับให้ prompt ผมไม่เติมอะไรอีก ถ้าไม่รู้จัก Auto Research นี่คือ GitHub repo ทางการของ Karpathy ที่ Carpathy/auto เขาปล่อยน่าจะมีนาคม ฮือฮามาก คอนเซปต์คือมีโมเดลรันเองอัตโนมัติ เลยเรียก auto research ทำรีเสิร์ชกับมินิโมเดลที่พยายามฝึก ปรับพารามิเตอร์ต่างๆ เห็นแต่ละอันคือพารามิเตอร์ที่เปลี่ยน ไอเดียคืออยากให้มันมั่นใจคำตอบขึ้นเรื่อยๆ metric ที่ใช้คือ validation BPB หรือ val BPP ยิ่งต่ำยิ่งดี เพราะต่ำแปลว่าโมเดลแปลกใจกับ token ถัดไปน้อยลง จำได้ตอนออกมา ช่องผมยังเล็กมาก มีคนตามสองสามร้อย ผมทำคลิปอธิบาย ดูได้ ผมว่าเป็นคลิปแรกๆ ที่ภูมิใจ เพราะอธิบายว่า auto research คืออะไรจริงๆ คนอื่นแค่บอก auto research สุดยอด ไม่ได้อธิบาย คลิปนั้นดีมาก จุดกระแสช่องผม คืนเดียวได้ subscriber มาพันคน สุดยอดเลย ผมเลยผูกพันกับ auto research กับ Karpathy เสมอ คำถามรอบนี้คือโมเดลไหนรัน autonomous research loop แข็งสุดบน DGX Spark เครื่องเดียว มี contract ตายตัว มาจาก repo Karpathy ตรงๆ แก้ได้ไฟล์เดียว train.py ไฟล์เดียวที่แก้ได้ เป้าหมายอย่างที่บอกลด validation bits per bite แล้วมี practical test หนึ่งอัน พวกนี้คือ controller สี่ตัว เห็นใน thumbnail แล้ว แน่ใจมีคอมเมนต์ถามทำไมไม่เอารุ่นนั้นรุ่นนี้ ผมรู้สึกจากรีเสิร์ชว่าสี่ตัวนี้ดีสุด ที่ยัดลง Spark แล้วทดลองได้ อย่าง DeepSeek Flash อยากทำ แต่กินที่เยอะไป ไหนจะฝึกโมเดลต้องมี memory เหลือ ยัดไม่ลง เอาสี่ตัวนี้ Ornith 1.5 35B A3B สายโค้ดกับ autonomous research โดยเฉพาะ ไม่เคยใช้มาก่อน มาจากห้องแล็บเล็ก แต่คนบอกดีมาก เดี๋ยวรู้กัน ต่อไป Muse Glimmer เล่นนิดหน่อยในคลิป DFlash สัปดาห์ก่อน ของ Meta รุ่น open weights ใหม่ๆ เป็น broad agent จุดแข็ง recovery กับ multimodal งานนี้ไม่ต้องใช้ multimodal แต่เขาว่าเก่งมาก Neatron 3.5 Lightning ของ Nvidia รุ่น open ใหม่ๆ เป็น efficient agent workhorse แบบ sparse activation แล้ว Quen 3.8 27B เคยทดลองมาก่อน เป็นแชมป์เก่าที่ validate local แล้ว รู้ว่าเก่งมาก อยากรู้ว่าเจอตัวอื่นจะเป็นไง เอาสี่ตัวนี้ หลายตัวยังไม่ค่อยได้ลอง ไซส์ใกล้กันหมด ไม่มีตัวเล็ก โมเดล decent ทั้งหมด น่าจะทำ auto research ไหว ข้อมูลใช้ Climix 400B shuffle ของ Karpathy หนึ่งใน dataset ที่เขาใช้ ไม่ใช้ทั้งหมด เอาแค่พอทำได้ เขาทำ auto research บนของจริง H100 เราทำบน DGX Spark เครื่องเดียว ตัวอย่างเล็กกว่า แต่ dataset เดียวกัน เป็นภาษาผสมหลายแหล่ง คลิป auto research แรกผมใช้ Chinese stories นิทานเด็กสั้นๆ อันนี้ตัวแทนภาษาทั่วไปกว่า metric คือ val BPB อย่างที่บอก ยิ่งต่ำยิ่งดี นี่คือทดลองต้นจนจบ โมเดลตั้งสมมติฐาน อย่างปรับพารามิเตอร์เล็กๆ แก้สคริปต์ train.py ฝึกภายใต้ guard แล้ว evaluate เสร็จ ตัดสินใจ keep หรือ discard แล้ววน loop กลับไป ถ้าปุ่มไหนเวิร์ก น่าจะดันปุ่มนั้นต่อจนหยุดเวิร์ก นั่นคือไอเดีย นั่นคือ auto research นั่นคือ loop ลำดับจะลอง Ornith ก่อนเพราะม้านอกสุด แล้วขึ้นไป Neotron, Glimmer แล้ว Quen 3.8 Quen 3.8 ตัวเดียวที่เทสต์จริงจัง รู้ว่าแกร่ง อีกสอง Muse กับ Neimatron น่าจะดี บริษัทข้างหลังดี แต่ไม่แน่ใจ ลำดับนี้ Ornith, Neatron, Glimmer แล้ว Quen เริ่ม setup environment เริ่มด้วยโมเดล Ornith นี่คือ orchestrator ที่รันทดลองกับผม profile default ของ Hermes agent ผม รันบน GBT-5.6 Soul ช่วย setup โมเดล local สร้าง profile แล้ว เห็นตรงนี้ ใช้เวลาจัดให้สะอาดเรียบร้อย เริ่มด้วย Ornith ออกแบบมาให้ paste prompt เดียว บอกให้อ่าน markdown ไฟล์นี้ให้จบแล้วทำตามเป๊ะ เริ่มจากเช็ก hard readiness gate ถ้า gate ไม่พร้อมห้ามฝึก ไฟล์นี้คือ prompt Ornith photo research controller prompt บอกว่าเกิดอะไร ขอบเขต hardness readiness gate contract กับ research loop markdown ไฟล์นี้มี instruction ทั้งหมด ไม่ยาวมากเพราะตรงไปตรงมา paste เลย ดูว่าโมเดลรันไหมก่อน ทักทาย มาแล้ว I'm ready to help ทำงานอะไรดี paste ลงไปปล่อยรัน อ่าน campaign prompt ถูก จะตรวจ hard readiness gate ก่อนเริ่ม เห็น reasoning ที่ setup มา เห็นวิธีคิด ไม่ใช่แค่ prompt เห็นไหมรันแล้ว ทดลองหนึ่งเสร็จ เปลี่ยน warm up baseline 1.19 ไม่แย่ แต่ทดลองหนึ่งได้ 1.2 แย่กว่า ทิ้ง ไปทดลองสอง น่าสนใจดู reasoning เห็นทฤษฎีมัน ลองคิดว่าปุ่ม leverage สูงคืออะไร ขนาดโมเดล LR schedule atom beta value embedding ไอเดียทดลองสอง เปลี่ยน depth จำนวน layer ในโมเดล โมเดล Ornith นี่คิดเยอะมาก สมมติฐานทดลองสอง เพิ่ม capacity โมเดล depth จากหกไปแปดในขอบ schema พารามิเตอร์ต่อ step เพิ่ม ควรลด perplexity แม้ step count ลดในงบตายตัว ทดลองสอง แย่กว่าอีก กลับ baseline สมมติฐานทดลองสาม LR schedule ใช้ 50 เปอร์เซ็นต์ของงบกับ warm down ratio ลด warm down ratio เหลือ 0.1 ให้ LR อยู่ใกล้ peak นานกว่า ปล่อยทดลองสาม invalid เพราะ crash น่าจะ LR divergence เช็กสาเหตุ crash แล้ว reset ผมไม่ตามเรียลไทม์ทุกอัน มี window 6 ชั่วโมง เดี๋ยวกลับมาสรุปว่าทำอะไร ผลเป็นไง Ornith เสร็จ session รวม 6 ชั่วโมง ได้ keep สองอัน ก้าวหน้าจาก baseline เยอะ baseline ดีอยู่แล้ว keep ได้สองทดลอง orchestrator ผมเปลี่ยนเป็น Grock รู้สึกเป็น manager ดีกว่า อธิบายอยู่ trainer มีปุ่มใหญ่สองปุ่มบน Muan optimizer หลัก ปรับ weight matrix หลักแรงแค่ไหนเรียก matrix LR กับบีบ weight พวกนั้นเรียก weight decay สูตรตั้งต้นค่อนข้าง aggressive keep ทั้งสองคือแตะ weight เบาลง step เล็กลงกับ shrink เบามาก analogy นะ นึกว่าซ้อมห้านาที หลัง batch test แต่ละรอบ optimizer ขยับปุ่มในโมเดลให้ทำนายรอบหน้าดีขึ้น ปุ่มส่วนใหญ่ที่ผสมข้อมูลจริงเรียก muon สอง setting คุม Muan ขนาด step กระโดดไกลแค่ไหนหลังพลาด กับ weight decay เหมือนแรงดึงอย่าสุดโต่ง ดึงปุ่มกลับศูนย์ตลอด ไม่ให้สุดโต่ง tweak ที่ดีขึ้นคือให้โมเดลเก็บสิ่งที่เรียนมา keep มากกว่า แค่นั้นก็ชนะ baseline แล้วไปต่อทำ half-size step กระโดดพวกนี้ใช่ไหม กระโดดไกลแค่ไหนหลังพลาด หดกระโดดพวกนั้น นั่นคือ impact ที่ได้ นี่คือโมเดล Ornith จบรอบมัน เห็นไหมมีแค่ 33 ทดลองใน 6 ชั่วโมง คิดนานมาก handle compaction ไม่ดี ฟื้นหลัง compaction ลำบาก ใช้เวลาทบทวนว่าอยู่ไหน รีวิวทุกอย่าง กลับมาเร็วๆ นาน แต่ execute ได้ หา keep ได้สองอัน ไม่แย่ ตัวแรก ยังไม่รู้เทียบคนอื่นไง มาดูกัน ต่อไป Neotron Lightning ของ Nvidia บอกลา Ornith เตรียมรอบ Neotron โหลดก่อน นี่ Neotron 3.5 Lightning 30B A3B setup profile แล้ว แค่โหลดโมเดลจริงแล้วรัน environment ควรเหมือนเดิม แยกแต่เหมือนกันทุกโมเดล อันนี้รันข้ามคืน นอนแล้วดูผลเช้า ให้ Grock ทำทุกอย่าง โหลดโมเดล monitor สถานการณ์ เปิด Hermes profile ให้ prompt เริ่ม auto research นี่คือโบนัสเทสต์โมเดลด้วย เทสต์ว่า Grock รับมือไหวไหม ทำดี เทียบเท่าที่เจอกับ Soul Soul ช้าไปเลยเปลี่ยนเป็น Grock ดีอยู่ รอดู ผมไปนอน ดูผลเช้า อรุณสวัสดิ์ทุกคน ประหลาดใจ มันเวิร์กจริง Grock โหลด weight Neotron 3.5 Lightning หมด setup environment เปิด campaign จริง เสร็จหมด steer ได้จนจบ ทดลอง valid 43 อัน มากกว่า Ornith ดูเร็วกว่าวิธีขยับ แต่ผมนอนดูไม่ค่อยได้ มาดูผลสุดท้าย ทำ dot plot ให้ดูผลจริง เส้นเขียวคือ Neotron ส้มคือ Ornith อีกสองตัวอัปเดตเมื่อได้ผล เห็นไหมนี่คือเลขทดลองกับ valbd อยากให้ลงใช่ไหม ตอนแรกขยับคล้ายกัน ลด weight decay ได้ผลดี พวกนี้คือ keep แล้ว discard เยอะ ลด unmbed LR ได้ อีกตัว softening แบบ Muan แล้วนี่ matrix LR คล้ายๆ ลดลง ได้ heap อีกจากการลด wave decay ลงอีก แล้วตัวใหญ่มาทีหลัง เห็น Neotron ดิ่งแรง ดีขึ้นเยอะ ด้วยการเพิ่ม batch size Grock อธิบายว่าแต่ละ chunk คือ 024 token optimizer ยังอัปเดตบน 65,000 กว่า token ทุก step เหมือนเดิม ไม่เปลี่ยน ที่เปลี่ยนคือเดิม 32 GPU ทำเป็นสองคำ คำละ 32 chunk แล้วอัปเดต หลังเป็นคำเดียว 64 chunk แล้วอัปเดต lesson ต่ออัปเดตขนาดเดียวกัน ต่างที่แพ็ก ก่อนสองคำเล็ก หลังคำเดียวใหญ่ คำใหญ่คำเดียว overhead น้อยกว่าสองคำเล็ก ใน window ซ้อม 5 นาทีตายตัว โมเดลเลยอัปเดตแม่นๆ ได้มากกว่า นั่นคือเหตุผลคะแนนดีขึ้น นั่นคือ leaderboard สองโมเดล Neotron Lightning ทำดีกว่า ได้ผลดีกว่า เข้าตัวเต็งสองตัว Muse Glimmer กับ Quen 3.8 บอกลา Neotron บอกมันว่านำอยู่ ทำดี ตอนนี้นำ เหลืออีกสองโมเดล มันเข้าใจผิดว่าตัวเอง keep อะไร นึกว่า keep คะแนนเดียว จริง keep สี่ มาสองโมเดลต่อไป นำอยู่ จะต่อโมเดลหน้าพร้อมเมื่อไร ผม standby ไม่ต้อง standby เสร็จตรงนี้ ออกตรงนี้ เริ่ม Muse Glimmer ผมว่าโหลด weight ไว้แล้วก่อนหน้า ถ้าดูคลิป Deep Flash 2 โหลด Muse Glimmer ไว้สองสามเวอร์ชัน เลือกตัวดีสุดไปเลย นี่คือ profile ใช้ Glimmer 30B ให้ prompt เดียวกับตอนต้น บอกให้อ่าน markdown ให้จบทำตามเป๊ะ มาดูว่าเวิร์กไหม ตัวนี้ context window 131,000 โมเดลใหญ่กว่าสองตัวก่อน ไม่เร็วเท่า Neotron Lightning มั้ง ถาม Grock ตัว Ornith บนดิสก์แค่ 21 GB ส่วน Neotron 20 ตัวนี้ใหญ่สุดเพราะทำ BF-16 Muse Glimmer เลยช้ากว่า น่าสนใจ ตัวนี้มี DFlash หรือ DFlash 2 จากคลิปก่อน น่าจะเร็วพอควร ใช่ Quen จะใช้ BF16 ด้วยให้เท่าเทียม ตอนนี้มี Muse รัน 6 ชั่วโมง เช็กบ้างเป็นครั้งคราว ไม่งั้นรอผล 6 ชั่วโมง Muse เริ่มทำ ทดลองสองสามอัน แต่ปัญหาใหญ่คือ autonomous loop ลำบาก ทดลองเสร็จอันหนึ่ง valid โดน discard บอก next experiment will be launched now แต่ไม่ทำอะไร นั่ง idle ต้องให้ Grock คอยดัน คอย prompt เห็นไหม นี่ Grock เขียน do not stop at the prompt clock active Launch the next hypothesis now No questions after each receipt Keep or reset Then immediately launch the next until expired This is autonomous I will not type another start command แล้วมันทำ แล้ว idle อีก ปัญหา instruction following ของ Muse Glimmer ไม่ยอม act autonomously ตัวอื่นไม่มีปัญหานี้เลย ให้ Grock ดันต่อเพราะอยากได้ผล แต่เสียเวลา idle นั่งเฉยๆ เยอะ น่าจำไว้ มาแล้ว Grock ส่งอันต่อไป ดูว่าทำต่อไหม เห็น reasoning ต้อง loop ต่อไม่รอ user user สั่ง do not stop at prompt ต้องปล่อยทดลองต่อเนื่อง รอดูว่าทำจริงไหม นั่นคือปัญหากับ Glimmer เดี๋ยวดูว่าเข้าใจไหม มันหาทางหยุด idle ได้ เห็นไหมรันทดลองรัวๆ ใช้ pulling method ต่างจากสองตัวก่อน ปกติหยุดตรงนี้ รายงาน แล้วเปิดเอง ตัวนี้ Muse รันรัวเลย อย่างน้อยไม่ต้อง prompt แล้ว ดี Glimmer เสร็จ หา improvement จาก baseline ได้ ยังมีปัญหา instruction following แต่ผ่านมาได้ นี่คือผลหลังสามตัว สีฟ้าคือ Muse เห็นไหมนานมาก keep ทุกอย่าง ไม่เจออะไร สุดท้ายเจอ keep สองอันล่าง แต่ตอนนี้บ๊วยอยู่ จบ session ทั้งที่ 6 ชั่วโมงยังไม่หมด อย่างที่บอกหยุดบ่อย เลยทดลองน้อย keep สองอันมาจากอันนี้ unmbed LR ขยับเป็น 0.005 ปล่อยให้ layer สุดท้ายพูดดังขึ้นนิด layer สุดท้ายคือส่วนที่เปลี่ยนขีดเขียนในเป็น guess token ถัดไป เดิม step เล็กมาก Muse เพิ่มนิดราว 25 เปอร์เซ็นต์ ยังเล็ก เรียนบทเดิมเร็วขึ้นนิด จับคำที่ควร output ได้ตรงขึ้น แค่นั้นก็ชนะ baseline แช่แข็ง keep สองผู้ชนะสูงสุดคือ weight decay เหมือนที่พูด แต่หยุดดึง weight กลับแรง ลด weight decay ไม่ให้หดตัวเลขเข้าศูนย์มาก ไม่มีอันไหนขยายโมเดลหรือฝึกนาน window ซ้อมเดียวกัน แค่พูดเร็วขึ้นนิดตอนท้ายกับลบสิ่งที่ซ้อมมาน้อยลงด้วย weight decay นั่นคือสองผล keep สุดท้ายคือ Quen ใช้ตัวนี้ ของ Mia Mia Lab หรือ Mia AI lab บน Twitter ทิ้งลิงก์ใน description เธอทำ optimized เก่งสูตรโมเดล ไม่มีอะไรหวือหวา แต่ใช้ DFlash 2 ได้ อย่างที่พูด เป็น checkpoint NVFP4 กับ dense BF16 LM head ใช้ context เต็ม 262K น่าจะรันดี เอาตัวนี้ เวอร์ชัน optimized recipe รุ่นนี้เยอะมาก เอาตัวที่รู้ว่าดี checkpoint ผมใช้เอง รู้ว่า performance สูง รันมาแล้ว ครึ่งทางราว 3 ชั่วโมง โมเดล Quen คิดเยอะมาก เคยมีคนพูด สงสัยควรปิด thinking ไหม แต่นี่คืองานคิดเป็นหลัก เลยเปิดไว้ ผ่านมา 10 ทดลอง หาได้ดีทีเดียว สรุปตอนนี้ หาได้ดีมาก batch เหมือน Neotron เจอ ลด val BPB เหลือ 1.16 tweak เล็กๆ แบบ Neotron ยังไม่เจอ แต่เหลือครึ่งรอบ ตอนต้นมีปัญหากับ environment หาวิธีรันทดลอง คิดเยอะ เห็นไหม secondguess ตัวเอง แต่เวิร์ก เห็นไหม let me reconsider the big picture keep ดีขึ้นเยอะ insight สำคัญคือ bat device batch size graticom จากสองเหลือหนึ่ง เห็นไหมพยายามให้เหตุผล batch size เปลี่ยนแล้วดีขึ้น แล้วควรทำไงต่อ คิดมากไปหน่อย แต่ถึงอยู่ ผมไปนอนอีก รันมาทั้งวัน ดูไม่ออก นี่จะเข้าวันสามพรุ่งนี้ หวังว่าตื่นมาเสร็จหมด จบทดลองได้ อรุณสวัสดิ์ทุกคน รันข้ามคืนสำเร็จ ครบ 6 ชั่วโมง ได้ 21 ทดลอง มาดูผล ใส่ชาร์ต ได้ผลสุดท้าย local AI auto research challenge เรียบร้อย ผู้เข้าแข่งสี่ตัว เห็นว่าวิ่งนานแค่ไหน สีม่วงคือ Quen 3.8 มาดูผลสุดท้าย จำได้ Nemo ได้ 1.143 ส่วน Quen ได้ 1.142 เฉือน Neotron นิดเดียว เศษเสี้ยวจริงๆ ทำแบบน่าสนใจ batch เหมือนที่ Neotron กระโดดใหญ่จากตรงนี้ลงตรงนี้ ย้าย batch 32 ไป 64 เลยลงมาตรงนี้ improvement ใหญ่อีกอันคือเพิ่ม warm-up 5 เปอร์เซ็นต์ แต่ละรัน 5 นาที 15 วินาทีแรก 5 เปอร์เซ็นต์ ค่อยๆ เข้ารัน ไม่ใส่ step เต็มตั้งแต่ต้น warm-up เล็กๆ ช่วย stabilize ได้ improvement ดีจาก baseline นั่นคือผล ผมคาด Quen 3.8 ชนะจริง ชนะ แต่ Neotron เกินคาดน่าสนใจ ทำมากสุด ทดลองเยอะสุด สมชื่อ lightning วิ่งเร็วผ่านทดลอง น่าจะ 60 หรือ 42 อัน น้อยสุดคือ Quen มีแค่ 21 ทดลอง Neotron มี 43 เกือบหรือมากกว่าสองเท่า เพราะเปิด thinking ให้ Quen เลยคิดนาน แต่คิดแล้วคุ้ม หา hypothesis เวิร์กได้ ทดลองน้อยสุดแต่ชนะ คะแนนดีสุด takeaway อื่น Ornith กลางๆ เร็ว decent streaming เร็วมาก แต่ไม่ฉลาดเท่าตัวอื่น แต่ decent อยากเล่นอีก Muse น่าผิดหวัง Muse Glimmer อาจเพราะเวอร์ชันที่ใช้ มีปัญหา instruction following จริง หยุดทดลองตลอด เลยทดลองน้อย แถมทดลองได้เยอะกว่า Quen ยังคิด hypothesis ดีๆ ไม่ได้ เทสต์น่าสนใจถ้าอยากทำ machine learning training กับโมเดล local แนะนำ Quen Quen 3.8 27B หรือ Neotron Lightning ถ้าอยากได้เร็ว รันได้เยอะ จบทดลอง หวังว่าน่าสนใจ เทสต์โมเดลแบบต่าง แต่บางคนใช้ได้ถ้าใช้โมเดล local ฝึกโมเดล local ตัวอื่น ผู้ชนะ Quen 3.8 27B คอมเมนต์บอกหน่อยว่าคิดไงกับการทดลองนี้ จบคลิปนี้ ขอบคุณที่รับชมครับ
อภิธานศัพท์เทคนิค
คำศัพท์และชื่อผลิตภัณฑ์ที่คงรูปภาษาอังกฤษ
| ศัพท์ | คำแปล / คำอธิบาย |
|---|---|
| Auto Research (auto research) | Auto Research |
| Carpathy / Carpathy-auto | Karpathy |
| GitHub repo | GitHub repo |
| autonomous research controller | controller |
| autonomous research loop | loop |
| fixed contract | fixed contract |
| train.py (one editable file) | train.py |
| objective | objective |
| practical test | practical test |
| validation BPB / val BPP | validation BPB |
| bits per bite | bits per bite |
| next token (surprise) | next token |
| perplexity | perplexity |
| mini model | mini model |
| fine-tuning adapter | adapter |
| tinkering | tinkering |
| hypothesis / knob | hypothesis / knob |
| guard (train under) | guard |
| evaluate / keep / discard / reset | keep / discard |
| baseline (1.19) | baseline |
| warm up / warm down ratio | warm up |
| LR schedule / LR divergence | LR schedule |
| crash (invalid) | crash |
| depth (layers 6→8) | depth |
| schema bounds | schema bounds |
| model size / atom beta | atom beta |
| value embedding | value embedding |
| matrix LR | matrix LR |
| weight decay | weight decay |
| unembed LR (0.005, +25%) | unembed LR |
| muon optimizer | muon |
| weight matrix | weight matrix |
| batch size (32→64) | batch size |
| chunk (024 tokens) | chunk |
| bite / gulp (pack) | bite / gulp |
| overhead | overhead |
| lesson per update (65K) | lesson |
| step / update | step |
| practice window (5 min) | practice window |
| warm-up 5% (15s) | warm-up |
| stabilize | stabilize |
| dot plot / leaderboard | leaderboard |
| thumbnail | thumbnail |
| hard readiness gate | readiness gate |
| campaign prompt | campaign prompt |
| controller prompt (markdown) | controller prompt |
| orchestrator (Hermes profile) | orchestrator |
| GBT-5.6 Soul / Soul | Soul |
| Grock | Grock |
| Ornith 1.5 35B A3B | Ornith |
| Neotron 3.5 Lightning 30B | Neotron |
| Muse Glimmer (Glimmer 30B) | Muse Glimmer |
| Quen 3.8 27B | Quen 3.8 |
| Meta / Nvidia / Xiaomi ไม่มี | Meta / Nvidia |
| BF-16 / BF16 / NVFP4 | BF-16 |
| dense BF16 LM head | LM head |
| context (131K / 262K) | context |
| DFlash / DFlash 2 | DFlash 2 |
| DeepSeek Flash | DeepSeek Flash |
| Mia Mia Lab (Twitter) | Mia Lab |
| checkpoint / recipe | checkpoint |
| thinking on/off | thinking |
| secondguess / reconsider | secondguess |
| idle (not looping) | idle |
| pulling method | pulling method |
| do not stop at the prompt | do not stop |
| instruction following | instruction following |
| compaction (recover) | compaction |
| streaming (fast) | streaming |
| sparse activation | sparse activation |
| agent workhorse | workhorse |
| coding specialist | specialist |
| recovery / multimodal / broad | multimodal |
| incumbent control | control |
| claw model / GBT model | claw model |
| cloud vs local model | local model |
| front-end / game dev | front-end |
| terminal window | terminal |
| machine learning training | training |
| 6-hour window / overnight | overnight |
| day three (3 days) | day three |
| 21 GB / 20 (disk) | 21 GB |
| 1.16 / 1.143 / 1.142 | 1.142 |
| Climix 400B shuffle | Climix |
| Chinese stories | Chinese stories |
| H100 | H100 |
| Agent Wikis / Pro $9.99 | Agent Wikis |
| Hyperframes | Hyperframes |
ซับไตเติ้ลภาษาไทย
ดาวน์โหลดหรือดูซับทั้งหมด
1 00:00:00,000 --> 00:00:04,331 ช่องนี้ผมชอบเทสต์โมเดลเทียบกัน 2 00:00:04,331 --> 00:00:10,394 ดูว่าแต่ละตัวต่างกันยังไง บางทีโมเดล cloud 3 00:00:10,394 --> 00:00:13,859 มาตรฐาน บางทีโมเดล local 4 00:00:13,859 --> 00:00:17,179 แต่เทสต์พวกนั้นมักมีภาพ
เปิดดูซับไตเติ้ลทั้งหมด (335 segments)
1 00:00:00,000 --> 00:00:04,331 ช่องนี้ผมชอบเทสต์โมเดลเทียบกัน 2 00:00:04,331 --> 00:00:10,394 ดูว่าแต่ละตัวต่างกันยังไง บางทีโมเดล cloud 3 00:00:10,394 --> 00:00:13,859 มาตรฐาน บางทีโมเดล local 4 00:00:13,859 --> 00:00:17,179 แต่เทสต์พวกนั้นมักมีภาพ 5 00:00:17,179 --> 00:00:23,387 ออกแบบหน้าเว็บหรือสร้างเกมอะไรที่มองเห็นได้ 6 00:00:23,387 --> 00:00:26,996 หนึ่งเพราะผมวิเคราะห์ง่าย 7 00:00:26,996 --> 00:00:30,749 เห็นเว็บก็รู้เลยว่าดีไม่ดี 8 00:00:30,749 --> 00:00:39,411 สองเพราะในวิดีโอมันน่าสนใจกว่าเห็นเกมเห็นเว็บแทนตัวหนังสือใน 9 00:00:39,411 --> 00:00:45,907 terminal แต่อยากเทสต์โมเดล local บน DGX Spark 10 00:00:45,907 --> 00:00:52,259 แบบไม่มีภาพ กับ Auto Research แบบต้นตำรับของ 11 00:00:52,259 --> 00:00:58,900 Karpathy จาก repo ทางการของเขา น่าสนใจว่าโมเดล 12 00:00:58,900 --> 00:01:05,108 local จะทำได้แค่ไหน แถมสร้างมินิโมเดลอีกตัว 13 00:01:05,108 --> 00:01:11,171 ก่อนหน้านี้ตอนทำ auto research มักใช้โมเดล 14 00:01:11,171 --> 00:01:16,512 claw ตัวล่าสุดหรือโมเดล GBT ตัวล่าสุด 15 00:01:16,512 --> 00:01:22,720 เลยอยากรู้ว่าโมเดล local รับมือแบบนี้ไหวไหม 16 00:01:22,720 --> 00:01:29,072 เพราะรู้ว่าคนในชุมชน local AI ใช้โมเดล local 17 00:01:29,072 --> 00:01:34,847 tinkering ฝึกโมเดลตัวเองหรือ fine-tuning 18 00:01:34,847 --> 00:01:39,611 adapter กันเยอะ นั่นคือคลิปวันนี้ 19 00:01:39,611 --> 00:01:45,963 เอาสี่โมเดลมาให้โจทย์ auto research เดียวกัน 20 00:01:45,963 --> 00:01:50,149 ดูว่าตัวไหนเก่งสุด มาเริ่มกัน 21 00:01:50,149 --> 00:01:56,501 ถ้าอยากยกระดับเอเจนต์ของตัวเอง ลองดูโปรเจกต์ 22 00:01:56,501 --> 00:02:02,564 Agent Wikis ของผม ที่นั่นมี knowledge base 23 00:02:02,564 --> 00:02:09,349 ที่ผมใช้ทุกวันทั้งค้นคว้าทำคลิปและสร้างโปรเจกต์ 24 00:02:09,349 --> 00:02:14,691 หัวข้อมี Hermes Agent กับ Hyperframes 25 00:02:14,691 --> 00:02:20,321 กับเครื่องมือ local AI และอีกเพียบ wiki 26 00:02:20,321 --> 00:02:26,817 มาตรฐานเปิดให้ใช้ฟรีทั้งหมด แต่ถ้าสมัคร Agent 27 00:02:26,817 --> 00:02:33,314 Wikis Pro จะได้ Excel wiki ด้วย รวมถึง custom 28 00:02:33,314 --> 00:02:39,810 skill ที่ผมพัฒนาร่วมกับเอเจนต์มาตลอดหลายเดือน 29 00:02:39,810 --> 00:02:44,430 Pro เดือนละ 9.99 ดอลลาร์เท่านั้น 30 00:02:44,430 --> 00:02:49,049 สมัครตอนนี้ล็อกเรทราคานี้ตลอดชีพ 31 00:02:49,049 --> 00:02:58,721 ตอนนี้ผมกำลังทำโปรไฟล์เอเจนต์เฉพาะทางกับเทมเพลตเวิร์กโฟลว์อัตโนมัติ 32 00:02:58,721 --> 00:03:03,052 พอของพวกนี้ออก ราคา Pro จะขึ้น 33 00:03:03,052 --> 00:03:08,827 เลยแนะนำให้สมัครวันนี้ที่ agentwikis.com 34 00:03:08,827 --> 00:03:12,580 ขอบคุณทุกคนที่สนับสนุนครับ 35 00:03:12,580 --> 00:03:18,066 กลับเข้าวิดีโอกันต่อ เล่าแผนทดลองเร็วๆ 36 00:03:18,066 --> 00:03:21,387 แล้วเข้าเลย คำถามคือ AI 37 00:03:21,387 --> 00:03:27,305 ปรับปรุงสูตรฝึกตัวเองได้ไหม มีโมเดล local 38 00:03:27,305 --> 00:03:32,647 สี่ตัวแข่งกันเป็น autonomous research 39 00:03:32,647 --> 00:03:39,143 controller รันเองอัตโนมัติหลังผม setup กับให้ 40 00:03:39,143 --> 00:03:45,062 prompt ผมไม่เติมอะไรอีก ถ้าไม่รู้จัก Auto 41 00:03:45,062 --> 00:03:51,703 Research นี่คือ GitHub repo ทางการของ Karpathy 42 00:03:51,703 --> 00:03:58,343 ที่ Carpathy/auto เขาปล่อยน่าจะมีนาคม ฮือฮามาก 43 00:03:58,343 --> 00:04:04,407 คอนเซปต์คือมีโมเดลรันเองอัตโนมัติ เลยเรียก 44 00:04:04,407 --> 00:04:06,283 auto research 45 00:04:06,283 --> 00:04:11,192 ทำรีเสิร์ชกับมินิโมเดลที่พยายามฝึก 46 00:04:11,192 --> 00:04:14,079 ปรับพารามิเตอร์ต่างๆ 47 00:04:14,079 --> 00:04:25,339 เห็นแต่ละอันคือพารามิเตอร์ที่เปลี่ยน ไอเดียคืออยากให้มันมั่นใจคำตอบขึ้นเรื่อยๆ 48 00:04:25,339 --> 00:04:31,691 metric ที่ใช้คือ validation BPB หรือ val BPP 49 00:04:31,691 --> 00:04:37,755 ยิ่งต่ำยิ่งดี เพราะต่ำแปลว่าโมเดลแปลกใจกับ 50 00:04:37,755 --> 00:04:42,230 token ถัดไปน้อยลง จำได้ตอนออกมา 51 00:04:42,230 --> 00:04:47,138 ช่องผมยังเล็กมาก มีคนตามสองสามร้อย 52 00:04:47,138 --> 00:04:52,624 ผมทำคลิปอธิบาย ดูได้ ผมว่าเป็นคลิปแรกๆ 53 00:04:52,624 --> 00:04:59,986 ที่ภูมิใจ เพราะอธิบายว่า auto research คืออะไรจริงๆ 54 00:04:59,986 --> 00:05:06,627 คนอื่นแค่บอก auto research สุดยอด ไม่ได้อธิบาย 55 00:05:06,627 --> 00:05:12,402 คลิปนั้นดีมาก จุดกระแสช่องผม คืนเดียวได้ 56 00:05:12,402 --> 00:05:18,609 subscriber มาพันคน สุดยอดเลย ผมเลยผูกพันกับ 57 00:05:18,609 --> 00:05:23,085 auto research กับ Karpathy เสมอ 58 00:05:23,085 --> 00:05:29,581 คำถามรอบนี้คือโมเดลไหนรัน autonomous research 59 00:05:29,581 --> 00:05:35,355 loop แข็งสุดบน DGX Spark เครื่องเดียว มี 60 00:05:35,355 --> 00:05:41,130 contract ตายตัว มาจาก repo Karpathy ตรงๆ 61 00:05:41,130 --> 00:05:47,338 แก้ได้ไฟล์เดียว train.py ไฟล์เดียวที่แก้ได้ 62 00:05:47,338 --> 00:05:53,978 เป้าหมายอย่างที่บอกลด validation bits per bite 63 00:05:53,978 --> 00:05:59,753 แล้วมี practical test หนึ่งอัน พวกนี้คือ 64 00:05:59,753 --> 00:06:05,383 controller สี่ตัว เห็นใน thumbnail แล้ว 65 00:06:05,383 --> 00:06:11,591 แน่ใจมีคอมเมนต์ถามทำไมไม่เอารุ่นนั้นรุ่นนี้ 66 00:06:11,591 --> 00:06:18,087 ผมรู้สึกจากรีเสิร์ชว่าสี่ตัวนี้ดีสุด ที่ยัดลง 67 00:06:18,087 --> 00:06:24,728 Spark แล้วทดลองได้ อย่าง DeepSeek Flash อยากทำ 68 00:06:24,728 --> 00:06:30,791 แต่กินที่เยอะไป ไหนจะฝึกโมเดลต้องมี memory 69 00:06:30,791 --> 00:06:37,432 เหลือ ยัดไม่ลง เอาสี่ตัวนี้ Ornith 1.5 35B A3B 70 00:06:37,432 --> 00:06:43,062 สายโค้ดกับ autonomous research โดยเฉพาะ 71 00:06:43,062 --> 00:06:47,826 ไม่เคยใช้มาก่อน มาจากห้องแล็บเล็ก 72 00:06:47,826 --> 00:06:54,322 แต่คนบอกดีมาก เดี๋ยวรู้กัน ต่อไป Muse Glimmer 73 00:06:54,322 --> 00:07:00,963 เล่นนิดหน่อยในคลิป DFlash สัปดาห์ก่อน ของ Meta 74 00:07:00,963 --> 00:07:06,737 รุ่น open weights ใหม่ๆ เป็น broad agent 75 00:07:06,737 --> 00:07:11,213 จุดแข็ง recovery กับ multimodal 76 00:07:11,213 --> 00:07:17,565 งานนี้ไม่ต้องใช้ multimodal แต่เขาว่าเก่งมาก 77 00:07:17,565 --> 00:07:23,628 Neatron 3.5 Lightning ของ Nvidia รุ่น open 78 00:07:23,628 --> 00:07:29,402 ใหม่ๆ เป็น efficient agent workhorse แบบ 79 00:07:29,402 --> 00:07:34,455 sparse activation แล้ว Quen 3.8 27B 80 00:07:34,455 --> 00:07:41,096 เคยทดลองมาก่อน เป็นแชมป์เก่าที่ validate local 81 00:07:41,096 --> 00:07:43,694 แล้ว รู้ว่าเก่งมาก 82 00:07:43,694 --> 00:07:49,613 อยากรู้ว่าเจอตัวอื่นจะเป็นไง เอาสี่ตัวนี้ 83 00:07:49,613 --> 00:07:55,099 หลายตัวยังไม่ค่อยได้ลอง ไซส์ใกล้กันหมด 84 00:07:55,099 --> 00:08:01,740 ไม่มีตัวเล็ก โมเดล decent ทั้งหมด น่าจะทำ auto 85 00:08:01,740 --> 00:08:08,380 research ไหว ข้อมูลใช้ Climix 400B shuffle ของ 86 00:08:08,380 --> 00:08:13,289 Karpathy หนึ่งใน dataset ที่เขาใช้ 87 00:08:13,289 --> 00:08:18,774 ไม่ใช้ทั้งหมด เอาแค่พอทำได้ เขาทำ auto 88 00:08:18,774 --> 00:08:24,693 research บนของจริง H100 เราทำบน DGX Spark 89 00:08:24,693 --> 00:08:30,612 เครื่องเดียว ตัวอย่างเล็กกว่า แต่ dataset 90 00:08:30,612 --> 00:08:36,242 เดียวกัน เป็นภาษาผสมหลายแหล่ง คลิป auto 91 00:08:36,242 --> 00:08:41,006 research แรกผมใช้ Chinese stories 92 00:08:41,006 --> 00:08:46,925 นิทานเด็กสั้นๆ อันนี้ตัวแทนภาษาทั่วไปกว่า 93 00:08:46,925 --> 00:08:53,277 metric คือ val BPB อย่างที่บอก ยิ่งต่ำยิ่งดี 94 00:08:53,277 --> 00:08:58,474 นี่คือทดลองต้นจนจบ โมเดลตั้งสมมติฐาน 95 00:08:58,474 --> 00:09:04,971 อย่างปรับพารามิเตอร์เล็กๆ แก้สคริปต์ train.py 96 00:09:04,971 --> 00:09:11,323 ฝึกภายใต้ guard แล้ว evaluate เสร็จ ตัดสินใจ 97 00:09:11,323 --> 00:09:16,520 keep หรือ discard แล้ววน loop กลับไป 98 00:09:16,520 --> 00:09:18,829 ถ้าปุ่มไหนเวิร์ก 99 00:09:18,829 --> 00:09:25,326 น่าจะดันปุ่มนั้นต่อจนหยุดเวิร์ก นั่นคือไอเดีย 100 00:09:25,326 --> 00:09:31,822 นั่นคือ auto research นั่นคือ loop ลำดับจะลอง 101 00:09:31,822 --> 00:09:38,319 Ornith ก่อนเพราะม้านอกสุด แล้วขึ้นไป Neotron, 102 00:09:38,319 --> 00:09:42,649 Glimmer แล้ว Quen 3.8 Quen 3.8 103 00:09:42,649 --> 00:09:48,713 ตัวเดียวที่เทสต์จริงจัง รู้ว่าแกร่ง อีกสอง 104 00:09:48,713 --> 00:09:54,920 Muse กับ Neimatron น่าจะดี บริษัทข้างหลังดี 105 00:09:54,920 --> 00:10:01,417 แต่ไม่แน่ใจ ลำดับนี้ Ornith, Neatron, Glimmer 106 00:10:01,417 --> 00:10:06,181 แล้ว Quen เริ่ม setup environment 107 00:10:06,181 --> 00:10:12,099 เริ่มด้วยโมเดล Ornith นี่คือ orchestrator 108 00:10:12,099 --> 00:10:18,307 ที่รันทดลองกับผม profile default ของ Hermes 109 00:10:18,307 --> 00:10:24,659 agent ผม รันบน GBT-5.6 Soul ช่วย setup โมเดล 110 00:10:24,659 --> 00:10:29,712 local สร้าง profile แล้ว เห็นตรงนี้ 111 00:10:29,712 --> 00:10:36,064 ใช้เวลาจัดให้สะอาดเรียบร้อย เริ่มด้วย Ornith 112 00:10:36,064 --> 00:10:41,983 ออกแบบมาให้ paste prompt เดียว บอกให้อ่าน 113 00:10:41,983 --> 00:10:46,891 markdown ไฟล์นี้ให้จบแล้วทำตามเป๊ะ 114 00:10:46,891 --> 00:10:52,810 เริ่มจากเช็ก hard readiness gate ถ้า gate 115 00:10:52,810 --> 00:10:59,451 ไม่พร้อมห้ามฝึก ไฟล์นี้คือ prompt Ornith photo 116 00:10:59,451 --> 00:11:05,369 research controller prompt บอกว่าเกิดอะไร 117 00:11:05,369 --> 00:11:11,577 ขอบเขต hardness readiness gate contract กับ 118 00:11:11,577 --> 00:11:17,929 research loop markdown ไฟล์นี้มี instruction 119 00:11:17,929 --> 00:11:23,992 ทั้งหมด ไม่ยาวมากเพราะตรงไปตรงมา paste เลย 120 00:11:23,992 --> 00:11:30,344 ดูว่าโมเดลรันไหมก่อน ทักทาย มาแล้ว I'm ready 121 00:11:30,344 --> 00:11:36,552 to help ทำงานอะไรดี paste ลงไปปล่อยรัน อ่าน 122 00:11:36,552 --> 00:11:43,193 campaign prompt ถูก จะตรวจ hard readiness gate 123 00:11:43,193 --> 00:11:48,534 ก่อนเริ่ม เห็น reasoning ที่ setup มา 124 00:11:48,534 --> 00:11:54,742 เห็นวิธีคิด ไม่ใช่แค่ prompt เห็นไหมรันแล้ว 125 00:11:54,742 --> 00:12:01,238 ทดลองหนึ่งเสร็จ เปลี่ยน warm up baseline 1.19 126 00:12:01,238 --> 00:12:07,012 ไม่แย่ แต่ทดลองหนึ่งได้ 1.2 แย่กว่า ทิ้ง 127 00:12:07,012 --> 00:12:13,220 ไปทดลองสอง น่าสนใจดู reasoning เห็นทฤษฎีมัน 128 00:12:13,220 --> 00:12:19,861 ลองคิดว่าปุ่ม leverage สูงคืออะไร ขนาดโมเดล LR 129 00:12:19,861 --> 00:12:24,769 schedule atom beta value embedding 130 00:12:24,769 --> 00:12:30,544 ไอเดียทดลองสอง เปลี่ยน depth จำนวน layer 131 00:12:30,544 --> 00:12:35,452 ในโมเดล โมเดล Ornith นี่คิดเยอะมาก 132 00:12:35,452 --> 00:12:41,660 สมมติฐานทดลองสอง เพิ่ม capacity โมเดล depth 133 00:12:41,660 --> 00:12:47,723 จากหกไปแปดในขอบ schema พารามิเตอร์ต่อ step 134 00:12:47,723 --> 00:12:53,064 เพิ่ม ควรลด perplexity แม้ step count 135 00:12:53,064 --> 00:12:59,705 ลดในงบตายตัว ทดลองสอง แย่กว่าอีก กลับ baseline 136 00:12:59,705 --> 00:13:04,758 สมมติฐานทดลองสาม LR schedule ใช้ 50 137 00:13:04,758 --> 00:13:10,965 เปอร์เซ็นต์ของงบกับ warm down ratio ลด warm 138 00:13:10,965 --> 00:13:16,884 down ratio เหลือ 0.1 ให้ LR อยู่ใกล้ peak 139 00:13:16,884 --> 00:13:22,803 นานกว่า ปล่อยทดลองสาม invalid เพราะ crash 140 00:13:22,803 --> 00:13:28,722 น่าจะ LR divergence เช็กสาเหตุ crash แล้ว 141 00:13:28,722 --> 00:13:34,641 reset ผมไม่ตามเรียลไทม์ทุกอัน มี window 6 142 00:13:34,641 --> 00:13:40,704 ชั่วโมง เดี๋ยวกลับมาสรุปว่าทำอะไร ผลเป็นไง 143 00:13:40,704 --> 00:13:46,912 Ornith เสร็จ session รวม 6 ชั่วโมง ได้ keep 144 00:13:46,912 --> 00:13:52,831 สองอัน ก้าวหน้าจาก baseline เยอะ baseline 145 00:13:52,831 --> 00:13:58,605 ดีอยู่แล้ว keep ได้สองทดลอง orchestrator 146 00:13:58,605 --> 00:14:05,101 ผมเปลี่ยนเป็น Grock รู้สึกเป็น manager ดีกว่า 147 00:14:05,101 --> 00:14:11,309 อธิบายอยู่ trainer มีปุ่มใหญ่สองปุ่มบน Muan 148 00:14:11,309 --> 00:14:16,073 optimizer หลัก ปรับ weight matrix 149 00:14:16,073 --> 00:14:22,136 หลักแรงแค่ไหนเรียก matrix LR กับบีบ weight 150 00:14:22,136 --> 00:14:28,633 พวกนั้นเรียก weight decay สูตรตั้งต้นค่อนข้าง 151 00:14:28,633 --> 00:14:34,696 aggressive keep ทั้งสองคือแตะ weight เบาลง 152 00:14:34,696 --> 00:14:40,326 step เล็กลงกับ shrink เบามาก analogy นะ 153 00:14:40,326 --> 00:14:46,389 นึกว่าซ้อมห้านาที หลัง batch test แต่ละรอบ 154 00:14:46,389 --> 00:14:53,030 optimizer ขยับปุ่มในโมเดลให้ทำนายรอบหน้าดีขึ้น 155 00:14:53,030 --> 00:14:59,093 ปุ่มส่วนใหญ่ที่ผสมข้อมูลจริงเรียก muon สอง 156 00:14:59,093 --> 00:15:02,847 setting คุม Muan ขนาด step 157 00:15:02,847 --> 00:15:08,621 กระโดดไกลแค่ไหนหลังพลาด กับ weight decay 158 00:15:08,621 --> 00:15:14,973 เหมือนแรงดึงอย่าสุดโต่ง ดึงปุ่มกลับศูนย์ตลอด 159 00:15:14,973 --> 00:15:17,716 ไม่ให้สุดโต่ง tweak 160 00:15:17,716 --> 00:15:23,924 ที่ดีขึ้นคือให้โมเดลเก็บสิ่งที่เรียนมา keep 161 00:15:23,924 --> 00:15:29,843 มากกว่า แค่นั้นก็ชนะ baseline แล้วไปต่อทำ 162 00:15:29,843 --> 00:15:34,607 half-size step กระโดดพวกนี้ใช่ไหม 163 00:15:34,607 --> 00:15:40,237 กระโดดไกลแค่ไหนหลังพลาด หดกระโดดพวกนั้น 164 00:15:40,237 --> 00:15:46,011 นั่นคือ impact ที่ได้ นี่คือโมเดล Ornith 165 00:15:46,011 --> 00:15:52,075 จบรอบมัน เห็นไหมมีแค่ 33 ทดลองใน 6 ชั่วโมง 166 00:15:52,075 --> 00:15:58,138 คิดนานมาก handle compaction ไม่ดี ฟื้นหลัง 167 00:15:58,138 --> 00:16:03,768 compaction ลำบาก ใช้เวลาทบทวนว่าอยู่ไหน 168 00:16:03,768 --> 00:16:10,264 รีวิวทุกอย่าง กลับมาเร็วๆ นาน แต่ execute ได้ 169 00:16:10,264 --> 00:16:14,740 หา keep ได้สองอัน ไม่แย่ ตัวแรก 170 00:16:14,740 --> 00:16:21,092 ยังไม่รู้เทียบคนอื่นไง มาดูกัน ต่อไป Neotron 171 00:16:21,092 --> 00:16:27,299 Lightning ของ Nvidia บอกลา Ornith เตรียมรอบ 172 00:16:27,299 --> 00:16:33,940 Neotron โหลดก่อน นี่ Neotron 3.5 Lightning 30B 173 00:16:33,940 --> 00:16:40,581 A3B setup profile แล้ว แค่โหลดโมเดลจริงแล้วรัน 174 00:16:40,581 --> 00:16:44,190 environment ควรเหมือนเดิม 175 00:16:44,190 --> 00:16:49,964 แยกแต่เหมือนกันทุกโมเดล อันนี้รันข้ามคืน 176 00:16:49,964 --> 00:16:56,605 นอนแล้วดูผลเช้า ให้ Grock ทำทุกอย่าง โหลดโมเดล 177 00:16:56,605 --> 00:17:02,524 monitor สถานการณ์ เปิด Hermes profile ให้ 178 00:17:02,524 --> 00:17:06,277 prompt เริ่ม auto research 179 00:17:06,277 --> 00:17:12,052 นี่คือโบนัสเทสต์โมเดลด้วย เทสต์ว่า Grock 180 00:17:12,052 --> 00:17:18,692 รับมือไหวไหม ทำดี เทียบเท่าที่เจอกับ Soul Soul 181 00:17:18,692 --> 00:17:25,189 ช้าไปเลยเปลี่ยนเป็น Grock ดีอยู่ รอดู ผมไปนอน 182 00:17:25,189 --> 00:17:30,241 ดูผลเช้า อรุณสวัสดิ์ทุกคน ประหลาดใจ 183 00:17:30,241 --> 00:17:36,449 มันเวิร์กจริง Grock โหลด weight Neotron 3.5 184 00:17:36,449 --> 00:17:42,945 Lightning หมด setup environment เปิด campaign 185 00:17:42,945 --> 00:17:49,586 จริง เสร็จหมด steer ได้จนจบ ทดลอง valid 43 อัน 186 00:17:49,586 --> 00:17:54,350 มากกว่า Ornith ดูเร็วกว่าวิธีขยับ 187 00:17:54,350 --> 00:18:00,991 แต่ผมนอนดูไม่ค่อยได้ มาดูผลสุดท้าย ทำ dot plot 188 00:18:00,991 --> 00:18:07,631 ให้ดูผลจริง เส้นเขียวคือ Neotron ส้มคือ Ornith 189 00:18:07,631 --> 00:18:11,241 อีกสองตัวอัปเดตเมื่อได้ผล 190 00:18:11,241 --> 00:18:17,881 เห็นไหมนี่คือเลขทดลองกับ valbd อยากให้ลงใช่ไหม 191 00:18:17,881 --> 00:18:23,944 ตอนแรกขยับคล้ายกัน ลด weight decay ได้ผลดี 192 00:18:23,944 --> 00:18:30,441 พวกนี้คือ keep แล้ว discard เยอะ ลด unmbed LR 193 00:18:30,441 --> 00:18:36,793 ได้ อีกตัว softening แบบ Muan แล้วนี่ matrix 194 00:18:36,793 --> 00:18:43,434 LR คล้ายๆ ลดลง ได้ heap อีกจากการลด wave decay 195 00:18:43,434 --> 00:18:50,074 ลงอีก แล้วตัวใหญ่มาทีหลัง เห็น Neotron ดิ่งแรง 196 00:18:50,074 --> 00:18:55,849 ดีขึ้นเยอะ ด้วยการเพิ่ม batch size Grock 197 00:18:55,849 --> 00:19:02,201 อธิบายว่าแต่ละ chunk คือ 024 token optimizer 198 00:19:02,201 --> 00:19:07,687 ยังอัปเดตบน 65,000 กว่า token ทุก step 199 00:19:07,687 --> 00:19:14,327 เหมือนเดิม ไม่เปลี่ยน ที่เปลี่ยนคือเดิม 32 GPU 200 00:19:14,327 --> 00:19:19,524 ทำเป็นสองคำ คำละ 32 chunk แล้วอัปเดต 201 00:19:19,524 --> 00:19:25,588 หลังเป็นคำเดียว 64 chunk แล้วอัปเดต lesson 202 00:19:25,588 --> 00:19:30,352 ต่ออัปเดตขนาดเดียวกัน ต่างที่แพ็ก 203 00:19:30,352 --> 00:19:36,559 ก่อนสองคำเล็ก หลังคำเดียวใหญ่ คำใหญ่คำเดียว 204 00:19:36,559 --> 00:19:42,767 overhead น้อยกว่าสองคำเล็ก ใน window ซ้อม 5 205 00:19:42,767 --> 00:19:48,686 นาทีตายตัว โมเดลเลยอัปเดตแม่นๆ ได้มากกว่า 206 00:19:48,686 --> 00:19:55,038 นั่นคือเหตุผลคะแนนดีขึ้น นั่นคือ leaderboard 207 00:19:55,038 --> 00:20:00,090 สองโมเดล Neotron Lightning ทำดีกว่า 208 00:20:00,090 --> 00:20:06,731 ได้ผลดีกว่า เข้าตัวเต็งสองตัว Muse Glimmer กับ 209 00:20:06,731 --> 00:20:12,939 Quen 3.8 บอกลา Neotron บอกมันว่านำอยู่ ทำดี 210 00:20:12,939 --> 00:20:16,548 ตอนนี้นำ เหลืออีกสองโมเดล 211 00:20:16,548 --> 00:20:22,755 มันเข้าใจผิดว่าตัวเอง keep อะไร นึกว่า keep 212 00:20:22,755 --> 00:20:28,530 คะแนนเดียว จริง keep สี่ มาสองโมเดลต่อไป 213 00:20:28,530 --> 00:20:34,882 นำอยู่ จะต่อโมเดลหน้าพร้อมเมื่อไร ผม standby 214 00:20:34,882 --> 00:20:41,089 ไม่ต้อง standby เสร็จตรงนี้ ออกตรงนี้ เริ่ม 215 00:20:41,089 --> 00:20:47,586 Muse Glimmer ผมว่าโหลด weight ไว้แล้วก่อนหน้า 216 00:20:47,586 --> 00:20:53,360 ถ้าดูคลิป Deep Flash 2 โหลด Muse Glimmer 217 00:20:53,360 --> 00:20:59,568 ไว้สองสามเวอร์ชัน เลือกตัวดีสุดไปเลย นี่คือ 218 00:20:59,568 --> 00:21:04,476 profile ใช้ Glimmer 30B ให้ prompt 219 00:21:04,476 --> 00:21:09,385 เดียวกับตอนต้น บอกให้อ่าน markdown 220 00:21:09,385 --> 00:21:16,025 ให้จบทำตามเป๊ะ มาดูว่าเวิร์กไหม ตัวนี้ context 221 00:21:16,025 --> 00:21:21,511 window 131,000 โมเดลใหญ่กว่าสองตัวก่อน 222 00:21:21,511 --> 00:21:27,863 ไม่เร็วเท่า Neotron Lightning มั้ง ถาม Grock 223 00:21:27,863 --> 00:21:34,071 ตัว Ornith บนดิสก์แค่ 21 GB ส่วน Neotron 20 224 00:21:34,071 --> 00:21:39,701 ตัวนี้ใหญ่สุดเพราะทำ BF-16 Muse Glimmer 225 00:21:39,701 --> 00:21:46,342 เลยช้ากว่า น่าสนใจ ตัวนี้มี DFlash หรือ DFlash 226 00:21:46,342 --> 00:21:52,549 2 จากคลิปก่อน น่าจะเร็วพอควร ใช่ Quen จะใช้ 227 00:21:52,549 --> 00:21:58,468 BF16 ด้วยให้เท่าเทียม ตอนนี้มี Muse รัน 6 228 00:21:58,468 --> 00:22:04,676 ชั่วโมง เช็กบ้างเป็นครั้งคราว ไม่งั้นรอผล 6 229 00:22:04,676 --> 00:22:09,728 ชั่วโมง Muse เริ่มทำ ทดลองสองสามอัน 230 00:22:09,728 --> 00:22:15,070 แต่ปัญหาใหญ่คือ autonomous loop ลำบาก 231 00:22:15,070 --> 00:22:21,566 ทดลองเสร็จอันหนึ่ง valid โดน discard บอก next 232 00:22:21,566 --> 00:22:27,918 experiment will be launched now แต่ไม่ทำอะไร 233 00:22:27,918 --> 00:22:33,837 นั่ง idle ต้องให้ Grock คอยดัน คอย prompt 234 00:22:33,837 --> 00:22:39,900 เห็นไหม นี่ Grock เขียน do not stop at the 235 00:22:39,900 --> 00:22:46,541 prompt clock active Launch the next hypothesis 236 00:22:46,541 --> 00:22:52,749 now No questions after each receipt Keep or 237 00:22:52,749 --> 00:22:59,101 reset Then immediately launch the next until 238 00:22:59,101 --> 00:23:05,164 expired This is autonomous I will not type 239 00:23:05,164 --> 00:23:11,660 another start command แล้วมันทำ แล้ว idle อีก 240 00:23:11,660 --> 00:23:18,012 ปัญหา instruction following ของ Muse Glimmer 241 00:23:18,012 --> 00:23:21,332 ไม่ยอม act autonomously 242 00:23:21,332 --> 00:23:26,096 ตัวอื่นไม่มีปัญหานี้เลย ให้ Grock 243 00:23:26,096 --> 00:23:32,737 ดันต่อเพราะอยากได้ผล แต่เสียเวลา idle นั่งเฉยๆ 244 00:23:32,737 --> 00:23:38,223 เยอะ น่าจำไว้ มาแล้ว Grock ส่งอันต่อไป 245 00:23:38,223 --> 00:23:43,709 ดูว่าทำต่อไหม เห็น reasoning ต้อง loop 246 00:23:43,709 --> 00:23:50,205 ต่อไม่รอ user user สั่ง do not stop at prompt 247 00:23:50,205 --> 00:23:55,980 ต้องปล่อยทดลองต่อเนื่อง รอดูว่าทำจริงไหม 248 00:23:55,980 --> 00:24:02,332 นั่นคือปัญหากับ Glimmer เดี๋ยวดูว่าเข้าใจไหม 249 00:24:02,332 --> 00:24:08,828 มันหาทางหยุด idle ได้ เห็นไหมรันทดลองรัวๆ ใช้ 250 00:24:08,828 --> 00:24:13,448 pulling method ต่างจากสองตัวก่อน 251 00:24:13,448 --> 00:24:19,944 ปกติหยุดตรงนี้ รายงาน แล้วเปิดเอง ตัวนี้ Muse 252 00:24:19,944 --> 00:24:25,863 รันรัวเลย อย่างน้อยไม่ต้อง prompt แล้ว ดี 253 00:24:25,863 --> 00:24:32,359 Glimmer เสร็จ หา improvement จาก baseline ได้ 254 00:24:32,359 --> 00:24:38,855 ยังมีปัญหา instruction following แต่ผ่านมาได้ 255 00:24:38,855 --> 00:24:45,496 นี่คือผลหลังสามตัว สีฟ้าคือ Muse เห็นไหมนานมาก 256 00:24:45,496 --> 00:24:51,271 keep ทุกอย่าง ไม่เจออะไร สุดท้ายเจอ keep 257 00:24:51,271 --> 00:24:56,901 สองอันล่าง แต่ตอนนี้บ๊วยอยู่ จบ session 258 00:24:56,901 --> 00:25:03,542 ทั้งที่ 6 ชั่วโมงยังไม่หมด อย่างที่บอกหยุดบ่อย 259 00:25:03,542 --> 00:25:10,038 เลยทดลองน้อย keep สองอันมาจากอันนี้ unmbed LR 260 00:25:10,038 --> 00:25:14,224 ขยับเป็น 0.005 ปล่อยให้ layer 261 00:25:14,224 --> 00:25:17,978 สุดท้ายพูดดังขึ้นนิด layer 262 00:25:17,978 --> 00:25:24,330 สุดท้ายคือส่วนที่เปลี่ยนขีดเขียนในเป็น guess 263 00:25:24,330 --> 00:25:30,970 token ถัดไป เดิม step เล็กมาก Muse เพิ่มนิดราว 264 00:25:30,970 --> 00:25:37,467 25 เปอร์เซ็นต์ ยังเล็ก เรียนบทเดิมเร็วขึ้นนิด 265 00:25:37,467 --> 00:25:43,530 จับคำที่ควร output ได้ตรงขึ้น แค่นั้นก็ชนะ 266 00:25:43,530 --> 00:25:49,305 baseline แช่แข็ง keep สองผู้ชนะสูงสุดคือ 267 00:25:49,305 --> 00:25:55,512 weight decay เหมือนที่พูด แต่หยุดดึง weight 268 00:25:55,512 --> 00:25:58,833 กลับแรง ลด weight decay 269 00:25:58,833 --> 00:26:02,586 ไม่ให้หดตัวเลขเข้าศูนย์มาก 270 00:26:02,586 --> 00:26:07,927 ไม่มีอันไหนขยายโมเดลหรือฝึกนาน window 271 00:26:07,927 --> 00:26:09,660 ซ้อมเดียวกัน 272 00:26:09,660 --> 00:26:17,167 แค่พูดเร็วขึ้นนิดตอนท้ายกับลบสิ่งที่ซ้อมมาน้อยลงด้วย 273 00:26:17,167 --> 00:26:23,807 weight decay นั่นคือสองผล keep สุดท้ายคือ Quen 274 00:26:23,807 --> 00:26:30,159 ใช้ตัวนี้ ของ Mia Mia Lab หรือ Mia AI lab บน 275 00:26:30,159 --> 00:26:35,501 Twitter ทิ้งลิงก์ใน description เธอทำ 276 00:26:35,501 --> 00:26:41,275 optimized เก่งสูตรโมเดล ไม่มีอะไรหวือหวา 277 00:26:41,275 --> 00:26:46,472 แต่ใช้ DFlash 2 ได้ อย่างที่พูด เป็น 278 00:26:46,472 --> 00:26:52,680 checkpoint NVFP4 กับ dense BF16 LM head ใช้ 279 00:26:52,680 --> 00:26:58,166 context เต็ม 262K น่าจะรันดี เอาตัวนี้ 280 00:26:58,166 --> 00:27:03,940 เวอร์ชัน optimized recipe รุ่นนี้เยอะมาก 281 00:27:03,940 --> 00:27:10,292 เอาตัวที่รู้ว่าดี checkpoint ผมใช้เอง รู้ว่า 282 00:27:10,292 --> 00:27:15,922 performance สูง รันมาแล้ว ครึ่งทางราว 3 283 00:27:15,922 --> 00:27:21,697 ชั่วโมง โมเดล Quen คิดเยอะมาก เคยมีคนพูด 284 00:27:21,697 --> 00:27:25,162 สงสัยควรปิด thinking ไหม 285 00:27:25,162 --> 00:27:31,514 แต่นี่คืองานคิดเป็นหลัก เลยเปิดไว้ ผ่านมา 10 286 00:27:31,514 --> 00:27:37,577 ทดลอง หาได้ดีทีเดียว สรุปตอนนี้ หาได้ดีมาก 287 00:27:37,577 --> 00:27:44,218 batch เหมือน Neotron เจอ ลด val BPB เหลือ 1.16 288 00:27:44,218 --> 00:27:48,982 tweak เล็กๆ แบบ Neotron ยังไม่เจอ 289 00:27:48,982 --> 00:27:55,478 แต่เหลือครึ่งรอบ ตอนต้นมีปัญหากับ environment 290 00:27:55,478 --> 00:28:01,541 หาวิธีรันทดลอง คิดเยอะ เห็นไหม secondguess 291 00:28:01,541 --> 00:28:08,182 ตัวเอง แต่เวิร์ก เห็นไหม let me reconsider the 292 00:28:08,182 --> 00:28:14,534 big picture keep ดีขึ้นเยอะ insight สำคัญคือ 293 00:28:14,534 --> 00:28:18,865 bat device batch size graticom 294 00:28:18,865 --> 00:28:25,361 จากสองเหลือหนึ่ง เห็นไหมพยายามให้เหตุผล batch 295 00:28:25,361 --> 00:28:30,703 size เปลี่ยนแล้วดีขึ้น แล้วควรทำไงต่อ 296 00:28:30,703 --> 00:28:35,755 คิดมากไปหน่อย แต่ถึงอยู่ ผมไปนอนอีก 297 00:28:35,755 --> 00:28:42,252 รันมาทั้งวัน ดูไม่ออก นี่จะเข้าวันสามพรุ่งนี้ 298 00:28:42,252 --> 00:28:46,871 หวังว่าตื่นมาเสร็จหมด จบทดลองได้ 299 00:28:46,871 --> 00:28:52,501 อรุณสวัสดิ์ทุกคน รันข้ามคืนสำเร็จ ครบ 6 300 00:28:52,501 --> 00:28:57,698 ชั่วโมง ได้ 21 ทดลอง มาดูผล ใส่ชาร์ต 301 00:28:57,698 --> 00:29:04,195 ได้ผลสุดท้าย local AI auto research challenge 302 00:29:04,195 --> 00:29:08,093 เรียบร้อย ผู้เข้าแข่งสี่ตัว 303 00:29:08,093 --> 00:29:13,723 เห็นว่าวิ่งนานแค่ไหน สีม่วงคือ Quen 3.8 304 00:29:13,723 --> 00:29:20,075 มาดูผลสุดท้าย จำได้ Nemo ได้ 1.143 ส่วน Quen 305 00:29:20,075 --> 00:29:24,694 ได้ 1.142 เฉือน Neotron นิดเดียว 306 00:29:24,694 --> 00:29:30,902 เศษเสี้ยวจริงๆ ทำแบบน่าสนใจ batch เหมือนที่ 307 00:29:30,902 --> 00:29:37,543 Neotron กระโดดใหญ่จากตรงนี้ลงตรงนี้ ย้าย batch 308 00:29:37,543 --> 00:29:42,451 32 ไป 64 เลยลงมาตรงนี้ improvement 309 00:29:42,451 --> 00:29:48,226 ใหญ่อีกอันคือเพิ่ม warm-up 5 เปอร์เซ็นต์ 310 00:29:48,226 --> 00:29:54,289 แต่ละรัน 5 นาที 15 วินาทีแรก 5 เปอร์เซ็นต์ 311 00:29:54,289 --> 00:29:55,389 ค่อยๆ 312 00:29:55,389 --> 00:30:02,318 เข้ารัน ไม่ใส่ step เต็มตั้งแต่ต้น warm-up เล็กๆ 313 00:30:02,318 --> 00:30:08,814 ช่วย stabilize ได้ improvement ดีจาก baseline 314 00:30:08,814 --> 00:30:14,589 นั่นคือผล ผมคาด Quen 3.8 ชนะจริง ชนะ แต่ 315 00:30:14,589 --> 00:30:20,941 Neotron เกินคาดน่าสนใจ ทำมากสุด ทดลองเยอะสุด 316 00:30:20,941 --> 00:30:27,148 สมชื่อ lightning วิ่งเร็วผ่านทดลอง น่าจะ 60 317 00:30:27,148 --> 00:30:33,212 หรือ 42 อัน น้อยสุดคือ Quen มีแค่ 21 ทดลอง 318 00:30:33,212 --> 00:30:38,553 Neotron มี 43 เกือบหรือมากกว่าสองเท่า 319 00:30:38,553 --> 00:30:43,895 เพราะเปิด thinking ให้ Quen เลยคิดนาน 320 00:30:43,895 --> 00:30:49,380 แต่คิดแล้วคุ้ม หา hypothesis เวิร์กได้ 321 00:30:49,380 --> 00:30:55,588 ทดลองน้อยสุดแต่ชนะ คะแนนดีสุด takeaway อื่น 322 00:30:55,588 --> 00:31:01,651 Ornith กลางๆ เร็ว decent streaming เร็วมาก 323 00:31:01,651 --> 00:31:08,003 แต่ไม่ฉลาดเท่าตัวอื่น แต่ decent อยากเล่นอีก 324 00:31:08,003 --> 00:31:12,045 Muse น่าผิดหวัง Muse Glimmer 325 00:31:12,045 --> 00:31:18,109 อาจเพราะเวอร์ชันที่ใช้ มีปัญหา instruction 326 00:31:18,109 --> 00:31:24,027 following จริง หยุดทดลองตลอด เลยทดลองน้อย 327 00:31:24,027 --> 00:31:30,668 แถมทดลองได้เยอะกว่า Quen ยังคิด hypothesis ดีๆ 328 00:31:30,668 --> 00:31:37,165 ไม่ได้ เทสต์น่าสนใจถ้าอยากทำ machine learning 329 00:31:37,165 --> 00:31:43,372 training กับโมเดล local แนะนำ Quen Quen 3.8 330 00:31:43,372 --> 00:31:49,291 27B หรือ Neotron Lightning ถ้าอยากได้เร็ว 331 00:31:49,291 --> 00:31:54,055 รันได้เยอะ จบทดลอง หวังว่าน่าสนใจ 332 00:31:54,055 --> 00:32:00,263 เทสต์โมเดลแบบต่าง แต่บางคนใช้ได้ถ้าใช้โมเดล 333 00:32:00,263 --> 00:32:06,615 local ฝึกโมเดล local ตัวอื่น ผู้ชนะ Quen 3.8 334 00:32:06,615 --> 00:32:12,678 27B คอมเมนต์บอกหน่อยว่าคิดไงกับการทดลองนี้ 335 00:32:12,678 --> 00:32:16,720 จบคลิปนี้ ขอบคุณที่รับชมครับ