▶SUBTHAIแปลไทย · ซับ · พากย์⚙
บทความแปลภาษาไทย · YouTube

Which Local LLM Performs Autoresearch the Best?

0:000:00
เล่นเสียงต้นฉบับของวิดีโอ พร้อมแสดงซับไทยซิงก์ตามเวลา
กำลังโหลดวิดีโอ…
01

สรุปย่อ

ประเด็นสำคัญจากวิดีโอ

> **ที่มา:** [YouTube — Tonbi's AI Garage](https://www.youtube.com/watch?v=jCNeVZJAYGM) · เผยแพร่ 31 ส.ค. 2026 · ~32:17 นาที

# สรุปภาษาไทย — Which Local LLM Performs Autoresearch the Best?

> **ที่มา:** [YouTube — Tonbi's AI Garage](https://www.youtube.com/watch?v=jCNeVZJAYGM) · เผยแพร่ 31 ส.ค. 2026 · ~32:17 นาที
> *สรุปโดยอัตโนมัติ — เนื้อหาต้นฉบับ © Tonbi's AI Garage*

## วิดีโอนี้เกี่ยวกับอะไร
Tonbi จับโมเดล local 4 ตัวมาแข่ง **Auto Research** ต้นตำรับ Karpathy (repo Carpathy/auto) — ให้แต่ละตัวเป็น autonomous research controller ปรับสูตรฝึกมินิโมเดลเองบน DGX Spark เครื่องเดียว เป้าหมายลด validation BPB ให้ต่ำสุด

## ประเด็นหลัก

1. **โจทย์:** AI ปรับปรุงสูตรฝึกตัวเองได้ไหม · แก้ได้ไฟล์เดียว train.py · metric คือ validation BPB (ยิ่งต่ำยิ่งดี = แปลกใจกับ token ถัดไปน้อยลง) · ข้อมูล Climix 400B shuffle (ตัวอย่างเล็กกว่า Karpathy ที่ใช้ H100) · loop: ตั้งสมมติฐาน → แก้ train.py → ฝึกภายใต้ guard → evaluate → keep/discard → วนใหม่
2. **ผู้เข้าแข่ง 4 ตัว (ไซส์ใกล้กัน):** Ornith 1.5 35B A3B (สายโค้ด/auto research ห้องแล็บเล็ก ม้านอก) · Muse Glimmer (Meta, broad agent) · Neatron 3.5 Lightning 30B (Nvidia, workhorse แบบ sparse) · Quen 3.8 27B (แชมป์เก่า local ที่ validate แล้ว)
3. **Ornith (6 ชม. 33 ทดลอง 2 keep):** baseline 1.19 → keep สองอันคือแตะ weight เบาลง (matrix LR step เล็กลง + weight decay เบามาก) · คิดนาน ฟื้นหลัง compaction ช้า · กลางๆ streaming เร็วแต่ไม่ฉลาดสุด
4. **Neotron (ข้ามคืน 43 ทดลอง valid):** เร็วสมชื่อ lightning · keep หลายอัน (ลด weight decay, ลด unembed/matrix LR) · ไม้เด็ดคือเพิ่ม batch 32→64 (lesson ต่ออัปเดตเท่าเดิม 65K token แต่แพ็กเป็นคำใหญ่คำเดียว overhead น้อยกว่า) ทำคะแนนดิ่ง · Grock รับบท orchestrator โหลดโมเดล setup เปิด campaign เองหมด
5. **Muse Glimmer (น่าผิดหวัง บ๊วย):** ปัญหา instruction following — ทดลองเสร็จแล้วนั่ง idle ไม่ยอมวน loop เอง ต้องให้ Grock คอยดัน (do not stop at the prompt...) · สุดท้าย keep 2 อัน (unembed LR → 0.005 บวก 25% + ลด weight decay) แต่จบก่อนครบ 6 ชม. ทดลองน้อย คิด hypothesis ไม่คม
6. **Quen 3.8 (แชมป์ 21 ทดลอง):** เปิด thinking ไว้เลยคิดนาน ทดลองน้อยสุด (น้อยกว่า Neotron ครึ่ง) แต่คิดคุ้ม — เจอ batch 32→64 เหมือน Neotron (val BPB ลง 1.16) บวกไม้เด็ดเพิ่ม warm-up 5% (15 วิแรกของรัน 5 นาที ค่อยๆ เข้า step เต็ม ช่วย stabilize) · **ชนะที่ 1.142 เฉือน Neotron 1.143 แค่เศษเสี้ยว**
7. **สรุป+คำแนะนำ:** อยากทำ ML training กับโมเดล local → Quen 3.8 27B (แม่นสุด) หรือ Neotron Lightning (เร็วสุด รันเยอะสุด) · ทดลองนี้กินเวลา 3 วัน

## ใครควรดู
สาย local AI ที่ใช้โมเดล local ฝึกโมเดลต่อ — เห็นทั้งวิธี setup การแข่ง กลยุทธ์ของแต่ละตัว และคำตอบว่าแชมป์คือใคร

---
*Attribution: Which Local LLM Performs Autoresearch — Tonbi's AI Garage (youtube.com/watch?v=jCNeVZJAYGM), เผยแพร่ 31 ส.ค. 2026*
02

คำแปลเต็ม

แปลตามบทสนทนาต้นฉบับ ปรับเป็นภาษาไทยธรรมชาติ

ช่องนี้ผมชอบเทสต์โมเดลเทียบกัน ดูว่าแต่ละตัวต่างกันยังไง บางทีโมเดล cloud มาตรฐาน บางทีโมเดล local แต่เทสต์พวกนั้นมักมีภาพ ออกแบบหน้าเว็บหรือสร้างเกมอะไรที่มองเห็นได้ หนึ่งเพราะผมวิเคราะห์ง่าย เห็นเว็บก็รู้เลยว่าดีไม่ดี สองเพราะในวิดีโอมันน่าสนใจกว่าเห็นเกมเห็นเว็บแทนตัวหนังสือใน terminal แต่อยากเทสต์โมเดล local บน DGX Spark แบบไม่มีภาพ กับ Auto Research แบบต้นตำรับของ Karpathy จาก repo ทางการของเขา น่าสนใจว่าโมเดล local จะทำได้แค่ไหน แถมสร้างมินิโมเดลอีกตัว ก่อนหน้านี้ตอนทำ auto research มักใช้โมเดล claw ตัวล่าสุดหรือโมเดล GBT ตัวล่าสุด เลยอยากรู้ว่าโมเดล local รับมือแบบนี้ไหวไหม เพราะรู้ว่าคนในชุมชน local AI ใช้โมเดล local tinkering ฝึกโมเดลตัวเองหรือ fine-tuning adapter กันเยอะ นั่นคือคลิปวันนี้ เอาสี่โมเดลมาให้โจทย์ auto research เดียวกัน ดูว่าตัวไหนเก่งสุด มาเริ่มกัน ถ้าอยากยกระดับเอเจนต์ของตัวเอง ลองดูโปรเจกต์ Agent Wikis ของผม ที่นั่นมี knowledge base ที่ผมใช้ทุกวันทั้งค้นคว้าทำคลิปและสร้างโปรเจกต์ หัวข้อมี Hermes Agent กับ Hyperframes กับเครื่องมือ local AI และอีกเพียบ wiki มาตรฐานเปิดให้ใช้ฟรีทั้งหมด แต่ถ้าสมัคร Agent Wikis Pro จะได้ Excel wiki ด้วย รวมถึง custom skill ที่ผมพัฒนาร่วมกับเอเจนต์มาตลอดหลายเดือน Pro เดือนละ 9.99 ดอลลาร์เท่านั้น สมัครตอนนี้ล็อกเรทราคานี้ตลอดชีพ ตอนนี้ผมกำลังทำโปรไฟล์เอเจนต์เฉพาะทางกับเทมเพลตเวิร์กโฟลว์อัตโนมัติ พอของพวกนี้ออก ราคา Pro จะขึ้น เลยแนะนำให้สมัครวันนี้ที่ agentwikis.com ขอบคุณทุกคนที่สนับสนุนครับ กลับเข้าวิดีโอกันต่อ เล่าแผนทดลองเร็วๆ แล้วเข้าเลย คำถามคือ AI ปรับปรุงสูตรฝึกตัวเองได้ไหม มีโมเดล local สี่ตัวแข่งกันเป็น autonomous research controller รันเองอัตโนมัติหลังผม setup กับให้ prompt ผมไม่เติมอะไรอีก ถ้าไม่รู้จัก Auto Research นี่คือ GitHub repo ทางการของ Karpathy ที่ Carpathy/auto เขาปล่อยน่าจะมีนาคม ฮือฮามาก คอนเซปต์คือมีโมเดลรันเองอัตโนมัติ เลยเรียก auto research ทำรีเสิร์ชกับมินิโมเดลที่พยายามฝึก ปรับพารามิเตอร์ต่างๆ เห็นแต่ละอันคือพารามิเตอร์ที่เปลี่ยน ไอเดียคืออยากให้มันมั่นใจคำตอบขึ้นเรื่อยๆ metric ที่ใช้คือ validation BPB หรือ val BPP ยิ่งต่ำยิ่งดี เพราะต่ำแปลว่าโมเดลแปลกใจกับ token ถัดไปน้อยลง จำได้ตอนออกมา ช่องผมยังเล็กมาก มีคนตามสองสามร้อย ผมทำคลิปอธิบาย ดูได้ ผมว่าเป็นคลิปแรกๆ ที่ภูมิใจ เพราะอธิบายว่า auto research คืออะไรจริงๆ คนอื่นแค่บอก auto research สุดยอด ไม่ได้อธิบาย คลิปนั้นดีมาก จุดกระแสช่องผม คืนเดียวได้ subscriber มาพันคน สุดยอดเลย ผมเลยผูกพันกับ auto research กับ Karpathy เสมอ คำถามรอบนี้คือโมเดลไหนรัน autonomous research loop แข็งสุดบน DGX Spark เครื่องเดียว มี contract ตายตัว มาจาก repo Karpathy ตรงๆ แก้ได้ไฟล์เดียว train.py ไฟล์เดียวที่แก้ได้ เป้าหมายอย่างที่บอกลด validation bits per bite แล้วมี practical test หนึ่งอัน พวกนี้คือ controller สี่ตัว เห็นใน thumbnail แล้ว แน่ใจมีคอมเมนต์ถามทำไมไม่เอารุ่นนั้นรุ่นนี้ ผมรู้สึกจากรีเสิร์ชว่าสี่ตัวนี้ดีสุด ที่ยัดลง Spark แล้วทดลองได้ อย่าง DeepSeek Flash อยากทำ แต่กินที่เยอะไป ไหนจะฝึกโมเดลต้องมี memory เหลือ ยัดไม่ลง เอาสี่ตัวนี้ Ornith 1.5 35B A3B สายโค้ดกับ autonomous research โดยเฉพาะ ไม่เคยใช้มาก่อน มาจากห้องแล็บเล็ก แต่คนบอกดีมาก เดี๋ยวรู้กัน ต่อไป Muse Glimmer เล่นนิดหน่อยในคลิป DFlash สัปดาห์ก่อน ของ Meta รุ่น open weights ใหม่ๆ เป็น broad agent จุดแข็ง recovery กับ multimodal งานนี้ไม่ต้องใช้ multimodal แต่เขาว่าเก่งมาก Neatron 3.5 Lightning ของ Nvidia รุ่น open ใหม่ๆ เป็น efficient agent workhorse แบบ sparse activation แล้ว Quen 3.8 27B เคยทดลองมาก่อน เป็นแชมป์เก่าที่ validate local แล้ว รู้ว่าเก่งมาก อยากรู้ว่าเจอตัวอื่นจะเป็นไง เอาสี่ตัวนี้ หลายตัวยังไม่ค่อยได้ลอง ไซส์ใกล้กันหมด ไม่มีตัวเล็ก โมเดล decent ทั้งหมด น่าจะทำ auto research ไหว ข้อมูลใช้ Climix 400B shuffle ของ Karpathy หนึ่งใน dataset ที่เขาใช้ ไม่ใช้ทั้งหมด เอาแค่พอทำได้ เขาทำ auto research บนของจริง H100 เราทำบน DGX Spark เครื่องเดียว ตัวอย่างเล็กกว่า แต่ dataset เดียวกัน เป็นภาษาผสมหลายแหล่ง คลิป auto research แรกผมใช้ Chinese stories นิทานเด็กสั้นๆ อันนี้ตัวแทนภาษาทั่วไปกว่า metric คือ val BPB อย่างที่บอก ยิ่งต่ำยิ่งดี นี่คือทดลองต้นจนจบ โมเดลตั้งสมมติฐาน อย่างปรับพารามิเตอร์เล็กๆ แก้สคริปต์ train.py ฝึกภายใต้ guard แล้ว evaluate เสร็จ ตัดสินใจ keep หรือ discard แล้ววน loop กลับไป ถ้าปุ่มไหนเวิร์ก น่าจะดันปุ่มนั้นต่อจนหยุดเวิร์ก นั่นคือไอเดีย นั่นคือ auto research นั่นคือ loop ลำดับจะลอง Ornith ก่อนเพราะม้านอกสุด แล้วขึ้นไป Neotron, Glimmer แล้ว Quen 3.8 Quen 3.8 ตัวเดียวที่เทสต์จริงจัง รู้ว่าแกร่ง อีกสอง Muse กับ Neimatron น่าจะดี บริษัทข้างหลังดี แต่ไม่แน่ใจ ลำดับนี้ Ornith, Neatron, Glimmer แล้ว Quen เริ่ม setup environment เริ่มด้วยโมเดล Ornith นี่คือ orchestrator ที่รันทดลองกับผม profile default ของ Hermes agent ผม รันบน GBT-5.6 Soul ช่วย setup โมเดล local สร้าง profile แล้ว เห็นตรงนี้ ใช้เวลาจัดให้สะอาดเรียบร้อย เริ่มด้วย Ornith ออกแบบมาให้ paste prompt เดียว บอกให้อ่าน markdown ไฟล์นี้ให้จบแล้วทำตามเป๊ะ เริ่มจากเช็ก hard readiness gate ถ้า gate ไม่พร้อมห้ามฝึก ไฟล์นี้คือ prompt Ornith photo research controller prompt บอกว่าเกิดอะไร ขอบเขต hardness readiness gate contract กับ research loop markdown ไฟล์นี้มี instruction ทั้งหมด ไม่ยาวมากเพราะตรงไปตรงมา paste เลย ดูว่าโมเดลรันไหมก่อน ทักทาย มาแล้ว I'm ready to help ทำงานอะไรดี paste ลงไปปล่อยรัน อ่าน campaign prompt ถูก จะตรวจ hard readiness gate ก่อนเริ่ม เห็น reasoning ที่ setup มา เห็นวิธีคิด ไม่ใช่แค่ prompt เห็นไหมรันแล้ว ทดลองหนึ่งเสร็จ เปลี่ยน warm up baseline 1.19 ไม่แย่ แต่ทดลองหนึ่งได้ 1.2 แย่กว่า ทิ้ง ไปทดลองสอง น่าสนใจดู reasoning เห็นทฤษฎีมัน ลองคิดว่าปุ่ม leverage สูงคืออะไร ขนาดโมเดล LR schedule atom beta value embedding ไอเดียทดลองสอง เปลี่ยน depth จำนวน layer ในโมเดล โมเดล Ornith นี่คิดเยอะมาก สมมติฐานทดลองสอง เพิ่ม capacity โมเดล depth จากหกไปแปดในขอบ schema พารามิเตอร์ต่อ step เพิ่ม ควรลด perplexity แม้ step count ลดในงบตายตัว ทดลองสอง แย่กว่าอีก กลับ baseline สมมติฐานทดลองสาม LR schedule ใช้ 50 เปอร์เซ็นต์ของงบกับ warm down ratio ลด warm down ratio เหลือ 0.1 ให้ LR อยู่ใกล้ peak นานกว่า ปล่อยทดลองสาม invalid เพราะ crash น่าจะ LR divergence เช็กสาเหตุ crash แล้ว reset ผมไม่ตามเรียลไทม์ทุกอัน มี window 6 ชั่วโมง เดี๋ยวกลับมาสรุปว่าทำอะไร ผลเป็นไง Ornith เสร็จ session รวม 6 ชั่วโมง ได้ keep สองอัน ก้าวหน้าจาก baseline เยอะ baseline ดีอยู่แล้ว keep ได้สองทดลอง orchestrator ผมเปลี่ยนเป็น Grock รู้สึกเป็น manager ดีกว่า อธิบายอยู่ trainer มีปุ่มใหญ่สองปุ่มบน Muan optimizer หลัก ปรับ weight matrix หลักแรงแค่ไหนเรียก matrix LR กับบีบ weight พวกนั้นเรียก weight decay สูตรตั้งต้นค่อนข้าง aggressive keep ทั้งสองคือแตะ weight เบาลง step เล็กลงกับ shrink เบามาก analogy นะ นึกว่าซ้อมห้านาที หลัง batch test แต่ละรอบ optimizer ขยับปุ่มในโมเดลให้ทำนายรอบหน้าดีขึ้น ปุ่มส่วนใหญ่ที่ผสมข้อมูลจริงเรียก muon สอง setting คุม Muan ขนาด step กระโดดไกลแค่ไหนหลังพลาด กับ weight decay เหมือนแรงดึงอย่าสุดโต่ง ดึงปุ่มกลับศูนย์ตลอด ไม่ให้สุดโต่ง tweak ที่ดีขึ้นคือให้โมเดลเก็บสิ่งที่เรียนมา keep มากกว่า แค่นั้นก็ชนะ baseline แล้วไปต่อทำ half-size step กระโดดพวกนี้ใช่ไหม กระโดดไกลแค่ไหนหลังพลาด หดกระโดดพวกนั้น นั่นคือ impact ที่ได้ นี่คือโมเดล Ornith จบรอบมัน เห็นไหมมีแค่ 33 ทดลองใน 6 ชั่วโมง คิดนานมาก handle compaction ไม่ดี ฟื้นหลัง compaction ลำบาก ใช้เวลาทบทวนว่าอยู่ไหน รีวิวทุกอย่าง กลับมาเร็วๆ นาน แต่ execute ได้ หา keep ได้สองอัน ไม่แย่ ตัวแรก ยังไม่รู้เทียบคนอื่นไง มาดูกัน ต่อไป Neotron Lightning ของ Nvidia บอกลา Ornith เตรียมรอบ Neotron โหลดก่อน นี่ Neotron 3.5 Lightning 30B A3B setup profile แล้ว แค่โหลดโมเดลจริงแล้วรัน environment ควรเหมือนเดิม แยกแต่เหมือนกันทุกโมเดล อันนี้รันข้ามคืน นอนแล้วดูผลเช้า ให้ Grock ทำทุกอย่าง โหลดโมเดล monitor สถานการณ์ เปิด Hermes profile ให้ prompt เริ่ม auto research นี่คือโบนัสเทสต์โมเดลด้วย เทสต์ว่า Grock รับมือไหวไหม ทำดี เทียบเท่าที่เจอกับ Soul Soul ช้าไปเลยเปลี่ยนเป็น Grock ดีอยู่ รอดู ผมไปนอน ดูผลเช้า อรุณสวัสดิ์ทุกคน ประหลาดใจ มันเวิร์กจริง Grock โหลด weight Neotron 3.5 Lightning หมด setup environment เปิด campaign จริง เสร็จหมด steer ได้จนจบ ทดลอง valid 43 อัน มากกว่า Ornith ดูเร็วกว่าวิธีขยับ แต่ผมนอนดูไม่ค่อยได้ มาดูผลสุดท้าย ทำ dot plot ให้ดูผลจริง เส้นเขียวคือ Neotron ส้มคือ Ornith อีกสองตัวอัปเดตเมื่อได้ผล เห็นไหมนี่คือเลขทดลองกับ valbd อยากให้ลงใช่ไหม ตอนแรกขยับคล้ายกัน ลด weight decay ได้ผลดี พวกนี้คือ keep แล้ว discard เยอะ ลด unmbed LR ได้ อีกตัว softening แบบ Muan แล้วนี่ matrix LR คล้ายๆ ลดลง ได้ heap อีกจากการลด wave decay ลงอีก แล้วตัวใหญ่มาทีหลัง เห็น Neotron ดิ่งแรง ดีขึ้นเยอะ ด้วยการเพิ่ม batch size Grock อธิบายว่าแต่ละ chunk คือ 024 token optimizer ยังอัปเดตบน 65,000 กว่า token ทุก step เหมือนเดิม ไม่เปลี่ยน ที่เปลี่ยนคือเดิม 32 GPU ทำเป็นสองคำ คำละ 32 chunk แล้วอัปเดต หลังเป็นคำเดียว 64 chunk แล้วอัปเดต lesson ต่ออัปเดตขนาดเดียวกัน ต่างที่แพ็ก ก่อนสองคำเล็ก หลังคำเดียวใหญ่ คำใหญ่คำเดียว overhead น้อยกว่าสองคำเล็ก ใน window ซ้อม 5 นาทีตายตัว โมเดลเลยอัปเดตแม่นๆ ได้มากกว่า นั่นคือเหตุผลคะแนนดีขึ้น นั่นคือ leaderboard สองโมเดล Neotron Lightning ทำดีกว่า ได้ผลดีกว่า เข้าตัวเต็งสองตัว Muse Glimmer กับ Quen 3.8 บอกลา Neotron บอกมันว่านำอยู่ ทำดี ตอนนี้นำ เหลืออีกสองโมเดล มันเข้าใจผิดว่าตัวเอง keep อะไร นึกว่า keep คะแนนเดียว จริง keep สี่ มาสองโมเดลต่อไป นำอยู่ จะต่อโมเดลหน้าพร้อมเมื่อไร ผม standby ไม่ต้อง standby เสร็จตรงนี้ ออกตรงนี้ เริ่ม Muse Glimmer ผมว่าโหลด weight ไว้แล้วก่อนหน้า ถ้าดูคลิป Deep Flash 2 โหลด Muse Glimmer ไว้สองสามเวอร์ชัน เลือกตัวดีสุดไปเลย นี่คือ profile ใช้ Glimmer 30B ให้ prompt เดียวกับตอนต้น บอกให้อ่าน markdown ให้จบทำตามเป๊ะ มาดูว่าเวิร์กไหม ตัวนี้ context window 131,000 โมเดลใหญ่กว่าสองตัวก่อน ไม่เร็วเท่า Neotron Lightning มั้ง ถาม Grock ตัว Ornith บนดิสก์แค่ 21 GB ส่วน Neotron 20 ตัวนี้ใหญ่สุดเพราะทำ BF-16 Muse Glimmer เลยช้ากว่า น่าสนใจ ตัวนี้มี DFlash หรือ DFlash 2 จากคลิปก่อน น่าจะเร็วพอควร ใช่ Quen จะใช้ BF16 ด้วยให้เท่าเทียม ตอนนี้มี Muse รัน 6 ชั่วโมง เช็กบ้างเป็นครั้งคราว ไม่งั้นรอผล 6 ชั่วโมง Muse เริ่มทำ ทดลองสองสามอัน แต่ปัญหาใหญ่คือ autonomous loop ลำบาก ทดลองเสร็จอันหนึ่ง valid โดน discard บอก next experiment will be launched now แต่ไม่ทำอะไร นั่ง idle ต้องให้ Grock คอยดัน คอย prompt เห็นไหม นี่ Grock เขียน do not stop at the prompt clock active Launch the next hypothesis now No questions after each receipt Keep or reset Then immediately launch the next until expired This is autonomous I will not type another start command แล้วมันทำ แล้ว idle อีก ปัญหา instruction following ของ Muse Glimmer ไม่ยอม act autonomously ตัวอื่นไม่มีปัญหานี้เลย ให้ Grock ดันต่อเพราะอยากได้ผล แต่เสียเวลา idle นั่งเฉยๆ เยอะ น่าจำไว้ มาแล้ว Grock ส่งอันต่อไป ดูว่าทำต่อไหม เห็น reasoning ต้อง loop ต่อไม่รอ user user สั่ง do not stop at prompt ต้องปล่อยทดลองต่อเนื่อง รอดูว่าทำจริงไหม นั่นคือปัญหากับ Glimmer เดี๋ยวดูว่าเข้าใจไหม มันหาทางหยุด idle ได้ เห็นไหมรันทดลองรัวๆ ใช้ pulling method ต่างจากสองตัวก่อน ปกติหยุดตรงนี้ รายงาน แล้วเปิดเอง ตัวนี้ Muse รันรัวเลย อย่างน้อยไม่ต้อง prompt แล้ว ดี Glimmer เสร็จ หา improvement จาก baseline ได้ ยังมีปัญหา instruction following แต่ผ่านมาได้ นี่คือผลหลังสามตัว สีฟ้าคือ Muse เห็นไหมนานมาก keep ทุกอย่าง ไม่เจออะไร สุดท้ายเจอ keep สองอันล่าง แต่ตอนนี้บ๊วยอยู่ จบ session ทั้งที่ 6 ชั่วโมงยังไม่หมด อย่างที่บอกหยุดบ่อย เลยทดลองน้อย keep สองอันมาจากอันนี้ unmbed LR ขยับเป็น 0.005 ปล่อยให้ layer สุดท้ายพูดดังขึ้นนิด layer สุดท้ายคือส่วนที่เปลี่ยนขีดเขียนในเป็น guess token ถัดไป เดิม step เล็กมาก Muse เพิ่มนิดราว 25 เปอร์เซ็นต์ ยังเล็ก เรียนบทเดิมเร็วขึ้นนิด จับคำที่ควร output ได้ตรงขึ้น แค่นั้นก็ชนะ baseline แช่แข็ง keep สองผู้ชนะสูงสุดคือ weight decay เหมือนที่พูด แต่หยุดดึง weight กลับแรง ลด weight decay ไม่ให้หดตัวเลขเข้าศูนย์มาก ไม่มีอันไหนขยายโมเดลหรือฝึกนาน window ซ้อมเดียวกัน แค่พูดเร็วขึ้นนิดตอนท้ายกับลบสิ่งที่ซ้อมมาน้อยลงด้วย weight decay นั่นคือสองผล keep สุดท้ายคือ Quen ใช้ตัวนี้ ของ Mia Mia Lab หรือ Mia AI lab บน Twitter ทิ้งลิงก์ใน description เธอทำ optimized เก่งสูตรโมเดล ไม่มีอะไรหวือหวา แต่ใช้ DFlash 2 ได้ อย่างที่พูด เป็น checkpoint NVFP4 กับ dense BF16 LM head ใช้ context เต็ม 262K น่าจะรันดี เอาตัวนี้ เวอร์ชัน optimized recipe รุ่นนี้เยอะมาก เอาตัวที่รู้ว่าดี checkpoint ผมใช้เอง รู้ว่า performance สูง รันมาแล้ว ครึ่งทางราว 3 ชั่วโมง โมเดล Quen คิดเยอะมาก เคยมีคนพูด สงสัยควรปิด thinking ไหม แต่นี่คืองานคิดเป็นหลัก เลยเปิดไว้ ผ่านมา 10 ทดลอง หาได้ดีทีเดียว สรุปตอนนี้ หาได้ดีมาก batch เหมือน Neotron เจอ ลด val BPB เหลือ 1.16 tweak เล็กๆ แบบ Neotron ยังไม่เจอ แต่เหลือครึ่งรอบ ตอนต้นมีปัญหากับ environment หาวิธีรันทดลอง คิดเยอะ เห็นไหม secondguess ตัวเอง แต่เวิร์ก เห็นไหม let me reconsider the big picture keep ดีขึ้นเยอะ insight สำคัญคือ bat device batch size graticom จากสองเหลือหนึ่ง เห็นไหมพยายามให้เหตุผล batch size เปลี่ยนแล้วดีขึ้น แล้วควรทำไงต่อ คิดมากไปหน่อย แต่ถึงอยู่ ผมไปนอนอีก รันมาทั้งวัน ดูไม่ออก นี่จะเข้าวันสามพรุ่งนี้ หวังว่าตื่นมาเสร็จหมด จบทดลองได้ อรุณสวัสดิ์ทุกคน รันข้ามคืนสำเร็จ ครบ 6 ชั่วโมง ได้ 21 ทดลอง มาดูผล ใส่ชาร์ต ได้ผลสุดท้าย local AI auto research challenge เรียบร้อย ผู้เข้าแข่งสี่ตัว เห็นว่าวิ่งนานแค่ไหน สีม่วงคือ Quen 3.8 มาดูผลสุดท้าย จำได้ Nemo ได้ 1.143 ส่วน Quen ได้ 1.142 เฉือน Neotron นิดเดียว เศษเสี้ยวจริงๆ ทำแบบน่าสนใจ batch เหมือนที่ Neotron กระโดดใหญ่จากตรงนี้ลงตรงนี้ ย้าย batch 32 ไป 64 เลยลงมาตรงนี้ improvement ใหญ่อีกอันคือเพิ่ม warm-up 5 เปอร์เซ็นต์ แต่ละรัน 5 นาที 15 วินาทีแรก 5 เปอร์เซ็นต์ ค่อยๆ เข้ารัน ไม่ใส่ step เต็มตั้งแต่ต้น warm-up เล็กๆ ช่วย stabilize ได้ improvement ดีจาก baseline นั่นคือผล ผมคาด Quen 3.8 ชนะจริง ชนะ แต่ Neotron เกินคาดน่าสนใจ ทำมากสุด ทดลองเยอะสุด สมชื่อ lightning วิ่งเร็วผ่านทดลอง น่าจะ 60 หรือ 42 อัน น้อยสุดคือ Quen มีแค่ 21 ทดลอง Neotron มี 43 เกือบหรือมากกว่าสองเท่า เพราะเปิด thinking ให้ Quen เลยคิดนาน แต่คิดแล้วคุ้ม หา hypothesis เวิร์กได้ ทดลองน้อยสุดแต่ชนะ คะแนนดีสุด takeaway อื่น Ornith กลางๆ เร็ว decent streaming เร็วมาก แต่ไม่ฉลาดเท่าตัวอื่น แต่ decent อยากเล่นอีก Muse น่าผิดหวัง Muse Glimmer อาจเพราะเวอร์ชันที่ใช้ มีปัญหา instruction following จริง หยุดทดลองตลอด เลยทดลองน้อย แถมทดลองได้เยอะกว่า Quen ยังคิด hypothesis ดีๆ ไม่ได้ เทสต์น่าสนใจถ้าอยากทำ machine learning training กับโมเดล local แนะนำ Quen Quen 3.8 27B หรือ Neotron Lightning ถ้าอยากได้เร็ว รันได้เยอะ จบทดลอง หวังว่าน่าสนใจ เทสต์โมเดลแบบต่าง แต่บางคนใช้ได้ถ้าใช้โมเดล local ฝึกโมเดล local ตัวอื่น ผู้ชนะ Quen 3.8 27B คอมเมนต์บอกหน่อยว่าคิดไงกับการทดลองนี้ จบคลิปนี้ ขอบคุณที่รับชมครับ

04

อภิธานศัพท์เทคนิค

คำศัพท์และชื่อผลิตภัณฑ์ที่คงรูปภาษาอังกฤษ

ศัพท์คำแปล / คำอธิบาย
Auto Research (auto research)Auto Research
Carpathy / Carpathy-autoKarpathy
GitHub repoGitHub repo
autonomous research controllercontroller
autonomous research looploop
fixed contractfixed contract
train.py (one editable file)train.py
objectiveobjective
practical testpractical test
validation BPB / val BPPvalidation BPB
bits per bitebits per bite
next token (surprise)next token
perplexityperplexity
mini modelmini model
fine-tuning adapteradapter
tinkeringtinkering
hypothesis / knobhypothesis / knob
guard (train under)guard
evaluate / keep / discard / resetkeep / discard
baseline (1.19)baseline
warm up / warm down ratiowarm up
LR schedule / LR divergenceLR schedule
crash (invalid)crash
depth (layers 6→8)depth
schema boundsschema bounds
model size / atom betaatom beta
value embeddingvalue embedding
matrix LRmatrix LR
weight decayweight decay
unembed LR (0.005, +25%)unembed LR
muon optimizermuon
weight matrixweight matrix
batch size (32→64)batch size
chunk (024 tokens)chunk
bite / gulp (pack)bite / gulp
overheadoverhead
lesson per update (65K)lesson
step / updatestep
practice window (5 min)practice window
warm-up 5% (15s)warm-up
stabilizestabilize
dot plot / leaderboardleaderboard
thumbnailthumbnail
hard readiness gatereadiness gate
campaign promptcampaign prompt
controller prompt (markdown)controller prompt
orchestrator (Hermes profile)orchestrator
GBT-5.6 Soul / SoulSoul
GrockGrock
Ornith 1.5 35B A3BOrnith
Neotron 3.5 Lightning 30BNeotron
Muse Glimmer (Glimmer 30B)Muse Glimmer
Quen 3.8 27BQuen 3.8
Meta / Nvidia / Xiaomi ไม่มีMeta / Nvidia
BF-16 / BF16 / NVFP4BF-16
dense BF16 LM headLM head
context (131K / 262K)context
DFlash / DFlash 2DFlash 2
DeepSeek FlashDeepSeek Flash
Mia Mia Lab (Twitter)Mia Lab
checkpoint / recipecheckpoint
thinking on/offthinking
secondguess / reconsidersecondguess
idle (not looping)idle
pulling methodpulling method
do not stop at the promptdo not stop
instruction followinginstruction following
compaction (recover)compaction
streaming (fast)streaming
sparse activationsparse activation
agent workhorseworkhorse
coding specialistspecialist
recovery / multimodal / broadmultimodal
incumbent controlcontrol
claw model / GBT modelclaw model
cloud vs local modellocal model
front-end / game devfront-end
terminal windowterminal
machine learning trainingtraining
6-hour window / overnightovernight
day three (3 days)day three
21 GB / 20 (disk)21 GB
1.16 / 1.143 / 1.1421.142
Climix 400B shuffleClimix
Chinese storiesChinese stories
H100H100
Agent Wikis / Pro $9.99Agent Wikis
HyperframesHyperframes
05

ซับไตเติ้ลภาษาไทย

ดาวน์โหลดหรือดูซับทั้งหมด

1
00:00:00,000 --> 00:00:04,331
ช่องนี้ผมชอบเทสต์โมเดลเทียบกัน

2
00:00:04,331 --> 00:00:10,394
ดูว่าแต่ละตัวต่างกันยังไง บางทีโมเดล cloud

3
00:00:10,394 --> 00:00:13,859
มาตรฐาน บางทีโมเดล local

4
00:00:13,859 --> 00:00:17,179
แต่เทสต์พวกนั้นมักมีภาพ
thai-subtitles.srt
SubRip — ใช้กับเครื่องเล่นวิดีโอส่วนใหญ่
↓ ดาวน์โหลด
thai-subtitles.vtt
WebVTT — ใช้กับเว็บ / YouTube
↓ ดาวน์โหลด
เปิดดูซับไตเติ้ลทั้งหมด (335 segments)
1
00:00:00,000 --> 00:00:04,331
ช่องนี้ผมชอบเทสต์โมเดลเทียบกัน

2
00:00:04,331 --> 00:00:10,394
ดูว่าแต่ละตัวต่างกันยังไง บางทีโมเดล cloud

3
00:00:10,394 --> 00:00:13,859
มาตรฐาน บางทีโมเดล local

4
00:00:13,859 --> 00:00:17,179
แต่เทสต์พวกนั้นมักมีภาพ

5
00:00:17,179 --> 00:00:23,387
ออกแบบหน้าเว็บหรือสร้างเกมอะไรที่มองเห็นได้

6
00:00:23,387 --> 00:00:26,996
หนึ่งเพราะผมวิเคราะห์ง่าย

7
00:00:26,996 --> 00:00:30,749
เห็นเว็บก็รู้เลยว่าดีไม่ดี

8
00:00:30,749 --> 00:00:39,411
สองเพราะในวิดีโอมันน่าสนใจกว่าเห็นเกมเห็นเว็บแทนตัวหนังสือใน

9
00:00:39,411 --> 00:00:45,907
terminal แต่อยากเทสต์โมเดล local บน DGX Spark

10
00:00:45,907 --> 00:00:52,259
แบบไม่มีภาพ กับ Auto Research แบบต้นตำรับของ

11
00:00:52,259 --> 00:00:58,900
Karpathy จาก repo ทางการของเขา น่าสนใจว่าโมเดล

12
00:00:58,900 --> 00:01:05,108
local จะทำได้แค่ไหน แถมสร้างมินิโมเดลอีกตัว

13
00:01:05,108 --> 00:01:11,171
ก่อนหน้านี้ตอนทำ auto research มักใช้โมเดล

14
00:01:11,171 --> 00:01:16,512
claw ตัวล่าสุดหรือโมเดล GBT ตัวล่าสุด

15
00:01:16,512 --> 00:01:22,720
เลยอยากรู้ว่าโมเดล local รับมือแบบนี้ไหวไหม

16
00:01:22,720 --> 00:01:29,072
เพราะรู้ว่าคนในชุมชน local AI ใช้โมเดล local

17
00:01:29,072 --> 00:01:34,847
tinkering ฝึกโมเดลตัวเองหรือ fine-tuning

18
00:01:34,847 --> 00:01:39,611
adapter กันเยอะ นั่นคือคลิปวันนี้

19
00:01:39,611 --> 00:01:45,963
เอาสี่โมเดลมาให้โจทย์ auto research เดียวกัน

20
00:01:45,963 --> 00:01:50,149
ดูว่าตัวไหนเก่งสุด มาเริ่มกัน

21
00:01:50,149 --> 00:01:56,501
ถ้าอยากยกระดับเอเจนต์ของตัวเอง ลองดูโปรเจกต์

22
00:01:56,501 --> 00:02:02,564
Agent Wikis ของผม ที่นั่นมี knowledge base

23
00:02:02,564 --> 00:02:09,349
ที่ผมใช้ทุกวันทั้งค้นคว้าทำคลิปและสร้างโปรเจกต์

24
00:02:09,349 --> 00:02:14,691
หัวข้อมี Hermes Agent กับ Hyperframes

25
00:02:14,691 --> 00:02:20,321
กับเครื่องมือ local AI และอีกเพียบ wiki

26
00:02:20,321 --> 00:02:26,817
มาตรฐานเปิดให้ใช้ฟรีทั้งหมด แต่ถ้าสมัคร Agent

27
00:02:26,817 --> 00:02:33,314
Wikis Pro จะได้ Excel wiki ด้วย รวมถึง custom

28
00:02:33,314 --> 00:02:39,810
skill ที่ผมพัฒนาร่วมกับเอเจนต์มาตลอดหลายเดือน

29
00:02:39,810 --> 00:02:44,430
Pro เดือนละ 9.99 ดอลลาร์เท่านั้น

30
00:02:44,430 --> 00:02:49,049
สมัครตอนนี้ล็อกเรทราคานี้ตลอดชีพ

31
00:02:49,049 --> 00:02:58,721
ตอนนี้ผมกำลังทำโปรไฟล์เอเจนต์เฉพาะทางกับเทมเพลตเวิร์กโฟลว์อัตโนมัติ

32
00:02:58,721 --> 00:03:03,052
พอของพวกนี้ออก ราคา Pro จะขึ้น

33
00:03:03,052 --> 00:03:08,827
เลยแนะนำให้สมัครวันนี้ที่ agentwikis.com

34
00:03:08,827 --> 00:03:12,580
ขอบคุณทุกคนที่สนับสนุนครับ

35
00:03:12,580 --> 00:03:18,066
กลับเข้าวิดีโอกันต่อ เล่าแผนทดลองเร็วๆ

36
00:03:18,066 --> 00:03:21,387
แล้วเข้าเลย คำถามคือ AI

37
00:03:21,387 --> 00:03:27,305
ปรับปรุงสูตรฝึกตัวเองได้ไหม มีโมเดล local

38
00:03:27,305 --> 00:03:32,647
สี่ตัวแข่งกันเป็น autonomous research

39
00:03:32,647 --> 00:03:39,143
controller รันเองอัตโนมัติหลังผม setup กับให้

40
00:03:39,143 --> 00:03:45,062
prompt ผมไม่เติมอะไรอีก ถ้าไม่รู้จัก Auto

41
00:03:45,062 --> 00:03:51,703
Research นี่คือ GitHub repo ทางการของ Karpathy

42
00:03:51,703 --> 00:03:58,343
ที่ Carpathy/auto เขาปล่อยน่าจะมีนาคม ฮือฮามาก

43
00:03:58,343 --> 00:04:04,407
คอนเซปต์คือมีโมเดลรันเองอัตโนมัติ เลยเรียก

44
00:04:04,407 --> 00:04:06,283
auto research

45
00:04:06,283 --> 00:04:11,192
ทำรีเสิร์ชกับมินิโมเดลที่พยายามฝึก

46
00:04:11,192 --> 00:04:14,079
ปรับพารามิเตอร์ต่างๆ

47
00:04:14,079 --> 00:04:25,339
เห็นแต่ละอันคือพารามิเตอร์ที่เปลี่ยน ไอเดียคืออยากให้มันมั่นใจคำตอบขึ้นเรื่อยๆ

48
00:04:25,339 --> 00:04:31,691
metric ที่ใช้คือ validation BPB หรือ val BPP

49
00:04:31,691 --> 00:04:37,755
ยิ่งต่ำยิ่งดี เพราะต่ำแปลว่าโมเดลแปลกใจกับ

50
00:04:37,755 --> 00:04:42,230
token ถัดไปน้อยลง จำได้ตอนออกมา

51
00:04:42,230 --> 00:04:47,138
ช่องผมยังเล็กมาก มีคนตามสองสามร้อย

52
00:04:47,138 --> 00:04:52,624
ผมทำคลิปอธิบาย ดูได้ ผมว่าเป็นคลิปแรกๆ

53
00:04:52,624 --> 00:04:59,986
ที่ภูมิใจ เพราะอธิบายว่า auto research คืออะไรจริงๆ

54
00:04:59,986 --> 00:05:06,627
คนอื่นแค่บอก auto research สุดยอด ไม่ได้อธิบาย

55
00:05:06,627 --> 00:05:12,402
คลิปนั้นดีมาก จุดกระแสช่องผม คืนเดียวได้

56
00:05:12,402 --> 00:05:18,609
subscriber มาพันคน สุดยอดเลย ผมเลยผูกพันกับ

57
00:05:18,609 --> 00:05:23,085
auto research กับ Karpathy เสมอ

58
00:05:23,085 --> 00:05:29,581
คำถามรอบนี้คือโมเดลไหนรัน autonomous research

59
00:05:29,581 --> 00:05:35,355
loop แข็งสุดบน DGX Spark เครื่องเดียว มี

60
00:05:35,355 --> 00:05:41,130
contract ตายตัว มาจาก repo Karpathy ตรงๆ

61
00:05:41,130 --> 00:05:47,338
แก้ได้ไฟล์เดียว train.py ไฟล์เดียวที่แก้ได้

62
00:05:47,338 --> 00:05:53,978
เป้าหมายอย่างที่บอกลด validation bits per bite

63
00:05:53,978 --> 00:05:59,753
แล้วมี practical test หนึ่งอัน พวกนี้คือ

64
00:05:59,753 --> 00:06:05,383
controller สี่ตัว เห็นใน thumbnail แล้ว

65
00:06:05,383 --> 00:06:11,591
แน่ใจมีคอมเมนต์ถามทำไมไม่เอารุ่นนั้นรุ่นนี้

66
00:06:11,591 --> 00:06:18,087
ผมรู้สึกจากรีเสิร์ชว่าสี่ตัวนี้ดีสุด ที่ยัดลง

67
00:06:18,087 --> 00:06:24,728
Spark แล้วทดลองได้ อย่าง DeepSeek Flash อยากทำ

68
00:06:24,728 --> 00:06:30,791
แต่กินที่เยอะไป ไหนจะฝึกโมเดลต้องมี memory

69
00:06:30,791 --> 00:06:37,432
เหลือ ยัดไม่ลง เอาสี่ตัวนี้ Ornith 1.5 35B A3B

70
00:06:37,432 --> 00:06:43,062
สายโค้ดกับ autonomous research โดยเฉพาะ

71
00:06:43,062 --> 00:06:47,826
ไม่เคยใช้มาก่อน มาจากห้องแล็บเล็ก

72
00:06:47,826 --> 00:06:54,322
แต่คนบอกดีมาก เดี๋ยวรู้กัน ต่อไป Muse Glimmer

73
00:06:54,322 --> 00:07:00,963
เล่นนิดหน่อยในคลิป DFlash สัปดาห์ก่อน ของ Meta

74
00:07:00,963 --> 00:07:06,737
รุ่น open weights ใหม่ๆ เป็น broad agent

75
00:07:06,737 --> 00:07:11,213
จุดแข็ง recovery กับ multimodal

76
00:07:11,213 --> 00:07:17,565
งานนี้ไม่ต้องใช้ multimodal แต่เขาว่าเก่งมาก

77
00:07:17,565 --> 00:07:23,628
Neatron 3.5 Lightning ของ Nvidia รุ่น open

78
00:07:23,628 --> 00:07:29,402
ใหม่ๆ เป็น efficient agent workhorse แบบ

79
00:07:29,402 --> 00:07:34,455
sparse activation แล้ว Quen 3.8 27B

80
00:07:34,455 --> 00:07:41,096
เคยทดลองมาก่อน เป็นแชมป์เก่าที่ validate local

81
00:07:41,096 --> 00:07:43,694
แล้ว รู้ว่าเก่งมาก

82
00:07:43,694 --> 00:07:49,613
อยากรู้ว่าเจอตัวอื่นจะเป็นไง เอาสี่ตัวนี้

83
00:07:49,613 --> 00:07:55,099
หลายตัวยังไม่ค่อยได้ลอง ไซส์ใกล้กันหมด

84
00:07:55,099 --> 00:08:01,740
ไม่มีตัวเล็ก โมเดล decent ทั้งหมด น่าจะทำ auto

85
00:08:01,740 --> 00:08:08,380
research ไหว ข้อมูลใช้ Climix 400B shuffle ของ

86
00:08:08,380 --> 00:08:13,289
Karpathy หนึ่งใน dataset ที่เขาใช้

87
00:08:13,289 --> 00:08:18,774
ไม่ใช้ทั้งหมด เอาแค่พอทำได้ เขาทำ auto

88
00:08:18,774 --> 00:08:24,693
research บนของจริง H100 เราทำบน DGX Spark

89
00:08:24,693 --> 00:08:30,612
เครื่องเดียว ตัวอย่างเล็กกว่า แต่ dataset

90
00:08:30,612 --> 00:08:36,242
เดียวกัน เป็นภาษาผสมหลายแหล่ง คลิป auto

91
00:08:36,242 --> 00:08:41,006
research แรกผมใช้ Chinese stories

92
00:08:41,006 --> 00:08:46,925
นิทานเด็กสั้นๆ อันนี้ตัวแทนภาษาทั่วไปกว่า

93
00:08:46,925 --> 00:08:53,277
metric คือ val BPB อย่างที่บอก ยิ่งต่ำยิ่งดี

94
00:08:53,277 --> 00:08:58,474
นี่คือทดลองต้นจนจบ โมเดลตั้งสมมติฐาน

95
00:08:58,474 --> 00:09:04,971
อย่างปรับพารามิเตอร์เล็กๆ แก้สคริปต์ train.py

96
00:09:04,971 --> 00:09:11,323
ฝึกภายใต้ guard แล้ว evaluate เสร็จ ตัดสินใจ

97
00:09:11,323 --> 00:09:16,520
keep หรือ discard แล้ววน loop กลับไป

98
00:09:16,520 --> 00:09:18,829
ถ้าปุ่มไหนเวิร์ก

99
00:09:18,829 --> 00:09:25,326
น่าจะดันปุ่มนั้นต่อจนหยุดเวิร์ก นั่นคือไอเดีย

100
00:09:25,326 --> 00:09:31,822
นั่นคือ auto research นั่นคือ loop ลำดับจะลอง

101
00:09:31,822 --> 00:09:38,319
Ornith ก่อนเพราะม้านอกสุด แล้วขึ้นไป Neotron,

102
00:09:38,319 --> 00:09:42,649
Glimmer แล้ว Quen 3.8 Quen 3.8

103
00:09:42,649 --> 00:09:48,713
ตัวเดียวที่เทสต์จริงจัง รู้ว่าแกร่ง อีกสอง

104
00:09:48,713 --> 00:09:54,920
Muse กับ Neimatron น่าจะดี บริษัทข้างหลังดี

105
00:09:54,920 --> 00:10:01,417
แต่ไม่แน่ใจ ลำดับนี้ Ornith, Neatron, Glimmer

106
00:10:01,417 --> 00:10:06,181
แล้ว Quen เริ่ม setup environment

107
00:10:06,181 --> 00:10:12,099
เริ่มด้วยโมเดล Ornith นี่คือ orchestrator

108
00:10:12,099 --> 00:10:18,307
ที่รันทดลองกับผม profile default ของ Hermes

109
00:10:18,307 --> 00:10:24,659
agent ผม รันบน GBT-5.6 Soul ช่วย setup โมเดล

110
00:10:24,659 --> 00:10:29,712
local สร้าง profile แล้ว เห็นตรงนี้

111
00:10:29,712 --> 00:10:36,064
ใช้เวลาจัดให้สะอาดเรียบร้อย เริ่มด้วย Ornith

112
00:10:36,064 --> 00:10:41,983
ออกแบบมาให้ paste prompt เดียว บอกให้อ่าน

113
00:10:41,983 --> 00:10:46,891
markdown ไฟล์นี้ให้จบแล้วทำตามเป๊ะ

114
00:10:46,891 --> 00:10:52,810
เริ่มจากเช็ก hard readiness gate ถ้า gate

115
00:10:52,810 --> 00:10:59,451
ไม่พร้อมห้ามฝึก ไฟล์นี้คือ prompt Ornith photo

116
00:10:59,451 --> 00:11:05,369
research controller prompt บอกว่าเกิดอะไร

117
00:11:05,369 --> 00:11:11,577
ขอบเขต hardness readiness gate contract กับ

118
00:11:11,577 --> 00:11:17,929
research loop markdown ไฟล์นี้มี instruction

119
00:11:17,929 --> 00:11:23,992
ทั้งหมด ไม่ยาวมากเพราะตรงไปตรงมา paste เลย

120
00:11:23,992 --> 00:11:30,344
ดูว่าโมเดลรันไหมก่อน ทักทาย มาแล้ว I'm ready

121
00:11:30,344 --> 00:11:36,552
to help ทำงานอะไรดี paste ลงไปปล่อยรัน อ่าน

122
00:11:36,552 --> 00:11:43,193
campaign prompt ถูก จะตรวจ hard readiness gate

123
00:11:43,193 --> 00:11:48,534
ก่อนเริ่ม เห็น reasoning ที่ setup มา

124
00:11:48,534 --> 00:11:54,742
เห็นวิธีคิด ไม่ใช่แค่ prompt เห็นไหมรันแล้ว

125
00:11:54,742 --> 00:12:01,238
ทดลองหนึ่งเสร็จ เปลี่ยน warm up baseline 1.19

126
00:12:01,238 --> 00:12:07,012
ไม่แย่ แต่ทดลองหนึ่งได้ 1.2 แย่กว่า ทิ้ง

127
00:12:07,012 --> 00:12:13,220
ไปทดลองสอง น่าสนใจดู reasoning เห็นทฤษฎีมัน

128
00:12:13,220 --> 00:12:19,861
ลองคิดว่าปุ่ม leverage สูงคืออะไร ขนาดโมเดล LR

129
00:12:19,861 --> 00:12:24,769
schedule atom beta value embedding

130
00:12:24,769 --> 00:12:30,544
ไอเดียทดลองสอง เปลี่ยน depth จำนวน layer

131
00:12:30,544 --> 00:12:35,452
ในโมเดล โมเดล Ornith นี่คิดเยอะมาก

132
00:12:35,452 --> 00:12:41,660
สมมติฐานทดลองสอง เพิ่ม capacity โมเดล depth

133
00:12:41,660 --> 00:12:47,723
จากหกไปแปดในขอบ schema พารามิเตอร์ต่อ step

134
00:12:47,723 --> 00:12:53,064
เพิ่ม ควรลด perplexity แม้ step count

135
00:12:53,064 --> 00:12:59,705
ลดในงบตายตัว ทดลองสอง แย่กว่าอีก กลับ baseline

136
00:12:59,705 --> 00:13:04,758
สมมติฐานทดลองสาม LR schedule ใช้ 50

137
00:13:04,758 --> 00:13:10,965
เปอร์เซ็นต์ของงบกับ warm down ratio ลด warm

138
00:13:10,965 --> 00:13:16,884
down ratio เหลือ 0.1 ให้ LR อยู่ใกล้ peak

139
00:13:16,884 --> 00:13:22,803
นานกว่า ปล่อยทดลองสาม invalid เพราะ crash

140
00:13:22,803 --> 00:13:28,722
น่าจะ LR divergence เช็กสาเหตุ crash แล้ว

141
00:13:28,722 --> 00:13:34,641
reset ผมไม่ตามเรียลไทม์ทุกอัน มี window 6

142
00:13:34,641 --> 00:13:40,704
ชั่วโมง เดี๋ยวกลับมาสรุปว่าทำอะไร ผลเป็นไง

143
00:13:40,704 --> 00:13:46,912
Ornith เสร็จ session รวม 6 ชั่วโมง ได้ keep

144
00:13:46,912 --> 00:13:52,831
สองอัน ก้าวหน้าจาก baseline เยอะ baseline

145
00:13:52,831 --> 00:13:58,605
ดีอยู่แล้ว keep ได้สองทดลอง orchestrator

146
00:13:58,605 --> 00:14:05,101
ผมเปลี่ยนเป็น Grock รู้สึกเป็น manager ดีกว่า

147
00:14:05,101 --> 00:14:11,309
อธิบายอยู่ trainer มีปุ่มใหญ่สองปุ่มบน Muan

148
00:14:11,309 --> 00:14:16,073
optimizer หลัก ปรับ weight matrix

149
00:14:16,073 --> 00:14:22,136
หลักแรงแค่ไหนเรียก matrix LR กับบีบ weight

150
00:14:22,136 --> 00:14:28,633
พวกนั้นเรียก weight decay สูตรตั้งต้นค่อนข้าง

151
00:14:28,633 --> 00:14:34,696
aggressive keep ทั้งสองคือแตะ weight เบาลง

152
00:14:34,696 --> 00:14:40,326
step เล็กลงกับ shrink เบามาก analogy นะ

153
00:14:40,326 --> 00:14:46,389
นึกว่าซ้อมห้านาที หลัง batch test แต่ละรอบ

154
00:14:46,389 --> 00:14:53,030
optimizer ขยับปุ่มในโมเดลให้ทำนายรอบหน้าดีขึ้น

155
00:14:53,030 --> 00:14:59,093
ปุ่มส่วนใหญ่ที่ผสมข้อมูลจริงเรียก muon สอง

156
00:14:59,093 --> 00:15:02,847
setting คุม Muan ขนาด step

157
00:15:02,847 --> 00:15:08,621
กระโดดไกลแค่ไหนหลังพลาด กับ weight decay

158
00:15:08,621 --> 00:15:14,973
เหมือนแรงดึงอย่าสุดโต่ง ดึงปุ่มกลับศูนย์ตลอด

159
00:15:14,973 --> 00:15:17,716
ไม่ให้สุดโต่ง tweak

160
00:15:17,716 --> 00:15:23,924
ที่ดีขึ้นคือให้โมเดลเก็บสิ่งที่เรียนมา keep

161
00:15:23,924 --> 00:15:29,843
มากกว่า แค่นั้นก็ชนะ baseline แล้วไปต่อทำ

162
00:15:29,843 --> 00:15:34,607
half-size step กระโดดพวกนี้ใช่ไหม

163
00:15:34,607 --> 00:15:40,237
กระโดดไกลแค่ไหนหลังพลาด หดกระโดดพวกนั้น

164
00:15:40,237 --> 00:15:46,011
นั่นคือ impact ที่ได้ นี่คือโมเดล Ornith

165
00:15:46,011 --> 00:15:52,075
จบรอบมัน เห็นไหมมีแค่ 33 ทดลองใน 6 ชั่วโมง

166
00:15:52,075 --> 00:15:58,138
คิดนานมาก handle compaction ไม่ดี ฟื้นหลัง

167
00:15:58,138 --> 00:16:03,768
compaction ลำบาก ใช้เวลาทบทวนว่าอยู่ไหน

168
00:16:03,768 --> 00:16:10,264
รีวิวทุกอย่าง กลับมาเร็วๆ นาน แต่ execute ได้

169
00:16:10,264 --> 00:16:14,740
หา keep ได้สองอัน ไม่แย่ ตัวแรก

170
00:16:14,740 --> 00:16:21,092
ยังไม่รู้เทียบคนอื่นไง มาดูกัน ต่อไป Neotron

171
00:16:21,092 --> 00:16:27,299
Lightning ของ Nvidia บอกลา Ornith เตรียมรอบ

172
00:16:27,299 --> 00:16:33,940
Neotron โหลดก่อน นี่ Neotron 3.5 Lightning 30B

173
00:16:33,940 --> 00:16:40,581
A3B setup profile แล้ว แค่โหลดโมเดลจริงแล้วรัน

174
00:16:40,581 --> 00:16:44,190
environment ควรเหมือนเดิม

175
00:16:44,190 --> 00:16:49,964
แยกแต่เหมือนกันทุกโมเดล อันนี้รันข้ามคืน

176
00:16:49,964 --> 00:16:56,605
นอนแล้วดูผลเช้า ให้ Grock ทำทุกอย่าง โหลดโมเดล

177
00:16:56,605 --> 00:17:02,524
monitor สถานการณ์ เปิด Hermes profile ให้

178
00:17:02,524 --> 00:17:06,277
prompt เริ่ม auto research

179
00:17:06,277 --> 00:17:12,052
นี่คือโบนัสเทสต์โมเดลด้วย เทสต์ว่า Grock

180
00:17:12,052 --> 00:17:18,692
รับมือไหวไหม ทำดี เทียบเท่าที่เจอกับ Soul Soul

181
00:17:18,692 --> 00:17:25,189
ช้าไปเลยเปลี่ยนเป็น Grock ดีอยู่ รอดู ผมไปนอน

182
00:17:25,189 --> 00:17:30,241
ดูผลเช้า อรุณสวัสดิ์ทุกคน ประหลาดใจ

183
00:17:30,241 --> 00:17:36,449
มันเวิร์กจริง Grock โหลด weight Neotron 3.5

184
00:17:36,449 --> 00:17:42,945
Lightning หมด setup environment เปิด campaign

185
00:17:42,945 --> 00:17:49,586
จริง เสร็จหมด steer ได้จนจบ ทดลอง valid 43 อัน

186
00:17:49,586 --> 00:17:54,350
มากกว่า Ornith ดูเร็วกว่าวิธีขยับ

187
00:17:54,350 --> 00:18:00,991
แต่ผมนอนดูไม่ค่อยได้ มาดูผลสุดท้าย ทำ dot plot

188
00:18:00,991 --> 00:18:07,631
ให้ดูผลจริง เส้นเขียวคือ Neotron ส้มคือ Ornith

189
00:18:07,631 --> 00:18:11,241
อีกสองตัวอัปเดตเมื่อได้ผล

190
00:18:11,241 --> 00:18:17,881
เห็นไหมนี่คือเลขทดลองกับ valbd อยากให้ลงใช่ไหม

191
00:18:17,881 --> 00:18:23,944
ตอนแรกขยับคล้ายกัน ลด weight decay ได้ผลดี

192
00:18:23,944 --> 00:18:30,441
พวกนี้คือ keep แล้ว discard เยอะ ลด unmbed LR

193
00:18:30,441 --> 00:18:36,793
ได้ อีกตัว softening แบบ Muan แล้วนี่ matrix

194
00:18:36,793 --> 00:18:43,434
LR คล้ายๆ ลดลง ได้ heap อีกจากการลด wave decay

195
00:18:43,434 --> 00:18:50,074
ลงอีก แล้วตัวใหญ่มาทีหลัง เห็น Neotron ดิ่งแรง

196
00:18:50,074 --> 00:18:55,849
ดีขึ้นเยอะ ด้วยการเพิ่ม batch size Grock

197
00:18:55,849 --> 00:19:02,201
อธิบายว่าแต่ละ chunk คือ 024 token optimizer

198
00:19:02,201 --> 00:19:07,687
ยังอัปเดตบน 65,000 กว่า token ทุก step

199
00:19:07,687 --> 00:19:14,327
เหมือนเดิม ไม่เปลี่ยน ที่เปลี่ยนคือเดิม 32 GPU

200
00:19:14,327 --> 00:19:19,524
ทำเป็นสองคำ คำละ 32 chunk แล้วอัปเดต

201
00:19:19,524 --> 00:19:25,588
หลังเป็นคำเดียว 64 chunk แล้วอัปเดต lesson

202
00:19:25,588 --> 00:19:30,352
ต่ออัปเดตขนาดเดียวกัน ต่างที่แพ็ก

203
00:19:30,352 --> 00:19:36,559
ก่อนสองคำเล็ก หลังคำเดียวใหญ่ คำใหญ่คำเดียว

204
00:19:36,559 --> 00:19:42,767
overhead น้อยกว่าสองคำเล็ก ใน window ซ้อม 5

205
00:19:42,767 --> 00:19:48,686
นาทีตายตัว โมเดลเลยอัปเดตแม่นๆ ได้มากกว่า

206
00:19:48,686 --> 00:19:55,038
นั่นคือเหตุผลคะแนนดีขึ้น นั่นคือ leaderboard

207
00:19:55,038 --> 00:20:00,090
สองโมเดล Neotron Lightning ทำดีกว่า

208
00:20:00,090 --> 00:20:06,731
ได้ผลดีกว่า เข้าตัวเต็งสองตัว Muse Glimmer กับ

209
00:20:06,731 --> 00:20:12,939
Quen 3.8 บอกลา Neotron บอกมันว่านำอยู่ ทำดี

210
00:20:12,939 --> 00:20:16,548
ตอนนี้นำ เหลืออีกสองโมเดล

211
00:20:16,548 --> 00:20:22,755
มันเข้าใจผิดว่าตัวเอง keep อะไร นึกว่า keep

212
00:20:22,755 --> 00:20:28,530
คะแนนเดียว จริง keep สี่ มาสองโมเดลต่อไป

213
00:20:28,530 --> 00:20:34,882
นำอยู่ จะต่อโมเดลหน้าพร้อมเมื่อไร ผม standby

214
00:20:34,882 --> 00:20:41,089
ไม่ต้อง standby เสร็จตรงนี้ ออกตรงนี้ เริ่ม

215
00:20:41,089 --> 00:20:47,586
Muse Glimmer ผมว่าโหลด weight ไว้แล้วก่อนหน้า

216
00:20:47,586 --> 00:20:53,360
ถ้าดูคลิป Deep Flash 2 โหลด Muse Glimmer

217
00:20:53,360 --> 00:20:59,568
ไว้สองสามเวอร์ชัน เลือกตัวดีสุดไปเลย นี่คือ

218
00:20:59,568 --> 00:21:04,476
profile ใช้ Glimmer 30B ให้ prompt

219
00:21:04,476 --> 00:21:09,385
เดียวกับตอนต้น บอกให้อ่าน markdown

220
00:21:09,385 --> 00:21:16,025
ให้จบทำตามเป๊ะ มาดูว่าเวิร์กไหม ตัวนี้ context

221
00:21:16,025 --> 00:21:21,511
window 131,000 โมเดลใหญ่กว่าสองตัวก่อน

222
00:21:21,511 --> 00:21:27,863
ไม่เร็วเท่า Neotron Lightning มั้ง ถาม Grock

223
00:21:27,863 --> 00:21:34,071
ตัว Ornith บนดิสก์แค่ 21 GB ส่วน Neotron 20

224
00:21:34,071 --> 00:21:39,701
ตัวนี้ใหญ่สุดเพราะทำ BF-16 Muse Glimmer

225
00:21:39,701 --> 00:21:46,342
เลยช้ากว่า น่าสนใจ ตัวนี้มี DFlash หรือ DFlash

226
00:21:46,342 --> 00:21:52,549
2 จากคลิปก่อน น่าจะเร็วพอควร ใช่ Quen จะใช้

227
00:21:52,549 --> 00:21:58,468
BF16 ด้วยให้เท่าเทียม ตอนนี้มี Muse รัน 6

228
00:21:58,468 --> 00:22:04,676
ชั่วโมง เช็กบ้างเป็นครั้งคราว ไม่งั้นรอผล 6

229
00:22:04,676 --> 00:22:09,728
ชั่วโมง Muse เริ่มทำ ทดลองสองสามอัน

230
00:22:09,728 --> 00:22:15,070
แต่ปัญหาใหญ่คือ autonomous loop ลำบาก

231
00:22:15,070 --> 00:22:21,566
ทดลองเสร็จอันหนึ่ง valid โดน discard บอก next

232
00:22:21,566 --> 00:22:27,918
experiment will be launched now แต่ไม่ทำอะไร

233
00:22:27,918 --> 00:22:33,837
นั่ง idle ต้องให้ Grock คอยดัน คอย prompt

234
00:22:33,837 --> 00:22:39,900
เห็นไหม นี่ Grock เขียน do not stop at the

235
00:22:39,900 --> 00:22:46,541
prompt clock active Launch the next hypothesis

236
00:22:46,541 --> 00:22:52,749
now No questions after each receipt Keep or

237
00:22:52,749 --> 00:22:59,101
reset Then immediately launch the next until

238
00:22:59,101 --> 00:23:05,164
expired This is autonomous I will not type

239
00:23:05,164 --> 00:23:11,660
another start command แล้วมันทำ แล้ว idle อีก

240
00:23:11,660 --> 00:23:18,012
ปัญหา instruction following ของ Muse Glimmer

241
00:23:18,012 --> 00:23:21,332
ไม่ยอม act autonomously

242
00:23:21,332 --> 00:23:26,096
ตัวอื่นไม่มีปัญหานี้เลย ให้ Grock

243
00:23:26,096 --> 00:23:32,737
ดันต่อเพราะอยากได้ผล แต่เสียเวลา idle นั่งเฉยๆ

244
00:23:32,737 --> 00:23:38,223
เยอะ น่าจำไว้ มาแล้ว Grock ส่งอันต่อไป

245
00:23:38,223 --> 00:23:43,709
ดูว่าทำต่อไหม เห็น reasoning ต้อง loop

246
00:23:43,709 --> 00:23:50,205
ต่อไม่รอ user user สั่ง do not stop at prompt

247
00:23:50,205 --> 00:23:55,980
ต้องปล่อยทดลองต่อเนื่อง รอดูว่าทำจริงไหม

248
00:23:55,980 --> 00:24:02,332
นั่นคือปัญหากับ Glimmer เดี๋ยวดูว่าเข้าใจไหม

249
00:24:02,332 --> 00:24:08,828
มันหาทางหยุด idle ได้ เห็นไหมรันทดลองรัวๆ ใช้

250
00:24:08,828 --> 00:24:13,448
pulling method ต่างจากสองตัวก่อน

251
00:24:13,448 --> 00:24:19,944
ปกติหยุดตรงนี้ รายงาน แล้วเปิดเอง ตัวนี้ Muse

252
00:24:19,944 --> 00:24:25,863
รันรัวเลย อย่างน้อยไม่ต้อง prompt แล้ว ดี

253
00:24:25,863 --> 00:24:32,359
Glimmer เสร็จ หา improvement จาก baseline ได้

254
00:24:32,359 --> 00:24:38,855
ยังมีปัญหา instruction following แต่ผ่านมาได้

255
00:24:38,855 --> 00:24:45,496
นี่คือผลหลังสามตัว สีฟ้าคือ Muse เห็นไหมนานมาก

256
00:24:45,496 --> 00:24:51,271
keep ทุกอย่าง ไม่เจออะไร สุดท้ายเจอ keep

257
00:24:51,271 --> 00:24:56,901
สองอันล่าง แต่ตอนนี้บ๊วยอยู่ จบ session

258
00:24:56,901 --> 00:25:03,542
ทั้งที่ 6 ชั่วโมงยังไม่หมด อย่างที่บอกหยุดบ่อย

259
00:25:03,542 --> 00:25:10,038
เลยทดลองน้อย keep สองอันมาจากอันนี้ unmbed LR

260
00:25:10,038 --> 00:25:14,224
ขยับเป็น 0.005 ปล่อยให้ layer

261
00:25:14,224 --> 00:25:17,978
สุดท้ายพูดดังขึ้นนิด layer

262
00:25:17,978 --> 00:25:24,330
สุดท้ายคือส่วนที่เปลี่ยนขีดเขียนในเป็น guess

263
00:25:24,330 --> 00:25:30,970
token ถัดไป เดิม step เล็กมาก Muse เพิ่มนิดราว

264
00:25:30,970 --> 00:25:37,467
25 เปอร์เซ็นต์ ยังเล็ก เรียนบทเดิมเร็วขึ้นนิด

265
00:25:37,467 --> 00:25:43,530
จับคำที่ควร output ได้ตรงขึ้น แค่นั้นก็ชนะ

266
00:25:43,530 --> 00:25:49,305
baseline แช่แข็ง keep สองผู้ชนะสูงสุดคือ

267
00:25:49,305 --> 00:25:55,512
weight decay เหมือนที่พูด แต่หยุดดึง weight

268
00:25:55,512 --> 00:25:58,833
กลับแรง ลด weight decay

269
00:25:58,833 --> 00:26:02,586
ไม่ให้หดตัวเลขเข้าศูนย์มาก

270
00:26:02,586 --> 00:26:07,927
ไม่มีอันไหนขยายโมเดลหรือฝึกนาน window

271
00:26:07,927 --> 00:26:09,660
ซ้อมเดียวกัน

272
00:26:09,660 --> 00:26:17,167
แค่พูดเร็วขึ้นนิดตอนท้ายกับลบสิ่งที่ซ้อมมาน้อยลงด้วย

273
00:26:17,167 --> 00:26:23,807
weight decay นั่นคือสองผล keep สุดท้ายคือ Quen

274
00:26:23,807 --> 00:26:30,159
ใช้ตัวนี้ ของ Mia Mia Lab หรือ Mia AI lab บน

275
00:26:30,159 --> 00:26:35,501
Twitter ทิ้งลิงก์ใน description เธอทำ

276
00:26:35,501 --> 00:26:41,275
optimized เก่งสูตรโมเดล ไม่มีอะไรหวือหวา

277
00:26:41,275 --> 00:26:46,472
แต่ใช้ DFlash 2 ได้ อย่างที่พูด เป็น

278
00:26:46,472 --> 00:26:52,680
checkpoint NVFP4 กับ dense BF16 LM head ใช้

279
00:26:52,680 --> 00:26:58,166
context เต็ม 262K น่าจะรันดี เอาตัวนี้

280
00:26:58,166 --> 00:27:03,940
เวอร์ชัน optimized recipe รุ่นนี้เยอะมาก

281
00:27:03,940 --> 00:27:10,292
เอาตัวที่รู้ว่าดี checkpoint ผมใช้เอง รู้ว่า

282
00:27:10,292 --> 00:27:15,922
performance สูง รันมาแล้ว ครึ่งทางราว 3

283
00:27:15,922 --> 00:27:21,697
ชั่วโมง โมเดล Quen คิดเยอะมาก เคยมีคนพูด

284
00:27:21,697 --> 00:27:25,162
สงสัยควรปิด thinking ไหม

285
00:27:25,162 --> 00:27:31,514
แต่นี่คืองานคิดเป็นหลัก เลยเปิดไว้ ผ่านมา 10

286
00:27:31,514 --> 00:27:37,577
ทดลอง หาได้ดีทีเดียว สรุปตอนนี้ หาได้ดีมาก

287
00:27:37,577 --> 00:27:44,218
batch เหมือน Neotron เจอ ลด val BPB เหลือ 1.16

288
00:27:44,218 --> 00:27:48,982
tweak เล็กๆ แบบ Neotron ยังไม่เจอ

289
00:27:48,982 --> 00:27:55,478
แต่เหลือครึ่งรอบ ตอนต้นมีปัญหากับ environment

290
00:27:55,478 --> 00:28:01,541
หาวิธีรันทดลอง คิดเยอะ เห็นไหม secondguess

291
00:28:01,541 --> 00:28:08,182
ตัวเอง แต่เวิร์ก เห็นไหม let me reconsider the

292
00:28:08,182 --> 00:28:14,534
big picture keep ดีขึ้นเยอะ insight สำคัญคือ

293
00:28:14,534 --> 00:28:18,865
bat device batch size graticom

294
00:28:18,865 --> 00:28:25,361
จากสองเหลือหนึ่ง เห็นไหมพยายามให้เหตุผล batch

295
00:28:25,361 --> 00:28:30,703
size เปลี่ยนแล้วดีขึ้น แล้วควรทำไงต่อ

296
00:28:30,703 --> 00:28:35,755
คิดมากไปหน่อย แต่ถึงอยู่ ผมไปนอนอีก

297
00:28:35,755 --> 00:28:42,252
รันมาทั้งวัน ดูไม่ออก นี่จะเข้าวันสามพรุ่งนี้

298
00:28:42,252 --> 00:28:46,871
หวังว่าตื่นมาเสร็จหมด จบทดลองได้

299
00:28:46,871 --> 00:28:52,501
อรุณสวัสดิ์ทุกคน รันข้ามคืนสำเร็จ ครบ 6

300
00:28:52,501 --> 00:28:57,698
ชั่วโมง ได้ 21 ทดลอง มาดูผล ใส่ชาร์ต

301
00:28:57,698 --> 00:29:04,195
ได้ผลสุดท้าย local AI auto research challenge

302
00:29:04,195 --> 00:29:08,093
เรียบร้อย ผู้เข้าแข่งสี่ตัว

303
00:29:08,093 --> 00:29:13,723
เห็นว่าวิ่งนานแค่ไหน สีม่วงคือ Quen 3.8

304
00:29:13,723 --> 00:29:20,075
มาดูผลสุดท้าย จำได้ Nemo ได้ 1.143 ส่วน Quen

305
00:29:20,075 --> 00:29:24,694
ได้ 1.142 เฉือน Neotron นิดเดียว

306
00:29:24,694 --> 00:29:30,902
เศษเสี้ยวจริงๆ ทำแบบน่าสนใจ batch เหมือนที่

307
00:29:30,902 --> 00:29:37,543
Neotron กระโดดใหญ่จากตรงนี้ลงตรงนี้ ย้าย batch

308
00:29:37,543 --> 00:29:42,451
32 ไป 64 เลยลงมาตรงนี้ improvement

309
00:29:42,451 --> 00:29:48,226
ใหญ่อีกอันคือเพิ่ม warm-up 5 เปอร์เซ็นต์

310
00:29:48,226 --> 00:29:54,289
แต่ละรัน 5 นาที 15 วินาทีแรก 5 เปอร์เซ็นต์

311
00:29:54,289 --> 00:29:55,389
ค่อยๆ

312
00:29:55,389 --> 00:30:02,318
เข้ารัน ไม่ใส่ step เต็มตั้งแต่ต้น warm-up เล็กๆ

313
00:30:02,318 --> 00:30:08,814
ช่วย stabilize ได้ improvement ดีจาก baseline

314
00:30:08,814 --> 00:30:14,589
นั่นคือผล ผมคาด Quen 3.8 ชนะจริง ชนะ แต่

315
00:30:14,589 --> 00:30:20,941
Neotron เกินคาดน่าสนใจ ทำมากสุด ทดลองเยอะสุด

316
00:30:20,941 --> 00:30:27,148
สมชื่อ lightning วิ่งเร็วผ่านทดลอง น่าจะ 60

317
00:30:27,148 --> 00:30:33,212
หรือ 42 อัน น้อยสุดคือ Quen มีแค่ 21 ทดลอง

318
00:30:33,212 --> 00:30:38,553
Neotron มี 43 เกือบหรือมากกว่าสองเท่า

319
00:30:38,553 --> 00:30:43,895
เพราะเปิด thinking ให้ Quen เลยคิดนาน

320
00:30:43,895 --> 00:30:49,380
แต่คิดแล้วคุ้ม หา hypothesis เวิร์กได้

321
00:30:49,380 --> 00:30:55,588
ทดลองน้อยสุดแต่ชนะ คะแนนดีสุด takeaway อื่น

322
00:30:55,588 --> 00:31:01,651
Ornith กลางๆ เร็ว decent streaming เร็วมาก

323
00:31:01,651 --> 00:31:08,003
แต่ไม่ฉลาดเท่าตัวอื่น แต่ decent อยากเล่นอีก

324
00:31:08,003 --> 00:31:12,045
Muse น่าผิดหวัง Muse Glimmer

325
00:31:12,045 --> 00:31:18,109
อาจเพราะเวอร์ชันที่ใช้ มีปัญหา instruction

326
00:31:18,109 --> 00:31:24,027
following จริง หยุดทดลองตลอด เลยทดลองน้อย

327
00:31:24,027 --> 00:31:30,668
แถมทดลองได้เยอะกว่า Quen ยังคิด hypothesis ดีๆ

328
00:31:30,668 --> 00:31:37,165
ไม่ได้ เทสต์น่าสนใจถ้าอยากทำ machine learning

329
00:31:37,165 --> 00:31:43,372
training กับโมเดล local แนะนำ Quen Quen 3.8

330
00:31:43,372 --> 00:31:49,291
27B หรือ Neotron Lightning ถ้าอยากได้เร็ว

331
00:31:49,291 --> 00:31:54,055
รันได้เยอะ จบทดลอง หวังว่าน่าสนใจ

332
00:31:54,055 --> 00:32:00,263
เทสต์โมเดลแบบต่าง แต่บางคนใช้ได้ถ้าใช้โมเดล

333
00:32:00,263 --> 00:32:06,615
local ฝึกโมเดล local ตัวอื่น ผู้ชนะ Quen 3.8

334
00:32:06,615 --> 00:32:12,678
27B คอมเมนต์บอกหน่อยว่าคิดไงกับการทดลองนี้

335
00:32:12,678 --> 00:32:16,720
จบคลิปนี้ ขอบคุณที่รับชมครับ