▶SUBTHAIแปลไทย · ซับ · พากย์⚙
บทความแปลภาษาไทย · YouTube

Adding Vision to a Text-Only LLM: A Local DS4-Flash Experiment

0:000:00
เล่นเสียงต้นฉบับของวิดีโอ พร้อมแสดงซับไทยซิงก์ตามเวลา
กำลังโหลดวิดีโอ…
01

สรุปย่อ

ประเด็นสำคัญจากวิดีโอ

- **ช่อง:** Tonbi's AI Garage · **ความยาว:** ~22 นาที · **ลิงก์:** https://www.youtube.com/watch?v=79txDFqcrpU

# สรุป: Adding Vision to a Text-Only LLM: A Local DS4-Flash Experiment

- **ช่อง:** Tonbi's AI Garage · **ความยาว:** ~22 นาที · **ลิงก์:** https://www.youtube.com/watch?v=79txDFqcrpU

## ประเด็นหลัก
- DeepSeek V4 Flash ที่รันบน DGX Spark เป็นโมเดล text-only ที่เก่งด้านโค้ดและเอเจนต์ แต่ไม่มีวิทัศน์ เพราะเช็กพอยต์ไม่มี vision tower, projector และ image processor
- วิธีแก้แบบเดิมสองแบบไม่น่าพอใจ: เทรนใหม่ให้เห็นภาพ (หนักและใช้เวลาหลายเดือน) หรือสลับไปใช้โมเดล multimodal เล็ก (เสียพลังของ DeepSeek)
- แนวคิดของ Mia AI Lab: 'จ้างตา' ให้โมเดล โดยรันโมเดลวิทัศน์เล็ก (Qwen 3 VL 4B, 4 พันล้านพารามิเตอร์) เป็น sidecar บนพอร์ต 8889 คอยบรรยายภาพเป็นข้อความ แล้วให้ DeepSeek อ่านข้อความนั้นใช้เหตุผลต่อ พิกเซลไม่เคยไปถึงสมอง
- สะพานเชื่อมคือ MCP server ที่มี 3 เครื่องมือ: describe image, OCR image และ compare images (สูงสุด 4 ภาพ) แปลงภาพเป็น base64 แล้วเรียก OpenAI compatible API ของ sidecar
- ตั้งค่า sidecar แบบ deterministic (temperature 0, ปิดการคิด) เพราะมันคือบริการสกัดข้อมูล ไม่ใช่แชตบอต ภาพเดียวกันต้องให้รายงานเดียวกัน
- ราคาที่ต้องจ่าย: KV cache ลดจาก 2.49 ล้านโทเคนเหลือ 1.37 ล้านโทเคน คอนเท็กซ์ลดลง 72% (จาก 240,000 เหลือ 65,000 โทเคน) และต้องปิด memory watchdog ระหว่างเดโม
- ข้อจำกัดคือ 'เกมโทรศัพท์ต่อคำ': ถ้าตาพลาดรายละเอียด สมองก็ไม่มีทางรู้ เพราะฉะนั้นคำอธิบายคือหลักฐาน (evidence) ไม่ใช่ความจริงสูงสุด (ground truth)
- ทดสอบจริง 3 ภาพ: ภาพอนิเมะ 3D cutout (จับได้ว่าตัวละครทำจากกระดาษแข็ง), ภาพ claymation ไดโนเสาร์ (บรรยายละเอียดดี) และ thumbnail ความละเอียดต่ำ (อ่านหัวข้อได้ แต่ hallucinate แผงขวาที่จริงเป็นเพลย์ลิสต์ Spotify)
- ข้อดี: ไม่ต้องเทรนใหม่ ได้พลัง reasoning เต็มของ DeepSeek มีเธรดสนทนาเดียว เปิดปิดได้ และใช้กับแฮร์เนสที่รองรับ MCP ได้ทุกตัว
- ผู้สร้างให้ดาวน์โหลด repo ได้จาก GitHub ของ Mia AI Lab และแนะนำโปรเจกต์ agentwiks.com ของตัวเอง

## ความเห็นสรุป
วิดีโอนี้อธิบายแนวคิด 'เปลี่ยนวิทัศน์ให้เป็นเครื่องมือ' ได้ชัดเจนและทดสอบจริงครบวงจร ทั้งสถาปัตยกรรม การติดตั้ง และข้อแลกเปลี่ยน แม้ระบบจะยังเป็น experimental และมีข้อจำกัดเรื่องคอนเท็กซ์ แต่เป็นแนวทางที่ใช้งานได้จริงกับฮาร์ดแวร์เครื่องเดียว เหมาะสำหรับคนที่รันโมเดล local แล้วอยากได้ความสามารถมองภาพโดยไม่ทิ้งโมเดลหลัก
02

คำแปลเต็ม

แปลตามบทสนทนาต้นฉบับ ปรับเป็นภาษาไทยธรรมชาติ

**เปิดตัวการทดลอง:** อย่างที่เห็น ผมอยู่ใน Hermes agent และนี่คือเทอร์มินัลเซสชันที่ผม SSH เข้าไปยังเครื่อง DGX Spark ของผม ซึ่งเป็นที่ที่รันโมเดล DeepSeek เวอร์ชัน 4/0731 ในเครื่อง (local) ผมให้มันดูภาพนี้ซึ่งเป็นภาพตัวอย่าง (thumbnail) ของวิดีโอเก่า ๆ ของผม แล้วถามว่ามันบอกได้ไหมว่ารูปนี้คืออะไร ผมส่ง URL ของรูปให้โมเดล มันลองใช้เครื่องมือหลายตัว แต่สุดท้ายก็บอกว่าระบุเนื้อหาในภาพตัวอย่างไม่ได้ เพราะเครื่องมือวิทัศน์บนเครื่องนี้เป็น text-only เนื่องจากโมเดล DS4 ตัวนี้เป็น text-only ไม่มีความสามารถด้านวิทัศน์ในตัว

**ปัญหา:** แล้วจะทำยังไงดี? โมเดลนี้เก่งมาก เป็นโมเดลเขียนโค้ดที่เยี่ยม เป็นโมเดลเอเจนต์ที่ยอดเยี่ยม แต่มันไม่มีวิทัศน์ และงานหลายอย่างของผมต้องใช้วิทัศน์ด้วย ผมเคยคิดว่าไม่มีทางแก้ ต้องใช้โมเดล multimodal แล้วลืม DeepSeek ไปซะ แต่แล้วผมก็มาเจอโพสต์ของ Mia AI Lab ถ้าสนใจโมเดล local หรือ AI โดยรวม บัญชีนี้ติดตามได้ดีมาก เธออธิบายเรื่องระบบรองรับวิทัศน์แบบทดลอง (experimental) สำหรับโมเดล DeepSeek เวอร์ชัน 4 Flash ที่รันในเครื่อง เธอใช้ DGX Spark สองตัว ส่วนผมใช้ตัวเดียว วิธีที่เธอทำน่าสนใจมาก มันเป็นระบบทดลองขั้นสูง คาดเดาได้ว่าจะมีบั๊กบ้าง เธอบอกว่า 'จำไว้ ตอนนี้ยังเป็นเวอร์ชันทดลอง คุณจะเสีย KV cache ไปเยอะมาก' มันอาจไม่ใช่วิธีที่ประหยัดที่สุด แต่ผมว่าเป็นไอเดียที่น่าสนใจ

**แผนวันนี้:** ในวิดีโอนี้ ผมจะอธิบายว่า Mia ทำได้ยังไง นั่นคือการให้ดวงตากับโมเดลที่ตาบอด เราจะทดสอบมัน ผมจะอธิบายสถาปัตยกรรมของการตั้งค่าแบบนี้ แล้วก็ทดสอบจริง ผมจะติดตั้งส่วนวิทัศน์เข้ากับโมเดล V4 local ของผม แล้วดูว่ามันอ่านภาพตัวอย่างได้หรือยัง ระบบนี้จะประมวลผลทั้งภาพและข้อความได้แล้ว เริ่มกันเลย

**โปรโมตโปรเจกต์:** ถ้าคุณรันเอเจนต์เองและอยากได้ LM wikis ที่ผมใช้ทำวิจัยและสร้างวิดีโอเหล่านี้ ลองดูโปรเจกต์ของผมที่ agentwiks.com ผมให้ wiki เหล่านี้ฟรีในหลายหัวข้อ และคุณสมัครโปรแบบ $9.99 ต่อเดือนได้ จะได้เข้าถึง wiki ขนาดใหญ่พิเศษ (super-sized extra-large) ที่มีหน้ามากขึ้นและรายละเอียดในแต่ละหัวข้อมากขึ้น

**ที่มาของ repo:** กลับมาที่วิดีโอ ตัว repo เองคือ Mia AI Lab และนี่คือ DeepSeek เวอร์ชัน 4 ของเธอ ซึ่งออกแบบมาสำหรับ DGX Spark สองตัว แต่ผมจะรันบนตัวเดียว ข้อมูลทั้งหมดอยู่ใน GitHub ลองดูได้ถ้าอยากลองทำเอง ที่ผมทำคือส่ง repo นี้ให้เอเจนต์ของผมปรับให้เข้ากับการตั้งค่าของผมเอง

**สถาปัตยกรรมและแนวคิด:** นี่คือแนวคิดและวิธีที่เขาทำ นี่คือปัญหาก่อน: DeepSeek เวอร์ชัน 4 Flash ที่รันบน DGX Spark ของผม มีความสามารถ reasoning เชิงลึก ใช้เครื่องมือ (tool use) และเวิร์กโฟลว์เอเจนต์ทั้งหมดบนฮาร์ดแวร์ของตัวเอง มันเป็นโมเดลที่ทรงพลังมาก เคยเห็นผมทดสอบมาก่อน มันจัดการงานเขียนโค้ดที่น่าประทับใจได้ แม้แต่บน DGX Spark ตัวเดียวก็ยังเก่งและค่อนข้างเร็ว นี่คือโมเดลที่ผมอยากให้มาตอบคำถาม

**ทำไมตาบอด:** คุณเคยเห็นมาก่อนแล้ว วางภาพ screenshot เข้าไป โมเดลตาบอดสนิท ประมวลผลไม่ได้ เพราะเช็กพอยต์นี้ไม่มี vision tower ไม่มี projector ไม่มี image processor สิ่งเหล่านี้ไม่ใช่แค่การตั้งค่าที่เปิดปิดได้ในโมเดล local พวกมันคือชิ้นส่วนของโครงข่ายประสาทที่ไม่ได้ถูกสร้างมาเลย มันไม่ใช่สิ่งที่โมเดลนี้ให้ความสำคัญ

**สองทางแก้อันเดิม:** มีวิธีแก้ง่าย ๆ สองวิธี แต่ทั้งคู่ก็ไม่ค่อยดี วิธี A คือเทรนใหม่ให้มันเห็นภาพเต็มรูปแบบ ซึ่งเป็นงานหนักทั้งแรงคนและ GPU คงต้องใช้เวลาเป็นเดือน ต้องเทรนด้วย vision encoder และ projector แล้ว fine-tune ด้วยข้อมูลภาพ อย่างที่คิดไว้ นี่คือสิ่งที่ AI labs ทำ ไม่ใช่สิ่งที่คนเดียวจะทำได้ โดยเฉพาะในกรอบเวลาสั้น ๆ วิธี B คือสลับไปใช้โมเดลวิทัศน์ แทนที่สแต็กทั้งหมดด้วยโมเดล multimodal ที่เล็กกว่า แต่คุณจะแลกสมองกับดวงตา ไม่ได้พลังทั้งหมดของโมเดล DeepSeek

**ทางเลือกที่สาม:** และมีทางเลือกที่สาม ซึ่งคือสิ่งที่เราจะทำวันนี้: ไม่ต้องสอนให้มันเห็น แต่จ้างตาคู่หนึ่งให้มัน แนวคิดคือ รันโมเดลวิทัศน์ขนาดเล็กไว้ข้าง ๆ โมเดล DeepSeek ตัวใหญ่ เมื่อมีภาพเข้ามา โมเดลเล็กจะดูภาพแล้วเขียนสิ่งที่เห็น โมเดลใหญ่จะอ่านข้อความนั้นแล้วใช้เหตุผลหรือทำสิ่งที่ต้องทำ วิทัศน์ไม่ได้เป็นความสามารถของโมเดลอีกต่อไป แต่กลายเป็นเครื่องมือที่โมเดลเรียกใช้ นี่คือแนวคิดหลักของระบบวิทัศน์ทดลองนี้ วิทัศน์กลายเป็นเครื่องมือ พิกเซลไม่เคยไปถึงสมองเลย

**ขั้นตอนการทำงาน:** มาดูทีละขั้น: มีภาพเข้ามา เป็นไฟล์ local path หรือ URL อย่างที่ผมให้ไปก่อนหน้านี้ MCP server โหลดภาพ ลดขนาดภาพที่ใหญ่เกินไป แล้วแปลงเป็น base64 data URI จากนั้นก็ถึงโมเดล Qwen 3 VL 4B โมเดลเล็ก ๆ แต่นี่คือโมเดลวิทัศน์ นี่คือดวงตา หรือที่ผมจะเรียกว่า sidecar โมเดลวิทัศน์ 4 พันล้านพารามิเตอร์ตัวนี้รันบนพอร์ต 8889 พร้อม ๆ กัน รับพิกเซลเข้ามา ด้วย temperature เป็นศูนย์ หมายความว่าไม่มีการคิด ระบบจะ deterministic ให้มากที่สุดเท่าที่จะทำได้ และจะคืนคำอธิบายข้อเท็จจริงที่แม่นยำ ข้อความ OCR หรือการเปรียบเทียบ มันแค่ต้องอ่านพิกเซลแล้วอธิบายให้ชัดที่สุด กลายเป็นข้อความธรรมดา เป็นคำพูดเฉย ๆ นี่คือสิ่งเดียวที่ส่งระหว่างโมเดลสองตัว นั่นคือคำอธิบาย ข้อความที่สกัดได้ หรือ diff

**ฝั่งสมอง:** จากนั้นก็ถึงโมเดล DeepSeek ตัวหลักของเราที่รันบนอีกพอร์ตหนึ่ง มันอ่านคำอธิบายเหมือนข้อความธรรมดา แล้วคิดทบทวนแบบเต็มความพยายาม (full effort) มันไม่เคยได้รับภาพต้นฉบับ มีแต่คำอธิบายที่โมเดลวิทัศน์เล็ก ๆ เขียนไว้ แล้วมันก็จะตอบคุณ นี่คือทั้งระบบ ง่าย ๆ ตรงไปตรงมา แต่ค่อนข้างฉลาด: ดวงตาบรรยาย สมองใช้เหตุผล แต่ละโมเดลทำในสิ่งที่มันถนัด และสมองไม่เคยแตะพิกเซล

**ตัวดวงตา (sidecar):** โมเดลวิทัศน์ของเรา หรือ sidecar ตั้งใจให้เล็กและเรียบง่าย มีแค่ 4 พันล้านพารามิเตอร์ ใช้ GPU memory แค่ 4% อุณหภูมิเป็นศูนย์และปิดการคิด อุณหภูมิศูนย์แปลว่า deterministic มากที่สุด ไม่มีความคิดสร้างสรรค์ ไม่มีความคิดเห็นใด ๆ และต้องเป็นโมเดลเล็กแน่นอน เพราะคุณรันโมเดล DeepSeek ไปพร้อมกัน หน่วยความจำบน DGX Spark มีจำกัด

**ทำไมต้องเคร่งขนาดนั้น?** เพราะ sidecar คือบริการสกัดข้อมูล (extraction service) ไม่ใช่แชตบอต มันเป็นโมเดลแยกต่างหาก แต่ไม่ใช่ตัวที่คุณจะคุยด้วย มันมีบทบาทที่ชัดเจน และเป็นบทบาทที่น่าเบื่อมาก มันไม่คุย ไม่คาดเดา ไม่ตอบผู้ใช้ มันดูพิกเซลแล้วรายงานข้อเท็จจริง คำอธิบาย OCR การเปรียบเทียบ ดังนั้นตั้งค่าให้ deterministic: ภาพเดียวกันให้รายงานเดียวกัน และนั่นสำคัญ คุณอยากให้ deterministic มากที่สุด คำว่า deterministic หมายถึงอินพุตเดียวกันให้เอาต์พุตเดียวกันทุกครั้ง

**สะพานเชื่อม (bridge):** สะพานเชื่อมก็สำคัญในระบบนี้เช่นกัน มี MCP tools สามตัวที่ใช้ และคุณจะเห็นเอเจนต์ใช้เครื่องมือเหล่านี้ หรืออย่างน้อยก็พยายามใช้ ผมปิดมันไว้ตอนนี้ แต่ระบบจะพยายามใช้ describe image มีสามตัว: describe image, OCR image และ compare images ซึ่งเปรียบเทียบภาพได้ถึงสี่ภาพเทียบข้างกัน มันรับ local paths หรือ URLs แปลงเป็น base64 แล้วเรียก OpenAI compatible API ของ sidecar ระบบนี้ auto register เข้ากับ agent harnesses มากกว่า 11 ตัว เราจะใช้ Hermes agent สำหรับการทดลองนี้ แต่จากมุมมองของโมเดล reasoning การเห็นภาพก็ไม่ต่างจากการรันคำสั่งเชลล์ คุณเรียกเครื่องมือ แล้วข้อความก็กลับมา สำหรับโมเดล DeepSeek ของเรา มันแค่รันสิ่งนี้เป็น MCP tool เท่านั้น

**กฎสี่ข้อ:** มีกฎสี่ข้อเพื่อให้ระบบซื่อสัตย์ หนึ่ง เมื่อมีการกล่าวถึงภาพ ให้เรียก describe image หรือ OCR image เมื่อข้อความในภาพคือประเด็น บ่อยครั้งที่คุณอยากอ่านข้อความที่อยู่ในภาพ นั่นคือสิ่งที่ใช้ สอง ให้ถือว่าสิ่งที่กลับมาคือหลักฐาน (evidence) ไม่ใช่ความจริงสูงสุด (ground truth) เพราะมันคือการตีความสิ่งที่เห็น โดยเฉพาะถ้าภาพไม่ชัดหรือค่อนข้างนามธรรม สาม คำตอบสุดท้ายต้องมาจาก DeepSeek เสมอ ห้ามให้โมเดลเล็กตอบผู้ใช้ และ repo ย้ำเรื่องนี้หนักมาก สี่ ห้ามส่งพิกเซลไปที่พอร์ต 888 เด็ดขาด นั่นคือพอร์ตของโมเดล DeepSeek สมองเป็น text-only และต้องเป็นแบบนั้นต่อไป

**ราคาที่ต้องจ่าย:** ดวงตาไม่ได้ฟรี คุณต้องจ่ายด้วยคอนเท็กซ์ และนี่คือสิ่งที่ Mia พูดถึงเรื่อง KV cache คุณจะได้ KV cache 2.49 ล้านโทเคนจากโหมด text-only ของโมเดล DeepSeek เอง แต่พอเป็นโหมดวิทัศน์ สมองเหลือ 1.37 ล้านโทเคน sidecar ทำให้สมองเสียหน่วยความจำทำงานไปเกือบครึ่งหนึ่ง ค่อนข้างเยอะ Mia เตือนไว้อย่างที่เห็นว่า ตอนนี้ยังเป็นเวอร์ชันทดลอง และคุณจะเสีย KV cache ไปเยอะ คุณเห็นเหตุผลแล้ว นี่คือเหตุผลที่ระบบนี้ปิดเป็นค่าเริ่มต้น คุณควรใช้มันเมื่อจำเป็นต้องใช้วิทัศน์จริง ๆ เท่านั้น

**ข้อจำกัด:** ข้อจำกัดคือเกมโทรศัพท์ต่อคำ (telephone game) และนี่คือเหตุผลที่ระบบนี้อาจไม่สมบูรณ์แบบนัก เพราะสมองไม่เคยตรวจสอบพิกเซล ถ้าตาพลาดรายละเอียดไป รายละเอียดนั้นก็เหมือนไม่มีอยู่จริง เราจะทดสอบกันว่ามันทำงานดีแค่ไหนกับภาพสองสามภาพ แต่ถ้ามีคำอธิบายที่ไม่สมบูรณ์หรือผิด มันจะเข้าไปในโมเดล reasoning และกลายเป็นพื้นฐานของคำตอบที่ผิด นี่คือเหตุผลที่ถือว่ามันเป็นหลักฐาน ไม่ใช่ความจริงสูงสุด

**สิ่งที่ได้:** แต่คุณได้เก็บโมเดลฐานไว้โดยไม่ต้องเทรนใหม่ ได้พลังและความสามารถ reasoning ทั้งหมดของ DeepSeek คุณได้เธรดการสนทนาเดียว โมเดลตอบคำถามตัวเดียว โดยไม่ต้องสลับไปมาระหว่างโมเดลหลายตัว และได้คำอธิบาย OCR และการเปรียบเทียบภาพ มันทำงานกับแฮร์เนสที่รองรับ MCP ทุกตัว และเปิดปิดได้ตามต้องการ มันเป็นระบบทดลองและเป็นงานประปา (plumbing) ที่ทำเสร็จในวันเดียว เราจะทำตอนนี้เลย

**เริ่มลงมือ:** นี่คือบทสรุปของผม แนวคิดง่าย ๆ แต่ความเรียบง่ายนี่แหละที่ทำให้มันใช้งานได้ เรามาลองกัน ผมจะเริ่มเซสชันใหม่ นี่คือโปรไฟล์เริ่มต้นของ Spark agent ของผม และผมตั้งค่าผ่าน GBT Soul เพราะผมไม่สามารถใช้ repo ตามเดิมได้ เนื่องจากผมใช้ DGX Spark แค่ตัวเดียวและสูตรการตั้งค่าต่างจากของ Mia ที่ใช้สองตัว ผมเลยต้องปรับแต่งเล็กน้อย ให้เอเจนต์ของผมจัดการ คุณเห็นว่ามันรันอยู่แล้ว โมเดลเดียวกันคือโมเดลวิทัศน์ Qwen และคุณเห็น MCP tools ที่ถูกค้นพบ นี่คือสองหน้าต่างต่างกัน อันนี้คือโปรไฟล์เริ่มต้นที่ผมตั้งค่าทุกอย่างไว้ และอันนี้คือโมเดล DeepSeek local ที่รันอยู่จริง นี่คือสิ่งที่เราจะใช้ และคุณเห็นเครื่องมือสามตัว: describe image, OCR image และ compare images ทุกอย่างพร้อมแล้ว

**ทดสอบภาพแรก:** ลองอันแรก ซึ่งรันบน Spark ในเครื่อง ผมสร้างภาพนี้ด้วยโมเดล Cray 2 มาดูกัน ผมจะคัดลอกแล้วดูว่ามันบอกได้ไหมว่ารูปนี้คืออะไร เพราะภาพนี้ค่อนข้างชัดเจน เป็นสาวอนิเมะคนเดียว กลับมาที่นี่ ผมพิมพ์ว่า 'อธิบายว่ามีอะไรอยู่ในภาพนี้ให้ละเอียดที่สุด' เราจะลองสองสามภาพ ดูว่าจะได้รายละเอียดแค่ไหน อันนี้น่าจะตรงไปตรงมา ควรทำได้ง่าย และเราจะลองกับข้อความด้วย เพราะอยากรู้ว่า OCR image จะทำได้แค่ไหน

**เจอปัญหาเล็กน้อย:** อย่างที่เห็น มันล่ม (down) ไปชั่วครู่ อย่างที่บอก มันเป็นระบบทดลอง เราอาจเจอข้อผิดพลาดแบบนี้ ลองแก้ดู โอเค กลับมาทำงานได้แล้ว ปัญหาไม่เกี่ยวกับ vision sidecar เลย แต่เกี่ยวกับวิธีตั้งค่า memory watchdog ของผม เพราะผมมักรันอะไรหลายอย่างพร้อมกันบน Spark เสมอ ผมมี memory watchdog ที่จะปิดระบบบางอย่างถ้าสถานการณ์เริ่มเสี่ยง แต่แก้ได้แล้ว ลองอีกครั้ง 'อธิบายว่ามีอะไรอยู่ในภาพนี้ให้ละเอียดที่สุด' จริง ๆ แล้วไม่ใช่ปัญหาของ vision sidecar แต่เป็นวิธีตั้งค่า Spark ของผม

**ผลลัพธ์ภาพแรก:** โอเค เราทำให้มันทำงานได้แล้ว เห็นตรงนี้ไหม ตอนเรียกเครื่องมือ มันใช้ MCP DS4 เพื่ออธิบายภาพ และเห็นว่า vision sidecar กลับมาทำงานแล้ว คำอธิบายส่งกลับมาแล้ว นี่คือสิ่งที่ได้: ธีมคือภาพประกอบสไตล์ 3D cutout ของตัวละครหญิงแนวอนิเมะ มันอธิบายรายละเอียดได้ค่อนข้างดี ตัวละครอนิเมะวัยรุ่น ผมสีน้ำตาลแดงหยักศกยาวปานกลาง ดวงตาโตสื่ออารมณ์ เสื้อผ้า ครบทุกอย่าง ทั้งท่าทาง พื้นหลัง ซึ่งจริง ๆ ไม่มีพื้นหลังอะไร มันเรียบ ๆ ซึ่งก็จริง และประเด็นของงานชิ้นนี้คือจุดที่ค่อนข้างละเอียดอ่อน ผมแปลกใจที่มันจับได้ ตัวละครทำจากกระดาษแข็ง นั่นคือไอเดีย การทำสไตล์ไลซ์ตัวละครอนิเมะ ไม่ใช่แค่ภาพประกอบธรรมดา มันจับได้ด้วยว่า ใจความของงานคือตัวละครที่ทำจากกระดาษแข็ง ซ้อนเป็นชั้น ๆ เป็นลอนลูกฟูก มีพื้นผิว พื้นหลังน้อยมาก งานนี้มันเห็นได้ดีมาก

**ทดสอบภาพที่สอง:** ลองอีกอันที่ยากขึ้นเล็กน้อย นี่คือภาพถัดไป มีอะไรเกิดขึ้นเยอะกว่า อยู่ในโลกไดโนเสาร์แบบ claymation นี่คือภาพอ้างอิงที่ผมสร้าง มีไดโนเสาร์กับแมมมอธขนปุกปุยตัวเล็ก ๆ ซับซ้อนขึ้นมาหน่อย มาดูว่ามันจัดการยังไง ผมพิมพ์ว่า 'คราวนี้อธิบายอันนี้' แม้โมเดลวิทัศน์ Qwen จะรองรับวิดีโอ แต่การตั้งค่าปัจจุบันของ MCP server และเครื่องมือที่มีอยู่รองรับได้แค่ภาพ เราจะเน้นภาพก่อน 'อธิบายภาพนี้ด้วย vision MCP server' ดูมันทำงาน เห็นการเรียกเครื่องมือ ชื่อ MCP DS4 vision describe image มันกำลังรันอยู่ โอเค นี่คือผลลัพธ์ ใช้เวลาไม่นาน สองสามวินาที ประมาณ 20 วินาที ภาพคือ claymation สไตล์ความละเอียดสูง ในสภาพแวดล้อมยุคก่อนประวัติศาสตร์อันเขียวชอุ่ม ตัวเอกคือแมมมอธกับไดโนเสาร์ มันอธิบายได้ละเอียดดีทีเดียว น่าประทับใจ มันจับสภาพแวดล้อมและพื้นหลังได้ดีมาก ภูมิประเทศหินเขียวชอุ่ม ท้องฟ้า แสง และสื่อกลางภาพ (middleground) นี่คือคำอธิบายที่ค่อนข้างดีของสิ่งที่เราเห็นในภาพ

**ทดสอบ OCR กับภาพความละเอียดต่ำ:** ลองกลับไปที่ภาพแรก ไม่รู้ว่าหน้าจอคุณเห็นไหม แต่มันความละเอียดต่ำมาก ดูสิว่ามันอ่านได้ไหม และอันนี้ใช้ URL ไม่ใช่ไฟล์ในเครื่อง โอเค ภาพคือแบนเนอร์โปรโมตดิจิทัล จริง ๆ คือ thumbnail ข้อความที่เห็นคือ 'Ultimate Guide to Hermes Desktop Plugins' ตัวใหญ่สีขาว มันอ่านถูกต้อง คิดว่านี่คือข้อความเดียวบนภาพ อ่านได้ น่าประทับใจ อย่างที่บอก ภาพนี้ความละเอียดค่อนข้างต่ำ แผงซ้ายคือกราฟหุ้น (stock chart) ด้านบน แล้วก็ราคา มันอ่านได้จริง ๆ ผมว่าผมยังอ่านไม่ออกเลย มันเบลอเกินไป แต่มันอ่านบางอย่างจากกราฟนี้ได้ แผงขวาคือหน้าต่าง Hermes Plugin ด้านบน ตามด้วยรายการปลั๊กอินซ้ำ ๆ อันนั้นมันพลาด นี่คือตัวอย่างของ hallucination เพราะแผงขวาจริง ๆ คือลิสต์เพลย์ลิสต์ Spotify นี่คือตัวอย่างสิ่งที่มันมองไม่เห็น และไม่ใช่ความผิดของ DeepSeek มันคือโมเดลวิทัศน์ที่มองไม่เห็นเอง

**บทเรียนจากภาพที่สาม:** มันคือกราฟิกโปรโมตเกี่ยวกับปลั๊กอิน Hermes Desktop สิ่งหลักที่ผมอยากเช็คคือมันอ่านหัวข้อได้ไหม และมันก็อ่านได้ชัดเจน และยังเห็นส่วนที่เล็กมาก บอกได้ว่านี่คือกราฟหุ้น น่าประทับใจทีเดียว แต่นี่ก็ดีเพราะเราเห็นข้อจำกัด ถ้าโมเดลวิทัศน์พลาดอะไรบางอย่าง เช่น แผงขวาไม่เกี่ยวกับกราฟหุ้น DeepSeek ก็ทำอะไรไม่ได้ มันต้องยอมรับภาพหลอนนั้นไป

**ข้อแลกเปลี่ยน:** นี่คือสรุปข้อแลกเปลี่ยน (trade-offs) ที่คุณจะเจอ โปรไฟล์ DS4 ปกติของผมบน DGX Spark: เช็กพอยต์ DeepSeek มีหน่วยความจำราว ๆ 80 กิกะไบต์ และคอนเท็กซ์ 240,000 โทเคน และคุณเห็นกับโปรไฟล์ DS4 Vision แบบอยู่ร่วมกัน (coexistent) บวกโมเดล Qwen ข้อแลกเปลี่ยนอยู่ด้านล่าง: ในโหมดวิทัศน์ ผมใช้คอนเท็กซ์ได้น้อยลงมาก แค่ 65,000 โทเคนต่อวินโดว์ ใช้ได้แค่หนึ่ง batch และใช้ได้แค่ plain decoding ซึ่งทำให้ช้ากว่าปกติ ผลคือคอนเท็กซ์ลดลง 72% ผมน่าจะปรับแต่งให้ดีกว่านี้ได้ แต่อย่างที่เห็น คอนเท็กซ์ต้องลดลงอย่างมาก เพราะ KV cache กินพื้นที่เยอะมากตอนนี้ และผมมักมี watchdog คอยดูแลหน่วยความจำ แต่ต้องปิดมันระหว่างเดโมนี้ เพราะมันใกล้ขีดจำกัดเกินไป ผมต้องปิดชั่วคราว เพราะระบบนี้กินหน่วยความจำมากกว่าปกติ คุณต้องคำนึงถึงเรื่องนี้

**ความเห็นปิดท้าย:** ผมประทับใจคุณภาพของโมเดลวิทัศน์จริง ๆ มันมองภาพได้ค่อนข้างดี แม้แต่ภาพยาก ๆ แต่ก็มีข้อแลกเปลี่ยนที่สำคัญ แต่ก็ยังน่าสนใจอยู่ดี ตัว vision sidecar นี่คือการทดลองดู repo ทดลองนี้ เพราะในแง่แนวคิด ผมว่ามันพัฒนาต่อได้ และปรับแต่งให้มีประสิทธิภาพขึ้นโดยไม่ต้องแลกอะไรหนักขนาดนี้ ถ้าอยากลองด้วยตัวเอง ตามที่บอก ไปดู Mia AI Lab ได้ เธอมีสูตร (recipes) หลากหลาย ลองดูบัญชี X ของเธอ Mia AI Lab

จบวิดีโอเท่านี้ หวังว่าคุณจะสนุกกับมัน ผมว่าเป็นแนวคิดที่น่าสนใจที่จะทดลอง ทิ้งคอมเมนต์ไว้ได้ บอกความคิดเห็นของคุณ แล้วพบกันใหม่ ขอบคุณที่รับชม

03

หมายเหตุการแปล

ความโปร่งใสเกี่ยวกับความไม่แน่นอนในต้นฉบับ

  • ## จุดที่ไม่ชัดเจน / ที่ต้องใช้ดุลยพินิจ
  • ไม่มีจุดที่ต้องใช้ `[ฟังไม่ชัด]` — ทุกตอนแปลได้ครบถ้วน
  • คำพูดที่ถอดได้ไม่ชัด (transcription artifacts) ซึ่งแปลแบบคงความหมายและระบุไว้ตรงนี้:
  • 3. **'88 80 gigabyte'** — ตัวเลขหน่วยความจำที่พูดไม่ชัด แปลเป็น 'ราว ๆ 80 กิกะไบต์'
04

อภิธานศัพท์เทคนิค

คำศัพท์และชื่อผลิตภัณฑ์ที่คงรูปภาษาอังกฤษ

ศัพท์คำแปล / คำอธิบาย
text-only modelโมเดลที่รับได้เฉพาะข้อความ ไม่รองรับภาพ
vision towerชั้นโครงข่ายประสาทที่ใช้ประมวลผลภาพ (โมเดลนี้ไม่มี)
projectorตัวฉายภาพ/เชื่อมต่อฟีเจอร์ภาพเข้ากับโมเดลภาษา
image processorตัวประมวลผลภาพ
multimodal modelโมเดลที่รองรับหลายรูปแบบข้อมูล (ภาพ+เสียง+ข้อความ)
vision encoderตัวเข้ารหัสภาพ ใช้ในการเทรนให้โมเดลเห็นภาพ
fine-tuneการปรับแต่งโมเดลเพิ่มเติมด้วยชุดข้อมูลเฉพาะ
sidecarโมเดลวิทัศน์ตัวช่วยที่รันคู่กับโมเดลหลัก ทำหน้าที่เป็น 'ดวงตา'
MCP (Model Context Protocol)โปรโตคอลเชื่อมต่อเครื่องมือให้โมเดลเรียกใช้
MCP server / MCP toolsเซิร์ฟเวอร์/เครื่องมือที่เชื่อมต่อผ่าน MCP
describe imageเครื่องมือให้บรรยายภาพ
OCR imageเครื่องมืออ่านข้อความในภาพ (Optical Character Recognition)
compare imagesเครื่องมือเปรียบเทียบภาพ (สูงสุด 4 ภาพ)
base64 data URIรูปแบบการเข้ารหัสข้อมูลภาพเป็นข้อความสำหรับส่งผ่าน API
OpenAI compatible APIAPI ที่ใช้งานรูปแบบเดียวกับ OpenAI
KV cacheหน่วยความจำแคชของ key-value ที่ใช้ระหว่างการสร้างข้อความ
context window / tokensกรอบคอนเท็กซ์ / หน่วยนับข้อความของโมเดล
deterministicให้ผลลัพธ์เดิมทุกครั้งเมื่ออินพุตเดียวกัน
temperatureค่าควบคุมความสุ่มของคำตอบ (0 = คงที่ที่สุด)
hallucinationภาพหลอน/การที่โมเดลสร้างข้อมูลที่ไม่ตรงความจริง
ground truthความจริงสูงสุด/ข้อมูลอ้างอิงที่ถูกต้อง
evidenceหลักฐาน (สิ่งที่ sidecar ส่งกลับมา ต้องตรวจสอบก่อนเชื่อ)
agent harnessโครงสร้าง/เฟรมเวิร์กที่ใช้รันเอเจนต์
tool useความสามารถของโมเดลในการเรียกใช้เครื่องมือ
reasoningการใช้เหตุผลเชิงลึกของโมเดล
DGX Sparkคอมพิวเตอร์ AI ส่วนตัวของ NVIDIA (ฮาร์ดแวร์ที่ใช้รันโมเดล)
checkpointไฟล์น้ำหนักโมเดลที่เทรนเสร็จแล้ว
memory watchdogโปรแกรมเฝ้าระวังหน่วยความจำ คอยปิดระบบเมื่อใกล้เต็ม
plain decodingวิธีสร้างข้อความแบบธรรมดา (ช้ากว่าแบบพิเศษ)
telephone gameเกมโทรศัพท์ต่อคำ หมายถึงข้อมูลที่เพี้ยนเมื่อถูกส่งต่อ
plumbingงานเชื่อมต่อระบบ (งานพื้นฐานที่ทำเสร็จในวันเดียว)
claymationเทคนิคแอนิเมชันดินน้ำมัน
3D cutoutภาพประกอบสไตล์ตัดวางสามมิติ
thumbnailภาพตัวอย่างของวิดีโอ
LM wikisฐานความรู้ที่ผู้สร้างใช้ทำวิจัย (ที่ agentwiks.com)
recipesสูตรการตั้งค่าโมเดล/ระบบ
DeepSeek V4 Flash (DS4-Flash)โมเดลภาษาหลัก text-only ที่ใช้ในการทดลอง
Qwen 3 VL 4Bโมเดลวิทัศน์ขนาด 4 พันล้านพารามิเตอร์ ทำหน้าที่เป็นดวงตา
Hermes agentเอเจนต์ที่ใช้รันการทดลองและเรียก MCP tools
GitHubแพลตฟอร์มเก็บโค้ด ที่เก็บ repo ของ Mia AI Lab
agentwiks.comเว็บโปรเจกต์ของผู้สร้างที่แจก wiki ฟรี
Mia AI Labบัญชีผู้สร้าง repo ต้นทาง (บน X)
Spotify playlistลิสต์เพลงใน Spotify (สิ่งที่โมเดลมองไม่เห็นในภาพทดสอบ)
stock chartกราฟราคาหุ้น
05

ซับไตเติ้ลภาษาไทย

ดาวน์โหลดหรือดูซับทั้งหมด

1
00:00:00,000 --> 00:00:04,164
**เปิดตัวการทดลอง:** อย่างที่เห็น ผมอยู่ใน

2
00:00:04,164 --> 00:00:08,427
Hermes agent และนี่คือเทอร์มินัลเซสชันที่ผม

3
00:00:08,427 --> 00:00:11,996
SSH เข้าไปยังเครื่อง DGX Spark ของผม

4
00:00:11,996 --> 00:00:15,962
ซึ่งเป็นที่ที่รันโมเดล DeepSeek เวอร์ชัน
thai-subtitles.srt
SubRip — ใช้กับเครื่องเล่นวิดีโอส่วนใหญ่
↓ ดาวน์โหลด
thai-subtitles.vtt
WebVTT — ใช้กับเว็บ / YouTube
↓ ดาวน์โหลด
เปิดดูซับไตเติ้ลทั้งหมด (358 segments)
1
00:00:00,000 --> 00:00:04,164
**เปิดตัวการทดลอง:** อย่างที่เห็น ผมอยู่ใน

2
00:00:04,164 --> 00:00:08,427
Hermes agent และนี่คือเทอร์มินัลเซสชันที่ผม

3
00:00:08,427 --> 00:00:11,996
SSH เข้าไปยังเครื่อง DGX Spark ของผม

4
00:00:11,996 --> 00:00:15,962
ซึ่งเป็นที่ที่รันโมเดล DeepSeek เวอร์ชัน

5
00:00:15,962 --> 00:00:18,341
4/0731 ในเครื่อง (local)

6
00:00:18,341 --> 00:00:21,811
ผมให้มันดูภาพนี้ซึ่งเป็นภาพตัวอย่าง

7
00:00:21,811 --> 00:00:25,083
(thumbnail) ของวิดีโอเก่า ๆ ของผม

8
00:00:25,083 --> 00:00:29,445
แล้วถามว่ามันบอกได้ไหมว่ารูปนี้คืออะไร ผมส่ง

9
00:00:29,445 --> 00:00:33,906
URL ของรูปให้โมเดล มันลองใช้เครื่องมือหลายตัว

10
00:00:33,906 --> 00:00:38,665
แต่สุดท้ายก็บอกว่าระบุเนื้อหาในภาพตัวอย่างไม่ได้

11
00:00:38,665 --> 00:00:42,432
เพราะเครื่องมือวิทัศน์บนเครื่องนี้เป็น

12
00:00:42,432 --> 00:00:46,299
text-only เนื่องจากโมเดล DS4 ตัวนี้เป็น

13
00:00:46,299 --> 00:00:50,363
text-only ไม่มีความสามารถด้านวิทัศน์ในตัว

14
00:00:50,363 --> 00:00:54,626
**ปัญหา:** แล้วจะทำยังไงดี? โมเดลนี้เก่งมาก

15
00:00:54,626 --> 00:00:57,303
เป็นโมเดลเขียนโค้ดที่เยี่ยม

16
00:00:57,303 --> 00:01:00,079
เป็นโมเดลเอเจนต์ที่ยอดเยี่ยม

17
00:01:00,079 --> 00:01:01,864
แต่มันไม่มีวิทัศน์

18
00:01:01,864 --> 00:01:05,631
และงานหลายอย่างของผมต้องใช้วิทัศน์ด้วย

19
00:01:05,631 --> 00:01:10,191
ผมเคยคิดว่าไม่มีทางแก้ ต้องใช้โมเดล multimodal

20
00:01:10,191 --> 00:01:14,752
แล้วลืม DeepSeek ไปซะ แต่แล้วผมก็มาเจอโพสต์ของ

21
00:01:14,752 --> 00:01:19,114
Mia AI Lab ถ้าสนใจโมเดล local หรือ AI โดยรวม

22
00:01:19,114 --> 00:01:21,295
บัญชีนี้ติดตามได้ดีมาก

23
00:01:21,295 --> 00:01:25,261
เธออธิบายเรื่องระบบรองรับวิทัศน์แบบทดลอง

24
00:01:25,261 --> 00:01:29,821
(experimental) สำหรับโมเดล DeepSeek เวอร์ชัน 4

25
00:01:29,821 --> 00:01:34,282
Flash ที่รันในเครื่อง เธอใช้ DGX Spark สองตัว

26
00:01:34,282 --> 00:01:38,248
ส่วนผมใช้ตัวเดียว วิธีที่เธอทำน่าสนใจมาก

27
00:01:38,248 --> 00:01:40,528
มันเป็นระบบทดลองขั้นสูง

28
00:01:40,528 --> 00:01:44,593
คาดเดาได้ว่าจะมีบั๊กบ้าง เธอบอกว่า 'จำไว้

29
00:01:44,593 --> 00:01:49,054
ตอนนี้ยังเป็นเวอร์ชันทดลอง คุณจะเสีย KV cache

30
00:01:49,054 --> 00:01:53,317
ไปเยอะมาก' มันอาจไม่ใช่วิธีที่ประหยัดที่สุด

31
00:01:53,317 --> 00:01:57,580
แต่ผมว่าเป็นไอเดียที่น่าสนใจ **แผนวันนี้:**

32
00:01:57,580 --> 00:02:01,546
ในวิดีโอนี้ ผมจะอธิบายว่า Mia ทำได้ยังไง

33
00:02:01,546 --> 00:02:04,917
นั่นคือการให้ดวงตากับโมเดลที่ตาบอด

34
00:02:04,917 --> 00:02:06,206
เราจะทดสอบมัน

35
00:02:06,206 --> 00:02:10,171
ผมจะอธิบายสถาปัตยกรรมของการตั้งค่าแบบนี้

36
00:02:10,171 --> 00:02:11,658
แล้วก็ทดสอบจริง

37
00:02:11,658 --> 00:02:15,921
ผมจะติดตั้งส่วนวิทัศน์เข้ากับโมเดล V4 local

38
00:02:15,921 --> 00:02:20,184
ของผม แล้วดูว่ามันอ่านภาพตัวอย่างได้หรือยัง

39
00:02:20,184 --> 00:02:24,249
ระบบนี้จะประมวลผลทั้งภาพและข้อความได้แล้ว

40
00:02:24,249 --> 00:02:27,323
เริ่มกันเลย **โปรโมตโปรเจกต์:**

41
00:02:27,323 --> 00:02:31,090
ถ้าคุณรันเอเจนต์เองและอยากได้ LM wikis

42
00:02:31,090 --> 00:02:34,758
ที่ผมใช้ทำวิจัยและสร้างวิดีโอเหล่านี้

43
00:02:34,758 --> 00:02:39,319
ลองดูโปรเจกต์ของผมที่ agentwiks.com ผมให้ wiki

44
00:02:39,319 --> 00:02:43,383
เหล่านี้ฟรีในหลายหัวข้อ และคุณสมัครโปรแบบ

45
00:02:43,383 --> 00:02:46,853
$9.99 ต่อเดือนได้ จะได้เข้าถึง wiki

46
00:02:46,853 --> 00:02:50,720
ขนาดใหญ่พิเศษ (super-sized extra-large)

47
00:02:50,720 --> 00:02:55,578
ที่มีหน้ามากขึ้นและรายละเอียดในแต่ละหัวข้อมากขึ้น

48
00:02:55,578 --> 00:02:59,841
**ที่มาของ repo:** กลับมาที่วิดีโอ ตัว repo

49
00:02:59,841 --> 00:03:04,302
เองคือ Mia AI Lab และนี่คือ DeepSeek เวอร์ชัน

50
00:03:04,302 --> 00:03:08,664
4 ของเธอ ซึ่งออกแบบมาสำหรับ DGX Spark สองตัว

51
00:03:08,664 --> 00:03:12,630
แต่ผมจะรันบนตัวเดียว ข้อมูลทั้งหมดอยู่ใน

52
00:03:12,630 --> 00:03:16,992
GitHub ลองดูได้ถ้าอยากลองทำเอง ที่ผมทำคือส่ง

53
00:03:16,992 --> 00:03:18,090
repo

54
00:03:18,090 --> 00:03:23,047
นี้ให้เอเจนต์ของผมปรับให้เข้ากับการตั้งค่าของผมเอง

55
00:03:23,047 --> 00:03:25,525
**สถาปัตยกรรมและแนวคิด:**

56
00:03:25,525 --> 00:03:29,888
นี่คือแนวคิดและวิธีที่เขาทำ นี่คือปัญหาก่อน:

57
00:03:29,888 --> 00:03:34,250
DeepSeek เวอร์ชัน 4 Flash ที่รันบน DGX Spark

58
00:03:34,250 --> 00:03:37,819
ของผม มีความสามารถ reasoning เชิงลึก

59
00:03:37,819 --> 00:03:40,198
ใช้เครื่องมือ (tool use)

60
00:03:40,198 --> 00:03:44,957
และเวิร์กโฟลว์เอเจนต์ทั้งหมดบนฮาร์ดแวร์ของตัวเอง

61
00:03:44,957 --> 00:03:49,517
มันเป็นโมเดลที่ทรงพลังมาก เคยเห็นผมทดสอบมาก่อน

62
00:03:49,517 --> 00:03:53,285
มันจัดการงานเขียนโค้ดที่น่าประทับใจได้

63
00:03:53,285 --> 00:03:55,069
แม้แต่บน DGX Spark

64
00:03:55,069 --> 00:03:58,242
ตัวเดียวก็ยังเก่งและค่อนข้างเร็ว

65
00:03:58,242 --> 00:04:01,513
นี่คือโมเดลที่ผมอยากให้มาตอบคำถาม

66
00:04:01,513 --> 00:04:05,677
**ทำไมตาบอด:** คุณเคยเห็นมาก่อนแล้ว วางภาพ

67
00:04:05,677 --> 00:04:08,850
screenshot เข้าไป โมเดลตาบอดสนิท

68
00:04:08,850 --> 00:04:13,212
ประมวลผลไม่ได้ เพราะเช็กพอยต์นี้ไม่มี vision

69
00:04:13,212 --> 00:04:17,475
tower ไม่มี projector ไม่มี image processor

70
00:04:17,475 --> 00:04:22,531
สิ่งเหล่านี้ไม่ใช่แค่การตั้งค่าที่เปิดปิดได้ในโมเดล

71
00:04:22,531 --> 00:04:23,629
local

72
00:04:23,629 --> 00:04:29,181
พวกมันคือชิ้นส่วนของโครงข่ายประสาทที่ไม่ได้ถูกสร้างมาเลย

73
00:04:29,181 --> 00:04:32,750
มันไม่ใช่สิ่งที่โมเดลนี้ให้ความสำคัญ

74
00:04:32,750 --> 00:04:37,211
**สองทางแก้อันเดิม:** มีวิธีแก้ง่าย ๆ สองวิธี

75
00:04:37,211 --> 00:04:39,987
แต่ทั้งคู่ก็ไม่ค่อยดี วิธี A

76
00:04:39,987 --> 00:04:43,358
คือเทรนใหม่ให้มันเห็นภาพเต็มรูปแบบ

77
00:04:43,358 --> 00:04:46,432
ซึ่งเป็นงานหนักทั้งแรงคนและ GPU

78
00:04:46,432 --> 00:04:50,595
คงต้องใช้เวลาเป็นเดือน ต้องเทรนด้วย vision

79
00:04:50,595 --> 00:04:54,164
encoder และ projector แล้ว fine-tune

80
00:04:54,164 --> 00:04:58,626
ด้วยข้อมูลภาพ อย่างที่คิดไว้ นี่คือสิ่งที่ AI

81
00:04:58,626 --> 00:05:02,096
labs ทำ ไม่ใช่สิ่งที่คนเดียวจะทำได้

82
00:05:02,096 --> 00:05:05,169
โดยเฉพาะในกรอบเวลาสั้น ๆ วิธี B

83
00:05:05,169 --> 00:05:07,548
คือสลับไปใช้โมเดลวิทัศน์

84
00:05:07,548 --> 00:05:11,316
แทนที่สแต็กทั้งหมดด้วยโมเดล multimodal

85
00:05:11,316 --> 00:05:14,786
ที่เล็กกว่า แต่คุณจะแลกสมองกับดวงตา

86
00:05:14,786 --> 00:05:18,156
ไม่ได้พลังทั้งหมดของโมเดล DeepSeek

87
00:05:18,156 --> 00:05:22,023
**ทางเลือกที่สาม:** และมีทางเลือกที่สาม

88
00:05:22,023 --> 00:05:24,799
ซึ่งคือสิ่งที่เราจะทำวันนี้:

89
00:05:24,799 --> 00:05:29,161
ไม่ต้องสอนให้มันเห็น แต่จ้างตาคู่หนึ่งให้มัน

90
00:05:29,161 --> 00:05:33,325
แนวคิดคือ รันโมเดลวิทัศน์ขนาดเล็กไว้ข้าง ๆ

91
00:05:33,325 --> 00:05:37,191
โมเดล DeepSeek ตัวใหญ่ เมื่อมีภาพเข้ามา

92
00:05:37,191 --> 00:05:40,760
โมเดลเล็กจะดูภาพแล้วเขียนสิ่งที่เห็น

93
00:05:40,760 --> 00:05:46,511
โมเดลใหญ่จะอ่านข้อความนั้นแล้วใช้เหตุผลหรือทำสิ่งที่ต้องทำ

94
00:05:46,511 --> 00:05:50,774
วิทัศน์ไม่ได้เป็นความสามารถของโมเดลอีกต่อไป

95
00:05:50,774 --> 00:05:54,442
แต่กลายเป็นเครื่องมือที่โมเดลเรียกใช้

96
00:05:54,442 --> 00:05:58,209
นี่คือแนวคิดหลักของระบบวิทัศน์ทดลองนี้

97
00:05:58,209 --> 00:06:00,688
วิทัศน์กลายเป็นเครื่องมือ

98
00:06:00,688 --> 00:06:05,149
พิกเซลไม่เคยไปถึงสมองเลย **ขั้นตอนการทำงาน:**

99
00:06:05,149 --> 00:06:09,610
มาดูทีละขั้น: มีภาพเข้ามา เป็นไฟล์ local path

100
00:06:09,610 --> 00:06:14,171
หรือ URL อย่างที่ผมให้ไปก่อนหน้านี้ MCP server

101
00:06:14,171 --> 00:06:18,434
โหลดภาพ ลดขนาดภาพที่ใหญ่เกินไป แล้วแปลงเป็น

102
00:06:18,434 --> 00:06:22,994
base64 data URI จากนั้นก็ถึงโมเดล Qwen 3 VL 4B

103
00:06:22,994 --> 00:06:27,456
โมเดลเล็ก ๆ แต่นี่คือโมเดลวิทัศน์ นี่คือดวงตา

104
00:06:27,456 --> 00:06:31,619
หรือที่ผมจะเรียกว่า sidecar โมเดลวิทัศน์ 4

105
00:06:31,619 --> 00:06:36,081
พันล้านพารามิเตอร์ตัวนี้รันบนพอร์ต 8889 พร้อม

106
00:06:36,081 --> 00:06:39,848
ๆ กัน รับพิกเซลเข้ามา ด้วย temperature

107
00:06:39,848 --> 00:06:43,715
เป็นศูนย์ หมายความว่าไม่มีการคิด ระบบจะ

108
00:06:43,715 --> 00:06:47,680
deterministic ให้มากที่สุดเท่าที่จะทำได้

109
00:06:47,680 --> 00:06:52,042
และจะคืนคำอธิบายข้อเท็จจริงที่แม่นยำ ข้อความ

110
00:06:52,042 --> 00:06:54,223
OCR หรือการเปรียบเทียบ

111
00:06:54,223 --> 00:06:58,387
มันแค่ต้องอ่านพิกเซลแล้วอธิบายให้ชัดที่สุด

112
00:06:58,387 --> 00:07:01,956
กลายเป็นข้อความธรรมดา เป็นคำพูดเฉย ๆ

113
00:07:01,956 --> 00:07:05,823
นี่คือสิ่งเดียวที่ส่งระหว่างโมเดลสองตัว

114
00:07:05,823 --> 00:07:10,086
นั่นคือคำอธิบาย ข้อความที่สกัดได้ หรือ diff

115
00:07:10,086 --> 00:07:14,051
**ฝั่งสมอง:** จากนั้นก็ถึงโมเดล DeepSeek

116
00:07:14,051 --> 00:07:17,422
ตัวหลักของเราที่รันบนอีกพอร์ตหนึ่ง

117
00:07:17,422 --> 00:07:20,793
มันอ่านคำอธิบายเหมือนข้อความธรรมดา

118
00:07:20,793 --> 00:07:25,056
แล้วคิดทบทวนแบบเต็มความพยายาม (full effort)

119
00:07:25,056 --> 00:07:27,535
มันไม่เคยได้รับภาพต้นฉบับ

120
00:07:27,535 --> 00:07:30,905
มีแต่คำอธิบายที่โมเดลวิทัศน์เล็ก ๆ

121
00:07:30,905 --> 00:07:35,664
เขียนไว้ แล้วมันก็จะตอบคุณ นี่คือทั้งระบบ ง่าย ๆ

122
00:07:35,664 --> 00:07:39,531
ตรงไปตรงมา แต่ค่อนข้างฉลาด: ดวงตาบรรยาย

123
00:07:39,531 --> 00:07:43,694
สมองใช้เหตุผล แต่ละโมเดลทำในสิ่งที่มันถนัด

124
00:07:43,694 --> 00:07:48,255
และสมองไม่เคยแตะพิกเซล **ตัวดวงตา (sidecar):**

125
00:07:48,255 --> 00:07:51,328
โมเดลวิทัศน์ของเรา หรือ sidecar

126
00:07:51,328 --> 00:07:54,600
ตั้งใจให้เล็กและเรียบง่าย มีแค่ 4

127
00:07:54,600 --> 00:07:58,566
พันล้านพารามิเตอร์ ใช้ GPU memory แค่ 4%

128
00:07:58,566 --> 00:08:01,441
อุณหภูมิเป็นศูนย์และปิดการคิด

129
00:08:01,441 --> 00:08:05,704
อุณหภูมิศูนย์แปลว่า deterministic มากที่สุด

130
00:08:05,704 --> 00:08:09,967
ไม่มีความคิดสร้างสรรค์ ไม่มีความคิดเห็นใด ๆ

131
00:08:09,967 --> 00:08:14,230
และต้องเป็นโมเดลเล็กแน่นอน เพราะคุณรันโมเดล

132
00:08:14,230 --> 00:08:18,493
DeepSeek ไปพร้อมกัน หน่วยความจำบน DGX Spark

133
00:08:18,493 --> 00:08:22,458
มีจำกัด **ทำไมต้องเคร่งขนาดนั้น?** เพราะ

134
00:08:22,458 --> 00:08:26,325
sidecar คือบริการสกัดข้อมูล (extraction

135
00:08:26,325 --> 00:08:30,687
service) ไม่ใช่แชตบอต มันเป็นโมเดลแยกต่างหาก

136
00:08:30,687 --> 00:08:33,364
แต่ไม่ใช่ตัวที่คุณจะคุยด้วย

137
00:08:33,364 --> 00:08:37,924
มันมีบทบาทที่ชัดเจน และเป็นบทบาทที่น่าเบื่อมาก

138
00:08:37,924 --> 00:08:41,097
มันไม่คุย ไม่คาดเดา ไม่ตอบผู้ใช้

139
00:08:41,097 --> 00:08:45,558
มันดูพิกเซลแล้วรายงานข้อเท็จจริง คำอธิบาย OCR

140
00:08:45,558 --> 00:08:48,731
การเปรียบเทียบ ดังนั้นตั้งค่าให้

141
00:08:48,731 --> 00:08:52,994
deterministic: ภาพเดียวกันให้รายงานเดียวกัน

142
00:08:52,994 --> 00:08:56,662
และนั่นสำคัญ คุณอยากให้ deterministic

143
00:08:56,662 --> 00:08:59,537
มากที่สุด คำว่า deterministic

144
00:08:59,537 --> 00:09:04,296
หมายถึงอินพุตเดียวกันให้เอาต์พุตเดียวกันทุกครั้ง

145
00:09:04,296 --> 00:09:06,774
**สะพานเชื่อม (bridge):**

146
00:09:06,774 --> 00:09:10,839
สะพานเชื่อมก็สำคัญในระบบนี้เช่นกัน มี MCP

147
00:09:10,839 --> 00:09:12,623
tools สามตัวที่ใช้

148
00:09:12,623 --> 00:09:16,589
และคุณจะเห็นเอเจนต์ใช้เครื่องมือเหล่านี้

149
00:09:16,589 --> 00:09:20,753
หรืออย่างน้อยก็พยายามใช้ ผมปิดมันไว้ตอนนี้

150
00:09:20,753 --> 00:09:25,016
แต่ระบบจะพยายามใช้ describe image มีสามตัว:

151
00:09:25,016 --> 00:09:29,378
describe image, OCR image และ compare images

152
00:09:29,378 --> 00:09:33,542
ซึ่งเปรียบเทียบภาพได้ถึงสี่ภาพเทียบข้างกัน

153
00:09:33,542 --> 00:09:37,904
มันรับ local paths หรือ URLs แปลงเป็น base64

154
00:09:37,904 --> 00:09:42,167
แล้วเรียก OpenAI compatible API ของ sidecar

155
00:09:42,167 --> 00:09:46,628
ระบบนี้ auto register เข้ากับ agent harnesses

156
00:09:46,628 --> 00:09:50,198
มากกว่า 11 ตัว เราจะใช้ Hermes agent

157
00:09:50,198 --> 00:09:53,965
สำหรับการทดลองนี้ แต่จากมุมมองของโมเดล

158
00:09:53,965 --> 00:09:55,063
reasoning

159
00:09:55,063 --> 00:09:58,929
การเห็นภาพก็ไม่ต่างจากการรันคำสั่งเชลล์

160
00:09:58,929 --> 00:10:02,697
คุณเรียกเครื่องมือ แล้วข้อความก็กลับมา

161
00:10:02,697 --> 00:10:05,374
สำหรับโมเดล DeepSeek ของเรา

162
00:10:05,374 --> 00:10:09,141
มันแค่รันสิ่งนี้เป็น MCP tool เท่านั้น

163
00:10:09,141 --> 00:10:13,602
**กฎสี่ข้อ:** มีกฎสี่ข้อเพื่อให้ระบบซื่อสัตย์

164
00:10:13,602 --> 00:10:18,064
หนึ่ง เมื่อมีการกล่าวถึงภาพ ให้เรียก describe

165
00:10:18,064 --> 00:10:20,046
image หรือ OCR image

166
00:10:20,046 --> 00:10:22,723
เมื่อข้อความในภาพคือประเด็น

167
00:10:22,723 --> 00:10:26,887
บ่อยครั้งที่คุณอยากอ่านข้อความที่อยู่ในภาพ

168
00:10:26,887 --> 00:10:28,969
นั่นคือสิ่งที่ใช้ สอง

169
00:10:28,969 --> 00:10:33,232
ให้ถือว่าสิ่งที่กลับมาคือหลักฐาน (evidence)

170
00:10:33,232 --> 00:10:36,702
ไม่ใช่ความจริงสูงสุด (ground truth)

171
00:10:36,702 --> 00:10:39,775
เพราะมันคือการตีความสิ่งที่เห็น

172
00:10:39,775 --> 00:10:44,038
โดยเฉพาะถ้าภาพไม่ชัดหรือค่อนข้างนามธรรม สาม

173
00:10:44,038 --> 00:10:47,508
คำตอบสุดท้ายต้องมาจาก DeepSeek เสมอ

174
00:10:47,508 --> 00:10:50,879
ห้ามให้โมเดลเล็กตอบผู้ใช้ และ repo

175
00:10:50,879 --> 00:10:53,159
ย้ำเรื่องนี้หนักมาก สี่

176
00:10:53,159 --> 00:10:56,629
ห้ามส่งพิกเซลไปที่พอร์ต 888 เด็ดขาด

177
00:10:56,629 --> 00:11:00,396
นั่นคือพอร์ตของโมเดล DeepSeek สมองเป็น

178
00:11:00,396 --> 00:11:03,668
text-only และต้องเป็นแบบนั้นต่อไป

179
00:11:03,668 --> 00:11:07,138
**ราคาที่ต้องจ่าย:** ดวงตาไม่ได้ฟรี

180
00:11:07,138 --> 00:11:11,599
คุณต้องจ่ายด้วยคอนเท็กซ์ และนี่คือสิ่งที่ Mia

181
00:11:11,599 --> 00:11:15,961
พูดถึงเรื่อง KV cache คุณจะได้ KV cache 2.49

182
00:11:15,961 --> 00:11:20,324
ล้านโทเคนจากโหมด text-only ของโมเดล DeepSeek

183
00:11:20,324 --> 00:11:24,190
เอง แต่พอเป็นโหมดวิทัศน์ สมองเหลือ 1.37

184
00:11:24,190 --> 00:11:25,876
ล้านโทเคน sidecar

185
00:11:25,876 --> 00:11:30,436
ทำให้สมองเสียหน่วยความจำทำงานไปเกือบครึ่งหนึ่ง

186
00:11:30,436 --> 00:11:34,402
ค่อนข้างเยอะ Mia เตือนไว้อย่างที่เห็นว่า

187
00:11:34,402 --> 00:11:38,565
ตอนนี้ยังเป็นเวอร์ชันทดลอง และคุณจะเสีย KV

188
00:11:38,565 --> 00:11:41,540
cache ไปเยอะ คุณเห็นเหตุผลแล้ว

189
00:11:41,540 --> 00:11:45,505
นี่คือเหตุผลที่ระบบนี้ปิดเป็นค่าเริ่มต้น

190
00:11:45,505 --> 00:11:49,768
คุณควรใช้มันเมื่อจำเป็นต้องใช้วิทัศน์จริง ๆ

191
00:11:49,768 --> 00:11:51,949
เท่านั้น **ข้อจำกัด:**

192
00:11:51,949 --> 00:11:56,312
ข้อจำกัดคือเกมโทรศัพท์ต่อคำ (telephone game)

193
00:11:56,312 --> 00:12:00,674
และนี่คือเหตุผลที่ระบบนี้อาจไม่สมบูรณ์แบบนัก

194
00:12:00,674 --> 00:12:03,450
เพราะสมองไม่เคยตรวจสอบพิกเซล

195
00:12:03,450 --> 00:12:05,532
ถ้าตาพลาดรายละเอียดไป

196
00:12:05,532 --> 00:12:09,002
รายละเอียดนั้นก็เหมือนไม่มีอยู่จริง

197
00:12:09,002 --> 00:12:13,661
เราจะทดสอบกันว่ามันทำงานดีแค่ไหนกับภาพสองสามภาพ

198
00:12:13,661 --> 00:12:17,230
แต่ถ้ามีคำอธิบายที่ไม่สมบูรณ์หรือผิด

199
00:12:17,230 --> 00:12:20,006
มันจะเข้าไปในโมเดล reasoning

200
00:12:20,006 --> 00:12:23,179
และกลายเป็นพื้นฐานของคำตอบที่ผิด

201
00:12:23,179 --> 00:12:26,649
นี่คือเหตุผลที่ถือว่ามันเป็นหลักฐาน

202
00:12:26,649 --> 00:12:30,218
ไม่ใช่ความจริงสูงสุด **สิ่งที่ได้:**

203
00:12:30,218 --> 00:12:34,381
แต่คุณได้เก็บโมเดลฐานไว้โดยไม่ต้องเทรนใหม่

204
00:12:34,381 --> 00:12:38,446
ได้พลังและความสามารถ reasoning ทั้งหมดของ

205
00:12:38,446 --> 00:12:41,619
DeepSeek คุณได้เธรดการสนทนาเดียว

206
00:12:41,619 --> 00:12:43,701
โมเดลตอบคำถามตัวเดียว

207
00:12:43,701 --> 00:12:47,369
โดยไม่ต้องสลับไปมาระหว่างโมเดลหลายตัว

208
00:12:47,369 --> 00:12:51,235
และได้คำอธิบาย OCR และการเปรียบเทียบภาพ

209
00:12:51,235 --> 00:12:55,003
มันทำงานกับแฮร์เนสที่รองรับ MCP ทุกตัว

210
00:12:55,003 --> 00:12:57,283
และเปิดปิดได้ตามต้องการ

211
00:12:57,283 --> 00:13:01,447
มันเป็นระบบทดลองและเป็นงานประปา (plumbing)

212
00:13:01,447 --> 00:13:05,115
ที่ทำเสร็จในวันเดียว เราจะทำตอนนี้เลย

213
00:13:05,115 --> 00:13:09,675
**เริ่มลงมือ:** นี่คือบทสรุปของผม แนวคิดง่าย ๆ

214
00:13:09,675 --> 00:13:13,938
แต่ความเรียบง่ายนี่แหละที่ทำให้มันใช้งานได้

215
00:13:13,938 --> 00:13:17,012
เรามาลองกัน ผมจะเริ่มเซสชันใหม่

216
00:13:17,012 --> 00:13:21,176
นี่คือโปรไฟล์เริ่มต้นของ Spark agent ของผม

217
00:13:21,176 --> 00:13:25,637
และผมตั้งค่าผ่าน GBT Soul เพราะผมไม่สามารถใช้

218
00:13:25,637 --> 00:13:29,603
repo ตามเดิมได้ เนื่องจากผมใช้ DGX Spark

219
00:13:29,603 --> 00:13:33,767
แค่ตัวเดียวและสูตรการตั้งค่าต่างจากของ Mia

220
00:13:33,767 --> 00:13:37,534
ที่ใช้สองตัว ผมเลยต้องปรับแต่งเล็กน้อย

221
00:13:37,534 --> 00:13:42,094
ให้เอเจนต์ของผมจัดการ คุณเห็นว่ามันรันอยู่แล้ว

222
00:13:42,094 --> 00:13:46,457
โมเดลเดียวกันคือโมเดลวิทัศน์ Qwen และคุณเห็น

223
00:13:46,457 --> 00:13:51,017
MCP tools ที่ถูกค้นพบ นี่คือสองหน้าต่างต่างกัน

224
00:13:51,017 --> 00:13:55,677
อันนี้คือโปรไฟล์เริ่มต้นที่ผมตั้งค่าทุกอย่างไว้

225
00:13:55,677 --> 00:13:58,849
และอันนี้คือโมเดล DeepSeek local

226
00:13:58,849 --> 00:14:02,418
ที่รันอยู่จริง นี่คือสิ่งที่เราจะใช้

227
00:14:02,418 --> 00:14:06,681
และคุณเห็นเครื่องมือสามตัว: describe image,

228
00:14:06,681 --> 00:14:11,242
OCR image และ compare images ทุกอย่างพร้อมแล้ว

229
00:14:11,242 --> 00:14:15,405
**ทดสอบภาพแรก:** ลองอันแรก ซึ่งรันบน Spark

230
00:14:15,405 --> 00:14:19,272
ในเครื่อง ผมสร้างภาพนี้ด้วยโมเดล Cray 2

231
00:14:19,272 --> 00:14:20,370
มาดูกัน

232
00:14:20,370 --> 00:14:25,030
ผมจะคัดลอกแล้วดูว่ามันบอกได้ไหมว่ารูปนี้คืออะไร

233
00:14:25,030 --> 00:14:29,590
เพราะภาพนี้ค่อนข้างชัดเจน เป็นสาวอนิเมะคนเดียว

234
00:14:29,590 --> 00:14:31,870
กลับมาที่นี่ ผมพิมพ์ว่า

235
00:14:31,870 --> 00:14:36,332
'อธิบายว่ามีอะไรอยู่ในภาพนี้ให้ละเอียดที่สุด'

236
00:14:36,332 --> 00:14:40,694
เราจะลองสองสามภาพ ดูว่าจะได้รายละเอียดแค่ไหน

237
00:14:40,694 --> 00:14:44,065
อันนี้น่าจะตรงไปตรงมา ควรทำได้ง่าย

238
00:14:44,065 --> 00:14:48,526
และเราจะลองกับข้อความด้วย เพราะอยากรู้ว่า OCR

239
00:14:48,526 --> 00:14:52,591
image จะทำได้แค่ไหน **เจอปัญหาเล็กน้อย:**

240
00:14:52,591 --> 00:14:56,259
อย่างที่เห็น มันล่ม (down) ไปชั่วครู่

241
00:14:56,259 --> 00:14:59,035
อย่างที่บอก มันเป็นระบบทดลอง

242
00:14:59,035 --> 00:15:02,901
เราอาจเจอข้อผิดพลาดแบบนี้ ลองแก้ดู โอเค

243
00:15:02,901 --> 00:15:07,164
กลับมาทำงานได้แล้ว ปัญหาไม่เกี่ยวกับ vision

244
00:15:07,164 --> 00:15:11,328
sidecar เลย แต่เกี่ยวกับวิธีตั้งค่า memory

245
00:15:11,328 --> 00:15:12,716
watchdog ของผม

246
00:15:12,716 --> 00:15:16,880
เพราะผมมักรันอะไรหลายอย่างพร้อมกันบน Spark

247
00:15:16,880 --> 00:15:19,359
เสมอ ผมมี memory watchdog

248
00:15:19,359 --> 00:15:23,622
ที่จะปิดระบบบางอย่างถ้าสถานการณ์เริ่มเสี่ยง

249
00:15:23,622 --> 00:15:26,100
แต่แก้ได้แล้ว ลองอีกครั้ง

250
00:15:26,100 --> 00:15:30,561
'อธิบายว่ามีอะไรอยู่ในภาพนี้ให้ละเอียดที่สุด'

251
00:15:30,561 --> 00:15:34,527
จริง ๆ แล้วไม่ใช่ปัญหาของ vision sidecar

252
00:15:34,527 --> 00:15:37,501
แต่เป็นวิธีตั้งค่า Spark ของผม

253
00:15:37,501 --> 00:15:39,781
**ผลลัพธ์ภาพแรก:** โอเค

254
00:15:39,781 --> 00:15:43,450
เราทำให้มันทำงานได้แล้ว เห็นตรงนี้ไหม

255
00:15:43,450 --> 00:15:46,721
ตอนเรียกเครื่องมือ มันใช้ MCP DS4

256
00:15:46,721 --> 00:15:50,687
เพื่ออธิบายภาพ และเห็นว่า vision sidecar

257
00:15:50,687 --> 00:15:54,355
กลับมาทำงานแล้ว คำอธิบายส่งกลับมาแล้ว

258
00:15:54,355 --> 00:15:58,420
นี่คือสิ่งที่ได้: ธีมคือภาพประกอบสไตล์ 3D

259
00:15:58,420 --> 00:16:01,394
cutout ของตัวละครหญิงแนวอนิเมะ

260
00:16:01,394 --> 00:16:04,567
มันอธิบายรายละเอียดได้ค่อนข้างดี

261
00:16:04,567 --> 00:16:06,549
ตัวละครอนิเมะวัยรุ่น

262
00:16:06,549 --> 00:16:09,424
ผมสีน้ำตาลแดงหยักศกยาวปานกลาง

263
00:16:09,424 --> 00:16:13,192
ดวงตาโตสื่ออารมณ์ เสื้อผ้า ครบทุกอย่าง

264
00:16:13,192 --> 00:16:16,166
ทั้งท่าทาง พื้นหลัง ซึ่งจริง ๆ

265
00:16:16,166 --> 00:16:20,032
ไม่มีพื้นหลังอะไร มันเรียบ ๆ ซึ่งก็จริง

266
00:16:20,032 --> 00:16:25,089
และประเด็นของงานชิ้นนี้คือจุดที่ค่อนข้างละเอียดอ่อน

267
00:16:25,089 --> 00:16:29,352
ผมแปลกใจที่มันจับได้ ตัวละครทำจากกระดาษแข็ง

268
00:16:29,352 --> 00:16:33,416
นั่นคือไอเดีย การทำสไตล์ไลซ์ตัวละครอนิเมะ

269
00:16:33,416 --> 00:16:37,481
ไม่ใช่แค่ภาพประกอบธรรมดา มันจับได้ด้วยว่า

270
00:16:37,481 --> 00:16:41,447
ใจความของงานคือตัวละครที่ทำจากกระดาษแข็ง

271
00:16:41,447 --> 00:16:45,214
ซ้อนเป็นชั้น ๆ เป็นลอนลูกฟูก มีพื้นผิว

272
00:16:45,214 --> 00:16:48,882
พื้นหลังน้อยมาก งานนี้มันเห็นได้ดีมาก

273
00:16:48,882 --> 00:16:50,766
**ทดสอบภาพที่สอง:**

274
00:16:50,766 --> 00:16:54,930
ลองอีกอันที่ยากขึ้นเล็กน้อย นี่คือภาพถัดไป

275
00:16:54,930 --> 00:16:59,292
มีอะไรเกิดขึ้นเยอะกว่า อยู่ในโลกไดโนเสาร์แบบ

276
00:16:59,292 --> 00:17:02,960
claymation นี่คือภาพอ้างอิงที่ผมสร้าง

277
00:17:02,960 --> 00:17:06,628
มีไดโนเสาร์กับแมมมอธขนปุกปุยตัวเล็ก ๆ

278
00:17:06,628 --> 00:17:10,594
ซับซ้อนขึ้นมาหน่อย มาดูว่ามันจัดการยังไง

279
00:17:10,594 --> 00:17:13,767
ผมพิมพ์ว่า 'คราวนี้อธิบายอันนี้'

280
00:17:13,767 --> 00:17:17,236
แม้โมเดลวิทัศน์ Qwen จะรองรับวิดีโอ

281
00:17:17,236 --> 00:17:20,706
แต่การตั้งค่าปัจจุบันของ MCP server

282
00:17:20,706 --> 00:17:24,375
และเครื่องมือที่มีอยู่รองรับได้แค่ภาพ

283
00:17:24,375 --> 00:17:28,836
เราจะเน้นภาพก่อน 'อธิบายภาพนี้ด้วย vision MCP

284
00:17:28,836 --> 00:17:33,396
server' ดูมันทำงาน เห็นการเรียกเครื่องมือ ชื่อ

285
00:17:33,396 --> 00:17:37,858
MCP DS4 vision describe image มันกำลังรันอยู่

286
00:17:37,858 --> 00:17:42,319
โอเค นี่คือผลลัพธ์ ใช้เวลาไม่นาน สองสามวินาที

287
00:17:42,319 --> 00:17:45,690
ประมาณ 20 วินาที ภาพคือ claymation

288
00:17:45,690 --> 00:17:47,573
สไตล์ความละเอียดสูง

289
00:17:47,573 --> 00:17:52,134
ในสภาพแวดล้อมยุคก่อนประวัติศาสตร์อันเขียวชอุ่ม

290
00:17:52,134 --> 00:17:54,811
ตัวเอกคือแมมมอธกับไดโนเสาร์

291
00:17:54,811 --> 00:17:58,776
มันอธิบายได้ละเอียดดีทีเดียว น่าประทับใจ

292
00:17:58,776 --> 00:18:02,345
มันจับสภาพแวดล้อมและพื้นหลังได้ดีมาก

293
00:18:02,345 --> 00:18:05,815
ภูมิประเทศหินเขียวชอุ่ม ท้องฟ้า แสง

294
00:18:05,815 --> 00:18:08,690
และสื่อกลางภาพ (middleground)

295
00:18:08,690 --> 00:18:13,548
นี่คือคำอธิบายที่ค่อนข้างดีของสิ่งที่เราเห็นในภาพ

296
00:18:13,548 --> 00:18:17,018
**ทดสอบ OCR กับภาพความละเอียดต่ำ:**

297
00:18:17,018 --> 00:18:21,380
ลองกลับไปที่ภาพแรก ไม่รู้ว่าหน้าจอคุณเห็นไหม

298
00:18:21,380 --> 00:18:25,742
แต่มันความละเอียดต่ำมาก ดูสิว่ามันอ่านได้ไหม

299
00:18:25,742 --> 00:18:29,807
และอันนี้ใช้ URL ไม่ใช่ไฟล์ในเครื่อง โอเค

300
00:18:29,807 --> 00:18:33,574
ภาพคือแบนเนอร์โปรโมตดิจิทัล จริง ๆ คือ

301
00:18:33,574 --> 00:18:38,135
thumbnail ข้อความที่เห็นคือ 'Ultimate Guide to

302
00:18:38,135 --> 00:18:41,704
Hermes Desktop Plugins' ตัวใหญ่สีขาว

303
00:18:41,704 --> 00:18:46,066
มันอ่านถูกต้อง คิดว่านี่คือข้อความเดียวบนภาพ

304
00:18:46,066 --> 00:18:49,140
อ่านได้ น่าประทับใจ อย่างที่บอก

305
00:18:49,140 --> 00:18:51,915
ภาพนี้ความละเอียดค่อนข้างต่ำ

306
00:18:51,915 --> 00:18:55,782
แผงซ้ายคือกราฟหุ้น (stock chart) ด้านบน

307
00:18:55,782 --> 00:18:58,459
แล้วก็ราคา มันอ่านได้จริง ๆ

308
00:18:58,459 --> 00:19:02,127
ผมว่าผมยังอ่านไม่ออกเลย มันเบลอเกินไป

309
00:19:02,127 --> 00:19:05,200
แต่มันอ่านบางอย่างจากกราฟนี้ได้

310
00:19:05,200 --> 00:19:08,968
แผงขวาคือหน้าต่าง Hermes Plugin ด้านบน

311
00:19:08,968 --> 00:19:11,545
ตามด้วยรายการปลั๊กอินซ้ำ ๆ

312
00:19:11,545 --> 00:19:17,890
อันนั้นมันพลาด นี่คือตัวอย่างของ hallucination เพราะแผงขวาจริง ๆ

313
00:19:17,890 --> 00:19:20,468
คือลิสต์เพลย์ลิสต์ Spotify

314
00:19:20,468 --> 00:19:23,839
นี่คือตัวอย่างสิ่งที่มันมองไม่เห็น

315
00:19:23,839 --> 00:19:26,615
และไม่ใช่ความผิดของ DeepSeek

316
00:19:26,615 --> 00:19:29,985
มันคือโมเดลวิทัศน์ที่มองไม่เห็นเอง

317
00:19:29,985 --> 00:19:32,365
**บทเรียนจากภาพที่สาม:**

318
00:19:32,365 --> 00:19:36,529
มันคือกราฟิกโปรโมตเกี่ยวกับปลั๊กอิน Hermes

319
00:19:36,529 --> 00:19:37,627
Desktop

320
00:19:37,627 --> 00:19:41,890
สิ่งหลักที่ผมอยากเช็คคือมันอ่านหัวข้อได้ไหม

321
00:19:41,890 --> 00:19:46,450
และมันก็อ่านได้ชัดเจน และยังเห็นส่วนที่เล็กมาก

322
00:19:46,450 --> 00:19:50,614
บอกได้ว่านี่คือกราฟหุ้น น่าประทับใจทีเดียว

323
00:19:50,614 --> 00:19:53,588
แต่นี่ก็ดีเพราะเราเห็นข้อจำกัด

324
00:19:53,588 --> 00:19:57,157
ถ้าโมเดลวิทัศน์พลาดอะไรบางอย่าง เช่น

325
00:19:57,157 --> 00:20:00,627
แผงขวาไม่เกี่ยวกับกราฟหุ้น DeepSeek

326
00:20:00,627 --> 00:20:04,692
ก็ทำอะไรไม่ได้ มันต้องยอมรับภาพหลอนนั้นไป

327
00:20:04,692 --> 00:20:08,856
**ข้อแลกเปลี่ยน:** นี่คือสรุปข้อแลกเปลี่ยน

328
00:20:08,856 --> 00:20:12,425
(trade-offs) ที่คุณจะเจอ โปรไฟล์ DS4

329
00:20:12,425 --> 00:20:16,490
ปกติของผมบน DGX Spark: เช็กพอยต์ DeepSeek

330
00:20:16,490 --> 00:20:20,753
มีหน่วยความจำราว ๆ 80 กิกะไบต์ และคอนเท็กซ์

331
00:20:20,753 --> 00:20:25,214
240,000 โทเคน และคุณเห็นกับโปรไฟล์ DS4 Vision

332
00:20:25,214 --> 00:20:29,279
แบบอยู่ร่วมกัน (coexistent) บวกโมเดล Qwen

333
00:20:29,279 --> 00:20:33,244
ข้อแลกเปลี่ยนอยู่ด้านล่าง: ในโหมดวิทัศน์

334
00:20:33,244 --> 00:20:36,913
ผมใช้คอนเท็กซ์ได้น้อยลงมาก แค่ 65,000

335
00:20:36,913 --> 00:20:40,482
โทเคนต่อวินโดว์ ใช้ได้แค่หนึ่ง batch

336
00:20:40,482 --> 00:20:43,158
และใช้ได้แค่ plain decoding

337
00:20:43,158 --> 00:20:47,421
ซึ่งทำให้ช้ากว่าปกติ ผลคือคอนเท็กซ์ลดลง 72%

338
00:20:47,421 --> 00:20:51,982
ผมน่าจะปรับแต่งให้ดีกว่านี้ได้ แต่อย่างที่เห็น

339
00:20:51,982 --> 00:20:55,948
คอนเท็กซ์ต้องลดลงอย่างมาก เพราะ KV cache

340
00:20:55,948 --> 00:21:00,211
กินพื้นที่เยอะมากตอนนี้ และผมมักมี watchdog

341
00:21:00,211 --> 00:21:04,771
คอยดูแลหน่วยความจำ แต่ต้องปิดมันระหว่างเดโมนี้

342
00:21:04,771 --> 00:21:09,133
เพราะมันใกล้ขีดจำกัดเกินไป ผมต้องปิดชั่วคราว

343
00:21:09,133 --> 00:21:12,801
เพราะระบบนี้กินหน่วยความจำมากกว่าปกติ

344
00:21:12,801 --> 00:21:17,263
คุณต้องคำนึงถึงเรื่องนี้ **ความเห็นปิดท้าย:**

345
00:21:17,263 --> 00:21:20,931
ผมประทับใจคุณภาพของโมเดลวิทัศน์จริง ๆ

346
00:21:20,931 --> 00:21:24,599
มันมองภาพได้ค่อนข้างดี แม้แต่ภาพยาก ๆ

347
00:21:24,599 --> 00:21:27,375
แต่ก็มีข้อแลกเปลี่ยนที่สำคัญ

348
00:21:27,375 --> 00:21:31,341
แต่ก็ยังน่าสนใจอยู่ดี ตัว vision sidecar

349
00:21:31,341 --> 00:21:34,315
นี่คือการทดลองดู repo ทดลองนี้

350
00:21:34,315 --> 00:21:37,884
เพราะในแง่แนวคิด ผมว่ามันพัฒนาต่อได้

351
00:21:37,884 --> 00:21:43,733
และปรับแต่งให้มีประสิทธิภาพขึ้นโดยไม่ต้องแลกอะไรหนักขนาดนี้

352
00:21:43,733 --> 00:21:48,294
ถ้าอยากลองด้วยตัวเอง ตามที่บอก ไปดู Mia AI Lab

353
00:21:48,294 --> 00:21:52,755
ได้ เธอมีสูตร (recipes) หลากหลาย ลองดูบัญชี X

354
00:21:52,755 --> 00:21:56,027
ของเธอ Mia AI Lab จบวิดีโอเท่านี้

355
00:21:56,027 --> 00:21:58,208
หวังว่าคุณจะสนุกกับมัน

356
00:21:58,208 --> 00:22:01,678
ผมว่าเป็นแนวคิดที่น่าสนใจที่จะทดลอง

357
00:22:01,678 --> 00:22:05,544
ทิ้งคอมเมนต์ไว้ได้ บอกความคิดเห็นของคุณ

358
00:22:05,544 --> 00:22:08,320
แล้วพบกันใหม่ ขอบคุณที่รับชม