Adding Vision to a Text-Only LLM: A Local DS4-Flash Experiment
สรุปย่อ
ประเด็นสำคัญจากวิดีโอ
- **ช่อง:** Tonbi's AI Garage · **ความยาว:** ~22 นาที · **ลิงก์:** https://www.youtube.com/watch?v=79txDFqcrpU
# สรุป: Adding Vision to a Text-Only LLM: A Local DS4-Flash Experiment - **ช่อง:** Tonbi's AI Garage · **ความยาว:** ~22 นาที · **ลิงก์:** https://www.youtube.com/watch?v=79txDFqcrpU ## ประเด็นหลัก - DeepSeek V4 Flash ที่รันบน DGX Spark เป็นโมเดล text-only ที่เก่งด้านโค้ดและเอเจนต์ แต่ไม่มีวิทัศน์ เพราะเช็กพอยต์ไม่มี vision tower, projector และ image processor - วิธีแก้แบบเดิมสองแบบไม่น่าพอใจ: เทรนใหม่ให้เห็นภาพ (หนักและใช้เวลาหลายเดือน) หรือสลับไปใช้โมเดล multimodal เล็ก (เสียพลังของ DeepSeek) - แนวคิดของ Mia AI Lab: 'จ้างตา' ให้โมเดล โดยรันโมเดลวิทัศน์เล็ก (Qwen 3 VL 4B, 4 พันล้านพารามิเตอร์) เป็น sidecar บนพอร์ต 8889 คอยบรรยายภาพเป็นข้อความ แล้วให้ DeepSeek อ่านข้อความนั้นใช้เหตุผลต่อ พิกเซลไม่เคยไปถึงสมอง - สะพานเชื่อมคือ MCP server ที่มี 3 เครื่องมือ: describe image, OCR image และ compare images (สูงสุด 4 ภาพ) แปลงภาพเป็น base64 แล้วเรียก OpenAI compatible API ของ sidecar - ตั้งค่า sidecar แบบ deterministic (temperature 0, ปิดการคิด) เพราะมันคือบริการสกัดข้อมูล ไม่ใช่แชตบอต ภาพเดียวกันต้องให้รายงานเดียวกัน - ราคาที่ต้องจ่าย: KV cache ลดจาก 2.49 ล้านโทเคนเหลือ 1.37 ล้านโทเคน คอนเท็กซ์ลดลง 72% (จาก 240,000 เหลือ 65,000 โทเคน) และต้องปิด memory watchdog ระหว่างเดโม - ข้อจำกัดคือ 'เกมโทรศัพท์ต่อคำ': ถ้าตาพลาดรายละเอียด สมองก็ไม่มีทางรู้ เพราะฉะนั้นคำอธิบายคือหลักฐาน (evidence) ไม่ใช่ความจริงสูงสุด (ground truth) - ทดสอบจริง 3 ภาพ: ภาพอนิเมะ 3D cutout (จับได้ว่าตัวละครทำจากกระดาษแข็ง), ภาพ claymation ไดโนเสาร์ (บรรยายละเอียดดี) และ thumbnail ความละเอียดต่ำ (อ่านหัวข้อได้ แต่ hallucinate แผงขวาที่จริงเป็นเพลย์ลิสต์ Spotify) - ข้อดี: ไม่ต้องเทรนใหม่ ได้พลัง reasoning เต็มของ DeepSeek มีเธรดสนทนาเดียว เปิดปิดได้ และใช้กับแฮร์เนสที่รองรับ MCP ได้ทุกตัว - ผู้สร้างให้ดาวน์โหลด repo ได้จาก GitHub ของ Mia AI Lab และแนะนำโปรเจกต์ agentwiks.com ของตัวเอง ## ความเห็นสรุป วิดีโอนี้อธิบายแนวคิด 'เปลี่ยนวิทัศน์ให้เป็นเครื่องมือ' ได้ชัดเจนและทดสอบจริงครบวงจร ทั้งสถาปัตยกรรม การติดตั้ง และข้อแลกเปลี่ยน แม้ระบบจะยังเป็น experimental และมีข้อจำกัดเรื่องคอนเท็กซ์ แต่เป็นแนวทางที่ใช้งานได้จริงกับฮาร์ดแวร์เครื่องเดียว เหมาะสำหรับคนที่รันโมเดล local แล้วอยากได้ความสามารถมองภาพโดยไม่ทิ้งโมเดลหลัก
คำแปลเต็ม
แปลตามบทสนทนาต้นฉบับ ปรับเป็นภาษาไทยธรรมชาติ
**เปิดตัวการทดลอง:** อย่างที่เห็น ผมอยู่ใน Hermes agent และนี่คือเทอร์มินัลเซสชันที่ผม SSH เข้าไปยังเครื่อง DGX Spark ของผม ซึ่งเป็นที่ที่รันโมเดล DeepSeek เวอร์ชัน 4/0731 ในเครื่อง (local) ผมให้มันดูภาพนี้ซึ่งเป็นภาพตัวอย่าง (thumbnail) ของวิดีโอเก่า ๆ ของผม แล้วถามว่ามันบอกได้ไหมว่ารูปนี้คืออะไร ผมส่ง URL ของรูปให้โมเดล มันลองใช้เครื่องมือหลายตัว แต่สุดท้ายก็บอกว่าระบุเนื้อหาในภาพตัวอย่างไม่ได้ เพราะเครื่องมือวิทัศน์บนเครื่องนี้เป็น text-only เนื่องจากโมเดล DS4 ตัวนี้เป็น text-only ไม่มีความสามารถด้านวิทัศน์ในตัว
**ปัญหา:** แล้วจะทำยังไงดี? โมเดลนี้เก่งมาก เป็นโมเดลเขียนโค้ดที่เยี่ยม เป็นโมเดลเอเจนต์ที่ยอดเยี่ยม แต่มันไม่มีวิทัศน์ และงานหลายอย่างของผมต้องใช้วิทัศน์ด้วย ผมเคยคิดว่าไม่มีทางแก้ ต้องใช้โมเดล multimodal แล้วลืม DeepSeek ไปซะ แต่แล้วผมก็มาเจอโพสต์ของ Mia AI Lab ถ้าสนใจโมเดล local หรือ AI โดยรวม บัญชีนี้ติดตามได้ดีมาก เธออธิบายเรื่องระบบรองรับวิทัศน์แบบทดลอง (experimental) สำหรับโมเดล DeepSeek เวอร์ชัน 4 Flash ที่รันในเครื่อง เธอใช้ DGX Spark สองตัว ส่วนผมใช้ตัวเดียว วิธีที่เธอทำน่าสนใจมาก มันเป็นระบบทดลองขั้นสูง คาดเดาได้ว่าจะมีบั๊กบ้าง เธอบอกว่า 'จำไว้ ตอนนี้ยังเป็นเวอร์ชันทดลอง คุณจะเสีย KV cache ไปเยอะมาก' มันอาจไม่ใช่วิธีที่ประหยัดที่สุด แต่ผมว่าเป็นไอเดียที่น่าสนใจ
**แผนวันนี้:** ในวิดีโอนี้ ผมจะอธิบายว่า Mia ทำได้ยังไง นั่นคือการให้ดวงตากับโมเดลที่ตาบอด เราจะทดสอบมัน ผมจะอธิบายสถาปัตยกรรมของการตั้งค่าแบบนี้ แล้วก็ทดสอบจริง ผมจะติดตั้งส่วนวิทัศน์เข้ากับโมเดล V4 local ของผม แล้วดูว่ามันอ่านภาพตัวอย่างได้หรือยัง ระบบนี้จะประมวลผลทั้งภาพและข้อความได้แล้ว เริ่มกันเลย
**โปรโมตโปรเจกต์:** ถ้าคุณรันเอเจนต์เองและอยากได้ LM wikis ที่ผมใช้ทำวิจัยและสร้างวิดีโอเหล่านี้ ลองดูโปรเจกต์ของผมที่ agentwiks.com ผมให้ wiki เหล่านี้ฟรีในหลายหัวข้อ และคุณสมัครโปรแบบ $9.99 ต่อเดือนได้ จะได้เข้าถึง wiki ขนาดใหญ่พิเศษ (super-sized extra-large) ที่มีหน้ามากขึ้นและรายละเอียดในแต่ละหัวข้อมากขึ้น
**ที่มาของ repo:** กลับมาที่วิดีโอ ตัว repo เองคือ Mia AI Lab และนี่คือ DeepSeek เวอร์ชัน 4 ของเธอ ซึ่งออกแบบมาสำหรับ DGX Spark สองตัว แต่ผมจะรันบนตัวเดียว ข้อมูลทั้งหมดอยู่ใน GitHub ลองดูได้ถ้าอยากลองทำเอง ที่ผมทำคือส่ง repo นี้ให้เอเจนต์ของผมปรับให้เข้ากับการตั้งค่าของผมเอง
**สถาปัตยกรรมและแนวคิด:** นี่คือแนวคิดและวิธีที่เขาทำ นี่คือปัญหาก่อน: DeepSeek เวอร์ชัน 4 Flash ที่รันบน DGX Spark ของผม มีความสามารถ reasoning เชิงลึก ใช้เครื่องมือ (tool use) และเวิร์กโฟลว์เอเจนต์ทั้งหมดบนฮาร์ดแวร์ของตัวเอง มันเป็นโมเดลที่ทรงพลังมาก เคยเห็นผมทดสอบมาก่อน มันจัดการงานเขียนโค้ดที่น่าประทับใจได้ แม้แต่บน DGX Spark ตัวเดียวก็ยังเก่งและค่อนข้างเร็ว นี่คือโมเดลที่ผมอยากให้มาตอบคำถาม
**ทำไมตาบอด:** คุณเคยเห็นมาก่อนแล้ว วางภาพ screenshot เข้าไป โมเดลตาบอดสนิท ประมวลผลไม่ได้ เพราะเช็กพอยต์นี้ไม่มี vision tower ไม่มี projector ไม่มี image processor สิ่งเหล่านี้ไม่ใช่แค่การตั้งค่าที่เปิดปิดได้ในโมเดล local พวกมันคือชิ้นส่วนของโครงข่ายประสาทที่ไม่ได้ถูกสร้างมาเลย มันไม่ใช่สิ่งที่โมเดลนี้ให้ความสำคัญ
**สองทางแก้อันเดิม:** มีวิธีแก้ง่าย ๆ สองวิธี แต่ทั้งคู่ก็ไม่ค่อยดี วิธี A คือเทรนใหม่ให้มันเห็นภาพเต็มรูปแบบ ซึ่งเป็นงานหนักทั้งแรงคนและ GPU คงต้องใช้เวลาเป็นเดือน ต้องเทรนด้วย vision encoder และ projector แล้ว fine-tune ด้วยข้อมูลภาพ อย่างที่คิดไว้ นี่คือสิ่งที่ AI labs ทำ ไม่ใช่สิ่งที่คนเดียวจะทำได้ โดยเฉพาะในกรอบเวลาสั้น ๆ วิธี B คือสลับไปใช้โมเดลวิทัศน์ แทนที่สแต็กทั้งหมดด้วยโมเดล multimodal ที่เล็กกว่า แต่คุณจะแลกสมองกับดวงตา ไม่ได้พลังทั้งหมดของโมเดล DeepSeek
**ทางเลือกที่สาม:** และมีทางเลือกที่สาม ซึ่งคือสิ่งที่เราจะทำวันนี้: ไม่ต้องสอนให้มันเห็น แต่จ้างตาคู่หนึ่งให้มัน แนวคิดคือ รันโมเดลวิทัศน์ขนาดเล็กไว้ข้าง ๆ โมเดล DeepSeek ตัวใหญ่ เมื่อมีภาพเข้ามา โมเดลเล็กจะดูภาพแล้วเขียนสิ่งที่เห็น โมเดลใหญ่จะอ่านข้อความนั้นแล้วใช้เหตุผลหรือทำสิ่งที่ต้องทำ วิทัศน์ไม่ได้เป็นความสามารถของโมเดลอีกต่อไป แต่กลายเป็นเครื่องมือที่โมเดลเรียกใช้ นี่คือแนวคิดหลักของระบบวิทัศน์ทดลองนี้ วิทัศน์กลายเป็นเครื่องมือ พิกเซลไม่เคยไปถึงสมองเลย
**ขั้นตอนการทำงาน:** มาดูทีละขั้น: มีภาพเข้ามา เป็นไฟล์ local path หรือ URL อย่างที่ผมให้ไปก่อนหน้านี้ MCP server โหลดภาพ ลดขนาดภาพที่ใหญ่เกินไป แล้วแปลงเป็น base64 data URI จากนั้นก็ถึงโมเดล Qwen 3 VL 4B โมเดลเล็ก ๆ แต่นี่คือโมเดลวิทัศน์ นี่คือดวงตา หรือที่ผมจะเรียกว่า sidecar โมเดลวิทัศน์ 4 พันล้านพารามิเตอร์ตัวนี้รันบนพอร์ต 8889 พร้อม ๆ กัน รับพิกเซลเข้ามา ด้วย temperature เป็นศูนย์ หมายความว่าไม่มีการคิด ระบบจะ deterministic ให้มากที่สุดเท่าที่จะทำได้ และจะคืนคำอธิบายข้อเท็จจริงที่แม่นยำ ข้อความ OCR หรือการเปรียบเทียบ มันแค่ต้องอ่านพิกเซลแล้วอธิบายให้ชัดที่สุด กลายเป็นข้อความธรรมดา เป็นคำพูดเฉย ๆ นี่คือสิ่งเดียวที่ส่งระหว่างโมเดลสองตัว นั่นคือคำอธิบาย ข้อความที่สกัดได้ หรือ diff
**ฝั่งสมอง:** จากนั้นก็ถึงโมเดล DeepSeek ตัวหลักของเราที่รันบนอีกพอร์ตหนึ่ง มันอ่านคำอธิบายเหมือนข้อความธรรมดา แล้วคิดทบทวนแบบเต็มความพยายาม (full effort) มันไม่เคยได้รับภาพต้นฉบับ มีแต่คำอธิบายที่โมเดลวิทัศน์เล็ก ๆ เขียนไว้ แล้วมันก็จะตอบคุณ นี่คือทั้งระบบ ง่าย ๆ ตรงไปตรงมา แต่ค่อนข้างฉลาด: ดวงตาบรรยาย สมองใช้เหตุผล แต่ละโมเดลทำในสิ่งที่มันถนัด และสมองไม่เคยแตะพิกเซล
**ตัวดวงตา (sidecar):** โมเดลวิทัศน์ของเรา หรือ sidecar ตั้งใจให้เล็กและเรียบง่าย มีแค่ 4 พันล้านพารามิเตอร์ ใช้ GPU memory แค่ 4% อุณหภูมิเป็นศูนย์และปิดการคิด อุณหภูมิศูนย์แปลว่า deterministic มากที่สุด ไม่มีความคิดสร้างสรรค์ ไม่มีความคิดเห็นใด ๆ และต้องเป็นโมเดลเล็กแน่นอน เพราะคุณรันโมเดล DeepSeek ไปพร้อมกัน หน่วยความจำบน DGX Spark มีจำกัด
**ทำไมต้องเคร่งขนาดนั้น?** เพราะ sidecar คือบริการสกัดข้อมูล (extraction service) ไม่ใช่แชตบอต มันเป็นโมเดลแยกต่างหาก แต่ไม่ใช่ตัวที่คุณจะคุยด้วย มันมีบทบาทที่ชัดเจน และเป็นบทบาทที่น่าเบื่อมาก มันไม่คุย ไม่คาดเดา ไม่ตอบผู้ใช้ มันดูพิกเซลแล้วรายงานข้อเท็จจริง คำอธิบาย OCR การเปรียบเทียบ ดังนั้นตั้งค่าให้ deterministic: ภาพเดียวกันให้รายงานเดียวกัน และนั่นสำคัญ คุณอยากให้ deterministic มากที่สุด คำว่า deterministic หมายถึงอินพุตเดียวกันให้เอาต์พุตเดียวกันทุกครั้ง
**สะพานเชื่อม (bridge):** สะพานเชื่อมก็สำคัญในระบบนี้เช่นกัน มี MCP tools สามตัวที่ใช้ และคุณจะเห็นเอเจนต์ใช้เครื่องมือเหล่านี้ หรืออย่างน้อยก็พยายามใช้ ผมปิดมันไว้ตอนนี้ แต่ระบบจะพยายามใช้ describe image มีสามตัว: describe image, OCR image และ compare images ซึ่งเปรียบเทียบภาพได้ถึงสี่ภาพเทียบข้างกัน มันรับ local paths หรือ URLs แปลงเป็น base64 แล้วเรียก OpenAI compatible API ของ sidecar ระบบนี้ auto register เข้ากับ agent harnesses มากกว่า 11 ตัว เราจะใช้ Hermes agent สำหรับการทดลองนี้ แต่จากมุมมองของโมเดล reasoning การเห็นภาพก็ไม่ต่างจากการรันคำสั่งเชลล์ คุณเรียกเครื่องมือ แล้วข้อความก็กลับมา สำหรับโมเดล DeepSeek ของเรา มันแค่รันสิ่งนี้เป็น MCP tool เท่านั้น
**กฎสี่ข้อ:** มีกฎสี่ข้อเพื่อให้ระบบซื่อสัตย์ หนึ่ง เมื่อมีการกล่าวถึงภาพ ให้เรียก describe image หรือ OCR image เมื่อข้อความในภาพคือประเด็น บ่อยครั้งที่คุณอยากอ่านข้อความที่อยู่ในภาพ นั่นคือสิ่งที่ใช้ สอง ให้ถือว่าสิ่งที่กลับมาคือหลักฐาน (evidence) ไม่ใช่ความจริงสูงสุด (ground truth) เพราะมันคือการตีความสิ่งที่เห็น โดยเฉพาะถ้าภาพไม่ชัดหรือค่อนข้างนามธรรม สาม คำตอบสุดท้ายต้องมาจาก DeepSeek เสมอ ห้ามให้โมเดลเล็กตอบผู้ใช้ และ repo ย้ำเรื่องนี้หนักมาก สี่ ห้ามส่งพิกเซลไปที่พอร์ต 888 เด็ดขาด นั่นคือพอร์ตของโมเดล DeepSeek สมองเป็น text-only และต้องเป็นแบบนั้นต่อไป
**ราคาที่ต้องจ่าย:** ดวงตาไม่ได้ฟรี คุณต้องจ่ายด้วยคอนเท็กซ์ และนี่คือสิ่งที่ Mia พูดถึงเรื่อง KV cache คุณจะได้ KV cache 2.49 ล้านโทเคนจากโหมด text-only ของโมเดล DeepSeek เอง แต่พอเป็นโหมดวิทัศน์ สมองเหลือ 1.37 ล้านโทเคน sidecar ทำให้สมองเสียหน่วยความจำทำงานไปเกือบครึ่งหนึ่ง ค่อนข้างเยอะ Mia เตือนไว้อย่างที่เห็นว่า ตอนนี้ยังเป็นเวอร์ชันทดลอง และคุณจะเสีย KV cache ไปเยอะ คุณเห็นเหตุผลแล้ว นี่คือเหตุผลที่ระบบนี้ปิดเป็นค่าเริ่มต้น คุณควรใช้มันเมื่อจำเป็นต้องใช้วิทัศน์จริง ๆ เท่านั้น
**ข้อจำกัด:** ข้อจำกัดคือเกมโทรศัพท์ต่อคำ (telephone game) และนี่คือเหตุผลที่ระบบนี้อาจไม่สมบูรณ์แบบนัก เพราะสมองไม่เคยตรวจสอบพิกเซล ถ้าตาพลาดรายละเอียดไป รายละเอียดนั้นก็เหมือนไม่มีอยู่จริง เราจะทดสอบกันว่ามันทำงานดีแค่ไหนกับภาพสองสามภาพ แต่ถ้ามีคำอธิบายที่ไม่สมบูรณ์หรือผิด มันจะเข้าไปในโมเดล reasoning และกลายเป็นพื้นฐานของคำตอบที่ผิด นี่คือเหตุผลที่ถือว่ามันเป็นหลักฐาน ไม่ใช่ความจริงสูงสุด
**สิ่งที่ได้:** แต่คุณได้เก็บโมเดลฐานไว้โดยไม่ต้องเทรนใหม่ ได้พลังและความสามารถ reasoning ทั้งหมดของ DeepSeek คุณได้เธรดการสนทนาเดียว โมเดลตอบคำถามตัวเดียว โดยไม่ต้องสลับไปมาระหว่างโมเดลหลายตัว และได้คำอธิบาย OCR และการเปรียบเทียบภาพ มันทำงานกับแฮร์เนสที่รองรับ MCP ทุกตัว และเปิดปิดได้ตามต้องการ มันเป็นระบบทดลองและเป็นงานประปา (plumbing) ที่ทำเสร็จในวันเดียว เราจะทำตอนนี้เลย
**เริ่มลงมือ:** นี่คือบทสรุปของผม แนวคิดง่าย ๆ แต่ความเรียบง่ายนี่แหละที่ทำให้มันใช้งานได้ เรามาลองกัน ผมจะเริ่มเซสชันใหม่ นี่คือโปรไฟล์เริ่มต้นของ Spark agent ของผม และผมตั้งค่าผ่าน GBT Soul เพราะผมไม่สามารถใช้ repo ตามเดิมได้ เนื่องจากผมใช้ DGX Spark แค่ตัวเดียวและสูตรการตั้งค่าต่างจากของ Mia ที่ใช้สองตัว ผมเลยต้องปรับแต่งเล็กน้อย ให้เอเจนต์ของผมจัดการ คุณเห็นว่ามันรันอยู่แล้ว โมเดลเดียวกันคือโมเดลวิทัศน์ Qwen และคุณเห็น MCP tools ที่ถูกค้นพบ นี่คือสองหน้าต่างต่างกัน อันนี้คือโปรไฟล์เริ่มต้นที่ผมตั้งค่าทุกอย่างไว้ และอันนี้คือโมเดล DeepSeek local ที่รันอยู่จริง นี่คือสิ่งที่เราจะใช้ และคุณเห็นเครื่องมือสามตัว: describe image, OCR image และ compare images ทุกอย่างพร้อมแล้ว
**ทดสอบภาพแรก:** ลองอันแรก ซึ่งรันบน Spark ในเครื่อง ผมสร้างภาพนี้ด้วยโมเดล Cray 2 มาดูกัน ผมจะคัดลอกแล้วดูว่ามันบอกได้ไหมว่ารูปนี้คืออะไร เพราะภาพนี้ค่อนข้างชัดเจน เป็นสาวอนิเมะคนเดียว กลับมาที่นี่ ผมพิมพ์ว่า 'อธิบายว่ามีอะไรอยู่ในภาพนี้ให้ละเอียดที่สุด' เราจะลองสองสามภาพ ดูว่าจะได้รายละเอียดแค่ไหน อันนี้น่าจะตรงไปตรงมา ควรทำได้ง่าย และเราจะลองกับข้อความด้วย เพราะอยากรู้ว่า OCR image จะทำได้แค่ไหน
**เจอปัญหาเล็กน้อย:** อย่างที่เห็น มันล่ม (down) ไปชั่วครู่ อย่างที่บอก มันเป็นระบบทดลอง เราอาจเจอข้อผิดพลาดแบบนี้ ลองแก้ดู โอเค กลับมาทำงานได้แล้ว ปัญหาไม่เกี่ยวกับ vision sidecar เลย แต่เกี่ยวกับวิธีตั้งค่า memory watchdog ของผม เพราะผมมักรันอะไรหลายอย่างพร้อมกันบน Spark เสมอ ผมมี memory watchdog ที่จะปิดระบบบางอย่างถ้าสถานการณ์เริ่มเสี่ยง แต่แก้ได้แล้ว ลองอีกครั้ง 'อธิบายว่ามีอะไรอยู่ในภาพนี้ให้ละเอียดที่สุด' จริง ๆ แล้วไม่ใช่ปัญหาของ vision sidecar แต่เป็นวิธีตั้งค่า Spark ของผม
**ผลลัพธ์ภาพแรก:** โอเค เราทำให้มันทำงานได้แล้ว เห็นตรงนี้ไหม ตอนเรียกเครื่องมือ มันใช้ MCP DS4 เพื่ออธิบายภาพ และเห็นว่า vision sidecar กลับมาทำงานแล้ว คำอธิบายส่งกลับมาแล้ว นี่คือสิ่งที่ได้: ธีมคือภาพประกอบสไตล์ 3D cutout ของตัวละครหญิงแนวอนิเมะ มันอธิบายรายละเอียดได้ค่อนข้างดี ตัวละครอนิเมะวัยรุ่น ผมสีน้ำตาลแดงหยักศกยาวปานกลาง ดวงตาโตสื่ออารมณ์ เสื้อผ้า ครบทุกอย่าง ทั้งท่าทาง พื้นหลัง ซึ่งจริง ๆ ไม่มีพื้นหลังอะไร มันเรียบ ๆ ซึ่งก็จริง และประเด็นของงานชิ้นนี้คือจุดที่ค่อนข้างละเอียดอ่อน ผมแปลกใจที่มันจับได้ ตัวละครทำจากกระดาษแข็ง นั่นคือไอเดีย การทำสไตล์ไลซ์ตัวละครอนิเมะ ไม่ใช่แค่ภาพประกอบธรรมดา มันจับได้ด้วยว่า ใจความของงานคือตัวละครที่ทำจากกระดาษแข็ง ซ้อนเป็นชั้น ๆ เป็นลอนลูกฟูก มีพื้นผิว พื้นหลังน้อยมาก งานนี้มันเห็นได้ดีมาก
**ทดสอบภาพที่สอง:** ลองอีกอันที่ยากขึ้นเล็กน้อย นี่คือภาพถัดไป มีอะไรเกิดขึ้นเยอะกว่า อยู่ในโลกไดโนเสาร์แบบ claymation นี่คือภาพอ้างอิงที่ผมสร้าง มีไดโนเสาร์กับแมมมอธขนปุกปุยตัวเล็ก ๆ ซับซ้อนขึ้นมาหน่อย มาดูว่ามันจัดการยังไง ผมพิมพ์ว่า 'คราวนี้อธิบายอันนี้' แม้โมเดลวิทัศน์ Qwen จะรองรับวิดีโอ แต่การตั้งค่าปัจจุบันของ MCP server และเครื่องมือที่มีอยู่รองรับได้แค่ภาพ เราจะเน้นภาพก่อน 'อธิบายภาพนี้ด้วย vision MCP server' ดูมันทำงาน เห็นการเรียกเครื่องมือ ชื่อ MCP DS4 vision describe image มันกำลังรันอยู่ โอเค นี่คือผลลัพธ์ ใช้เวลาไม่นาน สองสามวินาที ประมาณ 20 วินาที ภาพคือ claymation สไตล์ความละเอียดสูง ในสภาพแวดล้อมยุคก่อนประวัติศาสตร์อันเขียวชอุ่ม ตัวเอกคือแมมมอธกับไดโนเสาร์ มันอธิบายได้ละเอียดดีทีเดียว น่าประทับใจ มันจับสภาพแวดล้อมและพื้นหลังได้ดีมาก ภูมิประเทศหินเขียวชอุ่ม ท้องฟ้า แสง และสื่อกลางภาพ (middleground) นี่คือคำอธิบายที่ค่อนข้างดีของสิ่งที่เราเห็นในภาพ
**ทดสอบ OCR กับภาพความละเอียดต่ำ:** ลองกลับไปที่ภาพแรก ไม่รู้ว่าหน้าจอคุณเห็นไหม แต่มันความละเอียดต่ำมาก ดูสิว่ามันอ่านได้ไหม และอันนี้ใช้ URL ไม่ใช่ไฟล์ในเครื่อง โอเค ภาพคือแบนเนอร์โปรโมตดิจิทัล จริง ๆ คือ thumbnail ข้อความที่เห็นคือ 'Ultimate Guide to Hermes Desktop Plugins' ตัวใหญ่สีขาว มันอ่านถูกต้อง คิดว่านี่คือข้อความเดียวบนภาพ อ่านได้ น่าประทับใจ อย่างที่บอก ภาพนี้ความละเอียดค่อนข้างต่ำ แผงซ้ายคือกราฟหุ้น (stock chart) ด้านบน แล้วก็ราคา มันอ่านได้จริง ๆ ผมว่าผมยังอ่านไม่ออกเลย มันเบลอเกินไป แต่มันอ่านบางอย่างจากกราฟนี้ได้ แผงขวาคือหน้าต่าง Hermes Plugin ด้านบน ตามด้วยรายการปลั๊กอินซ้ำ ๆ อันนั้นมันพลาด นี่คือตัวอย่างของ hallucination เพราะแผงขวาจริง ๆ คือลิสต์เพลย์ลิสต์ Spotify นี่คือตัวอย่างสิ่งที่มันมองไม่เห็น และไม่ใช่ความผิดของ DeepSeek มันคือโมเดลวิทัศน์ที่มองไม่เห็นเอง
**บทเรียนจากภาพที่สาม:** มันคือกราฟิกโปรโมตเกี่ยวกับปลั๊กอิน Hermes Desktop สิ่งหลักที่ผมอยากเช็คคือมันอ่านหัวข้อได้ไหม และมันก็อ่านได้ชัดเจน และยังเห็นส่วนที่เล็กมาก บอกได้ว่านี่คือกราฟหุ้น น่าประทับใจทีเดียว แต่นี่ก็ดีเพราะเราเห็นข้อจำกัด ถ้าโมเดลวิทัศน์พลาดอะไรบางอย่าง เช่น แผงขวาไม่เกี่ยวกับกราฟหุ้น DeepSeek ก็ทำอะไรไม่ได้ มันต้องยอมรับภาพหลอนนั้นไป
**ข้อแลกเปลี่ยน:** นี่คือสรุปข้อแลกเปลี่ยน (trade-offs) ที่คุณจะเจอ โปรไฟล์ DS4 ปกติของผมบน DGX Spark: เช็กพอยต์ DeepSeek มีหน่วยความจำราว ๆ 80 กิกะไบต์ และคอนเท็กซ์ 240,000 โทเคน และคุณเห็นกับโปรไฟล์ DS4 Vision แบบอยู่ร่วมกัน (coexistent) บวกโมเดล Qwen ข้อแลกเปลี่ยนอยู่ด้านล่าง: ในโหมดวิทัศน์ ผมใช้คอนเท็กซ์ได้น้อยลงมาก แค่ 65,000 โทเคนต่อวินโดว์ ใช้ได้แค่หนึ่ง batch และใช้ได้แค่ plain decoding ซึ่งทำให้ช้ากว่าปกติ ผลคือคอนเท็กซ์ลดลง 72% ผมน่าจะปรับแต่งให้ดีกว่านี้ได้ แต่อย่างที่เห็น คอนเท็กซ์ต้องลดลงอย่างมาก เพราะ KV cache กินพื้นที่เยอะมากตอนนี้ และผมมักมี watchdog คอยดูแลหน่วยความจำ แต่ต้องปิดมันระหว่างเดโมนี้ เพราะมันใกล้ขีดจำกัดเกินไป ผมต้องปิดชั่วคราว เพราะระบบนี้กินหน่วยความจำมากกว่าปกติ คุณต้องคำนึงถึงเรื่องนี้
**ความเห็นปิดท้าย:** ผมประทับใจคุณภาพของโมเดลวิทัศน์จริง ๆ มันมองภาพได้ค่อนข้างดี แม้แต่ภาพยาก ๆ แต่ก็มีข้อแลกเปลี่ยนที่สำคัญ แต่ก็ยังน่าสนใจอยู่ดี ตัว vision sidecar นี่คือการทดลองดู repo ทดลองนี้ เพราะในแง่แนวคิด ผมว่ามันพัฒนาต่อได้ และปรับแต่งให้มีประสิทธิภาพขึ้นโดยไม่ต้องแลกอะไรหนักขนาดนี้ ถ้าอยากลองด้วยตัวเอง ตามที่บอก ไปดู Mia AI Lab ได้ เธอมีสูตร (recipes) หลากหลาย ลองดูบัญชี X ของเธอ Mia AI Lab
จบวิดีโอเท่านี้ หวังว่าคุณจะสนุกกับมัน ผมว่าเป็นแนวคิดที่น่าสนใจที่จะทดลอง ทิ้งคอมเมนต์ไว้ได้ บอกความคิดเห็นของคุณ แล้วพบกันใหม่ ขอบคุณที่รับชม
หมายเหตุการแปล
ความโปร่งใสเกี่ยวกับความไม่แน่นอนในต้นฉบับ
- ## จุดที่ไม่ชัดเจน / ที่ต้องใช้ดุลยพินิจ
- ไม่มีจุดที่ต้องใช้ `[ฟังไม่ชัด]` — ทุกตอนแปลได้ครบถ้วน
- คำพูดที่ถอดได้ไม่ชัด (transcription artifacts) ซึ่งแปลแบบคงความหมายและระบุไว้ตรงนี้:
- 3. **'88 80 gigabyte'** — ตัวเลขหน่วยความจำที่พูดไม่ชัด แปลเป็น 'ราว ๆ 80 กิกะไบต์'
อภิธานศัพท์เทคนิค
คำศัพท์และชื่อผลิตภัณฑ์ที่คงรูปภาษาอังกฤษ
| ศัพท์ | คำแปล / คำอธิบาย |
|---|---|
| text-only model | โมเดลที่รับได้เฉพาะข้อความ ไม่รองรับภาพ |
| vision tower | ชั้นโครงข่ายประสาทที่ใช้ประมวลผลภาพ (โมเดลนี้ไม่มี) |
| projector | ตัวฉายภาพ/เชื่อมต่อฟีเจอร์ภาพเข้ากับโมเดลภาษา |
| image processor | ตัวประมวลผลภาพ |
| multimodal model | โมเดลที่รองรับหลายรูปแบบข้อมูล (ภาพ+เสียง+ข้อความ) |
| vision encoder | ตัวเข้ารหัสภาพ ใช้ในการเทรนให้โมเดลเห็นภาพ |
| fine-tune | การปรับแต่งโมเดลเพิ่มเติมด้วยชุดข้อมูลเฉพาะ |
| sidecar | โมเดลวิทัศน์ตัวช่วยที่รันคู่กับโมเดลหลัก ทำหน้าที่เป็น 'ดวงตา' |
| MCP (Model Context Protocol) | โปรโตคอลเชื่อมต่อเครื่องมือให้โมเดลเรียกใช้ |
| MCP server / MCP tools | เซิร์ฟเวอร์/เครื่องมือที่เชื่อมต่อผ่าน MCP |
| describe image | เครื่องมือให้บรรยายภาพ |
| OCR image | เครื่องมืออ่านข้อความในภาพ (Optical Character Recognition) |
| compare images | เครื่องมือเปรียบเทียบภาพ (สูงสุด 4 ภาพ) |
| base64 data URI | รูปแบบการเข้ารหัสข้อมูลภาพเป็นข้อความสำหรับส่งผ่าน API |
| OpenAI compatible API | API ที่ใช้งานรูปแบบเดียวกับ OpenAI |
| KV cache | หน่วยความจำแคชของ key-value ที่ใช้ระหว่างการสร้างข้อความ |
| context window / tokens | กรอบคอนเท็กซ์ / หน่วยนับข้อความของโมเดล |
| deterministic | ให้ผลลัพธ์เดิมทุกครั้งเมื่ออินพุตเดียวกัน |
| temperature | ค่าควบคุมความสุ่มของคำตอบ (0 = คงที่ที่สุด) |
| hallucination | ภาพหลอน/การที่โมเดลสร้างข้อมูลที่ไม่ตรงความจริง |
| ground truth | ความจริงสูงสุด/ข้อมูลอ้างอิงที่ถูกต้อง |
| evidence | หลักฐาน (สิ่งที่ sidecar ส่งกลับมา ต้องตรวจสอบก่อนเชื่อ) |
| agent harness | โครงสร้าง/เฟรมเวิร์กที่ใช้รันเอเจนต์ |
| tool use | ความสามารถของโมเดลในการเรียกใช้เครื่องมือ |
| reasoning | การใช้เหตุผลเชิงลึกของโมเดล |
| DGX Spark | คอมพิวเตอร์ AI ส่วนตัวของ NVIDIA (ฮาร์ดแวร์ที่ใช้รันโมเดล) |
| checkpoint | ไฟล์น้ำหนักโมเดลที่เทรนเสร็จแล้ว |
| memory watchdog | โปรแกรมเฝ้าระวังหน่วยความจำ คอยปิดระบบเมื่อใกล้เต็ม |
| plain decoding | วิธีสร้างข้อความแบบธรรมดา (ช้ากว่าแบบพิเศษ) |
| telephone game | เกมโทรศัพท์ต่อคำ หมายถึงข้อมูลที่เพี้ยนเมื่อถูกส่งต่อ |
| plumbing | งานเชื่อมต่อระบบ (งานพื้นฐานที่ทำเสร็จในวันเดียว) |
| claymation | เทคนิคแอนิเมชันดินน้ำมัน |
| 3D cutout | ภาพประกอบสไตล์ตัดวางสามมิติ |
| thumbnail | ภาพตัวอย่างของวิดีโอ |
| LM wikis | ฐานความรู้ที่ผู้สร้างใช้ทำวิจัย (ที่ agentwiks.com) |
| recipes | สูตรการตั้งค่าโมเดล/ระบบ |
| DeepSeek V4 Flash (DS4-Flash) | โมเดลภาษาหลัก text-only ที่ใช้ในการทดลอง |
| Qwen 3 VL 4B | โมเดลวิทัศน์ขนาด 4 พันล้านพารามิเตอร์ ทำหน้าที่เป็นดวงตา |
| Hermes agent | เอเจนต์ที่ใช้รันการทดลองและเรียก MCP tools |
| GitHub | แพลตฟอร์มเก็บโค้ด ที่เก็บ repo ของ Mia AI Lab |
| agentwiks.com | เว็บโปรเจกต์ของผู้สร้างที่แจก wiki ฟรี |
| Mia AI Lab | บัญชีผู้สร้าง repo ต้นทาง (บน X) |
| Spotify playlist | ลิสต์เพลงใน Spotify (สิ่งที่โมเดลมองไม่เห็นในภาพทดสอบ) |
| stock chart | กราฟราคาหุ้น |
ซับไตเติ้ลภาษาไทย
ดาวน์โหลดหรือดูซับทั้งหมด
1 00:00:00,000 --> 00:00:04,164 **เปิดตัวการทดลอง:** อย่างที่เห็น ผมอยู่ใน 2 00:00:04,164 --> 00:00:08,427 Hermes agent และนี่คือเทอร์มินัลเซสชันที่ผม 3 00:00:08,427 --> 00:00:11,996 SSH เข้าไปยังเครื่อง DGX Spark ของผม 4 00:00:11,996 --> 00:00:15,962 ซึ่งเป็นที่ที่รันโมเดล DeepSeek เวอร์ชัน
เปิดดูซับไตเติ้ลทั้งหมด (358 segments)
1 00:00:00,000 --> 00:00:04,164 **เปิดตัวการทดลอง:** อย่างที่เห็น ผมอยู่ใน 2 00:00:04,164 --> 00:00:08,427 Hermes agent และนี่คือเทอร์มินัลเซสชันที่ผม 3 00:00:08,427 --> 00:00:11,996 SSH เข้าไปยังเครื่อง DGX Spark ของผม 4 00:00:11,996 --> 00:00:15,962 ซึ่งเป็นที่ที่รันโมเดล DeepSeek เวอร์ชัน 5 00:00:15,962 --> 00:00:18,341 4/0731 ในเครื่อง (local) 6 00:00:18,341 --> 00:00:21,811 ผมให้มันดูภาพนี้ซึ่งเป็นภาพตัวอย่าง 7 00:00:21,811 --> 00:00:25,083 (thumbnail) ของวิดีโอเก่า ๆ ของผม 8 00:00:25,083 --> 00:00:29,445 แล้วถามว่ามันบอกได้ไหมว่ารูปนี้คืออะไร ผมส่ง 9 00:00:29,445 --> 00:00:33,906 URL ของรูปให้โมเดล มันลองใช้เครื่องมือหลายตัว 10 00:00:33,906 --> 00:00:38,665 แต่สุดท้ายก็บอกว่าระบุเนื้อหาในภาพตัวอย่างไม่ได้ 11 00:00:38,665 --> 00:00:42,432 เพราะเครื่องมือวิทัศน์บนเครื่องนี้เป็น 12 00:00:42,432 --> 00:00:46,299 text-only เนื่องจากโมเดล DS4 ตัวนี้เป็น 13 00:00:46,299 --> 00:00:50,363 text-only ไม่มีความสามารถด้านวิทัศน์ในตัว 14 00:00:50,363 --> 00:00:54,626 **ปัญหา:** แล้วจะทำยังไงดี? โมเดลนี้เก่งมาก 15 00:00:54,626 --> 00:00:57,303 เป็นโมเดลเขียนโค้ดที่เยี่ยม 16 00:00:57,303 --> 00:01:00,079 เป็นโมเดลเอเจนต์ที่ยอดเยี่ยม 17 00:01:00,079 --> 00:01:01,864 แต่มันไม่มีวิทัศน์ 18 00:01:01,864 --> 00:01:05,631 และงานหลายอย่างของผมต้องใช้วิทัศน์ด้วย 19 00:01:05,631 --> 00:01:10,191 ผมเคยคิดว่าไม่มีทางแก้ ต้องใช้โมเดล multimodal 20 00:01:10,191 --> 00:01:14,752 แล้วลืม DeepSeek ไปซะ แต่แล้วผมก็มาเจอโพสต์ของ 21 00:01:14,752 --> 00:01:19,114 Mia AI Lab ถ้าสนใจโมเดล local หรือ AI โดยรวม 22 00:01:19,114 --> 00:01:21,295 บัญชีนี้ติดตามได้ดีมาก 23 00:01:21,295 --> 00:01:25,261 เธออธิบายเรื่องระบบรองรับวิทัศน์แบบทดลอง 24 00:01:25,261 --> 00:01:29,821 (experimental) สำหรับโมเดล DeepSeek เวอร์ชัน 4 25 00:01:29,821 --> 00:01:34,282 Flash ที่รันในเครื่อง เธอใช้ DGX Spark สองตัว 26 00:01:34,282 --> 00:01:38,248 ส่วนผมใช้ตัวเดียว วิธีที่เธอทำน่าสนใจมาก 27 00:01:38,248 --> 00:01:40,528 มันเป็นระบบทดลองขั้นสูง 28 00:01:40,528 --> 00:01:44,593 คาดเดาได้ว่าจะมีบั๊กบ้าง เธอบอกว่า 'จำไว้ 29 00:01:44,593 --> 00:01:49,054 ตอนนี้ยังเป็นเวอร์ชันทดลอง คุณจะเสีย KV cache 30 00:01:49,054 --> 00:01:53,317 ไปเยอะมาก' มันอาจไม่ใช่วิธีที่ประหยัดที่สุด 31 00:01:53,317 --> 00:01:57,580 แต่ผมว่าเป็นไอเดียที่น่าสนใจ **แผนวันนี้:** 32 00:01:57,580 --> 00:02:01,546 ในวิดีโอนี้ ผมจะอธิบายว่า Mia ทำได้ยังไง 33 00:02:01,546 --> 00:02:04,917 นั่นคือการให้ดวงตากับโมเดลที่ตาบอด 34 00:02:04,917 --> 00:02:06,206 เราจะทดสอบมัน 35 00:02:06,206 --> 00:02:10,171 ผมจะอธิบายสถาปัตยกรรมของการตั้งค่าแบบนี้ 36 00:02:10,171 --> 00:02:11,658 แล้วก็ทดสอบจริง 37 00:02:11,658 --> 00:02:15,921 ผมจะติดตั้งส่วนวิทัศน์เข้ากับโมเดล V4 local 38 00:02:15,921 --> 00:02:20,184 ของผม แล้วดูว่ามันอ่านภาพตัวอย่างได้หรือยัง 39 00:02:20,184 --> 00:02:24,249 ระบบนี้จะประมวลผลทั้งภาพและข้อความได้แล้ว 40 00:02:24,249 --> 00:02:27,323 เริ่มกันเลย **โปรโมตโปรเจกต์:** 41 00:02:27,323 --> 00:02:31,090 ถ้าคุณรันเอเจนต์เองและอยากได้ LM wikis 42 00:02:31,090 --> 00:02:34,758 ที่ผมใช้ทำวิจัยและสร้างวิดีโอเหล่านี้ 43 00:02:34,758 --> 00:02:39,319 ลองดูโปรเจกต์ของผมที่ agentwiks.com ผมให้ wiki 44 00:02:39,319 --> 00:02:43,383 เหล่านี้ฟรีในหลายหัวข้อ และคุณสมัครโปรแบบ 45 00:02:43,383 --> 00:02:46,853 $9.99 ต่อเดือนได้ จะได้เข้าถึง wiki 46 00:02:46,853 --> 00:02:50,720 ขนาดใหญ่พิเศษ (super-sized extra-large) 47 00:02:50,720 --> 00:02:55,578 ที่มีหน้ามากขึ้นและรายละเอียดในแต่ละหัวข้อมากขึ้น 48 00:02:55,578 --> 00:02:59,841 **ที่มาของ repo:** กลับมาที่วิดีโอ ตัว repo 49 00:02:59,841 --> 00:03:04,302 เองคือ Mia AI Lab และนี่คือ DeepSeek เวอร์ชัน 50 00:03:04,302 --> 00:03:08,664 4 ของเธอ ซึ่งออกแบบมาสำหรับ DGX Spark สองตัว 51 00:03:08,664 --> 00:03:12,630 แต่ผมจะรันบนตัวเดียว ข้อมูลทั้งหมดอยู่ใน 52 00:03:12,630 --> 00:03:16,992 GitHub ลองดูได้ถ้าอยากลองทำเอง ที่ผมทำคือส่ง 53 00:03:16,992 --> 00:03:18,090 repo 54 00:03:18,090 --> 00:03:23,047 นี้ให้เอเจนต์ของผมปรับให้เข้ากับการตั้งค่าของผมเอง 55 00:03:23,047 --> 00:03:25,525 **สถาปัตยกรรมและแนวคิด:** 56 00:03:25,525 --> 00:03:29,888 นี่คือแนวคิดและวิธีที่เขาทำ นี่คือปัญหาก่อน: 57 00:03:29,888 --> 00:03:34,250 DeepSeek เวอร์ชัน 4 Flash ที่รันบน DGX Spark 58 00:03:34,250 --> 00:03:37,819 ของผม มีความสามารถ reasoning เชิงลึก 59 00:03:37,819 --> 00:03:40,198 ใช้เครื่องมือ (tool use) 60 00:03:40,198 --> 00:03:44,957 และเวิร์กโฟลว์เอเจนต์ทั้งหมดบนฮาร์ดแวร์ของตัวเอง 61 00:03:44,957 --> 00:03:49,517 มันเป็นโมเดลที่ทรงพลังมาก เคยเห็นผมทดสอบมาก่อน 62 00:03:49,517 --> 00:03:53,285 มันจัดการงานเขียนโค้ดที่น่าประทับใจได้ 63 00:03:53,285 --> 00:03:55,069 แม้แต่บน DGX Spark 64 00:03:55,069 --> 00:03:58,242 ตัวเดียวก็ยังเก่งและค่อนข้างเร็ว 65 00:03:58,242 --> 00:04:01,513 นี่คือโมเดลที่ผมอยากให้มาตอบคำถาม 66 00:04:01,513 --> 00:04:05,677 **ทำไมตาบอด:** คุณเคยเห็นมาก่อนแล้ว วางภาพ 67 00:04:05,677 --> 00:04:08,850 screenshot เข้าไป โมเดลตาบอดสนิท 68 00:04:08,850 --> 00:04:13,212 ประมวลผลไม่ได้ เพราะเช็กพอยต์นี้ไม่มี vision 69 00:04:13,212 --> 00:04:17,475 tower ไม่มี projector ไม่มี image processor 70 00:04:17,475 --> 00:04:22,531 สิ่งเหล่านี้ไม่ใช่แค่การตั้งค่าที่เปิดปิดได้ในโมเดล 71 00:04:22,531 --> 00:04:23,629 local 72 00:04:23,629 --> 00:04:29,181 พวกมันคือชิ้นส่วนของโครงข่ายประสาทที่ไม่ได้ถูกสร้างมาเลย 73 00:04:29,181 --> 00:04:32,750 มันไม่ใช่สิ่งที่โมเดลนี้ให้ความสำคัญ 74 00:04:32,750 --> 00:04:37,211 **สองทางแก้อันเดิม:** มีวิธีแก้ง่าย ๆ สองวิธี 75 00:04:37,211 --> 00:04:39,987 แต่ทั้งคู่ก็ไม่ค่อยดี วิธี A 76 00:04:39,987 --> 00:04:43,358 คือเทรนใหม่ให้มันเห็นภาพเต็มรูปแบบ 77 00:04:43,358 --> 00:04:46,432 ซึ่งเป็นงานหนักทั้งแรงคนและ GPU 78 00:04:46,432 --> 00:04:50,595 คงต้องใช้เวลาเป็นเดือน ต้องเทรนด้วย vision 79 00:04:50,595 --> 00:04:54,164 encoder และ projector แล้ว fine-tune 80 00:04:54,164 --> 00:04:58,626 ด้วยข้อมูลภาพ อย่างที่คิดไว้ นี่คือสิ่งที่ AI 81 00:04:58,626 --> 00:05:02,096 labs ทำ ไม่ใช่สิ่งที่คนเดียวจะทำได้ 82 00:05:02,096 --> 00:05:05,169 โดยเฉพาะในกรอบเวลาสั้น ๆ วิธี B 83 00:05:05,169 --> 00:05:07,548 คือสลับไปใช้โมเดลวิทัศน์ 84 00:05:07,548 --> 00:05:11,316 แทนที่สแต็กทั้งหมดด้วยโมเดล multimodal 85 00:05:11,316 --> 00:05:14,786 ที่เล็กกว่า แต่คุณจะแลกสมองกับดวงตา 86 00:05:14,786 --> 00:05:18,156 ไม่ได้พลังทั้งหมดของโมเดล DeepSeek 87 00:05:18,156 --> 00:05:22,023 **ทางเลือกที่สาม:** และมีทางเลือกที่สาม 88 00:05:22,023 --> 00:05:24,799 ซึ่งคือสิ่งที่เราจะทำวันนี้: 89 00:05:24,799 --> 00:05:29,161 ไม่ต้องสอนให้มันเห็น แต่จ้างตาคู่หนึ่งให้มัน 90 00:05:29,161 --> 00:05:33,325 แนวคิดคือ รันโมเดลวิทัศน์ขนาดเล็กไว้ข้าง ๆ 91 00:05:33,325 --> 00:05:37,191 โมเดล DeepSeek ตัวใหญ่ เมื่อมีภาพเข้ามา 92 00:05:37,191 --> 00:05:40,760 โมเดลเล็กจะดูภาพแล้วเขียนสิ่งที่เห็น 93 00:05:40,760 --> 00:05:46,511 โมเดลใหญ่จะอ่านข้อความนั้นแล้วใช้เหตุผลหรือทำสิ่งที่ต้องทำ 94 00:05:46,511 --> 00:05:50,774 วิทัศน์ไม่ได้เป็นความสามารถของโมเดลอีกต่อไป 95 00:05:50,774 --> 00:05:54,442 แต่กลายเป็นเครื่องมือที่โมเดลเรียกใช้ 96 00:05:54,442 --> 00:05:58,209 นี่คือแนวคิดหลักของระบบวิทัศน์ทดลองนี้ 97 00:05:58,209 --> 00:06:00,688 วิทัศน์กลายเป็นเครื่องมือ 98 00:06:00,688 --> 00:06:05,149 พิกเซลไม่เคยไปถึงสมองเลย **ขั้นตอนการทำงาน:** 99 00:06:05,149 --> 00:06:09,610 มาดูทีละขั้น: มีภาพเข้ามา เป็นไฟล์ local path 100 00:06:09,610 --> 00:06:14,171 หรือ URL อย่างที่ผมให้ไปก่อนหน้านี้ MCP server 101 00:06:14,171 --> 00:06:18,434 โหลดภาพ ลดขนาดภาพที่ใหญ่เกินไป แล้วแปลงเป็น 102 00:06:18,434 --> 00:06:22,994 base64 data URI จากนั้นก็ถึงโมเดล Qwen 3 VL 4B 103 00:06:22,994 --> 00:06:27,456 โมเดลเล็ก ๆ แต่นี่คือโมเดลวิทัศน์ นี่คือดวงตา 104 00:06:27,456 --> 00:06:31,619 หรือที่ผมจะเรียกว่า sidecar โมเดลวิทัศน์ 4 105 00:06:31,619 --> 00:06:36,081 พันล้านพารามิเตอร์ตัวนี้รันบนพอร์ต 8889 พร้อม 106 00:06:36,081 --> 00:06:39,848 ๆ กัน รับพิกเซลเข้ามา ด้วย temperature 107 00:06:39,848 --> 00:06:43,715 เป็นศูนย์ หมายความว่าไม่มีการคิด ระบบจะ 108 00:06:43,715 --> 00:06:47,680 deterministic ให้มากที่สุดเท่าที่จะทำได้ 109 00:06:47,680 --> 00:06:52,042 และจะคืนคำอธิบายข้อเท็จจริงที่แม่นยำ ข้อความ 110 00:06:52,042 --> 00:06:54,223 OCR หรือการเปรียบเทียบ 111 00:06:54,223 --> 00:06:58,387 มันแค่ต้องอ่านพิกเซลแล้วอธิบายให้ชัดที่สุด 112 00:06:58,387 --> 00:07:01,956 กลายเป็นข้อความธรรมดา เป็นคำพูดเฉย ๆ 113 00:07:01,956 --> 00:07:05,823 นี่คือสิ่งเดียวที่ส่งระหว่างโมเดลสองตัว 114 00:07:05,823 --> 00:07:10,086 นั่นคือคำอธิบาย ข้อความที่สกัดได้ หรือ diff 115 00:07:10,086 --> 00:07:14,051 **ฝั่งสมอง:** จากนั้นก็ถึงโมเดล DeepSeek 116 00:07:14,051 --> 00:07:17,422 ตัวหลักของเราที่รันบนอีกพอร์ตหนึ่ง 117 00:07:17,422 --> 00:07:20,793 มันอ่านคำอธิบายเหมือนข้อความธรรมดา 118 00:07:20,793 --> 00:07:25,056 แล้วคิดทบทวนแบบเต็มความพยายาม (full effort) 119 00:07:25,056 --> 00:07:27,535 มันไม่เคยได้รับภาพต้นฉบับ 120 00:07:27,535 --> 00:07:30,905 มีแต่คำอธิบายที่โมเดลวิทัศน์เล็ก ๆ 121 00:07:30,905 --> 00:07:35,664 เขียนไว้ แล้วมันก็จะตอบคุณ นี่คือทั้งระบบ ง่าย ๆ 122 00:07:35,664 --> 00:07:39,531 ตรงไปตรงมา แต่ค่อนข้างฉลาด: ดวงตาบรรยาย 123 00:07:39,531 --> 00:07:43,694 สมองใช้เหตุผล แต่ละโมเดลทำในสิ่งที่มันถนัด 124 00:07:43,694 --> 00:07:48,255 และสมองไม่เคยแตะพิกเซล **ตัวดวงตา (sidecar):** 125 00:07:48,255 --> 00:07:51,328 โมเดลวิทัศน์ของเรา หรือ sidecar 126 00:07:51,328 --> 00:07:54,600 ตั้งใจให้เล็กและเรียบง่าย มีแค่ 4 127 00:07:54,600 --> 00:07:58,566 พันล้านพารามิเตอร์ ใช้ GPU memory แค่ 4% 128 00:07:58,566 --> 00:08:01,441 อุณหภูมิเป็นศูนย์และปิดการคิด 129 00:08:01,441 --> 00:08:05,704 อุณหภูมิศูนย์แปลว่า deterministic มากที่สุด 130 00:08:05,704 --> 00:08:09,967 ไม่มีความคิดสร้างสรรค์ ไม่มีความคิดเห็นใด ๆ 131 00:08:09,967 --> 00:08:14,230 และต้องเป็นโมเดลเล็กแน่นอน เพราะคุณรันโมเดล 132 00:08:14,230 --> 00:08:18,493 DeepSeek ไปพร้อมกัน หน่วยความจำบน DGX Spark 133 00:08:18,493 --> 00:08:22,458 มีจำกัด **ทำไมต้องเคร่งขนาดนั้น?** เพราะ 134 00:08:22,458 --> 00:08:26,325 sidecar คือบริการสกัดข้อมูล (extraction 135 00:08:26,325 --> 00:08:30,687 service) ไม่ใช่แชตบอต มันเป็นโมเดลแยกต่างหาก 136 00:08:30,687 --> 00:08:33,364 แต่ไม่ใช่ตัวที่คุณจะคุยด้วย 137 00:08:33,364 --> 00:08:37,924 มันมีบทบาทที่ชัดเจน และเป็นบทบาทที่น่าเบื่อมาก 138 00:08:37,924 --> 00:08:41,097 มันไม่คุย ไม่คาดเดา ไม่ตอบผู้ใช้ 139 00:08:41,097 --> 00:08:45,558 มันดูพิกเซลแล้วรายงานข้อเท็จจริง คำอธิบาย OCR 140 00:08:45,558 --> 00:08:48,731 การเปรียบเทียบ ดังนั้นตั้งค่าให้ 141 00:08:48,731 --> 00:08:52,994 deterministic: ภาพเดียวกันให้รายงานเดียวกัน 142 00:08:52,994 --> 00:08:56,662 และนั่นสำคัญ คุณอยากให้ deterministic 143 00:08:56,662 --> 00:08:59,537 มากที่สุด คำว่า deterministic 144 00:08:59,537 --> 00:09:04,296 หมายถึงอินพุตเดียวกันให้เอาต์พุตเดียวกันทุกครั้ง 145 00:09:04,296 --> 00:09:06,774 **สะพานเชื่อม (bridge):** 146 00:09:06,774 --> 00:09:10,839 สะพานเชื่อมก็สำคัญในระบบนี้เช่นกัน มี MCP 147 00:09:10,839 --> 00:09:12,623 tools สามตัวที่ใช้ 148 00:09:12,623 --> 00:09:16,589 และคุณจะเห็นเอเจนต์ใช้เครื่องมือเหล่านี้ 149 00:09:16,589 --> 00:09:20,753 หรืออย่างน้อยก็พยายามใช้ ผมปิดมันไว้ตอนนี้ 150 00:09:20,753 --> 00:09:25,016 แต่ระบบจะพยายามใช้ describe image มีสามตัว: 151 00:09:25,016 --> 00:09:29,378 describe image, OCR image และ compare images 152 00:09:29,378 --> 00:09:33,542 ซึ่งเปรียบเทียบภาพได้ถึงสี่ภาพเทียบข้างกัน 153 00:09:33,542 --> 00:09:37,904 มันรับ local paths หรือ URLs แปลงเป็น base64 154 00:09:37,904 --> 00:09:42,167 แล้วเรียก OpenAI compatible API ของ sidecar 155 00:09:42,167 --> 00:09:46,628 ระบบนี้ auto register เข้ากับ agent harnesses 156 00:09:46,628 --> 00:09:50,198 มากกว่า 11 ตัว เราจะใช้ Hermes agent 157 00:09:50,198 --> 00:09:53,965 สำหรับการทดลองนี้ แต่จากมุมมองของโมเดล 158 00:09:53,965 --> 00:09:55,063 reasoning 159 00:09:55,063 --> 00:09:58,929 การเห็นภาพก็ไม่ต่างจากการรันคำสั่งเชลล์ 160 00:09:58,929 --> 00:10:02,697 คุณเรียกเครื่องมือ แล้วข้อความก็กลับมา 161 00:10:02,697 --> 00:10:05,374 สำหรับโมเดล DeepSeek ของเรา 162 00:10:05,374 --> 00:10:09,141 มันแค่รันสิ่งนี้เป็น MCP tool เท่านั้น 163 00:10:09,141 --> 00:10:13,602 **กฎสี่ข้อ:** มีกฎสี่ข้อเพื่อให้ระบบซื่อสัตย์ 164 00:10:13,602 --> 00:10:18,064 หนึ่ง เมื่อมีการกล่าวถึงภาพ ให้เรียก describe 165 00:10:18,064 --> 00:10:20,046 image หรือ OCR image 166 00:10:20,046 --> 00:10:22,723 เมื่อข้อความในภาพคือประเด็น 167 00:10:22,723 --> 00:10:26,887 บ่อยครั้งที่คุณอยากอ่านข้อความที่อยู่ในภาพ 168 00:10:26,887 --> 00:10:28,969 นั่นคือสิ่งที่ใช้ สอง 169 00:10:28,969 --> 00:10:33,232 ให้ถือว่าสิ่งที่กลับมาคือหลักฐาน (evidence) 170 00:10:33,232 --> 00:10:36,702 ไม่ใช่ความจริงสูงสุด (ground truth) 171 00:10:36,702 --> 00:10:39,775 เพราะมันคือการตีความสิ่งที่เห็น 172 00:10:39,775 --> 00:10:44,038 โดยเฉพาะถ้าภาพไม่ชัดหรือค่อนข้างนามธรรม สาม 173 00:10:44,038 --> 00:10:47,508 คำตอบสุดท้ายต้องมาจาก DeepSeek เสมอ 174 00:10:47,508 --> 00:10:50,879 ห้ามให้โมเดลเล็กตอบผู้ใช้ และ repo 175 00:10:50,879 --> 00:10:53,159 ย้ำเรื่องนี้หนักมาก สี่ 176 00:10:53,159 --> 00:10:56,629 ห้ามส่งพิกเซลไปที่พอร์ต 888 เด็ดขาด 177 00:10:56,629 --> 00:11:00,396 นั่นคือพอร์ตของโมเดล DeepSeek สมองเป็น 178 00:11:00,396 --> 00:11:03,668 text-only และต้องเป็นแบบนั้นต่อไป 179 00:11:03,668 --> 00:11:07,138 **ราคาที่ต้องจ่าย:** ดวงตาไม่ได้ฟรี 180 00:11:07,138 --> 00:11:11,599 คุณต้องจ่ายด้วยคอนเท็กซ์ และนี่คือสิ่งที่ Mia 181 00:11:11,599 --> 00:11:15,961 พูดถึงเรื่อง KV cache คุณจะได้ KV cache 2.49 182 00:11:15,961 --> 00:11:20,324 ล้านโทเคนจากโหมด text-only ของโมเดล DeepSeek 183 00:11:20,324 --> 00:11:24,190 เอง แต่พอเป็นโหมดวิทัศน์ สมองเหลือ 1.37 184 00:11:24,190 --> 00:11:25,876 ล้านโทเคน sidecar 185 00:11:25,876 --> 00:11:30,436 ทำให้สมองเสียหน่วยความจำทำงานไปเกือบครึ่งหนึ่ง 186 00:11:30,436 --> 00:11:34,402 ค่อนข้างเยอะ Mia เตือนไว้อย่างที่เห็นว่า 187 00:11:34,402 --> 00:11:38,565 ตอนนี้ยังเป็นเวอร์ชันทดลอง และคุณจะเสีย KV 188 00:11:38,565 --> 00:11:41,540 cache ไปเยอะ คุณเห็นเหตุผลแล้ว 189 00:11:41,540 --> 00:11:45,505 นี่คือเหตุผลที่ระบบนี้ปิดเป็นค่าเริ่มต้น 190 00:11:45,505 --> 00:11:49,768 คุณควรใช้มันเมื่อจำเป็นต้องใช้วิทัศน์จริง ๆ 191 00:11:49,768 --> 00:11:51,949 เท่านั้น **ข้อจำกัด:** 192 00:11:51,949 --> 00:11:56,312 ข้อจำกัดคือเกมโทรศัพท์ต่อคำ (telephone game) 193 00:11:56,312 --> 00:12:00,674 และนี่คือเหตุผลที่ระบบนี้อาจไม่สมบูรณ์แบบนัก 194 00:12:00,674 --> 00:12:03,450 เพราะสมองไม่เคยตรวจสอบพิกเซล 195 00:12:03,450 --> 00:12:05,532 ถ้าตาพลาดรายละเอียดไป 196 00:12:05,532 --> 00:12:09,002 รายละเอียดนั้นก็เหมือนไม่มีอยู่จริง 197 00:12:09,002 --> 00:12:13,661 เราจะทดสอบกันว่ามันทำงานดีแค่ไหนกับภาพสองสามภาพ 198 00:12:13,661 --> 00:12:17,230 แต่ถ้ามีคำอธิบายที่ไม่สมบูรณ์หรือผิด 199 00:12:17,230 --> 00:12:20,006 มันจะเข้าไปในโมเดล reasoning 200 00:12:20,006 --> 00:12:23,179 และกลายเป็นพื้นฐานของคำตอบที่ผิด 201 00:12:23,179 --> 00:12:26,649 นี่คือเหตุผลที่ถือว่ามันเป็นหลักฐาน 202 00:12:26,649 --> 00:12:30,218 ไม่ใช่ความจริงสูงสุด **สิ่งที่ได้:** 203 00:12:30,218 --> 00:12:34,381 แต่คุณได้เก็บโมเดลฐานไว้โดยไม่ต้องเทรนใหม่ 204 00:12:34,381 --> 00:12:38,446 ได้พลังและความสามารถ reasoning ทั้งหมดของ 205 00:12:38,446 --> 00:12:41,619 DeepSeek คุณได้เธรดการสนทนาเดียว 206 00:12:41,619 --> 00:12:43,701 โมเดลตอบคำถามตัวเดียว 207 00:12:43,701 --> 00:12:47,369 โดยไม่ต้องสลับไปมาระหว่างโมเดลหลายตัว 208 00:12:47,369 --> 00:12:51,235 และได้คำอธิบาย OCR และการเปรียบเทียบภาพ 209 00:12:51,235 --> 00:12:55,003 มันทำงานกับแฮร์เนสที่รองรับ MCP ทุกตัว 210 00:12:55,003 --> 00:12:57,283 และเปิดปิดได้ตามต้องการ 211 00:12:57,283 --> 00:13:01,447 มันเป็นระบบทดลองและเป็นงานประปา (plumbing) 212 00:13:01,447 --> 00:13:05,115 ที่ทำเสร็จในวันเดียว เราจะทำตอนนี้เลย 213 00:13:05,115 --> 00:13:09,675 **เริ่มลงมือ:** นี่คือบทสรุปของผม แนวคิดง่าย ๆ 214 00:13:09,675 --> 00:13:13,938 แต่ความเรียบง่ายนี่แหละที่ทำให้มันใช้งานได้ 215 00:13:13,938 --> 00:13:17,012 เรามาลองกัน ผมจะเริ่มเซสชันใหม่ 216 00:13:17,012 --> 00:13:21,176 นี่คือโปรไฟล์เริ่มต้นของ Spark agent ของผม 217 00:13:21,176 --> 00:13:25,637 และผมตั้งค่าผ่าน GBT Soul เพราะผมไม่สามารถใช้ 218 00:13:25,637 --> 00:13:29,603 repo ตามเดิมได้ เนื่องจากผมใช้ DGX Spark 219 00:13:29,603 --> 00:13:33,767 แค่ตัวเดียวและสูตรการตั้งค่าต่างจากของ Mia 220 00:13:33,767 --> 00:13:37,534 ที่ใช้สองตัว ผมเลยต้องปรับแต่งเล็กน้อย 221 00:13:37,534 --> 00:13:42,094 ให้เอเจนต์ของผมจัดการ คุณเห็นว่ามันรันอยู่แล้ว 222 00:13:42,094 --> 00:13:46,457 โมเดลเดียวกันคือโมเดลวิทัศน์ Qwen และคุณเห็น 223 00:13:46,457 --> 00:13:51,017 MCP tools ที่ถูกค้นพบ นี่คือสองหน้าต่างต่างกัน 224 00:13:51,017 --> 00:13:55,677 อันนี้คือโปรไฟล์เริ่มต้นที่ผมตั้งค่าทุกอย่างไว้ 225 00:13:55,677 --> 00:13:58,849 และอันนี้คือโมเดล DeepSeek local 226 00:13:58,849 --> 00:14:02,418 ที่รันอยู่จริง นี่คือสิ่งที่เราจะใช้ 227 00:14:02,418 --> 00:14:06,681 และคุณเห็นเครื่องมือสามตัว: describe image, 228 00:14:06,681 --> 00:14:11,242 OCR image และ compare images ทุกอย่างพร้อมแล้ว 229 00:14:11,242 --> 00:14:15,405 **ทดสอบภาพแรก:** ลองอันแรก ซึ่งรันบน Spark 230 00:14:15,405 --> 00:14:19,272 ในเครื่อง ผมสร้างภาพนี้ด้วยโมเดล Cray 2 231 00:14:19,272 --> 00:14:20,370 มาดูกัน 232 00:14:20,370 --> 00:14:25,030 ผมจะคัดลอกแล้วดูว่ามันบอกได้ไหมว่ารูปนี้คืออะไร 233 00:14:25,030 --> 00:14:29,590 เพราะภาพนี้ค่อนข้างชัดเจน เป็นสาวอนิเมะคนเดียว 234 00:14:29,590 --> 00:14:31,870 กลับมาที่นี่ ผมพิมพ์ว่า 235 00:14:31,870 --> 00:14:36,332 'อธิบายว่ามีอะไรอยู่ในภาพนี้ให้ละเอียดที่สุด' 236 00:14:36,332 --> 00:14:40,694 เราจะลองสองสามภาพ ดูว่าจะได้รายละเอียดแค่ไหน 237 00:14:40,694 --> 00:14:44,065 อันนี้น่าจะตรงไปตรงมา ควรทำได้ง่าย 238 00:14:44,065 --> 00:14:48,526 และเราจะลองกับข้อความด้วย เพราะอยากรู้ว่า OCR 239 00:14:48,526 --> 00:14:52,591 image จะทำได้แค่ไหน **เจอปัญหาเล็กน้อย:** 240 00:14:52,591 --> 00:14:56,259 อย่างที่เห็น มันล่ม (down) ไปชั่วครู่ 241 00:14:56,259 --> 00:14:59,035 อย่างที่บอก มันเป็นระบบทดลอง 242 00:14:59,035 --> 00:15:02,901 เราอาจเจอข้อผิดพลาดแบบนี้ ลองแก้ดู โอเค 243 00:15:02,901 --> 00:15:07,164 กลับมาทำงานได้แล้ว ปัญหาไม่เกี่ยวกับ vision 244 00:15:07,164 --> 00:15:11,328 sidecar เลย แต่เกี่ยวกับวิธีตั้งค่า memory 245 00:15:11,328 --> 00:15:12,716 watchdog ของผม 246 00:15:12,716 --> 00:15:16,880 เพราะผมมักรันอะไรหลายอย่างพร้อมกันบน Spark 247 00:15:16,880 --> 00:15:19,359 เสมอ ผมมี memory watchdog 248 00:15:19,359 --> 00:15:23,622 ที่จะปิดระบบบางอย่างถ้าสถานการณ์เริ่มเสี่ยง 249 00:15:23,622 --> 00:15:26,100 แต่แก้ได้แล้ว ลองอีกครั้ง 250 00:15:26,100 --> 00:15:30,561 'อธิบายว่ามีอะไรอยู่ในภาพนี้ให้ละเอียดที่สุด' 251 00:15:30,561 --> 00:15:34,527 จริง ๆ แล้วไม่ใช่ปัญหาของ vision sidecar 252 00:15:34,527 --> 00:15:37,501 แต่เป็นวิธีตั้งค่า Spark ของผม 253 00:15:37,501 --> 00:15:39,781 **ผลลัพธ์ภาพแรก:** โอเค 254 00:15:39,781 --> 00:15:43,450 เราทำให้มันทำงานได้แล้ว เห็นตรงนี้ไหม 255 00:15:43,450 --> 00:15:46,721 ตอนเรียกเครื่องมือ มันใช้ MCP DS4 256 00:15:46,721 --> 00:15:50,687 เพื่ออธิบายภาพ และเห็นว่า vision sidecar 257 00:15:50,687 --> 00:15:54,355 กลับมาทำงานแล้ว คำอธิบายส่งกลับมาแล้ว 258 00:15:54,355 --> 00:15:58,420 นี่คือสิ่งที่ได้: ธีมคือภาพประกอบสไตล์ 3D 259 00:15:58,420 --> 00:16:01,394 cutout ของตัวละครหญิงแนวอนิเมะ 260 00:16:01,394 --> 00:16:04,567 มันอธิบายรายละเอียดได้ค่อนข้างดี 261 00:16:04,567 --> 00:16:06,549 ตัวละครอนิเมะวัยรุ่น 262 00:16:06,549 --> 00:16:09,424 ผมสีน้ำตาลแดงหยักศกยาวปานกลาง 263 00:16:09,424 --> 00:16:13,192 ดวงตาโตสื่ออารมณ์ เสื้อผ้า ครบทุกอย่าง 264 00:16:13,192 --> 00:16:16,166 ทั้งท่าทาง พื้นหลัง ซึ่งจริง ๆ 265 00:16:16,166 --> 00:16:20,032 ไม่มีพื้นหลังอะไร มันเรียบ ๆ ซึ่งก็จริง 266 00:16:20,032 --> 00:16:25,089 และประเด็นของงานชิ้นนี้คือจุดที่ค่อนข้างละเอียดอ่อน 267 00:16:25,089 --> 00:16:29,352 ผมแปลกใจที่มันจับได้ ตัวละครทำจากกระดาษแข็ง 268 00:16:29,352 --> 00:16:33,416 นั่นคือไอเดีย การทำสไตล์ไลซ์ตัวละครอนิเมะ 269 00:16:33,416 --> 00:16:37,481 ไม่ใช่แค่ภาพประกอบธรรมดา มันจับได้ด้วยว่า 270 00:16:37,481 --> 00:16:41,447 ใจความของงานคือตัวละครที่ทำจากกระดาษแข็ง 271 00:16:41,447 --> 00:16:45,214 ซ้อนเป็นชั้น ๆ เป็นลอนลูกฟูก มีพื้นผิว 272 00:16:45,214 --> 00:16:48,882 พื้นหลังน้อยมาก งานนี้มันเห็นได้ดีมาก 273 00:16:48,882 --> 00:16:50,766 **ทดสอบภาพที่สอง:** 274 00:16:50,766 --> 00:16:54,930 ลองอีกอันที่ยากขึ้นเล็กน้อย นี่คือภาพถัดไป 275 00:16:54,930 --> 00:16:59,292 มีอะไรเกิดขึ้นเยอะกว่า อยู่ในโลกไดโนเสาร์แบบ 276 00:16:59,292 --> 00:17:02,960 claymation นี่คือภาพอ้างอิงที่ผมสร้าง 277 00:17:02,960 --> 00:17:06,628 มีไดโนเสาร์กับแมมมอธขนปุกปุยตัวเล็ก ๆ 278 00:17:06,628 --> 00:17:10,594 ซับซ้อนขึ้นมาหน่อย มาดูว่ามันจัดการยังไง 279 00:17:10,594 --> 00:17:13,767 ผมพิมพ์ว่า 'คราวนี้อธิบายอันนี้' 280 00:17:13,767 --> 00:17:17,236 แม้โมเดลวิทัศน์ Qwen จะรองรับวิดีโอ 281 00:17:17,236 --> 00:17:20,706 แต่การตั้งค่าปัจจุบันของ MCP server 282 00:17:20,706 --> 00:17:24,375 และเครื่องมือที่มีอยู่รองรับได้แค่ภาพ 283 00:17:24,375 --> 00:17:28,836 เราจะเน้นภาพก่อน 'อธิบายภาพนี้ด้วย vision MCP 284 00:17:28,836 --> 00:17:33,396 server' ดูมันทำงาน เห็นการเรียกเครื่องมือ ชื่อ 285 00:17:33,396 --> 00:17:37,858 MCP DS4 vision describe image มันกำลังรันอยู่ 286 00:17:37,858 --> 00:17:42,319 โอเค นี่คือผลลัพธ์ ใช้เวลาไม่นาน สองสามวินาที 287 00:17:42,319 --> 00:17:45,690 ประมาณ 20 วินาที ภาพคือ claymation 288 00:17:45,690 --> 00:17:47,573 สไตล์ความละเอียดสูง 289 00:17:47,573 --> 00:17:52,134 ในสภาพแวดล้อมยุคก่อนประวัติศาสตร์อันเขียวชอุ่ม 290 00:17:52,134 --> 00:17:54,811 ตัวเอกคือแมมมอธกับไดโนเสาร์ 291 00:17:54,811 --> 00:17:58,776 มันอธิบายได้ละเอียดดีทีเดียว น่าประทับใจ 292 00:17:58,776 --> 00:18:02,345 มันจับสภาพแวดล้อมและพื้นหลังได้ดีมาก 293 00:18:02,345 --> 00:18:05,815 ภูมิประเทศหินเขียวชอุ่ม ท้องฟ้า แสง 294 00:18:05,815 --> 00:18:08,690 และสื่อกลางภาพ (middleground) 295 00:18:08,690 --> 00:18:13,548 นี่คือคำอธิบายที่ค่อนข้างดีของสิ่งที่เราเห็นในภาพ 296 00:18:13,548 --> 00:18:17,018 **ทดสอบ OCR กับภาพความละเอียดต่ำ:** 297 00:18:17,018 --> 00:18:21,380 ลองกลับไปที่ภาพแรก ไม่รู้ว่าหน้าจอคุณเห็นไหม 298 00:18:21,380 --> 00:18:25,742 แต่มันความละเอียดต่ำมาก ดูสิว่ามันอ่านได้ไหม 299 00:18:25,742 --> 00:18:29,807 และอันนี้ใช้ URL ไม่ใช่ไฟล์ในเครื่อง โอเค 300 00:18:29,807 --> 00:18:33,574 ภาพคือแบนเนอร์โปรโมตดิจิทัล จริง ๆ คือ 301 00:18:33,574 --> 00:18:38,135 thumbnail ข้อความที่เห็นคือ 'Ultimate Guide to 302 00:18:38,135 --> 00:18:41,704 Hermes Desktop Plugins' ตัวใหญ่สีขาว 303 00:18:41,704 --> 00:18:46,066 มันอ่านถูกต้อง คิดว่านี่คือข้อความเดียวบนภาพ 304 00:18:46,066 --> 00:18:49,140 อ่านได้ น่าประทับใจ อย่างที่บอก 305 00:18:49,140 --> 00:18:51,915 ภาพนี้ความละเอียดค่อนข้างต่ำ 306 00:18:51,915 --> 00:18:55,782 แผงซ้ายคือกราฟหุ้น (stock chart) ด้านบน 307 00:18:55,782 --> 00:18:58,459 แล้วก็ราคา มันอ่านได้จริง ๆ 308 00:18:58,459 --> 00:19:02,127 ผมว่าผมยังอ่านไม่ออกเลย มันเบลอเกินไป 309 00:19:02,127 --> 00:19:05,200 แต่มันอ่านบางอย่างจากกราฟนี้ได้ 310 00:19:05,200 --> 00:19:08,968 แผงขวาคือหน้าต่าง Hermes Plugin ด้านบน 311 00:19:08,968 --> 00:19:11,545 ตามด้วยรายการปลั๊กอินซ้ำ ๆ 312 00:19:11,545 --> 00:19:17,890 อันนั้นมันพลาด นี่คือตัวอย่างของ hallucination เพราะแผงขวาจริง ๆ 313 00:19:17,890 --> 00:19:20,468 คือลิสต์เพลย์ลิสต์ Spotify 314 00:19:20,468 --> 00:19:23,839 นี่คือตัวอย่างสิ่งที่มันมองไม่เห็น 315 00:19:23,839 --> 00:19:26,615 และไม่ใช่ความผิดของ DeepSeek 316 00:19:26,615 --> 00:19:29,985 มันคือโมเดลวิทัศน์ที่มองไม่เห็นเอง 317 00:19:29,985 --> 00:19:32,365 **บทเรียนจากภาพที่สาม:** 318 00:19:32,365 --> 00:19:36,529 มันคือกราฟิกโปรโมตเกี่ยวกับปลั๊กอิน Hermes 319 00:19:36,529 --> 00:19:37,627 Desktop 320 00:19:37,627 --> 00:19:41,890 สิ่งหลักที่ผมอยากเช็คคือมันอ่านหัวข้อได้ไหม 321 00:19:41,890 --> 00:19:46,450 และมันก็อ่านได้ชัดเจน และยังเห็นส่วนที่เล็กมาก 322 00:19:46,450 --> 00:19:50,614 บอกได้ว่านี่คือกราฟหุ้น น่าประทับใจทีเดียว 323 00:19:50,614 --> 00:19:53,588 แต่นี่ก็ดีเพราะเราเห็นข้อจำกัด 324 00:19:53,588 --> 00:19:57,157 ถ้าโมเดลวิทัศน์พลาดอะไรบางอย่าง เช่น 325 00:19:57,157 --> 00:20:00,627 แผงขวาไม่เกี่ยวกับกราฟหุ้น DeepSeek 326 00:20:00,627 --> 00:20:04,692 ก็ทำอะไรไม่ได้ มันต้องยอมรับภาพหลอนนั้นไป 327 00:20:04,692 --> 00:20:08,856 **ข้อแลกเปลี่ยน:** นี่คือสรุปข้อแลกเปลี่ยน 328 00:20:08,856 --> 00:20:12,425 (trade-offs) ที่คุณจะเจอ โปรไฟล์ DS4 329 00:20:12,425 --> 00:20:16,490 ปกติของผมบน DGX Spark: เช็กพอยต์ DeepSeek 330 00:20:16,490 --> 00:20:20,753 มีหน่วยความจำราว ๆ 80 กิกะไบต์ และคอนเท็กซ์ 331 00:20:20,753 --> 00:20:25,214 240,000 โทเคน และคุณเห็นกับโปรไฟล์ DS4 Vision 332 00:20:25,214 --> 00:20:29,279 แบบอยู่ร่วมกัน (coexistent) บวกโมเดล Qwen 333 00:20:29,279 --> 00:20:33,244 ข้อแลกเปลี่ยนอยู่ด้านล่าง: ในโหมดวิทัศน์ 334 00:20:33,244 --> 00:20:36,913 ผมใช้คอนเท็กซ์ได้น้อยลงมาก แค่ 65,000 335 00:20:36,913 --> 00:20:40,482 โทเคนต่อวินโดว์ ใช้ได้แค่หนึ่ง batch 336 00:20:40,482 --> 00:20:43,158 และใช้ได้แค่ plain decoding 337 00:20:43,158 --> 00:20:47,421 ซึ่งทำให้ช้ากว่าปกติ ผลคือคอนเท็กซ์ลดลง 72% 338 00:20:47,421 --> 00:20:51,982 ผมน่าจะปรับแต่งให้ดีกว่านี้ได้ แต่อย่างที่เห็น 339 00:20:51,982 --> 00:20:55,948 คอนเท็กซ์ต้องลดลงอย่างมาก เพราะ KV cache 340 00:20:55,948 --> 00:21:00,211 กินพื้นที่เยอะมากตอนนี้ และผมมักมี watchdog 341 00:21:00,211 --> 00:21:04,771 คอยดูแลหน่วยความจำ แต่ต้องปิดมันระหว่างเดโมนี้ 342 00:21:04,771 --> 00:21:09,133 เพราะมันใกล้ขีดจำกัดเกินไป ผมต้องปิดชั่วคราว 343 00:21:09,133 --> 00:21:12,801 เพราะระบบนี้กินหน่วยความจำมากกว่าปกติ 344 00:21:12,801 --> 00:21:17,263 คุณต้องคำนึงถึงเรื่องนี้ **ความเห็นปิดท้าย:** 345 00:21:17,263 --> 00:21:20,931 ผมประทับใจคุณภาพของโมเดลวิทัศน์จริง ๆ 346 00:21:20,931 --> 00:21:24,599 มันมองภาพได้ค่อนข้างดี แม้แต่ภาพยาก ๆ 347 00:21:24,599 --> 00:21:27,375 แต่ก็มีข้อแลกเปลี่ยนที่สำคัญ 348 00:21:27,375 --> 00:21:31,341 แต่ก็ยังน่าสนใจอยู่ดี ตัว vision sidecar 349 00:21:31,341 --> 00:21:34,315 นี่คือการทดลองดู repo ทดลองนี้ 350 00:21:34,315 --> 00:21:37,884 เพราะในแง่แนวคิด ผมว่ามันพัฒนาต่อได้ 351 00:21:37,884 --> 00:21:43,733 และปรับแต่งให้มีประสิทธิภาพขึ้นโดยไม่ต้องแลกอะไรหนักขนาดนี้ 352 00:21:43,733 --> 00:21:48,294 ถ้าอยากลองด้วยตัวเอง ตามที่บอก ไปดู Mia AI Lab 353 00:21:48,294 --> 00:21:52,755 ได้ เธอมีสูตร (recipes) หลากหลาย ลองดูบัญชี X 354 00:21:52,755 --> 00:21:56,027 ของเธอ Mia AI Lab จบวิดีโอเท่านี้ 355 00:21:56,027 --> 00:21:58,208 หวังว่าคุณจะสนุกกับมัน 356 00:21:58,208 --> 00:22:01,678 ผมว่าเป็นแนวคิดที่น่าสนใจที่จะทดลอง 357 00:22:01,678 --> 00:22:05,544 ทิ้งคอมเมนต์ไว้ได้ บอกความคิดเห็นของคุณ 358 00:22:05,544 --> 00:22:08,320 แล้วพบกันใหม่ ขอบคุณที่รับชม