How DeepSeek-V4-Flash 0731 REALLY Handles Challenging Tasks (Even Running on One Spark)
สรุปย่อ
ประเด็นสำคัญจากวิดีโอ
- **ช่อง:** Tonbi's AI Garage · **ความยาว:** ~35 นาที · **ลิงก์:** https://www.youtube.com/watch?v=y9-ILYAhsJk
# สรุป: How DeepSeek-V4-Flash 0731 REALLY Handles Challenging Tasks (Even Running on One Spark) - **ช่อง:** Tonbi's AI Garage · **ความยาว:** ~35 นาที · **ลิงก์:** https://www.youtube.com/watch?v=y9-ILYAhsJk ## ประเด็นหลัก - Tonbi ทดสอบโมเดล DeepSeek-V4-Flash 0731 ด้วยโจทย์ยาก 3 ข้อที่เคยใช้ในการแข่งขัน AI Royal Rumble ได้แก่ หน้า landing page แบบอินเทอร์แอกทีฟ โลก Three.js จากย่อหน้าแรกของ The Lord of the Rings และเกม platformer แบบ time loop puzzle - เปรียบเทียบสองเวอร์ชัน คือเวอร์ชันคลาวด์เต็มรูปแบบ (ผ่าน API ใน Hermes Agent) กับเวอร์ชันท้องถิ่นที่ถูก quantize หนัก ๆ (Q2) รันบน DGX Spark เครื่องเดียว - โจทย์แรก: เวอร์ชันคลาวด์ทำ landing page ได้ดี เทียบเท่า Kimi K3 ส่วนเวอร์ชันท้องถิ่นก็สร้างหน้าเว็บที่ใช้งานได้จริง แม้ไม่สวยเท่า แต่มากกว่าที่คาดไว้ - โจทย์สอง: เวอร์ชันคลาวด์สร้างฉากแบบ cinematic จาก Lord of the Rings ใน 40 นาที ดูใช้ได้ แม้ไม่ดีเท่า Opus 5 ส่วนเวอร์ชันท้องถิ่นใช้เวลาประมาณ 1.5 ชั่วโมง ได้ผลงานเรียบง่ายและมีบั๊กกล้องสั่น - โจทย์สาม: เกม Echo Vault ของเวอร์ชันคลาวด์ใช้กลไกหลากหลาย (แผ่นกด กุญแจ กำแพงล่องหน การกรอกลับเวลา) สร้างสรรค์และดีกว่า Kimi K3 ส่วนเวอร์ชันท้องถิ่นทำเกมง่าย ๆ ที่กลไกใช้งานได้จริง (ใช้เวลาประมาณ 2 ชั่วโมง 40 นาที) - จุดเด่นใหญ่คือต้นทุน: การรันทั้งหมดรวมทุกโจทย์เสียแค่ 53 เซนต์ เทียบกับ $25 สำหรับเกมเดียวของ Kimi K3 ราคา API บน OpenRouter อยู่ที่ input 9 เซนต์ / output 18 เซนต์ - เรื่องขนาด: DeepSeek-V4-Flash มีพารามิเตอร์รวม 284B เทียบกับ Kimi K3 ที่ 2.8T (เกือบ 10 เท่า) แต่ผลลัพธ์กลับอยู่ในระดับเดียวกันหรือดีกว่าในบางโจทย์ - เวอร์ชันท้องถิ่นที่ quantize หนัก ๆ ทำทุกโจทย์สำเร็จ แม้คุณภาพไม่เท่าเวอร์ชันเต็ม แต่นับว่าน่าประทับใจสำหรับโมเดลขนาดเล็กที่รันบนเครื่องเดียว - ข้อดีของการรันโมเดลท้องถิ่น: ข้อมูลอยู่บนเครื่อง ไม่ส่งออกไปคลาวด์ ไม่มีปัญหาการเชื่อมต่อหลุด และสนุกสำหรับคนชอบปรับแต่งโมเดล - Tonbi กล่าวถึงการเปิดตัวโมเดล Qwen 3.8 ในสัปดาห์หน้า และอาจทำวิดีโอทดสอบโจทย์เดียวกันกับเวอร์ชัน 27B ## ความเห็นสรุป วิดีโอนี้แสดงให้เห็นว่า DeepSeek-V4-Flash 0731 เป็นโมเดลที่คุ้มค่ามาก ทั้งในแง่ความสามารถที่เทียบชั้นโมเดลระดับแนวหน้าที่ใหญ่กว่าหลายเท่า และราคาที่ถูกอย่างเหลือเชื่อ การทดสอบแบบ one-shot กับโจทย์ที่ยากจริง ๆ ทำให้เห็นภาพความสามารถได้ชัดเจนกว่าการรีวิวแบบ first-look ทั่วไป แม้ผลลัพธ์จะไม่สมบูรณ์แบบ แต่ก็ถือว่าน่าประทับใจ โดยเฉพาะเวอร์ชันท้องถิ่นที่รันบน Spark เครื่องเดียวครับ
คำแปลเต็ม
แปลตามบทสนทนาต้นฉบับ ปรับเป็นภาษาไทยธรรมชาติ
ตัวอย่างเปิดคลิป — หน้าเว็บลูกโลกอินเทอร์แอกทีฟ
ถ้าคุณเคยดูวิดีโอ first-look (รีวิวโมเดลครั้งแรก) ของผม คุณจะคุ้นเคยกับ prompt (คำสั่ง) นี้ดี ผมขอให้โมเดลสร้างเว็บไซต์ ซึ่งเป็นหน้า landing page (หน้าโปรโมตสินค้า) สำหรับเกมแนว Star Wars เจอกับ One Piece และขอลูกกลมเรืองแสงเอาไว้ด้วย นี่คือสิ่งที่มันสร้างออกมาให้ครับ เห็นชัดว่ามันอินเทอร์แอกทีฟมาก พอผมเลื่อนเมาส์ไปเหนือลูกโลก ลูกโลกก็ขยับตาม ซึ่งเป็นสิ่งที่ผมไม่เคยเห็นโมเดลไหนทำมาก่อน และพอเลื่อนหน้าลงมา ควรจะมี headline (พาดหัว) โผล่ขึ้นมาแบบสไตล์ stutter (ตัวอักษรทยอยโผล่ทีละตัว) มาดูกันว่ามันจะเวิร์กไหมครับ นี่ไงครับ ลูกโลกเริ่มจางหายไป แล้วพาดหัวก็ทยอยโผล่เข้ามา The Odyssey for One Piece begins (การผจญภัยของ One Piece เริ่มต้นขึ้น) โมเดลนี้ทำได้ดีมากครับ พอเลื่อนขึ้นไป ลูกโลกก็กลับคืนมาเหมือนเดิม ลูกโลกดูสวยมากจริง ๆ ครับ มันมีองค์ประกอบอินเทอร์แอกทีฟซึ่งโมเดลรุ่นก่อน ๆ ไม่เคยทำได้ และเอฟเฟกต์ stutter ของพาดหัวก็ออกมาดีด้วย นี่คืองานที่ดีมากของโมเดลตัวนี้ และอย่างที่คุณคงเดาได้จากชื่อวิดีโอ นี่คือผลงานของโมเดล DeepSeek-V4-Flash 0731 ครับ
งานนี้ถือว่าง่าย แต่ในวิดีโอวันนี้ เราจะทดสอบโมเดลตัวนี้กันจริง ๆ ครับ ทั้งเวอร์ชันคลาวด์ เวอร์ชัน API ทางการ และตัวที่รันอยู่บนเครื่อง PC ของผมเอง เริ่มกันเลยครับ
โปรโมตโปรเจกต์ agentwikis.com
อ้อ ถ้าคุณใช้ Agent Swarm (ระบบจัดการ agent หลายตัว) อยู่ และอยากได้ LM wikis (คลังความรู้เกี่ยวกับโมเดลภาษา) ที่ผมใช้ค้นคว้าและสร้างวิดีโอพวกนี้ด้วยตัวเอง ลองไปดูโปรเจกต์ของผมที่ agentwikis.com ได้นะครับ ผมให้ wiki เหล่านี้ฟรีในหลากหลายหัวข้อ และคุณสมัครบัญชีโปรได้ในราคา $9.99 ต่อเดือน เพื่อเข้าถึง wiki ขนาดใหญ่พิเศษ ที่มีหน้ามากขึ้นและรายละเอียดในแต่ละหัวข้อมากขึ้นด้วย กลับมาที่วิดีโอกันครับ
ข่าวการเปิดตัว DeepSeek-V4-Flash 0731
สัปดาห์ที่แล้ว DeepSeek ประกาศโมเดล DeepSeek-V4-Flash 0731 ขึ้นมาค่อนข้างกระทันหัน เป็นเวอร์ชันใหม่ของโมเดล DeepSeek-V4-Flash รุ่นก่อนหน้า อย่างที่เห็นใน benchmark (การวัดประสิทธิภาพ) ตรงนี้ มันพัฒนาขึ้นอย่างมาก และพวกเขาปล่อย open weights (น้ำหนักโมเดลแบบเปิด) ออกมาพร้อมกันด้วย นับเป็นการเปิดตัวที่น่าตื่นเต้นครับ มีคนจำนวนมากรีบทดลองใช้ทันที เพราะเราเพิ่งเคยเห็นโมเดลที่เก่งขนาดนี้รันบน Spark ได้เพียงสองเครื่อง และผลลัพธ์บางอย่างก็ impressive (น่าประทับใจ) มาก เช่น คนนี้ชื่อ Mosh Aib ทำเกมนี้ใน Hermes Agent (เฟรมเวิร์กสำหรับรัน agent อัตโนมัติ) ด้วยเงินเพียง 7 เซนต์ ฟังก์ชันน่าประทับใจมาก แต่ที่มากกว่านั้นคือเรื่องต้นทุน มันถูกมาก ๆ และเร็วมากด้วยครับ
ตอนแรกผมคิดว่าผมคงรันมันไม่ได้ เพราะผมมี DGX Spark (คอมพิวเตอร์ AI ส่วนตัวของ NVIDIA) แค่เครื่องเดียว แต่ Blaze Goodson ลงมือทำงานตรงนี้เยอะมาก และตอนนี้มันใส่ลงใน Spark เครื่องเดียวได้เต็มรูปแบบแล้วครับ เขาได้ความเร็ว prefill (การประมวลผลข้อมูลล่วงหน้าก่อนเริ่มสร้างคำตอบ) ประมาณ 1,000 token ต่อวินาที และการเสิร์ฟแบบ multi-agent (หลาย agent ทำงานพร้อมกัน) 59 token ต่อวินาที และผมก็รันบน DGX Spark ของตัวเอง ได้ตัวเลขใกล้เคียงกันครับ
นี่คือคำอธิบายเวอร์ชันที่ผมรันบนเครื่องได้ ความแตกต่างใหญ่คือมันถูก quantize (บีบอัดขนาดโมเดล) อย่างหนักสำหรับส่วน routed experts (โมเดลแบบผู้เชี่ยวชาญแยกเส้นทาง) ซึ่งเป็นส่วนที่กินหน่วยความจำและ activations (ค่าการทำงานของนิวรอน) มากที่สุด เห็นไหมครับ ตรงนี้เป็น Q2
อธิบายเรื่อง quantization แบบเข้าใจง่าย
ถ้าคุณไม่รู้จัก quantization ผมมีวิดีโอที่อธิบายเรื่องนี้แบบละเอียดอยู่ แต่พูดสั้น ๆ มันคือวิธีลดขนาดของน้ำหนักโมเดล เพื่อให้สามารถรันโมเดลที่ใหญ่กว่าบน GPU หรือฮาร์ดแวร์ที่เล็กกว่าได้ เวลาคนพูดถึง dense weights (น้ำหนักเต็มรูปแบบ) ปกติจะหมายถึงสิ่งที่เรียกว่า 16-bit ซึ่งถือเป็นขนาดเต็ม จริงไหมครับ พอบีบลงมาเป็น 8-bit ก็เหลือครึ่งหนึ่งของขนาด และวิธี quantization สมัยใหม่ลงไปที่ 8-bit ได้ง่ายมาก โดยแทบไม่สูญเสียคุณภาพเลย แม้แต่ 4-bit ซึ่งเป็นนวัตกรรมใหม่กว่า ก็ไม่เห็นคุณภาพตกมากเท่าไร แต่พอลงไปต่ำกว่า 4-bit เริ่มยากขึ้นครับ ทำได้ แต่จะเจอปัญหาทั้งเรื่องความเร็วและคุณภาพ ดังนั้นการลงไปที่ 2-bit ตรงนี้ ถือเป็นการ quantization ที่รุนแรง (aggressive) มากครับ แต่มันก็ยังใช้งานได้ และยังเขียนโค้ดได้ในระดับหนึ่ง
แนวคิดของวิดีโอนี้
ในวิดีโอวันนี้ ผมแค่อยากทดสอบมัน ไม่จำเป็นต้องเป็น first look เพราะ first look ปกติผมจะให้งานไว ๆ ง่าย ๆ ผมอยากทดสอบมันอย่างหนักจริง ๆ ด้วยโจทย์ที่ท้าทาย ผมจะใช้โจทย์จากซีรีส์ AI Royal Rumble (การแข่งขันท้าทายโมเดล AI) ของผม ซึ่งเป็นโจทย์ที่ยาวมาก บางโจทย์ใช้เวลาหลายชั่วโมง ผมจะให้ทั้งเวอร์ชันเต็มซึ่งรันผ่าน API บนคลาวด์ โดยใช้ Hermes Agent และผมจะใช้โมเดลท้องถิ่นของผมรันโจทย์เดียวกันเป๊ะ หวังว่าคุณจะได้เห็นว่าโมเดลใหม่ DeepSeek-V4-Flash นี้ทำอะไรได้บ้าง รวมถึงความแตกต่างระหว่างเวอร์ชันเต็มบนคลาวด์กับเวอร์ชันท้องถิ่นที่ถูก quantize หนัก ๆ ด้วย ผมว่ามันน่าสนใจดี เริ่มกันเลยครับ
โจทย์ข้อที่ 1 — หน้า landing page แบบอินเทอร์แอกทีฟ
โอเค คุณอาจจำโจทย์นี้ได้ครับ นี่มาจาก AI Royal Rumble และอันนี้คือ Claude Fable (โมเดล AI) ที่ทำเว็บแบบอินเทอร์แอกทีฟนี้ นี่คือเว็บไซต์จริง ๆ ผมแค่เลื่อนลงมา มันมีองค์ประกอบอินเทอร์แอกทีฟหลายอย่าง ผมทำโจทย์นี้กับโมเดลห้าตัว และได้ผลลัพธ์ที่น่าสนใจจากทุกตัว บางตัวดีกว่าตัวอื่น แต่ทุกตัวผลิตอะไรออกมาได้บ้าง เราจะทำโจทย์เดิมเป๊ะครับ แต่จะเปลี่ยนหัวข้อ เพื่อไม่ให้เหมือนการโปรโมต AI Royal Rumble มันจะโปรโมตตัว DeepSeek เอง จุดที่ยากคือมันมีองค์ประกอบแบบ scrolling (การเลื่อนหน้า) เยอะมาก ไม่มีวิดีโอจริง ๆ ตรงนี้ คุณต้องสร้างจังหวะและ transition (การเปลี่ยนฉาก) พวกนี้ขึ้นมาเอง ซึ่งเป็นเรื่องยากมากสำหรับโมเดล แต่เราจะมาดูกันว่าโมเดล DeepSeek จะทำได้ไหม ด้วย prompt เดียวกับที่ผมให้โมเดลพวกนั้นเป๊ะ
เราจะทำในแอปเดสก์ท็อปเองครับ เห็นไหม เรามี DeepSeek-V4-Flash เอาล่ะ เราอยากได้ตัว 0731 มีหลายเวอร์ชันตรงนี้ [เสียงสูดจมูก] ขอให้แน่ใจว่าเปิดตัวนี้อยู่ มันกำลังเริ่ม session (รอบการสนทนา) ใหม่ และผมจะให้ prompt กับมัน นี่คือสิ่งที่ผมให้โมเดลตัวอื่นเป๊ะ เป็นแบบ one-shot (ให้ครั้งเดียวจบ) พวกมันต้องทำงานด้วยตัวเอง ถามคำถามผมไม่ได้ แต่โจทย์คือ สร้าง launch website (เว็บไซต์เปิดตัว) คุณภาพระดับโปรดักชันที่สมบูรณ์สำหรับ DeepSeek V4/0731 และมีรายละเอียดทั้งหมดว่าต้องทำอะไร แต่การออกแบบเป็นสิทธิ์ของโมเดลเอง ผมจะให้ prompt นี้กับเวอร์ชันคลาวด์ใน Hermes Agent แล้วดูว่ามันทำงานยังไง จากนั้นผมจะทำแบบเดียวกันกับเวอร์ชันท้องถิ่น ซึ่งอยู่บน Spark ของผม มันกำลังรันอยู่ตอนนี้ เห็นไหมว่าผมสร้าง Hermes profile (โปรไฟล์การตั้งค่า) พิเศษให้มัน ชื่อ DS4 และเห็น DeepSeek chat ซึ่งเป็นโมเดลที่รันอยู่บนเครื่อง มาดูกันว่ามันทำงานไหมครับ ผมสังเกตว่ามันเร็วมาก และตอบกลับมาไวมาก ผมจะวาง prompt นี้ลงไป แล้วดูว่าโมเดลท้องถิ่นทำอะไรได้บ้าง และผมจะบอกความจริงกับคุณว่ามันล้มเหลวหรือสำเร็จ อย่างที่บอก โจทย์พวกนี้ท้าทายมาก ไม่ใช่แค่สร้าง landing page ให้หน่อย นี่คืองานออกแบบ front-end (ส่วนติดต่อผู้ใช้ของเว็บ) ที่ซับซ้อน ถ้ามันล้มเหลว ซึ่งมันอาจล้มเหลวได้ อย่าไปโทษตัวโมเดลเลย มันคือเวอร์ชันที่ถูก quantize หนัก ๆ และถ้ามันผลิตอะไรออกมาได้ก็ถือว่าน่าประทับใจแล้ว ยังอยากเห็นด้วยว่ามันเร็วแค่ไหน เห็นไหมว่ามันเคลื่อนที่ด้วยความเร็วที่พอใช้ได้ และเวอร์ชันคลาวด์ก็ยังรันอยู่ ผมจะปล่อยให้ agent พวกนี้ทำงาน แล้วจะมารายงานผลเมื่อได้ผลลัพธ์ครับ
ระหว่างรอ — อัปเดตสถานะ
โอเค ผ่านไปประมาณหนึ่งชั่วโมงแล้ว มันยังทำงานอยู่ แต่ใกล้เสร็จแล้วครับ ตัวท้องถิ่นดูเหมือนจะใกล้เสร็จพอสมควร เห็นไหม นี่คือ agent DeepSeek ท้องถิ่น ก่อนหน้านี้มันมี context window (หน่วยความจำบริบท) แค่ 100,000 ซึ่งเป็นเพราะการตั้งค่าแบบอนุรักษ์นิยมของผมเอง ผมเลยขยายเป็น 240K มันไปได้สูงกว่านั้นด้วยซ้ำ ผมทดสอบถึง 500K มาแล้ว แต่ตอนนี้ขออนุรักษ์ไว้ที่ 240 ก่อน ตอนที่มันเป็น 100K มันเล็กเกินไป มันคอยบีบอัดข้อมูลอยู่ตลอด แต่มันใกล้เสร็จแล้ว ไม่น่าใช้เวลานาน โมเดลท้องถิ่นเสร็จก่อนครับ เห็นไหม ตัวคลาวด์ยังทำงานอยู่ ไม่รู้ว่าจะดีหรือแย่ แต่โมเดลท้องถิ่นเสร็จเร็วกว่า ผมจะรอให้ตัวคลาวด์เสร็จ เพื่อจะได้ดูเทียบกัน แต่ที่น่าสนใจคือมันทำเสร็จเร็วกว่าจริง ๆ เรียบร้อยทั้งคู่ครับ และผมจะเริ่มจากเวอร์ชันท้องถิ่น
ผลลัพธ์โจทย์ข้อ 1 — เวอร์ชันท้องถิ่น
จำไว้นะครับ นี่คือ DeepSeek-V4-Flash 0731 เวอร์ชันที่ถูก quantize หนัก ๆ ซึ่งผมรันบน DGX Spark เครื่องเดียว นี่คือเว็บไซต์ แนวคิดคือพอเลื่อนลงมา มันควรมีองค์ประกอบต่าง ๆ ที่รวมตัวกันแล้วแยกออก เพื่อสร้าง landing page และเห็นชัดว่ามันทำได้ครับ แบบ one-shot เลย DeepSeek-V4-Flash เอาล่ะ ผมจะเลื่อนลงไปแล้ว ขอความกรุณาต่อตัวนี้หน่อยนะครับ เพราะมันเป็นเวอร์ชันที่ถูก quantize หนัก ๆ และนี่คืองานที่ยากมากจริง ๆ เลื่อนลงไปเลยครับ มันเริ่มเลื่อนลงมาแล้ว เห็นไหม มีองค์ประกอบอินเทอร์แอกทีฟบางอย่าง นั่นแหละ จางเข้ามาสวยดี เห็นมันขยับขึ้นและขยายขึ้นตอนที่เราเลื่อนลง ขึ้น เส้นขยับ Low High Max เห็นได้ชัดว่าบางองค์ประกอบตรงนี้เพี้ยนไป แต่ข้างล่างนี้ก็เห็นว่ามันขยับ เอาล่ะ จางเข้ามา นั่นแหละ Fast is the flagship Get the weights โอเค มันคงไม่ชนะ AI Royal Rumble หรอก แต่ขอบอกว่ามันสร้าง landing page ที่ใช้งานได้จริง และนั่นคือสิ่งที่ GLM 5.2 (โมเดล AI) ทำไม่ได้ตอน AI Royal Rumble ครับ มันมีองค์ประกอบอยู่หลายอย่าง บางอย่างก็เรียบมาก บางอย่างก็พังนิดหน่อย แต่อย่างน้อยมันก็พยายามทำองค์ประกอบอินเทอร์แอกทีฟพวกนี้ เห็นแถบนี้เลื่อนขึ้นลงตามการเลื่อนหน้าของเรา เห็นอันนี้พยายามขยายตอนเลื่อนลงหรือเลื่อนขึ้น มี fade (การค่อย ๆ จางหาย) ตัวหนังสือนี้หดเล็กลงตอนที่มันเลื่อนลง มันพยายามอย่างเต็มที่จริง ๆ ครับ มากกว่าที่ผมคาดไว้ด้วยซ้ำ แต่เห็นชัดว่ามันเทียบไม่ได้กับอะไรอย่าง Fable หรือ Soul ไม่ใช่ว่าพวกเขาอ้างว่าเทียบได้นะ ใช่ นี่คือผลงานของเวอร์ชันท้องถิ่นของผม มาดูกันว่าเวอร์ชันคลาวด์เต็มรูปแบบของ DeepSeek ทำอะไรได้บ้าง
ผลลัพธ์โจทย์ข้อ 1 — เวอร์ชันคลาวด์เต็มรูปแบบ
โอเค นี่คือตัวทางการครับ ตัวเต็มบนคลาวด์ หน้าตาดีตั้งแต่แรกเห็นเลย เลื่อนลงมาดูกัน นั่นสวยดี V4 Flash เอฟเฟกต์นั้นเจ๋งมาก ดี 30B mixture of experts routing Sparks เจ๋งมาก Low High Max Outperforms It's open, take it right now Fast is the flagship เจ๋งมาก หน้าตาตรงนั้นสวยดี Get the weights นั่นแหละ น่าประทับใจจริง ๆ ครับ มันอยู่ในระดับเดียวกับที่เราเห็นจากโมเดลพวกนั้นแน่นอน ผมจัดให้มันเทียบเท่ากับที่ K3 ทำได้เลยครับ Kimi K3 และผมคิดว่าบางส่วนมันเทียบได้กับ Soul และแม้แต่ Fable อาจต่ำกว่าสองตัวนั้นเล็กน้อย แต่เทียบเท่า Kimi K3 แน่นอน ด้วยขนาดที่เล็กกว่ามาก เอฟเฟกต์บางอย่างก็เจ๋งดี แน่นอนว่ามันไม่สมบูรณ์แบบ แม้แต่ Fable ก็ยังไม่สมบูรณ์ มีองค์ประกอบซ้อนทับกันบ้าง แต่โดยรวมผมพอใจกับผลลัพธ์นั้นมาก เจ๋ง ดี ใช่ครับ นั่นคือผลของโจทย์ยากข้อแรก และต่อไปเราจะไปโจทย์ข้อสองกัน
โจทย์ข้อที่ 2 — โลก Three.js จาก The Lord of the Rings
โจทย์ข้อสองที่ผมจะให้ มันไม่ได้เป็นส่วนหนึ่งของ AI Royal Rumble แต่อ้างอิงมาจากทวีตของ Andrej Karpathy เขาพูดถึงการใช้ Opus 5 (โมเดล AI) สร้างโลก Three.js (ไลบรารี JavaScript สำหรับกราฟิก 3 มิติ) ซึ่งเป็นฉากแบบ cinematic (เหมือนในภาพยนตร์) จากย่อหน้าแรกของ The Lord of the Rings จริงไหมครับ หน้าตามันดีมากสำหรับสิ่งที่มันเป็น และเขาบอกว่า Opus 5 ใช้เวลาทำสองชั่วโมง ด้วยงบประมาณ token ประมาณหนึ่งล้าน และนี่คือสิ่งที่มันสร้าง ดูดีอย่างที่ผมบอกครับ นั่นคือแนวคิดที่เราจะทำ ผมอยากลองสร้างแบบเดียวกันกับโมเดล DeepSeek ดูว่ามันทำได้ดีแค่ไหน คงไม่ใกล้เคียงขนาดนั้น แต่ถ้ามันเรนเดอร์ฉากแบบนี้ได้บ้างก็ถือว่าน่าประทับใจแล้ว เพราะนี่ค่อนข้างขั้นสูง นี่คือ prompt เต็มครับ ผมบอกว่าผมให้ย่อหน้าแรกของ Lord of the Rings และอยากให้มันสร้างโลก Three.js จากย่อหน้านั้น นี่คือข้อความหรือย่อหน้านั้นเอง และข้างล่างผมบอกว่า คุณต้องสร้าง cinematic rendering (การเรนเดอร์แบบภาพยนตร์) ของย่อหน้าแรกนี้ในสไตล์นี้ และผมให้วิดีโออ้างอิงนี้ด้วย เพราะ Karpathy เอามันไปวางบนเว็บไซต์ของเขาเอง ผมจะให้วิดีโอนั้นเป็น reference (ข้อมูลอ้างอิง) ให้พวกมันดู แม้ว่าพวกมันไม่ใช่ vision model (โมเดลที่มองเห็นภาพได้) จะดูไม่ได้ แต่บางทีอาจใช้ประโยชน์จาก reference นี้ได้บ้าง แล้วเราจะได้เห็นกัน
ผลลัพธ์โจทย์ข้อ 2 — เวอร์ชันท้องถิ่น
โอเค เราได้ผลลัพธ์จากโมเดลท้องถิ่นแล้ว ใช้เวลาประมาณหนึ่งชั่วโมงครึ่ง แต่เรามีอะไรบางอย่าง เห็นไหมว่ามีโลกบางอย่างเกิดขึ้น ผมจะกด play ดูว่าเรามีอะไร มันสร้างภาพยนตร์ออกมาจริง ๆ แน่นอนว่าไม่เนียนเท่าตัว Opus แต่มีคำบรรยาย มีการเคลื่อนกล้อง ตรงนั้นคือ Bag End mound (เนินแบ็กเอนด์) เท่าที่เห็น มันสั่น มีแผ่นดินไหวเหรอ? ผมว่าไม่น่ามีในหนังต้นฉบับนะ นั่นอาจเป็นองค์ประกอบที่พังไป เห็นตัวละครอยู่ตรงนี้ ผมไม่รู้ว่าทำไมมันสั่นมากขนาดนี้ เห็นตัวละครอีกตัว นั่น Bilbo หรือเปล่า? นี่คือ Party Fields (ทุ่งปาร์ตี้) [เสียงหัวเราะ] นี่คือ Hobbit holes (โพรงฮอบบิท) เล็ก ๆ แบบพื้นฐานมาก เห็นชัดว่ามีปัญหากล้องสั่น แต่อย่างที่บอก นี่คือโมเดลท้องถิ่นที่ถูก quantize หนัก ๆ ทำแบบ one-shot ผมว่าสำหรับสิ่งที่มันเป็น มันก็น่ารักดี อย่างน้อยมันก็ทำได้ มันไม่พัง แค่เรียบง่ายมาก และมีบั๊กเล็ก ๆ น้อย ๆ อยู่ตรงนี้ ต้นไม้ตรงนี้ดูค่อนข้างดีเลย โอ้โห โอเค ไม่รู้ว่าเกิดอะไรขึ้นตรงนั้น ไม่อยากทำให้คุณตกใจ ใช่ ผมไม่รู้ว่ากล้องสั่นเพราะอะไร แต่ฉากสุดท้ายตรงนี้ก็ไม่ได้แย่ขนาดนั้น จริงไหมครับ
ผลลัพธ์โจทย์ข้อ 2 — เวอร์ชันคลาวด์
โอเค นั่นคือโมเดลท้องถิ่นจัดการโจทย์นี้ มาดูกันว่าโมเดลคลาวด์ทางการทำอะไรได้บ้าง โอเค อันนี้ใช้เวลาประมาณ 40 นาทีตั้งแต่ต้นจนจบ ผมมีปัญหาการเชื่อมต่อบ้าง คิดว่าตอนนี้มีความต้องการใช้โมเดลนี้สูงมาก นี่คือสิ่งที่มันผลิตออกมา มาดูกัน กด play มันมีเสียงด้วยนะ แต่คุณฟังไม่ได้ หน้าตาดีกว่ามาก มันเป็นเต็นท์ปาร์ตี้เล็ก ๆ น่ารัก ท้องฟ้าดูสวยมากจริง ๆ นั่นคือ Hobbit holes แบ็กเอนด์ โอ้โห ว้าว กล้องถูกตัดไปหน่อย แต่มันดูคล้ายกับที่ Opus ทำเลย มีรายละเอียดเล็ก ๆ น้อย ๆ เยอะ แน่นอนว่าไม่สมบูรณ์แบบ แต่จริง ๆ แล้วมีองค์ประกอบดี ๆ อยู่เยอะ ผมว่าอย่างนั้น ตอนนี้เข้าสู่ช่วงกลางคืน ไฟดูดี ไฟตรงนี้ ท้องฟ้าก็สวยมาก ไฟตรงนั้นดูสวย นั่นแหละ โดยรวมแล้ว ผมว่ามันทำได้ค่อนข้างดีสำหรับการ one-shot โจทย์แบบนี้ ไม่ใช่ทุกอย่างที่สมบูรณ์แบบ จริงไหมครับ แต่มันเก็บรายละเอียดได้เยอะ ผมอยากย้อนกลับไปตอนที่มันอยู่ข้างใต้ ตรงนี้มันถูกตัดออกไป มีบางอย่างผิดกับมุมกล้อง แต่คุณเห็นไหมว่านี่คืออุโมงค์ที่เต็มไปด้วยสมบัติ มันสร้างฉากนั้นขึ้นมาใหม่ได้อย่างถูกต้องทีเดียว ภายใต้แสงสีเทา และมันดูไม่ดีเท่า Opus เห็นไหม? ดูใช้ได้เลย จริง ๆ แล้วดูไม่ดีเท่า Opus 5 แต่ผมว่ามันดูใช้ได้ทีเดียว สำหรับสิ่งที่มันเป็น และวิวกลางคืนก็ดูสวย ดังนั้นผมค่อนข้างประทับใจผลลัพธ์นี้สำหรับการ one-shot งานที่ค่อนข้างยากจริง ๆ และเห็นได้ชัดว่าคุณแยกความแตกต่างระหว่างเวอร์ชันเต็มทางการกับสิ่งที่โมเดลท้องถิ่นของผมทำได้ ใช่ นั่นแหละครับ
โจทย์ข้อที่ 3 — เกมปริศนาวงวนเวลา
โจทย์ยากข้อสุดท้ายที่ผมจะให้ คือ prompt เดียวกับที่ผมให้ agent ใน AI Royal Rumble เพื่อสร้างเกม และนี่ไม่ใช่เกมยิงปืนง่าย ๆ อะไรแบบนั้น พวกมันต้องสร้างเกม platformer (เกมแพลตฟอร์มกระโดดปีน) แบบ time loop puzzle (ปริศนาวงวนเวลา) ที่เล่นได้สมบูรณ์ โดยผู้เล่นต้องร่วมมือกับบันทึกการเล่นของตัวเองในรอบก่อน ๆ กลไกตัวนี้ยากมากจริง ๆ ตัวเกมไม่ต้องสวยงามอะไร ไม่ต้องมีอะไรเว่อร์ ๆ โมเดลส่วนใหญ่ แม้แต่ Fable ก็ทำแค่จอพิกเซลง่าย ๆ เช่น อันนี้คือของ Soul หรือ GPT-Soul (โมเดล AI) แนวคิดคือคุณต้องเล่นเป็นเทิร์น ๆ โดยเทิร์นก่อนหน้าจะเป็นเหมือนผี และคุณต้องร่วมมือกับตัวเอง ซึ่งก็คือเวอร์ชันก่อนหน้าของตัวเอง เพื่อแก้ปริศนา หวังว่าผมอธิบายเข้าใจนะครับ แต่แนวคิดคือแบบนั้น ใช่ มันเป็นกลไกที่ค่อนข้างซับซ้อน นี่คือของ GPT-Soul มาดูกัน นี่คือของ Fable เห็นชัดว่าภาพไม่ได้เว่อร์อะไร แต่กลไกต่างหากที่ยาก และโจทย์พวกนี้ยากมาก ใช้เวลาหลายชั่วโมงกว่าจะเสร็จ นั่นคือของ Fable และนี่คือของ Kimi K3 ภาพยิ่งเรียบง่ายเข้าไปอีก แต่กลไกก็ยากเหมือนกัน พวกมันทำกลไกได้ดีทุกตัว มีแค่ Kimi K3 ที่พลาดโจทย์นี้ ไม่ออกมาดีเท่าตัวอื่น นี่คือสิ่งที่ผมขอให้โมเดล DeepSeek ลองทำ ผมจะทึ่งมากถ้าโมเดลท้องถิ่นทำได้ มาดูกันครับ ผมเคยนับโมเดล DeepSeek ท้องถิ่นที่ถูก quantize ว่าตกรอบไปแล้ว แต่จนถึงตอนนี้มันผ่านทุกโจทย์มาได้ ไม่สมบูรณ์แบบ ที่จริงก็ไม่ค่อยดีนัก แต่ก็ผลิตอะไรออกมาได้ ใช่ ผมจะให้ prompt นี้กับพวกมัน แล้วมาดูกันว่าทำอะไรได้บ้าง โอเค เริ่ม session ใหม่ให้ตัวนี้ แล้วดูว่ามันจัดการยังไง
ระหว่างรอ — อัปเดตสถานะ
โอเค มันเริ่มทำงานแล้ว ทั้งสองตัวรันมาแล้ว 1 ชั่วโมง 10 นาที อันนี้จะใช้เวลานานหน่อย ผมว่า Kimi K2 หรือ Kimi K3 ใช้เวลาประมาณ 2 ชั่วโมง เห็นไหมว่ามันยังทำงานอยู่ ยังคิดอยู่ พยายามวางแผน แต่นี่เป็นโจทย์ที่ยาก มันต้องใช้เวลานาน ที่จริงผมว่า Kimi K3 ใช้เวลาราว 3 ชั่วโมงทำโจทย์นี้ และแม้แต่ Fable ก็น่าจะเกินสองชั่วโมง มันต้องใช้เวลาพอสมควรครับ
เอาล่ะ เสร็จแล้ว นี่คือเวอร์ชันท้องถิ่น มันเสร็จตอน 1 ชั่วโมง 10 นาที หลังอัปเดตเมื่อกี้พอดี ผมถูกรบกวนเล็กน้อยระหว่างนั้น รวมแล้วประมาณ 2 ชั่วโมง 40 นาที ใกล้เคียงกับ Kimi K3 ครับ และเวอร์ชันคลาวด์ก็เสร็จตามมาอีกสักพัก แต่ผมมีปัญหาการเชื่อมต่ออีกครั้ง ใช้เวลาใกล้เคียงกันน่าจะได้ โอเค อันแรกที่ผมจะลองคือโมเดลท้องถิ่น ลองเล่นเกมของมันดูครับ
ผลลัพธ์โจทย์ข้อ 3 — เวอร์ชันท้องถิ่น
โอเค นี่คือเกมของโมเดลท้องถิ่น เห็นไหมว่ามีคำแนะนำอยู่ตรงนี้ แผงนี้มีบั๊ก ถ้าคุณเปิด console (คอนโซลสำหรับตรวจสอบโค้ด) จะเห็นว่ามีบั๊กในวิธีที่มันแสดงผล ปกติใน AI Royal Rumble แบบนี้ก็ถูกตัดสิทธิ์ทันที แต่ผมจะให้โอกาสมันซ่อมบั๊กนี้ เพื่อที่เราจะได้เห็นว่าเกมจริง ๆ เป็นยังไง มันน่าจะเป็นอะไรที่พื้นฐานมาก มาดูกัน เห็นไหม มันเป็นบั๊กของ loader (ตัวโหลดข้อมูล) ที่ต้องการอะไรบางอย่าง โอเค ได้แล้ว มันพื้นฐานมาก ใช่ แค่นั้นเอง โอ้ คุณเก็บอันนั้นได้ โอเค ผมจะลองแก้ปริศนานี้หน้ากล้องเลย โอเค คิดว่าเข้าใจแล้ว นั่นคือกุญแจ ได้แล้ว นั่นคือกุญแจ อ่านตัวหนังสือยาก แต่มันเขียนว่า key (กุญแจ) และ lock (แม่กุญแจ) ตรงนี้ หยุดบนแผ่นที่ 8 เพื่อเปิดประตู หยุดบนแผ่นเพื่อปลดล็อกประตู แล้วหยุดบนเป้าหมายเพื่อชนะ โอเค คิดว่าเข้าใจแล้ว ชนะแล้ว นั่นแหละ เกมง่ายมาก แต่กลไกใช้งานได้จริง เห็นไหม คุณต้องหยุดตรงนั้น แล้วเจ้าตัวนี้ต้องอยู่ตรงนั้น แล้วก็ชนะ จริงไหม? โอเค มันทำกลไกได้ แบบง่ายที่สุดเท่าที่จะทำได้ แต่นี่คือโมเดลท้องถิ่นของผมอีกครั้ง การที่มันทำให้มันทำงานได้ ถือว่าน่าประทับใจสำหรับผมอย่างน้อย มาลองเวอร์ชันทางการจริง ๆ กันครับ
ผลลัพธ์โจทย์ข้อ 3 — เวอร์ชันคลาวด์
โอเค เห็นได้เลยว่าอันนี้ขั้นสูงกว่า นี่คือโมเดล DeepSeek เต็มรูปแบบที่รันบนคลาวด์ ผ่าน New Portal ในกรณีนี้ พวกเขาเรียกมันว่า Echo Vault เกมปริศนาวงวนเวลา มาดูกันว่าผมเล่นได้ดีแค่ไหน ไปเลย ขึ้น มีกำแพงล่องหน เห็นจะได้ ถ้าผมทำแบบนั้นล่ะ? ทำยังไง โอเค ได้แล้ว ผมได้ rewind (กรอกลับเวลา) งั้นกำแพงล่องหนนั้นเปิดด้วยสิ่งนี้ โอเค ผ่านได้แล้ว ผมเก็บอะไรบางอย่างได้ โอ้ นั่นคือกุญแจ นั่นแหละ คิดว่ารอบนี้คงไม่ทันเวลา ผมใช้เวลานานเกินไปกับประตูแรก นี่คล้ายกัน เห็นไหม? นั่นแหละ คิดว่าไม่ทัน ขอเล่นใหม่ โอเค ลองอีกครั้ง นั่นคือหนึ่ง แล้วเอากุญแจไปวางตรงนี้ เปิดประตูที่ดูเหมือนล่องหนนั่น นี่คือ ถ้าคุณจำอันที่ Kimi K3 ทำไว้ได้ อันนี้ดูอลังการกว่า ขึ้น ผมตายหรือเปล่า? ติดอยู่ตรงนี้ ไม่รู้จะทำยังไง ต้องจับจังหวะสินะ? ผมจะลอดข้างล่าง ขึ้น เดาว่ามันยกมันขึ้นไว้ จริงไหม? ผมผ่านได้ไหม? เราทำได้ ห้องนิรภัยเปิดแล้ว Four loops, three echoes, one timeline (สี่วงวน สามเสียงสะท้อน หนึ่งไทม์ไลน์) ดีมาก พวกมันใช้กลไกหลายอย่างตรงนี้ ทั้งแผ่นกด กุญแจ และเจ้าตัวนี้ที่ช่วยยกของ ถือว่าฉลาดมาก เพราะหลายโมเดล แม้แต่ของ Soul ก็แค่ใช้ปุ่มง่าย ๆ ถึงภาพจะสวยกว่ามาก แต่ก็เป็นแค่ปุ่มเดียว และถ้าคุณจำได้ นี่คือของ Kimi K3 อันนี้ก็ประมาณสองปุ่ม และอีกอันที่เขาเรียกว่า fuse (ฟิวส์) แต่จริง ๆ แล้วคือกุญแจ ดังนั้นโมเดล DeepSeek นี้มีเกมที่สร้างสรรค์กว่า ผมว่าอย่างนั้น และภาพก็ดีกว่าตัว Kimi ด้วย จริงไหมครับ แน่นอน ดีกว่าชัด ๆ น่าประทับใจทีเดียว เมื่อพิจารณาความแตกต่างระหว่างสองโมเดลนี้ และนั่นคือโจทย์สุดท้ายของเรา
สรุปผลการทดสอบโดยรวม
โดยรวมจากการเล่นกับมันและดูว่ามันทำงานยังไง ผมว่ามันทำได้ระดับเดียวกันครับ จำตอนเปิดคลิปได้ไหม ลูกกลมนั้นเทียบเท่ากับโมเดล frontier (โมเดลระดับแนวหน้า) รุ่นล่าสุดได้เลย หน้า landing page ในงานออกแบบ front-end อาจต่ำกว่า Kimi K3 ในโจทย์ AI Royal Rumble เล็กน้อย แต่มันทำเสร็จเร็วกว่ามาก และในโจทย์เกมนี้ ผมแปลกใจจริง ๆ เพราะมันดีกว่าที่ Kimi K3 ทำได้อย่างเห็นได้ชัด และแนวคิดยังซับซ้อนกว่าของ Soul ด้วยซ้ำ จำอันนี้ได้ไหม? อันนี้ก็แค่แผ่นกด จับประตูให้เปิดไว้ อันนี้ซับซ้อนกว่า ดังนั้นในเชิงแนวคิดในฐานะเกม มันใกล้เคียงกับที่ Fable ทำได้ ซึ่งค่อนข้างบ้า ใช่ มันอยู่ในระดับเดียวกับ Kimi K3 และแล้วแต่โจทย์ บางโจทย์ก็เหนือกว่า
เปรียบเทียบขนาดโมเดล
และนี่คือสิ่งที่ทำให้บ้าตอนเปรียบเทียบสองโมเดลนี้ โมเดล DeepSeek นี้มีพารามิเตอร์รวม 284 พันล้านตัว (284B) ส่วน Kimi K3 มี 2.8 ล้านล้านตัว ใหญ่กว่าเกือบ 10 เท่า และ activated parameters (พารามิเตอร์ที่ถูกใช้งานจริงในแต่ละครั้ง) มากกว่า 8 เท่า ซึ่ง Kimi เป็นโมเดลที่ยอดเยี่ยม ผมไม่ได้จะดูถูกมันนะครับ ผมแค่ทึ่งที่โมเดลที่เบาบางขนาดนี้ต่อยอดหนักเกินตัวขนาดไหน เลเยอร์ลึกกว่า 2.2 เท่า มี context window เท่ากัน ข้อได้เปรียบใหญ่ของ K3 คือรองรับภาพด้วย ทำ vision (การมองเห็น) ได้ และใช้สถาปัตยกรรม routed experts คล้ายกัน ผมอาจทำวิดีโอเกี่ยวกับสถาปัตยกรรมเต็มรูปแบบของ DeepSeek ตัวนี้ ถ้าคนสนใจ แต่มันมีลักษณะคล้ายกันหลายอย่าง การที่สองโมเดลนี้ให้ผลลัพธ์ใกล้เคียงกัน บางครั้งต่ำกว่าเล็กน้อย บางครั้งสูงกว่าเล็กน้อย มันค่อนข้างบ้าเมื่อเทียบกับความต่างของขนาด และความต่างของราคา
เรื่องราคา
อย่างเช่น บน OpenRouter (แพลตฟอร์มรวม API ของโมเดล AI) ราคา input (ข้อมูลนำเข้า) ของโมเดล DeepSeek คือ 9 เซนต์ ราคา output (ข้อมูลที่โมเดลสร้าง) คือ 18 เซนต์ ส่วน Kimi K3 อยู่ที่ 2.9 และ 14 ตามลำดับ ต่างกันมหาศาลมากครับ ถ้าจำได้จาก AI Royal Rumble ตัว Kimi K3 ทำให้ผมเสียเงิน $25 เพื่อสร้างเกม ส่วนตัวนี้เสียแค่ 53 เซนต์สำหรับการรันทั้งหมด ผมไม่มีตัวเลขแยกรายโจทย์ แต่รวมถึง landing page เกมลูกกลม One Piece ที่คุณเห็นตอนเปิดคลิป และฉาก Lord of the Rings ทั้งหมด รวมแล้ว 53 เซนต์ New Portal มีดีลลด 90% อีกราวหนึ่งสัปดาห์ แต่ต่อให้คูณสิบ มันก็แค่ $5 กว่า ๆ เท่านั้น แค่นั้นก็ถูกกว่าที่เราใช้กับ Kimi K3 มากแล้ว เพราะแค่เกมเดียวก็ $25 อย่างที่บอก นั่นแหละครับ
บทสรุปและมุมมองส่วนตัว
นั่นคือจุดจบของการทดสอบโจทย์ยากของผม ไม่ใช่ first look จริง ๆ เพราะใช้เวลาทั้งวัน แต่เป็นโจทย์ที่ท้าทายจริง ๆ และมันจัดการได้ทุกข้อครับ เวอร์ชัน dense (เต็มรูปแบบ) ทำได้ดีมาก และแม้แต่เวอร์ชันท้องถิ่นที่ถูก quantize หนัก ๆ ของผม ก็ทำเสร็จทุกโจทย์ โจทย์สุดท้ายที่เป็นเกมใช้สองรอบ ไม่ใช่ one-shot แต่สองโจทย์แรกเป็น one-shot และแน่นอนว่าคุณภาพไม่ได้ดีเลิศ แต่ผมจะไม่มีวันใช้โมเดลท้องถิ่นที่ถูก quantize แบบนั้นกับงานหนัก ๆ แบบนี้ ผมจะใช้โมเดล frontier อย่างจริงจังสำหรับงานเขียนโค้ดที่หนักหน่วงแบบนี้ แต่การได้เล่นกับโมเดลท้องถิ่นมันสนุกดี นั่นคือเหตุผลหลักของผม
คุณอาจสงสัยว่าทำไม เพราะตอนนี้มันไม่มีเหตุผลทางเศรษฐกิจเท่าไรนัก โมเดล DeepSeek นี้บนคลาวด์ถูกมากจนไม่มีเหตุผลทางเศรษฐกิจมากนักที่จะรันบนเครื่องเอง แต่มันสนุกที่ได้เล่นกับโมเดลเหล่านี้ในระดับท้องถิ่น ตั้งค่าพวกมัน ลองปรับแต่งให้เหมาะสม คุณเรียนรู้ได้เยอะ ถ้าคุณเป็นคนชอบงัดแงะแบบผม การทำแบบนี้สนุกมากครับ และถ้าคุณแคร์เรื่องความเป็นส่วนตัวมาก จุดเด่นใหญ่คือผมเก็บข้อมูลทั้งหมดไว้บนเครื่องของผม ไม่ส่งไปเซิร์ฟเวอร์คลาวด์ และมันเป็นของผม ไม่มีใครเอาออกไปจากผมได้ คุณคงเห็นมาก่อนหน้านี้แล้ว ผมมีปัญหาการเชื่อมต่อกับเวอร์ชันคลาวด์ มันหลุดบ่อย อันนั้นจะไม่เกิดขึ้นถ้ารันบนเครื่อง จริงไหมครับ นั่นคือข้อดีอีกข้อหนึ่ง
และผมอยากรู้ว่าคนสนใจกันไหม ถ้าสนใจ ผมจะทำเวอร์ชันแบบ fine-tuning (การปรับแต่งโมเดลเพิ่มเติม) เพื่อการวิจัยแบบอัตโนมัติ โดยพยายามปรับแต่งโมเดล DeepSeek ท้องถิ่นของผมให้ดีที่สุด ตอนนี้ผมยังไม่ได้งัดแงะมากขนาดนั้น แต่โดยรวมผมค่อนข้างประทับใจกับประสิทธิภาพของมัน ผมจะไม่ใช้มันกับงานเขียนโค้ดระดับโหด อย่างที่บอก แต่มันเป็น workhorse (ม้าลากงาน) ที่แข็งแกร่งได้ ผมใช้มันต่อเนื่องเกินกว่างานพวกนี้อีกเล็กน้อย มันตอบสนองเร็วมาก เป็นนักวิจัยที่ดี ฉลาดพอสมควร ไม่ได้ดูโง่ ไม่ทำเรื่องโง่ ๆ และผมว่ามันมีประโยชน์จริง ๆ ในฐานะ workhorse สำหรับงานระยะยาว (long-horizon tasks) มันจัดการ context ยาว ๆ ได้ดีมาก ดังนั้นผมว่าแน่นอนว่ามันเป็นโมเดลที่มีประโยชน์เมื่อรันบนเครื่องท้องถิ่น
วิดีโอหน้าและคำถามทิ้งท้าย
เอาล่ะ นั่นคือทั้งหมด นี่จะเป็นการจบวิดีโอนี้ หวังว่าคุณจะสนุกนะครับ สัปดาห์หน้าโมเดลใหม่ Qwen 3.8 จะออกมา ผมรู้ว่าเวอร์ชัน max ออกมาบนคลาวด์แล้ว บางทีผมอาจทำอะไรคล้าย ๆ นี้ ให้โจทย์เดียวกัน ใช้เวอร์ชันคลาวด์ ตัว max และผมรู้ว่าพวกเขาจะต้องทำ open weights สำหรับเวอร์ชัน 27 พันล้าน (27B) ซึ่งเล็กกว่า DeepSeek ตัวนี้ด้วยซ้ำ แต่ผมอยากรู้ว่ามันจะรับมือกับโจทย์ยาก ๆ แบบนี้ยังไง โมเดลนั้นมี vision ด้วย ซึ่งน่าสนใจ มาดูกันว่ามันทำงานยังไง จริง ๆ แล้วผมคงโฮสต์เวอร์ชัน max ไม่ไหว แต่เวอร์ชัน 27 พันล้านทำได้ เอาไว้ดูกันสัปดาห์หน้า
นี่จะเป็นการจบวิดีโอนี้ ฝากคอมเมนต์ไว้ด้วยนะครับ คุณคิดยังไงบ้าง ประสบการณ์ของคุณจนถึงตอนนี้กับ DeepSeek-V4-Flash 0731 เป็นยังไงบ้าง ชื่อยาวมากจริง ๆ จริงไหมครับ แต่ประสบการณ์ของคุณกับโมเดลนี้เป็นยังไง บอกผมด้วยนะครับ นี่คือการจบวิดีโอนี้ ขอบคุณที่รับชมครับ
หมายเหตุการแปล
ความโปร่งใสเกี่ยวกับความไม่แน่นอนในต้นฉบับ
- ## จุดที่ไม่ได้ใช้ [ฟังไม่ชัด]
- เสียงพูดโดยรวมฟังได้ชัด จึงไม่มีการใช้เครื่องหมาย [ฟังไม่ชัด] ในคำแปล อย่างไรก็ตาม เนื่องจากเป็นคำบรรยายอัตโนมัติ จึงมีจุดที่ตัวสะกด/คำในคำบรรยายกำกวม ซึ่งผู้แปลตีความอย่างระมัดระวังและระบุไว้ด้านล่าง
- 6. **"New Portal"** — ชื่อแพลตฟอร์ม/บริการที่ใช้รันโมเดลคลาวด์ ฟังไม่ชัดว่าเป็นชื่อผลิตภัณฑ์หรือไม่ จึงคงเป็นภาษาอังกฤษ "New Portal" ตามคำบรรยาย
- 8. **"Mosh Aib"** — ชื่อผู้ใช้ที่ฟังไม่ชัด คงการสะกดตามคำบรรยายอัตโนมัติ
- ## รายการ [ฟังไม่ชัด] ในคำแปล
อภิธานศัพท์เทคนิค
คำศัพท์และชื่อผลิตภัณฑ์ที่คงรูปภาษาอังกฤษ
| ศัพท์ | คำแปล / คำอธิบาย |
|---|---|
| DeepSeek-V4-Flash 0731 | โมเดล AI รุ่นใหม่ล่าสุดของ DeepSeek ที่ถูกทดสอบในวิดีโอนี้ |
| Hermes Agent | เฟรมเวิร์กสำหรับรัน agent อัตโนมัติ ใช้ส่งงานให้โมเดล AI |
| DGX Spark | คอมพิวเตอร์ AI ส่วนตัวของ NVIDIA ใช้รันโมเดลบนเครื่อง |
| Agent Swarm | ระบบจัดการ agent หลายตัวทำงานร่วมกัน |
| LM wikis | คลังความรู้เกี่ยวกับโมเดลภาษา (language models) |
| agentwikis.com | เว็บโปรเจกต์ของเจ้าของช่องที่แจก wiki ฟรี |
| quantization / quantize | การบีบอัดขนาดน้ำหนักโมเดลให้เล็กลง เพื่อรันบนฮาร์ดแวร์ที่เล็กกว่า |
| Q2 | ระดับการบีบอัดเหลือ 2 บิต (รุนแรงมาก) |
| dense weights | น้ำหนักโมเดลแบบเต็มรูปแบบ (ปกติหมายถึง 16-bit) |
| open weights | น้ำหนักโมเดลที่เปิดเผยให้ดาวน์โหลดใช้ฟรี |
| benchmark | การวัดประสิทธิภาพโมเดล |
| prefill | การประมวลผลข้อมูลล่วงหน้าก่อนเริ่มสร้างคำตอบ |
| token | หน่วยย่อยของข้อความที่โมเดลประมวลผล |
| multi-agent | ระบบที่ agent หลายตัวทำงานพร้อมกัน |
| routed experts | สถาปัตยกรรมโมเดลแบบผู้เชี่ยวชาญแยกเส้นทาง (เฉพาะส่วนที่เกี่ยวข้องถูกเรียกใช้งาน) |
| activations | ค่าการทำงานของนิวรอนระหว่างประมวลผล |
| context window | หน่วยความจำบริบท ขนาดข้อความที่โมเดลประมวลผลได้ในครั้งเดียว |
| prompt | คำสั่ง/โจทย์ที่ให้กับโมเดล |
| one-shot | การให้งานครั้งเดียวจบ โดยโมเดลทำงานเองโดยไม่ถามคำถามเพิ่ม |
| session | รอบการสนทนากับโมเดล |
| landing page | หน้าโปรโมตสินค้า/หน้าเปิดตัวของเว็บไซต์ |
| launch website | เว็บไซต์เปิดตัวสินค้า |
| front-end | ส่วนติดต่อผู้ใช้ของเว็บไซต์ |
| scrolling | การเลื่อนหน้าเว็บ |
| transition | การเปลี่ยนฉาก/จังหวะการแสดงผล |
| stutter effect | เอฟเฟกต์ตัวอักษรทยอยโผล่ทีละตัว |
| fade | การค่อย ๆ จางหายของภาพ/ตัวอักษร |
| Three.js | ไลบรารี JavaScript สำหรับสร้างกราฟิก 3 มิติในเว็บเบราว์เซอร์ |
| cinematic rendering | การเรนเดอร์ฉากแบบภาพยนตร์ |
| vision model | โมเดลที่มองเห็นและประมวลผลภาพได้ |
| reference | ข้อมูลอ้างอิงที่ให้โมเดลใช้ประกอบ |
| platformer | เกมแพลตฟอร์ม (กระโดดปีนผ่านด่าน) |
| time loop puzzle | เกมปริศนาวงวนเวลา |
| pixel display | การแสดงผลแบบพิกเซล (กราฟิกเรียบง่ายแบบเกมย้อนยุค) |
| rewind | การกรอกลับเวลาในเกม |
| console | คอนโซลสำหรับตรวจสอบโค้ด/ข้อผิดพลาด |
| loader | ตัวโหลดข้อมูล/ทรัพยากรของเกม |
| key / lock | กุญแจ / แม่กุญแจ (ไอเทมในเกม) |
| fuse | ฟิวส์ (ในเกมของ Kimi K3 ใช้แทนกุญแจ) |
| Echo Vault | ชื่อเกมปริศนาวงวนเวลาที่โมเดล DeepSeek สร้าง |
| New Portal | แพลตฟอร์ม/บริการที่ใช้รันโมเดลบนคลาวด์ (อ้างอิงตามคำบรรยาย) |
| frontier model | โมเดลระดับแนวหน้าที่ล้ำสมัยที่สุด |
| activated parameters | พารามิเตอร์ที่ถูกใช้งานจริงในการประมวลผลแต่ละครั้ง |
| OpenRouter | แพลตฟอร์มรวม API ของโมเดล AI หลายตัว |
| input / output | ข้อมูลนำเข้า / ผลลัพธ์ที่โมเดลสร้าง |
| fine-tuning | การปรับแต่งโมเดลเพิ่มเติมด้วยข้อมูลเฉพาะ |
| workhorse | ม้าลากงาน หมายถึงโมเดลที่ใช้งานประจำได้อย่างต่อเนื่อง |
| long-horizon tasks | งานระยะยาวที่ต้องทำหลายขั้นตอนต่อเนื่องกัน |
| vision | ความสามารถในการมองเห็น/ประมวลผลภาพ |
| AI Royal Rumble | ซีรีส์การแข่งขันท้าทายโมเดล AI ของช่อง |
| first-look | วิดีโอรีวิวโมเดลครั้งแรกแบบงานไว ๆ |
| Claude Fable | โมเดล AI ที่อ้างอิงจากซีรีส์ AI Royal Rumble |
| Kimi K3 | โมเดล AI ที่อ้างอิงจากซีรีส์ AI Royal Rumble |
| GPT-Soul | โมเดล AI ที่อ้างอิงจากซีรีส์ AI Royal Rumble |
| GLM 5.2 | โมเดล AI ที่อ้างอิงจากซีรีส์ AI Royal Rumble |
| Opus 5 | โมเดล AI ที่อ้างอิงจากทวีตของ Andrej Karpathy |
| Qwen 3.8 | โมเดล AI รุ่นใหม่ที่จะเปิดตัว (กล่าวถึงในวิดีโอ) |
| Andrej Karpathy | นักวิจัย AI ผู้โพสต์ตัวอย่างการสร้างฉาก 3 มิติด้วย Opus 5 |
| The Lord of the Rings | นวนิยายแฟนตาซี ใช้เป็นโจทย์สร้างฉาก 3 มิติ |
| Bag End | บ้านของบิลโบในเรื่องลอร์ดออฟเดอะริงส์ |
| Hobbit holes | โพรงบ้านของฮอบบิท |
| Party Fields | ทุ่งปาร์ตี้ (สถานที่ในเรื่อง) |
| Bilbo | บิลโบ แบ๊กกิ้นส์ ตัวละครในเรื่อง |
| Star Wars / One Piece | ภาพยนตร์/การ์ตูนที่ใช้เป็นธีมในโจทย์สร้าง landing page |
ซับไตเติ้ลภาษาไทย
ดาวน์โหลดหรือดูซับทั้งหมด
1 00:00:00,000 --> 00:00:01,735 ตัวอย่างเปิดคลิป — 2 00:00:01,735 --> 00:00:06,167 หน้าเว็บลูกโลกอินเทอร์แอกทีฟ ถ้าคุณเคยดูวิดีโอ 3 00:00:06,167 --> 00:00:09,733 first-look (รีวิวโมเดลครั้งแรก) ของผม 4 00:00:09,733 --> 00:00:13,299 คุณจะคุ้นเคยกับ prompt (คำสั่ง) นี้ดี
เปิดดูซับไตเติ้ลทั้งหมด (589 segments)
1 00:00:00,000 --> 00:00:01,735 ตัวอย่างเปิดคลิป — 2 00:00:01,735 --> 00:00:06,167 หน้าเว็บลูกโลกอินเทอร์แอกทีฟ ถ้าคุณเคยดูวิดีโอ 3 00:00:06,167 --> 00:00:09,733 first-look (รีวิวโมเดลครั้งแรก) ของผม 4 00:00:09,733 --> 00:00:13,299 คุณจะคุ้นเคยกับ prompt (คำสั่ง) นี้ดี 5 00:00:13,299 --> 00:00:17,731 ผมขอให้โมเดลสร้างเว็บไซต์ ซึ่งเป็นหน้า landing 6 00:00:17,731 --> 00:00:22,164 page (หน้าโปรโมตสินค้า) สำหรับเกมแนว Star Wars 7 00:00:22,164 --> 00:00:26,597 เจอกับ One Piece และขอลูกกลมเรืองแสงเอาไว้ด้วย 8 00:00:26,597 --> 00:00:29,777 นี่คือสิ่งที่มันสร้างออกมาให้ครับ 9 00:00:29,777 --> 00:00:32,668 เห็นชัดว่ามันอินเทอร์แอกทีฟมาก 10 00:00:32,668 --> 00:00:36,908 พอผมเลื่อนเมาส์ไปเหนือลูกโลก ลูกโลกก็ขยับตาม 11 00:00:36,908 --> 00:00:41,052 ซึ่งเป็นสิ่งที่ผมไม่เคยเห็นโมเดลไหนทำมาก่อน 12 00:00:41,052 --> 00:00:45,389 และพอเลื่อนหน้าลงมา ควรจะมี headline (พาดหัว) 13 00:00:45,389 --> 00:00:47,894 โผล่ขึ้นมาแบบสไตล์ stutter 14 00:00:47,894 --> 00:00:50,303 (ตัวอักษรทยอยโผล่ทีละตัว) 15 00:00:50,303 --> 00:00:53,965 มาดูกันว่ามันจะเวิร์กไหมครับ นี่ไงครับ 16 00:00:53,965 --> 00:00:58,398 ลูกโลกเริ่มจางหายไป แล้วพาดหัวก็ทยอยโผล่เข้ามา 17 00:00:58,398 --> 00:01:02,831 The Odyssey for One Piece begins (การผจญภัยของ 18 00:01:02,831 --> 00:01:07,264 One Piece เริ่มต้นขึ้น) โมเดลนี้ทำได้ดีมากครับ 19 00:01:07,264 --> 00:01:11,311 พอเลื่อนขึ้นไป ลูกโลกก็กลับคืนมาเหมือนเดิม 20 00:01:11,311 --> 00:01:13,238 ลูกโลกดูสวยมากจริง ๆ 21 00:01:13,238 --> 00:01:18,346 ครับ มันมีองค์ประกอบอินเทอร์แอกทีฟซึ่งโมเดลรุ่นก่อน ๆ 22 00:01:18,346 --> 00:01:21,333 ไม่เคยทำได้ และเอฟเฟกต์ stutter 23 00:01:21,333 --> 00:01:23,453 ของพาดหัวก็ออกมาดีด้วย 24 00:01:23,453 --> 00:01:26,441 นี่คืองานที่ดีมากของโมเดลตัวนี้ 25 00:01:26,441 --> 00:01:29,813 และอย่างที่คุณคงเดาได้จากชื่อวิดีโอ 26 00:01:29,813 --> 00:01:33,861 นี่คือผลงานของโมเดล DeepSeek-V4-Flash 0731 27 00:01:33,861 --> 00:01:37,619 ครับ งานนี้ถือว่าง่าย แต่ในวิดีโอวันนี้ 28 00:01:37,619 --> 00:01:40,992 เราจะทดสอบโมเดลตัวนี้กันจริง ๆ ครับ 29 00:01:40,992 --> 00:01:44,654 ทั้งเวอร์ชันคลาวด์ เวอร์ชัน API ทางการ 30 00:01:44,654 --> 00:01:48,219 และตัวที่รันอยู่บนเครื่อง PC ของผมเอง 31 00:01:48,219 --> 00:01:52,556 เริ่มกันเลยครับ โปรโมตโปรเจกต์ agentwikis.com 32 00:01:52,556 --> 00:01:56,700 อ้อ ถ้าคุณใช้ Agent Swarm (ระบบจัดการ agent 33 00:01:56,700 --> 00:01:59,880 หลายตัว) อยู่ และอยากได้ LM wikis 34 00:01:59,880 --> 00:02:02,867 (คลังความรู้เกี่ยวกับโมเดลภาษา) 35 00:02:02,867 --> 00:02:07,203 ที่ผมใช้ค้นคว้าและสร้างวิดีโอพวกนี้ด้วยตัวเอง 36 00:02:07,203 --> 00:02:10,865 ลองไปดูโปรเจกต์ของผมที่ agentwikis.com 37 00:02:10,865 --> 00:02:12,793 ได้นะครับ ผมให้ wiki 38 00:02:12,793 --> 00:02:15,395 เหล่านี้ฟรีในหลากหลายหัวข้อ 39 00:02:15,395 --> 00:02:19,538 และคุณสมัครบัญชีโปรได้ในราคา $9.99 ต่อเดือน 40 00:02:19,538 --> 00:02:22,526 เพื่อเข้าถึง wiki ขนาดใหญ่พิเศษ 41 00:02:22,526 --> 00:02:27,633 ที่มีหน้ามากขึ้นและรายละเอียดในแต่ละหัวข้อมากขึ้นด้วย 42 00:02:27,633 --> 00:02:31,199 กลับมาที่วิดีโอกันครับ ข่าวการเปิดตัว 43 00:02:31,199 --> 00:02:35,632 DeepSeek-V4-Flash 0731 สัปดาห์ที่แล้ว DeepSeek 44 00:02:35,632 --> 00:02:38,908 ประกาศโมเดล DeepSeek-V4-Flash 0731 45 00:02:38,908 --> 00:02:41,124 ขึ้นมาค่อนข้างกระทันหัน 46 00:02:41,124 --> 00:02:45,172 เป็นเวอร์ชันใหม่ของโมเดล DeepSeek-V4-Flash 47 00:02:45,172 --> 00:02:48,737 รุ่นก่อนหน้า อย่างที่เห็นใน benchmark 48 00:02:48,737 --> 00:02:51,243 (การวัดประสิทธิภาพ) ตรงนี้ 49 00:02:51,243 --> 00:02:55,098 มันพัฒนาขึ้นอย่างมาก และพวกเขาปล่อย open 50 00:02:55,098 --> 00:02:57,892 weights (น้ำหนักโมเดลแบบเปิด) 51 00:02:57,892 --> 00:02:59,530 ออกมาพร้อมกันด้วย 52 00:02:59,530 --> 00:03:02,903 นับเป็นการเปิดตัวที่น่าตื่นเต้นครับ 53 00:03:02,903 --> 00:03:05,601 มีคนจำนวนมากรีบทดลองใช้ทันที 54 00:03:05,601 --> 00:03:09,842 เพราะเราเพิ่งเคยเห็นโมเดลที่เก่งขนาดนี้รันบน 55 00:03:09,842 --> 00:03:14,178 Spark ได้เพียงสองเครื่อง และผลลัพธ์บางอย่างก็ 56 00:03:14,178 --> 00:03:18,322 impressive (น่าประทับใจ) มาก เช่น คนนี้ชื่อ 57 00:03:18,322 --> 00:03:21,406 Mosh Aib ทำเกมนี้ใน Hermes Agent 58 00:03:21,406 --> 00:03:24,971 (เฟรมเวิร์กสำหรับรัน agent อัตโนมัติ) 59 00:03:24,971 --> 00:03:29,211 ด้วยเงินเพียง 7 เซนต์ ฟังก์ชันน่าประทับใจมาก 60 00:03:29,211 --> 00:03:33,451 แต่ที่มากกว่านั้นคือเรื่องต้นทุน มันถูกมาก ๆ 61 00:03:33,451 --> 00:03:35,186 และเร็วมากด้วยครับ 62 00:03:35,186 --> 00:03:39,426 ตอนแรกผมคิดว่าผมคงรันมันไม่ได้ เพราะผมมี DGX 63 00:03:39,426 --> 00:03:43,281 Spark (คอมพิวเตอร์ AI ส่วนตัวของ NVIDIA) 64 00:03:43,281 --> 00:03:46,461 แค่เครื่องเดียว แต่ Blaze Goodson 65 00:03:46,461 --> 00:03:50,604 ลงมือทำงานตรงนี้เยอะมาก และตอนนี้มันใส่ลงใน 66 00:03:50,604 --> 00:03:54,363 Spark เครื่องเดียวได้เต็มรูปแบบแล้วครับ 67 00:03:54,363 --> 00:03:56,483 เขาได้ความเร็ว prefill 68 00:03:56,483 --> 00:04:00,916 (การประมวลผลข้อมูลล่วงหน้าก่อนเริ่มสร้างคำตอบ) 69 00:04:00,916 --> 00:04:05,156 ประมาณ 1,000 token ต่อวินาที และการเสิร์ฟแบบ 70 00:04:05,156 --> 00:04:09,107 multi-agent (หลาย agent ทำงานพร้อมกัน) 59 71 00:04:09,107 --> 00:04:12,769 token ต่อวินาที และผมก็รันบน DGX Spark 72 00:04:12,769 --> 00:04:16,142 ของตัวเอง ได้ตัวเลขใกล้เคียงกันครับ 73 00:04:16,142 --> 00:04:20,189 นี่คือคำอธิบายเวอร์ชันที่ผมรันบนเครื่องได้ 74 00:04:20,189 --> 00:04:23,369 ความแตกต่างใหญ่คือมันถูก quantize 75 00:04:23,369 --> 00:04:27,609 (บีบอัดขนาดโมเดล) อย่างหนักสำหรับส่วน routed 76 00:04:27,609 --> 00:04:31,464 experts (โมเดลแบบผู้เชี่ยวชาญแยกเส้นทาง) 77 00:04:31,464 --> 00:04:35,704 ซึ่งเป็นส่วนที่กินหน่วยความจำและ activations 78 00:04:35,704 --> 00:04:39,944 (ค่าการทำงานของนิวรอน) มากที่สุด เห็นไหมครับ 79 00:04:39,944 --> 00:04:43,702 ตรงนี้เป็น Q2 อธิบายเรื่อง quantization 80 00:04:43,702 --> 00:04:47,750 แบบเข้าใจง่าย ถ้าคุณไม่รู้จัก quantization 81 00:04:47,750 --> 00:04:51,797 ผมมีวิดีโอที่อธิบายเรื่องนี้แบบละเอียดอยู่ 82 00:04:51,797 --> 00:04:56,037 แต่พูดสั้น ๆ มันคือวิธีลดขนาดของน้ำหนักโมเดล 83 00:04:56,037 --> 00:04:59,795 เพื่อให้สามารถรันโมเดลที่ใหญ่กว่าบน GPU 84 00:04:59,795 --> 00:05:04,228 หรือฮาร์ดแวร์ที่เล็กกว่าได้ เวลาคนพูดถึง dense 85 00:05:04,228 --> 00:05:06,830 weights (น้ำหนักเต็มรูปแบบ) 86 00:05:06,830 --> 00:05:10,203 ปกติจะหมายถึงสิ่งที่เรียกว่า 16-bit 87 00:05:10,203 --> 00:05:14,540 ซึ่งถือเป็นขนาดเต็ม จริงไหมครับ พอบีบลงมาเป็น 88 00:05:14,540 --> 00:05:18,201 8-bit ก็เหลือครึ่งหนึ่งของขนาด และวิธี 89 00:05:18,201 --> 00:05:22,538 quantization สมัยใหม่ลงไปที่ 8-bit ได้ง่ายมาก 90 00:05:22,538 --> 00:05:26,200 โดยแทบไม่สูญเสียคุณภาพเลย แม้แต่ 4-bit 91 00:05:26,200 --> 00:05:28,513 ซึ่งเป็นนวัตกรรมใหม่กว่า 92 00:05:28,513 --> 00:05:32,656 ก็ไม่เห็นคุณภาพตกมากเท่าไร แต่พอลงไปต่ำกว่า 93 00:05:32,656 --> 00:05:35,355 4-bit เริ่มยากขึ้นครับ ทำได้ 94 00:05:35,355 --> 00:05:39,209 แต่จะเจอปัญหาทั้งเรื่องความเร็วและคุณภาพ 95 00:05:39,209 --> 00:05:43,160 ดังนั้นการลงไปที่ 2-bit ตรงนี้ ถือเป็นการ 96 00:05:43,160 --> 00:05:47,304 quantization ที่รุนแรง (aggressive) มากครับ 97 00:05:47,304 --> 00:05:49,231 แต่มันก็ยังใช้งานได้ 98 00:05:49,231 --> 00:05:52,122 และยังเขียนโค้ดได้ในระดับหนึ่ง 99 00:05:52,122 --> 00:05:55,302 แนวคิดของวิดีโอนี้ ในวิดีโอวันนี้ 100 00:05:55,302 --> 00:05:59,735 ผมแค่อยากทดสอบมัน ไม่จำเป็นต้องเป็น first look 101 00:05:59,735 --> 00:06:03,783 เพราะ first look ปกติผมจะให้งานไว ๆ ง่าย ๆ 102 00:06:03,783 --> 00:06:06,577 ผมอยากทดสอบมันอย่างหนักจริง ๆ 103 00:06:06,577 --> 00:06:10,721 ด้วยโจทย์ที่ท้าทาย ผมจะใช้โจทย์จากซีรีส์ AI 104 00:06:10,721 --> 00:06:15,058 Royal Rumble (การแข่งขันท้าทายโมเดล AI) ของผม 105 00:06:15,058 --> 00:06:17,178 ซึ่งเป็นโจทย์ที่ยาวมาก 106 00:06:17,178 --> 00:06:19,683 บางโจทย์ใช้เวลาหลายชั่วโมง 107 00:06:19,683 --> 00:06:23,345 ผมจะให้ทั้งเวอร์ชันเต็มซึ่งรันผ่าน API 108 00:06:23,345 --> 00:06:26,043 บนคลาวด์ โดยใช้ Hermes Agent 109 00:06:26,043 --> 00:06:30,669 และผมจะใช้โมเดลท้องถิ่นของผมรันโจทย์เดียวกันเป๊ะ 110 00:06:30,669 --> 00:06:33,656 หวังว่าคุณจะได้เห็นว่าโมเดลใหม่ 111 00:06:33,656 --> 00:06:36,933 DeepSeek-V4-Flash นี้ทำอะไรได้บ้าง 112 00:06:36,933 --> 00:06:43,582 รวมถึงความแตกต่างระหว่างเวอร์ชันเต็มบนคลาวด์กับเวอร์ชันท้องถิ่นที่ถูก 113 00:06:43,582 --> 00:06:47,244 quantize หนัก ๆ ด้วย ผมว่ามันน่าสนใจดี 114 00:06:47,244 --> 00:06:51,484 เริ่มกันเลยครับ โจทย์ข้อที่ 1 — หน้า landing 115 00:06:51,484 --> 00:06:54,086 page แบบอินเทอร์แอกทีฟ โอเค 116 00:06:54,086 --> 00:06:58,037 คุณอาจจำโจทย์นี้ได้ครับ นี่มาจาก AI Royal 117 00:06:58,037 --> 00:07:02,181 Rumble และอันนี้คือ Claude Fable (โมเดล AI) 118 00:07:02,181 --> 00:07:04,975 ที่ทำเว็บแบบอินเทอร์แอกทีฟนี้ 119 00:07:04,975 --> 00:07:08,444 นี่คือเว็บไซต์จริง ๆ ผมแค่เลื่อนลงมา 120 00:07:08,444 --> 00:07:12,106 มันมีองค์ประกอบอินเทอร์แอกทีฟหลายอย่าง 121 00:07:12,106 --> 00:07:14,612 ผมทำโจทย์นี้กับโมเดลห้าตัว 122 00:07:14,612 --> 00:07:17,696 และได้ผลลัพธ์ที่น่าสนใจจากทุกตัว 123 00:07:17,696 --> 00:07:19,527 บางตัวดีกว่าตัวอื่น 124 00:07:19,527 --> 00:07:22,321 แต่ทุกตัวผลิตอะไรออกมาได้บ้าง 125 00:07:22,321 --> 00:07:26,465 เราจะทำโจทย์เดิมเป๊ะครับ แต่จะเปลี่ยนหัวข้อ 126 00:07:26,465 --> 00:07:30,512 เพื่อไม่ให้เหมือนการโปรโมต AI Royal Rumble 127 00:07:30,512 --> 00:07:33,114 มันจะโปรโมตตัว DeepSeek เอง 128 00:07:33,114 --> 00:07:36,969 จุดที่ยากคือมันมีองค์ประกอบแบบ scrolling 129 00:07:36,969 --> 00:07:40,920 (การเลื่อนหน้า) เยอะมาก ไม่มีวิดีโอจริง ๆ 130 00:07:40,920 --> 00:07:44,678 ตรงนี้ คุณต้องสร้างจังหวะและ transition 131 00:07:44,678 --> 00:07:47,666 (การเปลี่ยนฉาก) พวกนี้ขึ้นมาเอง 132 00:07:47,666 --> 00:07:50,653 ซึ่งเป็นเรื่องยากมากสำหรับโมเดล 133 00:07:50,653 --> 00:07:54,797 แต่เราจะมาดูกันว่าโมเดล DeepSeek จะทำได้ไหม 134 00:07:54,797 --> 00:07:59,037 ด้วย prompt เดียวกับที่ผมให้โมเดลพวกนั้นเป๊ะ 135 00:07:59,037 --> 00:08:03,084 เราจะทำในแอปเดสก์ท็อปเองครับ เห็นไหม เรามี 136 00:08:03,084 --> 00:08:07,228 DeepSeek-V4-Flash เอาล่ะ เราอยากได้ตัว 0731 137 00:08:07,228 --> 00:08:10,601 มีหลายเวอร์ชันตรงนี้ [เสียงสูดจมูก] 138 00:08:10,601 --> 00:08:14,552 ขอให้แน่ใจว่าเปิดตัวนี้อยู่ มันกำลังเริ่ม 139 00:08:14,552 --> 00:08:18,792 session (รอบการสนทนา) ใหม่ และผมจะให้ prompt 140 00:08:18,792 --> 00:08:22,743 กับมัน นี่คือสิ่งที่ผมให้โมเดลตัวอื่นเป๊ะ 141 00:08:22,743 --> 00:08:26,019 เป็นแบบ one-shot (ให้ครั้งเดียวจบ) 142 00:08:26,019 --> 00:08:30,067 พวกมันต้องทำงานด้วยตัวเอง ถามคำถามผมไม่ได้ 143 00:08:30,067 --> 00:08:33,150 แต่โจทย์คือ สร้าง launch website 144 00:08:33,150 --> 00:08:34,789 (เว็บไซต์เปิดตัว) 145 00:08:34,789 --> 00:08:39,125 คุณภาพระดับโปรดักชันที่สมบูรณ์สำหรับ DeepSeek 146 00:08:39,125 --> 00:08:43,269 V4/0731 และมีรายละเอียดทั้งหมดว่าต้องทำอะไร 147 00:08:43,269 --> 00:08:47,220 แต่การออกแบบเป็นสิทธิ์ของโมเดลเอง ผมจะให้ 148 00:08:47,220 --> 00:08:51,267 prompt นี้กับเวอร์ชันคลาวด์ใน Hermes Agent 149 00:08:51,267 --> 00:08:53,387 แล้วดูว่ามันทำงานยังไง 150 00:08:53,387 --> 00:08:57,531 จากนั้นผมจะทำแบบเดียวกันกับเวอร์ชันท้องถิ่น 151 00:08:57,531 --> 00:09:01,771 ซึ่งอยู่บน Spark ของผม มันกำลังรันอยู่ตอนนี้ 152 00:09:01,771 --> 00:09:04,855 เห็นไหมว่าผมสร้าง Hermes profile 153 00:09:04,855 --> 00:09:08,710 (โปรไฟล์การตั้งค่า) พิเศษให้มัน ชื่อ DS4 154 00:09:08,710 --> 00:09:10,733 และเห็น DeepSeek chat 155 00:09:10,733 --> 00:09:13,817 ซึ่งเป็นโมเดลที่รันอยู่บนเครื่อง 156 00:09:13,817 --> 00:09:16,226 มาดูกันว่ามันทำงานไหมครับ 157 00:09:16,226 --> 00:09:19,984 ผมสังเกตว่ามันเร็วมาก และตอบกลับมาไวมาก 158 00:09:19,984 --> 00:09:22,104 ผมจะวาง prompt นี้ลงไป 159 00:09:22,104 --> 00:09:25,477 แล้วดูว่าโมเดลท้องถิ่นทำอะไรได้บ้าง 160 00:09:25,477 --> 00:09:30,006 และผมจะบอกความจริงกับคุณว่ามันล้มเหลวหรือสำเร็จ 161 00:09:30,006 --> 00:09:33,090 อย่างที่บอก โจทย์พวกนี้ท้าทายมาก 162 00:09:33,090 --> 00:09:36,559 ไม่ใช่แค่สร้าง landing page ให้หน่อย 163 00:09:36,559 --> 00:09:38,969 นี่คืองานออกแบบ front-end 164 00:09:38,969 --> 00:09:42,438 (ส่วนติดต่อผู้ใช้ของเว็บ) ที่ซับซ้อน 165 00:09:42,438 --> 00:09:45,714 ถ้ามันล้มเหลว ซึ่งมันอาจล้มเหลวได้ 166 00:09:45,714 --> 00:09:49,665 อย่าไปโทษตัวโมเดลเลย มันคือเวอร์ชันที่ถูก 167 00:09:49,665 --> 00:09:51,111 quantize หนัก ๆ 168 00:09:51,111 --> 00:09:55,736 และถ้ามันผลิตอะไรออกมาได้ก็ถือว่าน่าประทับใจแล้ว 169 00:09:55,736 --> 00:09:58,724 ยังอยากเห็นด้วยว่ามันเร็วแค่ไหน 170 00:09:58,724 --> 00:10:03,156 เห็นไหมว่ามันเคลื่อนที่ด้วยความเร็วที่พอใช้ได้ 171 00:10:03,156 --> 00:10:07,204 และเวอร์ชันคลาวด์ก็ยังรันอยู่ ผมจะปล่อยให้ 172 00:10:07,204 --> 00:10:08,842 agent พวกนี้ทำงาน 173 00:10:08,842 --> 00:10:13,179 แล้วจะมารายงานผลเมื่อได้ผลลัพธ์ครับ ระหว่างรอ 174 00:10:13,179 --> 00:10:14,913 — อัปเดตสถานะ โอเค 175 00:10:14,913 --> 00:10:19,153 ผ่านไปประมาณหนึ่งชั่วโมงแล้ว มันยังทำงานอยู่ 176 00:10:19,153 --> 00:10:21,081 แต่ใกล้เสร็จแล้วครับ 177 00:10:21,081 --> 00:10:25,417 ตัวท้องถิ่นดูเหมือนจะใกล้เสร็จพอสมควร เห็นไหม 178 00:10:25,417 --> 00:10:28,308 นี่คือ agent DeepSeek ท้องถิ่น 179 00:10:28,308 --> 00:10:31,295 ก่อนหน้านี้มันมี context window 180 00:10:31,295 --> 00:10:34,186 (หน่วยความจำบริบท) แค่ 100,000 181 00:10:34,186 --> 00:10:38,619 ซึ่งเป็นเพราะการตั้งค่าแบบอนุรักษ์นิยมของผมเอง 182 00:10:38,619 --> 00:10:42,956 ผมเลยขยายเป็น 240K มันไปได้สูงกว่านั้นด้วยซ้ำ 183 00:10:42,956 --> 00:10:45,076 ผมทดสอบถึง 500K มาแล้ว 184 00:10:45,076 --> 00:10:48,352 แต่ตอนนี้ขออนุรักษ์ไว้ที่ 240 ก่อน 185 00:10:48,352 --> 00:10:51,436 ตอนที่มันเป็น 100K มันเล็กเกินไป 186 00:10:51,436 --> 00:10:55,869 มันคอยบีบอัดข้อมูลอยู่ตลอด แต่มันใกล้เสร็จแล้ว 187 00:10:55,869 --> 00:11:00,013 ไม่น่าใช้เวลานาน โมเดลท้องถิ่นเสร็จก่อนครับ 188 00:11:00,013 --> 00:11:02,807 เห็นไหม ตัวคลาวด์ยังทำงานอยู่ 189 00:11:02,807 --> 00:11:04,735 ไม่รู้ว่าจะดีหรือแย่ 190 00:11:04,735 --> 00:11:07,529 แต่โมเดลท้องถิ่นเสร็จเร็วกว่า 191 00:11:07,529 --> 00:11:11,769 ผมจะรอให้ตัวคลาวด์เสร็จ เพื่อจะได้ดูเทียบกัน 192 00:11:11,769 --> 00:11:15,624 แต่ที่น่าสนใจคือมันทำเสร็จเร็วกว่าจริง ๆ 193 00:11:15,624 --> 00:11:17,551 เรียบร้อยทั้งคู่ครับ 194 00:11:17,551 --> 00:11:20,539 และผมจะเริ่มจากเวอร์ชันท้องถิ่น 195 00:11:20,539 --> 00:11:24,008 ผลลัพธ์โจทย์ข้อ 1 — เวอร์ชันท้องถิ่น 196 00:11:24,008 --> 00:11:27,959 จำไว้นะครับ นี่คือ DeepSeek-V4-Flash 0731 197 00:11:27,959 --> 00:11:30,850 เวอร์ชันที่ถูก quantize หนัก ๆ 198 00:11:30,850 --> 00:11:40,101 ซึ่งผมรันบน DGX Spark เครื่องเดียว นี่คือเว็บไซต์ แนวคิดคือพอเลื่อนลงมา มันควรมีองค์ประกอบต่าง ๆ 199 00:11:40,101 --> 00:11:44,534 ที่รวมตัวกันแล้วแยกออก เพื่อสร้าง landing page 200 00:11:44,534 --> 00:11:48,581 และเห็นชัดว่ามันทำได้ครับ แบบ one-shot เลย 201 00:11:48,581 --> 00:11:52,725 DeepSeek-V4-Flash เอาล่ะ ผมจะเลื่อนลงไปแล้ว 202 00:11:52,725 --> 00:11:55,712 ขอความกรุณาต่อตัวนี้หน่อยนะครับ 203 00:11:55,712 --> 00:11:59,760 เพราะมันเป็นเวอร์ชันที่ถูก quantize หนัก ๆ 204 00:11:59,760 --> 00:12:04,096 และนี่คืองานที่ยากมากจริง ๆ เลื่อนลงไปเลยครับ 205 00:12:04,096 --> 00:12:06,987 มันเริ่มเลื่อนลงมาแล้ว เห็นไหม 206 00:12:06,987 --> 00:12:11,131 มีองค์ประกอบอินเทอร์แอกทีฟบางอย่าง นั่นแหละ 207 00:12:11,131 --> 00:12:12,480 จางเข้ามาสวยดี 208 00:12:12,480 --> 00:12:16,624 เห็นมันขยับขึ้นและขยายขึ้นตอนที่เราเลื่อนลง 209 00:12:16,624 --> 00:12:19,129 ขึ้น เส้นขยับ Low High Max 210 00:12:19,129 --> 00:12:22,984 เห็นได้ชัดว่าบางองค์ประกอบตรงนี้เพี้ยนไป 211 00:12:22,984 --> 00:12:26,549 แต่ข้างล่างนี้ก็เห็นว่ามันขยับ เอาล่ะ 212 00:12:26,549 --> 00:12:30,693 จางเข้ามา นั่นแหละ Fast is the flagship Get 213 00:12:30,693 --> 00:12:34,933 the weights โอเค มันคงไม่ชนะ AI Royal Rumble 214 00:12:34,933 --> 00:12:38,499 หรอก แต่ขอบอกว่ามันสร้าง landing page 215 00:12:38,499 --> 00:12:42,546 ที่ใช้งานได้จริง และนั่นคือสิ่งที่ GLM 5.2 216 00:12:42,546 --> 00:12:46,690 (โมเดล AI) ทำไม่ได้ตอน AI Royal Rumble ครับ 217 00:12:46,690 --> 00:12:49,388 มันมีองค์ประกอบอยู่หลายอย่าง 218 00:12:49,388 --> 00:12:53,243 บางอย่างก็เรียบมาก บางอย่างก็พังนิดหน่อย 219 00:12:53,243 --> 00:12:58,543 แต่อย่างน้อยมันก็พยายามทำองค์ประกอบอินเทอร์แอกทีฟพวกนี้ 220 00:12:58,543 --> 00:13:02,783 เห็นแถบนี้เลื่อนขึ้นลงตามการเลื่อนหน้าของเรา 221 00:13:02,783 --> 00:13:07,120 เห็นอันนี้พยายามขยายตอนเลื่อนลงหรือเลื่อนขึ้น 222 00:13:07,120 --> 00:13:08,854 มี fade (การค่อย ๆ 223 00:13:08,854 --> 00:13:15,985 จางหาย) ตัวหนังสือนี้หดเล็กลงตอนที่มันเลื่อนลง มันพยายามอย่างเต็มที่จริง ๆ 224 00:13:15,985 --> 00:13:18,876 ครับ มากกว่าที่ผมคาดไว้ด้วยซ้ำ 225 00:13:18,876 --> 00:13:23,213 แต่เห็นชัดว่ามันเทียบไม่ได้กับอะไรอย่าง Fable 226 00:13:23,213 --> 00:13:27,646 หรือ Soul ไม่ใช่ว่าพวกเขาอ้างว่าเทียบได้นะ ใช่ 227 00:13:27,646 --> 00:13:31,019 นี่คือผลงานของเวอร์ชันท้องถิ่นของผม 228 00:13:31,019 --> 00:13:35,451 มาดูกันว่าเวอร์ชันคลาวด์เต็มรูปแบบของ DeepSeek 229 00:13:35,451 --> 00:13:38,631 ทำอะไรได้บ้าง ผลลัพธ์โจทย์ข้อ 1 — 230 00:13:38,631 --> 00:13:41,426 เวอร์ชันคลาวด์เต็มรูปแบบ โอเค 231 00:13:41,426 --> 00:13:44,799 นี่คือตัวทางการครับ ตัวเต็มบนคลาวด์ 232 00:13:44,799 --> 00:13:48,750 หน้าตาดีตั้งแต่แรกเห็นเลย เลื่อนลงมาดูกัน 233 00:13:48,750 --> 00:13:53,086 นั่นสวยดี V4 Flash เอฟเฟกต์นั้นเจ๋งมาก ดี 30B 234 00:13:53,086 --> 00:13:57,423 mixture of experts routing Sparks เจ๋งมาก Low 235 00:13:57,423 --> 00:14:01,759 High Max Outperforms It's open, take it right 236 00:14:01,759 --> 00:14:04,843 now Fast is the flagship เจ๋งมาก 237 00:14:04,843 --> 00:14:08,987 หน้าตาตรงนั้นสวยดี Get the weights นั่นแหละ 238 00:14:08,987 --> 00:14:11,107 น่าประทับใจจริง ๆ ครับ 239 00:14:11,107 --> 00:14:16,214 มันอยู่ในระดับเดียวกับที่เราเห็นจากโมเดลพวกนั้นแน่นอน 240 00:14:16,214 --> 00:14:20,262 ผมจัดให้มันเทียบเท่ากับที่ K3 ทำได้เลยครับ 241 00:14:20,262 --> 00:14:24,598 Kimi K3 และผมคิดว่าบางส่วนมันเทียบได้กับ Soul 242 00:14:24,598 --> 00:14:28,838 และแม้แต่ Fable อาจต่ำกว่าสองตัวนั้นเล็กน้อย 243 00:14:28,838 --> 00:14:31,440 แต่เทียบเท่า Kimi K3 แน่นอน 244 00:14:31,440 --> 00:14:33,560 ด้วยขนาดที่เล็กกว่ามาก 245 00:14:33,560 --> 00:14:35,873 เอฟเฟกต์บางอย่างก็เจ๋งดี 246 00:14:35,873 --> 00:14:39,535 แน่นอนว่ามันไม่สมบูรณ์แบบ แม้แต่ Fable 247 00:14:39,535 --> 00:14:43,582 ก็ยังไม่สมบูรณ์ มีองค์ประกอบซ้อนทับกันบ้าง 248 00:14:43,582 --> 00:14:47,437 แต่โดยรวมผมพอใจกับผลลัพธ์นั้นมาก เจ๋ง ดี 249 00:14:47,437 --> 00:14:50,713 ใช่ครับ นั่นคือผลของโจทย์ยากข้อแรก 250 00:14:50,713 --> 00:14:55,050 และต่อไปเราจะไปโจทย์ข้อสองกัน โจทย์ข้อที่ 2 — 251 00:14:55,050 --> 00:14:58,712 โลก Three.js จาก The Lord of the Rings 252 00:14:58,712 --> 00:15:00,736 โจทย์ข้อสองที่ผมจะให้ 253 00:15:00,736 --> 00:15:04,687 มันไม่ได้เป็นส่วนหนึ่งของ AI Royal Rumble 254 00:15:04,687 --> 00:15:08,348 แต่อ้างอิงมาจากทวีตของ Andrej Karpathy 255 00:15:08,348 --> 00:15:12,396 เขาพูดถึงการใช้ Opus 5 (โมเดล AI) สร้างโลก 256 00:15:12,396 --> 00:15:16,540 Three.js (ไลบรารี JavaScript สำหรับกราฟิก 3 257 00:15:16,540 --> 00:15:19,431 มิติ) ซึ่งเป็นฉากแบบ cinematic 258 00:15:19,431 --> 00:15:23,671 (เหมือนในภาพยนตร์) จากย่อหน้าแรกของ The Lord 259 00:15:23,671 --> 00:15:25,983 of the Rings จริงไหมครับ 260 00:15:25,983 --> 00:15:29,260 หน้าตามันดีมากสำหรับสิ่งที่มันเป็น 261 00:15:29,260 --> 00:15:33,018 และเขาบอกว่า Opus 5 ใช้เวลาทำสองชั่วโมง 262 00:15:33,018 --> 00:15:36,295 ด้วยงบประมาณ token ประมาณหนึ่งล้าน 263 00:15:36,295 --> 00:15:40,728 และนี่คือสิ่งที่มันสร้าง ดูดีอย่างที่ผมบอกครับ 264 00:15:40,728 --> 00:15:42,944 นั่นคือแนวคิดที่เราจะทำ 265 00:15:42,944 --> 00:15:46,991 ผมอยากลองสร้างแบบเดียวกันกับโมเดล DeepSeek 266 00:15:46,991 --> 00:15:51,231 ดูว่ามันทำได้ดีแค่ไหน คงไม่ใกล้เคียงขนาดนั้น 267 00:15:51,231 --> 00:15:56,628 แต่ถ้ามันเรนเดอร์ฉากแบบนี้ได้บ้างก็ถือว่าน่าประทับใจแล้ว 268 00:15:56,628 --> 00:16:01,061 เพราะนี่ค่อนข้างขั้นสูง นี่คือ prompt เต็มครับ 269 00:16:01,061 --> 00:16:05,301 ผมบอกว่าผมให้ย่อหน้าแรกของ Lord of the Rings 270 00:16:05,301 --> 00:16:09,637 และอยากให้มันสร้างโลก Three.js จากย่อหน้านั้น 271 00:16:09,637 --> 00:16:12,625 นี่คือข้อความหรือย่อหน้านั้นเอง 272 00:16:12,625 --> 00:16:16,672 และข้างล่างผมบอกว่า คุณต้องสร้าง cinematic 273 00:16:16,672 --> 00:16:19,949 rendering (การเรนเดอร์แบบภาพยนตร์) 274 00:16:19,949 --> 00:16:22,454 ของย่อหน้าแรกนี้ในสไตล์นี้ 275 00:16:22,454 --> 00:16:26,598 และผมให้วิดีโออ้างอิงนี้ด้วย เพราะ Karpathy 276 00:16:26,598 --> 00:16:29,489 เอามันไปวางบนเว็บไซต์ของเขาเอง 277 00:16:29,489 --> 00:16:32,476 ผมจะให้วิดีโอนั้นเป็น reference 278 00:16:32,476 --> 00:16:36,909 (ข้อมูลอ้างอิง) ให้พวกมันดู แม้ว่าพวกมันไม่ใช่ 279 00:16:36,909 --> 00:16:40,378 vision model (โมเดลที่มองเห็นภาพได้) 280 00:16:40,378 --> 00:16:44,811 จะดูไม่ได้ แต่บางทีอาจใช้ประโยชน์จาก reference 281 00:16:44,811 --> 00:16:49,244 นี้ได้บ้าง แล้วเราจะได้เห็นกัน ผลลัพธ์โจทย์ข้อ 282 00:16:49,244 --> 00:16:51,653 2 — เวอร์ชันท้องถิ่น โอเค 283 00:16:51,653 --> 00:16:54,833 เราได้ผลลัพธ์จากโมเดลท้องถิ่นแล้ว 284 00:16:54,833 --> 00:16:57,724 ใช้เวลาประมาณหนึ่งชั่วโมงครึ่ง 285 00:16:57,724 --> 00:16:59,652 แต่เรามีอะไรบางอย่าง 286 00:16:59,652 --> 00:17:03,795 เห็นไหมว่ามีโลกบางอย่างเกิดขึ้น ผมจะกด play 287 00:17:03,795 --> 00:17:07,843 ดูว่าเรามีอะไร มันสร้างภาพยนตร์ออกมาจริง ๆ 288 00:17:07,843 --> 00:17:11,986 แน่นอนว่าไม่เนียนเท่าตัว Opus แต่มีคำบรรยาย 289 00:17:11,986 --> 00:17:16,034 มีการเคลื่อนกล้อง ตรงนั้นคือ Bag End mound 290 00:17:16,034 --> 00:17:19,407 (เนินแบ็กเอนด์) เท่าที่เห็น มันสั่น 291 00:17:19,407 --> 00:17:23,839 มีแผ่นดินไหวเหรอ? ผมว่าไม่น่ามีในหนังต้นฉบับนะ 292 00:17:23,839 --> 00:17:26,634 นั่นอาจเป็นองค์ประกอบที่พังไป 293 00:17:26,634 --> 00:17:28,658 เห็นตัวละครอยู่ตรงนี้ 294 00:17:28,658 --> 00:17:31,741 ผมไม่รู้ว่าทำไมมันสั่นมากขนาดนี้ 295 00:17:31,741 --> 00:17:35,500 เห็นตัวละครอีกตัว นั่น Bilbo หรือเปล่า? 296 00:17:35,500 --> 00:17:43,980 นี่คือ Party Fields (ทุ่งปาร์ตี้) [เสียงหัวเราะ] นี่คือ Hobbit holes (โพรงฮอบบิท) เล็ก ๆ 297 00:17:43,980 --> 00:17:47,835 แบบพื้นฐานมาก เห็นชัดว่ามีปัญหากล้องสั่น 298 00:17:47,835 --> 00:17:51,689 แต่อย่างที่บอก นี่คือโมเดลท้องถิ่นที่ถูก 299 00:17:51,689 --> 00:17:54,580 quantize หนัก ๆ ทำแบบ one-shot 300 00:17:54,580 --> 00:17:58,339 ผมว่าสำหรับสิ่งที่มันเป็น มันก็น่ารักดี 301 00:17:58,339 --> 00:18:02,675 อย่างน้อยมันก็ทำได้ มันไม่พัง แค่เรียบง่ายมาก 302 00:18:02,675 --> 00:18:05,855 และมีบั๊กเล็ก ๆ น้อย ๆ อยู่ตรงนี้ 303 00:18:05,855 --> 00:18:09,517 ต้นไม้ตรงนี้ดูค่อนข้างดีเลย โอ้โห โอเค 304 00:18:09,517 --> 00:18:12,215 ไม่รู้ว่าเกิดอะไรขึ้นตรงนั้น 305 00:18:12,215 --> 00:18:14,432 ไม่อยากทำให้คุณตกใจ ใช่ 306 00:18:14,432 --> 00:18:17,226 ผมไม่รู้ว่ากล้องสั่นเพราะอะไร 307 00:18:17,226 --> 00:18:20,888 แต่ฉากสุดท้ายตรงนี้ก็ไม่ได้แย่ขนาดนั้น 308 00:18:20,888 --> 00:18:25,321 จริงไหมครับ ผลลัพธ์โจทย์ข้อ 2 — เวอร์ชันคลาวด์ 309 00:18:25,321 --> 00:18:29,079 โอเค นั่นคือโมเดลท้องถิ่นจัดการโจทย์นี้ 310 00:18:29,079 --> 00:18:33,416 มาดูกันว่าโมเดลคลาวด์ทางการทำอะไรได้บ้าง โอเค 311 00:18:33,416 --> 00:18:37,367 อันนี้ใช้เวลาประมาณ 40 นาทีตั้งแต่ต้นจนจบ 312 00:18:37,367 --> 00:18:39,776 ผมมีปัญหาการเชื่อมต่อบ้าง 313 00:18:39,776 --> 00:18:43,823 คิดว่าตอนนี้มีความต้องการใช้โมเดลนี้สูงมาก 314 00:18:43,823 --> 00:18:47,774 นี่คือสิ่งที่มันผลิตออกมา มาดูกัน กด play 315 00:18:47,774 --> 00:18:50,858 มันมีเสียงด้วยนะ แต่คุณฟังไม่ได้ 316 00:18:50,858 --> 00:18:54,906 หน้าตาดีกว่ามาก มันเป็นเต็นท์ปาร์ตี้เล็ก ๆ 317 00:18:54,906 --> 00:18:59,049 น่ารัก ท้องฟ้าดูสวยมากจริง ๆ นั่นคือ Hobbit 318 00:18:59,049 --> 00:19:03,386 holes แบ็กเอนด์ โอ้โห ว้าว กล้องถูกตัดไปหน่อย 319 00:19:03,386 --> 00:19:06,277 แต่มันดูคล้ายกับที่ Opus ทำเลย 320 00:19:06,277 --> 00:19:08,686 มีรายละเอียดเล็ก ๆ น้อย ๆ 321 00:19:08,686 --> 00:19:12,251 เยอะ แน่นอนว่าไม่สมบูรณ์แบบ แต่จริง ๆ 322 00:19:12,251 --> 00:19:16,492 แล้วมีองค์ประกอบดี ๆ อยู่เยอะ ผมว่าอย่างนั้น 323 00:19:16,492 --> 00:19:20,346 ตอนนี้เข้าสู่ช่วงกลางคืน ไฟดูดี ไฟตรงนี้ 324 00:19:20,346 --> 00:19:24,105 ท้องฟ้าก็สวยมาก ไฟตรงนั้นดูสวย นั่นแหละ 325 00:19:24,105 --> 00:19:28,248 โดยรวมแล้ว ผมว่ามันทำได้ค่อนข้างดีสำหรับการ 326 00:19:28,248 --> 00:19:30,176 one-shot โจทย์แบบนี้ 327 00:19:30,176 --> 00:19:33,934 ไม่ใช่ทุกอย่างที่สมบูรณ์แบบ จริงไหมครับ 328 00:19:33,934 --> 00:19:36,536 แต่มันเก็บรายละเอียดได้เยอะ 329 00:19:36,536 --> 00:19:40,005 ผมอยากย้อนกลับไปตอนที่มันอยู่ข้างใต้ 330 00:19:40,005 --> 00:19:44,341 ตรงนี้มันถูกตัดออกไป มีบางอย่างผิดกับมุมกล้อง 331 00:19:44,341 --> 00:19:48,967 แต่คุณเห็นไหมว่านี่คืออุโมงค์ที่เต็มไปด้วยสมบัติ 332 00:19:48,967 --> 00:19:53,496 มันสร้างฉากนั้นขึ้นมาใหม่ได้อย่างถูกต้องทีเดียว 333 00:19:53,496 --> 00:19:57,929 ภายใต้แสงสีเทา และมันดูไม่ดีเท่า Opus เห็นไหม? 334 00:19:57,929 --> 00:20:01,880 ดูใช้ได้เลย จริง ๆ แล้วดูไม่ดีเท่า Opus 5 335 00:20:01,880 --> 00:20:04,386 แต่ผมว่ามันดูใช้ได้ทีเดียว 336 00:20:04,386 --> 00:20:08,337 สำหรับสิ่งที่มันเป็น และวิวกลางคืนก็ดูสวย 337 00:20:08,337 --> 00:20:12,577 ดังนั้นผมค่อนข้างประทับใจผลลัพธ์นี้สำหรับการ 338 00:20:12,577 --> 00:20:15,661 one-shot งานที่ค่อนข้างยากจริง ๆ 339 00:20:15,661 --> 00:20:24,430 และเห็นได้ชัดว่าคุณแยกความแตกต่างระหว่างเวอร์ชันเต็มทางการกับสิ่งที่โมเดลท้องถิ่นของผมทำได้ 340 00:20:24,430 --> 00:20:27,514 ใช่ นั่นแหละครับ โจทย์ข้อที่ 3 — 341 00:20:27,514 --> 00:20:31,946 เกมปริศนาวงวนเวลา โจทย์ยากข้อสุดท้ายที่ผมจะให้ 342 00:20:31,946 --> 00:20:36,283 คือ prompt เดียวกับที่ผมให้ agent ใน AI Royal 343 00:20:36,283 --> 00:20:40,716 Rumble เพื่อสร้างเกม และนี่ไม่ใช่เกมยิงปืนง่าย 344 00:20:40,716 --> 00:20:44,859 ๆ อะไรแบบนั้น พวกมันต้องสร้างเกม platformer 345 00:20:44,859 --> 00:20:49,100 (เกมแพลตฟอร์มกระโดดปีน) แบบ time loop puzzle 346 00:20:49,100 --> 00:20:52,376 (ปริศนาวงวนเวลา) ที่เล่นได้สมบูรณ์ 347 00:20:52,376 --> 00:20:57,676 โดยผู้เล่นต้องร่วมมือกับบันทึกการเล่นของตัวเองในรอบก่อน 348 00:20:57,676 --> 00:20:59,989 ๆ กลไกตัวนี้ยากมากจริง ๆ 349 00:20:59,989 --> 00:21:04,325 ตัวเกมไม่ต้องสวยงามอะไร ไม่ต้องมีอะไรเว่อร์ ๆ 350 00:21:04,325 --> 00:21:08,951 โมเดลส่วนใหญ่ แม้แต่ Fable ก็ทำแค่จอพิกเซลง่าย ๆ 351 00:21:08,951 --> 00:21:16,660 เช่น อันนี้คือของ Soul หรือ GPT-Soul (โมเดล AI) แนวคิดคือคุณต้องเล่นเป็นเทิร์น ๆ 352 00:21:16,660 --> 00:21:19,648 โดยเทิร์นก่อนหน้าจะเป็นเหมือนผี 353 00:21:19,648 --> 00:21:22,153 และคุณต้องร่วมมือกับตัวเอง 354 00:21:22,153 --> 00:21:25,430 ซึ่งก็คือเวอร์ชันก่อนหน้าของตัวเอง 355 00:21:25,430 --> 00:21:29,477 เพื่อแก้ปริศนา หวังว่าผมอธิบายเข้าใจนะครับ 356 00:21:29,477 --> 00:21:31,693 แต่แนวคิดคือแบบนั้น ใช่ 357 00:21:31,693 --> 00:21:35,452 มันเป็นกลไกที่ค่อนข้างซับซ้อน นี่คือของ 358 00:21:35,452 --> 00:21:38,535 GPT-Soul มาดูกัน นี่คือของ Fable 359 00:21:38,535 --> 00:21:41,330 เห็นชัดว่าภาพไม่ได้เว่อร์อะไร 360 00:21:41,330 --> 00:21:45,281 แต่กลไกต่างหากที่ยาก และโจทย์พวกนี้ยากมาก 361 00:21:45,281 --> 00:21:49,714 ใช้เวลาหลายชั่วโมงกว่าจะเสร็จ นั่นคือของ Fable 362 00:21:49,714 --> 00:21:54,147 และนี่คือของ Kimi K3 ภาพยิ่งเรียบง่ายเข้าไปอีก 363 00:21:54,147 --> 00:21:58,483 แต่กลไกก็ยากเหมือนกัน พวกมันทำกลไกได้ดีทุกตัว 364 00:21:58,483 --> 00:22:01,278 มีแค่ Kimi K3 ที่พลาดโจทย์นี้ 365 00:22:01,278 --> 00:22:03,302 ไม่ออกมาดีเท่าตัวอื่น 366 00:22:03,302 --> 00:22:07,156 นี่คือสิ่งที่ผมขอให้โมเดล DeepSeek ลองทำ 367 00:22:07,156 --> 00:22:11,396 ผมจะทึ่งมากถ้าโมเดลท้องถิ่นทำได้ มาดูกันครับ 368 00:22:11,396 --> 00:22:15,829 ผมเคยนับโมเดล DeepSeek ท้องถิ่นที่ถูก quantize 369 00:22:15,829 --> 00:22:17,178 ว่าตกรอบไปแล้ว 370 00:22:17,178 --> 00:22:20,455 แต่จนถึงตอนนี้มันผ่านทุกโจทย์มาได้ 371 00:22:20,455 --> 00:22:23,828 ไม่สมบูรณ์แบบ ที่จริงก็ไม่ค่อยดีนัก 372 00:22:23,828 --> 00:22:27,682 แต่ก็ผลิตอะไรออกมาได้ ใช่ ผมจะให้ prompt 373 00:22:27,682 --> 00:22:32,019 นี้กับพวกมัน แล้วมาดูกันว่าทำอะไรได้บ้าง โอเค 374 00:22:32,019 --> 00:22:34,621 เริ่ม session ใหม่ให้ตัวนี้ 375 00:22:34,621 --> 00:22:37,993 แล้วดูว่ามันจัดการยังไง ระหว่างรอ — 376 00:22:37,993 --> 00:22:41,270 อัปเดตสถานะ โอเค มันเริ่มทำงานแล้ว 377 00:22:41,270 --> 00:22:44,835 ทั้งสองตัวรันมาแล้ว 1 ชั่วโมง 10 นาที 378 00:22:44,835 --> 00:22:48,883 อันนี้จะใช้เวลานานหน่อย ผมว่า Kimi K2 หรือ 379 00:22:48,883 --> 00:22:51,870 Kimi K3 ใช้เวลาประมาณ 2 ชั่วโมง 380 00:22:51,870 --> 00:22:55,339 เห็นไหมว่ามันยังทำงานอยู่ ยังคิดอยู่ 381 00:22:55,339 --> 00:22:58,616 พยายามวางแผน แต่นี่เป็นโจทย์ที่ยาก 382 00:22:58,616 --> 00:23:02,278 มันต้องใช้เวลานาน ที่จริงผมว่า Kimi K3 383 00:23:02,278 --> 00:23:06,711 ใช้เวลาราว 3 ชั่วโมงทำโจทย์นี้ และแม้แต่ Fable 384 00:23:06,711 --> 00:23:08,734 ก็น่าจะเกินสองชั่วโมง 385 00:23:08,734 --> 00:23:12,782 มันต้องใช้เวลาพอสมควรครับ เอาล่ะ เสร็จแล้ว 386 00:23:12,782 --> 00:23:17,022 นี่คือเวอร์ชันท้องถิ่น มันเสร็จตอน 1 ชั่วโมง 387 00:23:17,022 --> 00:23:19,913 10 นาที หลังอัปเดตเมื่อกี้พอดี 388 00:23:19,913 --> 00:23:24,249 ผมถูกรบกวนเล็กน้อยระหว่างนั้น รวมแล้วประมาณ 2 389 00:23:24,249 --> 00:23:28,200 ชั่วโมง 40 นาที ใกล้เคียงกับ Kimi K3 ครับ 390 00:23:28,200 --> 00:23:31,862 และเวอร์ชันคลาวด์ก็เสร็จตามมาอีกสักพัก 391 00:23:31,862 --> 00:23:34,946 แต่ผมมีปัญหาการเชื่อมต่ออีกครั้ง 392 00:23:34,946 --> 00:23:38,030 ใช้เวลาใกล้เคียงกันน่าจะได้ โอเค 393 00:23:38,030 --> 00:23:41,113 อันแรกที่ผมจะลองคือโมเดลท้องถิ่น 394 00:23:41,113 --> 00:23:45,161 ลองเล่นเกมของมันดูครับ ผลลัพธ์โจทย์ข้อ 3 — 395 00:23:45,161 --> 00:23:47,184 เวอร์ชันท้องถิ่น โอเค 396 00:23:47,184 --> 00:23:49,594 นี่คือเกมของโมเดลท้องถิ่น 397 00:23:49,594 --> 00:23:53,641 เห็นไหมว่ามีคำแนะนำอยู่ตรงนี้ แผงนี้มีบั๊ก 398 00:23:53,641 --> 00:23:57,881 ถ้าคุณเปิด console (คอนโซลสำหรับตรวจสอบโค้ด) 399 00:23:57,881 --> 00:24:02,025 จะเห็นว่ามีบั๊กในวิธีที่มันแสดงผล ปกติใน AI 400 00:24:02,025 --> 00:24:05,687 Royal Rumble แบบนี้ก็ถูกตัดสิทธิ์ทันที 401 00:24:05,687 --> 00:24:08,481 แต่ผมจะให้โอกาสมันซ่อมบั๊กนี้ 402 00:24:08,481 --> 00:24:12,529 เพื่อที่เราจะได้เห็นว่าเกมจริง ๆ เป็นยังไง 403 00:24:12,529 --> 00:24:16,865 มันน่าจะเป็นอะไรที่พื้นฐานมาก มาดูกัน เห็นไหม 404 00:24:16,865 --> 00:24:20,431 มันเป็นบั๊กของ loader (ตัวโหลดข้อมูล) 405 00:24:20,431 --> 00:24:23,804 ที่ต้องการอะไรบางอย่าง โอเค ได้แล้ว 406 00:24:23,804 --> 00:24:26,887 มันพื้นฐานมาก ใช่ แค่นั้นเอง โอ้ 407 00:24:26,887 --> 00:24:29,007 คุณเก็บอันนั้นได้ โอเค 408 00:24:29,007 --> 00:24:32,477 ผมจะลองแก้ปริศนานี้หน้ากล้องเลย โอเค 409 00:24:32,477 --> 00:24:36,042 คิดว่าเข้าใจแล้ว นั่นคือกุญแจ ได้แล้ว 410 00:24:36,042 --> 00:24:40,379 นั่นคือกุญแจ อ่านตัวหนังสือยาก แต่มันเขียนว่า 411 00:24:40,379 --> 00:24:44,041 key (กุญแจ) และ lock (แม่กุญแจ) ตรงนี้ 412 00:24:44,041 --> 00:24:46,932 หยุดบนแผ่นที่ 8 เพื่อเปิดประตู 413 00:24:46,932 --> 00:24:49,533 หยุดบนแผ่นเพื่อปลดล็อกประตู 414 00:24:49,533 --> 00:24:52,521 แล้วหยุดบนเป้าหมายเพื่อชนะ โอเค 415 00:24:52,521 --> 00:24:56,761 คิดว่าเข้าใจแล้ว ชนะแล้ว นั่นแหละ เกมง่ายมาก 416 00:24:56,761 --> 00:24:59,459 แต่กลไกใช้งานได้จริง เห็นไหม 417 00:24:59,459 --> 00:25:01,194 คุณต้องหยุดตรงนั้น 418 00:25:01,194 --> 00:25:04,952 แล้วเจ้าตัวนี้ต้องอยู่ตรงนั้น แล้วก็ชนะ 419 00:25:04,952 --> 00:25:07,458 จริงไหม? โอเค มันทำกลไกได้ 420 00:25:07,458 --> 00:25:10,059 แบบง่ายที่สุดเท่าที่จะทำได้ 421 00:25:10,059 --> 00:25:13,432 แต่นี่คือโมเดลท้องถิ่นของผมอีกครั้ง 422 00:25:13,432 --> 00:25:15,841 การที่มันทำให้มันทำงานได้ 423 00:25:15,841 --> 00:25:19,118 ถือว่าน่าประทับใจสำหรับผมอย่างน้อย 424 00:25:19,118 --> 00:25:22,298 มาลองเวอร์ชันทางการจริง ๆ กันครับ 425 00:25:22,298 --> 00:25:26,056 ผลลัพธ์โจทย์ข้อ 3 — เวอร์ชันคลาวด์ โอเค 426 00:25:26,056 --> 00:25:30,104 เห็นได้เลยว่าอันนี้ขั้นสูงกว่า นี่คือโมเดล 427 00:25:30,104 --> 00:25:34,151 DeepSeek เต็มรูปแบบที่รันบนคลาวด์ ผ่าน New 428 00:25:34,151 --> 00:25:38,488 Portal ในกรณีนี้ พวกเขาเรียกมันว่า Echo Vault 429 00:25:38,488 --> 00:25:42,824 เกมปริศนาวงวนเวลา มาดูกันว่าผมเล่นได้ดีแค่ไหน 430 00:25:42,824 --> 00:25:46,100 ไปเลย ขึ้น มีกำแพงล่องหน เห็นจะได้ 431 00:25:46,100 --> 00:25:50,437 ถ้าผมทำแบบนั้นล่ะ? ทำยังไง โอเค ได้แล้ว ผมได้ 432 00:25:50,437 --> 00:25:52,364 rewind (กรอกลับเวลา) 433 00:25:52,364 --> 00:25:56,123 งั้นกำแพงล่องหนนั้นเปิดด้วยสิ่งนี้ โอเค 434 00:25:56,123 --> 00:25:59,688 ผ่านได้แล้ว ผมเก็บอะไรบางอย่างได้ โอ้ 435 00:25:59,688 --> 00:26:04,121 นั่นคือกุญแจ นั่นแหละ คิดว่ารอบนี้คงไม่ทันเวลา 436 00:26:04,121 --> 00:26:08,072 ผมใช้เวลานานเกินไปกับประตูแรก นี่คล้ายกัน 437 00:26:08,072 --> 00:26:12,505 เห็นไหม? นั่นแหละ คิดว่าไม่ทัน ขอเล่นใหม่ โอเค 438 00:26:12,505 --> 00:26:14,818 ลองอีกครั้ง นั่นคือหนึ่ง 439 00:26:14,818 --> 00:26:17,034 แล้วเอากุญแจไปวางตรงนี้ 440 00:26:17,034 --> 00:26:20,600 เปิดประตูที่ดูเหมือนล่องหนนั่น นี่คือ 441 00:26:20,600 --> 00:26:23,587 ถ้าคุณจำอันที่ Kimi K3 ทำไว้ได้ 442 00:26:23,587 --> 00:26:27,442 อันนี้ดูอลังการกว่า ขึ้น ผมตายหรือเปล่า? 443 00:26:27,442 --> 00:26:32,067 ติดอยู่ตรงนี้ ไม่รู้จะทำยังไง ต้องจับจังหวะสินะ? 444 00:26:32,067 --> 00:26:36,982 ผมจะลอดข้างล่าง ขึ้น เดาว่ามันยกมันขึ้นไว้ จริงไหม? 445 00:26:36,982 --> 00:26:38,235 ผมผ่านได้ไหม? 446 00:26:38,235 --> 00:26:41,993 เราทำได้ ห้องนิรภัยเปิดแล้ว Four loops, 447 00:26:41,993 --> 00:26:45,366 three echoes, one timeline (สี่วงวน 448 00:26:45,366 --> 00:26:48,739 สามเสียงสะท้อน หนึ่งไทม์ไลน์) ดีมาก 449 00:26:48,739 --> 00:26:53,075 พวกมันใช้กลไกหลายอย่างตรงนี้ ทั้งแผ่นกด กุญแจ 450 00:26:53,075 --> 00:26:56,833 และเจ้าตัวนี้ที่ช่วยยกของ ถือว่าฉลาดมาก 451 00:26:56,833 --> 00:27:01,266 เพราะหลายโมเดล แม้แต่ของ Soul ก็แค่ใช้ปุ่มง่าย 452 00:27:01,266 --> 00:27:05,314 ๆ ถึงภาพจะสวยกว่ามาก แต่ก็เป็นแค่ปุ่มเดียว 453 00:27:05,314 --> 00:27:08,397 และถ้าคุณจำได้ นี่คือของ Kimi K3 454 00:27:08,397 --> 00:27:12,734 อันนี้ก็ประมาณสองปุ่ม และอีกอันที่เขาเรียกว่า 455 00:27:12,734 --> 00:27:16,107 fuse (ฟิวส์) แต่จริง ๆ แล้วคือกุญแจ 456 00:27:16,107 --> 00:27:18,130 ดังนั้นโมเดล DeepSeek 457 00:27:18,130 --> 00:27:21,985 นี้มีเกมที่สร้างสรรค์กว่า ผมว่าอย่างนั้น 458 00:27:21,985 --> 00:27:26,418 และภาพก็ดีกว่าตัว Kimi ด้วย จริงไหมครับ แน่นอน 459 00:27:26,418 --> 00:27:29,309 ดีกว่าชัด ๆ น่าประทับใจทีเดียว 460 00:27:29,309 --> 00:27:33,260 เมื่อพิจารณาความแตกต่างระหว่างสองโมเดลนี้ 461 00:27:33,260 --> 00:27:35,958 และนั่นคือโจทย์สุดท้ายของเรา 462 00:27:35,958 --> 00:27:37,885 สรุปผลการทดสอบโดยรวม 463 00:27:37,885 --> 00:27:42,029 โดยรวมจากการเล่นกับมันและดูว่ามันทำงานยังไง 464 00:27:42,029 --> 00:27:44,920 ผมว่ามันทำได้ระดับเดียวกันครับ 465 00:27:44,920 --> 00:27:46,751 จำตอนเปิดคลิปได้ไหม 466 00:27:46,751 --> 00:27:50,220 ลูกกลมนั้นเทียบเท่ากับโมเดล frontier 467 00:27:50,220 --> 00:27:54,171 (โมเดลระดับแนวหน้า) รุ่นล่าสุดได้เลย หน้า 468 00:27:54,171 --> 00:27:58,508 landing page ในงานออกแบบ front-end อาจต่ำกว่า 469 00:27:58,508 --> 00:28:02,362 Kimi K3 ในโจทย์ AI Royal Rumble เล็กน้อย 470 00:28:02,362 --> 00:28:06,313 แต่มันทำเสร็จเร็วกว่ามาก และในโจทย์เกมนี้ 471 00:28:06,313 --> 00:28:10,168 ผมแปลกใจจริง ๆ เพราะมันดีกว่าที่ Kimi K3 472 00:28:10,168 --> 00:28:12,095 ทำได้อย่างเห็นได้ชัด 473 00:28:12,095 --> 00:28:15,854 และแนวคิดยังซับซ้อนกว่าของ Soul ด้วยซ้ำ 474 00:28:15,854 --> 00:28:19,034 จำอันนี้ได้ไหม? อันนี้ก็แค่แผ่นกด 475 00:28:19,034 --> 00:28:22,503 จับประตูให้เปิดไว้ อันนี้ซับซ้อนกว่า 476 00:28:22,503 --> 00:28:25,201 ดังนั้นในเชิงแนวคิดในฐานะเกม 477 00:28:25,201 --> 00:28:29,634 มันใกล้เคียงกับที่ Fable ทำได้ ซึ่งค่อนข้างบ้า 478 00:28:29,634 --> 00:28:32,910 ใช่ มันอยู่ในระดับเดียวกับ Kimi K3 479 00:28:32,910 --> 00:28:36,283 และแล้วแต่โจทย์ บางโจทย์ก็เหนือกว่า 480 00:28:36,283 --> 00:28:38,211 เปรียบเทียบขนาดโมเดล 481 00:28:38,211 --> 00:28:42,933 และนี่คือสิ่งที่ทำให้บ้าตอนเปรียบเทียบสองโมเดลนี้ 482 00:28:42,933 --> 00:28:46,594 โมเดล DeepSeek นี้มีพารามิเตอร์รวม 284 483 00:28:46,594 --> 00:28:50,160 พันล้านตัว (284B) ส่วน Kimi K3 มี 2.8 484 00:28:50,160 --> 00:28:53,726 ล้านล้านตัว ใหญ่กว่าเกือบ 10 เท่า และ 485 00:28:53,726 --> 00:28:55,653 activated parameters 486 00:28:55,653 --> 00:28:59,604 (พารามิเตอร์ที่ถูกใช้งานจริงในแต่ละครั้ง) 487 00:28:59,604 --> 00:29:04,037 มากกว่า 8 เท่า ซึ่ง Kimi เป็นโมเดลที่ยอดเยี่ยม 488 00:29:04,037 --> 00:29:06,350 ผมไม่ได้จะดูถูกมันนะครับ 489 00:29:06,350 --> 00:29:11,842 ผมแค่ทึ่งที่โมเดลที่เบาบางขนาดนี้ต่อยอดหนักเกินตัวขนาดไหน 490 00:29:11,842 --> 00:29:15,793 เลเยอร์ลึกกว่า 2.2 เท่า มี context window 491 00:29:15,793 --> 00:29:18,684 เท่ากัน ข้อได้เปรียบใหญ่ของ K3 492 00:29:18,684 --> 00:29:22,828 คือรองรับภาพด้วย ทำ vision (การมองเห็น) ได้ 493 00:29:22,828 --> 00:29:26,779 และใช้สถาปัตยกรรม routed experts คล้ายกัน 494 00:29:26,779 --> 00:29:31,212 ผมอาจทำวิดีโอเกี่ยวกับสถาปัตยกรรมเต็มรูปแบบของ 495 00:29:31,212 --> 00:29:33,621 DeepSeek ตัวนี้ ถ้าคนสนใจ 496 00:29:33,621 --> 00:29:36,609 แต่มันมีลักษณะคล้ายกันหลายอย่าง 497 00:29:36,609 --> 00:29:40,367 การที่สองโมเดลนี้ให้ผลลัพธ์ใกล้เคียงกัน 498 00:29:40,367 --> 00:29:42,583 บางครั้งต่ำกว่าเล็กน้อย 499 00:29:42,583 --> 00:29:44,800 บางครั้งสูงกว่าเล็กน้อย 500 00:29:44,800 --> 00:29:48,847 มันค่อนข้างบ้าเมื่อเทียบกับความต่างของขนาด 501 00:29:48,847 --> 00:29:52,894 และความต่างของราคา เรื่องราคา อย่างเช่น บน 502 00:29:52,894 --> 00:29:57,327 OpenRouter (แพลตฟอร์มรวม API ของโมเดล AI) ราคา 503 00:29:57,327 --> 00:30:01,567 input (ข้อมูลนำเข้า) ของโมเดล DeepSeek คือ 9 504 00:30:01,567 --> 00:30:06,000 เซนต์ ราคา output (ข้อมูลที่โมเดลสร้าง) คือ 18 505 00:30:06,000 --> 00:30:10,433 เซนต์ ส่วน Kimi K3 อยู่ที่ 2.9 และ 14 ตามลำดับ 506 00:30:10,433 --> 00:30:14,384 ต่างกันมหาศาลมากครับ ถ้าจำได้จาก AI Royal 507 00:30:14,384 --> 00:30:18,046 Rumble ตัว Kimi K3 ทำให้ผมเสียเงิน $25 508 00:30:18,046 --> 00:30:21,323 เพื่อสร้างเกม ส่วนตัวนี้เสียแค่ 53 509 00:30:21,323 --> 00:30:23,635 เซนต์สำหรับการรันทั้งหมด 510 00:30:23,635 --> 00:30:27,683 ผมไม่มีตัวเลขแยกรายโจทย์ แต่รวมถึง landing 511 00:30:27,683 --> 00:30:32,116 page เกมลูกกลม One Piece ที่คุณเห็นตอนเปิดคลิป 512 00:30:32,116 --> 00:30:36,259 และฉาก Lord of the Rings ทั้งหมด รวมแล้ว 53 513 00:30:36,259 --> 00:30:38,958 เซนต์ New Portal มีดีลลด 90% 514 00:30:38,958 --> 00:30:43,390 อีกราวหนึ่งสัปดาห์ แต่ต่อให้คูณสิบ มันก็แค่ $5 515 00:30:43,390 --> 00:30:47,631 กว่า ๆ เท่านั้น แค่นั้นก็ถูกกว่าที่เราใช้กับ 516 00:30:47,631 --> 00:30:51,292 Kimi K3 มากแล้ว เพราะแค่เกมเดียวก็ $25 517 00:30:51,292 --> 00:30:53,605 อย่างที่บอก นั่นแหละครับ 518 00:30:53,605 --> 00:30:55,725 บทสรุปและมุมมองส่วนตัว 519 00:30:55,725 --> 00:30:59,869 นั่นคือจุดจบของการทดสอบโจทย์ยากของผม ไม่ใช่ 520 00:30:59,869 --> 00:31:01,507 first look จริง ๆ 521 00:31:01,507 --> 00:31:06,036 เพราะใช้เวลาทั้งวัน แต่เป็นโจทย์ที่ท้าทายจริง ๆ 522 00:31:06,036 --> 00:31:09,891 และมันจัดการได้ทุกข้อครับ เวอร์ชัน dense 523 00:31:09,891 --> 00:31:12,108 (เต็มรูปแบบ) ทำได้ดีมาก 524 00:31:12,108 --> 00:31:16,444 และแม้แต่เวอร์ชันท้องถิ่นที่ถูก quantize หนัก 525 00:31:16,444 --> 00:31:18,853 ๆ ของผม ก็ทำเสร็จทุกโจทย์ 526 00:31:18,853 --> 00:31:22,515 โจทย์สุดท้ายที่เป็นเกมใช้สองรอบ ไม่ใช่ 527 00:31:22,515 --> 00:31:25,984 one-shot แต่สองโจทย์แรกเป็น one-shot 528 00:31:25,984 --> 00:31:28,875 และแน่นอนว่าคุณภาพไม่ได้ดีเลิศ 529 00:31:28,875 --> 00:31:33,308 แต่ผมจะไม่มีวันใช้โมเดลท้องถิ่นที่ถูก quantize 530 00:31:33,308 --> 00:31:37,066 แบบนั้นกับงานหนัก ๆ แบบนี้ ผมจะใช้โมเดล 531 00:31:37,066 --> 00:31:38,166 frontier 532 00:31:38,166 --> 00:31:42,792 อย่างจริงจังสำหรับงานเขียนโค้ดที่หนักหน่วงแบบนี้ 533 00:31:42,792 --> 00:31:46,454 แต่การได้เล่นกับโมเดลท้องถิ่นมันสนุกดี 534 00:31:46,454 --> 00:31:50,405 นั่นคือเหตุผลหลักของผม คุณอาจสงสัยว่าทำไม 535 00:31:50,405 --> 00:31:54,741 เพราะตอนนี้มันไม่มีเหตุผลทางเศรษฐกิจเท่าไรนัก 536 00:31:54,741 --> 00:31:56,090 โมเดล DeepSeek 537 00:31:56,090 --> 00:32:02,547 นี้บนคลาวด์ถูกมากจนไม่มีเหตุผลทางเศรษฐกิจมากนักที่จะรันบนเครื่องเอง 538 00:32:02,547 --> 00:32:07,461 แต่มันสนุกที่ได้เล่นกับโมเดลเหล่านี้ในระดับท้องถิ่น 539 00:32:07,461 --> 00:32:10,834 ตั้งค่าพวกมัน ลองปรับแต่งให้เหมาะสม 540 00:32:10,834 --> 00:32:15,171 คุณเรียนรู้ได้เยอะ ถ้าคุณเป็นคนชอบงัดแงะแบบผม 541 00:32:15,171 --> 00:32:17,291 การทำแบบนี้สนุกมากครับ 542 00:32:17,291 --> 00:32:20,856 และถ้าคุณแคร์เรื่องความเป็นส่วนตัวมาก 543 00:32:20,856 --> 00:32:25,675 จุดเด่นใหญ่คือผมเก็บข้อมูลทั้งหมดไว้บนเครื่องของผม 544 00:32:25,675 --> 00:32:29,626 ไม่ส่งไปเซิร์ฟเวอร์คลาวด์ และมันเป็นของผม 545 00:32:29,626 --> 00:32:31,938 ไม่มีใครเอาออกไปจากผมได้ 546 00:32:31,938 --> 00:32:34,444 คุณคงเห็นมาก่อนหน้านี้แล้ว 547 00:32:34,444 --> 00:32:38,106 ผมมีปัญหาการเชื่อมต่อกับเวอร์ชันคลาวด์ 548 00:32:38,106 --> 00:32:39,205 มันหลุดบ่อย 549 00:32:39,205 --> 00:32:42,578 อันนั้นจะไม่เกิดขึ้นถ้ารันบนเครื่อง 550 00:32:42,578 --> 00:32:45,951 จริงไหมครับ นั่นคือข้อดีอีกข้อหนึ่ง 551 00:32:45,951 --> 00:32:49,324 และผมอยากรู้ว่าคนสนใจกันไหม ถ้าสนใจ 552 00:32:49,324 --> 00:32:52,119 ผมจะทำเวอร์ชันแบบ fine-tuning 553 00:32:52,119 --> 00:32:54,720 (การปรับแต่งโมเดลเพิ่มเติม) 554 00:32:54,720 --> 00:32:57,130 เพื่อการวิจัยแบบอัตโนมัติ 555 00:32:57,130 --> 00:33:00,117 โดยพยายามปรับแต่งโมเดล DeepSeek 556 00:33:00,117 --> 00:33:02,430 ท้องถิ่นของผมให้ดีที่สุด 557 00:33:02,430 --> 00:33:05,706 ตอนนี้ผมยังไม่ได้งัดแงะมากขนาดนั้น 558 00:33:05,706 --> 00:33:10,235 แต่โดยรวมผมค่อนข้างประทับใจกับประสิทธิภาพของมัน 559 00:33:10,235 --> 00:33:13,705 ผมจะไม่ใช้มันกับงานเขียนโค้ดระดับโหด 560 00:33:13,705 --> 00:33:17,945 อย่างที่บอก แต่มันเป็น workhorse (ม้าลากงาน) 561 00:33:17,945 --> 00:33:19,390 ที่แข็งแกร่งได้ 562 00:33:19,390 --> 00:33:23,727 ผมใช้มันต่อเนื่องเกินกว่างานพวกนี้อีกเล็กน้อย 563 00:33:23,727 --> 00:33:27,100 มันตอบสนองเร็วมาก เป็นนักวิจัยที่ดี 564 00:33:27,100 --> 00:33:30,954 ฉลาดพอสมควร ไม่ได้ดูโง่ ไม่ทำเรื่องโง่ ๆ 565 00:33:30,954 --> 00:33:33,556 และผมว่ามันมีประโยชน์จริง ๆ 566 00:33:33,556 --> 00:33:41,073 ในฐานะ workhorse สำหรับงานระยะยาว (long-horizon tasks) มันจัดการ context ยาว ๆ 567 00:33:41,073 --> 00:33:42,172 ได้ดีมาก 568 00:33:42,172 --> 00:33:49,014 ดังนั้นผมว่าแน่นอนว่ามันเป็นโมเดลที่มีประโยชน์เมื่อรันบนเครื่องท้องถิ่น 569 00:33:49,014 --> 00:33:52,194 วิดีโอหน้าและคำถามทิ้งท้าย เอาล่ะ 570 00:33:52,194 --> 00:33:55,856 นั่นคือทั้งหมด นี่จะเป็นการจบวิดีโอนี้ 571 00:33:55,856 --> 00:34:00,000 หวังว่าคุณจะสนุกนะครับ สัปดาห์หน้าโมเดลใหม่ 572 00:34:00,000 --> 00:34:03,566 Qwen 3.8 จะออกมา ผมรู้ว่าเวอร์ชัน max 573 00:34:03,566 --> 00:34:07,902 ออกมาบนคลาวด์แล้ว บางทีผมอาจทำอะไรคล้าย ๆ นี้ 574 00:34:07,902 --> 00:34:11,949 ให้โจทย์เดียวกัน ใช้เวอร์ชันคลาวด์ ตัว max 575 00:34:11,949 --> 00:34:15,611 และผมรู้ว่าพวกเขาจะต้องทำ open weights 576 00:34:15,611 --> 00:34:19,851 สำหรับเวอร์ชัน 27 พันล้าน (27B) ซึ่งเล็กกว่า 577 00:34:19,851 --> 00:34:21,972 DeepSeek ตัวนี้ด้วยซ้ำ 578 00:34:21,972 --> 00:34:25,730 แต่ผมอยากรู้ว่ามันจะรับมือกับโจทย์ยาก ๆ 579 00:34:25,730 --> 00:34:33,246 แบบนี้ยังไง โมเดลนั้นมี vision ด้วย ซึ่งน่าสนใจ มาดูกันว่ามันทำงานยังไง จริง ๆ 580 00:34:33,246 --> 00:34:37,487 แล้วผมคงโฮสต์เวอร์ชัน max ไม่ไหว แต่เวอร์ชัน 581 00:34:37,487 --> 00:34:41,148 27 พันล้านทำได้ เอาไว้ดูกันสัปดาห์หน้า 582 00:34:41,148 --> 00:34:43,365 นี่จะเป็นการจบวิดีโอนี้ 583 00:34:43,365 --> 00:34:47,220 ฝากคอมเมนต์ไว้ด้วยนะครับ คุณคิดยังไงบ้าง 584 00:34:47,220 --> 00:34:50,110 ประสบการณ์ของคุณจนถึงตอนนี้กับ 585 00:34:50,110 --> 00:34:53,580 DeepSeek-V4-Flash 0731 เป็นยังไงบ้าง 586 00:34:53,580 --> 00:34:56,278 ชื่อยาวมากจริง ๆ จริงไหมครับ 587 00:34:56,278 --> 00:35:00,036 แต่ประสบการณ์ของคุณกับโมเดลนี้เป็นยังไง 588 00:35:00,036 --> 00:35:03,505 บอกผมด้วยนะครับ นี่คือการจบวิดีโอนี้ 589 00:35:03,505 --> 00:35:05,240 ขอบคุณที่รับชมครับ