First Look at GLM-5.3: Next-Level Coding Model Born from Post-Training
สรุปย่อ
ประเด็นสำคัญจากวิดีโอ
- **ช่อง:** Tonbi's AI Garage · **ความยาว:** ~19 นาที · **ลิงก์:** https://www.youtube.com/watch?v=XKQ-QLJnaDs
# สรุป: First Look at GLM-5.3: Next-Level Coding Model Born from Post-Training - **ช่อง:** Tonbi's AI Garage · **ความยาว:** ~19 นาที · **ลิงก์:** https://www.youtube.com/watch?v=XKQ-QLJnaDs ## ประเด็นหลัก - GLM-5.3 โมเดล AI ที่พัฒนาจากบริษัท AI จีน Zhipu AI เปิดตัววันที่ 1 พฤษภาคม 2024 - ใช้เทคนิคการฝึกหลังการเรียนรู้ (post-training) ในสภาพแวดล้อมที่ซับซ้อนขึ้น - มีพารามิเตอร์เท่าเดิมกับ GLM-5.2 (743 พันล้าน) แต่ประสิทธิภาพเพิ่มขึ้นอย่างมีนัยสำคัญ - ในการทดสอบโปรแกรมคอมพิวเตอร์ ได้คะแนน 88.2 ใน Terminal Bench 2.1 เทียบเท่ากับโมเดลชั้นนำ - ประหยัดต้นทุนการใช้งานด้วยการใช้โทเคนที่น้อยกว่า ลดลงจาก 96,000 เหลือ 75,000 โทเคน - มีประสิทธิภาพด้านความปลอดภัยในระบบไซเบอร์ที่ดีขึ้น ได้คะแนน 54.4% ในการทดสอบ Exploit Bench - ราคาใช้งานคือ 1.40 ดอลลาร์ต่อล้านโทเคนอินพุต และ 4.40 ดอลลาร์ต่อล้านโทเคนเอาต์พุต - ทดลองสร้างเกมและวิเคราะห์ความปลอดภัยของระบบได้ดีกว่า GLM-5.2 และ Fable ในบางด้าน ## ความเห็นสรุป GLM-5.3 เป็นการพัฒนาที่น่าทึ่งจาก GLM-5.2 ด้วยการฝึกหลังการเรียนรู้ในสภาพแวดล้อมที่ซับซ้อน ทำให้มีประสิทธิภาพในการโปรแกรมคอมพิวเตอร์ที่ดีขึ้นโดยใช้ทรัพยากรน้อยกว่า แม้ว่าจะยังไม่เหนือกว่าโมเดลขนาดใหญ่บางตัวในทุกด้าน แต่ในราคาที่ประหยัดกว่า GLM-5.3 เป็นตัวเลือกที่น่าสนใจสำหรับงานโปรแกรมทั่วไปและการวิเคราะห์ความปลอดภัย
คำแปลเต็ม
แปลตามบทสนทนาต้นฉบับ ปรับเป็นภาษาไทยธรรมชาติ
แน่นอนครับ มีโมเดลใหม่สำหรับทดสอบ แนวทางนี้สำหรับสร้างเกมเล็กๆ ในเบราว์เซอร์สำหรับพื้นที่ฝึกฝนของโจรอวกาศ ซึ่งฉันเล่นในบทบาทยานอวกาศที่พยายามหลบหลีกศัตรูและรวบรวมเศษพลังงาน ฉันคิดว่านี่คือการทดสอบที่ดีเพราะใช้องค์ประกอบหลากหลายของอินเตอร์เฟซฟร้อนต์เอนด์ ลองดูกันว่ามันเป็นอย่างไร มาเข้าสู่พื้นที่จากที่นี่ ดูน่าดีมากครับ ลูกบอลตรงกลาง ตามที่คุณเห็น ดูสวยงามมาก อืม ยานของฉันดูน่าดีมากครับ ศัตรูเองก็ดูเป็นสามมิติขนาดใหญ่ ขณะที่ฉันรวบรวม คุณสามารถเห็นนี่ได้ ฉันได้รับบาดเจ็บบ้าง โอ๊ะ ไม่ ฉันแพ้ไปแล้ว นี่คือเกมที่ฉันสร้างขึ้นสำหรับโมเดลหลายตัวล่าสุด คุณสามารถเห็นการเปรียบเทียบที่นี่กับโมเดลหลายตัวที่แตกต่างกัน และตามที่คุณคาดหวัง โมเดลที่เราจะพูดถึงวันนี้คือ GLM 5.3 สัปดาห์ที่แล้ว ห้องปฏิบัติการ AI จีนที่มีชื่อเสียงในเรื่องโมเดลโอเพ่นเซิร์ส โดยเฉพาะอย่างยิ่งชุด GLM ได้เปิดตัวโมเดล GLM 5.3 แล้ว นี่คือโมเดลล่าสุดของพวกเขา โมเดลก่อนหน้า GLM 5.2 มีอิทธิพลมากในฐานะโมเดลโอเพ่นเซิร์สที่มีความเข้าถึงใกล้เคียงกับระดับของโมเดลชั้นนำ ดังนั้น โมเดลนี้จึงถูกคาดหวังอย่างมาก GLM 5.3 มีอยู่มาแล้วสองสามวันที่นี่ แท้จริงแล้วได้เปิดตัวสัปดาห์ที่แล้ว แต่ไม่สามารถเข้าถึงผ่าน API ได้สองสามวัน คุณต้องใช้แผนสมาชิกพิเศษของพวกเขาหรือตัวเลือกอื่นๆ แต่ตอนนี้พวกเขาได้เปิดตัว API แล้ว ดังนั้นเราจึงสามารถใช้มันผ่าน Open Router หรือบริการคลาวด์อื่นๆ นี่จะมองแรกของฉันเกี่ยวกับ GLM 5.3 เราจะทดสอบมันสองสามอย่าง เพื่อดูว่าประสิทธิภาพของมันจะเป็นอย่างไร และดูว่ามันจะใช้ต้นทุนเราในสิ่งเหล่านี้เท่าไหร่ มาเริ่มกันดีกว่า และถ้าคุณกำลังมองหาพัฒนาเอเจนต์ของคุณ ลองเช็คโปรเจกต์ Agent Wikis ของฉัน ที่นี่ คุณสามารถเข้าถึงกฎความรู้ที่ฉันใช้ทุกวันในการวิจัยวิดีโอเหล่านี้และสร้างโปรเจกต์ หัวข้อรวมถึงเอเจนต์ Hermes และ hyperframes และเครื่องมือ AI สแตนด์อโลน และอื่นๆ อีกมากมาย ทุก wiki มาตรฐานนี้ฟรี แต่ถ้าคุณสมัครสมาชิก Agent Wikis Pro คุณจะได้รับการเข้าถึง wiki ขั้นสูง พร้อมกับทักษะที่กำหนดเองที่ฉันพัฒนากับลูกค้าของฉันในช่วงหลายเดือนของการทำงานร่วมกัน ราคา Pro คือ 9.99 ดอลลาร์ต่อเดือน และถ้าคุณลงทะเบียนตอนนี้ คุณจะได้รับราคาตลอดชีพ ฉันกำลังทำงานอยู่กับโปรไฟล์ที่กำหนดเอสำหรับเอเจนต์และเทมเพลตเวิร์กโฟลว์อัตโนมัติดังนั้น ในท้ายที่สุดของวิดีโอนี้ คุณจะเห็นว่าฉันได้ทำอะไรบ้างแล้ว เปลี่ยนไปใช้แพลตฟอร์ม Open Router และทดลองใช้ GLM 5.3 มาทดสอบการทำงาน ในการทดสอบเบื้องต้น มันทำงานได้ดีมาก และฉันสามารถสร้างเกมที่สวยงามได้ ดังนั้น มันน่าดีขึ้นมาก นี่คือที่มาของ GLM 5.3 และนี่คือพวกเขาทำให้มันแตกต่างจาก 5.2 ที่สำคัญ และตอนนี้ เรากลับมาที่วิดีโอ GLM 5.3 นะครับ สิ่งแรกที่เราต้องรู้ก็คือ มันยังคงใช้ฐานข้อมูลเดียวกันของการผสมผสานผู้เชี่ยวชาญ 743 พันล้านพารามิเตอร์เหมือนเดิมใน 5.2 ดังนั้น โมเดลพื้นฐานยังคงเหมือนเดิม ทุกอย่างที่เปลี่ยนแปลง และทุกอย่างที่ได้รับประโยชน์นั้นมาจากการฝึกหลังการเรียนรู้ และนี่คือสิ่งที่น่าสนใจเอง บริษัท Zhipu AI กำลังพัฒนาการกระโดดครั้งใหญ่ในการฝึกหลังการเรียนรู้ และโดยเฉพาะอย่างยิ่งพวกเขาใช้การฝึกหลังการเรียนรู้ในระดับสภาพแวดล้อม และผลลัพธ์คือพวกเขาสามารถทำงานกับงานโปรแกรมที่ยากขึ้น โดยเฉพาะอย่างยิ่งงานที่ใช้เวลานาน และนี่คือวิธีการทั้งหมด ใช่ไหมครับ ดังนั้น มันยังคงเป็นฐานเดียวกัน แต่ตอนนี้มันทำงานในสภาพแวดล้อมที่หลากหลายขึ้น และประเภทของสภาพแวดล้อมที่หลากหลายขึ้น และงานที่ยาวนานขึ้น ดังนั้นฉันจึงสนใจที่จะเห็นการประเมินและตรวจสอบว่าวิธีการนี้มีประสิทธิภาพเพียงไหน
หากคุณจำได้ "การต่อสู้กับจักรวาล AI" ที่ฉันทำ โมเดล GLM 5.2 ในเวลานั้นถูกกำจัดออกไปในรอบแรกเพราะในงานออกแบบอินเตอร์เฟซ มันผลิตอะไรที่เป็นปัญหาบางอย่าง ดังนั้นฉันจึงสงสัยว่าโมเดลล่าสุดนี้สามารถวิเคราะห์ได้ว่ามันเป็นปัญหาและแก้ไขได้หรือเปล่า และเราจะทำงานนั้นเป็นจริงในภายหลัง
และตอนนี้ เราไปยังตัวชี้วัดที่ทุกคนชอบเห็น คุณสามารถสังเกตเห็นว่าแม้ว่ามันจะเป็นเพียงการฝึกหลังการเรียนรู้ แต่ก็มีการเพิ่มขึ้นอย่างใหญ่หลวง และเฉพาะในตัวชี้วัดโปรแกรมคอมพิวเตอร์ คุณจะเห็นการกระโดดของการปรับปรุง 23 และ 20 และ 23 หากเรามองที่นี่ไปยังการเปรียบเทียบกับโมเดลอื่นๆ GLM 5.3 คือโมเดลสีน้ำเงินที่นี่ คุณสามารถเห็นว่ามีการปรับปรุงอย่างยิ่งใหญ่เมื่อเทียบกับ 5.2 และโดยยึดตามมาตรฐานบางอย่างมันเทียบเท่ากับ Kimiko 3 และแม้กระทั่ง GPT 5.6 Soul พร้อมกับ Fable ซึ่งน่าทึ่งจริงๆ คุณสามารถเห็นว่าบางอย่างพอดีกับมันเลย ถ้าเราดูที่การทดสอบโปรแกรมคอมพิวเตอร์ Terminal Bench 2.1 ที่นี่ คุณสามารถเห็นว่า Fable ได้คะแนน 88 และ GPT Soul ได้ 88.8 และ GLM 5.3 ได้ 88.2 ใช่ครับ นี่คือมาตรฐานมาตรฐาน มันน่าทึ่งจริงๆ แต่ฉันคิดว่าเรารู้ว่าเราต้องทดสอบโมเดลจริงๆ ก่อนที่เราจะสามารถพึงพอใจกับผลลัพธ์ได้อย่างสมบูรณ์ แต่หนึ่งในข้อดีใหญ่ๆ คือมันได้ผลลัพธ์เดียวกับโมเดลที่พัฒนามากขึ้น แต่ด้วยจำนวนโทเคนที่น้อยกว่ามาก ซึ่งสำคัญมาก มีการเพิ่มขึ้นของประสิทธิภาพในการทำงาน การฝึกหลังการเรียนรู้สอนโมเดลเกี่ยวกับเส้นทางการอนุมานที่สั้นลง ดังนั้นด้วยความพยายามสูงสุด และในการทดสอบโปรแกรมของ DAI โมเดลนี้ได้พัฒนาจาก 23.4% เป็น 34.5% ในขณะที่โทเคนเอาต์พุตเฉลี่ยลดลงจาก 96,000 เหลือเพียง 75,000 เท่านั้น ดังนั้น ได้ผลลัพธ์ที่ดีกว่าด้วยจำนวนโทเคนที่น้อยกว่า ซึ่งหมายความว่าต้นทุนที่น้อยกว่าแน่นอน และคุณสามารถเห็นการเปรียบเทียบที่นี่กับ Claude Opus 4.8 มันได้ผลลัพธ์ที่ดีกว่าด้วยน้อยกว่าครึ่งของจำนวนโทเคนเอาต์พุต
## บทสรุป
GLM-5.3 เป็นการอัพเกรดที่สำคัญจาก GLM-5.2 ด้วยการฝึกหลังการเรียนรู้ในสภาพแวดล้อมที่หลากหลาย ทำให้มีประสิทธิภาพดีขึ้นในงานโปรแกรมคอมพิวเตอร์ ได้คะแนน 88.2 ใน Terminal Bench 2.1 แทบจะเทียบเท่ากับโมเดลชั้นนำ และใช้โทเคนเออกแบบลดลง 30% ทำให้คุ้มค่าทางเศรษฐศาสตร์มากขึ้น
หมายเหตุการแปล
ความโปร่งใสเกี่ยวกับความไม่แน่นอนในต้นฉบับ
- ## สถานการณ์ที่ไม่ชัดเจน
- ไม่พบเซ็มเมนต์ที่ฟังไม่ชัดเจนในคำบรรยายต้นฉบับที่เป็นข้อความ
อภิธานศัพท์เทคนิค
คำศัพท์และชื่อผลิตภัณฑ์ที่คงรูปภาษาอังกฤษ
| ศัพท์ | คำแปล / คำอธิบาย |
|---|---|
| GLM-5.3 | โมเดล AI ขนาดใหญ่จาก Zhipu AI ในเดือนพฤษภาคม 2024 |
| Post-training | การฝึกหลังการเรียนรู้ เทคนิคการปรับปรุงโมเดลหลังจากฝึกเบสไลน์ |
| Terminal Bench 2.1 | การทดสอบมาตรฐานสำหรับโมเดล AI ด้านการเขียนโปรแกรมคอมพิวเตอร์ |
| Exploit Bench | การทดสอบความปลอดภัยของระบบเชิงลึกสำหรับวินิจฉัยจุดอ่อนไซเบอร์ |
| Open Router | บริการเชื่อมต่อ API สำหรับเรียกใช้โมเดล AI หลายตัว |
| Claude Opus 4.8 | โมเดล AI ของ Anthropic ในรุ่นชั้นนำ |
| Fable | โมเดล AI คู่แข่งที่มีประสิทธิภาพสูง |
| Kimiko 3 | โมเดล AI อีกรุ่นหนึ่งที่ได้คะแนนสูงในการทดสอบ |
| GPT-5.6 Soul | รุ่นขั้นสูงของโมเดล GPT |
| DAI | โปรแกรมการทดสอบ AI สำหรับประเมินประสิทธิภาพ |
| API | อินเตอร์เฟซการเรียกใช้งานแอพลิเคชัน |
| Tokens | หน่วยย่อยของข้อมูลที่ AI ใช้ในการประมวลผล |
| Slime | เฟรมเวิร์กโอเพ่นซอร์สสำหรับการฝึกหลังการเรียนรู้ |
| Royal Rumble | ชื่อทดสอบสร้างเกมที่มีโมเดลหลายตัวแข่งขันกัน |
| 743B parameters | จำนวนพารามิเตอร์ของโมเดล GLM (743 พันล้าน) |
| Cost efficiency | ประสิทธิภาพในการใช้ต้นทุน ค่าใช้จ่ายต่อผลลัพธ์ |
| Cybersecurity | ความปลอดภัยด้านไซเบอร์ การป้องกันการโจมตีดิจิทัล |
| Prompt engineering | ศาสตร์การออกแบบคำสั่งเพื่อให้ AI ทำงานตามต้องการ |
| Frontend | ส่วนติดต่อผู้ใช้ของเว็บแอพพลิเคชัน |
ซับไตเติ้ลภาษาไทย
ดาวน์โหลดหรือดูซับทั้งหมด
1 00:00:00,000 --> 00:00:15,743 แน่นอนครับ มีโมเดลใหม่สำหรับทดสอบ แนวทางนี้สำหรับสร้างเกมเล็กๆ 2 00:00:15,743 --> 00:00:26,407 ในเบราว์เซอร์สำหรับพื้นที่ฝึกฝนของโจรอวกาศ 3 00:00:26,407 --> 00:00:43,165 ซึ่งฉันเล่นในบทบาทยานอวกาศที่พยายามหลบหลีกศัตรูและรวบรวมเศษพลังงาน 4 00:00:43,165 --> 00:01:03,479 ฉันคิดว่านี่คือการทดสอบที่ดีเพราะใช้องค์ประกอบหลากหลายของอินเตอร์เฟซฟร้อนต์เอนด์
เปิดดูซับไตเติ้ลทั้งหมด (109 segments)
1 00:00:00,000 --> 00:00:15,743 แน่นอนครับ มีโมเดลใหม่สำหรับทดสอบ แนวทางนี้สำหรับสร้างเกมเล็กๆ 2 00:00:15,743 --> 00:00:26,407 ในเบราว์เซอร์สำหรับพื้นที่ฝึกฝนของโจรอวกาศ 3 00:00:26,407 --> 00:00:43,165 ซึ่งฉันเล่นในบทบาทยานอวกาศที่พยายามหลบหลีกศัตรูและรวบรวมเศษพลังงาน 4 00:00:43,165 --> 00:01:03,479 ฉันคิดว่านี่คือการทดสอบที่ดีเพราะใช้องค์ประกอบหลากหลายของอินเตอร์เฟซฟร้อนต์เอนด์ 5 00:01:03,479 --> 00:01:09,826 ลองดูกันว่ามันเป็นอย่างไร 6 00:01:09,826 --> 00:01:19,983 มาเข้าสู่พื้นที่จากที่นี่ ดูน่าดีมากครับ 7 00:01:19,983 --> 00:01:30,901 ลูกบอลตรงกลาง ตามที่คุณเห็น ดูสวยงามมาก อืม 8 00:01:30,901 --> 00:01:36,741 ยานของฉันดูน่าดีมากครับ 9 00:01:36,741 --> 00:01:44,613 ศัตรูเองก็ดูเป็นสามมิติขนาดใหญ่ 10 00:01:44,613 --> 00:01:53,500 ขณะที่ฉันรวบรวม คุณสามารถเห็นนี่ได้ 11 00:01:53,500 --> 00:02:04,164 ฉันได้รับบาดเจ็บบ้าง โอ๊ะ ไม่ ฉันแพ้ไปแล้ว 12 00:02:04,164 --> 00:02:16,352 นี่คือเกมที่ฉันสร้างขึ้นสำหรับโมเดลหลายตัวล่าสุด 13 00:02:16,352 --> 00:02:31,841 คุณสามารถเห็นการเปรียบเทียบที่นี่กับโมเดลหลายตัวที่แตกต่างกัน 14 00:02:31,841 --> 00:02:36,665 และตามที่คุณคาดหวัง 15 00:02:36,665 --> 00:02:45,806 โมเดลที่เราจะพูดถึงวันนี้คือ GLM 5.3 16 00:02:45,806 --> 00:02:53,931 สัปดาห์ที่แล้ว ห้องปฏิบัติการ AI 17 00:02:53,931 --> 00:03:04,596 จีนที่มีชื่อเสียงในเรื่องโมเดลโอเพ่นเซิร์ส 18 00:03:04,596 --> 00:03:15,768 โดยเฉพาะอย่างยิ่งชุด GLM ได้เปิดตัวโมเดล GLM 19 00:03:15,768 --> 00:03:24,655 5.3 แล้ว นี่คือโมเดลล่าสุดของพวกเขา 20 00:03:24,655 --> 00:03:29,987 โมเดลก่อนหน้า GLM 5.2 21 00:03:29,987 --> 00:03:50,808 มีอิทธิพลมากในฐานะโมเดลโอเพ่นเซิร์สที่มีความเข้าถึงใกล้เคียงกับระดับของโมเดลชั้นนำ 22 00:03:50,808 --> 00:04:02,234 ดังนั้น โมเดลนี้จึงถูกคาดหวังอย่างมาก GLM 5.3 23 00:04:02,234 --> 00:04:09,090 มีอยู่มาแล้วสองสามวันที่นี่ 24 00:04:09,090 --> 00:04:17,977 แท้จริงแล้วได้เปิดตัวสัปดาห์ที่แล้ว 25 00:04:17,977 --> 00:04:28,133 แต่ไม่สามารถเข้าถึงผ่าน API ได้สองสามวัน 26 00:04:28,133 --> 00:04:40,829 คุณต้องใช้แผนสมาชิกพิเศษของพวกเขาหรือตัวเลือกอื่นๆ 27 00:04:40,829 --> 00:04:49,462 แต่ตอนนี้พวกเขาได้เปิดตัว API แล้ว 28 00:04:49,462 --> 00:04:59,873 ดังนั้นเราจึงสามารถใช้มันผ่าน Open Router 29 00:04:59,873 --> 00:05:05,205 หรือบริการคลาวด์อื่นๆ 30 00:05:05,205 --> 00:05:13,838 นี่จะมองแรกของฉันเกี่ยวกับ GLM 5.3 31 00:05:13,838 --> 00:05:19,932 เราจะทดสอบมันสองสามอย่าง 32 00:05:19,932 --> 00:05:30,088 เพื่อดูว่าประสิทธิภาพของมันจะเป็นอย่างไร 33 00:05:30,088 --> 00:05:42,022 และดูว่ามันจะใช้ต้นทุนเราในสิ่งเหล่านี้เท่าไหร่ 34 00:05:42,022 --> 00:05:46,085 มาเริ่มกันดีกว่า 35 00:05:46,085 --> 00:05:55,480 และถ้าคุณกำลังมองหาพัฒนาเอเจนต์ของคุณ 36 00:05:55,480 --> 00:06:05,890 ลองเช็คโปรเจกต์ Agent Wikis ของฉัน ที่นี่ 37 00:06:05,890 --> 00:06:26,203 คุณสามารถเข้าถึงกฎความรู้ที่ฉันใช้ทุกวันในการวิจัยวิดีโอเหล่านี้และสร้างโปรเจกต์ 38 00:06:26,203 --> 00:06:36,868 หัวข้อรวมถึงเอเจนต์ Hermes และ hyperframes 39 00:06:36,868 --> 00:06:48,548 และเครื่องมือ AI สแตนด์อโลน และอื่นๆ อีกมากมาย 40 00:06:48,548 --> 00:06:59,466 ทุก wiki มาตรฐานนี้ฟรี แต่ถ้าคุณสมัครสมาชิก 41 00:06:59,466 --> 00:07:10,130 Agent Wikis Pro คุณจะได้รับการเข้าถึง wiki 42 00:07:10,130 --> 00:07:11,908 ขั้นสูง 43 00:07:11,908 --> 00:07:32,983 พร้อมกับทักษะที่กำหนดเองที่ฉันพัฒนากับลูกค้าของฉันในช่วงหลายเดือนของการทำงานร่วมกัน 44 00:07:32,983 --> 00:07:41,362 ราคา Pro คือ 9.99 ดอลลาร์ต่อเดือน 45 00:07:41,362 --> 00:07:47,456 และถ้าคุณลงทะเบียนตอนนี้ 46 00:07:47,456 --> 00:07:53,042 คุณจะได้รับราคาตลอดชีพ 47 00:07:53,042 --> 00:08:15,133 ฉันกำลังทำงานอยู่กับโปรไฟล์ที่กำหนดเอสำหรับเอเจนต์และเทมเพลตเวิร์กโฟลว์อัตโนมัติดังนั้น 48 00:08:15,133 --> 00:08:24,781 ในทันทีที่เผยแพร่ ราคา Pro จะเพิ่มขึ้น 49 00:08:24,781 --> 00:08:35,700 ดังนั้นให้คิดในการลงทะเบียนวันนี้บนเว็บไซต์ 50 00:08:35,700 --> 00:08:39,254 agentwikis.com 51 00:08:39,254 --> 00:08:50,427 ขอบคุณทุกคนสำหรับการสนับสนุนของคุณ และตอนนี้ 52 00:08:50,427 --> 00:08:58,806 เรากลับมาที่วิดีโอ GLM 5.3 นะครับ 53 00:08:58,806 --> 00:09:05,154 สิ่งแรกที่เราต้องรู้ก็คือ 54 00:09:05,154 --> 00:09:18,611 มันยังคงใช้ฐานข้อมูลเดียวกันของการผสมผสานผู้เชี่ยวชาญ 55 00:09:18,611 --> 00:09:30,291 743 พันล้านพารามิเตอร์เหมือนเดิมใน 5.2 ดังนั้น 56 00:09:30,291 --> 00:09:37,147 โมเดลพื้นฐานยังคงเหมือนเดิม 57 00:09:37,147 --> 00:09:42,733 ทุกอย่างที่เปลี่ยนแปลง 58 00:09:42,733 --> 00:09:57,460 และทุกอย่างที่ได้รับประโยชน์นั้นมาจากการฝึกหลังการเรียนรู้ 59 00:09:57,460 --> 00:10:08,124 และนี่คือสิ่งที่น่าสนใจเอง บริษัท Zhipu AI 60 00:10:08,124 --> 00:10:21,074 กำลังพัฒนาการกระโดดครั้งใหญ่ในการฝึกหลังการเรียนรู้ 61 00:10:21,074 --> 00:10:38,340 และโดยเฉพาะอย่างยิ่งพวกเขาใช้การฝึกหลังการเรียนรู้ในระดับสภาพแวดล้อม 62 00:10:38,340 --> 00:10:51,798 และผลลัพธ์คือพวกเขาสามารถทำงานกับงานโปรแกรมที่ยากขึ้น 63 00:10:51,798 --> 00:11:00,177 โดยเฉพาะอย่างยิ่งงานที่ใช้เวลานาน 64 00:11:00,177 --> 00:11:10,841 และนี่คือวิธีการทั้งหมด ใช่ไหมครับ ดังนั้น 65 00:11:10,841 --> 00:11:16,681 มันยังคงเป็นฐานเดียวกัน 66 00:11:16,681 --> 00:11:28,107 แต่ตอนนี้มันทำงานในสภาพแวดล้อมที่หลากหลายขึ้น 67 00:11:28,107 --> 00:11:37,756 และประเภทของสภาพแวดล้อมที่หลากหลายขึ้น 68 00:11:37,756 --> 00:11:42,580 และงานที่ยาวนานขึ้น 69 00:11:42,580 --> 00:12:02,893 ดังนั้นฉันจึงสนใจที่จะเห็นการประเมินและตรวจสอบว่าวิธีการนี้มีประสิทธิภาพเพียงไหน 70 00:12:02,893 --> 00:12:14,320 หากคุณจำได้ "การต่อสู้กับจักรวาล AI" ที่ฉันทำ 71 00:12:14,320 --> 00:12:17,620 โมเดล GLM 5.2 72 00:12:17,620 --> 00:12:32,347 ในเวลานั้นถูกกำจัดออกไปในรอบแรกเพราะในงานออกแบบอินเตอร์เฟซ 73 00:12:32,347 --> 00:12:40,219 มันผลิตอะไรที่เป็นปัญหาบางอย่าง 74 00:12:40,219 --> 00:13:02,563 ดังนั้นฉันจึงสงสัยว่าโมเดลล่าสุดนี้สามารถวิเคราะห์ได้ว่ามันเป็นปัญหาและแก้ไขได้หรือเปล่า 75 00:13:02,563 --> 00:13:13,735 และเราจะทำงานนั้นเป็นจริงในภายหลัง และตอนนี้ 76 00:13:13,735 --> 00:13:21,861 เราไปยังตัวชี้วัดที่ทุกคนชอบเห็น 77 00:13:21,861 --> 00:13:37,857 คุณสามารถสังเกตเห็นว่าแม้ว่ามันจะเป็นเพียงการฝึกหลังการเรียนรู้ 78 00:13:37,857 --> 00:13:45,983 แต่ก็มีการเพิ่มขึ้นอย่างใหญ่หลวง 79 00:13:45,983 --> 00:13:55,377 และเฉพาะในตัวชี้วัดโปรแกรมคอมพิวเตอร์ 80 00:13:55,377 --> 00:14:07,057 คุณจะเห็นการกระโดดของการปรับปรุง 23 และ 20 และ 81 00:14:07,057 --> 00:14:08,157 23 82 00:14:08,157 --> 00:14:20,091 หากเรามองที่นี่ไปยังการเปรียบเทียบกับโมเดลอื่นๆ 83 00:14:20,091 --> 00:14:27,962 GLM 5.3 คือโมเดลสีน้ำเงินที่นี่ 84 00:14:27,962 --> 00:14:41,927 คุณสามารถเห็นว่ามีการปรับปรุงอย่างยิ่งใหญ่เมื่อเทียบกับ 85 00:14:41,927 --> 00:14:53,608 5.2 และโดยยึดตามมาตรฐานบางอย่างมันเทียบเท่ากับ 86 00:14:53,608 --> 00:15:04,780 Kimiko 3 และแม้กระทั่ง GPT 5.6 Soul พร้อมกับ 87 00:15:04,780 --> 00:15:10,366 Fable ซึ่งน่าทึ่งจริงๆ 88 00:15:10,366 --> 00:15:19,761 คุณสามารถเห็นว่าบางอย่างพอดีกับมันเลย 89 00:15:19,761 --> 00:15:31,441 ถ้าเราดูที่การทดสอบโปรแกรมคอมพิวเตอร์ Terminal 90 00:15:31,441 --> 00:15:41,343 Bench 2.1 ที่นี่ คุณสามารถเห็นว่า Fable 91 00:15:41,343 --> 00:15:52,769 ได้คะแนน 88 และ GPT Soul ได้ 88.8 และ GLM 5.3 92 00:15:52,769 --> 00:16:02,164 ได้ 88.2 ใช่ครับ นี่คือมาตรฐานมาตรฐาน 93 00:16:02,164 --> 00:16:05,973 มันน่าทึ่งจริงๆ 94 00:16:05,973 --> 00:16:16,891 แต่ฉันคิดว่าเรารู้ว่าเราต้องทดสอบโมเดลจริงๆ 95 00:16:16,891 --> 00:16:34,919 ก่อนที่เราจะสามารถพึงพอใจกับผลลัพธ์ได้อย่างสมบูรณ์ แต่หนึ่งในข้อดีใหญ่ๆ 96 00:16:34,919 --> 00:16:46,091 คือมันได้ผลลัพธ์เดียวกับโมเดลที่พัฒนามากขึ้น 97 00:16:46,091 --> 00:16:57,264 แต่ด้วยจำนวนโทเคนที่น้อยกว่ามาก ซึ่งสำคัญมาก 98 00:16:57,264 --> 00:17:06,912 มีการเพิ่มขึ้นของประสิทธิภาพในการทำงาน 99 00:17:06,912 --> 00:17:22,909 การฝึกหลังการเรียนรู้สอนโมเดลเกี่ยวกับเส้นทางการอนุมานที่สั้นลง 100 00:17:22,909 --> 00:17:29,765 ดังนั้นด้วยความพยายามสูงสุด 101 00:17:29,765 --> 00:17:36,620 และในการทดสอบโปรแกรมของ DAI 102 00:17:36,620 --> 00:17:45,761 โมเดลนี้ได้พัฒนาจาก 23.4% เป็น 34.5% 103 00:17:45,761 --> 00:17:56,172 ในขณะที่โทเคนเอาต์พุตเฉลี่ยลดลงจาก 96,000 104 00:17:56,172 --> 00:18:04,805 เหลือเพียง 75,000 เท่านั้น ดังนั้น 105 00:18:04,805 --> 00:18:15,977 ได้ผลลัพธ์ที่ดีกว่าด้วยจำนวนโทเคนที่น้อยกว่า 106 00:18:15,977 --> 00:18:25,626 ซึ่งหมายความว่าต้นทุนที่น้อยกว่าแน่นอน 107 00:18:25,626 --> 00:18:37,306 และคุณสามารถเห็นการเปรียบเทียบที่นี่กับ Claude 108 00:18:37,306 --> 00:18:39,337 Opus 4.8 109 00:18:39,337 --> 00:18:54,572 มันได้ผลลัพธ์ที่ดีกว่าด้วยน้อยกว่าครึ่งของจำนวนโทเคนเอาต์พุต