▶SUBTHAIแปลไทย · ซับ · พากย์⚙
บทความแปลภาษาไทย · YouTube

First Look at GLM-5.3: Next-Level Coding Model Born from Post-Training

0:000:00
เล่นเสียงต้นฉบับของวิดีโอ พร้อมแสดงซับไทยซิงก์ตามเวลา
กำลังโหลดวิดีโอ…
01

สรุปย่อ

ประเด็นสำคัญจากวิดีโอ

- **ช่อง:** Tonbi's AI Garage · **ความยาว:** ~19 นาที · **ลิงก์:** https://www.youtube.com/watch?v=XKQ-QLJnaDs

# สรุป: First Look at GLM-5.3: Next-Level Coding Model Born from Post-Training

- **ช่อง:** Tonbi's AI Garage · **ความยาว:** ~19 นาที · **ลิงก์:** https://www.youtube.com/watch?v=XKQ-QLJnaDs

## ประเด็นหลัก

- GLM-5.3 โมเดล AI ที่พัฒนาจากบริษัท AI จีน Zhipu AI เปิดตัววันที่ 1 พฤษภาคม 2024
- ใช้เทคนิคการฝึกหลังการเรียนรู้ (post-training) ในสภาพแวดล้อมที่ซับซ้อนขึ้น
- มีพารามิเตอร์เท่าเดิมกับ GLM-5.2 (743 พันล้าน) แต่ประสิทธิภาพเพิ่มขึ้นอย่างมีนัยสำคัญ
- ในการทดสอบโปรแกรมคอมพิวเตอร์ ได้คะแนน 88.2 ใน Terminal Bench 2.1 เทียบเท่ากับโมเดลชั้นนำ
- ประหยัดต้นทุนการใช้งานด้วยการใช้โทเคนที่น้อยกว่า ลดลงจาก 96,000 เหลือ 75,000 โทเคน
- มีประสิทธิภาพด้านความปลอดภัยในระบบไซเบอร์ที่ดีขึ้น ได้คะแนน 54.4% ในการทดสอบ Exploit Bench
- ราคาใช้งานคือ 1.40 ดอลลาร์ต่อล้านโทเคนอินพุต และ 4.40 ดอลลาร์ต่อล้านโทเคนเอาต์พุต
- ทดลองสร้างเกมและวิเคราะห์ความปลอดภัยของระบบได้ดีกว่า GLM-5.2 และ Fable ในบางด้าน

## ความเห็นสรุป

GLM-5.3 เป็นการพัฒนาที่น่าทึ่งจาก GLM-5.2 ด้วยการฝึกหลังการเรียนรู้ในสภาพแวดล้อมที่ซับซ้อน ทำให้มีประสิทธิภาพในการโปรแกรมคอมพิวเตอร์ที่ดีขึ้นโดยใช้ทรัพยากรน้อยกว่า แม้ว่าจะยังไม่เหนือกว่าโมเดลขนาดใหญ่บางตัวในทุกด้าน แต่ในราคาที่ประหยัดกว่า GLM-5.3 เป็นตัวเลือกที่น่าสนใจสำหรับงานโปรแกรมทั่วไปและการวิเคราะห์ความปลอดภัย
02

คำแปลเต็ม

แปลตามบทสนทนาต้นฉบับ ปรับเป็นภาษาไทยธรรมชาติ

แน่นอนครับ มีโมเดลใหม่สำหรับทดสอบ แนวทางนี้สำหรับสร้างเกมเล็กๆ ในเบราว์เซอร์สำหรับพื้นที่ฝึกฝนของโจรอวกาศ ซึ่งฉันเล่นในบทบาทยานอวกาศที่พยายามหลบหลีกศัตรูและรวบรวมเศษพลังงาน ฉันคิดว่านี่คือการทดสอบที่ดีเพราะใช้องค์ประกอบหลากหลายของอินเตอร์เฟซฟร้อนต์เอนด์ ลองดูกันว่ามันเป็นอย่างไร มาเข้าสู่พื้นที่จากที่นี่ ดูน่าดีมากครับ ลูกบอลตรงกลาง ตามที่คุณเห็น ดูสวยงามมาก อืม ยานของฉันดูน่าดีมากครับ ศัตรูเองก็ดูเป็นสามมิติขนาดใหญ่ ขณะที่ฉันรวบรวม คุณสามารถเห็นนี่ได้ ฉันได้รับบาดเจ็บบ้าง โอ๊ะ ไม่ ฉันแพ้ไปแล้ว นี่คือเกมที่ฉันสร้างขึ้นสำหรับโมเดลหลายตัวล่าสุด คุณสามารถเห็นการเปรียบเทียบที่นี่กับโมเดลหลายตัวที่แตกต่างกัน และตามที่คุณคาดหวัง โมเดลที่เราจะพูดถึงวันนี้คือ GLM 5.3 สัปดาห์ที่แล้ว ห้องปฏิบัติการ AI จีนที่มีชื่อเสียงในเรื่องโมเดลโอเพ่นเซิร์ส โดยเฉพาะอย่างยิ่งชุด GLM ได้เปิดตัวโมเดล GLM 5.3 แล้ว นี่คือโมเดลล่าสุดของพวกเขา โมเดลก่อนหน้า GLM 5.2 มีอิทธิพลมากในฐานะโมเดลโอเพ่นเซิร์สที่มีความเข้าถึงใกล้เคียงกับระดับของโมเดลชั้นนำ ดังนั้น โมเดลนี้จึงถูกคาดหวังอย่างมาก GLM 5.3 มีอยู่มาแล้วสองสามวันที่นี่ แท้จริงแล้วได้เปิดตัวสัปดาห์ที่แล้ว แต่ไม่สามารถเข้าถึงผ่าน API ได้สองสามวัน คุณต้องใช้แผนสมาชิกพิเศษของพวกเขาหรือตัวเลือกอื่นๆ แต่ตอนนี้พวกเขาได้เปิดตัว API แล้ว ดังนั้นเราจึงสามารถใช้มันผ่าน Open Router หรือบริการคลาวด์อื่นๆ นี่จะมองแรกของฉันเกี่ยวกับ GLM 5.3 เราจะทดสอบมันสองสามอย่าง เพื่อดูว่าประสิทธิภาพของมันจะเป็นอย่างไร และดูว่ามันจะใช้ต้นทุนเราในสิ่งเหล่านี้เท่าไหร่ มาเริ่มกันดีกว่า และถ้าคุณกำลังมองหาพัฒนาเอเจนต์ของคุณ ลองเช็คโปรเจกต์ Agent Wikis ของฉัน ที่นี่ คุณสามารถเข้าถึงกฎความรู้ที่ฉันใช้ทุกวันในการวิจัยวิดีโอเหล่านี้และสร้างโปรเจกต์ หัวข้อรวมถึงเอเจนต์ Hermes และ hyperframes และเครื่องมือ AI สแตนด์อโลน และอื่นๆ อีกมากมาย ทุก wiki มาตรฐานนี้ฟรี แต่ถ้าคุณสมัครสมาชิก Agent Wikis Pro คุณจะได้รับการเข้าถึง wiki ขั้นสูง พร้อมกับทักษะที่กำหนดเองที่ฉันพัฒนากับลูกค้าของฉันในช่วงหลายเดือนของการทำงานร่วมกัน ราคา Pro คือ 9.99 ดอลลาร์ต่อเดือน และถ้าคุณลงทะเบียนตอนนี้ คุณจะได้รับราคาตลอดชีพ ฉันกำลังทำงานอยู่กับโปรไฟล์ที่กำหนดเอสำหรับเอเจนต์และเทมเพลตเวิร์กโฟลว์อัตโนมัติดังนั้น ในท้ายที่สุดของวิดีโอนี้ คุณจะเห็นว่าฉันได้ทำอะไรบ้างแล้ว เปลี่ยนไปใช้แพลตฟอร์ม Open Router และทดลองใช้ GLM 5.3 มาทดสอบการทำงาน ในการทดสอบเบื้องต้น มันทำงานได้ดีมาก และฉันสามารถสร้างเกมที่สวยงามได้ ดังนั้น มันน่าดีขึ้นมาก นี่คือที่มาของ GLM 5.3 และนี่คือพวกเขาทำให้มันแตกต่างจาก 5.2 ที่สำคัญ และตอนนี้ เรากลับมาที่วิดีโอ GLM 5.3 นะครับ สิ่งแรกที่เราต้องรู้ก็คือ มันยังคงใช้ฐานข้อมูลเดียวกันของการผสมผสานผู้เชี่ยวชาญ 743 พันล้านพารามิเตอร์เหมือนเดิมใน 5.2 ดังนั้น โมเดลพื้นฐานยังคงเหมือนเดิม ทุกอย่างที่เปลี่ยนแปลง และทุกอย่างที่ได้รับประโยชน์นั้นมาจากการฝึกหลังการเรียนรู้ และนี่คือสิ่งที่น่าสนใจเอง บริษัท Zhipu AI กำลังพัฒนาการกระโดดครั้งใหญ่ในการฝึกหลังการเรียนรู้ และโดยเฉพาะอย่างยิ่งพวกเขาใช้การฝึกหลังการเรียนรู้ในระดับสภาพแวดล้อม และผลลัพธ์คือพวกเขาสามารถทำงานกับงานโปรแกรมที่ยากขึ้น โดยเฉพาะอย่างยิ่งงานที่ใช้เวลานาน และนี่คือวิธีการทั้งหมด ใช่ไหมครับ ดังนั้น มันยังคงเป็นฐานเดียวกัน แต่ตอนนี้มันทำงานในสภาพแวดล้อมที่หลากหลายขึ้น และประเภทของสภาพแวดล้อมที่หลากหลายขึ้น และงานที่ยาวนานขึ้น ดังนั้นฉันจึงสนใจที่จะเห็นการประเมินและตรวจสอบว่าวิธีการนี้มีประสิทธิภาพเพียงไหน

หากคุณจำได้ "การต่อสู้กับจักรวาล AI" ที่ฉันทำ โมเดล GLM 5.2 ในเวลานั้นถูกกำจัดออกไปในรอบแรกเพราะในงานออกแบบอินเตอร์เฟซ มันผลิตอะไรที่เป็นปัญหาบางอย่าง ดังนั้นฉันจึงสงสัยว่าโมเดลล่าสุดนี้สามารถวิเคราะห์ได้ว่ามันเป็นปัญหาและแก้ไขได้หรือเปล่า และเราจะทำงานนั้นเป็นจริงในภายหลัง

และตอนนี้ เราไปยังตัวชี้วัดที่ทุกคนชอบเห็น คุณสามารถสังเกตเห็นว่าแม้ว่ามันจะเป็นเพียงการฝึกหลังการเรียนรู้ แต่ก็มีการเพิ่มขึ้นอย่างใหญ่หลวง และเฉพาะในตัวชี้วัดโปรแกรมคอมพิวเตอร์ คุณจะเห็นการกระโดดของการปรับปรุง 23 และ 20 และ 23 หากเรามองที่นี่ไปยังการเปรียบเทียบกับโมเดลอื่นๆ GLM 5.3 คือโมเดลสีน้ำเงินที่นี่ คุณสามารถเห็นว่ามีการปรับปรุงอย่างยิ่งใหญ่เมื่อเทียบกับ 5.2 และโดยยึดตามมาตรฐานบางอย่างมันเทียบเท่ากับ Kimiko 3 และแม้กระทั่ง GPT 5.6 Soul พร้อมกับ Fable ซึ่งน่าทึ่งจริงๆ คุณสามารถเห็นว่าบางอย่างพอดีกับมันเลย ถ้าเราดูที่การทดสอบโปรแกรมคอมพิวเตอร์ Terminal Bench 2.1 ที่นี่ คุณสามารถเห็นว่า Fable ได้คะแนน 88 และ GPT Soul ได้ 88.8 และ GLM 5.3 ได้ 88.2 ใช่ครับ นี่คือมาตรฐานมาตรฐาน มันน่าทึ่งจริงๆ แต่ฉันคิดว่าเรารู้ว่าเราต้องทดสอบโมเดลจริงๆ ก่อนที่เราจะสามารถพึงพอใจกับผลลัพธ์ได้อย่างสมบูรณ์ แต่หนึ่งในข้อดีใหญ่ๆ คือมันได้ผลลัพธ์เดียวกับโมเดลที่พัฒนามากขึ้น แต่ด้วยจำนวนโทเคนที่น้อยกว่ามาก ซึ่งสำคัญมาก มีการเพิ่มขึ้นของประสิทธิภาพในการทำงาน การฝึกหลังการเรียนรู้สอนโมเดลเกี่ยวกับเส้นทางการอนุมานที่สั้นลง ดังนั้นด้วยความพยายามสูงสุด และในการทดสอบโปรแกรมของ DAI โมเดลนี้ได้พัฒนาจาก 23.4% เป็น 34.5% ในขณะที่โทเคนเอาต์พุตเฉลี่ยลดลงจาก 96,000 เหลือเพียง 75,000 เท่านั้น ดังนั้น ได้ผลลัพธ์ที่ดีกว่าด้วยจำนวนโทเคนที่น้อยกว่า ซึ่งหมายความว่าต้นทุนที่น้อยกว่าแน่นอน และคุณสามารถเห็นการเปรียบเทียบที่นี่กับ Claude Opus 4.8 มันได้ผลลัพธ์ที่ดีกว่าด้วยน้อยกว่าครึ่งของจำนวนโทเคนเอาต์พุต

## บทสรุป

GLM-5.3 เป็นการอัพเกรดที่สำคัญจาก GLM-5.2 ด้วยการฝึกหลังการเรียนรู้ในสภาพแวดล้อมที่หลากหลาย ทำให้มีประสิทธิภาพดีขึ้นในงานโปรแกรมคอมพิวเตอร์ ได้คะแนน 88.2 ใน Terminal Bench 2.1 แทบจะเทียบเท่ากับโมเดลชั้นนำ และใช้โทเคนเออกแบบลดลง 30% ทำให้คุ้มค่าทางเศรษฐศาสตร์มากขึ้น

03

หมายเหตุการแปล

ความโปร่งใสเกี่ยวกับความไม่แน่นอนในต้นฉบับ

  • ## สถานการณ์ที่ไม่ชัดเจน
  • ไม่พบเซ็มเมนต์ที่ฟังไม่ชัดเจนในคำบรรยายต้นฉบับที่เป็นข้อความ
04

อภิธานศัพท์เทคนิค

คำศัพท์และชื่อผลิตภัณฑ์ที่คงรูปภาษาอังกฤษ

ศัพท์คำแปล / คำอธิบาย
GLM-5.3โมเดล AI ขนาดใหญ่จาก Zhipu AI ในเดือนพฤษภาคม 2024
Post-trainingการฝึกหลังการเรียนรู้ เทคนิคการปรับปรุงโมเดลหลังจากฝึกเบสไลน์
Terminal Bench 2.1การทดสอบมาตรฐานสำหรับโมเดล AI ด้านการเขียนโปรแกรมคอมพิวเตอร์
Exploit Benchการทดสอบความปลอดภัยของระบบเชิงลึกสำหรับวินิจฉัยจุดอ่อนไซเบอร์
Open Routerบริการเชื่อมต่อ API สำหรับเรียกใช้โมเดล AI หลายตัว
Claude Opus 4.8โมเดล AI ของ Anthropic ในรุ่นชั้นนำ
Fableโมเดล AI คู่แข่งที่มีประสิทธิภาพสูง
Kimiko 3โมเดล AI อีกรุ่นหนึ่งที่ได้คะแนนสูงในการทดสอบ
GPT-5.6 Soulรุ่นขั้นสูงของโมเดล GPT
DAIโปรแกรมการทดสอบ AI สำหรับประเมินประสิทธิภาพ
APIอินเตอร์เฟซการเรียกใช้งานแอพลิเคชัน
Tokensหน่วยย่อยของข้อมูลที่ AI ใช้ในการประมวลผล
Slimeเฟรมเวิร์กโอเพ่นซอร์สสำหรับการฝึกหลังการเรียนรู้
Royal Rumbleชื่อทดสอบสร้างเกมที่มีโมเดลหลายตัวแข่งขันกัน
743B parametersจำนวนพารามิเตอร์ของโมเดล GLM (743 พันล้าน)
Cost efficiencyประสิทธิภาพในการใช้ต้นทุน ค่าใช้จ่ายต่อผลลัพธ์
Cybersecurityความปลอดภัยด้านไซเบอร์ การป้องกันการโจมตีดิจิทัล
Prompt engineeringศาสตร์การออกแบบคำสั่งเพื่อให้ AI ทำงานตามต้องการ
Frontendส่วนติดต่อผู้ใช้ของเว็บแอพพลิเคชัน
05

ซับไตเติ้ลภาษาไทย

ดาวน์โหลดหรือดูซับทั้งหมด

1
00:00:00,000 --> 00:00:15,743
แน่นอนครับ มีโมเดลใหม่สำหรับทดสอบ แนวทางนี้สำหรับสร้างเกมเล็กๆ

2
00:00:15,743 --> 00:00:26,407
ในเบราว์เซอร์สำหรับพื้นที่ฝึกฝนของโจรอวกาศ

3
00:00:26,407 --> 00:00:43,165
ซึ่งฉันเล่นในบทบาทยานอวกาศที่พยายามหลบหลีกศัตรูและรวบรวมเศษพลังงาน

4
00:00:43,165 --> 00:01:03,479
ฉันคิดว่านี่คือการทดสอบที่ดีเพราะใช้องค์ประกอบหลากหลายของอินเตอร์เฟซฟร้อนต์เอนด์
thai-subtitles.srt
SubRip — ใช้กับเครื่องเล่นวิดีโอส่วนใหญ่
↓ ดาวน์โหลด
thai-subtitles.vtt
WebVTT — ใช้กับเว็บ / YouTube
↓ ดาวน์โหลด
เปิดดูซับไตเติ้ลทั้งหมด (109 segments)
1
00:00:00,000 --> 00:00:15,743
แน่นอนครับ มีโมเดลใหม่สำหรับทดสอบ แนวทางนี้สำหรับสร้างเกมเล็กๆ

2
00:00:15,743 --> 00:00:26,407
ในเบราว์เซอร์สำหรับพื้นที่ฝึกฝนของโจรอวกาศ

3
00:00:26,407 --> 00:00:43,165
ซึ่งฉันเล่นในบทบาทยานอวกาศที่พยายามหลบหลีกศัตรูและรวบรวมเศษพลังงาน

4
00:00:43,165 --> 00:01:03,479
ฉันคิดว่านี่คือการทดสอบที่ดีเพราะใช้องค์ประกอบหลากหลายของอินเตอร์เฟซฟร้อนต์เอนด์

5
00:01:03,479 --> 00:01:09,826
ลองดูกันว่ามันเป็นอย่างไร

6
00:01:09,826 --> 00:01:19,983
มาเข้าสู่พื้นที่จากที่นี่ ดูน่าดีมากครับ

7
00:01:19,983 --> 00:01:30,901
ลูกบอลตรงกลาง ตามที่คุณเห็น ดูสวยงามมาก อืม

8
00:01:30,901 --> 00:01:36,741
ยานของฉันดูน่าดีมากครับ

9
00:01:36,741 --> 00:01:44,613
ศัตรูเองก็ดูเป็นสามมิติขนาดใหญ่

10
00:01:44,613 --> 00:01:53,500
ขณะที่ฉันรวบรวม คุณสามารถเห็นนี่ได้

11
00:01:53,500 --> 00:02:04,164
ฉันได้รับบาดเจ็บบ้าง โอ๊ะ ไม่ ฉันแพ้ไปแล้ว

12
00:02:04,164 --> 00:02:16,352
นี่คือเกมที่ฉันสร้างขึ้นสำหรับโมเดลหลายตัวล่าสุด

13
00:02:16,352 --> 00:02:31,841
คุณสามารถเห็นการเปรียบเทียบที่นี่กับโมเดลหลายตัวที่แตกต่างกัน

14
00:02:31,841 --> 00:02:36,665
และตามที่คุณคาดหวัง

15
00:02:36,665 --> 00:02:45,806
โมเดลที่เราจะพูดถึงวันนี้คือ GLM 5.3

16
00:02:45,806 --> 00:02:53,931
สัปดาห์ที่แล้ว ห้องปฏิบัติการ AI

17
00:02:53,931 --> 00:03:04,596
จีนที่มีชื่อเสียงในเรื่องโมเดลโอเพ่นเซิร์ส

18
00:03:04,596 --> 00:03:15,768
โดยเฉพาะอย่างยิ่งชุด GLM ได้เปิดตัวโมเดล GLM

19
00:03:15,768 --> 00:03:24,655
5.3 แล้ว นี่คือโมเดลล่าสุดของพวกเขา

20
00:03:24,655 --> 00:03:29,987
โมเดลก่อนหน้า GLM 5.2

21
00:03:29,987 --> 00:03:50,808
มีอิทธิพลมากในฐานะโมเดลโอเพ่นเซิร์สที่มีความเข้าถึงใกล้เคียงกับระดับของโมเดลชั้นนำ

22
00:03:50,808 --> 00:04:02,234
ดังนั้น โมเดลนี้จึงถูกคาดหวังอย่างมาก GLM 5.3

23
00:04:02,234 --> 00:04:09,090
มีอยู่มาแล้วสองสามวันที่นี่

24
00:04:09,090 --> 00:04:17,977
แท้จริงแล้วได้เปิดตัวสัปดาห์ที่แล้ว

25
00:04:17,977 --> 00:04:28,133
แต่ไม่สามารถเข้าถึงผ่าน API ได้สองสามวัน

26
00:04:28,133 --> 00:04:40,829
คุณต้องใช้แผนสมาชิกพิเศษของพวกเขาหรือตัวเลือกอื่นๆ

27
00:04:40,829 --> 00:04:49,462
แต่ตอนนี้พวกเขาได้เปิดตัว API แล้ว

28
00:04:49,462 --> 00:04:59,873
ดังนั้นเราจึงสามารถใช้มันผ่าน Open Router

29
00:04:59,873 --> 00:05:05,205
หรือบริการคลาวด์อื่นๆ

30
00:05:05,205 --> 00:05:13,838
นี่จะมองแรกของฉันเกี่ยวกับ GLM 5.3

31
00:05:13,838 --> 00:05:19,932
เราจะทดสอบมันสองสามอย่าง

32
00:05:19,932 --> 00:05:30,088
เพื่อดูว่าประสิทธิภาพของมันจะเป็นอย่างไร

33
00:05:30,088 --> 00:05:42,022
และดูว่ามันจะใช้ต้นทุนเราในสิ่งเหล่านี้เท่าไหร่

34
00:05:42,022 --> 00:05:46,085
มาเริ่มกันดีกว่า

35
00:05:46,085 --> 00:05:55,480
และถ้าคุณกำลังมองหาพัฒนาเอเจนต์ของคุณ

36
00:05:55,480 --> 00:06:05,890
ลองเช็คโปรเจกต์ Agent Wikis ของฉัน ที่นี่

37
00:06:05,890 --> 00:06:26,203
คุณสามารถเข้าถึงกฎความรู้ที่ฉันใช้ทุกวันในการวิจัยวิดีโอเหล่านี้และสร้างโปรเจกต์

38
00:06:26,203 --> 00:06:36,868
หัวข้อรวมถึงเอเจนต์ Hermes และ hyperframes

39
00:06:36,868 --> 00:06:48,548
และเครื่องมือ AI สแตนด์อโลน และอื่นๆ อีกมากมาย

40
00:06:48,548 --> 00:06:59,466
ทุก wiki มาตรฐานนี้ฟรี แต่ถ้าคุณสมัครสมาชิก

41
00:06:59,466 --> 00:07:10,130
Agent Wikis Pro คุณจะได้รับการเข้าถึง wiki

42
00:07:10,130 --> 00:07:11,908
ขั้นสูง

43
00:07:11,908 --> 00:07:32,983
พร้อมกับทักษะที่กำหนดเองที่ฉันพัฒนากับลูกค้าของฉันในช่วงหลายเดือนของการทำงานร่วมกัน

44
00:07:32,983 --> 00:07:41,362
ราคา Pro คือ 9.99 ดอลลาร์ต่อเดือน

45
00:07:41,362 --> 00:07:47,456
และถ้าคุณลงทะเบียนตอนนี้

46
00:07:47,456 --> 00:07:53,042
คุณจะได้รับราคาตลอดชีพ

47
00:07:53,042 --> 00:08:15,133
ฉันกำลังทำงานอยู่กับโปรไฟล์ที่กำหนดเอสำหรับเอเจนต์และเทมเพลตเวิร์กโฟลว์อัตโนมัติดังนั้น

48
00:08:15,133 --> 00:08:24,781
ในทันทีที่เผยแพร่ ราคา Pro จะเพิ่มขึ้น

49
00:08:24,781 --> 00:08:35,700
ดังนั้นให้คิดในการลงทะเบียนวันนี้บนเว็บไซต์

50
00:08:35,700 --> 00:08:39,254
agentwikis.com

51
00:08:39,254 --> 00:08:50,427
ขอบคุณทุกคนสำหรับการสนับสนุนของคุณ และตอนนี้

52
00:08:50,427 --> 00:08:58,806
เรากลับมาที่วิดีโอ GLM 5.3 นะครับ

53
00:08:58,806 --> 00:09:05,154
สิ่งแรกที่เราต้องรู้ก็คือ

54
00:09:05,154 --> 00:09:18,611
มันยังคงใช้ฐานข้อมูลเดียวกันของการผสมผสานผู้เชี่ยวชาญ

55
00:09:18,611 --> 00:09:30,291
743 พันล้านพารามิเตอร์เหมือนเดิมใน 5.2 ดังนั้น

56
00:09:30,291 --> 00:09:37,147
โมเดลพื้นฐานยังคงเหมือนเดิม

57
00:09:37,147 --> 00:09:42,733
ทุกอย่างที่เปลี่ยนแปลง

58
00:09:42,733 --> 00:09:57,460
และทุกอย่างที่ได้รับประโยชน์นั้นมาจากการฝึกหลังการเรียนรู้

59
00:09:57,460 --> 00:10:08,124
และนี่คือสิ่งที่น่าสนใจเอง บริษัท Zhipu AI

60
00:10:08,124 --> 00:10:21,074
กำลังพัฒนาการกระโดดครั้งใหญ่ในการฝึกหลังการเรียนรู้

61
00:10:21,074 --> 00:10:38,340
และโดยเฉพาะอย่างยิ่งพวกเขาใช้การฝึกหลังการเรียนรู้ในระดับสภาพแวดล้อม

62
00:10:38,340 --> 00:10:51,798
และผลลัพธ์คือพวกเขาสามารถทำงานกับงานโปรแกรมที่ยากขึ้น

63
00:10:51,798 --> 00:11:00,177
โดยเฉพาะอย่างยิ่งงานที่ใช้เวลานาน

64
00:11:00,177 --> 00:11:10,841
และนี่คือวิธีการทั้งหมด ใช่ไหมครับ ดังนั้น

65
00:11:10,841 --> 00:11:16,681
มันยังคงเป็นฐานเดียวกัน

66
00:11:16,681 --> 00:11:28,107
แต่ตอนนี้มันทำงานในสภาพแวดล้อมที่หลากหลายขึ้น

67
00:11:28,107 --> 00:11:37,756
และประเภทของสภาพแวดล้อมที่หลากหลายขึ้น

68
00:11:37,756 --> 00:11:42,580
และงานที่ยาวนานขึ้น

69
00:11:42,580 --> 00:12:02,893
ดังนั้นฉันจึงสนใจที่จะเห็นการประเมินและตรวจสอบว่าวิธีการนี้มีประสิทธิภาพเพียงไหน

70
00:12:02,893 --> 00:12:14,320
หากคุณจำได้ "การต่อสู้กับจักรวาล AI" ที่ฉันทำ

71
00:12:14,320 --> 00:12:17,620
โมเดล GLM 5.2

72
00:12:17,620 --> 00:12:32,347
ในเวลานั้นถูกกำจัดออกไปในรอบแรกเพราะในงานออกแบบอินเตอร์เฟซ

73
00:12:32,347 --> 00:12:40,219
มันผลิตอะไรที่เป็นปัญหาบางอย่าง

74
00:12:40,219 --> 00:13:02,563
ดังนั้นฉันจึงสงสัยว่าโมเดลล่าสุดนี้สามารถวิเคราะห์ได้ว่ามันเป็นปัญหาและแก้ไขได้หรือเปล่า

75
00:13:02,563 --> 00:13:13,735
และเราจะทำงานนั้นเป็นจริงในภายหลัง และตอนนี้

76
00:13:13,735 --> 00:13:21,861
เราไปยังตัวชี้วัดที่ทุกคนชอบเห็น

77
00:13:21,861 --> 00:13:37,857
คุณสามารถสังเกตเห็นว่าแม้ว่ามันจะเป็นเพียงการฝึกหลังการเรียนรู้

78
00:13:37,857 --> 00:13:45,983
แต่ก็มีการเพิ่มขึ้นอย่างใหญ่หลวง

79
00:13:45,983 --> 00:13:55,377
และเฉพาะในตัวชี้วัดโปรแกรมคอมพิวเตอร์

80
00:13:55,377 --> 00:14:07,057
คุณจะเห็นการกระโดดของการปรับปรุง 23 และ 20 และ

81
00:14:07,057 --> 00:14:08,157
23

82
00:14:08,157 --> 00:14:20,091
หากเรามองที่นี่ไปยังการเปรียบเทียบกับโมเดลอื่นๆ

83
00:14:20,091 --> 00:14:27,962
GLM 5.3 คือโมเดลสีน้ำเงินที่นี่

84
00:14:27,962 --> 00:14:41,927
คุณสามารถเห็นว่ามีการปรับปรุงอย่างยิ่งใหญ่เมื่อเทียบกับ

85
00:14:41,927 --> 00:14:53,608
5.2 และโดยยึดตามมาตรฐานบางอย่างมันเทียบเท่ากับ

86
00:14:53,608 --> 00:15:04,780
Kimiko 3 และแม้กระทั่ง GPT 5.6 Soul พร้อมกับ

87
00:15:04,780 --> 00:15:10,366
Fable ซึ่งน่าทึ่งจริงๆ

88
00:15:10,366 --> 00:15:19,761
คุณสามารถเห็นว่าบางอย่างพอดีกับมันเลย

89
00:15:19,761 --> 00:15:31,441
ถ้าเราดูที่การทดสอบโปรแกรมคอมพิวเตอร์ Terminal

90
00:15:31,441 --> 00:15:41,343
Bench 2.1 ที่นี่ คุณสามารถเห็นว่า Fable

91
00:15:41,343 --> 00:15:52,769
ได้คะแนน 88 และ GPT Soul ได้ 88.8 และ GLM 5.3

92
00:15:52,769 --> 00:16:02,164
ได้ 88.2 ใช่ครับ นี่คือมาตรฐานมาตรฐาน

93
00:16:02,164 --> 00:16:05,973
มันน่าทึ่งจริงๆ

94
00:16:05,973 --> 00:16:16,891
แต่ฉันคิดว่าเรารู้ว่าเราต้องทดสอบโมเดลจริงๆ

95
00:16:16,891 --> 00:16:34,919
ก่อนที่เราจะสามารถพึงพอใจกับผลลัพธ์ได้อย่างสมบูรณ์ แต่หนึ่งในข้อดีใหญ่ๆ

96
00:16:34,919 --> 00:16:46,091
คือมันได้ผลลัพธ์เดียวกับโมเดลที่พัฒนามากขึ้น

97
00:16:46,091 --> 00:16:57,264
แต่ด้วยจำนวนโทเคนที่น้อยกว่ามาก ซึ่งสำคัญมาก

98
00:16:57,264 --> 00:17:06,912
มีการเพิ่มขึ้นของประสิทธิภาพในการทำงาน

99
00:17:06,912 --> 00:17:22,909
การฝึกหลังการเรียนรู้สอนโมเดลเกี่ยวกับเส้นทางการอนุมานที่สั้นลง

100
00:17:22,909 --> 00:17:29,765
ดังนั้นด้วยความพยายามสูงสุด

101
00:17:29,765 --> 00:17:36,620
และในการทดสอบโปรแกรมของ DAI

102
00:17:36,620 --> 00:17:45,761
โมเดลนี้ได้พัฒนาจาก 23.4% เป็น 34.5%

103
00:17:45,761 --> 00:17:56,172
ในขณะที่โทเคนเอาต์พุตเฉลี่ยลดลงจาก 96,000

104
00:17:56,172 --> 00:18:04,805
เหลือเพียง 75,000 เท่านั้น ดังนั้น

105
00:18:04,805 --> 00:18:15,977
ได้ผลลัพธ์ที่ดีกว่าด้วยจำนวนโทเคนที่น้อยกว่า

106
00:18:15,977 --> 00:18:25,626
ซึ่งหมายความว่าต้นทุนที่น้อยกว่าแน่นอน

107
00:18:25,626 --> 00:18:37,306
และคุณสามารถเห็นการเปรียบเทียบที่นี่กับ Claude

108
00:18:37,306 --> 00:18:39,337
Opus 4.8

109
00:18:39,337 --> 00:18:54,572
มันได้ผลลัพธ์ที่ดีกว่าด้วยน้อยกว่าครึ่งของจำนวนโทเคนเอาต์พุต