▶SUBTHAIแปลไทย · ซับ · พากย์⚙
บทความแปลภาษาไทย · YouTube

EXL3 Explained: Smaller Local Models, Less Quality Loss

0:000:00
เล่นเสียงต้นฉบับของวิดีโอ พร้อมแสดงซับไทยซิงก์ตามเวลา
กำลังโหลดวิดีโอ…
01

สรุปย่อ

ประเด็นสำคัญจากวิดีโอ

- **ช่อง:** Tonbi's AI Garage · **ความยาว:** ~20 นาที · **ลิงก์:** https://www.youtube.com/watch?v=ROHgM8uV_8M

# สรุป: EXL3 Explained: Smaller Local Models, Less Quality Loss

- **ช่อง:** Tonbi's AI Garage · **ความยาว:** ~20 นาที · **ลิงก์:** https://www.youtube.com/watch?v=ROHgM8uV_8M

## ประเด็นหลัก

- EXL3 เป็นเทคนิคควอนไทซ์โมเดล AI ที่กำลังเป็นที่ถกเถียงกันอย่างรุนแรงในชุมชน AI สถานที่
- การควอนไทซ์เป็นวิธีการลดขนาดโมเดลเพื่อให้สามารถทำงานบนฮาร์ดแวร์ที่มีหน่วยความจำน้อยลง
- EXL3 แตกต่างจากเทคนิคควอนไทซ์อื่นๆ โดยใช้แนวคิดใหม่ในการแบ่งข้อมูลเป็นส่วนๆ และปรับแต่งรายละเอียดแต่ละส่วน
- จะมีการทดลองเปรียบเทียบระหว่าง EXL3 กับ NV FP4 บนโมเดล Qwen 3.8 27B
- การทดลองจะทำบน DJ X Spark เพื่อตรวจสอบขนาดโมเดล คุณภาพ และการใช้งาน memory

## ความเห็นสรุป

EXL3 มีแนวคิดการทำงานที่น่าสนใจโดยพยายามรักษาคุณภาพของโมเดลไว้ในขณะที่ลดขนาดลง ถ้าผลลัพธ์จากการทดลองยืนยันว่า EXL3 สามารถลดขนาดโมเดลได้โดยไม่สูญเสียคุณภาพมากนัก นี่อาจเป็นทางเลือกที่ดีสำหรับผู้ที่ใช้โมเดล AI บนเครื่องส่วนตัว โดยเฉพาะในกรณีที่มีข้อจำกัดด้านหน่วยความจำ
02

คำแปลเต็ม

แปลตามบทสนทนาต้นฉบับ ปรับเป็นภาษาไทยธรรมชาติ

เห็นได้ชัดว่าฉันกำลังทำงานใน Hermes Agent พูดคุยกับโมเดลสถานที่หนึ่งของฉัน และนี่คือโมเดล Qwen 3.8 27B และคุณจะเห็นว่าฉันกำลังถามคำถามเกี่ยวกับการ Quantization ฉันต้องทำการวิจัยเพิ่มเติมที่นี่ ฉันสามารถถามเกี่ยวกับว่ารูปแบบนี้แตกต่างจากอื่นๆ อย่างไร และโมเดลนี้มีความสำคัญเพราะฉันไม่ได้ดาวน์โหลดมันจาก Hugging Face โดยตรง นี่คือโมเดลที่ฉัน Quantized เอง ดังนั้นฉันจึงสร้าง recipe นี้ขึ้นมา และนี่คือเทคนิค Quantization ที่เรียกว่า EXL3

น่าแปลกใจที่หลายคนยังไม่รู้ว่า ในปัจจุบันมีสงครามเกิดขึ้นในชุมชน AI สถานที่ นี่คือการถกเถียงที่รุนแรงเกี่ยวกับว่าเทคนิค Quantization ใดที่ดีที่สุดสำหรับโมเดลสถานที่ หากคุณไม่รู้ การ Quantization คือวิธีการลดขนาดของโมเดลเพื่อให้สามารถใช้โมเดลที่ใหญ่กว่าให้ทำงานบนฮาร์ดแวร์ที่มีหน่วยความจำน้อยลง และมันเป็นวิธีการที่สำคัญมากสำหรับให้ LLM ขนาดใหญ่เหล่านี้สามารถทำงานบนฮาร์ดแวร์รายบุคคลได้จริงๆ ดังนั้นจึงมีเทคนิค Quantization หลายอันที่ได้รับความนิยมมาก ฉันได้แนะนำสองสามอันไปแล้ว NBFB4 ฉันได้ทำวิดีโอเกี่ยวกับมันเมื่อสัปดาห์ที่แล้ว แต่การถกเถียงปัจจุบันคือเกี่ยวกับตัวนี้ EXL3 ดังนั้นฉันจึงต้องการทำวิดีโออันหนึ่ง ซึ่งจะเป็นการแบ่งประเภทที่ไม่เกี่ยวข้องกับเทคนิคขั้นสูงหรืออะไรทั้งนั้น ฉันจะอธิบายแค่แนวคิดเบื้องต้นสำหรับใครก็ตาม แม้ว่าคุณจะไม่ใช่คนที่เกี่ยวข้องกับเทคโนโลยี คุณควรจะเข้าใจอย่างน้อยว่า EXL3 ทำอะไรเปรียบเทียบกับเทคนิค Quantization อื่นๆ ได้อย่างไร

จากนั้นเราจะมาทดลองจริงบบ DJ X Spark ของฉัน เราจะทำการ Quantize Qwen 3.8 27B คุณจะเห็นในวิดีโอก่อนหน้านี้ที่ฉันทำ NV FP4 version ดังนั้นตอนนี้เราจะทำเป็นเวอร์ชัน EXL นะ EXL3 version และเราจะมาดูว่าพวกเขาเปรียบเทียบกันอย่างไร เพื่อดูว่านี่จริงๆ แล้วเราจะได้โมเดลที่เล็กลงโดยยังคงรักษาคุณภาพและความฉลาดไว้ ดังนั้นเรามาเริ่มกันเลย

และถ้าคุณกำลังมองหาวิธี Level ตัว Agent ของคุณเอง ลองดูโปรเจ็กต์ Agent Wiki's ที่นี่ คุณจะได้เข้าถึง knowledge bases ที่ฉันใช้ทุกวันสำหรับการวิจัย...

เราจะมาเริ่มกับการทดลองบน DJ X Spark ที่ฉันมี โดยการทำ Quantization กับโมเดล Qwen 3.8 27B ที่เห็นในวิดีโอก่อนหน้านี้ฉันได้ทำเป็นรุ่น NV FP4 ดังนั้นในครั้งนี้เราจะทำเป็นรุ่น EXL3 และเราจะเปรียบเทียบกันเพื่อดูว่ารุ่นนี้จริงๆ แล้วสามารถทำให้โมเดลมีขนาดเล็กลงได้โดยยังคงรักษาคุณภาพและความฉลาดไว้ได้หรือไม่

04

อภิธานศัพท์เทคนิค

คำศัพท์และชื่อผลิตภัณฑ์ที่คงรูปภาษาอังกฤษ

ศัพท์คำแปล / คำอธิบาย
EXL3เทคนิคควอนไทซ์โมเดล AI ที่ใช้การแบ่งข้อมูลเป็นส่วนๆ และปรับแต่งรายละเอียดแต่ละส่วน
Quantizationการลดขนาดโมเดล AI เพื่อให้สามารถทำงานบนฮาร์ดแวร์ที่มีหน่วยความจำน้อยลง
Local Modelsโมเดล AI ที่ดาวน์โหลดและทำงานบนเครื่องผู้ใช้โดยตรง
Hugging Faceแพลตฟอร์มสำหรับแชร์และดาวน์โหลดโมเดล AI
Qwen 3.8 27Bโมเดล AI ขนาด 27 พันล้านพารามิเตอร์จาก Alibaba
DJ X Sparkฮาร์ดแวร์ที่ใช้สำหรับการทดลองควอนไทซ์
NV FP4เทคนิคควอนไทซ์อีกประเภทหนึ่งที่ใช้การลดทศนิยม 4 บิต
LLMLarge Language Model (โมเดลภาษาขนาดใหญ่)
Hermes Agentแพลตฟอร์มสำหรับสร้างและจัดการ AI Agent
Agent Wiki'sโปรเจ็กต์สำหรับจัดการ knowledge bases ของ AI Agent
05

ซับไตเติ้ลภาษาไทย

ดาวน์โหลดหรือดูซับทั้งหมด

1
00:00:00,000 --> 00:00:23,787
เห็นได้ชัดว่าฉันกำลังทำงานใน Hermes Agent

2
00:00:23,787 --> 00:00:42,353
พูดคุยกับโมเดลสถานที่หนึ่งของฉัน

3
00:00:42,353 --> 00:00:58,018
และนี่คือโมเดล Qwen 3.8 27B

4
00:00:58,018 --> 00:01:22,965
และคุณจะเห็นว่าฉันกำลังถามคำถามเกี่ยวกับการ
thai-subtitles.srt
SubRip — ใช้กับเครื่องเล่นวิดีโอส่วนใหญ่
↓ ดาวน์โหลด
thai-subtitles.vtt
WebVTT — ใช้กับเว็บ / YouTube
↓ ดาวน์โหลด
เปิดดูซับไตเติ้ลทั้งหมด (50 segments)
1
00:00:00,000 --> 00:00:23,787
เห็นได้ชัดว่าฉันกำลังทำงานใน Hermes Agent

2
00:00:23,787 --> 00:00:42,353
พูดคุยกับโมเดลสถานที่หนึ่งของฉัน

3
00:00:42,353 --> 00:00:58,018
และนี่คือโมเดล Qwen 3.8 27B

4
00:00:58,018 --> 00:01:22,965
และคุณจะเห็นว่าฉันกำลังถามคำถามเกี่ยวกับการ

5
00:01:22,965 --> 00:01:49,073
Quantization ฉันต้องทำการวิจัยเพิ่มเติมที่นี่

6
00:01:49,073 --> 00:02:16,922
ฉันสามารถถามเกี่ยวกับว่ารูปแบบนี้แตกต่างจากอื่นๆ

7
00:02:16,922 --> 00:02:20,983
อย่างไร

8
00:02:20,983 --> 00:02:50,572
และโมเดลนี้มีความสำคัญเพราะฉันไม่ได้ดาวน์โหลดมันจาก

9
00:02:50,572 --> 00:03:12,039
Hugging Face โดยตรง นี่คือโมเดลที่ฉัน

10
00:03:12,039 --> 00:03:34,666
Quantized เอง ดังนั้นฉันจึงสร้าง recipe

11
00:03:34,666 --> 00:03:56,712
นี้ขึ้นมา และนี่คือเทคนิค Quantization

12
00:03:56,712 --> 00:04:05,995
ที่เรียกว่า EXL3

13
00:04:05,995 --> 00:04:23,401
น่าแปลกใจที่หลายคนยังไม่รู้ว่า

14
00:04:23,401 --> 00:04:48,928
ในปัจจุบันมีสงครามเกิดขึ้นในชุมชน AI สถานที่

15
00:04:48,928 --> 00:05:13,876
นี่คือการถกเถียงที่รุนแรงเกี่ยวกับว่าเทคนิค

16
00:05:13,876 --> 00:05:39,404
Quantization ใดที่ดีที่สุดสำหรับโมเดลสถานที่

17
00:05:39,404 --> 00:05:56,229
หากคุณไม่รู้ การ Quantization

18
00:05:56,229 --> 00:06:53,086
คือวิธีการลดขนาดของโมเดลเพื่อให้สามารถใช้โมเดลที่ใหญ่กว่าให้ทำงานบนฮาร์ดแวร์ที่มีหน่วยความจำน้อยลง

19
00:06:53,086 --> 00:07:16,874
และมันเป็นวิธีการที่สำคัญมากสำหรับให้ LLM

20
00:07:16,874 --> 00:07:48,203
ขนาดใหญ่เหล่านี้สามารถทำงานบนฮาร์ดแวร์รายบุคคลได้จริงๆ

21
00:07:48,203 --> 00:08:06,189
ดังนั้นจึงมีเทคนิค Quantization

22
00:08:06,189 --> 00:08:21,854
หลายอันที่ได้รับความนิยมมาก

23
00:08:21,854 --> 00:08:40,419
ฉันได้แนะนำสองสามอันไปแล้ว NBFB4

24
00:08:40,419 --> 00:09:06,527
ฉันได้ทำวิดีโอเกี่ยวกับมันเมื่อสัปดาห์ที่แล้ว

25
00:09:06,527 --> 00:09:32,055
แต่การถกเถียงปัจจุบันคือเกี่ยวกับตัวนี้ EXL3

26
00:09:32,055 --> 00:09:52,941
ดังนั้นฉันจึงต้องการทำวิดีโออันหนึ่ง

27
00:09:52,941 --> 00:10:34,134
ซึ่งจะเป็นการแบ่งประเภทที่ไม่เกี่ยวข้องกับเทคนิคขั้นสูงหรืออะไรทั้งนั้น

28
00:10:34,134 --> 00:10:59,082
ฉันจะอธิบายแค่แนวคิดเบื้องต้นสำหรับใครก็ตาม

29
00:10:59,082 --> 00:11:24,609
แม้ว่าคุณจะไม่ใช่คนที่เกี่ยวข้องกับเทคโนโลยี

30
00:11:24,609 --> 00:11:42,595
คุณควรจะเข้าใจอย่างน้อยว่า EXL3

31
00:11:42,595 --> 00:12:08,703
ทำอะไรเปรียบเทียบกับเทคนิค Quantization อื่นๆ

32
00:12:08,703 --> 00:12:32,490
ได้อย่างไร จากนั้นเราจะมาทดลองจริงบบ DJ X

33
00:12:32,490 --> 00:12:58,598
Spark ของฉัน เราจะทำการ Quantize Qwen 3.8 27B

34
00:12:58,598 --> 00:13:23,546
คุณจะเห็นในวิดีโอก่อนหน้านี้ที่ฉันทำ NV FP4

35
00:13:23,546 --> 00:13:49,074
version ดังนั้นตอนนี้เราจะทำเป็นเวอร์ชัน EXL

36
00:13:49,074 --> 00:13:57,776
นะ EXL3 version

37
00:13:57,776 --> 00:14:22,144
และเราจะมาดูว่าพวกเขาเปรียบเทียบกันอย่างไร

38
00:14:22,144 --> 00:14:32,587
เพื่อดูว่านี่จริงๆ

39
00:14:32,587 --> 00:15:06,817
แล้วเราจะได้โมเดลที่เล็กลงโดยยังคงรักษาคุณภาพและความฉลาดไว้

40
00:15:06,817 --> 00:15:20,162
ดังนั้นเรามาเริ่มกันเลย

41
00:15:20,162 --> 00:15:42,788
และถ้าคุณกำลังมองหาวิธี Level ตัว Agent

42
00:15:42,788 --> 00:16:08,316
ของคุณเอง ลองดูโปรเจ็กต์ Agent Wiki's ที่นี่

43
00:16:08,316 --> 00:16:26,302
คุณจะได้เข้าถึง knowledge bases

44
00:16:26,302 --> 00:16:44,867
ที่ฉันใช้ทุกวันสำหรับการวิจัย...

45
00:16:44,867 --> 00:17:10,975
เราจะมาเริ่มกับการทดลองบน DJ X Spark ที่ฉันมี

46
00:17:10,975 --> 00:17:35,923
โดยการทำ Quantization กับโมเดล Qwen 3.8 27B

47
00:17:35,923 --> 00:18:02,031
ที่เห็นในวิดีโอก่อนหน้านี้ฉันได้ทำเป็นรุ่น NV

48
00:18:02,031 --> 00:18:25,818
FP4 ดังนั้นในครั้งนี้เราจะทำเป็นรุ่น EXL3

49
00:18:25,818 --> 00:18:51,346
และเราจะเปรียบเทียบกันเพื่อดูว่ารุ่นนี้จริงๆ

50
00:18:51,346 --> 00:19:36,600
แล้วสามารถทำให้โมเดลมีขนาดเล็กลงได้โดยยังคงรักษาคุณภาพและความฉลาดไว้ได้หรือไม่