EXL3 Explained: Smaller Local Models, Less Quality Loss
สรุปย่อ
ประเด็นสำคัญจากวิดีโอ
- **ช่อง:** Tonbi's AI Garage · **ความยาว:** ~20 นาที · **ลิงก์:** https://www.youtube.com/watch?v=ROHgM8uV_8M
# สรุป: EXL3 Explained: Smaller Local Models, Less Quality Loss - **ช่อง:** Tonbi's AI Garage · **ความยาว:** ~20 นาที · **ลิงก์:** https://www.youtube.com/watch?v=ROHgM8uV_8M ## ประเด็นหลัก - EXL3 เป็นเทคนิคควอนไทซ์โมเดล AI ที่กำลังเป็นที่ถกเถียงกันอย่างรุนแรงในชุมชน AI สถานที่ - การควอนไทซ์เป็นวิธีการลดขนาดโมเดลเพื่อให้สามารถทำงานบนฮาร์ดแวร์ที่มีหน่วยความจำน้อยลง - EXL3 แตกต่างจากเทคนิคควอนไทซ์อื่นๆ โดยใช้แนวคิดใหม่ในการแบ่งข้อมูลเป็นส่วนๆ และปรับแต่งรายละเอียดแต่ละส่วน - จะมีการทดลองเปรียบเทียบระหว่าง EXL3 กับ NV FP4 บนโมเดล Qwen 3.8 27B - การทดลองจะทำบน DJ X Spark เพื่อตรวจสอบขนาดโมเดล คุณภาพ และการใช้งาน memory ## ความเห็นสรุป EXL3 มีแนวคิดการทำงานที่น่าสนใจโดยพยายามรักษาคุณภาพของโมเดลไว้ในขณะที่ลดขนาดลง ถ้าผลลัพธ์จากการทดลองยืนยันว่า EXL3 สามารถลดขนาดโมเดลได้โดยไม่สูญเสียคุณภาพมากนัก นี่อาจเป็นทางเลือกที่ดีสำหรับผู้ที่ใช้โมเดล AI บนเครื่องส่วนตัว โดยเฉพาะในกรณีที่มีข้อจำกัดด้านหน่วยความจำ
คำแปลเต็ม
แปลตามบทสนทนาต้นฉบับ ปรับเป็นภาษาไทยธรรมชาติ
เห็นได้ชัดว่าฉันกำลังทำงานใน Hermes Agent พูดคุยกับโมเดลสถานที่หนึ่งของฉัน และนี่คือโมเดล Qwen 3.8 27B และคุณจะเห็นว่าฉันกำลังถามคำถามเกี่ยวกับการ Quantization ฉันต้องทำการวิจัยเพิ่มเติมที่นี่ ฉันสามารถถามเกี่ยวกับว่ารูปแบบนี้แตกต่างจากอื่นๆ อย่างไร และโมเดลนี้มีความสำคัญเพราะฉันไม่ได้ดาวน์โหลดมันจาก Hugging Face โดยตรง นี่คือโมเดลที่ฉัน Quantized เอง ดังนั้นฉันจึงสร้าง recipe นี้ขึ้นมา และนี่คือเทคนิค Quantization ที่เรียกว่า EXL3
น่าแปลกใจที่หลายคนยังไม่รู้ว่า ในปัจจุบันมีสงครามเกิดขึ้นในชุมชน AI สถานที่ นี่คือการถกเถียงที่รุนแรงเกี่ยวกับว่าเทคนิค Quantization ใดที่ดีที่สุดสำหรับโมเดลสถานที่ หากคุณไม่รู้ การ Quantization คือวิธีการลดขนาดของโมเดลเพื่อให้สามารถใช้โมเดลที่ใหญ่กว่าให้ทำงานบนฮาร์ดแวร์ที่มีหน่วยความจำน้อยลง และมันเป็นวิธีการที่สำคัญมากสำหรับให้ LLM ขนาดใหญ่เหล่านี้สามารถทำงานบนฮาร์ดแวร์รายบุคคลได้จริงๆ ดังนั้นจึงมีเทคนิค Quantization หลายอันที่ได้รับความนิยมมาก ฉันได้แนะนำสองสามอันไปแล้ว NBFB4 ฉันได้ทำวิดีโอเกี่ยวกับมันเมื่อสัปดาห์ที่แล้ว แต่การถกเถียงปัจจุบันคือเกี่ยวกับตัวนี้ EXL3 ดังนั้นฉันจึงต้องการทำวิดีโออันหนึ่ง ซึ่งจะเป็นการแบ่งประเภทที่ไม่เกี่ยวข้องกับเทคนิคขั้นสูงหรืออะไรทั้งนั้น ฉันจะอธิบายแค่แนวคิดเบื้องต้นสำหรับใครก็ตาม แม้ว่าคุณจะไม่ใช่คนที่เกี่ยวข้องกับเทคโนโลยี คุณควรจะเข้าใจอย่างน้อยว่า EXL3 ทำอะไรเปรียบเทียบกับเทคนิค Quantization อื่นๆ ได้อย่างไร
จากนั้นเราจะมาทดลองจริงบบ DJ X Spark ของฉัน เราจะทำการ Quantize Qwen 3.8 27B คุณจะเห็นในวิดีโอก่อนหน้านี้ที่ฉันทำ NV FP4 version ดังนั้นตอนนี้เราจะทำเป็นเวอร์ชัน EXL นะ EXL3 version และเราจะมาดูว่าพวกเขาเปรียบเทียบกันอย่างไร เพื่อดูว่านี่จริงๆ แล้วเราจะได้โมเดลที่เล็กลงโดยยังคงรักษาคุณภาพและความฉลาดไว้ ดังนั้นเรามาเริ่มกันเลย
และถ้าคุณกำลังมองหาวิธี Level ตัว Agent ของคุณเอง ลองดูโปรเจ็กต์ Agent Wiki's ที่นี่ คุณจะได้เข้าถึง knowledge bases ที่ฉันใช้ทุกวันสำหรับการวิจัย...
เราจะมาเริ่มกับการทดลองบน DJ X Spark ที่ฉันมี โดยการทำ Quantization กับโมเดล Qwen 3.8 27B ที่เห็นในวิดีโอก่อนหน้านี้ฉันได้ทำเป็นรุ่น NV FP4 ดังนั้นในครั้งนี้เราจะทำเป็นรุ่น EXL3 และเราจะเปรียบเทียบกันเพื่อดูว่ารุ่นนี้จริงๆ แล้วสามารถทำให้โมเดลมีขนาดเล็กลงได้โดยยังคงรักษาคุณภาพและความฉลาดไว้ได้หรือไม่
อภิธานศัพท์เทคนิค
คำศัพท์และชื่อผลิตภัณฑ์ที่คงรูปภาษาอังกฤษ
| ศัพท์ | คำแปล / คำอธิบาย |
|---|---|
| EXL3 | เทคนิคควอนไทซ์โมเดล AI ที่ใช้การแบ่งข้อมูลเป็นส่วนๆ และปรับแต่งรายละเอียดแต่ละส่วน |
| Quantization | การลดขนาดโมเดล AI เพื่อให้สามารถทำงานบนฮาร์ดแวร์ที่มีหน่วยความจำน้อยลง |
| Local Models | โมเดล AI ที่ดาวน์โหลดและทำงานบนเครื่องผู้ใช้โดยตรง |
| Hugging Face | แพลตฟอร์มสำหรับแชร์และดาวน์โหลดโมเดล AI |
| Qwen 3.8 27B | โมเดล AI ขนาด 27 พันล้านพารามิเตอร์จาก Alibaba |
| DJ X Spark | ฮาร์ดแวร์ที่ใช้สำหรับการทดลองควอนไทซ์ |
| NV FP4 | เทคนิคควอนไทซ์อีกประเภทหนึ่งที่ใช้การลดทศนิยม 4 บิต |
| LLM | Large Language Model (โมเดลภาษาขนาดใหญ่) |
| Hermes Agent | แพลตฟอร์มสำหรับสร้างและจัดการ AI Agent |
| Agent Wiki's | โปรเจ็กต์สำหรับจัดการ knowledge bases ของ AI Agent |
ซับไตเติ้ลภาษาไทย
ดาวน์โหลดหรือดูซับทั้งหมด
1 00:00:00,000 --> 00:00:23,787 เห็นได้ชัดว่าฉันกำลังทำงานใน Hermes Agent 2 00:00:23,787 --> 00:00:42,353 พูดคุยกับโมเดลสถานที่หนึ่งของฉัน 3 00:00:42,353 --> 00:00:58,018 และนี่คือโมเดล Qwen 3.8 27B 4 00:00:58,018 --> 00:01:22,965 และคุณจะเห็นว่าฉันกำลังถามคำถามเกี่ยวกับการ
เปิดดูซับไตเติ้ลทั้งหมด (50 segments)
1 00:00:00,000 --> 00:00:23,787 เห็นได้ชัดว่าฉันกำลังทำงานใน Hermes Agent 2 00:00:23,787 --> 00:00:42,353 พูดคุยกับโมเดลสถานที่หนึ่งของฉัน 3 00:00:42,353 --> 00:00:58,018 และนี่คือโมเดล Qwen 3.8 27B 4 00:00:58,018 --> 00:01:22,965 และคุณจะเห็นว่าฉันกำลังถามคำถามเกี่ยวกับการ 5 00:01:22,965 --> 00:01:49,073 Quantization ฉันต้องทำการวิจัยเพิ่มเติมที่นี่ 6 00:01:49,073 --> 00:02:16,922 ฉันสามารถถามเกี่ยวกับว่ารูปแบบนี้แตกต่างจากอื่นๆ 7 00:02:16,922 --> 00:02:20,983 อย่างไร 8 00:02:20,983 --> 00:02:50,572 และโมเดลนี้มีความสำคัญเพราะฉันไม่ได้ดาวน์โหลดมันจาก 9 00:02:50,572 --> 00:03:12,039 Hugging Face โดยตรง นี่คือโมเดลที่ฉัน 10 00:03:12,039 --> 00:03:34,666 Quantized เอง ดังนั้นฉันจึงสร้าง recipe 11 00:03:34,666 --> 00:03:56,712 นี้ขึ้นมา และนี่คือเทคนิค Quantization 12 00:03:56,712 --> 00:04:05,995 ที่เรียกว่า EXL3 13 00:04:05,995 --> 00:04:23,401 น่าแปลกใจที่หลายคนยังไม่รู้ว่า 14 00:04:23,401 --> 00:04:48,928 ในปัจจุบันมีสงครามเกิดขึ้นในชุมชน AI สถานที่ 15 00:04:48,928 --> 00:05:13,876 นี่คือการถกเถียงที่รุนแรงเกี่ยวกับว่าเทคนิค 16 00:05:13,876 --> 00:05:39,404 Quantization ใดที่ดีที่สุดสำหรับโมเดลสถานที่ 17 00:05:39,404 --> 00:05:56,229 หากคุณไม่รู้ การ Quantization 18 00:05:56,229 --> 00:06:53,086 คือวิธีการลดขนาดของโมเดลเพื่อให้สามารถใช้โมเดลที่ใหญ่กว่าให้ทำงานบนฮาร์ดแวร์ที่มีหน่วยความจำน้อยลง 19 00:06:53,086 --> 00:07:16,874 และมันเป็นวิธีการที่สำคัญมากสำหรับให้ LLM 20 00:07:16,874 --> 00:07:48,203 ขนาดใหญ่เหล่านี้สามารถทำงานบนฮาร์ดแวร์รายบุคคลได้จริงๆ 21 00:07:48,203 --> 00:08:06,189 ดังนั้นจึงมีเทคนิค Quantization 22 00:08:06,189 --> 00:08:21,854 หลายอันที่ได้รับความนิยมมาก 23 00:08:21,854 --> 00:08:40,419 ฉันได้แนะนำสองสามอันไปแล้ว NBFB4 24 00:08:40,419 --> 00:09:06,527 ฉันได้ทำวิดีโอเกี่ยวกับมันเมื่อสัปดาห์ที่แล้ว 25 00:09:06,527 --> 00:09:32,055 แต่การถกเถียงปัจจุบันคือเกี่ยวกับตัวนี้ EXL3 26 00:09:32,055 --> 00:09:52,941 ดังนั้นฉันจึงต้องการทำวิดีโออันหนึ่ง 27 00:09:52,941 --> 00:10:34,134 ซึ่งจะเป็นการแบ่งประเภทที่ไม่เกี่ยวข้องกับเทคนิคขั้นสูงหรืออะไรทั้งนั้น 28 00:10:34,134 --> 00:10:59,082 ฉันจะอธิบายแค่แนวคิดเบื้องต้นสำหรับใครก็ตาม 29 00:10:59,082 --> 00:11:24,609 แม้ว่าคุณจะไม่ใช่คนที่เกี่ยวข้องกับเทคโนโลยี 30 00:11:24,609 --> 00:11:42,595 คุณควรจะเข้าใจอย่างน้อยว่า EXL3 31 00:11:42,595 --> 00:12:08,703 ทำอะไรเปรียบเทียบกับเทคนิค Quantization อื่นๆ 32 00:12:08,703 --> 00:12:32,490 ได้อย่างไร จากนั้นเราจะมาทดลองจริงบบ DJ X 33 00:12:32,490 --> 00:12:58,598 Spark ของฉัน เราจะทำการ Quantize Qwen 3.8 27B 34 00:12:58,598 --> 00:13:23,546 คุณจะเห็นในวิดีโอก่อนหน้านี้ที่ฉันทำ NV FP4 35 00:13:23,546 --> 00:13:49,074 version ดังนั้นตอนนี้เราจะทำเป็นเวอร์ชัน EXL 36 00:13:49,074 --> 00:13:57,776 นะ EXL3 version 37 00:13:57,776 --> 00:14:22,144 และเราจะมาดูว่าพวกเขาเปรียบเทียบกันอย่างไร 38 00:14:22,144 --> 00:14:32,587 เพื่อดูว่านี่จริงๆ 39 00:14:32,587 --> 00:15:06,817 แล้วเราจะได้โมเดลที่เล็กลงโดยยังคงรักษาคุณภาพและความฉลาดไว้ 40 00:15:06,817 --> 00:15:20,162 ดังนั้นเรามาเริ่มกันเลย 41 00:15:20,162 --> 00:15:42,788 และถ้าคุณกำลังมองหาวิธี Level ตัว Agent 42 00:15:42,788 --> 00:16:08,316 ของคุณเอง ลองดูโปรเจ็กต์ Agent Wiki's ที่นี่ 43 00:16:08,316 --> 00:16:26,302 คุณจะได้เข้าถึง knowledge bases 44 00:16:26,302 --> 00:16:44,867 ที่ฉันใช้ทุกวันสำหรับการวิจัย... 45 00:16:44,867 --> 00:17:10,975 เราจะมาเริ่มกับการทดลองบน DJ X Spark ที่ฉันมี 46 00:17:10,975 --> 00:17:35,923 โดยการทำ Quantization กับโมเดล Qwen 3.8 27B 47 00:17:35,923 --> 00:18:02,031 ที่เห็นในวิดีโอก่อนหน้านี้ฉันได้ทำเป็นรุ่น NV 48 00:18:02,031 --> 00:18:25,818 FP4 ดังนั้นในครั้งนี้เราจะทำเป็นรุ่น EXL3 49 00:18:25,818 --> 00:18:51,346 และเราจะเปรียบเทียบกันเพื่อดูว่ารุ่นนี้จริงๆ 50 00:18:51,346 --> 00:19:36,600 แล้วสามารถทำให้โมเดลมีขนาดเล็กลงได้โดยยังคงรักษาคุณภาพและความฉลาดไว้ได้หรือไม่