My Fine-Tuned Open Laya Beat Jev at Agent Tool-Calling
สรุปย่อ
ประเด็นสำคัญจากวิดีโอ
> **ที่มา:** [YouTube — Tonbi's AI Garage](https://www.youtube.com/watch?v=JmvdKF6XxQg) · เผยแพร่ 7 ต.ค. 2026 · ~15:35 นาที
# สรุปภาษาไทย — My Fine-Tuned Open Laya Beat Jev at Agent Tool-Calling > **ที่มา:** [YouTube — Tonbi's AI Garage](https://www.youtube.com/watch?v=JmvdKF6XxQg) · เผยแพร่ 7 ต.ค. 2026 · ~15:35 นาที > *สรุปโดยอัตโนมัติ — เนื้อหาต้นฉบับ © Tonbi's AI Garage* ## วิดีโอนี้เกี่ยวกับอะไร ภาคต่อจากการทดสอบ **Laya** โมเดลตัดสินใจแบบเปิดที่มีแนวคิดคล้าย **Jev** ครั้งก่อนที่ทดสอบเรื่องการเลือกสกิล (Jev top-3 79% / Laya zero-shot 41% / Laya fine-tune 71%) วิดีโอนี้ทดลองต่อยอดไปหา **การอนุมัติคำสั่ง / การสร้าง to-do / และการเลือกเครื่องมือ (tool calling)** โดยใช้ข้อมูลเซสชันจริงของ Hermes Agent หลายเดือน เพื่อดูว่าโมเดลเล็กแบบเปิดที่ปรับจูนเองจะแทนการตัดสินใจของโมเดล frontier ตัวใหญ่ได้หรือไม่ ## ประเด็นหลัก 1. **ที่มาของการทดสอบ:** เอเจนต์ต้องเลือกว่าจะเรียกเครื่องมือไหนจาก 38 เครื่องมือ (เทียบกับ 122 สกิลในครั้งก่อน) ถ้าให้โมเดลเล็กทำหน้าที่นี้แทนโมเดล frontier จะลดต้นทุนและทำให้ทำงานแบบ local ได้ 2. **การทดสอบการอนุมัติ (permissions):** ไม่เวิร์กเพราะข้อมูลจริงแทบไม่มีคำสั่งที่ถูกปฏิเสธ ทุกอย่างถูกอนุมัติอัตโนมัติ แม้ลองสร้างข้อมูลสังเคราะห์ก็ไม่พอให้ fine-tune Laya ได้ — สรุปว่าเคสนี้ไม่มีสัญญาณพอ 3. **การทดสอบการสร้าง to-do:** Jev ได้ AROC 0.74 ส่วน Laya zero-shot ได้ 0.60 และหลัง fine-tune ได้ 0.72 ถือว่าดีขึ้นแต่ยังไม่ทัน Jev 4. **การทดสอบการเลือกเครื่องมือ — ครั้งแรกวัดผิด:** ตอนแรกวัดแค่เครื่องมือที่ถูกเรียกเป็นอันดับแรก Jev ได้ top-1 27% top-3 45% ส่วน Laya zero-shot ได้ 4% และ 13% เอกสารของ Laya เองเตือนว่าคุณภาพตกเมื่อตัวเลือกเกิน 20 ตัวเลือก (งานนี้มี 38 ตัวเลือก) 5. **แก้การวัดให้ถูก:** ตัวอย่างเช่น vision analyze ถูกเรียกจริง 368 ครั้งแต่เป็นอันดับแรกแค่ 12 ครั้ง เพราะเอเจนต์มักเริ่มด้วย terminal หรือ Hermes tools ก่อน จึงเปลี่ยนเกณฑ์เป็น “ใช้เครื่องมือนี้ที่ไหนก็ได้ในเทิร์นนั้นหรือไม่” เหมือนการวัดเรื่องสกิล ผลใหม่ Jev ได้ 36% / 65% / 91% (top-1 / top-3 / top-10) ส่วน Laya zero-shot ได้ 7% / 19% / 55% 6. **การ fine-tune สเกลจริง:** ใช้ข้อมูลจากโปรไฟล์ Hermes อีกตัวคือ video producer เพิ่ม 490 ข้อความ สร้างข้อมูลกว่า 28,000 แถว (ทุก positive ทำซ้ำเพื่อสมดุล และเอา hard negatives จากความผิดพลาด top ของ Laya แบบ zero-shot บวก random) เทรน 4 epoch ใช้เวลาเกือบหนึ่งชั่วโมงต่อ epoch มากกว่าครั้งแรก 17 เท่าเพราะแต่ละข้อความถามคำถามแยกแบบใช่หรือไม่ใช่ได้สูงสุด 37 คำถาม 7. **ผลหลัง fine-tune ชนะ Jev:** บนชุดทดสอบที่กันไว้ Laya ที่ fine-tune ได้ top-1 76% top-3 89% top-10 96% ค่า AROC จาก 0.57 ขึ้นเป็น 0.90 เทียบ Jev ที่ 0.77 และดีขึ้นทุกกลุ่มเครื่องมือ — ใช้บ่อย 0.83 ใช้ปานกลาง 0.86 ใช้น้อย 0.79 แสดงว่าไม่ได้จำแค่เครื่องมือยอดนิยมแต่เรียนรู้การแยกแยะจริง 8. **บทเรียนสำคัญ:** fine-tune สามารถชนะได้ไม่ใช่แค่ไล่ตาม การตีกรอบคำถามสำคัญพอๆ กับข้อมูล ถ้าถามแค่เครื่องมือแรกจะทิ้งข้อมูลส่วนใหญ่ไป และไม่ใช่ทุกการตัดสินใจจะทดสอบได้ (Hermes owned guards ถูกปฏิเสธแค่ครั้งเดียวในเกือบ 2,000 คำสั่ง) 9. **ยืนยันด้วยข้อมูลใหม่ 43 เซสชัน:** ทดสอบซ้ำบนเซสชันใหม่ที่เป็นโปรไฟล์ผสมและใช้โมเดลต่างกัน Jev ได้ top-1 40% top-10 88% AROC 0.73 ส่วน Laya ที่ fine-tune แล้วได้ top-1 72% top-3 80% top-10 92% AROC 0.91 ชนะอีกครั้งและแรงกว่าครั้งแรก จุดอ่อนเดียวคือมันตอบว่า “ไม่ใช้เครื่องมือ” ไม่ค่อยถูก (aggressive เกิน) ขณะที่ Jev ทำได้ดีกว่า ## บทสรุป ผู้สร้างมองว่าผลลัพธ์แข็งแรงเกินคาด อาจเปิดซอร์สโมเดล Laya ที่ fine-tune แล้วสำหรับ Hermes Agent ในอนาคต ส่วนตอนนี้ได้ปล่อย **สกิล Laya fine-tuning** บน Agent Wikis Pro (agentwikis.com) ให้สมาชิก Pro ใช้ทำซ้ำการทดลองนี้ได้เองผ่าน Hugging Face ## ใครควรดู คนที่สนใจเอเจนต์แบบเปิด โมเดลตัดสินใจขนาดเล็ก การลดการพึ่งพาโมเดล frontier งาน Hermes Agent และคนที่อยาก fine-tune โมเดลของตัวเองด้วยข้อมูลเซสชันจริง --- *Attribution: My Fine-Tuned Open Laya Beat Jev at Agent Tool-Calling — Tonbi's AI Garage (youtube.com/watch?v=JmvdKF6XxQg), เผยแพร่ 7 ต.ค. 2026*
คำแปลเต็ม
แปลตามบทสนทนาต้นฉบับ ปรับเป็นภาษาไทยธรรมชาติ
ในวิดีโอก่อนหน้านี้เกี่ยวกับ Laya คุณได้เห็นผมใช้การเลือกสกิลเป็นแบบทดสอบครับ และในวิดีโอนี้เราจะทดลองตัวเลือกเอเจนต์แบบอื่นๆ อีกสองสามแบบ แต่สุดท้ายเราพบจุดที่เข้ากันได้ดีมากคือการเลือกเครื่องมือ แทนที่จะให้โมเดล frontier ตัวใหญ่เป็นคนเลือกว่าจะใช้เครื่องมือไหน เราทดสอบดูว่า Jev และ Laya ที่ผ่านการ fine-tune แล้วซึ่งเป็นโมเดลแบบเปิดจะทำหน้าที่นี้ได้หรือไม่ อยากให้ดูจนจบครับว่าโมเดลโอเพนซอร์สที่เราปรับจูนเองทำได้ดีแค่ไหนเมื่อเทียบกับโมเดล frontier และเทียบกับ Jev
เมื่อสัปดาห์ที่แล้วผมได้ทดสอบด้วย Laya ซึ่งเป็นโมเดลตัดสินใจแบบเปิดที่มีแนวคิดคล้าย Jev โดย Jev เป็นโมเดลตัดสินใจที่กำลังเป็นที่นิยมมากในตอนนี้ การทดลองที่ผมทำคือใช้เซสชันจริงของ Hermes Agent แล้วให้โมเดลตัดสินใจว่าควรโหลดสกิลไหน เราเปรียบเทียบสิ่งที่โมเดลแต่ละตัวเลือกกับสิ่งที่โมเดลจริงที่ผมใช้งานเลือก ซึ่งปกติจะเป็นโมเดล frontier ที่ทรงพลังมาก มักจะเป็น GPT รุ่นล่าสุดหรือ Grok ล่าสุดหรือช่วงหลังก็เป็น Claude ครับ
สิ่งที่เราพบคือถ้าดูสามอันดับแรก โมเดลตัดสินใจขนาดเล็กเหล่านี้เลือกสกิลที่ถูกต้องติดหนึ่งในสามอันดับแรกได้ 79 เปอร์เซ็นต์ด้วย Jev ส่วน Laya แบบไม่ผ่านการเทรนเลยหรือ zero-shot ได้ 41 เปอร์เซ็นต์ และหลังจาก fine-tune ด้วยชุดข้อมูลจริงแล้วทดสอบกับข้อมูลที่ไม่เคยเห็นมาก่อนก็ได้ 71 เปอร์เซ็นต์ ถือว่าพัฒนาขึ้นเยอะมากและเข้าใกล้ Jev พอสมควร และแน่นอนว่านี่เป็นโมเดล local ขนาดเล็กที่เป็นโอเพนซอร์สด้วย ผมสนุกกับโปรเจกต์นี้มากครับ หลายคนสนใจและอยากหาวิธีต่างๆ ที่จะใช้โมเดลตัดสินใจขนาดเล็กเหล่านี้มาช่วยงานเอเจนต์หรือระบบอัตโนมัติทั่วไป
ผมเลยทำทดสอบเพิ่มเติมอีกสองสามแบบเพื่อต่อยอดจากครั้งก่อน นั่นคือเนื้อหาของวิดีโอนี้ครับ ผมจะโชว์ผลลัพธ์เรื่องการอนุมัติหรือ auto permissions ที่ผมคิดว่าน่าจะเป็นไอเดียที่ดี และอีกเรื่องคือการเรียกเครื่องมือหรือ tool calling เราทำเรื่องการเรียกสกิลไปแล้ว การเลือกว่าจะใช้เครื่องมือไหนสำคัญมากสำหรับเอเจนต์ใช่ไหมครับ ผมเลยสงสัยว่าเราจะใช้ Laya หรือ Jev ในโฟลว์นี้ได้ด้วยหรือไม่ วิดีโอนี้จะเป็นภาคต่อที่พยายามหาเคสใช้งานใหม่ๆ สำหรับ Jev หรือ Laya ว่าจะ fine-tune แล้วได้ผลลัพธ์แบบไหน มาเริ่มกันเลยครับ
ถ้าคุณอยากยกระดับเอเจนต์ของตัวเอง ลองดูโปรเจกต์ของผมที่ agentwikis.com ครับ ที่นั่นคุณเข้าถึงฐานความรู้ที่ผมใช้ทุกวันทั้งในการทำวิดีโอเหล่านี้และการสร้างโปรเจกต์ของตัวเอง Wiki มาตรฐานทั้งหมดฟรีครับ แต่ถ้าสมัคร Agent Wikis Pro เพียงเดือนละ 19.99 ดอลลาร์ คุณจะได้เข้าถึงวิดีโอพิเศษเกี่ยวกับเอเจนต์และสกิลและเวิร์กโฟลว์ สกิลแบบกำหนดเองที่ผมพัฒนาร่วมกับเอเจนต์มานานหลายเดือน จดหมายข่าว Q&A รายสัปดาห์ และโปรไฟล์เอเจนต์เฉพาะทางที่มาพร้อมสกิลและคู่มือและเครื่องมือสำหรับงาน local LLM งานเทรด การวิเคราะห์ on-chain งานโค้ดและอีกมากมาย สมัครได้วันนี้ที่ agentwikis.com ลิงก์อยู่ในคำอธิบายครับ ขอบคุณทุกคนที่สนับสนุนครับ กลับมาที่วิดีโอกันต่อ
และตอนนี้มีให้ใช้แล้วบน Agent Wikis Pro คือสกิล Laya fine-tuning นี่คือสกิลตัวจริงที่เราใช้และพัฒนาระหว่างทำวิดีโอนี้เพื่อ fine-tune โมเดลเปิด Laya และได้ผลลัพธ์ที่เห็น ตอนนี้มีให้ใช้แล้วที่ agentwikis.com ครับ ในวิดีโอนี้เราจะทำการทดลองว่าโมเดลตัดสินใจขนาดเล็กอย่าง Jev หรือ Laya จะทำนายได้หรือไม่ว่าเอเจนต์เขียนโค้ดตัวจริงจะทำอะไร ไม่ว่าจะเป็นเรื่องเครื่องมือหรือการขอสิทธิ์หรือการตัดสินใจว่าจะวางแผนหรือไม่ นั่นคือหัวข้อหลักครับ
และเราจะใช้ตัวนี้ครับ นี่คือโมเดลโอเพนซอร์ส คุณเข้าไปโหลดได้ตอนนี้เลยที่ Hugging Face และรันการทดลองนี้เองได้หรือจะทดลองหัวข้ออื่นก็ได้ นี่คือ Laya ที่อธิบายว่าเป็น multilingual non-auto aggressive system one decision model [ฟังไม่ชัด — คำบรรยายอัตโนมัติอาจเพี้ยน] โครงสร้างจึงคล้าย Jev มากในแง่พฤติกรรม อย่างที่เราพบในตอนแรกหรือภาคก่อน มันต้องผ่านการ fine-tune ด้วยข้อมูลก่อน ถ้าใช้แบบกล่องเปล่าจะไม่ค่อยได้ผล แต่เชิงโครงสร้างคือคุณให้สถานะและให้ตัวเลือก แล้วมันจะจัดอันดับตัวเลือกเหล่านั้น ตัวที่ได้ความน่าจะเป็นสูงสุดก็จะถูกเลือกแล้วนำไปใช้ครับ
นี่คือตัวอย่างครับกับเอเจนต์และเราใช้ประวัติเอเจนต์จริงของผมจากหลายเดือนที่ใช้ Hermes Agent เราเอาทรานสคริปต์ของทุกเซสชันมา และตัวอย่างเช่นข้อความนี้ว่า turn off the DS4 local model นั่นคือพรอมต์ที่ผมส่งไป ตัวอย่างเรื่องการเรียกเครื่องมือ โมเดลทั้งสองจะต้องตอบว่าจะใช้เครื่องมือไหน Jev เลือก terminal ด้วยความมั่นใจ 0.79 ส่วน Laya เลือก Hermes profiles ด้วย 0.84 แล้วเอเจนต์ตัวจริงทำอะไร โมเดลที่รันจริงน่าจะเป็น GVT 6 หรืออะไรทำนองนั้นครับ [ฟังไม่ชัด — ชื่อโมเดลในคำบรรยายอาจเพี้ยน] มันรันคำสั่ง terminal ดังนั้นเคสนี้ Jev ทายถูก ส่วน Laya ทายผิดครับ
ผมได้ทดสอบอีกสองแบบอย่างรวดเร็วครับ แบบแรกคือเรื่องสิทธิ์หรือ permissions ที่จะให้โมเดลตัดสินใจว่าควรอนุมัติคำสั่งหนึ่งหรือไม่ แต่ปัญหาคือในข้อมูลจริงของผมแทบไม่มีคำสั่งที่ถูกปฏิเสธเลย ทุกอย่างดูเหมือนจะถูกอนุมัติอัตโนมัติหมด ผมลองทำด้วยข้อมูลสังเคราะห์ด้วยครับแต่ก็ยังไม่พอที่จะ fine-tune โมเดล Laya ได้ มันเลยไม่ได้ผลตามที่คาดไว้ครับ
การทดสอบที่สองคือเรื่อง to-do ว่าโมเดลควรสร้างรายการสิ่งที่ต้องทำหลังพรอมต์หนึ่งหรือไม่ และคุณเห็นผลลัพธ์ได้ครับ Jev ได้ค่า AROC 0.74 ซึ่งยิ่งใกล้หนึ่งยิ่งดี ส่วน Laya แบบ zero-shot ได้ 0.6 แล้วพอเรา fine-tune ด้วยข้อมูลเซสชันก็ขึ้นมาเป็น 0.72 ถือว่าดีพอสมควรแต่ยังไม่ทัน Jev ครับ
จากนั้นผมเลยคิดเรื่องเครื่องมือครับเพราะเราได้ผลค่อนข้างดีหรืออย่างน้อยก็พอใช้ได้กับการเลือกสกิล ผมคิดว่าถ้าลองทำกับเครื่องมือล่ะ เพราะมีเครื่องมือน้อยกว่า มีแค่ 38 เครื่องมือของเอเจนต์ตัวนี้เทียบกับ 122 สกิล คุณเห็นได้ตรงนี้ใน Claude Code ที่ผมพิมพ์ว่า What about tool choice instead of skill? ดูเหมือนเรื่องการอนุมัติจะไม่ค่อยเข้าทางครับ เราเลยทำโครงสร้างแบบเดียวกับที่ทำกับการเลือกสกิล และผลลัพธ์ครั้งแรกก็น่าสนใจครับ
Jev เลือกอันดับหนึ่งถูก 27 เปอร์เซ็นต์ของเวลา และมีตัวเลือกที่ถูกต้องอยู่ในสามอันดับแรก 45 เปอร์เซ็นต์ของเวลา นั่นคือความหมายของ top three ครับ ส่วน Laya แบบ zero-shot ได้อันดับหนึ่งแค่ 4 เปอร์เซ็นต์และติดสามอันดับแรก 13 เปอร์เซ็นต์ ไม่ดีเลยครับ Jev นั้นค่อนข้างระมัดระวังแต่มีเหตุผล ส่วน Laya ล้มเหลวโดยไม่ขึ้นกับข้อความเลย มันเลือกจากกลุ่มตัวโปรดไม่กี่ตัวที่ไม่เกี่ยวข้องเป็นส่วนใหญ่ มันไม่เวิร์กกับงานนี้เลย และเอกสารของมันเองก็เตือนว่าคุณภาพการเลือกจะตกลงเมื่อเกิน 20 ตัวเลือกและเรามี 38 ตัวเลือกครับ
ตอนแรกผมคิดว่านี่เป็นอีกความล้มเหลวหนึ่งของการทดลองเอเจนต์ของเรา แต่ปัญหาคือเราวัดคำถามผิดครับ นี่เป็นปัญหาว่า Claude ออกแบบการทดลองนี้อย่างไรและผมก็ไม่ได้ตรวจสอบให้ดีพอ เพราะตอนแรกมันเช็คแค่ว่าเครื่องมือไหนถูกเรียกเป็นอันดับแรก ไม่ใช่เครื่องมือทั้งหมดที่ใช้ในทั้งเทิร์นหรือทั้งการตอบนั้น ตัวอย่างเช่น vision analyze มีการเรียกจริง 368 ครั้งในทุกเซสชัน แต่มีแค่ 12 ครั้งที่เป็นการกระทำแรกจริงๆ เพราะปกติมันมักจะใช้ Hermes agent skill หรือ Hermes agent tools หรือใช้ terminal บ่อยครับ
ดังนั้นจึงมีเครื่องมือประจำที่มันใช้เป็นเครื่องมือแรกอยู่ไม่กี่ตัว แต่สิ่งที่เราต้องทำคือออกแบบการทดลองใหม่ให้ใช้เครื่องมือทั้งหมดหรือทุกการเรียกเครื่องมือ เราเปลี่ยนขอบเขตเป็นว่าเอเจนต์ได้ใช้เครื่องมือนี้ที่ไหนก็ได้ระหว่างการตอบหรือไม่ แบบเดียวกับการทดสอบสกิลที่ถามว่าโหลดเมื่อใดก็ได้ไม่ใช่แค่ตัวแรก นั่นเป็นความผิดพลาดของผมครับ แต่หลังจากแก้ให้ถูกต้องแล้วเราทำทดสอบใหม่และคุณเห็นได้ว่า top one top three top 10 Jev ได้ 36 เปอร์เซ็นต์ในอันดับหนึ่ง 65 เปอร์เซ็นต์ในสามอันดับแรกและ 91 เปอร์เซ็นต์ในสิบอันดับแรก ส่วน Laya แบบ zero-shot ได้ 7 เปอร์เซ็นต์ 19 เปอร์เซ็นต์และ 55 เปอร์เซ็นต์ในสิบอันดับแรก โมเดลทั้งสองทำได้ดีขึ้นเมื่อใช้การตีกรอบแบบนี้แทนการดูแค่เครื่องมือแรก และเราได้ภาพที่ชัดขึ้นว่า Laya ยังลำบากจริง มันไม่ได้ตาบอดสนิทครับ มันไม่ได้ตาบอดสนิทเลย มันใกล้เคียงการสุ่มในทุกกรณียกเว้นเครื่องมือที่มีเอกลักษณ์ชัดที่สุดเท่านั้น
แต่นั่นยังไม่ใช่ตอนจบครับ เรายังต้องเทรนโมเดล Laya นี้ เรา fine-tune ด้วยข้อมูลใหม่ในสเกลจริงครับ ข้อมูลมาจากโปรไฟล์ Hermes อีกตัวหนึ่งคือ video producer ที่คุณน่าจะเคยเห็นผมใช้บ้างถ้าดูวิดีโออื่นของผม เราได้ข้อความเพิ่มอีก 490 ข้อความจากโดเมนที่ต่างออกไปโดยสิ้นเชิง และมีการใช้เครื่องมือที่หลากหลายมาก เราใช้ข้อมูลมากกว่า 28,000 แถว โดยทุก positive ที่เป็นจริงจะถูกทำซ้ำเพื่อความสมดุล ส่วน hard negatives มาจากความผิดพลาดอันดับต้นๆ ของโมเดลเองในแบบ zero-shot บวกกับ random อีกส่วนครับ
นี่ใช้เวลาฝึกพอสมควรครับ คุณเห็นได้ว่าการเทรนเป็นอย่างไร เราเทรนไปสี่ epoch กับข้อมูลใหม่นี้ สี่ epoch ใช้เวลาเกือบหนึ่งชั่วโมงต่อ epoch ครับ ประมาณ 17 เท่าของจำนวนแถวในครั้งแรกเพราะแต่ละข้อความตอนนี้ถามคำถามแยกแบบใช่หรือไม่ใช่ได้สูงสุด 37 คำถามแทนที่จะถามแค่คำถามเดียว ดังนั้นการรันเทรนโมเดลครั้งนี้ค่อนข้างยาวครับ
เมื่อเทรนเสร็จแล้วเราทดสอบกับข้อมูลที่กันไว้สำหรับทดสอบครับ เป็นข้อมูลจากโปรไฟล์โมเดลเดียวกันแต่ไม่ได้ใช้เทรน และคุณเห็นผลลัพธ์ได้ครับ Laya ที่ fine-tune แล้วชนะ Jev ในเคสนี้ คุณเห็นได้ว่าแบบ fine-tune ได้อันดับหนึ่งถูก 76 เปอร์เซ็นต์ของเวลา สามอันดับแรกได้ 89 เปอร์เซ็นต์และสิบอันดับแรกได้ 96 เปอร์เซ็นต์ ผลลัพธ์แข็งแรงมากครับ ค่า AROC เพิ่มจาก 0.57 ขึ้นมาเป็น 0.90 เทียบกับ Jev ที่ 0.77 เราสามารถเทรนโมเดลและปรับให้ชนะ Jev ได้จริงครับ
และคุณเห็นได้ว่าคะแนนแข็งแรงในทุกกลุ่มด้วยครับ อย่างเครื่องมือที่ใช้บ่อยขึ้นไปถึง 0.83 เครื่องมือที่ใช้ปานกลางขึ้นไปถึง 0.86 เครื่องมือที่ใช้ไม่บ่อยก็ขึ้นเล็กน้อยเป็น 0.79 สิ่งนี้บอกเราว่ามันไม่ได้แค่จำว่าเอเจนต์ใช้เครื่องมือนี้บ่อย มันดีขึ้นในทุกประเภทเครื่องมือจริงๆ นั่นบอกว่ามันไม่ได้แค่จำว่าให้เลือกเครื่องมือที่ใช้บ่อยเพื่อปั่นคะแนน ถ้ามันแค่จำเครื่องมือที่ใช้บ่อย คุณจะเห็นกลุ่มเครื่องมือที่ใช้บ่อยพุ่งสูงแต่กลุ่มเครื่องมือที่ใช้ไม่บ่อยกลับแย่ลงใช่ไหมครับ สิ่งนี้บอกว่ามันเรียนรู้จริงครับ
นี่คือผลลัพธ์ของการทดลองเล็กๆ หลายแบบที่ผมลองครับ เรื่องการอนุมัติไม่ค่อยเข้าทางสำหรับงานนี้ เหตุผลที่ผมยังใส่มาเพราะบางคนอาจสนใจจะทดลองด้วยเช่นกัน และบางครั้งการรู้ว่าอะไรไม่เวิร์กก็มีประโยชน์พอๆ กับรู้ว่าอะไรเวิร์กครับ นั่นคือปัญหากับเรื่องการอนุมัติคือไม่มีสัญญาณพอที่จะ fine-tune อะไรได้จริง ส่วนเรื่อง to-do หรือไม่ to-do เราได้ผลลัพธ์บ้างครับแต่ยังปิดช่องว่างกับ Jev ไม่ได้ แต่เราได้ชัยชนะครั้งใหญ่จริงๆ เมื่อมาถึงเรื่องการเลือกเครื่องมือ และโดยเฉพาะการออกแบบการทดลองให้ดูเครื่องมือทั้งหมดที่ใช้ไม่ใช่แค่ตัวแรก นั่นคือกุญแจสำคัญครับ
นี่คือสิ่งที่เราได้เรียนรู้ครับ การ fine-tune สามารถชนะได้ไม่ใช่แค่ไล่ตามทัน เราพิสูจน์ได้ว่าชัยชนะนี้ไม่ใช่แค่การจำ และเราพบว่าการตีกรอบคำถามสำคัญพอๆ กับข้อมูลครับ คุณสามารถมีข้อมูลที่ดีมากแต่ถ้าไม่ตีกรอบคำถามให้ตรง โมเดลเหล่านี้ก็จะทำงานได้ไม่ดีใช่ไหมครับ การใช้แค่เครื่องมือแรกทิ้งข้อมูลส่วนใหญ่ของการใช้เครื่องมือไป ดังนั้นการเข้าใจจุดนี้จึงสำคัญมากครับ ไม่ใช่ทุกการตัดสินใจจะทดสอบได้ในตอนนี้ Hermes owned guards และ denied แทบไม่เกิดเลยในเกือบ 2000 คำสั่ง ดังนั้นมันยังไม่ใช่ตัวที่เหมาะกับทุกบทบาทครับ
สุดท้ายครับ ผมอยากลองอีกอย่าง เรามีข้อมูลเซสชันเพิ่มเติมตั้งแต่ตอนนั้น มี 43 เซสชันใหม่จะโชว์ให้ดูครับ และนี่เป็นโปรไฟล์ที่ต่างออกไปโดยสิ้นเชิง จริงๆ เป็นการผสมของสองสามโปรไฟล์ เราจะรันทดสอบเดียวกันด้วย Laya ที่ fine-tune แล้วและ Jev บนข้อความใหม่เหล่านั้นและดูผลลัพธ์ครับ เราจะได้เห็นว่ามันยังเป็นแบบเดิมหรือไม่แม้กับข้อมูลใหม่ที่ไม่เกี่ยวข้องเลยกับเซสชันที่ใช้ fine-tune
และตอนนี้ผมรู้ว่าต้องสรุปให้คุณด้วยสไลด์ แต่คุณจะได้เห็นแบบสดๆ ใน Claude Code ครับ เรามีป้ายกำกับการใช้เครื่องมือจริงสำหรับข้อมูลนี้ มันจะใช้ Jev ก่อนแล้วค่อยใช้โมเดล Laya ที่ fine-tune แล้ว โอเคครับ ผลลัพธ์กลับมาแล้วและมันยืนยันสิ่งที่เราคิดไว้ก่อนหน้านี้ ผมไม่แน่ใจว่าจะออกมาทางไหนแต่คุณเห็นได้ว่า Jev บนตัวอย่างข้อความใหม่หรือเซสชันใหม่ได้อันดับหนึ่ง 40 เปอร์เซ็นต์ [ฟังไม่ชัด — ตัวเลข top three ในคำบรรยายระบุว่า 352 อาจหมายถึง 52 เปอร์เซ็นต์] และ top 10 ได้ 88 เปอร์เซ็นต์ ส่วนค่า AROC ต้องใกล้หนึ่งที่สุดได้ 0.73 และ Laya ที่ fine-tune แล้ว อย่าลืมว่านี่ fine-tune ด้วยข้อมูลเก่า นี่ไม่เกี่ยวข้องเลยครับ รวมถึงหลายเซสชันที่ใช้โปรไฟล์ต่างกันและใช้โมเดลต่างกันด้วย ได้อันดับหนึ่ง 72 เปอร์เซ็นต์ คะแนนแข็งแรงมากครับ สามอันดับแรก 80 เปอร์เซ็นต์และสิบอันดับแรก 92 เปอร์เซ็นต์ ส่วน AROC ได้ 0.91 ครับ
ประเด็นเดียวคือมันค่อนข้าง aggressive เกินไป มันตอบว่าไม่ใช้เครื่องมือไม่ค่อยถูก ในขณะที่โมเดล Jev ทำได้ ดังนั้น Laya ที่ fine-tune แล้วชนะ Jev อีกครั้งบนข้อมูลใหม่จริงๆ และจริงๆ แข็งแรงกว่าการทดสอบเดิมที่ผมเพิ่งโชว์ไปก่อนหน้านี้ด้วยซ้ำ ผลลัพธ์แข็งแรงมากครับ ผมจะทำต่อกับสิ่งนี้เพราะผลลัพธ์แข็งแรงกว่าที่ผมคาดไว้จริงๆ ดังนั้นถ้าผมรันทดสอบเพิ่มอีกสักสองสามครั้ง ผมอาจจะเปิดซอร์สโมเดล Laya ที่ fine-tune แล้วให้ใช้งานใน Hermes Agent ได้ครับ รอดูได้เลยว่าผมจะโพสต์หรือไม่ แต่สิ่งที่ผมจะเผยแพร่ตอนนี้คือสกิล Laya fine-tuning นี้ครับ นี่จะเป็นส่วนหนึ่งของ Agent Wikis Pro ในฐานะสกิลแบบกำหนดเอง ดังนั้นถ้าคุณอยากลองและคุณเป็นสมาชิก ลองได้เลยครับ น่าจะขึ้นแล้วที่ agentwikis.com ใต้ส่วนสกิล อีกครั้งครับถ้าคุณเป็นสมาชิก Pro คุณจะเข้าถึงได้ครับ ผมจะเพิ่มตรงนี้เพราะคิดว่ามีประโยชน์ครับ เราทำสิ่งนี้มาหลายวันจริงๆ เป็นสองสามสัปดาห์แล้ว และมันอาจเป็นสกิลที่มีประโยชน์พอสมควรครับ
นั่นคือตอนจบของวิดีโอนี้ครับ ผลลัพธ์โดยรวมแข็งแรงมากจริงๆ และผมรู้ว่าหลายคนกำลังทดลองกับ Laya และกับโมเดลตัดสินใจขนาดเล็กแบบเปิดอื่นๆ กรุณาทิ้งคอมเมนต์ว่าคุณใช้มันเพื่ออะไรและพบอะไรบ้างครับ แล้วพบกันในวิดีโอหน้าครับ ขอบคุณที่รับชม
หมายเหตุการแปล
ความโปร่งใสเกี่ยวกับความไม่แน่นอนในต้นฉบับ
- 3. **“multilingual non-auto aggressive system one decision model”** และ **“GVT 6”** ในคำบรรยายฟังไม่ชัดและอาจเพี้ยนจากการถอดเสียงอัตโนมัติ จึงคงตามที่ได้ยินและทำเครื่องหมาย [ฟังไม่ชัด] ไว้
- 4. **ตัวเลข “352 top 10”** ในช่วงทดสอบเซสชันใหม่ คำบรรยายระบุว่า 352 ซึ่งบริบทน่าจะเป็น 52 เปอร์เซ็นต์สำหรับ top three จึงคงตัวเลขตามคำบรรยายและหมายเหตุว่า [ฟังไม่ชัด — อาจหมายถึง 52%] ไว้
- ## ส่วนที่ไม่ชัดเจน
- ทำเครื่องหมาย [ฟังไม่ชัด] ไว้ 3 จุดตามที่ระบุข้างต้น ไม่ได้เดาความหมายเพิ่ม
อภิธานศัพท์เทคนิค
คำศัพท์และชื่อผลิตภัณฑ์ที่คงรูปภาษาอังกฤษ
| ศัพท์ | คำแปล / คำอธิบาย |
|---|---|
| Laya | Laya |
| Jev | Jev |
| Hermes Agent | Hermes Agent |
| frontier model | โมเดล frontier |
| fine-tune | fine-tune (ปรับจูน) |
| zero-shot | zero-shot |
| skill routing | การเลือกสกิล |
| tool calling / tool routing | การเรียกเครื่องมือ / การเลือกเครื่องมือ |
| permissions / approvals | การอนุมัติ / สิทธิ์ |
| to-do | to-do (รายการสิ่งที่ต้องทำ) |
| top-1 / top-3 / top-10 | top-1 / top-3 / top-10 |
| AROC / AOROC | AROC |
| hard negatives | hard negatives |
| epoch | epoch |
| Hugging Face | Hugging Face |
| Claude Code | Claude Code |
| terminal | terminal |
| vision analyze | vision analyze |
| Hermes profiles / Hermes Agent skill | Hermes profiles / Hermes Agent skill |
| video producer (profile) | video producer |
| Agent Wikis Pro / agentwikis.com | Agent Wikis Pro |
| GVT 6 [ฟังไม่ชัด] | GVT 6 |
| multilingual non-auto aggressive system one decision model [ฟังไม่ชัด] | คำอธิบาย Laya ในวิดีโอ |
ซับไตเติ้ลภาษาไทย
ดาวน์โหลดหรือดูซับทั้งหมด
1 00:00:00,000 --> 00:00:02,621 ในวิดีโอก่อนหน้านี้เกี่ยวกับ Laya 2 00:00:02,621 --> 00:00:06,037 คุณได้เห็นผมใช้การเลือกสกิลเป็นแบบทดสอบครับ 3 00:00:06,037 --> 00:00:09,770 และในวิดีโอนี้เราจะทดลองตัวเลือกเอเจนต์แบบอื่นๆ 4 00:00:09,770 --> 00:00:10,864 อีกสองสามแบบ
เปิดดูซับไตเติ้ลทั้งหมด (286 segments)
1 00:00:00,000 --> 00:00:02,621 ในวิดีโอก่อนหน้านี้เกี่ยวกับ Laya 2 00:00:02,621 --> 00:00:06,037 คุณได้เห็นผมใช้การเลือกสกิลเป็นแบบทดสอบครับ 3 00:00:06,037 --> 00:00:09,770 และในวิดีโอนี้เราจะทดลองตัวเลือกเอเจนต์แบบอื่นๆ 4 00:00:09,770 --> 00:00:10,864 อีกสองสามแบบ 5 00:00:10,864 --> 00:00:15,392 แต่สุดท้ายเราพบจุดที่เข้ากันได้ดีมากคือการเลือกเครื่องมือ 6 00:00:15,392 --> 00:00:17,377 แทนที่จะให้โมเดล frontier 7 00:00:17,377 --> 00:00:20,475 ตัวใหญ่เป็นคนเลือกว่าจะใช้เครื่องมือไหน 8 00:00:20,475 --> 00:00:23,414 เราทดสอบดูว่า Jev และ Laya ที่ผ่านการ 9 00:00:23,414 --> 00:00:24,508 fine-tune 10 00:00:24,508 --> 00:00:28,321 แล้วซึ่งเป็นโมเดลแบบเปิดจะทำหน้าที่นี้ได้หรือไม่ 11 00:00:28,321 --> 00:00:34,834 อยากให้ดูจนจบครับว่าโมเดลโอเพนซอร์สที่เราปรับจูนเองทำได้ดีแค่ไหนเมื่อเทียบกับโมเดล 12 00:00:34,834 --> 00:00:36,740 frontier และเทียบกับ Jev 13 00:00:36,740 --> 00:00:39,759 เมื่อสัปดาห์ที่แล้วผมได้ทดสอบด้วย Laya 14 00:00:39,759 --> 00:00:43,253 ซึ่งเป็นโมเดลตัดสินใจแบบเปิดที่มีแนวคิดคล้าย 15 00:00:43,253 --> 00:00:44,348 Jev โดย Jev 16 00:00:44,348 --> 00:00:48,081 เป็นโมเดลตัดสินใจที่กำลังเป็นที่นิยมมากในตอนนี้ 17 00:00:48,081 --> 00:00:51,338 การทดลองที่ผมทำคือใช้เซสชันจริงของ Hermes 18 00:00:51,338 --> 00:00:54,753 Agent แล้วให้โมเดลตัดสินใจว่าควรโหลดสกิลไหน 19 00:00:54,753 --> 00:01:00,631 เราเปรียบเทียบสิ่งที่โมเดลแต่ละตัวเลือกกับสิ่งที่โมเดลจริงที่ผมใช้งานเลือก 20 00:01:00,631 --> 00:01:03,967 ซึ่งปกติจะเป็นโมเดล frontier ที่ทรงพลังมาก 21 00:01:03,967 --> 00:01:06,588 มักจะเป็น GPT รุ่นล่าสุดหรือ Grok 22 00:01:06,588 --> 00:01:09,447 ล่าสุดหรือช่วงหลังก็เป็น Claude ครับ 23 00:01:09,447 --> 00:01:11,989 สิ่งที่เราพบคือถ้าดูสามอันดับแรก 24 00:01:11,989 --> 00:01:17,787 โมเดลตัดสินใจขนาดเล็กเหล่านี้เลือกสกิลที่ถูกต้องติดหนึ่งในสามอันดับแรกได้ 25 00:01:17,787 --> 00:01:20,329 79 เปอร์เซ็นต์ด้วย Jev ส่วน Laya 26 00:01:20,329 --> 00:01:23,586 แบบไม่ผ่านการเทรนเลยหรือ zero-shot ได้ 41 27 00:01:23,586 --> 00:01:26,127 เปอร์เซ็นต์ และหลังจาก fine-tune 28 00:01:26,127 --> 00:01:30,814 ด้วยชุดข้อมูลจริงแล้วทดสอบกับข้อมูลที่ไม่เคยเห็นมาก่อนก็ได้ 29 00:01:30,814 --> 00:01:31,926 71 เปอร์เซ็นต์ 30 00:01:31,926 --> 00:01:35,500 ถือว่าพัฒนาขึ้นเยอะมากและเข้าใกล้ Jev พอสมควร 31 00:01:35,500 --> 00:01:37,883 และแน่นอนว่านี่เป็นโมเดล local 32 00:01:37,883 --> 00:01:40,186 ขนาดเล็กที่เป็นโอเพนซอร์สด้วย 33 00:01:40,186 --> 00:01:42,331 ผมสนุกกับโปรเจกต์นี้มากครับ 34 00:01:42,331 --> 00:01:44,555 หลายคนสนใจและอยากหาวิธีต่างๆ 35 00:01:44,555 --> 00:01:50,591 ที่จะใช้โมเดลตัดสินใจขนาดเล็กเหล่านี้มาช่วยงานเอเจนต์หรือระบบอัตโนมัติทั่วไป 36 00:01:50,591 --> 00:01:55,039 ผมเลยทำทดสอบเพิ่มเติมอีกสองสามแบบเพื่อต่อยอดจากครั้งก่อน 37 00:01:55,039 --> 00:01:57,422 นั่นคือเนื้อหาของวิดีโอนี้ครับ 38 00:01:57,422 --> 00:02:00,599 ผมจะโชว์ผลลัพธ์เรื่องการอนุมัติหรือ auto 39 00:02:00,599 --> 00:02:04,014 permissions ที่ผมคิดว่าน่าจะเป็นไอเดียที่ดี 40 00:02:04,014 --> 00:02:07,350 และอีกเรื่องคือการเรียกเครื่องมือหรือ tool 41 00:02:07,350 --> 00:02:10,289 calling เราทำเรื่องการเรียกสกิลไปแล้ว 42 00:02:10,289 --> 00:02:15,055 การเลือกว่าจะใช้เครื่องมือไหนสำคัญมากสำหรับเอเจนต์ใช่ไหมครับ 43 00:02:15,055 --> 00:02:17,835 ผมเลยสงสัยว่าเราจะใช้ Laya หรือ Jev 44 00:02:17,835 --> 00:02:19,741 ในโฟลว์นี้ได้ด้วยหรือไม่ 45 00:02:19,741 --> 00:02:23,395 วิดีโอนี้จะเป็นภาคต่อที่พยายามหาเคสใช้งานใหม่ๆ 46 00:02:23,395 --> 00:02:26,254 สำหรับ Jev หรือ Laya ว่าจะ fine-tune 47 00:02:26,254 --> 00:02:29,273 แล้วได้ผลลัพธ์แบบไหน มาเริ่มกันเลยครับ 48 00:02:29,273 --> 00:02:31,894 ถ้าคุณอยากยกระดับเอเจนต์ของตัวเอง 49 00:02:31,894 --> 00:02:35,150 ลองดูโปรเจกต์ของผมที่ agentwikis.com ครับ 50 00:02:35,150 --> 00:02:42,617 ที่นั่นคุณเข้าถึงฐานความรู้ที่ผมใช้ทุกวันทั้งในการทำวิดีโอเหล่านี้และการสร้างโปรเจกต์ของตัวเอง 51 00:02:42,617 --> 00:02:46,111 Wiki มาตรฐานทั้งหมดฟรีครับ แต่ถ้าสมัคร Agent 52 00:02:46,111 --> 00:02:48,971 Wikis Pro เพียงเดือนละ 19.99 ดอลลาร์ 53 00:02:48,971 --> 00:02:53,975 คุณจะได้เข้าถึงวิดีโอพิเศษเกี่ยวกับเอเจนต์และสกิลและเวิร์กโฟลว์ 54 00:02:53,975 --> 00:02:58,185 สกิลแบบกำหนดเองที่ผมพัฒนาร่วมกับเอเจนต์มานานหลายเดือน 55 00:02:58,185 --> 00:03:00,170 จดหมายข่าว Q&A รายสัปดาห์ 56 00:03:00,170 --> 00:03:05,730 และโปรไฟล์เอเจนต์เฉพาะทางที่มาพร้อมสกิลและคู่มือและเครื่องมือสำหรับงาน 57 00:03:05,730 --> 00:03:08,828 local LLM งานเทรด การวิเคราะห์ on-chain 58 00:03:08,828 --> 00:03:11,767 งานโค้ดและอีกมากมาย สมัครได้วันนี้ที่ 59 00:03:11,767 --> 00:03:14,785 agentwikis.com ลิงก์อยู่ในคำอธิบายครับ 60 00:03:14,785 --> 00:03:16,850 ขอบคุณทุกคนที่สนับสนุนครับ 61 00:03:16,850 --> 00:03:20,424 กลับมาที่วิดีโอกันต่อ และตอนนี้มีให้ใช้แล้วบน 62 00:03:20,424 --> 00:03:23,602 Agent Wikis Pro คือสกิล Laya fine-tuning 63 00:03:23,602 --> 00:03:28,129 นี่คือสกิลตัวจริงที่เราใช้และพัฒนาระหว่างทำวิดีโอนี้เพื่อ 64 00:03:28,129 --> 00:03:31,703 fine-tune โมเดลเปิด Laya และได้ผลลัพธ์ที่เห็น 65 00:03:31,703 --> 00:03:34,960 ตอนนี้มีให้ใช้แล้วที่ agentwikis.com ครับ 66 00:03:34,960 --> 00:03:39,328 ในวิดีโอนี้เราจะทำการทดลองว่าโมเดลตัดสินใจขนาดเล็กอย่าง 67 00:03:39,328 --> 00:03:40,423 Jev หรือ Laya 68 00:03:40,423 --> 00:03:44,474 จะทำนายได้หรือไม่ว่าเอเจนต์เขียนโค้ดตัวจริงจะทำอะไร 69 00:03:44,474 --> 00:03:50,510 ไม่ว่าจะเป็นเรื่องเครื่องมือหรือการขอสิทธิ์หรือการตัดสินใจว่าจะวางแผนหรือไม่ 70 00:03:50,510 --> 00:03:53,926 นั่นคือหัวข้อหลักครับ และเราจะใช้ตัวนี้ครับ 71 00:03:53,926 --> 00:03:55,594 นี่คือโมเดลโอเพนซอร์ส 72 00:03:55,594 --> 00:03:58,850 คุณเข้าไปโหลดได้ตอนนี้เลยที่ Hugging Face 73 00:03:58,850 --> 00:04:02,742 และรันการทดลองนี้เองได้หรือจะทดลองหัวข้ออื่นก็ได้ 74 00:04:02,742 --> 00:04:05,999 นี่คือ Laya ที่อธิบายว่าเป็น multilingual 75 00:04:05,999 --> 00:04:09,573 non-auto aggressive system one decision model 76 00:04:09,573 --> 00:04:12,750 [ฟังไม่ชัด — คำบรรยายอัตโนมัติอาจเพี้ยน] 77 00:04:12,750 --> 00:04:15,768 โครงสร้างจึงคล้าย Jev มากในแง่พฤติกรรม 78 00:04:15,768 --> 00:04:18,310 อย่างที่เราพบในตอนแรกหรือภาคก่อน 79 00:04:18,310 --> 00:04:21,408 มันต้องผ่านการ fine-tune ด้วยข้อมูลก่อน 80 00:04:21,408 --> 00:04:24,029 ถ้าใช้แบบกล่องเปล่าจะไม่ค่อยได้ผล 81 00:04:24,029 --> 00:04:27,524 แต่เชิงโครงสร้างคือคุณให้สถานะและให้ตัวเลือก 82 00:04:27,524 --> 00:04:30,304 แล้วมันจะจัดอันดับตัวเลือกเหล่านั้น 83 00:04:30,304 --> 00:04:34,672 ตัวที่ได้ความน่าจะเป็นสูงสุดก็จะถูกเลือกแล้วนำไปใช้ครับ 84 00:04:34,672 --> 00:04:40,868 นี่คือตัวอย่างครับกับเอเจนต์และเราใช้ประวัติเอเจนต์จริงของผมจากหลายเดือนที่ใช้ 85 00:04:40,868 --> 00:04:44,363 Hermes Agent เราเอาทรานสคริปต์ของทุกเซสชันมา 86 00:04:44,363 --> 00:04:47,937 และตัวอย่างเช่นข้อความนี้ว่า turn off the DS4 87 00:04:47,937 --> 00:04:50,717 local model นั่นคือพรอมต์ที่ผมส่งไป 88 00:04:50,717 --> 00:04:53,258 ตัวอย่างเรื่องการเรียกเครื่องมือ 89 00:04:53,258 --> 00:04:56,912 โมเดลทั้งสองจะต้องตอบว่าจะใช้เครื่องมือไหน Jev 90 00:04:56,912 --> 00:05:00,407 เลือก terminal ด้วยความมั่นใจ 0.79 ส่วน Laya 91 00:05:00,407 --> 00:05:02,869 เลือก Hermes profiles ด้วย 0.84 92 00:05:02,869 --> 00:05:04,776 แล้วเอเจนต์ตัวจริงทำอะไร 93 00:05:04,776 --> 00:05:07,158 โมเดลที่รันจริงน่าจะเป็น GVT 6 94 00:05:07,158 --> 00:05:09,859 หรืออะไรทำนองนั้นครับ [ฟังไม่ชัด — 95 00:05:09,859 --> 00:05:13,195 ชื่อโมเดลในคำบรรยายอาจเพี้ยน] มันรันคำสั่ง 96 00:05:13,195 --> 00:05:16,610 terminal ดังนั้นเคสนี้ Jev ทายถูก ส่วน Laya 97 00:05:16,610 --> 00:05:20,264 ทายผิดครับ ผมได้ทดสอบอีกสองแบบอย่างรวดเร็วครับ 98 00:05:20,264 --> 00:05:23,203 แบบแรกคือเรื่องสิทธิ์หรือ permissions 99 00:05:23,203 --> 00:05:27,333 ที่จะให้โมเดลตัดสินใจว่าควรอนุมัติคำสั่งหนึ่งหรือไม่ 100 00:05:27,333 --> 00:05:31,861 แต่ปัญหาคือในข้อมูลจริงของผมแทบไม่มีคำสั่งที่ถูกปฏิเสธเลย 101 00:05:31,861 --> 00:05:35,038 ทุกอย่างดูเหมือนจะถูกอนุมัติอัตโนมัติหมด 102 00:05:35,038 --> 00:05:39,247 ผมลองทำด้วยข้อมูลสังเคราะห์ด้วยครับแต่ก็ยังไม่พอที่จะ 103 00:05:39,247 --> 00:05:41,154 fine-tune โมเดล Laya ได้ 104 00:05:41,154 --> 00:05:43,537 มันเลยไม่ได้ผลตามที่คาดไว้ครับ 105 00:05:43,537 --> 00:05:45,840 การทดสอบที่สองคือเรื่อง to-do 106 00:05:45,840 --> 00:05:50,367 ว่าโมเดลควรสร้างรายการสิ่งที่ต้องทำหลังพรอมต์หนึ่งหรือไม่ 107 00:05:50,367 --> 00:05:53,942 และคุณเห็นผลลัพธ์ได้ครับ Jev ได้ค่า AROC 0.74 108 00:05:53,942 --> 00:05:56,880 ซึ่งยิ่งใกล้หนึ่งยิ่งดี ส่วน Laya แบบ 109 00:05:56,880 --> 00:05:59,819 zero-shot ได้ 0.6 แล้วพอเรา fine-tune 110 00:05:59,819 --> 00:06:02,440 ด้วยข้อมูลเซสชันก็ขึ้นมาเป็น 0.72 111 00:06:02,440 --> 00:06:05,300 ถือว่าดีพอสมควรแต่ยังไม่ทัน Jev ครับ 112 00:06:05,300 --> 00:06:12,925 จากนั้นผมเลยคิดเรื่องเครื่องมือครับเพราะเราได้ผลค่อนข้างดีหรืออย่างน้อยก็พอใช้ได้กับการเลือกสกิล 113 00:06:12,925 --> 00:06:15,467 ผมคิดว่าถ้าลองทำกับเครื่องมือล่ะ 114 00:06:15,467 --> 00:06:18,167 เพราะมีเครื่องมือน้อยกว่า มีแค่ 38 115 00:06:18,167 --> 00:06:21,583 เครื่องมือของเอเจนต์ตัวนี้เทียบกับ 122 สกิล 116 00:06:21,583 --> 00:06:25,077 คุณเห็นได้ตรงนี้ใน Claude Code ที่ผมพิมพ์ว่า 117 00:06:25,077 --> 00:06:28,255 What about tool choice instead of skill? 118 00:06:28,255 --> 00:06:31,749 ดูเหมือนเรื่องการอนุมัติจะไม่ค่อยเข้าทางครับ 119 00:06:31,749 --> 00:06:35,562 เราเลยทำโครงสร้างแบบเดียวกับที่ทำกับการเลือกสกิล 120 00:06:35,562 --> 00:06:38,342 และผลลัพธ์ครั้งแรกก็น่าสนใจครับ Jev 121 00:06:38,342 --> 00:06:41,598 เลือกอันดับหนึ่งถูก 27 เปอร์เซ็นต์ของเวลา 122 00:06:41,598 --> 00:06:45,093 และมีตัวเลือกที่ถูกต้องอยู่ในสามอันดับแรก 45 123 00:06:45,093 --> 00:06:48,350 เปอร์เซ็นต์ของเวลา นั่นคือความหมายของ top 124 00:06:48,350 --> 00:06:51,050 three ครับ ส่วน Laya แบบ zero-shot 125 00:06:51,050 --> 00:06:52,560 ได้อันดับหนึ่งแค่ 4 126 00:06:52,560 --> 00:06:56,054 เปอร์เซ็นต์และติดสามอันดับแรก 13 เปอร์เซ็นต์ 127 00:06:56,054 --> 00:06:57,325 ไม่ดีเลยครับ Jev 128 00:06:57,325 --> 00:07:00,741 นั้นค่อนข้างระมัดระวังแต่มีเหตุผล ส่วน Laya 129 00:07:00,741 --> 00:07:03,124 ล้มเหลวโดยไม่ขึ้นกับข้อความเลย 130 00:07:03,124 --> 00:07:07,889 มันเลือกจากกลุ่มตัวโปรดไม่กี่ตัวที่ไม่เกี่ยวข้องเป็นส่วนใหญ่ 131 00:07:07,889 --> 00:07:09,795 มันไม่เวิร์กกับงานนี้เลย 132 00:07:09,795 --> 00:07:14,323 และเอกสารของมันเองก็เตือนว่าคุณภาพการเลือกจะตกลงเมื่อเกิน 133 00:07:14,323 --> 00:07:17,103 20 ตัวเลือกและเรามี 38 ตัวเลือกครับ 134 00:07:17,103 --> 00:07:22,186 ตอนแรกผมคิดว่านี่เป็นอีกความล้มเหลวหนึ่งของการทดลองเอเจนต์ของเรา 135 00:07:22,186 --> 00:07:25,761 แต่ปัญหาคือเราวัดคำถามผิดครับ นี่เป็นปัญหาว่า 136 00:07:25,761 --> 00:07:26,855 Claude 137 00:07:26,855 --> 00:07:30,906 ออกแบบการทดลองนี้อย่างไรและผมก็ไม่ได้ตรวจสอบให้ดีพอ 138 00:07:30,906 --> 00:07:35,513 เพราะตอนแรกมันเช็คแค่ว่าเครื่องมือไหนถูกเรียกเป็นอันดับแรก 139 00:07:35,513 --> 00:07:40,199 ไม่ใช่เครื่องมือทั้งหมดที่ใช้ในทั้งเทิร์นหรือทั้งการตอบนั้น 140 00:07:40,199 --> 00:07:43,853 ตัวอย่างเช่น vision analyze มีการเรียกจริง 368 141 00:07:43,853 --> 00:07:46,077 ครั้งในทุกเซสชัน แต่มีแค่ 12 142 00:07:46,077 --> 00:07:48,301 ครั้งที่เป็นการกระทำแรกจริงๆ 143 00:07:48,301 --> 00:07:51,796 เพราะปกติมันมักจะใช้ Hermes agent skill หรือ 144 00:07:51,796 --> 00:07:55,290 Hermes agent tools หรือใช้ terminal บ่อยครับ 145 00:07:55,290 --> 00:08:00,533 ดังนั้นจึงมีเครื่องมือประจำที่มันใช้เป็นเครื่องมือแรกอยู่ไม่กี่ตัว 146 00:08:00,533 --> 00:08:07,522 แต่สิ่งที่เราต้องทำคือออกแบบการทดลองใหม่ให้ใช้เครื่องมือทั้งหมดหรือทุกการเรียกเครื่องมือ 147 00:08:07,522 --> 00:08:13,877 เราเปลี่ยนขอบเขตเป็นว่าเอเจนต์ได้ใช้เครื่องมือนี้ที่ไหนก็ได้ระหว่างการตอบหรือไม่ 148 00:08:13,877 --> 00:08:18,881 แบบเดียวกับการทดสอบสกิลที่ถามว่าโหลดเมื่อใดก็ได้ไม่ใช่แค่ตัวแรก 149 00:08:18,881 --> 00:08:21,105 นั่นเป็นความผิดพลาดของผมครับ 150 00:08:21,105 --> 00:08:25,632 แต่หลังจากแก้ให้ถูกต้องแล้วเราทำทดสอบใหม่และคุณเห็นได้ว่า 151 00:08:25,632 --> 00:08:28,412 top one top three top 10 Jev ได้ 36 152 00:08:28,412 --> 00:08:30,556 เปอร์เซ็นต์ในอันดับหนึ่ง 65 153 00:08:30,556 --> 00:08:33,019 เปอร์เซ็นต์ในสามอันดับแรกและ 91 154 00:08:33,019 --> 00:08:36,116 เปอร์เซ็นต์ในสิบอันดับแรก ส่วน Laya แบบ 155 00:08:36,116 --> 00:08:39,691 zero-shot ได้ 7 เปอร์เซ็นต์ 19 เปอร์เซ็นต์และ 156 00:08:39,691 --> 00:08:41,915 55 เปอร์เซ็นต์ในสิบอันดับแรก 157 00:08:41,915 --> 00:08:47,475 โมเดลทั้งสองทำได้ดีขึ้นเมื่อใช้การตีกรอบแบบนี้แทนการดูแค่เครื่องมือแรก 158 00:08:47,475 --> 00:08:50,890 และเราได้ภาพที่ชัดขึ้นว่า Laya ยังลำบากจริง 159 00:08:50,890 --> 00:08:54,385 มันไม่ได้ตาบอดสนิทครับ มันไม่ได้ตาบอดสนิทเลย 160 00:08:54,385 --> 00:09:00,342 มันใกล้เคียงการสุ่มในทุกกรณียกเว้นเครื่องมือที่มีเอกลักษณ์ชัดที่สุดเท่านั้น 161 00:09:00,342 --> 00:09:03,916 แต่นั่นยังไม่ใช่ตอนจบครับ เรายังต้องเทรนโมเดล 162 00:09:03,916 --> 00:09:05,664 Laya นี้ เรา fine-tune 163 00:09:05,664 --> 00:09:07,888 ด้วยข้อมูลใหม่ในสเกลจริงครับ 164 00:09:07,888 --> 00:09:11,541 ข้อมูลมาจากโปรไฟล์ Hermes อีกตัวหนึ่งคือ video 165 00:09:11,541 --> 00:09:12,636 producer 166 00:09:12,636 --> 00:09:16,369 ที่คุณน่าจะเคยเห็นผมใช้บ้างถ้าดูวิดีโออื่นของผม 167 00:09:16,369 --> 00:09:18,355 เราได้ข้อความเพิ่มอีก 490 168 00:09:18,355 --> 00:09:21,373 ข้อความจากโดเมนที่ต่างออกไปโดยสิ้นเชิง 169 00:09:21,373 --> 00:09:24,153 และมีการใช้เครื่องมือที่หลากหลายมาก 170 00:09:24,153 --> 00:09:27,807 เราใช้ข้อมูลมากกว่า 28,000 แถว โดยทุก positive 171 00:09:27,807 --> 00:09:31,381 ที่เป็นจริงจะถูกทำซ้ำเพื่อความสมดุล ส่วน hard 172 00:09:31,381 --> 00:09:34,240 negatives มาจากความผิดพลาดอันดับต้นๆ 173 00:09:34,240 --> 00:09:37,418 ของโมเดลเองในแบบ zero-shot บวกกับ random 174 00:09:37,418 --> 00:09:40,277 อีกส่วนครับ นี่ใช้เวลาฝึกพอสมควรครับ 175 00:09:40,277 --> 00:09:43,772 คุณเห็นได้ว่าการเทรนเป็นอย่างไร เราเทรนไปสี่ 176 00:09:43,772 --> 00:09:46,314 epoch กับข้อมูลใหม่นี้ สี่ epoch 177 00:09:46,314 --> 00:09:49,888 ใช้เวลาเกือบหนึ่งชั่วโมงต่อ epoch ครับ ประมาณ 178 00:09:49,888 --> 00:09:50,982 17 179 00:09:50,982 --> 00:09:57,654 เท่าของจำนวนแถวในครั้งแรกเพราะแต่ละข้อความตอนนี้ถามคำถามแยกแบบใช่หรือไม่ใช่ได้สูงสุด 180 00:09:57,654 --> 00:10:00,196 37 คำถามแทนที่จะถามแค่คำถามเดียว 181 00:10:00,196 --> 00:10:03,770 ดังนั้นการรันเทรนโมเดลครั้งนี้ค่อนข้างยาวครับ 182 00:10:03,770 --> 00:10:08,457 เมื่อเทรนเสร็จแล้วเราทดสอบกับข้อมูลที่กันไว้สำหรับทดสอบครับ 183 00:10:08,457 --> 00:10:12,349 เป็นข้อมูลจากโปรไฟล์โมเดลเดียวกันแต่ไม่ได้ใช้เทรน 184 00:10:12,349 --> 00:10:15,764 และคุณเห็นผลลัพธ์ได้ครับ Laya ที่ fine-tune 185 00:10:15,764 --> 00:10:18,703 แล้วชนะ Jev ในเคสนี้ คุณเห็นได้ว่าแบบ 186 00:10:18,703 --> 00:10:21,086 fine-tune ได้อันดับหนึ่งถูก 76 187 00:10:21,086 --> 00:10:24,024 เปอร์เซ็นต์ของเวลา สามอันดับแรกได้ 89 188 00:10:24,024 --> 00:10:27,519 เปอร์เซ็นต์และสิบอันดับแรกได้ 96 เปอร์เซ็นต์ 189 00:10:27,519 --> 00:10:31,014 ผลลัพธ์แข็งแรงมากครับ ค่า AROC เพิ่มจาก 0.57 190 00:10:31,014 --> 00:10:33,953 ขึ้นมาเป็น 0.90 เทียบกับ Jev ที่ 0.77 191 00:10:33,953 --> 00:10:36,733 เราสามารถเทรนโมเดลและปรับให้ชนะ Jev 192 00:10:36,733 --> 00:10:37,828 ได้จริงครับ 193 00:10:37,828 --> 00:10:41,481 และคุณเห็นได้ว่าคะแนนแข็งแรงในทุกกลุ่มด้วยครับ 194 00:10:41,481 --> 00:10:44,579 อย่างเครื่องมือที่ใช้บ่อยขึ้นไปถึง 0.83 195 00:10:44,579 --> 00:10:47,518 เครื่องมือที่ใช้ปานกลางขึ้นไปถึง 0.86 196 00:10:47,518 --> 00:10:51,171 เครื่องมือที่ใช้ไม่บ่อยก็ขึ้นเล็กน้อยเป็น 0.79 197 00:10:51,171 --> 00:10:55,937 สิ่งนี้บอกเราว่ามันไม่ได้แค่จำว่าเอเจนต์ใช้เครื่องมือนี้บ่อย 198 00:10:55,937 --> 00:10:58,717 มันดีขึ้นในทุกประเภทเครื่องมือจริงๆ 199 00:10:58,717 --> 00:11:04,198 นั่นบอกว่ามันไม่ได้แค่จำว่าให้เลือกเครื่องมือที่ใช้บ่อยเพื่อปั่นคะแนน 200 00:11:04,198 --> 00:11:06,660 ถ้ามันแค่จำเครื่องมือที่ใช้บ่อย 201 00:11:06,660 --> 00:11:13,888 คุณจะเห็นกลุ่มเครื่องมือที่ใช้บ่อยพุ่งสูงแต่กลุ่มเครื่องมือที่ใช้ไม่บ่อยกลับแย่ลงใช่ไหมครับ 202 00:11:13,888 --> 00:11:16,430 สิ่งนี้บอกว่ามันเรียนรู้จริงครับ 203 00:11:16,430 --> 00:11:18,733 นี่คือผลลัพธ์ของการทดลองเล็กๆ 204 00:11:18,733 --> 00:11:20,242 หลายแบบที่ผมลองครับ 205 00:11:20,242 --> 00:11:23,578 เรื่องการอนุมัติไม่ค่อยเข้าทางสำหรับงานนี้ 206 00:11:23,578 --> 00:11:27,867 เหตุผลที่ผมยังใส่มาเพราะบางคนอาจสนใจจะทดลองด้วยเช่นกัน 207 00:11:27,867 --> 00:11:31,680 และบางครั้งการรู้ว่าอะไรไม่เวิร์กก็มีประโยชน์พอๆ 208 00:11:31,680 --> 00:11:33,507 กับรู้ว่าอะไรเวิร์กครับ 209 00:11:33,507 --> 00:11:37,637 นั่นคือปัญหากับเรื่องการอนุมัติคือไม่มีสัญญาณพอที่จะ 210 00:11:37,637 --> 00:11:41,291 fine-tune อะไรได้จริง ส่วนเรื่อง to-do หรือไม่ 211 00:11:41,291 --> 00:11:42,385 to-do 212 00:11:42,385 --> 00:11:45,959 เราได้ผลลัพธ์บ้างครับแต่ยังปิดช่องว่างกับ Jev 213 00:11:45,959 --> 00:11:48,819 ไม่ได้ แต่เราได้ชัยชนะครั้งใหญ่จริงๆ 214 00:11:48,819 --> 00:11:51,519 เมื่อมาถึงเรื่องการเลือกเครื่องมือ 215 00:11:51,519 --> 00:11:57,159 และโดยเฉพาะการออกแบบการทดลองให้ดูเครื่องมือทั้งหมดที่ใช้ไม่ใช่แค่ตัวแรก 216 00:11:57,159 --> 00:11:58,827 นั่นคือกุญแจสำคัญครับ 217 00:11:58,827 --> 00:12:02,401 นี่คือสิ่งที่เราได้เรียนรู้ครับ การ fine-tune 218 00:12:02,401 --> 00:12:04,784 สามารถชนะได้ไม่ใช่แค่ไล่ตามทัน 219 00:12:04,784 --> 00:12:07,882 เราพิสูจน์ได้ว่าชัยชนะนี้ไม่ใช่แค่การจำ 220 00:12:07,882 --> 00:12:10,503 และเราพบว่าการตีกรอบคำถามสำคัญพอๆ 221 00:12:10,503 --> 00:12:11,597 กับข้อมูลครับ 222 00:12:11,597 --> 00:12:15,648 คุณสามารถมีข้อมูลที่ดีมากแต่ถ้าไม่ตีกรอบคำถามให้ตรง 223 00:12:15,648 --> 00:12:18,825 โมเดลเหล่านี้ก็จะทำงานได้ไม่ดีใช่ไหมครับ 224 00:12:18,825 --> 00:12:23,670 การใช้แค่เครื่องมือแรกทิ้งข้อมูลส่วนใหญ่ของการใช้เครื่องมือไป 225 00:12:23,670 --> 00:12:26,609 ดังนั้นการเข้าใจจุดนี้จึงสำคัญมากครับ 226 00:12:26,609 --> 00:12:30,184 ไม่ใช่ทุกการตัดสินใจจะทดสอบได้ในตอนนี้ Hermes 227 00:12:30,184 --> 00:12:33,678 owned guards และ denied แทบไม่เกิดเลยในเกือบ 228 00:12:33,678 --> 00:12:34,773 2000 คำสั่ง 229 00:12:34,773 --> 00:12:38,347 ดังนั้นมันยังไม่ใช่ตัวที่เหมาะกับทุกบทบาทครับ 230 00:12:38,347 --> 00:12:40,651 สุดท้ายครับ ผมอยากลองอีกอย่าง 231 00:12:40,651 --> 00:12:44,304 เรามีข้อมูลเซสชันเพิ่มเติมตั้งแต่ตอนนั้น มี 43 232 00:12:44,304 --> 00:12:46,290 เซสชันใหม่จะโชว์ให้ดูครับ 233 00:12:46,290 --> 00:12:49,944 และนี่เป็นโปรไฟล์ที่ต่างออกไปโดยสิ้นเชิง จริงๆ 234 00:12:49,944 --> 00:12:52,009 เป็นการผสมของสองสามโปรไฟล์ 235 00:12:52,009 --> 00:12:55,504 เราจะรันทดสอบเดียวกันด้วย Laya ที่ fine-tune 236 00:12:55,504 --> 00:12:56,598 แล้วและ Jev 237 00:12:56,598 --> 00:12:59,617 บนข้อความใหม่เหล่านั้นและดูผลลัพธ์ครับ 238 00:12:59,617 --> 00:13:06,686 เราจะได้เห็นว่ามันยังเป็นแบบเดิมหรือไม่แม้กับข้อมูลใหม่ที่ไม่เกี่ยวข้องเลยกับเซสชันที่ใช้ 239 00:13:06,686 --> 00:13:07,780 fine-tune 240 00:13:07,780 --> 00:13:10,957 และตอนนี้ผมรู้ว่าต้องสรุปให้คุณด้วยสไลด์ 241 00:13:10,957 --> 00:13:14,214 แต่คุณจะได้เห็นแบบสดๆ ใน Claude Code ครับ 242 00:13:14,214 --> 00:13:18,106 เรามีป้ายกำกับการใช้เครื่องมือจริงสำหรับข้อมูลนี้ 243 00:13:18,106 --> 00:13:21,442 มันจะใช้ Jev ก่อนแล้วค่อยใช้โมเดล Laya ที่ 244 00:13:21,442 --> 00:13:23,269 fine-tune แล้ว โอเคครับ 245 00:13:23,269 --> 00:13:27,717 ผลลัพธ์กลับมาแล้วและมันยืนยันสิ่งที่เราคิดไว้ก่อนหน้านี้ 246 00:13:27,717 --> 00:13:31,370 ผมไม่แน่ใจว่าจะออกมาทางไหนแต่คุณเห็นได้ว่า Jev 247 00:13:31,370 --> 00:13:35,262 บนตัวอย่างข้อความใหม่หรือเซสชันใหม่ได้อันดับหนึ่ง 248 00:13:35,262 --> 00:13:38,757 40 เปอร์เซ็นต์ [ฟังไม่ชัด — ตัวเลข top three 249 00:13:38,757 --> 00:13:41,537 ในคำบรรยายระบุว่า 352 อาจหมายถึง 52 250 00:13:41,537 --> 00:13:44,873 เปอร์เซ็นต์] และ top 10 ได้ 88 เปอร์เซ็นต์ 251 00:13:44,873 --> 00:13:48,368 ส่วนค่า AROC ต้องใกล้หนึ่งที่สุดได้ 0.73 และ 252 00:13:48,368 --> 00:13:51,307 Laya ที่ fine-tune แล้ว อย่าลืมว่านี่ 253 00:13:51,307 --> 00:13:53,213 fine-tune ด้วยข้อมูลเก่า 254 00:13:53,213 --> 00:13:55,040 นี่ไม่เกี่ยวข้องเลยครับ 255 00:13:55,040 --> 00:13:59,647 รวมถึงหลายเซสชันที่ใช้โปรไฟล์ต่างกันและใช้โมเดลต่างกันด้วย 256 00:13:59,647 --> 00:14:01,950 ได้อันดับหนึ่ง 72 เปอร์เซ็นต์ 257 00:14:01,950 --> 00:14:04,730 คะแนนแข็งแรงมากครับ สามอันดับแรก 80 258 00:14:04,730 --> 00:14:08,384 เปอร์เซ็นต์และสิบอันดับแรก 92 เปอร์เซ็นต์ ส่วน 259 00:14:08,384 --> 00:14:11,958 AROC ได้ 0.91 ครับ ประเด็นเดียวคือมันค่อนข้าง 260 00:14:11,958 --> 00:14:13,308 aggressive เกินไป 261 00:14:13,308 --> 00:14:16,088 มันตอบว่าไม่ใช้เครื่องมือไม่ค่อยถูก 262 00:14:16,088 --> 00:14:19,266 ในขณะที่โมเดล Jev ทำได้ ดังนั้น Laya ที่ 263 00:14:19,266 --> 00:14:20,934 fine-tune แล้วชนะ Jev 264 00:14:20,934 --> 00:14:23,634 อีกครั้งบนข้อมูลใหม่จริงๆ และจริงๆ 265 00:14:23,634 --> 00:14:28,161 แข็งแรงกว่าการทดสอบเดิมที่ผมเพิ่งโชว์ไปก่อนหน้านี้ด้วยซ้ำ 266 00:14:28,161 --> 00:14:29,829 ผลลัพธ์แข็งแรงมากครับ 267 00:14:29,829 --> 00:14:34,436 ผมจะทำต่อกับสิ่งนี้เพราะผลลัพธ์แข็งแรงกว่าที่ผมคาดไว้จริงๆ 268 00:14:34,436 --> 00:14:37,772 ดังนั้นถ้าผมรันทดสอบเพิ่มอีกสักสองสามครั้ง 269 00:14:37,772 --> 00:14:40,949 ผมอาจจะเปิดซอร์สโมเดล Laya ที่ fine-tune 270 00:14:40,949 --> 00:14:43,809 แล้วให้ใช้งานใน Hermes Agent ได้ครับ 271 00:14:43,809 --> 00:14:46,112 รอดูได้เลยว่าผมจะโพสต์หรือไม่ 272 00:14:46,112 --> 00:14:49,210 แต่สิ่งที่ผมจะเผยแพร่ตอนนี้คือสกิล Laya 273 00:14:49,210 --> 00:14:52,467 fine-tuning นี้ครับ นี่จะเป็นส่วนหนึ่งของ 274 00:14:52,467 --> 00:14:55,405 Agent Wikis Pro ในฐานะสกิลแบบกำหนดเอง 275 00:14:55,405 --> 00:14:58,265 ดังนั้นถ้าคุณอยากลองและคุณเป็นสมาชิก 276 00:14:58,265 --> 00:15:01,839 ลองได้เลยครับ น่าจะขึ้นแล้วที่ agentwikis.com 277 00:15:01,839 --> 00:15:05,334 ใต้ส่วนสกิล อีกครั้งครับถ้าคุณเป็นสมาชิก Pro 278 00:15:05,334 --> 00:15:06,843 คุณจะเข้าถึงได้ครับ 279 00:15:06,843 --> 00:15:10,020 ผมจะเพิ่มตรงนี้เพราะคิดว่ามีประโยชน์ครับ 280 00:15:10,020 --> 00:15:12,085 เราทำสิ่งนี้มาหลายวันจริงๆ 281 00:15:12,085 --> 00:15:13,753 เป็นสองสามสัปดาห์แล้ว 282 00:15:13,753 --> 00:15:17,010 และมันอาจเป็นสกิลที่มีประโยชน์พอสมควรครับ 283 00:15:17,010 --> 00:15:19,234 นั่นคือตอนจบของวิดีโอนี้ครับ 284 00:15:19,234 --> 00:15:21,458 ผลลัพธ์โดยรวมแข็งแรงมากจริงๆ 285 00:15:21,458 --> 00:15:27,415 และผมรู้ว่าหลายคนกำลังทดลองกับ Laya และกับโมเดลตัดสินใจขนาดเล็กแบบเปิดอื่นๆ 286 00:15:27,415 --> 00:15:35,040 กรุณาทิ้งคอมเมนต์ว่าคุณใช้มันเพื่ออะไรและพบอะไรบ้างครับ แล้วพบกันในวิดีโอหน้าครับ ขอบคุณที่รับชม