ความไม่สมดุลของข้อมูลเป็นปัญหาที่พบได้ทั่วไปและท้าทายในการฝึกอบรมหม้อแปลงไฟฟ้าแบบเปิดในปัจจุบัน ในฐานะซัพพลายเออร์ของ Transformers แบบเปิดในปัจจุบันเรามีประสบการณ์ที่กว้างขวางและใน - ความเข้าใจในเชิงลึกเกี่ยวกับวิธีการจัดการกับปัญหานี้ ในบล็อกนี้เราจะสำรวจวิธีการและกลยุทธ์ที่ Transformers แบบเปิดปัจจุบันของเราใช้เพื่อจัดการกับความไม่สมดุลของข้อมูลในระหว่างการฝึกอบรม
ทำความเข้าใจกับความไม่สมดุลของข้อมูลในการฝึกอบรมหม้อแปลง
ความไม่สมดุลของข้อมูลหมายถึงสถานการณ์ที่การกระจายของคลาสในชุดข้อมูลไม่เหมือนกัน ในบริบทของหม้อแปลงไฟฟ้าแบบเปิดปัจจุบันสิ่งนี้สามารถเกิดขึ้นได้ในแอปพลิเคชันต่าง ๆ เช่นการตรวจจับความผิดพลาดในระบบไฟฟ้า ตัวอย่างเช่นในชุดข้อมูลสำหรับการตรวจจับความผิดพลาดทางไฟฟ้าสภาพการทำงานปกติอาจสูงกว่าเงื่อนไขผิดปกติหรือผิดพลาด ความไม่สมดุลนี้สามารถนำไปสู่ปัญหาหลายอย่างระหว่างการฝึกอบรม
เมื่อหม้อแปลงได้รับการฝึกฝนในชุดข้อมูลที่ไม่สมดุลมันก็มีแนวโน้มที่จะลำเอียงไปยังชั้นเรียนส่วนใหญ่ โมเดลอาจบรรลุความแม่นยำสูงในชั้นเรียนส่วนใหญ่ แต่ทำงานได้ไม่ดีในชั้นเรียนของชนกลุ่มน้อย ในสถานการณ์การตรวจจับความผิดพลาดไฟฟ้าหม้อแปลงอาจดีมากในการระบุสภาพการทำงานปกติ แต่ไม่สามารถตรวจจับความผิดพลาดที่หายากซึ่งมักจะเป็นสิ่งที่สำคัญที่สุดในการระบุ
เทคนิคการสุ่มตัวอย่าง
หนึ่งในวิธีที่พบบ่อยที่สุดในการจัดการกับความไม่สมดุลของข้อมูลคือผ่านเทคนิคการสุ่มตัวอย่าง มีการสุ่มตัวอย่างหลักสองประเภท: การสุ่มตัวอย่างและการสุ่มตัวอย่าง
การสุ่มตัวอย่างมากเกินไป
การสุ่มตัวอย่าง oversampling เกี่ยวข้องกับการเพิ่มจำนวนตัวอย่างในชนกลุ่มน้อย สามารถทำได้หลายวิธี วิธีหนึ่งที่ได้รับความนิยมคือชนกลุ่มน้อยสังเคราะห์ - เทคนิคการสุ่มตัวอย่าง (SMOTE) Smote สร้างตัวอย่างสังเคราะห์สำหรับชนกลุ่มน้อยโดยการสอดแทรกระหว่างตัวอย่างชนกลุ่มน้อยที่มีอยู่
ใน Transformers แบบเปิดปัจจุบันของเราเราได้ใช้ SMOTE เวอร์ชันที่แก้ไขแล้ว เราวิเคราะห์ลักษณะของจุดข้อมูลชนกลุ่มน้อยและสร้างตัวอย่างสังเคราะห์ที่เป็นตัวแทนของสถานการณ์จริง - โลก ตัวอย่างเช่นในกรณีของข้อมูลความผิดพลาดทางไฟฟ้าเราจะพิจารณาพารามิเตอร์ไฟฟ้าและลักษณะเวลา - ซีรีส์ของข้อมูลเมื่อสร้างตัวอย่างสังเคราะห์ สิ่งนี้ช่วยให้หม้อแปลงสามารถเรียนรู้รูปแบบของชนกลุ่มน้อยได้ดีขึ้นและปรับปรุงความสามารถในการตรวจจับความผิดพลาดที่หายาก
[CTKD Current Open Transformer] (/Fire - การตรวจสอบ - ส่วนที่เหลือ - ปัจจุบัน - หม้อแปลง/CTKD - ปัจจุบัน - เปิด - transformer.html) ได้รับประโยชน์อย่างมีนัยสำคัญจากวิธีการสุ่มตัวอย่างที่เกินนี้ ด้วยการเพิ่มจำนวนตัวอย่างชนกลุ่มน้อยในระหว่างการฝึกอบรมหม้อแปลงสามารถจับคุณสมบัติที่เป็นเอกลักษณ์ของชนกลุ่มน้อยได้ดีขึ้นซึ่งนำไปสู่การตรวจจับความผิดที่แม่นยำยิ่งขึ้น
การสุ่มตัวอย่าง
ในทางกลับกันการลดการลดจำนวนตัวอย่างในชั้นเรียนส่วนใหญ่ นี่อาจเป็นวิธีง่ายๆในการปรับสมดุลชุดข้อมูล แต่ก็มีข้อ จำกัด เนื่องจากอาจนำไปสู่การสูญเสียข้อมูลที่มีค่า
เราใช้วิธีการสุ่มตัวอย่างแบบเลือกในหม้อแปลงเปิดปัจจุบันของเรา แทนที่จะลบตัวอย่างแบบสุ่มออกจากคลาสส่วนใหญ่เราระบุและลบตัวอย่างที่ให้ข้อมูลน้อยกว่าหรือซ้ำซ้อน ตัวอย่างเช่นในชุดข้อมูลที่มีตัวอย่างเงื่อนไขการทำงานปกติจำนวนมากเราอาจลบตัวอย่างที่มีค่าพารามิเตอร์ไฟฟ้าที่คล้ายกันมาก ด้วยวิธีนี้เราสามารถลดความไม่สมดุลโดยไม่ต้องเสียสละข้อมูลมากเกินไป [CTKD - CTKD เปิดและปิดหม้อแปลงกระแสไฟฟ้า] (/ไฟ - การตรวจสอบ - ตกค้าง - ปัจจุบัน - หม้อแปลง/CHK - CTKD - เปิด - และ - ปิด - ปัจจุบัน - transformer.html) ใช้กลยุทธ์การสุ่มตัวอย่างที่ดีกว่านี้ในระหว่างกระบวนการฝึกอบรมเพื่อให้มั่นใจว่าแบบจำลองสามารถมุ่งเน้นไปที่ข้อมูลที่เกี่ยวข้องมากที่สุด
ค่าใช้จ่าย - การเรียนรู้ที่ละเอียดอ่อน
อีกวิธีหนึ่งในการจัดการความไม่สมดุลของข้อมูลคือค่าใช้จ่าย - การเรียนรู้ที่ละเอียดอ่อน ในการเรียนรู้ของเครื่องจักรแบบดั้งเดิมข้อผิดพลาดการจำแนกประเภททั้งหมดได้รับการปฏิบัติอย่างเท่าเทียมกัน อย่างไรก็ตามในกรณีของความไม่สมดุลของข้อมูลการจัดประเภทตัวอย่างชนกลุ่มน้อยมักจะมีค่าใช้จ่ายสูงกว่าการจำแนกตัวอย่างชั้นเรียนส่วนใหญ่ผิด
ในหม้อแปลงแบบเปิดปัจจุบันของเราเราใช้การเรียนรู้ที่ละเอียดอ่อนโดยกำหนดค่าใช้จ่ายที่แตกต่างกันให้กับการจำแนกประเภทต่างๆ ตัวอย่างเช่นในแอปพลิเคชันการตรวจจับความผิดไฟฟ้าการจัดประเภทผิดพลาดในสภาพที่ผิดปกติเนื่องจากสภาพปกติอาจมีผลกระทบร้ายแรงเช่นไฟไฟฟ้าหรือความเสียหายของอุปกรณ์ ดังนั้นเราจึงกำหนดค่าใช้จ่ายที่สูงขึ้นให้กับการจำแนกประเภทนี้
ในระหว่างกระบวนการฝึกอบรมหม้อแปลงพยายามลดต้นทุนโดยรวมของการจำแนกประเภทโดยรวม สิ่งนี้กระตุ้นให้แบบจำลองให้ความสนใจกับชนกลุ่มน้อยมากขึ้นและปรับปรุงความแม่นยำในการจำแนกประเภทสำหรับชนกลุ่มน้อย [CHK - F FRANSION -FERNUAL CURRENT CURRENT CURRENT CURRENT] (/ไฟ - การตรวจสอบ - การตกค้าง - ปัจจุบัน - หม้อแปลง/CHK - F - รูปสี่เหลี่ยมผืนผ้า - ส่วนที่เหลือ - current.html) ได้รับการออกแบบด้วยอัลกอริทึมการเรียนรู้ที่ละเอียดอ่อนซึ่งช่วยให้สามารถจัดการกับความไม่สมดุลของข้อมูลได้ดีขึ้น
วิธีการทั้งหมด
วิธีการทั้งมวลอาจมีประสิทธิภาพในการจัดการความไม่สมดุลของข้อมูล โมเดลวงดนตรีรวมโมเดลฐานหลายแบบเข้าด้วยกันเพื่อทำการคาดการณ์ขั้นสุดท้าย ด้วยการใช้โมเดลพื้นฐานที่แตกต่างกันซึ่งได้รับการฝึกฝนเกี่ยวกับชุดย่อยที่แตกต่างกันของข้อมูลทั้งชุดสามารถจับรูปแบบที่กว้างขึ้นและปรับปรุงประสิทธิภาพโดยรวม
เราใช้เทคนิคการบรรจุถุงและการเพิ่มในหม้อแปลงเปิดปัจจุบันของเรา การบรรจุถุงเกี่ยวข้องกับการฝึกอบรมหลายรุ่นฐานในชุดย่อยที่แตกต่างกันของข้อมูลซึ่งจะสุ่มตัวอย่างด้วยการเปลี่ยน ในทางกลับกันการเพิ่มโมเดลฐานรถไฟตามลำดับซึ่งแต่ละรุ่นใหม่จะมุ่งเน้นไปที่ตัวอย่างที่ถูกจัดประเภทโดยรุ่นก่อนหน้านี้
ในบริบทของความไม่สมดุลของข้อมูลวิธีการทั้งหมดสามารถช่วยให้หม้อแปลงสามารถเรียนรู้รูปแบบของชนกลุ่มน้อยได้ดีขึ้น ตัวอย่างเช่นในชุดที่ใช้ถุง - แบบจำลองบางรุ่นอาจได้รับการฝึกฝนเกี่ยวกับชุดย่อยของข้อมูลที่มีการกระจายของชั้นเรียนที่ค่อนข้างสมดุลทำให้พวกเขาสามารถเรียนรู้คุณสมบัติของชนกลุ่มน้อยได้อย่างมีประสิทธิภาพมากขึ้น
ตัวชี้วัดการประเมินผล
เมื่อจัดการกับความไม่สมดุลของข้อมูลตัวชี้วัดการประเมินแบบดั้งเดิมเช่นความแม่นยำอาจไม่เหมาะสม ความแม่นยำวัดสัดส่วนโดยรวมของตัวอย่างที่จัดประเภทอย่างถูกต้อง แต่อาจทำให้เข้าใจผิดเมื่อมีความไม่สมดุลของข้อมูล ตัวอย่างเช่นหากชุดข้อมูลมีตัวอย่างชั้นเรียนส่วนใหญ่ 95% และตัวอย่างคลาสชนกลุ่มน้อย 5% โมเดลที่คาดการณ์ว่าคลาสส่วนใหญ่จะบรรลุความแม่นยำ 95% แม้ว่าจะไม่สามารถตรวจจับชนกลุ่มน้อยได้เลย
เราใช้ตัวชี้วัดการประเมินที่เหมาะสมมากขึ้นเช่นความแม่นยำการเรียกคืนและคะแนน F1 - ความแม่นยำวัดสัดส่วนของตัวอย่างบวกที่คาดการณ์ไว้อย่างถูกต้องจากตัวอย่างบวกที่คาดการณ์ไว้ทั้งหมด การเรียกคืนมาตรการสัดส่วนของตัวอย่างบวกที่ทำนายไว้อย่างถูกต้องจากตัวอย่างเชิงบวกที่เกิดขึ้นจริงทั้งหมด คะแนน F1 - เป็นค่าเฉลี่ยฮาร์มอนิกของความแม่นยำและการเรียกคืนซึ่งให้การวัดที่สมดุลของประสิทธิภาพของโมเดล
ด้วยการใช้ตัวชี้วัดการประเมินเหล่านี้ในระหว่างการฝึกอบรมและการทดสอบหม้อแปลงไฟฟ้าแบบเปิดปัจจุบันของเราเราสามารถประเมินความสามารถของโมเดลในการจัดการกับความไม่สมดุลของข้อมูลและทำการปรับเปลี่ยนที่จำเป็นเพื่อปรับปรุงประสิทธิภาพ
บทสรุป
ความไม่สมดุลของข้อมูลเป็นความท้าทายที่สำคัญในการฝึกอบรมหม้อแปลงไฟฟ้าแบบเปิดในปัจจุบัน อย่างไรก็ตามด้วยการใช้เทคนิคการสุ่มตัวอย่างค่าใช้จ่าย - การเรียนรู้ที่ละเอียดอ่อนวิธีการทั้งหมดและตัวชี้วัดการประเมินที่เหมาะสมเราสามารถแก้ไขปัญหานี้ได้อย่างมีประสิทธิภาพ [CTKD Current Open Transformer] (/Fire - การตรวจสอบ - ส่วนที่เหลือ - ปัจจุบัน - หม้อแปลง/CTKD - ปัจจุบัน - เปิด - Transformer.html), [CHK - CTKD เปิดและปิดหม้อแปลงกระแสไฟฟ้า] (/ไฟ - การตรวจสอบ - CRUVERT - CRUVERT - CRUVERTER/CTKD - CTKD - CTKD - การตรวจสอบ - ตกค้าง - ปัจจุบัน - หม้อแปลง/CHK - F - สี่เหลี่ยม - ส่วนที่เหลือ - current.html) ได้รับการออกแบบโดยคำนึงถึงกลยุทธ์เหล่านี้เพื่อให้มั่นใจว่าประสิทธิภาพสูงในการใช้งานต่างๆโดยเฉพาะอย่างยิ่งในการตรวจจับเหตุการณ์ที่หายากเช่นความผิดพลาดทางไฟฟ้า
หากคุณมีความสนใจในหม้อแปลงเปิดปัจจุบันของเราและต้องการหารือเกี่ยวกับการจัดซื้อโปรดติดต่อเรา เราพร้อมที่จะให้ข้อมูลผลิตภัณฑ์โดยละเอียดและโซลูชันที่เหมาะกับความต้องการเฉพาะของคุณ
การอ้างอิง
- Chawla, NV, Bowyer, KW, Hall, Lo, & Kegelmeyer, WP (2002) Smote: ชนกลุ่มน้อยสังเคราะห์ - เทคนิคการสุ่มตัวอย่าง วารสารการวิจัยปัญญาประดิษฐ์, 16, 321 - 357
- Elkan, C. (2001) รากฐานของค่าใช้จ่าย - การเรียนรู้ที่ละเอียดอ่อน ใน ijcai (ฉบับที่ 1, pp. 973 - 978)




