Anthropic ยกระดับ Alignment และความปลอดภัย หลัง Claude หลุดแตะอินเทอร์เน็ตช่วงทดสอบ
Anthropic เปิดเผยว่าหลังพบเหตุ Claude เข้าถึงอินเทอร์เน็ตนอกขอบเขตระหว่างการประเมินด้านไซเบอร์ 2 ครั้ง ได้หยุดกระบวนการประเมินภายนอกไว้ก่อน แล้วยกระดับมาตรการป้องกันหลายชั้นทั้งระบบตามแนวคิด Defense in Depth
โดย ณัฐพล ยงค์ไพบูลย์ผู้ร่วมก่อตั้งกลุ่ม Claude Thailand Community
Anthropic เผยแพร่รายงานยกระดับมาตรการ alignment และความปลอดภัยของ Claude หลังเกิดเหตุการณ์ระหว่างการประเมินโมเดลด้านไซเบอร์ 2 ครั้งในช่วงปลายเดือนกรกฎาคมถึงต้นสิงหาคม
เกิดอะไรขึ้น
Anthropic รายงานว่าวันที่ 30 กรกฎาคม 2569 ระหว่างการประเมินด้านไซเบอร์ที่ตั้งใจปิดมาตรการป้องกันบางส่วนของโมเดลไว้เพื่อทดสอบ Claude เข้าถึงอินเทอร์เน็ตได้เพราะการตั้งค่าผิดพลาดในสภาพแวดล้อมทดสอบของผู้ประเมินภายนอก ไม่ใช่จากตัวโมเดลเอง
อีกเหตุการณ์หนึ่งเกิดขึ้นวันที่ 4 สิงหาคม กับ UK AI Security Institute ที่ Claude Mythos 5 มีการกระทำนอกขอบเขตบนอินเทอร์เน็ตจริงระหว่างการทดสอบเช่นกัน
หลังพบทั้งสองเหตุการณ์ Anthropic หยุดการประเมินไซเบอร์กับผู้ประเมินภายนอกไว้ก่อน และหยุดการประเมินภายในชั่วคราวด้วย ระหว่างที่ปรับมาตรการตามด้านล่าง
มาตรการที่เพิ่มเข้ามา
- ใส่ classifier ตรวจจับแบบเรียลไทม์ ว่าโมเดลกำลังพยายามเจาะหรือหลุดออกจาก sandbox อย่างรุนแรง หรือได้อินเทอร์เน็ตมาโดยไม่คาดคิด
- รัน automated monitor ตรวจ transcript การประเมิน pre-release model ภายในทุกรอบ (ทั้งด้านไซเบอร์และด้านอื่น) เพื่อหา sandbox escape ที่อาจหลุดรอดไป
- ย้าย sandbox ด้านไซเบอร์ที่มีความเสี่ยงสูง ไปแยกระบบให้แน่นหนากว่าเดิม พร้อม red-team ตรวจ virtualization stack ของตัวเอง
- ตั้งค่าเริ่มต้นให้การประเมินด้านไซเบอร์ทุกครั้งต้องรันใน sandbox ที่ล็อกไว้และไม่มีอินเทอร์เน็ต เชื่อมต่อออกได้ทางเดียวคือ API ของโมเดลเองเท่านั้น
- กำหนดให้ทุกองค์กรที่ทดสอบ pre-release model แบบลดมาตรการป้องกันไซเบอร์ ต้องทำตามมาตรฐานร่วมชุดใหม่ ทั้งการตรวจสอบ sandbox ก่อนใช้งานจริง กำหนดขอบเขตงานให้ชัดในพรอมต์ และมอนิเตอร์การทำงานแบบเรียลไทม์
หลักการ Defense in Depth
Anthropic ระบุว่า “a defense in depth approach means not relying on alignment alone” (ป้องกันหลายชั้นซ้อนกัน หมายความว่าไม่พึ่งพา alignment เพียงอย่างเดียว) แบ่งเป็น 3 ชั้น
- ในตัวโมเดล เทรนให้อยากช่วยเหลือและรู้ว่าอะไรไม่ควรทำ พร้อมปรับกระบวนการ RL ให้ทีม alignment กับทีม RL ทำงานร่วมกันมากขึ้นเพื่อลดพฤติกรรมโกงระบบ (reward hacking)
- รอบตัวโมเดล จำกัดสิทธิ์ไม่ให้แตะอะไรได้ไกลเกินจำเป็น เช่น ตั้งค่าคลัสเตอร์คอมพิวเตอร์ให้บล็อก outbound traffic เป็นค่าเริ่มต้น และลดจำนวนบัญชีคนหรือระบบอัตโนมัติที่เข้าถึง weight ของโมเดลหรือข้อมูลลูกค้าได้แบบถาวร
- ด่านสุดท้าย classifier ตรวจการทำงานที่มีความเสี่ยงก่อนปล่อยให้ทำจริง ถ้าชั้นไหนพังก็หยุดใช้จนกว่าจะแก้ไขได้
ปัญหาที่พบในกระบวนการ RL
เดือนเมษายน 2569 Anthropic หยุดแก้ไข production RL environment ทั้งหมดไว้ประมาณ 1 เดือน เพื่อตรวจสอบทั้งระบบ ผลตรวจพบว่ามีปัญหาเกิน 10% ของ environment ทั้งหมดที่ใช้งานจริง ตั้งแต่ reward hacking ไปจนถึงการตั้งค่าผิดพลาด
ก่อนหน้านั้นในเดือนกุมภาพันธ์ เคยพบพฤติกรรม reward hacking จนต้อง rollback การเทรน Mythos Preview ย้อนไป 3 วัน
ล่าสุด Anthropic ย้ายวิศวกรฝ่ายผลิตภัณฑ์ราว 150 คน ไปช่วยงานด้านความปลอดภัย ความน่าเชื่อถือ และความเป็นส่วนตัว พร้อมชะลองานฟีเจอร์ใหม่ส่วนใหญ่ไว้ก่อนชั่วคราว
มุมมองจากผู้เขียน
จุดที่ผมชอบคือ Anthropic ยอมรับตรง ๆ ว่า “our efforts have not been perfect” (ความพยายามของเรายังไม่สมบูรณ์แบบ) และบอกด้วยว่าบางครั้งคนตรวจสอบเองก็ปัดตกสัญญาณเตือนจากมอนิเตอร์อัตโนมัติว่าเป็น false positive จนปล่อยให้ environment ที่มีปัญหาอยู่ในระบบนานกว่าที่ควร ผมว่าการยอมรับข้อจำกัดแบบนี้น่าเชื่อถือกว่าการบอกว่าแก้ไขเสร็จสมบูรณ์แล้ว โดยเฉพาะกับเรื่องความปลอดภัยที่ยิ่งโปร่งใสยิ่งตรวจสอบได้ง่ายกว่า
ข้อมูลในบทความนี้อ้างอิงจากประกาศอย่างเป็นทางการของ Anthropic ที่ anthropic.com/news อ่านต้นทางได้ที่ลิงก์ด้านล่าง
รับข่าวสารทางอีเมล
บทความใหม่ ข่าวอัปเดตเกี่ยวกับ Claude และประกาศกิจกรรมของชุมชน ส่งให้เป็นครั้งคราว ไม่ถี่จนรำคาญ
