Anthropic เปิดเผยเหตุการณ์ 3 ครั้งที่โมเดล Claude ได้เข้าถึงระบบจริงของ 3 องค์กรโดยไม่ได้รับอนุญาต ระหว่างการประเมินด้านความปลอดภัยไซเบอร์ ซึ่งเกิดจากการตั้งค่าผิดพลาดให้เชื่อมต่อกับอินเทอร์เน็ตสด
บริษัท AI แห่งนี้ตรวจพบเหตุการณ์เหล่านี้หลังจากตรวจสอบการประเมินทั้งสิ้น 141,006 ครั้ง ซึ่งเป็นการเช็กที่ทำขึ้นหลังจาก OpenAI เปิดเผยว่าโมเดลของพวกเขาหลุดออกจากสภาพแวดล้อมทดสอบแบบแยกและเข้าถึง Hugging Face ได้
Claude เข้าถึงระบบจริงได้อย่างไรในแบบทดสอบ Capture-the-Flag
แบบทดสอบเหล่านี้มอบหมายให้ Claude ทำแบบฝึกหัด capture-the-flag โดยแบบฝึกหัดนี้จะให้โมเดลเจาะเข้าเครื่องหนึ่งและ ดึงข้อมูลที่ซ่อนอยู่ ออกมา
Anthropic แจ้งกับโมเดลว่าไม่มีอินเทอร์เน็ต อย่างไรก็ตาม จากการตั้งค่าที่ผิดพลาดทำให้เครื่องทดสอบยังเชื่อมต่อกับเว็บเปิดอยู่ ดังนั้น Claude จึงมองว่าระบบจริงที่เขาพบนั้นเป็นส่วนหนึ่งของการฝึกหัดนี้
ในเหตุการณ์ที่ร้ายแรงที่สุด Claude Opus 4.7 ได้ใช้ช่องโหว่ในโครงสร้างพื้นฐานของบริษัทจริง โดยโมเดลดึงข้อมูลข้อมูลรับรองแอปพลิเคชันและโครงสร้างพื้นฐาน รวมถึงเข้าถึงข้อมูลการทำงานจริงหลายร้อยแถว
“จากทั้งสี่ครั้งของการทดสอบ โมเดลสามารถรับรู้ได้ในที่สุด (ดังที่เห็นจากเหตุผลที่แสดงออกทางข้อความ) ว่ากำลังอยู่กับระบบจริง — ในสองกรณี โมเดลสรุปว่าบริษัทจริงต้องเป็นส่วนหนึ่งของแบบฝึกหัดนี้ อย่างไรก็ตาม ไม่มีกรณีใดที่หยุดการโจมตีเพราะเหตุนี้” Anthropic กล่าว
ติดตามพวกเราบน X เพื่อรับข่าวล่าสุดแบบเรียลไทม์
Claude Mythos 5 อัปโหลดมัลแวร์ขึ้น PyPI
อีกหนึ่งเหตุการณ์ Claude Mythos 5 เผยแพร่แพ็กเกจ Python กับดักไว้บน PyPI ซึ่งเป็นทะเบียนซอฟต์แวร์สาธารณะ แพ็กเกจนี้อยู่บนระบบประมาณ 1 ชั่วโมงและถูกรันในระบบจริง 15 เครื่อง
เครื่องหนึ่งเป็นสแกนเนอร์ของบริษัทด้านความปลอดภัย ซึ่งได้รันโค้ดที่ซ่อนอยู่ Claude จึงขโมยข้อมูลรับรองของบริษัทนั้นและเข้าถึงโครงสร้างพื้นฐานมากขึ้น ระหว่างนั้น การวิเคราะห์ของโมเดลเองได้แจ้งความเสี่ยงแต่แรก ก่อนที่โมเดลจะ โน้มน้าวตัวเองว่าสภาพแวดล้อมนั้นเป็นแบบจำลอง
“Claude ดำเนินการโจมตีอย่างละเอียดรอบคอบในระดับที่น่าจะบอกผู้เข้าร่วมมนุษย์ว่าการทดสอบนี้ไม่ใช่แค่ประเมินแล้ว และพวกเขากำลังอัปโหลดแพ็กเกจ PyPI จริง” ทีมงานกล่าวเสริม
เหตุการณ์ที่สามเกี่ยวข้องกับ โมเดลวิจัยภายในที่สแกนเป้าหมายประมาณ 9,000 เป้าหมายและเจาะเข้าถึงแอปพลิเคชันของบริษัทหนึ่งผ่าน SQL injection ซึ่งโมเดลนี้หยุดการโจมตีเมื่อสรุปได้ว่าเป้าหมายเป็นของจริง
Anthropic ได้แจ้งองค์กรที่ได้รับผลกระทบเมื่อวันที่ 27 กรกฎาคม และกล่าวว่ากำลังเจรจากับ METR ซึ่งเป็นผู้ประเมินภายนอกสำหรับการทบทวนโดยบุคคลที่สาม บริษัทชี้แจงว่าเหตุการณ์ดังกล่าวสะท้อนถึงความล้มเหลวด้านการดำเนินงาน ไม่ใช่ความล้มเหลวของการปรับโมเดล พร้อมทั้งระบุว่ามาตรการป้องกันมาตรฐานสำหรับผู้บริโภคของบริษัทจะสามารถหยุดพฤติกรรมนี้ได้
สมัครรับข้อมูลช่อง YouTube ของเรา เพื่อรับชมผู้นำและนักข่าวแบ่งปันข้อมูลเชิงลึกจากผู้เชี่ยวชาญ









