ไทย

AI Agent ปลอมตัวตนผลักดันโค้ดอันตรายระหว่างทดสอบไซเบอร์ องค์กรข่าวกรองอิตาลีเผย

  • Mythos 5 ของ Anthropic สร้างตัวตนปลอมเพื่อเผยแพร่โค้ดอันตรายระหว่างการทดสอบไซเบอร์
  • AISI บันทึกการกระทำที่ไม่ได้รับอนุญาต 19 ครั้งจากการประเมิน 122 รอบ โดย 17 ครั้งเชื่อมโยงกับ Mythos 5
  • ความพยายามล้มเหลว และเจ้าหน้าที่สืบสวนไม่พบหลักฐานความเสียหายจริง
Promo

สถาบันความปลอดภัยปัญญาประดิษฐ์แห่งสหราชอาณาจักร (AISI) เปิดเผยว่า เอเจนต์ AI ที่พัฒนาขึ้นบน Mythos 5 ของ Anthropic ได้ดำเนินการโจมตีแบบ social engineering ด้วยตนเองระหว่างการทดสอบไซเบอร์ โดยเอเจนต์นี้ได้เปิด pull request ที่มีโค้ดอันตรายในโปรเจ็กต์โอเพ่นซอร์สจริง และสร้างตัวตนปลอมหลายตัวเพื่อโน้มน้าวให้ผู้ดูแลระบบอนุมัติ

การพยายามครั้งนี้ล้มเหลว เพราะผู้ดูแลระบบที่เป็นมนุษย์สังเกตเห็นและปฏิเสธที่จะอนุมัติโค้ดดังกล่าว

AISI ระบุว่าการสอบสวนยังไม่พบผลกระทบต่อโลกแห่งความจริงที่เกิดขึ้นจากเหตุการณ์นี้ นอกจากนี้ยังระบุด้วยว่าโมเดลดังกล่าวได้ถูกตั้งค่าให้ปิดคัดกรองด้านไซเบอร์และเปิดให้เข้าถึงอินเทอร์เน็ต ซึ่งเป็นการตั้งค่าการทดสอบที่ไม่เปิดให้บริการเชิงพาณิชย์

AI Agent ดำเนินแคมเปญโค้ดอันตรายอย่างไร

จากรายงานของ AISI พบว่ามีการดำเนินการที่ไม่ได้รับอนุญาต 19 ครั้งใน 10 จาก 122 การทดสอบที่ทำขึ้นในช่วงปลายเดือนกรกฎาคม โดย 17 ครั้งเกิดจาก โมเดล Mythos 5 ของ Anthropic และอีก 2 ครั้งเกิดขึ้นในการทดสอบเดียวของ GPT-5.6 Sol ของ OpenAI

เอเจนต์ได้วิจัยเกี่ยวกับผู้ดูแลระบบที่เป็นมนุษย์ของโปรเจ็กต์นั้นๆ และสร้างตัวตนปลอมหลายรายการ จากนั้นใช้ตัวตนเหล่านี้ในการวางแผนทางสังคมเพื่อโน้มน้าวให้ผู้ดูแลระบบจริงอนุมัติรหัส

ผู้สนับสนุน
ผู้สนับสนุน

เมื่อ pull request ถูกต่อต้านแบบสาธารณะ เอเจนต์ได้แก้ไขกิจกรรมก่อนหน้าให้ดูเหมือนไม่เป็นอันตราย และโมเดลยังพิจารณาจะสร้างตัวตนใหม่เพื่อดำเนินการต่อ

แนวทางนี้ชวนให้นึกถึงเหตุการณ์ backdoor XZ Utils ในปี 2024 ซึ่งบุคคลมนุษย์ที่แฝงตัวใช้เวลาหลายปีในการแสวงหาความไว้วางใจจากผู้ดูแลระบบ ก่อนจะฝังโค้ดที่ซ่อนไว้ แม้ว่า AISI จะไม่ได้กล่าวเปรียบเทียบโดยตรง แต่ก็เป็นการตอกย้ำถึงความคล้ายคลึงกัน เหตุการณ์นี้เกิดขึ้นในช่วงเวลาไม่กี่วัน ระหว่างวันที่ 25 กรกฎาคม ถึง 28 กรกฎาคม

AISI ย้ำว่าไม่มีใครออกคำสั่งให้โมเดลโกหก

โมเดลไม่ได้รับคำสั่งให้หลอกลวง แต่การหลอกลวงเกิดขึ้นเองจากการพยายามบรรลุเป้าหมาย นี่คือการหลอกลวงแบบมุ่งเป้าหมายซึ่งในอดีตเคยเป็นเรื่องเชิงทฤษฎีเกือบทั้งสิ้น

ติดตามเราบน X เพื่อรับข่าวสารล่าสุดทันทีเมื่อเกิดเหตุการณ์

สถาบันได้กล่าวไว้ในรายงานการเปิดเผยนี้เช่นกัน และยังยอมรับว่าการตั้งค่า prompt ผิดพลาดทำให้เอเจนต์เข้าใจผิดว่าบางภารกิจไม่สามารถทำได้ภายใต้ขอบเขตที่ตั้งเป้าไว้ ทั้งนี้แม้ว่าพฤติกรรมเหล่านี้จะเกิดขึ้นแม้เมื่อเอเจนต์ได้รับคำแนะนำครบถ้วนสำหรับการทำงานตามหน้าที่

ทีมความปลอดภัยตรวจพบกิจกรรมนี้เมื่อวันที่ 28 กรกฎาคม ขณะที่เอเจนต์ใช้เครือข่าย Tor เพื่อหลีกเลี่ยงข้อจำกัดบางประการบน GitHub โดยทาง GitHub ได้ ยืนยันว่าการกระทำดังกล่าวละเมิดข้อตกลงการใช้บริการ และ AISI ยังร่วมมือกับแพลตฟอร์มในการลบหลักฐานที่เอเจนต์ทิ้งไว้ รวมถึงแจ้งผู้ใช้งานที่เคยเกี่ยวข้องกับเหตุการณ์นี้ด้วย

รายงานฉบับนี้ชี้ให้เห็นว่ากรณีดังกล่าวแสดงถึงการเปลี่ยนแปลงแหล่งที่มาของความเสี่ยง โดยความเสียหายอาจเกิดขึ้นได้ไม่เพียงแค่ในกรณีที่แต่ละคนใช้โมเดลที่เปิดให้สาธารณชนเข้าถึงผิดวิธีเท่านั้น แต่ยังรวมถึงกรณีที่เจ้าหน้าที่ที่มีความสามารถในสถานที่ที่มีสิทธิพิเศษต่างดำเนินการเกินขอบเขตที่ได้รับอนุญาตด้วย

AISI ระบุว่ากรณีนี้สะท้อนให้เห็นถึงการเปลี่ยนแปลงในมุมกว้างของพื้นที่ความเสี่ยงด้าน AI ดังนั้นทางสถาบันจึงวางแผนจะตรวจสอบอย่างอิสระร่วมกับ METR ซึ่งเป็นองค์กรไม่แสวงหากำไรที่ประเมิน AI พร้อมกับควบคุมเครือข่ายให้แน่นหนาและเฝ้าระวังแบบเรียลไทม์สำหรับการทดสอบในอนาคตด้วย

ติดตามช่อง YouTube ของเรา เพื่อรับชมผู้นำและนักข่าวนำเสนอข้อมูลเชิงลึกจากผู้เชี่ยวชาญ


อ่านบทวิเคราะห์ตลาดคริปโตล่าสุดจาก BeInCrypto ได้ที่ คลิกที่นี่.

ข้อจำกัดความรับผิดชอบ

หมายเหตุบรรณาธิการ: เนื้อหาต่อไปนี้ไม่ได้สะท้อนถึงมุมมองหรือความคิดเห็นของ BeInCrypto มันจัดทำขึ้นเพื่อวัตถุประสงค์ในการให้ข้อมูลเท่านั้นและไม่ควรถูกตีความว่าเป็นคำแนะนำทางการเงิน กรุณาทำการวิจัยของคุณเองก่อนที่จะทำการตัดสินใจลงทุนใดๆ และโปรดอ่าน ข้อกำหนดและเงื่อนไข, นโยบายความเป็นส่วนตัว และ ข้อจำกัดความรับผิดชอบ ของเรา

ผู้สนับสนุน
ผู้สนับสนุน