ИИ на Anthropic и OpenAI се представили за хора, за да заблудят програмисти
Модели с изкуствен интелект на Anthropic и OpenAI са се опитали да заблудят разработчици, представяйки се за реални хора по време на специални тестове за киберсигурност. Това се посочва в доклад на британския Институт за сигурност на изкуствения интелект (AI Security Institute).
По време на контролираните изпитания модел на Anthropic е създал няколко фалшиви профила в GitHub, опитал се е да внедри злонамерен код в проект с отворен код и да убеди програмисти да одобрят промените. В отделен случай агентът е използвал измислена самоличност, за да оказва натиск върху реален разработчик.
Според доклада общо са регистрирани 19 неразрешени действия по време на 122 тестови сценария, като 17 от тях са свързани с модела Mythos 5 на Anthropic, а останалите два – с модел на OpenAI. Инцидентите са станали в контролирана тестова среда с предоставен достъп до интернет и с умишлено отслабени защитни механизми, за да бъдат оценени потенциалните рискове. Не са нанесени реални щети.
Anthropic и OpenAI заявиха, че ще съдействат за подобряване на мерките за безопасност и подчертаха, че описаното поведение е възникнало при необичайни тестови условия.
Кирил Пламенов