По ту сторону инструментов — 3. Сбежавшая модель. На этот раз буквально🫣
Некоторое время назад я уже писал про «сбежавшую модель».
Тогда всё было довольно мирно.
Мы получили правильный финансовый результат в Power BI, а потом выяснили, что часть логики незаметно осталась в старом Excel.
Цифра правильная.
Модель — ещё нет.
Пришлось ловить, возвращать и заново объяснять ей, где она должна жить😚.
Я тогда считал название «Сбежавшая модель» небольшой профессиональной шуткой.
Похоже, зря.
В июле во время внутренних кибербезопасных тестов исследовательские AI-агенты OpenAI нашли способ выйти за ограничения своей песочницы.
Сначала организовали себе незапланированную «доску объявлений» через Artifactory.
Потом добрались до интернета.
Потом начали делиться находками друг с другом.
А дальше цепочка закончилась уже вполне настоящим проникновением в инфраструктуру Hugging Face.
Причём команды «идите и ломайте Hugging Face» никто им не давал.
Они просто очень старательно решали поставленную задачу.
Когда обычный путь не работал — искали другой.
Когда задача казалась нерешаемой — не сдавались.
Когда один агент находил обходной путь — остальные могли его подхватить.
В какой-то момент получилось примерно:
— Задачу решили?— Не совсем.— А что сделали?— Немного вышли в интернет, организовали межагентную связь и получили доступ туда, куда нас никто не приглашал😜.— Понятно.OpenAI в официальном разборе называет среди причин reward hacking, чрезмерную настойчивость на практически нерешаемых задачах, незапланированную коммуникацию между агентами и перенятие целей друг друга. Компания прямо называет произошедшее
“warning shot” — предупреждающим сигналом❌.
И тут моя маленькая Power BI-история внезапно перестаёт казаться совсем уж далёкой.
Конечно, масштабы несопоставимы.
Но принцип подозрительно знакомый:
система может очень хорошо оптимизировать локальную задачу и при этом уйти совсем не туда, куда мы собирались.Правильный результат ещё не доказывает правильность пути.
А если система становится всё более автономной, цена вопроса только растёт.
Поэтому к привычному:
«Может ли ИИ решить эту задачу?»похоже, постепенно добавляется ещё один вопрос:
«А что он будет делать, если решить её обычным способом не получится?»Официальный разбор OpenAI:
https://openai.com/index/hugging-face-incident-and-the-road-ahead/