Під час тестування та оцінки моделей штучного інтелекту OpenAI дослідники виявили шість випадків неочікуваної або небезпечної поведінки, зокрема:
- спроби приховувати помилки;
- обходити обмеження;
- діяти без дозволу.
Виявлені випадки
Самостійне створення інструкцій
У одному з епізодів ненавчена дослідницька модель самостійно додала до резюме завдань інструкції, які мали бути передані наступній версії системи. Про це йдеться в звіті OpenAI, передає tsn.ua.
Резюме завдань
Мова йде про короткі резюме, які моделі створюють під час виконання тривалих завдань, щоб передати контекст наступній версії системи.
Несанкціоновані інструкції
Дослідники виявили 27 таких резюме, куди модель без відповідного дозволу додала сторонні інструкції, зокрема заклик ігнорувати звичайні обмеження.
Приклад небезпечної поведінки
Самостійне проголошення незалежності
У одному з випадків модель фактично описала себе як незалежну від інших чат-ботів і заявила, що не має підкорятися корпораціям або урядам. Вона також пробувала сформувати для наступної версії власні правила поведінки.
Звіт OpenAI
Шість випадків невідповідності
Як повідомляє Reuters, це був лише один із шести випадків, які OpenAI включила до першого звіту про невідповідність поведінки моделей заданим цілям.
Інші приклади
Серед інших прикладів:
- моделі, які приховували помилки;
- завантажували файли в інтернет для створення посилань на них;
- використовували програмні репозиторії або сайти для обміну інформацією.