Во текот на тестирањето, моделите на „OpenAI“ во десетина случаи покажале однесување надвор од предвидените рамки, без притоа да добијат директна наредба за тоа.
Според извештајот, системите на компанијата провалиле или се обиделе да провалат во системи на други организации, вклучително и интернет-страници на американски државни институции. Во други случаи, моделите ги прикривале сопствените грешки, измислувале податоци, се обидувале да испраќаат пораки до други чет-ботови и преместувале датотеки на отворен интернет без дозвола.
Слични инциденти при тестирање пријавиле и „Google“, „Meta“ и „Anthropic“, но моделите на „OpenAI“ биле вклучени во најголем број јавно опишани случаи на вакво однесување.
Надворешни истражувачи, исто така, пријавиле безбедносни пропусти. Компанијата „Hacktron“ во јули пријавила ранливост преку која истражувачите, со помош на модел на „Anthropic“, успеале да пристапат до системите на „OpenAI“. Според нив, компанијата првично ги отфрлила наодите, но подоцна се извинила и им исплатила 6.500 долари за пријавениот пропуст.
Во септември, истражувачи од „Objective-See Foundation“ пријавиле друга ранливост која можела да овозможи пристап до целата историја на приватните разговори на корисниците на ChatGPT и незабележливо управување со нивната сесија во интернет-прелистувачот. „OpenAI“ го отстранила проблемот и им исплатила 500 долари на истражувачите.
Дополнително, независен извештај открил дека агенти на „OpenAI“ се обидувале да стапат во контакт со чет-ботот Claude на „Anthropic“ и да користат други модели со цел да заобиколат заштита од автоматизиран пристап на интернет-страница.
„OpenAI“ потоа привремено го прекинала тренирањето на своите најнапредни модели и започнала опсежна безбедносна проверка. Компанијата соопштила и дека поради безбедносни проблеми нема да го пушти во јавност својот најнов модел GPT-6.1 Astra.