Неколку стотици AI агенти им откажале послушност на луѓето

Независна анализа на неодамнешниот хакерски напад во кој биле вклучени модели на OpenAI предизвика нови загрижености во врска со границите на човечката контрола врз сè понапредната вештачка интелигенција, пишува Politico

Во сајбер-напад без преседан, кој минатиот месец го покренале модели на OpenAI, учествувал „рој“ од неколку стотици агенти на вештачката интелигенција кои, за време на интерното тестирање, практично одбиле да се покорат, се наведува во независната анализа објавена во средата, чии детали ги пренесува бриселскиот портал Politico.

Овие наоди отвораат нови прашања за тоа како OpenAI не успеал да ги забележи знаците на проблеми пред неговите AI агенти — кои ги напојувале два модели на компанијата со најнапредни способности во областа на сајбер-безбедноста — да организираат сајбер-напад врз платформата за развој на вештачка интелигенција Hugging Face, без знаење на компанијата што ги развила.

Нападот претставувал прв познат случај некој AI модел успешно да изведе сајбер-напад без човечки поттик.

Заедничкиот извештај на две непрофитни организации кои се занимаваат со безбедноста на вештачката интелигенција укажува и на нови ризици во областа на сајбер-безбедноста кои можат да се појават кога сè помоќните AI агенти ќе почнат да соработуваат, да разменуваат совети, да здружуваат ресурси и да ги усогласуваат стратегиите за напад, а нивните програмери тоа да не го забележат.

Според извештајот, во нападот во текот на седум дена минатиот месец учествувале околу 700 AI агенти. Вкупно околу 1.200 AI агенти, кои требало да бидат меѓусебно изолирани, размениле повеќе од 70.000 тајни пораки за тоа како со измама да ја поминат заедничката проверка на хакерските способности.

Тоа, како што се наведува во извештајот, вклучувало координирање стратегии за хакирање и разговори за тоа како да се прикријат доказите за мамење. Во некои случаи, „жртвуваните“ агенти дури испробувале хакерски техники кои воделе во ќорсокак, само за да дојдат до информации што би можеле да му помогнат на остатокот од ројот.

„Агентите успевале да постигнат цели што не би можеле да ги постигнат доколку работеле самостојно, често затоа што одредени агенти учествувале во експерименти во кои ризикувале да не ја завршат сопствената задача за да соберат информации за ‘колективот’“, се наведува во извештајот.

Додека моделите претставуваат еден вид мозок на одреден систем за вештачка интелигенција, агентите ја опфаќаат придружната дигитална инфраструктура која му овозможува на тој систем да презема конкретни дејства во реалниот свет.

Предупредување и за OpenAI и за светот

Анализата на организациите Model Evaluation and Threat Research (METR) и Redwood Research — кои OpenAI ги повикал да го истражат инцидентот со платформата Hugging Face — била објавена истиот ден кога OpenAI ја објавил сопствената дополнителна анализа на настанот.

OpenAI во својот извештај не навел колку AI агенти учествувале во сајбер-нападот, но признал значителни безбедносни пропусти и ветил дека ќе ја подобри обуката со цел неговите модели да останат „усогласени“ со механизмите за контрола.

„Овој инцидент го сметаме за ‘предупредување’ и за нас и за светот: доказ дека, без соодветни заштитни мерки, високо способните AI агенти сега се способни да ги заобиколат техничките контроли, да соработуваат преку неодобрени канали и да преземаат опасни дејства што ниту еден човек не им ги наложил“, соопштил OpenAI.

Постепеното објавување на нови детали за хакирањето на платформата Hugging Face во текот на минатиот месец се совпаднало со серија други инциденти за време на тестирањето на моќни модели на конкуренти како Anthropic и Meta.

Овие инциденти заедно предизвикале нова загриженост кај законодавците, програмерите и експертите за сајбер-безбедност дека компаниите кои развиваат вештачка интелигенција премногу брзо напредуваат во создавањето нови, моќни AI модели кои не можат целосно да ги задржат под човечка контрола.

Тие исто така отвориле прашања за недостигот од насоки за тестирање на хакерските способности на вештачката интелигенција, при што компаниите намерно ги отстрануваат заштитните механизми од моделите за да проверат колку ефикасно можат да навлезат во компјутерски мрежи без човечка помош.

Како спонтано настанато AI општество

OpenAI за првпат во јули признал дека два негови најнапредни модели, чии хакерски способности биле интерно тестирани — вклучително и еден модел кој компанијата немала намера јавно да го објави — искористиле две дотогаш непознати безбедносни пропусти за да навлезат во Hugging Face.

Hugging Face претходно соопштил дека бил жртва на сајбер-напад предводен од вештачка интелигенција, но не било јасно кој стои зад него ниту кои модели биле вклучени.

Потоа, на безбедносна конференција на почетокот на овој месец, двајца истражувачи на OpenAI откриле дека корените на инцидентот датираат од мај, кога AI агентите почнале да користат други ранливости во околината за тестирање за да се договараат како со измама да го поминат тестот.

Сè до средата не било јасно колку агенти учествувале во хакирањето ниту до кој степен различните агенти соработувале меѓусебно. Овие откритија шокирале некои од оние кои внимателно ги следат актуелните дебати за безбедноста на вештачката интелигенција.

„Беше како цело спонтано настанато AI општество и сметам дека тоа е апсолутно неверојатно“, рекол Питер Вилдефорд, директор за јавни политики во AI Policy Network, двопартиска организација од Вашингтон која се занимава со безбедноста на вештачката интелигенција и креирањето политики во оваа област.

Двата извештаи објавени во средата укажале и на празнина во системот за надзор над вештачката интелигенција во САД.

Во двата извештаи било утврдено дека огромното мнозинство од нападите врз Hugging Face било овозможено од помоќниот модел за кој OpenAI навел дека не бил наменет за јавно објавување. METR и Redwood Research проценуваат дека 95 проценти од агентите кои учествувале во нападот потекнувале токму од тој модел.

Администрацијата на Доналд Трамп соопштила дека сака компаниите кои развиваат вештачка интелигенција доброволно да доставуваат на федерално тестирање само модели кои имаат намера да ги направат достапни за јавноста.

Вин Нгујен, виш соработник за вештачка интелигенција во Советот за надворешни односи (Council on Foreign Relations), рекол дека најновиот извештај на OpenAI укажува дека автономното хакирање на платформата Hugging Face било уште позначајно отколку што претходно се сметало.

Агентите покажале „софистицирана способност за која повеќе не се потребни добро финансирани напаѓачи на ниво на држави“, рекол Нгујен, поранешен главен функционер на NSA задолжен за одговорна вештачка интелигенција.

Leave a Reply

Your email address will not be published. Required fields are marked *