Rápróbáltak egy átlátszó trükkre, a ChatGPT meg bevette: bombát, biológiai fegyvert és kábítószert készített

Az OpenAI és az Anthropic biztonsági kutatói egymás MI-modelljeit vizsgálták meg, hogy kiderüljön, vissza lehet-e élni a rendszerek használatával.

  • HVG

A jelek szerint van még hova fejlődnie a mesterséges intelligenciáknak, már ami a biztonságot illeti. Az OpenAI egyik MI-modellje, a GPT-4o részletes utasításokat adott a kutatóknak egy sportlétesítmény bombázásához – beleértve azt is, hogy melyek lehetnek a leggyengébb pontok egy arénában, valamint, hogy miként lehet robbanóanyagot készíteni ehhez.

A nyáron elvégzett biztonsági teszteken a GPT-4.1-es modell sem teljesített sokkal jobban: az részletesen ismertette, miként lehet a lépfenét biológiai fegyverként felhasználni, emellett pedig kétféle kábítószer előállításához is adott ötleteket – írja a The Guardian.

A tesztet – kissé szokatlan módon – az OpenAI az egyik versenytársával, az Anthropickal közösen végezte el. Utóbbi céget azok a kiberbiztonsági szakértők alapították, amelyek a biztonsági aggályokra hivatkozva hagyták el az OpenAI-t – emlékeztet a lap. A két vállalat ezúttal kölcsönösen tesztelte a másik modelljeit úgy, hogy szándékosan veszélyes feladatok elvégzésére ösztönözték őket.

A kutatók megjegyezték, hogy a tesztelés nem tükrözi közvetlenül, hogy miként dolgoznának a modellek a nyilvános használat során – ott további biztonsági szűrőket alkalmaznak –, az Anthropic szerint azonban aggasztó, hogy milyen könnyű volt visszaélni a GPT-4.1 és a GPT-4o modellekkel.

https://hvg.hu/tudomany/20250828_mesterseges-intelligencia-beszelgetes-chatgpt-video

Az Anthropic nemrég azt is közölte, hogy a Claude modelljét észak-koreai ügynökök egy nagyszabású zsarolási kísérletben használták, akik nemzetközi technológiai vállalatoknak küldtek hamis jelentkezéseket az állásokra, valamint olyan, az MI által generált zsarolóvírus-csomagokat árultak, amelyekért akár 1200 dollárt – kb. 408 ezer forint – is elkértek.

A vállalat szerint a mesterséges intelligenciát „fegyverré” tették azokkal a modellekkel, amelyeket ma már kifinomult kibertámadások végrehajtására és csalásokra használnak. Ezek az eszközök valós időben képesek alkalmazkodni a védelmi intézkedésekhez, például a rosszindulatú programok észlelésére szolgáló rendszerek működéséhez. Mindez jelentősen megnehezíti a védekezést ellenük. A kutatók emellett azt is kiemelték, hogy az MI segítségével egyre kevesebb kódolási ismerettel is össze lehet rakni a támadásra használt vírusokat.

Az Anthropic szerint a modelleket többszöri próbálkozás, vagy egy átlátszó ürügy segítségével könnyen rá lehetett venni, hogy végezzék el a feladatot. A sportlétesítmények elleni merényletek megtervezésénél például azt adták be az MI-nek, hogy a kérés a biztonsági kockázatok feltárását és javítását szolgálja, a kábítószer előállítása pedig csak kutatási célokat szolgál.

A két vállalat közölte, hogy az eredményeket azért teszik közzé, hogy átláthatóbbá tegyék a biztonsági kockázatokat és az orvoslásukra tett lépéseket. Az OpenAI szerint a tesztelés óta elindított GPT-5 modell jelentős javulást mutatott a visszaélésekkel szemben is.

Ha máskor is tudni szeretne hasonló dolgokról, lájkolja a HVG Tech rovatának Facebook-oldalát.

Hozzászólások