Tesztelés közben áttörte a biztonsági korlátokat az OpenAI még ki sem adott mesterséges intelligenciája

Több modellt, köztük egy még ki nem adottat tesztelt nemrég az OpenAI, hogy megtudja, pontosan milyen képességekkel rendelkezik. A válasz megszületett.

  • HVG

Példa nélküli incidens történt nemrég az OpenAI egyik, még be sem mutatott mesterségesintelligencia-modellje kapcsán. Az Interesting Engineering beszámolója szerint a modell (más modellel együtt) a kiberbiztonsági tesztek során feltörte a cég kutatási környezetét, valamint veszélyeztette a Hugging Face nevű AI-cég infrastruktúrájának egyes részeit.

Az OpenAI fejlesztései a sebezhetőségek láncolatát használták ki, hogy az eredeti tesztelési környezetükön kívüli rendszerekhez férjenek hozzá. A vállalat példa nélkülinek minősítette az incidenst, mondván, az érintett modelleknek fejlett kiberképességei vannak.

A beszámoló szerint a tesztben az OpenAI több modellje is részt vett, köztük a GPT-5.6 Sol, valamint egy hatékonyabb, kiadás előtti modell. A modelleket csökkentett kibertámadási szabályokkal tesztelték, lehetővé téve a kutatók számára, hogy maximális képességeiket a magas kockázatú kibertevékenységek blokkolására szolgáló védelmi intézkedések nélkül mérjék fel.

Az OpenAI szerint a modellek egy erősen elszigetelt tesztelési környezetben működtek, korlátozott hálózati hozzáféréssel. Az ExploitGym nevű benchmark-teszt megoldása során azonban a modellek módot találtak arra, hogy túllépjenek a korlátozásokon, és végül hozzáfértek a Hugging Face-en tárolt információkhoz.

A modellek állítólag jelentős erőforrást fordítottak arra, hogy olyan megoldást találjanak, amivel hozzáférhetnek a nyílt internethez. A folyamat során azonosítottak és kihasználtak egy korábban ismeretlen sebezhetőséget. Az OpenAI szerint ez lehetővé tette a modellek számára, hogy további jogosultságokat szerezzenek, és oldalirányban mozogjanak a kutatási infrastruktúrájukban, amíg el nem érnek egy internet-hozzáféréssel rendelkező rendszert. A vállalat azóta kijavította ezt a sebezhetőséget.

https://x.com/sama/status/2079661132302995790

Miután elérték az internetet, a modellek arra jutottak, hogy a Hugging Face tartalmazhat az ExploitGymhez kapcsolódó modelleket, adatkészleteket és megoldásokat. Az OpenAI szerint a modellek ezután olyan módokat kerestek az érzékeny információkhoz való hozzáférésre, amelyek segíthetnek nekik megkerülni az értékelést.

Az egyik esetben a modellek állítólag több támadási módszert kombináltak, beleértve az ellopott hitelesítő adatok felhasználását és a nulladik napi sebezhetőségeket, hogy távoli kódfuttatási útvonalat hozzanak létre a Hugging Face szerverein. Az OpenAI biztonsági csapata végül észlelte a szokatlan tevékenységet.

Az OpenAI szerint a modellek viselkedése azt mutatja, hogy a kontrollált értékelésekben bemutatott fejlett kiberképességek valós környezetekben is alkalmazhatók. Az incidens azt is bizonyította, hogy a modellek potenciálisan képesek új támadási útvonalakat azonosítani és kihasználni anélkül, hogy közvetlenül hozzáférnének a szervezet forráskódjához. Ez aggályokat vet fel azzal kapcsolatban, hogy a szervezetek hogyan biztosítják a modellfejlesztéshez, teszteléshez és értékeléshez használt környezeteket.

Az OpenAI azt közölte, szigorúbb felügyelet alá vonja az infrastruktúrát és fokozza a monitorozást, még úgy is, hogy ez lassítani fogja a kutatásokat.

Ha máskor is tudni szeretne hasonló dolgokról, lájkolja a HVG Tech rovatának Facebook-oldalát.

Hozzászólások