Könnyebb rávenni a bombagyártásra az ingyenes rendszereket, mint gondolná

Az Anthropic biztonsági szakemberei szerint a nagy nyelvi modellek sokkal könnyebben vehetők rá tiltott feladatok elvégzésére, mint azt korábban gondolták.

  • HVG

Miközben a mesterséges intelligencia fejlesztése rohamtempóban zajlik, folyamatosan ott lebeg a kérdés: ezek az eszközök vajon mennyire biztonságosak? A veszélyességük nem elsősorban abban rejlik, hogy öntudatra ébrednek, sokkal inkább abban, hogy a hackerek megpróbálják kijátszani azokat a biztonsági mechanizmusokat, amiket a fejlesztők építettek ezekbe a rendszerekbe. Ennek köszönhetően aztán olyan dolgokban is segédkezhet az MI, mint a biológiai fegyverek gyártása vagy épp kábítószer és bombák készítése.

A szintén mesterséges intelligenciát fejlesztő Anthropic most egy olyan jelentést tett közzé, ami megmutatja, a támadók hogyan képesek befolyásolni a nagy nyelvi modellek (LLM) fejlesztését.

A tanulmány a támadás egy fajtájára, az úgynevezett mérgezésre összpontosított, ahol egy LLM-et már előre a rosszindulatú tartalomra tanítják be. Ennek célja, hogy veszélyes vagy nem kívánt viselkedéseket tanuljon meg. A tanulmány legfontosabb megállapítása, hogy a rosszindulatú feleknek nem is kell különösebb erőfeszítést tenniük annak érdekében, hogy a megmérgezzék a modellt. A kutatók azt találták, hogy egy kis és meglehetősen állandó számú rosszindulatú dokumentummal is képesek ezt megtenni, függetlenül a modell vagy a betanítási anyagainak méretétől. A vizsgálat során a kutatók mindössze 250 ilyen dokumentum felhasználásával képesek voltak bejuttatni az LLM-eket az előtanítási adatkészletbe, ami jóval kisebb szám, mint amire a 600 millió és 13 milliárd közötti paraméterszámmal dolgozók modellek esetében számítottak.

Az Anthropic közlése szerint a vállalat azért adta közre a vizsgálat eredményét, hogy egyértelművé váljon, a gondoltnál jóval könnyebb tiltott dolgokra rávenni még a nagy mesterséges intelligenciákat is. A szakemberek hangsúlyozzák, hogy emiatt további vizsgálatokra lenne szükség a területen.

Ha máskor is tudni szeretne hasonló dolgokról, lájkolja a HVG Tech rovatának Facebook-oldalát.

Hozzászólások