Tavaly december végén adta ki a hangcsoui székhelyű DeepSeek vállalat R1 nevű nagy nyelvi modelljét, amely szinte pillanatok alatt hihetetlenül népszerűvé vált. Teljesítményénél már csak a betanítási költsége volt figyelemreméltóbb: az R1-Zero előzetes kiadásának betanítása állítólag csak a töredékébe került annak, amit mások költöttek LLM-jeikre. A fejlesztők által nemrégiben kiadott tanulmány már konkrét számokat is közöl: ez az összeg mindössze 294 ezer dollár volt, de persze szükség volt még 512 darab Nvidia H800 chipre is (a cikk korábbi, januárban megjelent verziója még nem tartalmazta ezt az információt).
Az említett összeg meglepő, hiszen töredéke a konkurensek dollármilliárdjainak (az amerikai modellfejlesztők csak idén több tízmilliárd dollárt költöttek), fel is vetődik a kérdés: hogyan tudta a DeepSeek elérni ezt? A válasz: a megerősítésnek nevezett stratégiával. Hogy ez pontosabban mit is jelent, arról a Nature folyóiratban közöltek tanulmányt.
A legtöbb, logikai feladatokat ellátó MI-modellt ember által jegyzett adatokon és bemutatókon kell betanítani, hogy elsajátítsák, hogyan oldjanak meg bizonyos problémákat. Ez az eljárás viszont drága és időigényes is, mivel a modellek egyre nagyobb kihívást jelentő feladatokat kapnak. A DeepSeek viszont más utat követ, és azzal javítja modellje logikai és kimeneti teljesítményét, hogy addig ösztönzi azt egy próbálkozási és hibázási folyamat végrehajtására, amíg meg nem kapja a helyes választ.
https://hvg.hu/tudomany/20250128_deepseek-r1-mesterseges-intelligencia-chatbot-teszt-kina-cenzura-ebx
„Ahogy a gyermek navigálja avatárját a játék világában, próbálgatás és hiba útján megtanulja, hogy egyes műveletekkel (például érmék gyűjtésével) pontokat tud szerezni, míg mások nullára állítják vissza a pontszámukat. Hasonlóképpen, a DeepSeek-R1 magas pontszámot kap, ha helyesen válaszol a kérdésekre, és alacsonyat, ha rossz válaszokat ad. Ez ellentétben áll a korábbi, felszólításon alapuló megközelítésekkel, amelyek inkább ahhoz hasonlítottak, mintha azt várták volna el a gyermektől, hogy úgy sajátítsa el a videojátékok menetét, hogy elolvassa az utasításokat, illetve a felügyelt tanuláson alapuló megközelítésekhez, amelyek ahhoz hasonlíthatók, mintha azt kérték volna el a gyermektől, hogy úgy ismerje meg a játékot, hogy több százszor nézi, ahogy a testvére játssza” – magyarázzák a kutatók a módszer lényegét.
Az R1 által előállított kimenetekhez rendelt pontozási rendszerrel (helyes válaszok több pont) elérték azt, hogy az LLM képes volt önállóan helyes következtetésre jutni, miközben a magasabb pontszámokat kereste. Ez különösen a matematikai és programozási kérdéseknél működött jól, amelyekre általában ellenőrizhetően helyes válasz van. Tény viszont, hogy amikor arra kérték a modellt, hogy a válaszához logikai következtetést generáljon, időnként váltott az angol és a kínai nyelv között. Emellett 10 ezer szavas vagy annál hosszabb magyarázatokat is adott.
A Nature folyóiratban megjelent tanulmányban közölt számok máris vitát indítottak el. A The Register szerint a 294 ezer dollár remekül hangzik, azonban úgy tűnik, a kínai kutatók összekeverték a betanítás utáni megerősítéses tanulást a DeepSeek V3 által használt költségesebb betanítás előtti folyamattal. A DeepSeek kutatócsoportja ugyanis nyilvánosságra hozta, hogy mennyi számítási energiát használtak az alapmodell betanításához. A DeepSeek V3-at 2048 H800 GPU-n tanították körülbelül két hónapig. Összesen a modell 2,79 millió GPU-órát igényelt, a becsült költség 5,58 millió dollár volt.
Mivel az R1 nem létezhet a V3 megépítése nélkül, a modell tényleges költsége közelebb volt az 5,87 millió dollárhoz. Az, hogy az adatokat szándékosan alábecsülték-e, hogy a nyugati modellfejlesztőket komolytalan hype-függőként tüntessék fel, jelenleg heves vita tárgya. Mindenesetre az az elképzelés, hogy a DeepSeek lényegesen olcsóbb vagy hatékonyabb a nyugati modellekhez képest, túlzónak tűnik – összegzi a The Register.
Ha máskor is tudni szeretne hasonló dolgokról, lájkolja a HVG Tech rovatának Facebook-oldalát.