Új audiomodellt mutatott be a Google. A Gemini 3.5 Transcribe nevű mesterséges intelligencia fő erőssége, mint a nevéből is sejthető, a szöveget átírása, amely a cég szerint továbbfejlesztett beszédfelismerő algoritmust használ a kiejtett szavak pontosabb és jobb megértése érdekében.
A Google azt állítja, hogy a modell képes a felhasználó „strukturálatlan beszédét” formázott szöveggé alakítani. Emellett használható hangparancsokkal történő szerkesztésre is, a leiratozás során pedig eltávolítja a töltelékszavakat.
A Google szerint a modell képes megtanulni az egyéni szókincset és az egyedi írásmódokat is, emellett pedig pontosan rögzít alfanumerikus karakterláncokat. Ez utóbbi például akkor lehet hasznos, ha egy cég rendelések fogadására, a telefonos ügyfélszolgálat megerősítésére használja az AI-t: a rendelési számok vagy az irányítószámok rögzítése sokkal pontosabb lesz.
https://x.com/Google/status/2092659280604205090
A cég azt állítja, a Gemini 3.5 Transcribe akár három ember beszédét is képes egy időben leírni, amelyekhez időbélyeget is használ. Ez rendkívül hasznos lehet, ha valaki például egy podcast leiratát akarja elkészíteni.
A Google azt ígéri, a fejlesztés szövegfelolvasó funkcióját hamarosan bármely weboldalon használni lehet majd a Chrome-ban, emellett pedig a válaszokat le lehet majd diktálni – például egy weboldal kommentmezőjénél.
A megoldás hamarosan elérhetővé válik, a fejlesztők pedig hozzáférhetnek majd a modellhez, hogy testreszabják azt.
Ha máskor is tudni szeretne hasonló dolgokról, lájkolja a HVG Tech rovatának Facebook-oldalát.