A hangos gondolkodásból is összefüggő szöveget ír a Google új AI-modellje

Kiadta a Google a Gemini 3.5 Transcribe nevű modelljét, amely akár három beszélő szövegét is képes pontosan leiratozni, a beszélők változását pedig időbélyeggel jelzi.

  • HVG

Új audiomodellt mutatott be a Google. A Gemini 3.5 Transcribe nevű mesterséges intelligencia fő erőssége, mint a nevéből is sejthető, a szöveget átírása, amely a cég szerint továbbfejlesztett beszédfelismerő algoritmust használ a kiejtett szavak pontosabb és jobb megértése érdekében.

A Google azt állítja, hogy a modell képes a felhasználó „strukturálatlan beszédét” formázott szöveggé alakítani. Emellett használható hangparancsokkal történő szerkesztésre is, a leiratozás során pedig eltávolítja a töltelékszavakat.

A Google szerint a modell képes megtanulni az egyéni szókincset és az egyedi írásmódokat is, emellett pedig pontosan rögzít alfanumerikus karakterláncokat. Ez utóbbi például akkor lehet hasznos, ha egy cég rendelések fogadására, a telefonos ügyfélszolgálat megerősítésére használja az AI-t: a rendelési számok vagy az irányítószámok rögzítése sokkal pontosabb lesz.

https://x.com/Google/status/2092659280604205090

A cég azt állítja, a Gemini 3.5 Transcribe akár három ember beszédét is képes egy időben leírni, amelyekhez időbélyeget is használ. Ez rendkívül hasznos lehet, ha valaki például egy podcast leiratát akarja elkészíteni.

A Google azt ígéri, a fejlesztés szövegfelolvasó funkcióját hamarosan bármely weboldalon használni lehet majd a Chrome-ban, emellett pedig a válaszokat le lehet majd diktálni – például egy weboldal kommentmezőjénél.

A megoldás hamarosan elérhetővé válik, a fejlesztők pedig hozzáférhetnek majd a modellhez, hogy testreszabják azt.

Ha máskor is tudni szeretne hasonló dolgokról, lájkolja a HVG Tech rovatának Facebook-oldalát.

Hozzászólások