Gemini 3.5 Transcribe: Nový model převodu hlasu na text od Googlu, který čistí, opravuje a přepisuje v 85 jazycích

  • Google představuje Gemini 3.5 Transcribe, svůj dosud nejpřesnější model pro převod řeči na text, s mírou chybovosti slov 2,6 % v nahraném zvuku a o 70 % rychlejším než Chirp 3.
  • Model eliminuje vkládací slova, interpretuje autokorekce, rozpoznává personalizovanou slovní zásobu a rozlišuje v nahrávkách až tři mluvčí.
  • Je již k dispozici v Gboardu pro Android, Gemini pro macOS, AI Studiu a Gemini API, integrace s Chromem bude brzy dostupná.

Gemini 3.5 přepisuje v akci

Google představil svůj dosud nejambicióznější produkt v oblasti rozpoznávání řeči. S názvem Gemini 3.5 Transcribe se nejedná o typický převodník řeči na text: slibuje, že porozumí tomu, co říkáme, vyčistí to a vrátí uhlazený text, bez nadbytečných slov a se správnou interpunkcí. Společnost jej prezentuje jako svůj dosud nejpřesnější model a počáteční data naznačují významné zlepšení, zejména v hlučném prostředí nebo se složitými přízvuky.

Velkou novinkou je, že systém nekopíruje jen to, co slyší. Pokud řeknete „sejdeme se v úterý... ne, ve středu“, konečný výsledek bude „sejdeme se ve středu“. Systém také odstraňuje „eh“ a „em“, formátuje čísla a PSČ a dokonce rozpoznává specializovanou slovní zásobu, pokud je k dispozici s vlastním seznamem. To vše se děje rychlostí, o které Google tvrdí, že je o 70 % rychlejší než u jeho předchozího enginu Chirp 3 , a s podporou více než 85 jazyků.

Jak přepsat nahraný hlas v systému Android
Související článek:
Jak bez problémů přepsat nahraný hlas v systému Android

Přepis, který rozumí tomu, co myslíte

Klíčem k Gemini 3.5 Transcribe je jeho inteligentní transkripce. Model je naučen tak, aby chápal záměr mluvčího, nejen jednotlivá slova. To je patrné v detailech, jako jsou automatické opravy: pokud uděláte chybu uprostřed věty a opravíte se, systém si uchová finální verzi. Dokáže také rozlišit až tři mluvčí v předem nahraném zvukovém souboru a každému z nich přiřadit časová razítka, což je velmi užitečné pro schůzky, pohovory nebo analýzu hovorů.

Rozhraní pro přepis Gemini 3.5

Pokud jde o přesnost, data Googlu ukazují míru chybovosti slov (WER) 4 % pro streamování a 2,6 % pro předem nahraný zvuk, dle měření od Artificial Analysis. To znamená, že v praxi se chyby za normálních podmínek snižují na méně než tři slova na sto . Společnost také zdůrazňuje výkon v hlučném prostředí, kde ostatní modely často mají potíže.

Další výhodou modelu je jeho vlastní slovní zásoba. Můžete nahrát seznam vlastních jmen, zkratek nebo odborných termínů a systém je rozpozná, aniž byste je museli hláskovat. To je obzvláště užitečné pro lékaře, právníky nebo novináře, kteří pracují se specializovaným žargonem. Model navíc automaticky detekuje jazyk a dokáže mezi nimi přepínat i během konverzace, což dříve představovalo velký problém.

Jak povolit živé přepisy a automatické titulky v systému Android
Související článek:
Živé přepisy a automatické titulky v systému Android

Kde je k dispozici a v jakých produktech se používá

Gemini 3.5 Transcribe není jen laboratorní experiment. Google jej již integroval do několika svých produktů. Nejviditelnějším příkladem je Rambler, funkce diktování Gboardu pro Android , která nyní tento model využívá k nabídce čistších přepisů na klávesnicích Androidu . Je také přítomna v aplikaci Gemini pro macOS, kde umožňuje uživatelům diktovat hlasové příkazy, které jsou kombinovány s kontextem obrazovky pro shrnutí souborů, generování obrázků nebo opětovné použití textu mezi aplikacemi.

Gemini 3.5 přepisuje na zařízeních

Pro vývojáře je model k dispozici ve veřejné verzi Preview prostřednictvím rozhraní Gemini API, a to jak v Google AI Studiu, tak v Antigravity. Lze jej také testovat na platformě Gemini Enterprise Agent Platform, podnikové platformě společnosti. S těmito nástroji mohou technické týmy vytvářet hlasové agenty, systémy titulků v reálném čase nebo nástroje pro analýzu hovorů, aniž by se musely spoléhat na externí služby.

Další zastávkou bude Chrome. Google potvrdil, že pracuje na integraci tohoto modelu do prohlížeče, aby uživatelé mohli diktovat text v libovolném webovém poli bez nutnosti přepínání mezi aplikacemi. To by otevřelo dveře k psaní e-mailů, vyplňování formulářů nebo interakci s Gemini přímo pomocí hlasu, ačkoli zatím není známo přesné datum vydání.

HD zvuk na Androidu
Související článek:
Jak přepsat zvuk z WhatsAppu pomocí Google Gemini

Cena a omezení náhledové verze

Verze pro vývojáře má svá vlastní pravidla. Live API, určené pro streamování v reálném čase, umožňuje relace až deset minut a nezahrnuje identifikaci mluvčího. Interactions API pro předem nahraný zvuk podporuje soubory o délce až jedné hodiny a nabízí diarizaci až se třemi hlasy, ačkoli přiřazení více než třem mluvčím je považováno za experimentální. Pokud jde o ceny, Google odhaduje kombinované náklady na 0,009 USD za minutu streamování a 0,005 USD za minutu souborů , ačkoli se jedná o orientační výpočty založené na spotřebě tokenů.

Gemini 3.5 Transcribe pro vývojáře

Je důležité si uvědomit, že dostupnost se liší v závislosti na zemi a jazyce. Například Rambler je k dispozici pouze na některých trzích a aplikace Gemini pro macOS v současné době funguje pouze v angličtině. Google neposkytl podrobnosti o tom, kdy se podpora rozšíří do dalších regionů, ale zdá se pravděpodobné, že to bude během několika měsíců.

Na konkurenční frontě přichází Gemini 3.5 Transcribe se silným argumentem: integrovanou automatickou korekcí. Služby jako Whisper od OpenAI nebo AssemblyAI nabízejí dobrou přesnost, ale chybí jim editační vrstva, která odstraňuje výplňová slova a formátuje text. Odborníci však poukazují na to, že lidský dohled je i nadále nezbytný v kontextech, kde je doslovná věrnost kritická, jako jsou právní prohlášení nebo lékařské zprávy.

Aplikace s umělou inteligencí
Související článek:
Nejlepší aplikace pro umělou inteligenci pro Android: Aktualizovaný průvodce, funkce a využití v reálném světě

Co to znamená pro průměrného uživatele?

Pro ty, kteří diktují zprávy, poznámky nebo e-maily ze svého mobilního telefonu, je rozdíl znatelný již od prvního použití. Přepisy jsou čistší, bez těch „ehm“ a „ehm“, které je pak nutné ručně mazat, a se správně umístěnou interpunkcí. Ocení také to, že systém rozumí opravám za chodu, což šetří čas a zabraňuje frustraci.

Používání Gemini 3.5 Transcribe v každodenním životě

V profesionální sféře může být tento nástroj průlomový pro novináře, výzkumníky nebo asistenty, kteří pracují s nahrávkami. Schopnost identifikovat, kdo a kdy na schůzce hovoří, drasticky zkracuje čas editace. A pro týmy zákaznických služeb se analýza po hovoru díky přesným a označeným přepisům stává mnohem jednodušší.

Je však třeba si uvědomit, že model je ve fázi náhledu a že některé funkce, jako například deníkové záznamy s více než třemi hlasy, jsou stále experimentální. Google slíbil vylepšení v nadcházejících měsících, ale prozatím doporučuje vždy si přepisy před oficiálním použitím zkontrolovat.

S příchodem Gemini 3.5 Transcribe Google dokazuje, že hlas může být stejně výkonným rozhraním jako klávesnice, pokud je technologie na úrovni. Kombinace rychlosti, přesnosti a automatické úpravy z něj činí velmi atraktivní nástroj jak pro individuální uživatele, tak pro firmy. Jak si povede v reálném světě, se teprve uvidí, ale první dojmy jsou slibné.

Jak nastavit AI asistenta pro Android
Související článek:
AI Assistant v systému Android: Vyberte si a používejte toho, který vám nejlépe vyhovuje

Přidat jako preferovaný zdroj v Googlu