Google lansează Gemini 3.5 Transcribe

Spread the love

Lansarea Gemini 3.5: upgrade major la transcriere

Gemini 3.5 Transcribe este cel mai avansat model Google de tip speech‑to‑text, creat pentru transcriere rapidă, precisă și inteligentă, atât în timp real, cât și pentru fișiere audio preînregistrate. Modelul aduce o serie de îmbunătățiri majore față de generațiile anterioare, fiind deja integrat în aplicațiile Google și disponibil pentru dezvoltatori prin API.

Ce este Gemini 3.5 Transcribe și de ce contează

Spre deosebire de sistemele clasice de recunoaștere vocală, care se împiedică de zgomot, jargon sau disfluențe, Gemini 3.5 Transcribe convertește audio brut în text curat, formatat și precis.

Modelul este deja folosit în:

  • aplicația Gemini pe Android și macOS
  • funcția Rambler din Gboard
  • ecosistemul Google Antigravity

API-uri disponibile pentru dezvoltatori

Google oferă două moduri de integrare:

1. Streaming în timp real

  • latență sub o secundă
  • ideal pentru agenți vocali, subtitrare live, interacțiuni dinamice
  • disponibil prin gemini‑3.5‑transcribe‑live

2. Procesare audio preînregistrată

  • transcriere pentru întâlniri, apeluri, jurnale audio
  • timestamp la nivel de cuvânt
  • identificare vorbitori
  • disponibil prin gemini‑3.5‑transcribe

Capabilități avansate: ce face modelul atât de bun

Smart Transcription

  • elimină automat filler words („um”, „ah”)
  • corectează auto‑rectificările din vorbire
  • formatează textul automat

Function Calling

Modelul poate delega sarcini complexe altor modele Gemini: generare imagini, analiză fișiere, rezumare documente.

Precizie ridicată

  • WER 4.0% în streaming
  • WER 2.6% în non‑streaming

Robust în medii reale

Recunoaște corect coduri poștale, ID‑uri, numere, chiar și în medii zgomotoase.

Vocabular personalizat

Se adaptează la jargonul utilizatorului.

Suport global pentru limbi

Peste 85 de limbi, cu dialecte și accente regionale.

Identificare multi‑speaker

Atribuire corectă pentru până la 3 vorbitori (3+ experimental).

Performanță: un salt major față de Chirp 3

Gemini 3.5 Transcribe aduce:

  • latență îmbunătățită cu 70%
  • WER mai bun pe benchmark-ul FLEURS: 5.50% streaming / 5.04% non‑streaming

Integrare în produsele Google

Gboard – Rambler pe Android

Transformă vorbirea în text curat, permite editări vocale și schimbarea stilului de scriere..

Google Antigravity

Folosește contextul ecranului și istoricul chatului pentru acuratețe maximă.

Google AI Studio

Permite vibe coding cu vocea.

Gemini pe macOS

Transcriere + comenzi vocale + integrare cu contextul ecranului.

Chrome (în curând)

Talk‑to‑type în orice câmp web.

Ecosistemul dezvoltatorilor și feedbackul companiilor

Platforme precum Agora, Fishjam, LangChain, LiveKit, Pipecat și Vercel folosesc Gemini Live API pentru interfețe vocale performante.

Companii precum Vivo, Intellitek Health și Lingopal raportează latență excelentă, acuratețe și suport lingvistic extins.

Disponibilitate

  • Dezvoltatori: public preview în Gemini API (AI Studio, Antigravity)
  • Enterprise: public preview în Gemini Enterprise Agent Platform
  • Consumatori: macOS (engleză), Rambler pe Android în țări selectate, în curând în Chrome

Concluzie

Gemini 3.5 Transcribe nu este doar un model de transcriere – este un instrument vocal inteligent, capabil să înțeleagă context, intenție și stilul natural de vorbire. Cu suport extins pentru limbi, precizie ridicată și integrare profundă în ecosistemul Google, devine o soluție ideală pentru aplicații moderne bazate pe voce.

Leave a Comment

Adresa ta de email nu va fi publicată. Câmpurile obligatorii sunt marcate cu *

Scroll to Top