Google ka prezantuar modele të reja audio përmes Gemini API dhe Google AI Studio, duke u dhënë zhvilluesve mundësi të krijojnë aplikacione që komunikojnë me përdoruesit përmes zërit në kohë reale.

Çka ofrojnë modelet e reja?

Gemini 3.8 Live dhe Gemini 3.8 Live Extended Thinking janë krijuar për agjentë zanorë që mund të zhvillojnë biseda, të arsyetojnë dhe të kryejnë detyra përmes mjeteve dhe API-ve.

Disa nga veçoritë kryesore janë:

  • Thirrje asinkrone të funksioneve: Aplikacioni mund të kryejë veprime në prapavijë ndërsa vazhdon të komunikojë me përdoruesin.
  • Kuptimi i kontekstit vizual: Modelet mund të përdorin edhe të dhëna vizuale gjatë bisedës.
  • Saktësi me të dhëna teknike: Përpunim më i mirë i kodeve të konfirmimit, numrave të kërkesave dhe termave teknikë.
  • Mbështetje shumëgjuhëshe: Mundësi për të ndërtuar përvoja zanore në dhjetëra gjuhë.
  • Arsyetim më i thellë: Versioni Extended Thinking është i orientuar drejt kërkesave komplekse dhe shumëhapëshe.

Gemini 3.5 Transcribe

Google ka prezantuar gjithashtu Gemini 3.5 Transcribe, një model për shndërrimin e të folurit në tekst me vonesë të ulët. Ai mbështet mbi 85 gjuhë dhe ofron funksione si:

  • Njohja automatike e ndërrimit të gjuhëve gjatë bisedës.
  • Fjalor i personalizuar për terma specifikë të industrisë.
  • Transkriptime më të pastra dhe të strukturuara.
📚 Regjistrohu sot dhe fito qasje në mbi 80 kurse apo 3,800+ mësime në një platformë të vetme.

Çfarë do të thotë kjo për zhvilluesit?

Këto modele mund të përdoren për krijimin e asistentëve zanorë, aplikacioneve të shërbimit ndaj klientit, transkriptimit në kohë reale, analizës së thirrjeve dhe platformave interaktive.

Me këto përditësime, Google po e bën më të lehtë ndërtimin e aplikacioneve ku zëri nuk shërben vetëm për komandim, por edhe për komunikim dhe kryerje të detyrave.