Google ka prezantuar modele të reja audio përmes Gemini API dhe Google AI Studio, duke u dhënë zhvilluesve mundësi të krijojnë aplikacione që komunikojnë me përdoruesit përmes zërit në kohë reale.
Çka ofrojnë modelet e reja?
Gemini 3.8 Live dhe Gemini 3.8 Live Extended Thinking janë krijuar për agjentë zanorë që mund të zhvillojnë biseda, të arsyetojnë dhe të kryejnë detyra përmes mjeteve dhe API-ve.
Disa nga veçoritë kryesore janë:
- Thirrje asinkrone të funksioneve: Aplikacioni mund të kryejë veprime në prapavijë ndërsa vazhdon të komunikojë me përdoruesin.
- Kuptimi i kontekstit vizual: Modelet mund të përdorin edhe të dhëna vizuale gjatë bisedës.
- Saktësi me të dhëna teknike: Përpunim më i mirë i kodeve të konfirmimit, numrave të kërkesave dhe termave teknikë.
- Mbështetje shumëgjuhëshe: Mundësi për të ndërtuar përvoja zanore në dhjetëra gjuhë.
- Arsyetim më i thellë: Versioni Extended Thinking është i orientuar drejt kërkesave komplekse dhe shumëhapëshe.
Gemini 3.5 Transcribe
Google ka prezantuar gjithashtu Gemini 3.5 Transcribe, një model për shndërrimin e të folurit në tekst me vonesë të ulët. Ai mbështet mbi 85 gjuhë dhe ofron funksione si:
- Njohja automatike e ndërrimit të gjuhëve gjatë bisedës.
- Fjalor i personalizuar për terma specifikë të industrisë.
- Transkriptime më të pastra dhe të strukturuara.
📚 Regjistrohu sot dhe fito qasje në mbi 80 kurse apo 3,800+ mësime në një platformë të vetme.
Çfarë do të thotë kjo për zhvilluesit?
Këto modele mund të përdoren për krijimin e asistentëve zanorë, aplikacioneve të shërbimit ndaj klientit, transkriptimit në kohë reale, analizës së thirrjeve dhe platformave interaktive.
Me këto përditësime, Google po e bën më të lehtë ndërtimin e aplikacioneve ku zëri nuk shërben vetëm për komandim, por edhe për komunikim dhe kryerje të detyrave.
