ChatGPT integra per fi la manera veu al propi xat

Darrera actualització: 26/11/2025
Autor: Isaac
  • El mode de veu avançat de Xat GPT passa a estar integrat a la mateixa finestra de xat que el text.
  • Els usuaris poden parlar, veure la transcripció en temps real i rebre imatges, mapes o altres elements visuals en una sola interfície.
  • Es manté l'opció d'activar el "Mode separat" per conservar l'experiència de només àudio estil assistent virtual clàssic.
  • L'actualització s'està desplegant a la web ia les aplicacions mòbils de iOS i Android per a tots els usuaris, amb funcions extra per a comptes de pagament.

chatgpt mode veu al xat

L'assistent de OpenAI fa un pas important en la manera com ens relacionem amb la intel·ligència artificial. A partir d'ara, el mode veu de ChatGPT deixa de ser una pantalla a part i passa a conviure directament amb el xat de text, cosa que simplifica l'ús diari i elimina molts canvis de finestra innecessaris.

Amb aquesta actualització, qualsevol persona pot parlar amb ChatGPT, veure la transcripció de la conversa i rebre mapes, imatges o altres continguts visuals sense sortir del mateix fil de xat. La idea és acostar l'experiència a una xerrada natural on veu i pantalla treballin juntes en comptes d'estar separades.

Mode veu dins del xat: què canvia exactament

Fins ara, els que volien fer servir la veu a ChatGPT havien de saltar-se a una interfície dedicada a l'àudio, dominada pel clàssic orbe blau o una manera de pantalla completa diferent del xat habitual. Això generava certa fricció, sobretot si lusuari volia revisar missatges anteriors o consultar informació visual mentre parlava.

Amb la nova versió, el mode de veu avançat s'activa directament des de la barra d'escriptura, tocant la icona amb forma d'ona de so situada a la dreta del quadre de text. No hi ha cap canvi brusc d'entorn: es manté el mateix fil de conversa i l'historial complet a la vista.

Quan es prem aquesta icona, ChatGPT comença a escoltar i mostra a la pantalla una transcripció en viu del que es diu, tant de l'usuari com de l'assistent. El resultat és una experiència híbrida en què es pot seguir la conversa per veu sense perdre el control del que apareix al xat.

La integració també permet que, al mig del diàleg, l'assistent afegiu elements visuals en temps real com mapes, imatges relacionades, fragments de pàgines web o altres recursos. Tot això es presenta incrustat al mateix fil, sense haver d'abandonar el mode veu ni obrir finestres addicionals.

Un detall pràctic és que es pot alternar entre escriure i parlar de manera contínua. Encara que el mode de veu estigui actiu, si l'usuari prefereix teclejar una part de la consulta, el sistema l'acceptarà i respondrà igualment per veu mantenint la continuïtat de la conversa.

  Google Translate vs DeepL: diferències reals i quina et compensa

interfície chatgpt amb mode veu integrat

Una experiència més natural i ràpida: latència, emocions i GPT-5.1

La integració de veu i text no arriba sola. OpenAI ha introduït ajustaments tècnics perquè la interacció per veu sigui més fluida, amb temps de resposta que s'approximen al ritme d'una xerrada entre dues persones. La companyia parla de respostes al voltant dels 200 mil·lisegons, cosa que redueix considerablement la sensació d'espera.

Alhora, l'assistent incorpora millores en l'entonació i l'expressivitat de les veus, buscant que sonin menys robòtiques i més properes a una conversa quotidiana. La idea és que l'usuari percebi un to més personal capaç de transmetre matisos i emocions lleugeres sense deixar de ser una eina automàtica.

En el pla tècnic, aquestes novetats es recolzen en la integració amb models més recents, com GPT-5.1, que permeten ajustar amb més precisió el to, la velocitat i la manera com la IA respon per àudio. Encara que aquests avenços no converteixen l'assistent en un interlocutor humà, sí que rebaixen part de la distància habitual de les veus sintètiques.

Aquest enfocament encaixa en la tendència del sector cap a interaccions multimodals més riques, en què text, veu i imatges es combinen en un únic flux. Davant solucions rivals com Gemini Live de Google, l'aposta d'OpenAI passa per integrar-ho tot a la mateixa interfície, en lloc d'obligar a saltar d'un context a un altre.

Per a lusuari final, la conseqüència pràctica és que pot mantenir una conversa de mans lliures molt més continua, obtenint alhora suport visual quan la consulta ho requereix, ja sigui per orientar-se amb un mapa, revisar un gràfic o seguir un esquema a la pantalla.

ús de chatgpt mode veu en mòbil

Com s'activa, quins dispositius i diferències entre usuaris gratuïts i de pagament

La nova experiència de veu està desplegant gradualment tant a la web com a les aplicacions mòbils de ChatGPT per a iOS i Android. En la majoria dels casos, només cal actualitzar l'app des de la botiga corresponent o recarregar la versió web perquè el canvi aparegui disponible.

Un cop instal·lada la darrera versió, l'accés és senzill: només cal prémer la icona d'ona de veu al costat del quadre de text del xat. A partir d'aquell moment, l'aplicació escolta l'usuari i mostra a la finestra la transcripció i les respostes, sense canviar de pantalla.

Per als que utilitzen la versió gratuïta del servei, el mode veu en línia està disponible sense cost addicional, encara que amb limitacions en el temps d'ús si no hi ha una subscripció de pagament. En canvi, els plans com ChatGPT Plus, Pro o Teams ofereixen més minuts de conversa i accés a un mode de veu avançat amb veus més elaborades i capacitats dàudio millorades.

  Què és un enginyer de prompts i per què serà un perfil clau

Hi ha, de fet, dues experiències diferenciades de veu: una estàndard, accessible a qualsevol usuari, basada en tecnologies de reconeixement i síntesi més convencionals; i una altra d'avançada, que aprofita les capacitats de models més potents per oferir respostes més expressives i una interacció més polida en temps real.

A Espanya i la resta d'Europa, l'actualització segueix el mateix patró que a altres mercats: es va activant de forma progressiva a mòbils ia la web, de manera que no tots els usuaris la reben el mateix dia. Tot i així, OpenAI indica que la implementació està pensada per arribar a tots els comptes, sense restriccions per regió, més enllà de la diferència entre plans gratuïts i de pagament.

configuracio mode veu chatgpt

Més control per a l'usuari: «Mode separat» i ajustaments de veu

La integració de text i veu és l'aposta per defecte, però OpenAI no ha eliminat l'experiència clàssica de només àudio. Per als qui prefereixen una interacció més immersiva, sense veure el xat ni la transcripció, continua existint l'opció d'usar l'anomenat «Mode separat».

Aquesta modalitat es pot habilitar des del menú de configuració de ChatGPT, a l'apartat de Mode de Veu. En activar-la, l'aplicació torna al disseny anterior, on l'usuari entra en un entorn dedicat exclusivament a la conversa per àudio, semblant a parlar amb un assistent digital tradicional.

El canvi entre la interfície integrada i el mode separat no té límit d'activacions: l'usuari pot provar-ne una, tornar a l'altra i ajustar la configuració tantes vegades com vulgui. Aquesta flexibilitat cerca adaptar-se tant als que valoren tenir l'historial del xat sempre a la vista com als que se senten més còmodes amb una pantalla neta centrada a la veu.

A més d'escollir el tipus d'interfície, des dels ajustaments és possible personalitzar alguns aspectes de la veu, com la selecció entre diferents locucions disponibles. En el cas de la manera avançada, aquestes veus han estat dissenyades per sonar més naturals i amb una entonació una mica més rica, encara que sense perdre el caràcter d'eina d'assistència.

Que la companyia mantingui les dues opcions reflecteix certa cautela: no tots els usuaris accepten immediatament els canvis de disseny, i la transició a una interfície única pot generar resistència entre els qui ja s'havien acostumat al flux anterior. Així, l'actualització ofereix novetats sense tancar la porta als hàbits previs.

  Guia Completa de Work IQ de Copilot: La Intel·ligència Contextual per a Empreses

Impacte en productivitat, startups i casos dús a Europa

La unificació de veu i text en una sola finestra no només millora la comoditat de lusuari domèstic; també obre noves possibilitats per a startups i equips que treballen amb automatització. Poder combinar dictat, respostes parlades i contingut visual en una mateixa interfície simplifica la creació d'assistents i d'eines conversacionals.

En el context europeu, aquesta integració pot resultar especialment útil en entorns de treball híbrids i remots, on es valora cada cop més la capacitat de fer consultes ràpides per veu mentre es revisen documents, mapes o dashboards en pantalla. Sectors com latenció al client, leducació en línia o el suport tècnic poden aprofitar aquest enfocament multimodal.

Per a fundadors i equips tècnics, comptar amb un únic entorn per a text i veu facilita les proves de concepte i el desenvolupament de productes que integrin entrada oral sense necessitat de dissenyar interfícies separades. Fins i tot amb eines sense codi, resulta més senzill experimentar amb assistents que combinin dictat, respostes parlades i elements visuals dins del mateix flux.

D'altra banda, la presència d'una manera de veu accessible des de la versió web i les aplicacions mòbils rebaixa barreres d'accessibilitat per a persones que prefereixen no escriure al teclat o que tenen dificultats de visió, en poder escoltar les respostes sense renunciar a la informació visual quan la necessiten.

El moviment encaixa en una indústria de la IA que, tant a Espanya com a la resta del continent, viu un moment d'expansió en ús i inversió. Les grans plataformes, entre les quals hi ha OpenAI, competeixen per oferir experiències més completes i fàcils d'adoptar, conscients que petites millores en usabilitat poden marcar la diferència en l'adopció massiva.

Amb aquest canvi, ChatGPT fa un pas més cap a una interacció realment multimodal, en què parlar, llegir i veure contingut succeeixen al mateix lloc. La possibilitat d'escollir entre una interfície integrada o una manera separada, unida a les millores en velocitat i naturalitat de les veus, situa l'assistent en una posició més còmoda per a l'ús diari, tant per part d'usuaris particulars com d'organitzacions que busquen introduir la veu als fluxos de treball sense complicacions addicionals.

google meet traducció de veu-1
Article relacionat:
Google Meet integra traducció de veu en temps real amb IA: funcionalitats i escenaris dús