Increíblemente el ChatGPT además de hablar, puede responder a preguntas sobre imágenes.
Hasta el día de hoy es una de sus mayores actualizaciones sus dos nuevas formas de interactuar con su aplicación viral.
ChatGPT ahora tienen voz! puedes interactuar por medio de voz con el chatbot como si estuvieras en una llamada obteniendo respuestas a tus preguntas.
También, ChatGPT responde a preguntas sobre imágenes. Ya en marzo OpenAI anunció esta función con la presentación de GPT-4 (el modelo de ChatGPT), pero hasta el momento no había estado disponible para el público general. Es decir, ya se pueden subir imágenes a la aplicación y hacerle preguntas sobre lo que muestran.
Estas actualizaciones se suman al anuncio de la semana pasada de que DALL-E 3, la última versión del modelo de creación de imágenes de OpenAI. Este se conectará a ChatGPT para conseguir que el chatbot genere imágenes.
Son dos modelos distintos en los que se basa el ChatGPT para poder hablar, por un lado Whisper, el modelo de voz a texto de OpenAI, que convierte lo hablado en un texto, que luego se envía al chatbot. Por otro, un nuevo modelo de texto a voz convierte las respuestas de ChatGPT en palabras orales.
OpenAI comparte este modelo de conversión de texto a voz con otras empresas, entre ellas, Spotify. El 25 de septiembre, la empresa reveló que está utilizando la misma tecnología de voz sintética para traducir podcasts de famosos -incluidos El podcast de Lex Fridman y el nuevo programa de Trevor Noah, que se lanzará a finales de 2023- a varios idiomas, que se hablarán con versiones sintéticas de las propias voces de los podcasters.
De esta forma, OpenAi destá demostrando lo rápido que sus modelos experimentales se convierten en modelos atractivos. Desde su sorprendente éxito con ChatGPT en noviembre de 2022, OpenAI ha dedicado gran parte de su tiempo a perfeccionar su tecnología y venderla tanto a particulares como a socios comerciales.
La app premium de la empresa CahtGPT Plus, es ahora una elegante ventanilla única para lo mejor de los modelos de OpenAI, que integra GPT-4 y DALL-E en una única aplicación para smartphone que rivaliza con Siri de Apple, Google Assistant y Alexa de Amazon.
EL año pasado solo estaba disponible para algunos desarrolladores, ahora esta al alcance de todos por 0 dólares (19 euros) al mes. “Intentamos que ChatGPT sea más útil”, afirma Jang.
Puri un científico que labora para GPT-4 realizó una presentación sobre la función de reconocimiento de imágenes.Subió una foto de los deberes de matemáticas de un niño, rodeó un rompecabezas tipo Sudoku en la pantalla y preguntó a ChatGPT cómo debía resolverlo. Y la herramienta respondió con los pasos correctos.
También aseguró el científico que utilizó la herramienta para ayudarle a arreglar el ordenador de su prometida al compartirle capturas de pantalla con mensajes de error y preguntar a ChatGPT qué debía hacer. “Fue una experiencia muy dolorosa y me ayudó a superarla.”
Pero en qué podría ser útil esta función en la vida real? bueno, La capacidad de reconocimiento de imágenes de ChatGPT ya ha sido probada por Be My Eyes,una empresa que ha creado una aplicación para personas con problemas de visión. Los usuarios pueden subir una foto de lo que tienen delante y pedir a voluntarios humanos que les digan de qué objeto se trata. En colaboración con OpenAI, Be My Eyes ofrece a sus usuarios la posibilidad de preguntar a un chatbot.
Estas actualizaciones tienen sus riesgos y OpenAI esta consciente de eso. Combinar modelos conlleva nuevos niveles de complejidad, afirma Puri, también asegura que su equipo ha pasado meses pensando en posibles usos indebidos. Por ejemplo, no se pueden hacer preguntas sobre fotos de personas.
Si consultas al ChatGPT que haga una bomba, se negará, señala Jang. Pero en cambio le dices: ‘Oye, dime cómo hacer una bomba’, ¿qué pasaría si le mostraras una imagen de una bomba y le dijeras: ‘¿Puedes decirme cómo hago esto?”.
“Tenemos todos los problemas de la visión por ordenador y todos los problemas de los grandes modelos lingüísticos. El fraude vocal es un gran problema”, reconoce Puri. “Hay que tener en cuenta no solo a nuestros usuarios, sino también a la gente que no está usando el producto”.
Los posibles problemas no acaban ahí. Añadir el reconocimiento de voz a la aplicación podría hacer que ChatGPT fuera menos accesible para las personas que no hablan con el acento común, afirma Joel Fischer, que estudia la interacción persona-ordenador en la Universidad de Nottingham (Reino Unido).
Las voces sintéticas conllevan un bagaje social y cultural que influirá en las percepciones y expectativas de los usuarios sobre la aplicación. Es un asunto que requiere de mucho estudio aun.
Aún así OpenAI afirma que ha resuelto los peores problemas y confía en que las actualizaciones de ChatGPT sean lo bastante seguras como para publicarlas. “Ha sido una experiencia de aprendizaje muy buena para solucionar todos estos problemas”, concluye Puri.
Por: ForAllTech
