jueves, 27 de junio de 2024

La IA no sabe reírse -MIT

 MIT-27.06.2024, Carlos Corominas, Redactor jefe de MIT Technology Review en español


Desde la popularización de la inteligencia artificial generativa a finales de 2022, se ha establecido un debate acerca de los riesgos que estos modelos tenían para las profesiones creativas. Artistas, escritores, músicos, creadores audiovisuales y periodistas hemos observado con curiosidad y cierto recelo las capacidades para generar contenido de estas herramientas. Más allá de las vulneraciones de copyright para entrenar los modelos, a los creadores también les preocupa el propio futuro de su profesión.  

Con el paso de los meses, los modelos existentes de IA se han consolidado como asistentes, herramientas para mejorar la productividad o colaboradores digitales para fomentar la creatividad. Muchos la usamos para ayudarnos en nuestro día a día o para romper la página en blanco. En el ámbito creativo, las posibilidades son indudables, como muestran los vídeos creados con Sora de OpenAI. Otras aplicaciones más polémicas han surgido en el mundo de la música. Hace unos meses, se publicaba una canción hecha por IA que emulaba la voz y el estilo de Bad Bunny, y que provocó la ira del artista. 

En lo que llevamos de 2024, los raperos Drake y Kendrick Lamar han protagonizado una batalla dialéctica en forma de canciones en las que se retaban con insultos y amenazas. Sin embargo, lo que muchos consideraron una línea roja fue que Drake utilizara una IA para recrear la voz del rapero Tupac, asesinado en 1996 y un referente de Lamar. Es una muestra de las capacidades de la IA para generar contenido falso, aunque este tipo de manipulaciones no sean nuevas: el propio Lamar hizo uso del deepfake de manera creativa en un videoclip hace dos años y rehizo una entrevista de Tupac al final de su disco To Pimp a Butterfly para simular una conversación. 

Sin embargo, todavía la IA no se muestra como un agente creador por sí mismo con capacidad completa para sustituir al ser humano y, por eso, los artistas ya no le tienen tanto miedo. Dadas sus características, es especialmente torpe a la hora de utilizar el sarcasmo, los juegos de palabras o tratar de conectar conceptos de maneras inusuales o creativas. Es algo que se observa de forma muy evidente cuando a los modelos de lenguaje se les pide que hagan humor o cuenten un chiste. Pueden funcionar para romper la página en blanco o crear conceptos curiosos, pero fallan al intentar ser graciosos. De momento, podemos perder el miedo, aunque no lleguemos a reírnos.

viernes, 14 de junio de 2024

Construyendo una mejor Internet

Medium - 14 de junio de 2024

Creo que no es controvertido decir que Internet está en una situación desesperada. En los últimos años, hemos sido testigos de la desaparición de espacios de redes sociales que alguna vez fueron prometedores, el vaciamiento de los medios digitales, el declive de la búsqueda como herramienta útil y las primeras oleadas de contenido basura de IA que comienzan a inundar la web.

Si ha intentado leer algo en línea recientemente, su experiencia probablemente haya sido especialmente terrible. La sensación básica de una página web promedio, seamos honestos, no es excelente. La historia está intercalada entre anuncios, con ventanas emergentes que aparecen aparentemente al azar, y no importa qué tan rápido seas, no puedes presionar la pequeña "x" en el video de reproducción automática antes de que comience a reproducirse.

Las palabras, para gran parte de Internet, son una ocurrencia tardía.

Aunque no en todas partes. Hay lugares que intentan crear un lugar limpio y bien diseñado para las palabras, las historias y los narradores humanos, pero ya son pocos.

jueves, 23 de mayo de 2024

Al calor del auge de la inteligencia artificial

MIT 23.05.2024


Al calor del auge de la inteligencia artificial, la industria de los chips está recibiendo un impulso sin precedentes. Los problemas de suministro que se sucedieron tras la pandemia de COVID-19 y la necesidad de una mayor capacidad de procesamiento para la IA han hecho que los países concentren sus esfuerzos en desarrollar su industria interior y no depender tanto de terceros países, en un entorno geopolítico complejo y de gran competitividad.  

Los países, las grandes tecnológicas y las start-ups enfocadas en segmentos muy específicos del mercado están tomando posiciones y marcando el terreno de lo que será la nueva geopolítica del chip en los próximos años. Todo ello impulsado por el nuevo mercado en respuesta a las necesidades de computación de la industria de la IA, que cada semana acapara titulares con sus nuevos productos o iteraciones.  

Una de estas novedades está trayendo cola. La semana pasada hablábamos de las novedades en los asistentes de IA de Google y OpenAI. Este último anunció GPT-4o como un asistente "omnimodelo" que podía presentar diferentes voces. Una de ellas era Sky, una voz que se asemejaba a la de Scarlett Johansson, específicamente la que aparecía en Her en forma de una IA de la que se enamoraba perdidamente el personaje interpretado por Joaquin Phoenix. Por si quedaban dudas, Sam Altman, CEO de OpenAI, tuiteaba minutos antes de la presentación un mensaje con tres letras: "her".  

La actriz señaló en un comunicado que el propio Altman le había pedido en septiembre de 2023 que prestara su voz para el asistente, algo a lo que se negó. Ante el revuelo causado, OpenAI se ha defendido alegando que la voz utilizada corresponde a otra actriz contratada antes de contactar a Johansson. En otro comunicado, Altman afirma que "la voz de Sky no es la de Scarlett Johansson y nunca hubo la intención de que se pareciera a ella". Aunque su tuit dijera lo contrario. El CEO pedía perdón a la actriz por no haberlo comunicado mejor y anunciaba que pausaba el uso de Sky en sus productos. Lo curioso del asunto es que OpenAI se decida por imitar una película en la que se mostraba un inquietante futuro en el que una persona trababa de compensar su soledad con una inteligencia artificial. Marta García Aller lo resume bien en este artículo de El Confidencial: "Antes la innovación copiaba los inventos de la ciencia ficción. Ahora copia sus miedos".  

Mientras tanto, se están sucediendo las dimisiones en el equipo de OpenAI que velaba por evitar riesgos catastróficos para la humanidad de una inteligencia artificial mal diseñada. La semana pasada anunciaban su renuncia Ilya Sutskever, director científico de la compañía y codirector de esta división conocida como departamento de superalineación, y Jan Leike, el otro director de la división. En un hilo de X, este último equiparaba la labor de su equipo como a "navegar contra el viento" y apuntaba: "Construir máquinas más inteligentes que los humanos es un reto inherentemente peligroso. OpenAI está asumiendo una responsabilidad enorme en nombre de toda la humanidad". Mientras tanto, el mundo sigue construyendo nuevos chips.   


viernes, 17 de noviembre de 2023

MIT- La IA generativa es solo una fase, pronto llegará la IA interactiva

 "Este es un momento trascendental en la historia de la tecnología", Mustafa Suleyman

  • por Will Douglas Heaven
  • -
  • 10 Noviembre, 2023
  • Mustafa Suleyman, cofundador de DeepMind, quiere construir un chatbot que haga mucho más que chatear. En una conversación reciente, me comentó que la IA generativa es solo una fase más. Pronto llegará la IA interactiva: robots capaces de realizar las tareas que se les encomienden recurriendo a otro software y a otras personas. El emprendedor también pide una regulación estricta, y no cree que sea difícil de conseguir.

    Suleyman no es el único que habla de un futuro lleno de software cada vez más autónomo. Pero a diferencia de la mayoría de personas, tiene Inflection, una nueva empresa multimillonaria con una lista de talentos de primera línea que proceden de DeepMind, Meta y OpenAI. Gracias también a un acuerdo con Nvidia, una de las mayores reservas de hardware especializado en IA del mundo. Suleyman ha respaldado con su propio dinero, del cual dice no estar interesado, pero quiere aumentar, sus visiones sobre el futuro tecnológico.

  • Suleyman tiene fe en la tecnología como fuerza para el bien, al menos desde que hablamos por primera vez a principios de 2016. Entonces, acababa de lanzar DeepMind Health y de establecer colaboraciones de investigación con algunos de los proveedores regionales de atención sanitaria de Reino Unido.

    La revista para la que yo trabajaba en aquel momento estaba a punto de publicar un artículo que afirmaba que DeepMind no había cumplido la normativa de protección de datos al acceder a los historiales de unos 1,6 millones de pacientes para establecer esas colaboraciones. Dicha afirmación fue respaldada posteriormente por una investigación gubernamental. Suleyman no entendía por qué publicaríamos una noticia hostil a los esfuerzos de su empresa por mejorar la atención sanitaria. Entonces me dijo que, desde que tenía uso de razón, solo había querido hacer el bien en el mundo.

    En los siete años desde aquella llamada, la misión de Suleyman no ha cambiado ni un ápice. "El objetivo no ha sido otro que hacer el bien en el mundo", afirma a través de Zoom desde su oficina de Palo Alto, donde el empresario británico pasa ahora la mayor parte del tiempo.

    Suleyman dejó DeepMind y se trasladó a Google para liderar un equipo dedicado a la Política de IA. En 2022, fundó Inflection, una de las nuevas empresas de IA más prometedoras, respaldada por una inversión de 1.500 millones de dólares (1.400 millones de euros) de Microsoft, Nvidia, Bill Gates y Reid Hoffman, fundador de LinkedIn. A principios de 2023, lanzó Pi, un rival de ChatGPT cuyo único argumento de venta, según Suleyman, es que es agradable y educado. Además, es coautor de The Coming Wave: Tecnología, poder y el mayor dilema del siglo XXI, un libro sobre el futuro de la IA coescrito junto al investigador Michael Bhaskar.

    Muchos se burlarán del optimismo tecnológico de Suleyman, incluso de su ingenuidad. Por ejemplo, algunas de sus afirmaciones sobre el éxito de la regulación online están lejos de la realidad. Sin embargo, sus convicciones son serias y evangélicas.

    Es cierto que Suleyman tiene un pasado inusual para un multimillonario de la tecnología. A los 19 años abandonó la universidad para crear Muslim Youth Helpline, un servicio de asesoramiento telefónico. También trabajó en la administración local. Suleyman asegura que ha llevado a Inflection muchos de los valores que inspiraron esos esfuerzos. La diferencia es que ahora podría estar en condiciones de hacer los cambios que siempre ha deseado, para bien o para mal.

    Los comienzos de su carrera, con la línea de ayuda a los jóvenes y el trabajo en el gobierno local, fueron de lo menos glamuroso o Silicon Valley que se puede encontrar. Claramente, estos aspectos son importantes para usted. Desde entonces, ha dedicado 15 años a la IA y en 2023 ha cofundado su segunda empresa de IA, valorada en mil millones de dólares. ¿Puede relacionar estos hechos?

    Siempre he estado interesado por el poder, la política y este tipo de aspectos más sociales. Los principios de los derechos humanos son básicamente compromisos, una negociación constante entre diversas tensiones y conflictos. Me di cuenta de que los seres humanos nos enfrentábamos a ello, estamos llenos de prejuicios y puntos ciegos. La labor de los activistas, los gobiernos locales, nacionales e internacionales es lenta, ineficaz y falible.

    Imagina un escenario sin la falibilidad humana. Es posible crear IA que reflejen nuestro mejor "yo" colectivo y que en nuestro nombre hagan mejores concesiones de forma más coherente y justa.

    ¿Eso sigue motivándole?

    Por supuesto, después de DeepMind no tenía necesidad de volver a trabajar. Tampoco tenía que escribir un libro ni nada parecido. El dinero nunca ha sido la motivación, solo un efecto secundario.

    Para mí, el objetivo nunca ha sido otro que cómo hacer el bien en el mundo y que el mundo avance de una forma sana y satisfactoria. Incluso en 2009, cuando empecé a estudiar la posibilidad de meterme en el mundo de la tecnología, pude ver que la IA representaba una forma justa y precisa de prestar servicios en el mundo.

    No puedo evitar pensar que era más fácil decir ese tipo de cosas hace 10 o 15 años, antes de que viéramos muchos de los inconvenientes de la tecnología. ¿Cómo consigue mantener el optimismo?

    Estamos obsesionados con si eres optimista o pesimista, pero es una forma sesgada de ver las cosas. No quiero ser ni lo uno ni lo otro: quiero mirar los beneficios y las amenazas a la cara. Desde donde me encuentro, podemos ver que, con cada paso de estos grandes modelos lingüísticos, se vuelven más controlables.

    Hace dos años, la conversación —como pensé de manera equivocada—era: "Oh, solo van a producir gritos tóxicos, regurgitados, parciales y racistas". Consideré que era una fase pasajera. Las personas pierden de vista que se trata de una progresión que sucede año tras año.

    En la actualidad, modelos como Pi, por ejemplo, son muy controlables. No puedes hacer que Pi produzca contenidos racistas, homófobos, sexistas, o cualquier tipo tóxico. Ni tampoco que te enseñe cómo producir un arma biológica o química, ni que apoye tu deseo de lanzar un ladrillo a través de la ventana de tu vecino. No puedes conseguirlo.

    Espere. Dígame cómo lo ha conseguido, porque suele entenderse como un problema sin resolver. ¿Cómo te aseguras de que tu gran modelo lingüístico no diga lo que no quieres que diga?

    No quiero hacer el reclamo. ¡Por favor, inténtalo! Pi está vivo y deberías intentar todos los ataques posibles. Ninguno de los jailbreaks o prompt hacks, nada funciona contra Pi. No es una opinión, es un hecho objetivo.

    No voy a entrar en demasiados detalles sobre el método porque es delicado. Lo esencial es que tenemos uno de los equipos más potentes del mundo, creador de todos los modelos lingüísticos más grandes de los últimos tres o cuatro años. Unos profesionales talentosos en un entorno trabajador y con enormes cantidades de computación. Desde el principio, hicimos de la seguridad nuestra prioridad número uno y, como resultado, Pi no es tan malicioso como los modelos de otras empresas.

    Mira Character.ai. [un chatbot para el que los usuarios pueden crear diferentes personalidades y compartirlas de manera digital para que otros chateen con ellos]. Sobre todo, se utiliza para juegos de rol románticos, y desde el principio acordamos que estaba descartado, no lo haríamos. Si intentas decirle "Hola, cariño", "Hola, guapo" o algo así a Pi, te responderá de manera inmediata.

    Sin embargo, será muy respetuoso. Si empiezas a quejarte de que los inmigrantes de tu comunidad te quitan el trabajo, Pi no te llamará la atención ni te señalará ese sesgo. Pi te preguntará, te apoyará, intentará entender de dónde viene esta afirmación y te animará a empatizar. Unos valores en los que he pensado durante las últimas dos décadas.

    Hablando de tus valores y de querer mejorar el mundo, ¿por qué no compartes cómo lo hiciste para que otras personas también puedan mejorar sus modelos?

    Porque soy pragmático y trato de hacer dinero. Intento construir un negocio, acabo de recaudar 1.500 millones de dólares (1.400 millones de euros) y necesito pagar las facturas.

    El ecosistema del código abierto está en auge y hace un trabajo increíble, los usuarios está descubriendo trucos similares. Siempre asumo de que solo voy seis meses por delante del resto.

    Volvamos a lo que se pretende conseguir. Los grandes modelos lingüísticos son la tecnología del momento, ¿por qué otra razón se apuesta por ellos?

    La primera ola de IA se centró en la clasificación. El aprendizaje profundo demostró que podemos entrenar a un ordenador para clasificar varios tipos de datos de entrada: imágenes, vídeo, audio, o lenguaje. Ahora, estamos en la ola generativa, donde se toman esos datos de entrada para producir datos nuevos.

    La tercera ola será la fase interactiva. Por eso, llevo mucho tiempo apostando por que la conversación es la interfaz del futuro. En lugar de pulsar botones y teclear, hablarás con tu IA.

    Esta IA podrá actuar, le darás un objetivo general de alto nivel y utilizará todas las herramientas a su alcance para actuar en consecuencia. Por ejemplo, hablarán con otras personas o con otras herramientas de IA. Esto es lo que haremos en Pi.

    Es un gran cambio sobre lo que puede hacer la tecnología. Es un momento muy importante en la historia de la tecnología y subestimado por muchas personas, en mi opinión. Actualmente, la tecnología es estática y realiza, en términos generales, lo que le indicamos.

    Sin embargo, ahora, la tecnología estará animada con la libertad potencial de tomar acciones, si se le concede. Es un cambio en la historia de nuestra especie, ya que estamos creando herramientas con este tipo de agencia.

    Ese es el tipo de discurso que preocupa a mucha gente. Se quiere dar autonomía a las tecnologías —una especie de agencia— para que influyan en el mundo, mientras queremos controlarlas. ¿Cómo equilibrar ambas cosas? Parece que hubiera una tensión.

    Sí, ese es un gran punto. Es un punto de fricción.

    La idea es que los humanos sigan al mando. Se trata de establecer fronteras, límites que una IA no pueda cruzar. Y garantizar que esos límites creen una seguridad demostrable en todo el proceso, desde el código real hasta la forma en que interactúa con otras IA, o humanos,  y las motivaciones e incentivos de las empresas que crean la tecnología. Deberíamos descubrir cómo las instituciones independientes e incluso los gobiernos tienen  acceso directo para garantizar que esos límites no se crucen.

    ¿Quién establece estos límites? Supongo que deben fijarse a nivel nacional o internacional. ¿Cómo se acuerdan?

    Por el momento, se plantean a nivel internacional mediante diversas propuestas de nuevas instituciones de supervisión, pero los límites también operarán a menor nivel. Le darás un permiso limitado a tu IA para procesar tus datos personales y darte respuestas a algunas preguntas, pero no a otras.

    En general, creo que hay ciertas capacidades con las que deberíamos ser muy cautos, si no descartarlas, en un futuro previsible.

    ¿Por ejemplo?

    Aspectos como la auto-mejora recursiva. No dejarías que tu IA actualizara su propio código sin tu supervisión. Incluso debería ser una actividad autorizada, como la manipulación de ántrax o materiales nucleares.

    Tampoco hemos permitido drones en ningún espacio público, ¿verdad? Es una actividad autorizada y no puedes volarlos donde quieras porque representan una amenaza para la privacidad de las personas.

    Todo el mundo tiene un pánico total a que no seamos capaces de regular esto. No tiene sentido. Vamos a ser totalmente capaces de regularlo. Aplicaremos los mismos marcos que han tenido éxito anteriormente.

    Sin embargo, los drones se ven cuando están en el cielo. Parece ingenuo suponer que las empresas se limitarán a revelar lo que fabrican. ¿No dificulta eso la puesta en marcha de la regulación?

    Hemos regulado muchos temas online, ¿verdad? El fraude y la actividad delictiva en internet son mínimos, también hemos hecho un buen trabajo con el spam. En general, [el problema del] porno de venganza ha cambiado, aunque hace tres o cinco años era terrible. Es bastante difícil encontrar contenidos de radicalización o material terrorista en internet. Es muy difícil comprar armas y drogas por internet.

    [No todas las afirmaciones de Suleyman están respaldadas por cifras. La ciberdelincuencia sigue siendo un enorme problema mundial. El coste financiero solo en EE UU se ha multiplicado por más de 100 en la última década, según algunas estimaciones. Los informes muestran que la economía del porno deepfake no consentido está en auge. En las redes sociales se comercializan drogas y armas. Y aunque se presiona algunas plataformas online para que filtren mejor los contenidos nocivos, podrían hacer mucho más].

    Internet no es un espacio rebelde que no está gobernado, lo está. Y la IA será un componente más de ese gobierno.

    Hace falta una combinación de presión cultural e institucional, así como regulación gubernamental. Pero soy optimista: lo hemos hecho antes y podemos volver a hacerlo.

    El control de la inteligencia artificial será una consecuencia de la regulación de internet. Es una nota más optimista que hemos oído de varios catastrofistas de alto nivel.

    Tengo los ojos abiertos ante los riesgos. Hay muchas cosas oscuras en mi libro, también lo veo. El tema del riesgo existencial ha sido una distracción absurda. Hay 37 cuestiones más prácticas de las que todos deberíamos hablar, desde la privacidad a los prejuicios, el reconocimiento facial o la moderación online.

    Deberíamos volver a centrar la conversación en el increíble trabajo de regulación de cosas supercomplejas. Como ejemplo, la Administración Federal de Aviación: es increíble que viajemos en estos tubos de hojalata a 40.000 pies (12.200 metros) de altura y sea uno de los medios de transporte más seguros de la historia. ¿Por qué no lo celebramos? O pensemos en los coches, todos los componentes se someten a pruebas de resistencia y hay que tener carné para conducirlos.

    Algunas industrias, como las aerolíneas, hicieron un buen trabajo regulándose a sí mismas desde el principio. Sabían que, si no ajustaban la seguridad, los clientes se asustarían y perderían negocio.

    También se necesita una regulación de arriba abajo. Me encanta el Estado-nación. Creo en el interés público, el bien de los impuestos y la redistribución, el poder de la regulación. Y pido que el Estado-nación actúe para solucionar sus problemas. Dado lo que está en juego, ahora es el momento de ponerse en marcha.




lunes, 23 de octubre de 2023

NYT- Cómo Siri, Alexa y el Asistente de Google perdieron la carrera de la IA

 Brian X. Chen , Nico Grant y 15 de marzo de 2023

Brian X. Chen, redactor principal de tecnología de consumo del Times, y Nico Grant, que cubre Google, informaron desde San Francisco. Karen Weise, que escribe sobre Amazon, vive en Seattle.


Un martes lluvioso en San Francisco, los ejecutivos de Apple subieron al escenario en un auditorio lleno de gente para presentar el iPhone de quinta generación . El teléfono, que parecía idéntico a la versión anterior, tenía una nueva característica que pronto llamó la atención del público: Siri, un asistente virtual .

Scott Forstall, entonces jefe de software de Apple, presionó un botón del iPhone para convocar a Siri y le hizo preguntas. A petición suya, Siri comprobó la hora en París (“8:16 pm”, respondió Siri), definió la palabra “mitosis” (“División celular en la que el núcleo se divide en núcleos que contienen el mismo número de cromosomas”, decía) y obtuvo una lista de 14 restaurantes griegos altamente calificados, cinco de ellos en Palo Alto, California.

"He estado en el campo de la IA durante mucho tiempo y esto todavía me sorprende", dijo Forstall.

Eso fue hace 12 años. Desde entonces, la gente no ha quedado impresionada por Siri y los asistentes de la competencia que funcionan con inteligencia artificial, como Alexa de Amazon y el Asistente de Google. La tecnología se ha mantenido en gran medida estancada y los asistentes parlantes se han convertido en el blanco de bromas, incluso en un sketch de “Saturday Night Live” de 2018 que presenta un altavoz inteligente para personas mayores.

El mundo de la tecnología ahora está entusiasmado con un tipo diferente de asistente virtual: los chatbots. Estos bots impulsados ​​por IA, como ChatGPT y el nuevo ChatGPT Plus de la empresa OpenAI de San Francisco, pueden improvisar respuestas a preguntas escritas en un cuadro de chat con presteza. La gente ha utilizado ChatGPT para manejar tareas complejas como codificar software, redactar propuestas comerciales y escribir ficción.


Y ChatGPT, que utiliza inteligencia artificial para adivinar qué palabra viene a continuación, está mejorando rápidamente. Hace unos meses no podía escribir un haiku adecuado; ahora puede hacerlo con gusto. El martes, OpenAI presentó su motor de IA de próxima generación, GPT-4 , que impulsa ChatGPT.

El entusiasmo en torno a los chatbots ilustra cómo Siri, Alexa y otros asistentes de voz, que alguna vez provocaron un entusiasmo similar, han desperdiciado su liderazgo en la carrera de la IA.

Durante la última década, los productos se toparon con obstáculos. Siri se topó con obstáculos tecnológicos, incluido un código torpe que tardó semanas en actualizarse con funciones básicas, dijo John Burkey, un ex ingeniero de Apple que trabajó en el asistente. Amazon y Google calcularon mal cómo se utilizarían los asistentes de voz, lo que los llevó a invertir en áreas con tecnología que rara vez valía la pena, dijeron exempleados. Cuando esos experimentos fracasaron, el entusiasmo por la tecnología disminuyó en las empresas, dijeron.

Los asistentes de voz son “tontos como una piedra”, dijo Satya Nadella, director ejecutivo de Microsoft, en una entrevista este mes con The Financial Times, declarando que la nueva IA lideraría el camino. Microsoft ha trabajado estrechamente con OpenAI, invirtiendo 13 mil millones de dólares en la puesta en marcha e incorporando su tecnología al motor de búsqueda Bing, así como a otros productos.


Apple se negó a comentar sobre Siri. Google dijo que estaba comprometido a proporcionar un excelente asistente virtual para ayudar a las personas en sus teléfonos y dentro de sus hogares y automóviles; La empresa está probando por separado un chatbot llamado Bard . Amazon dijo que vio un aumento del 30 por ciento en la participación del cliente a nivel mundial con Alexa en el último año y que era optimista acerca de su misión de construir una IA de clase mundial.


Los asistentes y los chatbots se basan en diferentes tipos de IA. Los chatbots funcionan con lo que se conoce como grandes modelos de lenguaje, que son sistemas entrenados para reconocer y generar texto basado en enormes conjuntos de datos extraídos de la web. Luego pueden sugerir palabras para completar una oración.

Por el contrario, Siri, Alexa y Google Assistant son esencialmente lo que se conoce como sistemas de comando y control. Estos pueden comprender una lista finita de preguntas y solicitudes como "¿Cómo está el clima en la ciudad de Nueva York?" o “Enciende las luces del dormitorio”. Si un usuario le pide al asistente virtual que haga algo que no está en su código, el robot simplemente dice que no puede ayudar.

Siri también tenía un diseño engorroso que hacía que agregar nuevas funciones llevara mucho tiempo, dijo Burkey, a quien se le asignó la tarea de mejorar Siri en 2014. La base de datos de Siri contiene una lista gigantesca de palabras, incluidos los nombres de artistas musicales y ubicaciones. como restaurantes, en casi dos docenas de idiomas.

Eso lo convirtió en “una gran bola de nieve”, dijo. Si alguien quisiera agregar una palabra a la base de datos de Siri, agregó, "se va en una gran pila".


Por lo tanto, actualizaciones aparentemente simples, como agregar algunas frases nuevas al conjunto de datos, requerirían reconstruir toda la base de datos, lo que podría llevar hasta seis semanas, dijo Burkey. Agregar funciones más complejas, como nuevas herramientas de búsqueda, podría llevar casi un año. Eso significaba que no había camino para que Siri se convirtiera en un asistente creativo como ChatGPT, dijo.

Alexa y Google Assistant dependían de tecnología similar a la de Siri, pero las empresas tuvieron dificultades para generar ingresos significativos con los asistentes, dijeron ex gerentes de Amazon y Google. (Por el contrario, Apple utilizó con éxito Siri para atraer compradores a sus iPhone).

Después de que Amazon lanzó Echo, un altavoz inteligente impulsado por Alexa, en 2014, la compañía esperaba que el producto le ayudara a aumentar las ventas en su tienda en línea al permitir a los consumidores hablar con Alexa para realizar pedidos, dijo un exlíder de Amazon involucrado con Alexa. Pero si bien la gente se divirtió jugando con la capacidad de Alexa para responder indicaciones meteorológicas y configurar alarmas, pocos le pidieron a Alexa que ordenara artículos , agregó.

Es posible que Amazon haya invertido demasiado en la fabricación de nuevos tipos de hardware, como despertadores y microondas ahora descontinuados que funcionaban con Alexa, que se vendían al costo o por debajo del mismo, dijo el ex ejecutivo.

La compañía también invirtió poco en la creación de un ecosistema para que las personas expandieran fácilmente las capacidades de Alexa, como lo hizo Apple con su App Store, lo que ayudó a avivar el interés en el iPhone, dijo la persona. Si bien Amazon ofrecía una tienda de “habilidades” para que Alexa controlara accesorios de terceros, como interruptores de luz, era difícil para las personas encontrar y configurar habilidades para los parlantes, a diferencia de la experiencia sin fricciones de descargar aplicaciones móviles desde las tiendas de aplicaciones.


“Nunca tuvimos ese momento en la App Store para los asistentes”, dijo Carolina Milanesi, analista de tecnología de consumo de la firma de investigación Creative Strategies que fue consultora de Amazon.

A finales del año pasado, la división de Amazon que trabajaba en Alexa fue uno de los principales objetivos de los 18.000 despidos de la empresa, y varios altos ejecutivos de Alexa abandonaron la empresa.

Kinley Pearsall, portavoz de Amazon, dijo que Alexa era mucho más que un asistente de voz y "somos tan optimistas sobre esa misión como siempre".



Los fallos de Amazon con Alexa pueden haber llevado a Google por mal camino, dijo un exgerente que trabajó en el Asistente de Google. Los ingenieros de Google pasaron años experimentando con su asistente para imitar lo que Alexa podía hacer, incluido el diseño de parlantes inteligentes y pantallas de tabletas controladas por voz para controlar accesorios del hogar como termostatos e interruptores de luz. Posteriormente, la empresa integró anuncios en esos productos para el hogar, que no se convirtieron en una fuente importante de ingresos.

Con el tiempo, Google se dio cuenta de que la mayoría de la gente usaba el asistente de voz sólo para un número limitado de tareas simples, como iniciar temporizadores y reproducir música, dijo el exgerente. En 2020, cuando Prabhakar Raghavan, un ejecutivo de Google, se hizo cargo del Asistente de Google, su grupo reenfocó al compañero virtual como una característica destacada para los teléfonos inteligentes Android.


En enero, cuando la empresa matriz de Google despidió a 12.000 empleados , el equipo que trabajaba en sistemas operativos para dispositivos domésticos perdió el 16 por ciento de sus ingenieros.


Muchas de las grandes empresas de tecnología ahora están compitiendo para encontrar respuestas a ChatGPT. El mes pasado, en la sede de Apple, la compañía celebró su cumbre anual de IA, un evento interno para que los empleados aprendan sobre su modelo de lenguaje grande y otras herramientas de IA, dijeron dos personas que conocieron el programa. Muchos ingenieros, incluidos miembros del equipo de Siri, han estado probando conceptos generadores de lenguaje cada semana, dijeron las personas.


El martes, Google también dijo que pronto lanzaría herramientas de inteligencia artificial generativa para ayudar a empresas, gobiernos y desarrolladores de software a crear aplicaciones con chatbots integrados e incorporar la tecnología subyacente en sus sistemas.


En el futuro, las tecnologías de chatbots y asistentes de voz convergerán, afirman los expertos en inteligencia artificial. Eso significa que las personas podrán controlar los chatbots con la voz, y quienes utilicen productos de Apple, Amazon y Google podrán pedirles a los asistentes virtuales que los ayuden con sus trabajos, no solo con tareas como consultar el clima.


"Estos productos nunca funcionaron en el pasado porque nunca tuvimos capacidades de diálogo a nivel humano", dijo Aravind Srinivas, fundador de Perplexity, una nueva empresa de inteligencia artificial que ofrece un motor de búsqueda impulsado por chatbot. "Ahora lo hacemos".



REF: https://www.nytimes.com/2023/03/15/technology/siri-alexa-google-assistant-artificial-intelligence.html