martes, 28 de enero de 2025

Mentes humanas frente a modelos de aprendizaje automático (Marina Tosic y Dee Penco)

 

Explorando los paralelismos y diferencias entre la psicología y el aprendizaje automático, 23-enero 2025

“Mientras que los psicólogos sueñan con un día en que se comprenda por completo la complejidad de la mente humana, o los profesionales de los datos sueñan con un día en que los modelos de IA alcancen la inteligencia artificial general, cada dominio aún conserva su campo único. Sin embargo, el diálogo entre estos dos campos profundiza nuestra comprensión de ambos”. 



El año 2024 fue un año importante en el reconocimiento de las contribuciones del aprendizaje automático y la inteligencia artificial.

El Premio Nobel de Química fue otorgado por los avances en la ciencia de las proteínas: David Baker por la creación de nuevos tipos de proteínas, junto con Demis Hassabis y John Jumper por el desarrollo de un modelo de IA que resolvió un desafío de 50 años de predecir las estructuras complejas de las proteínas.

Además, John Hopfield y Geoffrey Hinton recibieron el Premio Nobel de Física por su trabajo en redes neuronales artificiales, modelos similares al cerebro capaces de reconocer patrones y producir resultados que se asemejan a los procesos de toma de decisiones humanas.

Aunque la inteligencia artificial modela cada vez con mayor precisión la resolución de problemas y la toma de decisiones humanas, aún es necesario comprender plenamente los mecanismos detrás de la cognición humana.

La psicología de la (re)acción humana involucra dimensiones complejas interconectadas, moldeadas por capas de factores conscientes y subconscientes.

—Entonces, ¿qué diferencia a los modelos humanos y de ML/IA a la hora de generar resultados?

Para abordar esta pregunta, exploremos estos dos mundos (la psicología y el aprendizaje automático) y descubramos las conexiones que dan forma al modo en que los humanos y los modelos de IA creados por humanos producen resultados.

Los objetivos de este post son :

  1. Acercar explicaciones de psicología profesional de alto nivel a los lectores técnicos sobre lo que afecta la toma de decisiones humanas.
  2. Muestre el proceso de modelado de aprendizaje automático (ML) de alto nivel y explique cómo los modelos de ML generan resultados para profesionales no técnicos.
  3. Identifique las diferencias y similitudes entre los dos procesos (el humano y la máquina) que producen resultados.

Aspecto psicológico: ¿Cómo generan resultados los seres humanos? | Por Dee

Antes de comenzar a escribir esta sección , quiero enfatizar que todos los psicólogos del mundo estarían encantados si hubiera una manera para que las personas funcionaran de manera más simple, o al menos tan simple como los modelos de IA o ML.

Los expertos en IA y ML probablemente estén horrorizados por lo que acabo de decir porque insinué que “la IA y el ML son simples”.

— Pero esa no era mi intención.

Sólo quiero destacar lo mucho más simples que son estos modelos comparados con las complejidades de los humanos .

Cuando Marina me explicaba a alto nivel cómo funciona el modelado del aprendizaje automático, no pude evitar pensar:

Si pudiéramos “reducir” a los humanos a esta metodología “ sencilla” , curaríamos la mayoría de los problemas psicológicos, transformaríamos vidas para mejor y mejoraríamos drásticamente el bienestar general de la población.

Imagínese si una persona pudiera recibir entradas , pasarlas a algunos algoritmos internos que pudieran determinar el peso , la importancia y la calidad de esa entrada, hacer la predicción más probable y, en base a eso, producir un resultado controlado : pensamiento , emoción o comportamiento .

Pero a diferencia del aprendizaje automático o la inteligencia artificial, la mente humana procesa la información de formas mucho más complejas, influenciadas por numerosos factores interconectados.

A partir de este punto, dejaré de especular sobre lo que sucede dentro de un modelo de IA o ML y explicaré el flujo de modelado “humano”.

Para ilustrar el concepto, analizaré varios factores que influyen en la toma de decisiones de los seres humanos.

Para ello, te invito a que imagines a una persona como un “ modelo preentrenado de caja negra”. En otras palabras, un modelo ya viene precargado con patrones de conocimiento y pesos aprendidos en la etapa de entrenamiento.

Estos patrones y pesos o factores varían de persona a persona y se conocen como:

  • (1) Inteligencia y cociente intelectual
  • (2) Mundo emocional y EQ
  • (3) Mundo consciente : lo que el “modelo” ha aprendido hasta ahora: valores, experiencias, propósito
  • (4) Mundo inconsciente y subconsciente: lo que el “modelo” aprendió y reprimió hasta ahora: memoria a corto y largo plazo + (de nuevo) valores, experiencias, propósito
  • (5) Predisposiciones genéticas: con qué nacemos
  • (6) Medio ambiente: social, cultural, físico.
  • (7) Necesidades fisiológicas: Jerarquía de Maslow (Jerarquía de necesidades)
  • (8) Estado hormonal y fisiológico: neurobiología, sistema endocrino, excitación
  • (9) Centros de toma de decisiones: Ello, Yo, Superyó, que separan entidades dentro de nosotros.
  • (10) Intuición y creatividad : pueden considerarse parte de las variables agrupadas anteriormente o entidades separadas por sí mismas (intuición, pensamiento divergente, estado de flujo)

Hasta ahora, hemos identificado 10 factores que varían para cada persona.

Quiero enfatizar que todos ellos están interconectados y a veces tan “fusionados” entre sí que incluso pueden llegar a combinarse .

Además, cada uno puede ser más grueso o más delgado y puede contener “partículas”, o información predominante o deficiente .

  • Por ejemplo, los factores hormonales pueden tener una hormona predominante (como la serotonina , que afecta al estado de ánimo; el cortisol en respuesta al estrés; la dopamina , que es esencial para la excitación, etc.). El factor intelectual puede ser mayor o menor .

Ahora imaginemos que hay algún algoritmo dentro de la persona que reorganiza constantemente el orden de importancia de los factores, de modo que a veces uno puede terminar al frente, a veces en el medio y a veces atrás.

  • Tomemos las necesidades fisiológicas, como el hambre , por ejemplo. Si la colocamos al principio, determinará qué información llega a la segunda, tercera, cuarta, etc.; el resultado dependerá de eso .

En otras palabras, si tomas decisiones mientras tienes hambre , el resultado probablemente no será el mismo que si tuvieras el estómago lleno .

📌 Los factores están ordenados por importancia, con el más importante en el momento específico siempre en la primera posición, luego el segundo, y así sucesivamente.

Lo que acabo de describir brevemente es cómo operan los humanos cuando reciben información de entrada en circunstancias específicas.

🙋🏽‍♀️ Volviendo a la idea introductoria, ¿expliqué por qué los psicólogos de todo el mundo anhelan una experiencia humana más sencilla? ¿Por qué nosotros, de este lado, estaríamos realmente contentos si la gente fuera tan “complicada” como ML?

  • Pensemos solamente en cuántos problemas psicológicos podrían resolverse —dado que los factores psicológicos son fundamentales para todo— y cuántos otros problemas a nuestro alrededor podrían resolverse si tan solo pudiéramos “ajustar” o “reiniciar” nuestros factores tan fácilmente como en el modelo ML.

— Pero ¿qué puedes hacer para controlar mejor tus resultados?

¿Recuerdas la parte que mencioné anteriormente sobre el “espesor” de tus factores? Bueno, dado que el espesor de tus factores y su orden determinan tu resultado (la emoción que sientes, el pensamiento que formas y la reacción a la información), es útil saber que puedes espesar algunos de estos factores para tu beneficio y mantenerlos firmemente en la primera posición.

Lo simplificaré de nuevo con varios ejemplos:
probablemente puedas (y con suerte) asegurarte de no tener hambre nunca. Puedes trabajar en la regulación de tus hormonas. En terapia, puedes abordar tus miedos y trabajar para eliminarlos. Puedes ajustar creencias profundamente arraigadas almacenadas en tu subconsciente, y así sucesivamente. 👉🏼 Nosotros (tú) podemos hacer esto, y es una pena que más personas no trabajen en ajustar sus factores.

Y por ahora dejémoslo así.

Hasta que alguna forma de IA descubra una forma más eficiente de hacer esto o en nuestro lugar, continuaremos tomando ciertas decisiones, sintiendo ciertas emociones y realizando acciones específicas como lo hacemos ahora.

Aspectos del aprendizaje automático: ¿Cómo generan resultados los modelos? | Por Marina

Cuando Dee habló de la “ caja negra humana ” con patrones preentrenados, no pude evitar pensar en lo mucho que se parece al proceso de aprendizaje automático . Así como los humanos tienen múltiples factores interconectados que influyen en sus decisiones, los modelos de aprendizaje automático tienen su versión de esta complejidad.

Entonces, ¿qué es el aprendizaje automático?

Es un subconjunto de la IA que permite a las máquinas aprender de datos pasados ​​(o datos históricos) y luego hacer predicciones o tomar decisiones sobre nuevos registros de datos sin estar programadas explícitamente para cada escenario posible .

Dicho esto, algunos de los “escenarios” de ML más comunes son:

  • Pronóstico o regresión (por ejemplo, predicción de precios de viviendas)
  • Clasificación (por ejemplo, etiquetar imágenes de gatos y perros)
  • Agrupamiento (por ejemplo, encontrar grupos de clientes analizando sus hábitos de compra)
  • Detección de anomalías (por ejemplo, detección de valores atípicos en sus transacciones para el análisis de fraudes)

O, para ejemplificar estos escenarios con nuestras tareas cognitivas diarias humanas, también predecimos (por ejemplo, ¿lloverá hoy? ), clasificamos (por ejemplo, ¿es un amigo o un extraño? ) y detectamos anomalías (por ejemplo, el queso que se echó a perder en nuestro refrigerador ). La diferencia radica en cómo procesamos estas tareas y qué entradas o datos tenemos (por ejemplo, la presencia de nubes frente a un cielo brillante y despejado ).

Por lo tanto, los datos (y su calidad) siempre son el núcleo de la producción de resultados de modelos de calidad a partir de los escenarios anteriores.

Datos: la “entrada” central

De manera similar a los humanos, que recopilan información sensorial multimodal de varias fuentes (por ejemplo, videos de YouTube, música de la radio, publicaciones de blogs de Medium, registros financieros de hojas de Excel, etc.), los modelos de ML se basan en datos que pueden ser:

  • Estructurado (como filas en una hoja de cálculo)
  • Semiestructurado (archivos JSON, XML)
  • No estructurado (imágenes, documentos PDF, texto libre, audio, etc.)

Debido a que los datos alimentan cada conocimiento que produce un modelo de ML, nosotros ( los profesionales de datos ) dedicamos una cantidad sustancial de tiempo a prepararlos, lo que a menudo se cita como el 50-70 % del esfuerzo general del proyecto de ML .

Esta fase de preparación brinda a los modelos de ML una muestra del “filtrado y preprocesamiento” que los humanos realizan naturalmente.

Buscamos valores atípicos, manejamos valores faltantes y duplicados, eliminamos parte de las entradas (características), características innecesarias o creamos otras nuevas.

Además de las tareas mencionadas anteriormente, también podemos "ajustar" las entradas de datos. — ¿Recuerdas cómo Dee mencionó que los factores son "más gruesos" o "más delgados"? — En ML, logramos algo similar a través de la ingeniería de características y la asignación de pesos , aunque de una manera completamente matemática.

En resumen, estamos “organizando” las entradas de datos para que el modelo pueda “aprender” de datos limpios y de alta calidad, produciendo resultados de modelo más confiables.

Modelado: Entrenamiento y prueba

Si bien los humanos pueden aprender y adaptar sus “pesos factoriales” a través de prácticas deliberadas, como describió Dee, los modelos de ML tienen un proceso de aprendizaje estructurado de manera similar.

Una vez que nuestros datos están en buen estado, los introducimos en algoritmos de ML (como redes neuronales , árboles de decisión o métodos de conjunto ).

En una configuración típica de aprendizaje supervisado, el algoritmo ve ejemplos etiquetados con las respuestas correctas (como mil imágenes etiquetadas como “gato” o “perro”).

Luego ajusta sus ponderaciones internas (su versión de los “factores de importancia”) para que coincidan (predigan) con esas etiquetas lo más exactamente posible. En otras palabras, el modelo entrenado podría asignar una puntuación de probabilidad que indique la probabilidad de que cada nueva imagen sea un “gato” o un “perro”, en función de los patrones aprendidos.

Aquí es donde el aprendizaje automático es más "sencillo" que la mente humana: los resultados del modelo provienen de un proceso definido de suma de entradas ponderadas, mientras que los humanos barajan múltiples factores (como hormonas, sesgos subconscientes o necesidades físicas inmediatas), lo que hace que nuestro proceso interno sea mucho menos transparente.

Así pues, las dos fases fundamentales en la construcción de modelos son:

  • Entrenamiento : Se muestran los datos etiquetados al modelo. Este “aprende” patrones que vinculan las entradas (características de la imagen, por ejemplo) con las salidas (la etiqueta correcta de la mascota).
  • Pruebas : Evaluamos el modelo con datos nuevos que no hemos visto (nuevas imágenes de gatos y perros ) para medir su capacidad de generalización. Si etiqueta incorrectamente ciertas imágenes de manera constante, podemos modificar los parámetros o recopilar más ejemplos de entrenamiento para mejorar la precisión de los resultados generados.

Como todo vuelve a los datos, es importante mencionar que la parte de modelado puede implicar más, especialmente si tenemos " datos desequilibrados ".

Por ejemplo: si el conjunto de entrenamiento tiene 5000 imágenes de perros pero solo 1000 imágenes de gatos , el modelo podría inclinarse a predecir perros con mayor frecuencia, a menos que apliquemos técnicas especiales para abordar el “ desequilibrio ”. Pero esta es una historia que requeriría una publicación completamente nueva.

La idea detrás de esta mención es que la cantidad de ejemplos en el conjunto de datos de entrada para cada resultado posible (la imagen “gato” o “perro”) influye en la complejidad del proceso de entrenamiento del modelo y su precisión de salida.

Los ajustes en curso y el factor humano

Sin embargo, a pesar de su aparente sencillez, un pipeline de ML no es algo que se pueda " instalar y olvidar ".

Cuando las predicciones del modelo comienzan a desviarse ( quizás porque nuevos datos han cambiado el escenario ), volvemos a entrenar y afinamos el sistema.

Nuevamente , los profesionales de datos detrás de escena necesitan decidir cómo limpiar o enriquecer los datos y reajustar los parámetros del modelo para mejorar las métricas de rendimiento del modelo.

Eso es el “ reaprendizaje ” en el aprendizaje automático.

Esto es importante porque los sesgos y errores en los datos o modelos pueden tener repercusiones en los resultados y tener consecuencias en la vida real . Por ejemplo, un modelo de calificación crediticia entrenado con datos históricos sesgados podría reducir sistemáticamente las calificaciones de ciertos grupos demográficos, lo que llevaría a la denegación injusta de préstamos u oportunidades financieras.

En esencia, los humanos siguen impulsando el ciclo de retroalimentación de la mejora en el entrenamiento de las máquinas, dando forma a cómo evoluciona y se “comporta” el modelo ML/IA.

En esta publicación, exploramos cómo los humanos generan resultados, influenciados por al menos diez factores principales interrelacionados, y cómo los modelos de ML producen resultados a través de algoritmos basados ​​en datos.

Aunque las máquinas y los humanos no obtienen resultados de la misma manera, las ideas centrales son notablemente similares.

  • Para los humanos , el proceso es intuitivo: recibimos y recopilamos información sensorial y la almacenamos en diversas formas de memoria. Nuestros procesos cognitivos combinan lógica, emociones, hormonas, experiencias pasadas, información externa del momento, etc., para producir acciones o comportamientos. Como lo ilustró Dee, esta combinación única de factores crea nuestra capacidad humana de ser predecibles y sorprendentes, racionales y emocionales, todo a la vez.
  • En el caso del aprendizaje automático o la inteligencia artificial , el flujo del proceso se basa en datos. Proporcionamos datos estructurados, semiestructurados o no estructurados, los almacenamos, los limpiamos, los etiquetamos o enriquecemos, los modelamos con algoritmos de aprendizaje automático o inteligencia artificial y, luego, dejamos que el modelo desarrollado genere predicciones, decisiones o recomendaciones. Sin embargo, como se muestra arriba, incluso este proceso aparentemente sencillo requiere una supervisión humana constante y una adaptación a nuevos escenarios.

La diferencia clave radica en la imprevisibilidad de los procesos mentales humanos, frente a la naturaleza más rastreable y parametrizada de los modelos ML/IA.

Y mientras la mayoría de nosotros nos preguntamos qué nos depara el futuro —qué pasará cuando la IA alcance la IAG y posiblemente reemplace nuestros trabajos con sus habilidades “sobrehumanas”— Dee compartió una perspectiva interesante sobre ese punto:

¿Qué pasaría si la IA comenzara a seguir nuestro camino? Desarrollaría emociones, llenaría su memoria con datos conflictivos o dañinos, crearía de algún modo una identidad y se volvería impredecible.

Hmm... No te lo esperabas, ¿verdad? — El resultado no tiene por qué ser necesariamente que la IA nos supere. — Tal vez superemos a la IA , lo que abre otra pregunta: ¿los rasgos (factores) humanos evolucionan necesariamente...? Porque tal vez ese sea el futuro de la IA.

Hasta entonces, es importante reconocer que tanto los modelos humanos como los de máquina pueden aprender, adaptarse y cambiar sus resultados a lo largo del tiempo, siempre que reciban las entradas adecuadas y la voluntad de seguir perfeccionando el proceso.

Podemos trabajar para mejorar la calidad de los resultados seleccionando mejores insumos y refinando la forma en que se procesan, ya sea en sesiones guiadas con consejeros o en diseños de datos y algoritmos de ML/IA.

miércoles, 30 de octubre de 2024

IA y Periodismo

 Antoni Vidal Carretero, 18 de octubre de 2024

La inteligencia artificial (IA) se ha convertido en uno de los temas más desafiantes y fascinantes de nuestra época, con el potencial de transformar radicalmente las dinámicas sociales, políticas y económicas. A medida que la IA avanza, es necesario reflexionar sobre sus grandes retos sociológicos y su impacto en las democracias occidentales. Si bien la IA puede ofrecer soluciones innovadoras y aumentar la eficiencia de las instituciones, también plantea riesgos profundos en términos de desigualdad, manipulación de la información y concentración de poder en manos de unos pocos.

Uno de los efectos positivos más evidentes es la capacidad de la IA para mejorar la gestión de los recursos públicos, optimizar los sistemas de transporte y salud, e incluso fortalecer la seguridad. Sin embargo, estas promesas de progreso tecnológico deben ir acompañadas de un escrutinio ético riguroso, ya que también existen efectos negativos potenciales que pueden erosionar la calidad de las democracias. En sociedades libres, donde la transparencia y la participación ciudadana son pilares, el uso indebido de la IA podría comprometer la equidad en el acceso a la información y los derechos fundamentales.

En este sentido, el "cuarto poder", representado por los medios de comunicación, juega un papel crucial. A medida que las herramientas de IA comienzan a generar, filtrar y priorizar contenido informativo, surge el riesgo de que el control sobre la información quede centralizado en manos de empresas tecnológicas o grupos con intereses específicos. Esto podría limitar el acceso a fuentes diversas y dar paso a una realidad informativa sesgada, en la que el ciudadano pierde capacidad de discernimiento. La libertad de expresión, piedra angular de las democracias, se vería afectada si el flujo informativo es controlado por algoritmos que priorizan lo sensacionalista o lo rentable, en detrimento de lo veraz. A tenor de esto último, cabe destacar los acuerdos de colaboración firmados recientemente entre grandes grupos como PRISA, Le Monde, The Guardian o Condé Nast con OpenAI, de los que poco se sabe, pero que podrían incidir radicalmente en cómo se informa a una parte importante de la ciudadanía occidental.

El ensayo El último periodista: La Inteligencia Artificial toma el relevo, el prestigioso comunicador y periodista Antoni Vidal Carretero, explora estas cuestiones en profundidad. En este libro, se analiza cómo la IA está transformando la labor del periodismo y la forma en que las sociedades se informan, advirtiendo sobre la necesidad de que los ciudadanos mantengan el control sobre las fuentes de información. Esta obra ofrece una valiosa reflexión sobre el futuro del "periodismo humano" frente a la automatización masiva de contenidos, y cómo los cambios que estamos presenciando impactarán en la preservación de la democracia y las libertades civiles.

Aprender a dominar la tecnología detrás de la IA se torna pues imprescindible para garantizar que su desarrollo responda al interés general y no a objetivos privados. Solo así podremos proteger nuestras instituciones, asegurar un acceso equilibrado a la información y evitar que las decisiones políticas y sociales sean dictadas por fuerzas invisibles o incontrolables.

jueves, 27 de junio de 2024

La IA no sabe reírse -MIT

 MIT-27.06.2024, Carlos Corominas, Redactor jefe de MIT Technology Review en español


Desde la popularización de la inteligencia artificial generativa a finales de 2022, se ha establecido un debate acerca de los riesgos que estos modelos tenían para las profesiones creativas. Artistas, escritores, músicos, creadores audiovisuales y periodistas hemos observado con curiosidad y cierto recelo las capacidades para generar contenido de estas herramientas. Más allá de las vulneraciones de copyright para entrenar los modelos, a los creadores también les preocupa el propio futuro de su profesión.  

Con el paso de los meses, los modelos existentes de IA se han consolidado como asistentes, herramientas para mejorar la productividad o colaboradores digitales para fomentar la creatividad. Muchos la usamos para ayudarnos en nuestro día a día o para romper la página en blanco. En el ámbito creativo, las posibilidades son indudables, como muestran los vídeos creados con Sora de OpenAI. Otras aplicaciones más polémicas han surgido en el mundo de la música. Hace unos meses, se publicaba una canción hecha por IA que emulaba la voz y el estilo de Bad Bunny, y que provocó la ira del artista. 

En lo que llevamos de 2024, los raperos Drake y Kendrick Lamar han protagonizado una batalla dialéctica en forma de canciones en las que se retaban con insultos y amenazas. Sin embargo, lo que muchos consideraron una línea roja fue que Drake utilizara una IA para recrear la voz del rapero Tupac, asesinado en 1996 y un referente de Lamar. Es una muestra de las capacidades de la IA para generar contenido falso, aunque este tipo de manipulaciones no sean nuevas: el propio Lamar hizo uso del deepfake de manera creativa en un videoclip hace dos años y rehizo una entrevista de Tupac al final de su disco To Pimp a Butterfly para simular una conversación. 

Sin embargo, todavía la IA no se muestra como un agente creador por sí mismo con capacidad completa para sustituir al ser humano y, por eso, los artistas ya no le tienen tanto miedo. Dadas sus características, es especialmente torpe a la hora de utilizar el sarcasmo, los juegos de palabras o tratar de conectar conceptos de maneras inusuales o creativas. Es algo que se observa de forma muy evidente cuando a los modelos de lenguaje se les pide que hagan humor o cuenten un chiste. Pueden funcionar para romper la página en blanco o crear conceptos curiosos, pero fallan al intentar ser graciosos. De momento, podemos perder el miedo, aunque no lleguemos a reírnos.

viernes, 14 de junio de 2024

Construyendo una mejor Internet

Medium - 14 de junio de 2024

Creo que no es controvertido decir que Internet está en una situación desesperada. En los últimos años, hemos sido testigos de la desaparición de espacios de redes sociales que alguna vez fueron prometedores, el vaciamiento de los medios digitales, el declive de la búsqueda como herramienta útil y las primeras oleadas de contenido basura de IA que comienzan a inundar la web.

Si ha intentado leer algo en línea recientemente, su experiencia probablemente haya sido especialmente terrible. La sensación básica de una página web promedio, seamos honestos, no es excelente. La historia está intercalada entre anuncios, con ventanas emergentes que aparecen aparentemente al azar, y no importa qué tan rápido seas, no puedes presionar la pequeña "x" en el video de reproducción automática antes de que comience a reproducirse.

Las palabras, para gran parte de Internet, son una ocurrencia tardía.

Aunque no en todas partes. Hay lugares que intentan crear un lugar limpio y bien diseñado para las palabras, las historias y los narradores humanos, pero ya son pocos.

jueves, 23 de mayo de 2024

Al calor del auge de la inteligencia artificial

MIT 23.05.2024


Al calor del auge de la inteligencia artificial, la industria de los chips está recibiendo un impulso sin precedentes. Los problemas de suministro que se sucedieron tras la pandemia de COVID-19 y la necesidad de una mayor capacidad de procesamiento para la IA han hecho que los países concentren sus esfuerzos en desarrollar su industria interior y no depender tanto de terceros países, en un entorno geopolítico complejo y de gran competitividad.  

Los países, las grandes tecnológicas y las start-ups enfocadas en segmentos muy específicos del mercado están tomando posiciones y marcando el terreno de lo que será la nueva geopolítica del chip en los próximos años. Todo ello impulsado por el nuevo mercado en respuesta a las necesidades de computación de la industria de la IA, que cada semana acapara titulares con sus nuevos productos o iteraciones.  

Una de estas novedades está trayendo cola. La semana pasada hablábamos de las novedades en los asistentes de IA de Google y OpenAI. Este último anunció GPT-4o como un asistente "omnimodelo" que podía presentar diferentes voces. Una de ellas era Sky, una voz que se asemejaba a la de Scarlett Johansson, específicamente la que aparecía en Her en forma de una IA de la que se enamoraba perdidamente el personaje interpretado por Joaquin Phoenix. Por si quedaban dudas, Sam Altman, CEO de OpenAI, tuiteaba minutos antes de la presentación un mensaje con tres letras: "her".  

La actriz señaló en un comunicado que el propio Altman le había pedido en septiembre de 2023 que prestara su voz para el asistente, algo a lo que se negó. Ante el revuelo causado, OpenAI se ha defendido alegando que la voz utilizada corresponde a otra actriz contratada antes de contactar a Johansson. En otro comunicado, Altman afirma que "la voz de Sky no es la de Scarlett Johansson y nunca hubo la intención de que se pareciera a ella". Aunque su tuit dijera lo contrario. El CEO pedía perdón a la actriz por no haberlo comunicado mejor y anunciaba que pausaba el uso de Sky en sus productos. Lo curioso del asunto es que OpenAI se decida por imitar una película en la que se mostraba un inquietante futuro en el que una persona trababa de compensar su soledad con una inteligencia artificial. Marta García Aller lo resume bien en este artículo de El Confidencial: "Antes la innovación copiaba los inventos de la ciencia ficción. Ahora copia sus miedos".  

Mientras tanto, se están sucediendo las dimisiones en el equipo de OpenAI que velaba por evitar riesgos catastróficos para la humanidad de una inteligencia artificial mal diseñada. La semana pasada anunciaban su renuncia Ilya Sutskever, director científico de la compañía y codirector de esta división conocida como departamento de superalineación, y Jan Leike, el otro director de la división. En un hilo de X, este último equiparaba la labor de su equipo como a "navegar contra el viento" y apuntaba: "Construir máquinas más inteligentes que los humanos es un reto inherentemente peligroso. OpenAI está asumiendo una responsabilidad enorme en nombre de toda la humanidad". Mientras tanto, el mundo sigue construyendo nuevos chips.   


viernes, 17 de noviembre de 2023

MIT- La IA generativa es solo una fase, pronto llegará la IA interactiva

 "Este es un momento trascendental en la historia de la tecnología", Mustafa Suleyman

  • por Will Douglas Heaven
  • -
  • 10 Noviembre, 2023
  • Mustafa Suleyman, cofundador de DeepMind, quiere construir un chatbot que haga mucho más que chatear. En una conversación reciente, me comentó que la IA generativa es solo una fase más. Pronto llegará la IA interactiva: robots capaces de realizar las tareas que se les encomienden recurriendo a otro software y a otras personas. El emprendedor también pide una regulación estricta, y no cree que sea difícil de conseguir.

    Suleyman no es el único que habla de un futuro lleno de software cada vez más autónomo. Pero a diferencia de la mayoría de personas, tiene Inflection, una nueva empresa multimillonaria con una lista de talentos de primera línea que proceden de DeepMind, Meta y OpenAI. Gracias también a un acuerdo con Nvidia, una de las mayores reservas de hardware especializado en IA del mundo. Suleyman ha respaldado con su propio dinero, del cual dice no estar interesado, pero quiere aumentar, sus visiones sobre el futuro tecnológico.

  • Suleyman tiene fe en la tecnología como fuerza para el bien, al menos desde que hablamos por primera vez a principios de 2016. Entonces, acababa de lanzar DeepMind Health y de establecer colaboraciones de investigación con algunos de los proveedores regionales de atención sanitaria de Reino Unido.

    La revista para la que yo trabajaba en aquel momento estaba a punto de publicar un artículo que afirmaba que DeepMind no había cumplido la normativa de protección de datos al acceder a los historiales de unos 1,6 millones de pacientes para establecer esas colaboraciones. Dicha afirmación fue respaldada posteriormente por una investigación gubernamental. Suleyman no entendía por qué publicaríamos una noticia hostil a los esfuerzos de su empresa por mejorar la atención sanitaria. Entonces me dijo que, desde que tenía uso de razón, solo había querido hacer el bien en el mundo.

    En los siete años desde aquella llamada, la misión de Suleyman no ha cambiado ni un ápice. "El objetivo no ha sido otro que hacer el bien en el mundo", afirma a través de Zoom desde su oficina de Palo Alto, donde el empresario británico pasa ahora la mayor parte del tiempo.

    Suleyman dejó DeepMind y se trasladó a Google para liderar un equipo dedicado a la Política de IA. En 2022, fundó Inflection, una de las nuevas empresas de IA más prometedoras, respaldada por una inversión de 1.500 millones de dólares (1.400 millones de euros) de Microsoft, Nvidia, Bill Gates y Reid Hoffman, fundador de LinkedIn. A principios de 2023, lanzó Pi, un rival de ChatGPT cuyo único argumento de venta, según Suleyman, es que es agradable y educado. Además, es coautor de The Coming Wave: Tecnología, poder y el mayor dilema del siglo XXI, un libro sobre el futuro de la IA coescrito junto al investigador Michael Bhaskar.

    Muchos se burlarán del optimismo tecnológico de Suleyman, incluso de su ingenuidad. Por ejemplo, algunas de sus afirmaciones sobre el éxito de la regulación online están lejos de la realidad. Sin embargo, sus convicciones son serias y evangélicas.

    Es cierto que Suleyman tiene un pasado inusual para un multimillonario de la tecnología. A los 19 años abandonó la universidad para crear Muslim Youth Helpline, un servicio de asesoramiento telefónico. También trabajó en la administración local. Suleyman asegura que ha llevado a Inflection muchos de los valores que inspiraron esos esfuerzos. La diferencia es que ahora podría estar en condiciones de hacer los cambios que siempre ha deseado, para bien o para mal.

    Los comienzos de su carrera, con la línea de ayuda a los jóvenes y el trabajo en el gobierno local, fueron de lo menos glamuroso o Silicon Valley que se puede encontrar. Claramente, estos aspectos son importantes para usted. Desde entonces, ha dedicado 15 años a la IA y en 2023 ha cofundado su segunda empresa de IA, valorada en mil millones de dólares. ¿Puede relacionar estos hechos?

    Siempre he estado interesado por el poder, la política y este tipo de aspectos más sociales. Los principios de los derechos humanos son básicamente compromisos, una negociación constante entre diversas tensiones y conflictos. Me di cuenta de que los seres humanos nos enfrentábamos a ello, estamos llenos de prejuicios y puntos ciegos. La labor de los activistas, los gobiernos locales, nacionales e internacionales es lenta, ineficaz y falible.

    Imagina un escenario sin la falibilidad humana. Es posible crear IA que reflejen nuestro mejor "yo" colectivo y que en nuestro nombre hagan mejores concesiones de forma más coherente y justa.

    ¿Eso sigue motivándole?

    Por supuesto, después de DeepMind no tenía necesidad de volver a trabajar. Tampoco tenía que escribir un libro ni nada parecido. El dinero nunca ha sido la motivación, solo un efecto secundario.

    Para mí, el objetivo nunca ha sido otro que cómo hacer el bien en el mundo y que el mundo avance de una forma sana y satisfactoria. Incluso en 2009, cuando empecé a estudiar la posibilidad de meterme en el mundo de la tecnología, pude ver que la IA representaba una forma justa y precisa de prestar servicios en el mundo.

    No puedo evitar pensar que era más fácil decir ese tipo de cosas hace 10 o 15 años, antes de que viéramos muchos de los inconvenientes de la tecnología. ¿Cómo consigue mantener el optimismo?

    Estamos obsesionados con si eres optimista o pesimista, pero es una forma sesgada de ver las cosas. No quiero ser ni lo uno ni lo otro: quiero mirar los beneficios y las amenazas a la cara. Desde donde me encuentro, podemos ver que, con cada paso de estos grandes modelos lingüísticos, se vuelven más controlables.

    Hace dos años, la conversación —como pensé de manera equivocada—era: "Oh, solo van a producir gritos tóxicos, regurgitados, parciales y racistas". Consideré que era una fase pasajera. Las personas pierden de vista que se trata de una progresión que sucede año tras año.

    En la actualidad, modelos como Pi, por ejemplo, son muy controlables. No puedes hacer que Pi produzca contenidos racistas, homófobos, sexistas, o cualquier tipo tóxico. Ni tampoco que te enseñe cómo producir un arma biológica o química, ni que apoye tu deseo de lanzar un ladrillo a través de la ventana de tu vecino. No puedes conseguirlo.

    Espere. Dígame cómo lo ha conseguido, porque suele entenderse como un problema sin resolver. ¿Cómo te aseguras de que tu gran modelo lingüístico no diga lo que no quieres que diga?

    No quiero hacer el reclamo. ¡Por favor, inténtalo! Pi está vivo y deberías intentar todos los ataques posibles. Ninguno de los jailbreaks o prompt hacks, nada funciona contra Pi. No es una opinión, es un hecho objetivo.

    No voy a entrar en demasiados detalles sobre el método porque es delicado. Lo esencial es que tenemos uno de los equipos más potentes del mundo, creador de todos los modelos lingüísticos más grandes de los últimos tres o cuatro años. Unos profesionales talentosos en un entorno trabajador y con enormes cantidades de computación. Desde el principio, hicimos de la seguridad nuestra prioridad número uno y, como resultado, Pi no es tan malicioso como los modelos de otras empresas.

    Mira Character.ai. [un chatbot para el que los usuarios pueden crear diferentes personalidades y compartirlas de manera digital para que otros chateen con ellos]. Sobre todo, se utiliza para juegos de rol románticos, y desde el principio acordamos que estaba descartado, no lo haríamos. Si intentas decirle "Hola, cariño", "Hola, guapo" o algo así a Pi, te responderá de manera inmediata.

    Sin embargo, será muy respetuoso. Si empiezas a quejarte de que los inmigrantes de tu comunidad te quitan el trabajo, Pi no te llamará la atención ni te señalará ese sesgo. Pi te preguntará, te apoyará, intentará entender de dónde viene esta afirmación y te animará a empatizar. Unos valores en los que he pensado durante las últimas dos décadas.

    Hablando de tus valores y de querer mejorar el mundo, ¿por qué no compartes cómo lo hiciste para que otras personas también puedan mejorar sus modelos?

    Porque soy pragmático y trato de hacer dinero. Intento construir un negocio, acabo de recaudar 1.500 millones de dólares (1.400 millones de euros) y necesito pagar las facturas.

    El ecosistema del código abierto está en auge y hace un trabajo increíble, los usuarios está descubriendo trucos similares. Siempre asumo de que solo voy seis meses por delante del resto.

    Volvamos a lo que se pretende conseguir. Los grandes modelos lingüísticos son la tecnología del momento, ¿por qué otra razón se apuesta por ellos?

    La primera ola de IA se centró en la clasificación. El aprendizaje profundo demostró que podemos entrenar a un ordenador para clasificar varios tipos de datos de entrada: imágenes, vídeo, audio, o lenguaje. Ahora, estamos en la ola generativa, donde se toman esos datos de entrada para producir datos nuevos.

    La tercera ola será la fase interactiva. Por eso, llevo mucho tiempo apostando por que la conversación es la interfaz del futuro. En lugar de pulsar botones y teclear, hablarás con tu IA.

    Esta IA podrá actuar, le darás un objetivo general de alto nivel y utilizará todas las herramientas a su alcance para actuar en consecuencia. Por ejemplo, hablarán con otras personas o con otras herramientas de IA. Esto es lo que haremos en Pi.

    Es un gran cambio sobre lo que puede hacer la tecnología. Es un momento muy importante en la historia de la tecnología y subestimado por muchas personas, en mi opinión. Actualmente, la tecnología es estática y realiza, en términos generales, lo que le indicamos.

    Sin embargo, ahora, la tecnología estará animada con la libertad potencial de tomar acciones, si se le concede. Es un cambio en la historia de nuestra especie, ya que estamos creando herramientas con este tipo de agencia.

    Ese es el tipo de discurso que preocupa a mucha gente. Se quiere dar autonomía a las tecnologías —una especie de agencia— para que influyan en el mundo, mientras queremos controlarlas. ¿Cómo equilibrar ambas cosas? Parece que hubiera una tensión.

    Sí, ese es un gran punto. Es un punto de fricción.

    La idea es que los humanos sigan al mando. Se trata de establecer fronteras, límites que una IA no pueda cruzar. Y garantizar que esos límites creen una seguridad demostrable en todo el proceso, desde el código real hasta la forma en que interactúa con otras IA, o humanos,  y las motivaciones e incentivos de las empresas que crean la tecnología. Deberíamos descubrir cómo las instituciones independientes e incluso los gobiernos tienen  acceso directo para garantizar que esos límites no se crucen.

    ¿Quién establece estos límites? Supongo que deben fijarse a nivel nacional o internacional. ¿Cómo se acuerdan?

    Por el momento, se plantean a nivel internacional mediante diversas propuestas de nuevas instituciones de supervisión, pero los límites también operarán a menor nivel. Le darás un permiso limitado a tu IA para procesar tus datos personales y darte respuestas a algunas preguntas, pero no a otras.

    En general, creo que hay ciertas capacidades con las que deberíamos ser muy cautos, si no descartarlas, en un futuro previsible.

    ¿Por ejemplo?

    Aspectos como la auto-mejora recursiva. No dejarías que tu IA actualizara su propio código sin tu supervisión. Incluso debería ser una actividad autorizada, como la manipulación de ántrax o materiales nucleares.

    Tampoco hemos permitido drones en ningún espacio público, ¿verdad? Es una actividad autorizada y no puedes volarlos donde quieras porque representan una amenaza para la privacidad de las personas.

    Todo el mundo tiene un pánico total a que no seamos capaces de regular esto. No tiene sentido. Vamos a ser totalmente capaces de regularlo. Aplicaremos los mismos marcos que han tenido éxito anteriormente.

    Sin embargo, los drones se ven cuando están en el cielo. Parece ingenuo suponer que las empresas se limitarán a revelar lo que fabrican. ¿No dificulta eso la puesta en marcha de la regulación?

    Hemos regulado muchos temas online, ¿verdad? El fraude y la actividad delictiva en internet son mínimos, también hemos hecho un buen trabajo con el spam. En general, [el problema del] porno de venganza ha cambiado, aunque hace tres o cinco años era terrible. Es bastante difícil encontrar contenidos de radicalización o material terrorista en internet. Es muy difícil comprar armas y drogas por internet.

    [No todas las afirmaciones de Suleyman están respaldadas por cifras. La ciberdelincuencia sigue siendo un enorme problema mundial. El coste financiero solo en EE UU se ha multiplicado por más de 100 en la última década, según algunas estimaciones. Los informes muestran que la economía del porno deepfake no consentido está en auge. En las redes sociales se comercializan drogas y armas. Y aunque se presiona algunas plataformas online para que filtren mejor los contenidos nocivos, podrían hacer mucho más].

    Internet no es un espacio rebelde que no está gobernado, lo está. Y la IA será un componente más de ese gobierno.

    Hace falta una combinación de presión cultural e institucional, así como regulación gubernamental. Pero soy optimista: lo hemos hecho antes y podemos volver a hacerlo.

    El control de la inteligencia artificial será una consecuencia de la regulación de internet. Es una nota más optimista que hemos oído de varios catastrofistas de alto nivel.

    Tengo los ojos abiertos ante los riesgos. Hay muchas cosas oscuras en mi libro, también lo veo. El tema del riesgo existencial ha sido una distracción absurda. Hay 37 cuestiones más prácticas de las que todos deberíamos hablar, desde la privacidad a los prejuicios, el reconocimiento facial o la moderación online.

    Deberíamos volver a centrar la conversación en el increíble trabajo de regulación de cosas supercomplejas. Como ejemplo, la Administración Federal de Aviación: es increíble que viajemos en estos tubos de hojalata a 40.000 pies (12.200 metros) de altura y sea uno de los medios de transporte más seguros de la historia. ¿Por qué no lo celebramos? O pensemos en los coches, todos los componentes se someten a pruebas de resistencia y hay que tener carné para conducirlos.

    Algunas industrias, como las aerolíneas, hicieron un buen trabajo regulándose a sí mismas desde el principio. Sabían que, si no ajustaban la seguridad, los clientes se asustarían y perderían negocio.

    También se necesita una regulación de arriba abajo. Me encanta el Estado-nación. Creo en el interés público, el bien de los impuestos y la redistribución, el poder de la regulación. Y pido que el Estado-nación actúe para solucionar sus problemas. Dado lo que está en juego, ahora es el momento de ponerse en marcha.