Connect with us

Noticias

DeepSeek desafía la cadena de pensamiento o1 de OpenAI, pero le faltan algunos eslabones

Published

on

akinbostanci/Getty Images

Consideremos un tren que sale de Chicago y viaja hacia el oeste a setenta millas por hora, y otro tren que sale de San Francisco y viaja hacia el este a ochenta millas por hora. ¿Puedes averiguar cuándo y dónde se encontrarán?

Es un problema matemático clásico de la escuela primaria, y los programas de inteligencia artificial (IA), como el modelo de lenguaje grande “o1” lanzado recientemente por OpenAI, actualmente en versión preliminar, no solo encontrarán la respuesta sino que también explicarán un poco cómo llegaron a ella.

Las explicaciones son parte de un enfoque cada vez más popular en la IA generativa conocido como cadena de pensamiento.

Aunque la cadena de pensamiento puede ser muy útil, también tiene el potencial de ser totalmente desconcertante dependiendo de cómo se haga, como descubrí mediante un poco de experimentación.

También: OpenAI amplía la disponibilidad del modelo o1: aquí se explica quién obtiene acceso y cuánto

La idea detrás del procesamiento de la cadena de pensamiento es que el modelo de IA puede detallar la secuencia de cálculos que realiza en busca de la respuesta final, logrando en última instancia una IA “explicable”. Una IA tan explicable podría posiblemente dar a los humanos una mayor confianza en las predicciones de la IA al revelar la base de una respuesta.

Por contexto, un modelo de IA se refiere a parte de un programa de IA que contiene numerosos parámetros de red neuronal y funciones de activación que comprenden los elementos clave de cómo funciona el programa.

Para explorar el asunto, comparé o1 de OpenAI con R1-Lite, el modelo más nuevo de la startup DeepSeek con sede en China. R1-Lite va más allá que o1 al dar declaraciones detalladas de la cadena de pensamiento, lo que contrasta con el estilo bastante conciso de o1.

Además: ChatGPT escribe mi rutina en los 12 principales lenguajes de programación. Esto es lo que me dicen los resultados

DeepSeek afirma que R1-Lite puede superar a o1 en varias pruebas de referencia, incluida MATH, una prueba desarrollada por UC Berkeley que consta de 12.500 conjuntos de preguntas y respuestas de matemáticas.

La luminaria de la IA Andrew Ng, fundador de Landing.ai, explicó que la introducción de R1-Lite es “parte de un movimiento importante” que va más allá de simplemente hacer que los modelos de IA sean más grandes para hacer que hagan un trabajo adicional para justificar sus resultados.

Pero descubrí que R1-Lite también puede ser desconcertante y tedioso en formas que no lo son.

Además: las pruebas de software basadas en IA ganan más defensores, pero persisten las preocupaciones

Envié la pregunta de matemáticas sobre trenes famosos anterior a la vista previa de R1-Lite y o1. Puede probar R1-Lite de forma gratuita creando una cuenta gratuita en el sitio web de DeepSeek y puede acceder a la vista previa de o1 como parte de una cuenta ChatGPT paga con OpenAI. (R1-Lite aún no se ha lanzado como código abierto, aunque hay otros proyectos de DeepSeek disponibles en GitHub).

deepseek-versus-openai-si-un-tren-sale-chicago-2024.png

Ambos chatbots comienzan con rutas bastante simples hacia una solución al famoso problema de los trenes en matemáticas de la escuela primaria.

Ambos modelos obtuvieron respuestas similares, aunque el modelo o1 fue notablemente más rápido, tardando cinco segundos en dar una respuesta, mientras que el R1-Lite de DeepSeek tardó 21 segundos (cada uno de los dos modelos te dice cuánto tiempo “pensaron”). o1 también utilizó un número más preciso de millas entre Chicago y San Francisco en su cálculo.

La diferencia más interesante llegó en la siguiente ronda.

También: ¿Qué tan bien puede funcionar el código de vista previa o1 de OpenAI? Superó mis 4 pruebas y mostró su trabajo con sorprendente detalle.

Cuando pedí a ambos modelos que calcularan aproximadamente dónde se encontrarían los dos trenes, es decir, en qué pueblo o ciudad de Estados Unidos, el modelo o1 rápidamente produjo Cheyenne, Wyoming. En el proceso, o1 telegrafió su cadena de pensamiento mostrando brevemente mensajes cortos como “Analizando el viaje de los trenes”, “Mapeando el viaje” o “Determinando el punto de encuentro”.

Estos no eran realmente informativos sino más bien un indicador de que algo estaba pasando.

Por el contrario, el DeepSeek R1-Lite pasó casi un minuto en su cadena de pensamiento y, como en otros casos, fue muy detallado, dejando un rastro de descripciones de “pensamientos” que suman un total de 2200 palabras. Estos se volvieron cada vez más complicados a medida que el modelo avanzaba a través de la cadena. El modelo comenzó de manera bastante simple, postulando que dondequiera que llegara cada tren al final de 12 horas sería aproximadamente donde ambos trenes estarían cerca uno del otro, en algún lugar entre los dos orígenes.

Pero luego el R1-Lite de DeepSeek se descarriló completamente, por así decirlo. Probó muchas formas extrañas y extravagantes de calcular la ubicación y narró cada método con un detalle insoportable.

deepseek-versus-openai-dónde-se-encuentran-los-trenes-2024.png

Mientras que el modelo o1 de OpenAI concluye su trabajo con bastante rapidez, el R1-Lite de DeepSeek, a la izquierda, pasa por un proceso de “pensamiento” largo y sinuoso que se vuelve cada vez más complicado y distrae.

Primero, calculó distancias desde Chicago a varias ciudades diferentes en el camino a San Francisco, así como las distancias entre ciudades, para aproximar una ubicación.

Además: probé 9 detectores de contenido de IA, y estos 2 identificaron correctamente el texto de IA en todo momento.

Luego recurrió al uso longitud en el mapa y calculando los grados de longitud que viajó el tren de Chicago. Luego retrocedió e intentó calcular distancias distancia de conducción.

En medio de todo esto, la modelo escupió la afirmación: “Espera, me estoy confundiendo”, lo que probablemente sea cierto para el ser humano que mira todo esto.

deepseek-confundido-por-su-propio-razonamiento-2024

El R1-Lite de DeepSeek expresa confusión: el modelo de IA no está literalmente confundido, pero el ser humano que lo usa podría estarlo.

Cuando R1-Lite produjo la respuesta – “en el oeste de Nebraska o el este de Colorado”, que es una aproximación aceptable – el razonamiento era tan abstruso que ya no era “explicable” sino desalentador.

Además: la IA no está chocando contra una pared; simplemente se está volviendo demasiado inteligente para los puntos de referencia, dice Anthropic

Al explicar un supuesto proceso de razonamiento con laborioso detalle, a diferencia del modelo o1, que mantiene la respuesta bastante breve, el R1-Lite de DeepSeek en realidad termina siendo complejo y confuso.

Es posible que con indicaciones más precisas que incluyan detalles como rutas de tren reales, la cadena de pensamiento pueda ser mucho más limpia. El acceso a bases de datos externas para las coordenadas del mapa también podría hacer que el R1-Lite tenga menos eslabones en la cadena de pensamiento.

La prueba demuestra que en estos primeros días de razonamiento en cadena de pensamiento, los humanos que trabajan con chatbots probablemente terminen confundidos incluso si finalmente obtienen una respuesta aceptable del modelo de IA.

Continue Reading
Click to comment

Leave a Reply

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Noticias

Lo que hace y no hace el PD para profesores de OpenAI

Published

on

¿Qué es lo primero que deberían hacer los profesores que se sumergen en la inteligencia artificial generativa?

¿Deberían aprender a aprovechar la IA para crear el plan de lección perfecto? ¿Utilizar la herramienta para generar preguntas para un cuestionario? ¿O deberían aprender primero sobre los posibles sesgos y la desinformación que a menudo se introducen en el contenido generado por IA antes de utilizarlo en su trabajo diario?

Deberían comenzar con lo básico, según OpenAI, creador de ChatGPT y una de las empresas de investigación de inteligencia artificial más destacadas del mundo. El mes pasado, la empresa lanzó un curso en línea de una hora de duración y a su propio ritmo. para profesores de K-12 sobre la definición, el uso y los daños de la IA generativa en el aula. Se lanzó en colaboración con Common Sense Media, una organización nacional sin fines de lucro que califica y revisa una amplia gama de contenido digital según su idoneidad para la edad.

Desde su lanzamiento el 20 de noviembre, alrededor de 10.000 educadores han tomado el curso, y el 98 por ciento de los docentes “compartieron que el curso ofrecía nuevas ideas o estrategias que podrían aplicar a su trabajo”, dijo Robbie Torney, director senior de programas de IA. en Common Sense Media, en un correo electrónico.

Para Eric Curts, entrenador de IA para distritos escolares del noreste de Ohio, el curso es una “buena introducción” para los educadores que aún no han experimentado con ChatGPT o cualquier otro chatbot de IA generativa.

“No se trata sólo de hablar de los beneficios que aporta la IA. También aborda cuestiones como la necesidad de privacidad de los datos”, dijo. “Menciona varias veces que no se debe incluir información de identificación personal sobre los estudiantes”.

El curso también cubre “incitar” a la IA a realizar las tareas que usted desea, dijo Drew Olssen, coordinador de tecnología del distrito escolar de Agua Fría en Avondale, Arizona. El curso viene con una “biblioteca de indicaciones” con ejemplos de indicaciones que los maestros pueden uso: desde redactar correos electrónicos hasta crear un cuestionario para la clase.

“Es una plantilla básica y agradable de lo que harías si ingresaras a ChatGPT por primera vez”, dijo.

Formar a los profesores para que utilicen la IA requiere recursos y tiempo que muchos distritos escolares no tienen, afirmó Olssen, por lo que un curso como este, junto con otros cursos introductorios gratuitos, puede ser un buen punto de partida.

Una encuesta representativa a nivel nacional Un estudio de más de 700 profesores, realizado por el Centro de Investigación EdWeek este otoño, indicó que el 58 por ciento no había recibido ningún desarrollo profesional sobre IA generativa. Esto fue una disminución del 13 por ciento desde la última vez que el Centro de Investigación EdWeek encuestó a los maestros en la primavera. Hubo solo un aumento del 1 por ciento (del 5 al 6 por ciento) en los docentes que dijeron que recibían formación profesional continua en IA generativa.

“Estamos en las primeras etapas de adopción de la IA en K-12. Nuestra primera prioridad es equipar a los educadores con recursos fundamentales para utilizar las herramientas de inteligencia artificial de manera reflexiva y modelar un uso eficaz y responsable en el aula. Este curso, intencionadamente simple, breve y accesible, fue diseñado para comenzar a construir esa base. Estamos entusiasmados de que los educadores quieran recursos más detallados sobre estos temas”, dijo un portavoz de OpenAI.

Un curso intensivo sobre IA generativa necesita más detalles, dicen los expertos

No todo el mundo está de acuerdo con la cantidad de temas nuevos introducidos en el curso de una hora de OpenAI (que le llevó a este reportero unos 30 minutos completar) y el ritmo al que se tratan.

“Para meter tanto, [a teacher] Está garantizado que lo superará rápidamente”, dijo Eryk Salvaggio, investigador del meta(LAB) de la Universidad de Harvard, que ha trabajado en pedagogía basada en IA.

Salvaggio dijo que si bien el curso brinda a los docentes consejos sobre el uso de la IA para ahorrar tiempo y ser más productivos, aún enfatiza que los docentes deben seguir “iterando” los resultados de una consulta solicitada.

“¿La IA realmente ahorra más tiempo a los docentes que si hicieran la tarea ellos mismos?” dijo Salvaggio.

El curso OpenAI se divide en tres secciones: una explicación de la IA, consejos prácticos sobre cómo los profesores pueden usar la IA para preparar lecciones o enseñar y una lección sobre los riesgos que implica el uso de ChatGPT en el aula. Cada módulo tiene secciones de videos y cuestionarios asociados para que los profesores prueben sus conocimientos a medida que avanzan en el curso.

El principal mecanismo de capacitación es crear indicaciones sólidas para ChatGPT para que los profesores obtengan los resultados que buscan. A través de diferentes ejemplos, el curso detalla qué constituye la “mejor” indicación en comparación con una indicación “OK” o menos detallada.

Sin embargo, los ejemplos no cubren varias tareas comunes en el aula, dijo Curts, como nivelar un texto, hacer adaptaciones para estudiantes con discapacidades o idear actividades para la clase.

En las sesiones de formación del propio Curts, que duran tres horas, dedica una hora a abordar los riesgos del uso de IA generativa, que incluyen plagio, “deepfakes”y preocupaciones sobre la privacidad de los datos. La sección de OpenAI sobre daños es mucho más breve y no analiza el plagio ni los deepfakes.

“A [cover risks] correctamente, merece mucho más tiempo del que se puede dedicar en un curso introductorio como este, pero al menos pone estos temas en el radar de los profesores, lo cual creo que es importante”, dijo Curts.

El curso no explica en profundidad cómo funciona la IA, lo que otros expertos en IA identificaron como una oportunidad perdida.

“Gastan una frase en ello [at the beginning]. No se unen [how AI works] a sus limitaciones”, dijo Pat Yongpradit, director académico de Code.org y líder de TeachAI, una iniciativa que apoya a las escuelas en el uso y la enseñanza de la tecnología.

Por ejemplo, dijo, la razón por la que una herramienta como ChatGPT está sesgada es porque refleja los prejuicios del mundo que nos rodea.

Existe la suposición subyacente de que es demasiado técnico para que un consumidor medio (como un profesor) comprenda cómo funciona la IA generativa. Pero los profesores deberían tener al menos un nivel “medio” de conocimiento para entender por qué la IA funciona como lo hace, afirmó.

Además, “es importante lograr que la gente tome buenas decisiones sobre el uso de la IA”, añadió Yongpradit. El curso podría haber agregado ejemplos de sesgos específicos, o incluso ejemplos en los que no es apropiado usar IA debido a sus sesgos, dijo.

Torney, de Common Sense, dijo que el curso es una manera para que “los profesores ocupados adquieran habilidades esenciales en poco tiempo”.

Los detalles complejos y técnicos sobre cómo funciona ChatGPT se dividieron en partes manejables para que los profesores los abordaran a su propio ritmo, dijo. “Anticipamos que se necesitará más capacitación”, añadió Torney.

Los distritos pueden aprovechar este rumbo, pero tienen que trazar un camino a seguir

Yongpradit espera que el curso introductorio de OpenAI despierte el apetito de los profesores por aprender más sobre la IA.

“Lo peor sería si los profesores pensaran que este curso es todo el desarrollo profesional que necesitan”, dijo. “Tampoco creo que los creadores crean que esto sea suficiente. Esta es una pequeña porción de una oportunidad más grande”.

Yongpradit sugiere el desarrollo profesional continuo a través de comunidades de aprendizaje profesional, donde los profesores puedan compartir sus experiencias sobre el uso de la IA en sus aulas y aprender unos de otros.

El distrito escolar de Agua Fría ha implementado una versión de esta capacitación desde 2022, poco después del lanzamiento de ChatGPT por primera vez, dijo Olssen, coordinador de tecnología del distrito. Olssen reunió a un grupo de profesores, bibliotecarios, formadores de alfabetización y administradores que se reúnen todos los meses para discutir cómo utilizar la IA en las aulas.

“Es un tipo de modelo de formación de formadores”, dijo Olssen, “en el que estos embajadores dirigen sesiones de formación con otros educadores cada trimestre”.

El mes pasado, el grupo discutió cómo ir más allá del uso de la IA para realizar tareas simples como generar hojas de trabajo y, en cambio, se centró en cómo se podría usar la IA para crear experiencias de aprendizaje “más profundas” para los estudiantes, a través de proyectos o trabajos de investigación.

Cuando se trata de abordar los sesgos inherentes de la IA generativa y el potencial de desinformación, Olssen dijo que el distrito capacita a maestros y estudiantes, al comienzo del año escolar, sobre cómo evaluar el rendimiento de la IA. La capacitación del distrito es “muy explícita en cuanto a verificar la claridad, precisión, relevancia y ética de lo que escupe una plataforma de IA”, dijo.

El curso OpenAI presenta una comprensión superficial de estos riesgos, dijo Olssen, pero más allá de cualquier curso introductorio, corresponde a los distritos escolares hacer que los maestros sean plenamente conscientes de los daños de “confiar demasiado” en cualquier tecnología.

“Los educadores también están ávidos de más contenido; un tema importante en la retroalimentación ha sido el deseo de un curso más largo”, dijo Torney.

¿Quiere leer más sobre cómo los profesores pueden utilizar (y aprender sobre) la IA? Estén atentos al nuevo informe especial de la Semana de la Educación que se publicará el lunes.

Continue Reading

Noticias

Ya nadie habla de ChatGPT

Published

on

Sam Altman niega que el acuerdo de OpenAI con Microsoft se esté desmoronando y se burla del lanzamiento de productos

El director ejecutivo de OpenAI, Sam Altman, fue entrevistado hoy por Andrew Ross Sorkin en la Cumbre DealBook del New York Times y dijo algunas cosas interesantes sobre la relación de su empresa con su socio Microsoft, la nueva influencia política de Elon Musk y los límites teóricos del escalamiento de la IA. Altman también adelantó el próximo lanzamiento de productos “12 días de OpenAI”.

Se le preguntó a Altman sobre los informes de que el acuerdo de 13 mil millones de dólares de OpenAI con Microsoft está en peligro de desmoronarse:

“No creo que nos estemos desenredando. No pretenderé que no haya desajustes ni desafíos. Obviamente hay algunos. Pero en general, creo que ha sido algo tremendamente positivo para ambas empresas”.

Con respecto a la carrera armamentista de la computación con IA, se le preguntó a Altman si OpenAI necesitaba desarrollar sus propios recursos informáticos, en lugar de depender de socios (como NVIDIA y microsoft):

“No… Creo que debemos asegurarnos de tener suficiente computación del tipo que queremos, en la que podamos confiar y todo eso. Y puede haber razones por las que tenemos algunas ideas muy locas sobre cosas que nos gustaría construir que son, ya sabes, de alto riesgo y alta recompensa. Pero ciertamente no necesitamos que OpenAI se vuelva realmente bueno en la construcción de centros de datos a gran escala similares a computadoras”.

Sorkin le preguntó a Altman sobre el hecho de que nunca recibió ninguna participación en OpenAI, que busca pasar de una entidad sin fines de lucro a una empresa principal con fines de lucro.

“Mira, es raro que no obtuviera capital… No lo quería… Si pudiera retroceder en el tiempo, lo habría tomado… sólo un poquito, sólo para nunca tenerlo. para responder a esta pregunta”.

De cara a cómo serán los próximos uno o dos años de progreso en la IA, Altman dijo:

“Los agentes son de lo que todo el mundo habla… ya sabes, esta idea de que puedes darle a un sistema de IA una tarea bastante complicada, como un tipo de tarea que le asignas a un humano muy inteligente y que tarda un tiempo en ponerse en marcha y realizarla. y utilizar un montón de herramientas y crear algo de valor. Ese es el tipo de cosas que esperaría el próximo año… Si funciona tan bien como esperamos, realmente puede transformar las cosas”.

Algunas de las cosas más interesantes que dijo Altman estaban relacionadas con el cofundador de OpenAI, Elon Musk, y su startup xAI, que compite directamente con ChatGPT. Refiriéndose a xAI, Altman dijo: “Supongo que serán un competidor realmente serio… Tremendo respeto por la rapidez con la que construyeron ese centro de datos”, refiriéndose a Colossus, el enorme clúster de supercomputación de xAI impulsado por 100.000 GPU Nvidia H100.

Luego, la conversación giró hacia la nueva influencia política de Elon Musk que surge de su estrecha relación con el presidente electo Donald Trump, y cómo Musk podría usar esa influencia para beneficiar a su imperio y castigar a sus competidores:

“Sería profundamente antiestadounidense utilizar el poder político (en la medida en que lo tiene Elon) para perjudicar a sus competidores… No creo que Elon lo hiciera”.

Altman reflexionó sobre su relación personal con Musk, que se ha deteriorado: “Crecí con él como un megahéroe… Todavía me alegro de que exista”.

Cuando se le preguntó si los informes sobre las leyes de escala de la IA podrían estar chocando contra una pared, Altman no se lo creyó:

“Siempre me ha llamado la atención lo mucho que a la gente le encanta especular: ¿hay un muro? ¿Seguirá escalando? En lugar de simplemente mirar la curva de progreso y decir: ‘Tal vez no debería apostar una exponencial contra otra exponencial como esa’”.

Altman adelantó una serie de lanzamientos y demostraciones diarias de OpenAI que se llevarán a cabo durante las próximas semanas:

“Tenemos un montón de cosas nuevas y geniales… Haremos ’12 días de OpenAI’ a partir de mañana, pero lanzaremos algo o haremos una demostración todos los días durante los próximos 12 días de la semana”.

Esta publicación se ha actualizado para aclarar una cita de Sam Altman.

Se le preguntó a Altman sobre los informes de que el acuerdo de 13 mil millones de dólares de OpenAI con Microsoft está en peligro de desmoronarse:

“No creo que nos estemos desenredando. No pretenderé que no haya desajustes ni desafíos. Obviamente hay algunos. Pero en general, creo que ha sido algo tremendamente positivo para ambas empresas”.

Con respecto a la carrera armamentista de la computación con IA, se le preguntó a Altman si OpenAI necesitaba desarrollar sus propios recursos informáticos, en lugar de depender de socios (como NVIDIA y microsoft):

“No… Creo que debemos asegurarnos de tener suficiente computación del tipo que queremos, en la que podamos confiar y todo eso. Y puede haber razones por las que tenemos algunas ideas muy locas sobre cosas que nos gustaría construir que son, ya sabes, de alto riesgo y alta recompensa. Pero ciertamente no necesitamos que OpenAI se vuelva realmente bueno en la construcción de centros de datos a gran escala similares a computadoras”.

Sorkin le preguntó a Altman sobre el hecho de que nunca recibió ninguna participación en OpenAI, que busca pasar de una entidad sin fines de lucro a una empresa principal con fines de lucro.

“Mira, es raro que no obtuviera capital… No lo quería… Si pudiera retroceder en el tiempo, lo habría tomado… sólo un poquito, sólo para nunca tenerlo. para responder a esta pregunta”.

De cara a cómo serán los próximos uno o dos años de progreso en la IA, Altman dijo:

“Los agentes son de lo que todo el mundo habla… ya sabes, esta idea de que puedes darle a un sistema de IA una tarea bastante complicada, como un tipo de tarea que le asignas a un humano muy inteligente y que tarda un tiempo en ponerse en marcha y realizarla. y utilizar un montón de herramientas y crear algo de valor. Ese es el tipo de cosas que esperaría el próximo año… Si funciona tan bien como esperamos, realmente puede transformar las cosas”.

Algunas de las cosas más interesantes que dijo Altman estaban relacionadas con el cofundador de OpenAI, Elon Musk, y su startup xAI, que compite directamente con ChatGPT. Refiriéndose a xAI, Altman dijo: “Supongo que serán un competidor realmente serio… Tremendo respeto por la rapidez con la que construyeron ese centro de datos”, refiriéndose a Colossus, el enorme clúster de supercomputación de xAI impulsado por 100.000 GPU Nvidia H100.

Luego, la conversación giró hacia la nueva influencia política de Elon Musk que surge de su estrecha relación con el presidente electo Donald Trump, y cómo Musk podría usar esa influencia para beneficiar a su imperio y castigar a sus competidores:

“Sería profundamente antiestadounidense utilizar el poder político (en la medida en que lo tiene Elon) para perjudicar a sus competidores… No creo que Elon lo hiciera”.

Altman reflexionó sobre su relación personal con Musk, que se ha deteriorado: “Crecí con él como un megahéroe… Todavía me alegro de que exista”.

Cuando se le preguntó si los informes sobre las leyes de escala de la IA podrían estar chocando contra una pared, Altman no se lo creyó:

“Siempre me ha llamado la atención lo mucho que a la gente le encanta especular: ¿hay un muro? ¿Seguirá escalando? En lugar de simplemente mirar la curva de progreso y decir: ‘Tal vez no debería apostar una exponencial contra otra exponencial como esa’”.

Altman adelantó una serie de lanzamientos y demostraciones diarias de OpenAI que se llevarán a cabo durante las próximas semanas:

“Tenemos un montón de cosas nuevas y geniales… Haremos ’12 días de OpenAI’ a partir de mañana, pero lanzaremos algo o haremos una demostración todos los días durante los próximos 12 días de la semana”.

Esta publicación se ha actualizado para aclarar una cita de Sam Altman.

Continue Reading

Noticias

🔮 De ChatGPT a mil millones de agentes

Published

on

Hola, soy Azeem.

Estoy en la Cumbre DealBook en Nueva York hoy y acabo de escuchar a Sam Altman hablar sobre su visión sobre los próximos años:

Espero que en 2025 tengamos sistemas que la gente mire, incluso aquellos que son escépticos sobre el progreso actual, y digan: ‘Vaya, no esperaba eso’. Los agentes son de lo que todo el mundo habla y por una buena razón. Esta idea de que puedes darle a un sistema de IA una tarea bastante complicada, el tipo de tarea que le darías a un ser humano muy inteligente, que lleva un tiempo implementar y usar un montón de herramientas y crear algo de valor. Ese es el tipo de cosas que esperaría el próximo año. Y eso es un gran problema. Si eso funciona tan bien como esperamos, realmente puede transformar las cosas.

Los agentes han estado en mi hoja de ruta por un tiempo. El año pasado hablé de nuestra mil millones de agentes futuros e invirtió en un par de nuevas empresas que construyen sistemas agentes. En la publicación de hoy, analizamos cómo pensamos que pasaremos de asistentes de inteligencia artificial como ChatGPT a miles de millones de agentes que nos respaldan en segundo plano. ¡Disfrutar!

Por

y

En un futuro muy cercano, los trabajadores del conocimiento podrían contar con el apoyo de miles de agentes de IA, todos operando en paralelo. Esto no es futurismo especulativo. Jensen Huang de Nvidia habló recientemente sobre el papel de los agentes Ya juega en Nvidia y cómo ve su futuro:

Puntilla: ¿Ya estás utilizando cadenas de razonamiento y herramientas como o1 en nuestro propio negocio para mejorarlo?

Jensen: Absolutamente. Nuestro sistema de ciberseguridad actual no puede funcionar sin nuestros propios agentes. Contamos con agentes de IA que ayudan a diseñar chips: Hopper no sería posible, Blackwell no sería posible y ni siquiera pensamos en Rubin. Contamos con diseñadores de chips de IA, ingenieros de software de IA e ingenieros de verificación de IA, y los construimos todos internamente. Tenemos la capacidad y preferiríamos aprovechar la oportunidad para explorar la tecnología nosotros mismos. Espero que Nvidia algún día sea una empresa de 50.000 empleados con 100 millones de asistentes de IA […] Las IA reclutarán a otras IA para resolver problemas […] Por lo tanto, seremos simplemente una gran base de empleados, algunos de ellos digitales y otros biológicos.

De manera similar, Sam Altman anticipa el surgimiento de una unicornio unipersonal—Una empresa de mil millones de dólares administrada por un solo individuo que aprovecha un ejército de agentes de IA.

Los asistentes de IA actuales, como ChatGPT, requieren una participación humana constante: son copilotos, no actores autónomos. La próxima evolución, que ya está en marcha, es la de agentes que ejecutan tareas de forma independiente una vez que se les asigna un objetivo, muy parecido a delegar a un equipo experimentado y dar un paso atrás mientras ellos se encargan del resto. Y no hay límite para el tamaño de este equipo.

Para ayudarle a entender esto, nos asociamos con

ingeniero de aprendizaje automático, escritor y editor en jefe de .

Juntos, exploraremos tres áreas en la publicación de hoy:

  • El estado actual de los agentes de IA y sus aplicaciones en el mundo real.

  • ¿Por qué su adopción generalizada se está volviendo inevitable?

  • Cómo esta transición podría conducir a un futuro en el que miles de millones de agentes aumenten el trabajo humano.

Los agentes han sido una prioridad para los científicos informáticos durante décadas, pero hasta hace poco se lograron pocos avances. Lo lejos que hemos llegado se refleja mejor en una cita de un artículo de 1997 por los científicos informáticos Christopher Welty y Louis Hoebel, quienes luego escribieron

Cualquiera que tenga conocimientos sobre “agentes” no puede evitar reconocer que, como tecnología de inteligencia artificial, normalmente hay muy poca inteligencia real involucrada. En cierto sentido, los Agentes pueden definirse como IA a pequeña escala que funciona.

La era ChatGPT introdujo sistemas basados ​​en LLM que actualmente consideramos “agentes de IA”. Los primeros prototipos como BebéAGIpor ejemplo, demostró que la planificación de tareas podría permitir a los LLM actuar de forma autónoma.

Ejemplo de Yohei Nakajima

Las últimas mejoras se han capturado en puntos de referencia (consulte la Informe sobre el estado de la IA 2024 para profundizar) e investigaciones que demuestran que los LLM existentes se pueden utilizar para crear agentes que aprenden continuamente en entornos abiertos (como Minecraft).

Lanzamiento de DeepMind gatoun “agente generalista” que utiliza la misma idea subyacente en los LLM para realizar tareas, desde apilar bloques con un brazo robótico real hasta subtitular imágenes. Joon Park y sus colegas propusieron Agentes generativos como una caja de arena interactiva que se utilizará principalmente para las ciencias sociales. En ciencias duras, investigadores de Stanford crearon un laboratorio virtual que utilizaba agentes crear 92 nuevos diseños de nanocuerposincluidos múltiples nanocuerpos con actividad de unión exitosa contra el virus que causa Covid-19 (como se destaca en EV#501).

En la empresa, Adepto imaginó un asistente digital que podría convertir un comando de texto en una serie de acciones, como hacer un plano para una pieza nueva de un automóvil, y recaudó 350 millones de dólares hacerlo antes de ser absorbido en Amazon.

En el ámbito del consumo, empresas emergentes como Shortwave han desarrollado agentes que pueden desempeñar el papel de asistentes ejecutivos para gestionar y estructurar la información en dominios como el correo electrónico. Azeem ha invertido en dos nuevas empresas de agentes, WordWare y Mellizo.

Mientras tanto, Microsoft ha estado aprovechando su fortaleza en software empresarial para establecer silenciosamente un punto de apoyo en esta área. Encima 100.000 de sus clientes empresariales ya están experimentando en Copilot Studio, creando agentes autónomos personalizados o implementando soluciones listas para usar.

Hiscox, una aseguradora, utilizó agentes para reducir el tiempo de cotización de riesgos complejos de tres días a unos pocos minutos. De manera similar, McKinsey, utilizando el ecosistema de agentes de Microsoft, ha reducido su flujo de trabajo de admisión de proyectos de 20 días a dos días.

Socios de conocimiento predice que todos tendrán un asistente de IA: estos agentes tomarán diferentes formas y redefinirán los límites entre aplicaciones, plataformas y servicios.

Durante el siglo pasado, hemos sido testigos de asombrosos aumentos de productividad en industrias como la manufacturera y la agrícola: las fábricas producen productos exponencialmente más rápido y las granjas alimentan a miles de millones con una fracción de la fuerza laboral que alguna vez necesitaron. Sin embargo, en las aulas todavía se necesita un maestro para educar a 30 estudiantes. Esto es La maldición de Baumol. Cuando los salarios aumentan en sectores de alta productividad como el manufacturero, los servicios intensivos en mano de obra deben aumentar los salarios para competir, incluso si su productividad permanece estancada. Así, mientras los productos manufacturados se abaratan, muchos servicios se encarecen.

En el centro de esta cuestión está nuestra incapacidad para escalar nuestra propia humano tiempo. Según la Ley de Amdahl, la velocidad de un sistema está limitada por su componente más lento. En muchas partes del sector de servicios, esto se reduce a limitaciones en torno a los procesos dependientes de los seres humanos. La Revolución Industrial superó las limitaciones físicas mediante la mecanización; La IA podría ser una oportunidad similar para superar los obstáculos cognitivos al otro lado de…

  1. Velocidad: Los sistemas de IA operan mucho más allá de los tiempos de reacción humanos, procesando datos en milisegundos. El LLM más rápido produce resultados a 6000 veces la velocidad que puede alcanzar un humano.

  2. Escala: Podemos implementar tantos agentes de IA como lo permitan nuestros recursos computacionales, superando potencialmente la población humana.

  3. Paralelización: Las tareas se pueden dividir entre miles o incluso millones de agentes de IA. En lugar de analizar 100 documentos secuencialmente, 100 agentes de IA pueden procesarlos simultáneamente y fusionar sus hallazgos en un solo informe.

  4. Eficiencia de costes: Con el tiempo, los agentes se vuelven más baratos que la mano de obra humana, especialmente cuando se escala. En este momento podemos conseguir un sistema protoagente para realizar un metanálisis de 200 artículos de ArXiv por aproximadamente el 1% del costo humano. AlphaFold predijo 200 millones de estructuras proteicas, cada una de las cuales tradicionalmente cuesta $100,000 y un doctorado completo para determinar.

  5. Personalización: En lugar de dividir un servicio humano entre muchos, la IA permite experiencias individualizadas para todos: un tutor privado para usted o su hijo, por ejemplo.

  6. Aprendizaje y adaptación: Como sostiene el investigador independiente Gwern Branwen: “Todo problema suficientemente difícil se convierte en un problema de aprendizaje por refuerzo.“Cada desafío complejo requiere tomar secuencias de decisiones bajo incertidumbre donde cada elección afecta las opciones y resultados futuros, que es exactamente lo que resuelve el aprendizaje por refuerzo. Con esto, los sistemas de IA pueden ejecutar millones de experimentos paralelos, agregar sus aprendizajes mediante el reparto de peso y actuar sobre esos conocimientos de una manera que los sistemas biológicos no pueden.

Durante el próximo año, el despliegue de agentes tomará un “Gatear, caminar, correr” acercarse. Las empresas están experimentando con casos de uso simples, antes de expandirse en complejidad. De ahí todo lo que se habla de los agentes de servicio al cliente, una implementación fácil y de riesgo relativamente bajo. Pero la complejidad y la variedad de tareas que un agente puede realizar crecerán.

Para pensar más en una evolución que podríamos comenzar a ver el próximo año, veamos una profesión que todos aman… los abogados.

Honoré Daumier, Les Gens du Justice: Les avocats et les plaideurs, 1845

De acuerdo a una base de datos mantenida por el Departamento de Trabajo de EE. UU.los abogados realizan 22 tareas profesionales distintas. Una de estas tareas principales es la preparación de escritos y dictámenes legales para presentaciones judiciales. Imagine a un socio de una firma de abogados asignando un complejo escrito de apelación a lo que parece ser un único asistente de IA, pero que en realidad es una orquesta de agentes especializados, cada uno con una “experiencia” distinta.

El proceso comienza en el momento en que se cargan los expedientes del caso. Un agente coordinador (un director de proyectos de IA, por así decirlo) analiza inmediatamente los requisitos del tribunal y los plazos de presentación. En cuestión de segundos, un agente de investigación revisa bases de datos legales a una velocidad sobrehumana. Identifica todos los precedentes relevantes y patrones sutiles en el razonamiento judicial en casos similares. Al mismo tiempo, un agente de análisis de casos examina el expediente del juicio, relaciona los hechos del caso con elementos legales e identifica argumentos prometedores que los abogados humanos podrían pasar por alto en miles de páginas de testimonios.

Así como un agente de redacción elabora argumentos preliminares en un lenguaje legal preciso, un agente de gestión de citaciones garantiza que cada referencia cumpla con los estándares del Bluebook y valida que cada caso citado siga siendo una buena ley. Un agente de cumplimiento técnico monitorea continuamente el formato, el recuento de palabras y las reglas judiciales en tiempo real, mientras que un agente de control de calidad valida las cotizaciones y garantiza la coherencia lógica. El agente coordinador contrata a otros agentes, gestiona los flujos de trabajo y resuelve conflictos.

Y esto es sólo para una única tarea…

La magia del sistema agente es que puede escalar. Podría tener una docena o más de informes preparados en paralelo. Lo que comienza con unos pocos agentes especializados manejando un informe legal rápidamente se convierte en cascada. Empezar con 1,3 millones de abogados estadounidensescada uno de los cuales despliega 5 agentes especializados para cada una de las 22 tareas que realizan; eso ya son mil millones de agentes. Eso es sólo para 1 millón de abogados… Se estima que hay 1.000 millones trabajadores del conocimiento en todo el mundo. Habrá miles de millones de agentes. Y esto supone 5 agentes por tarea. ¿Pero por qué no 5, 10, 100 agentes? Teóricamente no hay más límite que el de eficacia.

Pero hacer que las organizaciones de abogados sean más eficientes no es lo único que los agentes permitirán. Como señala Flo Crivello, fundador y CEO de Lindy, cuando las herramientas se vuelven exponencialmente más baratas, pasan de ser activos corporativos a permitir la creatividad individual:

Continue Reading

Trending