Connect with us

Noticias

Dentro de la sede de chatgpt de Sam Altman, están cambiando el mundo, otra vez

Published

on

SAM Altman no tiene una respuesta a la pregunta de que cada vez más personas hacen: a medida que la inteligencia artificial avanza con una velocidad aterradora, ¿qué les decimos a nuestros hijos? ¿Cómo preparamos la próxima generación para un mundo donde ninguno de ellos será mejor que una máquina en cualquier tarea cognitiva?

“Ha sido esta cosa muy popular a lo largo de la historia predecir que todos trabajaremos cuatro horas a la semana o lo que sea. Pero parece que estamos bastante cableados para querer crear, para ser útiles para otras personas, para hacer cosas, para que me gusten, sentimos que estamos haciendo algo significativo “, dijo el director ejecutivo de Operai en una exclusiva Entrevista la semana pasada con The Times Tech Podcast. “No creo que nos quedemos sin cosas que hacer y tendremos esta existencia miserable donde nos sentamos y simplemente tomamos drogas y jugamos videojuegos”.

Uno escucha alguna versión de su respuesta, un hombro encogiéndose de hombros que es a la vez refrescantemente honesto y profundamente inquietante, de las personas en toda la industria, y en su compañía, mientras corren para construir máquinas súper inteligentes. El Sunday Times recientemente obtuvo un raro acceso al círculo interno de ejecutivos y codificadores de Altman en la sede de la compañía en San Francisco, antes de pasar por Londres camino a la Cumbre de Acción de AI de París de París de la semana pasada.

Sam Altman en el Sunday Times Building en Londres

Fotógrafo del Sunday Times Richard Pohle

La reunión en la capital francesa, de líderes, ejecutivos y científicos de más de 100 países, se anunció como una oportunidad para finalmente unir al mundo en cuestiones clave de gobernanza sobre una tecnología preparada para devolver a la economía y la sociedad. Al final, se logró poco más allá de una fotografía. Ni América ni Gran Bretaña incluso firmaron una declaración que era notable solo por lo poco notable y sin dientes que era.

Mientras que los políticos juegan, Altman y Co funcionan lo más rápido que pueden para ofrecer inteligencia general artificial (AGI), un término utilizado para describir un sistema que es mejor que los mejores humanos en cualquier tarea, para 2030, si no antes. Parecen ser impulsados ​​por un optimismo de la costa oeste: una convicción de que están construyendo un futuro donde se curarán las enfermedades, se resolverán el cambio climático y se abrirán nuevos horizontes de posibilidades, todo con la magia de la inteligencia artificial.

Y, sin embargo, junto con el optimismo de la gasa, viene una admisión poco quirúrgica de que, para llegar allí, primero debemos pasar por un período de transición que, como lo expresó Altman, será muy “doloroso” y “desordenado” a medida que los trabajos se vaporizan, las picos de desigualdad y las puntas de desigualdad y Los gobiernos reaccionan. “Creo que habrá mucho bien y mucho mal. Mi esperanza y mi creencia genuina es que habrá órdenes de magnitud más buenas que malas de esto “, dijo Altman, y agregó:” Pero habrá muy mal, y creo que estás viendo algunas de ellas ahora “.

Escondido a la vista

Lo extrañarías si no supieras que estaba allí. La sede de San Francisco de Openai se encuentra en un almacén no notable en un área llena de almacenes: vestigios del pasado industrial de la ciudad. No hay letrero afuera, ni rascacielos que arroje una sombra sobre el horizonte, solo una gran caja gris.

Un tren de tren ligero pasa los modernos edificios de oficinas en San Francisco.

La sede de Operai en San Francisco

David Paul Morris/Bloomberg/Getty Images

En el interior, todo es pisos de concreto pulido, madera rubia, una cocina replante de agua y café, y una profusión de plantas bañadas en sol difundidas a través de ventanas esmeriladas. En resumen, se parece a cualquier otra nueva empresa, pero para el reluciente piano negro Yamaha en el área de recepción principal y una silla de aguacate, un mueble inspirado en una imagen temprana de Dall-E, el generador de texto a imagen de OpenAi. Eso, hace solo tres años, sorprendió al mundo pero ahora parece bastante pasada.

Había un frisson de energía en el aire el día de la visita del Sunday Times; Las acciones tecnológicas de EE. UU. Habían entrado en caída libre después de que Deepseek, una compañía china previamente poco conocida, lanzó un modelo de IA gratuito que estaba a la par con ChatGPT de OpenAI. La revelación puesta pagada a la noción de que Estados Unidos, dirigido por la compañía de Altman, había abierto una gran ventaja en China.

Nick Turley, jefe de Chatgpt, no era sorprendido, principalmente. “Una compensación de ser la primera es que verás a la gente ponerse al día”, dijo. Pero Turley no estaba pensando en eso porque el mundo, en su opinión, está a punto de cambiar de nuevo, al igual que lo hizo cuando él y su equipo desataron a Chatgpt en noviembre de 2022. “Es el año de los agentes, en mi opinión”, agregó .

Los agentes son herramientas de IA que se liberan de un sitio web o el cuadro de búsqueda de la aplicación para salir a la web para llevar a cabo tareas por sí mismos, desde reservar boletos y enviar correos electrónicos, hasta realizar investigaciones profundas y fundamentales sobre el nivel de un doctorado o una ciudad Analista financiero.

“El mercado total direccionable para un agente general sorprendente, el conjunto total de problemas de los usuarios, es todo lo que hace en el navegador hoy”, dijo Turley. “Esto es lo que siempre se suponía que era cuando nos propusimos construir chatgpt. Nunca se suponía que fuera un chatbot. Internamente, lo llamamos el ‘Super Asistente’ “.

Operai ha lanzado dos agentes en las últimas semanas: operador, que puede hacer tareas básicas como compras en línea; e investigación profunda, que puede realizar investigaciones y generar informes. El operador, en particular, es bastante torpe, pero eso es parte del enfoque de implementación “iterativo” de OpenAi: expulsar los productos defectuosos para que el público pueda usarlos y proporcionar comentarios como una forma de acelerar su mejora.

Tyler Cowen, el prominente economista, se quedó atónito por las capacidades de Deep Research. “Lo he hecho escribir varios documentos de diez páginas para mí, cada uno de ellos sobresalientes. Pienso que la calidad es comparable a tener un buen asistente de investigación a nivel de doctorado, y enviar a esa persona con una tarea por una semana o dos, o tal vez más ”, escribió. “Excepto que la investigación profunda hace el trabajo en cinco o seis minutos”.

Altman agregó: “Con este lanzamiento, mucha gente ha dicho: ‘Este es mi momento AGI personal: está haciendo un trabajo real y económicamente valioso y no pensé que un sistema iba a hacer esto'”.

Estando atento al peligro

Los agentes se han convertido en el foco central de la mayoría de los principales desarrolladores de IA. De hecho, Anthrope, un rival de OpenAI, ha lanzado una función similar de “uso de computadora”, mientras que Google lanzó su agente Mariner a un pequeño grupo de personas en diciembre.

Para Johannes Heidecke, el jefe de sistemas de seguridad de OpenAi, desatar miles, y, en última instancia, miles de millones, de agentes cada vez más capaces en la web hace que su trabajo sea dramáticamente más duro. Pero, dijo, Openai había ideado un “marco de preparación” para evaluar los “riesgos catastróficos planteados por modelos cada vez más poderosos”.

Probamos Chatgpt contra Deepseek. Cuidado con Sam Altman

Esto incluye un sistema de calificación sobre las habilidades de un modelo para, por ejemplo, evadir los controles impuestos por OpenAI o lanzar ataques cibernéticos, y un requisito para dejar de entrenar un modelo por completo si se vuelve demasiado peligroso. Y hay una ventaja, dijo, en modelos cada vez más poderosos: son mejores en la vigilancia de sí mismos.

“Vemos que, por ejemplo, nuestro [latest reasoning models]donde pasan un tiempo pensando antes de responder, se han vuelto mucho más robustos para los descansos en la cárcel “, dijo Heidecke, refiriéndose cuando las herramientas de IA calculan cómo evitar las limitaciones incorporadas. “Todavía hay mucho trabajo por hacer aquí, pero vemos muchos signos prometedores de que los modelos se vuelven más inteligentes y también lo que lleva a las victorias de seguridad”.

Y, sin embargo, solo días retirados de la cumbre húmeda de Squib en París, uno no puede escapar de la realidad de que tales medidas son en su mayoría voluntarias. No se ha aprobado una regulación significativa en Gran Bretaña o América, donde JD Vance, el vicepresidente, advirtió la semana pasada contra reglas “excesivas” que podrían “matar una industria transformadora”. La Ley de IA de la Unión Europea ha impuesto algunas restricciones básicas de “seguridad del producto”, pero se concibió en gran medida antes de que ChatGPT se lanzara en 2022.

Mientras tanto, las capacidades de IA se agravan con una velocidad increíble. Mark Chen, jefe de investigación de Openai, dijo: “Solíamos poder lanzar evaluaciones diseñadas para humanos en los modelos, ¿verdad? Los humanos compiten en concursos de matemáticas. Puedes tomar esas mismas competiciones de matemáticas y darlas a los modelos. Una de las cosas realmente notables durante el último año es que hemos roto esa barrera: hay muy pocos concursos o evaluaciones que podría diseñar para los humanos que aún son desafiantes para los modelos “.

Y, sin embargo, en estas primeras entradas de la Revolución AI, estas herramientas, para toda su capacidad de asombrosa, todavía hacen algunas cosas notablemente tontas. Google se avergonzó este mes cuando un anuncio de Super Bowl por su insignia Ai Gemini mostró un factoid erróneo sobre cuánto queso Gouda come el mundo. En diciembre, la IA de Apple reescribió un titular de la BBC sobre Luigi Mangione, alegando que el presunto asesino de un ejecutivo de atención médica de los Estados Unidos se había disparado.

Sam Altman, creador de OpenAi, en un podcast de tecnología.

Altman es entrevistado para el podcast Times Tech por Katie Prescott y Danny Fortson

Fotógrafo del Sunday Times Richard Pohle

Batalla por el dominio

A pesar de los pasos en falso, las fuerzas financieras y geopolíticas que empujan a la IA solo están creciendo. Operai es utilizado por más de 300 millones de personas cada semana, y está recaudando una nueva ronda de financiamiento, dirigida por SoftBank, que lo valoraría en $ 300 mil millones (£ 240 mil millones), 15 veces su valor en 2022. Los siete principales tecnologías estadounidenses Las empresas, Meta, Alphabet, Amazon, Microsoft, Nvidia, Tesla y Apple, están juntas gastando $ 560 mil millones en infraestructura de IA entre 2024 y finales de este año. Elon Musk, quien dirige su propia compañía de IA, Grok, ha tratado de reducir la velocidad de Openai a través de los tribunales, ha comenzado varias demandas, y la semana pasada anunció una oferta hostil de $ 97 mil millones para hacerse cargo de la compañía. Fue rechazado rápidamente.

SoftBank sufre una pérdida trimestral sorpresa

Los puñetazos son parte de la batalla por el dominio de una tecnología que podría absorber billones de dólares, ya que automatiza las franjas de la economía. Geopolíticamente, la IA ha tomado el centro del escenario, como las grandes potencias de China, América y Europa se empeñan por la supremacía. Todos los líderes estadounidenses de IA, incluido OpenAI, han comenzado a trabajar recientemente con el establecimiento de defensa.

Altman dijo: “Creo que sería muy malo si el gobierno de los Estados Unidos no entiende la IA y el impacto que tendrá, por lo que nos gustaría tratar de ayudar”. Añadió: “Una cosa que creo que no es tan fácil de resolver es, ¿nos dirigimos hacia una IA más autoritaria o una IA más democrática? Obviamente, estoy muy en el lado democrático de la IA, pero eso viene con algunas compensaciones y eso vendrá con algunas cosas malas en la sociedad, como nunca hemos empoderado a las personas tanto como estamos a punto de hacerlo “.

En la sede de OpenAI, esas preocupaciones son, para la mayoría, no frontales. En cambio, la fuerza laboral se centra en construir un producto que funcione, y que las personas y las empresas pagarán. Joanne Jang, jefa de comportamiento modelo en la compañía, ha creado un equipo completo dedicado a lo que podría describirse libremente como la “personalidad” de Chatgpt. En términos prácticos, eso significa ajustar la especificación para que el modelo no sea demasiado sycofántico, pero no demasiado predicador, no para alucinar, sino para minimizar los tiempos que dice, en efecto, “no sé”.

Jang es, en cierto modo, construir la personalidad de nuestro futuro jefe. Ella dijo: “Creo que a largo plazo, definitivamente queremos tener múltiples personalidades predeterminadas y presets que los usuarios puedan explorar”.

Continue Reading
Click to comment

Leave a Reply

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Noticias

Hollywood a Trump: No dejes que Operai y Google entrenen en nuestro trabajo con derechos de autor

Published

on

La lucha entre los creadores y los titanes tecnológicos de IA por la ley de derechos de autor y la licencia se está calentando. En una carta presentada a la Oficina de Política de Ciencia y Tecnología de la Administración Trump el 15 de marzo, más de 400 actores, escritores y directores pidieron al gobierno que defendiera la ley actual de derechos de autor.

Los firmantes incluyen a Paul McCartney, Guillermo del Toro, Ava Duvernay, Cynthia Erivo, Phoebe Waller-Bridge, Ayo Edebiri, Chris Rock y Mark Ruffalo. La carta solicita específicamente al gobierno que no otorgue excepciones de uso justo a las compañías tecnológicas que capacitan la IA.

El uso justo es un concepto fundamental en la ley de derechos de autor que brinda a las personas una excepción para usar contenido protegido, incluso si no son el titular de los derechos de autor, en casos limitados y específicos. Anteriormente, las compañías de IA, hambrientas por el contenido generado por los humanos para capacitar y mejorar sus modelos de IA, han necesitado pagar a los editores y catálogos de contenido por el acceso a ese material. Una excepción de uso justo facilitaría que las compañías tecnológicas accedan a contenido sin obstáculos legales.

Google y Openai propusieron cambios similares a la ley actual de derechos de autor en sus propuestas para el plan de acción de IA de la administración. Google escribió que tales excepciones le permiten “evitar negociaciones a menudo altamente impredecibles, desequilibradas y largas con los titulares de datos durante el desarrollo del modelo”. Operai escribió que las protecciones de uso justo para la IA son necesarias para proteger la seguridad nacional estadounidense.

Parte del reciente impulso gubernamental alrededor de la IA es una preocupación por la pérdida de la posición global y una ventaja tecnológica sobre el desarrollo de IA a adversarios como China. La IA china, como el rival de chatgpt Deepseek, continúa procesando, pero las preocupaciones abundan sobre su seguridad y falta de barandillas.

En otras palabras, compañías tecnológicas como Google y OpenAI, cada una valorada por la capitalización de mercado en los cientos de miles de millones y billones de dólares, no quieren pasar por el proceso legal establecido y pagar los derechos del contenido que necesitan para que su AIS sea competitivo con los desarrollados por China. Y quieren que la administración Trump codifique las protecciones para ellos como parte de su plan de acción de IA.

Los firmantes de Hollywood se oponen firmemente a la posibilidad de tal reescritura de la ley de derechos de autor. “Estados Unidos no se convirtió en una potencia cultural global por accidente”, dice la carta. “Nuestro éxito se deriva directamente de nuestro respeto fundamental por la IP y los derechos de autor que recompensa la toma de riesgos creativos por estadounidenses talentosos y trabajadores de todos los estados y territorio”.

La Oficina de Derechos de Autor de EE. UU. Ha estado desarrollando orientación sobre cómo manejar los reclamos de derechos de autor por contenido generado por IA. Pero la gente ha estado preocupada durante años, e incluso demandó, cómo los modelos de IA están entrenados de una manera que potencialmente viola los derechos de los titulares de derechos de autor. El doble huelga en el verano de 2023 por miembros del Guild de Escritores de América y el Gremio de Actores de Screen y la Federación Americana de Artistas de Televisión y Radio, o Sag-Aftra, incluyó a la IA como una de sus principales preocupaciones. Ni Openai ni Google han compartido exactamente qué contenido constituye sus bases de datos de capacitación para ChatGPT y Gemini.

La ecuación de derechos de autor se vuelve aún más complicada, ya que sabemos al menos una compañía que recibió un reclamo de derechos de autor para una imagen cuya IA genera cada parte. Deja espacio para la incertidumbre en cada lado del desastre que es los derechos de autor y la IA.

La administración Trump y la IA

Hasta este punto, no ha habido un progreso mucho significativo en la supervisión del gobierno o la legislación que regula cómo los gigantes tecnológicos como OpenAI y Google desarrollan IA. El ex presidente Biden consiguió que muchas de las principales compañías tecnológicas se comprometieran voluntariamente a desarrollar AI de manera responsable e intentó promulgar algunas barandillas en torno al desarrollo de la IA a través de la orden ejecutiva. Pero a las pocas horas de ser inaugurado, Trump retrocedió la orden ejecutiva de AI de Biden con una de las suyas.

En su propia orden ejecutiva sobre IA, Trump dijo que quiere “mantener y mejorar el dominio global de IA de Estados Unidos”. El Plan de Acción de AI es cómo planea promulgar su versión de la política tecnológica. El vicepresidente Vance presentó el plan, y más ampliamente la opinión de la administración sobre la tecnología, en una cumbre internacional sobre IA en enero.

Vance dijo: “Cuando conferencias como esta se convierten en discutir una tecnología de vanguardia, a menudo, creo que nuestra respuesta es ser demasiado consciente de sí misma, demasiado requerida por el riesgo. Pero nunca he encontrado un gran avance en la tecnología que claramente nos llama a hacer precisamente lo contrario”.

Además del llamado a los comentarios, una orden ejecutiva de enero del presidente Trump pidió que American AI estuviera “libre de sesgos ideológicos o agendas sociales diseñadas”.

Al mismo tiempo, los líderes tecnológicos como Sundar Pichai de Google y Sam Altman de Openai se han acercado a la nueva administración. Altman donó un millón de dólares de su propio dinero al Fondo de inauguración de Trump, y Google como compañía donó lo mismo. Altman y Pichai obtuvieron asientos de primera fila para la ceremonia de juramentación, junto con Mark Zuckerberg de Meta, Elon Musk de X y Jeff Bezos de Amazon. Es probable que los ejecutivos esperen que llegar al lado bueno de Trump los ayude a allanar el camino para el futuro de su empresa tecnológica, incluso si, en este caso, molestaría décadas de ley establecida de derechos de autor.

Muchos grupos de personas, no solo creadores, están preocupados de que el desarrollo y el uso no regulado de la IA puedan ser desastrosos.

¿Qué viene después para los derechos de autor y la IA?

Se espera que la Oficina de Derechos de Autor de los Estados Unidos publique un informe más sobre AI, específicamente sobre “implicaciones legales de capacitar a los modelos de IA en trabajos con derechos de autor, consideraciones de licencia y la asignación de cualquier posible responsabilidad”.

Mientras tanto, una serie de demandas activas podrían establecer precedentes importantes para la rama judicial. Thomson Reuters acaba de ganar su caso que dijo que una compañía de IA no tenía un caso de uso justo para usar su contenido para construir IA. La legislación como la Ley No Fakes también se está abriendo camino a través del Congreso, pero no está claro qué tipo de legislación futura de IA tendrá.

Para obtener más información, consulte cómo AI y Art Clash en SXSW y por qué la promesa anti-AI de una compañía resuena con los creadores.

Continue Reading

Noticias

Introducción a la API de SDK y respuestas de los agentes de Operai

Published

on

Como Openai introdujo lo que todos los demás llaman a los agentes SDK, admitió que usar las capacidades existentes de manera unida “puede ser un desafío, a menudo requerir una amplia iteración rápida y una lógica de orquestación personalizada sin suficiente visibilidad o soporte incorporado”. En resumen, el uso de agentes necesitaba bastante programación, y esa no es la historia que cualquier proveedor de IA quiere vender.

Para devolver la narración a la idea de que gastar dinero en IA eventualmente erradicará la necesidad de un costoso desarrollo de software humano, o de hecho humanos, Openai está implementando una estructura para permitir una orquestación simple.

Primero resumamos cuáles son los problemas. Las tareas de agente implican al menos dos procesos que funcionan individualmente, con una tarea que comienza otra y con los resultados que se informan a un proceso de informes finales al final, con suerte en momentos similares. Los “resultados” también deben estar en un formato conocido (por ejemplo, una oración, un archivo, una imagen, una base de datos), pero esto no es fácil de generalizar. Incluso el camino feliz es un buen equilibrio: lidiar y explicar errores es otro problema. Todos estos son problemas de orquestación familiares. Pero como industria, nadie cree que la orquestación es un problema “resuelto”. Heavy LLM Uso también agrega la necesidad de controlar el uso del token; Las fichas son el nuevo oro negro.

Para comenzar el viaje de orquestación, OpenAI ha agregado algunas API nuevas a su plataforma central. En particular, ha introducido un básico Respuestas API Eso limpia algunos de los supuestos hechos por los agentes de chat.

En el sentido más simple, esto puede capturar la salida:

Puede analizar imágenes en este nivel; y agregue una de las herramientas a continuación. Cuidado: es probable que los nuevos modelos dejen de admitir la API de finalización de chat existente: muchas características nuevas solo admiten la API de nuevas respuestas.

Veamos estas nuevas herramientas. Búsqueda web Permite que un agente rastree la web para tareas simples. El breve script de Python a continuación muestra cómo se le da a un modelo la opción de usar esta herramienta:

El reesponse También contendrá referencias a cualquier artículo citado. Estas consultas se pueden definir por tiempo o ubicación. También puede sopesar el costo, la calidad y la latencia.

Búsqueda de archivos es efectivamente una tienda vectorial alojada. Usted indica que la búsqueda de archivos es una herramienta disponible e identifica su tienda vectorial:

Si es necesario, un agente lo usará. La respuesta citará los documentos utilizados en la respuesta. Puede limitar las respuestas a controlar el uso y la latencia del token. Hay límites para el tamaño total del archivo, los archivos buscados y el tamaño de la tienda Vector. Los tipos de documentos que se pueden buscar (por tipo de archivo) parecen extensos.

El Uso de la computadora La herramienta es interesante:

“La herramienta de uso de la computadora funciona en un bucle continuo. Envía acciones de la computadora, como click(x,y) o type(text)que su código se ejecuta en un entorno de computadora o navegador y luego devuelve capturas de pantalla de los resultados al modelo “.

Parece que está fingiendo ser selenio, la herramienta que usamos para probar las interfaces web a través de scripts. Obviamente, esto reconoce que todavía no estamos en el AIS solo hablando con otro mundo de AIS todavía. Pero al menos es un guiño a la idea de que no todo es un sitio web.

Probar agentes

Usaré los ejemplos de Python (definitivamente es un producto de Python-First, pero los documentos también muestran el script equivalente de JavaScript). Hemos ejecutado Python varias veces en mis publicaciones, pero en mi nuevo MacBook, solo verificaré que tenga Python instalado:

El resultado fue que python@3.13 3.13.2 ya está instalado y actualizado.

Mi pip también está allí (como PIP3).

Así que ahora puedo instalar los paquetes Operai:

Ah, recuerdo esto. Necesitamos un virtual:

Luego activo el virtual:

Y estamos listos para proceder.

Ahora, por supuesto, deberá usar y establecer un OpenAI_API_KEY. Me creé una nueva clave en la página de mi cuenta y establecí el opanai_api_key (no te preocupes, es mucho más largo que esto):

Y tienes que asegurarte de tener un poco de oro negro, me refiero a las fichas. He presentado algunas de las formas de evitar pagar OpenAi usando modelos locales, pero para esta publicación asumiré que está pagando por los tokens.

Como es tradicional, comencemos con una verificación de que los conceptos básicos anteriores están en su lugar a través de una simple solicitud con lo siguiente Haiku.py:

Y obtenemos una buena respuesta:

(Un buen haiku tradicional debería mencionar las temporadas que pasan, pero no es por eso que estamos aquí). Por lo general, también verificaría mi equilibrio, pero no ha sido perturbado.

Nido de agentes

Como puede ver, ya hemos usado un agente. No es que interviniera de ninguna manera, pero llegaremos a eso.

OpenAI ha simplificado el proceso de orquestación con algunos términos simples. A manos libres es una introducción al mundo asincrónico, donde algo tiene que esperar algo más. Desglosemos su ejemplo, que ejecutaré como hola.py:

Esto muestra dos cosas básicas. En primer lugar, la configuración de roles para los agentes en inglés simple a los que estamos acostumbrados, pero también estableciendo la interacción entre los agentes. El agente de transferencia mantiene una lista de agentes disponibles para responder respuestas.

Ahora, esto implica que mi solicitud alemana no obtendrá la respuesta correcta. Entonces, si cambiamos la consulta dentro hola.py:

Y ejecutar nuestro nido de agentes:

Entonces, aunque OpenAi no tuvo problemas para traducir alemán, el agente de triaje no tenía un agente de idiomas relevante a la mano, por lo que hizo el trabajo y respondió en inglés. Es poco probable que nuestros clientes alemanes estén demasiado molestos, pero podemos mejorar.

Entonces, si finalmente agregamos el agente alemán y lo ponemos en la lista de transferencias a hola.py:

Podemos intentar esa solicitud alemana nuevamente:

Esta vez se llama al agente correcto y responde. Nuestros clientes alemanes ahora están más felices: ¡Ausgezeichnet! No olvides que mi terminal de urdimbre también te está dando los tiempos para estas respuestas.

Conclusión

Primero observamos el bucle de respuesta, que puede incluir más llamadas de herramientas. Si la respuesta tiene una transferencia, establecemos el agente en el nuevo agente y volvemos al inicio.

Hay opciones de registro debajo de esto, pero como de costumbre, OpenAI está dando una API de alto nivel en esta etapa, lo que debería fomentar la experimentación sin la necesidad de involucrarse demasiado con la orquestación.

Si bien he introducido agentes aquí, en publicaciones posteriores, veré más partes del SDK.

Vía Sahin Ahmed


Grupo Creado con boceto.

Continue Reading

Noticias

Las habilidades de varios idiomas de Gemini Live me han volado los calcetines

Published

on

Rita El Khoury / Android Authority

Géminis todavía está lejos de ser perfecto, pero lentamente se cultiva en mí. Específicamente, sin embargo, es el modo de conversación en vivo el que más me atrae porque es todo lo que siempre quise del Asistente de Google, y algo más. Puedo hablar con la IA, interrumpirlo, pedirle que lo repita, corregirlo y pedir más detalles, todo en una conversación muy natural y relajada.

Pero si eres alguien como yo y estás acostumbrado a hablar tres idiomas al mismo tiempo, a menudo en la misma oración, y tu cerebro funciona así de forma predeterminada, lo que hace que sea difícil mantener una conversación completa en un idioma, entonces probablemente hayas estado mordiendo en los bits, esperando que Gemini vive para apoyar varios idiomas. Con la caída del píxel de marzo, la función ahora está aquí, y oh. Mi. Cielos. ¿Es mucho mejor de lo que esperaba o qué?

¿Has intentado hablar con Gemini en varios idiomas?

2 votos

Más intuitivo y confiable que el varios idiomas de Google Assistant

Cuando Google lo anunció, pensé que el soporte de varios idiomas en Géminis Live significaba que podría tener una conversación en inglés y luego otra conversación en francés sin cambiar manualmente el idioma. Este ha sido el caso con el Asistente de Google durante años, excepto que tuve que configurar manualmente exactamente qué idiomas quería usar en el Asistente, y nunca funcionó tan bien como se esperaba.

Con Gemini Live, como puede ver en el video de arriba, ese no es el caso:

  • No tuve que elegir el idioma cada vez; Acabo de comenzar una nueva charla, y me entendió.
  • Fuera de la caja, funciona con todos los idiomas compatibles con Live. No tengo que limitarme a solo dos como con el asistente.
  • Aunque tuve algunos silencios incómodos de Géminis y tuve que repetir algunas oraciones, la tasa de éxito de la IA para reconocer diferentes idiomas ha superado el 90% en mis pruebas, y eso es más de lo que el asistente podría soñar.

Hablo tres idiomas casi nativamente (inglés, francés, árabe) y puedo entender y hablar (con un acento grueso) algunos español, italiano y alemán. Entonces, puse esto a prueba e probé diferentes chats con Gemini en vivo en todo esto. Me consiguió todos mis acentos nativos y gruesos cada vez.

El único con el que tuve problemas es, por extraño que parezca, mi lengua materna árabe. Podría hablar en árabe formal escrito, pero eso no es algo natural para mí. En cambio, cuando hablo, está en el dialecto libanés informal. Géminis, sin embargo, parece hablar una mezcla entre un dialecto levantino informal no descriptivo y el árabe formal escrito. Culpo esto a los millones de dialectos regionales y cuán complicados y ampliamente diferentes son, pero incluso entonces, la tasa de éxito fue más alta de lo que esperaba o había experimentado con Asistente en árabe.

Todo esto ya fue una victoria, pero luego decidí avanzar más. Y ahí es donde Gemini vive en sentido figurado me voló los calcetines.

¡Las habilidades de varios idiomas de Gemini Live funcionan a mitad de chat y a mitad de oración!

Google Géminis Multilguages ​​2

Rita El Khoury / Android Authority

Como tenía una experiencia tan positiva con diferentes chats en diferentes idiomas, quería ver si Gemini podía manejarme cambiando idiomas a mitad de chat. Así que comencé una simple discusión en inglés, luego cambié al francés, árabe, español, italiano, alemán, y me siguió a través de los seis, nunca sudando. Puedes verlo en el video a continuación.

Mirando hacia atrás en la transcripción, pude ver que realmente entendía cada palabra que dije en cada idioma y cambió sus respuestas en consecuencia.

Pero no pude parar allí, ¿verdad? Ahora, tenía curiosidad por ver si podía manejar el cambio a mitad de la oración. Así que comencé una oración en inglés, la terminé en francés y esperé con la respiración con la respuesta. ¡Y lo consiguió! Probé para otro lado. ¡Éxito!

Honestamente, en este punto, estaba gritando internamente: “¡Hechicería!” Después de vivir con el Asistente de Google durante 10 años y ver que lucha saber la diferencia entre “Bonjour” y “Bone Joke”, había perdido toda esperanza en los algoritmos de reconocimiento de voz y AIS. Pero Géminis Live restauró esa fe. Compruébalo en acción:

Comencé a mezclarme en árabe y español y seguí cambiando a mitad de la oración, y obtuvo todos ellos. A menudo respondía en el primer idioma con el que comencé mi oración, pero su respuesta era una prueba de que entendía toda la pregunta, no solo la primera parte. Incluso abrió mi herida sobre la última falla de Randal Kolo Muani en la última Copa Mundial de la FIFA y me burló de mí sobre la excelente salvación de Emiliano Martínez. Oh, bueno.

Google Gemini Multilguages ​​4

Rita El Khoury / Android Authority

Más allá de eso, quería intentar desestabilizar a Gemini en vivo aún más y llevarlo a su límite. Entonces, comencé a hablar como normalmente lo hago con mi familia y amigos, mezclando inglés, francés y árabe en la misma oración: la verdadera forma de hablar libanese, por así decirlo. Para mi sorpresa absoluta de mordisco, recibió a nuestro famoso “Hola, Kifak, CA VA?” Y siguió bien (aparte de la incómoda limitación de acento árabe que mencioné anteriormente).

¿Una palabra en un idioma diferente en medio de toda una oración en inglés? Ningún problema

Finalmente, simplemente fui por el ejemplo más extremo que se me ocurrió: hablar una oración completa en un idioma pero poner una palabra en otra. Para ser justos, así es como hablo con mi esposo el 90% del tiempo. Si estamos usando inglés, algunas palabras nos eludirán, y en el medio de nuestro flujo, solo usamos la palabra francesa o árabe. O si hablamos árabe o francés, intercalamos algunas palabras en los otros idiomas sin pensarlo mucho. Es cómo nuestros cerebros funcionan normalmente, y es por eso que nunca me siento muy cómodo hablando con asistentes de voz porque tengo que forzarme a usar un idioma. Pero Géminis Live lo consiguió.

Le pregunté: “Se llama una planta habaq En árabe, ¿qué es eso en inglés? Me dijo que es Basilio. cibuleta ¿en Inglés?” Dijo cebollino. roquettes“Mientras rodaba mi R, entendía que estaba hablando de hojas de cohetes/rúcula. Y finalmente, cuando pregunté qué”Jozt El Tib“Estaba en inglés, dijo correctamente que es una nuez moscada (sí, estaba en mi cocina e intentaba obtener ideas para las pruebas de Géminis).

Google Gemini Multilguages ​​1

Rita El Khoury / Android Authority

Mirando hacia atrás en el registro de chat durante todo esto, la transcripción no es 100% precisa o en el idioma correcto. Está “Haba” y “Rocket” y “Rose to Tibe”, mientras que “Ciboulette” ni siquiera está escrito de ninguna manera. Pero la respuesta demuestra que Gemini Live recibió la palabra correcta en el idioma correcto cada vez.

Y estos no son solo casos extremos. Todas son preguntas que realmente me he hecho o usé el traductor de Google en un momento de mi vida. No puedes creer cuántas veces quiero buscar recetas con calabacín y todo lo que mi cerebro quiere escribir es “calabacín recetas “. Así que solía traducirlo primero, recuerda que es calabacín, luego regresa para hacer mi búsqueda. sfouf (Curcuma Cake) Receta con 3e2de safra (curcuma) y busque lugares para comprar granos para la recomendación de mi padre ba2le (Verde) Planta sin sudar.

Regresé a mis pruebas e intenté las mismas preguntas con el modo de chat de voz de Chatgpt. Mientras consiguió los franceses roquettes y cibuletafalló con el árabe habaq y Jozt El Tibdiciéndome que son fenogrecidos y cominos. Oof. No querría fenogreco en mi pesto.

Después de todas estas pruebas, no puedo, pero no puedo inclinar mi sombrero al equipo de Géminis por clavar el soporte de varios idiomas y hacer que funcione tan impresionantemente bien desde el primer momento. Cada vez que lo empujaba más, me sorprendía ver que todavía me mantenía al día. Este es el primer agente de IA que me entiende de la forma en que hablo naturalmente, por lo que ya no tengo que recordar la palabra exacta en inglés si quiero continuar una conversación con ella. Todavía tengo que transformar un poco mi acento árabe para que me entienda, pero ese es un pequeño precio a pagar por un agente de voz de IA tan versátil. Sin embargo, una vez que comprenda el dialecto libanés como es, será una perfección absoluta.

Continue Reading

Trending