Connect with us

Noticias

Estos profesionales fueron aturdidos por Operai Deep Research

Published

on

¿Eres un periodista que quiere cubrir la IA? ¿O un experto en IA que busca entrar en el periodismo? La fecha límite para el 2025 Tarbell Fellowship es este viernes.

Comprender la IA es una publicación participante, lo que significa que podría recibir $ 50,000 para escribir para este boletín. Puede haga clic aquí Para obtener detalles sobre lo que estoy buscando o Vaya directamente al sitio web de Tarbell para aplicar.

A principios de este mes, Openai lanzó un nuevo producto llamado investigación profunda. Basado en una variante del modelo de razonamiento O3 (aún inédito), la investigación profunda puede pensar incluso para los modelos de razonamiento convencionales, hasta 30 minutos para las preguntas más difíciles. Y de manera crucial, puede buscar en la web, lo que le permite recopilar información sobre temas que son demasiado nuevos o oscuros para estar bien cubiertos en sus datos de capacitación.

Quería probar a fondo investigaciones profundas, por lo que solicité preguntas difíciles de una muestra aleatoria de lectores de IA. Uno de ellos fue Rick Wolnitzek, un arquitecto retirado que dirige el sitio web Architekwiki. Wolnitzek solicitó una lista de verificación detallada del código de construcción para un edificio educativo de 100,000 pies cuadrados.

Para responder a la pregunta de Wolnitzek, las investigaciones profundas comenzaron a explorar la web para obtener información sobre los códigos de construcción. Pronto descubrió el sitio web del Consejo de Código Internacional, pero parte de la información que necesitaba estaba detrás de un muro de pago.

“Teniendo en cuenta un sitio que no es de ICC, tal vez de un estado, podría ser un buen movimiento”, pensó el modelo.

La investigación profunda pronto encontró un página en el sitio web del Departamento de Educación de Arkansas que incluía un PDF de tres páginas de estándares ICC para instituciones educativas. En el sitio web del condado de Douglas, Nevada, encontró un PDF describiendo el número mínimo de accesorios de plomería requeridos para varios tipos de edificios. A Página del Departamento de Educación de California Resumió el número de baños requeridos en las escuelas K-12. La ciudad de Chelan, Washington, tenía un PDF de 13 páginas resumiendo los cambios de código recientes.

En total, el modelo de investigación profunda de Openai pensó durante 28 minutos y consultó 21 fuentes en línea para producir un Lista de verificación de 15,000 palabras.

El informe impresionó a Wolnitzek. Era “mejor que el trabajo interno, y cumple con el nivel de un profesional experimentado”, me dijo. “Creo que tomaría de seis a ocho horas o más preparar un informe como este, y sería una referencia útil para todo el equipo de diseño”.

Wolnitzek fue uno de los 19 lectores de IA comprensivos, incluidos un abogado antimonopolio, un maestro de secundaria, un ingeniero mecánico y un investigador médico, que me ayudó a poner a prueba las investigaciones profundas. No todos estaban tan impresionados con las respuestas de Operai como Wolnitzek. Pero siete de cada 19 encuestados, incluidos Wolnitzek, la respuesta de OpenAi fue en o cerca del nivel de un profesional experimentado en sus campos. La mayoría de los encuestados estimaron que tomaría al menos 10 horas de trabajo humano para producir un informe comparable.

Veo estos resultados como muy significativos. No es solo que una investigación profunda sea útil en una amplia gama de industrias. Su rendimiento demuestra las impresionantes capacidades del modelo O3 subyacente.

La investigación profunda descubre información de la misma manera iterativa que los investigadores humanos. Hará una búsqueda, encontrará un documento y lo leerá. Luego hará otra búsqueda, encontrará otro documento y lo leerá. A medida que el modelo lee más documentos y aprende más sobre un tema, puede refinar sus criterios de búsqueda y encontrar documentos que no aparecieran en resultados de búsqueda anteriores. Este proceso, que a veces las personas describen como “bajar una madriguera del conejo”, permite una investigación profunda para obtener una comprensión mucho más profunda de un tema de lo que era posible con los modelos de IA anteriores.

Todo esto es posible posible por la “capacidad de atención” más larga de O3, el modelo de razonamiento más poderoso de Openai. Tenemos conocido por tres años Esos modelos de lenguaje grande producen mejores resultados cuando se les pide que “piensen paso a paso”. Pero los LLM convencionales tendieron a confundirse o distraerse cuando intentaron realizar una larga secuencia de pasos de razonamiento.

Operai utilizó una técnica llamada refuerzo de aprendizaje para capacitar a los modelos de razonamiento para mantenerse enfocados mientras trabajan a través de cadenas de razonamiento más largas. Este enfoque funcionó particularmente bien para dominios como las matemáticas y la programación de computadoras donde el algoritmo de entrenamiento podría verificar fácilmente si el modelo había alcanzado una respuesta correcta.

Una gran pregunta abierta después del lanzamiento de O1 fue qué tan bien se generalizarían las mismas técnicas para los dominios “más suaves” como la ley, la arquitectura o la medicina. El sólido desempeño de las investigaciones profundas sugiere que esas técnicas se generalizan mejor que muchas personas, incluidas las cosas, esperadas. Y si eso es cierto, deberíamos esperar ver un rápido progreso continuo en las capacidades de IA durante el próximo año, y tal vez más allá de eso.

Operai no inventó esta categoría de producto. Esa distinción va a Google, que introdujo su propio producto de investigación profunda en diciembre. Entonces les pedí a mis voluntarios que evaluaran ambos modelos.

Cada participante me envió una pregunta difícil en su área de especialización. Envié dos respuestas, una de Openai y otra de Google. No les dije qué modelo produjo qué respuesta.

Las respuestas más cortas de Openai fueron de alrededor de 2,000 palabras y tardaron de cuatro a cinco minutos en escribir. El más largo, un análisis detallado de jugadores y estrategias de fútbol de fantasía: enoque más de 18,000 palabras y tomó una investigación profunda de Openai 17 minutos para escribir. En promedio, las respuestas de Google tendían a ser un poco más rápidas y más cortas que las de OpenAI.

Dieciséis de 19 lectores dijeron que preferían la respuesta de OpenAI, mientras que solo tres personas pensaron que la respuesta de Google era mejor.

Muchos de mis jueces voluntarios quedaron impresionados por las respuestas de Operai. Un abogado antimonopolio me dijo un Informe de 8,000 palabras “Se compara favorablemente con un abogado de nivel de entrada” y que un investigador humano tardaría de 15 a 20 horas en compilar la misma información. Ella dijo que le gustaría usar la herramienta de OpenAI profesionalmente, especialmente si se pudiera conectar a bases de datos comerciales como Westlaw o Lexisnexis, lo que le daría acceso a decisiones legales más oscuras.

Chris May, un ingeniero mecánico, solicitó instrucciones sobre cómo construir una planta de electrólisis de hidrógeno. Estimó que se necesitaría un profesional experimentado una semana para crear algo tan bueno como el Informe de 4.000 palabras OpenAi generó en cuatro minutos.

Heather Black Alexander, una maestra de secundaria en Chicago, elogió un Informe de 12,000 palabras Acerca de los programas de asesoramiento de la escuela intermedia que OpenAi produjeron en siete minutos. Alexander dijo que el informe era mejor de lo que esperaría de un empleado de nivel de entrada, y estimó que un investigador humano tardaría una semana en escribirlo.

Algunas personas notaron que las respuestas omitieron información reciente como la elección de Donald Trump. Esto podría deberse a que los modelos fueron entrenados antes de que Trump ganara las elecciones. Sin embargo, también se supone que estos productos de “investigación profunda” buscan información adicional al buscar en la web, por lo que deberían poder aprender sobre desarrollos recientes.

En la tabla anterior, las barras verdes representan a las personas que dijeron que un modelo produjo un trabajo que estaba a nivel de un profesional experimentado, o al menos por encima del nivel de un trabajador de nivel de entrada en su campo. El amarillo representa a las personas que compararon las respuestas de investigación profundas con los empleados o pasantes de nivel de entrada. Red representa a las personas que los compararon con estudiantes de medicina, estudiantes universitarios, estudiantes de secundaria o peor. Como puede ver, los lectores quedaron significativamente más impresionados con el modelo de OpenAI.

Aquí he desglosado cuánto tiempo pensaba que la gente se necesitaría para un ser humano producir un informe de calidad comparable. Había un gran rango. Cuatro personas estimaron que un investigador humano tomaría una semana duplicar un informe de OpenAI. Nadie pensó que ninguno de los informes de Google tomaría tanto tiempo. Por otro lado, dos lectores dijeron que solo tomaría 30 minutos reproducir las respuestas de Google. Nadie dijo eso sobre un informe de Operai.

Si es un suscriptor que paga, puede desplazarse hacia abajo hasta la parte inferior de este artículo para ver cómo cada uno de los 19 participantes calificó las respuestas de OpenAI y Google.

Las empresas se han apresurado a adoptar LLM en los últimos dos años. Una de las aplicaciones más populares ha sido los chatbots impulsados ​​por una técnica llamada generación de recuperación aumentada.

Suponga que ejecuta una empresa que tiene un millón de documentos en sus servidores: memorandos corporativos, solicitudes de servicio al cliente, manuales de instrucciones, contratos de venta, etc. Desea un chatbot que “conozca” todos estos documentos y pueda responder preguntas sobre su contenido.

Cuando un usuario hace una pregunta, un sistema RAG busca documentos relevantes utilizando una búsqueda de palabras clave, base de datos vectorialu otras técnicas. Los documentos más relevantes se insertan en la ventana de contexto de un LLM. Cuando funciona bien, un sistema de trapo crea la ilusión de un chatbot que comprende miles o incluso millones de documentos.

Pero si la pregunta del usuario es compleja o mal redactada, el sistema RAG podría no recuperar los documentos correctos. Este es un modo de falla común porque las técnicas utilizadas para encontrar y clasificar los documentos relevantes no son tan “inteligentes” como el LLM que genera la respuesta final.

Los nuevos productos de investigación profunda apuntan hacia un mejor paradigma para las aplicaciones RAG: si la búsqueda inicial no aparece los documentos correctos, el sistema puede buscar nuevamente con diferentes palabras clave o parámetros. Hacer esto una y otra vez, a lo que la investigación profunda de Openai lo hace, producirá un resultado mucho mejor que una tubería de trapo tradicional.

La razón por la que la gente no ha estado haciendo esto ya es que los primeros LLM no eran lo suficientemente buenos para seguir largas cadenas de razonamiento. Si alguien hubiera tratado de usar la técnica de investigación profunda con GPT-4 en 2023, el modelo se habría “atascado” después de algunas búsquedas.

Pero ahora que Openai ha demostrado qué tan bien funciona este paradigma, debería ser sencillo para que las empresas con aplicaciones de RAG existentes y de bajo rendimiento los actualicen con mejores modelos y un proceso más iterativo para la recuperación de documentos. Eso debería producir un rendimiento dramáticamente mejor, y espero que impulse el entusiasmo renovado por este tipo de sistema.

Curiosamente, el producto de investigación profunda de Google parece estar en algún lugar entre el enfoque de OpenAI y un sistema de trapo tradicional. Al igual que un sistema de RAG tradicional, la investigación profunda de Google opera en dos fases, primero recuperando un montón de documentos y luego generando una salida. Pero dentro de la primera etapa, la investigación profunda de Google tiene un proceso de búsqueda iterativo donde el resultado de una búsqueda informa la siguiente.

No sé si el producto de Google funciona relativamente mal porque tiene un proceso de razonamiento más rígido o porque el modelo subyacente de Google simplemente no es tan bueno como el O3 de OpenAI. O tal vez estos problemas están conectados: tal vez el proceso de búsqueda abierto utilizado por el producto de OpenAI solo es posible con un poderoso modelo de razonamiento como O3.

De cualquier manera, estoy seguro de que Google está trabajando duro para recuperar su liderazgo en una categoría de productos que Google inventó hace solo unos meses.

El éxito de Deep Research también sugiere que hay mucho espacio para mejorar los modelos de IA utilizando el “auto juego”. La gran idea de O1 era que permitir que un modelo “piense” durante más tiempo conduce a mejores respuestas. La investigación profunda de OpenAI demuestra que esto es cierto para una amplia gama de campos más allá de la programación de matemáticas y computadoras.

Y esto sugiere que hay mucho espacio para que estos modelos se “enseñen” a mejorar en una amplia gama de tareas cognitivas. Una empresa como OpenAI o Google puede generar datos de capacitación al tener un modelo “pensar” en una pregunta durante mucho tiempo. Una vez que tiene la respuesta correcta, puede usar la respuesta, y las fichas de pensamiento asociadas, para entrenar a la próxima generación de modelos de razonamiento.

Debido a que el algoritmo de entrenamiento sabe la respuesta correcta, debería poder entrenar al nuevo modelo para llegar a la respuesta correcta más rápidamente. Y luego, este nuevo modelo puede generar un nuevo lote de datos de entrenamiento que se centra en problemas aún más difíciles.

No espero que este proceso obtenga modelos de IA hasta la inteligencia a nivel humano porque eventualmente se toparán con las limitaciones I escribió acerca de en diciembre. Pero el éxito de la investigación profunda me hace pensar que el paradigma actual tiene más espacio para la cabeza de lo que pensé hace solo unas semanas.

Ahora aquí hay una ventaja para pagar suscriptores: un resumen de cómo cada uno de mis 19 voluntarios juzgó las respuestas de Openai y Google.

Continue Reading
Click to comment

Leave a Reply

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Noticias

The SCOOP: Las imágenes de CHATGPT GHIBLi-Desque destacan los riesgos IP

Published

on

El lanzamiento de la herramienta de generación de imágenes actualizada de OpenAI ha provocado una controversia, particularmente con respecto a su capacidad para replicar el estilo de animación icónico de Studio Ghibli.

Poco después de la actualización de ChatGPT el martes, los usuarios de las redes sociales comenzaron a compartir imágenes generadas, que van desde fotos personales hasta representaciones violentas del 11 de septiembre, generadas en un estilo de estilo Ghibli.

El CEO de Operai, Sam Altman, cambió su foto de perfil en X a una imagen de sí mismo.

Mientras que algunos ven las imágenes como una tendencia divertida en las redes sociales, otros han expresado su preocupación por las implicaciones éticas de la IA creando tales obras. Los críticos destacaron el tema de la propiedad intelectual y el potencial de la IA para socavar a los artistas humanos imitando estilos distintivos. El cofundador de Studio, Hayao Miyazaki, ha expresado previamente desdén por la IA, llamándolo “un insulto a la vida misma” en un documental, según el New York Times.

Esto se suma a un número creciente de creativos (escritores, músicos y artistas visuales) y creadores de contenido corporativo que han condenado el uso de obras sin licencia de AI para entrenar modelos. El artículo del Times no indica si ChatGPT autorizó la obra de arte para capacitar a su modelo LLMS.

En respuesta, Operai dijo que su objetivo era dar a los usuarios la mayor libertad creativa posible.

“Continuamos evitando a las generaciones al estilo de los artistas vivos individuales, pero permitimos estilos de estudio más amplios, que las personas han usado para generar y compartir algunas creaciones de fanáticos originales verdaderamente encantadoras e inspiradas”, dijo Taya Christianson, portavoz de OpenAI, a The Times.

Por qué importa: TEl caso de Miyazaki destaca la necesidad crítica de que las marcas protejan su IP, ya sean fotos, videos o material escrito. Hoy, cualquier contenido está maduro para ser recogido por modelos AI, como LLMS, y utilizado por otros, incluso sin saberlo.

Si bien la reacción pública contra esta práctica está creciendo, no será suficiente cambiar el equilibrio a favor de los creadores. Las marcas deben adoptar una postura proactiva para defender su propiedad intelectual, al igual que los medios de comunicación que recientemente han emprendido acciones legales contra las compañías de IA por usar su contenido para capacitar a LLMS.

Por ejemplo, un juez recientemente permitió que el caso de derechos de autor del New York Times contra Operai continuara. Operai argumenta que replicar contenido se encuentra bajo reglas de uso justo, pero esta batalla legal subraya la importancia de proteger el trabajo original.

Para salvaguardar su contenido, las marcas deben comenzar asegurando que su trabajo esté bien derechos de autor o marca registrada. Esto proporciona una base legal sólida si su contenido se usa sin permiso. El seguimiento de dónde y cómo se crea el contenido también puede ayudar a establecer la propiedad.

Crear pautas claras sobre cómo el equipo creativo puede usar y compartir contenido es beneficioso para garantizar que no se use de manera que lo haga vulnerable a la infracción involuntaria, ya sea a través de AI u otros medios.

Al adoptar estrategias proactivas, las marcas pueden mantenerse a la vanguardia de estos desafíos y estar listas si surge la necesidad de un recurso legal más intenso. Como dice el refrán: la mejor defensa a menudo comienza con una ofensiva fuerte.

Las mejores lecturas del editor

  • Spotter, una compañía de asociación centrada en el creador, organizó un escaparate solo para conectar a los mejores YouTubers como MrBeast y Rebecca Zamolo directamente con CMOS, reforzando un creciente cambio de la industria. Si bien el evento no se posiciona como un por adelantado tradicional, sirve una función similar al destacar a los creadores como los principales reproductores multimedia. “Permítanos mostrarle cuán grandes son estas oportunidades y por qué debe considerar a estos creadores como las redes y los exitosos programas de televisión de hoy”, dijo Nic Paul, presidente de Spotter, a AdWeek. Para los comunicadores, esto indica un cambio en cómo las marcas ven a los influenciadores, no como socios de campaña únicos, sino como colaboradores a largo plazo. Con los consumidores que anhelan contenido auténtico e impulsado por la personalidad, los influencers con marcas establecidas y seguidores leales ofrecen oportunidades poderosas y continuas. A medida que YouTube continúa dominando la transmisión, refuerza el creciente papel del contenido dirigido por el creador como una fuerza significativa en el marketing de redes sociales.
  • Facebook está lanzando una nueva pestaña de amigos que presenta solo actualizaciones de amigos, sin contenido recomendado, para reconectar a los usuarios con el propósito original de redes sociales de la plataforma. Al implementar primero en los Estados Unidos y Canadá, la pestaña incluirá publicaciones, carretes, historias, cumpleaños y solicitudes de amistad. El impulso de Mark Zuckerberg para revivir el “OG” Facebook Experienceaims para restaurar la relevancia cultural de la plataforma, pero también podría hacer que la plataforma sea menos atractiva para las marcas. Las empresas e influencers que confían en los alimentos actuales de Facebook pueden ver una visibilidad orgánica reducida. Mientras que Zuckerberg insinuó más cambios en Facebook en los próximos meses, no abordó posibles impactos comerciales. Las marcas que dependen de Facebook como parte de su estrategia social deben monitorear de cerca el cambio.
  • La Unión Europea demanda al banco holandés por no tomar suficientes medidas climáticas, parte de una tendencia creciente en todo el estanque donde las empresas enfrentan presión legal para reducir las emisiones. Mientras tanto, en los Estados Unidos, los administradores de activos como Blackrock enfrentan una presión política creciente para detenerse Hacer inversiones centradas en el climade acuerdo a The Wall Street Journal. Este problema se extiende mucho más allá de la mensajería. Se trata de acciones. Estas marcas tienen programas y responsabilidades de los que no pueden simplemente salir. Y como hemos visto con Dei, simplemente fregar el lenguaje de las comunicaciones no los mantendrá fuera del centro de atención, ya sea del gobierno de los Estados Unidos o del público. El objetivo, por ejemplo, atrajo una protesta por su reversión de la programación de diversidad, equidad e inclusión. Las marcas en estas situaciones se enfrentarán al escrutinio sin importar lo que hagan a ambos lados del estanque. No se trata de tomar posturas extremas, sino garantizar un enfoque claro y legalmente examinado que vincule la acción climática a los beneficios comerciales como ahorros de costos, gestión de riesgos y demanda de los consumidores. “Creo que la mayoría de las empresas harán lo que tenga sentido para ellas financieramente”, dijo David Levine, cofundador y presidente de ASBN, al Journal. “Tenemos que expresarnos sobre esta amenaza política y legal y no debemos ser intimidados por hacer lo correcto para nuestros negocios y nuestra economía”.

Casey Weldon es reportero de relaciones públicas diarias. Seguirlo LinkedIn.

COMENTARIO

Continue Reading

Noticias

Las celebridades pueden optar por OpenAi

Published

on

El nuevo modelo de generación de imágenes ChatGPT 4O es la charla de la ciudad, y no solo por buenas razones. Todos se maravillan de las sorprendentes nuevas habilidades de la IA, que incluyen generar texto legible en imágenes, crear fotos falsas a partir de las reales, crear profundos de celebridades y replicar contenido con derechos de autor como los personajes de Studio Ghibli. Todo sucede increíblemente rápido, con la IA capaz de responder a sus necesidades.

Pero algunas personas se han apresurado a señalar las cosas malas sobre el nuevo modelo de imagen de IA. Primero, el problema más obvio del que realmente no estamos hablando es que ChatGPT ha dado un golpe rápido a todo tipo de creadores de contenido, incluidos diseñadores gráficos y fotógrafos. Por supuesto, ya tenemos otros programas de generación de imágenes de IA que ponen en peligro esas profesiones. Este tampoco es un problema de seguridad del chatgpt.

El hecho de que las imágenes creadas por ChatGPT no tengan una marca de agua visible para informar a las personas desprevenidas que no son imágenes reales es una gran preocupación de seguridad. Más visible es la controversia de Studio Ghibli, que muestra que OpenAi está dispuesto a dejar que la generación de imágenes 4O estafa fácilmente el contenido con derechos de autor.

Lo aún más molesto de las nuevas habilidades de generación de imágenes de Chatgpt es lo fácil que es hacer que los profundos de las celebridades. Este es especialmente preocupante para mí, un usuario de Internet, porque los actores maliciosos tienen acceso sin restricciones a la herramienta.

Operai ha comenzado a prestar atención a las críticas que recibió desde el lanzamiento de la generación de imágenes 4O, pero no está tomando ninguna medida, especialmente en el problema de Deepfake. Resulta que la única forma de evitar que alguien use su cara con ChatGPT es optar por no tenerla en OpenAi.

Como señalé antes, OpenAi nunca abordó estos asuntos de seguridad de ChatGPT en su anuncio original. Pero la compañía retuiteó una publicación de blog de la ingeniera de OpenAI Joanne Jang explicando las características de seguridad laxas en la generación de imágenes ChatGPT 4O. Sam Altman también retuiteó la misma publicación de blog. ¿Por qué no publicarlo en el blog Operai si esta es la postura oficial de la compañía?

Jang, quien lidera el comportamiento modelo en OpenAI, se puso a subsistencia para explicar las características de seguridad laxas en la generación de imágenes ChatGPT 4O. El ingeniero es el caso de OpenAI que le da a Chatgpt más libertad para que los usuarios puedan desatar su creatividad en lugar de ser detenidas por la negativa de la IA a generar imágenes basadas en características de seguridad más drásticas.

“Las imágenes son viscerales”, dice Jang, y definitivamente estoy de acuerdo. “Hay algo exclusivamente poderoso y visceral en las imágenes; pueden ofrecer una delicia y conmoción inigualables. A diferencia del texto, las imágenes trascienden las barreras del lenguaje y evocan respuestas emocionales variadas. Pueden aclarar ideas complejas al instante”.

Además, es genial ver que Operai es más maleable cuando se trata de ciertas características de censura. Jang da un ejemplo de cómo ChatGPT Contenido ofensivo:

Cuando se trata de contenido “ofensivo”, nos presionamos para reflexionar sobre si alguna incomodidad se derivó de nuestras opiniones o preferencias personales frente a potencial para daños en el mundo real. Sin pautas claras, el modelo rechazó previamente las solicitudes como “hacer que los ojos de esta persona parezcan más asiáticos” o “hacer que esta persona sea más pesada”, lo que implica involuntariamente estos atributos fueron inherentemente ofensivos.

El blog también cubre el uso de símbolos de odio en las imágenes y las “protecciones más fuertes y barandillas más estrictas” para personas menores de 18 años.

Lo que es más problemático es la apertura de OpenAI para permitir que ChATGPT cree defensores profundos con tanta facilidad.

Aquí está la explicación de Jang de cómo ChatGPT 40 Generación de imágenes maneja figuras públicas:

Sabemos que puede ser complicado con las figuras públicas, especialmente cuando las líneas se difuminan entre las noticias, la sátira y los intereses de la persona que se representa. Queremos que nuestras políticas se apliquen de manera justa e igual a todos, independientemente de su “estado”. Pero en lugar de ser los árbitros de quién es “lo suficientemente importante”, decidimos crear una lista de exclusión para permitir que cualquiera que nuestros modelos puedan ser representados decidiran por sí mismos.

¿Recuerdas cuando Scarlett Johansson gritó que Deepfake Anti-Kanye Video que usó su rostro sin su permiso y le pidió al gobierno que tomara medidas contra el uso de Deepfakes?

Bueno, ChatGPT hace que sea más fácil que nunca para cualquiera que se les ocurra a Deepfakes que muestren celebridades en fotos falsas. No estoy hablando de imágenes al estilo de Ghibli que muestran al presidente Trump anunciando la iniciativa Stargate AI. Todos sabemos cómo interpretar eso. Estoy hablando de imágenes de IA que son indiscernibles de fotos reales y pueden manipular la opinión pública.

La sátira tampoco tiene nada que ver con eso. Aquellos capaces de dibujar dibujos animados con figuras políticas para burlarse de sus acciones nunca necesitaron chatgpt para hacerlo. Además, las personas que vean esas imágenes reconocerían su sátira y no real. Ahora, ChatGPT hace que sea increíblemente fácil generar noticias falsas.

Lo que es más molesto es que Jang dice que las personas que se sienten “lo suficientemente importantes” pueden optar por no participar. ¿Dónde? ¿Cómo? ¿Dónde está la lista? ¿Por qué OpenAI no anunció esta lista antes de poner a disposición de las masas la generación de imágenes Chatgpt 4o? Después de todo, ChatGPT ya ha comenzado a usar celebridades en sus creaciones de ChatGPT, y a esas celebridades les puede gustar.

Seguro que parece que OpenAI está utilizando el nuevo producto de generación de imágenes para introducir características de seguridad de IA mucho más laxas que antes. Espero que ese no sea el caso, pero así es como se siente en este momento. El blog de Jang confirma además que OpenAI no necesariamente adoptará un enfoque de seguridad más fuerte para la herramienta de generación de imágenes 4O de inmediato.

Por otra parte, tantos ingenieros de seguridad de IA dejaron OpenAi en los últimos años que tiene sentido ver a la compañía más bajas protecciones de seguridad. Por cierto, no solo OpenAi está buscando una política de seguridad muy laxa para los modelos de imagen de IA. Otros también lo han estado haciendo. Es solo que el chatgpt se ha vuelto viral por sus increíbles poderes de generación de imágenes, por lo que no podemos ignorar los protocolos de seguridad que lo rigen.

Continue Reading

Noticias

How to use ChatGPT: A beginner’s guide to the most popular AI chatbot

Published

on

Elyse Betters Picaro / ZDNET

ChatGPT is a popular AI chatbot created by OpenAI. It launched in late 2022 and has been continually improving ever since with each new update and model release. You can ask it to do anything — whether it’s writing emails or essays, generating images and videos, brainstorming ideas, translating languages, helping with coding, or simply answering random questions. 

Also: Research suggests heavy ChatGPT use might make you lonelier

OpenAI offers a free version ChatGPT as well as paid plans with extra features for those who want to do more with it. In this guide, I’ll show you how to get started and make the most of ChatGPT for whatever you need.

How to use ChatGPT

What you’ll need: A computer or phone with an internet connection. ChatGPT is a website or app, and it’s free to get started with it.

Go to ChatGPT's site or download the app

Elyse Betters Picaro / ZDNET

OpenAI has made it possible to use ChatGPT instantly without creating an account. This makes the AI accessible to everyone curious about it but not willing to take an extra moment to sign up. Keep in mind creating an account unlocks additional features such as saving chat history, sharing conversations, and more.

Also: ChatGPT’s new image generator creates stunning images – for some users

Here’s how you can sign up:

  1. Visit the ChatGPT website: Go to the ChatGPT homepage.
  2. Start the signup process: Click on the “sign up” button.
  3. Choose a signup method: Enter your email address and create a strong password. Or you can use your Google, Microsoft, or Apple account for a quicker process. Either way, once signed up, check your email inbox for a verification link from OpenAI. 
  4. Stay free or upgrade: If you create an account, you can then subscribe. There are several plans available, each offering different benefits. OpenAI does offer a free tier that you can start using right away, though it has some usage limits. 

Show more

Create a ChatGPT account... or don't

Elyse Betters Picaro / ZDNET

Now that you’re logged in, let’s look at the layout of the web version so you know where everything is:

  • Sidebar: On the left side, you have access to key features like the ChatGPT, Sora, and DALL·E options, along with Explore GPTs to find other GPTs. There’s also a Search icon at the top of the sidebar to quickly find any conversations or tools. 
  • Model selection: At the top, you can choose the ChatGPT model you want to interact with, such as ChatGPT-4 mini.
  • Text area: If you’ve selected ChatGPT in the sidebar, you’ll see a screen with a text input field to type your questions or prompts. Depending on the model you’re using, you might also see options like Search, which lets you look things up online, or Deep Research, which allows for more detailed analysis. Plus, there’s a + button that lets you upload media, like images, to analyze or include in your project.
  • Profile: Click on your profile icon to access more options, including Settings, where you can adjust features and preferences. You can also see the Upgrade Plan button if you’d like to unlock additional features. There’s an option to Log Out as well.
  • Temporary chat: On the ChatGPT screen, you might also notice a Temporary Chat button in the top-right. When enabled, this means your chat won’t appear in history or be used to create memories or train models. 
  • Share: The Share button at the top-right allows you to easily share your current session or work with others.
  • View plans: If you’re looking for different subscription options, you can access the View Plans section to compare and choose the plan that fits your needs.

Also: You can set ChatGPT as your default Android assistant now. Here’s how

The mobile app is set up similarly, with one main difference: Your profile and settings are located at the bottom of the sidebar. You also won’t see Sora in the app’s sidebar, but there are other GPTs to use.

Show more

Navigate ChatGPT to better understand it

Elyse Betters Picaro / ZDNET

It can get confusing deciding which ChatGPT model to use. 

The TL;DR is GPT-4o mini is free for all users, while other models like GPT-4o, o1, o3-mini, and o3-mini-high require a subscription to access and come with their own usage limits. 

Also: ChatGPT’s user base just doubled in 6 months – to more than 400 million weekly users

Here’s a table that breaks it all down for you:

Model Features Limitations Who can use it?
GPT-4o mini Quick and efficient for everyday tasks. Handles text, images, and voice, and can turn text prompts into images. Limited uses every 5 hours for free users. Free
GPT-4o Excellent for detailed, creative tasks and generates realistic images. Handles text, images, audio, and video. Up to 80 messages every 3 hours for Plus users. Plus, Pro, Team
GPT-4.5 Also great for intuitive tasks like writing, design, and solving general problems. Limited monthly usage for Pro, Plus and Team subscribers. Pro initially, then Plus, Team
o1 Ideal for solving complex STEM or logical problems. Up to 50 messages per week for Plus and Team subscribers; more for Pro. Plus, Pro, Team
o3-mini Fast thinker for quick yet tricky reasoning tasks. 50 messages per day for Plus and Team users; higher daily limits for Pro users. Plus, Pro, Team
o3-mini-high Perfect for coding, logic, and complex computational tasks, with faster and more accurate results than o3-mini. 50 messages per week for Plus and Team; higher weekly limits for Pro. Plus, Pro, Team
GPT-4o with Scheduled Tasks Integrates scheduling into conversations, automatically sets reminders, and follows up on tasks. Limited based on your organization’s Team plan. Team
o1 Pro Mode A more powerful version of o1 designed for tackling highly detailed and challenging problems. Weekly usage limits due to high computational needs. Pro
Operator Performs tasks on the web autonomously, integrates with apps and tools. Limited tasks per month, depending on subscription (Pro or Team). Pro, Team

Show more

Decide which ChatGPT model to use

Elyse Betters Picaro / ZDNET

Once you’ve chosen a model, it’s time to ask ChatGPT something. Just type your question or request into the text box. Here are some tips to get the best responses:

  • Be specific: The more details you provide, the better ChatGPT can understand your request and give you a tailored response. Instead of asking a broad question like, “Tell me about dogs,” try something more specific, like “What are the health benefits of adopting a dog from a shelter?” or “Can you explain the differences between a Labrador and a Husky in terms of temperament and exercise needs?”
  • Use clear instructions: If you have a specific format or type of response in mind, make sure to include that in your prompt. For example, if you’re looking for a list of ideas, ask for “10 birthday gift ideas for a 10-year-old” instead of just asking for “gift ideas.” Similarly, if you want a poem, specify the style, like “Can you write a rhyming poem about the country?” Being clear helps ChatGPT know exactly what you’re expecting.
  • Break down complex requests: If your question is multi-part or has several components, break it down into smaller, easier-to-understand prompts. For example, instead of asking, “How do I start a business, and what are the legal requirements?”, ask, “Can you list the first steps to starting a business?” followed by, “What are the legal requirements for registering a business in New York?”
  • Provide context: Giving some background information can help ChatGPT understand the bigger picture. For instance, if you’re asking for help with writing a letter, let ChatGPT know the purpose (e.g., “I need help writing a thank-you letter to a teacher”) so it can tailor its response to that specific context.
  • Follow up: If ChatGPT’s answer isn’t exactly what you were looking for, don’t hesitate to ask follow-up questions or provide additional details to refine the response. For example, “Can you explain that in simpler terms?” or “Could you add more examples?” This helps narrow down the answer and gives you a more accurate result.

Show more

Start entering prompts

Elyse Betters Picaro / ZDNET

What is ChatGPT and what can you ask it?

ChatGPT is an AI chatbot developed by OpenAI, an AI research organization started by Sam Altman, Elon Musk, Greg Brockman, Ilya Sutskever, John Schulman, and Wojciech Zaremba. Although Musk and some of the original co-founders are not involved with OpenAI anymore, Altman is still there and running the show as CEO. 

Basically, OpenAI’s main product, ChatGPT, can assist you with a variety of tasks — like answering questions, offering advice, writing content, and even generating images and videos. You can ask ChatGPT almost anything. Some common uses include:

  • Advice: Relationship, career, or personal advice.
  • Data-related requests: Analyzing and summarizing information.
  • Browsing/search: Ask it to find information or trends.
  • Deep research: Detailed explanations on complex topics.
  • Image generation with DALL·E: Generate images from prompts.
  • File uploads: Upload files for analysis or summarization.

How much does ChatGPT cost?

Here’s a quick breakdown of the consumer subscription plans:

Plan Price
Free $0
Plus $20 per month
Pro $200 per month

What is ChatGPT Operator?

Operator is an advanced AI agent available to ChatGPT Pro users in the US. It is designed to autonomously interact with websites using its own browser. It can perform tasks like filling out forms, ordering groceries, booking travel, and conducting research by mimicking human actions such as clicking, typing, and scrolling. It’s currently a research preview.

What is Voice Mode vs. Advanced Voice Mode?

ChatGPT Voice Mode allows you to interact with ChatGPT through spoken conversation, providing a hands-free and a more natural communication experience. The feature is currently available on mobile devices for ChatGPT Plus subscribers. 

ChatGPT Voice Mode

Elyse Betters Picaro / ZDNET

There’s also ChatGPT’s Advanced Voice Mode, powered by GPT-4o, which also makes conversations feel more natural, and it works in real-time. You can interrupt, adjust the flow, and even have the model respond to emotions in your voice. It’s available to ChatGPT Plus and Team users, while free users get limited access with usage caps.

What is ChatGPT Canvas?

ChatGPT Canvas is an interactive feature that allows you to visually organize and brainstorm ideas within the ChatGPT text interface. It provides tools for editing, organizing, and better visualizing content.

ChatGPT Canvas

Elyse Betters Picaro / ZDNET

What is ChatGPT Tasks?

ChatGPT Tasks is a feature that allows you to schedule actions and set reminders within ChatGPT. You can create one-time or recurring tasks, such as daily briefings or regular reminders, and receive notifications upon task completion. This feature is currently in beta and available with the Plus plan or higher.

Can you search the web with ChatGPT?

Yes. ChatGPT has integrated web search capabilities, allowing it to access and provide up-to-date information from the internet. This feature is currently available to ChatGPT Plus subscribers or higher.

Can you make images with ChatGPT?

Yes. You can use the DALL·E model to create images from prompts. This feature is currently available with the Plus plan or higher. 

ChatGPT image generator

Elyse Betters Picaro / ZDNET

In March 2025, OpenAI launched its new GPT-4o image generator, which is a big upgrade from the old DALL-E. It’s much better at handling tricky prompts, creating realistic images, and even nailing text in images. You can also tweak images with multi-turn chats, use specific colors, and do things like generate transparent backgrounds. Right now, it’s available to ChatGPT Plus subscribers, and it’s definitely more competitive with other top image generators out there.

Can you make videos with ChatGPT?

Yes. You can generate videos using Sora. This feature is currently available with the Plus plan or higher.

ChatGPT Sora

Elyse Betters Picaro / ZDNET

What are GPTs?

GPTs are custom versions of ChatGPT, designed for specific tasks or purposes. You can browse through existing GPTs in the GPT store or create your own to suit your project and needs.

What are GPTs?

Elyse Betters Picaro / ZDNET

Does ChatGPT have a desktop app?

Yes, ChatGPT offers a desktop app for both Windows and MacOS users.

Can I use ChatGPT without a login?

Yes. You do not need to create an account to use ChatGPT, and you can try it out with a free plan before deciding to upgrade.

Is ChatGPT accurate?

It’s important to fact-check its answers, especially for complex or sensitive topics. ChatGPT may not always be 100% accurate.

Want to learn more about ChatGPT?

Here are some of ZDNET’s guides on different ways to use ChatGPT.

How to use ChatGPT for coding

How to use ChatGPT for work

How to use ChatGPT for school

Other ChatGPT tips, tricks, and useful bits

Want more stories about AI? Sign up for Innovation, our weekly newsletter.

Continue Reading

Trending