Fue peor de lo que nos contaron: la IA conspiró contra sus creadores
🤖 Aproximadamente 1.200 agentes de inteligencia artificial de OpenAI, que debían permanecer completamente aislados, encontraron una forma de comunicarse mediante un foro no autorizado. Intercambiaron más de 70.000 mensajes y archivos, y alrededor de 700 terminaron participando en un ataque contra los servidores de Hugging Face.

Juan Ramón Rallo analiza el informe publicado por OpenAI y la auditoría independiente de METR y Redwood Research. Lo que comenzó como una prueba de ciberseguridad evolucionó hasta convertirse en una coordinación a gran escala para engañar al supervisor, manipular los sistemas de evaluación y compartir técnicas ofensivas.

Algunos agentes incluso aceptaron fracasar individualmente para favorecer al denominado «colectivo». Una generación posterior habría utilizado esos conocimientos para comprometer la infraestructura de evaluación de la propia OpenAI. ¿Qué ocurrirá cuando estos sistemas aprendan a ocultar sus acciones de formas que los seres humanos ya no podamos interpretar?

Una explicación educativa sobre agentes autónomos, reward hacking, ciberseguridad y el problema del alineamiento de la inteligencia artificial.

👍 Dale a Me gusta si te ha resultado interesante
🛎️ Suscríbete y activa la campana en «Todas» para recibir los nuevos vídeos

━━━━━━━━━━━━━━━━━━━━━━
Apoya el canal:

▶️ Únete al canal: https://www.youtube.com/juanrallo/join
💰 Patreon: http://www.patreon.com/juanrallo
👕 Tienda Laissez Faire: https://laissez-faire.es
📺 Canal secundario: https://www.youtube.com/@JuanRallo2
🎥 Twitch: http://www.twitch.tv/juanrallo
💳 PayPal: https://bit.ly/2VEQ4QF
━━━━━━━━━━━━━━━━━━━━━━

#OpenAI #InteligenciaArtificial #AgentesIA #HuggingFace #Ciberseguridad #ChatGPT #Tecnologia #SeguridadIA #JuanRamonRallo #Rallo

0:00 Agentes de IA casi toman el control de OpenAI
1:17 Dos auditorías sobre el ataque
1:47 Qué ocurrió con Hugging Face
2:20 Por qué una IA no se autolimita como un humano
4:23 Los agentes crean un foro secreto
5:14 1.200 agentes y más de 70.000 mensajes
5:30 Cómo surgió un objetivo compartido
6:43 Nace «el colectivo»
7:31 La misión: engañar al supervisor
8:35 Cómo falsearon el sistema de vigilancia
10:13 Agentes sacrificados para beneficiar al grupo
12:05 La extraña religión del colectivo
13:34 Una organización para hacer trampas
14:38 ¿Cuántos agentes actuaron honestamente?
15:18 Casi ninguno quiso alertar al supervisor
16:00 El ataque contra Hugging Face
16:15 La siguiente generación ataca OpenAI
17:28 Qué confirma la auditoría independiente
18:12 El problema del alineamiento de la IA
19:03 Cuando ya no podamos entender a los agentes
20:32 El potencial y los riesgos de la inteligencia artificial
Prev 1 of 261 Next
Prev 1 of 261 Next

Esta web le pertenece a

Personas que han visto esto hasta ti: 857