La biblioteca de referencia en video sobre alineación, control y los problemas que siguen abiertos.
Recursos
Lo que le pasamos a alguien que pregunta por dónde empezar. Casi todo está en inglés, que es donde se publica el campo.
Cinco lecturas para empezar
En este orden. Las dos primeras no suponen nada; la última es una secuencia y toma varias sesiones.
- Preventing an AI-related catastrophe (80,000 Hours)
- The Most Important Century (Holden Karnofsky, Cold Takes)
- Why AI alignment could be hard with modern deep learning (Ajeya Cotra, Cold Takes)
- Core Views on AI Safety (Anthropic)
- AGI Safety from First Principles (Richard Ngo, Alignment Forum)
Videos
Para entender el campo sin leer un artículo entero.
Documentales largos sobre hacia dónde va la IA. El primero, sobre el escenario IA 2027, pasó los diez millones de reproducciones.
Animaciones que adaptan ensayos clásicos sobre IA, racionalidad y riesgo existencial.
Explicadores animados y cortos, cada uno sobre un riesgo o una propuesta concreta.
Debates y entrevistas donde las dos posiciones sobre el riesgo se discuten de frente.
Podcasts
Conversaciones largas, buenas para trayecto o gimnasio.
El podcast de referencia en alineación técnica: entrevistas extensas con quienes hacen la investigación.
Conversaciones con investigadores, fundadores y gente de política sobre qué hacer con la carrera propia.
Semanal, con gente de los laboratorios de frontera. Sirve para seguirle el paso a lo que sale.
Entrevistas con investigadores, reguladores y filósofos sobre riesgo existencial.
Libros
Cuando ya quieres el argumento completo y no un resumen.
Una narración accesible de por qué es difícil alinear un sistema con lo que de verdad queremos.
El argumento de uno de los autores del manual clásico de IA para redefinir el campo alrededor de la incertidumbre.
El libro que llevó la discusión sobre IA general al debate público. Es de 2014 y se nota, pero fija el vocabulario.
La versión más directa del caso pesimista. Útil incluso si no se comparte la conclusión.
Cursos
Con fechas, tareas y alguien al otro lado.
El punto de entrada que más recomendamos. Se trabaja en grupos de ocho con un facilitador, desarmando una amenaza paso a paso para ver en cuál de esos pasos conviene intervenir.
Cada unidad deja algo hecho: un informe dirigido a alguien que decide, un mapa de quién manda sobre los modelos de frontera y una posición propia defendida por escrito.
Recorre alineación, interpretabilidad, evaluaciones y control para que uno sepa en cuál encaja. Quien termina puede postular al sprint de proyectos de BlueDot.
Setenta y cinco minutos de charlas grabadas con ejercicios. Separa dos maneras de que un objetivo salga mal: que el modelo explote el criterio con que se le premia, o que aprenda otro objetivo.
Trata la seguridad como un problema de ingeniería y no solo de aprendizaje automático: lleva a la IA lo que la aviación y la industria nuclear aprendieron sobre accidentes.
Se programa desde el primer día: entrenar un transformador, abrirlo para ver qué calcula por dentro y armar una prueba que mida a un modelo.
Si quieres ver el campo completo
aisafety.com es un directorio abierto con cientos de organizaciones, programas y proyectos, y con quién financia cada cosa.
Recórrelos con alguien más
En el grupo de lectura se discute uno cada quince días, y en el de WhatsApp se pregunta lo que no cuadra.












