Paperslab

¿Se puede apagar solo lo peligroso?


Listen Later

Anthropic publicó casi en simultáneo cuatro piezas de seguridad: compartimentos removibles de conocimiento peligroso, una técnica para reducir la desalineación agéntica, un mapeo de los valores de Claude entre idiomas, y una medición de cuánto ayudan realmente los modelos de lenguaje a explotar vulnerabilidades de día N. Cuatro ángulos sobre la misma pregunta: ¿se puede aislar lo peligroso sin apagar todo lo demás?

🎧 Paperslab — el podcast que convierte papers de investigación en IA en conversaciones claras, en español, para audiencia técnica.

🔗 Todos los episodios: podcast.paperslab.es

...more
View all episodesView all episodes
Download on the App Store

PaperslabBy Esteban