¿Qué es la multimodalidad y qué cambia cuando un modelo puede ver, escuchar y hablar en el mismo razonamiento? En este episodio hablamos de las tareas que esto habilita (leer un documento escaneado, describir una imagen, transcribir y resumir una reunión, generar una imagen a partir de una idea), qué tan confiable es realmente lo que un modelo "ve" o "escucha", y por qué la sensación de hablar con algo que ve y oye nos empuja a tratarlo como si tuviera juicio o intención.
También abordamos el lado de accesibilidad (cómo estas herramientas pueden ser un puente real para personas con discapacidad visual o auditiva) y los riesgos que abre este salto: deepfakes, voz clonada y manipulación de imagen, y cómo eso cambia nuestra relación con lo que consideramos evidencia.
Cerramos con casos prácticos de uso diario, incluyendo cómo Copilot y su agente Facilitator están cambiando el flujo de trabajo en juntas y seguimiento de tareas.
Sígueles la pista:
Cass: @ai.cass
Frida: @fridaruh
Únete a la comunidad de AI The New Sexy : https://fridaruh.com/comunidad