En este episodio analizamos cómo funciona
realmente la visión artificial y cómo la inteligencia artificial ha
revolucionado la capacidad de las máquinas para interpretar imágenes.
Junto a nuestro invitado, Juan Antonio Sánchez, ingeniero
especializado en visión artificial y técnico de Ipsotek (grupo Atos), empresa
dedicada al desarrollo de soluciones de análisis inteligente de vídeo mediante
inteligencia artificial para seguridad, videovigilancia y automatización.
, trataremos de explicar de forma divulgativa
los principios básicos del procesamiento digital de imágenes, el funcionamiento
de las redes neuronales aplicadas a visión por computador y la evolución desde
los algoritmos clásicos hasta los actuales modelos de IA.
Entre los temas tratados destacan:
Qué es la visión artificial y cómo "ven" las máquinas.
Evolución desde los primeros sistemas de reconocimiento de imágenes hasta los modelos actuales de inteligencia
artificial.
Redes neuronales convolucionales (CNN), modelos YOLO y Transformers aplicados a visión.
Entrenamiento de modelos mediante grandes conjuntos de imágenes etiquetadas.
Aplicaciones reales en videovigilancia, industria, robótica, drones y automatización.
Funcionamiento de sensores como cámaras, LIDAR y sistemas de percepción.
Cómo estiman las máquinas distancias, profundidad y movimiento.
El papel de la visión artificial en las gafas inteligentes para personas ciegas, incluyendo Meta Ray-Ban y
otros asistentes visuales.
OCR, reconocimiento de objetos y descripción automática de imágenes.
Limitaciones actuales, alucinaciones de los modelos y retos de precisión para aplicaciones críticas.
El impacto de la IA generativa en el desarrollo de sistemas de visión.
Tendencias futuras: robots asistentes, computación de alto rendimiento, modelos multimodales y el
creciente papel de la IA en la percepción del entorno.
Además, se debate sobre el papel de la
comunidad de personas ciegas en la evolución de los sistemas de descripción
automática de imágenes, los desafíos regulatorios de la inteligencia artificial
y cómo estas tecnologías están cambiando la forma de desarrollar software y
productos basados en visión por computador.
Dale al play y acompáñanos en una conversación cercana, divertida y reveladora…
y conoce más acerca de los sistemas de visión artificial.
Enlaces a Sitios referenciados en el episodio:
Look Once) - Detección de objetos en tiempo real mediante redes neuronales.
(Convolutional Neural Networks) - Redes neuronales convolucionales
utilizadas para reconocimiento de imágenes y base histórica de muchos sistemas
Transformers (Transformers para visión) - Arquitecturas modernas que
permiten comprender imágenes y sirven de base para muchos modelos multimodales
láser que genera mapas tridimensionales del entorno para navegación autónoma,
de Open AI sobre el sistema GPT-4V(ision) en español - Documento técnico
que presenta GPT-4 con visión, describiendo su desarrollo, entrenamiento,
evaluación de seguridad, colaboración con Be My Eyes y las capacidades y
limitaciones del modelo para comprender imágenes.