Sospechosos habituales

ATA 813 Implementé un cazador de ofertas con IA


Listen Later

En este episodio de Atareao con Linux nos vamos a remangar para hablar de una de esas tecnologías que, una vez las dominas, te cambian la vida por completo: el Web Scraping asistido por Inteligencia Artificial.

Seguro que te ha pasado alguna vez. Quieres comprar un producto concreto, como unas zapatillas de running (yo las cambio cada 800 kilómetros y es un goteo constante), o quieres extraer todas las recetas de cocina de una web para montarte tu propio planificador semanal. Lo ideal sería que estas páginas tuvieran una API pública para descargar la información de forma limpia. Pero la cruda realidad es que casi ninguna te lo pone fácil. Ahí es donde entra el scraping: la técnica de extraer la información directamente de la página web.

En este episodio te cuento por qué el scraping clásico (ese que utiliza Beautiful Soup en Python y depende de identificar las etiquetas HTML y las clases CSS) tiene los días contados para tareas complejas. Basta con que un desarrollador cambie el diseño de la web para que tu script se rompa por completo. Además, con la llegada de las webs dinámicas, los tests A/B y los sistemas anti-bloqueo como Cloudflare, mantener un scraper tradicional es un auténtico dolor de muelas.

La gran alternativa: Inteligencia Artificial en local
¿Y si en lugar de pelearnos con el código fuente dejamos que un modelo de lenguaje (LLM) entienda la página exactamente igual que lo haría un humano? Un LLM comprende perfectamente qué es un "precio" o el "nombre de un producto", sin importar cómo esté maquetada la web ni el idioma en el que esté escrita. Y lo mejor de todo: ¡lo podemos hacer 100% gratis en local usando Ollama!

Te detallo mis pruebas ejecutando modelos en mi Slimbook One utilizando únicamente la CPU (¡sin gastar un céntimo en nubes ni necesitar tarjetas gráficas carísimas!). Hablaremos de cómo rinden modelos como Llama 3.2, Qwen, Mistral y DeepSeek R1, y cuál es el punto de equilibrio perfecto para no eternizarnos esperando la respuesta.

También te desvelo mi fórmula secreta para procesar la información. No podemos enviarle 2 Megabytes de HTML ruidoso a la IA. Te explico los 5 pasos que utilizo en Python para eliminar la basura (scripts, estilos, navegación) y reducir el HTML hasta en un 93%, permitiendo que el modelo extraiga los datos en segundos y nos devuelva un JSON estructurado impecable.

Por último, vemos cómo montar un auténtico vigilante de ofertas automatizado en segundo plano. Un sistema que compare los precios de varias tiendas en paralelo.

Capítulos del episodio:

  • 00:00:00 Introducción al Web Scraping con Inteligencia Artificial
  • 00:01:22 ¿Para qué sirve extraer datos? Ejemplos prácticos
  • 00:02:42 El gran talón de Aquiles del scraping tradicional
  • 00:04:31 La revolución de la IA: Entender la web sin saber HTML
  • 00:07:36 Los problemas habituales: Selectores rotos y webs dinámicas
  • 00:10:00 Cómo un modelo de lenguaje (LLM) procesa la información
  • 00:13:17 Cuándo elegir scraping clásico vs. scraping con IA
  • 00:15:28 Comparación de costes: Enfoque clásico, IA local e IA en la nube
  • 00:17:19 ¿Qué modelos usar? Pruebas con Llama, Qwen, Mistral y DeepSeek
  • 00:18:19 Detrás de escena: Mi script de Python y la limpieza del HTML
  • 00:21:05 Creando el prompt perfecto para extraer un JSON estructurado
  • 00:24:34 Ejemplo real: Comparativa paralela entre tiendas
  • 00:28:38 Diseñando un vigilante de ofertas automatizado (24/7)
  • 00:30:17 Casos de uso prácticos y mejoras para evitar bloqueos
  • 00:32:02 Cierre y detalles del próximo tutorial de scraping

Más información y enlaces en las notas del episodio

  • 🌐 Aquí lo puedes encontrar todo 👉 https://atareao.es
  • ✈️ Telegram (el grupo) 👉 https://t.me/atareao_con_linux
  • ✈️ Telegram (el canal) 👉 https://t.me/canal_atareao
  • 🦣 Mastodon 👉 https://mastodon.social/@atareao
  • 🐦 Twitter 👉 https://twitter.com/atareao
  • 🐙 GitHub 👉 https://github.com/atareao
...more
View all episodesView all episodes
Download on the App Store

Sospechosos habitualesBy Sospechosos Habituales


More shows like Sospechosos habituales

View all
Emilcar Daily by Emilcar

Emilcar Daily

24 Listeners

Applelianos by Applelianos

Applelianos

56 Listeners

Radio Fitness Revolucionario by Marcos Vázquez

Radio Fitness Revolucionario

137 Listeners

iSenaCode Live by Sergio Navas

iSenaCode Live

85 Listeners

Podcast WINTABLET.INFO by Javier Fernandez

Podcast WINTABLET.INFO

0 Listeners

mixx.io by Álex Barredo

mixx.io

40 Listeners

LO QUE TÚ DIGAS con Alex Fidalgo by Alex Fidalgo

LO QUE TÚ DIGAS con Alex Fidalgo

67 Listeners

Las Charlas de Applesfera by Webedia

Las Charlas de Applesfera

36 Listeners

Leña al mono que es de goma by rfog

Leña al mono que es de goma

0 Listeners

Cupertino, podcast sobre Apple by Álex Barredo, Ángel Jiménez, Matías Zavia

Cupertino, podcast sobre Apple

15 Listeners

Loop Infinito (by Xataka) by Webedia

Loop Infinito (by Xataka)

57 Listeners

Cacharreogeek by Cacharreogeek

Cacharreogeek

0 Listeners

monos estocásticos by Antonio Ortiz, Matías S. Zavia

monos estocásticos

3 Listeners

El Podcast de Marc Vidal by Marc Vidal

El Podcast de Marc Vidal

7 Listeners

El Mancuentro by Mancuentro Patal

El Mancuentro

0 Listeners