Combinar scraping e IA puede reducir el tiempo dedicado a ordenar directorios de empresas, anuncios o registros de marketplaces. El resultado debe ser una cola priorizada y explicable, no una lista opaca de personas a las que contactar. La clasificación empieza con una definición clara de lead cualificado y una fuente defendible.
Usa APIs oficiales cuando existan y recoge solo datos empresariales públicos o autorizados. Respeta controles de acceso, términos aplicables, robots, límites de petición y protección de datos. No infieras atributos sensibles. Documenta finalidad, base jurídica, retención y supresión antes de escalar.
Define las etiquetas antes de elegir modelo
Empieza con etiquetas accionables: cualificado, revisar, no relevante y datos insuficientes. Escribe ejemplos y exclusiones. Si dos personas no clasifican una muestra de forma consistente, la IA solo automatizará esa ambigüedad.
Separa reglas duras de juicio semántico. País, categoría, tamaño mínimo y duplicados son filtros deterministas. Después, un modelo puede valorar descripción o encaje, devolviendo etiqueta, confianza y motivo breve dentro de un esquema fijo.
Pipeline de producción
- recoger campos aprobados con URL y fecha
- normalizar nombres, dominios, ubicaciones y categorías
- deduplicar con claves exactas y fuzzy matching prudente
- aplicar exclusiones y reglas deterministas
- clasificar el texto restante con una rúbrica versionada
- validar salida estructurada y confianza
- enviar casos inciertos o valiosos a revisión humana
- exportar al CRM solo registros aprobados
Las colas y workers idempotentes desacoplan las etapas. Consulta la arquitectura con colas, workers y reintentos y cómo montar un pipeline desde scraping hasta CRM.
No dejes que la IA oculte datos malos
Un modelo no corrige procedencia ausente, anuncios obsoletos ni un mercado objetivo equivocado. Valida campos obligatorios antes de clasificar y devuelve datos insuficientes en vez de inventar. Conserva los hechos de origen separados de etiquetas generadas para auditar o recalcular cada decisión.
Mide precisión y exhaustividad sobre una muestra representativa etiquetada manualmente. Los falsos positivos consumen tiempo y pueden elevar el riesgo de cumplimiento; los falsos negativos esconden oportunidades. Ajusta umbrales según ese coste, no con un 0,7 arbitrario.
Errores comunes
- recoger datos sin una finalidad legítima definida
- enviar cada registro a un modelo caro
- mezclar filtros objetivos con opiniones del modelo
- aceptar texto libre en vez de un esquema
- interpretar confianza como probabilidad calibrada
- usar datos personales innecesarios en prompts
- reexportar duplicados o contactos suprimidos
- cambiar prompts sin versionado ni evaluación
Checklist práctico
- aprobar fuentes, campos, finalidad y retención
- preferir APIs e información empresarial pública
- definir etiquetas con ejemplos positivos y negativos
- normalizar y deduplicar antes de usar IA
- resolver criterios objetivos con reglas
- exigir salida estructurada y código de motivo
- fijar umbrales de revisión y rechazo
- registrar versiones de fuente, parser, rúbrica y modelo
- probar precisión, exhaustividad, coste y latencia
- monitorizar drift y atender borrado o supresión
Trazabilidad y estabilidad
Guarda para cada lead los hechos de origen, fecha de recogida, versión de transformación, rúbrica, resultado y corrección del revisor. Evita secretos y datos personales innecesarios en logs. Las correcciones deben alimentar una evaluación, no borrar silenciosamente el historial.
Monitoriza completitud, duplicados, distribución de etiquetas, tasa de revisión, coste por lead aceptado y conversión. Una mejora súbita puede ser un parser roto que repite descripciones. Usa la guía para detectar duplicados, spam y leads basura como filtro previo.
Cuándo tiene sentido contratar a alguien técnico
Busca un especialista cuando varias fuentes requieren parsers distintos, la clasificación condiciona el contacto comercial, necesitas auditoría o el coste del modelo crece sin control. Un perfil técnico puede definir contrato de datos, evaluación, revisión y controles de cumplimiento antes de contaminar el CRM.
Conclusión
El scraping aporta hechos permitidos; las reglas establecen el encaje objetivo; la IA interpreta texto ambiguo; las personas resuelven incertidumbre. Si necesitas un pipeline estable y medible, revisa mis servicios técnicos o contacta conmigo indicando fuentes, reglas y volumen.