Calidad del dato: el cuello de botella que frena tu proyecto de IA

Lo que nos ha enseñado I3OS sobre la calidad del dato

En nuestra experiencia, el cuello de botella suele ser el contexto, no el modelo. Antes de pedir a la IA que produzca un análisis necesitamos saber qué cliente estamos trabajando, qué fuentes están autorizadas, qué datos tienen fecha y qué procedimiento debe seguirse. Por eso I3OS combina Projects de cliente, conectores, documentación de skills y revisión humana. El resultado no depende solo de elegir un modelo mejor, sino de entregar información suficientemente completa, consistente y trazable.

El 80% del tiempo de un proyecto de IA se dedica a preparar datos. Si tus datos son incompletos, inconsistentes o están desactualizados, ningún modelo de machine learning va a producir resultados fiables. Te explicamos los 6 criterios de calidad, cómo diagnosticar tu situación y cómo montar un programa de data quality que funcione

Hay una frase que todo profesional de datos conoce: garbage in, garbage out. Si alimentas un modelo de inteligencia artificial con datos sucios, el modelo producirá resultados sucios. Con mucha confianza, con bonitos gráficos y con la apariencia de precisión técnica, pero sucios igualmente.

El problema es que la mayoría de las empresas subestiman el estado real de sus datos. Un estudio de Gartner estima que el coste medio de la mala calidad de datos para una organización es de 12,9 millones de dólares anuales. Y no es solo un problema de grandes corporaciones: un ecommerce con fichas de producto incompletas, precios desactualizados y datos de clientes duplicados tiene el mismo problema a su escala.

Lo peor es que este problema es invisible hasta que intentas hacer algo inteligente con tus datos. Un ERP funciona razonablemente bien con datos mediocres porque los humanos compensan los errores manualmente. Pero un modelo de machine learning no compensa: aprende los errores, los amplifica y los reproduce a escala.

En este artículo te explicamos qué significa realmente «calidad de datos» en el contexto de la IA, los 6 criterios que debes evaluar, cómo diagnosticar tu situación actual y cómo montar un programa de data quality que funcione sin necesitar un equipo de 20 data engineers.

Los 6 criterios de calidad de datos para IA

La calidad de datos no es un concepto abstracto. Se mide con criterios específicos. Estos son los seis fundamentales que afectan directamente al rendimiento de un modelo de IA:

1. Completitud

¿Están todos los campos necesarios rellenos? Un dataset de clientes donde el 30% no tiene email, el 15% no tiene código postal y el 40% no tiene fecha de última compra es un dataset incompleto que limitará severamente cualquier modelo de segmentación o predicción.

Semáforo: Verde >95% completitud en campos críticos. Ámbar 80-95%. Rojo <80%.

2. Exactitud

¿Los datos reflejan la realidad? Un precio de 0,01€ en una ficha de producto, una fecha de nacimiento de 1900 en un perfil de cliente, una dirección de envío que no existe. Los datos inexactos no solo distorsionan el modelo: pueden generar decisiones operativas erróneas.

3. Consistencia

¿Los mismos datos significan lo mismo en todos los sistemas? Si tu CRM almacena países con códigos ISO (ES, FR, DE) pero tu ecommerce usa nombres completos (España, Francia, Alemania), y tu ERP usa códigos numéricos (034, 033, 049), tienes un problema de consistencia que hará imposible cruzar datos sin una capa de transformación.

4. Actualidad (Timeliness)

¿Los datos están actualizados? Un modelo de predicción de demanda entrenado con datos de hace 3 años que no incluyen el impacto post-COVID producirá previsiones desfasadas. La frecuencia de actualización debe ser coherente con la velocidad de cambio del negocio.

5. Unicidad

¿Hay registros duplicados? Un cliente que aparece tres veces con variaciones del nombre (Juan Pérez, J. Pérez, Juan Pérez López) distorsiona los análisis de frecuencia de compra, lifetime value y segmentación. En bases de datos de pymes, las tasas de duplicados típicas están entre el 5% y el 15%.

6. Validez

¿Los datos cumplen con las reglas de formato y dominio esperadas? Un campo de email sin @, un teléfono con 5 dígitos, un código postal alfanumérico donde debería ser numérico. La validez se puede comprobar automáticamente con reglas de negocio.

Sin datos de calidad no hay IA que funcione. Audita antes de modelar.

Cómo diagnosticar la salud de tus datos en una semana

No necesitas un proyecto de 6 meses para saber si tus datos están listos para IA. Puedes hacer un diagnóstico rápido en una semana siguiendo estos pasos:

  1. Día 1-2: Identifica las fuentes críticas. ¿Qué bases de datos alimentarán tu proyecto de IA? Normalmente: CRM (clientes), ERP (transacciones), plataforma ecommerce (productos, pedidos), herramientas de marketing (campañas, leads). Haz una lista.
  2. Día 2-3: Extrae muestras representativas. No necesitas analizar millones de registros. Una muestra de 1.000-5.000 registros de cada fuente es suficiente para un diagnóstico. Exporta a CSV y carga en una hoja de cálculo o en una herramienta de perfilado.
  3. Día 3-4: Aplica los 6 criterios. Para cada fuente, mide: % de campos vacíos (completitud), % de valores fuera de rango (validez), número de duplicados detectados (unicidad), fecha del registro más antiguo y más reciente (actualidad). Herramientas gratuitas como OpenRefine o pandas (Python) permiten hacer esto en horas.
  4. Día 4-5: Clasifica con semáforo. Para cada fuente y cada criterio, asigna verde, ámbar o rojo. El resultado es una matriz de salud del dato que te dice exactamente dónde están los problemas y cuáles son críticos.

Herramientas recomendadas: Para pymes sin equipo de datos: OpenRefine (gratuito, excelente para limpieza y deduplicación), Google Sheets + fórmulas de validación, o un script básico en Python con pandas. Para empresas medianas: Great Expectations (open-source) o Talend Data Quality.

El coste real de los datos malos: ejemplos concretos

Para dimensionar el impacto, estos son ejemplos reales de cómo la mala calidad de datos afecta a proyectos de IA específicos:

  • Chatbot con datos de producto incompletos: Un chatbot RAG que responde preguntas sobre productos necesita fichas completas y actualizadas. Si el 20% de tus productos no tienen descripción detallada, el chatbot responderá «no tengo información sobre ese producto» en 1 de cada 5 consultas. La tasa de resolución (FCR) cae un 20% y el CSAT se desploma.
  • Motor de recomendaciones con categorías inconsistentes: Si tus productos están categorizados de forma diferente en la web, en el ERP y en el marketplace, el motor de recomendaciones no puede identificar patrones de compra cruzada. El AOV que debería subir un 15% apenas se mueve un 3%.
  • Predicción de demanda con histórico contaminado: Si no distingues entre ventas reales y devoluciones, o si los períodos de rotura de stock no están marcados, el modelo aprende patrones falsos. El MAPE que debería estar en 15-20% se queda en 35-40%, peor que una media móvil simple.
  • Selección de personal con datos históricos sesgados: Si tu dataset de contrataciones incluye 10 años de decisiones donde el 90% de los seleccionados para roles técnicos eran hombres, el modelo codificará ese sesgo. La regla del 4/5 fallará en la primera auditoría.

En todos estos casos, la solución no es un modelo más potente. Es mejorar los datos antes de modelar. Y eso empieza con un diagnóstico honesto de la situación actual.

Los cinco errores más comunes en data quality para IA

  1. Limpiar una vez y olvidar. La calidad de datos no es un proyecto puntual. Es un proceso continuo. Si limpias tu base de clientes hoy pero no estableces reglas de validación en la entrada de datos, en 6 meses estarás igual. La limpieza sin prevención es un ciclo infinito.
  2. No involucrar al negocio. Solo el equipo de negocio sabe qué significa «un dato correcto» en su contexto. Un data engineer puede detectar que un campo tiene un 20% de nulos, pero solo ventas sabe si esos nulos son un problema real o una situación esperada.
  3. Subestimar el coste de la preparación. El 80% del tiempo de un proyecto de IA típico se dedica a preparar datos. Si presupuestas solo el modelo y la herramienta pero ignoras la limpieza, transformación y validación de datos, tu proyecto se retrasará y costará más de lo previsto.
  4. No definir un Data Owner. Cada fuente de datos crítica necesita un responsable (Data Owner) que responda por su calidad. Si nadie es responsable, nadie mejora la calidad. El Data Owner no tiene que limpiar los datos personalmente: tiene que asegurar que se cumplan los estándares.
  5. Ignorar el sesgo en los datos. Los datos históricos reflejan decisiones pasadas, incluidas las sesgadas. Si tu modelo de selección se entrena con datos de contrataciones donde el 85% eran hombres, el modelo aprenderá a priorizar perfiles masculinos. La calidad del dato no es solo técnica: es también ética.

Programa de data quality mínimo viable

No necesitas un departamento de data governance para mejorar la calidad de tus datos. Un programa mínimo viable incluye:

  1. Data Owners designados. Asigna un responsable para cada fuente de datos crítica. En una pyme, suele ser el jefe del área que genera esos datos (ventas para el CRM, operaciones para el ERP, marketing para el CMS).
  2. Reglas de validación en la entrada. Configura validaciones automáticas en los formularios y sistemas donde se introducen datos: campos obligatorios, formatos estándar (email, teléfono, código postal), rangos válidos (precio >0, cantidad entero positivo). Es la medida con mayor ROI: prevenir errores cuesta 10x menos que corregirlos.
  3. Deduplicación periódica. Programa una revisión mensual o trimestral de duplicados en tus bases de datos principales. Herramientas como OpenRefine pueden identificar duplicados fuzzy (variaciones del mismo nombre/dirección) en minutos.
  4. Dashboard de salud del dato. Crea un panel sencillo con los indicadores clave por fuente: % completitud, % duplicados, fecha de última actualización. Revísalo mensualmente. Si un indicador cruza el umbral ámbar, actúa antes de que llegue a rojo.
  5. Documentación del diccionario de datos. Un documento simple que defina qué significa cada campo, qué formato tiene, qué valores son válidos y quién es el Data Owner. Sin diccionario de datos, cada persona interpreta los campos a su manera y la inconsistencia crece.

Calidad de datos y AI Act: una obligación regulatoria

El AI Act no solo regula los modelos de IA. También establece requisitos sobre los datos que los alimentan. Para sistemas de alto riesgo, el reglamento exige que los conjuntos de datos de entrenamiento sean representativos, libres de errores (en la medida de lo posible) y apropiados para la finalidad del sistema.

Esto significa que la calidad de datos deja de ser una buena práctica y se convierte en una obligación documentable. Si un auditor te pregunta con qué datos entrenaste tu modelo de selección de personal, necesitas poder demostrar que evaluaste su representatividad, detectaste sesgos y corregiste errores de calidad.

Las empresas que ya tienen un programa de data quality están mejor posicionadas para cumplir con el AI Act. Las que no lo tienen necesitarán invertir en gobernanza de datos antes de poder desplegar sistemas de alto riesgo con garantías.

Consejo: Incluye la evaluación de calidad de datos como paso obligatorio en el Gate 0 de cualquier proyecto de IA. Si los datos no pasan el semáforo (verde en criterios críticos), el proyecto no avanza al piloto. Es mejor descubrirlo antes que después.

Los datos son el verdadero combustible de la IA

Puedes tener el mejor modelo, la plataforma más avanzada y el equipo más talentoso. Si tus datos son mediocres, tus resultados serán mediocres. La calidad de datos no es sexy, no genera titulares y rara vez se incluye en las presentaciones de estrategia. Pero es la variable que más correlaciona con el éxito de un proyecto de IA.

La buena noticia: no necesitas datos perfectos para empezar. Necesitas datos suficientemente buenos para tu caso de uso específico, un proceso de mejora continua y la disciplina de medir y actuar sobre la calidad antes de cada proyecto.

Si quieres hacer una auditoría de calidad de tus datos, definir un programa de data quality mínimo viable o preparar tus datos para un proyecto de IA, en Impulsa3 hacemos auditorías de calidad de datos y te acompañamos en la preparación.

impulsa3.com · Transformación Digital e IA para pymes y ecommerce · servicios@impulsa3.com

Estos datos también son la base de RGPD e inteligencia artificial, IA generativa e IA predictiva, agentes de IA.