En este paso auditas y preparas el dato que tus casos de uso del paso 1 van a consumir: identidad única, campos completos, historial confiable y fuentes conectadas. La regla corta: la IA multiplica lo que le des — si le das orden, multiplica orden; si le das basura, multiplica basura a una velocidad que ningún humano alcanza.
La IA no arregla tus datos: los amplifica
Es la conversación que ningún proveedor quiere tener y la que define todo el roadmap. Un modelo de scoring entrenado sobre un CRM con 20% de duplicados aprende patrones de clientes que no existen. Una campaña de personalización sobre una base sin higiene le escribe "hola {nombre}" a contactos muertos hace tres años. Un asistente que resume la relación con una cuenta leyendo notas vacías, resume el vacío con mucha confianza.
El síntoma más común en empresas medianas de LATAM no es la falta de datos: es el exceso de datos en los que nadie confía. Tres sistemas con tres versiones del mismo cliente, campos que cada vendedor llena distinto y un historial de negocios donde "cerrado-perdido" significa cualquier cosa. Sobre eso, ninguna IA produce nada útil.
Los cuatro niveles de "datos listos"
Listo para IA no es un sentimiento: son cuatro condiciones verificables, en orden de dependencia.
- Identidad única. Cada cliente existe una sola vez, con una llave que lo identifica en todos los sistemas. Sin esto, todo lo demás se construye sobre arena. Las bases comerciales suelen llegar con 10–25% de duplicados.
- Completitud de campos críticos. No todos los campos: los que tu caso de uso consume. Para scoring: industria, tamaño, origen, actividad. Para personalización: comportamiento y consentimiento. Define la lista y mide la tasa de llenado real.
- Historial confiable. Los modelos predictivos aprenden del pasado: necesitan 12 meses o más de negocios con etapas que avanzaron de verdad y motivos de cierre reales, no "otro" en el 80% de los casos.
- Acceso conectado. El dato existe pero vive en silos: el pedido en el ERP, la conversación en WhatsApp, la visita en la web. La IA solo es tan inteligente como el contexto que ve; conectar las fuentes es la guía de integración de datos completa, y para el funnel comercial alcanza con empezar por los flujos de tus casos de uso.
Ningún modelo es mejor que el dato que lo alimenta. IA sobre datos sucios no es inteligencia artificial: es desorden a escala industrial.
Limpia para el caso de uso, no el universo
El error opuesto a ignorar los datos es querer limpiarlos todos: un proyecto de "calidad de datos total" de ocho meses que agota el presupuesto antes de encender una sola IA. La disciplina correcta es quirúrgica: toma los dos quick wins y la apuesta del paso 1 y preparé solo lo que consumen.
- ¿El caso es scoring de leads? Deduplica contactos y empresas, y sanea el historial de negocios de los últimos 12–18 meses.
- ¿El caso es personalización web? Necesitas comportamiento unificado y consentimiento en regla, no el histórico contable.
- ¿El caso es un asistente de ventas? Necesitas que las actividades se registren (llamadas, correos, reuniones) — si el CRM está vacío porque nadie lo usa, el problema es de adopción, y eso se arregla antes: mira la guía de implementación de HubSpot o, si el portal ya existe pero nadie lo alimenta, la guía de rescate de CRM.
Y tan importante como limpiar: instalar las reglas para que no se vuelva a ensuciar. Validaciones en formularios, campos obligatorios en el cambio de etapa, deduplicación automática en la entrada. Limpiar sin reglas es achicar el mar con balde.
El test de los 15 minutos
Antes de declarar el dato listo, haz esta prueba con tu equipo: saca 20 registros al azar de la entidad que tu caso de uso consume (20 contactos, 20 negocios cerrados, 20 cuentas). Revisalos a mano contra tres preguntas: ¿es una persona/empresa real y única?, ¿los campos críticos están llenos y son creíbles?, ¿el historial cuenta una historia que un humano entiende?
Si menos de 14 de los 20 pasan (70%), no actives el caso de uso todavía: el modelo va a aprender más ruido que señal, y la primera impresión del equipo —esa que no se recupera— va a ser "esto no sirve". Quince minutos de honestidad ahorran tres meses de piloto muerto.
Errores comunes en este paso
- Saltárselo directamente. "Después limpiamos" es el epitafio de la mayoría de los pilotos de IA. Después no existe: el modelo ya aprendió del desorden.
- Limpiar el universo entero antes de empezar. La parálisis por perfección mata tanto como la basura. Se prepara el dato del caso de uso, no la empresa completa.
- Asumir que el CRM está bien "porque se usa". Uso no es calidad. Mide la tasa de llenado y el test de los 20 registros antes de confiar.
- Olvidar el consentimiento. Personalizar y predecir con datos que el cliente no autorizó no es un detalle legal: es un riesgo comercial directo en cualquier país de LATAM con ley de protección de datos vigente.
Checklist antes de pasar al siguiente
- Llave de identidad definida y deduplicación hecha en las entidades de tus casos de uso.
- Campos críticos listados por caso de uso, con tasa de llenado medida y aceptable.
- Historial de 12+ meses validado para los casos predictivos (etapas y motivos de cierre reales).
- Fuentes conectadas para los flujos que el caso de uso necesita ver.
- Reglas de captura instaladas para que el dato no se vuelva a ensuciar.
- Test de los 20 registros pasado con 70% o más.
Con el dato preparado, empieza lo visible: paso 3, IA en marketing — segmentación, contenido y personalización. El índice completo está en la guía de IA aplicada a revenue.