Icono del sitio ¿Qué dicen los datos?

¿En qué consiste la limpieza de datos?

La limpieza de datos es el proceso de transformar nuestros datos para que la etapa de análisis sea más fácil y más precisa. Esto incluye eliminar información incorrecta o poco fiable. Existen un sinnúmero de mejores prácticas a la hora de limpiar datos. Una vez las conozcas, puedes aplicarlas independientemente de la herramienta que estés utilizando para limpiar los datos.

¿Cuál es la importancia de saber limpiar datos?

Si tenemos datos limpios podemos hacer mejores gráficas, agregar datos, ordenarlos, y hasta filtrarlos más fácilmente. Quizás han escuchado el refrán: “Basura que entra, basura que sale”. Pues esto también aplica a los datos, si no tenemos datos limpios la relevancia y los resultados de nuestro análisis se ven afectados.

¿Cómo evaluar la calidad de los datos?

Antes de comenzar a procesar nuestros datos, debemos hacer un análisis exploratorio. Esto nos permitirá identificar algunas anomalías en nuestros datos que tendrán que ser corregidas.

A continuación, presento una lista de anomalías que debemos identificar y corregir en el proceso de limpieza de datos:

1. Remover duplicados

2. Valores atípicos

3. Maneja la falta de datos

4. Campos obligatorios

5. Formato de fechas

6. Ortografía

7. Traducciones

8. Tipos de datos

9. Formato

10. Enlaces

11. Identificadores

12. Caracteres especiales

La limpieza de datos es una de las etapas más importantes del proceso de análisis y ciencia de datos. En muchas ocasiones se subestima su importancia y su potencial. El hacer una buena limpieza de datos nos ahorra tiempo y esfuerzo a la larga. No pases por alto los detalles. Mi consejo es, si encuentras patrones en la limpieza de datos, saca tiempo para identificar donde está la raíz del problema y diseña una solución que permita reducir el tiempo que pasarías haciendo la limpieza de datos.

Salir de la versión móvil