Frank Stephano Alayza Herrera
Juan Pablo Serrano Echeverría
Jesus Eduardo Castillo Saavedra
Alexander Lopez Piñeres
Emiliano Van den Heuvel
Carlos Andres Prieto Garavito
MARIA TERESA PANIAGUA RIVERA
que buenas tus imágenes ¿cómo las creas?
La clase se centra en la preparación y limpieza de datos para machine learning, esencial para el éxito de cualquier proyecto de inteligencia artificial. Aquí está el resumen:
Importancia de los datos: Se enfatiza que "datos sucios producen modelos sucios". Los datos deben ser completos y bien estructurados.
Ingeniería de características: Se transforma datos crudos en un formato que los algoritmos pueden entender. Esto incluye manejar valores faltantes, codificar variables categóricas y crear nuevas características.
Práctica con dataset: Se utiliza el dataset de Titanic para practicar la preparación de datos.
División de datos: Se separan los datos en conjuntos de entrenamiento y prueba, asegurando una distribución adecuada de las clases.
Detección de valores faltantes: Se identifican y manejan los datos nulos, eligiendo estrategias de imputación adecuadas.
Transformaciones de variables: Se imponen transformaciones a variables numéricas y categóricas para prepararlas para el modelo.
Pipeline de preparación: Se establece un flujo de trabajo estructurado para la preparación de datos, permitiendo repetibilidad en futuros proyectos.
La clase concluye con la preparación para el entrenamiento y evaluación de modelos en la siguiente sesión.
preparacion de la data, formalizar y dejar la informacion a utilizar lo mas integra posible
Falta un paso importante a mi entender, que impactar todas las preparacion en un archivo, ya que la siguente clase se continua pero no hay archivo nuevo, y las preparcion de esta clase No impacta sobre el archivo real.
para eso hay que pasarlo a un nuevo archivo.csv para ultilizar en la siguiente clase. agregar una ultima linea "df.to_csv('nombre_Nuevo.csv', index=False)"
Gracias