Naren Fragozo
Erick Bryan Angulo Quintero
camilo Rincon
Mireya Lara
Luis Miguel Osorio Molina
Frank Stephano Alayza Herrera
Adolfo Arreaga
Dilean Shadai García Alvarez
Juan Ramón García Santabárbara
Company_adminGabriel Obregón
Mikel Motzi
Frida Ruh
ProfesorDilean Shadai García Alvarez
Vianey Casasola
Hernán Pérez Barrera
Gabriel Calvo Vargas
Diego del Cid
Verónica Osorio
maria virginia Gómez Sandoval
astrid marciaga
Alejandro Zuñiga Saavedra
FIDGERAL RODOLFO SILVA HUERTAS
Edgar Eduardo Mansilla Mendizabal
ana santa
Tip rápido: Para abrir un notebook de GitHub en Colab, cambia github.com por colab.research.google.com/github en la URL.
Bro, excelente aporte!!!
Para comprender perfectamente la clase sobre regresión lineal y modelos predictivos, se recomienda tener conocimiento en los siguientes temas:
Estos conocimientos te ayudarán a sacar el máximo provecho de la clase.
Gracias por mencionarlo. Me parecía muy avanzado este curso, pero gracias a esta lista de conocimientos que hiciste, me di cuenta de lo que me falta aprender antes de tomar este curso. Sino, se me puede convertir en una pesadilla.
Gracias por las recomendaciones a tener en cuenta para entender de la manera adecuada y más efectiva esta clase.
wow, no tenia idea que esto se podia obtener con herramientas tan a la mano, gracias por el aporte y me quedo muy contento por aprender nuevos conceptos, nuevas librerias y dandome cuenta lo que tengo que aplicar para entrar a la IA y al machine learning, todo esto no lo sabia y ahora empiezo un nuevo viaje, muchas gracias.
Me encanta que ha pesar de ser la 3ra clase ya usaremos código para entender y poner en practica los conceptos vistos en este curso. <3
Los residuos son la diferencia entre el valor real observado de la variable dependiente (Y) y el valor estimado por el modelo de regresión (Ŷ).
Interpretación de los residuos
El predecir el precio de una casa, un residuo es la diferencia entre el precio real de la casa y el precio que el modelo calcula con las variables seleccionadas.
!Residuos
🧠📈 Regresión lineal aplicada a precios de casas
━━━━━━━━━━━━━━━━━━━━━━━
La regresión lineal:
✔️ Predice valores
✔️ Explica relaciones entre variables
✔️ Apoya la toma de decisiones de negocio
━━━━━━━━━━━━━━━━━━━━━━━
🧠 CONCEPTOS CLAVE DE REGRESIÓN LINEAL
🧮 Variables independientes (predictoras)
🎯 Variable dependiente (objetivo)
📖 Interpretabilidad de los coeficientes
⚖️ Generalización vs. predicción exacta
✂️ División del dataset:
🔧 Ajuste del modelo (fitting)
📉 Análisis de residuos
🎲 Uso de semilla aleatoria para reproducibilidad
━━━━━━━━━━━━━━━━━━━━━━━
🛠️ ENTORNO Y HERRAMIENTAS
🔹 Lenguaje y plataforma
🔹 Librerías utilizadas
━━━━━━━━━━━━━━━━━━━━━━━
🔎 VISUALIZACIÓN EXPLORATORIA
Para entender los datos se utilizan:
📊 Histogramas
📉 Gráficos de dispersión
📦 Box plots
🔥 Mapas de calor
📌 Apoyado en:
━━━━━━━━━━━━━━━━━━━━━━━
🏠 DATASET DEL EJEMPLO
📦 Dataset sintético de 1.000 casas
🎛️ Se agrega ruido aleatorio para simular datos reales
🔢 Variables predictoras
1️⃣ Tamaño de la vivienda
2️⃣ Cantidad de habitaciones
3️⃣ Edad de la casa
4️⃣ Score de ubicación
━━━━━━━━━━━━━━━━━━━━━━━
📈 RESULTADOS DEL MODELO
⭐ Valor de R² cercano a 1
✅ Indica un ajuste muy bueno del modelo
━━━━━━━━━━━━━━━━━━━━━━━
🔎 INTERPRETACIÓN DE COEFICIENTES
📐 Tamaño
➡️ ≈ 1.95 pesos por metro cuadrado
🚪 Habitaciones
➡️ ≈ 14.5 pesos por habitación
💡 Los coeficientes permiten entender el impacto real de cada variable.
El valor de la semilla que defines con np.random.seed(99) y el argumento random_state=42 en train_test_split deben ser coherentes si deseas replicar los mismos resultados en diferentes ejecuciones. Si usas np.random.seed(99), también debes establecer random_state=99 para que ambas funciones generen la misma secuencia de números aleatorios. De lo contrario, podrías obtener diferentes divisiones de tus datos, lo que afectaría la consistencia en el entrenamiento y evaluación del modelo. Asegúrate de que ambos valores sean iguales para evitar errores.
Hola Mikel,
Tu explicación tiene un detalle importante: no es necesario que la semilla de NumPy y el argumento random_state de train_test_split coincidan.
Te explico un poco más:
np.random.seed(99) asegura que los datos sintéticos (tamaño, habitaciones, edad, ubicación, ruido) sean siempre los mismos.train_test_split(..., random_state=42) asegura que la partición de entrenamiento y prueba sea siempre la misma, independientemente de la semilla global de NumPy.Por lo tanto, tus resultados ya son totalmente reproducibles aunque usemos 99 para NumPy y 42 en scikit-learn. No necesitas que los dos números sean iguales.
Acá te dejo un par de referencias si deseas profundizar:
np.random.seed)train_test_splitimport numpy as np
import pandas as pd
import matplotlib.pyplot as plt
import seaborn as sns
from sklearn.linear_model import LinearRegression
from sklearn.model_selection import train_test_split
from sklearn.metrics import mean_squared_error, r2_score, mean_absolute_error
Honestamente yo no sabía eso y la forma en como lo explicas es muy fácil de aprender. Y lo explicas super esto es increíble.
Para ser honesto yo no conocía esta información que estas presentado, y se ve muy interesante el tema.
Con este código podés ver la distribución de residuos
fig, axes = plt.subplots(1, 1, figsize=(15, 6)) axes.hist(residuos, bins=30, alpha=0.7) axes.set_title('Distribución de Residuos') plt.tight_layout() plt.show()
Excelente video!
Muchas gracias, muy buena la clase.
Me causa algo de ruido la correlación extremadamente alta 0.93 entre precios y tamaño_m2, pues la correlación puede indicar que las variables son redundantes, es decir que ambas miden aspectos de la misma causa raíz. Esto puede derivar en inestabilidad del modelo. Dando mayor influencia o peso a estas características lo que puede llevar a sobre ajustes.
Como solución se podría eliminar una de ellas casi que continen los mismos datos.
astrid, me alegra poder entender muchos conceptos y formulas que son de mucha ayuda, para el analisis
Buen ejemplo de regresion,
TIP: otra forma de añadir un notebook en Colab, es bajar el codigo del repositorio en github, haces click en descargar y se descarga un archivo Regresion_Lineal_analisis_predictivo_Precios_Casas.ipynb
y luego lo abres como nuevo notebook en Colab.
A mis 47 años, como Ingeniero de Sistemas en Bogotá, he visto pasar muchas olas tecnológicas. Pero ninguna como esta. La Inteligencia Artificial no es solo una tendencia; es la herramienta transversal que está redefiniendo cómo trabajamos, enseñamos y creamos software en Qualitty Software.
Bastante claro un poco complicado con las formulas
No sabía bien el código para la creación de las diferentes graficas, muy interesante