Aprende a hacer regresión lineal múltiple en Excel con esta guía paso a paso

Una vez que haga clic en el análisis de datos, aparecerá una nueva ventana. Seleccione la regresión y haga clic en Aceptar.

Para el rango de entrada Y, complete la matriz de valores para la variable de respuesta. Para el rango de entrada x, complete la matriz de valores para las dos variables explicativas. Marque la casilla junto a las etiquetas para que Excel sepa que incluimos los nombres de variables en los rangos de entrada. Para el rango de salida, seleccione una celda donde desee que aparezca la salida de la regresión. Luego haga clic en Aceptar.

Aquí le mostramos cómo interpretar los números más relevantes en la salida:

R cuadrado: 0.734. Esto se conoce como el coeficiente de determinación. Es la proporción de la varianza en la variable de respuesta la que puede explicarse por las variables explicativas. En este ejemplo, el 73.4% de la variación en los puntajes del examen puede explicarse por el número de horas estudiadas y el número de exámenes de preparación tomados.

Error estándar: 5.366. Esta es la distancia promedio que los valores observados caen desde la línea de regresión. En este ejemplo, los valores observados caen un promedio de 5.366 unidades de la línea de regresión.

F: 23.46. Esta es la estadística F general para el modelo de regresión, calculado como regresión MS / MS residual.

Importancia F: 0.0000. Este es el valor p asociado con la estadística F general. Nos dice si el modelo de regresión en su conjunto es estadísticamente significativo. En otras palabras, nos dice si las dos variables explicativas combinadas tienen una asociación estadísticamente significativa con la variable de respuesta. En este caso, el valor p es inferior a 0.05, lo que indica que las variables explicativas de las horas estudiadas y los exámenes de preparación combinados tienen una asociación estadísticamente significativa con la puntuación del examen.

¿Cómo se hace una regresión múltiple en Excel?

En un artículo anterior, exploramos el análisis de regresión lineal y su aplicación en análisis financiero y modelado. Puede leer nuestro análisis de análisis de regresión en el artículo de modelado financiero para obtener más información sobre los conceptos estadísticos empleados en el método y donde encuentra la aplicación dentro de las finanzas.

Este artículo analizará práctico al modelar un modelo de regresión múltiple para el producto interno bruto (PIB) de un país.

Antes de comenzar, déjame agregar un descargo de responsabilidad corto. No soy un estadístico, y no afirmo que las variables dependientes e independientes seleccionadas sean las opciones de análisis correctas. El artículo tiene como objetivo mostrarle cómo ejecutar una regresión múltiple en Excel e interpretar el resultado, no enseñar sobre la configuración de nuestros supuestos modelo y elegir las variables más apropiadas.

Ahora que tenemos esto fuera del camino y las expectativas están configuradas, ¡abramos Excel y comencemos!

Obtendremos datos públicos de Eurostat, la base de datos de estadísticas para la Comisión Europea para este ejercicio. Todos los datos de origen relevantes están dentro del archivo modelo para su conveniencia, que puede descargar a continuación. También he mantenido los enlaces a las tablas de origen para explorar más si lo desea.

El conjunto de datos de la UE nos brinda información para todos los Estados miembros de la Unión. Como un gran fanático del Poirot Hercule de Agatha Christie, dirigamos nuestra atención a Bélgica.

Como puede ver en la tabla a continuación, tenemos diecinueve observaciones de nuestra variable objetivo (PIB), así como nuestras tres variables predictoras:

  • X1 – Educación Gasto en Mil.;

¿Cómo se hace una regresión en Excel?

Comencemos con el primer método para hacer la regresión lineal en Excel.

El primer método para retroceder en Excel utiliza el componente adicional llamado Herramientas de análisis.

Esta herramienta está incluida en Excel y es necesario activarla. Está disponible en todas las versiones de Excel (desde la versión 2003 hasta la versión 2019) pero, por defecto, no está habilitado. Por lo tanto, es necesario proceder con su activación. Veamos cómo.

Hacer en archivos y luego en opciones. En el cuadro de diálogo Opciones de Excel, seleccione el elemento de componentes adicionales.

Después de seleccionar componentes adicionales, seleccione herramientas de análisis y haga clic en Go.

En este punto, Excel mostrará el cuadro de diálogo de componentes adicionales. Aplique la marca en las herramientas de análisis y haga clic en Aceptar.

Ahora puede encontrar las herramientas de análisis en la hoja de datos dentro de la barra multifunción.

Pasemos a la práctica analizando el ejemplo mencionado al principio.

Realizamos una regresión lineal simple en Excel tomando en consideración las ventas en los últimos 24 meses y los gastos en publicidad durante el mismo período que una empresa en el sector de alimentos agrícolas.

En la columna B tenemos la compra de publicidad que es la variable independiente (x). En la columna C tenemos la cantidad vendida que representa la variable dependiente (y).

Obviamente, como se mencionó anteriormente, hay varios factores que pueden influir en el progreso de las ventas. Sin embargo, en este ejemplo, nos centraremos solo en una variable: el gasto publicitario.

¿Cómo interpretar los resultados de una regresión lineal multiple en Excel?

A menudo puede ejecutar análisis de regresión múltiple en Excel. Pero puede tener problemas para comprender los términos utilizados en el análisis de regresión. En este artículo, discutiré en detalle cómo interpretar los resultados de regresión múltiple en Excel con un ejemplo de la vida real.

Ahora, está listo para ejecutar el modelo de regresión para el conjunto de datos anterior en Excel.

  • Inicialmente, seleccione el comando de análisis de datos de la pestaña de datos.
  • Y elige la herramienta de regresión.
  • Más tarde, especifique el rango de entrada Y como $ E $ 4: $ E $ 15 y el rango de entrada x como $ C $ 4: $ D $ 15. Además, marque la casilla antes que las etiquetas y presione OK.

En la sección anterior, vio que la salida tiene tres porciones principales. Ahora, veamos cómo interpretar los resultados de regresión múltiple en Excel para cada porción.

Si observa de cerca la parte superior de la salida de regresión, obtendrá una tabla titulada Estadística de regresión que se muestra en la siguiente captura de pantalla.

  • Inicialmente, seleccione el comando de análisis de datos de la pestaña de datos.
  • Y elige la herramienta de regresión.
  • Más tarde, especifique el rango de entrada Y como $ E $ 4: $ E $ 15 y el rango de entrada x como $ C $ 4: $ D $ 15. Además, marque la casilla antes que las etiquetas y presione OK.
  • R múltiple (coeficiente de correlación): R múltiple R se refiere al grado de relación lineal entre las variables. La siguiente tabla puede ayudarlo a comprender mejor el término.
  • R cuadrado (coeficiente de determinación): R Square revela la bondad del ajuste. Eso significa cuántos puntos encajan con la línea de regresión. Cuanto mayor sea el valor de R Square, más bien ajustado la línea de regresión obtendrá. Aquí, el valor de R Square representa un excelente ajuste como 0.94. Significa que el 94% de la variación en la variable dependiente puede explicarse por la variable independiente. En el caso de las relaciones de regresión múltiple, debe mantener la atención sobre el cuadrado R ajustado.
  • Cuadrado R ajustado: el cuadrado R ajustado es fructífero cuando tiene dos o más variables independientes. Ya que proporciona la comparación entre las variables que uno es más importante que el otro. El valor será más alto que el cuadrado R si una nueva variable independiente mejora el modelo o viceversa. En este conjunto de datos, el valor del cuadrado R ajustado es 0.92. Eso significa que el 92% de los puntos se ajustan a la línea de regresión.
  • Además, en el medio de la salida, verá la tabla ANOVA (análisis de varianza).

    ¿Cómo se interpreta la regresion multiple?

    La regresión lineal múltiple (MLR) es una herramienta comúnmente utilizada por los científicos de datos. Las herramientas estadísticas inferenciales como MLR se utilizan para inferir patrones que no se pueden alcanzar solo con los datos de origen. En el caso de MLR, estamos tratando de predecir un resultado, o una variable dependiente, en relación con los cambios en los predictores, o variables independientes, para una población determinando una relación lineal entre la combinación de todas las variables independientes y la variable dependiente de una muestra de esa población. Eso es mucho que decir con palabras, así que veamos rápidamente algunas ecuaciones para garantizar nuestra comprensión. Primero, comenzaremos con una regresión lineal con una variable dependiente, donde una línea ajustada a los datos de la muestra tendría la ecuación

    Donde Y es nuestro resultado, X1 es nuestro predictor, B1 es nuestro primer coeficiente de tal manera que un cambio en el valor de X1 por 1 conduce a un cambio en Y por B1, y B0 es nuestra intersección del eje Y, o donde la línea cruza la línea El eje y cuando x1 es cero. En este caso, usaríamos este modelo para predecir un resultado novedoso y de un nuevo valor independiente X1. Podemos extender esto fácilmente de una regresión lineal singular a múltiple al agregar más coeficientes * términos variables independientes, como en

    donde todavía tenemos nuestra intercepción del eje, además de cinco variables independientes y sus respectivos coeficientes. Es técnicamente cierto que podemos interpretar fácilmente nuestros coeficientes B1 a B5 de la misma manera que para una regresión singular, sin embargo, esto requiere algunas suposiciones que no siempre son perfectamente ciertas para los datos en el mundo real. Los supuestos principales de una regresión lineal, múltiple y singular, son:

    • Linealidad: existe una relación lineal entre el resultado y las variables predictoras.
    • Normalidad: los residuos, o errores, calculados restando el valor predicho del valor real, siguen una distribución normal.
    • Homoscedasticidad: la variabilidad en la variable dependiente es igual para todos los valores de las variables independientes.

    Además de que a menudo todavía construimos modelos lineales para datos que no cumplen con estos estándares, con muchas variables independientes como en MLR, nos encontramos con otros problemas como la multicolinealidad, donde las variables que se supone que son independientes varían entre sí y el Presencia de variables categóricas, como una temperatura oceánica clasificada como fría, cálida o caliente en lugar de cuantificada en grados. Hay formas de lidiar con la multicolinealidad, como dejar caer uno de los dos predictores colineales del análisis, pero a veces para las características débilmente relacionadas, esto puede conducir a una pérdida de información que perjudica más sus predicciones de lo que ayuda. También puede agregar términos de interacción a su expresión lineal donde crea un nuevo predictor multiplicando las dos columnas originales, pero interpretar los coeficientes del término de interacción es complicado. Del mismo modo, los coeficientes categóricos de columna son complicados, porque se interpretan como un cambio lejos del valor de la categoría que dejó caer (¡tenga cuidado con la trampa variable ficticia!). Estos mejoran sus predicciones de MLR, pero al final, hacen que su modelo sea mucho más complicado, y no puede simplemente mirar los coeficientes como en las ecuaciones anteriores cuando se espera transmitir a los miembros de su equipo las conclusiones y patrones clave que su modelo ha aclarado . Entonces, ¿cuál es el truco? ¿Cómo podemos interpretar el efecto de una sola variable en el resultado cuando hay interacciones entre variables y variables categóricas? La respuesta es bastante simple:

    El mensaje de Yoda estaba más en la línea de creer en ti mismo y que puedes hacer cualquier cosa que creas que puedes, pero vamos a tomar la opción más perezosa: no lo hagas. En serio, ¡no lo intentes! Hay una mejor manera de observar el cambio en su variable de resultado con un cambio en una de las variables predictoras que tratar de interpretar coeficientes en modelos complicados, y ese es el truco.

    ¿Cómo se interpreta el coeficiente de una regresión lineal múltiple?

    Una vez que tenemos las estimaciones para la pendiente y la intercepción, debemos interpretarlas. Recuerde desde el comienzo de la lección lo que la pendiente de una línea significa algebraicamente. Si la pendiente se denota como (m ), entonces

    (m = dfrac { text {cambio en y}} { text {cambio en x}} )

    En otras palabras, la pendiente de una línea es el cambio en la variable y sobre el cambio en la variable x. Si el cambio en la variable X es uno, entonces la pendiente es:

    La pendiente se interpreta como el cambio de y para un aumento de una unidad en x. Esta es la misma idea para la interpretación de la pendiente de la línea de regresión.

    Interpretando la pendiente de la ecuación de regresión, ( hat { beta} _1 )

    ( hat { beta} _1 ) representa el aumento estimado en y por unidad de aumento en X. Tenga en cuenta que el aumento puede ser negativo, lo que se refleja cuando ( hat { beta} _1 ) es negativo.

    Nuevamente volviendo al álgebra, la intercepción es el valor de y cuando (x = 0 ). Tiene la misma interpretación en estadísticas.

    Interpretando la intersección de la ecuación de regresión, ( hat { beta} _0 )

    ( hat { beta} _0 ) es la intersección (y )-de la línea de regresión. Cuando (x = 0 ) está dentro del alcance de la observación, ( hat { beta} _0 ) es el valor estimado de y cuando (x = 0 ).

    Tenga en cuenta, sin embargo, cuando (x = 0 ) no está dentro del alcance de la observación, la intersección y generalmente no es de interés.

    Supongamos que encontramos la siguiente ecuación de regresión para el peso frente a la altura.

    ¿Qué es regresión lineal y multiple?

    Intentos de regresión lineal múltiple para modelar la relación entre
    dos o más variables explicativas y una variable de respuesta ajustando un lineal
    ecuación a datos observados. Cada valor de la variable independiente
    X está asociado con un valor de la variable dependiente y.
    La línea de regresión de la población para las variables explicativas de P x1,
    x2,…, XP se define como
    Y
    = 0 + 1×1 +
    2×2 +… +
    pxp. Esta línea describe cómo la respuesta media
    Y cambia con las variables explicativas. Los valores observados para
    Y varían sobre sus medios y y se supone
    tener la misma desviación estándar. los
    Valores ajustados B0, B1,…, BP
    estimar los parámetros 0, 1,
    …, P de la línea de regresión de la población.

    Dado que los valores observados para y varían sobre sus medios y,
    El modelo de regresión múltiple incluye un término para esta variación. En palabras, el modelo se expresa
    como datos = ajuste + residual, donde el término «ajuste» representa la expresión 0 +
    1×1 +
    2×2 +…
    pxp.
    El término «residual» representa las desviaciones de los valores observados y de sus
    significa y, que normalmente se distribuyen con media
    0 y varianza. La notación para las desviaciones del modelo es
    .

    En el modelo de mínimos cuadrados, la línea de mejor ajuste para los datos observados se calcula por
    minimizando la suma de los cuadrados del
    Desviaciones verticales de cada punto de datos a la línea (si un punto se encuentra en la línea ajustada exactamente,
    entonces su desviación vertical es 0). Porque las desviaciones se cuadran primero, luego se suman, allí
    No hay cancelaciones entre valores positivos y negativos. Las estimaciones de mínimos cuadrados
    B0, B1,… BP generalmente se calculan
    por software estadístico.

    ¿Qué es el análisis de regresión lineal?

    Una regresión se basa en la idea de que una variable dependiente está determinada por una o más variables independientes. Suponiendo que existe una relación causal entre las dos variables, el valor de la variable independiente afecta el valor de la variable dependiente. Por ejemplo, si desea saber cómo sus inversiones publicitarias influyen en sus ventas, se utilizaría un análisis de regresión para examinar la relación entre inversiones y ventas. Si esta relación está claramente representada, puede servir como un pronóstico. Los análisis de regresión tienen dos objetivos centrales. Se suponen:

    • Cuantifique las relaciones y descríbela utilizando los valores medidos y su representación gráfica.
    • Proporcionar pronósticos y predicciones.
    • Regresión simple: solo se usa una variable explicativa para explicar la variable dependiente.
    • Regresión múltiple: varias variables explicativas están vinculadas a una variable dependiente.
    • Regresión lineal: existe una relación lineal entre varias variables explicativas y varias variables dependientes. El concepto también incluye parámetros lineales y una estructura.
    • Regresión no lineal: si no hay una relación lineal entre variables dependientes e independientes, obtienes una regresión no lineal. Estos modelos pueden ser muy complejos, porque las relaciones entre las variables no se pueden organizar y rastrear utilizando métodos matemáticos simples.
    • Preparación de datos: para estudiar los desarrollos y tendencias de las variables, la situación de los datos debe ser lo más completa y exacta posible. Los cálculos aproximados y las verificaciones de plausibilidad se llevan a cabo para verificar los datos. Si faltan grabaciones, se pueden usar técnicas de datos faltantes, lo que también se llama imputación en el campo de las estadísticas. Si los datos y sus relaciones deben mostrarse gráficamente, esto se puede tener en cuenta durante la preparación. Algunos modelos de regresión requieren formatos de datos muy especiales, en los que primero deben convertirse. Este es el caso, por ejemplo, de una regresión lineal, en la que se supone una relación lineal entre dos variables.
    • Adaptación del modelo: cada modelo de regresión funciona con correcciones de errores estadísticos para poder actuar con posibles desviaciones. Las funciones que reducen las desviaciones a veces están determinadas por el modelo. Por lo tanto, una función lineal se usa en una regresión lineal para poder tratar las desviaciones. Los valores de error y las aproximaciones se calculan e integran en el modelo de regresión.
    • Validación del modelo utilizado: luego examinamos si el modelo de regresión describe la relación entre variables independientes y dependientes y la calidad de esta descripción. Los estadísticos tienen diferentes procedimientos y enfoques para verificar la validez del análisis de regresión utilizado. Por ejemplo, se analizan los nodos de datos particularmente influyentes, lo que afecta el contexto de las variables. Finalmente, se establece una función, que describe esta relación.
    • Valores de pronóstico: si el modelo describe adecuadamente la relación, se puede utilizar para fines de predicción. Nuevamente, la precisión juega un papel más que central. Cualquier inexactitud en los pronósticos se calcula o estime. Cualquier declaración que vaya más allá de los datos reales se denomina extrapolación.

    Los pronósticos en los conjuntos de datos se denominan interpolación. Este último es menos problemático que la extrapolación, incluso si las hipótesis emitidas deben verificarse cuidadosamente.

    El elemento decisivo para que funcione un análisis de regresión es la medida en que el modelo describe datos reales y posibles relaciones. La elección del modelo y las variables explicativas es, por lo tanto, decisiva. Solo se deben estudiar correlaciones significativas. En consecuencia, cada análisis de regresión incluye diferentes enfoques para aumentar la precisión, minimizar los errores y excluir valores estadísticos anormales que no son relevantes para el objeto estudiado. Por estas razones, estos modelos a menudo se comparan con figuras clave como el coeficiente de determinación o, en general, el criterio de información.

    Los análisis de regresión se utilizan en el marketing digital para comprender el viaje del cliente utilizando datos de análisis web o para usar marketing multicanal basado en datos confiables. En la práctica, estos análisis son complejos y requieren conocimientos y experiencia profesional. Sin embargo, los resultados pueden, dependiendo del modelo, ser muy claros y tangibles. Por ejemplo, si utilizamos un modelo de asignación para verificar la eficiencia en varios canales (como ventas directas, pancartas, socios afiliados, redes sociales, correos electrónicos o recomendaciones), los análisis de regresión pueden indicar claramente cuáles de estos canales tienen un buen equilibrio entre las inversiones y ventas. En términos de empresas, los resultados pueden volverse extremadamente útiles y ayudar a aumentar considerablemente el rey con los activos digitales individuales.

    Artículos Relacionados:

    Más posts relacionados:

    Deja una respuesta

    Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *