El análisis de regresión lineal se utiliza para predecir el valor de una variable basada en el valor de otra variable. La variable que desea predecir se llama variable dependiente. La variable que está utilizando para predecir el valor de la otra variable se llama variable independiente.
Esta forma de análisis estima los coeficientes de la ecuación lineal, que involucra una o más variables independientes que mejor predicen el valor de la variable dependiente. La regresión lineal se adapta a una línea recta o superficie que minimiza las discrepancias entre los valores de salida predichos y reales. Existen calculadoras de regresión lineal simples que utilizan un método de «mínimos cuadrados» para descubrir la mejor línea de ajuste para un conjunto de datos emparejados. Luego estimula el valor de x (variable dependiente) de y (variable independiente).
Puede realizar una regresión lineal en Microsoft Excel o utilizar paquetes de software estadístico, como las estadísticas de IBM SPSS® que simplifican en gran medida el proceso de uso de ecuaciones de regresión lineal, modelos de regresión lineal y fórmula de regresión lineal. Las estadísticas de SPSS se pueden aprovechar en técnicas como regresión lineal simple y regresión lineal múltiple.
Puede realizar el método de regresión lineal en una variedad de programas y entornos, que incluyen:
- R regresión lineal
- Regresión lineal de Matlab
- Regresión lineal de Sklearn
- Pitón de regresión lineal
- Regresión lineal de Excel
Los modelos de regresión lineal son relativamente simples y proporcionan una fórmula matemática fácil de interpretar que puede generar predicciones. La regresión lineal se puede aplicar a varias áreas en el estudio comercial y académico.
¿Qué es y para qué sirve el análisis de regresión?
El análisis de regresión es un método estadístico que muestra la relación entre dos o más variables. Generalmente expresado en un gráfico, el método prueba la relación entre una variable dependiente contra variables independientes. Típicamente, la variable (s) independiente (s) cambia con la variable dependiente (s) y el análisis de regresión intenta responder qué factores importan más a ese cambio.
Sabemos que necesitamos tomar decisiones basadas en datos, pero cuando hay literalmente millones o billones de puntos de datos, ¿dónde comienza? Afortunadamente, la inteligencia artificial (IA) y el aprendizaje automático (ML) pueden tomar enormes cantidades de datos y analizarlo en cuestión de horas para hacerlo más digestible. Entonces depende del analista examinar la relación más de cerca.
En el mundo real, un escenario en el que se usa el análisis de regresión podría verse algo así.
Un negocio minorista necesita predecir las cifras de ventas para el próximo mes (o la variable dependiente). Es difícil saberlo, ya que hay tantas variables que rodean ese número (las variables independientes): el clima, un nuevo lanzamiento del modelo, lo que hacen sus competidores o el trabajo de mantenimiento que se realiza al pavimento afuera.
Muchos pueden tener una opinión, como Bob de Cuentas o Rachel, que ha trabajado en el piso de ventas durante diez años. Pero el análisis de regresión se clasifica a través de todas las variables medibles y puede indicar lógicamente cuál tendrá un impacto. El análisis le dice qué factores influirán en las ventas y cómo las variables interactúan entre sí. Esto ayuda al negocio a tomar mejores decisiones basadas en datos.
¿Qué desarrollamos en un análisis de regresión?
En el modelado estadístico, el análisis de regresión es un conjunto de procesos estadísticos para estimar las relaciones entre una variable dependiente (a menudo llamada variable de ‘resultado’ o ‘respuesta’, o una ‘etiqueta’ en el lenguaje de aprendizaje automático) y una o más variables independientes ( a menudo llamado ‘predictores’, ‘covariables’, ‘variables explicativas’ o ‘características’). La forma más común de análisis de regresión es la regresión lineal, en la que se encuentra la línea (o una combinación lineal más compleja) que más se ajusta a los datos de acuerdo con un criterio matemático específico. Por ejemplo, el método de mínimos cuadrados ordinarios calcula la línea única (o hiperplano) que minimiza la suma de las diferencias cuadradas entre los datos verdaderos y esa línea (o hiperplano). Por razones matemáticas específicas (ver regresión lineal), esto permite al investigador estimar la expectativa condicional (o valor promedio de la población) de la variable dependiente cuando las variables independientes adquieren un conjunto dado de valores. Formas menos comunes de regresión Use procedimientos ligeramente diferentes para estimar los parámetros de ubicación alternativa (por ejemplo, regresión cuantil o análisis de condición necesario [1]) o estimar la expectativa condicional en una colección más amplia de modelos no lineales (por ejemplo, regresión no paramétrica).
El análisis de regresión se utiliza principalmente para dos propósitos conceptualmente distintos.
En segundo lugar, en algunas situaciones el análisis de regresión puede usarse para inferir relaciones causales entre las variables independientes y dependientes. Es importante destacar que las regresiones por sí mismas solo revelan relaciones entre una variable dependiente y una colección de variables independientes en un conjunto de datos fijo. Usar regresiones para la predicción o inferir relaciones causales, respectivamente, un investigador debe justificar cuidadosamente por qué las relaciones existentes tienen poder predictivo para un nuevo contexto o por qué una relación entre dos variables tiene una interpretación causal. Este último es especialmente importante cuando los investigadores esperan estimar las relaciones causales utilizando datos de observación. [2] [3]
¿Cómo se calcula el análisis de regresión lineal?
El análisis de regresión genera una ecuación para describir la relación estadística entre una o más variables predictivas y la variable de respuesta. Después de usar el software estadístico Minitab para ajustar un modelo de regresión y verificar el ajuste verificando los valores residuales, querrá interpretar los resultados. En este artículo, le mostraré cómo interpretar los valores de P y los coeficientes que aparecen en la salida para el análisis de regresión lineal.
El valor de P para cada término prueba la hipótesis nula de que el coeficiente es igual a cero (sin efecto). Un valor bajo P (<0.05) indica que puede rechazar la hipótesis nula. En otras palabras, es probable que un predictor que tenga un valor bajo P sea una adición significativa a su modelo porque los cambios en el valor del predictor están vinculados a los cambios en la variable de respuesta.
Por el contrario, un valor P más alto (no significativo) sugiere que los cambios en el predictor no están asociados con los cambios en la respuesta.
En la salida a continuación, podemos ver que las variables predictivas del Sur y el Norte son significativas porque sus dos valores P son 0,000. Sin embargo, el valor de P para el este (0.092) es mayor que el nivel alfa común de 0.05, lo que indica que no es estadísticamente significativo.
Como regla, utiliza valores P para determinar los términos que se conservarán en el modelo de regresión. En el modelo anterior, debemos considerar eliminar el este.
¿Que se calcula en el análisis de regresión?
A partir del procesamiento de los datos en la base de datos del estudio MPO & Partners, la Asociación de Estudios de Centro MPO ha desarrollado una nueva metodología para calcular el múltiplo, destinado a perfeccionar el procedimiento de evaluación de un estudio profesional.
Este método de cálculo innovador se basa en la técnica estadística de regresión. El análisis de la regresión es una técnica utilizada para analizar una serie de datos que consisten en una variable variable y una o más variables independientes. El objetivo es descubrir cualquier relación funcional existente entre la variable dependiente y las variables independientes.
El análisis trajo una contribución significativa en un sector caracterizado por transacciones «privadas» y, por lo tanto, no capturada por ninguna base de datos disponible en la actualidad. Además, el uso de una metodología objetiva, como los análisis de regresión, ha demostrado ser una herramienta extraordinariamente efectiva para gestionar los procesos agregativos de los estudios profesionales en progreso en nuestro país. El último fenómeno en un fuerte crecimiento en la última década y se conectó con el refinamiento de especializaciones.
También en la evaluación del estudio profesional, así como para las empresas, el enfoque solicitado al evaluador experto debe basarse en sólidos racionales, tener que evitar, cuando sea posible, enfoques subjetivos. Tanto para identificar, cada vez más puntualmente, el valor correcto del objetivo y proteger al evaluador con respecto a los riesgos profesionales. El análisis de regresión, como veremos a continuación, le permite satisfacer ambas necesidades.
¿Dónde se aplica la regresión lineal?
Más formalmente, en estadísticas, la regresión lineal representa un método de estima para el valor condicional esperado de una variable dependiente, o endógena, y { dongestyle y}, dados los valores de otras variables independientes, o exógeno, x1, .. ., xk { displaystyle x_ {1}, ldots, x_ {k}}: e [y | x1,…, xk] { dongestyle mathbb {e} [y | x_ {1}, ldots , x_ {k}]}}}} El uso de términos endógenos/exógenos a veces se critica, ya que implicaría una noción de causalidad que la existencia de una regresión no proporciona; En ciertos contextos, también causaría confusión, siendo, por ejemplo, el concepto de exogenidad en la economía definido formalmente a través de la hipótesis de la ortogonalidad subyacente a las propiedades estadísticas de la regresión lineal con el método de cuadrados mínimos.
La primera forma de regresión lineal, y aún popular, se basa en el método de cuadrados mínimos (ver más allá). La primera publicación que contiene una aplicación del método conocido está fechada en 1805, en nombre de Adrien-Marie Legendre; Carl Friedrich Gauss elabora independientemente el mismo método, publicando su investigación en 1809. Aunque Gauss afirmó haber desarrollado el método desde 1795, la autoría de sus aplicaciones estadísticas normalmente se atribuye a Legendre; El mismo término cuadrado mínimo deriva de la expresión francesa, utilizada por Legendre, Moindres Carrés.
El origen del término regresión está históricamente documentado. La expresión de reversión se usó en el siglo XIX para describir un fenómeno biológico, según el cual la descendencia de individuos excepcionales tiende a presentar características menos notables que las de los padres, y más similar a las de los antepasados más remotos. Francis Galton estudió este fenómeno, aplicando el término, quizás inadecuado, de regresión hacia el promedio (o mediocridad).
Para Galton, la regresión de la expresión solo tiene este significado, limitado a la esfera biológica. Su trabajo (1877, 1885) luego fue extendido por Karl Pearson y George Udny Yule a un contexto estadístico más general (1897, 1903); Las obras de Pearson y Yule plantean la hipótesis de que la distribución conjunta de las variables dependientes e independientes tiene una naturaleza gaussiana. Esta hipótesis es debilitada posteriormente por Ronald Fisher, en las obras de 1922 y 1925. Fisher en particular plantea la hipótesis de que la distribución de la variable dependiente es gaussiana, lo que no necesariamente implica eso para la articulación una de variables dependientes e independientes. Desde este punto de vista, la formulación de Fisher está más cerca de la de Gauss que 1821.
¿Dónde se puede aplicar regresión lineal?
Intenta descubrir la mejor relación lineal posible entre las características de entrada y la variable objetivo (y).
¡Eso es todo! Esto es lo que hace la regresión lineal. Bastante simple, ¿verdad?
En la jerga de aprendizaje automático, lo anterior se puede afirmar como «Es un algoritmo de aprendizaje automático supervisado que mejor se adapta a los datos que tiene la variable objetivo (variable dependiente) como una combinación lineal de las características de entrada (variables independientes). «
- La variable objetivo también se conoce como una variable o etiqueta independiente.
- Las características de entrada también se conocen como variables dependientes.
Por ahora, cuando piensa en la regresión lineal, piense en ajustar una línea de modo que la distancia entre los puntos de datos y la línea sea mínimo. Como se muestra arriba, la línea roja se ajusta mejor a esos datos que las otras líneas azules.
La relación lineal entre las características de entrada y la salida en 2D es simplemente una línea.
¡Sí! La regresión lineal intenta descubrir la mejor relación lineal entre la entrada y la salida.
y = θx + b # ecuación lineal
El objetivo de la regresión lineal es encontrar los mejores valores para θ yb que representan los datos dados.
Aprenderemos más sobre esto de manera detallada más adelante en este artículo.
¡OK! Es hora de profundizar en la regresión lineal.
Por ahora, pensemos que ya hemos obtenido la relación lineal adecuada entre las características de entrada y las etiquetas (explicadas más adelante). Ahora nos centramos en cómo un modelo de regresión lineal predeciría los valores de una instancia con la relación obtenida.
¿Dónde se utiliza el analisis de regresion?
El análisis de regresión, en sus diversas formas, es una de las técnicas estadísticas más utilizadas para explicar la relación existente entre una variable variable variable (o salida) de una variable y una o más variables independientes (también llamadas covies o regresores, predictores o variables aporte).
Las técnicas de regresión, sobre la base del conocimiento de un fenómeno estudiado en una muestra reducida de la población, pueden permitir construir una función matemática capaz de expresar la mejor descripción del fenómeno en sí, aplicable a toda la población.
En esencia, entre la solución múltiple al problema específico que puede variar entre cada campo de aplicación de Knows… _omissis_… Ale, económico, fiscal, médico, ingeniería, etc.), la técnica de regresión basada en la teoría de cuadrados mínimos (OLS) identifica esa solución que está estadísticamente (en la muestra) mejor lo aproximado al minimizar los desechos entre los valores reales observados y los devueltos por la función de regresión.
Intentaremos lidiar con los principales tipos de regresiones a partir del simple lineal para pasar a múltiples lineal y otros más complejos, como logarítmico y semi -ologia.
Con respecto a los análisis estadísticos, preliminarmente es necesario especificar, como un poco conocido por todos por conocimiento generalizado, que las estadísticas operan en los «grandes números grandes» llamados SO es necesario… _omissis_… colectivo o masa, Influenciado por un cierto número de variables (inferencias), a veces muy altas como en las estimaciones inmobiliarias, para las cuales cada análisis estadístico, para que tenga una base, debe llevarse a cabo en una serie de observaciones de fenómenos en gran medida más alto que el de las inferencias de las inferencias ; Por lo tanto, debe quedar claro que el prejuicio de los modelos estadísticos mejora a medida que aumenta el número de datos observados.
Una muestra estadística muy pequeña es que consiste indicativamente en 30 ¸60 observaciones y para su estudio ya es necesario (considerando el número de elementos reducidos) adopta una distribución del estudiante.
Artículos Relacionados:
- Regresión lineal simple: Qué es, cómo se interpreta y cómo se utiliza en la vida real
- Ejemplo de análisis de regresión lineal múltiple
- Regresión: Qué es, cómo se calcula y ejemplos prácticos
- Aplicación de la Regresión Lineal para el Análisis de Datos
- Estimación de la línea de regresión: cómo determinar el mejor ajuste para su conjunto de datos
