La regresión lineal fue el primer tipo de análisis de regresión que se estudiará rigurosamente y se utilizará ampliamente en aplicaciones prácticas. [4] Esto se debe a que los modelos que dependen linealmente de sus parámetros desconocidos son más fáciles de ajustar que los modelos que no están relacionados con sus parámetros y porque las propiedades estadísticas de los estimadores resultantes son más fáciles de determinar.
La regresión lineal tiene muchos usos prácticos. La mayoría de las aplicaciones entran en una de las siguientes dos categorías amplias:
- Si el objetivo es la predicción, el pronóstico o la reducción de errores, [la aclaración necesaria] la regresión lineal se puede usar para adaptarse a un modelo predictivo a un conjunto de datos observado de valores de la respuesta y variables explicativas. Después de desarrollar dicho modelo, si se recopilan valores adicionales de las variables explicativas sin un valor de respuesta que lo acompañe, el modelo ajustado se puede utilizar para hacer una predicción de la respuesta.
- Si el objetivo es explicar la variación en la variable de respuesta que puede atribuirse a la variación en las variables explicativas, el análisis de regresión lineal se puede aplicar para cuantificar la resistencia de la relación entre la respuesta y las variables explicativas, y en particular para determinar si algunas Las variables explicativas pueden no tener una relación lineal con la respuesta, o para identificar qué subconjuntos de variables explicativas pueden contener información redundante sobre la respuesta.
Los modelos de regresión lineal a menudo se ajustan utilizando el enfoque de mínimos cuadrados, pero también se pueden ajustar de otras maneras, como minimizar la «falta de ajuste» en alguna otra norma (como con menos regresión de desviaciones absolutas), o minimizando un penalizado La versión del costo de los mínimos cuadrados funcionan como en la regresión de cresta (penalización de la norma L2) y lasso (penalización de la norma L1). Por el contrario, el enfoque de mínimos cuadrados se puede utilizar para adaptarse a modelos que no son modelos lineales. Por lo tanto, aunque los términos «mínimos cuadrados» y «modelo lineal» están estrechamente vinculados, no son sinónimos.
¿Cuál es el modelo de regresión lineal?
Un modelo de regresión lineal describe la relación entre una variable dependiente, y y una o más variables independientes, X. La variable dependiente también se llama variable de respuesta. Las variables independientes también se denominan variables explicativas o predictoras. Las variables predictoras continuas también se denominan covariables, y las variables predictoras categóricas también se denominan factores. La matriz X de las observaciones en las variables predictoras generalmente se llama matriz de diseño.
βK es el coeficiente KTH, donde β0 es el término constante en el modelo. A veces, las matrices de diseño pueden incluir información sobre el término constante. Sin embargo, FITLM o Stepwiselm de forma predeterminada incluye un término constante en el modelo, por lo que no debe ingresar una columna de 1 en su Matriz de diseño X.
Si un modelo incluye solo una variable predictor (p = 1), entonces el modelo se llama modelo de regresión lineal simple.
En general, un modelo de regresión lineal puede ser un modelo de la forma
donde f (.) es una función de valor escalar de las variables independientes, xijs. Las funciones, F (x), pueden estar en cualquier forma que incluya funciones no lineales o polinomios. La linealidad, en los modelos de regresión lineal, se refiere a la linealidad de los coeficientes βK. Es decir, la variable de respuesta, y, es una función lineal de los coeficientes, βK.
donde y^i es la respuesta estimada y BKS son los coeficientes ajustados. Los coeficientes se estiman para minimizar la diferencia media cuadrada entre el vector de predicción y^ y el verdadero vector de respuesta y, es decir, y^ −y. Este método se llama método de mínimos cuadrados. Según los supuestos sobre los términos de ruido, estos coeficientes también maximizan la probabilidad del vector de predicción.
¿Qué es un modelo de regresión lineal y no lineal?
La regresión no lineal es una forma de análisis de regresión en el que los datos se ajustan a un modelo y luego se expresan como una función matemática. La regresión lineal simple relaciona dos variables (x e y) con una línea recta (y = mx + b), mientras que la regresión no lineal relaciona las dos variables en una relación no lineal (curva).
El objetivo del modelo es hacer que la suma de los cuadrados sea lo más pequeña posible. La suma de los cuadrados es una medida que rastrea hasta qué punto las observaciones y varían de la función no lineal (curva) que se usa para predecir Y.
Se calcula primero encontrando la diferencia entre la función no lineal ajustada y cada punto de Y de datos en el conjunto. Luego, cada una de esas diferencias está cuadrada. Por último, se agregan todas las figuras al cuadrado. Cuanto más pequeña sea la suma de estas figuras cuadradas, mejor será la función se ajusta a los puntos de datos en el conjunto. La regresión no lineal utiliza funciones logarítmicas, funciones trigonométricas, funciones exponenciales, funciones de potencia, curvas de Lorenz, funciones gaussianas y otros métodos de ajuste.
- La regresión no lineal es una función curva de una variable X (o variables) que se utiliza para predecir una variable y
- La regresión no lineal puede mostrar una predicción del crecimiento de la población con el tiempo.
El modelado de regresión no lineal es similar al modelado de regresión lineal, ya que ambos buscan rastrear una respuesta particular de un conjunto de variables gráficamente. Los modelos no lineales son más complicados que los modelos lineales para desarrollarse porque la función se crea a través de una serie de aproximaciones (iteraciones) que pueden provenir de prueba y error. Los matemáticos utilizan varios métodos establecidos, como el método Gauss-Newton y el método Levenberg-Marquardt.
¿Qué significa el modelo de regresión lineal?
Nos referimos a regresión lineal un modelo para la expectativa condicional de una respuesta variable (y ) (o regresión) en función de (p ) variables explicativas (a veces llamadas regresores o covariables) utilizando una ecuación de formulario
[ Begin {align*}
Mathsf {e} (y mid mathbf {x}) = beta_0 + beta_1 mathrm {x} _ _ {1} + cdots + beta_p mathrm {x} _ {p}.
End {alinearse*} ]
El hecho de que el promedio sea condicional a los valores de ( mathbf {x} ) simplemente implica que los regresores se consideran constantes o conocidos de antemano.
En la práctica, cualquier modelo es una aproximación de la realidad, por lo que agregamos un término de error que se utiliza para tener en cuenta que ninguna relación lineal exacta se une ( mathbf {x} ) y (y ), o que las medidas de (y ) contienen errores. Este término error aleatorio ( varepsilon ) servirá como base para la inferencia porque cuantificará la adecuación entre nuestro modelo y los datos.
Podemos reescribir el modelo lineal en términos del error para una muestra aleatoria de tamaño (n ): disgusto por (y_i ) el valor de (y ) para el sujeto (i ) y ((( Mathrm {x} _ {ij} ) El valor de la variable explicativa de (j ) e del asunto (i ). El modelo de regresión lineal es
[ Begin {alinearse}
Y_i = beta_0 + beta_1 mathrm {x} _ {i1} + ldots + beta_p mathrm {x} _ {ip} + varepsilon_ {i}, qquad i = 1, ldots, n, , etiqueta {2.1}
End {alinearse} ]
donde ( varepsilon_i ) es el término de error aditivo. Si no se especifica hipótesis en la ley aleatoria del error, sin embargo, solucionamos la esperanza del término error en cero porque postulamos que no hay un error sistemático, es decir, dude que ( mathsf {e} ( varepsilon_i mid boldsymbol {x} _i) = 0 ) ((i = 1, ldots, n) ).
¿Cuáles son los tipos de regresión no lineal?
Todos los modelos que se ajustan arriba son «modelos estadísticos lineales» en el sentido de que (al menos después de transformar Y y/o X), los modelos pueden estimarse utilizando mínimos cuadrados lineales. Un modelo estadístico lineal es aquel en el que las derivadas parciales de la función con respecto a cada parámetro no contienen ninguno de los parámetros desconocidos. Un ejemplo de un modelo no lineal que no se puede linealizar transformando las variables es
Sin embargo, dicho modelo podría ser bastante razonable para estos datos, ya que implica que la cantidad de cloro en cada muestra es igual a 0.49 a las 8 semanas y luego se descompone a un nivel asintótico desconocido A a una velocidad desconocida B. Este es, de hecho, el modelo sugerido por Los investigadores de quienes Draper y Smith obtuvieron los datos de la muestra.
Encontrar estimaciones de A y B que minimicen la suma residual de los cuadrados para el modelo anterior requiere una búsqueda numérica. El procedimiento de regresión no lineal en Statgraphics permite a los usuarios ajustarse a dichos modelos ingresando en el siguiente cuadro de diálogo de entrada de datos:
Al evaluar una función, cualquier término que no corresponde a columnas en las hojas de datos activas se considera parámetros desconocidos. El usuario también debe ingresar valores iniciales para los parámetros desconocidos para determinar la ubicación en la que comienza la búsqueda numérica:
Según los modelos ajustados anteriormente, una buena estimación inicial para el valor asintótico A es 0.38. Se sabe menos sobre el parámetro de velocidad B. En tales casos, a menudo es suficiente establecer el valor inicial en 0.1 o -0.1. Sin embargo, es importante que el signo sea correcto, ya que los algoritmos de búsqueda a veces tienen problemas si necesitan cruzar 0.
Artículos Relacionados:
