(i) Determinar la fiabilidad de un promedio.
(ii) servir como base para el control de la variabilidad.
(iii) comparar dos o más series con respecto a su variabilidad.
(iv) Para facilitar el uso de otras medidas estadísticas.
A continuación se da una breve explicación de estos puntos:
(i) Las medidas de variación señalan cuán lejos es un promedio representativo de la masa. Cuando la dispersión es pequeña, el promedio es un valor típico en el sentido que representa de cerca el valor individual y es confiable en el sentido de que es una buena estimación del promedio en el universo correspondiente. Por otro lado, cuando la dispersión es grande, el promedio no es tan típico y, a menos que la muestra sea muy grande, el promedio puede ser bastante poco confiable.
(ii) Otro propósito de medir la dispersión es determinar la naturaleza y la causa de la variación para controlar la variación en sí. En cuestión de salud, las variaciones en la temperatura corporal, el latido de pulso y la presión arterial son las guías básicas para las guías para el diagnóstico. El tratamiento prescrito está diseñado para controlar su variación. En la producción industrial, la operación eficiente requiere el control de la variación de calidad, cuya causa se buscan a través de programas de inspección y control de calidad. Por lo tanto, la medición de la dispersión es básica para el control de la causa de la variación. En problemas de ingeniería, las medidas de dispersión a menudo son especialmente importantes. En ciencias sociales, un problema especial que requiere la medición de la variabilidad es la medición de la «desigualdad» de la distribución de ingresos o riqueza, etc.
¿Por qué son importantes las medidas de tendencia central y dispersión?
Son indicadores que describen y resaltan algunas características de la distribución de la población.
Los índices de posición principales son:
– Promedio
– Mediana
– Moda
Promedio
– Los medios aritméticos son la medida de posición más simple y conocida de una distribución estadística. Recuerde que se define por la suma de los valores de todas las observaciones dividió el número de observaciones
Supongamos que tenemos la siguiente distribución de datos: 1; 2; 10; 20; 100; 150; 153; 160; 180; 1000; 2000;
El promedio aritmético es 343.27
– Medios aritméticos ponderados cuando nos enfrentamos con una distribución de elementos… _omissis_… ggruppate en las clases.
El objetivo perseguido en el cálculo de un promedio es reemplazar múltiples datos recopilados solo un número que, sin embargo, proporciona una representación efectiva del fenómeno diseñado para expresar el orden de magnitud o tendencia central del conjunto de datos relacionados con un fenómeno.
A veces, esta cifra puede no ser significativa si, como en el ejemplo desarrollado para el promedio simple, los datos son muy diferentes entre sí.
Existen otros tipos de medios (medios armónicos geométricos) que no se volvieron a elenciar para nuestro estudio.
La mediana
Por mediana significa el valor que ocupa la ubicación central en una serie de datos ordenadas.
Al igual que el promedio, la mediana también se puede calcular… _omissis_… Es cuantitativa o cualitativa ordenada.
Para el cálculo de la mediana, los datos deben ordenarse y detectar lo que está a la mitad de la distribución, de modo que el 50% de los valores de la serie es igual o menor que el 50% restante es más alto, seis Los datos están en disparos numéricos; De lo contrario, está dado por el promedio aritmético de los dos datos centrales.
Supongamos que tenemos la siguiente distribución de datos (lo mismo para la cual se calculó el promedio aritmético:
1; 2; 10; 20; 100; 150; 153; 160; 180; 1000; 2000;
¿Cuál es la importancia que tienen las medidas de tendencia central?
Las medidas de tendencia central se utilizan para resumir los conjuntos de datos que serán objeto de un estudio estadístico, se denominan medidas de tendencia central porque generalmente la mayor acumulación de datos se encuentra en los valores intermedios.
Las medidas de tendencia central son las herramientas más útiles en el campo de las estadísticas, ya que las representaciones cuantitativas de los datos que se han obtenido de una población nos proporcionan, es decir, es una herramienta utilizada para el cálculo y el análisis de la variabilidad. Obtener procesos
Las medidas de dispersión proporcionan información sobre la variación de la variable. Intentan resumir la dispersión que tiene un conjunto de datos en un solo valor. Las medidas de dispersión más utilizadas son: intervalo de variación, varianza, desviación estándar, coeficiente de variación.
Las medidas de tendencia central más utilizadas son: medios, medios y moda.
Las medidas estadísticas tienen como objetivo «resumir la información de» campeón «para tener una mejor comprensión de la población.
De la misma manera, podemos decir que la varianza es importante porque nos dice cosas sobre el conjunto de datos que probablemente no percibimos con el mero hecho de conocer el promedio aritmético, además de ser importantes en las estadísticas porque actúa como base Para otros tipos de cálculos estadísticos
Las medidas de tendencia central son medidas estadísticas que tienen como objetivo sintetizar un conjunto de valores en un solo valor. Representan un centro alrededor del cual se encuentra el conjunto de datos. Las medidas de tendencia central más utilizadas son: medios, medios y moda.
¿Cómo se interpretan las medidas de tendencia central y de dispersión?
Si bien las pantallas gráficas de nuestros datos son descriptores útiles de cómo se distribuye una variable, los resúmenes numéricos de nuestros datos son mucho más concisos y descriptivos. Pero, ¿qué serían buenos descriptores? Una regla simple tiende a funcionar bien en la mayoría de las situaciones. En particular, piense en esto: le digo que la típica persona sin hogar ha estado en las calles durante 14 meses. Sé esto porque tengo acceso a todas las personas sin hogar y he documentado cuánto tiempo han estado en las calles. Luego le doy una muestra aleatoria de personas sin hogar, te venda los ojos y te pido que elijas a una persona sin hogar de tu muestra. Cuando lo haces, te pido que adivines cuánto tiempo ha estado en las calles. ¿Cuál sería tu mejor suposición? Bueno, idealmente debería ser 14 meses porque esa es la duración promedio en la población. Por supuesto, podría decir 14 meses y eso podría ser exactamente cuánto tiempo ha estado esta persona en la calle. No te digo si tu suposición era correcta o no. En cambio, le pido que me diga cuántos meses ( pm ) de los 14 meses que son cierto de la población que podría ser si su suposición estuviera equivocada. No podrías responder esto sin una suposición ciega a menos que supieras cuánto varía la duración de la falta de vivienda en la población. Aquí es donde saber algo sobre lo que es más probable, lo más típico, el promedio y cuánta variación hay alrededor de esta característica típica, promedio y muy probable, es esencial para las estadísticas. En este capítulo nos centraremos en dominar dos conceptos: cómo calcular el «promedio» y cómo calcular la «variabilidad» en torno a este promedio. El primero es la tendencia central y la segunda es la dispersión.
La tendencia central es una medida estadística que define el centro de una distribución y es la más típica, la más representativa, de los puntajes que comprenden la distribución de la variable de interés. Hay tres medidas de tendencia central: la media, la mediana y el modo. Cada uno de estos tiene fortalezas y debilidades y es ideal para una situación específica con respecto a una variable dada. Veamos cuáles son estas medidas y cuándo son más útiles. Sin embargo, antes de hacerlo, un breve tutorial sobre algunos símbolos y operadores matemáticos que comenzará a ver. El principal de ellos es el operador de suma ( sum ).
Este símbolo griego nos llama a agregar todo lo que sigue. Por ejemplo, si lo hiciera ( sum (x_i) ) donde (i = 1, 2, 3, 4 ), entonces se nos pide que sumamos cada valor de (x ). El subíndice (i ) distingue entre (x_i = 1, x_i = 2, x_i = 3, text {y} x_i = 4 ) para que sepamos qué valor X estamos usando en el cálculo. En una nuez, entonces, ( sum (x_i) = sum (x_1 + x_2 + x_3 + x_4) = sum (1 + 2 + 3 + 4) = 10 ). También verá lo mismo expresado alternativamente así:
que básicamente significa lo mismo que el anterior: agregue cada observación (i ) de las observaciones totales (n ) de (x ). En otras palabras,
Comenzaremos a ver el signo de suma con una frecuencia creciente a medida que avanzamos en el curso. Tal vez se pregunte: ¿Necesito saber cómo hacer esto? La respuesta corta es no, no lo haces, porque no es completamente necesario obtener una comprensión básica de los conceptos con los que debemos luchar. Sin embargo, si tiene curiosidad, orientada a las matemáticas o simplemente desea una comprensión más profunda porque cree que es posible que desee tomar algunos cursos de estadísticas más, entonces sí, trate de comprender cómo funcionan las fórmulas. Si rompes esta nuez, te sorprenderás de todo el mundo que se abre antes que tú.
¿Cuál es la importancia de estas medidas para la estadística?
Las estadísticas no requieren aleatoriedad. Los tres elementos esenciales de las estadísticas son la medición, la comparación y la variación. La aleatoriedad es una forma de suministrar variación, y es una forma de modelar la variación, pero no es necesario. Tampoco es necesario tener aleatoriedad «verdadera» (de la variedad de lanzamiento de dados o muestreo de urna) para tener un modelo de probabilidad útil.
Para mi dinero, el tema #1 descuidado en las estadísticas es la medición.
En la mayoría de los textos de estadísticas que he visto, hay mucho en el análisis de datos y algunas cosas sobre la recopilación de datos (muestreo, asignación aleatoria, etc.), pero nada en absoluto en la medición. Nada sobre la confiabilidad y la validez, pero, incluso más que eso, nada en el concepto de medición, la idea de considerar la conexión entre los datos que recopila y el objeto subyacente de su estudio.
Es curioso: el modelo de datos (la «probabilidad») es fundamental para gran parte de la teoría y la práctica de las estadísticas, pero los pasos que se requieren para hacer que este funcione, los pasos de medición y evaluación de mediciones, están ocultos.
Cuando se trata de la cuestión de cómo tomar una muestra o cómo aleatorizar, o los problemas que surgen (no respuesta, derrames, selección, etc.) que interfieren con el modelo, los libros de texto de estadística toman en serio los problemas prácticos, incluso una introducción. El libro discutirá temas como el cegamiento en experimentos y autoselección en encuestas. Pero cuando se trata de medición, hay silencio, solo una suposición implícita de que la medición es lo que es, que es válido y que es tan confiable como es necesario.
¿Cuáles son las medidas estadísticas con mayor importancia?
¿Cuál es el número total de páginas vistas en su sitio web? ¿Este número está en aumento? ¿Conoce las fluctuaciones estacionales? ¿Qué ubicaciones geográficas provienen de su tráfico? Dentro de estos datos, recuerde distinguir entre vistas, usuarios y sesiones, porque estas diferentes estadísticas pueden recibir información valiosa.
¿Cuáles son las fuentes de su tráfico? ¿Investigación natural en Google? ¿Los enlaces entrantes de otros sitios? ¿Tráfico pagado desde anuncios web? Las redes sociales ?
¿Cuánto tiempo pasan los usuarios de Internet en su sitio? Cuanto más tiempo le dedicen, más interesante será su contenido para ellos, más probabilidades tendrá de convertirlos en clientes.
¿Qué porcentaje de visitantes abandonan su sitio después de haber consultado solo una página? Si 100 personas visitan su página de inicio y 90 lo dejan sin hacer clic en otra página, significa que su página de inicio tiene una tasa de rebote del 90 %. Por lo tanto, si la página de presentación de su producto presenta una tasa de rebote del 50 %, puede ser interesante probar los anuncios que dirigen el tráfico directamente en esta página en lugar de en su página de inicio. También puede intentar modificar el diseño de la página de inicio. Pero tenga cuidado, asegúrese de no confundir la tasa de rebote y la tasa de salida.
¿Qué artículos de blog y páginas generan más tráfico en su sitio? Enfatice los tipos de artículos que generan la mayor cantidad de tráfico.
¿Qué importancia tienen las medidas de dispersión en la estadística?
En una publicación anterior, utilizamos datos binarios para demostrar un error de muestreo y calcular los intervalos de confianza (IC) del 95%. Ahora, suponga que los datos pueden tomar muchos valores; Por ejemplo, la temperatura corporal normal tiene muchos valores y varía continuamente en un rango fisiológico. ¿Cómo podemos medir esta variabilidad en la temperatura corporal?
Para los datos continuos, la variabilidad se puede cuantificar como la desviación estándar (DE), que tiene las mismas unidades que los datos. La Figura 1 muestra temperaturas corporales de 100 personas, y la media y la DE de los valores de temperatura. La media es de 36.82 grados C, y el SD es de 0.41 grados C. La mayoría de los trabajos de investigación tienden a mostrar solo datos de resumen de media (DE), pero los datos de sujetos individuales en la Figura 1 muestran claramente cómo es la temperatura corporal variable. En esta muestra, algunas personas parecen acercarse a la hipotermia, y un compañero tiene una mala fiebre. Es importante mostrar los datos de los sujetos individuales para que los datos cuenten la historia.
Figura 1: Valores de datos de temperatura corporal de personas individuales (izquierda) y la media y SD (derecha).
Aproximadamente dos tercios de las observaciones en una población estarán dentro del rango desde la media-1 DE hasta la media + 1 SD. En la Figura 1, vemos que aproximadamente dos tercios de los valores de temperatura (izquierda) se encuentran dentro del tramo completo de las barras de error (derecha). El SD cuantifica la variabilidad en la temperatura corporal; El SD aumenta a medida que los valores de temperatura se vuelven más variables sobre la temperatura promedio (es decir, la propagación de temperaturas sobre la temperatura media aumenta), y viceversa. ¿Cómo se calcula el SD? Para hacerlo, necesitamos saber hasta dónde se encuentra cada punto de datos de la media, sumar estas desviaciones y promediarlas.
Simplemente agregar las desviaciones no funcionará porque las desviaciones positivas cancelarán las desviaciones negativas, lo que hace que la desviación promedio sea cero. Para solucionar este problema, la desviación estándar se calcula de esta manera:
- Calcule la media (es decir, el valor promedio).
¿Que nos indican las medidas de dispersión y variabilidad?
Las medidas de tendencia central no son adecuadas para describir los datos. Dos conjuntos de datos pueden tener la misma media, pero pueden ser completamente diferentes. Por lo tanto, para describir los datos, uno necesita conocer el alcance de la variabilidad. Esto se da por las medidas de dispersión. El rango, el rango intercuartil y la desviación estándar son las tres medidas de dispersión comúnmente utilizadas.
El rango es la diferencia entre la observación más grande y más pequeña de los datos. La principal ventaja de esta medida de dispersión es que es fácil de calcular. Por otro lado, tiene muchas desventajas. Es muy sensible a los valores atípicos y no utiliza todas las observaciones en un conjunto de datos. [1] Es más informativo proporcionar los valores mínimos y máximos en lugar de proporcionar el rango.
El rango intercuartil se define como la diferencia entre el percentil 25 y 75 (también llamado primer y tercer cuartil). Por lo tanto, el rango intercuartil describe el 50% medio de las observaciones. Si el rango intercuartil es grande, significa que el 50% de las observaciones medias está separada. La importante ventaja del rango intercuartil es que se puede usar como una medida de variabilidad si los valores extremos no se registran exactamente (como en el caso de los intervalos de clase abiertos en la distribución de frecuencia). [2] Otra característica ventajosa es que no se ve afectada por valores extremos. La principal desventaja en el uso del rango intercuartil como medida de dispersión es que no es susceptible de manipulación matemática.
¿Que nos indican las medidas de dispersión?
Corresponde al alcance de la serie estadística después de la eliminación del 25 % de los valores más bajos y el 25 % de los valores más fuertes. Esta medida es más robusta que la extensión, que es sensible a los valores extremos.
El promedio de estas diferencias puede parecer un buen indicador, pero las propiedades del promedio lo hacen cero. De hecho, algunas de estas diferencias son negativas y otras son positivas, la suma de las diferencias positivas compitiendo exactamente la suma de las diferencias negativas. Para abstrae del signo, se calcula el promedio del valor absoluto de las diferencias, la diferencia promedio.
La función de valores absolutos no es derivable, no es compatible con ciertos análisis. Para que las diferencias positen, luego usamos el cuadrado. El promedio de los cuadrados de las diferencias así calculadas es la varianza, que se expresa de la siguiente manera:
- V = 1n∑i = 1nei2 = 1n∑i = 1n (xi – x¯) 2 { displayStyle v = { frac {1} {n}} sum _ {i = 1}^{n} e_ {i }^{2} = { frac {1} {n}} sum _ {i = 1}^{n} (x_ {i}-{ bar {x}})^{2}} de una serie discreta no ordenada;
- V = ∑i = 1nni (xi -x (∑i = 1nni = ∑i = 1nfi (xi –x¯) 2 { displaystyle v = { frac { sum _ {i = 1}^{n} n_ {i} (x_ {i}-{ bar {x}})^{2}} { sum _ {i = 1}^{n} n_ {i}}} = sum _ {i = 1} ^{n} f_ {i} (x_ {i}-{ bar {x}})^{2}} en el caso de una serie discreta agrupada;
- V = ∑i = 1nni (mi – x¯) 2∑i = 1nni = ∑i = 1nfi (mi – x) 2 { displaystyle v = { frac { sum _ {i = 1}^{n} n_ {i} (m_ {i}-{ bar {x}})^{2}} { sum _ {i = 1}^{n} n_ {i}}} = sum _ {i = 1} ^{n} f_ {i} (m_ {i}-{ bar {x}})^{2}} en el caso de una serie continua.
La desaparición de los valores absolutos permite cálculos más simples. Demostramos que la varianza se puede calcular más simplemente mediante las siguientes fórmulas:
- V = 1n∑i = 1nei2 = 1n∑i = 1n (xi – x¯) 2 { displayStyle v = { frac {1} {n}} sum _ {i = 1}^{n} e_ {i }^{2} = { frac {1} {n}} sum _ {i = 1}^{n} (x_ {i}-{ bar {x}})^{2}} de una serie discreta no ordenada;
- V = ∑i = 1nni (xi -x (∑i = 1nni = ∑i = 1nfi (xi –x¯) 2 { displaystyle v = { frac { sum _ {i = 1}^{n} n_ {i} (x_ {i}-{ bar {x}})^{2}} { sum _ {i = 1}^{n} n_ {i}}} = sum _ {i = 1} ^{n} f_ {i} (x_ {i}-{ bar {x}})^{2}} en el caso de una serie discreta agrupada;
- V = ∑i = 1nni (mi – x¯) 2∑i = 1nni = ∑i = 1nfi (mi – x) 2 { displaystyle v = { frac { sum _ {i = 1}^{n} n_ {i} (m_ {i}-{ bar {x}})^{2}} { sum _ {i = 1}^{n} n_ {i}}} = sum _ {i = 1} ^{n} f_ {i} (m_ {i}-{ bar {x}})^{2}} en el caso de una serie continua.
¿Que son y para qué sirven las medidas de variabilidad?
Los estadísticos utilizan medidas resumidas para describir el grado de variabilidad o dispersión de un conjunto de datos. Las medidas de variabilidad más comunes son la extensión, la diferencia intercuartil (IQR), la varianza y la desviación estándar.
El rango es la distinción entre las cualidades más grandes y más pequeñas en muchas cualidades.
Piense, por ejemplo, de las cifras que acompañan el rango: 1, 3, 4, 5, 5, 6, 7, 11. Para esta disposición de números, el rango sería 11 – 1 o 10.
El GO intercuartil (IQR) es una proporción de variabilidad, a la luz de la separación de un índice de información en cuartiles.
Los cuartiles separan el índice de información de una solicitud de una publicación en cuatro partes equivalentes. Las cualidades que separan cada parte se conocen como el cuartil principal, segundo y tercero; Y se indican por Q1, Q2 y Q3, individualmente.
Q1 es el valor «promedio» en la primera mitad de la serie de datos ordenados.
Q3 es el valor «promedio» en la segunda mitad de todos los datos clasificados.
El intervalo intercuartil es equivalente a Q3 menos Q1. Piense, por ejemplo, de las cifras que acompañan este valor: 1, 2, 3, 4, 5, 6, 7, 8
Q2 es el medio de todo el índice de información: el valor promedio. En este modelo, tenemos un número de puntos de datos, por lo que el entorno es equivalente a la normalidad de las dos cualidades centrales. De esta manera, Q2 = (4 + 5)/2 o Q2 = 4.5. Q1 es el centro de un incentivo en la parte principal del índice de información. Q1 es el valor central en la primera mitad del conjunto de datos. Como hay un número de puntos de pares en la primera mitad del conjunto de datos, el valor medio es el promedio de los dos valores medios, es decir, Q1 = (2 + 3)/2 o 2 Q1 = 2.5. Q3 es el centro de un incentivo en la segunda mitad del conjunto de datos. Una vez más, como el segundo 50 % de la recopilación de información tiene una gran cantidad de percepciones, el valor central es normal de las dos cualidades centrales; es decir Q3 = (6 + 7)/2 o Q3 = 6.5. El intervalo intercuartil es Q3 menos Q1, por lo tanto, IQR = 6.5 – 2.5 = 4.
Artículos Relacionados:
