Cuando recopila datos de una muestra, la desviación estándar de la muestra se usa para hacer estimaciones o inferencias sobre la desviación estándar de la población.
La fórmula de desviación estándar de muestra se ve así:
- = Muestra de desviación estándar
- = suma de…
- = cada valor
- = Media de muestra
- = número de valores en la muestra
Con las muestras, usamos N – 1 en la fórmula porque el uso de N nos daría una estimación sesgada que subestima constantemente la variabilidad. La desviación estándar de la muestra tendería a ser menor que la desviación estándar real de la población.
La desviación estándar generalmente se calcula automáticamente por el software que use para su análisis estadístico. Pero también puede calcularlo a mano para comprender mejor cómo funciona la fórmula.
Hay seis pasos principales para encontrar la desviación estándar a mano. Usaremos un pequeño conjunto de datos de 6 puntajes para caminar a través de los escalones.
Para encontrar la media, sumar todos los puntajes, luego divídalos por el número de puntajes.
Resta la media de cada puntaje para obtener las desviaciones de la media.
Como x̅ = 50, aquí quitamos 50 de cada puntaje.
Multiplica cada desviación de la media por sí misma. Esto dará como resultado números positivos.
Agregue todas las desviaciones al cuadrado. Esto se llama la suma de cuadrados.
Divida la suma de los cuadrados por N – 1 (para una muestra) o N (para una población): esta es la varianza.
¿Cómo se calcula la desviación estándar ejemplos?
La desviación estándar es una medición estadística de la cantidad, un número varía del número promedio en una serie. Una desviación estándar baja significa que los datos están muy relacionados con el promedio, por lo tanto, muy confiable. Una alta desviación estándar significa que existe una gran varianza entre los datos y el promedio estadístico, y no es tan confiable. Sigue leyendo para ejemplos de desviación estándar y las diferentes formas en que aparece en la vida diaria.
La desviación estándar mide qué tan lejos se extienden los resultados del valor promedio. Puede encontrar la desviación estándar encontrando la raíz cuadrada de la varianza y luego cuadrar las diferencias de la media. Si se pregunta, «¿Cuál es la fórmula para la desviación estándar?» se parece a esto:
- Determine la media (el promedio de todos los números) agregando todas las piezas de datos (XI) y dividiendo por el número de datos (N).
- Resta la media (x̄) de cada valor.
- Cuadrado cada una de esas diferencias.
- Determine el promedio de los números cuadrados calculados en el #3 para encontrar la varianza. (En los tamaños de muestra, reste 1 del número total de valores al encontrar el promedio).
4. Determine el promedio de esos números al cuadrado para obtener la varianza.
0.16 + 1.96 + 0.36 + 0.16 + 2.56 = 5.2 5.2 ÷ 5 = 1.04 (varianza)
Raíz cuadrada de 1.04 = 1.01
La desviación estándar de los valores 2, 1, 3, 2 y 4 es 1.01.
A menos que esté sentado en una clase de estadísticas, puede pensar que la desviación estándar no afecta su vida cotidiana. ¡Pero te equivocarías! Aunque la mayoría de los estadísticos calculan la desviación estándar con programas de computadora y hojas de cálculo, es útil saber cómo hacerlo a mano.
¿Qué es desviación estándar y ejemplos?
Imagine supervisar a dos gerentes de departamento que venden ricotta. Dado que no desea desperdiciar ningún paquete de ricota, es importante que estos dos gerentes tengan un inventario constantemente actualizado. En un intento por medir qué tan bien administran los pedidos, decida analizar las cajas de ricota que cada gerente ha ordenado en las últimas seis semanas. Tomando el promedio de las últimas 6 semanas, es posible ver que cada gerente ordena un promedio de aproximadamente 42 cajas de ricota por semana. Para un análisis superficial, la escuela secundaria hace que parezca que su gestión es similar.
Pero si mira más de cerca, verá que uno de los gerentes tiene órdenes semanales de 32, 44, 68, 62, 20 y 31 cajas. Para este gerente, el promedio puede ser matemáticamente correcto, pero oculta la volatilidad de sus órdenes semanales. En otras palabras, a veces el promedio de un conjunto de datos no representa correctamente los datos. Aquí es donde entra en juego la desviación estándar.
La desviación estándar da una idea de cómo se distribuyen los datos en la muestra en comparación con el promedio. Dicho de otra manera: le permite saber si el promedio es confiable para dar una representación significativa de los datos.
En nuestro ejemplo, utilizamos la función Dev.ST.C en Excel para apoyar la desviación estándar a nuestro promedio.
En el caso del primer gerente, la desviación estándar es 2. Esto nos dice que cada datos de muestra está a una distancia promedio de 2 puntos desde el promedio. ¿Es una buena cosa? Bueno, piense de esta manera: una desviación estándar de 0 significaría que cada datos es exactamente el mismo que el promedio de la muestra (42.33 en este caso). Una desviación estándar de 2 no está tan lejos de 0, lo que indica que la mayoría de los datos se colocan muy cerca del promedio. Cuanto más la desviación estándar esté cerca de 0, más confiable es el promedio. Por lo tanto, una desviación estándar cercana a 0 nos dice que hay poca volatilidad en la muestra. Con una desviación estándar de 2, las órdenes semanales del primer gerente son considerablemente consistentes.
¿Cuánto es la desviación estándar?
La desviación estándar mide la dispersión o variación de los valores de una variable alrededor de su valor medio (media aritmética). En pocas palabras, la desviación estándar es la distancia promedio del valor medio de todos los valores en un conjunto de datos.
1,000 personas fueron interrogadas sobre su factura telefónica mensual. El valor medio es de $ 40 y la desviación estándar 27. lo que significa que la distancia promedio de todas las respuestas (= valores) a la media es de $ 27.
Calculamos la desviación estándar con la ayuda de la raíz cuadrada de la varianza. El símbolo de la desviación estándar de una variable aleatoria es «σ», el símbolo de una muestra es «s». La desviación estándar siempre está representada por la misma unidad de medición que la variable en cuestión. Esto hace que su interpretación sea más fácil, en comparación. a la varianza.
Una desviación estándar más baja generalmente indica que los valores medidos de una variable se distribuyen más cerca de la media; Una desviación estándar más alta indica que los datos apuntan a un diferencial más ampliamente.
Para las variables normalmente distribuidas, la regla general es que aproximadamente el 68 por ciento de todos los puntos de datos se extienden desde la media dentro de la desviación estándar. Dentro de dos desviaciones estándar que incluirían alrededor del 95 por ciento de todos los puntos de datos. Las desviaciones más altas que este promedio se llaman valores atípicos.
Le preguntamos a 1,000 personas cuánto dinero gastan en promedio para su almuerzo. El resultado medio es $ 4.50, la desviación estándar es S = $ 0.60. Esto significa que la distancia promedio de todos los datos apunta a la media es de $ 0.60. La variable tiene una distribución en forma de campana: es una distribución normal.
¿Qué es y cómo se calcula la desviación estándar?
La desviación estándar se usa básicamente para mostrar qué tan extendidos son los datos, en relación con la media.
Una desviación estándar baja indica que los datos están cerca de la media, mientras que una desviación estándar alta indica que los datos se extienden más lejos de la media.
Para este ejemplo, supongamos que he medido el peso de 10 bulldogs femeninos de una edad similar. A continuación se muestran sus pesos, medidos en kilogramos.
Este grupo de bulldogs femeninos seleccionados al azar se conoce como muestra.
Lo primero que debe hacer para calcular la desviación estándar de la muestra es resolver el valor promedio.
Para hacer esto, simplemente agregue todos los valores en su muestra y divida la respuesta por el número de valores en la muestra.
En mi ejemplo, sumar todos los valores llega a 226.8 kg.
Luego, dado que tengo 10 perros individuales en mi muestra, dividiré esto por 10 para darme un peso promedio de 22.7 kg.
Ahora tenemos el peso promedio, el siguiente paso es resolver qué tan lejos están estos valores individuales del valor promedio.
Entonces, tomemos el primer perro, que pesaba 20.4 kg.
Para el próximo perro, el cálculo será 25.2 – 22.7, que llega a 2.5 kg.
Y el proceso se repite para todos los valores en la muestra.
Una vez que tenemos estos valores, el siguiente paso es cuadrar cada uno.
Entonces, para el primer perro, esto será -2.3 kg cuadrado.
El próximo perro será de 2.5 kg al cuadrado, que llega a 6.25 kg2.
¿Qué significa la desviación estándar?
Una desviación estándar baja significa que los datos en un conjunto se agrupan cerca de la media. Una alta desviación estándar significa que los datos en un conjunto se extienden, algunos lejos de la media.
La mejor manera de interpretar la desviación estándar es pensarlo como el espacio entre las marcas en una regla o criterio, con la media en el centro.
Cada vez que viajamos una desviación estándar de la media de una distribución normal, sabemos que veremos un porcentaje predecible de la población dentro de esa área.
Una desviación estándar baja es aquel en el que el coeficiente de variación (CV) es menor que 1. El coeficiente de variación se define como
- CV = (desviación estándar del conjunto de datos) / (media del conjunto de datos)
Tenga en cuenta que CV <1 implica que la desviación estándar del conjunto de datos es menor que la media del conjunto de datos.
También es importante tener en cuenta que una media cercana a cero sesgará el coeficiente de variación a un valor alto. Peor aún, una media de cero implica un coeficiente de variación indefinido (debido a un denominador cero).
Una alta desviación estándar es aquel en el que el coeficiente de variación (CV) es mayor que 1. Tenga en cuenta que CV> 1 implica que la desviación estándar del conjunto de datos es mayor que la media del conjunto de datos.
Es más probable que esto ocurra en conjuntos de datos donde hay una gran variabilidad (alta desviación estándar) pero un valor promedio cercano a cero (media baja).
Cuando decimos «1 desviación estándar de la media», estamos hablando del siguiente rango de valores:
- CV = (desviación estándar del conjunto de datos) / (media del conjunto de datos)
¿Cómo calcular la varianza y la desviación estándar?
La varianza y la desviación estándar son métricas importantes que podemos usar para medir hasta qué punto se extienden nuestros datos alrededor del promedio. Podemos calcular la varianza de un conjunto de datos manualmente siguiendo estos pasos:
Encuentre la diferencia entre cada valor y la media del conjunto de datos.
Cuadrado cada uno de estos valores. Esto asegura que la distancia entre cada punto y la media sea positiva, y detiene los valores por debajo de la media de cancelación de valores por encima de la media.
Es difícil interpretar la varianza intuitivamente. Debido a que cuadran las desviaciones como parte del cálculo, la varianza se mide en unidades cuadradas. Por ejemplo, la varianza de los ingresos para la barra deportiva se mide en dólares al cuadrado.
Podemos resolver este problema calculando la desviación estándar, que es simplemente la raíz cuadrada de la varianza. Esto se mide en las mismas unidades que el conjunto de datos. Una desviación estándar más pequeña indica que los números están más cerca de la media del conjunto de datos.
Excel proporciona funciones incorporadas para calcular la varianza y la desviación estándar. La función var.p se puede usar para encontrar varianza, y stdev.p se puede usar para encontrar desviación estándar. Ambas funciones toman una matriz de celdas como su entrada y devuelven la varianza o la desviación estándar de esos valores.
La P en ambas funciones significa población. Cuando realizamos estadísticas descriptivas, queremos utilizar las versiones de población de estas dos funciones.
En la lección anterior, aprendimos a crear una distribución de frecuencia para nuestro bar deportivo.
¿Cómo se calcula la varianza y desviación estándar?
Podemos definir estadísticas descriptivas como el arte de perder muchas figuras (datos sin procesar) para obtener otras (indicadores que resuman la distribución). Entre estos, los indicadores de dispersión ocupan un lugar de elección…
La dispersión es un elemento importante en el análisis de una serie estadística cuantitativa. Es la medición de la propagación de los valores de una variable estadística, en ambos lados de una posición central (promedio o más raramente mediana). Esta expansión caracteriza una muestra o una población y permite comparaciones: en igual fuerza laboral, las edades de los estudiantes de una escuela secundaria están menos dispersas que las de los habitantes de una aldea.
Entre los indicadores más fáciles de calcular, retendremos el alcance y el medio absoluto (EAM). Los cuantiles (cuartiles, deciles y centros) también permiten juzgar la dispersión de una distribución, especialmente cuando no es simétrica, pero su interpretación es menos inmediata.
Por lo tanto, la varianza es laboriosa de calcular, pero hay un atajo, desarrollado en la página de propiedades de la varianza: el promedio de los cuadrados menos el cuadrado del promedio.
La desviación estándar se observa con un pequeño sigma ( ( sigma )). El término y el símbolo se deben a Karl Pearson (1893). En una muestra, a menudo se observa (s ). Vea la página sobre notación estadística.
La desviación estándar está en la misma unidad de medición que los datos. Incluso con poco hábito, es bastante simple de interpretar. Por otro lado, la varianza tiene su lugar más en las etapas de cálculo intermedias que en un informe.
¿Cómo se calcula la varianza?
Para obtener la varianza de muestra, podemos mencionar dos maneras.
La primera forma es dividir la suma de los cuadrados de los residuos del promedio para el número del campeón menos uno.
La segunda forma en que podemos usar es la siguiente:
Para calcular la varianza de muestra con Excel, todo es muy simple ya que solo inserte la fórmula:
Aclaremos un tiempo para todos sobre la diferencia que entre el cálculo de la varianza se refiere a una población y al cálculo de la varianza de la muestra.
La varianza entendida en un sentido clásico (varianza de la población) es el promedio de los cuadrados de los desechos y se calcula de la siguiente manera:
O también podría verse como el promedio de los cuadrados menos el cuadrado del promedio:
También observamos que para hacer una distinción entre esto y la varianza de la población, utilizamos las letras griegas «σ» en lugar de la letra romana «s» utilizada para la varianza de la muestra.
Este último, por otro lado, se calcula en las formas en que presentamos anteriormente:
Para obtener la varianza de muestra que comienza a partir de la varianza de la población, multiplicamos este último por N y la dividimos por N-1.
Si tenemos una forma de calcular la varianza de una población de datos, ¿por qué cambiar esta fórmula cuando nos enfrentamos a una muestra?
Artículos Relacionados:
