La estadística de prueba le dice cuán diferentes o más grupos son de la población general de la población, o cuán diferente es una pendiente lineal de la pendiente predicha por una hipótesis nula. Se utilizan diferentes estadísticas de prueba en diferentes pruebas estadísticas.
La significación estadística es arbitraria: depende del umbral, o valor alfa, elegido por el investigador. El umbral más común es P <0.05, lo que significa que es probable que los datos ocurran menos del 5% del tiempo bajo la hipótesis nula.
Cuando el valor p cae por debajo del valor alfa elegido, entonces decimos que el resultado de la prueba es estadísticamente significativo.
Su elección de la prueba t depende de si está estudiando un grupo o dos grupos y si le importa la dirección de la diferencia en los medios grupales.
Si está estudiando un grupo, use una prueba t pareada para comparar la media del grupo con el tiempo o después de una intervención, o use una prueba t de una muestra para comparar la media del grupo con un valor estándar. Si está estudiando dos grupos, use una prueba t de dos muestras.
Si desea saber solo si existe una diferencia, use una prueba de dos colas. Si desea saber si un grupo de grupo es mayor o menor que el otro, use una prueba de cola de cola izquierda o de cola derecha.
Una prueba t mide la diferencia en las medias grupales divididas por el error estándar agrupado de las dos medias de grupo.
De esta manera, calcula un número (el valor T) que ilustra la magnitud de la diferencia entre los dos medios de grupo que se comparan, y estima la probabilidad de que esta diferencia exista puramente por casualidad (valor p).
¿Qué son medidas de variabilidad y dispersión?
En esta ecuación, Xi representa los valores de muestra individuales y σxi su suma. La letra griega ‘σ’ (Sigma) es la capital griega ‘s’ y significa ‘suma’. Su cálculo se describe en el Ejemplo 1, a continuación.
La mediana se define como el punto medio de los datos ordenados. Se estima primero ordenando los datos de más pequeño a más grande, y luego contando hacia arriba para la mitad de las observaciones. La estimación de la mediana es la observación en el centro del orden en el caso de un número impar de observaciones, o el promedio simple de las dos observaciones medias si el número total de observaciones es par. Más específicamente, si hay un número impar de observaciones, es la observación [(n+1)/2] TH, y si hay un número par de observaciones, es el promedio de [N/2] TH y Las [(n/2) +1] TH Observaciones.
Considere los siguientes 5 pesos al nacer, en kilogramos, registrados en 1 decimal:
La media se define como la suma de las observaciones divididas por el número de observaciones. Así media = (1.2+1.3+…+2.1)/5 = 1.50kg. Es habitual citar 1 lugar decimal más para la media que los datos registrados.
Hay 5 observaciones, que es un número impar, por lo que el valor medio es la (5+1)/2 = 3ª observación, que es 1.4 kg. Recuerde que si el número de observaciones era uniforme, entonces la mediana se define como el promedio del [N/2] Th y el [(N/2) +1] Th. Por lo tanto, si hubiéramos observado un valor adicional de 3.5 kg en la muestra de peso al nacer, la mediana sería el promedio del 3er y la cuarta observación en la clasificación, a saber, el promedio de 1.4 y 1.5, que es de 1.45 kg.
¿Qué son las medidas de variabilidad y dispersión?
Las medidas de dispersión más conocidas son: el intervalo, la varianza, la desviación estándar y el coeficiente de variación (que no debe confundirse con el coeficiente de determinación). Entonces veremos estas cuatro medidas.
El intervalo es un valor numérico que indica la diferencia entre el valor máximo y mínimo de una población o un campeón estadístico. Su fórmula es:
- R → Es el rango.
- Massimo → es el valor máximo de la muestra o la población.
- Min → es el valor mínimo de la muestra o la población estadística.
- x → es la variable sobre la cual calcular esta medida.
La varianza es una medida de dispersión que representa la variabilidad de una serie de datos en comparación con su promedio. Formalmente se calcula como la suma de los cuadrados de los residuos divididos por el total de observaciones. Su fórmula es la siguiente:
- R → Es el rango.
- Massimo → es el valor máximo de la muestra o la población.
- Min → es el valor mínimo de la muestra o la población estadística.
- x → es la variable sobre la cual calcular esta medida.
La desviación estándar es otra medida que proporciona información de dispersión en comparación con el promedio. Su cálculo es exactamente el mismo que la varianza, pero tomando la raíz cuadrada de su resultado. Es decir, la desviación estándar es la raíz cuadrada de la varianza.
- R → Es el rango.
- Massimo → es el valor máximo de la muestra o la población.
- Min → es el valor mínimo de la muestra o la población estadística.
- x → es la variable sobre la cual calcular esta medida.
¿Qué son las medidas de variabilidad?
Por otro lado, cuando desea utilizar medidas adimoniales de variabilidad, se utilizan las medidas relativas de variabilidad, es decir, a números puros no expresados en ninguna unidad de medición, que permiten comparar incluso distribuciones muy diferentes.
Si, por ejemplo, desea comparar la variabilidad de una distribución de peso, expresada en kg, y la variabilidad de una distribución de la estatura, expresadas en CM, no se pueden usar medidas absolutas.
Del mismo modo, la variabilidad de dos distribuciones de precios si la primera se expresa en miles de euros y el segundo en millones de euros no se puede comparar, con medidas absolutas.
La medida de variabilidad relativa más generalizada es el coeficiente de variación, es decir, la relación entre los desechos cuadrados promedio y el promedio aritmético de la distribución de datos; en fórmulas: $$ bbox [#ffffff, 5px, border: 2px sólido #fd7b01] {c.v. = franc {s} { overline {x}}} $$
En general, para evitar demasiadas figuras decimales, el coeficiente de variación se expresa en forma porcentual: $$ c.v. = fracc {s} { overline {x}} cdot 100 $$
El coeficiente de variación así definido no puede usarse cuando la distribución promedio es cercana a cero, ya que supone un valor infinito (división por cero); Además, cuando el promedio es negativo, adquiere valores negativos.
Cuando el promedio es positivo, el coeficiente de variación puede tomar valores que van desde cero a un máximo no definido; Estos valores serán tan menores, al menos los datos de distribución se dispersan alrededor del promedio.
¿Cómo se interpretan las medidas de variabilidad?
Para los datos medidos a nivel ordinal, el rango y el rango intercuartil son las únicas medidas de variabilidad apropiadas.
Para niveles de intervalo y relación más complejos, la desviación estándar y la varianza también son aplicables.
Para distribuciones normales, se pueden usar todas las medidas. La desviación y la varianza estándar se prefieren porque tienen en cuenta todo su conjunto de datos, pero esto también significa que están fácilmente influenciados por valores atípicos.
Para distribuciones sesgadas o conjuntos de datos con valores atípicos, el rango intercuartil es la mejor medida. Se ve menos afectado por valores extremos porque se centra en la propagación en el medio del conjunto de datos.
¿Cómo interpretar las medidas de variabilidad?
Una medida de variabilidad es una estadística que habla más sobre la cantidad de dispersión dentro de un conjunto de datos. Describe cuánto se extienden los valores del conjunto de datos. En dónde más, una medida de tendencia central describe un valor típico de un conjunto de datos. Las medidas de variabilidad describen hasta qué punto los puntos de datos caen desde el centro. Por lo tanto, cuando hablamos de variabilidad, generalmente consideramos como el contexto en el que se distribuyen los valores. Cuando hay baja dispersión, indica que los puntos de un datos tienden a agruparse alrededor del centro. Una alta dispersión significa que los puntos de datos tienden a alejarse más del centro.
La variabilidad, la propagación y la dispersión son palabras similares que hablan más sobre el ancho de una distribución dada. Las medidas de variabilidad bien conocidas son la desviación estándar, la varianza, el rango y el rango intercuartil. En esta publicación, discutiremos las cuatro medidas comunes de variabilidad como se mencionó anteriormente. Esta publicación será de gran importancia para determinar cuál de las medidas de variabilidad anteriores es adecuada para sus datos.
La desviación estándar es la diferencia típica o estándar entre la media y cada punto de datos. Una desviación estándar más pequeña significa que los valores de un conjunto de datos se agrupan estrechamente. Por otro lado, una desviación estándar más grande indica que los valores se extienden más, por lo tanto, la distancia estándar es mayor. Convenientemente, la interpretación de la desviación estándar es más fácil porque utiliza las unidades originales de los datos dados. Es muy preciso decir que la desviación estándar es la medida de variabilidad más utilizada. Una desviación estándar es típicamente la raíz cuadrada de la varianza. La desviación estándar se denota como σ, mientras que la estimación de la muestra se denota como s.
Una varianza es un cuadrado promedio de la diferencia entre los valores de su media. Esta medida de variabilidad incluye cada uno de todos los valores dados en comparación con la media. En la varianza de cálculo, se pueden usar dos fórmulas dependiendo de si está calculando una varianza de una muestra de una estimación o toda la población.
¿Cuáles son las medidas de variabilidad?
Los dos conjuntos de diez mediciones en cada centro al mismo valor: ambos tienen media, mediana y modo 40. Sin embargo, una mirada a la figura muestra que son marcadamente diferentes. En el conjunto de datos I, las mediciones varían solo ligeramente del centro, mientras que para el conjunto de datos II las mediciones varían mucho. Así como hemos adjunto números a un conjunto de datos para ubicar su centro, ahora deseamos asociarnos a cada número de conjunto de datos que midan cuantitativamente cómo los datos se dispersan del centro o el clúster cerca de él. Estas nuevas cantidades se denominan medidas de variabilidad, y discutiremos tres de ellas.
La primera medida de variabilidad que discutimos es la más simple.
THERANGETHE Variabilidad de un conjunto de datos medido por el número R = XMAX – XMIN. De un conjunto de datos es el número de fórmula.
Wherxmaxis la medición más grande en el conjunto de datos y el yxminis el más pequeño.
Para el conjunto de datos I, el máximo es 43 y el mínimo es 38, por lo que el rango es R = 43-38 = 5.
Para el conjunto de datos II, el máximo es 47 y el mínimo es 33, por lo que el rango es R = 47-33 = 14.
El rango es una medida de variabilidad porque indica el tamaño del intervalo sobre el cual se distribuyen los puntos de datos. Un rango más pequeño indica menos variabilidad (menos dispersión) entre los datos, mientras que un rango más grande indica lo contrario.
Las otras dos medidas de variabilidad que consideraremos son más elaboradas y también dependen de si el conjunto de datos es solo una muestra extraída de una población mucho más grande o es toda la población (es decir, un censo).
Artículos Relacionados:
- La variabilidad estadística y sus aplicaciones para la toma de decisiones en la empresa
- ¿Qué es la variabilidad estadística? ¿Cómo se puede calcular?
- ¿Qué es la varianza y cómo se mide?
- Interpretación de la varianza: comprendiendo el análisis de datos
- Los salarios regionales están impactando el mercado laboral
