Cómo optimizar la distribución de datos para mejorar el rendimiento de tu sitio web

La distribución de datos es una función que especifica todos los valores posibles para una variable y también cuantifica la frecuencia relativa (probabilidad de la frecuencia con la que ocurren). Las distribuciones se consideran cualquier población que tenga una dispersión de datos. Es importante determinar el tipo de distribución que tiene la población para que podamos aplicar los métodos estadísticos correctos al analizarla.

Las distribuciones de datos se utilizan ampliamente en estadísticas. Supongamos que un ingeniero recopila 500 puntos de datos en la placa de un taller, no da ningún valor a la administración a menos que él/ella clasifique u organice los datos de manera útil. El método de distribución de datos organiza los datos sin procesar en métodos gráficos (como histogramas, gráficos de caja, cuadros de ejecución, etc.) y proporciona la información útil.

La ventaja básica de la distribución de datos es estimar la probabilidad de cualquier observación específica en un espacio de muestra. La distribución de probabilidad es un modelo matemático que calcula la probabilidad de ocurrencia de diferentes resultados posibles en una prueba o experimento. Se utiliza para definir diferentes tipos de variables aleatorias (típicamente discretas o continuas) para tomar la decisión depende de estos modelos. Basado en la categoría de variable aleatoria, uno puede usar media, modo, rango, probabilidad u otros métodos estadísticos.

Una distribución discreta resultante de datos contables que tienen un número finito de valores posibles. Además, se pueden informar distribuciones discretas en las tablas y los valores respectivos de la variable aleatoria son contables. Ej: dados ondulados, eligiendo una serie de cabezas, etc.

¿Qué significa distribución de datos?

Una distribución de datos es una función o un listado que muestra todos los valores posibles (o intervalos) de los datos. También (y esto es importante) le dice con qué frecuencia ocurre cada valor. A menudo, los datos en una distribución se ordenarán de más pequeños a más grandes, y los gráficos y gráficos le permiten ver fácilmente los valores y la frecuencia con los que aparecen.

A partir de una distribución, puede calcular la probabilidad de una observación particular en el espacio de la muestra, o la probabilidad de que una observación tenga un valor que sea menor (o mayor que) un punto de interés.

La función de una distribución que muestra la densidad de los valores de nuestros datos se denomina función de densidad de probabilidad, y a veces se abrevia PDF.

Una curva de distribución normal, a veces llamada curva de campana, es uno de los bloques de construcción de un modelo probabilístico. Hay algunas distribuciones estadísticas que surgen con tanta frecuencia que han recibido sus propios nombres; Una de ellas es la curva en forma de campana, también llamada distribución normal. Cuando se graba (de más pequeño a mayor, con frecuencia que los valores se encuentran en el eje Y) se parece a una forma de campana ordenada, con colas en ambos lados. El gráfico es continuo; Lo que significa que se incluye cada punto, y no hay discontinuidades entre los puntos. También es simétrico sobre un punto central (la media).

La distribución normal es en realidad una familia infinita de distribuciones (cada una completamente definida por medios únicos y desviación estándar) en lugar de solo una, pero comparten muchas de las mismas propiedades.

¿Cómo es la forma de distribución de los datos?

Podemos caracterizar la forma de un conjunto de datos mirando su histograma.

Primero, si los valores de datos parecen acumularse en un solo «montículo», decimos que la distribución es inimodal. Si parece haber dos «montículos», decimos que la distribución es bimodal. Si hay más de dos «montículos», decimos que la distribución es multimodal.

En segundo lugar, nos enfocamos en si la distribución es simétrica, o si tiene una «cola» más larga en un lado u otro. En el caso de que haya una «cola» más larga, decimos que la distribución está sesgada en la dirección de la cola más larga. En el caso de que la cola más larga se asocie con valores de datos más grandes, decimos que la distribución está sesgada o (sesgada positivamente). En el caso de que la cola más larga se asocie con valores más pequeños (o más negativos), decimos que la distribución está sesgada a la izquierda o (negativamente sesgada).

Si la distribución es simétrica, a menudo necesitaremos verificar si tiene forma de campana o tiene una forma diferente. En el caso de una distribución donde cada rectángulo tiene aproximadamente la misma altura, decimos que tenemos una distribución uniforme.

El siguiente gráfico ofrece algunos ejemplos de las formas de distribución antes mencionadas.

Para datos de nivel de intervalo o relación, una medida del centro es la media. La media de la población se denota por $ mu $, mientras que la media de la muestra destinada a estimar que se denota por $ sobreline {x} $. Ambos valores se calculan de manera muy similar. Suponiendo que la población tiene un tamaño de $ n $, una muestra tiene un tamaño $ n $ y $ x $ tramos en todos los valores de datos disponibles en la población o muestra, según corresponda, encontramos estos medios calculando al calcular
$$ mu = frac { sum x} {n} quad textrm {y} quad overline {x} = frac { sum x} {n} $$

¿Qué es distribución de datos agrupados?

En informática, dentro de los sistemas de información, en la práctica de la inteligencia empresarial para el almacén de datos (del almacén de datos en inglés, literalmente, DW abreviado) nos referimos a una recopilación o agregación de datos estructurados, provenientes de fuentes operativas internas (DBM) y Externo al sistema de información de la empresa, útil para análisis y relaciones de información, primero adaptado a través de herramientas especiales para transformar datos ETL, y luego analizado a través de herramientas de análisis o minería de datos OLAP (consulta multidimensional), típicamente para el uso de la compañía estratégica en la toma de decisiones comerciales procesos.

Se puede ver como una gran base de datos de lectura (en esquema de lectura), por lo tanto, útil para análisis históricos, o sin las operaciones en bruto habituales típicas de las bases de datos relacionales operacionales (en el esquema de escritura). Como parte del análisis multidimensional OLAP, el subconjunto del DW se dice en su lugar Data Mart.

William H. Inmon, el que habló explícitamente por el almacén de datos, lo define como una recopilación de datos integrada, orientada al sujeto, variable a lo largo del tiempo y no volátil «para apoyar los procesos de toma de decisiones.

La integración de datos constituye la principal característica distintiva del DW en comparación con otros sistemas de apoyo de decisiones.

  • Integrado: el requisito fundamental de un almacén de datos es la integración de los datos recopilados. En la fecha del almacén, los datos de múltiples sistemas transaccionales y fuentes externas fluyen. El objetivo de la integración se puede lograr viajando diferentes caminos: mediante el uso de métodos de codificación uniformes, a través de la búsqueda de una homogeneidad semántica de todas las variables, mediante el uso de las mismas unidades de medición;
  • Orientado al sujeto: el DW está orientado a cuestiones, aplicaciones o funciones corporativas específicas. En un DW, los datos se archivan para que los usuarios lean o procesen fácilmente. El objetivo, por lo tanto, ya no es minimizar la redundancia a través de la normalización, sino proporcionar datos organizados de tal manera que fomenten la producción de información. Pasamos del diseño para las funciones a un modelado de los datos que permite una visión multidimensional de la misma;
  • Variable a lo largo del tiempo: los datos almacenados dentro de un DW cubren un horizonte de tiempo mucho más extenso que los archivados en un sistema operativo. El DW contiene una serie de información relacionada con las áreas de interés que capturan la situación relacionada con un cierto fenómeno en un intervalo de tiempo bastante extenso. Esto implica que los datos contenidos en un DW se actualizan hasta una fecha determinada que, en la mayoría de los casos, está previa en la que el usuario cuestiona el sistema. Esto difiere de lo que ocurre en un sistema transaccional, en el que los datos siempre corresponden a una situación actualizada, generalmente no pueden proporcionar una imagen histórica del fenómeno analizado;
  • No volátil: esta característica indica la no modificación de los datos contenidos en el DW, que permite el acceso a la lectura. Esto implica una simplicidad de diseño de la base de datos en comparación con la de una aplicación transaccional. En este contexto, no se consideran las posibles anomalías debido a actualizaciones, y mucho menos usar herramientas complejas para administrar la integridad referencial o bloquear registros a los que otros usuarios pueden acceder a la fase de actualización.

El almacén de datos, por lo tanto, describe el proceso de adquisición, transformación y distribución de información dentro o fuera de las empresas como apoyo para los tomadores de decisiones. Difiere sustancialmente de los sistemas de gestión normales que, por el contrario, tienen la tarea de automatizar las operaciones de rutina.

¿Cómo sacar la distribución de datos?

Todos los días nos encontramos con una variedad de datos como datos de sensores, datos de ventas, datos de clientes, datos de tráfico, etc. Además, dependiendo del caso de uso, hacemos una variedad de procesamiento y probamos varios algoritmos en él. ¿Alguna vez se ha preguntado estas preguntas sobre sus datos:

¿Hay alguna confianza que pueda adjuntar a los valores que puede tomar? ¿Cuál es la posibilidad de que ocurra un valor extremo «x»?

El algoritmo que está aplicando puede asumir una suposición sobre la distribución de datos, ¿son correctos esos supuestos?

Pero, el desafío es que los datos del mundo real pueden no seguir ninguna distribución de probabilidad bien conocida. En este caso, podemos aproximar la distribución de probabilidad más probable y verificar su bondad de ajuste.

A través de esta publicación de blog, tengo la intención de resaltar los beneficios de conocer sus datos y aproximar la distribución de probabilidad de su parte. También mostraré ejemplos prácticos de cómo hacer eso y mediré la bondad del ajuste de la distribución ajustada a la de lo observado. El conjunto de datos utilizado en el blog es el conjunto de datos de automóviles usados ​​de Kaggle. El código utilizado en esta publicación de blog se puede descargar desde aquí.

Es una buena práctica conocer sus datos una vez que comience a trabajar en ellas. Muchos algoritmos, como la regresión lineal, asumen variables para seguir una distribución particular. El costo de no cumplir con los supuestos podría ser alto a veces.

Conociendo la distribución de probabilidad subyacente, podemos encontrar su función de densidad de probabilidad. Esto nos ayuda a adjuntar intervalos de confianza al rango de valores que los datos son probables. También podemos encontrar la probabilidad de que ocurra un valor extremo.

¿Qué es la distribución de datos?

Con tantos tipos de distribuciones de datos a considerar en la ciencia de datos, ¿cómo elige el correcto para modelar sus datos? Esta guía consignará las distribuciones más importantes con las que debe estar familiarizado en su trabajo.

Hay más de 20 tipos diferentes de distribuciones de datos (aplicadas al espacio continuo o discreto) comúnmente utilizados en la ciencia de datos para modelar varios tipos de fenómenos. También tienen muchas interconexiones, que nos permiten agruparlas en una familia de distribuciones. Una gran publicación de blog propone la siguiente visualización, donde las líneas continuas representan una relación exacta (caso especial, transformación o suma), y la línea discontinua indica una relación límite. La misma publicación proporciona una explicación detallada de estas relaciones, y este documento proporciona un análisis exhaustivo de las interacciones entre distribuciones.

La siguiente sección proporciona información sobre cada tipo de distribución que representa qué fenómenos modela típicamente, algunos escenarios de ejemplo que ilustran cuándo tiene sentido elegir la distribución, la función de distribución/masa de probabilidad y su forma típica en una visualización.

La función de densidad de probabilidad es una aproximación continua en términos de integrales de la densidad de una distribución o una versión suave de histogramas. La función de distribución acumulativa se puede expresar como f (x) = p (x ≤x), lo que indica la probabilidad de que X tome un valor menor o igual a x. Las funciones de PMF se aplican al dominio discreto y dan la probabilidad de que una variable aleatoria discreta sea exactamente igual a algún valor.

La distribución de Bernoulli es una distribución discreta que consta de solo un ensayo con 2 resultados (éxito/falla). Constituye la base para definir otras distribuciones más complejas, que analizan más de un ensayo, como las próximas 3 distribuciones.

¿Cómo hacer una tabla de distribución de datos?

Una vez que se ha realizado una distribución de frecuencia, como con los datos de flexión, se puede convertir en una tabla. Primero, crea una mesa. Necesita haber dos columnas. La primera columna está etiquetada como ‘categorías’ y la segunda columna está etiquetada como ‘frecuencia’. Agregue el número de filas debajo de estos títulos de columna en función del número de opciones de resultados. Si hay cuatro opciones de resultados, agregue cuatro filas debajo de los títulos de la columna:

Agregue cada opción de resultado a la fila designada. Si se desea un orden específico, entonces coloque las opciones de resultados en ese orden. En el caso de las flexiones, tiene sentido ordenar las categorías en orden numérico.

Esta es la tabla de distribución de frecuencia completa.

Se puede usar una distribución de frecuencia para crear muchos gráficos diferentes. Los gráficos más comunes son los gráficos de barras y circulares. Un gráfico de barras toma la distribución de frecuencia y representa la frecuencia usando barras. Cuanto más larga sea la barra, mayor es la frecuencia. Un gráfico circular utiliza la frecuencia relativa y representa las proporciones como partes de un círculo, como las rodajas de un pastel. Cuanto más grande sea la porción, mayor será la proporción o frecuencia.

La distribución de frecuencia para los sabores favoritos de helado se puede mostrar usando un gráfico de barras de un gráfico de pastel. El gráfico de barras colocaría cada categoría en el eje vertical y tiene números para indicar la frecuencia en el eje horizontal. La barra será tan larga como la frecuencia para cada categoría.

¿Qué tipo de distribución presentan los datos?

En un gráfico de distribución, un espacio es un intervalo que no contiene datos; Por otro lado, un pico es el punto más alto de un conjunto de datos.
Cuando varios puntos de datos se encuentran juntos, decimos que hay un clúster, lo que generalmente significa que estos puntos de datos tienen características similares. Por lo general, podemos definir como homogéneos los puntos que pertenecen a un grupo, debido al intercambio de características que los hacen tan similares entre sí (las cosas que son muy diversas o diferentes se llaman heterogéneas)
Y así, si queremos practicar cómo determinar la forma de una distribución, echemos un vistazo a los próximos ejemplos:

Figura 11: Sra. Katsufrakis Clase puntajes

  • 90%
  • 80%
  • 70%
    La respuesta es el número tres: 70%, dado que el gráfico está sesgado a la izquierda, lo que produce la media (promedio) para moverse hacia la izquierda también. En otras palabras, el área en cada lado de la línea media debe ser el mismo, y dado que el gráfico tiene una cola hacia la izquierda, es como si alguien lo estirara de ese lado y arrastrando así lo que solía ser el centro (el La media está tratando de obtener la tendencia central) hacia la izquierda también.
    Si tiene dudas al respecto, regrese y eche un vistazo a la Figura 9 para la distribución de sesgo negativo, donde se puede observar la línea media.

En este caso, estamos trabajando con una distribución de probabilidad, ya que estamos hablando de la probabilidad de que un cajero bancario lo ayude en los próximos cinco minutos; Por lo tanto, el eje vertical de nuestro gráfico de distribución representará la probabilidad, y el eje horizontal representará el tiempo.
Luego, si el banco dice que un cajero estará disponible por igual en cualquier momento durante esos 5 minutos, entonces tenemos las mismas posibilidades de que un cajero lo ayude en cada minuto de todo el rango de la distribución; Por lo tanto, la probabilidad de ser asistida en cualquier minuto de los cinco, es 15 frac {1} {5} 51. Entonces, el histograma de distribución de probabilidad parece:

Figura 12: Histograma de distribución de probabilidad uniforme

¿Cómo saber cuál es la distribución de los datos?

En una distribución unitaria simple, se presentan los métodos observados para cada unidad estadística. Por ejemplo, si el carácter de «calificación» se detecta entre los empleados de una empresa, la distribución unitaria es un conjunto de n parejas en el que el primer elemento indica la unidad (el nombre u otros datos de identificación, de cada empleado), el segundo Indica su calificación (licencia promedio, diploma de escuela secundaria, tres primeros años, etc.).

Del mismo modo, una distribución múltiple es un conjunto de n-uple en el que el primer elemento indica la unidad y lo siguiente indica las modalidades de los caracteres N-1 observados en esa unidad.

El conjunto de parejas o n-uple se representa mediante una tabla. En el caso de una distribución simple, hay una tabla de dos columnas, la primera que contiene las unidades individuales y el segundo los métodos observados.

En general, las distribuciones unitarias representan el primer resultado de una detección, que luego se organiza en forma de una distribución de frecuencias o cantidades. La serie de intensidad llamada SO es una excepción, que presenta la intensidad diferente de un fenómeno detectado de acuerdo con un criterio cualitativo o en cualquier caso no cuantitativo en el sentido estricto (no es una medida o un recuento). Los ejemplos son:

  • La serie territorial, en la que se detecta la intensidad de un fenómeno (por ejemplo, el precio de un activo) para diferentes territorios, como las regiones o provincias italianas;
  • La serie histórica, en la que se detecta la intensidad de un fenómeno (por ejemplo, PIB) en los años o cuartos posteriores.

En una distribución de frecuencia, se presenta el número de unidades en las que se detecta cada método de carácter. En una detección de la calificación, por ejemplo, la distribución de frecuencias es un conjunto de k parejas, donde k es el número de métodos de caracteres; En cada pareja, el primer elemento indica el modo y el segundo indica el número de unidades en las que se ha observado ese modo (la frecuencia absoluta con la que se observa).

¿Cómo identificar qué tipo de distribución es?

Abra el terminal de su versión de Linux con la combinación de teclas [CTRL] + [Alt] + [t] o use la función de búsqueda. Escriba el siguiente comando y presione Enviar:

Cat /etc /*liberar

El asterisco dentro del código sirve para garantizar que el comando tenga en cuenta todas las distribuciones, para que pueda indicar la instalada. Los datos mostrados pueden parecer poco claros al principio, algunas líneas aparecen dos veces y otras terminan con «lanzamiento». Tenga cuidado porque, según la distribución, los archivos con detalles de la versión utilizada pueden variar.

La línea de la cual concentrarse será la que tiene la indicación «bonty_name =». Aquí puede proporcionar la versión de Linux y el número de distribución que utilizó actualmente.

Otro comando que trabaja en todas las distribuciones, incluso sin tener que instalar una herramienta específica, es:

Lato de gato /etc /os

Si solo necesita saber el nombre y la versión de la distribución de Linux utilizada, simplemente use el comando:

Lsb_release -d

En el ejemplo informado aquí para seguir que la versión de Linux instalada es Ubuntu 20.04 LTS para el escritorio.

El siguiente comando enumera más información completa sobre la versión utilizada:

lsb_release -a

El comando LSB_Release funciona en todas las versiones de Linux, siempre que haya instalado el paquete LSB-Lelease o que esto es parte de su versión Ubuntu. Con las distribuciones de Debian/Ubuntu puede instalar el software necesario con este comando:

apt-get -y install lsb-core

¿Cómo se hace la distribución de frecuencias?

La frecuencia de un valor es el número de veces que ocurre en un conjunto de datos. Una distribución de frecuencia es el patrón de frecuencias de una variable. Es el número de veces que cada valor posible de una variable ocurre en un conjunto de datos.

  • Puede usar este tipo de distribución de frecuencia para variables ordinales o cuantitativas cuando desee comprender con qué frecuencia las observaciones caen por debajo de ciertos valores.

Las distribuciones de frecuencia a menudo se muestran utilizando tablas de frecuencia. Una tabla de frecuencia es una forma efectiva de resumir u organizar un conjunto de datos. Por lo general, se compone de dos columnas:

  • Puede usar este tipo de distribución de frecuencia para variables ordinales o cuantitativas cuando desee comprender con qué frecuencia las observaciones caen por debajo de ciertos valores.
  • Los valores o intervalos de clase
  • Sus frecuencias
  • El método para hacer una tabla de frecuencia difiere entre los cuatro tipos de distribuciones de frecuencia. Puede seguir las guías a continuación o usar software como Excel, SPSS o R para hacer una tabla de frecuencia.

    • Puede usar este tipo de distribución de frecuencia para variables ordinales o cuantitativas cuando desee comprender con qué frecuencia las observaciones caen por debajo de ciertos valores.
  • Los valores o intervalos de clase
  • Sus frecuencias
  • Cree una tabla con dos columnas y tantas filas como hay valores de la variable. Etiquete la primera columna usando el nombre de la variable y etiquete la segunda columna «frecuencia». Ingrese los valores en la primera columna.
  • Para las variables ordinales, los valores deben ordenarse de más pequeños a más grandes en las filas de la tabla.
  • Para variables nominales, los valores pueden estar en cualquier orden en la tabla. Es posible que desee pedirlos alfabéticamente o en otro orden lógico.
  • Cuenta las frecuencias. Las frecuencias son el número de veces que ocurre cada valor. Ingrese las frecuencias en la segunda columna de la tabla junto a sus valores correspondientes.
  • ¿Cómo se elabora una distribución de frecuencia para datos agrupados?

    Cuando estudiamos grandes conjuntos de datos como en la tabla a continuación, nuestro objetivo principal es, en primer lugar, presentar la información en una forma utilizable más precisa. Esto se realiza agrupando nuestros datos en varios, lo que resulta en una distribución de frecuencia agrupada como lo hemos hecho en la tabla a continuación.

    El formato para construir una tabla de frecuencia agrupada podría resumirse de la siguiente manera:

    • decida el número de clases en las que se agruparán los datos;
    • Determine el ancho del clan a veces llamado intervalo de clase;
    • Prepara el skeet de Tally;
    • obtener la tabla de frecuencia.

    Ilustraremos la construcción de una tabla de frecuencia agrupada considerando el siguiente ejemplo.

    Supongamos que tenemos datos sobre las puntuaciones de un grupo de 100 estudiantes en un examen de estadística como en la tabla anterior para preparar una distribución de frecuencia agrupada para los datos de los puntajes, primero decidimos sobre el número de clases para crear.

    Existe una fórmula para determinar aproximadamente el número de clases a formar en la construcción de una tabla de frecuencia agrupada. Se conoce como regla de Sturge, y se da como:

    donde n = el número de valores observados. En nuestro propio caso, n = también. Por lo tanto, por regla de Sturge, el número apropiado de clases para crear es aproximadamente igual a

    Esta regla solo ofrece una guía y no proporciona un sustituto del juicio sólido del investigador al decidir el número de clases. De hecho, la regla de Sturge da un resultado irrazonable cuando N es muy pequeño o muy grande. Una decisión sobre el número apropiado de clases para crear es más o menos un sentido común y depende, entre otras cosas, de la naturaleza de los datos, el rango de. Valores cubiertos, es decir, la dispersión de los valores y, por supuesto, sobre el número total de elementos que se estudian. Para muestras de aproximadamente 30 a 50 observaciones, de cinco a siete clases serán suficientes. Para grandes templos de aproximadamente 100 observaciones, podemos crear entre 10 y 12 clases. Para muestras de hasta 150 o más observaciones, podemos tener hasta 15 clases. Para muestras muy grandes, menos de diez clases generalmente darán mucha pérdida de información. Por ejemplo, agrupar los datos en la Tabla 5.4.1 en los puntajes de 100 estudiantes en tres grupos de la siguiente manera: 0-40, 40-80 y más de 80, habría sido muy insatisfactoria. Obviamente, se pierde mucha información.

    Artículos Relacionados:

    Más posts relacionados:

    Deja una respuesta

    Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *