miércoles, 19 de junio de 2019

Estadística. Medidas de Dispersión

Estadística. Contenido 4

Medidas de Dispersión 
para datos no agrupados


  • Rango
  • Desviación media
  • Varianza
  • Desviación estándar o típica

Medidas De Dispersión

Las medidas de tendencia central ofrecen una idea aproximada del comportamiento de una serie estadística. No obstante, no resultan suficientes para expresar sus características: una misma media puede provenir de valores cercanos a la misma o resultar de la confluencia de datos estadísticos enormemente dispares. Para conocer en que grado las medidas de tendencia central son representativas de la serie, se han de complementar con medidas de dispersión como la varianza o la desviación típica.

Concentración y dispersión

Las medidas de centralización ayudan a determinar el «centro de gravedad» de una distribución estadística. Para describir el comportamiento general de la serie se necesita, sin embargo, una información complementaria para saber si los datos están dispersos o agrupados.
Así, las medidas de dispersión pueden definirse como los valores numéricos cuyo objeto es analizar el grado de separación de los valores de una serie estadística con respecto a las medidas de tendencia central consideradas.
Las medidas de dispersión son de dos tipos:
  • Medidas de dispersión absoluta: como recorrido, desviación media, varianza y desviación típica, que se usan en los análisis estadísticos generales.
  • Medidas de dispersión relativa: que determinan la dispersión de la distribución estadística independientemente de las unidades en que se exprese la variable. Se trata de parámetros más técnicos y utilizados en estudios específicos, y entre ellas se encuentran los coeficientes de apertura, el recorrido relativo, el coeficiente de variación (índice de dispersión de Pearson) y el índice de dispersión mediana.

La distribución normal, o campana de Gauss, es una función simétrica (con la media aritmética en el centro de la serie) con un grado de dispersión bajo (la mayoría de los valores están comprendidos dentro del valor de la desviación típica ).

Recorrido

La medida de dispersión más inmediata es el recorrido de la distribución estadística, también llamado rango o amplitud. Dada una serie de valores x1, x2, ..., xn, su recorrido es la diferencia aritmética entre el máximo y el mínimo de estos valores:

Desviación media

Como medida de dispersión más frecuentemente utilizada, la desviación media se define como la media aritmética de los valores absolutos de la desviación de cada valor de la variable con respecto a la media. Su formulación matemática es la siguiente:

Varianza y desviación típica

La desviación media no siempre suministra una idea clara del grado de separación entre los valores de una variable estadística. Para estudios científicos, se prefiere utilizar una pareja de parámetros relacionados que se conocen como varianza y desviación típica.
La varianza se define como el cociente entre la suma de los cuadrados de las desviaciones de los valores de la variable y el número de datos del estudio. Matemáticamente, se expresa como:
Por su parte, la desviación típica, simbolizada por s, se define sencillamente como la raíz cuadrada de la varianza:
Por lo tanto, se tiene que:
La varianza y la desviación típica, cada una con su respectivo valor, se usan indistintamente en los estudios estadísticos.


Medidas de dispersión

Las medidas de dispersión nos informan sobre cuánto se alejan del centro los valores de la distribución.
Las medidas de dispersión son:

Rango o recorrido

El rango es la diferencia entre el mayor y el menor de los datos de una distribución estadística.

Desviación media

La desviación respecto a la media es la diferencia entre cada valor de la variable estadística y la media aritmética.
Di = x - x
La desviación media es la media aritmética de los valores absolutos de las desviaciones respecto a la media.
La desviación media se representa por signo
desviación media
desviación media

Ejemplo

Calcular la desviación media de la distribución:
9, 3, 8, 8, 9, 8, 9, 18
media
desviación media

Desviación media para datos agrupados

Si los datos vienen agrupados en una tabla de frecuencias, la expresión de la desviación mediaes:
delegación media
desviación media

Ejemplo

Calcular la desviación media de la distribución:
 xifix· fi|x - x||x - x| · fi
[10, 15)12.5337.59.28627.858
[15, 20)17.5587.54.28621.43
[20, 25)22.57157.50.7144.998
[25, 30)27.541105.71422.856
[30, 35)32.526510.17421.428
  21457.5 98.57
media
desviación media

Varianza

La varianza es la media aritmética del cuadrado de las desviaciones respecto a la media de una distribución estadística.
La varianza se representa por signo.
varianzavarianza

Varianza para datos agrupados

varianzavarianza
Para simplificar el cálculo de la varianza vamos o utilizar las siguientes expresiones que son equivalentes a las anteriores.
varianzavarianza

Varianza para datos agrupados

varianzavarianza

Ejercicios de varianza

Calcular la varianza de la distribución:
9, 3, 8, 8, 9, 8, 9, 18
media
varianza

Calcular la varianza de la distribución de la tabla:
 xifixi · fixi2 · fi
[10, 20)15115225
[20, 30)2582005000
[30,40)351035012 250
[40, 50)45940518 225
[50, 6055844024 200
[60,70)65426016 900
[70, 80)75215011 250
  421 82088 050
media
varianza

Propiedades de la varianza

La varianza será siempre un valor positivo o cero, en el caso de que las puntuaciones sean iguales.
Si a todos los valores de la variable se les suma un número la varianza no varía.
Si todos los valores de la variable se multiplican por un número la varianza queda multiplicada por el cuadrado de dicho número.
Si tenemos varias distribuciones con la misma media y conocemos sus respectivas varianzasse puede calcular la varianza total.
Si todas las muestras tienen el mismo tamaño:
varianzas
Si las muestras tienen distinto tamaño:
varianzas

Observaciones sobre la varianza

La varianza, al igual que la media, es un índice muy sensible a las puntuaciones extremas.
En los casos que no se pueda hallar la media tampoco será posible hallar la varianza.
La varianza no viene expresada en las mismas unidades que los datos, ya que las desviaciones están elevadas al cuadrado.

Desviación típica

La desviación típica es la raíz cuadrada de la varianza.
Es decir, la raíz cuadrada de la media de los cuadrados de las puntuaciones de desviación.
La desviación típica se representa por σ.
de relación típicadesviación

Desviación típica para datos agrupados

desviación típicadesviación
Para simplificar el cálculo vamos o utilizar las siguientes expresiones que son equivalentes a las anteriores.
desviación típicadesviación típica

Desviación típica para datos agrupados

desviación típicadesviación típica

Ejercicios de desviación típica

Calcular la desviación típica de la distribución:
9, 3, 8, 8, 9, 8, 9, 18
media
Desviación típica
Calcular la desviación típica de la distribución de la tabla:
 xifixi · fixi2 · fi
[10, 20)15115225
[20, 30)2582005000
[30,40)351035012 250
[40, 50)45940518 225
[50, 60)55844024 200
[60,70)65426016 900
[70, 80)75215011 250
  421 82088 050
media
desvición típica

Propiedades de la desviación típica

La desviación típica será siempre un valor positivo o cero, en el caso de que las puntuaciones sean iguales.
Si a todos los valores de la variable se les suma un número la desviación típica no varía.
Si todos los valores de la variable se multiplican por un número la desviación típica queda multiplicada por dicho número.
Si tenemos varias distribuciones con la misma media y conocemos sus respectivas desviaciones típicas se puede calcular la desviación típica total.
Si todas las muestras tienen el mismo tamaño:
desviación típica
Si las muestras tienen distinto tamaño:
desviación típica

Observaciones sobre la desviación típica

La desviación típica, al igual que la media y la varianza, es un índice muy sensible a las puntuaciones extremas.
En los casos que no se pueda hallar la media tampoco será posible hallar la desviación típica.
Cuanta más pequeña sea la desviación típica mayor será la concentración de datosalrededor de la media.



Estadística. Medidas de tendencia central

Estadística. Contenido 3

Análisis de datos. 
Medidas de Tendencia Central

  • Media aritmética
  • Mediana
  • Moda

Medidas De Tendencia Central

Las características globales de un conjunto de datos estadísticos pueden resumirse mediante una serie de cantidades numéricas representativas llamadas parámetros estadísticos. Entre ellas, las medidas de tendencia central, como la media aritmética, la moda o la mediana, ayudan a conocer de forma aproximada el comportamiento de una distribución estadística.

Medidas de centralización

Se llama medidas de posicióntendencia central o centralización a unos valores numéricos en torno a los cuales se agrupan, en mayor o menor medida, los valores de una variable estadística. Estas medidas se conocen también como promedios.
Para que un valor pueda ser considerado promedio, debe cumplirse que esté situado entre el menor y el mayor de la serie y que su cálculo y utilización resulten sencillos en términos matemáticos.
Se distinguen dos clases principales de valores promedio:
  • Las medidas de posición centrales: medias (aritmética, geométrica, cuadrática, ponderada), mediana y moda.
  • Las medidas de posición no centrales: entre las que destacan especialmente los cuantiles.
Las medidas de centralización son parámetros representativos de distribuciones de frecuencia como las que ilustra la imagen.

Media aritmética

Se define media aritmética de una serie de valores como el resultado producido al sumar todos ellos y dividir la suma por el número total de valores. La media aritmética se expresada como .
Dada una variable x que toma los valores x1, x2, ..., xn, con frecuencias absolutas simbolizadas por f1, f2, ..., fn, la media aritmética de todos estos valores vendrá dada por:

Media ponderada

En algunas series estadísticas, no todos los valores tienen la misma importancia. Entonces, para calcular la media se ponderan dichos valores según su peso, con lo que se obtiene una media ponderada.
Si se tiene una variable con valores x1, x2, ..., xn, a los que se asigna un peso mediante valores numéricos p1, p2, ..., pn, la media ponderada se calculará como sigue:

Mediana

La media aritmética no siempre es representativa de una serie estadística. Para complementarla, se utiliza un valor numérico conocido como mediana o valor central.
Dado un conjunto de valores ordenados, su mediana se define como un valor numérico tal que se encuentra en el centro de la serie, con igual número de valores superiores a él que inferiores. Normalmente, la mediana se expresa como Me.
La mediana es única para cada grupo de valores. Cuando el número de valores ordenados (de mayor a menor, o de menor a mayor) de la serie es impar, la mediana corresponderá al valor que ocupe la posición (n + 1)/2 de la serie. Si el número de valores es par, ninguno de ellos ocupará la posición central. Entonces, se tomará como mediana la media aritmética entre los dos valores centrales.
Determinación de la mediana de una serie de valores.

Moda

En una serie de valores a los que se asocia una frecuencia, se define moda como el valor de la variable que posee una frecuencia mayor que los restantes. La moda se simboliza normalmente por Mo.
Un grupo de valores puede tener varias modas. Una serie de valores con sólo una moda se denomina unimodal; si tiene dos modas, es bimodal, y así sucesivamente.





Medidas de tendencia central
La mayor parte de las serie de datos muestran una clara tendencia a agruparse alrededor de un cierto punto central. Así pues, dada cualquier serie de datos particular, por lo general es posible seleccionar algún valor o promedio típico para describir toda la serie de datos. Este valor descriptivo típico es una medición de tendencia central o de ubicación.
Cinco tipos de promedios a menudo usados como mediciones de tendencia central. Estos son la media aritmética, la mediana, la moda, el rango medio el eje medio.

La media aritmética

La media aritmética es el promedio o medición de tendencia central de uso más común. Se calcula sumando todas las observaciones de una serie de datos y luego dividiendo el total entre el número de elementos involucrados.
La expresión algebraica puede describirse como:
Fórmula de la media
Para simplificar la notación se usa convencionalmente el término:
media
donde:
símbolo de la media aritmética= media aritmética de la muestra
Sumatoria
= sumatoria de todos los valores de Xi

La mediana

La mediana es el valor medio de una secuencia ordenada de datos. Si no hay empates, la mitad de las observaciones serán menores y la otra mitad serán mayores. La mediana no se ve afectada por ninguna observación extrema de una serie de datos. Por tanto, siempre que esté presente una observación extrema es apropiado usar la mediana en vez de la media para describir una serie de datos.
La mediana
Para calcular la mediana de una serie de datos recolectados en su forma sin procesar, primero debemos poner los datos en una clasificación ordenada. Después usamos la fórmula de punto de posicionamiento:
Punto de posicionamiento
Para encontrar el lugar de la clasificación ordenada que corresponde al valor de la mediana, se sigue una de las dos reglas:
  1. Si el tamaño de la muestra es un número impar, la mediana se representa mediante el valor numérico correspondiente al punto de posicionamiento, la observación ordenada es (n+1)/2.
  2. Si el tamaño de la muestra es un número par entonces el punto de posicionamiento cae entre las dos observaciones medias de la clasificación ordenada. La mediana es el promedio de los valores numéricos correspondientes a estas dos observaciones medias.

La moda

La moda
La moda o modo es el valor de una serie de datos que aparece con más frecuencia. Se obtiene fácilmente de una clasificación ordenada. A diferencia de la media aritmética, la moda no se ve afectada por la ocurrencia de los valores extremos. 
Ejemplo: Los valores siguientes son las calificaciones de un alumno durante todo el año
7;  8;  9;  7;  9;  8;  8;  8;  7;  8
Podemos afirmar entonces que el modo es igual a 8, dado que es el valor que aparece con más frecuencia.

El rango medio

El rango medio es el promedio de las observaciones menores y mayores de una serie de datos.
El rango medio a menudo es usado como una medición de resumen tanto por analistas financieros como por reporteros meteorológicos, puesto que puede proporcionar una medición adecuada, rápida y simple para caracterizar toda una serie de datos, como por ejemplo todo una serie de lecturas registradas de temperatura por horas durante todo un día.

El eje medio

Como última medida de tendencia central, mencionamos al eje medio, que es el promedio del primer y tercer cuartiles de una serie de datos. Es decir:
Eje medio: (Q1 +  Q2) / 2
Siendo Q1 y Q2, el primer y segundo cuartil. En conclusión podemos decir que es una medición de resumen usada para zanjar problemas potenciales introducidos por  los valores extremos de los datos.



Estadística. Tablas estadísticas para datos no agrupados

Estadística. Contenido 2

Tablas estadísticas para datos no agrupados

Uso de TIC


  • Frecuencia absoluta
  • Frecuencia absoluta acumulada
  • Frecuencia relativa
  • Frecuencia relativa porcentual

Las Tablas de frecuencias son herramientas de Estadística donde se colocan los datos en columnas representando los distintos valores recogidos en la muestra y las frecuencias (las veces) en que ocurren.

    Elementos de las Tablas de frecuencias

    Datos

    Los datos son los valores de la muestra recogida en el estudio estadístico

    Frecuencia absoluta

    La frecuencia absoluta (ni) es el número de veces que aparece un determinado valor en un estudio estadístico. Número de veces que se repite el í-esimo valor de la variable. La suma de las frecuencias absolutas es igual al número total de datos, que se representa por n

    Frecuencia absoluta acumulada

    La Frecuencia absoluta acumulada (Ni) es la suma de las frecuencias absolutas de todos los valores inferiores o iguales al valor considerado.
    N1 = n1
    N2 = n1 + n2 = N1 + n2
    N3 = n1 + n2 + n3 = N2 + n3
    Nk = n.
    Se interpreta como el número de observaciones menores o iguales al í-esimo valor de la variable.

    Frecuencia relativa

    La frecuencia relativa (fi) es la proporción de veces que se repite un determinado dato.
    La frecuencia relativa es el cociente entre la frecuencia absoluta de un determinado valor y el número total de datos.
    fi = ni/n
    La suma de las frecuencias relativas es igual a 1.

    Frecuencia relativa acumulada

    La frecuencia relativa acumulada (Fi) es el número de observaciones menores o iguales al í-esimo valor de la variable pero en forma relativa.
    F1 = fl
    F2 = f1+ f2 = F1 + f2
    F3 = f1+ f2 + f3 = F2 + f3
    Fk = 1

    Tabla de frecuencia de datos no agrupados

    Los datos no agrupados son las de observaciones realizadas en un estudio estadistico que se presentan en su forma original tal y como fueron recolectados, para obtener información directamente de ellos.
    La Tabla de frecuencia de datos no agrupados indica las frecuencias con que aparecen los datos estadísticos sin que se haya hecho ninguna modificación al tamaño de las unidades originales. En estas distribuciones cada dato mantiene su propia identidad después que la distribución de frecuencia se ha elaborado. En estas distribuciones los valores de cada variable han sido solamente reagrupados, siguiendo un orden lógico con sus respectivas frecuencias.
    La tabla de frecuencias de datos no agrupados se emplea si las variables toman un número pequeños de valores o la variable es discreta.

    Tabla de frecuencia de datos agrupados

    La Tabla de frecuencia de datos agrupados aquella distribución en la que los datos estadísticos se encuentran ordenados en clases y con la frecuencia de cada clase; es decir, los datos originales de varios valores adyacentes del conjunto se combinan para formar un intervalo de clase.
    "Ejemplo de Tabla de Frecuencia de datos agrupados"
    La tabla de frecuencias agrupadas se emplea generalmente si las variables toman un número grande de valores o la variable es continua.
    En este caso se agrupan los valores en intervalos que tengan la misma amplitud denominados clases. A cada clase se le asigna su frecuencia correspondiente.
    Las clases deben ser excluyentes y exhaustivas, es decir que cada elemento de la muestra debe pertenecer a una sola clase y a su vez, todo elemento debe pertenecer a alguna clase.
    Cada clase está delimitada por el límite inferior de la clase y el límite superior de la clase.
    Los intervalos se forman teniendo presente que el límite inferior de una clase pertenece al intervalo, pero el límite superior no pertenece intervalo, se cuenta en el siguiente intervalo. No existe una regla fija de cuantos son los intervalos que se deben hacer; hay diferentes criterios, la literatura especializada recomienda considerar entre 5 y 20 intervalos. El número de intervalos se representa por la letra "K".
    El Recorrido es el límite dentro del cual están comprendidos todos los valores de la serie de datos,. Es la diferencia entre el valor máximo de una variable y el valor mínimo que ésta toma en una investigación cualquiera.
    R = Xmax. - Xmin.
    La Amplitud de la clase es la diferencia entre el límite superior e inferior de la clase y se representarán por "Ci"
    Ci = R/K
    Se considerará la misma amplitud para todos los intervalos.
    La Marcas de clases (Xi) representa a la variable a través de un valor. Se calcula como el punto medio de cada clase, o bien la semi suma de la clase
    La tabla de frecuencias puede representarse gráficamente en un histograma. Normalmente en el eje vertical se coloca las frecuencias y en el horizontal los intervalos de valores.

    Estadística Conceptos Básicos

    Estadística

    Contenido 1

    Conceptos básicos:

    Población estadística.- Es el conjunto de individuos, objetos o fenómenos de los cuales se desea estudiar una o varias características.

    Muestra estadística.- Es un subconjunto de casos o individuos de una población. En diversas aplicaciones interesa que una muestra sea representativa y para ello debe escogerse una técnica de muestra adecuada que produzca una muestra aleatoria adecuada.

    Individuo estadístico.- Cada uno de los elementos de la población.




    Variable Estadística:
    Una variable estadística es una característica que puede fluctuar y cuya variación es susceptible de adoptar diferentes valores, los cuales pueden medirse u observarse. Las variables adquieren valor cuando se relacionan con otras variables, es decir, si forman parte de una hipótesis o de una teoría. En este caso se las denomina constructos o construcciones hipotéticas.
    • Tipos de variables.-  Existen diferentes tipos de variables: cualitativa nominal, cualitativa ordinal, cuantitativa continua, cuantitativa discreta.

    Variables cualitativas.- Son el tipo de variables que como su nombre lo indica expresan distintas cualidades, características o modalidad. Cada modalidad que se presenta se denomina atributo o categoría, y la medición consiste en una clasificación de dichos atributos. Las variables cualitativas pueden ser dicotómicas cuando sólo pueden tomar dos valores posibles, como sí y no, hombre y mujer o ser politómicas cuando pueden adquirir tres o más valores. Dentro de ellas podemos distinguir:

    • Variable cualitativa ordinal o variable cuasicuantitativa: La variable puede tomar distintos valores ordenados siguiendo una escala establecida, aunque no es necesario que el intervalo entre mediciones sea uniforme, por ejemplo: leve, moderado, fuerte.
    • Variable cualitativa nominal: En esta variable los valores no pueden ser sometidos a un criterio de orden, como por ejemplo los colores o el lugar de registro

    Variables cuantitativas.- Son las variables que toman como argumento cantidades numéricas, son variables matemáticas. Las variables cuantitativas además pueden ser:

    • Variable discreta: Es la variable que presenta separaciones o interrupciones en la escala de valores que puede tomar. Estas separaciones o interrupciones indican la ausencia de valores entre los distintos valores específicos que la variable pueda asumir. Ejemplo: El número de hijos (1, 2, 3, 4, 5).
    • Variable continua: Es la variable que puede adquirir cualquier valor dentro de un intervalo especificado de valores. Por ejemplo la masa (2,3 kg, 2,4 kg, 2,5 kg,...) o la altura (1,64 m, 1,65 m, 1,66 m,...), o el salario. Solamente se está limitado por la precisión del aparato medidor, en teoría permiten que exista indefinidos valores entre dos variables.