viernes, diciembre 12

UNIDAD IV - Inferencia Estadística

Se basa en las conclusiones a la que se llega por la ciencia experimental basándose en información incompleta (de una parte de la población). La inferencia estadística es una parte de la Estadística que permite generar modelos probabilísticos a partir de un conjunto de observaciones. Del conjunto se observaciones que van a ser analizadas, se eligen aleatoriamente sólo unas cuantas, que es lo que se denomina muestra, y a partir de dicha muestra se estiman los parámetros del modelo, y se contrastan las hipótesis establecidas, con el objeto de determinar si el modelo probabilístico es el adecuado al problema real que se ha planteado.

Se elaboran hipótesis sobre el comportamiento de las variables aleatorias.


Muestreo aleatorio.

Población: Está formada por al totalidad de las observaciones en las que se tiene cierto interés.

Muestra: Subconjunto de observaciones seleccionadas de una población.



Las variables aleatorias de la muestra, contituye una muestra aleatoria de tamaño n.

1) Las variables aleatorias son independientes.
2) Todas las observaciones tienen la misma distribución de probabilidad.



De la muestra aleatoria se pueden calcular estadísticos:
Media, Varianza, Desviación Estándar, que tamnbién son variables aleatorias.

_____________________________________________________________________________________

Los problemas de estimación se presentan muy seguido y a veces es necesario estimar las media poblacional, la varianza, la proporción de objetos de una población que pertenece a cierta clase de interés.



Diferencia de medias entres dos poblaciones:

Diferencia de proporciones: P1-P2

Distribución F

Se emplea para probar si dos muestras provienen de poblaciones que poseen varianzas iguales. Esta prueba es útil para determinar si una población normal tiene una mayor variación que la otra y también se aplica cuando se trata de comparar simultáneamente varias medias poblacionales. La comparación simultánea de varias medias poblacionales se conoce como análisis de varianza. En ambas situaciones, las poblaciones deben ser normales y los datos tener al menos la escala de intervalos.

La distribución F se define como la razón entre dos distribuciones ji cuadrada independientes, dividida cada una de ellas entre sus respectivos grados de libertad.




Si las dos varianzas poblacionales son iguales, se genera una distribución F con promedio de 1. Si las varianzas de la población no son iguales, la distribución de las razones será también una distribución F, pero el promedio no será igual a 1.

jueves, diciembre 11

Distribución Ji-cuadrada

La distribución ji-cuadrado tiene muchas aplicaciones en inferencia estadística , por ejemplo en el test ji-cuadrado y en la estimación de varianzas. También está involucrada en el problema de estimar la media de una población normalmente distribuida y en el problema de estimar la pendiente de una recta deregresión lineal, a través de su papel en la distribución t , y participa en todos los problemas de análisas de varianza , por su papel en la distribución F , que es la distribución del cociente de dos variables aleatorias de distribución ji-cuadrada e independientes.

Tabla de distribución Ji cuadrada

En realidad la distribución ji-cuadrada es la distribución muestral de S² . O sea que si se extraen todas las muestras posibles de una población normal y a cada muestra se le calcula su varianza, se obtendrá la distribución muestral de varianzas.

Para estimar la varianza poblacional o la desviación estándar, se necesita conocer el estadístico X² . Si se elige una muestra de tamaño n de una población normal con varianza , el estadístico:

donde n es el tamaño de la muestra, S² la varianza muestral y la varianza de la población de donde se extrajo la muestra.

Las distribuciones X² no son simétricas. Tienen colas estrechas que se extienden a la derecha; esto es, están sesgadas a la derecha. Cuando n>2, la media de una distribución X² es n-1 y la varianza es 2(n-1).


__________________________________________________________________

Ejemplo:

Probabilidad para Ji con 27 grados de libertad.



Distribución t

La variable se distribuye normalmente con media cero y varianza. Sin embargo, para calcular Z se requiere que S sea conocido. Por lo tanto, se requiere una distribución para el caso en que S sea desconocido y se pueda reemplazar por un estadístico, tal como S. Esa es la distribución t.


T=\frac{\overline{X}_n-\mu}{S_n/\sqrt{n}}


[eq.latex.gif]




Ejemplo:

Al fabricante de un agente propulsor utilizado en sistemas de escape de emergencia de aeronaves, le gustaría afirmar que su producto tiene una tasa promedio de combustión de 40 in. por minuto. Para investigar esta afirmación, el fabricante prueba 25 granos de propulsor seleccionados al azar, y si el valor de t cae entre

entonces quedará satisfecho. ¿A qué conclusión debe llegar el fabricante si tiene una muestra con una media de 42.5 in/min y una desviación estándar de 0.75 in/min?

Según la tabla de distribución de t:




16.67 es un valor que excede por mucho a 1.711. De hecho, si la media es igual a 40, entonces la probabilidad de obtener un valor de t mayor que este es considerablemente menor que 0.05. El valor de t obtenido es un indicador de que la tasa promedio de combustión es mayor que 40 in/min.

_________________________________________________________________

Mas ejemplos:







Para el siguente ejemplo, se busca el valor para alfa, teniendo una confianza de 95%



como se considera la confianza de 0.95, entonces alfa sería 0.05 y se obtiene el valor:



Aproximación de la Distribución Binomial por la Normal

Utilizar la distribución normal (continua) como sustituto de una distribución binomial (discreta) para valores grandes de n, parece razonable porque conforme n aumenta, una distribución binomial se acerca más a una distribución normal.
La distribución de probabilidad normal, en general, se considera una buena aproximación a la binomial cuando n y n(1 - ) son ambos mayores que 5.
El valor .5 se resta o se suma, dependiendo del problema, a un valor seleccionado cuando una distribución de probabilidad binomial se aproxima por una distribución de probabilidad normal.


___________________________________________________________________


Ejemplo.

Un estudio reciente de una compañía de investigación de mercados mostró que 15% de las casas en Estados Unidos poseen una cámara de video. Se obtuvo una muestra de 200 casas.
De las 200 casas en la muestra ¿cuántas se espera que tengan una cámara de video?



La varianza

La desviación estándar


¿Cuál es la probabilidad de que menos de 40 casas de la muestra tengan cámara de video?
Se necesita P(X<40)>


Distribución Normal

Esta distribución es frecuentemente utilizada en las aplicaciones estadísticas. Muchas variables aleatorias continuas presentan una función de densidad cuya gráfica tiene forma de campana.

En otras ocasiones, al considerar distribuciones binomiales, tipo B(n,p), para un mismo valor de p y valores de n cada vez mayores, se ve que sus polígonos de frecuencias se aproximan a una curva en "forma de campana".

En resumen, la importancia de la distribución normal se debe principalmente a que hay muchas variables asociadas a fenómenos naturales que siguen el modelo de la norma

  • Errores cometidos al medir ciertas magnitudes.
  • Valores estadísticos muestrales, por ejemplo : la media.
  • Otras distribuciones como la binomial o la de Poisson son aproximaciones normales, ..
En general cualquier característica que se obtenga como suma de muchos factores.


Representación gráfica de esta función de densidad





Función de Distribución

  • Los valores más cercanos al amedia son más probables.

  • Conforme un valor se aleja más de la media, la porbabilidad va disminuyendo simétricamente a la recta de la media.

  • La probabilidad de cada valor va decreciendo dependiendo de un parámetro s , que es la desviación estándaR.



Más ejemplos de distribución normal (Campana de Gauss):





















miércoles, diciembre 10

Tamaño apropiado para una muestra

1:
Si n>=30, se puede aplicar el teorema del limite central para una población con cualaquier tipo de distribución de probabilidad.

2:
Si n<30, es necesario asegurarse que la distribución de probabilidad es normal.




Teorema del limite central