martes, 2 de diciembre de 2008

Cuartiles, deciles y percentiles.

Encuentre
a) Los cuartiles Q1, Q2, Q3 y
b) los deciles D1, D2, D3... D9
para los salarios de la empresa Pr.
Salarios No. de empleados
$250.00-$259.99 8
$260.00-$269.99 10
$270.00-$279.99 16$280.00-$289.99 14$290.00-$299.99 10$300.00-$309.99 5$310.00-$319.99 2Total: 65
a) El Q1 es el salario obtenido contando N/4=65/4. De los casos empezando con la primera clase (inferior). Ya que la primera clase incluye 8 casos, debemos tomar 16.25-8=8.25 de los 10 casos de la segunda clase. Por el método de interpolación lineal se obtiene Q1= $259.99 + 8.25/8 ($10.00)= $

Medidas de Dispersión

El rango semi-intercuartil o desviación cuartil de un conjunto de datos se determina mediante la siguiente expresión:
Rango percentilar
El rango percentilar 10-90 de un conjunto de datos se define
rango percentil 10-90=P90-P10
Desviación estándar
La desviación estándar de un conjunto de n de números x1, x2, ... xn se denota por S
donde x representa las desviaciones de cada uno de los números xj, respecto de la Xmedia. Por lo tanto S es la media cuadrática de las desviaciones en relación con la media o, como se le llama en forma común desviación de la media cuadrática.
Ejemplo.
Calcule el rango de los conjuntos, la desviación media
a) 12, 6, 7, 3, 15, 10, 18, 5
b) 9, 3, 8, 8, 9, 8, 9, 18

sábado, 20 de septiembre de 2008

Unidad I
*Notación sumatoria
La notación de una variable de xi:
*Media Aritmética



*Media Aritmética Ponderada


*Propiedades de la Media Aritmética




* La Mediana




miércoles, 10 de septiembre de 2008

Regresión Lineal

Regresión Lineal como Promedio

Mediante el siguiente ejemplo iniciaremos el estudio de lo que es la regresión lineal.
Se estudia el ingreso económico mensual de familias dependientes de obreros residentes. Dicho ingreso puede compararse contra la edad del padre de familia. De éste modo, se estudian dos variables que representan a su vez una variable bivariada susceptible de escribirse como un par ordenaso estadístico (x,y). En la Tabla siguiente, se muestran los datos correspondientes a una muestra aleatoria de 30 familias.
Tabla 1. Ingresos mensuales en miles de pesos de familias dependientes de obreros según la edad del padre

Familia Edad Ingresos

1----------35----------5.6

2----------35----------5.9

3----------36----------5.8

4----------38----------5.9

5----------38----------6.1

6----------38----------5.8

7----------40----------6.2

8----------41----------5.9

9----------41----------6.0

10--------43-----------5.9

11---------43----------6.0

12---------45----------6.3

13---------45----------6.2

14---------45----------5.9

15---------45----------6.2

16---------45----------6.4

17---------46----------6.2

18---------46----------6.1

19---------47----------6.8

20---------48----------7.0

21---------48----------6.7

22---------48----------6.5

23---------49----------6.8

24---------52----------6.7

25---------54----------7.4

26---------55----------7.5

27---------56----------7.9

28---------58----------7.8

29--------58-----------8.0
30---------60----------8.1



Regresion Lineal



Fórmulas:

Y'=a + b(x)

∑Y=n*a + b∑X

∑XY= a*∑X + b∑X2

donde, n= numero de muestras


Cálculo:

∑Y=195= (30)*a+(1378)*b

∑XY=9123.8=(1378)+(64726)b

(Sistema de ecuaciones simultáneas)


Solución:

a= 2.0470

b=0.0974


Sustitución:

Y=a + b(x)

Y'= 2.0470 +0.0974X

martes, 9 de septiembre de 2008

Problemas y Ejercicios

1. Suponga que el siguiente conjunto de datos es una muestra aleatoria de 40 calificaciones de autoconcepto.


a) Determine Xmáx y Xmín y el rango

Xmáx= 117
Xmín= 63
Rango= 117 - 63 = 54

b) ¿Cuántos intervalos sugeriría para mostrar la distribución?

Pueden ser 10 intervalos de 5 en 5 aproximadamente



c) Determine el ancho del intervalo, w, para permitir 10 intervalos.

54/10= 5.4 es el ancho del intervalo




d) Si w=5, ¿cuál es el primer intervalo (valor más bajo)



Sería el múltiplo de 5 más cercano a la Xmín (63) así que serían 60.




e) Si w=5, liste los valores



60-64; 65-69; 70-74; 75-79; 80-84; 85-89; 90-94; 95-99; 100;104; 105-109; 110-114; 115-119




f) Construya una distribución de frecuencias agrupada para los 40 valores. (Utilice el método de conteo con estacas)



g) Construya columnas de porcentajes y porcentaje acomulado para esos datos.

(Agregué este punto como las 2 últimas columnas de la tabla de arriba)


h) ¿Sería un polígono de frecuencias una gráfica adecuada para estos datos? ¿Por qué?

El polígono de frecuencia es un tipo de gráfica utilizado para datos de tipo cuantitativo continuo como estos, asi que si es adecuada



i) Construya un polígono con esos datos



j) Construya una ojiva con esos datos



k) Estime P10, P50 y P90 utilizando la ojiva.

P10= 80, P50= 100 y P90= 110


l) Construya una gráfica horizontal de caja y patillas para esos datos.



m) Comente sobre la aparente simetría o asimetría de esos datos.

según la ojiva, la distribución es asimétrica hacia la derecha


n) ¿Cómo diferirá una ojiva de asimetría positiva de la de asimetría negativa?

la positiva se eleva más rápido en base al lado izquierdo, en la negativa ocurre lo contrario



o) ¿Puede suponer cómo podría aparecer la ojiva de una distribución rectangular?

una línea recta con pendiente =1





2. El siguiente conjunto de datos es una muestra aleatoria de 50 casos de los datos del HSB. En este caso, los números representan la raza de los individuos, de donde 1= hispanos, 2= asiáticos, 3= negros, 4= blancos.







a) ¿Un polígono de frecuencia es apropiado para graficar esos datos? ¿Por qué?

No, porque los polígonos de frecuencia funcionan para datos cuantitativos, no tanto para categóricos


b) ¿Es apropiada una gráfica de barras para graficar esos datos? ¿Por qué?


Definitivamente porque muestra la frecuencia de cada categoría


c) Construya una distribución de frecuencias agrupada para esos datos (método de Tukey).



d) Construya una columna de porcentajes para esos datos

Lo incluí en la última columna de la tabla del inciso c


e) Construya un histograma de frecuencias para esos datos.





f) Etiquete el eje vertical de la figura del inciso e para identificar frecuencia y porcentajes

Lo agregué del lado derecho del histograma del inciso e


g) ¿Habría probablemente brechas entre las columnas del histograma? ¿Por qué?

Si, No a todas las Y les corresponde un dato categórico




Problemas página 50


En un grupo de sexto grado con 36 estudiantes, se administra una técnica sociométrica de "adivina quien" para evaluar el grado de relaciones positivas entre ellos para cada estudiante. los valores para los 36 estudiantes:



1) ¿Cuál es el rango?

Rango = Xmax- Xmin

R = 52-0= 52


2) Construya una distribución de frecuencias no agrupada



3) Construya una distribución de frecuencias agrupada, con w=5



4) Construya un histograma de esos datos y comente su forma de distribución




5) Construya una ojiva.



6) Estime Q1 y Q2
Q1=2 o 3, Q2=13.5

7) Calcule la media.

Me= 9.7777778



8) Dtermine la mediana.



Md= 5


9) Determine la moda.

Mo= 1


10) Compare la distancia de Qi a Q2, con la distancia de Q2 a Q3. El patrón sugiere asimetría...

Q3-Q2 es mayor que Q2-Q1. Positiva.

11) Para una década reciente, el incremento en el ingreso medio en el sur fue 74% para blancos y 113% para negros. ¿Cuál es el incremento para ambos grupos combinados si de cada 100 trabajadores 82 fueron blancos.

X = (n1x1+n2x2)/(n1+n2)
X =[(82)(74)+(18)(113)]/(82+18)

X =[6068+2034]/100
X =81.02%

12) Suponga que siete amigos viven junto a una autopista y quieren juntarse en la casa de uno de ellos para comer tacos y discutir las medidas de tendencia central y sus tipos de gráficas favoritas. Si sus casas a alo largo de la autopista están situadas de este a oeste en este orden: A, B,C,D,E,F,G. ?Dónde deberían reunirse para minimizar la suma de las distancias recorridas?

En la D, la D es la mediana, asi que se minimiza la suma de las distancias




13) Suponga que una distribución tiene una media de 70, una mediana de 65 y una moda de 55.
En qué dirección está sesgada la distribución?



Positivamente (a la derecha) ya que los datos van en incremento



14) si aplica una prueba de CI a una clase en dos ocasiones separadas, somo regla general, somente sobre las diferencias relativas entre las dos medias, las dos medianas y las dos modas?

Se espera que las medias difieran menos y que las modas difieran más.


En base a la tabla 2.2



15) Mo= 50





16) Md= 51

jueves, 4 de septiembre de 2008

Distribución de Frecuencia

DISTRIBUCION DE FRECUENCIA


* Distribuciones de frecuencia: Es una lista de datos ( ya sea de manera individual o por grupos) junto con sus frecuencias o conteos corespondientes.

* Límites de clases inferiores: Son las cifras más pequeñas que pueden pertenecer a las diferentes clases.

* Límite de clase superior: Son las cifras más altas que pueden pretenecer a las diferentes clases.

* Frontera de clase: Son las cifras utilizadas para separar las clases, aunque sin los espacios creados por los límites de clase.
Se obtienen de la siguiente manera: Se determinan el tamaño del espacio, entre el límite de clase superior de una clase y el límite de clase inferior de la siguiente.Se suma la mitad de esa cantidad a cada límite de clase superiopr para obtener las fronterasde clases superiores,se resta la mitad de esa cantidad de cada límite de clase inferior, para obtener la frontera de clases inferiores.

Tabla: Distribución de frecuencia de los niveles contaminantes de nicotina.

Nicotina Frecuencia

0 - 99 11
100 - 199 12
200 - 299 14
300 - 399 1
400 - 199 2

- Límites de clases inferiores: 0,100,300,400
- Límite de clases superiores : 99,199,299,399,499
- Fronteras de clase : -0.5,99.5,199.5,299.5,399.5,499.5

- Marca de clase: Son los puntos medios de las clases, cada marca de clase se calcula sumando el límite inferior con el límite superior y dividiendolo entre dos. 49.6,149.5,249.5,349.5,449.5

- Anchura de clase: Diferencia entre dos límites de clase inferiores, consecutivos o dos fronteras de clase consecutivas. 100


VISUALIZACION DE DATOS
Histograma:
Entre los dsitintos tipos de gráficas que se presentan este es particularmente importante.Una gráfica de barras en donde la escala horizontal representa clases de valores de datos y la escala vertical representa frecuencias.Las alturas de las barras corresponden a los valores de frecunencias.


Realizar un histograma de frecuencia contra concentración





martes, 2 de septiembre de 2008

Distribución de Frecuencia

DISTRIBUCION DE FRECUENCIA
Toma de datos
Los datos estadísticos generalmente son numéricos. Con ellos se realiza el estudio de situaciones variadas en los más diversos campos de la ciencia y de la tecnología.
Dicho estudio se refiere a situaciones en las cuales es indispensable obtener informacón confiable para tomar decisiones certeras las cuales en gran medida se producen gracias a que los datos se organizan en tablas o gráficas.
Fuentes de datos estadísticos
* Experimentales: Provienen de experimentos planteados y quizá controlados en alguna de las variables por un investigador.
* Por observación: No proceden de experimentos, sino de fuentes no controlables.
Datos agrupados
Cuando se toman datos experimentales o por observación estos aparecen sin orden, por eso se les llama datos en bruto o crudos.
Estos datos se pueden agrupar, se pueden ordenar de menos a mayor o de mayor a menor. Esto al menos nos permite saber cual es el dato mayor, menor y cuáles de éstos están en el centro, si son pocos datos, si se repiten los datos, es decir, los más frecuentes.
* Frecuencia: Es el número de veces que se repite un dato.
Estos datos también se pueden agrupar en tablas de frecuencia y frecuencias relativas. La agrupación de éstas tablas se hace mediante la distribución de los datos numéricos, en clase, según sea su frecuencia.
Ejemplo:
Los siguientes datos corresponden a las utilidades en pesos de una panificadora ("La Conchita") surante cada uno de los últimos 24 meses. Se dan tal cual se recogieron, por eso aparecen en desorden. El dueño desea traspasar la panadería y requiere conocer esos datos para tomar una decisión.


9830.7 13686.85 19272.21 18030.36 21169.32 15737.43

14528.9 14307.33 16400.36 16505.53 16946.47 16573.73

15179.04 7814.889 13859.12 14228.12 18623.63 16573.94

18702.29 20733.58 17558.57 17383.31 12109.07 17991.51

Preguntas:

1) ¿Cuál es la pregunta del dueño de la panificadora?

Se pregunta si es o no conveniente traspasar la panificadora

2) ¿Cuál es la población bajo estudio? Describela

La poblaciónm bajo estudio son las utilidades en pesos de la panificadora, éstas son mensuales y varían mucho de un mes a otro.

3) ¿Cuál es la variable correspondiente?

La variable son los meses

4) Ordena los datos anteriores en una tabla de menor a mayor


7814.889 13859.12 15179.04 16573.73 17558.57 18702.29

9830.7 14228.12 15737.43 16573.94 17991.51 19272.21

12109.07 14307.33 16400.36 16946.47 18030.36 20733.58

13686.85 14528.9 16505.53 17383.31 18623.63 21169.32

5) ¿Cuál es el mayor dato y cuál es el menor?

El mayor es: 21 169.32, el menor es: 7 814.889

6) ¿Cuál es la diferencia entre el dato mayor y el menor?

21 169.32 - 7 814.889 = 13 354.431

7) ¿Cuáles son los 2 valores en el centro de los datos?

16 505.53 y 16 573.73

lunes, 1 de septiembre de 2008

Apunte 2

Del siguiente conjunto de datos, obtener las definiciones de moda, mediana, media aritmética asi como el promedio por columna y obtener el promedio total de la siguiente tabla:




324.00 322.10 24.10 324.00
423.00 324.00 32.10 444.10
372.10 712.08 512.00 432.12
276.08 432.00 732.00 782.34
762.12 276.08 324.00 1024.1
423.00 423.00 712.10 732.32
372.10 701.10 632.44 423.40
324.00 432.10 837.32 932.50
272.10 324.08 632.00 632.43
722.08 232.10 844.42 324.00
Media Aritmetica por Columna 427.058 417.864 528.248 605.131
Media Aritmetica de la Tabla 494.57525
Moda de la Tabla 324.00
Mediana de la Tabla 427.70

martes, 26 de agosto de 2008

Estadisticas. Apunte no.1

Medidas de Tendencia Central
Promedios
1. Media aritmética.-
De un conjunto de datos numéricos es la suma de los datos dividida entre el total de ellos.
2. Mediana.-
De un grupo de datos numéricos ordenados de menor a mayor (o de mayor a menor) es el valor del dato estrictamente en el centro de todos los datos.
3. Moda.-
Es el valor del dato numérico más frecuente en un conjunto de datos numéricos.
Ejemplo:
Un empresario, dueño de una gasolinera "A" desea comparar las ventas diarias en litros de gasolina con las de un competidor "B". Ambas son gasolinas muy parecidas en cantidades de operarios, capacidad y ubicación en la ciudad. los datos correspondientes para 40 días del año 2007, tomados al azar, se muestran en las siguientes tablas:
Tabla "A"
Ventas en cientos de litros por día

28.7 42.9 39.4 35.6 37.0 37.9 37.6 29.0
36.6 38.5 37.5 35.4 40.8 33.7 38.7 29.2
33.0 35.9 25.3 32.7 31.4 34.9 29.3 31.2
37.6 30.6 31.1 33.1 35.8 37.2 31.1 37.7
39.5 33.2 32.4 35.1 33.4 32.8 33.0 35.9
Tabla "B"
Ventas en cientos de litros por día
39.7 30.6 36.5 41.5 37.7 28.5 34.6 32.8
39.4 44.6 37.1 31.4 43.9 38.4 40.4 37.9
42.4 40.0 34.0 35.8 36.1 34.8 35.2 30.5
28.0 48.9 47.6 43.0 44.2 40.6 41.5 52.5
36.0 33.0 44.4 46.3 34.1 52.1 27.7 47.9
Cuál gasolinera podría decirse que es la más productiva?
Tabla "A"
Media aritmética: x= 34.54
Mediana: 32.05 (Promedio entre los 2 números medios: 32.7 y 31.4)
Moda: 37.7 y 31.1
Tabla "B"
Media aritmética: x= 38.79
Mediana: 35.95 (Promedio entre los 2 números medios: 35.8 y 36.1)
Moda: 41.5
En base a los 6 resultados se puede decir que la gasolinera más productiva es la gasolinera "B"
MEDIA ARITMETICA DE DATOS AGRUPADOS
Respecto a este tema, encontre los siguientes enlaces: