Machine Translated by Google 6.5. PRUEBA DE HIPÓTESIS DE MUESTRAS PEQUEÑAS PARA UNA PROPORCIÓN (TEMA ESPECIAL)291 Prueba de hipótesis unilateral para p con una muestra pequeña. El valor p siempre se obtiene analizando la distribución nula del estadístico de prueba. El modelo normal se aproxima deficientemente a la distribución nula para ˆp cuando no se cumple la condición de éxito­ fracaso. Como alternativa, podemos generar la distribución nula mediante proporciones muestrales simuladas (ˆpsim) y usar esta distribución para calcular el área de la cola, es decir, el valor p. Seguimos usando la misma regla que antes al calcular el valor p para una prueba bilateral: duplicar el área de una sola cola, lo cual sigue siendo un enfoque razonable incluso cuando la distribución muestral es asimétrica. Sin embargo, esto puede resultar en valores p mayores que 1 cuando la estimación puntual está muy cerca de la media en la distribución nula; en tales casos, escribimos que el valor p es 1. Además, valores p muy grandes calculados de esta manera (p. ej., 0,85) también pueden estar ligeramente inflados. El ejercicio 6.48 indicó que el valor p es estimado. No es exacto porque la distribución nula simulada no es exacta, solo una aproximación cercana. Sin embargo, podemos generar una distribución nula exacta y un valor p utilizando el modelo binomial de la Sección 3.4. 6.5.3 Generación de la distribución nula exacta y el valor p El número de éxitos en n casos independientes se puede describir mediante el modelo binomial, que se introdujo en la Sección 3.4. Recordemos que la probabilidad de observar exactamente k éxitos viene dada por norte P(k éxitos) = k k p (1 − p) n−k = ¡norte! k k!(n − k)!p (1 − p) n−k (6.50) Donde p es la probabilidad real de éxito. La expresión se lee como n = k, y losksignos de exclamación representan norte factoriales. Por ejemplo, 3! es igual a 3 × 2 × 1 = 6, 4! es igual a 4 × 3 × 2 × 1 = 24, y así sucesivamente (véase la Sección 3.4). El área de la cola de la distribución nula se calcula sumando la probabilidad de la ecuación (6.50) para cada k que proporcione una evidencia al menos tan sólida a favor de la hipótesis alternativa como la de los datos. Si la prueba de hipótesis es unilateral, el valor p se representa mediante un área de cola única. Si la prueba es bilateral, se calcula el área de cola única y se duplica para obtener el valor p, tal como se ha hecho anteriormente. Machine Translated by Google 292 CAPÍTULO 6. INFERENCIA PARA DATOS CATEGÓRICOS Ejemplo 6.51 Calcule el valor p exacto para comprobar la afirmación del consultor de que la tasa de complicaciones de sus clientes es inferior al 10%. Se observaron exactamente k = 3 complicaciones en los n = 62 casos citados por el consultor. Dado que estamos probando contra el promedio nacional del 10%, nuestra hipótesis nula es p = 0,10. Podemos calcular el valor p sumando los casos en los que hay 3 o menos complicaciones: 3 norte valor p = p j=0 3 62 = (1 − p) n−j 0,1 j (1 − 0,1)62−j yo j=0 = j yo 62 0 + 0 0.1 (1 − 0,1)62−0 + 62 2 0.1 2 (1 − 0,1)62−2 + 62 1 0.1 1 (1 − 0,1)62−1 62 3 0.1 3 (1 − 0,1)62−3 = 0,0015 + 0,0100 + 0,0340 + 0,0755 = 0,1210 Este valor p exacto es muy cercano al valor p basado en las simulaciones (0,1222), y llegamos a la misma conclusión. No rechazamos la hipótesis nula, y no existe evidencia estadísticamente significativa que respalde la asociación. Si se graficara, la distribución nula exacta parecería casi idéntica a la distribución nula simulada que se muestra en la Figura 6.20 en la página 290. 6.5.4 Uso de simulación para pruebas de bondad de ajuste También se pueden utilizar métodos de simulación para comprobar la bondad del ajuste. En resumen, simulamos una nueva muestra basándonos en las probabilidades binarias supuestas y calculamos el estadístico de prueba de chi­cuadrado X². Repetimos esto varias veces (p. ej., 10 000 veces) y examinamos la distribución de estos Sí. estadísticos simulados de prueba de chi­cuadrado. Esta distribución será una distribución nula muy precisa para el estadístico de prueba X² si las probabilidades son exactas, y podemos hallar el extremo superior de esta distribución nula, utilizando un valor de corte del estadístico de prueba observado, para calcular el valor p. Ejemplo 6.52. La sección 6.3 presentó un ejemplo en el que analizamos si los jurados eran racialmente representativos de la población. ¿Diferirían nuestros hallazgos si utilizáramos una técnica de simulación? Dado que se cumplió la condición de recuento mínimo de bins, la distribución de chi­cuadrado es una excelente aproximación de la distribución nula, lo que significa que los resultados deberían ser muy similares. La Figura 6.21 muestra la distribución nula simulada utilizando 100.000 valores X² simulados con una curva superpuesta de la distribución de chi­cuadrado. Las distribuciones son prácticamente idénticas y los valores simulación p son prácticamente indistinguibles: 0,115 para la distribución nula simulada y 0,117 para la distribución nula teórica. Machine Translated by Google 6.6. PRUEBA DE HIPÓTESIS PARA DOS PROPORCIONES (TEMA ESPECIAL) 293 Observado X2 0 5 10 15 Estadística de prueba de chi­cuadrado (X2 ) Figura 6.21: La distribución nula precisa para el ejemplo del jurado de la Sección 6.3 se muestra como un histograma de estadísticas X2 simuladas , y también se muestra la distribución de chi­ simulación cuadrado teórica. 6.6 Prueba de hipótesis para dos proporciones (tema especial) La reanimación cardiopulmonar (RCP) es un procedimiento comúnmente utilizado en personas que sufren un ataque cardíaco cuando no hay otros recursos de emergencia disponibles. Este procedimiento es útil para mantener algo de circulación sanguínea, pero las compresiones torácicas involucradas también pueden causar lesiones internas. El sangrado interno y otras lesiones complican los esfuerzos de tratamiento adicionales después de la llegada a un hospital. Por ejemplo, se pueden usar anticoagulantes para ayudar a liberar un coágulo que está causando el ataque cardíaco. Sin embargo, el anticoagulante afectaría negativamente a una lesión interna. Aquí consideramos un experimento para pacientes que se sometieron a RCP por un ataque cardíaco y posteriormente fueron ingresados en un hospital.31 Estos pacientes fueron divididos aleatoriamente en un grupo de tratamiento donde recibieron un anticoagulante o el grupo de control donde no recibieron un anticoagulante. La variable de resultado de interés fue si los pacientes sobrevivieron durante al menos 24 horas. Ejemplo 6.53 Formule hipótesis para este estudio en un lenguaje sencillo y estadístico. Sea pc la tasa de supervivencia real de las personas que no reciben un anticoagulante (correspondiente al grupo de control) y pt la tasa de supervivencia de las personas que reciben un anticoagulante (correspondiente al grupo de tratamiento). Nos interesa saber si los anticoagulantes son útiles o perjudiciales, por lo que debería ser una prueba de dos caras. H0: Los anticoagulantes no tienen un efecto de supervivencia global, es decir, las proporciones de supervivencia son los mismos en cada grupo. pt − pc = 0. HA: Los anticoagulantes tienen un impacto en la supervivencia. pt − pc = 0. 31Eficacia y seguridad de la terapia trombolítica después de una reanimación cardiopulmonar inicialmente fallida: un ensayo clínico prospectivo, por B¨ottiger et al., The Lancet, 2001. Machine Translated by Google 294 CAPÍTULO 6. INFERENCIA PARA DATOS CATEGÓRICOS 6.6.1 Marco de muestra grande para una diferencia en dos proporciones En el experimento hubo 50 pacientes que no recibieron el anticoagulante y 40 Pacientes que lo hicieron. Los resultados del estudio se muestran en la Tabla 6.22. Total Sobrevivió Murió Control 11 39 50 Tratamiento 14 26 40 Total 25 65 90 Tabla 6.22: Resultados del estudio de RCP. Pacientes del grupo de tratamiento. A los pacientes del grupo de control se les administró un anticoagulante, pero no así a los del grupo de control. Ejercicio 6.54 ¿Cuál es la tasa de supervivencia observada en el grupo de control? Y en ¿El grupo de tratamiento? Además, proporcione una estimación puntual de la diferencia en la supervivencia. 32 proporciones de los dos grupos: ˆpt − pˆc. Según la estimación puntual, para los pacientes que se han sometido a RCP fuera de En el hospital, un 13% adicional de estos pacientes sobreviven cuando son tratados con sangre. diluyentes. Sin embargo, nos preguntamos si esta diferencia podría explicarse fácilmente por casualidad. Nos gustaría investigar esto utilizando un marco de muestra grande, pero primero necesitamos verificar el condiciones para tal enfoque. Ejemplo 6.55 ¿Puede la estimación puntual de la diferencia en las proporciones de supervivencia ser ¿modelado adecuadamente utilizando una distribución normal? Asumiremos que los pacientes son independientes, lo cual probablemente sea razonable. También se cumple la condición de éxito­fracaso. Dado que las proporciones son iguales bajo la nulo, podemos calcular la proporción agrupada, ˆp = (11 + 14)/(50 + 40) = 0,278, para comprobando las condiciones. Hallamos el número esperado de éxitos (13,9, 11,1) y Los fallos (36,1, 28,9) están por encima de 10. El modelo normal es razonable. Si bien podemos aplicar un marco normal como aproximación para encontrar un valor p, Es posible que tenga en cuenta que el número esperado de éxitos es solo 13,9 en un grupo y 11.1 en el otro. A continuación, realizamos un análisis basado en la teoría normal de muestras grandes. Continuaremos con un pequeño análisis de muestra y compararemos los resultados. Ejemplo 6.56 Evalúe las hipótesis presentadas en el Ejemplo 6.53 utilizando un marco de muestra grande. Utilice un nivel de significancia de α = 0,05. Suponemos que la distribución nula de la diferencia muestral sigue una distribución normal. con media 0 (el valor nulo) y una desviación estándar igual al error estándar de la estimación. La hipótesis nula en este caso sería que las dos proporciones son Lo mismo, por lo que calculamos el error estándar utilizando la fórmula de error estándar agrupado de la ecuación (6.16) en la página 273: SE = p(1 − p) Nuevo Testamento + p(1 − p) ≈ Carolina del Norte 11 0,278(1 − 0,278) 40 + 0,278(1 − 0,278) 50 32Tasa de supervivencia del control observada: pc = 50 = 0,22. Tasa de supervivencia del tratamiento: pt = diferencia: ˆpt − pˆc = 0,35 − 0,22 = 0,13. = 0,095 14 = 0,35. Observado 40 Machine Translated by Google 6.6. PRUEBA DE HIPÓTESIS PARA DOS PROPORCIONES (TEMA ESPECIAL) 295 donde hemos utilizado la estimación agrupada pˆ = proporción, 11+14 = 0,278 en lugar del verdadero 50+40 p. La distribución nula con media cero y desviación estándar de 0,095 se muestra en la Figura 6.23. Calculamos las áreas de cola para identificar el valor p. Para ello, utilizamos la puntuación Z de la estimación puntual: Z= (ˆpt − pˆc) − valor nulo 0,13 − 0 = = SE 0.095 1,37 Si consultamos esta puntuación Z en el Apéndice B.1, observamos que la cola derecha tiene un área de 0,0853. El valor p es el doble del área de la cola simple: 0,176. Este valor p no proporciona evidencia convincente de que el anticoagulante sea beneficioso. Por lo tanto, no hay evidencia suficiente para concluir si el anticoagulante es beneficioso o perjudicial. (Recuerde, nunca aceptamos la hipótesis nula; solo podemos rechazarla o no rechazarla). ^ p­pt ^ do cola derecha −0,29 −0,19 −0,1 0 0.1 0,19 0,29 Figura 6.23: La distribución nula de la estimación puntual ˆpt − pˆc, en el marco de muestra grande, es una distribución normal con media 0 y desviación estándar igual al error estándar; en este caso, EE = 0,095. El valor p está representado por las áreas sombreadas. El valor p de 0,176 se basa en la aproximación normal. Sabemos que cuando el tamaño de las muestras es grande, esta aproximación es bastante buena. Sin embargo, cuando el tamaño de las muestras es relativamente pequeño, como en este ejemplo, la aproximación puede ser solo adecuada. A continuación, desarrollamos una técnica de simulación, la aplicamos a estos datos y comparamos nuestros resultados. En general, el método de muestras pequeñas que desarrollamos puede utilizarse para muestras de cualquier tamaño, ya sea pequeño o grande, y debe considerarse más preciso que la técnica correspondiente para muestras grandes. 6.6.2 Simulación de una diferencia bajo la distribución nula Las ideas de esta sección se introdujeron por primera vez en la Sección opcional 1.8 en la página 42. Para el lector interesado, esta sección anterior proporciona una discusión más profunda. Supongamos que la hipótesis nula es verdadera. En ese caso, el anticoagulante no tiene ningún impacto en la supervivencia y la diferencia del 13 % se debe al azar. En este caso, podemos simular diferencias nulas debidas al azar mediante una técnica de aleatorización. 33 Al asignar aleatoriamente etiquetas de "tratamiento falso" y "control falso" a los historiales clínicos de los pacientes, podríamos obtener una nueva agrupación, completamente aleatoria. La diferencia esperada entre las dos proporciones en esta simulación es cero. 33El procedimiento de prueba que empleamos en esta sección se denomina formalmente prueba de permutación. Machine Translated by Google 296 CAPÍTULO 6. INFERENCIA PARA DATOS CATEGÓRICOS Ejecutamos esta simulación tomando 40 etiquetas falsas de tratamiento y 50 etiquetas falsas de control. y asignarlos aleatoriamente a los pacientes. Los recuentos de etiquetas de 40 y 50 corresponden a El número de asignaciones de tratamiento y control en el estudio real. Utilizamos una computadora programa para asignar aleatoriamente estas etiquetas a los pacientes y organizamos la simulación resultados en la Tabla 6.24. Sobrevivió Murió 15 control falso 10 tratamiento falso Total 25 Total 35 50 30 40 65 90 Tabla 6.24: Resultados simulados para el estudio de RCP bajo la hipótesis nula. Las etiquetas se asignaron aleatoriamente y son independientes del resultado de el paciente. Ejercicio 6.57 ¿Cuál es la diferencia en las tasas de supervivencia entre los dos grupos falsos? ¿ En la Tabla 6.24? ¿Cómo se compara esto con el 13% observado en los grupos reales? 34 La diferencia calculada en el Ejercicio 6.57 representa un valor extraído de la distribución nula. de las diferencias muestrales. A continuación, generamos muchos más experimentos simulados para construir la distribución nula, de forma muy similar a como lo hicimos en la Sección 6.5.2 para construir una distribución nula para un uno proporción de muestra. Precaución: La simulación en el caso de dos proporciones requiere que la función nula la diferencia es cero La técnica descrita aquí para simular una diferencia con la distribución nula se basa en una condición importante en la hipótesis nula: no hay conexión entre las dos variables consideradas. En algunos casos especiales, la diferencia nula podría no ser cero, y se utilizan métodos más avanzados (o una aproximación de muestra grande, Si fuera necesario), sería necesario. 6.6.3 Distribución nula para la diferencia de dos proporciones Construimos una aproximación a la distribución nula creando repetidamente tablas como la que se muestra en la Tabla 6.24 y calculando las diferencias muestrales. La distribución nula A partir de 10.000 simulaciones se muestra en la Figura 6.25. Ejemplo 6.58 Compare las figuras 6.23 y 6.25. ¿En qué se parecen? ¿En qué se parecen? ¿Son diferentes? Las formas son similares, pero los resultados simulados muestran que la aproximación continua de la distribución normal no es muy buena. Cabe preguntarse, ¿cuán cerca están? ¿los valores p? 34La diferencia es ˆpt,fake − pˆc,fake = Lo que observamos. 10 40 − 15 = −0,05, que está más cerca del valor nulo p0 = 0 que 50 Machine Translated by Google 6.6. PRUEBA DE HIPÓTESIS PARA DOS PROPORCIONES (TEMA ESPECIAL) 297 0,15 0.13 0 −0,4 −0,2 0.0 0.2 0.4 Figura 6.25: Aproximación de la distribución nula de la estimación puntual, ˆpt − pˆc. El valor p es el doble del área de la cola derecha. Ejercicio 6.59 El área de la cola derecha es de aproximadamente 0,13. (Es solo una coincidencia que también tengamos ˆpt − pˆc = 0,13). El valor p se calcula duplicando el área de la cola derecha: 0,26. ¿Cómo se compara este valor con la aproximación de muestra grande para el valor p? 35 En general, los métodos de muestras pequeñas producen resultados más precisos, ya que se basan en menos suposiciones. Sin embargo, suelen requerir trabajo adicional o simulaciones. Por esta razón, muchos estadísticos utilizan métodos de muestras pequeñas solo cuando no se cumplen las condiciones para los métodos de muestras grandes. 6.6.4 Aleatorización para tablas de dos vías y chi­cuadrado También se pueden utilizar métodos de aleatorización para las tablas de contingencia. En resumen, creamos una tabla de contingencia aleatorizada, calculamos el estadístico de prueba de chi­cuadrado x². Repetimos Sí. esto varias veces con una computadora y examinamos la distribución de estos estadísticos de prueba simulados. Este enfoque de aleatorización es válido para muestras de cualquier tamaño y será más preciso en los casos en que uno o más recuentos de bins esperados no alcancen el umbral mínimo de 5. Cuando se alcanza el umbral mínimo, la distribución nula simulada se asemejará mucho a la distribución de chi­cuadrado. Como antes, utilizamos la cola superior de la distribución nula para calcular el valor p. En este caso, la aproximación es bastante deficiente (valores p: 0,174 frente a 0,26), aunque llegamos a la misma conclusión. Los datos no aportan evidencia convincente de que el anticoagulante beneficie o perjudique a los pacientes. Machine Translated by Google 298 CAPÍTULO 6. INFERENCIA PARA DATOS CATEGÓRICOS 6.7 Ejercicios 6.7.1 Inferencia para una sola proporción 6.1 Estudiantes universitarios vegetarianos. Supongamos que el 8% de los estudiantes universitarios son vegetarianos. Determine si las siguientes afirmaciones son verdaderas o falsas y explique su razonamiento. (a) La distribución de las proporciones muestrales de vegetarianos en muestras aleatorias de tamaño 60 es aproximadamente normal ya que n ≥ 30. (b) La distribución de las proporciones muestrales de estudiantes universitarios vegetarianos en muestras aleatorias de tamaño 50 está sesgada hacia la derecha. (c) Se consideraría una muestra aleatoria de 125 estudiantes universitarios donde el 12% son vegetarianos. inusual. (d) Se consideraría una muestra aleatoria de 250 estudiantes universitarios donde el 12% son vegetarianos. inusual. (e) El error estándar se reduciría a la mitad si aumentáramos el tamaño de la muestra de 125 hasta 250. 6.2 Jóvenes estadounidenses, Parte I. Aproximadamente el 77 % de los adultos jóvenes creen que pueden alcanzar el sueño americano. Determine si las siguientes afirmaciones son verdaderas o falsas y explique su razonamiento.36 (a) La distribución de las proporciones muestrales de jóvenes estadounidenses que creen que pueden alcanzar el sueño americano El sueño americano en muestras de tamaño 20 queda sesgado. (b) La distribución de proporciones muestrales de jóvenes estadounidenses que creen que pueden alcanzar el sueño americano en muestras aleatorias de tamaño 40 es aproximadamente normal ya que n ≥ 30. (c) Una muestra aleatoria de 60 jóvenes estadounidenses donde el 85% cree que puede alcanzar el sueño americano El sueño sería considerado inusual. (d) Una muestra aleatoria de 120 jóvenes estadounidenses donde el 85% cree que puede lograr los objetivos estadounidenses. El sueño sería considerado inusual. 6.3 Gatos atigrados naranjas. Supongamos que el 90 % de los gatos atigrados naranjas son machos. Determine si las siguientes afirmaciones son verdaderas o falsas y explique su razonamiento. (a) La distribución de las proporciones muestrales de muestras aleatorias de tamaño 30 es asimétrica a la izquierda. (b) Usar un tamaño de muestra cuatro veces mayor reducirá el error estándar de la muestra. proporción a la mitad. (c) La distribución de proporciones muestrales de muestras aleatorias de tamaño 140 es aproximadamente normal. (d) La distribución de proporciones muestrales de muestras aleatorias de tamaño 280 es aproximadamente normal. 6.4 Jóvenes estadounidenses, Parte II. Aproximadamente el 25 % de los jóvenes estadounidenses han pospuesto formar una familia debido a la continua crisis económica. Determine si las siguientes afirmaciones son verdaderas o falsas y explique su razonamiento.37 (a) La distribución de las proporciones muestrales de jóvenes estadounidenses que han pospuesto formar una familia debido a la continua crisis económica en muestras aleatorias de tamaño 12 es asimétrica a la derecha. (b) Para que la distribución de las proporciones muestrales de jóvenes estadounidenses que han pospuesto formar una familia debido a la continua crisis económica sea aproximadamente normal, necesitamos muestras aleatorias con un tamaño muestral de al menos 40. (c) Una muestra aleatoria de 50 jóvenes estadounidenses, de los cuales el 20% ha retrasado formar una familia debido a la continua crisis económica, se consideraría inusual. (d) Una muestra aleatoria de 150 jóvenes estadounidenses, de los cuales el 20% ha retrasado formar una familia debido a la continua crisis económica, se consideraría inusual. (e) Triplicar el tamaño de la muestra reducirá el error estándar de la proporción de la muestra en un tercio. 36A. Vaughn. «Encuesta revela optimismo entre los jóvenes adultos, pero no en cuanto al dinero». En: Los Angeles Times (2011). 37Demos.org. “El Estado de los Jóvenes Estadounidenses: La Encuesta”. En: (2011). Machine Translated by Google 6.7. EJERCICIOS 299 6.5 Proposición 19 en California. En una encuesta de Survey USA de 2010, el 70 % de los 119 encuestados de entre 18 y 34 años afirmó que votaría en las elecciones generales de 2010 a favor de la Proposición 19, que modificaría la ley de California para legalizar la marihuana y permitir su regulación y tributación. Con un nivel de confianza del 95 %, esta muestra tiene un margen de error del 8 %. Con base en esta información, determine si las siguientes afirmaciones son verdaderas o falsas y explique su razonamiento. 38 (a) Tenemos un 95% de confianza en que entre el 62% y el 78% de los votantes de California en esta muestra Apoya la Proposición 19. (b) Tenemos un 95% de confianza en que entre el 62% y el 78% de todos los votantes de California entre las edades de 18 y 34 apoyan la Proposición 19. (c) Si consideramos muchas muestras aleatorias de 119 votantes de California entre las edades de 18 y 34, y calculamos intervalos de confianza del 95% para cada uno, el 95% de ellos incluirá la verdadera proporción de la población de californianos que apoyan la Proposición 19. (d) Para reducir el margen de error al 4%, necesitaríamos cuadriplicar (multiplicar por 4) el tamaño de la muestra. (e) Con base en este intervalo de confianza, hay evidencia suficiente para concluir que la mayoría de Los votantes de California entre 18 y 34 años apoyan la Proposición 19. 6.6 Ley de Salud de 2010. El 28 de junio de 2012, la Corte Suprema de Estados Unidos ratificó la debatida ley de salud de 2010, declarándola constitucional. Una encuesta de Gallup publicada al día siguiente de esta decisión indica que el 46 % de 1012 estadounidenses está de acuerdo con ella. Con un nivel de confianza del 95 %, esta muestra tiene un margen de error del 3 %. Con base en esta información, determine si las siguientes afirmaciones son verdaderas o falsas y explique su razonamiento.39 (a) Estamos 95% seguros de que entre el 43% y el 49% de los estadounidenses en esta muestra apoyan la Decisión de la Corte Suprema de Estados Unidos sobre la ley de atención médica de 2010. (b) Estamos 95% seguros de que entre el 43% y el 49% de los estadounidenses apoyan la decisión del La Corte Suprema de Estados Unidos sobre la ley de atención médica de 2010. (c) Si consideramos muchas muestras aleatorias de 1.012 estadounidenses y calculamos las proporciones muestrales de aquellos que apoyan la decisión de la Corte Suprema de Estados Unidos, el 95% de esas proporciones muestrales estarán entre el 43% y el 49%. (d) El margen de error con un nivel de confianza del 90% sería superior al 3%. el 6.7 Fuegos artificiales el 4 de julio. A finales de junio de 2012, Survey USA publicó los resultados de una encuesta que indicaba que el 56 % de los 600 residentes de Kansas seleccionados al azar planeaban encender fuegos artificiales el 4 de julio . Determine el margen de error para la estimación puntual del 56% utilizando un nivel de confianza del 95%.40 6.8 Conductores de edad avanzada. En enero de 2011, The Marist Poll publicó un informe que indicaba que el 66 % de los adultos a nivel nacional cree que los conductores con licencia deberían estar obligados a volver a presentar el examen práctico de conducir al cumplir los 65 años. También se informó que se entrevistaron a 1018 adultos estadounidenses, con un margen de error del 3 % utilizando un nivel de confianza del 95 %.41 (a) Verifique el margen de error informado por The Marist Poll. (b) Con base en un intervalo de confianza del 95%, ¿la encuesta proporciona evidencia convincente de que más del 70% de la población piensa que a los conductores con licencia se les debería exigir volver a tomar su examen de manejo una vez que cumplen 65 años? 38Survey USA, encuesta electoral n.° 16804, datos recopilados del 8 al 11 de julio de 2010. 39Gallup y los estadounidenses emiten una decisión dividida sobre la normativa sanitaria, datos recopilados el 28 de junio de 2012. 40Survey USA, Encuesta de noticias n.° 19333, datos recopilados el 27 de junio de 2012. Encuesta 41Marist, Normas de circulación: ¿Volver a realizar pruebas a los conductores a los 65 años?, 4 de marzo de 2011. Machine Translated by Google 300 CAPÍTULO 6. INFERENCIA PARA DATOS CATEGÓRICOS 6.9 La vida después de la universidad. Nos interesa estimar la proporción de graduados de una universidad mediana que encontraron trabajo en el plazo de un año tras finalizar su licenciatura. Supongamos que realizamos una encuesta y descubrimos que 348 de los 400 graduados seleccionados aleatoriamente encontraron trabajo. La generación de graduados en cuestión incluyó a más de 4500 estudiantes. (a) Describa el parámetro poblacional de interés. ¿Cuál es el valor de la estimación puntual de este? ¿parámetro? (b) Verifique si se cumplen las condiciones para construir un intervalo de confianza basado en estos datos. (c) Calcule un intervalo de confianza del 95% para la proporción de graduados que encontraron un trabajo dentro del año de completar su título universitario en esta universidad e interprete este intervalo en el contexto de los datos. (d) ¿Qué significa “95% de confianza”? (e) Ahora calcule un intervalo de confianza del 99% para el mismo parámetro e interpretelo en el contexto de los datos. (f) Compare la amplitud de los intervalos de confianza del 95% y del 99%. ¿Cuál es mayor? Explique. 6.10 Calificación de vida en Grecia. Grecia enfrenta una grave crisis económica desde finales de 2009. Una encuesta de Gallup encuestó a 1.000 griegos escogidos al azar en 2011 y descubrió que el 25% de ellos dijeron que calificarían sus vidas lo suficientemente mal como para ser consideradas “sufrimiento”.42 (a) Describa el parámetro poblacional de interés. ¿Cuál es el valor de la estimación puntual de este? ¿parámetro? (b) Verifique si se cumplen las condiciones requeridas para construir un intervalo de confianza basado en estos datos. se reunió. (c) Construya un intervalo de confianza del 95% para la proporción de griegos que “sufren”. (d) Sin hacer ningún cálculo, describa qué sucedería con el intervalo de confianza si decidiéramos utilizar un nivel de confianza más alto. (e) Sin realizar ningún cálculo, describa qué sucedería con el intervalo de confianza si utilizáramos una muestra más grande. 6.11 Estudiar en el extranjero. Una encuesta realizada a 1509 estudiantes de último año de secundaria que presentaron el examen SAT y completaron una encuesta web opcional entre el 25 y el 30 de abril de 2007 muestra que el 55 % de los estudiantes de último año de secundaria están bastante seguros de participar en un programa de estudios en el extranjero durante su etapa universitaria.43 (a) ¿Es esta muestra representativa de la población de estudiantes de último año de secundaria en Estados Unidos? Explique su razonamiento. (b) Supongamos que se cumplen las condiciones para la inferencia. Incluso si su respuesta a la parte (a) indica que este enfoque no sería fiable, podría ser interesante realizar este análisis (aunque no informarlo). Construya un intervalo de confianza del 90 % para la proporción de estudiantes de último año de secundaria (de aquellos que presentaron el examen SAT) que están bastante seguros de participar en un programa de estudios en el extranjero en la universidad e interprete este intervalo en contexto. (c) ¿Qué significa “90% de confianza”? (d) Con base en este intervalo, ¿sería apropiado afirmar que la mayoría de los estudiantes de último año de secundaria están bastante seguros de que participarán en un programa de estudios en el extranjero en la universidad? 42Gallup World, Más de uno de cada 10 “sufre” en todo el mundo, datos recopilados a lo largo de 2011. 43studentPOLL, Intereses de los estudiantes que van a la universidad en estudiar en el extranjero y otros aprendizajes internacionales Actividades, enero 2008. Machine Translated by Google 6.7. EJERCICIOS 301 6.12 Legalización de la marihuana, Parte I. La Encuesta Social General de 2010 preguntó a 1259 residentes de EE. UU.: "¿Cree que el consumo de marihuana debería legalizarse o no?". El 48 % de los encuestados respondió que sí.44 (a) ¿El 48 % es una estadística muestral o un parámetro poblacional? Explique. (b) Construya un intervalo de confianza del 95 % para la proporción de residentes de EE. UU. que creen que la marihuana... Debería legalizarse e interpretarse en el contexto de los datos. (c) Un crítico señala que este intervalo de confianza del 95 % solo es preciso si el estadístico sigue una distribución normal o si el modelo normal es una buena aproximación. ¿Es esto cierto para estos datos? Explique. (d) Una noticia sobre los resultados de esta encuesta afirma: “La mayoría de los estadounidenses piensa que se debería legalizar la marihuana”. Según su intervalo de confianza, ¿está justificada la afirmación de esta noticia? 6.13 Opción pública, Parte I. Un artículo del Washington Post de 2009 informó que "el apoyo a un plan de atención médica administrado por el gobierno para competir con las aseguradoras privadas se ha recuperado de sus mínimos del verano y obtiene un claro apoyo mayoritario del público". Más específicamente, el artículo dice que "siete de cada 10 demócratas respaldan el plan, mientras que casi nueve de cada 10 republicanos se oponen. Los independientes se dividen en un 52 por ciento en contra y un 42 por ciento a favor de la legislación". (El 6% respondió con "otro"). Se encuestaron 819 demócratas, 566 republicanos y 783 independientes.45 (a) Un comentarista político en la televisión afirma que la mayoría de los independientes se oponen al plan de opción pública de atención médica. ¿Estos datos proporcionan evidencia sólida para respaldar esta afirmación? (b) ¿Esperaría que un intervalo de confianza para la proporción de independientes que se oponen al plan de opción pública incluya 0,5? Explique. 6.14 La Guerra Civil. Una encuesta nacional realizada en 2011 entre una muestra aleatoria simple de 1507 adultos muestra que el 56 % de los estadounidenses cree que la Guerra Civil sigue siendo relevante para la política y la vida política estadounidenses.46 (a) Realice una prueba de hipótesis para determinar si estos datos proporcionan evidencia sólida de que la mayoría De los estadounidenses, la Guerra Civil sigue siendo relevante. (b) Interprete el valor p en este contexto. (c) Calcule un intervalo de confianza del 90 % para la proporción de estadounidenses que consideran que la Guerra Civil sigue siendo relevante. Interprete el intervalo en este contexto y comente si el intervalo de confianza concuerda con la conclusión de la prueba de hipótesis. 6.15 Navegación en el dispositivo móvil. Una encuesta realizada en 2012 a 2254 adultos estadounidenses indica que el 17 % de los usuarios de teléfonos celulares navegan en su teléfono en lugar de en una computadora u otro dispositivo.47 (a) Según un artículo en línea, un informe de una empresa de investigación móvil indica que el 38 por ciento de los usuarios chinos de internet móvil solo acceden a internet a través de sus teléfonos celulares.48 Realice una prueba de hipótesis para determinar si estos datos proporcionan evidencia sólida de que la proporción de estadounidenses que solo usan sus teléfonos celulares para acceder a internet es diferente a la proporción china del 38%. (b) Interprete el valor p en este contexto. (c) Calcule un intervalo de confianza del 95 % para la proporción de estadounidenses que acceden a internet. en sus teléfonos móviles e interpretan el intervalo en este contexto. 44Centro Nacional de Investigación de Opinión, Encuesta Social General, 2010. 45D. Balz y J. Cohen. “La mayoría apoya la opción pública de seguro médico, según una encuesta”. En: The El Washington Post (2009). 46Pew Research Center Publications, La Guerra Civil a los 150 años: sigue siendo relevante, sigue siendo divisiva, datos recopilados entre el 30 de marzo y el 3 de abril de 2011. 47Pew Internet, Cell Internet Use 2012, datos recopilados entre el 15 de marzo y el 13 de abril de 2012. 48S. Chang. “A los chinos les encanta usar teléfonos básicos para acceder a internet”. En: MIC Gadget (2012). Machine Translated by Google 302 CAPÍTULO 6. INFERENCIA PARA DATOS CATEGÓRICOS 6.16 ¿Vale la pena ir a la universidad? Parte I. En una muestra aleatoria simple de 331 adultos estadounidenses sin título universitario de cuatro años ni matriculados en la escuela, el 48 % afirmó no ir a la universidad porque no podía costearla.49 (a) Un artículo periodístico afirma que solo una minoría de los estadounidenses que deciden no ir a la universidad lo hacen porque no pueden costearla y utiliza la estimación puntual de esta encuesta como evidencia. Realice una prueba de hipótesis para determinar si estos datos proporcionan evidencia sólida que respalde esta afirmación. (b) ¿Esperaría que un intervalo de confianza para la proporción de adultos estadounidenses que deciden no ir a la universidad porque no pueden costearla incluya 0,5? Explique. 6.17 Prueba de sabor. Algunas personas afirman que pueden distinguir entre un refresco light y uno normal al primer sorbo. Un investigador, que quería comprobar esta afirmación, seleccionó aleatoriamente a 80 de estas personas. Luego, llenó 80 vasos blancos con refresco, la mitad light y la otra mitad normal, mediante una asignación aleatoria, y pidió a cada persona que tomara un sorbo de su vaso e identificara el refresco como light o normal. 53 participantes identificaron correctamente el refresco. (a) ¿Estos datos proporcionan evidencia sólida de que estas personas son capaces de detectar la diferencia entre un refresco light y uno normal? En otras palabras, ¿son los resultados significativamente mejores que una simple suposición aleatoria? (b) Interprete el valor p en este contexto. 6.18 ¿Vale la pena ir a la universidad? Parte II. El ejercicio 6.16 presenta los resultados de una encuesta donde el 48 % de 331 estadounidenses que deciden no ir a la universidad lo hacen porque no pueden costearla. (a) Calcule un intervalo de confianza del 90 % para la proporción de estadounidenses que deciden no ir a la universidad porque no pueden costearla e interprete el intervalo en contexto. (b) Supongamos que queremos que el margen de error para el nivel de confianza del 90% sea de aproximadamente el 1,5%. ¿Qué tamaño de encuesta recomendarías? 6.19 Fumadores universitarios. Nos interesa estimar la proporción de estudiantes de una universidad que fuman. De una muestra aleatoria de 200 estudiantes de esta universidad, 40 fuman. (a) Calcule un intervalo de confianza del 95 % para la proporción de estudiantes de esta universidad que fuman e interprete este intervalo en contexto. (Recordatorio: verifique las condiciones). (b) Si quisiéramos que el margen de error no fuera mayor del 2 % con un nivel de confianza del 95 % para... proporción de estudiantes que fuman, ¿qué tamaño de muestra necesitaríamos? 6.20 Legalizar la marihuana, Parte II. Como se explicó en el Ejercicio 6.12, la Encuesta Social General de 2010 reportó una muestra en la que aproximadamente el 48% de los residentes de EE. UU. pensaba que la marihuana debería legalizarse. Si quisiéramos limitar el margen de error de un intervalo de confianza del 95% al 2%, ¿aproximadamente cuántos estadounidenses necesitaríamos encuestar? 6.21 Opción pública, Parte II. El ejercicio 6.13 presenta los resultados de una encuesta que evaluó el apoyo a la opción pública de atención médica en 2009. El 52% de los independientes de la muestra se opuso a la opción pública. Si quisiéramos estimar esta cifra con una precisión del 1% y un 90% de confianza, ¿cuál sería el tamaño de muestra adecuado? 6.22 Acetaminofén y daño hepático. Se cree que altas dosis de acetaminofén (el ingrediente activo de analgésicos de venta libre como el Tylenol) pueden causar daño hepático. Un investigador quiere realizar un estudio para estimar la proporción de usuarios de acetaminofén que presentan daño hepático. Por participar en este estudio, pagará a cada sujeto $20 y brindará una consulta médica gratuita si el paciente presenta daño hepático. (a) Si quiere limitar el margen de error de su intervalo de confianza del 98% al 2%, ¿cuál es la cantidad mínima de dinero que necesita reservar para pagar a sus sujetos? (b) La cantidad que calculó en la parte (a) supera considerablemente su presupuesto, por lo que decide usar Menos sujetos. ¿Cómo afectará esto la amplitud de su intervalo de confianza? 49Pew Research Center Publications, ¿Vale la pena la universidad?, datos recopilados entre el 15 y el 29 de marzo de 2011. Machine Translated by Google 6.7. EJERCICIOS 303 6.7.2 Diferencia de dos proporciones 6.23 Experimento social, Parte I. Un “experimento social” realizado por un programa de televisión cuestionó lo que hacen las personas cuando ven a una mujer visiblemente lastimada siendo molestada por su padre. novio. En dos ocasiones diferentes en el mismo restaurante, la misma pareja fue retratada. En En un escenario la mujer estaba vestida “provocativamente” y en el otro escenario la mujer estaba Vestían de forma conservadora. La siguiente tabla muestra cuántos comensales del restaurante estaban presentes cada escenario, y si intervinieron o no. Guión Total conservador provocador Intervenir Sí 5 15 20 No 15 10 25 Total 20 25 45 Explique por qué la distribución muestral de la diferencia entre las proporciones de las intervenciones En escenarios provocativos y conservadores no sigue una distribución aproximadamente normal. 6.24 Éxito del trasplante de corazón. El Estudio de Trasplante de Corazón de la Universidad de Stanford se realizó para determinar si un programa experimental de trasplante de corazón aumentaba la esperanza de vida. Cada El paciente que ingresó al programa fue designado oficialmente como candidato a trasplante de corazón, lo que significa que Estaba gravemente enfermo y podría beneficiarse de un nuevo corazón. Los pacientes fueron asignados aleatoriamente a grupos de tratamiento y control. Los pacientes del grupo de tratamiento recibieron un trasplante, y los del grupo de control... El grupo de control no lo hizo. La siguiente tabla muestra cuántos pacientes sobrevivieron y murieron en cada grupo.50 tratamiento de control vivo 4 24 muerto 30 45 Una prueba de hipótesis rechazaría la conclusión de que la tasa de supervivencia es la misma en cada grupo, y por eso nos gustaría calcular un intervalo de confianza. Explique por qué no podemos construir tal intervalo utilizando la aproximación normal. ¿Qué podría salir mal si construimos la confianza? intervalo a pesar de este problema? 6.25 Preferencia de género y color. Un estudio de 2001 preguntó a 1924 estudiantes universitarios varones y 3666 mujeres cuál era su color favorito. Se obtuvo un intervalo de confianza del 95 % para la diferencia entre... Se calculó la proporción de hombres y mujeres cuyo color favorito es el negro (phombre −pmujer). es (0,02, 0,06). Con base en esta información, determine si las siguientes afirmaciones son verdaderas o Falso, y explique su razonamiento para cada afirmación que identifique como falsa.51 (a) Estamos 95% seguros de que la verdadera proporción de hombres cuyo color favorito es el negro es del 2%. hasta un 6% más que la proporción real de mujeres cuyo color favorito es el negro. (b) Estamos 95% seguros de que la verdadera proporción de hombres cuyo color favorito es el negro es del 2%. Un 6% más alto que la proporción real de mujeres cuyo color favorito es el negro. (c) El 95% de las muestras aleatorias producirán intervalos de confianza del 95% que incluyen la verdadera diferencia entre las proporciones poblacionales de hombres y mujeres cuyo color favorito es el negro. (d) Podemos concluir que existe una diferencia significativa entre las proporciones de hombres y mujeres cuyo color favorito es el negro y que la diferencia entre las dos proporciones muestrales es demasiado grande para que sea plausible que se deba al azar. (e) El intervalo de confianza del 95% para (pfemale −pmale) no se puede calcular solo con la información proporcionada en este ejercicio. 50B. Turnbull et al. “Supervivencia de los datos de trasplantes cardíacos”. En: Journal of the American Statistical Asociación 69 (1974), págs. 74–80. 51L Ellis y C Ficek. “Preferencias de color según el género y la orientación sexual”. En: Personalidad y Diferencias Individuales 31.8 (2001), págs. 1375­1379. Machine Translated by Google 304 CAPÍTULO 6. INFERENCIA PARA DATOS CATEGÓRICOS 6.26 The Daily Show. Una encuesta de la Fundación Pew Research de 2010 indica que, entre 1099 graduados universitarios, el 33 % ve The Daily Show. Mientras tanto, el 22 % de las 1110 personas encuestadas con título de bachillerato pero sin título universitario ve The Daily Show. Un intervalo de confianza del 95 % para (pgraduado universitario − pHS o menos), donde p es la proporción de quienes ven The Daily Show, es (0,07, 0,15). Con base en esta información, determine si las siguientes afirmaciones son verdaderas o falsas y explique su razonamiento si las considera falsas. 52 (a) Con un nivel de significación del 5%, los datos proporcionan evidencia convincente de una diferencia entre las proporciones de graduados universitarios y aquellos con un título de secundaria o menos que ven The Daily Show. (b) Estamos 95% seguros de que entre un 7% menos y un 15% más de graduados universitarios ven The Daily Show que aquellos con un título de secundaria o inferior. (c) 95% de muestras aleatorias de 1.099 graduados universitarios y 1.110 personas con un título de secundaria o menos producirá diferencias en las proporciones de muestra entre el 7% y el 15%. (d) Un intervalo de confianza del 90% para (pGrado universitario ­ pHS o menos) sería más amplio. (e) Un intervalo de confianza del 95% para (pHS o menos ­ pGrado universitario) es (­0,15,­0,07). 6.27 Opción Pública, Parte III. El ejercicio 6.13 presenta los resultados de una encuesta que evalúa el apoyo al plan de opción pública de atención médica en 2009. El 70% de 819 demócratas y el 42% de 783 independientes apoyan la opción pública. (a) Calcule un intervalo de confianza del 95% para la diferencia entre (pD − pI ) e interprételo en En este contexto, ya hemos comprobado las condiciones. (b) Verdadero o falso: Si hubiéramos elegido un demócrata y un independiente al azar en el momento de esta encuesta, es más probable que el demócrata apoyara la opción pública que el independiente. 6.28 Privación del sueño, CA vs. OR, Parte I. Según un informe sobre la privación del sueño de los Centros para el Control y la Prevención de Enfermedades, la proporción de residentes de California que reportaron descanso o sueño insuficiente durante cada uno de los 30 días anteriores es del 8.0%, mientras que esta proporción es del 8.8% para los residentes de Oregón. Estos datos se basan en muestras aleatorias simples de 11,545 residentes de California y 4,691 de Oregón. Calcule un intervalo de confianza del 95% para la diferencia entre las proporciones de californianos y oregonianos con privación del sueño e interprételo en el contexto de los datos.53 6.29 Perforación petrolera en alta mar, Parte I. Una encuesta de 2010 preguntó a 827 votantes registrados de California, seleccionados al azar, "¿Apoya? ¿O se opone? ¿A la perforación de petróleo y gas natural en la costa de California? ¿O no sabe lo suficiente para opinar?". A continuación, se muestra la distribución de las respuestas, según si el encuestado se graduó o no de la universidad.54 (a) ¿Qué porcentaje de graduados universitarios y qué porcentaje de no graduados universitarios en esta muestra no sabe lo suficiente como para opinar sobre la perforación de petróleo y gas natural en la costa de California? Graduado universitario Sí No Oponerse a 154 180 No sé 104 Total 438 Apoyo (b) Realice una prueba de hipótesis para determinar si los datos proporcionan evidencia sólida de que la proporción de graduados universitarios que no tienen una opinión sobre este tema es diferente a la de los no graduados universitarios. 132 126 131 389 52The Pew Research Center, Los estadounidenses pasan más tiempo siguiendo las noticias, datos recopilados del 8 al 28 de junio de 2010. 53CDC, Descanso o sueño insuficiente percibido entre adultos — Estados Unidos, 2008. 54Survey USA, encuesta electoral n.° 16804, datos recopilados del 8 al 11 de julio de 2010. Machine Translated by Google 6.7. EJERCICIOS 305 6.30 Privación del sueño, CA vs. OR, Parte II. El ejercicio 6.28 proporciona datos sobre las tasas de privación del sueño en californianos y oregonianos. La proporción de residentes de California que informaron... La falta de descanso o sueño durante cada uno de los 30 días anteriores es del 8,0%, mientras que esta proporción es del 8,8%. para los residentes de Oregón. Estos datos se basan en muestras aleatorias simples de 11,545 residentes de California y 4.691 residentes de Oregón. (a) Realice una prueba de hipótesis para determinar si estos datos proporcionan evidencia sólida de la tasa de sueño. La privación varía según el estado. (Recordatorio: consultar las condiciones) (b) Es posible que la conclusión de la prueba en la parte (a) sea incorrecta. Si este es el caso, ¿qué tipo ¿Se cometió algún error? 6.31 Perforación marina, Parte II. Resultados de una encuesta que evalúa el apoyo a la perforación petrolera y En el ejercicio 6.29 se introdujeron datos de gas natural en las costas de California . Graduado universitario Sí No Soporte 154 132 Oponerse 180 126 No sé 104 131 Total 438 389 (a) ¿Qué porcentaje de graduados universitarios y qué porcentaje de no graduados universitarios en esta muestra? ¿Apoyar la perforación de pozos de petróleo y gas natural en las costas de California? (b) Realice una prueba de hipótesis para determinar si los datos proporcionan evidencia sólida de que la proporción El porcentaje de graduados universitarios que apoyan las perforaciones en alta mar en California es diferente al de aquellos que no tienen graduados universitarios. 6.32 Escaneo corporal completo, Parte I. Un artículo de noticias informa que “los estadounidenses tienen diferentes puntos de vista sobre dos prácticas potencialmente incómodas e invasivas que los aeropuertos podrían implementar para descubrir posibles ataques terroristas”. Esta noticia se basó en una encuesta realizada al azar muestra de 1.137 adultos a nivel nacional, entrevistados telefónicamente del 7 al 10 de noviembre de 2010, donde uno de Las preguntas de la encuesta fueron: “Algunos aeropuertos ahora están utilizando máquinas de rayos X digitales de “cuerpo completo” para Revisar electrónicamente a los pasajeros en las filas de seguridad del aeropuerto. ¿Crees que estas nuevas máquinas de rayos X...? ¿Debería o no utilizarse en los aeropuertos?” A continuación se presenta un resumen de las respuestas según el partido afiliación.55 Afiliación a un partido Debería Respuesta Republicano Demócrata Independiente 264 299 351 No debería 38 55 77 No sé/No hay respuesta Total 16 15 22 318 369 450 (a) Realice una prueba de hipótesis apropiada para evaluar si existe una diferencia en la proporción de republicanos y demócratas que piensan que se deben aplicar exploraciones de cuerpo completo en Aeropuertos. Supongamos que se cumplen todas las condiciones pertinentes. (b) La conclusión de la prueba en la parte (a) puede ser incorrecta, lo que significa que se cometió un error de prueba. Si Se cometió un error. ¿Fue de tipo I o de tipo II? Explique. 55S. Condon. “Encuesta: 4 de cada 5 apoyan los escáneres corporales en aeropuertos”. En: CBS News (2010). Machine Translated by Google 306 CAPÍTULO 6. INFERENCIA PARA DATOS CATEGÓRICOS 6.33 Trabajadores del transporte privados de sueño. La Fundación Nacional del Sueño realizó un estudio Encuesta sobre los hábitos de sueño de trabajadores del transporte seleccionados al azar y una muestra de control de Trabajadores no relacionados con el transporte. Los resultados de la encuesta se muestran a continuación.56 Profesionales del transporte Control de trenes de Bux/Taxi/Limusina Menos de 6 horas de sueño 6 a 8 camiones Pilotos Conductores Operadores Conductores 35 19 35 29 132 117 119 21 horas de sueño Más de 8 horas 193 131 64 51 51 32 58 Total 292 202 203 180 210 Realice una prueba de hipótesis para evaluar si estos datos proporcionan evidencia de una diferencia entre los proporciones de conductores de camiones y trabajadores no relacionados con el transporte (el grupo de control) que ganan menos de 6 horas de sueño al día, es decir se considera falta de sueño. 6.34 Vitaminas prenatales y autismo. Investigadores que estudian la relación entre las vitaminas prenatales Uso y autismo: se encuestó a las madres de una muestra aleatoria de niños de entre 24 y 60 meses con autismo y realizó otra muestra aleatoria separada para niños con desarrollo típico. El La siguiente tabla muestra el número de madres de cada grupo que utilizaron y no utilizaron vitaminas prenatales. durante los tres meses previos al embarazo (período periconcepcional).57 Autismo Periconcepcional Sin vitamina Vitamina prenatal Vitamina Total Autismo Desarrollo típico Total 111 70 181 143 159 302 254 229 483 (a) Plantee hipótesis apropiadas para comprobar la independencia del uso de vitaminas prenatales durante el embarazo. tres meses antes del embarazo y el autismo. (b) Complete la prueba de hipótesis y establezca una conclusión apropiada. (Recordatorio: verifique cualquier condiciones necesarias para la prueba.) (c) Un artículo del New York Times que informaba sobre este estudio se titulaba “Las vitaminas prenatales pueden prevenir Fuera del autismo. ¿Te parece apropiado el título de este artículo? Explica tu respuesta. Además, proponga un título alternativo.58 6.35 VIH en África subsahariana. En julio de 2008, los Institutos Nacionales de Salud de EE. UU. anunciaron la interrupción anticipada de un estudio clínico debido a resultados inesperados. El estudio... La población estaba formada por mujeres infectadas por el VIH en el África subsahariana a las que se les había administrado una sola dosis. dosis de Nevaripina (un tratamiento para el VIH) durante el parto, para prevenir la transmisión del VIH al Bebé. El estudio fue una comparación aleatoria del tratamiento continuo de una mujer (después de un parto exitoso) con nevaripina frente a lopinavir, un segundo fármaco utilizado para tratar el VIH. 240 mujeres participaron en el estudio; 120 fueron asignados aleatoriamente a cada uno de los dos tratamientos. Veinticuatro semanas Después de iniciar el tratamiento del estudio, a cada mujer se le realizó una prueba para determinar si la infección por VIH era empeorando (un resultado llamado fracaso virológico). Veintiséis de las 120 mujeres tratadas con La nevaripina experimentó un fracaso virológico, mientras que 10 de las 120 mujeres tratadas con el otro fármaco Experimentaron un fracaso virológico.59 (a) Cree una tabla de dos vías que presente los resultados de este estudio. (b) Plantee hipótesis apropiadas para comprobar la independencia del tratamiento y el fracaso virológico. (c) Complete la prueba de hipótesis y establezca una conclusión apropiada. (Recordatorio: verifique cualquier condiciones necesarias para la prueba.) 56National Sleep Foundation, Encuesta sobre el sueño en Estados Unidos de 2012: El sueño de los trabajadores del transporte, 2012. 57R.J. Schmidt et al. “Vitaminas prenatales, variantes genéticas del metabolismo de un carbono y riesgo de autismo”. En: Epidemiología 22.4 (2011), pág. 476. 58R.C. Rabin. “Patrones: Las vitaminas prenatales podrían prevenir el autismo”. En: New York Times (2011). 59S. Lockman et al. “Respuesta a la terapia antirretroviral tras una dosis única de nevirapina durante el periparto”. En: Encuesta obstétrica y ginecológica 62.6 (2007), pág. 361. Machine Translated by Google 6.7. EJERCICIOS 307 6.36 Diabetes y desempleo. Una encuesta de Gallup de 2012 encuestó a estadounidenses sobre su situación laboral y si padecían diabetes. Los resultados indican que el 1,5 % de las 47 774 personas empleadas (a tiempo completo o parcial) y el 2,5 % de los 5855 desempleados de entre 18 y 29 años padecen diabetes. 60 (a) Cree una tabla de doble entrada que presente los resultados de este estudio. (b) Establezca hipótesis apropiadas para probar la independencia de la incidencia de diabetes y el empleo. estado. (c) La diferencia muestral es de aproximadamente el 1 %. Si completamos la prueba de hipótesis, encontraríamos que el valor p es muy pequeño (aproximadamente 0), lo que significa que la diferencia es estadísticamente significativa. Utilice este resultado para explicar la diferencia entre los hallazgos estadísticamente significativos y los prácticamente significativos. 6.7.3 Prueba de bondad de ajuste mediante chi­cuadrado 6.37 Verdadero o falso, Parte I. Determine si las siguientes afirmaciones son verdaderas o falsas. Para cada afirmación falsa, sugiera una redacción alternativa para convertirla en verdadera. (a) La distribución chi­cuadrado, al igual que la distribución normal, tiene dos parámetros: media y desviación estándar. (b) La distribución de chi­cuadrado siempre está sesgada hacia la derecha, independientemente del valor del parámetro de grados de libertad. (c) La estadística de chi­cuadrado siempre es positiva. (d) A medida que aumentan los grados de libertad, la forma de la distribución de chi­cuadrado se vuelve más sesgado. 6.38 Verdadero o falso, Parte II. Determine si las siguientes afirmaciones son verdaderas o falsas. Para cada afirmación falsa, sugiera una redacción alternativa para convertirla en verdadera. (a) A medida que aumentan los grados de libertad, aumenta la media de la distribución chi­cuadrado. (b) Si encontró X. (c) Al calcular el valor p de una prueba chi­cuadrado, 2 = 10 con df = 5 no podría rechazar H0 en el nivel de significancia del 5%. siempre sombreamos las áreas de las colas en ambas colas. (d) A medida que aumentan los grados de libertad, disminuye la variabilidad de la distribución chi­cuadrado. 6.39 Libro de texto de código abierto. Un profesor, que utiliza un libro introductorio de estadística de código abierto, predice que el 60 % de los estudiantes comprará una copia impresa, el 25 % lo imprimirá de la web y el 15 % lo leerá en línea. Al final del semestre, pide a sus estudiantes que completen una encuesta donde indiquen el formato del libro que usaron. De los 126 estudiantes, 71 dijeron haber comprado una copia impresa, 30 dijeron haberlo impreso de la web y 25 dijeron haberlo leído en línea. (a) Indique las hipótesis para probar si las predicciones del profesor fueron inexactas. (b) ¿Cuántos estudiantes esperaba el profesor que compraran el libro, lo imprimieran y lo leyeran? ¿Reservar exclusivamente online? (c) Esta es una configuración apropiada para una prueba de chi­cuadrado. Enumere las condiciones requeridas para una prueba y verificar que estén satisfechos. (d) Calcule la estadística de chi­cuadrado, los grados de libertad asociados a ella y el valor p. (e) Con base en el valor p calculado en la parte (d), ¿cuál es la conclusión de la prueba de hipótesis? Interprete su conclusión en este contexto. 60Gallup Wellbeing: Los estadounidenses empleados tienen mejor salud que los desempleados, datos recopilados en enero. 2, 2011 – 21 de mayo de 2012. Machine Translated by Google 308 CAPÍTULO 6. INFERENCIA PARA DATOS CATEGÓRICOS 6.40 Evolución vs. creacionismo. Una encuesta de Gallup publicada en diciembre de 2010 preguntó a 1019 adultos. que viven en los Estados Unidos continentales sobre su creencia en el origen de los humanos. Estos resultados, junto con resultados de una encuesta más completa de 2001 (que asumiremos que es completamente exacta), se resumen en la siguiente tabla:61 Año Respuesta 2010 2001 Los humanos evolucionaron con la guía de Dios (1) 38% 37% Los humanos evolucionaron, pero Dios no tuvo parte en el proceso (2) 16% 12% Dios creó a los humanos en su forma actual (3) 40% 45% Otro / Sin opinión (4) 6% 6% (a) Calcule el número real de encuestados en 2010 que caen en cada categoría de respuesta. (b) Plantee hipótesis para la siguiente pregunta de investigación: ¿Tiene creencias sobre el origen de la vida humana? ¿Ha cambiado desde 2001? (c) Calcule el número esperado de encuestados en cada categoría bajo la condición de que La hipótesis nula de la parte (b) es verdadera. (d) Realice una prueba de chi­cuadrado y exprese su conclusión. (Recordatorio: verifique las condiciones). 6.7.4 Prueba de independencia en tablas de dos vías 6.41 Personas que dejan de fumar. ¿Formar parte de un grupo de apoyo afecta la capacidad de las personas para dejar de fumar? Un departamento de salud del condado inscribió a 300 fumadores en un experimento aleatorio. 150 participantes fueron asignados a un grupo que usaba un parche de nicotina y se reunía semanalmente con un grupo de apoyo; Otros 150 recibieron el parche y no se reunieron con un grupo de apoyo. Al final del estudio, 40 de los participantes en el grupo de parche más apoyo habían dejado de fumar, mientras que sólo 30 fumadores habían dejar en el otro grupo. (a) Cree una tabla de dos vías que presente los resultados de este estudio. (b) Responda cada una de las siguientes preguntas bajo la hipótesis nula de que ser parte de un soporte El grupo no afecta la capacidad de las personas para dejar de fumar, e indica si se espera que Los valores son mayores o menores que los valores observados. i. ¿Cuántos sujetos del grupo “parche + apoyo” esperarías que abandonaran? ii. ¿Cuántos sujetos del grupo que solo tomó el parche esperaría que no abandonaran el tratamiento? 6.42 Escaneo corporal completo, Parte II. La siguiente tabla resume un conjunto de datos que encontramos por primera vez. en el Ejercicio 6.32 sobre las opiniones sobre escaneos de cuerpo completo y afiliación política. Las diferencias en Cada grupo político puede deberse al azar. Complete los siguientes cálculos bajo la hipótesis nula. Hipótesis de independencia entre la afiliación partidaria de un individuo y su apoyo a un partido político de cuerpo entero. escaneos. Puede ser útil agregar primero una columna adicional para los totales de fila antes de continuar con el cálculos. Afiliación a un partido Debería Respuesta Republicano Demócrata Independiente 264 299 351 No debería 38 55 77 No sé/No hay respuesta Total 16 15 22 318 369 450 (a) ¿Cuántos republicanos esperarías que no apoyaran el uso de escáneres de cuerpo completo? (b) ¿Cuántos demócratas esperaría que apoyaran el uso de escáneres de cuerpo completo? (c) ¿Cuántos independientes esperaría usted que no supieran o no respondieran? Cuatro de cada diez estadounidenses creen en el creacionismo estricto, 17 de diciembre de 2010, http://www.gallup.com/ encuesta/145286/Cuatro­estadounidenses­creen­en­el­creacionismo­estricto.aspx. Machine Translated by Google 6.7. EJERCICIOS 309 6.43 Perforación marina, Parte III. La siguiente tabla resume un conjunto de datos que encontramos por primera vez. En el Ejercicio 6.29 , que examina las respuestas de una muestra aleatoria de graduados universitarios y no graduados sobre el tema de la perforación petrolera, realice una prueba de chi­cuadrado para estos datos para comprobar si... Hay una diferencia estadísticamente significativa en las respuestas de los graduados universitarios y los no graduados. Graduado universitario Sí No Oponerse a 154 180 No sé 104 Total 438 Apoyo 132 126 131 389 6.44 Café y depresión. Investigadores realizaron un estudio que investigó la relación Entre el consumo de café con cafeína y el riesgo de depresión en mujeres. Recopilaron datos sobre 50.739 mujeres libres de síntomas de depresión al inicio del estudio en el año 1996, y Se hizo un seguimiento de estas mujeres hasta 2006. Los investigadores utilizaron cuestionarios para recopilar datos sobre consumo de café con cafeína, se preguntó a cada individuo sobre la depresión diagnosticada por el médico y También se preguntó sobre el uso de antidepresivos. La siguiente tabla muestra la distribución de incidencias. de depresión según la cantidad de consumo de café con cafeína.62 ≤1 Depresión Sí Consumo de café con cafeína 1 2­6 2­3 ≥4 taza/semana tazas/semana taza/día tazas/día tazas/día Total 670 373 905 95 2.607 564 11.545 12.215 clínica No Total 6.244 6.617 16.329 17.234 11.726 12.290 2.288 48.132 2.383 50.739 (a) ¿Qué tipo de prueba es apropiada para evaluar si existe una asociación entre el consumo de café ¿Y la depresión? (b) Escriba las hipótesis para la prueba que identificó en la parte (a). (c) Calcule la proporción general de mujeres que sufren y no sufren depresión. (d) Identifique el recuento esperado para la celda resaltada y calcule la contribución de esta celda. 2 a la estadística de prueba, es decir (Observado − Esperado) /Esperado. (e) La estadística de prueba es X 2 = 20,93. ¿Cuál es el valor p? (f) ¿Cuál es la conclusión de la prueba de hipótesis? (g) Uno de los autores de este estudio fue citado por el NYTimes diciendo que era “demasiado pronto para recomiendan que las mujeres consuman más café” basándose únicamente en este estudio.63 ¿Está de acuerdo con ¿Esta afirmación? Explica tu razonamiento. 62M. Lucas et al. “Café, cafeína y riesgo de depresión en mujeres”. En: Archivos de información interna Medicina 171.17 (2011), pág. 1571. 63A. O'Connor. “El consumo de café se relaciona con una menor depresión en las mujeres”. En: New York Times (2011). Machine Translated by Google 310 CAPÍTULO 6. INFERENCIA PARA DATOS CATEGÓRICOS 6.45 Privacidad en Facebook. Una encuesta de 2011 preguntó a 806 usuarios adultos de Facebook seleccionados al azar. sobre su configuración de privacidad de Facebook. Una de las preguntas de la encuesta era: "¿Sabes?" ¿Cómo ajustar la configuración de privacidad de Facebook para controlar lo que la gente puede y no puede ver? Las respuestas se tabulan de forma cruzada según el género.64 Género Masculino Femenino Total Sí 288 378 666 61 62 123 No estoy seguro 10 7 17 Total 359 447 806 Respuesta No (a) Plantee hipótesis apropiadas para probar la independencia de género y si Facebook Los usuarios saben cómo ajustar su configuración de privacidad. (b) Verifique todas las condiciones necesarias para la prueba y determine si se requiere o no una prueba de chi­cuadrado. se puede completar 6.46 Envío de regalos navideños. Una encuesta de diciembre de 2010 se realizó a 500 residentes de Los Ángeles seleccionados al azar. Los residentes de Los Ángeles preguntan qué transportista prefieren usar para enviar sus regalos navideños. La tabla... A continuación se muestra la distribución de respuestas por grupo de edad, así como los recuentos esperados para cada celda. (mostrado entre paréntesis). Edad 35­54 18­34 Servicio Postal de Estados Unidos Unión Postal Universal Método de envío FedEx Algo más 7 No estoy seguro 3 55+ Total 72 (81) 97 (102) 76 (62) 245 52 (53) 76 (68) 34 (41) 162 31 (21) 24 (27) (16) 64 9 3 126 (5) 6 (7) (4) (5) (5) (3) 165 209 4 6 Total 16 13 500 (a) Enuncie las hipótesis nula y alternativa para probar la independencia de la edad y la preferencia. Método de envío de regalos navideños entre los residentes de Los Ángeles. (b) ¿Se cumplen las condiciones para la inferencia mediante una prueba de chi­cuadrado? 6.7.5 Prueba de hipótesis de muestra pequeña para una proporción 6.47 Acoso escolar. Una encuesta de Survey USA de 2012 preguntó a los residentes de Florida la magnitud del problema. Pensaban que el acoso escolar se daba en las escuelas locales. 9 de 191 jóvenes de entre 18 y 34 años respondieron que el acoso escolar es... No hay problema en absoluto. Con estos datos, ¿es apropiado construir un intervalo de confianza utilizando el Fórmula ˆp±z pˆ(1 − pˆ)/n para la proporción real de floridanos de entre 18 y 34 años que creen que el acoso escolar es una amenaza. ¿No hay ningún problema? Si es apropiado, construya el intervalo de confianza. Si no lo es, explique. por qué. 64Survey USA, Encuesta de noticias n.° 17960, datos recopilados el 16 y 17 de febrero de 2011. Machine Translated by Google 6.7. EJERCICIOS 311 6.48 Elija una prueba. Nos gustaría probar las siguientes hipótesis: H0 : p = 0,1 HA : p = 0,1 El tamaño de la muestra es de 120 y la proporción muestral es del 8,5 %. Determine cuál de las siguientes pruebas es(son) adecuada(s) para esta situación y explique su razonamiento. I. Prueba Z para una proporción, es IV. Prueba de simulación para una proporción decir, prueba de proporción utilizando el modelo normal Prueba t de V. para una media II. Prueba Z para comparar dos proporciones III. χ 2 VI. ANOVA prueba de independencia 6.49 La Revolución Egipcia. Un levantamiento popular que comenzó el 25 de enero de 2011 en Egipto condujo a la Revolución Egipcia de 2011. Las encuestas muestran que alrededor del 69 % de los adultos estadounidenses siguieron de cerca las noticias sobre la crisis política y las manifestaciones en Egipto durante las dos primeras semanas posteriores al inicio del levantamiento. En una muestra aleatoria de 30 estudiantes de secundaria, se encontró que solo 17 de ellos siguieron de cerca las noticias sobre Egipto durante este período. (a) Escriba las hipótesis para probar si la proporción de estudiantes de secundaria que siguieron las noticias sobre Egipto es diferente a la proporción de adultos estadounidenses que lo hicieron. (b) Calcule la proporción de estudiantes de secundaria en esta muestra que siguieron las noticias sobre Egipto. de cerca durante este tiempo. (c) Con base en la teoría de muestras grandes, modelamos ˆp usando la distribución normal. ¿Por qué deberíamos ¿Hay que tener cuidado con este enfoque para estos datos? (d) La aproximación normal no será tan fiable como una simulación, especialmente para una muestra de este tamaño. Describa cómo realizar dicha simulación y, una vez obtenidos los resultados, cómo estimar el valor p. (e) A continuación se muestra un histograma que muestra la distribución de ˆpsim en 10 000 simulaciones bajo la hipótesis nula. Estime el valor p utilizando el gráfico y determine la conclusión de la prueba de hipótesis. 0,15 0.10 0.05 0 0.4 0.6 ^ 0.8 1.0 simulación p 65Gallup Politics, Las opiniones de los estadounidenses sobre Egipto son marcadamente más negativas, datos recopilados del 2 al 5 de febrero de 2011. Machine Translated by Google 312 CAPÍTULO 6. INFERENCIA PARA DATOS CATEGÓRICOS 6.50 Reproducción Asistida. La Tecnología de Reproducción Asistida (TRA) es un conjunto de técnicas que facilitan el embarazo (p. ej., la fertilización in vitro). Un informe de 2008 de los Centros Para el Control y la Prevención de Enfermedades se estimó que la TAR ha tenido éxito en lograr una vida Nacimiento en el 31% de los casos66. Una nueva clínica de fertilidad afirma que su tasa de éxito es superior a la media. Una muestra aleatoria de 30 de sus pacientes arrojó una tasa de éxito del 40%. Un organismo de control del consumidor Al grupo le gustaría determinar si esto proporciona evidencia sólida para respaldar la afirmación de la empresa. (a) Escriba las hipótesis para probar si la tasa de éxito de la TAR en esta clínica es significativamente mayor. que la tasa de éxito informada por los CDC. (b) Con base en la teoría de muestras grandes, modelamos ˆp usando la distribución normal. ¿Por qué esto no es así? ¿Apropiado aquí? (c) La aproximación normal sería menos confiable aquí, por lo que deberíamos utilizar una estrategia de simulación. Describa una configuración para una simulación que sería apropiada en esta situación y cómo El valor p se puede calcular utilizando los resultados de la simulación. (d) A continuación se muestra un histograma que muestra la distribución de ˆpsim en 10 000 simulaciones bajo la hipótesis nula. Hipótesis. Estime el valor p utilizando la gráfica y úselo para evaluar las hipótesis. (e) Tras realizar este análisis, el grupo de consumidores publica el siguiente titular: «Clínica de infertilidad anuncia falsamente mejores tasas de éxito». Comente la pertinencia de este titular. declaración. 0,15 0.10 0.05 0 0.0 0.1 0.2 0.3 ^ pag simulación 66CDC. Informe sobre tecnología de reproducción asistida de 2008. 0.4 0.5 0.6 0.7 Machine Translated by Google 6.7. EJERCICIOS 313 6.7.6 Prueba de hipótesis para dos proporciones 6.51 Experimento social, Parte II. El ejercicio 6.23 presenta un “experimento social” realizado Por un programa de televisión que cuestionó lo que hacen las personas cuando ven a una mujer visiblemente magullada. siendo molestada por su novio. En dos ocasiones diferentes en el mismo restaurante, el mismo... Se retrató a una pareja. En un escenario, la mujer vestía "provocativamente" y en el otro... En este escenario, la mujer vestía de forma conservadora. La siguiente tabla muestra cuántos restaurantes... Los comensales estuvieron presentes en cada escenario y si intervinieron o no. Guión Total conservador provocador Intervenir Sí 5 15 20 No 15 10 25 Total 20 25 45 Se realizó una simulación para probar si las personas reaccionan de manera diferente en los dos escenarios. 10.000 Se generaron diferencias simuladas para construir la distribución nula mostrada. El valor ˆppr,sim representa la proporción de comensales que intervinieron en la simulación para los provocativamente vestidos mujer, y ˆpcon,sim es la proporción para la mujer vestida de forma conservadora. 0.2 0.1 0 −0,4 −0,2 0.0 ^ pag 0.2 0.4 ^ −p pr_sim con_sim (a) ¿Cuáles son las hipótesis? Para los fines de este ejercicio, puede asumir que cada La persona observada en el restaurante se comportó de forma independiente, aunque nos gustaría evaluar Podríamos plantear esta suposición con mayor rigor si estuviéramos informando estos resultados. (b) Calcule la diferencia observada entre las tasas de intervención bajo los tratamientos provocativos y escenarios conservadores: ˆppr − pˆcon. (c) Estime el valor p utilizando la figura anterior y determine la conclusión de la hipótesis. prueba. Machine Translated by Google 314 CAPÍTULO 6. INFERENCIA PARA DATOS CATEGÓRICOS 6.52 ¿Es contagioso el bostezo? Un experimento realizado por Cazadores de Mitos, un programa de televisión de entretenimiento científico del Discovery Channel, evaluó si una persona puede ser inconsciente influenciados a bostezar si otra persona cerca de ellos bosteza. 50 personas fueron asignadas aleatoriamente a dos grupos: 34 a un grupo donde una persona cerca de ellos bostezó (tratamiento) y 16 a un grupo donde No había nadie bostezando cerca de ellos (control). La siguiente tabla muestra los resultados de este estudio. experimento.67 Resultado Bostezo No bostezar Total Grupo Control de tratamiento total 4 10 24 12 34 16 14 36 50 Se realizó una simulación para comprender la distribución de la estadística de prueba bajo el supuesto de independencia: que alguien bostece cerca de otra persona no tiene influencia en si la otra persona bosteza cerca de otra. La persona bostezará. Para realizar la simulación, un investigador escribió "bostezo" en 14 fichas. y no bostezar en 36 fichas para indicar si una persona bostezaba o no. Luego barajó las cartas y las repartieron en dos grupos de tamaño 34 y 16 para el tratamiento y el control, respectivamente. Contó cuántos participantes de cada grupo simulado bostezaron en una aparente respuesta a una Se calculó la diferencia entre las proporciones simuladas de bostezo como ˆptrtmt,sim − pˆctrl,sim. Esta simulación se repitió 10 000 veces mediante software para obtener 10.000 diferencias que se deben únicamente al azar. El histograma muestra la distribución de las diferencias simuladas. 0.2 0.1 0 −0.6 −0,4 −0,2 0.0 ^ 0.2 0.4 ^ −p pag control de trtmt (a) ¿Cuáles son las hipótesis? (b) Calcule la diferencia observada entre las tasas de bostezo en los dos escenarios. (c) Estime el valor p utilizando la figura anterior y determine la conclusión de la hipótesis. prueba. 67Cazadores de Mitos, Temporada 3, Episodio 28. 0.6 Machine Translated by Google Capítulo 7 Introducción a la regresión lineal La regresión lineal es una técnica estadística muy potente. Mucha gente está familiarizada con la regresión simplemente por leer las noticias, donde se superponen gráficos con líneas rectas sobre diagramas de dispersión. Los modelos lineales pueden utilizarse para predecir o evaluar si existe una relación lineal entre dos variables numéricas. La figura 7.1 muestra dos variables cuya relación se puede modelar perfectamente con un línea recta. La ecuación de la línea es y = 5 + 57,49x Imagine lo que significaría una relación lineal perfecta: sabría el valor exacto de y con solo conocer el valor de x. Esto es poco realista en casi cualquier proceso natural. Por ejemplo, si tomáramos los ingresos familiares x, este valor proporcionaría información útil sobre el apoyo financiero que la universidad de y puede ofrecer a un futuro estudiante. Sin embargo, seguiría habiendo variabilidad en el apoyo financiero, incluso al comparar estudiantes con familias con antecedentes financieros similares. La regresión lineal supone que la relación entre dos variables, x e y, puede ser modelado por una línea recta: y = β0 + β1x (7.1) β0, β1 Parámetros del modelo lineal Donde β0 y β1 representan dos parámetros del modelo (β es la letra griega beta). Estos parámetros se estiman a partir de datos, y sus estimaciones puntuales se expresan como b0 y b1. Cuando usamos x para predecir y, usualmente llamamos x la variable explicativa o predictora, y llamamos y la respuesta. Es raro que todos los datos se ubiquen en una línea recta, como se observa en los tres diagramas de dispersión de la Figura 7.2. En cada caso, los datos se ubican alrededor de una línea recta, incluso si ninguna de las observaciones se ubica exactamente en ella. El primer gráfico muestra una tendencia lineal descendente relativamente marcada, donde la variabilidad restante en los datos alrededor de la línea es mínima en relación con la fuerza de la relación entre x e y. El segundo gráfico muestra una tendencia ascendente que, si bien evidente, no es tan marcada como la primera. El último gráfico muestra una tendencia descendente muy débil en los datos, tan leve que apenas podemos notarla. En cada uno de estos ejemplos, tendremos cierta incertidumbre con respecto a nuestras estimaciones de los parámetros del modelo, β0 y β1. Por ejemplo, podríamos preguntarnos: ¿deberíamos mover la línea un poco hacia arriba o hacia abajo, o deberíamos inclinarla más o menos? 315 Machine Translated by Google 316 CAPÍTULO 7. INTRODUCCIÓN A LA REGRESIÓN LINEAL •• (dólares) acciones las de total Costo 1500 1000 •• 500 • 0 •• • • •• • 0 10 20 30 Número de acciones de Target Corporation a comprar Figura 7.1: Se presentaron simultáneamente solicitudes de doce compradores distintos a una empresa comercializadora para adquirir acciones de Target Corporation (ticker TGT, 26 de abril de 2012), y se informó el costo total de las acciones. Dado que el costo se calcula mediante una fórmula lineal, el ajuste lineal es perfecto. 400 50 20000 200 10000 0 0 0 −50 −50 0 50 −200 500 1000 1500 0 20 40 Figura 7.2: Tres conjuntos de datos en los que un modelo lineal puede ser útil aunque no todos los datos coincidan exactamente con la línea. A medida que avancemos en este capítulo, aprenderemos diferentes criterios para el ajuste de líneas y también aprenderemos sobre la incertidumbre asociada con las estimaciones de los parámetros del modelo. En este capítulo también veremos ejemplos en los que ajustar una línea recta a los datos, incluso si existe una relación clara entre las variables, no resulta útil. Un caso similar se muestra en la Figura 7.3 , donde existe una relación muy fuerte entre las variables, aunque la tendencia no sea lineal. Analizaremos las tendencias no lineales en este capítulo y en el siguiente, pero los detalles del ajuste de modelos no lineales se dejarán para un curso posterior. 7.1 Ajuste de línea, residuos y correlación Resulta útil reflexionar a fondo sobre el proceso de ajuste de líneas. En esta sección, examinamos los criterios para identificar un modelo lineal e introducimos un nuevo estadístico: la correlación. Machine Translated by Google 317 7.1. AJUSTE DE LÍNEAS, RESIDUOS Y CORRELACIÓN 15 (m) recorrida Distancia 10 5 0 • • • 0 • • • • • •• ••••• • •• • La línea recta que mejor se ajusta es la plana (!) 20 40 60 • • • • • • 80 Ángulo de inclinación (grados) Figura 7.3: Un modelo lineal no es útil en este caso no lineal. Estos datos provienen de un experimento introductorio de física. 7.1.1 Empezando con líneas rectas Los diagramas de dispersión se introdujeron en el Capítulo 1 como una técnica gráfica para presentar dos variables numéricas simultáneamente. Estos diagramas permiten examinar fácilmente la relación entre las variables. La Figura 7.4 muestra un diagrama de dispersión para la longitud de la cabeza y la longitud total de 104 zarigüeyas de cola de cepillo de Australia. Cada punto representa una zarigüeya de los datos. Las variables de longitud de la cabeza y la longitud total están asociadas. Las zarigüeyas con una longitud total superior a la media también tienden a tener longitudes de cabeza superiores a la media. Si bien la relación no es perfectamente lineal, podría ser útil explicar parcialmente la conexión entre estas variables con una línea recta. Las líneas rectas solo deben usarse cuando los datos parecen tener una relación lineal, como en el caso que se muestra en el panel izquierdo de la Figura 7.6. El panel derecho de la Figura 7.6 muestra un caso en el que una línea curva sería más útil para comprender la relación entre las dos variables. Precaución: Preste atención a las tendencias curvas. En este capítulo, solo consideramos modelos basados en líneas rectas. Si los datos muestran una tendencia no lineal, como la del panel derecho de la Figura 7.6, se deben utilizar técnicas más avanzadas. 7.1.2 Ajuste de una línea a ojo Queremos describir la relación entre las variables de longitud de la cabeza y longitud total en el conjunto de datos de zarigüeyas mediante una línea. En este ejemplo, usaremos la longitud total como variable predictora, x, para predecir la longitud de la cabeza de una zarigüeya, y. Podríamos ajustar la relación lineal a simple vista, como en la Figura 7.7. La ecuación para esta línea es yˆ = 41 + 0,59x (7.2) Machine Translated by Google 318 CAPÍTULO 7. INTRODUCCIÓN A LA REGRESIÓN LINEAL 100 • (mm) cabeza la de Longitud 95 90 85 75 80 85 90 95 Longitud total (cm) Figura 7.4: Un diagrama de dispersión que muestra la longitud de la cabeza contra la longitud total para 104 Zarigüeyas de cola de cepillo. Un punto representa una zarigüeya con una longitud de cabeza de 94,1 mm. y se destaca la longitud total 89cm. Figura 7.5: La zarigüeya de cola de cepillo común de Australia. —————————– Foto de wollombi en Flickr: www.flickr.com/photos/wollombi/58499575 Machine Translated by Google 319 7.1. AJUSTE DE LÍNEAS, RESIDUOS Y CORRELACIÓN 45 40 35 95 ciudad) en (conducción galón por Millas (mm) cabeza la de Longitud 100 90 30 25 20 85 15 75 80 85 90 95 Longitud total (cm) 2000 2500 3000 3500 4000 Peso (libras) Figura 7.6: La figura de la izquierda muestra la longitud de la cabeza frente a la longitud total y revela que muchos de los puntos podrían representarse con una banda recta. A la derecha, observamos que una banda curva es más apropiada en el diagrama de dispersión para el peso y el consumo de combustible en la ciudad del conjunto de datos de coches. Podemos usar esta línea para analizar las propiedades de las zarigüeyas. Por ejemplo, la ecuación predice que una zarigüeya con una longitud total de 80 cm tendrá una longitud de cabeza de yˆ = 41 + 0,59 × 80 = 88,2 Se utiliza un "sombrero" en la y para indicar que se trata de una estimación. Esta estimación puede considerarse un promedio: la ecuación predice que las zarigüeyas con una longitud total de 80 cm tendrán una longitud de cabeza promedio de 88,2 mm. A falta de más información sobre una zarigüeya de 80 cm, la predicción de la longitud de la cabeza que utiliza el promedio es una estimación razonable. 7.1.3 Residuos Los residuos son la variación restante en los datos después de tener en cuenta el ajuste del modelo: Datos = Ajuste + Residuo Cada observación tendrá un residuo. Si una observación se encuentra por encima de la línea de regresión, su residuo (la distancia vertical entre la observación y la línea) es positivo. Las observaciones por debajo de la línea tienen residuos negativos. Un objetivo al elegir el modelo lineal adecuado es que estos residuos sean lo más pequeños posible. En la Figura 7.7 se destacan tres observaciones . La observación marcada con una "×" tiene un residuo pequeño y negativo de aproximadamente ­1; la observación marcada con un "+" tiene un residuo grande de aproximadamente +7; y la observación marcada con un "" tiene un residuo moderado de aproximadamente ­4. El tamaño de un residuo suele describirse en términos de su valor absoluto. Por ejemplo, el residuo de "" es mayor que el de "×" porque | − 4| es mayor que | − 1|. Machine Translated by Google 320 CAPÍTULO 7. INTRODUCCIÓN A LA REGRESIÓN LINEAL 100 (mm) cabeza la de Longitud 95 90 85 75 80 85 90 95 Longitud total (cm) Figura 7.7: Se ajustó un modelo lineal razonable para representar la relación entre la longitud de la cabeza y la longitud total. Residuo: diferencia entre lo observado y lo esperado El residuo de la i La observación (xi , yi) es la diferencia entre la respuesta observada (yi) y la respuesta que predeciríamos en función del ajuste del modelo (ˆyi): ei = yi − yˆi Generalmente identificamos ˆyi introduciendo xi en el modelo. Ejemplo 7.3. El ajuste lineal mostrado en la Figura 7.7 se da como ˆy = 41 + 0,59x. Con base en esta línea, calcule formalmente el residuo de la observación (77,0, 85,3). Esta observación se representa con “×” en la gráfica. Compárela con la estimación visual anterior, ­1. Primero calculamos el valor previsto del punto “×” según el modelo: yˆ× = 41 + 0,59x× = 41 + 0,59 × 77,0 = 86,4 A continuación calculamos la diferencia entre la longitud real de la cabeza y la longitud prevista de la cabeza: e× = y× − yˆ× = 85,3 − 86,4 = −1,1 Esto está muy cerca de la estimación visual de ­1. Ejercicio 7.4 Si un modelo subestima una observación, ¿el residuo será positivo o negativo? ¿Qué ocurre si sobreestima la observación? 1 Si un modelo subestima una observación, su estimación es inferior a la real. El residuo, que es el valor real de la observación menos la estimación del modelo, debe ser positivo. Lo contrario ocurre cuando el modelo sobreestima la observación: el residuo es negativo. Machine Translated by Google 321 7.1. AJUSTE DE LÍNEAS, RESIDUOS Y CORRELACIÓN autor de residuales Derechos 5 0 −5 75 80 85 90 95 Longitud total (cm) Figura 7.8: Gráfico de residuos para el modelo de la Figura 7.7. Ejercicio 7.5 Calcule los residuos para las observaciones (85,0, 98,6) (“+” en la figura) y (95,5, 94,0) (“”) utilizando la relación lineal ˆy = 41 + 0,59x. 2 Los residuos son útiles para evaluar el ajuste de un modelo lineal a un conjunto de datos. A menudo se representan en un gráfico de residuos, como el que se muestra en la Figura 7.8 para la recta de regresión de la Figura 7.7. Los residuos se representan en sus posiciones horizontales originales, pero con la coordenada vertical como residuo. Por ejemplo, el punto (85.0, 98.6)+ tenía un residuo de 7.45, por lo que en el gráfico de residuos se ubica en (85.0, 7.45). Crear un gráfico de residuos es similar a voltear el diagrama de dispersión para que la recta de regresión quede horizontal. Ejemplo 7.6. Un propósito de los gráficos de residuos es identificar características o patrones que aún persisten en los datos después de ajustar un modelo. La Figura 7.9 muestra tres gráficos de dispersión con modelos lineales en la primera fila y gráficos de residuos en la segunda. ¿Puede identificar algún patrón restante en los residuos? En el primer conjunto de datos (primera columna), los residuos no muestran patrones evidentes. Parecen estar dispersos aleatoriamente alrededor de la línea discontinua que representa el 0. El segundo conjunto de datos muestra un patrón en los residuos. Existe cierta curvatura en el diagrama de dispersión, que es más evidente en el gráfico de residuos. No se recomienda usar una línea recta para modelar estos datos. En su lugar, se debe emplear una técnica más avanzada. El último gráfico muestra una tendencia al alza muy escasa, y los residuos tampoco muestran patrones evidentes. Es razonable intentar ajustar un modelo lineal a los datos. Sin embargo, no está claro si existe evidencia estadísticamente significativa de que el parámetro de pendiente sea distinto de cero. La estimación puntual del parámetro de pendiente, denominada b1, no es cero, pero cabe preguntarse si esto podría deberse simplemente al azar. Abordaremos este tipo de escenario en la Sección 7.4. 2 (+) Primero calcula el valor previsto según el modelo: yˆ+ = 41 + 0,59x+ = 41 + 0,59 × 85,0 = 91,15 Entonces el residuo está dado por e+ = y+ − yˆ+ = 98,6 − 91,15 = 7,45 Esta cifra se acercó a la estimación anterior de 7. () ˆy = 41 + 0,59x = 97,3. e = y − yˆ = −3,3, cerca de la estimación de ­4. Machine Translated by Google 322 CAPÍTULO 7. INTRODUCCIÓN A LA REGRESIÓN LINEAL incógnita $residuales resumen(g) incógnita $residuales resumen(g) incógnita Figura 7.9: Datos de muestra con sus líneas de mejor ajuste (fila superior) y sus gráficos residuales correspondientes (fila inferior). 7.1.4 Descripción de relaciones lineales con correlación Correlación: intensidad de una relación lineal. La correlación, que siempre toma valores entre ­1 y 1, describe la intensidad de la relación lineal entre dos variables. La Correlación R correlación se denota por R. Podemos calcular la correlación mediante una fórmula, al igual que hicimos con la media muestral y la desviación estándar. Sin embargo, esta fórmula es bastante compleja, por lo que generalmente realizamos los cálculos en una computadora o calculadora. La Figura 7.10 muestra ocho gráficos y sus correlaciones correspondientes. Solo cuando la relación es perfectamente lineal, la correlación es ­1 o 1. Si la relación es fuerte y positiva, la correlación será cercana a +1. Si es fuerte y negativa, será cercana a ­1. Si no existe una relación lineal aparente entre las variables, la correlación será cercana a cero. La correlación pretende cuantificar la fuerza de una tendencia lineal. Las tendencias no lineales, incluso siendo fuertes, a veces producen correlaciones que no reflejan la fuerza de la relación; véanse tres ejemplos de este tipo en la Figura 7.11. Ejercicio 7.7. Parece que ninguna línea recta se ajusta a ninguno de los conjuntos de datos representados en la Figura 7.11. Intente dibujar curvas no lineales en cada gráfico. Una vez que cree una curva para cada una, describa qué es importante para su ajuste. 3Formalmente, podemos calcular la correlación para las observaciones (x1, y1), (x2, y2), ..., (xn, yn) usando la fórmula R= 1 n−1 norte i=1 xi − x¯ yi − y¯ sx sí donde ¯x, ¯y, sx y sy son las medias muestrales y las desviaciones estándar para cada variable. 4Dejaremos que dibujes las líneas. En general, las líneas que dibujes deben estar cerca de la mayoría de los puntos. y reflejar las tendencias generales en los datos. Machine Translated by Google 323 7.1. AJUSTE DE LÍNEAS, RESIDUOS Y CORRELACIÓN R = 0,33 R = 0,69 R = 0,98 R = 1,00 R = −0,08 R = −0,64 R = −0,92 R = −1,00 Figura 7.10: Diagramas de dispersión de muestra y sus correlaciones. La primera fila muestra variables con una relación positiva, representada por una tendencia ascendente y a la derecha. La segunda fila muestra variables con una tendencia negativa, donde un valor alto en una variable se asocia con un valor bajo en la otra. R = −0,23 R = 0,31 R = 0,50 Figura 7.11: Diagramas de dispersión de muestra y sus correlaciones. En cada caso, existe una fuerte relación entre las variables. Sin embargo, la correlación no es muy fuerte y la relación no es lineal. Machine Translated by Google 324 CAPÍTULO 7. INTRODUCCIÓN A LA REGRESIÓN LINEAL 30 20 dólares) (miles Universidad la de Donaciones 10 0 0 100 200 Ingresos familiares ($1000s) Figura 7.12: Ayuda económica e ingresos familiares para una muestra aleatoria de 50 estudiantes de primer año de Elmhurst College. Se ajustan dos líneas a los datos; la línea continua representa la línea de mínimos cuadrados. 7.2 Ajuste de una línea mediante regresión de mínimos cuadrados El ajuste de modelos lineales a simple vista está abierto a críticas, ya que se basa en una preferencia individual. En esta sección, utilizamos la regresión de mínimos cuadrados como un enfoque más riguroso. Esta sección analiza los datos sobre ingresos familiares y ayudas económicas de una muestra aleatoria de cincuenta estudiantes de primer año de 2011 de Elmhurst College, Illinois.<sup>5</sup> La ayuda económica es una ayuda financiera que no requiere devolución, a diferencia de un préstamo. En la Figura 7.12 se muestra un diagrama de dispersión de los datos junto con dos ajustes lineales. Las líneas siguen una tendencia negativa en los datos; los estudiantes con mayores ingresos familiares tendían a recibir menos ayuda económica de la universidad. Ejercicio 7.8 ¿La correlación en la Figura 7.12 es positiva o negativa? 6 7.2.1 Una medida objetiva para encontrar la mejor línea Empecemos por pensar en qué entendemos por «mejor». Matemáticamente, buscamos una línea con residuos pequeños. Quizás nuestro criterio podría minimizar la suma de las magnitudes de los residuos: (7.9) |e1| + |e2| + ∙ ∙ ∙ + |en| Lo cual podríamos lograr con un programa informático. La línea discontinua resultante, que se muestra en la Figura 7.12, demuestra que este ajuste puede ser bastante razonable. Sin embargo, una práctica más común es elegir la línea que minimiza la suma de los residuos al cuadrado: 2y12 + e 2 2 + ∙ ∙ ∙ + e norte (7.10) 5Estos datos fueron extraídos de una tabla de datos de todos los estudiantes de primer año de la clase de 2011 en Elmhurst College que acompañaba a un artículo titulado Lo que los estudiantes realmente pagan para ir a la universidad, publicado en línea por The Chronicle of Higher Education: chronicle.com/article/What­Students­Really­Pay­to­Go/131435 6Los ingresos familiares mayores se asocian con menores cantidades de ayuda, por lo que la correlación será negativa. Utilizando una computadora, se puede calcular la correlación: ­0,499. Machine Translated by Google 7.2. AJUSTE DE UNA LÍNEA MEDIANTE REGRESIÓN DE MÍNIMOS CUADRADOS 325 La línea que minimiza este criterio de mínimos cuadrados se representa como la línea continua en la Figura 7.12. Esta se conoce comúnmente como línea de mínimos cuadrados. A continuación, se presentan tres posibles razones para elegir el Criterio (7.10) en lugar del Criterio (7.9): 1. Es el método más utilizado. 2. Calcular la línea según el criterio (7.10) es mucho más fácil a mano y en la mayoría del software estadístico. 3. En muchas aplicaciones, un residuo dos veces mayor que otro es más del doble de perjudicial. Por ejemplo, una diferencia de 4 suele ser más del doble de perjudicial que una diferencia de 2. Elevar los residuos al cuadrado explica esta discrepancia. Las dos primeras razones se deben principalmente a la tradición y la conveniencia; la última razón explica por qué el Criterio (7.10) suele ser el más útil.7 7.2.2 Condiciones para la línea de mínimos cuadrados Al ajustar una línea de mínimos cuadrados, generalmente requerimos Linealidad. Los datos deben mostrar una tendencia lineal. Si existe una tendencia no lineal (p. ej., panel izquierdo de la Figura 7.13), se debe aplicar un método de regresión avanzado de otro libro o curso posterior. Residuos casi normales. Generalmente, los residuos deben ser casi normales. Cuando esta condición resulta irrazonable, suele deberse a valores atípicos o a la preocupación por los puntos influyentes, que analizaremos con mayor profundidad en la Sección 7.3. Un ejemplo de residuos no normales se muestra en el segundo panel de la Figura 7.13. Variabilidad constante. La variabilidad de los puntos alrededor de la línea de mínimos cuadrados se mantiene prácticamente constante. Un ejemplo de variabilidad no constante se muestra en el tercer panel de la Figura 7.13. Tenga cuidado al aplicar la regresión a datos recopilados secuencialmente en lo que se denomina una serie temporal. Dichos datos pueden tener una estructura subyacente que debe considerarse en un modelo y análisis. Existen otros casos en los que las correlaciones dentro de los datos son importantes. Este tema se analizará con más detalle en el capítulo 8. Ejercicio 7.11 ¿Deberíamos tener preocupaciones acerca de aplicar la regresión de mínimos cuadrados a los datos de Elmhurst en la Figura 7.12? 8 7.2.3 Encontrar la recta de mínimos cuadrados Para los datos de Elmhurst, podríamos escribir la ecuación de la línea de regresión de mínimos cuadrados como ayuda = β0 + β1 × ingresos familiares Aquí, la ecuación se configura para predecir la ayuda económica basada en los ingresos familiares del estudiante, lo cual sería útil para quienes estén considerando Elmhurst. Estos dos valores, β0 y β1, son los parámetros de la línea de regresión. 7Hay aplicaciones en las que el criterio (7.9) puede ser más útil, y hay muchos otros criterios Podríamos considerarlo. Sin embargo, este libro solo aplica el criterio de mínimos cuadrados. La tendencia parece ser lineal; los datos se sitúan alrededor de la línea sin valores atípicos evidentes; la varianza es prácticamente constante. Estas tampoco son observaciones de series temporales. Se puede aplicar la regresión de mínimos cuadrados a estos datos. Machine Translated by Google incógnita incógnita g$residuales incógnita g$residuales CAPÍTULO 7. INTRODUCCIÓN A LA REGRESIÓN LINEAL g$residuales 326 incógnita Figura 7.13: Cuatro ejemplos que muestran cuándo los métodos de este capítulo son insuficientes para aplicarlos a los datos. En el panel izquierdo, una línea recta no se ajusta a los datos. En el segundo panel, hay valores atípicos; dos puntos a la izquierda están relativamente distantes del resto de los datos, y uno de ellos está muy alejado de la línea. En el tercer panel, la variabilidad de los datos alrededor de la línea aumenta con valores mayores de x. En el último panel, se muestra un conjunto de datos de series temporales, donde las observaciones sucesivas presentan una alta correlación. Al igual que en los capítulos 4 a 6, los parámetros se estiman utilizando datos observados. En la práctica, esta estimación se realiza mediante una computadora, de la misma manera que otras estimaciones, como la media muestral, se pueden obtener mediante una computadora o una calculadora. Sin embargo, también podemos obtener las estimaciones de los parámetros aplicando dos propiedades de la recta de mínimos cuadrados: • La pendiente de la línea de mínimos cuadrados se puede estimar mediante b1 = si R (7.12) sx donde R es la correlación entre las dos variables, y sx y sy son las desviaciones estándar muestrales de la variable explicativa y la respuesta, respectivamente. • Si ¯x es la media de la variable horizontal (de los datos) y ¯y es la media de la variable vertical, entonces el punto (¯x, y¯) está en la línea de mínimos cuadrados. b0, b1 Estimaciones de muestra de β0, β1 Utilizamos b0 y b1 para representar las estimaciones puntuales de los parámetros β0 y β1. Ejercicio 7.13. La Tabla 7.14 muestra las medias muestrales de los ingresos familiares y la ayuda económica, en $101,800 y $19,940, respectivamente. Trace el punto (101.8, 19.94) en la Figura 7.12 de la página 324 para verificar que se encuentre en la línea de mínimos cuadrados (línea continua). Ingresos familiares, en miles de dólares (“x”) significar Dakota del Sur ¯x = 101,8 sx = 63,2 ayuda de regalo, en miles de dólares (“y”) ¯y = 19,94 sy = 5,46 R = −0,499 Cuadro 7.14: Estadísticas resumidas sobre ingresos familiares y ayudas económicas. 9 Si necesita ayuda para encontrar esta ubicación, dibuje una línea recta desde el valor x de 100 (o aproximadamente). Luego, dibuja una línea horizontal en 20 (o cerca de ahí). Estas líneas deben intersectarse en la línea de mínimos cuadrados. Machine Translated by Google 327 7.2. AJUSTE DE UNA LÍNEA MEDIANTE REGRESIÓN DE MÍNIMOS CUADRADOS Ejercicio 7.14 Utilizando las estadísticas de resumen de la Tabla 7.14, calcule la pendiente de la línea de regresión de la ayuda económica en función del ingreso familiar.10 Quizás recuerdes la forma punto­pendiente de una recta de la clase de matemáticas (otra forma común es la pendiente­ ordenada al origen). Dada la pendiente de una recta y un punto en ella, (x ,y ), la ecuación de la recta se puede escribir como y − y0 = pendiente × (x − x0) (7.15) Un ejercicio común para familiarizarse más con los fundamentos de la regresión de mínimos cuadrados es utilizar estadísticas de resumen básicas y la forma punto­pendiente para producir la línea de mínimos cuadrados. SUGERENCIA: Cómo identificar la línea de mínimos cuadrados a partir de las estadísticas de resumen Para identificar la línea de mínimos cuadrados a partir de las estadísticas de resumen: • Estime el parámetro de pendiente, b1, mediante la ecuación (7.12). • Teniendo en cuenta que el punto (¯x, y¯) está en la recta de mínimos cuadrados, utilice x0 = ¯x e y0 = ¯y junto con la pendiente b1 en la ecuación punto­pendiente: y − y¯ = b1(x − x¯) • Simplifica la ecuación. Ejemplo 7.16 Utilizando el punto (101,8, 19,94) de las medias muestrales y la estimación de la pendiente b1 = −0,0431 del Ejercicio 7.14, encuentre la línea de mínimos cuadrados para predecir la ayuda basada en el ingreso familiar. Aplique la ecuación punto­pendiente utilizando (101.8, 19.94) y la pendiente b1 = −0.0431: y − y0 = b1(x − x0) y − 19,94 = −0,0431(x − 101,8) Desarrollando el lado derecho y luego sumando 19,94 a cada lado, la ecuación se simplifica: ayuda = 24,3 − 0,0431 × ingresos familiares Aquí hemos reemplazado y por ayuda y x por ingreso familiar para poner la ecuación en contexto. Mencionamos anteriormente que generalmente se utiliza una computadora para calcular la recta de mínimos cuadrados. En la Tabla 7.15 se muestra una tabla resumen basada en la salida de la computadora para los datos de Elmhurst. La primera columna de números proporciona estimaciones para b0 y b1, respectivamente. Compárelas con el resultado del Ejemplo 7.16. 10Aplique la ecuación (7.12) con las estadísticas de resumen de la tabla 7.14 para calcular la pendiente: b1 = sí R = sx 5,46 (−0,499) = −0,0431 63,2 Machine Translated by Google 328 CAPÍTULO 7. INTRODUCCIÓN A LA REGRESIÓN LINEAL Estimación del error estándar t valor Pr(>|t|) 18,83 0,0000 (Intercepto) 24.3193 ingresos 1.2915 familiares ­0.0431 0.0108 ­3,98 0,0002 Tabla 7.15: Resumen del ajuste por mínimos cuadrados de los datos de Elmhurst. Compare las estimaciones de los parámetros de la primera columna con los resultados del Ejemplo 7.16. Ejemplo 7.17 Examine la segunda, tercera y cuarta columnas de la Tabla 7.15. ¿Puede adivinar qué representan? Describiremos el significado de las columnas utilizando la segunda fila, que corresponde a β1. La primera columna proporciona la estimación puntual de β1, como calculamos en un ejemplo anterior: ­0,0431. La segunda columna representa el error estándar de esta estimación puntual: 0,0108. La tercera columna representa el estadístico de prueba t para la hipótesis nula de que β1 = 0: T = −3,98. La última columna representa el valor p del estadístico de prueba t para la hipótesis nula de que β1 = 0 y una hipótesis alternativa bilateral: 0,0002. Profundizaremos en estos detalles en la Sección 7.4. Ejemplo 7.18 Supongamos que una estudiante de último año de secundaria está considerando ingresar a Elmhurst College. ¿Puede simplemente usar la ecuación lineal que hemos estimado para calcular su ayuda financiera universitaria? Puede usarlo como una estimación, aunque algunos calificadores en este enfoque son importantes. En primer lugar, todos los datos provienen de una misma generación de estudiantes de primer año, y la forma en que la universidad determina la ayuda puede variar de un año a otro. En segundo lugar, la ecuación proporcionará una estimación imperfecta. Si bien la ecuación lineal es eficaz para captar la tendencia de los datos, no se podrá predecir con exactitud la ayuda de ningún estudiante individual. 7.2.4 Interpretación de las estimaciones de los parámetros de la línea de regresión La interpretación de los parámetros en un modelo de regresión es a menudo uno de los pasos más importantes del análisis. Ejemplo 7.19 Las estimaciones de pendiente e intersección para los datos de Elmhurst son ­0,0431 y 24,3. ¿Qué significan realmente estos números? Interpretar el parámetro de pendiente resulta útil en prácticamente cualquier aplicación. Por cada $1,000 adicionales de ingresos familiares, esperaríamos que un estudiante recibiera una diferencia neta de $1,000 × (−0.0431) = −$43.10 en ayuda en promedio, es decir, $43.10 menos. Cabe destacar que un mayor ingreso familiar se corresponde con una menor ayuda, ya que el coeficiente de ingresos familiares es negativo en el modelo. Debemos ser cautelosos en esta interpretación: si bien existe una asociación real, no podemos interpretar una conexión causal entre las variables, ya que estos datos son observacionales. Es decir, aumentar los ingresos familiares de un estudiante puede no causar una disminución en la ayuda. (Sería razonable contactar a la universidad y preguntar si la relación es causal, es decir, si las decisiones de ayuda de Elmhurst College se basan parcialmente en los ingresos familiares de los estudiantes). El intercepto estimado b0 = 24,3 (en miles de dólares) describe la ayuda promedio si la familia de un estudiante no tuviera ingresos. El significado del intercepto es relevante para esta aplicación, ya que el ingreso familiar de algunos estudiantes de Elmhurst es de $0. En otras aplicaciones, el intercepto puede tener poco o ningún valor práctico si no hay observaciones donde x sea cercano a cero. Machine Translated by Google 329 7.2. AJUSTE DE UNA LÍNEA MEDIANTE REGRESIÓN DE MÍNIMOS CUADRADOS Interpretación de parámetros estimados por mínimos cuadrados. La pendiente describe la diferencia estimada en la variable y si la variable explicativa x, para un caso, resulta ser una unidad mayor. La intersección describe el resultado promedio de y si x = 0 y el modelo lineal es válido hasta x = 0, lo cual no es el caso en muchas aplicaciones. 7.2.5 La extrapolación es peligrosa Cuando esas ventiscas azotaron la Costa Este este invierno, me satisfizo que el calentamiento global fuera un fraude. Esa nieve era gélida. Pero, en una tendencia alarmante, las temperaturas esta primavera han sido de 10 Piensen en esto: el 6 de febrero y agosto el grados. Hoy han llegado a casi 80 grados. A este ritmo, han subido. llegarán a 220 grados. Así que, claramente, amigos, el debate sobre el clima continúa. Stephen Colbert, 6 de abril de 2010 11 Los modelos lineales se pueden utilizar para aproximar la relación entre dos variables. Sin embargo, estos modelos presentan limitaciones reales. La regresión lineal es simplemente un marco de modelado. La realidad casi siempre es mucho más compleja que nuestra simple línea. Por ejemplo, desconocemos cómo se comportarán los datos fuera de nuestra ventana limitada. Ejemplo 7.20 Utilice el modelo ayuda = 24,3 − 0,0431 × ingreso familiar para estimar la ayuda de otro estudiante de primer año cuya familia tuvo un ingreso de $1 millón. Recordemos que las unidades de ingreso familiar están en miles de dólares, por lo que queremos calcular la ayuda para un ingreso familiar = 1000: 24,3 − 0,0431 × ingresos familiares = 24,3 − 0,0431 × 1000 = −18,8 El modelo predice que este estudiante recibirá una ayuda de ­$18,800 (!). Elmhurst College no puede (o al menos no lo hace) exigir a los estudiantes que paguen un extra además de la matrícula para asistir. La aplicación de una estimación del modelo a valores fuera del ámbito de los datos originales se denomina extrapolación. Generalmente, un modelo lineal es solo una aproximación de la relación real entre dos variables. Si extrapolamos, estamos apostando, de forma poco fiable, a que la relación lineal aproximada será válida en lugares donde no se ha analizado. 7.2.6 Uso de R2 para describir la fuerza de un ajuste Anteriormente evaluamos la solidez de la relación lineal entre dos variables mediante la correlación, R. Sin embargo, es más común explicar la solidez de un ajuste lineal mediante R² , también conocido como R². Si disponemos de un , modelo lineal, podríamos describir la precisión con la que los datos se agrupan en torno al ajuste lineal. El R2 de un modelo lineal describe la cantidad de variación en la respuesta que se explica por la línea de mínimos cuadrados. Por ejemplo, considere los datos de Elmhurst, que se muestran en la Figura 7.16. La varianza de 2 la variable de respuesta, ayuda recibida, es s = 29,8. Sin embargo, si aplicamos nuestra línea de mínimos cuadrados, ayuda este modelo reduce la incertidumbre en la predicción. 11http://www.colbertnation.com/the­colbert­report­videos/269929/ Machine Translated by Google 330 CAPÍTULO 7. INTRODUCCIÓN A LA REGRESIÓN LINEAL 30 20 dólares) (miles Universidad la de Donaciones 10 0 0 100 200 Ingresos familiares ($1000s) Figura 7.16: Ayuda económica e ingresos familiares para una muestra aleatoria de 50 estudiantes de primer año de Elmhurst College, mostrados con la línea de regresión de mínimos cuadrados. Ayuda utilizando los ingresos familiares del estudiante. La variabilidad en los residuos describe cuánta variación 2 RES permanece después de usar el modelo: s = 22.4. En resumen, hubo una reducción de 2 s 2 − s RES de ayuda 2 s de ayuda = 29,8 − 22,4 = 29.8 7.5 29.8 = 0,25 o aproximadamente un 25 % de la variación de los datos al utilizar información sobre los ingresos familiares para predecir la ayuda mediante un modelo lineal. Esto corresponde exactamente al valor de R cuadrado: R = −0,499 2 R = 0,25 Ejercicio 7.21 Si un modelo lineal tiene una relación negativa muy fuerte con una correlación de ­0,97, ¿cuánto de la variación en la respuesta se explica por la variable explicativa?12 7.2.7 Predictores categóricos con dos niveles Las variables categóricas también son útiles para predecir resultados. En este estudio, consideramos un predictor categórico con dos niveles (recuerde que un nivel es lo mismo que una categoría). Consideraremos las subastas de eBay de un videojuego, Mario Kart para Nintendo Wii, donde se registraron tanto el precio total de la subasta como el estado del juego.<sup>13</sup> En este estudio, buscamos predecir el precio total basándonos en el estado del juego, que toma valores de usado y nuevo. La Figura 7.17 muestra un gráfico de los datos de la subasta . Para incorporar la variable de condición del juego en una ecuación de regresión, debemos convertir las categorías a una forma numérica. Lo haremos utilizando una variable indicadora llamada cond new, que toma el valor 1 cuando el juego es nuevo y 0 cuando se usa. Utilizando esta variable indicadora, el modelo lineal puede escribirse como precio = β0 + β1 × cond nuevo 12Aproximadamente R2 = (−0,97)2 = 0,94 o el 94% de la variación se explica por el modelo lineal. 13Estos datos se recopilaron en el otoño de 2009 y se pueden encontrar en openintro.org. Machine Translated by Google 331 7.2. AJUSTE DE UNA LÍNEA MEDIANTE REGRESIÓN DE MÍNIMOS CUADRADOS 70 total Precio 60 50 precio = 42,87 + 10,90 cond_new 40 30 0 1 (usado) (nuevo) Figura 7.17: Precios totales de subasta del videojuego Mario Kart, divididos en juegos de condición usada (x = 0) y nueva (x = 1). Los mínimos cuadrados También se muestra la línea de regresión. Estimar el valor t del error estándar Pr(>|t|) (Interceptar) cond nuevo 42.87 0,81 52,67 0,0000 10.90 1,26 8,66 0,0000 Tabla 7.18: Resumen de la regresión de mínimos cuadrados para el precio final de la subasta contra la condición del juego. El modelo ajustado se resume en la Tabla 7.18, y el modelo con sus estimaciones de parámetros se da como precio = 42,87 + 10,90 × cond nuevo Para los predictores categóricos con solo dos niveles, el supuesto de linealidad siempre será satisfecho. Sin embargo, debemos evaluar si los residuos en cada grupo son aproximadamente normales y tienen una varianza aproximadamente igual. Como se puede ver en la Figura 7.17, ambos Las condiciones se satisfacen razonablemente con los datos de la subasta. Ejemplo 7.22 Interprete los dos parámetros estimados en el modelo para el precio de Mario Kart en subastas de eBay. La intersección es el precio estimado cuando cond new toma valor 0, es decir, cuando el juego Está en estado usado. Es decir, el precio de venta promedio de una versión usada del juego. es $42.87. La pendiente indica que, en promedio, los juegos nuevos se venden por unos 10,90 dólares más que los usados. juegos. Machine Translated by Google 332 CAPÍTULO 7. INTRODUCCIÓN A LA REGRESIÓN LINEAL SUGERENCIA: Interpretación de estimaciones del modelo para predictores categóricos. La intersección estimada es el valor de la variable de respuesta para la primera categoría (es decir, la categoría que corresponde a un valor de indicador de 0). La pendiente estimada es la variación promedio de la variable de respuesta entre las dos categorías. Desarrollaremos más a fondo estos datos de subastas de eBay en el Capítulo 8, donde examinaremos la influencia de múltiples variables predictoras simultáneamente mediante regresión múltiple. En la regresión múltiple, consideraremos la asociación del precio de subasta con cada variable, controlando la influencia de otras variables. Esto es especialmente importante, ya que algunos predictores están asociados. Por ejemplo, las subastas con juegos nuevos a menudo incluían más accesorios. 7.3 Tipos de valores atípicos en la regresión lineal En esta sección, identificamos criterios para determinar qué valores atípicos son importantes e influyentes. Los valores atípicos en la regresión son observaciones que se encuentran lejos de la nube de puntos. Estos puntos son especialmente importantes porque pueden tener una fuerte influencia en la línea de mínimos cuadrados. Ejemplo 7.23. La Figura 7.19 muestra seis gráficos, junto con la línea de mínimos cuadrados y los gráficos de residuos. Para cada par de diagramas de dispersión y gráficos de residuos, identifique los valores atípicos obvios y observe cómo influyen en la línea de mínimos cuadrados. Recuerde que un valor atípico es cualquier punto que no parece corresponder a la gran mayoría de los demás puntos. (1) Hay un valor atípico lejos de los otros puntos, aunque sólo parece influir ligeramente en la línea. (2) Hay un valor atípico a la derecha, aunque está bastante cerca de los mínimos cuadrados. línea, lo que sugiere que no fue muy influyente. (3) Hay un punto lejos de la nube, y este valor atípico parece tirar de la línea de mínimos cuadrados hacia la derecha; examine cómo la línea alrededor de la nube primaria no parece encajar muy bien. (4) Hay una nube primaria y luego una pequeña nube secundaria de cuatro valores atípicos. La nube secundaria parece influir considerablemente en la línea, lo que hace que la línea de mínimos cuadrados no se ajuste correctamente en casi todas partes. Podría haber una explicación interesante para las nubes duales, algo que podría investigarse. (5) No hay una tendencia obvia en la nube principal de puntos y el valor atípico de la derecha parece controlar en gran medida la pendiente de la línea de mínimos cuadrados. (6) Hay un valor atípico lejos de la nube, sin embargo, cae bastante cerca del punto menos Los cuadrados se alinean y no parecen ser muy influyentes. Examine los gráficos de residuos de la Figura 7.19. Probablemente encontrará cierta tendencia en las nubes principales de (3) y (4). En estos casos, los valores atípicos influyeron en la pendiente de las líneas de mínimos cuadrados. En (5), a los datos sin una tendencia clara se les asignó una línea con una tendencia pronunciada simplemente debido a un valor atípico (!). Machine Translated by Google 7.3. TIPOS DE VALORES ATÍPICOS EN LA REGRESIÓN LINEAL 333 (1) (2) (3) (4) (5) (6) Figura 7.19: Seis gráficos, cada uno con una línea de mínimos cuadrados y un gráfico de residuos. Todos Los conjuntos de datos tienen al menos un valor atípico. Machine Translated by Google 334 CAPÍTULO 7. INTRODUCCIÓN A LA REGRESIÓN LINEAL Los puntos de apalancamiento que caen horizontalmente desde el centro de la nube tienden a tirar más fuerte de la línea, por eso los llamamos puntos con alto apalancamiento. Los puntos que se encuentran horizontalmente lejos de la línea son puntos de alta influencia; estos puntos pueden influir considerablemente en la pendiente de la línea de mínimos cuadrados. Si uno de estos puntos de alta influencia parece ejercer su influencia en la pendiente de la línea, como en los casos (3), (4) y (5) del Ejemplo 7.23 , lo llamamos punto influyente. Generalmente, podemos decir que un punto es influyente si, de haber ajustado la línea sin él, este se habría encontrado inusualmente lejos de la línea de mínimos cuadrados. Es tentador eliminar los valores atípicos. No lo haga sin una buena razón. Los modelos que ignoran casos excepcionales (e interesantes) suelen tener un rendimiento deficiente. Por ejemplo, si una empresa financiera ignorara las mayores fluctuaciones del mercado (los "valores atípicos"), pronto quebraría por realizar inversiones mal planificadas. Precaución: No ignore los valores atípicos al ajustar un modelo final. Si existen valores atípicos en los datos, no deben eliminarse ni ignorarse sin una buena razón. Cualquier modelo final que se ajuste a los datos no será muy útil si ignora los casos más excepcionales. Precaución: Valores atípicos para un predictor categórico con dos niveles. Tenga cuidado al usar un predictor categórico cuando uno de los niveles tenga muy pocas observaciones. En este caso, esas pocas observaciones se convierten en puntos influyentes. 7.4 Inferencia para regresión lineal En esta sección, analizamos la incertidumbre en las estimaciones de la pendiente y la ordenada en el origen para una recta de regresión. Al igual que en capítulos anteriores, identificamos los errores estándar para las estimaciones puntuales, primero analizamos los errores estándar para estas nuevas estimaciones. Sin embargo, en el caso de la regresión, identificaremos los errores estándar mediante software estadístico. 7.4.1 Elecciones de mitad de mandato y desempleo Las elecciones para miembros de la Cámara de Representantes de los Estados Unidos se celebran cada dos años, coincidiendo cada cuatro años con las elecciones presidenciales. El conjunto de elecciones a la Cámara que tienen lugar a mitad de un mandato presidencial se denomina elecciones de mitad de mandato. En el sistema bipartidista de Estados Unidos, una teoría política sugiere que cuanto mayor sea la tasa de desempleo, peor le irá al partido del presidente en las elecciones de mitad de período. Para evaluar la validez de esta afirmación, podemos recopilar datos históricos y buscar una conexión. Consideramos todas las elecciones intermedias de 1898 a 2010, con excepción de las elecciones celebradas durante la Gran Depresión. La Figura 7.20 muestra estos datos y la línea de regresión de mínimos cuadrados: % de cambio en los escaños de la Cámara de Representantes para el partido del presidente. = −6,71 − 1,00 × (tasa de desempleo) Consideramos el cambio porcentual en el número de escaños del partido del Presidente (por ejemplo, el cambio porcentual en el número de escaños de los demócratas en 2010) frente a la tasa de desempleo. Machine Translated by Google 7.4. INFERENCIA PARA LA REGRESIÓN LINEAL 335 • Demócrata 10 Republicano Bush Clinton 2002 1998 • 0 • • Representantes. de Cámara la presidente partido del escaños los en porcentual Cambio −10 • • • −20 McKinley 1898 Reagan 1982 • • • • Obama 2010 • −30 4 8 12 Porcentaje de desempleo Figura 7.20: El cambio porcentual en los escaños en la Cámara de Representantes para el partido del Presidente en cada elección desde 1898 hasta 2010, graficado contra la tasa de desempleo. Se han eliminado los dos puntos de la Gran Depresión y se ha ajustado una línea de regresión de mínimos cuadrados a los datos. Al examinar los datos, no se observan desviaciones claras de la linealidad, la condición de varianza constante ni la normalidad de los residuos (aunque aquí no se examina un gráfico de probabilidad normal). Si bien los datos se recopilan secuencialmente, se realizó un análisis independiente para verificar cualquier correlación aparente entre observaciones sucesivas; no se encontró ninguna correlación. Ejercicio 7.24 Se eliminaron los datos de la Gran Depresión (1934 y 1938) porque la tasa de desempleo era del 21 % y del 18 %, respectivamente. ¿Está de acuerdo en que se eliminen para esta investigación? ¿Por qué sí o por qué no? 14 La línea que se muestra en la Figura 7.20 tiene una pendiente negativa . Sin embargo, esta pendiente (y la intersección con el eje y) son solo estimaciones de los valores de los parámetros. Cabe preguntarse: ¿es esta evidencia convincente de que el modelo lineal "verdadero" tiene una pendiente negativa? Es decir, ¿proporcionan los datos evidencia sólida de la precisión de la teoría política? Podemos enmarcar esta investigación en una prueba de hipótesis estadística unilateral: H0: β1 = 0. El modelo lineal verdadero tiene pendiente cero. HA: β1 < 0. El modelo lineal verdadero tiene una pendiente menor que cero. A mayor desempleo, mayor pérdida para el partido del presidente en la Cámara de Representantes. Rechazaríamos H0 en favor de HA si los datos proporcionan evidencia sólida de que el parámetro de pendiente real es menor que cero. Para evaluar las hipótesis, identificamos un error estándar para la estimación, calculamos un estadístico de prueba apropiado e identificamos el valor p. 14Ofreceremos dos consideraciones. Cada uno de estos puntos tendría un efecto de influencia muy alto en cualquier línea de regresión de mínimos cuadrados, y años con un desempleo tan alto podrían no ayudarnos a comprender qué sucedería en otros años donde el desempleo es solo moderadamente alto. Por otro lado, estos son casos excepcionales, y estaríamos descartando información importante si los excluyéramos de un análisis final. Machine Translated by Google 336 CAPÍTULO 7. INTRODUCCIÓN A LA REGRESIÓN LINEAL 7.4.2 Comprensión de la salida de regresión del software Al igual que otras estimaciones puntuales que hemos visto antes, podemos calcular un error estándar y Estadístico de prueba para b1. Generalmente, etiquetaremos el estadístico de prueba con una T, ya que sigue la distribución t. Nos basaremos en software estadístico para calcular el error estándar y dejaremos la explicación de cómo se determina este error estándar para un segundo o tercer curso de estadística. La Tabla 7.21 muestra la salida del software para la línea de regresión de mínimos cuadrados en la Figura 7.20 . La fila etiquetada unemp representa la información de la pendiente, que es el coeficiente de la variable de desempleo. Estimar el valor t del error estándar Pr(>|t|) (Intercepción) ­6,7142 desempleo ­1,0010 5.4567 ­1.23 0.2300 0.8717 ­1,15 0,2617 gl = 25 Tabla 7.21: Salida del software estadístico para el modelo de línea de regresión de las pérdidas en las elecciones de mitad de período para el partido del Presidente como respuesta a desempleo. Ejemplo 7.25 ¿Qué representan la primera y la segunda columna de la Tabla 7.21 ? Las entradas en la primera columna representan las estimaciones de mínimos cuadrados, b0 y b1, y Los valores de la segunda columna corresponden a los errores estándar de cada estimación. Anteriormente utilizamos una estadística de prueba para probar hipótesis en el contexto numérico. Datos. La regresión es muy similar. En las hipótesis que consideramos, el valor nulo de la pendiente... es 0, por lo que podemos calcular la estadística de prueba utilizando la fórmula de puntuación T (o Z): T= estimación − valor nulo = SE −1.0010 − 0 0.8717 = −1,15 Podemos buscar el valor p unilateral, que se muestra en la Figura 7.22 , utilizando la tabla de probabilidad para la distribución t en el Apéndice B.2 en la página 410. Ejemplo 7.26 La tabla 7.21 ofrece los grados de libertad para la estadística de prueba T: df = 25. Identifique el valor p para la prueba de hipótesis. Mirando la fila de 25 grados de libertad en el Apéndice B.2, vemos que la libertad absoluta El valor de la estadística de prueba es menor que cualquier valor indicado, lo que significa que el área de la cola y, por lo tanto, el valor p también es mayor que 0,100 (¡una cola!). Porque el valor p es tan grande que no podemos rechazar la hipótesis nula. Es decir, los datos no proporcionan evidencia convincente de que una tasa de desempleo más alta tiene alguna correspondencia con Pérdidas menores o mayores para el partido del Presidente en la Cámara de Representantes en elecciones de mitad de período. Podríamos haber identificado la estadística de prueba t a partir de la salida del software en la Tabla 7.21, se muestra en la segunda fila (desemp) y la tercera columna (valor t). La entrada en la segunda La fila y la última columna de la Tabla 7.21 representan el valor p para la prueba de hipótesis de dos caras. donde el valor nulo es cero. La prueba unilateral correspondiente tendría un valor p de la mitad de el valor indicado. Machine Translated by Google 7.4. INFERENCIA PARA LA REGRESIÓN LINEAL −2.62 −1,74 −0,87 337 0 0.87 1.74 2.62 Figura 7.22: La distribución que se muestra aquí es la distribución de muestreo para b1, si la hipótesis nula fuera verdadera. La cola sombreada representa el valor p. para la prueba de hipótesis que evalúa si existe evidencia convincente de que Un mayor desempleo corresponde a una mayor pérdida de escaños en la Cámara de Representantes. El partido del presidente durante una elección de mitad de período. Inferencia para regresión Generalmente nos basamos en software estadístico para identificar estimaciones puntuales y estándares. Errores en los parámetros de una línea de regresión. Tras verificar que se cumplen las condiciones de ajuste una línea, podemos usar los métodos aprendidos en la Sección 5.3 para la distribución t para crear intervalos de confianza para parámetros de regresión o para evaluar pruebas de hipótesis. Precaución: No utilice descuidadamente el valor p del resultado de la regresión. La última columna en el resultado de la regresión suele enumerar los valores p para una hipótesis específica: una prueba bilateral donde el valor nulo es cero. Si la prueba es unilateral y... La estimación puntual está en la dirección de HA, entonces puede reducir a la mitad el valor p del software para obtener el área de una cola. Si ninguno de estos escenarios coincide con su prueba de hipótesis, Tenga cuidado al utilizar la salida del software para obtener el valor p. Ejemplo 7.27 Examine la Figura 7.16 en la página 330, que relaciona la ayuda de Elmhurst College y los ingresos familiares del estudiante. ¿Qué tan seguro está de que la pendiente es estadísticamente...? significativamente diferente de cero? Es decir, ¿cree que una prueba de hipótesis formal... ¿Rechazar la afirmación de que la verdadera pendiente de la línea debe ser cero? Si bien la relación entre las variables no es perfecta, existe una evidente tendencia decreciente en los datos. Esto sugiere que la prueba de hipótesis rechazará la afirmación nula. que la pendiente es cero. Machine Translated by Google 338 CAPÍTULO 7. INTRODUCCIÓN A LA REGRESIÓN LINEAL Ejercicio 7.28. La Tabla 7.23 muestra el resultado del software estadístico resultante del ajuste de la recta de regresión por mínimos cuadrados de la Figura 7.16. Utilice este resultado para evaluar formalmente las siguientes hipótesis. H0: El coeficiente real de los ingresos familiares es cero. HA: El coeficiente real de los ingresos familiares no es cero.¹¹ Estimación del error estándar t valor Pr(>|t|) 18,83 0,0000 (Intercepto) 24.3193 ingresos familiares ­0.0431 1.2915 ­3,98 0,0002 gl = 48 0.0108 Tabla 7.23: Resumen del ajuste de mínimos cuadrados para los datos de Elmhurst College. CONSEJO: Verifique siempre los supuestos. Si las condiciones para ajustar la línea de regresión no se cumplen, no se deben aplicar los métodos aquí presentados. El error estándar o el supuesto de distribución de la estimación puntual (que se asume normal al aplicar la prueba t) podrían no ser válidos. 7.4.3 Una estadística de prueba alternativa En la Sección 7.4.2, consideramos la prueba t como una forma de evaluar la solidez de la evidencia para una prueba de hipótesis . Sin embargo, podríamos centrarnos en R² . Recordemos que R² describe la proporción de variabilidad en la variable de respuesta (y) explicada por la variable explicativa (x). Si esta proporción es grande, sugiere que existe una relación lineal entre las variables. Si esta proporción es pequeña, la evidencia proporcionada por los datos podría no ser convincente. Este concepto —considerando la cantidad de variabilidad en la variable de respuesta explicada por la variable explicativa— es un componente clave en algunas técnicas estadísticas. El análisis de varianza (ANOVA), presentado en la Sección 5.5, utiliza este principio general. El método establece que si las categorías explican suficiente variabilidad, concluiríamos que la media varía entre ellas. Por otro lado, si solo se explica una pequeña variabilidad, podríamos no estar convencidos. El ANOVA puede emplearse también en modelos de regresión avanzados para evaluar la inclusión de variables explicativas, aunque estos detalles se abordarán más adelante. Observamos la segunda fila, correspondiente a la variable de ingresos familiares. Vemos que la estimación puntual de la pendiente de la línea es ­0,0431, el error estándar de esta estimación es 0,0108 y el estadístico de la prueba t es ­3,98. El valor p corresponde exactamente a la prueba bilateral que nos interesa: 0,0002. El valor p es tan pequeño que rechazamos la hipótesis nula y concluimos que los ingresos familiares y la ayuda financiera en Elmhurst College para los estudiantes de primer año que ingresaron en 2011 están correlacionados negativamente y que el parámetro de pendiente real es, de hecho, menor que 0, tal como creíamos en el Ejemplo 7.27. Machine Translated by Google 7.5. EJERCICIOS 339 7.5 Ejercicios 7.5.1 Ajuste de línea, residuos y correlación 7.1 Visualice los residuos. Los diagramas de dispersión que se muestran a continuación tienen una línea de regresión superpuesta. Si construyéramos un gráfico de residuos (residuos versus x) para cada uno, describa cómo se verían. • • • •• •• • • • • • • •• • • •• • •••• •• ••• • • •• •• • • •• • ••• •• • • • • ••• •• • •• • •• • • •••• ••••• ••• •• • • •• • • • • • • • •• • • • • • • ••• • •• •• • • • • • • • • •• • • • • • • • • •• • • • ••• • • •• • ••••• • •• • ••• •• • • • • • • • •• •• • • • •• •• • •• • • ••• • • •• • •• •••• • •••• • •• • • •• • •• (a) (b) 7.2 Tendencias en los residuos. A continuación se muestran dos gráficos de los residuos restantes tras ajustar un modelo lineal a dos conjuntos de datos diferentes. Describa las características importantes y determine si un modelo lineal sería adecuado para estos datos. Explique su razonamiento. • • • • • • •• • • ••• • • • • • • • • • • • • • •• • • •• • • ••• •• • • • ••••• • • •• • ••• •• • • •• •• • • ••• • ••• •••• • • • • • ••• • ••• • ••• ••• • ••• • •• •••• Novedades •• •• • •• •••••• • ••••••• •••••••• ••• • ••••••• ••• •••••••• • • • •• • ••••••••••••••••••••••••••••••• •••••• •• •• •• • • • • ••• • • •• • • • • •• • • • • • • •• • • • • • ••• •• •••• • •• • • • • •••• • ••• •••• • • •• •• • •• • • • • • •• • • • • •• • • • • • •• •••• • • •• ••• •• •• • ••••• ••••••• • •• •••••••• •••••••• ••• •••••• •••••••••••• •••••••••••••••••••••••• •••••••••••••••••••••••• ••• • ••••••••• • • Novedades • •••• •• • • •••N•ovedades • • • • •••••• • •••••• •• •• • •••••••• ••• •• •• •••• ••• • ••••• •• • • • • • • • •••••••• • ••• • •• •• •• • • • •• • • •• • • • • • •• ••• •• • • • •• • • (a) (b) 7.3 Identificar relaciones, Parte I. Para cada uno de los seis gráficos, identifique la fortaleza de la relación (por ejemplo, débil, moderada o fuerte) en los datos y si sería razonable ajustar un modelo lineal. • • • • • • •• • •• • • •• • • •• •• •• • • •• • ••• •• • •• • • •• • • • ••• •• • • •• • ••• • •••• • • • • • • •• ••• •• • • • •• •• ••••• • •• •••• • ••• • •• • • • • • • • ••• • •• •••• • • • • •• • • • •• • • • • •• • • • • •• • • ••• • ••• • • • • •• ••••• • • • • • • •• • • • • • • •• • • • • • • • •• • • • • • •• • • •• • • (d) • ••• • • • • • • • • • •• • (do) • •••• •• •• • ••••• ••••• ••• • • • •• • • • • •• •• • • • • • • •• • • • • •• •• • • • • • • • • • • • •• • •• • • • •• • • • •• •• • • •• • • •• • • • • • • • • • • • • • •• ••• •• •• •• • • • • • • • • • • •• •• • • •• •• • • •• • • • • • • • • • • • (b) • • •• ••• • • • • • • •• •• ••• •• • •• • • • • • • •• • • •• • • • • •• • • • •• •• •• • • • • • • •• •• •• • • • • • •• • •• • • • •• • • • • •••• • • •• • • •• • •• •• • •• • • ••• • • • •• • ••• •• • • • • •• •• • (a) •• • • •••••• • • • • •• • • •• •• • • ••• •• • • •• ••• • • • • ••• • • • •• • • • • • •• • • • • • •••••• • • •• • •• • • •• •••••• ••• • • • • • • •• • • • • • ••••• ••• • • ••• •• ••• • •• •• •••• • • • • • • • • • •• • • • • • •••• ••• ••• •• •••• ••• •• ••• •••• •• •••• • ••• •• • •••••• •• •• • • • • •• • • •• •• • •• •• • ••• •• • •• ••• •• • ••••••• • • (mi) • • • (F) Machine Translated by Google 340 CAPÍTULO 7. INTRODUCCIÓN A LA REGRESIÓN LINEAL 7.4 Identificar relaciones, Parte I. Para cada uno de los seis gráficos, identifique la fortaleza de la relación (por ejemplo, débil, moderada o fuerte) en los datos y si sería razonable ajustar un modelo lineal. • • • • • ••• • •• • • •• ••• • • ••••• •••• • • • •• •• • • • •• • • • •••••• • • •• • • •• • • • • • ••• • •• • •• • • • • • • • • ••• •• • ••• ••• • • •• • • •• • •• •••• • • • • • • • • •• • ••• • • • • • ••• •• •• • • •• • • Novedades •• •••• • •• • •• • ••• • • • •• •••• • •••• • •• • ••• •• • •• •• • • • •••• •• • • • • • • •• •••• •• • ••• • •• • • •••••• • • • •• • • •• • ••••••••• • •••• •• ••• •••• • •• • • • •• • • • • • • • Novedades ••• •• • • (a) • • • ••• •• • • ••• •• ••••••••• •• • • • •• • • • • ••• •• ••• • ••• •• • • • •• ••••• •• • • • •• •• •• • • • •• • • ••• •• •• •• • • • • • •• • • • •• •• • • •• • •• (b) • (do) • • • • • • • •• • • • • • •• • • •• • • • • • • • • • • • ••• •• •• • • • • •• • • • • • • • • ••• • •• • • • • • • • • ••• • •• •• • • • • ••• • • •• ••• • • • •• • •• • • • • •• •• • • • • • • •• • • •• • • • • • •• • • • •• • • • •••• • • • • • • • • • •• • •• •• • • • • • •• • • ••• • • • • • • • • • • •• • • • • • •••• •• • • • • •• • • • • • • •• • • • • • •• • • • •• •• •• • • ••• • • • • • • •• • • • • • •• • • • •• • • • • • • • • • • •• • • •• • •• • • • • • •• • • • • • • • • • •• • • • (d) •• • • • • • •• • • • • • • •• • • • • • • • • • • • •• • • • ••• • •• • • • • • • • • • • • • • • • • • • • • • • • • • • •• • • • • • •• • • • • •• • • • • • ••• •• • • •• • • • • • • • •• •• • • • • • •• • • ••• • • • •• • • • • • • • •• • • •• • • ••• • •• • • • (mi) (F) 7.5 Exámenes y calificaciones. Los dos diagramas de dispersión a continuación muestran la relación entre las calificaciones de los exámenes finales y de mitad de semestre registradas durante varios años en un curso de Estadística en una universidad. (a) Con base en estos gráficos, ¿cuál de los dos exámenes tiene la correlación más fuerte con el resultado final? ¿Calificación del examen? Explícalo. (b) ¿Puedes pensar en una razón por la cual la correlación entre el examen que elegiste en la parte (a) y ¿El examen final es más alto? 80 80 final Examen 100 final Examen 100 60 60 40 40 40 60 80 Examen 1 100 40 60 80 Examen 2 100 Machine Translated by Google 7.5. EJERCICIOS 341 7.6 Esposos y esposas, parte I. La Oficina de Censos y Encuestas de Población de Gran Bretaña recopiló una vez datos sobre una muestra aleatoria de 170 parejas casadas en Gran Bretaña, registrando la edad (en años) y las alturas (convertidas aquí a pulgadas) de los esposos y las esposas.16 El diagrama de dispersión de la izquierda muestra la edad de la esposa graficada contra la edad de su esposo, y el diagrama de la derecha muestra la altura de la esposa graficada contra la altura del esposo. 70 60 40 pulgadas) (en esposa la de Altura años) (en esposa la de Edad 65 60 20 55 20 40 60 60 65 Edad del marido (en años) 70 75 Altura del marido (en pulgadas) (a) Describe la relación entre las edades de los esposos y las esposas. (b) Describe la relación entre las estaturas de los esposos y las esposas. (c) ¿Qué gráfica muestra una correlación más fuerte? Explica tu razonamiento. (d) Los datos sobre las estaturas se recopilaron originalmente en centímetros y luego se convirtieron a pulgadas. ¿Afecta esta conversión la correlación entre las estaturas de los esposos y las esposas? 7.7 Relaciona la correlación, Parte I. Relacione las correlaciones calculadas con el diagrama de dispersión correspondiente. • • • •• •• • • • ••• • •• • • •• •• (a) R = −0,7 (b) R = 0,45 (c) R = 0,06 (d) R = • ••••• • • • • • •• • •• • • • • • •• • • • ••• • •• •• • • •• ••• ••• ••• •• • • • •• •• •••• • • •• • • •• •• •• • • • •• • •••• ••• •• • • • • (1) • • •• •• • • 0,92 (2) • •• • • • • •• • • • • • •• • • • •• • • • • • •• • • • •• • •• • • • •• • •• • • • • • • • • • • • • • • • • • • • • ••• • • • • • • •• • • • •• • ••• • •• • • • ••• • •• • • •• • • •• • • • • • • • •• •• • • •• • • • • • • • • • • • • • • • • • •• • • • • • • •• • • • • • • • • • • •• • • •• • ••• • • • • •• • • • •• •• • • •• • • • • • • •• • • •• •• • • • • • ••• • • • • •• • ••• •• • • •• • • • • • • • • ••• • • • • • •• • • • •• • •• • • •• (a) R = 0,49 (b) •• • •• • • •• • • • • •• • •• • • • • • • • • •• •• ••••• • • •• •• • • • •• • ••• • • • • • •• •• • • • • • •• • •• • • • • • • • • ••• •• • • • • • • • • • •• • •• • • • •• • ••• • • • • •• • • •• • •• • R = −0,48 (c) R (1) diagrama de dispersión correspondiente. • • • • •• • •• • • • • • • • •• • • • • • • • •• • •• • • • • •• • • •• •• • • • • • • • •• •• • • • • • • • • •• •• • • • • • • • • •• • • • • •• • • • • •• • • • • • • ••• • • • • •• • •• • •• • (3) • 7.8 Relaciona la correlación, Parte II. Relacione las correlaciones calculadas con las • • •• • • •• • • ••• • •••• • • • • • • • • • •• • • • •• • • • •• • •• • • • •• • • • • • •• • • •• • • • •• • • • • • • • •• •• • •• • ••• •• •• •• • • • •• • •• • •• • • • • • • •• • • ••• •• • •• •• • • • • = −0,03 (d) R = −0,85 • ••• • • • •• • • •• • •• (3) • • • (2) • • •• ••• • • •• • • • •• • • • •••• •• •• • • • ••• •••• • • • • • ••• • • • ••• • • ••••• • • • • •• • • • • • •• • ••• •• • • •• • • • •• • ••• •••••• • • •• • • • ••• (4) • • • • • • •• • • • • • • •••• • • • • • • ••• • • • • •• • ••• • •• • • • • • • •• • • • • • • ••• • • •• • • • • • •• •• • • • •• • • • • • • • • • • • •• • • •• • • • • •• • • • • • • • • • ••• • • • • • • • • • • (4) 16D.J. Hand. Manual de pequeños conjuntos de datos. Chapman & Hall/CRC, 1994. Machine Translated by Google 342 CAPÍTULO 7. INTRODUCCIÓN A LA REGRESIÓN LINEAL 7.9 Velocidad y altura. Se pidió a 1302 estudiantes de la UCLA que completaran una encuesta donde se les preguntaba sobre su altura, la velocidad máxima a la que habían conducido y su sexo. El diagrama de dispersión de la izquierda muestra la relación entre la altura y la velocidad máxima, y el diagrama de dispersión de la derecha muestra la distribución por sexo en esta relación. 100 100 mph) (en rápida más Velocidad 150 mph) (en rápida más Velocidad 150 50 50 hembra 0 • macho 0 60 65 70 60 75 Altura (en pulgadas) 70 80 Altura (en pulgadas) (a) Describe la relación entre la altura y la velocidad más rápida. (b) ¿Por qué crees que estas variables están asociadas positivamente? (c) ¿Qué papel juega el género en la relación entre la altura y la velocidad de conducción más rápida? 7.10 Árboles. Los diagramas de dispersión a continuación muestran la relación entre la altura, el diámetro y el volumen de la madera en 31 cerezos negros talados. El diámetro del árbol se mide a 1,45 metros sobre el suelo.17 • • 70 70 • •• •• • • • 10 • • 65 • • • • • •• • • cúbicos) pies (en Volumen • cúbicos) pies (en Volumen 40 40 • • •• • • • • • • • •• • • • ••• • 85 • • • •• ••• • • 10 75 • •• •• • •• 8 Altura (en pies) 12 16 20 Diámetro (en pulgadas) (a) Describe la relación entre el volumen y la altura de estos árboles. (b) Describe la relación entre el volumen y el diámetro de estos árboles. (c) Supón que tienes las medidas de altura y diámetro de otro cerezo negro. ¿Cuál de estas variables sería preferible usar para predecir el volumen de madera de este árbol mediante un modelo de regresión lineal simple? Explica tu razonamiento. 17Fuente: Conjunto de datos R, http://stat.ethz.ch/R­manual/R­patched/library/datasets/html/trees.html. Machine Translated by Google 7.5. EJERCICIOS 343 7.11 El Coast Starlight, Parte I. El tren Coast Starlight de Amtrak va de Seattle a Los Ángeles. El diagrama de dispersión a continuación muestra la distancia entre cada parada (en millas) y el tiempo que se tarda en ir de una a otra (en minutos). (a) Describe la relación entre la distancia y el tiempo de viaje. 360 (b) ¿Cómo cambiaría la relación si en cambio se midiera el tiempo de viaje? 300 • • 240 (minutos) viaje de Tiempo ¿en horas y la distancia se medía en kilómetros? • • 180 • • (c) La correlación entre el tiempo de viaje (en millas) y la distancia (en minutos) es R = 0,636. ¿Cuál es la correlación? 120 ¿Entre el tiempo de viaje (en kilómetros) y la 60 • • • distancia (en horas)? •• • • • • • 0 100 200 300 Distancia (millas) 7.12 Bebés gateando, Parte I. Un estudio realizado en la Universidad de Denver investigó si los bebés tardan más en aprender a gatear en los meses fríos, cuando suelen estar abrigados con ropa que restringe su movimiento, que en los meses más cálidos.<sup> 18</sup> Los bebés nacidos durante el año de estudio se dividieron en doce grupos, uno por cada mes de nacimiento. Se comparó la edad promedio de gateo de los bebés de cada grupo con la temperatura promedio a los seis meses (cuando suelen empezar a intentar gatear). La temperatura se mide en grados Fahrenheit (◦F) y la edad, en semanas. 34 (a) Describe la relación entre la temperatura y la edad de gateo. (b) ¿Cómo cambiaría la 33 relación si la temperatura se midiera en grados Celsius (◦C) y la edad se midiera en meses? •• • • 32 • • 31 • semanas) (en gateo de promedio Edad (c) La correlación entre la temperatura en °F y la • • edad en semanas fue R = −0,70. Si convertimos la temperatura a °C y la edad a meses, ¿cuál 30 sería la correlación? 29 • • • 30 40 50 60 70 Temperatura (en °F) J.B. Benson. “Estación de nacimiento e inicio de la locomoción: implicaciones teóricas y metodológicas”. En: Conducta infantil y desarrollo 16.1 (1993), pp. 69–81. issn: 0163­6383. Machine Translated by Google 344 CAPÍTULO 7. INTRODUCCIÓN A LA REGRESIÓN LINEAL 7.13 Medidas corporales, parte I. Los investigadores que estudian antropometría recopilaron medidas de la circunferencia corporal y del diámetro esquelético, así como la edad, el peso, la altura y el sexo de 507 personas físicamente activas.19 El diagrama de dispersión a continuación muestra la relación entre la altura y la circunferencia del hombro (sobre los músculos deltoides), ambas medidas en centímetros. 200 (a) Describe la relación entre la circunferencia del 190 hombro y la altura. (b) ¿Cómo cambiaría la relación si la circunferencia del hombro 180 unidades de altura permanecieran en centímetros? cm) (en Altura se midiera en pulgadas mientras que las 170 160 150 90 100 110 120 130 Circunferencia del hombro (en cm) 7.14 Medidas corporales, Parte II. El diagrama de dispersión a continuación muestra la relación entre el peso medido en kilogramos y el perímetro de cadera medido en centímetros a partir de los datos descritos en el Ejercicio 7.13. 120 (a) Describe la relación entre la circunferencia de la cadera y el peso. (b) ¿Cómo 100 cambiaría la relación si el peso se midiera en libras kg) (en Peso mientras que las unidades de circunferencia de la cadera permanecieran en centímetros? 80 60 40 80 90 100 110 120 130 Circunferencia de la cadera (en cm) 7.15 Correlación, Parte I. ¿Cuál sería la correlación entre las edades de los esposos y las esposas si los hombres siempre se casaran con mujeres que fueran... (a) ¿3 años más jóvenes que ellos? (b) ¿2 años mayores que ellos? (c) ¿la mitad de su edad? 7.16 Correlación, Parte II. ¿Cuál sería la correlación entre los salarios anuales de hombres y mujeres en una empresa si para cierto tipo de puesto los hombres siempre ganaran? (a) ¿5.000 más que las mujeres? (b) ¿25% más que las mujeres? (c) ¿15% menos que las mujeres? 19G. Heinz et al. “Explorando las relaciones en las dimensiones corporales”. En: Journal of Statistics Education 11.2 (2003). Machine Translated by Google 7.5. EJERCICIOS 345 7.5.2 Ajuste de una línea mediante regresión de mínimos cuadrados 7.17 Gasto turístico. La Asociación de Agencias de Viajes Turcas informa el número de turistas extranjeros que visitan Turquía y gasto turístico por año.20 El diagrama de dispersión a continuación muestra relación entre estas dos variables junto con el ajuste de mínimos cuadrados. (a) Describe la relación entre el número de turistas y el gasto. (b) ¿Cuáles son las variables explicativas y de respuesta? (c) ¿Por qué podríamos querer ajustar una línea de regresión a estos datos? (d) ¿Cumplen los datos las condiciones requeridas para ajustar una línea de mínimos cuadrados? Además de la 10000 15000 Diagrama de dispersión, utilice el gráfico de residuos y el histograma para responder esta pregunta. 5000 dólares) de millones (en Gasto 20 10 0 5000 10000 15000 20000 25000 −1500 −750 0 750 1500 Derechos residuales de autor −2000 1000 0 Número de turistas (en miles) 0 20Asociación de Agencias de Viajes Turcas, Cifras de visitantes extranjeros y gastos turísticos por años. Machine Translated by Google 346 CAPÍTULO 7. INTRODUCCIÓN A LA REGRESIÓN LINEAL 7.18 Nutrición en Starbucks, Parte I. El diagrama de dispersión a continuación muestra la relación entre la cantidad de calorías y la cantidad de carbohidratos (en gramos) que contienen los artículos del menú de comida de Starbucks.21 Dado que Starbucks solo enumera la cantidad de calorías en los artículos que se muestran, estamos interesados en predecir la cantidad de carbohidratos que tiene un elemento del menú en función de su contenido calórico. (a) Describe la relación entre el número de calorías y la cantidad de carbohidratos (en gramos) que contienen los elementos del menú de comida de Starbucks. (b) En este escenario, ¿cuáles son las variables explicativas y de respuesta? (c) ¿Por qué podríamos querer ajustar una línea de regresión a estos datos? 40 60 80 (d) ¿Estos datos cumplen las condiciones requeridas para ajustar una línea de mínimos cuadrados? gramos) (en Carbohidratos 25 20 20 15 10 5 100 200 300 400 500 Calorías 0 0 −30 −15 15 30 0 −20 −40 40 20 Derechos residuales de autor 7.19 El Coast Starlight, Parte II. El ejercicio 7.11 presenta datos sobre el Coast Starlight. Tren Amtrak que va de Seattle a Los Ángeles. El tiempo medio de viaje de una parada a la siguiente... El siguiente en el Coast Starlight es de 129 minutos, con una desviación estándar de 113 minutos. La media La distancia recorrida de una parada a la siguiente es de 107 millas con una desviación estándar de 99 millas. La correlación entre el tiempo de viaje y la distancia es de 0,636. (a) Escriba la ecuación de la línea de regresión para predecir el tiempo de viaje. (b) Interprete la pendiente y la intersección en este contexto. 2 de la línea de regresión para predecir el tiempo de viaje a partir de la distancia recorrida para el (c) Calcular R 2 en el contexto de la solicitud. Coast Starlight e interpretar R (d) La distancia entre Santa Bárbara y Los Ángeles es de 103 millas. Usa el modelo para estimar el tiempo que tarda la luz de las estrellas en viajar entre estas dos ciudades. (e) En realidad, el Coast Starlight tarda unos 168 minutos en viajar desde Santa Bárbara hasta Los Ángeles. Ángeles. Calcula el valor residual y explica su significado. (f) Supongamos que Amtrak está considerando agregar una parada al Coast Starlight a 500 millas de Los Ángeles. Ángeles. ¿Sería apropiado utilizar este modelo lineal para predecir el tiempo de viaje desde Los Ángeles? ¿Ángeles hasta este punto? 21Fuente: Starbucks.com, recopilado el 10 de marzo de 2011, http://www.starbucks.com/menu/nutrition. Machine Translated by Google 7.5. EJERCICIOS 347 7.20 Medidas corporales, Parte III. El ejercicio 7.13 introduce datos sobre la circunferencia del hombro y Altura de un grupo de individuos. La media del perímetro de hombros es de 108,20 cm con una desviación estándar. de 10,37 cm. La altura media es de 171,14 cm con una desviación estándar de 9,41 cm. La correlación entre la altura y la circunferencia del hombro es 0,67. (a) Escribe la ecuación de la línea de regresión para predecir la altura. (b) Interprete la pendiente y la intersección en este contexto. (c) Calcular R 2 de la línea de regresión para predecir la altura a partir de la circunferencia del hombro, e interpretarla en el contexto de la solicitud. (d) Un estudiante seleccionado al azar de tu clase tiene una circunferencia de hombros de 100 cm. Predice la altura. de este estudiante utilizando el modelo. (e) El estudiante de la parte (d) mide 160 cm de altura. Calcule el residuo y explique qué es este residuo. medio. (f) Un niño de un año tiene una circunferencia de hombros de 56 cm. ¿Sería apropiado utilizar este modelo lineal? ¿Cómo predecir la altura de este niño? • 100 7.21 Calificaciones y TV. Los datos se recopilaron en el Número de horas por semana que los estudiantes ven televisión y • • 90 calificación que obtuvieron en una clase de biología en una escala de 100 puntos. Con base en el diagrama de dispersión y el diagrama de residuos proporcionados, • • • •• • • • • 70 100) (sobre Calificaciones determinar si un modelo lineal simple es apropiado para • • 0 10 • • 60 Predecir la calificación de un estudiante a partir del número de horas por Semana el estudiante ve la televisión. 80 describir la relación entre las dos variables, y • • 20 • • 30 TV (horas) 20 10 0 −10 −20 • • • • • • • • • •• • • •• • • • 30 7.22 Nutrición en Starbucks, Parte II. El ejercicio 7.18 introdujo un conjunto de datos sobre información nutricional de los artículos del • • menú de Starbucks. Con base en 100 20 gramos) (en Proteína El modelo es apropiado para predecir la cantidad de proteína de el número de calorías. −20 de estos elementos del menú y determinar si un lineal simple 10 20 El diagrama de dispersión y el diagrama de residuos proporcionados describen la Relación entre el contenido de proteínas y calorías 200 300 Calorías 400 500 Machine Translated by Google 348 CAPÍTULO 7. INTRODUCCIÓN A LA REGRESIÓN LINEAL 7.23 Cascos y almuerzos. El diagrama de dispersión muestra la relación entre el nivel socioeconómico, medido como el porcentaje de niños de un barrio que reciben almuerzos escolares a precio reducido (almuerzo), y el porcentaje de ciclistas del barrio que usan casco (casco). El porcentaje promedio de niños que reciben almuerzos a precio reducido es del 30,8% con una desviación estándar del 26,7% y el porcentaje promedio de ciclistas que usan casco es del 38,8% con una desviación estándar del 16,9%. (a) Si el R de la línea de regresión de mínimos 2 cuadrados para estos datos es del 72%, ¿cuál es la correlación entre 60 el almuerzo y el casco? • • 50 (b) Calcule la pendiente y la intersección de la línea de regresión de 40 mínimos cuadrados para estos datos. (c) Interprete cascos usando % la intersección de la línea de regresión de mínimos cuadrados en el contexto de la aplicación. • 30 • • • • • 20 (d) Interprete la pendiente de la recta de regresión de mínimos cuadrados en el contexto de la aplicación. (e) •• 10 ¿Cuál sería el valor del residuo para un barrio donde el 40% de los • niños reciben almuerzos a precio reducido y el 40% de los ciclistas usan casco? Interprete el significado de este residuo en el contexto 0 20 40 60 • 80 % que recibe almuerzo a precio reducido de la aplicación. 7.5.3 Tipos de valores atípicos en la regresión lineal 7.24 Valores atípicos, Parte I. Identifique los valores atípicos en los diagramas de dispersión que se muestran a continuación y determine qué tipo de valores atípicos son. Explique su razonamiento. ••• ••• • ••• ••• • • • • •• • •••••••• •• •• •• • • •• • • • • • • •• •• ••• •••••• •• •• ••• • • • ••• •• • • ••• •• •• • • • • • ••• • • ••• • •• • •• • •• • • •• • •• • • • • ••• • • • •• • • •• • • •• • •• • • ••• • • (a) • • • (b) •• • • • •• (do) 7.25 Valores atípicos, Parte II. Identifique los valores atípicos en los diagramas de dispersión que se muestran a continuación y determine qué tipo de valores atípicos son. Explique su razonamiento. • • •• • • •••• • • • ••• ••• •••••• • • •• •• • • •• ••• •• •• •• • •• • •• • •••• •• •• • • • •• •• ••••••• ••• ••• • •• • • • •• • • •• • • • • •• •• • • •• • • • •• • • • • (a) • • • • •• • • •• • •• • • • • • • • • •• • ••••• • • ••• • • • • (b) (do) 7.26 Bebés gateando, Parte II. El ejercicio 7.12 presenta datos sobre la temperatura media mensual durante el mes en que los bebés intentan gatear por primera vez (aproximadamente 6 meses después del nacimiento) y la edad media de gateo de los bebés nacidos en un mes determinado. Un diagrama de dispersión de estas dos variables revela un posible mes atípico, cuando la temperatura media es de unos 53 °F y la edad media de gateo es de unas 28,5 semanas. ¿Tiene este punto un alto poder de influencia? ¿Es un punto influyente? Machine Translated by Google 7.5. EJERCICIOS 349 7.27 Propietarios de viviendas urbanas, Parte I. El diagrama de dispersión a continuación muestra el porcentaje de familias que son propietarias de su vivienda frente al porcentaje de la población que vive en áreas urbanas en 2010.22 Hay 52 observaciones, cada una correspondiente a un estado de los EE. UU. También se incluyen Puerto Rico y el Distrito de Columbia. (a) Describa la relación entre el porcentaje de familias que son propietarias de su vivienda y el (b) El valor atípico en la esquina inferior derecha corresponde al Distrito de Columbia, donde el 100% de la población se vivienda de propietarios son que % Porcentaje de la población que vive en zonas urbanas en 2010. 70 65 60 55 50 45 considera urbana. ¿Qué tipo de valor atípico es esta observación? 40 50 60 70 80 90 100 % población urbana 7.5.4 Inferencia para regresión lineal En los siguientes ejercicios, verifique visualmente las condiciones para ajustar una línea de regresión de mínimos cuadrados, pero no es necesario que informe estas condiciones en sus soluciones. 7.28 Cerveza y contenido de alcohol en sangre. Muchas personas creen que el género, el peso, los hábitos de consumo de alcohol y muchos otros factores son mucho más importantes para predecir el contenido de alcohol en sangre (CAS) que simplemente considerar el número de bebidas consumidas. Aquí examinamos datos de dieciséis estudiantes voluntarios de la Universidad Estatal de Ohio, cada uno de los cuales bebió un número aleatorio de latas de cerveza. Estos estudiantes se dividían equitativamente entre hombres y mujeres, y diferían en peso y hábitos de consumo de alcohol. Treinta minutos después, un agente de policía midió su contenido de alcohol en sangre (CAS) en gramos de alcohol por decilitro de sangre.<sup>23</sup> El diagrama de dispersión y la tabla de regresión resumen los hallazgos. • 0,15 • decilitro) por (gramos BAC 0.10 • 0.05 • • 2 • • • • 4 • • • • • (Interceptar) cervezas • • 6 Estimar el valor t del error estándar Pr(>|t|) ­0.0127 0.0126 ­1.00 0.0180 0.0024 7.48 0.3320 0.0000 8 latas de cerveza (a) Describe la relación entre el número de latas de cerveza y el nivel de alcohol en sangre. (b) Escribe la ecuación de la recta de regresión. Interpreta la pendiente y la intersección en contexto. (c) ¿Los datos proporcionan evidencia sólida de que beber más latas de cerveza se asocia con un aumento del alcohol en sangre? Plantea las hipótesis nula y alternativa, indica el valor p y formula tu conclusión. 2 (d) El coeficiente de correlación entre el número de latas de cerveza y el nivel de alcohol en sangre es 0,89. Calcule R y interpretarlo en contexto. (e) Supongamos que visitamos un bar, preguntamos a la gente cuántas bebidas han tomado y también tomamos su nivel de alcohol en sangre. ¿Cree que la relación entre el número de bebidas consumidas y el nivel de alcohol en sangre sería tan fuerte como la relación encontrada en el estudio de Ohio State? 22Oficina del Censo de los Estados Unidos, Clasificación urbana y rural del censo de 2010 y criterios de área urbana y Características de la Vivienda: 2010. 23J. Malkevitch y LM Lesser. Para fines prácticos: Alfabetización matemática en el mundo actual. WH Freeman & Co, 2008. Machine Translated by Google 350 CAPÍTULO 7. INTRODUCCIÓN A LA REGRESIÓN LINEAL 7.29 Medidas corporales, Parte IV. El diagrama de dispersión y el resumen de mínimos cuadrados a continuación muestran la relación entre el peso medido en kilogramos y la altura medida en centímetros de 507 individuos físicamente activos. kg) (en Peso 100 80 Estimar el valor t del error estándar Pr(>|t|) 7.5394 ­13.93 0.0000 0.0440 23.13 0.0000 (Intersección) ­105.0113 altura 1.0176 60 40 150 175 200 Altura (en cm) (a) Describe la relación entre la altura y el peso. (b) Escribe la ecuación de la recta de regresión. Interpreta la pendiente y la intersección en contexto. (c) ¿Los datos proporcionan evidencia sólida de que un aumento en la altura está asociado con un aumento? ¿En peso? Indique las hipótesis nula y alternativa, indique el valor p y exprese su conclusión. 2 (d) El coeficiente de correlación entre la altura y el peso es 0,72. Calcule R contexto. y lo interpretemos en 7.30 Esposos y esposas, Parte II. El ejercicio 7.6 presenta un diagrama de dispersión que muestra la relación entre las edades de los esposos y las esposas en una muestra aleatoria de 170 parejas casadas en Gran Bretaña. Donde ambos cónyuges son menores de 65 años. A continuación se presenta el resultado resumido del método de mínimos cuadrados. Adecuado para predecir la edad de la esposa a partir de la edad del marido. 60 40 años) (en esposa la de Edad (Interceptar) edad del marido Estimar el valor t del error estándar Pr(>|t|) 1.5740 1,1501 1,37 0,1730 0.9112 0.0259 35.25 0.0000 gl = 168 20 20 40 60 Edad del marido (en años) (a) Podríamos preguntarnos: ¿la diferencia de edad entre maridos y esposas es consistente a lo largo de las edades? Si este fuera el caso, entonces el parámetro de pendiente sería β1 = 1. Utilice la información anterior. para evaluar si hay evidencia sólida de que la diferencia en las edades de marido y mujer difiere para diferentes edades. (b) Escriba la ecuación de la línea de regresión para predecir la edad de la esposa a partir de la edad del esposo. (c) Interprete la pendiente y la intersección en contexto. (d) Dado que R 2 = 0,88, ¿cuál es la correlación de las edades en este conjunto de datos? (e) Conoces a un hombre casado de Gran Bretaña que tiene 55 años. ¿Qué predecirías que hará su esposa? ¿Qué edad tendrá? ¿Qué tan confiable es esta predicción? (f) Conoces a otro hombre casado de Gran Bretaña que tiene 85 años. ¿Sería prudente usar la ¿El mismo modelo lineal para predecir la edad de su esposa? Explícalo. Machine Translated by Google 7.5. EJERCICIOS 351 7.31 Esposos y esposas, Parte III. El diagrama de dispersión a continuación resume las estaturas de los esposos y las esposas en una muestra aleatoria de 170 parejas casadas en Gran Bretaña, donde ambos miembros de la pareja son menores de 65 años. La tabla también incluye el resultado resumido del ajuste por mínimos cuadrados para predecir la estatura de la esposa a partir de la del esposo. 70 65 Estimación del error estándar t valor Pr(>|t|) 4,6842 9,30 0,0000 43.5755 0,0686 4,17 0,0000 (Interceptar) 60 0.2863 pulgadas) (en esposa la de Altura altura del marido 55 60 65 70 75 Altura del marido (en pulgadas) (a) ¿Existe evidencia sólida de que los hombres más altos se casan con mujeres más altas? Plantee las hipótesis e incluya la información utilizada para realizar la prueba. (b) Escriba la ecuación de la línea de regresión para predecir la altura de la esposa a partir de la altura del esposo. (c) Interprete la pendiente y la intersección en el contexto de la aplicación. (d) Dado que R (e) 2 = 0,09, ¿cuál es la correlación de las alturas en este conjunto de datos? Conoces a un hombre casado de Gran Bretaña que mide 5'9” (69 pulgadas). ¿Cuál predecirías que será su ¿Cuál será la altura de mi esposa? ¿Qué tan confiable es esta predicción? (f) Conoces a otro hombre casado de Gran Bretaña que mide 1,90 m (79 pulgadas). ¿Sería prudente usar el mismo modelo lineal para predecir la estatura de su esposa? ¿Por qué sí o por qué no? 7.32 Propietarios de viviendas urbanas, Parte II. El ejercicio 7.27 presenta un diagrama de dispersión que muestra la relación entre el porcentaje de familias propietarias de vivienda y el porcentaje de la población que vive en zonas urbanas. A continuación se muestra un diagrama de dispersión similar, excluyendo el Distrito de Columbia, así como el gráfico de residuos. Se registraron 51 casos. 2 • (a) Para estos datos, R = 0,28. ¿Cuál es la correlación? ¿Cómo se puede determinar si es positiva o • • negativa? (b) Examine la • • •• gráfica de residuos. ¿Qué observa? ¿Es adecuado un • • ajuste por mínimos cuadrados simple para estos • •• • • • • datos? • • • • •• • • • •• • • • • •• • • • • vivienda de propietarios son que % • • • • •• • • • • • • • 0 40 −10 •• 60 80 % población urbana • • ••• • • • • • •• • • •• • • • • • •• • • • • • • • • • • •• • • • • • •• • • • •• • Machine Translated by Google 352 CAPÍTULO 7. INTRODUCCIÓN A LA REGRESIÓN LINEAL 7.33 Bebés. ¿Es la edad gestacional (tiempo transcurrido entre la concepción y el nacimiento) de un bebé con bajo peso al nacer? ¿Es útil para predecir la circunferencia de la cabeza al nacer? Veinticinco bebés con bajo peso al nacer... Estudiado en un hospital universitario de Harvard; los investigadores calcularon la regresión de la circunferencia de la cabeza (medida en centímetros) contra la edad gestacional (medida en semanas). La estimación La línea de regresión es circunferencia de la cabeza = 3,91 + 0,78 × edad gestacional (a) ¿Cuál es la circunferencia de la cabeza prevista para un bebé cuya edad gestacional es de 28 semanas? (b) El error estándar para el coeficiente de edad gestacional es 0,35, que se asocia con df = 23. ¿El modelo proporciona evidencia sólida de que la edad gestacional está significativamente asociada? ¿con circunferencia de la cabeza? 7.34 Califica a mi profesor. Algunos estudiantes universitarios critican la enseñanza de sus profesores en RateMyPro­fessors.com, una página web donde los estudiantes califican anónimamente a sus profesores según su calidad, facilidad, y atractivo. Utilizando los datos autoseleccionados de este foro público, los investigadores examinan la relaciones entre calidad, facilidad y atractivo para los profesores de diversas universidades. En este En este ejercicio trabajaremos con una parte de estos datos que los investigadores pusieron a disposición del público.24 El diagrama de dispersión de la derecha muestra la relación entre la puntuación de la evaluación docente (mayor puntuación significa mejor) y belleza estandarizada Puntuación (una puntuación de 0 significa promedio, negativo) significa superior a la media) para una muestra de 463 profesores. A continuación se presentan los diagnósticos asociados Gráficos. También se proporciona un resultado de regresión para docente evaluación La puntuación significa por debajo del promedio y una puntuación positiva 5.0 4.5 4.0 3.5 3.0 2.5 2.0 predecir la puntuación de la evaluación docente a partir de la belleza. puntaje. −1,5 −1,0 −0,5 0,0 0,5 1,0 1,5 2,0 150 100 50 0,5 0,0 −0,5 −1,0 −1,5 autor de residuales derechos Frecuencia 1.0 belleza −1,5 −1,0 −0,5 0,0 0.5 belleza 1.0 1.5 2.0 −2.0 −1.0 0.0 1.0 derechos residuales de autor 24J. Felton et al. “Evaluaciones de profesores por parte de estudiantes basadas en la web: las relaciones entre la calidad percibida, facilidad y sensualidad”. En: Assessment & Evaluation in Higher Education 29.1 (2004), págs. 91­108. Machine Translated by Google 7.5. EJERCICIOS 353 0.5 −0,5 −1.5 autor de residuales derechos −0,5 −1.5 muestra de Cuantiles 0.5 Gráfico Q−Q normal 1 −3 −2 −1 0 2 0 3 Cuantiles teóricos (Interceptar) la belleza 100 200 300 400 orden de recopilación de datos Estimar el valor t del error estándar Pr(>|t|) 4.010 0,0255 157,21 0,0000 Celda 1 0.0322 4.13 0.0000 (a) Dado que la puntuación de belleza estandarizada promedio es ­0,0883 y la evaluación docente promedio Si la puntuación es 3,9983, calcule la pendiente. Alternativamente, la pendiente se puede calcular utilizando solo la Información proporcionada en la tabla de resumen del modelo. (b) ¿Estos datos proporcionan evidencia convincente de que la pendiente de la relación entre la enseñanza y la ¿La evaluación y la belleza son positivas? Explica tu razonamiento. (c) Enumere las condiciones requeridas para la regresión lineal y verifique si cada una se cumple para esto. modelo. Machine Translated by Google Capítulo 8 Regresión múltiple y logística Los principios de la regresión lineal simple sientan las bases para métodos de regresión más sofisticados, utilizados en una amplia gama de entornos complejos. En el capítulo 8, exploramos la regresión múltiple, que introduce la posibilidad de más de un predictor, y la regresión logística, una técnica para predecir resultados categóricos con dos categorías posibles. 8.1 Introducción a la regresión múltiple La regresión múltiple extiende la regresión simple de dos variables al caso en el que aún se tiene una respuesta, pero muchos predictores (denotados como x1, x2, x3, etc.). El método se basa en escenarios donde muchas variables pueden estar conectadas simultáneamente a una salida. Consideraremos las subastas en eBay del videojuego Mario Kart para la Nintendo Wii. La variable de resultado de interés es el precio total de la subasta, que corresponde a la puja más alta más los gastos de envío. Intentaremos determinar cómo se relaciona el precio total con cada característica de la subasta, controlando simultáneamente otras variables. Por ejemplo, manteniendo constantes todas las demás características, ¿las subastas más largas se asocian con precios más altos o más bajos? Y, en promedio, ¿cuánto más suelen pagar los compradores por volantes adicionales de Wii (volantes de plástico que se acoplan al mando de Wii) en las subastas? La regresión múltiple nos ayudará a responder estas y otras preguntas. El conjunto de datos Mario Kart incluye resultados de 141 subastas.1 Cuatro observaciones de Este conjunto de datos se muestra en la Tabla 8.1, y las descripciones de cada variable se muestran en la Tabla 8.2. Observe que las variables de condición y foto de archivo son variables indicadoras. Por ejemplo, la variable "cond new" toma el valor 1 si el juego en subasta es nuevo y 0 si es usado. El uso de variables indicadoras en lugar de nombres de categorías permite que estas variables se utilicen directamente en la regresión. Consulte la Sección 7.2.7 para obtener más detalles. La regresión múltiple también admite variables categóricas con varios niveles, aunque no contamos con ninguna de estas variables en este análisis, por lo que reservamos estos detalles para un segundo o tercer análisis. 1Diez DM, Barr CD y C¸ etinkaya­Rundel M. 2012. openintro: conjuntos de datos OpenIntro y funciones complementarias. cran.r­project.org/web/packages/openintro. 354 Machine Translated by Google 8.1. INTRODUCCIÓN A LA REGRESIÓN MÚLTIPLE 355 Precio, condición, nueva foto de stock, duración, ruedas 1 1 51.55 1 13 0 . . . 17 . . . . . . 1 . . . 140 38,76 0 0711 141 54,51 1 0 2 2 37.04 . . . . . . Tabla 8.1: Cuatro observaciones del conjunto de datos de Mario Kart. variable descripción precio Precio final de la subasta más gastos de envío, en dólares estadounidenses una variable categórica codificada de dos niveles, que toma el valor 1 cuando El juego es nuevo y 0 si el juego es usado Fotografía de stock de una variable categórica codificada de dos niveles, que toma el valor 1 si La foto principal utilizada en la subasta fue una foto de archivo y 0 si la La foto era exclusiva de esa subasta. duración la duración de la subasta, en días, tomando valores de 1 a 10 ruedas la cantidad de volantes de Wii incluidos en la subasta (un volante de Wii) segundo nuevo Es un volante de carreras de plástico que sostiene el controlador de Wii y es un Accesorio opcional pero útil para jugar a Mario Kart) Tabla 8.2: Variables y sus descripciones para el conjunto de datos de Mario Kart. 8.1.1 Un modelo de una sola variable para los datos de Mario Kart Ajustemos un modelo de regresión lineal con la condición del juego como predictor del precio de la subasta. El modelo puede escribirse como precio = 42,87 + 10,90 × cond nuevo Los resultados de este modelo se muestran en la Tabla 8.3 y un diagrama de dispersión del precio versus la condición del juego se muestra en la Figura 8.4. (Interceptar) Estimar el valor t del error estándar Pr(>|t|) 42.8711 0.8140 52.67 0.0000 segundo nuevo 10.8996 1.2583 8.66 0.0000 gl = 139 Tabla 8.3: Resumen de un modelo lineal para predecir el precio de subasta basado en condición de juego. Ejercicio 8.1 Examine la Figura 8.4. ¿Parece razonable el modelo lineal? Ejemplo 8.2 Interprete el coeficiente de la condición del juego en el modelo. ¿Es esto? ¿Coeficiente significativamente diferente de 0? Tenga en cuenta que cond new es una variable categórica de dos niveles que toma el valor 1 cuando El juego es nuevo y el valor es 0 cuando se usa. Por lo tanto, 10,90 significa que el modelo... 2Sí. La variabilidad constante, los residuos casi normales y la linealidad parecen razonables. Machine Translated by Google 356 CAPÍTULO 8. REGRESIÓN MÚLTIPLE Y LOGÍSTICA 70 Precio 60 50 40 30 0 (usado) 1 (nuevo) Condición Figura 8.4: Diagrama de dispersión del precio total de la subasta en función de la condición del juego. También se muestra la línea de mínimos cuadrados. predice $10,90 adicionales para aquellos juegos nuevos en comparación con los usados. (Consulte la Sección 7.2.7 para una revisión de la interpretación de las variables predictoras categóricas de dos niveles). Al examinar el resultado de la regresión en la Tabla 8.3, podemos ver que el valor p para cond new es muy cercano a cero, lo que indica que hay evidencia sólida de que el coeficiente es diferente de cero cuando se utiliza este modelo simple de una variable. 8.1.2 Inclusión y evaluación de muchas variables en un modelo A veces existen estructuras o relaciones subyacentes entre las variables predictoras. Por ejemplo, los juegos nuevos que se venden en eBay suelen incluir más volantes de Wii, lo que podría haber provocado precios más altos en esas subastas. Nos gustaría ajustar un modelo que incluya simultáneamente todas las variables potencialmente importantes. Esto nos ayudaría a evaluar la relación entre una variable predictora y el resultado, controlando al mismo tiempo la posible influencia de otras variables. Esta es la estrategia utilizada en la regresión múltiple. Si bien somos cautelosos al realizar interpretaciones causales mediante la regresión múltiple, estos modelos son un primer paso común para proporcionar evidencia de una conexión causal. Queremos construir un modelo que tenga en cuenta no sólo la condición del juego, como en la Sección 8.1.1, sino que también tenga en cuenta simultáneamente otras tres variables: fotografía de archivo, duración y ruedas. precio = β0 + β1 × nuevo + β2 × foto de stock + β3 × duración + β4 × ruedas yˆ = β0 + β1x1 + β2x2 + β3x3 + β4x4 (8.3) En esta ecuación, y representa el precio total, x1 indica si el juego es nuevo, x2 indica si se usó una foto de archivo, x3 es la duración de la subasta y x4 es el número de volantes de Wii incluidos con el juego. Al igual que en el caso de un solo predictor, un modelo de regresión múltiple podría omitir componentes importantes o no representar con precisión la relación entre el resultado y las variables explicativas disponibles. Machine Translated by Google 8.1. INTRODUCCIÓN A LA REGRESIÓN MÚLTIPLE 357 Si bien ningún modelo es perfecto, deseamos explorar la posibilidad de que éste pueda ajustarse a los datos. razonablemente bien. Estimamos los parámetros β0, β1, ..., β4 de la misma manera que lo hicimos en el caso de un Predictor único. Seleccionamos b0, b1, ..., b4 que minimizan la suma de los residuos al cuadrado: 141 SSE = e 2 +e 2 +∙∙∙+e 1 2 141 2 = 141 mi i=1 2 = i (yi − yˆi) 2 i=1 Aquí hay 141 residuos, uno por cada observación. Normalmente usamos una computadora para... Minimizar la suma en la ecuación (8.4) y calcular estimaciones puntuales, como se muestra en el ejemplo Salida en la Tabla 8.5. Utilizando esta salida, identificamos las estimaciones puntuales bi de cada βi , justo como hicimos en el caso del único predictor. (Interceptar) segunda Estimar el valor t del error estándar Pr(>|t|) 36.2110 1.5140 23.92 0.0000 5.1306 1.0511 1.0803 1.0568 1.02 0.3085 ­0.0268 0.1904 ­0,14 0,8882 duración ruedas7.2852 0.5547 13.13 foto de stock nueva 4.88 0.0000 0.0000 gl = 136 Tabla 8.5: Salida del modelo de regresión donde el precio es el resultado y segundo nuevo, foto de stock, duración y ruedas son los predictores. Modelo de regresión múltiple Un modelo de regresión múltiple es un modelo lineal con muchos predictores. En general, escribimos el modelo como yˆ = β0 + β1x1 + β2x2 + ∙ ∙ ∙ + βkxk Cuando hay k predictores, a menudo estimamos los parámetros βi mediante una computadora. Ejercicio 8.5 Escriba el modelo en la ecuación (8.3) utilizando las estimaciones puntuales de Tabla 8.5. ¿Cuántos predictores hay en este modelo?3 Ejercicio 8.6 ¿Qué representa β4, el coeficiente de la variable x4 (volantes de Wii)? 4 ¿Cuál es la estimación puntual de β4? Ejercicio 8.7 Calcule el residuo de la primera observación en la Tabla 8.1 en la página 355 utilizando la ecuación identificada en el Ejercicio 8.5. 5 3yˆ = 36,21 + 5,13x1 + 1,08x2 − 0,03x3 + 7,29x4, y hay k = 4 variables predictoras. Es la diferencia promedio en el precio de subasta por cada volante Wii adicional incluido al mantener la 4 Otras variables se mantienen constantes. La estimación puntual es b4 = 7,29. 5ei = yi − yˆi = 51,55 − 49,62 = 1,93, donde 49,62 se calculó utilizando los valores de las variables de la observación y la ecuación identificada en el Ejercicio 8.5. (8.4) Machine Translated by Google 358 CAPÍTULO 8. REGRESIÓN MÚLTIPLE Y LOGÍSTICA Ejemplo 8.8: Estimamos un coeficiente para cond new en la Sección 8.1.1 de b1 = 10.90 con un error estándar de SEb1 = 1.26 al utilizar regresión lineal simple. ¿Por qué podría haber una diferencia entre esta estimación y la obtenida en el contexto de regresión múltiple? Si examináramos los datos cuidadosamente, veríamos que algunos predictores están correlacionados. Por ejemplo, al estimar la conexión entre el precio del resultado y el predictor "cond new" mediante regresión lineal simple, no pudimos controlar otras variables como el número de volantes de Wii incluidos en la subasta. Dicho modelo estaba sesgado por la variable de confusión "ruedas". Al utilizar ambas variables, este sesgo subyacente e involuntario se reduce o elimina (aunque el sesgo de otras variables de confusión podría persistir). El ejemplo 8.8 describe un problema común en la regresión múltiple: la correlación entre las variables predictoras. Decimos que las dos variables predictoras son colineales (se pronuncia colineal) cuando están correlacionadas, y esta colinealidad complica la estimación del modelo. Si bien es imposible evitar la colinealidad en los datos observacionales, los experimentos suelen diseñarse para evitar que los predictores sean colineales. Ejercicio 8.9. El valor estimado de la intersección es 36,21, y se podría considerar la posibilidad de interpretar este coeficiente de alguna manera, por ejemplo, que es el precio predicho del modelo cuando cada variable toma valor cero: se utiliza el juego, la imagen principal no es una foto de archivo, la duración de la subasta es de cero días y no se incluyen ruedas. ¿Resulta útil esta interpretación? 8.1.3 R2 ajustado como una mejor estimación de la varianza explicada Primero usamos R2 en la Sección 7.2 para determinar la cantidad de variabilidad en la respuesta que fue explicada por el modelo: variabilidad en los residuos R=1−=1− Variabilidad V ar(yi) en el resultado V ar(ei) 2 Donde ei representa los residuos del modelo e yi los resultados. Esta ecuación sigue siendo válida en el marco de la regresión múltiple, pero una pequeña mejora a menudo puede ser aún más informativa. Ejercicio 8.10 La varianza de los residuos del modelo del Ejercicio 8.7 es 23,34 y la varianza del precio total en todas las subastas es 83,06. Calcule R² para este modelo. Esta estrategia para estimar R2 es aceptable cuando solo hay una única variable. Sin embargo, resulta menos útil cuando hay muchas variables. El R regular es, en realidad, una estimación sesgada de la variabilidad explicada por el modelo. Para obtener una mejor estimación, utilizamos el R ajustado . Tres de las variables (segunda nueva, foto de archivo y ruedas) toman el valor 0, pero la duración de la subasta siempre es de uno o más días. Si la subasta no está abierta durante ningún día, ¡nadie podrá pujar! Esto significa que el precio total de la subasta siempre sería cero; la interpretación de la intersección en este contexto no es esclarecedora. 7R2 = 1 − 23.34 83.06 = 0,719. Machine Translated by Google 8.2. SELECCIÓN DEL MODELO 359 R2 ajustado como herramienta para la evaluación del modelo El R2 ajustado se calcula como 2 R = 1 − adj V ar(ei)/(n − k − 1) =1− V ar(yi)/(n − 1) V ar(ei) × V ar(yi) n−1 n­k­1 donde n es el número de casos utilizados para ajustar el modelo y k es el número de variables predictoras en el modelo. Dado que k nunca es negativo, el R2 ajustado será menor —a menudo, solo un poco menor— que el R2 sin ajustar . El razonamiento detrás del R2 ajustado reside en los grados de libertad asociados a cada varianza.8 Ejercicio 8.11. Hubo n = 141 subastas en el conjunto de datos de Mario Kart y k = 4 variables predictoras en el modelo. Utilice n, k y las varianzas del Ejercicio 8.10 para calcular el R² del modelo de Mario Kart.9 adj. Ejercicio 8.12 Supongamos que añadiste otro predictor al modelo, pero la varianza de los errores V ar(ei) no disminuyó. ¿Qué pasaría con el R² ? ¿Qué pasaría con el R² ajustado ? 10 8.2 Selección del modelo El mejor modelo no siempre es el más complejo. A veces, incluir variables que no son evidentemente importantes puede reducir la precisión de las predicciones. En esta sección, analizamos estrategias de selección de modelos que nos ayudarán a eliminar las variables menos importantes. En esta sección, y en la práctica, el modelo que incluye todas las variables explicativas disponibles suele denominarse modelo completo. Nuestro objetivo es evaluar si el modelo completo es el mejor. De no serlo, buscamos un modelo más pequeño que sea preferible. 8.2.1 Identificación de variables en el modelo que pueden no ser útiles La Tabla 8.6 presenta un resumen de los resultados de la regresión del modelo completo para los datos de la subasta. La última columna de la tabla enumera los valores p que pueden utilizarse para evaluar hipótesis de la siguiente forma: H0: βi = 0 cuando las demás variables explicativas están incluidas en el modelo. HA: βi = 0 cuando las demás variables explicativas están incluidas en el modelo. En la regresión múltiple , los grados de libertad asociados con la varianza de la estimación de los residuos son n − k − 1, no n − 1. Por ejemplo, si hiciéramos predicciones para datos nuevos usando nuestro modelo actual, encontraríamos que el R2 sin ajustar es una estimación demasiado optimista de la reducción en la varianza en la respuesta, y usar los grados de libertad en la fórmula R2 ajustada ayuda a corregir este sesgo. 141−1 23.34 × = 0,711. 141−4−1 83.06 10El R2 sin ajustar permanecería igual y el R2 ajustado disminuiría. 9R2 = 1 − adj Machine Translated by Google 360 CAPÍTULO 8. REGRESIÓN MÚLTIPLE Y LOGÍSTICA Estimar el valor t del error estándar Pr(>|t|) (Interceptar) segunda 36,2110 5,1306 1.0511 4.88 0.0000 foto de stock nueva 1,0803 1.0568 1.02 0.3085 ­0,0268 0,1904 ­0,14 0,8882 duración ruedas7,2852 0,5547 13,13 0,0000 R2adj 1.5140 23.92 0.0000 = 0,7108 gl = 136 Tabla 8.6: El ajuste del modelo de regresión completo, incluido el R2 ajustado . Ejemplo 8.13 El coeficiente de cond new tiene un estadístico de prueba de T = 4,88 y una Valor p para sus hipótesis correspondientes (H0 : β1 = 0, HA : β1 = 0) de aproximadamente cero. ¿Cómo se puede interpretar esto? Si mantenemos todas las demás variables en el modelo y no agregamos otras, entonces hay una fuerte evidencia de que la condición de un juego (nuevo o usado) tiene una relación real con el total precio de subasta. Ejemplo 8.14 ¿Existe evidencia sólida de que el uso de una fotografía de archivo está relacionado con la ¿Precio total de la subasta? La estadística de la prueba t para la fotografía de archivo es T = 1,02 y el valor p es de aproximadamente 0,31. Después Teniendo en cuenta los demás predictores, no hay pruebas sólidas de que el uso de un stock La foto en una subasta está relacionada con el precio total de la subasta. Podríamos considerar eliminando la variable de fotografía de stock del modelo. Ejercicio 8.15 Identifique los valores p para las variables de duración y ruedas En el modelo. ¿Existe evidencia sólida que respalde la conexión entre estas variables? ¿con el precio total en el modelo?11 No hay evidencia estadísticamente significativa de que ni la foto de archivo ni la duración Las variables contribuyen significativamente al modelo. A continuación, consideramos estrategias comunes para podar dichas variables de un modelo. SUGERENCIA: Utilizar R2 ajustado en lugar de valores p para la selección del modelo El R2 ajustado se puede utilizar como una alternativa a los valores p para la selección del modelo. donde un R2 ajustado más alto representa un mejor ajuste del modelo. Por ejemplo, podríamos comparar dos modelos utilizando su R2 ajustado , y se preferiría el modelo con el R2 ajustado más alto . Este enfoque tiende a incluir más variables en el modelo final en comparación con el enfoque del valor p. 8.2.2 Dos estrategias de selección de modelos Dos estrategias comunes para agregar o eliminar variables en un modelo de regresión múltiple se denominan selección regresiva y selección directa. Estas técnicas a menudo se denominan 11El valor p para la duración de la subasta es 0,8882, lo que indica que no hay una significación estadística. evidencia de que la duración está relacionada con el precio total de la subasta cuando se tienen en cuenta las otras variables. El valor p para la variable de ruedas de Wii es aproximadamente cero, lo que indica que esta variable está asociada con la precio total de la subasta. Machine Translated by Google 8.2. SELECCIÓN DEL MODELO 361 Se utilizan como estrategias de selección de modelos por pasos, ya que añaden o eliminan una variable a la vez a medida que recorren los predictores candidatos. Analizaremos estas estrategias en el contexto del enfoque del valor p. Alternativamente, podríamos haber empleado un enfoque R² . adj La estrategia de eliminación regresiva comienza con el modelo que incluye todas las variables predictoras potenciales. Las variables se eliminan una a una del modelo hasta que solo queden las variables con valores p estadísticamente significativos. La estrategia en cada paso de eliminación consiste en descartar la variable con el mayor valor p, reajustar el modelo y reevaluar la inclusión de todas las variables. Ejemplo 8.16. Los resultados correspondientes al modelo completo para los datos de Mario Kart se muestran en la Tabla 8.6. ¿Cómo debemos proceder con la estrategia de eliminación regresiva? Hay dos variables con coeficientes estadísticamente iguales a cero: foto de stock y duración. Primero, eliminamos la variable duración, ya que tiene un valor p correspondiente mayor, y luego reajustamos el modelo. La Tabla 8.7 muestra un resumen de la regresión del nuevo modelo. En el nuevo modelo, no hay evidencia sólida de que el coeficiente de la foto de archivo sea distinto de cero, a pesar de que el valor p disminuyó ligeramente y los demás valores p se mantienen muy bajos. A continuación, eliminamos de nuevo la variable con el mayor valor p no significativo (foto de archivo) y reajustamos el modelo. El resumen actualizado de la regresión se muestra en la Tabla 8.8. En el último modelo, observamos que los dos predictores restantes tienen coeficientes estadísticamente significativos con valores p cercanos a cero. Dado que no quedan variables que se puedan eliminar del modelo, nos detenemos. El modelo final incluye solo las variables "cond new" y "wheels" para predecir el precio total de la subasta: yˆ = b0 + b1x1 + b4x4 = 36,78 + 5,58x1 + 7,23x4 donde x1 representa segundas ruedas y x4 representa ruedas. Una alternativa al uso de valores p en la selección de modelos es usar el R² ajustado . En cada paso de eliminación, reajustamos el modelo sin cada una de las variables susceptibles de eliminación. Por ejemplo, en el primer paso, ajustaríamos cuatro modelos, donde cada uno carecería de un predictor diferente. Si uno de estos modelos más pequeños tiene un R² ajustado mayor que nuestro modelo actual, seleccionaremos el modelo más pequeño con el R² ajustado más alto . Continuamos de esta manera hasta que la eliminación de variables no aumente el R2 ajustado Si . hubiéramos utilizado los criterios de R2 ajustados , habríamos mantenido la variable de la foto de archivo junto con... con el segundo nuevo y ruedas variables. Observe que el valor p de la foto de archivo varió ligeramente del modelo completo (0,309) al modelo sin la variable duración (0,275). Es común que los valores p de una variable cambien, debido a la colinealidad, tras eliminar otra variable. Esta fluctuación subraya la importancia de reajustar el modelo después de cada paso de eliminación de variables. Los valores p tienden a cambiar drásticamente cuando la variable eliminada presenta una alta correlación con otra variable del modelo. La estrategia de selección hacia adelante es la inversa de la técnica de eliminación hacia atrás. En lugar de eliminar variables una a la vez, agregamos variables una a la vez hasta que no podamos encontrar ninguna variable que presente evidencia sólida de su importancia en el modelo. Machine Translated by Google 362 CAPÍTULO 8. REGRESIÓN MÚLTIPLE Y LOGÍSTICA (Interceptar) segunda Estimar el valor t del error estándar Pr(>|t|) 36.0483 0,9745 36,99 0,0000 5.1763 nueva foto de stock ruedas 0,9961 5,20 0,0000 1.1177 1.0192 1.10 0.2747 7.2984 0,5448 13,40 0,0000 R2adj = 0,7128 gl = 137 Tabla 8.7: La salida del modelo de regresión donde el precio es el resultado y la variable duración ha sido eliminada del modelo. (Interceptar) segundas Estimar el valor t del error estándar Pr(>|t|) 36.7849 0,7066 52.06 0.0000 ruedas nuevas 5.5848 0,9245 6.04 0.0000 7.2328 0.5419 13.35 R2 = 0,7124 ajustado 0.0000 gl = 138 Tabla 8.8: La salida del modelo de regresión donde el precio es el resultado y se han eliminado las variables de duración y foto de stock. modelo. Ejemplo 8.17 Construya un modelo para el conjunto de datos de Mario Kart utilizando la estrategia de selección hacia adelante. Comenzamos con el modelo que no incluye variables. Luego ajustamos cada una de las posibles modelos con una sola variable. Es decir, ajustamos el modelo incluyendo solo la segunda nueva predictor, luego el modelo que incluye solo la variable de la foto de archivo, luego un modelo con Solo duración y un modelo con solo ruedas. Cada uno de los cuatro modelos (sí, encajamos) ¡cuatro modelos!) proporciona un valor p para el coeficiente de la variable predictora. De De estas cuatro variables, la variable ruedas tuvo el valor p más pequeño. Dado que su valor p es menor que 0,05 (el valor p fue menor que 2e­16), agregamos la variable de ruedas de Wii al modelo. Una vez que se agrega una variable en la selección hacia adelante, se incluirá en todos modelos considerados así como el modelo final. Dado que encontramos con éxito una primera variable para agregar, consideramos agregar otra. Encajamos tres nuevos modelos: (1) el modelo que incluye sólo el segundo nuevo y ruedas variables (resultado en la Tabla 8.8), (2) el modelo que incluye solo la foto de archivo y las ruedas variables, y (3) el modelo que incluye solo las variables de duración y ruedas. De De estos modelos, el primero tuvo el valor p más bajo para su nueva variable (el valor p correspondiente a la nueva variable fue 1.4e­08). Dado que este valor p es inferior a 0.05, añadimos Añade una nueva variable al modelo. Ahora se garantiza que el modelo final incluirá ambas Las variables condición y ruedas. Luego debemos repetir el proceso una tercera vez, ajustando dos nuevos modelos: (1) el modelo Incluyendo las variables de fotografía de stock, segunda mano nueva y ruedas (salida en la Tabla 8.7) y (2) el modelo que incluye las variables duración, cond new y ruedas. El valor p correspondiente a la fotografía de archivo en el primer modelo (0,275) fue menor que El valor p correspondiente a la duración en el segundo modelo (0,682). Sin embargo, dado que Este valor p más pequeño no fue inferior a 0,05, no hubo evidencia sólida de que debiera serlo. se incluirán en el modelo. Por lo tanto, no se añade ninguna variable y terminamos. El modelo final es el mismo que se obtuvo utilizando la estrategia de selección hacia atrás. Machine Translated by Google 8.3. COMPROBACIÓN DE LOS SUPUESTOS DEL MODELO MEDIANTE GRÁFICOS 363 Ejemplo 8.18 Como antes, podríamos haber utilizado el criterio R² en lugar adj de examinar los valores p al seleccionar las variables del modelo. En lugar de buscar las variables con el valor p más bajo, buscamos el modelo con el R² ajustado más alto . ¿Cuál sería el resultado de la selección anticipada utilizando el enfoque R² ajustado? Utilizando la estrategia de selección hacia adelante, comenzamos con el modelo sin predictores. A continuación, analizamos cada modelo con un solo predictor. Si uno de estos modelos tiene un R mayor que el modelo sin variables, utilizamos este nuevo modelo. Repetimos este procedimiento de ajuste , añadiendo una variable a la vez, hasta encontrar un modelo con un R mayor . Si hubiéramos aplicado la estrategia de selección progresiva con R , habríamos obtenido el modelo que incluye "cond new", "stock photo" y "wheels", que es ligeramente adjmayor ., que el obtenido con el enfoque del valor p y el mismo que obtuvimos con el R ajustado y la eliminación regresiva. Estrategias de selección de modelos. La estrategia de eliminación regresiva comienza con el modelo más grande y elimina las variables una por una hasta que se comprueba que todas las variables restantes son importantes para el modelo. La estrategia de selección progresiva comienza sin incluir variables en el modelo y luego las añade según su importancia hasta que no se encuentran otras variables importantes. No hay garantía de que las estrategias de eliminación regresiva y selección progresiva arrojen el mismo modelo final utilizando los métodos de valor p o R se debe elegir el modelo con el R ajustado . Si se prueban ambas estrategias y se obtienen modelos diferentes, mayor como criterio de desempate; existen otras opciones de desempate, pero quedan fuera del alcance de este libro. adj Generalmente, es aceptable usar una sola estrategia, generalmente la eliminación regresiva con el valor p o el criterio R ajustado . Sin embargo, antes de informar los resultados del modelo, debemos verificar que las condiciones del mismo sean razonables. 8.3 Comprobación de los supuestos del modelo mediante gráficos Métodos de regresión múltiple utilizando el modelo yˆ = β0 + β1x1 + β2x2 + ∙ ∙ ∙ + βkxk generalmente dependen de los cuatro supuestos siguientes: 1. Los residuos del modelo son casi normales, 2. la variabilidad de los residuos es casi constante, 3. los residuos son independientes, y 4. cada variable está relacionada linealmente con el resultado. Se pueden utilizar gráficos simples y efectivos para comprobar cada uno de estos supuestos. Consideraremos el modelo para los datos de la subasta que utiliza la condición del juego y el número de ruedas como predictores. Machine Translated by Google 364 CAPÍTULO 8. REGRESIÓN MÚLTIPLE Y LOGÍSTICA 15 10 autor de residuales Derechos 5 0 −5 −10 −2 −1 0 1 2 Cuantiles teóricos Figura 8.9: Un gráfico de probabilidad normal de los residuos es útil para identificar observaciones que podrían ser valores atípicos. Gráfica de probabilidad normal. En la Figura 8.9 se muestra una gráfica de probabilidad normal de los residuos. Si bien la gráfica presenta algunas irregularidades menores, no hay valores atípicos que... podría ser motivo de preocupación. En un gráfico de probabilidad normal para residuos, tendemos a Lo que más preocupa son los residuos que parecen ser valores atípicos, ya que estos indican tiempos largos. colas en la distribución de residuos. Valores absolutos de los residuos frente a los valores ajustados. Una gráfica del valor absoluto de Los residuos contra sus valores ajustados correspondientes (ˆyi) se muestran en la Figura 8.10. Este gráfico es útil para comprobar la condición de que la varianza de los residuos sea aproximadamente constante. No observamos ninguna desviación obvia de la varianza constante en este ejemplo. Residuos en orden de recolección de datos. Un gráfico de los residuos en el orden de su Las subastas correspondientes se observaron como se muestra en la Figura 8.11. Este gráfico es útil en identificar cualquier conexión entre casos que están cerca uno del otro, por ejemplo podríamos Busque precios en descenso a lo largo del tiempo o si hubo un momento del día en que las subastas tendían a alcanzar un precio más alto. Aquí no vemos ninguna estructura que indique un problema.12 Residuos frente a cada variable predictora. Consideramos un gráfico de los residuos frente a La segunda nueva variable y los residuos contra la variable de las ruedas. Estos gráficos son se muestra en la Figura 8.12. Para la variable de condición de dos niveles, se garantiza que no para ver cualquier tendencia restante y, en cambio, estamos verificando que la variabilidad no fluctúan entre grupos. En este ejemplo, cuando consideramos los residuos frente a los ruedas variables, vemos una posible estructura. Parece haber curvatura en los residuos, lo que indica que la relación probablemente no es lineal. 12Una comprobación especialmente rigurosa utilizaría métodos de series temporales . Por ejemplo, podríamos comprobar si Los residuos consecutivos están correlacionados. Al hacerlo con estos residuos, no se obtienen correlaciones estadísticamente significativas. Machine Translated by Google 8.3. COMPROBACIÓN DE LOS SUPUESTOS DEL MODELO MEDIANTE GRÁFICOS 365 • 10 • • • • • • • • • • • • residuos los de absoluto Valor 5 0 • • • • • •• • • • • • •• • • •• • • • • • • • • • • • • • • • • • • • •• • • • •• •• • •• • • • • • •• •• • • •• • • • • •• • 40 45 • 50 • 55 60 65 Valores ajustados Figura 8.10: Comparar el valor absoluto de los residuos con los valores ajustados (ˆyi) es útil para identificar desviaciones del supuesto de varianza constante. • autor de residuales Derechos 10 0 −10 • • • • • 40 60 • • • • • • • • • • • • • • • •• • • • • • • • • • ••• • •• • •• • • • • • • •• • • • • • • • •• • • • •• •• • • • • • • •• • •• • •• • • • • •• • •• • • • • •• • •• • •• • •• • •• • • • • • • • • •• • • •• • •• •• • • • • • • •• • • • • 0 • • 20 •• 80 100 120 140 Orden de recogida Figura 8.11: La representación gráfica de los residuos en el orden en que se recopilaron sus observaciones correspondientes ayuda a identificar conexiones entre observaciones sucesivas. Si parece que las observaciones consecutivas tienden a estar próximas entre sí, esto indica que el supuesto de independencia de las observaciones no se cumple. Machine Translated by Google 366 CAPÍTULO 8. REGRESIÓN MÚLTIPLE Y LOGÍSTICA autor de residuales Derechos 10 0 −10 Usado Nuevo Condición • autor de residuales Derechos 10 0 • • • •• • • • • • •• • • • •• •• • • • • • • • • • •• Novedades Novedades −10 • •• • • 0 1 2 3 4 Número de ruedas Figura 8.12: En la variable de dos niveles para la condición del juego, verificamos diferencias en la forma o variabilidad de la distribución. Para los predictores numéricos, también verificamos tendencias u otra estructura. Observamos una ligera curvatura en los residuos en relación con la variable de las ruedas. Machine Translated by Google 8.4. REGRESIÓN LOGÍSTICA 367 Es necesario resumir los diagnósticos para cualquier ajuste del modelo. Si los diagnósticos respaldan los supuestos del modelo, esto mejoraría la credibilidad de los hallazgos. Si la evaluación diagnóstica muestra que persiste la estructura subyacente en los residuos, debemos intentar ajustar el modelo para tenerla en cuenta. Si no es posible, podemos informar el modelo, pero también debemos señalar sus deficiencias. En el caso de los datos de subastas, informamos que puede existir una relación no lineal entre el precio total y el número de ruedas incluidas en una subasta. Esta información sería importante para compradores y vendedores; omitirla podría ser un obstáculo para quienes podrían beneficiarse del modelo. “Todos los modelos son erróneos, pero algunos son útiles” ­George EP Box. Lo cierto es que ningún modelo es perfecto. Sin embargo, incluso los modelos imperfectos pueden ser útiles. Informar sobre un modelo defectuoso puede ser razonable, siempre que seamos claros e informemos de sus deficiencias. Precaución: No reporte resultados cuando los supuestos se incumplen gravemente. Si bien existe un cierto margen de maniobra en los supuestos del modelo, no se exceda. Si los supuestos del modelo se incumplen claramente, considere un nuevo modelo, incluso si eso implica aprender más métodos estadísticos o contratar a alguien que pueda ayudarle. SUGERENCIA: Intervalos de confianza en regresión múltiple Los intervalos de confianza para los coeficientes en regresión múltiple se pueden calcular utilizando la misma fórmula que en el modelo de predictor único: bi ± t dfSEbi donde t gl es el valor t apropiado correspondiente al nivel de confianza y al modelo grados de libertad, gl = n − k − 1. 8.4 Regresión logística En esta sección, presentamos la regresión logística como herramienta para construir modelos cuando existe una variable de respuesta categórica con dos niveles. La regresión logística es un tipo de modelo lineal generalizado (MLG) para variables de respuesta donde la regresión múltiple regular no funciona bien. En particular, la variable de respuesta en estos entornos suele adoptar una forma en la que los residuos difieren completamente de la distribución normal. Los GLM pueden considerarse un enfoque de modelado en dos etapas. Primero, modelamos la variable de respuesta mediante una distribución de probabilidad, como la binomial o la de Poisson. Segundo, modelamos el parámetro de la distribución mediante un conjunto de predictores y una forma especial de regresión múltiple. En la Sección 8.4, revisaremos el conjunto de datos de correo electrónico del Capítulo 1. Estos correos electrónicos se recopilaron de una sola cuenta y trabajaremos en el desarrollo de un filtro antispam básico con estos datos. La variable de respuesta, spam, se ha codificado para tomar el valor 0 cuando un mensaje no es spam y 1 cuando sí lo es. Nuestra tarea consistirá en construir un modelo adecuado que clasifique los mensajes como spam o no spam utilizando las características del correo electrónico codificadas como variables predictoras. Si bien este modelo no será el mismo que los utilizados en filtros antispam a gran escala, comparte muchas de sus características. Machine Translated by Google CAPÍTULO 8. REGRESIÓN MÚLTIPLE Y LOGÍSTICA 368 variable descripción Especifica si el mensaje fue spam. correo basura a múltiples Una variable indicadora si más de una persona fue incluida en el campo Para del correo electrónico. cc Un indicador que indica si alguien fue copiado en el correo electrónico. adjuntar Un indicador que indica si había un archivo adjunto, como un documento o una imagen. dólar Un indicador de si la palabra “dólar” o el símbolo del dólar ($) apareció en el correo electrónico. ganador Un indicador de si la palabra “ganador” apareció en el mensaje de correo electrónico. heredar Un indicador de si la palabra “heredar” (o una variación, como “herencia”) formato de contraseña Un indicador de si la palabra "contraseña" estaba presente en el correo electrónico. apareció en el correo electrónico. re subj Indica si el correo electrónico contenía formato especial, como negrita, tablas, o enlaces Indica si se incluyó “Re:” al comienzo del asunto del correo electrónico. exclaim subj Indica si se incluyó algún signo de exclamación en el asunto del correo electrónico. Tabla 8.13: Descripciones de 11 variables en el conjunto de datos de correo electrónico. Observe que Todas las variables son variables indicadoras, que toman el valor 1 si la característica especificada está presente y 0 en caso contrario. 8.4.1 Datos de correo electrónico El conjunto de datos de correo electrónico se presentó por primera vez en el Capítulo 1 con un número relativamente pequeño de Variables. De hecho, existen muchas más variables disponibles que podrían ser útiles para clasificar el spam. Las descripciones de estas variables se presentan en la Tabla 8.13. La variable spam será el resultado, y las otras 10 variables serán los predictores del modelo. Mientras que nosotros He limitado los predictores utilizados en esta sección a variables categóricas (donde muchos se representan como variables indicadoras), los predictores numéricos también pueden usarse en logística. Regresión. Véase la nota al pie para una discusión adicional sobre este tema.13 8.4.2 Modelado de la probabilidad de un evento SUGERENCIA: Notación para un modelo de regresión logística La variable de resultado para un GLM se denota por Yi , donde se utiliza el índice i representar la observación i. En la aplicación de correo electrónico, se utilizará Yi para representar si el correo electrónico i es spam (Yi = 1) o no (Yi = 0). Las variables predictoras se representan de la siguiente manera: x1,i es el valor de la variable 1 para observación i, x2,i es el valor de la variable 2 para la observación i, y así sucesivamente. La regresión logística es un modelo lineal generalizado donde el resultado es una regresión de dos niveles. variable categórica. El resultado, Yi , toma el valor 1 (en nuestra aplicación, esto representa un mensaje de spam) con probabilidad pi y el valor 0 con probabilidad 1 − pi . Es el probabilidad pi que modelamos en relación con las variables predictoras. 13Recuerde del Capítulo 7 que si hay valores atípicos en las variables predictoras, las observaciones correspondientes puede ser especialmente influyente en el modelo resultante. Esta es la motivación para omitir los datos numéricos. variables, como el número de caracteres y saltos de línea en los correos electrónicos, que vimos en el Capítulo 1. Estas Las variables mostraron una asimetría extrema. Podríamos resolver este problema transformando estas variables (por ejemplo, utilizando un transformación logarítmica), pero omitiremos esta investigación adicional por razones de brevedad. Machine Translated by Google 8.4. REGRESIÓN LOGÍSTICA 369 (6.0, 0.998) • (4.0, 0.982) • 1.0 • • (5.0, 0.993) (3,0, 0,95) (2.0, 0.88) • 0.8 (1.0, 0.73) • 0.6 pi (0.0, 0.50) • 0.4 (−1,0, 0,27) • 0.2 (−3,0, 0,05) • • (−2,0, 0,12) (−5,0, 0,007) • • 0.0 (−4,0, 0,018) −6 −4 −2 2 0 4 6 logit(pi ) Figura 8.14: Valores de pi contra valores de logit(pi). El modelo de regresión logística relaciona la probabilidad de que un correo electrónico sea spam (pi) con la predictores x1,i, x2,i, ..., xk,i a través de un marco muy similar al de la regresión múltiple: transformación(pi) = β0 + β1x1,i + β2x2,i + ∙ ∙ ∙ βkxk,i (8.19) Queremos elegir una transformación en la ecuación (8.19) que tenga sentido práctico y matemático. Por ejemplo, queremos una transformación que iguale el rango de posibilidades del lado izquierdo de la ecuación (8.19) al rango de posibilidades del lado derecho; si no hubiera transformación para esta ecuación, el lado izquierdo solo podría tomar valores entre 0 y 1, pero el lado derecho podría tomar valores fuera de este rango. Una transformación común para pi es la transformación logit, que puede escribirse como logit(pi) = loge pi 1 − pi La transformación logit se muestra en la Figura 8.14. A continuación, reescribimos la ecuación (8.19) utilizando la transformación logit de pi : palco pi 1 − pi = β0 + β1x1,i + β2x2,i + ∙ ∙ ∙ + βkxk,i En nuestro ejemplo de spam, hay 10 variables predictoras, por lo que k = 10. Este modelo no es muy intuitivo, pero aún se asemeja a la regresión múltiple, y podemos ajustarlo mediante software. De hecho, al analizar los resultados del software, parecerá que volvemos a la regresión múltiple, aunque la interpretación de los coeficientes sea más compleja. Machine Translated by Google 370 CAPÍTULO 8. REGRESIÓN MÚLTIPLE Y LOGÍSTICA Ejemplo 8.20 Aquí creamos un filtro de spam con un único predictor: a múltiples. Esta variable indica si se incluyó más de una dirección de correo electrónico en el campo "Para" del correo electrónico. Se ajustó el siguiente modelo de regresión logística mediante software estadístico: pi registro 1 − pi = −2,12 − 1,81 × a múltiplo Si se selecciona un correo electrónico al azar y solo tiene una dirección en el campo "Para", ¿cuál es la probabilidad de que sea spam? ¿Qué ocurre si aparecen más de una dirección en el campo "Para"? Si solo hay un correo electrónico en el campo Para, entonces "para varios" toma el valor 0 y el valor = 0,11. Así como −2,12 e El lado derecho de la ecuación del modelo es ­2,12. Para calcular pi : etiquetamos un 1+e−2,12 valor ajustado de yi con un "sombrero" en la regresión univariable y múltiple; haremos lo mismo para esta probabilidad: ˆpi = 0,11. Si hay más de una dirección indicada en el campo Para, entonces el lado derecho de la ecuación del modelo es −2,12 − 1,81 × 1 = −3,93, que corresponde a una probabilidad ˆpi = 0,02. Observe que podríamos examinar ­2,12 y ­3,93 en la Figura 8.14 para estimar la probabilidad antes de calcular formalmente el valor. Para convertir desde valores en la escala de regresión (por ejemplo, ­2,12 y ­3,93 en el Ejemplo 8.20), Utilice la siguiente fórmula, que es el resultado de resolver pi en el modelo de regresión: mi β0+β1x1,i+∙∙∙+βkxk,i pi = β0+β1x1,i+∙∙∙+βkxk,i 1 + e Como en la mayoría de los problemas de datos aplicados, sustituimos las estimaciones puntuales por los parámetros ( βi) para poder utilizar esta fórmula. En el Ejemplo 8.20, las probabilidades se calcularon como −2,12 e 1 + e−2,12 −2,12−1,81 e = 0,11 1 + e−2,12−1,81 = 0,02 Si bien la información sobre si el correo electrónico está dirigido a varias personas es un punto de partida útil para clasificarlo como spam, las probabilidades del 11 % y del 2 % no difieren significativamente, y ninguna de las dos proporciona evidencia sólida sobre qué mensajes en particular son spam. Para obtener estimaciones más precisas, necesitaremos incluir muchas más variables en el modelo. Utilizamos software estadístico para ajustar el modelo de regresión logística con los diez predictores descritos en la Tabla 8.13. Al igual que en la regresión múltiple, el resultado puede presentarse en una tabla resumen, que se muestra en la Tabla 8.15. La estructura de esta tabla es prácticamente idéntica a la de la regresión múltiple; la única diferencia notable es que los valores p se calculan utilizando la distribución normal en lugar de la distribución t. Al igual que en la regresión múltiple, podríamos recortar algunas variables del modelo utilizando el valor p. Mediante la eliminación regresiva con un valor p de corte de 0,05 (comenzando con el modelo completo y recortando los predictores con valores p superiores a 0,05), eliminamos finalmente los predictores "exclaim subj", "dólar", "hered" y "cc". El resto de esta sección se basará en este modelo más pequeño, que se resume en la Tabla 8.16. Ejercicio 8.21 Examine el resumen del modelo reducido en la Tabla 8.16 y, en particular, examine la fila múltiple. ¿La estimación puntual es la misma que la obtenida anteriormente (­1,81) o es diferente? Explique por qué.14 14La nueva estimación es diferente: ­2,87. Este nuevo valor representa el coeficiente estimado cuando estamos También se tienen en cuenta otras variables en el modelo de regresión logística. Machine Translated by Google 8.4. REGRESIÓN LOGÍSTICA 371 Estimar el valor z del error estándar Pr(>|z|) (Interceptar) ­0,8362 0.0962 ­8.69 0.0000 al formato de múltiples ­2,8836 0,3121 ­9,24 0,0000 1,7038 0,3254 5,24 0,0000 ­1,5902 0,1239 ­12,84 0,0000 ­2,9082 0,3708 ­7,84 0,0000 0,1355 0,2268 0,60 0,5503 ganadores re subj exclamar subj cc ­0,4863 0,3054 ­1,59 0,1113 Adjuntar 0,9790 0,2170 4,51 0,0000 dólar ­0,0582 0,1589 ­0,37 0,7144 heredar 0,2093 0,3197 0,65 0,5127 contraseña ­1,4929 0,5295 ­2,82 0,0048 Tabla 8.15: Tabla resumen del modelo de regresión logística completo para el Ejemplo de filtro de spam. Estimar el valor z del error estándar Pr(>|z|) (Interceptar) ­0,8595 0.0910 ­9.44 0.0000 al formato de múltiples ­2,8372 0,3092 ­9,18 0,0000 1,7370 0,3218 5,40 0,0000 ­1,5569 0,1207 ­12,90 0,0000 ­3,0482 0,3630 ­8,40 0,0000 0,8643 0,2042 4,23 0,0000 ­1,4871 asunto adjuntar contraseña 0,5290 ­2,81 0,0049 ganadores re Tabla 8.16: Tabla resumen del modelo de regresión logística para el spam filtro, donde se ha realizado la selección de variables. Las estimaciones puntuales generalmente cambiarán un poco, y a veces mucho, dependiendo de qué otras variables se incluyen en el modelo. Esto suele deberse a la colinealidad en el Variables predictoras. Vimos esto anteriormente en el ejemplo de la subasta de eBay cuando comparamos el coeficiente de cond nuevo en un modelo de una sola variable y el coeficiente correspondiente en el modelo de regresión múltiple que utilizó tres variables adicionales (ver Secciones 8.1.1 y 8.1.2). Ejemplo 8.22 Los filtros de spam están diseñados para automatizarse, lo que significa que un programa Está escrito para recopilar información sobre los correos electrónicos a medida que llegan, y esta información es se colocan en forma de variables. Estas variables luego se introducen en un algoritmo que... utiliza un modelo estadístico, como el que hemos ajustado, para clasificar el correo electrónico. Supongamos que Escriba software para un filtro de spam utilizando el modelo reducido que se muestra en la Tabla 8.16. Si Si un correo electrónico entrante contiene la palabra "ganador", ¿esto aumentará o disminuirá el modelo? ¿Probabilidad calculada de que el correo electrónico entrante sea spam? El coeficiente estimado del ganador es positivo (1,7370). Una estimación positiva del coeficiente en la regresión logística, al igual que en la regresión múltiple, corresponde a un coeficiente positivo. asociación entre las variables predictoras y de respuesta al tener en cuenta la Otras variables del modelo. Dado que la variable de respuesta toma el valor 1 si se recibe un correo electrónico spam y 0 en caso contrario, el coeficiente positivo indica que la presencia de “ganador” en un correo electrónico aumenta la probabilidad del modelo de que el mensaje sea spam. Machine Translated by Google 372 CAPÍTULO 8. REGRESIÓN MÚLTIPLE Y LOGÍSTICA Ejemplo 8.23 Supongamos que el mismo correo electrónico del Ejemplo 8.22 estaba en formato HTML, lo que significa que la variable de formato tomó el valor 1. ¿Esta característica aumenta o disminuye la probabilidad de que el correo electrónico sea spam según el modelo? Dado que HTML corresponde a un valor de 1 en la variable de formato y el coeficiente de esta variable es negativo (­1,5569), esto reduciría la estimación de probabilidad devuelta por el modelo. 8.4.3 Decisiones prácticas en la aplicación del correo electrónico Los ejemplos 8.22 y 8.23 destacan una característica clave de la regresión logística y múltiple. En el ejemplo del filtro de spam, algunas características del correo electrónico lo clasificarán como spam, mientras que otras lo clasificarán como lo contrario. Si implementáramos un filtro de spam utilizando el modelo que hemos ajustado, entonces cada correo electrónico futuro que analicemos entraría en una de tres categorías según las características del correo electrónico: 1. Las características del correo electrónico generalmente indican que el correo electrónico no es spam, por lo que la probabilidad resultante de que el correo electrónico sea spam es bastante baja, digamos, inferior a 0,05. 2. Las características generalmente indican que el correo electrónico es spam, por lo que la probabilidad resultante es... La probabilidad de que un correo electrónico sea spam es bastante grande, digamos, más del 0,95. 3. Las características se compensan aproximadamente entre sí en cuanto a la evidencia a favor y en contra de la clasificación del mensaje como spam. Su probabilidad se encuentra en el rango restante, lo que significa que el correo electrónico no puede clasificarse adecuadamente como spam o no spam. Si gestionáramos un servicio de correo electrónico, tendríamos que pensar en qué hacer en cada uno de estos tres casos. En una aplicación de correo electrónico, normalmente solo hay dos posibilidades: filtrar el correo de la bandeja de entrada y enviarlo a la carpeta de spam, o dejar que el correo llegue a la bandeja de entrada. Ejercicio 8.24 El primer y el segundo escenario son intuitivos. Si la evidencia sugiere firmemente que un mensaje no es spam, envíelo a la bandeja de entrada. Si la evidencia sugiere firmemente que sí lo es, envíelo a la bandeja de correo no deseado. ¿Cómo debemos gestionar los correos electrónicos de la tercera categoría? 15 Ejercicio 8.25 Supongamos que aplicamos el modelo logístico que hemos construido como filtro de spam y que se depositan 100 mensajes en la carpeta de spam durante 3 meses. Si utilizamos las directrices anteriores para depositar mensajes en la carpeta de spam, ¿aproximadamente cuántos mensajes legítimos (no spam) esperaría encontrar entre los 100 mensajes? Casi cualquier clasificador tendrá algún error. En las directrices del filtro de spam mencionadas anteriormente, hemos decidido que se permite que hasta el 5 % de los mensajes en la carpeta de spam sean mensajes auténticos. Si quisiéramos dificultar un poco la clasificación de los mensajes como spam, podríamos usar un valor de corte de 0,99. Esto tendría dos efectos. Al elevar el estándar de lo que se puede clasificar como spam, se reduce la cantidad de correos electrónicos válidos que se clasifican como spam. En esta aplicación en particular, deberíamos optar por enviar más correos a la bandeja de entrada en lugar de enviar por error los mensajes importantes a la carpeta de correo no deseado. En resumen: los correos de la primera y la última categoría van a la bandeja de entrada normal, y los del segundo caso, a la carpeta de correo no deseado. 16En primer lugar, cabe destacar que propusimos un límite de 0,95 para la probabilidad predicha de spam. En el peor de los casos, todos los mensajes en la carpeta de spam tenían una probabilidad mínima de aproximadamente 0,95. Por lo tanto, deberíamos esperar encontrar aproximadamente 5 o menos mensajes legítimos entre los 100 mensajes colocados en la carpeta de spam. Machine Translated by Google 8.4. REGRESIÓN LOGÍSTICA 373 Sin embargo, tampoco clasificará correctamente una mayor proporción de mensajes de spam. Independientemente de la complejidad y la confianza que tengamos en nuestro modelo, estas consideraciones prácticas son absolutamente cruciales para crear un filtro de spam eficaz. Sin ellas, podríamos, de hecho, hacer más daño que bien con nuestro modelo estadístico. 8.4.4 Diagnóstico del clasificador de correo electrónico Condiciones de regresión logística Hay dos condiciones clave para ajustar un modelo de regresión logística: 1. Cada predictor xi está relacionado linealmente con logit(pi) si todos los demás predictores son se mantiene constante. 2. Cada resultado Yi es independiente de los demás resultados. La primera condición del modelo de regresión logística no se verifica fácilmente sin una cantidad considerable de datos. Por suerte, ¡tenemos 3921 correos electrónicos en nuestro conjunto de datos! Visualicemos primero estos datos trazando la clasificación real de los correos electrónicos frente a las probabilidades ajustadas del modelo, como se muestra en la Figura 8.17. La gran mayoría de los correos electrónicos (spam o no) aún tienen probabilidades ajustadas inferiores a 0,5. 1 (spam) 0 (no es spam) 0.0 0.2 0.4 0.6 0.8 1.0 Probabilidad predicha Figura 8.17: La probabilidad predicha de que cada uno de los 3912 correos electrónicos sea spam se clasifica según su agrupación, spam o no. Se ha añadido ruido (pequeños desplazamientos verticales aleatorios) a cada punto para que los puntos con valores casi idénticos no se grafican exactamente uno encima del otro. Esto permite ver más observaciones. Esto puede parecer desalentador al principio: hemos ajustado un modelo logístico para crear un filtro de spam, pero ningún correo electrónico tiene una probabilidad ajustada de ser spam superior a 0,75. No se desespere; en la Sección 8.4.5, analizaremos cómo mejorar el modelo mediante el uso de mejores variables . Nos gustaría evaluar la calidad de nuestro modelo. Por ejemplo, podríamos preguntarnos: si analizamos los correos electrónicos que modelamos con un 10 % de probabilidad de ser spam, ¿encontramos que aproximadamente el 10 % lo es realmente? Para facilitar esta tarea, utilizaremos un método estadístico avanzado llamado splines naturales, que estima la probabilidad local en la región de 0,00 a 0,75 (la probabilidad máxima predicha fue de 0,73, por lo que evitamos la extrapolación). Solo necesita saber sobre los splines naturales para comprender lo que hacemos es que se utilizan para ajustar líneas flexibles en lugar de líneas rectas. Machine Translated by Google 374 CAPÍTULO 8. REGRESIÓN MÚLTIPLE Y LOGÍSTICA 1 (spam) 0.8 Estimado localmente probabilidades con límites de confianza Verdad 0.6 ¿Qué esperamos si? el modelo logístico es razonable 0.4 Los límites se amplían porque no hay muchos datos se encuentran en este extremo derecho 0.2 0 (no es spam) 0.0 0.2 0.4 0.6 0.8 1.0 Probabilidad predicha Figura 8.18: La línea negra continua proporciona la estimación empírica de la probabilidad de las observaciones en función de sus probabilidades predichas (nivel de confianza). También se muestran los límites de esta línea), que se ajusta mediante splines naturales. A Se añadió una pequeña cantidad de ruido a las observaciones en el gráfico para permitir Habrá más observaciones por ver. El ajuste de la curva mediante splines naturales se muestra en la Figura 8.18 como una línea negra sólida. Si El modelo logístico se ajusta bien, la curva debe seguir de cerca la línea discontinua y = x. Se ha añadido sombreado para representar el límite de confianza de la línea curva para aclarar qué Las fluctuaciones podrían deberse plausiblemente al azar. Incluso con este límite de confianza, Existen debilidades en el primer supuesto del modelo. La curva sólida y su límite de confianza cae por debajo de la línea discontinua de aproximadamente 0,1 a 0,3, y luego se desplaza por encima de la línea discontinua de aproximadamente 0,35 a 0,55. Estas desviaciones indican el modelo que relaciona el parámetro con la Los predictores no se parecen mucho a la relación real. Podríamos evaluar el segundo supuesto del modelo de regresión logística: independencia de Resultados: utilizando los residuos del modelo. Los residuos de un modelo de regresión logística. se calculan de la misma manera que con la regresión múltiple: el resultado observado menos el Resultado esperado. Para la regresión logística, el valor esperado del resultado es el valor ajustado. probabilidad de la observación, y el residuo puede escribirse como ei = Yi − pˆi Podríamos graficar estos residuos contra una variedad de variables o en su orden de recolección, como hicimos con los residuos en la regresión múltiple. Sin embargo, dado que el modelo necesitará Se revisará para clasificar eficazmente el spam y ya ha visto gráficos residuales similares en Sección 8.3, no investigaremos los residuos aquí. Machine Translated by Google 8.4. REGRESIÓN LOGÍSTICA 375 8.4.5 Mejora del conjunto de variables para un filtro de spam Si estuviéramos construyendo un filtro de spam para un servicio de correo electrónico que administrara muchas cuentas (por ejemplo, Gmail o Hotmail), dedicaríamos mucho más tiempo a pensar en variables adicionales Esto podría ser útil para clasificar correos electrónicos como spam o no. También usaríamos transformaciones. u otras técnicas que nos ayudarían a incluir variables numéricas fuertemente sesgadas como predictores. Tómese unos minutos para pensar en variables adicionales que podrían ser útiles para identificar Identificación de spam. A continuación, se muestra una lista de variables que creemos que podrían ser útiles: (1) Se podría utilizar una variable indicadora para representar si hubo una relación bidireccional previa. Correspondencia con el remitente de un mensaje. Por ejemplo, si enviaste un mensaje a john@example.com y luego John te envió un correo electrónico, esta variable tomaría valor 1 para el correo electrónico que envió John. Si nunca le había enviado un correo electrónico a John, entonces la variable se establecería en 0. (2) Una segunda variable indicadora podría utilizar la información de señalización de spam anterior de una cuenta. La variable podría tomar el valor 1 si el remitente del mensaje ya lo ha enviado previamente. mensajes marcados como spam. (3) Una tercera variable indicadora podría marcar los correos electrónicos que contienen enlaces incluidos en correos anteriores. Mensajes de spam. Si se encuentra dicho enlace, establezca la variable en 1 para el correo electrónico. De lo contrario, configúrelo en 0. Las variables descritas anteriormente adoptan uno de dos enfoques. La variable (1) está especialmente diseñada Para aprovechar el hecho de que rara vez se envía spam entre personas que tienen una relación bidireccional. comunicación. Las variables (2) y (3) están diseñadas especialmente para marcar a los spammers comunes o mensajes de spam. Si bien tendríamos que verificar con los datos que cada una de las variables es Eficaces, parecen ideas prometedoras. La Tabla 8.19 muestra una tabla de contingencia para el spam y también para la nueva variable descrita en (1) arriba. Si observamos los 1.090 correos electrónicos donde hubo correspondencia con el remitente En los últimos 30 días, ninguno de estos mensajes fue spam. Esto sugiere la variable (1). sería muy eficaz para clasificar con precisión algunos mensajes como spam. Con esto Con una sola variable, podríamos enviar aproximadamente el 28% de los mensajes a la bandeja de entrada. confianza de que casi ninguno es spam. correspondencia previa No Sí Total spam 367 no spam 2464 0 1090 3554 367 Total 2831 1090 3921 Tabla 8.19: Una tabla de contingencia para spam y una nueva variable que representa Si había habido correspondencia con el remitente en el período anterior. 30 días. Las variables descritas en (2) y (3) proporcionarían una base excelente para distinguir los mensajes que provienen de spammers conocidos o los mensajes que toman una forma conocida. de spam. Para utilizar estas variables, necesitaríamos crear bases de datos: una que contenga correos electrónicos direcciones de spammers conocidos y una que contiene URLs encontradas en mensajes de spam conocidos. Nuestro El acceso a dicha información es limitado, por lo que no podemos implementar estas dos variables en este Machine Translated by Google 376 CAPÍTULO 8. REGRESIÓN MÚLTIPLE Y LOGÍSTICA Libro de texto. Sin embargo, si un servicio de correo electrónico nos contratara para crear un filtro de spam, estos serían los siguientes pasos importantes. Además de encontrar más y mejores predictores, necesitaríamos crear un modelo de regresión logística personalizado para cada cuenta de correo electrónico. Puede parecer una tarea abrumadora, pero su complejidad no es tan abrumadora como parece a primera vista. Dejaremos los detalles para un curso de estadística donde la programación informática tenga un papel más importante. En la difícil tarea de clasificar los mensajes de spam, hemos avanzado considerablemente. Hemos observado que variables sencillas de correo electrónico, como el formato, la inclusión de ciertas palabras y otras características circunstanciales, proporcionan información útil para la clasificación de spam. Aún quedan muchos desafíos por delante, desde una mejor comprensión de la regresión logística hasta la programación informática necesaria, pero completar esta tarea está prácticamente a su alcance. Machine Translated by Google 8.5. EJERCICIOS 377 8.5 Ejercicios 8.5.1 Introducción a la regresión múltiple 8.1 Peso del bebé, Parte I. Los Estudios de Salud y Desarrollo Infantil investigan una variedad de Temas. Un estudio consideró todos los embarazos entre 1960 y 1967 entre las mujeres del Kaiser Plan de Salud Foundation en el área de la Bahía Este de San Francisco. Aquí, estudiamos la relación Entre el tabaquismo y el peso del bebé. La variable tabaquismo se codifica como 1 si la madre es... fumador, y 0 si no lo es. La siguiente tabla resumen muestra los resultados de un modelo de regresión lineal para Predecir el peso promedio al nacer de los bebés, medido en onzas, en función del estado de tabaquismo de los niños. la madre.17 (Interceptar) humo Estimar el valor t del error estándar Pr(>|t|) 123.05 0,65 189,60 0,0000 ­8.94 1.03 ­8.65 0.0000 La variabilidad entre fumadores y no fumadores es aproximadamente igual y las distribuciones son simétrico. Con estas condiciones satisfechas, es razonable aplicar el modelo. (Tenga en cuenta que (No es necesario comprobar la linealidad ya que el predictor solo tiene dos niveles). (a) Escribe la ecuación de la línea de regresión. (b) Interprete la pendiente en este contexto y calcule el peso al nacer previsto de los bebés nacidos a madres fumadoras y no fumadoras. (c) ¿Existe una relación estadísticamente significativa entre el peso promedio al nacer y el tabaquismo? 8.2 Peso de los bebés, Parte II. El ejercicio 8.1 presenta un conjunto de datos sobre el peso al nacer de los bebés. Otra variable que consideramos es la paridad, que es 0 si el niño es el primogénito y 1 en caso contrario. La siguiente tabla resumen muestra los resultados de un modelo de regresión lineal para predecir el promedio peso al nacer de los bebés, medido en onzas, a partir de la paridad. Paridad (de Estimar el valor t del error estándar Pr(>|t|) 120.07 0,60 199,94 0,0000 intercepción) ­1.93 1.19 ­1.62 0.1052 (a) Escribe la ecuación de la línea de regresión. (b) Interprete la pendiente en este contexto y calcule el peso al nacer previsto de los primogénitos y otros. (c) ¿Existe una relación estadísticamente significativa entre el peso promedio al nacer y la paridad? 17Estudios de salud y desarrollo infantil, conjunto de datos sobre pesos de bebés. Machine Translated by Google 378 CAPÍTULO 8. REGRESIÓN MÚLTIPLE Y LOGÍSTICA 8.3 Peso de los bebés, Parte III. Consideramos las variables tabaquismo y paridad, una a la vez, en Modelado del peso al nacer de los bebés en los ejercicios 8.1 y 8.2. Un enfoque más realista para el modelado El peso de los bebés consiste en considerar simultáneamente todas las variables posiblemente relacionadas. Otras variables de interés incluye la duración del embarazo en días (gestación), la edad de la madre en años (edad), la altura de la madre en pulgadas (altura) y peso de la madre durante el embarazo en libras (peso). A continuación se presentan tres observaciones. de este conjunto de datos. peso corporal, edad de gestación, paridad, altura, peso, tabaquismo 1 120 27 100 2 113 284 33 135 0 62 . . . . . . 1236 117 282 . . . 0 . . . 297 0 0 . . . 64 . . . . . . 0 . . . 38 65 129 0 La siguiente tabla resumen muestra los resultados de un modelo de regresión para predecir la tasa de natalidad promedio. peso de los bebés en función de todas las variables incluidas en el conjunto de datos. (Interceptar) paridad Estimar el valor t del error estándar Pr(>|t|) ­80,41 14,35 ­5,60 0,0000 0,44 0,03 15,26 0,0000 gestacional ­3,33 1,13 ­2,95 0,0033 edad ­0,01 0,09 ­0,10 0,9170 altura 1,15 0,21 5,63 0,0000 peso fumar 0.05 0.03 1,99 0.0471 ­8.40 0,95 ­8.81 0.0000 (a) Escribe la ecuación de la línea de regresión que incluye todas las variables. (b) Interprete las pendientes de gestación y edad en este contexto. (c) El coeficiente de paridad es diferente al del modelo lineal mostrado en el Ejercicio 8.2. ¿Por qué? ¿Podría haber una diferencia? (d) Calcule el residuo de la primera observación en el conjunto de datos. (e) La varianza de los residuos es 249,28 y la varianza de los pesos al nacer de todos los bebés es 2 2 En el conjunto de datos es 332,57. Calcular el R . Tenga en cuenta que hay 1.236 y el R ajustado observaciones en el conjunto de datos. Machine Translated by Google 8.5. EJERCICIOS 379 8.4 Absentismo. Investigadores interesados en la relación entre el ausentismo escolar y ciertas características demográficas de los niños. Se recopilaron datos de 146 estudiantes seleccionados aleatoriamente en la zona rural de Nueva Gales del Sur, Australia, durante un año escolar específico. A continuación se presentan tres observaciones. de este conjunto de datos. 1 2 . . . días de sexo eth lrn 1 1 0 2 1 . . . 1 . . . 11 . . . 0 0 37 0 . . . 146 1 La siguiente tabla resumen muestra los resultados de un modelo de regresión lineal para predecir el promedio Número de días de ausencia según origen étnico (eth: 0 ­ aborigen, 1 ­ no aborigen), sexo (sexo: 0 ­ femenino, 1 ­ masculino) y estado del estudiante (lrn: 0 ­ estudiante promedio, 1 ­ estudiante lento).18 (Interceptar) eth Estimar el valor t del error estándar Pr(>|t|) 18.93 2,57 7,37 0,0000 ­9.11 2.60 ­3.51 0.0000 sexo 3.10 2.64 1.18 0.2411 lrn 2.15 2.65 0.81 0.4177 (a) Escribe la ecuación de la línea de regresión. (b) Interprete cada una de las pendientes en este contexto. (c) Calcule el residuo para la primera observación en el conjunto de datos: un estudiante que es aborigen, Masculino, de aprendizaje lento, faltó dos días a la escuela. (d) La varianza de los residuos es 240,57 y la varianza del número de días de ausencia para todos 2 2 . Tenga en cuenta que hay El número de estudiantes en el conjunto de datos es 264,17. Calcule el R y el R ajustado 146 observaciones en el conjunto de datos. GPA de 8.5. Una encuesta a 55 estudiantes de la Universidad de Duke les preguntó sobre su GPA y la cantidad de horas... estudian de noche, número de noches que salen y su género. Resumen de resultados del El modelo de regresión se muestra a continuación. Nótese que el sexo masculino se codifica como 1. (Intercepción) Estimar el valor t del error estándar Pr(>|t|) 3,45 0,35 9,85 0,00 semana de 0,00 0,00 0,27 0,79 estudio noche 0,01 0,05 0,11 0,91 de sueño 0,05 0,05 1,01 0,32 ­0,08 durante la noche género 0,12 ­0,68 0,50 (a) Calcule un intervalo de confianza del 95% para el coeficiente de género en el modelo e interprételo. en el contexto de los datos. (b) ¿Esperaría que un intervalo de confianza del 95% para la pendiente de las variables restantes incluya 0? Explicar 18W. N. Venables y BD Ripley. Estadística Aplicada Moderna con S. Cuarta Edición. Los datos también pueden se puede encontrar en el paquete R MASS. Nueva York: Springer, 2002. Machine Translated by Google 380 CAPÍTULO 8. REGRESIÓN MÚLTIPLE Y LOGÍSTICA 8.6 Cerezos. El rendimiento de la madera es aproximadamente igual al volumen de un árbol, sin embargo, esto... El valor es difícil de medir sin talar primero el árbol. En cambio, se utilizan otras variables, como La altura y el diámetro pueden utilizarse para predecir el volumen y el rendimiento de un árbol. Los investigadores que desean... comprender la relación entre estas variables para los cerezos negros, datos recopilados de 31 Estos árboles se encuentran en el Bosque Nacional Allegheny, Pensilvania. La altura se mide en pies y el diámetro... en pulgadas (a 54 pulgadas sobre el suelo) y el volumen en pies cúbicos.19 (Intersección) Estimar el valor t del error estándar Pr(>|t|) ­57,99 8.64 ­6.71 altura diámetro 0.00 0,34 0.13 2.61 0.01 4,71 0,26 17.82 0.00 (a) Calcule un intervalo de confianza del 95% para el coeficiente de altura e interprételo en el contexto de los datos. (b) Un árbol en esta muestra mide 79 pies de alto, tiene un diámetro de 11,3 pulgadas y tiene 24,2 pies cúbicos de espacio. Volumen. Determine si el modelo sobreestima o subestima el volumen de este árbol y ¿Por cuánto? 8.5.2 Selección del modelo 8.7 Peso del bebé, Parte IV. El ejercicio 8.3 considera un modelo que predice el peso de un recién nacido. Utilizando varios predictores. Utilice la tabla de regresión a continuación, que resume el modelo, para responder. las siguientes preguntas. Si es necesario, consulte el Ejercicio 8.3 para recordar el significado de cada variable. (Interceptar) Estimar el valor t del error estándar Pr(>|t|) ­80.41 14,35 ­5,60 0,0000 0.44 0.03 15.26 0.0000 gestacional ­3.33 1.13 ­2,95 0.0033 edad ­0.01 0.09 ­0.10 0.9170 altura 1.15 0,21 5.63 0.0000 peso fumar 0.05 0.03 1,99 0.0471 ­8.40 0,95 ­8.81 0.0000 paridad (a) Determine qué variables, si las hay, no tienen una relación lineal significativa con el resultado. y deberían ser candidatas a ser eliminadas del modelo. Si hay más de una variable de este tipo, Indica cuál debe eliminarse primero. (b) La siguiente tabla resumen muestra los resultados del modelo con la variable de edad eliminada. Determinar si se deben eliminar otras variables del modelo. (Interceptar) Estimar el valor t del error estándar Pr(>|t|) ­80.64 14.04 ­5.74 0.0000 0.44 0.03 15.28 0.0000 paridad ­3.29 1.06 ­3.10 0.0020 altura 1.15 0,20 5.64 0.0000 peso fumar 0.05 0.03 2.00 0.0459 ­8.38 0,95 ­8.82 0.0000 gestación 19D.J. Hand. Manual de pequeños conjuntos de datos. Chapman & Hall/CRC, 1994. Machine Translated by Google 8.5. EJERCICIOS 381 8.8 Ausentismo, Parte II. El ejercicio 8.4 considera un modelo que predice el número de días Ausente utilizando tres predictores: origen étnico (eth), género (sex) y estado de aprendizaje (lrn). Utilice Utilice la tabla de regresión a continuación para responder las siguientes preguntas. Si es necesario, consulte el Ejercicio 8.4. para obtener detalles adicionales sobre cada variable. Estimar el valor t del error estándar Pr(>|t|) 18,93 2,57 7,37 0,0000 (Interceptar) eth ­9,11 2,60 ­3,51 0,0000 sexo 3,10 2,64 1,18 0,2411 lrn 2,15 2,65 0,81 0,4177 (a) Determine qué variables, si las hay, no tienen una relación lineal significativa con el resultado. y deberían ser candidatas a ser eliminadas del modelo. Si hay más de una variable de este tipo, Indica cuál debe eliminarse primero. (b) La siguiente tabla de resumen muestra los resultados de la regresión que reajustamos después de eliminar al alumno. Estado del modelo. Determine si se deben eliminar otras variables del modelo. (Interceptar) eth Estimar el valor t del error estándar Pr(>|t|) 2,22 9,01 0,0000 19,98 sexo ­9.06 2.60 ­3.49 0.0006 2.78 2.60 1.07 0.2878 8.9 Pesos de los bebés, Parte V. El ejercicio 8.3 proporciona una salida de regresión para el modelo completo (incluido todas las variables explicativas disponibles en el conjunto de datos) para predecir el peso al nacer de los bebés. En este En este ejercicio consideramos un algoritmo de selección hacia adelante y agregamos variables al modelo una a la vez. La siguiente tabla muestra el valor p y el R ajustado. 2 de cada modelo donde incluimos solo el Predictor correspondiente. Según esta tabla, ¿qué variable debería añadirse primero al modelo? variable fumar paridad 2,2 ×edad Valor p del peso gestacional 10−16 0,1052altura 0,2375 2,97 × 10−12 8,2 × 10−8 2,2 × 10−16 2 R ajustado 0.1657 0.0013 0.0003 0.0386 0.0569 0,0229 8.10 Ausentismo, Parte III. El ejercicio 8.4 proporciona resultados de regresión para el modelo completo, incluyendo todas las variables explicativas disponibles en el conjunto de datos, para predecir el número de días de ausencia. de la escuela. En este ejercicio, consideramos un algoritmo de selección hacia adelante y añadimos variables al 2 Modelar uno a uno. La tabla a continuación muestra el valor p y el R ajustado. Incluya solo el predictor correspondiente. Con base en esta tabla, ¿qué variable debe agregarse? ¿El modelo primero? variable etnicidad valor p 0,0007 0,0714 2 R adj sexo estado de aprendiz 0,3142 0.5870 0,0001 0 de cada modelo donde nos encontramos Machine Translated by Google 382 CAPÍTULO 8. REGRESIÓN MÚLTIPLE Y LOGÍSTICA 8.5.3 Comprobación de los supuestos del modelo mediante gráficos 8.11 Pesos de bebés, Parte V. El ejercicio 8.7 presenta un modelo de regresión para predecir el peso promedio Peso al nacer de los bebés según la duración de la gestación, la paridad, la altura, el peso y el estado de tabaquismo. La madre. Determine si se cumplen los supuestos del modelo utilizando los gráficos a continuación. De no ser así, describa Cómo proceder con el análisis. 40 40 0 autor de residuales Derechos autor de residuales Derechos 20 0 −20 −40 −40 −60 80 −3 −2 −1 0 1 2 3 120 40 40 0 0 −40 −40 0 400 800 1200 150 200 250 300 350 Duración de la gestación 40 40 0 0 autor de residuales Derechos autor de residuales Derechos Orden de recogida −40 −40 1 0 55 60 65 70 Altura de la madre Paridad 40 40 0 0 autor de residuales Derechos autor de residuales Derechos 160 Valores ajustados autor de residuales Derechos autor de residuales Derechos Cuantiles teóricos −40 −40 100 150 200 Peso de la madre 250 1 0 Fumar Machine Translated by Google 8.5. EJERCICIOS 383 8.12 Promedio general (GPA) y coeficiente intelectual (CI). Se ajustó un modelo de regresión para predecir el GPA a partir del género y el CI, y ambos predictores resultaron estadísticamente significativos. Utilizando las gráficas a continuación, determine si este modelo de regresión es adecuado para estos datos. 2 •• • ••• • • •• •• • • • • •• 0 autor de residuales Derechos •• •••••••• •••••• ••••••••• ••• •• ••• •• • ••• •• •••• 4 • • • •• •••• • • • • •• 2 residuos los de absolutos Valores −2 −4 −6 6 • • • • • • •• • −1 1 0 • •• • 4 • • • •• • •• • • •• • • • • • • • −2 • • • • • •• • •• • • ••••• •• •• • • • • • • • •• •• • • • •• • • • • • • •• • • −2 • 80 • 75 100 Coeficiente intelectual • •• •• • •• •• •• •• • • •• •• • •• • • autor de residuales Derechos −6 •• • • • • • •• • •• • • ••• • • • • •• •• • • • •••• •• • • • •• • • • • • • • • • • • • • • •• • • •• • • • • • • −6 40 −2 • • • 10 • Orden de recogida 2 8 • 2 • −6 0 •• • • • • • •• • • • • autor de residuales Derechos autor de residuales Derechos 2 • Valores ajustados • •• •• •• • •• • •• • • •• • • • •• • • • ••• ••• • • •• • •• 6 Cuantiles teóricos • • • • • •• 2 • •• • • • • •• •• • 0 −2 • •• •• •• • Novedades • • • • • • 0 1 Género • 125 Machine Translated by Google 384 CAPÍTULO 8. REGRESIÓN MÚLTIPLE Y LOGÍSTICA 8.5.4 Regresión logística 8.13 Clasificación de las zarigüeyas, Parte I. La zarigüeya de cola de cepillo común de la región de Australia es una un poco más lindo que su primo lejano, la zarigüeya americana (ver Figura 7.5 en la página 318). Consideramos 104 zarigüeyas de cola de cepillo de dos regiones de Australia, donde las zarigüeyas pueden considerarse una Muestra aleatoria de la población. La primera región es Victoria, que se encuentra en la mitad oriental de Australia y atraviesa la costa sur. La segunda región está formada por Nueva Gales del Sur y Queensland, que compone el este y el noreste de Australia. Utilizamos regresión logística para diferenciar entre las zarigüeyas en estas dos regiones. El resultado La variable, llamada población, toma el valor 1 cuando una zarigüeya es de Victoria y 0 cuando es de Nueva Gales del Sur o Queensland. Consideramos cinco predictores: sexo masculino (un indicador de una 15 40 10 20 15 Frecuencia 60 Frecuencia Frecuencia zarigüeya siendo macho), longitud de la cabeza, ancho del cráneo, longitud total y longitud de la cola. Cada variable se resume en un histograma. El modelo de regresión logística completo y un modelo reducido después de la variable La selección se resume en la tabla. 5 0 5 0 0 1 (Femenino) (Masculino) 0 85 90 95 100 50 40 10 5 20 5 0 0 85 90 95 0 longitud total (en cm) longitud de la cola (en cm) masculino longitud de la cabeza 1 (Victoria) población Modelo reducido Modelo completo (Interceptar) sexo 0 (No Victoria) 32 34 36 38 40 42 Estimar 65 Frecuencia Frecuencia 15 Frecuencia 10 60 60 20 80 55 ancho del cráneo (en mm) longitud de la cabeza (en mm) sexo_masculino 75 10 SE Z Pr(>|Z|) 0,0007 Estimar SE Z Pr(>|Z|) 39,2349 11,5368 3,40 ­1,2376 0,6662 0,0632 33.5095 9.9053 3.38 0.0007 ­1,86 ­0,1601 0,1386 ­1,16 ­0,2012 0,2480 ­1,4207 0,6457 ­2,20 0,0278 0.1294 ­0,2787 0,1226 ­2,27 0,5687 0,1322 0.0000 4,30 ­1,8057 0,3599 ­5,02 0,1327 ­1,52 0,6488 0,1531 4,24 ­1,8708 0,3741 ­5,00 ancho del cráneo longitud total longitud de la cola 0.0000 0.0231 0.0000 0.0000 (a) Examine cada uno de los predictores. ¿Hay valores atípicos que probablemente tengan una probabilidad muy grande? ¿Influencia en el modelo de regresión logística? (b) La tabla resumen del modelo completo indica que se debe eliminar al menos una variable Al utilizar el método del valor p para la selección de variables: longitud de la cabeza. El segundo componente... de la tabla resume el modelo reducido tras la selección de variables. Explique por qué Las estimaciones restantes varían entre los dos modelos. Machine Translated by Google 8.5. EJERCICIOS 385 8.14 Desastre del Challenger, Parte I. El 28 de enero de 1986, se esperaba un lanzamiento de rutina para El transbordador espacial Challenger. Setenta y tres segundos después del vuelo, ocurrió el desastre: el transbordador... se desintegró, matando a los siete tripulantes a bordo. Se está investigando la causa del El desastre se centró en un sello crítico llamado junta tórica, y se cree que el daño a estas juntas tóricas durante el lanzamiento de un transbordador puede estar relacionada con la temperatura ambiente durante el lanzamiento. La tabla A continuación se resumen los datos de observación sobre juntas tóricas para 23 misiones del transbordador, donde el orden de misión Se basa en la temperatura en el momento del lanzamiento. La temperatura indica la temperatura en grados Fahrenheit. Dañado representa el número de juntas tóricas dañadas y Sin daños representa el número de juntas tóricas dañadas. Juntas tóricas que no estaban dañadas. Misión del transbordador Temperatura 1 2 3 4 5 6 78 9 10 11 12 0 0 0 0 0 0 6 6 6 6 6 6 0 0 0 0 6 6 6 6 53 57 58 63 66 67 67 67 68 69 70 70 Dañado 5 Sin daños 1 15 15 15 0 15 6 Misión del transbordador 13 14 15 16 17 18 19 20 21 22 23 Temperatura 70 70 72 73 75 75 76 76 78 79 81 Dañado 0 6 sin daños 15 0 0 0 0 6 6 6 6 15 (a) Cada columna de la tabla anterior representa una misión diferente del transbordador. Examine estos datos. y describe lo que observas con respecto a la relación entre las temperaturas y juntas tóricas dañadas (b) Las fallas se han codificado como 1 para una junta tórica dañada y 0 para una junta tórica no dañada, y Se ajustó un modelo de regresión logística a estos datos. A continuación se presenta un resumen de este modelo. Describe los componentes clave de esta tabla resumen en palabras. (Interceptar) Temperatura Estimar el valor z del error estándar Pr(>|z|) 11.6630 3.2963 3.54 0.0004 ­0.2162 0.0532 ­4.07 0.0000 (c) Escriba el modelo logístico utilizando las estimaciones puntuales de los parámetros del modelo. (d) Basándose en el modelo, ¿cree que las preocupaciones sobre las juntas tóricas están justificadas? Explique. 8.15 Clasificación de zarigüeyas, Parte II. Se propuso un modelo de regresión logística para clasificar zarigüeyas comunes de cola de cepillo en sus dos regiones en el Ejercicio 8.13. Utilice los resultados del resumen Tabla para el modelo reducido presentado en el Ejercicio 8.13 para las preguntas siguientes. El resultado La variable tomó el valor 1 si la zarigüeya era de Victoria y 0 en caso contrario. (a) Escriba la forma del modelo. Identifique también cuáles de las siguientes variables son positivas asociado (cuando se controlan otras variables) con una zarigüeya procedente de Victoria: cráneo ancho, largo total y largo de la cola. (b) Supongamos que vemos una zarigüeya de cola de cepillo en un zoológico de los EE. UU., y un cartel dice que la zarigüeya había sido... capturado en estado salvaje en Australia, pero no se indica en qué parte de Australia. Sin embargo, el letrero... indica que la zarigüeya es macho, su cráneo mide unos 63 mm de ancho, su cola mide 37 cm de largo, y su longitud total es de 83 cm. ¿Cuál es la probabilidad calculada del modelo reducido de que esto ¿La zarigüeya es de Victoria? ¿Cuánta confianza tienes en la precisión del modelo para esta probabilidad? ¿cálculo? Machine Translated by Google 386 CAPÍTULO 8. REGRESIÓN MÚLTIPLE Y LOGÍSTICA 8.16 Desastre del Challenger, Parte II. El ejercicio 8.14 nos presentó las juntas tóricas que se identificaron como una explicación plausible para la ruptura del transbordador espacial Challenger a los 73 segundos de despegue en 1986. La investigación encontró que la temperatura ambiente en el momento del lanzamiento del transbordador Estaba estrechamente relacionado con el daño de las juntas tóricas, que son un componente crítico del transbordador. Ver este ejercicio anterior si desea explorar los datos originales. 1.0 daño de Probabilidad 0.8 0.6 0.4 0.2 0.0 50 55 60 65 70 75 80 Temperatura (Fahrenheit) (a) Los datos proporcionados en el ejercicio anterior se muestran en el gráfico. El modelo logístico se ajusta a Estos datos pueden escribirse como pag registro 1 − pˆ = 11,6630 − 0,2162 × Temperatura donde ˆp es la probabilidad estimada por el modelo de que una junta tórica se dañe. Utilice el modelo para calcular la probabilidad de que una junta tórica se dañe en cada uno de los siguientes Temperaturas ambientales: 11, 12 y 13 grados Celsius. Las probabilidades estimadas por el modelo A continuación se proporcionan varias temperaturas ambiente adicionales, donde los subíndices indican la temperatura: pˆ57 = 0,341 ˆp59 = 0,251 ˆp61 = 0,179 ˆp63 = 0,124 pˆ65 = 0,084 ˆp67 = 0,056 ˆp69 = 0,037 ˆp71 = 0,024 (b) Agregue las probabilidades estimadas por el modelo de la parte (a) en el gráfico, luego conecte estos puntos usando una curva suave para representar las probabilidades estimadas por el modelo. (c) Describa cualquier inquietud que pueda tener con respecto a la aplicación de la regresión logística en esta solicitud. y tenga en cuenta cualquier suposición que sea necesaria para aceptar la validez del modelo. Machine Translated by Google Apéndice A Ejercicio de fin de capítulo soluciones 1 Introducción a los datos 1.1 (a) Tratamiento: 10/43 = 0,23 → 23 %. Control: 2/46 = 0,04 “¿Los pacientes que practican el método Buteyko experimentan → 4 %. (b) Hay un 19 % una mejora en su condición?” Diferencia entre las tasas de reducción del dolor en 1.5 (a) 50 × 3 = 150. (b) Cuatro números continuos los dos grupos. A primera vista, parece que los pacientes del variables numéricas: longitud del sépalo, ancho del sépalo, grupo de tratamiento tienen más probabilidades de... longitud del pétalo y ancho del pétalo. (c) Una variable Experimente una reducción del dolor gracias a la acupuntura. categórica, especie, con tres niveles: setosa, tratamiento. (c) Las respuestas pueden variar, pero deben ser versicolor y virginica. sensato. Dos posibles respuestas: 1Aunque el 1.7 (a) Población de interés: todos los nacimientos en La diferencia entre los grupos es grande, soy escéptico de que los resultados muestren una diferencia real y creo que esto podría deberse al azar. 2La diferencia en estas tasas Sur de California. Muestra: 143,196 nacimientos entre 1989 y 1993 en el sur de California. Si Los nacimientos en este lapso de tiempo pueden considerarse Parece bastante grande, por lo que sospecho que la acupuntura ser representativo de todos los nacimientos, entonces los resultados está teniendo un impacto positivo en el dolor. son generalizables a la población del sur California. Sin embargo, dado que el estudio es observacional, 1.3 (ai) 143.196 sujetos de estudio elegibles nacidos en el sur de California entre 1989 y 1993. los hallazgos no implican relaciones causales. (b) Población: todos los jóvenes de 18 a 69 años diagnosticados y tratados (a­ii) Mediciones de monóxido de carbono, dióxido de por asma. Muestra: 600 pacientes adultos de 18 a 69 años nitrógeno, ozono y partículas menos diagnosticados y tratados por asma. Desde de 10 µg/m³ (PM10) recolectadas en estaciones de monitoreo de la calidad del aire, así como la duración de la gestación. Estas son variables numéricas continuas. La muestra está formada por pacientes voluntarios, Los resultados no necesariamente pueden generalizarse a la (a­iii) La pregunta de investigación: “¿Existe una asociación población en general. Sin embargo, dado que el estudio entre la exposición a la contaminación del aire y ¿Nacimientos prematuros?” (bi) 600 pacientes adultos de entre 18­69 años diagnosticados y actualmente tratados por Es un experimento, cuyos resultados se pueden utilizar para establecer relaciones causales. asma. (b­ii) Las variables fueron si 1.9 (a) Explicativo: número de horas de estudio No, el paciente practicó el método Buteyko. por semana. Respuesta: GPA. (b) Hay un (categóricas) y medidas de calidad de vida, actividad, síntomas Ligera relación positiva entre las dos variables. Un encuestado de asma y reducción de medicación de los pacientes reportó un promedio general (GPA) superior. (categóricas, ordinales). 4.0, lo cual es un error de datos. También hay algunos También puede ser razonable tratar las calificaciones de una manera encuestados que informaron un nivel de estudio inusualmente alto escala de 1 a 10 como variables numéricas discretas. horas (60 y 70 horas/semana). La variabilidad en el promedio de (b­iii) La pregunta de investigación: “¿Los pacientes asmáticos calificaciones (GPA) también parece ser mayor para los estudiantes. 387 Machine Translated by Google 388 APÉNDICE A. SOLUCIONES DE LOS EJERCICIOS DEL FINAL DEL CAPÍTULO adeptos que estudian menos que los que estudian más. 1.21 (a) Experimento. (b) El tratamiento es ejercicio. Dado que los datos se vuelven escasos a medida que aumenta el número de dos veces por semana. El control no es ejercicio. (c) Sí, el Las horas de estudio aumentan, es algo difícil La variable de bloqueo es la edad. (d) No. (e) Esta es una para evaluar la fortaleza de la relación y experimento, por lo que una conclusión causal es razonable. También la variabilidad entre diferentes números de Dado que la muestra es aleatoria, se puede llegar a una conclusión: horas de estudio. (c) Observacional. (d) Dado que esto generalizarse a la población en general. Sin embargo, debemos es un estudio observacional, una relación causal considerar que un efecto placebo es No está implícito. posible. (f) Sí. Personas muestreadas aleatoriamente 1.11 (a) Observacional. (b) El profesor sospecha que los No se debería exigir que participen en una prueba clínica. estudiantes de una sección determinada pueden tener juicio, y también existen preocupaciones éticas sobre sentimientos similares sobre el curso. Para asegurar que cada El plan para instruir a un grupo a no participar en un sección esté razonablemente representada, puede elegir comportamiento saludable, que en este caso es ejercicio. seleccionar aleatoriamente un número fijo de estudiantes, Digamos 10, de cada sección para un tamaño de muestra total 1.23 (a) Asociación positiva: mamíferos con de 40 estudiantes. Dado que una muestra aleatoria de fijos El tamaño se tomó dentro de cada sección en este escenario. Los períodos de gestación más largos tienden a vivir más tiempo. nario, esto representa un muestreo estratificado. 1.13 El muestreo de la guía telefónica perdería información números de teléfono no listados, por lo que esto resultaría en sesgo. Las personas que no tienen sus números registrados pueden compartir ciertas características, por ejemplo Tenga en cuenta que los teléfonos celulares no están listados en el teléfono. Bueno. (b) La asociación seguiría siendo positiva. (c) No, no son independientes. Véase la parte (a). 1.25 (a) 1/lineal y 3/no lineal. (b) 4/algunos Puede haber curvatura (no linealidad) en el Lado derecho. "Lineal" también sería aceptable. para el tipo de relación de la parcela 4. (c) 2. libros, por lo que una muestra de la guía telefónica sería 1.27 (a) Disminución: la nueva puntuación es menor no necesariamente ser un representante de la población. que la media de las 24 puntuaciones anteriores. 1.15 La estimación estará sesgada y será tienden a sobreestimar el tamaño real de la familia. Por ejemplo, supongamos que tuviéramos sólo dos familias: la Primero con 2 padres y 5 hijos, y el segundo con 2 padres y 1 hijo. Entonces, si dibujamos... Uno de los seis niños al azar, 5 veces (b) Calcule una media ponderada. Utilice un peso de 24 para la media antigua y 1 para la nueva media: (24 × 74 + 1 × 64)/(24 + 1) = 73,6. Hay Otras formas de resolver este ejercicio que no utilizan una media ponderada. (c) La nueva puntuación es mayor a más de 1 desviación estándar de la media anterior, por lo que aumenta. De 6 probaríamos la familia más grande 1.29 Ambas distribuciones están sesgadas hacia la derecha y 1.17 (a) No, este es un estudio observacional. bimodal con modas a 10 y 20 cigarrillos; (b) Esta afirmación no está justificada; implica una Tenga en cuenta que las personas pueden estar redondeando Asociación causal entre los trastornos del sueño y sus respuestas a medio paquete o a un paquete completo. La mediana de cada distribución está entre 10 y 15. acoso escolar. Sin embargo, esto fue un estudio observacional. estudio. Una mejor conclusión sería “Escuela cigarrillos. El 50% medio de los datos (el Los niños identificados como acosadores tienen más probabilidades de El RIQ parece distribuirse de manera uniforme en cada grupo “Los niños que sufren de trastornos del sueño son más propensos a sufrirlos que los que no los acosan”. 1.19 (a) Experimento, ya que el tratamiento fue asignado a cada paciente. (b) Respuesta: Duración del resfriado. Explicativo: Tratamiento, con 4 niveles: placebo, 1 g, 3 g, 3 g con aditivos. (c) Los pacientes y tienen un ancho de unos 10 a 15. Hay Valores atípicos potenciales por encima de 40 cigarrillos al día. Parece que los encuestados que fuman sólo unos pocos cigarrillos (0 a 5) fuman más entre semana que los fines de semana. fueron cegados. (d) Doble ciego con respecto a los investigadores 1.31 (a) ¯xamtW fines de semana = 20, ¯xamtW días laborables que evaluaron a los pacientes. 16. (b) samtW fines de semana = 0, samtW días laborables = 4.18. Pero las enfermeras que interactuaron brevemente con los En esta muestra muy pequeña, mayor en días laborables. pacientes durante la distribución del medicamento no estaban cegadas. Podríamos decir que el estudio... fue parcialmente doble ciego. (e) No. Los pacientes fueron asignados aleatoriamente a grupos de tratamiento y quedaron cegados, por lo que esperaríamos aproximadamente una Número igual de pacientes en cada grupo para no adherirse al tratamiento. 1.33 (a) Ambas distribuciones tienen la misma mediana y RIQ. (b) La segunda distribución tiene una Mediana más alta y RIQ más alto. (c) La segunda distribución tiene una mediana más alta. Los RIQ son iguales. (d) La segunda distribución tiene una mediana más alta y RIC más grande. = Machine Translated by Google 389 1.35 100 ver las frecuencias relativas de las categorías en este gráfico. 90 1.49 Las posiciones verticales en las que se ubican los ideo­ Los grupos lógicos se dividen en Sí, No y No. 80 Montones Algunas categorías difieren, lo que indica que las variables son dependientes. 70 60 1.51 (a) Falso. En lugar de comparar conteos, Deberíamos comparar porcentajes. (b) Verdadero. (c) • 50 1.37 Las descripciones variarán un poco. (a) 2. Unimodal, simétrica, centrada en 60, desviación estándar de aproximadamente 3. (b) 3. Simétrica y distribuida aproximadamente de manera uniforme de 0 a 100. (c) 1. Sesgada hacia la derecha, unimodal, centrada en alrededor de 1,5, y la mayoría de las observaciones se sitúan entre 0 y 3. Una fracción muy pequeña de observaciones supera un valor de 5. 1.39 El histograma muestra que la distribución es bimodal, lo que no es evidente en el Diagrama de caja. El diagrama de caja facilita la identificación Falso. No podemos inferir una relación causal. de una asociación en un estudio observacional. Sin embargo, podemos decir que el medicamento que toma una persona afecta su riesgo en este caso, ya que eligió ese medicamento. y su elección puede estar asociada a otras variables, por lo que el inciso (b) es verdadero. La diferencia entre estas afirmaciones es sutil, pero importante. (d) Verdadero. 1.53 (a) Proporción de quienes sufrieron un ataque cardíaco: 7.979 227.571 ≈ 0,035 (b) Número esperado de problemas cardiovasculares en el grupo de rosiglitazona si Tener problemas cardiovasculares y tratamiento eran independientes se pueden calcular como el número de pacientes en ese grupo multiplicado por el de valores más precisos de observaciones fuera de los bigotes. tasa general de problemas cardiovasculares en la 7.979 estudio: 67.593 × 227.571 ≈ 2370. (ci) H0: Modelo independiente. El tratamiento y los problemas cardiovasculares 1.41 (a) La mediana es mejor; la media se ve sustancialmente son independientes. Tienen afectada por las dos observaciones extremas. (b) El RIQ es No hay relación y la diferencia en la incidencia mejor; la desviación estándar, al igual que la media, se ve tasas entre la rosiglitazona y la pioglitazona sustancialmente afectada. Los grupos se deben al azar. HA: Modelo alternativo. por los dos altos salarios. 1.43 La distribución es unimodal y simétrica con una media de unos 25 minutos y una desviación estándar de unos 5 minutos. No parece haber ningún condado con características inusuales tiempos de viaje medios altos o bajos. Dado que la distribución ya es unimodal y simétrica, una La transformación logarítmica no es necesaria. 1.45 Las respuestas variarán. Hay focos de mayor tiempo de viaje alrededor de DC, sureste de Nueva York, Chicago, Minneapolis, Los Ángeles y muchos más otras grandes ciudades. También hay una gran sección de tiempos de viaje promedio más cortos que se superponen con tierras de cultivo en el Medio Oeste. Muchos agricultores Las casas están adyacentes a sus tierras de cultivo, por lo que sus El viaje diario sería de 0 minutos, lo que podría explicar por qué el tiempo promedio de viaje para estos Los condados son relativamente bajos. El tratamiento y los problemas cardiovasculares son no independiente. La diferencia en la incidencia tasas entre la rosiglitazona y la pioglitazona Los grupos no se deben al azar y la rosiglitazona se asocia con un mayor riesgo de enfermedad grave problemas cardiovasculares. (c­ii) Un mayor número de pacientes con problemas cardiovasculares en el grupo de rosiglitazona de lo esperado bajo el El supuesto de independencia respaldaría la hipótesis alternativa. Esto sugieren que la rosiglitazona aumenta el riesgo de Tales problemas. (c­iii) En el estudio real, observamos 2593 eventos cardiovasculares en el grupo de rosigli­tazona. En las 1000 simulaciones bajo El modelo de independencia, observamos algo menos de 2.593 en todas las simulaciones, lo que sugiere que los resultados reales no vinieron de la modelo de independencia. Es decir, el análisis proporciona evidencia sólida de que las variables no son 1.47 (a) Vemos el orden de las categorías independiente, y rechazamos la independencia y las frecuencias relativas en el gráfico de barras. modelo a favor de la alternativa. Los resultados del estudio (b) No hay características que sean evidentes en proporcionan evidencia sólida de que la rosiglitazona... el gráfico circular pero no en el gráfico de barras. (c) Nosotros se asocia con un mayor riesgo de enfermedades cardiovasculares Generalmente preferimos usar un gráfico de barras ya que también podemos problemas particulares. Machine Translated by Google 390 APÉNDICE A. SOLUCIONES DE LOS EJERCICIOS DEL FINAL DEL CAPÍTULO 2 Probabilidad 2.1 (a) Falso. Estos son ensayos independientes. (b) Falso. Hay relacionado (independiente), entonces la ocurrencia de uno no cartas con figuras rojas. (c) Verdadero. Una carta no puede ser a la vez una figura y un as. impide que ocurra el otro. 2.11 (a) 0.16 + 0.09 = 0.25. 2.3 (a) 10 lanzamientos. Menos lanzamientos implican mayor del esposo y la esposa son independientes: 0.25 × 0.26 = 0.065. variabilidad en la fracción muestral de caras, lo que significa También podría notar que en realidad hicimos una segunda (b) 0.17 + 0.09 = 0.26. (c) Suponiendo que el nivel de educación que hay una mayor probabilidad de obtener al menos un 60% suposición: que la decisión de casarse no está relacionada con el de caras. (b) 100 lanzamientos. Un mayor número de nivel de educación. (d) La suposición de independencia del esposo/ lanzamientos significa que la proporción observada de caras a esposa probablemente no sea razonable, porque las personas a menudo estaría más cerca del promedio, 0,50, y por lo tanto menudo se casan con otra persona con un nivel comparable de también por encima de 0,40. (c) 100 lanzamientos. Con más educación. Dejaremos que usted piense si la segunda suposición lanzamientos, la proporción observada de caras a menudo señalada en la parte (c) es razonable. 2.13 (a) Inválido. La suma estaría más cerca del promedio, 0,50. (d) 10 lanzamientos. Un es mayor que 1. (b) Válido. Las probabilidades están entre 0 y 1, menor número de lanzamientos aumentaría la variabilidad en la fracción de lanzamientos que resultan caras. (c) Inválido. La suma es menor 10 2.5 (a) 0.5 = 0.00098. (b) 0.5 (c) P(al menos 10 = 0,00098. y suman 1. En esta clase, todos los estudiantes obtienen una C. que 1. (d) No válido. Hay una probabilidad negativa. (e) Válido. una cruz) = 1 − P(ninguna cruz) = 1 − (0.5 10) ≈ 1 − 0.001 = 0.999. 2.7 (a) No, hay votantes que son políticamente independientes y también votantes indecisos. (b) Diagrama de Venn a continuación: Las probabilidades están entre 0 y 1, y suman 1. (f) Inválido. Hay una probabilidad negativa. 2.15 (a) No, pero podríamos si A y B son independientes. (bi) 0.21. (b­ii) 0.3 + 0.7 ­ 0.21 = 0.79. (b­iii) Igual que P(A): 0.3. (c) No, porque 0.1 = 0.21, donde 0.21 fue el valor calculado bajo la independencia de la parte (a). (d) P(A | B) = 0.1/0.7 = 0.143. 2.17 (a) 0.60 + 0.20 ­ 0.18 = 0.62. (b) 0.18/0.20 = 0.90. (c) 0,11/0,33 ≈ 0,33. (d) No, de lo contrario las respuestas finales de las partes (c) 24%. (d) Sume las secciones disjuntas correspondientes en (b) y (c) habrían sido iguales. (e) 0,06/0,34 ≈ 0,18. el diagrama de Venn: 0,24 + 0,11 + 0,12 = 0,47. Como alternativa, utilice la regla general de la adición: 0,35 + 0,23 − 0,11 = 0,47. (e) 1 − 0,47 = 0,53. (f) P(Independiente) × P(oscilación) = 0,35 × 0,23 = 0,08, que no es igual a P(Independiente y oscilación) = 0,11, por lo que los eventos son dependientes. Si afirmara que 2.19 (a) 162/248 = 0,65. (b) 181/252 = 0,72 (c) Suponiendo que esta diferencia podría deberse a la variabilidad del muestreo en la las elecciones de citas sean independientes de la preferencia encuesta, esa respuesta también sería razonable (profundizaremos en este tema en capítulos posteriores). 2.9 (a) Si la clase no se por las hamburguesas, lo que a primera vista parece razonable: 0,65 × 0,72 = 0,468. (d) (252 + 6 − 1)/500 = 0,514 2.21 (a) El califica en una curva, son independientes. Si se califica con una diagrama de árbol: curva, entonces no son independientes ni disjuntos (a menos que el instructor solo otorgue una A, que es una situación que ignoraremos en las ¿Se pueden construir ¿Aprobado? diagramas de Sí, 0,86 partes (b) y (c)). (b) Probablemente no sean independientes: si 0,8*0,86 = 0,688 caja? Sí, 0.8 estudian juntos, sus hábitos de estudio estarían relacionados, lo No, 0.14 que sugiere que su desempeño en el curso también lo está. (c) Sí, 0,65 No. Consulte la respuesta a la parte (a) cuando el curso no se 0,8*0,14 = 0,112 0,2*0,65 = 0,13 no, 0.2 califica con una curva. De manera más general: si dos cosas no No, 0.35 0,2*0,35 = 0,07 son... P(puede construir|pasar) = 0,8×0,86 = 0,8×0,86 + 0,2×0,65 P (puede construir y pasar) (b) 0.688 0.818 P (pase) ≈ 0,84. = Machine Translated by Google 391 2.23 Primero dibuja un diagrama de árbol: En las pruebas de lupus, solo hay un 7,14% de casos positivos. probabilidad de que en realidad tenga lupus. Mientras que House Resultado ¿VIH? positivo, 0,997 no es del todo correcto: es posible que el paciente tenga lupus; 0,259*0,997 = 0,2582 su escepticismo implícito está justificado. Sí, 0,259 negativo, 0,003 positivo, 0,074 0,259*0,003 = 0,0008 0,741*0,074 = 0,0548 2.27 (a) 0.3. (b) 0.3. (c) 0.3. (d) 0.3 × 0.3 = no, 0.741 negativo, 0,926 Luego calcula la probabilidad: P(VIH |+) = 0,259×0,997 P (VIH y +) = 0.3131 = 0,259×0,997+0,741×0,074 P (+) 0,2582 0.09. (e) Sí, la población de la que se extrae la muestra es idéntica en cada extracción. 0,741*0,926 = 0,6862 (2/9) ≈ 0,067. (d) No. En esta pequeña población de canicas, quitando una canica significativamente = 0,8247. 2.25 Un diagrama de árbol de la situación: cambia la probabilidad de lo que podría sacarse próximo. Resultado ¿Lupus? positivo, 0,98 0,02*0,98 = 0,0196 2.31 Para 1 leggings (L) y 2 jeans (J), hay Hay tres posibles ordenamientos: LJJ, JLJ y JJL. 0,02*0,02 = 0,0004 La probabilidad de LJJ es (5/24) × (7/23) × Sí, 0.02 negativo, 0,02 positivo, 0,26 0,98*0,26 = 0,2548 (6/22) = 0,0173. Los otros dos ordenamientos tienen La misma probabilidad, y estos tres posibles ordenamientos 0,98*0,74 = 0,7252 son eventos disjuntos. Respuesta final: 0.0519. no, 0.98 negativo, 0,74 0.0196 = P (lupus y positivo) P(lupus|positivo) = P (positivo) = 0,0714. Incluso cuando un paciente 0,0196+0,2548 2.29 (a) 2/9. (b) 3/9 = 1/3. (c) (3/10) × 2.33 (a) 13. (b) No. Los estudiantes no son un muestra aleatoria. 2.35 (a) La siguiente tabla resume el modelo de probabilidad: Evento XP(X) 3 corazones 50 3 negros 25 Demás 0 13 12 52 51 50 24 × × × 26 × 25 11 52 51 50 1 − (0,0129 + = 0,0129 = 0,1176 X ∙ P(X) (X − E(X))2 (50 − (X − E(X))2 ∙ P (X) 0.65 3,59)2 = 2154,1 (25 − 3,59)2 = 458,5 2154,1 × 0,0129 = 27,9 2.94 (0 − 3,59)2 = 12,9 458,5 × 0,1176 = 53,9 12,9 × 0,8695 = 11,2 0 0,1176) = 0,8695 V(X) = 93.0 E(X) = $3.59 SD(X) = V(X) = 9,64 (b) E(X −5) = E(X)−5 = 3,59−5 = −$1,41. La desviación estándar es la misma que la desviación estándar. desviación de X: $9,64. (c) No. Las ganancias esperadas son negativas, por lo que en promedio perderías dinero jugando el juego. 2.37 Los tres juegos independientes tienen un riesgo menor, pero En este contexto simplemente significa que es probable que perdamos. Evento XP (X) X ∙ P (X) Auge 0,18 1 3 0,18 × 1 3 Normal 0.09 1 3 0,09 × 1 3 1 3 −0,12 × Recesión ­0,12 una cantidad más estable ya que el valor esperado = 0,06 = 0,03 1 3 = −0,04 E(X) = 0,05 El rendimiento esperado es un aumento del valor del 5%. por un solo año. 2.39 (a) Esperado: ­$0.16. Varianza: 8.95. SD: $2,99. (b) Esperado: ­$0,16. SD: $1,73. (c) Los valores esperados son los mismos, pero las DE difieren. La desviación estándar del juego con ganancias/ derrotas triplicadas es mayor, ya que los tres juegos Sigue siendo negativo. 2.41 Un juego justo tiene un valor esperado de cero: $5 × 0,46 + x × 0,54 = 0. Resolviendo para x: ­$4,26. Apostarías $4.26 a que los Padres llegarán al juego limpio 2.43 (a) Esperado: $3.90. DE: $0.34. (b) Esperado: $27.30. DE: $0.89. Si calculó parte (b) utilizando la parte (a), debería haber obtenido una DE de $0,90. 2.45 Las respuestas aproximadas están bien. Respuestas son solo estimaciones basadas en la muestra. independientes podrían ir en direcciones diferentes (por ejemplo,(a) (29 + 32)/144 = 0,42. (b) 21/144 = 0,15. Podría ganar un juego y perder dos juegos). Así que (c) (26 + 12 + 15)/144 = 0,37. Machine Translated by Google 392 APÉNDICE A. SOLUCIONES DE LOS EJERCICIOS DEL FINAL DEL CAPÍTULO 3 Distribuciones de variables aleatorias 3.1 (a) 8,85%. (d) 3,11 (a) Z = 0,67. (b) µ = $1650, x = $1800. (c) 0,67 = → σ = (b) 6,94%. (c) 58,86%. $223,88. 4,56%. 1800−1650 σ 3.13 Z = 1.56 → 0.0594, es decir, 6%. 3.15 (a) Z = 0.73 → 0.2327. (b) Si está pujando en una sola subasta y 0 1.48 (b) −1,35 0 (a) establece un precio máximo de puja bajo, es probable que alguien le supere la oferta. Si establece un precio máximo de puja alto, puede ganar la subasta, pero pagar más de lo necesario. Si está pujando en más de una subasta y establece su precio máximo de puja muy bajo, probablemente no gane ninguna de −0,4 −2 1.5 (c) 2 0 (d) las subastas. Sin embargo, si el precio máximo de puja es incluso modestamente alto, es probable que gane varias subastas. (c) Una respuesta aproximadamente igual al percentil 10 sería 3.3 (a) Verbal: N(μ = 462, σ = 119), Cuantitativa: N(μ = 584, σ razonable. Lamentablemente, ningún punto de corte de percentil = 151). (b) ZV R = 1,33, ZQR = 0,57. garantiza más allá de cualquier evento posible que gane al menos una subasta. Sin embargo, puede elegir un percentil más alto si Código QR quiere estar más seguro de ganar una subasta. (d) Las respuestas variarán ligeramente, pero deberían corresponder a la respuesta realidad virtual z = 0,57 del inciso (c). Usamos el percentil 10 : z = 1,33 (c) Obtuvo 1,33 desviaciones estándar por encima de la media Z = −1,28 → $69,80. 3.17 14/20 = 70 % están dentro de 1 DE. Dentro de 2 DE: 19/20 en la sección de razonamiento verbal y 0,57 desviaciones estándar por encima de la media en la sección de razonamiento verbal. = 95 %. Dentro de 3 DE: 20/20 = 100 %. la sección de razonamiento cuantitativo. (d) Obtuvo mejores resultados en la sección de razonamiento verbal, ya que su puntuación Z en esa sección fue mayor. (e) P ercV R = 0,9082 ≈ Siguen esta regla de cerca. 3.19 La distribución es unimodal y simétrica. La curva normal superpuesta se aproxima bastante bien a la distribución. Los 91 %, P ercQR = 0,7157 ≈ 72 %. (f) 100 % − 91 % = 9 % obtuvo puntos en el gráfico de probabilidad normal también siguen una mejores resultados que ella en VR, y 100 % − 72 % = 28 % línea relativamente recta. Hay una observación ligeramente obtuvo mejores resultados que ella en QR. (g) No podemos comparar las puntuaciones brutas, ya que están en escalas diferentes. distante en el extremo inferior, pero no es extrema. Los datos parecen estar razonablemente aproximados por la distribución normal. 3.21 (a) No. Las tarjetas no son independientes. Comparar sus puntuaciones percentiles es más apropiado cuando se compara su desempeño con el de otros. (h) La respuesta a la parte (b) no cambiaría ya que las puntuaciones Z se pueden calcular para distribuciones. que no son normales. Sin embargo, no pudimos responder a los incisos (c)­(f), ya que no podemos usar la tabla de probabilidad normal para calcular probabilidades y percentiles sin un modelo normal. 3.5 (a) Z = 0.84, que corresponde a 711 Por ejemplo, si la primera carta es un as de tréboles, eso implica que la segunda carta no puede ser un as de tréboles. Además, existen muchas categorías posibles, que deberían simplificarse. (b) No. Se consideran seis eventos. La distribución de Bernoulli solo permite dos eventos o categorías. Nótese que lanzar un dado podría ser una prueba de Bernoulli si simplemente en QR. (b) Z = −0.52, que corresponde a 400 en VR. consideramos dos eventos, por ejemplo, sacar un 6 y no sacar un 6, aunque sería necesario especificar dichos detalles. 3.7 (a) Z = 1.2 → 0.1151. (b) Z = −1.28 → 70.6 ◦F o más frío. sario. 3.9 (a) N(25, 2.78). (b) Z = 1.08 → 0.1401. (c) Las respuestas son 3,23 (a) (1 − 0,471)2 × 0,471 = 0,1318. (b) 0,4713 = 0,1045. (c) µ muy similares porque solo se cambiaron las unidades. (La única = 1/0,471 = 2,12, σ = √ 2,38 = 1,54. (d) µ = 1/0,30 = 3,33, σ = razón por la que difieren ligeramente es porque 28 °C son 82.4 2,79. (e) Cuando p es menor, el evento es más raro, lo que °F, no exactamente 83 °F). significa que el número esperado de ensayos es­ Machine Translated by Google 393 para un éxito y la desviación estándar de la 3,37 0 victorias (­$3): 0,1458. 1 victoria (­$1): 0,3936. 2 victorias los tiempos de espera son (+$1): 0,3543. 3 victorias (+$3): 0,1063. mayores. 3,25 (a) 0,8752 × 0,125 = 0,096. (b) µ = 8, σ = 7,48. 3.39 (a) 1/5 × 1/4 × 1/2 × 1/1 = 1/5! 1/3 = 1/120. × (b) Como las 3.27 (a) Sí. Se cumplen las condiciones: independencia, número fijo de ensayos, éxito o fracaso en cada ensayo y probabilidad de éxito constante en todos los ensayos. (b) 0,200. (c) 0,200. (d) Ana Ben Carl Damián Remolino probabilidades deben sumar 1, debe haber 5! = 120 posibles ordenamientos. (c) 8! = 40.320. 3.41 (a) Geométrica: (5/6)4 × (1/6) = 0,0804. 0,0024 + 0,0284 + 0,1323 = 0,1631. (e) 1 − 0,0024 = 0,9976. 3.29 (a) µ = 35, σ = 3,24. (b) Sí. Z = 3,09. Nótese que la distribución geométrica es sólo un caso especial de la distribución binomial negativa cuando hay un solo éxito en el último intento. (b) Binomial: 0,0322. (c) Binomial negativa: Dado que 45 es más de 2 desviaciones estándar de 0,0193. La media se consideraría inusual. Cabe destacar que no se requiere el modelo normal para aplicar esta regla general. (c) 3.43 (a) Modelo binomial negativo con n = 4 y p = 0,55, donde el Usando un modelo normal: 0,0010. Esto sí parece ser una éxito se define como una estudiante. El modelo binomial negativo observación inusual. Si se usara un modelo normal con una es apropiado, ya que el último ensayo es fijo, pero se desconoce corrección de 0,5, la probabilidad se calcularía como 0,0017. el orden de los tres primeros. (b) 0,1838. (c) = 3. (d) En el modelo binomial no hay restricciones sobre el resultado del último 3 ensayo. 1 3.31 Se busca determinar la probabilidad de que haya más de 1786 inscritos. Usando el modelo normal: 0,0537. Con una corrección de 0,5: 0,0559. 3.33 (a) 1 − 0.753 = 0.5781. (b) 0.1406. (c) 0.4219. (d) 1 − 0.253 En el modelo binomial negativo, el último ensayo es fijo. Por lo tanto, nos interesa el número de ordenaciones de los otros k − 1 éxitos en los primeros n − 1 ensayos. = 0.9844. 3.35 (a) Distribución geométrica: 0.109. (b) Binomial: 0.219. (c) Binomial: 0.137. (d) 1 − 0.8756 = 0.551. (e) Geométrica: 0.084. (f) Usando una distribución binomial con n = 6 y p = 0.75, vemos que µ = 4.5, σ = 1.06, y Z =?2.36. Dado que esto no está dentro de las 2 DE, puede considerarse inusual. 3.45 (a) Poisson con λ = 75. (b) µ = λ = 75, σ = √ λ = 8.66. (c) Z = −1.73. Dado que 60 se encuentra dentro de 2 desviaciones estándar de la media, generalmente no se consideraría inusual. Tenga en cuenta que a menudo utilizamos esta regla general incluso cuando el modelo normal no se aplica. 3.47 Utilizando Poisson con λ = 75: 0,0402. 4 Fundamentos de la inferencia 4.1 (a) Media. Cada estudiante reporta un valor numérico: un de un ejemplo a otro. (e) Utilizamos el EE, que es 1,91/ √ 100 = número de horas. (b) Media. Cada estudiante reporta un número, 0,191 para la media de esta muestra. que es un porcentaje, y podemos promediar estos porcentajes. (c) Proporción. Cada estudiante reporta Sí o No; por lo tanto, 4.5 (a) SE = 2,89. (b) Z = 1,73, lo que indica que los dos valores esta es una variable categórica y usamos una proporción. (d) no son inusualmente distantes entre sí cuando se tiene en Media. Cada estudiante reporta un número, que es un porcentaje, cuenta la incertidumbre en la estimación puntual de John. como en el inciso (b). (e) Proporción. Cada estudiante reporta si consiguió trabajo o no; por lo tanto, esta es una variable categórica y usamos una proporción. 4.7 (a) Estamos 95% seguros de que los residentes de EE. UU. pasan un promedio de 3,53 a 3,83 horas por día relajándose o realizando actividades que disfrutan después de un día de 4.3 (a) Media: 13,65. Mediana: 14. (b) DE: 1,91. RIQ: 15 − 13 = trabajo promedio. (b) El 95% de dichas muestras aleatorias 2. (c) Z16 = 1,23, lo cual no es inusual, ya que se encuentra a 2 DE de la media. Z18 = 2,23, lo cual generalmente se considera producirán un IC del 95% que contiene las horas promedio reales por día que los residentes de EE. UU. pasan relajándose inusual. (d) No. Las estimaciones puntuales basadas en o realizando actividades que disfrutan después de un día de muestras solo se aproximan al parámetro poblacional y varían trabajo promedio. (c) Pueden estar un poco menos seguros de de una muestra a otra. capturar el parámetro, por lo que el intervalo será un poco más delgado. Machine Translated by Google 394 APÉNDICE A. SOLUCIONES DE LOS EJERCICIOS DEL FINAL DEL CAPÍTULO 4.9 Una forma común de disminuir el ancho de (El tiempo promedio que cada empleado pasa sin trabajar en El intervalo sin perder la confianza consiste en aumentar el la empresa es mayor a 15 tamaño de la muestra. También puede ser posible minutos para March Madness.) utilizar un método de muestreo más avanzado, como como muestreo estratificado, aunque el análisis requerido está más allá del alcance de este curso, y tal 4.17 En primer lugar, las hipótesis deben ser sobre la media poblacional (µ) no la media muestral. En segundo lugar, la hipótesis nula debe tener una En este contexto, puede resultar difícil aplicar un método de muestreo. signo y la hipótesis alternativa debe ser 4.11 (a) Falso. Siempre que la distribución de datos observada. La forma correcta de configurar no está muy sesgado (n = 64 en esta muestra, por lo que Estas hipótesis se muestran a continuación: sobre el valor hipotético nulo, no sobre la media muestral podemos ser un poco indulgentes con el sesgo), La media muestral será casi normal, lo que permite la H0 : µ = 2 horas aproximación normal del método descrito. (b) Falso. La HA : µ > 2 horas inferencia se basa en la parámetro de población, no la estimación puntual. La prueba unilateral indica que sólo somos La estimación puntual siempre está en la confianza Me interesa demostrar que 2 es una subestimación. Aquí el intervalo. (c) Verdadero. (d) Falso. La confianza interés se centra solo en una dirección. El intervalo no se trata de una media muestral. (e) Falso. Por lo tanto, una prueba unilateral parece la más apropiada. Si También nos interesaría que los datos mostraran Para tener más confianza en que captamos el parámetro, necesitamos un intervalo más amplio. Piense en Necesitando una red más grande para estar más seguro de atrapar Un pez en un lago turbio. (f) Verdadero. Explicación opcional: Esto es cierto ya que el modelo normal Se utilizó para modelar la media muestral. El margen de error es la mitad del ancho del intervalo, y La media muestral es el punto medio del intervalo. (g) Falso. En el cálculo de la norma error, dividimos la desviación estándar por la Raíz cuadrada del tamaño de la muestra. Para cortar el EE (o margen de error) a la mitad, necesitaríamos muestra 22 = 4 veces el número de personas en la muestra inicial. 4.13 Independencia: muestra de < 10% de población. Debemos asumir que es una muestra aleatoria simple para seguir adelante; en la práctica, Investigaría si este es el caso, pero Aquí solo informaremos que estamos haciendo esto. Suposición. Nótese que no hay estudiantes. que no han tenido relaciones exclusivas en el muestra, que sugiere algunas respuestas de los estudiantes Es probable que falten (quizás solo valores positivos) Se informaron casos). El tamaño de la muestra es de al menos 30. El sesgo es fuerte, pero la muestra es muy grande. Así que esto no es una preocupación. IC del 90%: (2,97, 3,43). Estamos 90% seguros de que el número promedio de relaciones exclusivas que tienen los estudiantes de Duke han estado en está entre 2,97 y 3,43. Hay pruebas sólidas de que 2 era una sobreestimación, entonces La prueba debe ser de dos caras. 4.19 (a) Esta afirmación no parece plausible ya que 3 horas (180 minutos) no está en el intervalo. (b) 2,2 horas (132 minutos) está en el Intervalo de confianza del 95%, por lo que no tenemos evidencia para afirmar que está equivocada. Sin embargo, sería... es más apropiado utilizar la estimación puntual de la muestra. (c) Un intervalo de confianza del 99% será ser más amplio que un intervalo de confianza del 95%, lo que significa que encerraría este intervalo más pequeño. Esto significa que 132 minutos estarían en el intervalo más amplio, y no rechazaríamos su reclamo basándonos en un nivel de confianza del 99%. 4.21 Independencia: La muestra es presumiblemente una muestra aleatoria simple, aunque deberíamos verificar que así sea. Generalmente, esto es lo que se se entiende por “muestra aleatoria”, aunque es una buena Para todas las siguientes preguntas y soluciones, se puede asumir que... "Muestra aleatoria" en realidad significa "muestra aleatoria simple". 75 rodamientos de bolas son más pequeños que 10% de la población de rodamientos de bolas. El El tamaño de la muestra es de al menos 30. Los datos son sólo ligeramente sesgado. Bajo el supuesto de que el La muestra aleatoria es una muestra aleatoria simple, ¯x se distribuirá normalmente. H0 : µ = 7 horas. HA : µ = 7 horas. Z = −1,04 → valor p= 4.15 (a) H0 : µ = 8 (En promedio, los neoyorquinos 2×0,1492 = 0,2984. Dado que el valor p es mayor dormir 8 horas por noche.) HA : µ < 8 (En promedio, Si es mayor que 0,05, no podemos rechazar H0. Los datos no Los neoyorquinos duermen menos de 8 horas por noche.) No se proporciona evidencia convincente de que la vida útil (b) H0 : µ = 15 (La cantidad promedio de tiempo que cada promedio de todos los rodamientos de bolas producidos por este empleado pasa sin trabajar en la empresa es La máquina es diferente a 7 horas. (Comentario sobre 15 minutos para March Madness.) HA : µ > 15 utilizando una alternativa unilateral: el trabajador puede ser Machine Translated by Google 395 (Si está interesado en saber si los rodamientos de bolas tienen 1 error. De los 42 medicamentos sospechosos, esperaríamos un rendimiento inferior o superior al que afirma el fabricante, que aproximadamente 20/42 representaran un error, mientras sugerimos una prueba bilateral). 4.23 (a) Independencia: La que aproximadamente 22/42 (aproximadamente el 52 %) serían muestra es aleatoria y 64 pacientes casi con seguridad medicamentos con efectos adversos. (d) No hay suficiente información para determinarlo. representarían menos del 10 % de los residentes de urgencias. El tamaño de la muestra es de al menos 30. No se proporciona 4.31 (a) Independencia: La muestra es aleatoria. información sobre la asimetría. En la práctica, solicitaríamos En la práctica, deberíamos preguntarnos si 70 clientes son ver los datos para comprobar esta condición, pero aquí menos del 10% de la población (asumiremos que este es el asumiremos que la asimetría no es muy marcada. (b) H0 : µ = caso para este ejercicio). El tamaño de la muestra es de al 127. HA : µ = 127. menos 30. No se proporciona información sobre el sesgo, por Z = 2,15 → valor p = 2 × 0,0158 = 0,0316. preguntaríamos. Por ahora, asumiremos que el sesgo no es lo que este es otro elemento sobre el que normalmente Dado que el valor p es menor que α = 0,05, rechazamos H0. muy fuerte. (b) H0 : µ = 18. HA : µ > 18. Z = 3,46 → valor p = Los datos proporcionan evidencia convincente de que el tiempo 0,0003, que es menor que α = 0,05, por lo que rechazamos H0. promedio de espera en urgencias ha aumentado durante el Hay evidencia sólida de que el ingreso promedio por cliente es último año. (c) Sí, cambiaría. El valor p es mayor que 0,01, lo mayor que $18. (c) (18,65, 19,85). (d) Sí. La prueba de hipótesis que significa que no rechazaríamos H0 con α = 0,01. rechaza la noción de que µ = 18, y este valor no está en el 4.25 H0 : µ = 130. HA : µ = 130. Z = 1.39 → valor p = 2 × 0.0823 promedio por cliente parezca significativo, el dueño del intervalo de confianza. (e) Aunque el aumento en los ingresos = 0.1646, que es mayor que α = 0.05. Los datos no proporcionan restaurante podría considerar otros criterios, como las ganancias totales. Con una hora feliz más larga, los ingresos de toda la evidencia convincente de que el contenido calórico promedio real en bolsas de papas fritas sea diferente de 130 calorías. noche podrían disminuir, ya que se ofrecen precios más bajos durante más tiempo. Además, los costos suelen aumentar cuando bajan los precios. Una mejor medida a considerar 4.27 (a) H0: Los antidepresivos no ayudan a aliviar los síntomas HA: Los de la fibromialgia. podría ser un aumento en las ganancias totales de toda la noche. antidepresivos tratan los síntomas de la fibromialgia. Observación: Diana también podría haber tomado nota especial si sus síntomas empeoraron mucho, por lo que un enfoque más científico habría sido utilizar una prueba de dos colas. Mientras 4.33 (a) La distribución es unimodal y fuertemente sesgada a la que las partes (b)­(d) utilizan la versión de una cola, sus derecha, con una mediana entre 5 y 10 años. Las edades respuestas serán un poco diferentes si utilizó una prueba de oscilan entre 0 y poco más de 50 años, y el 50% medio de la dos colas. (b) Concluir que los antidepresivos funcionan para distribución se encuentra aproximadamente entre 5 y 15 años. el tratamiento de los síntomas de la fibromialgia cuando en Existen posibles valores atípicos en el extremo superior. (b) realidad no lo hacen. (c) Concluir que los antidepresivos no Cuando el tamaño de la muestra es pequeño, la distribución funcionan para el tratamiento de los síntomas de la fibromialgia muestral es sesgada a la derecha, al igual que la distribución cuando en realidad sí lo hacen. (d) Si comete un error de Tipo poblacional. A medida que aumenta el tamaño de la muestra, 1, continuará tomando medicamentos que en realidad no tratan la distribución muestral se vuelve más unimodal, simétrica y se su trastorno. Si comete un error de Tipo 2, dejará de tomar aproxima a la normalidad. La variabilidad también disminuye. medicamentos que podrían tratar su trastorno. 4.29 (a) Si la Esto concuerda con el Teorema del Límite Central. hipótesis nula se rechaza en el error, entonces los reguladores concluyeron que el efecto adverso fue mayor en los que tomaron el medicamento que en los que no lo tomaron, cuando 4.35 Los centros son los mismos en cada gráfica, y cada en realidad las tasas son las mismas para los dos grupos. (b) conjunto de datos proviene de una distribución casi normal Si la hipótesis nula no se rechaza, pero debería haberse (véase la Sección 4.2.6), aunque los histogramas pueden no rechazado, entonces los reguladores no identificaron que el parecer muy normales, ya que cada uno representa solo 100 efecto adverso fue mayor en quienes tomaban el medicamento. puntos de datos. La única manera de determinar qué gráfica (c) Las respuestas pueden variar ligeramente. Si los 403 corresponde a cada escenario es examinar la variabilidad de medicamentos son realmente adecuados, entonces cada distribución. La gráfica B es la más variable, seguida de aproximadamente 403 × 0,05 ≈ 20 medicamentos tendrán un la gráfica A y luego la gráfica C. Tipo Esto significa que la gráfica B corresponderá a los datos originales, la gráfica A a las medias de muestra con tamaño 5 y la gráfica C a las medias de muestra con tamaño 25. Machine Translated by Google 396 APÉNDICE A. SOLUCIONES DE LOS EJERCICIOS DEL FINAL DEL CAPÍTULO 4.37 (a) Sesgada a la derecha. Hay una cola larga en el extremo 60/15 = 4 minutos. Utilizando EE = 1,62/√ 15, Z = 1,31 → 0,0951. Opción superior de la distribución, pero una cola mucho más corta en el 2: Dado que la distribución poblacional no es normal, un tamaño de extremo inferior. (b) Menor que, ya que la mediana sería menor que la media. muestra pequeño podría no ser suficiente para obtener una distribución en una distribución sesgada hacia la derecha. (c) No deberíamos. (d) con las herramientas que hemos aprendido hasta ahora. (c) Ahora Aunque la distribución de la población no sea normal, las condiciones podemos estar seguros de que se cumplen las condiciones. Z = 0,92 muestral casi normal. Por lo tanto, no podemos estimar la probabilidad para la inferencia se satisfacen razonablemente, con la posible excepción del sesgo. Si el sesgo no es muy fuerte (deberíamos pedir ver los datos), entonces podemos usar el Teorema del Límite Central para estimar esta probabilidad. Por ahora, asumiremos que el sesgo no es muy fuerte, aunque la descripción sugiere que es al menos de moderado a fuerte. Use N(1.3, SEx¯ = 0.3/ √ 60): Z = 2.58 → 0.0049. (e) Lo disminuiría por un factor → 0,1788. 4.43 (a) H0 : µ2009 = µ2004. HA : µ2009 = µ2004. (b) ¯x2009 −x¯2004 = −3,6 correos electrónicos no deseados por día. (c) No se rechazó la hipótesis nula, y los datos no proporcionan evidencia de 1/ √ 2. 4.39 (a) Z = −3.33 → 0.0004. (b) Se conoce la DE de la población convincente de que el promedio real de correos electrónicos no y los datos son casi normales, por lo que la media de la muestra será casi deseados por día en los años 2004 y 2009 sea diferente. La normal con una distribución N(µ, σ/√ n), es decir, N(2,5, 0,0095). (c) Z = diferencia observada es aproximadamente la que podríamos −10,54 → ≈ 0. (d) Véase a continuación: esperar solo de la variabilidad del muestreo. (d) Sí, ya que la hipótesis de que no hay diferencias no se rechazó en la parte (c). 4.45 (a) H0 : p2009 = p2004. HA : p2009 = p2004. (b) ­7%. (c) Se rechazó la hipótesis nula. Los datos proporcionan evidencia sólida de que la verdadera proporción de quienes eliminan su correo no deseado una vez al mes o con menor frecuencia fue mayor en 2004 que en 2009. La diferencia es tan grande que no puede explicarse fácilmente como Población Muestreo (n = 10) debida al azar. (d) No, ya que la diferencia nula, 0, se rechazó en la parte (c). 4.47 (a) El escenario I es mayor. Recuerde que una media de muestra basada en menos datos tiende a ser menos precisa y a tener errores estándar mayores. (b) El escenario I es mayor. Cuanto mayor sea el nivel de confianza, mayor será el margen de error correspondiente. (c) Son iguales. El tamaño de la muestra no afecta el cálculo del valor p 2.41 2.44 2.47 2.50 2.53 2.56 2.59 para una puntuación Z dada. (d) El escenario I es mayor. Si la hipótesis nula es más difícil de rechazar (menor α), entonces es (e) No pudimos estimar (a) sin una distribución poblacional casi más probable que cometamos un error de Tipo 2. normal. Tampoco pudimos estimar (c), ya que el tamaño de la muestra no es suficiente para obtener una distribución muestral casi normal si la distribución poblacional no es casi normal. 4.41 (a) No podemos utilizar el modelo normal para este cálculo, 4.49 10 ≥ 2.58 × debería 102 √n → n ≥ 692.5319. Él pero podemos utilizar el histograma. encuestar al menos a 693 clientes. 4.51 (a) La Se ha demostrado que aproximadamente 500 canciones duran hipótesis nula sería que la media este año también es de 128 más de 5 minutos, por lo que la probabilidad es de aproximadamente minutos. La hipótesis alternativa sería que la media es diferente 500/3000 = 0,167. (b) Dos respuestas diferentes son razonables. de 128 minutos. (b) Primero calcule el EE: √39 64 = 4.875. A Opción 1. Dado que la distribución de la población está solo continuación, identifique las puntuaciones Z que darían como ligeramente sesgada a la derecha, incluso un tamaño de muestra resultado el rechazo de H0: Zlower = −1.96, Zupper = 1.96. En cada caso, calcule el corte de la media muestral correspondiente: pequeño producirá una distribución de muestreo casi normal. También sabemos que las canciones se muestrean aleatoriamente ¯xlower = 118.445 y ¯xupper = 137.555. (c) Construya y que el tamaño de la muestra es inferior al 10 % de la población, puntuaciones Z para los valores de la parte (b) pero utilizando la por lo que la duración de una canción en la muestra es supuesta distribución verdadera (es decir, µ = 135), es decir, sin independiente de la de otra. Buscamos la probabilidad de que la utilizar el valor nulo (µ = 128). La probabilidad de rechazar duración total de 15 canciones sea superior a 60 minutos, lo que correctamente la hipótesis nula sería significa que la canción promedio debería durar al menos... Machine Translated by Google 397 sería 0,0003 + 0,3015 = 0,3018 usando estos dos puntos de entonces sea 1 − 0,3018 = 0,6982. corte, y la probabilidad de un error de tipo 2 sería 5 Inferencia para datos numéricos 5.1 (a) Para cada observación en un conjunto de datos, Los niños son diferentes y los datos indican que Hay exactamente una observación especialmente Las puntuaciones de las madres son más altas que las de los padres. correspondiente en el otro conjunto de datos para la misma Para los padres de niños superdotados. ubicación geográfica. Los datos están emparejados. (b) H0 : µdiff = 0 (no hay diferencia en el promedio) temperatura máxima diaria entre el 1 de enero de 1968 y el 1 de enero de 2008 en los Estados Unidos continentales). HA : µdiff > 0 (la temperatura máxima diaria promedio el 1 de enero de 1968 fue inferior al promedio Temperatura máxima diaria en enero de 2008 en el Estados Unidos continental.) Si eligió una prueba de dos caras, Eso también sería aceptable. Si este es el caso, Tenga en cuenta que su valor p será un poco mayor que lo que se informa aquí en la parte (d). (c) Independencia: las ubicaciones son aleatorias y representan menos más del 10% de todas las ubicaciones posibles en los EE.UU. El tamaño de la muestra es de al menos 30. No nos dan La distribución para comprobar la asimetría. En la práctica, pediríamos ver los datos para comprobarlo. condición, pero aquí avanzaremos bajo la suposición de que no está fuertemente sesgada. (d) Z = 1,60 → valor p = 0,0548. (e) Dado que el valor p > α (ya que no se proporciona, utilice 0,05), falla Rechazar H0. Los datos no proporcionan una prueba sólida. evidencia de calentamiento de la temperatura en los Estados Unidos continentales. Sin embargo, cabe señalar que la El valor p está muy cerca de 0,05. (f) Tipo 2, ya que Es posible que haya fallado incorrectamente al rechazar H0. Puede haber un aumento, pero no pudimos detectarlo. (g) Sí, ya que no pudimos rechazar H0, que tenía un valor nulo de 0. 5.3 (a) (­0,03, 2,23). (b) Tenemos un 90% de confianza. que la temperatura máxima diaria promedio del 1 de enero de 2008 En los Estados Unidos continentales la temperatura fue 0,03 grados menor. 2,23 grados más que la temperatura máxima diaria promedio el 1 de enero de 1968. (c) No, ya que 0 está incluido en el intervalo. 5.7 Independencia: Muestras aleatorias que son Menos del 10% de la población. Ambas muestras son al menos de talla 30. En la práctica, pediríamos los datos para comprobar el sesgo (que no se proporciona), pero aquí avanzaremos bajo el suposición de que el sesgo no es extremo (hay Hay cierto margen de error en la asimetría para muestras tan grandes). Use z = 1,65. IC del 90 %: (0,16, 5,84). tienen un 90% de confianza en que la puntuación media en 2008 fue entre 0,16 y 5,84 puntos superior al promedio Puntuación en 2004. 5.9 (a) H0 : µ2008 = µ2004 → µ2004−µ2008 = 0 (El puntaje promedio en matemáticas en 2008 es igual al promedio Puntuación de matemáticas en 2004.) HA : µ2008 = µ2004 → µ2004 − µ2008 = 0 (puntuación media de matemáticas en 2008) (es diferente al puntaje promedio de matemáticas en 2004.) Se comprobaron las condiciones necesarias para la inferencia. en el Ejercicio 5.7. Z = −1,74 → valor p = 0,0818. Dado que el valor p < α, rechace H0. Los datos proporcionan evidencia sólida de que la puntuación media en matemáticas Para los estudiantes de 13 años ha cambiado entre 2004 y 2008. (b) Sí, es posible un error de tipo 1. Rechazamos H0, pero es posible que H0 sea Realmente cierto. (c) No, ya que rechazamos H0 en parte (a). 5.11 (a) Estamos 95% seguros de que aquellos en La dieta Paleo pierde 0,891 libras menos a 4,891 libras más que los del grupo de control. (b) No. El valor que no representa ninguna diferencia entre las dietas, 0, se incluye en el intervalo de confianza. (c) El cambio habría desplazó el intervalo de confianza en 1 libra, obteniendo un IC = (0,109, 5,891), que no incluye 5.5 (a) Cada una de las 36 madres está relacionada con 0. Si hubiéramos observado este resultado, habríamos exactamente uno de los 36 padres (y viceversa), rechazó H0. Así que hay una correspondencia especial entre las madres y los padres. (b) H0 : µdiff = 0. HA : µdiff = 0. Independencia: muestra aleatoria de menos del 10% de la población. Tamaño de muestra de al menos 30. La asimetría de las diferencias es, en el peor de los casos, leve. Z = 2,72 → valor p = 0,0066. Dado que el valor p < 0,05, se rechaza H0 . Los datos proporcionan una fuerte evidencia de que el promedio Puntuaciones de CI de madres y padres de niños superdotados 5.13 Condiciones de independencia y tamaño de la muestra están satisfechos. Casi cualquier grado de asimetría es razonable con muestras tan grandes. Calcule el = 0,114. El IC del 95%: + SE2 articulación SE: SE2 METRO O (­11,32, ­10,88). Tenemos un 95% de confianza en que El porcentaje promedio de grasa corporal en los hombres es del 11,32%. hasta un 10,88% inferior al porcentaje medio de grasa corporal en las mujeres. Machine Translated by Google 398 APÉNDICE A. SOLUCIONES DE LOS EJERCICIOS DEL FINAL DEL CAPÍTULO 5.15 (a) gl = 6 − 1 = 5, t 5 = 2,02 (columna con dos colas de 0,10, fila con gl = 5). (b) gl = 21 − 1 = 5, t 20 = 2,53 (columna con dos colas de 0,02, fila con gl = 20). (c) gl = 28, el 11 = 3.11. 28 = 2,05. (d) gl = 11, t El gráfico de capacidad de las diferencias muestra una línea aproximadamente recta. No hay una razón clara por la que esta distribución esté sesgada, y Dado que el gráfico de cuantiles normal parece razonable, Podemos marcar esta condición como razonablemente 5.17 La media es el punto medio: ¯x = 20. Identifique el margen satisfecha. (d) T = 4,94 para gl = 10 − 1 = 9 → de error: ME = 1.015, luego use Valor p < 0,01. (e) Dado que el valor p < 0,05, rechace H0. Los el 35 = 2,03 y SE = s/√ n en la fórmula para margen de error para identificar s = 3. 5.19 (a) H0: µ = 8 (los neoyorquinos duermen 8 horas por noche en promedio.) HA: µ < 8 (los neoyorquinos duermen menos de 8 horas por noche en promedio.) (b) Independencia: La muestra es aleatoria y de menos del 10% de los neoyorquinos. La muestra es pequeño, por lo que lo usaremos en la distribución. Para esto tamaño de muestra, se acepta una ligera desviación y la Los valores mínimo y máximo sugieren que no hay mucha desviación en el datos. T = −1,75. gl = 25 − 1 = 24. (c) 0,025 < Valor p < 0,05. Si de hecho la población real media de la cantidad de sueño que los neoyorquinos tienen por noche era de 8 horas, la probabilidad de obtener una muestra aleatoria datos proporcionan evidencia sólida de que el número promedio de coches en la intersección es más alta el viernes 6 que el viernes 11 13. (Podríamos creer que esta intersección es representativa de todas las carreteras, es decir, hay más tráfico el viernes 6 en comparación con el viernes 13 . Sin embargo, debemos ser cautelosos con los requisitos supuesto para tal generalización.) (f) Si el número promedio de vehículos que pasan por la intersección En realidad fue lo mismo el viernes 6 y 13º, entonces la probabilidad de que observemos una estadística de prueba alejada de cero es menor que 0,01. (g) Podríamos haber cometido un error de tipo 1, es decir, rechazó incorrectamente la hipótesis nula. de 25 neoyorquinos donde la cantidad promedio de sueño es 5.27 (a) H0 : µdiff = 0. HA : µdiff = 0. de 7,73 horas por noche o menos T = −2,71. gl = 5. 0,02 < valor p < 0,05. está entre 0,025 y 0,05. (d) Dado que el valor p < Dado que el valor p < 0,05, rechace H0. Los datos proporcionan 0,05, rechaza H0. Los datos proporcionan evidencia sólida de evidencia sólida de que el número promedio de que los neoyorquinos duermen menos de 8 horas. Las admisiones en urgencias relacionadas con accidentes de por noche en promedio. (e) No, ya que rechazamos H0. tráfico son diferentes entre el viernes 6 y 5,21 toneladas 19 es 1,73 para una cola. Queremos el cola inferior, por lo que se establece ­1,73 igual a la puntuación T, luego Resolver para ¯x: 56,91. 5.23 No, no debería seguir adelante con el prueba, ya que las distribuciones del ingreso personal total están muy sesgadas. Cuando la muestra... Los tamaños son grandes, podemos ser un poco indulgentes con la inclinación. Sin embargo, una desviación tan fuerte observada en este ejercicio requeriría tamaños de muestra algo grandes. un poco más alto que 30. 5.25 (a) Estos datos están emparejados. Por ejemplo, Viernes 13. Además, los datos indican que la dirección de esa diferencia es la ac­ Los accidentes son menores el viernes 6 en relación a Viernes 13. (b) (­6,49, ­0,17). (c) Esto es un estudio observacional, no un experimento, por lo que No podemos inferir tan fácilmente una intervención causal implicado en esta declaración. Es cierto que hay Hay una diferencia. Sin embargo, por ejemplo, esto no No significa que un adulto responsable salga a El viernes 13 tiene mayor probabilidad de causar daño que en cualquier otra noche. El viernes 13 de septiembre de 1991, digamos, 5.29 (a) Los pollos alimentados con linaza pesaron un promedio probablemente sería más similar al viernes 6 de septiembre de de 218,75 gramos, mientras que los alimentados con frijol de caballo 1991 que al viernes 6 de otro mes o año. (b) Sea Pesaron un promedio de 160,20 gramos. Ambas distribuciones son relativamente simétricas, sin valores atípicos aparentes. µdiff = µsexto − µdecimotercero. H0 : µdiff = 0. Hay mayor variabilidad en la HA : µdiff = 0. (c) Independencia: Los meses pesos de pollos alimentados con linaza. (b) H0 : µls = Los seleccionados no son aleatorios. Sin embargo, si pensamos µhb. HA : µls = µhb. Dejamos las condiciones a Estas fechas son aproximadamente equivalentes a una simple Para que lo consideres. T = 3.02, gl = min(11, 9) = 9 Muestra aleatoria de todas las fechas del viernes 6/13 → 0,01 < valor p < 0,02. Dado que el valor p < 0,05, pares, entonces la independencia es razonable. Para continuar, Rechace H0. Los datos proporcionan evidencia sólida debemos hacer esta suposición sólida: que existe una diferencia significativa entre Aunque deberíamos tener en cuenta esta suposición en cualquier pesos promedio de los pollos alimentados con linaza Resultados reportados. Con menos de 10 observaciones, y frijol de caballo. (c) Tipo 1, ya que rechazamos necesitaríamos usar la distribución t. H0. (d) Sí, dado que el valor p > 0,01, deberíamos para modelar la media muestral. La probabilidad normal No han logrado rechazar H0. Machine Translated by Google 399 5.31 H0 : µC = µS. HA : µC = µS. T = 3,48, para alimentar tipos (presumiblemente mantenidos separados de gl = 11 → valor p < 0,01. Dado que el valor p < 0,05, entre sí), por lo tanto, la independencia de las observaciones Rechace H0. Los datos proporcionan evidencia sólida es razonable. Aprox. normal: el que el peso promedio de los pollos que fueron distribuciones de pesos dentro de cada tipo de alimento La caseína alimentada es diferente del peso promedio parecen ser bastante simétricos. Varianza constante: Con base de pollos que fueron alimentados con soja (con pesos en los diagramas de caja uno al lado del otro, la de caseína siendo más alta). Dado que este es un experimento El supuesto de varianza constante parece razonable. Existen diferencias en la composición real. aleatorio, la diferencia observada es Puede atribuirse a la dieta. 5.33 H0 : µT = µC . HA : µT = µC . T = 2,24, gl = 21 → 0,02 < valor p < 0,05. Dado que el valor p < 0,05, se rechaza H0. Los datos proporcionan una sólida evidencia de que el consumo promedio de alimentos por los pacientes en los grupos de tratamiento y control son diferentes. Además, los datos indican que los pacientes del Desviaciones estándar estimadas, pero estas podrían ser debido al azar, ya que se trata de muestras bastante pequeñas. F5,65 = 15,36 y el valor p es aproximadamente 0. Con un valor p tan pequeño, rechazamos H0. El Los datos proporcionan evidencia convincente de que el peso promedio de los polluelos varía en algunos (o todos) los grupos. grupos de suplementos alimenticios. grupo de alimentación distraída (tratamiento) 5.39 (a) H0: La media poblacional de MET consumen más alimentos que los pacientes del grupo control para cada grupo es igual a los demás. HA: En grupo. 5.35 Sea µdiff = µpre − µpost. H0 : µdiff = 0: El tratamiento no tiene efecto. HA : µdiff > 0: El tratamiento es eficaz para reducir las puntuaciones Pd T, la La puntuación media previa al tratamiento es superior a la Puntuación media posterior al tratamiento. Tenga en cuenta que la Los valores informados son anteriores menos posteriores, por lo que estamos buscando una diferencia positiva, que sería Corresponden a una reducción de la psicopatía Puntuación T desviada. Las condiciones se comprueban como Sigue. Independencia: Los sujetos se asignan aleatoriamente a los tratamientos, por lo que los pacientes En cada grupo son independientes. Los tres tamaños de muestra son menores de 30, por lo que usamos t pruebas.Las distribuciones de diferencias son algo al menos un par de medias es diferente. (b) Independencia: No tenemos ninguna información sobre cómo se recopilaron los datos, por lo que no podemos evaluar la independencia. Para proceder, debemos asumir Los sujetos de cada grupo son independientes. En En la práctica, nos gustaría preguntar por más detalles. Aprox. normal: Los datos están limitados a continuación por cero y las desviaciones estándar son mayores que los medios, lo que indica muy fuerte fuerte sesgo. Sin embargo, dado que los tamaños de muestra son extremadamente grandes, incluso un sesgo extremo es aceptable. Varianza constante: Esta condición es suficientemente se cumplen, ya que las desviaciones estándar son razonablemente consistente entre los grupos. (c) Véase más abajo, con la última columna omitida: Df sesgado. Los tamaños de muestra son pequeños, por lo que no podemos relajar este supuesto de forma fiable. (Continuaremos, pero no informaremos los resultados de este 4 Valor F de la media cuadrada de la suma de los cuadrados 10508 2627 5.2 Residuos de café 50734 25564819 504 Total 50738 25575327 análisis específico, al menos para el grupo de tratamiento (d) Dado que el valor p es muy pequeño, rechace H0 . 1.) Para los tres grupos: gl = 13. T1 = 1,89 Los datos proporcionan evidencia convincente de que el MET (0,025 < valor p < 0,05), T2 = 1,35 (valor p = promedio difiere entre al menos un par de 0,10), T3 = −1,40 (valor p > 0,10). El único grupos. Se encontró una reducción significativa de la prueba en el tratamiento 5.41 (a) H0: El promedio de GPA es el mismo para todos 1 Sin embargo, habíamos notado anteriormente que este mayores. HA: Al menos un par de medias son diferentes. (b) resultado podría no ser confiable debido a la desviación en la distribución. Nótese que el cálculo de Dado que el valor p > 0,05, no se puede rechazar. El valor p para el tratamiento 3 fue innecesario: diferencia entre los promedios de calificaciones (GPA) H0. Los datos no proporcionan evidencia convincente de una La media de la muestra indicó un aumento en Pd T en tres grupos de especialidades. (c) El total de grados de puntuaciones bajo este tratamiento (en contraposición a una libertad es 195 + 2 = 197, por lo que la muestra El tamaño es 197 + 1 = 198. disminución, que fue el resultado del interés). Eso Es decir, podríamos decirlo sin completar formalmente el prueba de hipótesis de que el valor p sería grande para este grupo de tratamiento. 5.43 (a) Falso. A medida que aumenta el número de grupos, también aumenta el número de comparaciones y Por lo tanto, el nivel de significancia modificado disminuye. 5.37 H0: µ1 = µ2 = ∙ ∙ ∙ = µ6. HA: El peso promedio varía en algunos grupos (o en todos). observaciones sean independientes independientemente de la muestra. Independencia: Los polluelos se asignan al azar tamaño. (b) Verdadero. (c) Verdadero. (d) Falso. Necesitamos que las Machine Translated by Google 400 APÉNDICE A. SOLUCIONES DE LOS EJERCICIOS DEL FINAL DEL CAPÍTULO 5.45 (a) H0: La diferencia de puntuación promedio es la misma para α = 0,05/3 = 0,0167 para el nivel de significancia. Utilice las todos los tratamientos. HA: Al menos un par de medias es diferente. siguientes hipótesis para cada prueba por pares. (b) Debemos verificar las condiciones. Si revisamos el ejemplo anterior... Los tamaños de muestra son iguales y utilizamos la DE agrupada, En el ejercicio, veremos que los pacientes fueron aleatorizados, por lo que podemos calcular un EE = 3,7 con los gl agrupados = H0: Las dos medias son iguales. HA: Las dos medias son diferentes. por lo que se cumple la independencia. Existen algunas 39. El valor p solo para el Tratamiento 1 frente al Tratamiento 3 preocupaciones menores sobre la asimetría, especialmente en el podría ser estadísticamente significativo: 0,01 < valor p < 0,02. tercer grupo, aunque esto puede ser aceptable. Las desviaciones Dado que no podemos determinarlo, debemos utilizar un ordenador estándar entre los grupos son razonablemente similares. Dado que para obtener el valor p, 0,015, que es estadísticamente significativo el valor p es menor que 0,05, se rechaza H0. Los datos proporcionan para el nivel de significancia ajustado. Es decir, hemos identificado evidencia convincente de una diferencia en la reducción promedio de la puntuación entre los tratamientos. (c) Determinamos que al que los Tratamientos 1 y 3 tienen efectos diferentes. Al verificar las otras dos comparaciones, las diferencias no son estadísticamente menos dos medias son diferentes en el inciso (b), por lo que ahora significativas. realizamos K = 3 × 2/2 = 3 pruebas t por pares, cada una de las cuales utiliza 6 Inferencia para datos categóricos 6.1 (a) Falso. No satisface la condición de éxito­fracaso. (b) Verdadero. La Universidad que encontró trabajo en el plazo de un año tras condición de éxito­fracaso no se cumple. En la mayoría de las muestras graduarse. ˆp = 348/400 = 0,87. (b) Esta es una muestra aleatoria esperaríamos que ˆp estuviera cerca de 0,08, la verdadera proporción de menos del 10 % de la población, por lo que las observaciones poblacional. Si bien ˆp puede estar muy por encima de 0,08, está limitado son independientes. Se cumple la condición de éxito­fracaso: 348 por debajo por 0, lo que sugiere que adoptaría una forma sesgada hacia la éxitos, 52 fracasos, ambos muy por encima de 10. (c) (0,8371, derecha. Trazar la distribución muestral confirmaría esta sospecha. (c) 0,9029). Tenemos un 95 % de confianza en que aproximadamente Falso. SEpˆ = 0,0243, y ˆp = 0,12 está a solo = 1,65 EE de la media, lo que entre el 84 % y el 90 % de los graduados de esta universidad no se consideraría inusual. (d) Verdadero. pˆ = 0,12 está a 2,32 errores encontraron trabajo en el plazo de un año tras completar su estándar de la media, lo que a menudo se considera inusual. (e) Falso. licenciatura. (d) El 95 % de dichas muestras aleatorias produciría 0,12−0,08 0,0243 Disminuye el EE en un factor de 1/ √ 2. 6.3 (a) Verdadero. Véase el razonamiento de 6.1(b). (b) Verdadero. Calculamos la raíz un intervalo de confianza del 95 % que incluye la verdadera proporción de estudiantes de esta universidad que encontraron cuadrada del tamaño de la muestra en la fórmula del EE. (c) Verdadero. Se trabajo en el plazo de un año tras graduarse. (e) (0,8267, 0,9133). cumplen las condiciones de independencia y de éxito­fracaso. (d) Verdadero. Interpretación similar a la anterior. (f) El IC del 99% es más amplio, Se cumplen las condiciones de independencia y de éxito­fracaso. ya que estamos más seguros de que la proporción real está dentro del intervalo y, por lo tanto, necesitamos cubrir un rango más amplio. 6.11 (a) No. La muestra solo representa a los estudiantes que presentaron el examen SAT, y esta también fue una encuesta en 6.5 (a) Falso. Se construye un intervalo de confianza para estimar la proporción poblacional, no la proporción muestral. (b) Verdadero. IC del 95 %: 70 % ± 8 %. (c) Verdadero. Según la definición de intervalo de confianza. (d) Verdadero. Cuadruplicar el tamaño de la muestra reduce el EE y el EM en un factor de 1/√4. (e) Verdadero. El IC del 95 % es completamente superior al 50 %. línea. (b) (0.5289, 0.5711). Tenemos un 90% de confianza en que entre el 53% y el 57% de los estudiantes de último año de secundaria que presentaron el examen SAT están bastante seguros de participar en un programa de estudios en el extranjero en la universidad. (c) El 90% de estas muestras aleatorias produciría un intervalo de confianza del 90% que incluye la proporción real. (d) Sí. El intervalo se encuentra completamente por encima del 50%. 6.7 Con una muestra aleatoria de <10% de la población, se cumple 6.13 (a) Esta es una configuración apropiada para una prueba de la independencia. También se cumple la condición de éxito­fracaso. ME = 1.960.56×0.44 = 0.0397 ≈ 4% hipótesis. H0 : p = 0,50. HA : p > 0,50. z norte Se cumplen tanto la independencia como la condición de éxito­ fracaso. Z = 1,12 → valor p = 0,1314. Dado que el valor p > α = pˆ(1−pˆ) 600 6.9 (a) Proporción de graduados de esta uni­ 0,05, no se rechaza H0. Los datos no proporcionan una prueba sólida . Machine Translated by Google 401 evidencia a favor de la afirmación. (b) Sí, ya que no rechazamos 6.23 Este no es un experimento aleatorio, y no está claro si las H0 en la parte (a). 6.15 (a) H0 : p = personas se verían afectadas por el comportamiento de sus 0,38. HA : p = 0,38. Se cumplen la independencia (muestra aleatoria, <10 % de la población) y la condición de éxito­ fracaso. Z = −20,5 → valor p ≈ 0. Dado que el valor p es muy pequeño, rechazamos H0. Los datos proporcionan evidencia sólida de que la proporción de estadounidenses que solo usan sus teléfonos celulares para acceder a Internet es diferente a la proporción china del 38 %, y los datos indican que la proporción es menor en EE. UU. (b) Si de hecho el 38% de los estadounidenses usara su teléfono celular como punto de acceso principal a Internet, la probabilidad de obtener una pares. Es decir, la independencia podría no ser válida. Además, solo hay cinco intervenciones en el escenario de provocación, por lo que la condición de éxito­fracaso no se cumple. Incluso si consideramos una prueba de hipótesis donde agrupamos las proporciones, la condición de éxito­fracaso no se cumplirá. Dado que una condición es Si una de las dos es cuestionable y la otra no se cumple, la diferencia en las proporciones muestrales no seguirá una distribución casi normal. 6.25 (a) Falso. muestra aleatoria de 2254 estadounidenses donde el 17% o Todo el intervalo de confianza es superior a 0. (b) Verdadero. menos o el 59% o más usara únicamente su teléfono celular (c) Verdadero. (d) Verdadero. (e) Falso. para acceder a Internet sería aproximadamente 0. (c) (0,1545, 0,1855). Son simplemente los valores negados y reordenados: (­0,06, ­0,02). 6.27 (a) (0,23, 0,33). Tenemos un 95 % de confianza en que la Tenemos un 95 % de confianza en que aproximadamente entre el 15,5 % y el 18,6 % de todos los estadounidenses usan principalmente sus teléfonos celulares para navegar por internet. 6.17 (a) H0 : p = 0,5. HA : p > 0,5. Se satisface la independencia (muestra aleatoria, <10 % de la población), al igual que las condiciones de éxito­fracaso (usando p0 = 0,5, esperamos 40 éxitos y 40 fracasos). Z = 2,91 → valor p = 0,0018. Dado que el valor p < 0,05, rechazamos la hipótesis nula. Los datos proporcionan evidencia sólida de que la tasa de identificación correcta de un refresco para estas personas es significativamente mejor que simplemente adivinando al azar. (b) Si de hecho las personas no pueden notar la diferencia entre refresco de dieta y regular y adivinan al azar, la probabilidad de obtener una muestra aleatoria de 80 personas donde 53 o más identifican un refresco correctamente sería 0,0018. 6.19 (a) Se satisface la independencia (muestra aleatoria de <10% de la población), como es la proporción de demócratas que apoyan el plan es entre un 23 % y un 33 % mayor que la de independientes que lo apoyan. (b) Verdadero. 6.29 (a) Graduados universitarios: 23,7 %. Graduados no universitarios: 33,7 %. (b) Sean pCG y pNCG la proporción de graduados universitarios y no universitarios que respondieron "no sabe". H0 : pCG = pNCG. HA : pCG = pNCG. Se satisface la independencia (muestra aleatoria, < 10% de la población), y también se satisface la condición de éxito­fracaso, que comprobaríamos utilizando la proporción agrupada (ˆp = 235/827 = 0,284). Z = −3,18 → valor p = 0,0014. Dado que el valor p es muy pequeño, rechazamos H0. Los datos proporcionan pruebas sólidas de que la proporción de graduados universitarios que no tienen una opinión sobre este tema es diferente a la de los no graduados universitarios. Los datos también indican que menos graduados universitarios dicen que "no saben" que los no graduados universitarios (es decir, los condición de éxito­fracaso (40 fumadores, 160 no fumadores). datos indican la dirección después de que rechazamos H0). El IC del 95%: (0,145, 0,255). Estamos 95% seguros de que 6.31 (a) Graduados universitarios: 35,2%. Graduados no entre el 14,5% y el 25,5% de todos los estudiantes de esta universitarios: 33,9%. (b) universidad fuman. (b) Queremos que z SE no sea mayor que 0,02 para un nivel de confianza del 95%. Usamos z = 1,96 e introducimos la estimación puntual ˆp = 0,2 en la fórmula SE: Sea pCG y pNCG la proporción de graduados universitarios y no universitarios que apoyan la perforación en alta mar. 1,96 0,2(1 − 0,2)/n ≤ 0,02. El tamaño de la muestra n debe ser al menos de 1537. 6.21 El margen de error, calculado como z EE, debe ser menor que 0,01 para un nivel de confianza del 90 %. Usamos z = 1,65 para un nivel de confianza del 90 % y podemos usar la estimación puntual ˆp = 0,52 en la fórmula para el EE. 1,65 = 0,52(1 − 0,52)/n ≤ 0,01. Por lo tanto, el tamaño de la muestra n debe ser de al menos 6796. H0 : pCG = pNCG. HA : pCG = pNCG. Se cumple la independencia (muestra aleatoria, < 10 % de la población), y también se cumple la condición de éxito­fracaso, que comprobaríamos mediante la proporción agrupada (ˆp = 286/827 = 0,346). Z = 0,39 → valor p = 0,6966. Dado que el valor p > α (0,05), no se rechaza H0. Los datos no proporcionan evidencia sólida de una diferencia entre las proporciones de graduados universitarios y no universitarios que apoyan la perforación petrolera en California. Machine Translated by Google 402 APÉNDICE A. SOLUCIONES DE LOS EJERCICIOS DEL FINAL DEL CAPÍTULO 6.33 El subíndice C significa grupo de control. El subíndice Los hábitos de estudio de los demás hacen que la independencia sea probablemente T significa conductores de camiones. (a) H0 : pC = razonable. Tamaño de la muestra: Todos los recuentos esperados pT . HA : pC = pT . Se cumple la independencia (muestras son al menos 5. Grados de libertad: gl = k −1 = aleatorias, < 10% de la población), al igual que la condición 3−1 = 2 es mayor que 1. (d) X de éxito­fracaso, que Valor p > 0,3. (e) Dado que el valor p es grande, Lo comprobaríamos utilizando la proporción agrupada No podemos rechazar H0. Los datos no proporcionan (ˆp = 70/495 = 0,141). Z = −1,58 → valor p fuerte evidencia que indica que las predicciones del profesor = 0,1164. Dado que el valor p es alto, no podemos eran estadísticamente inexactas. Rechace H0. Los datos no proporcionan evidencia sólida de 6.41 (a). Tabla de doble entrada: que las tasas de privación del sueño sean diferentes para los 2 = 2,32, gl = 2, Abandonar trabajadores no relacionados con el transporte y los camioneros. Tratamiento Conductores. Parche + grupo de apoyo 40 Sí No Total 110 120 230 Solo el parche 30 Total 70 6.35 (a) Resumen del estudio: Falla vírica Sí No Total Tratamiento Nevaripina Lopinavir Total 26 10 36 94 110 204 120 120 240 (bi) Erow1,col1 = 150×70 = 35. 300 150 150 300 (total fila 1)×(total columna 1) total de la tabla el valor observado. (total fila 2)×(total columna 2) total de la tabla = Esto es más bajo que = (b­ii) Erow2,col2 = 150×230 = 115. Esto 300 es inferior al valor observado. (b) H0 : pN = pL. No hay diferencia en las tasas de fracaso virológico entre Nevaripina y Grupos de lopinavir. HA : pN = pL. Hay Algunas diferencias en las tasas de fracaso virológico entre los grupos de Nevaripina y Lopinavir. (c) Se utilizó una asignación aleatoria, por lo que las observaciones en Cada grupo es independiente. Si los pacientes en 6.43 H0: La opinión de los graduados universitarios y los no graduados no es diferente sobre el tema de la perforación para petróleo y gas natural en las costas de California. HA: Opiniones respecto a la perforación petrolera y El gas natural en las costas de California tiene un asociación con la obtención de un título universitario. Los resultados del estudio son representativos de los de la Fila 1, columna 1 = 151,5 Fila 1, columna 2 = 134,5 población general (algo imposible de comprobar). Efila 2, columna 1 = 162,1 Efila 2, columna 2 = 143,9 con la información dada), entonces también podemos Generalizar con confianza los hallazgos a la población. La Fila 3, columna 1 = 124,5 Fila 3, columna 2 = 110,5 condición de éxito­fracaso, que Independencia: Las muestras son ambas aleatorias, Lo comprobaríamos utilizando la proporción agrupada no relacionados y de menos del 10% de la población, por lo (ˆp = 36/240 = 0,15) se cumple. Z = 3,04 → valor p = 0,0024. Dado que el valor p es bajo, rechazamos H0. Existe una razonable. Tamaño de la muestra: Todos los recuentos esperados fuerte evidencia de una diferencia. tienen al menos 5. Grados de libertad: gl = que la independencia entre observaciones es Las tasas de fracaso virológico entre los grupos de Nevarip­ (R − 1) × (C − 1) = (3 − 1) × (2 − 1) = 2, ina y Lopinavir no parecen ser diferentes. que es mayor que 1. X independiente. → 0,001 < valor p < 0,005. Dado que el valor p 6.37 (a) Falso. La distribución chi­cuadrado tiene un parámetro llamado grados de libertad. (b) Verdadero. (c) Verdadero. (d) Falso. Como los grados 2 = 11,47, gl = 2 < α, rechazamos H0. Hay evidencia sólida que existe una asociación entre el apoyo a Perforaciones en alta mar y tener un título universitario. de libertad aumenta, la forma del chi­cuadrado 6.45 (a) H0 : No existe relación entre La distribución se vuelve más simétrica. género y qué tan informados están los usuarios de Facebook 6.39 (a) H0: La distribución del formato del libro utilizado por los estudiantes sigue la Predicciones del profesor. HA: La distribución del formato del libro utilizado por los estudiantes no sigue sobre cómo ajustar su configuración de privacidad. HA : Existe una relación entre el género y cómo Los usuarios informados de Facebook están a punto de adaptarse su configuración de privacidad. (b) Los recuentos esperados: las predicciones del profesor. Fila 1, columna 1 = 296,6 Fila 1, columna 2 = 369,3 (b) Ehard = 126 × 0,60 = 75,6. Impresión electrónica = Copiar 126 × 0,25 = 31,5. Een línea = 126 × 0,15 = 18,9. Efila 2, columna 1 = 54,8 Efila 2, columna 2 = 68,2 (c) Independencia: La muestra no es aleatoria. Sin embargo, si el profesor tiene motivos para creer Fila 3, columna 1 = 7,6 Fila 3, columna 2 = 9,4 La muestra es aleatoria, todos los recuentos esperados son que las proporciones son estables a partir de un término por encima de 5, y gl = (3 − 1) × (2 − 1) = 2 > 1, por lo que al siguiente y los estudiantes no se están afectando entre sí Podemos proceder con la prueba. Machine Translated by Google 403 6.47 No es apropiado. Solo hay 9 éxitos en la muestra, por lo Generalmente utilizaríamos una computadora para realizar estas que no se cumple la condición de éxito­fracaso. simulaciones.) (e) El valor p es aproximadamente 0,001 + 0,005 6.49 (a) H0 : p = 0.69. HA : p = 0.69. (b) ˆp = = 0.57. (c) La de dos caras es aproximadamente 0,272. + 0,020 + 0,035 + 0,075 = 0,136, lo que significa que el valor p 17 condición de éxito­fracaso no se cumple; note que es apropiado 30 Su valor p puede variar ligeramente, ya que se basa en una usar el valor nulo (p0 = 0.69) para calcular el número esperado estimación visual. Dado que el valor p es mayor que 0,05, no de éxitos y fracasos. (d) Las respuestas pueden variar. Cada podemos rechazar H0. Los datos no proporcionan evidencia estudiante puede ser representado con una tarjeta. Tome 100 sólida de que la proporción de estudiantes de secundaria que tarjetas, 69 tarjetas negras que representan a aquellos que siguieron las noticias sobre Egipto sea diferente a la de adultos siguen las noticias sobre Egipto y 31 tarjetas rojas que estadounidenses que sí lo hicieron. representan a aquellos que no. Baraje las tarjetas y saque con reemplazo (barajeando cada vez entre extracciones) 30 tarjetas 6.51 El subíndice tivo y que representen a los 30 estudiantes de secundaria. Calcule la proporción de tarjetas negras en esta muestra, ˆpsim, es decir, estafa relaciones públicas corresponde a provoca­a conservador. (a) H0 : ppr = pcon. HA : ppr = pcon. (b) ­0,35. (c) La cola izquierda del valor p se la proporción de aquellos que siguen las noticias en la simulación. calcula sumando los dos intervalos izquierdos: 0,005 + 0,015 = Repita esto muchas veces (por ejemplo, 10,000 veces) y grafique 0,02. Al duplicar la cola, el valor p es 0,04. (Los estudiantes las proporciones de muestra resultantes. El valor p será dos pueden obtener resultados aproximados, y un pequeño número veces la proporción de simulaciones donde ˆpsim ≤ 0,57. (Nota: de estudiantes puede tener un valor p de aproximadamente 0,05). Dado que el valor p es bajo, rechazamos H0. Los datos proporcionan evidencia sólida de que las personas reaccionan de manera diferente en ambos escenarios. 7 Introducción a la regresión lineal 7.9 (a) La relación es positiva, débil y posiblemente lineal. Sin 7.1 (a) El gráfico de residuos mostrará residuos distribuidos aleatoriamente alrededor de 0. La varianza es embargo, parece haber algunas observaciones anómalas a la También aproximadamente constante. (b) Los residuos tendrán izquierda, donde varios estudiantes tienen la misma altura, que forma de abanico, con mayor variabilidad para valores x menores. está notablemente alejada de la nube de los otros puntos. También habrá muchos puntos a la derecha, por encima de la línea. El modelo presenta problemas de ajuste en este caso. Además, hay muchos estudiantes que parecen no haber conducido un coche, y están representados por un conjunto de puntos en la parte inferior del diagrama de dispersión. (b) No 7.3 (a) Relación fuerte, pero una línea recta no se ajustaría a los datos. (b) Relación fuerte, y un ajuste lineal sería razonable. (c) Relación débil, y sería razonable intentar un ajuste lineal. (d) Relación moderada, pero una línea recta no se ajustaría a los datos. (e) Relación fuerte, y un ajuste lineal sería razonable. (f) Relación débil, y sería razonable intentar un ajuste lineal. hay una explicación obvia de por qué ser simplemente alto debería llevar a una persona a conducir más rápido. Sin embargo, un factor de confusión es el género. Los hombres tienden a ser más altos que las mujeres en promedio, y las experiencias personales (anecdóticas) podrían sugerir que conducen más rápido. Si investigáramos esta sospecha, encontraríamos que los estudios sociológicos la confirman. (c) Los hombres son más altos en promedio y conducen más rápido. El género es, de 7.5 (a) Examen 2, ya que hay menos dispersión en el gráfico de hecho, una variable de confusión importante. la calificación del examen final en comparación con el examen 2. Observe que la relación entre el Examen 1 y el Examen Final parece ser ligeramente no lineal. (b) El Examen 2 y el examen final están relativamente próximos cronológicamente, o el Examen 2 puede ser acumulativo, por lo que presenta mayores similitudes en el material con el examen final. Las respuestas pueden variar para la parte (b). 7.11 (a) Existe una relación algo débil, positiva y posiblemente lineal entre la distancia recorrida y el tiempo de viaje. Hay una agrupación cerca de la esquina inferior izquierda que deberíamos tomar en cuenta. Nota especial: (b) Cambiar las unidades no cambiará la forma, dirección ni fuerza de la relación entre las dos variables. Si las distancias más largas medidas en millas se asocian con 7.7 (a) R = −0,7 → (4). (b) R = 0,45 → (3). (c) R = 0,06 → (1). (d) R = 0,92 → (2). un tiempo de viaje más largo medido en minutos, más largo Machine Translated by Google 404 APÉNDICE A. SOLUCIONES DE LOS EJERCICIOS DEL FINAL DEL CAPÍTULO Las distancias medidas en kilómetros se asociarán tiempo. b0: Cuando la distancia recorrida es de 0 millas, se ated con un mayor tiempo de viaje medido en horas. (c) El espera que el tiempo de viaje sea de 51 minutos. No tiene sentido tener una distancia recorrida. cambio de unidades no afecta la correlación: R = 0,636. de 0 millas en este contexto. Aquí, la intersección con el eje y 7.13 (a) Existe una relación moderada, positiva y lineal entre la circunferencia del hombro y la altura. (b) Cambiar las unidades, incluso aunque sea solo para una de las variables, no cambiará la forma, dirección o fuerza de la relación entre las dos variables. solo sirve para ajustar la altura de la línea y = 0,6362 = 0,40. no 2 tiene sentido por sí sola. (c) R Aproximadamente el 40 % de la variabilidad del tiempo de viaje se explica por el modelo, es decir, por la distancia recorrida. (d) tiempo de viaje = 51 + 0,726 × distancia = 51 + 0,726 × 103 ≈ 126 minutos. (Nota: debemos ser cautelosos en nuestras predicciones con este 7.15 En cada parte, podemos escribir las edades de los esposos como una función lineal de las edades de las esposas: (a) edadH = edadW + 3; (b) edadH = edadW − 2; y (c) edadH = 2×edadW . Por lo tanto, la correlación será exactamente 1 en las modelo, ya que aún no hemos evaluado si es un modelo bien ajustado). (e) ei = yi − yˆi = 168 − 126 = 42 minutos. Un residuo positivo significa que el modelo subestima el tiempo de viaje. (f) No, este cálculo requeriría extrapolación. tres partes. Una forma alternativa de comprender esta solución es crear un conjunto de datos simulado, como un conjunto de datos de 5 mujeres con edades de 26, 27, 28, 29 y 30 (o algún otro conjunto de edades). Luego, con base en la descripción, digamos para la parte (a), podemos calcular las edades de sus esposos como 29, 30, 31, 32 y 33. Podemos trazar estos puntos para ver que caen en una línea recta, y siempre lo harán. El mismo enfoque se puede aplicar también a las otras partes. 7.17 (a) Existe una asociación lineal positiva muy fuerte entre el número de turistas y el gasto. (b) Explicativo: número de turistas (en miles). Respuesta: gasto (en millones de dólares estadounidenses). (c) Podemos predecir el gasto para un número dado de turistas mediante una recta de regresión. 7.21 La relación entre las variables es algo lineal. Sin embargo, hay dos valores atípicos aparentes. Los residuos no muestran una distribución aleatoria. Dispersión de dom alrededor de 0. Un modelo lineal simple podría no ser apropiado para estos datos, y deberíamos investigar los dos valores atípicos. 7.23 (a) √ R2 = 0.849. Dado que la tendencia es negativa, R también lo es: R = −0.849. (b) b0 = 55.34. b1 = −0.537. (c) Para un vecindario con 0% de almuerzos con tarifa reducida, esperaríamos que el 55.34% de los ciclistas usaran casco. (d) Por cada punto porcentual adicional de almuerzos con tarifa reducida en un vecindario, esperaríamos que un 0.537% menos de niños usaran casco. (e) ˆy = 40 × (−0.537) + 55.34 = 33.86, e = 40 − yˆ = 6.14. Esta información puede ser útil para determinar cuánto podría gastar el país en publicidad en el extranjero o para pronosticar los ingresos esperados del turismo. (d) Aunque la relación Hay un 6,14 % más de ciclistas que usan casco de lo que predijo el modelo de regresión en este vecindario. 7.25 (a) El valor atípico está en la esquina superior izquierda. parece lineal en el diagrama de dispersión, el gráfico de residuos en realidad muestra una relación no lineal. Esto no es una contradicción: los gráficos de residuos pueden mostrar divergencias con respecto a la linealidad que pueden ser difíciles Dado que está horizontalmente alejado del centro de los datos, de ver en un diagrama de dispersión. Un modelo lineal simple es un punto con alto apalancamiento. Dado que la pendiente de es inadecuado para modelar estos datos. También es importante la línea de regresión sería muy diferente si se ajustara sin este considerar que estos datos se observan secuencialmente, lo punto, también es un punto influyente. (b) El valor atípico se que significa que puede haber una estructura oculta que no es encuentra en la esquina inferior izquierda. Está horizontalmente evidente en alejado del resto de los datos, por lo que es un punto de alto apalancamiento. La línea nuevamente se vería notablemente los datos actuales pero que es importante tener en cuenta. diferente si el ajuste excluyera este punto, lo que significa que el valor atípico es influyente. (c) El valor atípico está en la parte 7.19 (a) Primero, calcule la pendiente: b1 = R × sy/sx = 0,636 × 113/99 = 0,726. A continuación, utilice el hecho de que la recta de regresión pasa por el punto (¯x, y¯): ¯y = b0 + b1 × x¯. Sustituya ¯x, ¯y y b1, y despeje b0: 51. Solución: tiempo de viaje = 51 + 0,726 × distancia. (b) b1: Por cada milla adicional de distancia, el modelo predice 0,726 minutos adicionales de viaje. media superior del gráfico. Dado que está cerca del centro horizontal de los datos, no es un punto de alto apalancamiento. Esto significa que también tendrá poca o ninguna influencia en la pendiente de la línea de regresión. 7.27 (a) Existe una relación negativa, de moderada a fuerte, algo lineal entre el porcentaje de familias propietarias de su vivienda y el Machine Translated by Google 405 Correlacionado. El verdadero parámetro de pendiente es, de porcentaje de la población que vivía en áreas urbanas en 2010. Hay un caso atípico: un estado donde Aproximadamente mayor El 100% de la población es urbana. La variabilidad en el que 0. (d) Aproximadamente el 52 % de la variabilidad del peso porcentaje de propietarios de vivienda también aumenta a se puede explicar por la altura de los individuos. medida que nos desplazamos de izquierda a derecha en el gráfico. (b) El valor atípico se encuentra en la esquina inferior derecha, horizontalmente alejado del centro de los demás puntos, por lo que es un punto con un alto apalancamiento. Es un punto influyente, ya que excluirlo del análisis afectaría considerablemente la pendiente de la línea de regresión. 7.29 (a) La relación es positiva, de moderada a fuerte, y lineal. Hay algunos valores atípicos, pero ningún punto que parezca ser influyente. (b) Peso = −105,0113 + 1,0176 × altura. Pendiente: Por cada centímetro adicional de altura, el modelo predice que el peso promedio será de 1,0176 kilogramos adicionales (aproximadamente 2,2 libras). Intersección: Se espera que las personas de 0 centímetros de 2 hecho, 0,722 = 0,52. 7.31 (a) H0: β1 = 0. HA: β1 > 0. Una prueba bilateral también sería aceptable para esta aplicación. El valor p, como se informa en la tabla, es increíblemente pequeño. Por lo tanto, para una prueba unilateral, el valor p también será increíblemente pequeño y rechazamos H0. Los datos proporcionan evidencia convincente de que las estaturas de las esposas y los esposos están correlacionadas positivamente. (b) estatura = 43.5755 + 0.2863 × estaturaH. (c) Pendiente: Por cada pulgada adicional en la estatura del esposo, se O espera que la estatura promedio de la esposa sea de 0.2863 pulgadas adicionales en promedio. Intersección: Se espera que los hombres que miden 0 pulgadas de estatura tengan esposas que miden, en promedio, 43.5755 pulgadas de estatura. La intersección aquí no tiene sentido y solo sirve para ajustar la altura de la línea. (d) La pendiente es positiva, por lo que R también debe ser positiva. R = √ 0,09 = 0,30. (e) 63,2612. altura pesen ­105,0113 kilogramos. Esto obviamente no es posible. Aquí, la intersección con el eje y solo sirve para ajustar la altura de la línea y no tiene sentido por sí sola. (c) H0: El coeficiente de pendiente real de la altura es cero (β1 = 0). H0: El coeficiente de pendiente real de la altura es mayor que cero Desde R 2 es baja, la predicción basada en este modelo de regresión no es muy confiable. (f) No, debemos evitar extrapolar. (β1 > 0). Una prueba bilateral también sería aceptable para esta aplicación. El valor p para la hipótesis alternativa bilateral (β1 = 7,33 a) 25,75. (b) H0: β1 = 0. HA: β1 = 0. 0) es increíblemente pequeño, por lo que el valor p para la Una prueba unilateral también podría ser adecuada para esta hipótesis unilateral será aún menor. Es decir, rechazamos H0. aplicación. T = 2,23, gl = 23 → valor p entre 0,02 y 0,05. Por lo Los datos proporcionan evidencia convincente de que la altura tanto, rechazamos H0. Existe una asociación entre la edad y el peso son positivos. gestacional y el perímetro cefálico. También podemos afirmar que la asociación es positiva. 8 Regresión múltiple y logística 8.1 (a) peso del bebé = 123.05 − 8.94 × fumar (b) El peso aumento en el peso al nacer del bebé por cada día adicional de corporal estimado de los bebés nacidos de madres fumadoras embarazo, manteniéndose todo lo demás constante. βedad: El es 8.94 onzas menor que el de los bebés nacidos de madres modelo predice una disminución de 0,01 onzas en el peso al no fumadoras. Fumador: 123.05 − 8.94 × 1 = 114.11 onzas. No fumador: 123.05 − 8.94 × 0 = 123.05 onzas. (c) H0: β1 = 0. HA: nacer del bebé por cada año adicional de edad de la madre, β1 = 0. T = −8.65, y el valor p es aproximadamente 0. Dado estar correlacionada con una de las otras variables del modelo, que el valor p es muy pequeño, rechazamos H0. Los datos lo que complica la estimación del modelo. (d) peso del bebé = proporcionan evidencia sólida de que el parámetro de pendiente 120,58. e = 120 − 120,58 = −0,58. El manteniéndose todo lo demás constante. (c) La paridad podría real es distinto de 0 y de que existe una asociación. El modelo sobreestima el peso al nacer de este bebé. (e) R 8.5 (a) Entre el peso al nacer y el tabaquismo. Además, al rechazar la hipótesis H0, podemos concluir que el tabaquismo se asocia con un menor peso al nacer. 8.3 (a) peso del bebé = −80.41 + 0.44 × gestación − 3.33 × paridad − 0.01 × edad + 1.15 × altura + 0.05 × peso − 8.40 × tabaquismo. (b) βgestación: El modelo predice un peso de 0.44 onzas. 2 = 0,2504. R = 0,2468. adj. 2 (­0.32, 0.16). Tenemos un 95% de confianza en que, en promedio, los estudiantes varones tienen un promedio de 0.32 puntos menor a 0.16 puntos mayor que el de las mujeres al controlar las demás variables del modelo. (b) Sí, ya que el valor p es mayor que 0.05 en todos los casos (sin incluir la intersección). 8.7 (a) No existe una relación significativa. Machine Translated by Google 406 APÉNDICE A. SOLUCIONES DE LOS EJERCICIOS DEL FINAL DEL CAPÍTULO entre la edad de la madre. Deberíamos considerar eliminar esta La posible excepción de gestaciones muy cortas o largas. El variable del modelo. resto de los residuos parecen... (b) Todas las demás variables son estadísticamente significativas al nivel del 5%. distribuirse aleatoriamente alrededor de 0. 8.9 Con base solo en el valor p, ya sea gestación o primero se debe agregar humo al modelo. 2 Sin embargo, dado que el R ajustado para el modelo Todas las preocupaciones planteadas aquí son relativamente leves. Hay algunos casos atípicos, pero hay mucho. datos que indican que la influencia de tales observaciones ser menor Con la gestación más alta sería preferible 8.13 (a) Hay algunos valores atípicos potenciales, por ejemplo: para añadir la gestación en el primer paso del algoritmo de a la izquierda en la variable longitud total, pero selección hacia adelante. (Otras explicaciones son Nada que sea motivo de seria preocupación en un análisis de datos. posible. Por ejemplo, sería razonable Establezca este valor en un valor grande. (b) Cuando se estiman los coeficientes utilizar únicamente el R ajustado 2 .) son sensibles a qué variables se incluyen en El modelo, esto generalmente indica que algunos 8.11 Residuos casi normales: Los normales El gráfico de probabilidad muestra una distribución casi normal de los residuos, sin embargo, hay algunas Pequeñas irregularidades en las colas. Con un conjunto de datos Tan grandes que no serían una preocupación. Variabilidad constante de los residuos: el diagrama de dispersión de los residuos frente a los valores ajustados no No muestran ninguna estructura general. Sin embargo, los valores con valores ajustados muy bajos o muy altos también parecen tener valores atípicos algo mayores. Además, los Las variables son colineales. Por ejemplo, el género de una zarigüeya puede estar relacionado con la longitud de su cabeza. lo que explicaría por qué el coeficiente (y el valor p) para el sexo masculino cambió cuando eliminamos La longitud de la cabeza es variable. Del mismo modo, la de una zarigüeya Es probable que el ancho del cráneo esté relacionado con su cabeza. longitud, probablemente incluso mucho más estrechamente relacionada que la longitud de la cabeza era relativa al género. 8.15 (a) El modelo logístico que relaciona ˆpi con la residuos parecen... Los predictores pueden escribirse como log tienen una variabilidad constante entre las dos paridades 33,5095 − 1,4207 × sex malei − 0,2787 × pi 1−pˆi y grupos de estatus de tabaquismo, aunque estos elementos Ancho del cráneo i + 0,5687 × longitud total i. Solo son relativamente menores. La longitud total tiene una asociación positiva con una = Residuos independientes: el diagrama de dispersión de los zarigüeya procedente de Victoria. (b) ˆp = 0,0062. residuos en función del orden de recopilación de datos muestra unaSi bien la probabilidad es muy cercana a cero, tenemos Dispersión aleatoria, lo que sugiere que no hay estructuras No ejecutar diagnósticos en el modelo. Podríamos aparentes relacionadas con el orden de los datos. fueron recogidos. preciso para una zarigüeya encontrada en un zoológico de EE. UU. También soy un poco escéptico de que el modelo siga siendo Relaciones lineales entre la variable de respuesta y las variables Por ejemplo, tal vez el zoológico seleccionó una zarigüeya. explicativas numéricas: con características específicas pero solo se miraron en Los residuos frente a la altura y el peso de la madre son una región. Por otro lado, es alentador que la zarigüeya haya distribuidos aleatoriamente alrededor de 0. Los residuos sido capturada en estado salvaje. La gráfica de la duración de la gestación tampoco muestra (Respuestas sobre la fiabilidad del modelo cualquier estructura restante clara o fuerte, con (La probabilidad variará.) Machine Translated by Google Apéndice B Tablas de distribución B.1 Tabla de probabilidad normal Y El área a la izquierda de Z representa el percentil de la observación. La tabla de probabilidad normal siempre muestra percentiles. Z positivo Z negativo Para encontrar el área de la derecha, calcula 1 menos el área de la izquierda. 1.0000 0.6664 = 0.3336 Para obtener detalles adicionales sobre cómo trabajar con la distribución normal y la tabla de probabilidad normal, consulte la Sección 3.1, que comienza en la página 118. 407 Machine Translated by Google 408 APÉNDICE B. TABLAS DE DISTRIBUCIÓN Z negativo 0.09 0.08 0.07 Segundo decimal de Z 0,04 0,06 0.05 0,03 0.02 0.01 0.00 Z 0,0002 0,0003 0,0003 0,0003 0,0003 0,0003 0,0003 0,0003 0,0003 0,0003 −3,4 0,0003 0,0004 0,0004 0,0004 0,0004 0,0004 0,0004 0,0005 0,0005 0,0005 −3,3 0,0005 0,0005 0,0005 0,0006 0,0006 0,0006 0,0006 0,0006 0,0007 0,0007 −3,2 0,0007 0,0007 0,0008 0,0008 0,0008 0,0008 0,0009 0,0009 0,0009 0,0010 −3,1 0,0010 0,0010 0,0011 0,0011 0,0011 0,0012 0,0012 0,0013 0,0013 0,0013 −3,0 0,0014 0,0014 0,0015 0,0015 0,0016 0,0016 0,0017 0,0018 0,0018 0,0019 −2,9 0,0019 0,0020 0,0021 0,0021 0,0022 0,0023 0,0023 0,0024 0,0025 0,0026 −2,8 0,0026 0,0027 0,0028 0,0029 0,0030 0,0031 0,0032 0,0033 0,0034 0,0035 −2,7 0,0036 0,0037 0,0038 0,0039 0,0040 0,0041 0,0043 0,0044 0,0045 0,0047 −2,6 0,0048 0,0049 0,0051 0,0052 0,0054 0,0055 0,0057 0,0059 0,0060 0,0062 −2,5 0,0064 0,0066 0,0068 0,0069 0,0071 0,0073 0,0075 0,0078 0,0080 0,0082 −2,4 0,0084 0,0087 0,0089 0,0091 0,0094 0,0096 0,0099 0,0102 0,0104 0,0107 −2,3 0,0110 0,0113 0,0116 0,0119 0,0122 0,0125 0,0129 0,0132 0,0136 0,0139 −2,2 0,0143 0,0146 0,0150 0,0154 0,0158 0,0162 0,0166 0,0170 0,0174 0,0179 −2,1 0,0183 0,0188 0,0192 0,0197 0,0202 0,0207 0,0212 0,0217 0,0222 0,0228 −2,0 0,0233 0,0239 0,0244 0,0250 0,0256 0,0262 0,0268 0,0274 0,0281 0,0287 −1,9 0,0294 0,0301 0,0307 0,0314 0,0322 0,0329 0,0336 0,0344 0,0351 0,0359 −1,8 0,0367 0,0375 0,0384 0,0392 0,0401 0,0409 0,0418 0,0427 0,0436 0,0446 −1,7 0,0455 0,0465 0,0475 0,0485 0,0495 0,0505 0,0516 0,0526 0,0537 0,0548 −1,6 0,0559 0,0571 0,0582 0,0594 0,0606 0,0618 0,0630 0,0643 0,0655 0,0668 −1,5 0,0681 0,0694 0,0708 0,0721 0,0735 0,0749 0,0764 0,0778 0,0793 0,0808 −1,4 0,0823 0,0838 0,0853 0,0869 0,0885 0,0901 0,0918 0,0934 0,0951 0,0968 −1,3 0,0985 0,1003 0,1020 0,1038 0,1056 0,1075 0,1093 0,1112 0,1131 0,1151 −1,2 0,1170 0,1190 0,1210 0,1230 0,1251 0,1271 0,1292 0,1314 0,1335 0,1357 −1,1 0,1379 0,1401 0,1423 0,1446 0,1469 0,1492 0,1515 0,1539 0,1562 0,1587 −1,0 0,1611 0,1635 0,1660 0,1685 0,1711 0,1736 0,1762 0,1788 0,1814 0,1841 −0,9 0,1867 0,1894 0,1922 0,1949 0,1977 0,2005 0,2033 0,2061 0,2090 0,2119 −0,8 0,2148 0,2177 0,2206 0,2236 0,2266 0,2296 0,2327 0,2358 0,2389 0,2420 −0,7 0,2451 0,2483 0,2514 0,2546 0,2578 0,2611 0,2643 0,2676 0,2709 0,2743 −0,6 0,2776 0,2810 0,2843 0,2877 0,2912 0,2946 0,2981 0,3015 0,3050 0,3085 −0,5 0,3121 0,3156 0,3192 0,3228 0,3264 0,3300 0,3336 0,3372 0,3409 0,3446 −0,4 0,3483 0,3520 0,3557 0,3594 0,3632 0,3669 0,3707 0,3745 0,3783 0,3821 −0,3 0,3859 0,3897 0,3936 0,3974 0,4013 0,4052 0,4090 0,4129 0,4168 0,4207 −0,2 0,4247 0,4286 0,4325 0,4364 0,4404 0,4443 0,4483 0,4522 0,4562 0,4602 −0,1 0,4641 0,4681 0,4721 0,4761 0,4801 0,4840 0,4880 0,4920 0,4960 0,5000 −0,0 Para Z ≤ −3,50, la probabilidad es menor o igual a 0,0002. Machine Translated by Google 409 Y B.1. TABLA DE PROBABILIDAD NORMAL Z positivo Z 0.00 0.01 0.02 Segundo decimal de Z 0,04 0,03 0,06 0,05 0.07 0.08 0.09 0,0 0,5000 0,5040 0,5080 0,5120 0,5160 0,5199 0,5239 0,5279 0,5319 0,5359 0,1 0,5398 0,5438 0,5478 0,5517 0,5557 0,5596 0,5636 0,5675 0,5714 0,5753 0,2 0,5793 0,5832 0,5871 0,5910 0,5948 0,5987 0,6026 0,6064 0,6103 0,6141 0,3 0,6179 0,6217 0,6255 0,6293 0,6331 0,6368 0,6406 0,6443 0,6480 0,6517 0,4 0,6554 0,6591 0,6628 0,6664 0,6700 0,6736 0,6772 0,6808 0,6844 0,6879 0,5 0,6915 0,6950 0,6985 0,7019 0,7054 0,7088 0,7123 0,7157 0,7190 0,7224 0,6 0,7257 0,7291 0,7324 0,7357 0,7389 0,7422 0,7454 0,7486 0,7517 0,7549 0,7 0,7580 0,7611 0,7642 0,7673 0,7704 0,7734 0,7764 0,7794 0,7823 0,7852 0,8 0,7881 0,7910 0,7939 0,7967 0,7995 0,8023 0,8051 0,8078 0,8106 0,8133 0,9 0,8159 0,8186 0,8212 0,8238 0,8264 0,8289 0,8315 0,8340 0,8365 0,8389 1,0 0,8413 0,8438 0,8461 0,8485 0,8508 0,8531 0,8554 0,8577 0,8599 0,8621 1,1 0,8643 0,8665 0,8686 0,8708 0,8729 0,8749 0,8770 0,8790 0,8810 0,8830 1,2 0,8849 0,8869 0,8888 0,8907 0,8925 0,8944 0,8962 0,8980 0,8997 0,9015 1,3 0,9032 0,9049 0,9066 0,9082 0,9099 0,9115 0,9131 0,9147 0,9162 0,9177 1,4 0,9192 0,9207 0,9222 0,9236 0,9251 0,9265 0,9279 0,9292 0,9306 0,9319 1,5 0,9332 0,9345 0,9357 0,9370 0,9382 0,9394 0,9406 0,9418 0,9429 0,9441 1,6 0,9452 0,9463 0,9474 0,9484 0,9495 0,9505 0,9515 0,9525 0,9535 0,9545 1,7 0,9554 0,9564 0,9573 0,9582 0,9591 0,9599 0,9608 0,9616 0,9625 0,9633 1,8 0,9641 0,9649 0,9656 0,9664 0,9671 0,9678 0,9686 0,9693 0,9699 0,9706 1,9 0,9713 0,9719 0,9726 0,9732 0,9738 0,9744 0,9750 0,9756 0,9761 0,9767 2,0 0,9772 0,9778 0,9783 0,9788 0,9793 0,9798 0,9803 0,9808 0,9812 0,9817 2,1 0,9821 0,9826 0,9830 0,9834 0,9838 0,9842 0,9846 0,9850 0,9854 0,9857 2,2 0,9861 0,9864 0,9868 0,9871 0,9875 0,9878 0,9881 0,9884 0,9887 0,9890 2,3 0,9893 0,9896 0,9898 0,9901 0,9904 0,9906 0,9909 0,9911 0,9913 0,9916 2,4 0,9918 0,9920 0,9922 0,9925 0,9927 0,9929 0,9931 0,9932 0,9934 0,9936 2,5 0,9938 0,9940 0,9941 0,9943 0,9945 0,9946 0,9948 0,9949 0,9951 0,9952 2,6 0,9953 0,9955 0,9956 0,9957 0,9959 0,9960 0,9961 0,9962 0,9963 0,9964 2,7 0,9965 0,9966 0,9967 0,9968 0,9969 0,9970 0,9971 0,9972 0,9973 0,9974 2,8 0,9974 0,9975 0,9976 0,9977 0,9977 0,9978 0,9979 0,9979 0,9980 0,9981 2,9 0,9981 0,9982 0,9982 0,9983 0,9984 0,9984 0,9985 0,9985 0,9986 0,9986 3,0 0,9987 0,9987 0,9987 0,9988 0,9988 0,9989 0,9989 0,9989 0,9990 0,9990 3,1 0,9990 0,9991 0,9991 0,9991 0,9992 0,9992 0,9992 0,9992 0,9993 0,9993 3,2 0,9993 0,9993 0,9994 0,9994 0,9994 0,9994 0,9994 0,9995 0,9995 0,9995 3,3 0,9995 0,9995 0,9995 0,9996 0,9996 0,9996 0,9996 0,9996 0,9996 0,9997 3,4 0,9997 0,9997 0,9997 0,9997 0,9997 0,9997 0,9997 0,9997 0,9997 0,9998 Para Z ≥ 3,50, la probabilidad es mayor o igual a 0,9998. Machine Translated by Google 410 APÉNDICE B. TABLAS DE DISTRIBUCIÓN Tabla de distribución de t B.2 −3 −2 −1 0 1 2 3 −3 −2 −1 0 Una cola 123 −3 −2 −1 0 Una cola Figura B.1: Tres distribuciones t. una cola 0,100 0,050 0,025 0,010 dos colas 0,200 0,100 0,050 0,020 0.010 1 3,08 6,31 12,71 31,82 63.66 9.92 5.84 4.60 4.03 df 0.005 2 1,89 2,92 4,30 6,96 3 1,64 2,35 3,18 4,54 4 1,53 2,13 2,78 3,75 5 1,48 2,02 2,57 3,36 6 1,44 1,94 2,45 3,14 7 1,41 1,89 2,36 3,00 8 1,40 1,86 2,31 2,90 9 1,38 1,83 2,26 2,82 10 1,37 1,81 2,23 2,76 3.71 3.50 3.36 3.25 3.17 11 1,36 1,36 1,35 1,35 1,34 1,80 1,78 1,77 1,76 1,75 2,72 2,68 2,65 2,62 2,60 3.11 3.05 3.01 2.98 2,95 1,34 1,33 1.33 1.33 1.33 1,75 1,74 1,73 1,73 1,72 2.20 2.18 2.16 2.14 2.13 2.12 2.11 2.10 2.09 2.09 2,58 2,57 2.55 2.54 2.53 2.92 2.90 2.88 2.86 2.85 1,32 1,32 1,32 1,32 1,32 1,72 1,72 1,71 1,71 1,71 2,08 2,07 2,07 2,06 2,06 2,52 2,51 2,50 2,49 2,49 2.83 2.82 2.81 2.80 2.79 1,31 1,31 1,31 1,31 1,31 1,71 1,70 1,70 1,70 1,70 2,06 2,05 2,05 2,05 2,04 2,48 2,47 2,47 2,46 2,46 2.78 2.77 2.76 2.76 2.75 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 1 Dos colas 23 Machine Translated by Google 411 B.2. TABLA DE DISTRIBUCIÓN T una cola 0.100 0.050 0.025 0.010 0.005 dos colas 0.200 0.100 0.050 0.020 0.010 df 1,31 1,31 1,31 1,31 1,31 1,70 1,69 1,69 1,69 1,69 2,04 2,04 2,03 2,03 2,03 2.45 2.45 2.44 2.44 2.44 2.74 2.74 2.73 2.73 2.72 1,31 1,30 1,30 1,30 1,30 1,69 1,69 1,69 1,68 1,68 2,03 2,03 2,02 2,02 2,02 2.43 2.43 2.43 2.43 2.42 2.72 2.72 2.71 2.71 2.70 1.30 1.30 1.30 1.30 1.30 1.68 1.68 1.68 1.68 1.68 2.02 2.02 2.02 2.02 2.01 2,42 2,42 2,42 2,41 2,41 2.70 2.70 2.70 2.69 2.69 1.30 1.30 1.30 1.30 1.30 1.68 1.68 1.68 1.68 1.68 2.01 2.01 2.01 2.01 2.01 2,41 2,41 2,41 2,40 2,40 2.69 2.68 2.68 2.68 2.68 1.30 1.29 1.29 1.29 1.29 1.67 1.67 1.66 1.66 1.66 2.00 1.99 1.99 1,99 1.98 2.39 2.38 2.37 2.37 2.36 2.66 2.65 2.64 2.63 2.63 1.29 1.29 1.28 1.28 1.28 1.66 1.65 1.65 1.65 1.65 1.98 1.97 1.97 1.97 1.96 2.35 2.35 2.34 2.34 2.33 2.61 2.60 2.59 2.59 2.59 1.65 1.96 2.33 2.58 31 32 33 34 35 36 37 38 39 40 41 42 43 44 45 46 47 48 49 50 60 70 80 90 100 150 200 300 400 500 ∞ 1.28 Machine Translated by Google 412 APÉNDICE B. TABLAS DE DISTRIBUCIÓN B.3 Tabla de probabilidad de chi­cuadrado 0 5 10 15 Figura B.2: Las áreas en la tabla de chi­cuadrado siempre se refieren a la cola derecha. Cola superior 0.3 0.2 0.1 0.05 0.02 0,01 0,005 0,001 df 2 2.41 3.22 4.61 5,99 7.82 9.21 3 3.66 4.64 6.25 7.81 9.84 11.34 4 4.88 5,99 7.78 9.49 11.67 13.28 5 6.06 7.29 9.24 11.07 13.39 15.09 6 7,23 7 8.56 10.64 12.59 15.03 16.81 8,38 8 9,52 9,80 12,02 14,07 16,62 18,48 20,28 24,32 11,03 13,36 15,51 18,17 20,09 21,95 26,12 9 10,66 12,24 14,68 16,92 19,68 21,67 23,59 27,88 10 11,78 13,44 15,99 18,31 21,16 23,21 25,19 29,59 11 12,90 14,63 17,28 19,68 22,62 24,72 26,76 31,26 12 14,01 15,81 18,55 21,03 24,05 26,22 28,30 32,91 13 15,12 16,98 19,81 22,36 25,47 27,69 29,82 34,53 14 16,22 18,15 21,06 23,68 26,87 29,14 31,32 36,12 15 17,32 19,31 22,31 25,00 28,26 30,58 32,80 37,70 16 18,42 20,47 23,54 26,30 29,63 32,00 34,27 39,25 17 19,51 21,61 24,77 27,59 31,00 33,41 35,72 40,79 18 20,60 22,76 25,99 28,87 32,35 34,81 37,16 42,31 19 21,69 23,90 27,20 30,14 33,69 36,19 38,58 43,82 20 22,77 25,04 28,41 31,41 35,02 37,57 40,00 45,31 25 28,17 30,68 34,38 37,65 41,57 44,31 46,93 52,62 30 33,53 36,25 40,26 43,77 47,96 50,89 53,67 59,70 40 44,16 47,27 51,81 55,76 60,44 63,69 66,77 73,40 50 54,72 58,16 63,17 67,50 72,61 76,15 79,49 86,66 10.60 13.82 12.84 16.27 14.86 18.47 16,75 20,52 18.55 22.46 Machine Translated by Google Índice distribución t, 222–225 factor de confusión, 14 variable de confusión, 14 tabla de A do , 76 contingencia, 35 proporción de columna, 36 totales de Regla de adición, 70 ajustada 2 2 columna, 35 proporciones (R adj ), 359, 358–359 R de fila, 36 totales de fila, 35 hipótesis alternativa (HA), 172 análisis de varianza (ANOVA), 236, 236–246, 338 continuo, 6 control, evidencia anecdótica, 9 17 grupo de asociada, 8 control, 2, 19 muestra de conveniencia, 11 correlación, eliminación hacia atrás, 361 gráfico 322, 322 de barras, 35 gráfico de barras segmentado, 38 datos, 1 Teorema de Bayes, 91, 89–93 índices de aprobación, 287–288 Estadísticas bayesianas, 93 tabaquismo infantil, 217–220 sesgos, 11 cáncer en perros, herbicida, 271–273 ciegos, 19 automóviles, 20 bloqueos, 17 Índice de aprobación del Congreso, 268 bloqueos, 17 condados, 4–8, 12, 32–35, 40–42 Corrección de Bonferroni, diagrama RCP y anticoagulantes, 293–297 discriminación, de caja 245 , 42–46 delfines y mercurio, diagrama de caja 28 en paralelo, 40 225–227 consumo de drogas, 79–83 correo electrónico, 35–40, caso, 4 71, 73–74, 367–376 correo electrónico50, 3– categórico, 6 4, 20–31 FCID, 104–106 Teorema del límite central, 167, 185–188 datos atención médica, 269 normales, 170–172, 222 distribución de chi­cuadrado, 276 tabla mario kart, 181–182, 354–367 consultor de chi­cuadrado, 276 cohorte, médico, 288–290 elecciones de mitad 13 colecciones, de período, 334–336 71 colineal, 358 Bateo de la MLB, 237–242 totales de columna, possum, 317–321 35 complemento, 76 composición racial del jurado, 273–275, 279, 292 carrera condición, 82 10, 159–174 carrera probabilidad 10Samp, 159–174, 215–217 condicional, 82, 81–83, 93 intervalo de confianza, Datos bursátiles del S&P 500, 280–283 165, 165–170, 367 nivel de confianza, 168–169 Compañía de preparación para el SAT, interpretación, 170 usando el 228–230 sueño escolar, 177–180, 182– modelo normal, 189–190 183 algoritmo de búsqueda, 283– 287 viruela, 83–86 seguro, 165 factor células madre, función cardíaca, 232–235 de confusión, 14 accidente cerebrovascular, 1–3, 6 413 Machine Translated by Google 414 ÍNDICE Corte Suprema, 263­265 libros Regla general de multiplicación, 84 modelo de texto, 212­215 lineal generalizado, 148, 367 Griego comparación de dos exámenes, 231­232 pescado blanco y mercurio, 228 densidad de datos, alfa (α), 176 beta (β), 315 lambda 23 pesca de datos, (λ), 148 mu (μ), 22 238 matriz de mu (μ), 96 datos, 4 espionaje de sigma (σ), 26 datos, 238 baraja de sigma (σ), 98 cartas, 72 grados de libertad (gl) distribución t, 222 chi­ cuadrado, 276 alto apalancamiento, regresión, 359 334 histograma, densidad, 105 23 histograma hueco, 40, 104­105 dependiente, 8, 12 hipótesis, 172 desviación, 25 gl, pruebas de hipótesis, 172­185 véase grados de libertad (gl) discreto, 6 errores de decisión, 176 disjunto, 70, valor p, 177, 177­180 nivel 70­72 distribución, 21, de significancia, 176, 184­185 usando el 105 modelo normal, 190­192 Bernoulli, 133, 133–134 binomial, 137, 137–143 aproximación normal, 141–143 geométrica, 135, 134– 136 binomial negativa, 144, 144– 147 normal, 118, 118–132 Poisson, 147, 147–148 diagrama de puntos, 21 doble ciego, 19 independiente, 8, 12, 77 independiente e idénticamente distribuido (iid), 135 variable indicadora, 330, 354, 368 punto influyente, 334 mapa de intensidad, 32, 32–35 rango intercuartil, 28, 29 RIQ, 28 probabilidad conjunta, 80, 80–81 tamaño del efecto, Ley de los grandes números, criterio 211 error, de mínimos cuadrados 69 , línea de 163 evento, 71, 71–72 mínimos cuadrados 325 , E(X), 96 regresión de mínimos cuadrados 325 , 324–328 expectativa, 95–97 valor extrapolación, 329 esperado, 96 experimento, interpretación de parámetros, 328–329 13, 17 explicativo, 12 R­cuadrado 2 exponencialmente, (niveles R, 135 extrapolación, 329 6 combinación lineal, 100 ), 329, 329–330 regresión lineal, 315 regresión logística, 367, 367–376 transformación Prueba F, 240 logit, 369 cola larga, 24 variable cara de tarjeta, oculta, 14 72 factorial, 138 fallo, 133 falso negativo, 89 falso margen de error, 170, 189, 193–194, 266–267 probabilidad positivo, 89 primer marginal, 80, 80–81 media, 21 promedio, cuartil, 28 selección 21 media hacia adelante, 361 tabla de ponderada, 23 frecuencias, 35 modelo cuadrado medio entre completo, 359 grupos (MSG), 240 error cuadrático medio (MSE), 240 mediana, 28 elecciones intermedias, 334 falacia del jugador, 86 Regla general de adición, 73 Machine Translated by Google ÍNDICE 415 Milgram, Stanley, 133 media poblacional, 161 modalidad parámetros poblacionales, 161 bimodal, 24 asociación positiva, 8 multimodal, 24 potencia, 195 unimodal, 24 prácticamente significativo, 196 moda, 24 predictor, 315 selección de modelo, 359–363 primario, 86 gráfico de mosaico, probabilidad, 69, 68–93 38 comparaciones múltiples, 245 función de densidad de probabilidad, 105 regresión múltiple, 332, 356, 354–367 supuestos distribución de probabilidad, 74 del modelo, 363–367 probabilidad de éxito, 133 muestra Regla de multiplicación, 78 probabilística, ver muestra falacia del mutuamente excluyentes, 70, 70–72 fiscal, 239 estudio prospectivo, 14 n elegir k, 138 splines naturales, 373 asociación T1, 28 negativa, 8 nominal, 6 no Q3, 28 respuesta, 11 gráfico cuartil­cuantil, 128 cuartil sesgo por no primer respuesta, 11 curva normal, cuartil, 28 tercer 118 gráfico de cuartil, 28 probabilidad normal, 128, 128–132 tabla de probabilidad normal, 121 hipótesis nula proceso aleatorio, 69, 69–70 (H0), 172 valor nulo, 173 numérico, variable aleatoria, 95, 95–103 6 aleatorización, 44 experimento aleatorizado, 13, 17 tasa, 148 tabla estudio observacional, 13 de frecuencias relativas, 35 réplica, unidad observacional, 4 17 representativo, unilateral, 178 11 residuo, 242, 319, ordinal, 6 319–321 gráfico de residuos, 321 resultado, 69 respuesta, 12 estudios valor atípico, 29 retrospectivos, 14 estimaciones robustas, 30 valor p, 177 ejemplo de interpretación, 179 totales de fila, 35 media móvil, 161 emparejado, 213 datos pareados, 212­215 parámetro, 119, S, 76 315 pacientes, s, 26 19 percentil, 28, 121 muestra, 9, 9–12 prueba de permutación, 295 conglomerado, gráfico circular, 16 muestra por 40 placebo, 13, 19 conglomerados, 16 muestra efecto placebo, 19 de conveniencia, 11 estimación puntual, 161, 160­164 falta de respuesta, 11 sesgo diferencia de medias, 215–216 por falta de respuesta, 11 diferencia de proporciones, 268 media muestra aleatoria, 10–12 muestreo simple, 161 proporción aleatorio simple, 264 punto­pendiente, simple, 14 estratos, 16 327 estimación muestreo estratificado , agrupada, 272 desviación 16 media de la muestra, 161 estándar agrupada, 235 población, 9, 9– proporción de la 12 muestra, 133 espacio muestral, 76 estadística de la muestra, 30 Machine Translated by Google ÍNDICE 416 distribución de muestreo, 162 transformación, 31 grupo variación de muestreo, 161 de tratamiento, 2, 19 diagrama diagrama de dispersión, 7, 20 de árbol, 86, 86–93 ensayo, 133 SE, 163 bilateral, 178 secundarios, 86 conjuntos, Error tipo 1, 176 71 diagrama de caja en paralelo, Error tipo 2, 176 40 nivel de significancia, 176, 184–185 Comparaciones múltiples, 243–246 imparcial, 188 muestra aleatoria simple, 11 unidad de observación, 4 simulación, 44 sesgo variabilidad, 25, 28 ejemplo: extremo, 31 ejemplo: variable, 4 moderado, 160, 175, 179, 185 ejemplo: leve a varianza, 26, 98 moderado, 42 ejemplo: fuerte, 185, 213, Diagramas de Venn, 72 218 ejemplo: muy fuerte, 24, 130, 188 voluntarios, 19 sesgado a la izquierda, 23 cola larga, 24 sesgado a la derecha, 23 sesgo fuerte, 29 directriz fuertemente sesgada, 188 simétrico, 23 cola, 23 desviación estándar, 26, 98 error estándar diferencia en medias, 216 diferencia en proporciones, 268 media simple, 164 proporción simple, 264 error estándar (SE), 163 distribución normal estándar, 119 estadísticamente significativo, 196 paso a paso, 361 estratos, 16 participantes del estudio, 19 éxito, 133 condición de éxito­fracaso, 264 trajes, 72 suma de cuadrados errores (SSE), 240 suma de cuadrados entre grupos, 240 suma de cuadrados total (SST), 240 estadística de resumen, 3, 7, 30 simétrico, 23 Puntuación T (T), 229 tabla t, 223 proporciones de tabla, 81 cola, 23 estadística de prueba, 192 el resultado de interés, 82 tercer cuartil, 28 series de tiempo, 325, 364 datos de series de tiempo, 187 media ponderada, 23 bigotes, 29 con reemplazo, 94 sin reemplazo, 94 Z, 120 Puntuación Z, 120 Prueba Z, 311
0
You can add this document to your study collection(s)
Sign in Available only to authorized usersYou can add this document to your saved list
Sign in Available only to authorized users(For complaints, use another form )