CURSO: INVESTIGACIÓN CIENTIFICA I PROCESAMIENTO Y ANÁLISIS DE DATOS INTEGRANTES: 1. Mullisaca Apaza Rocio Dayhelly 2. Quispe Condori Wily Rossel 3. Parisuaña Apaza Nayely Mercedes 4. Pacori Adco André Nicolas Docente: CABALLERO APAZA LUZ MARINA "UN PROYECTO EXITOSO COMIENZA CON UNA VISIÓN CLARA Y SE CONSTRUYE PASO A PASO CON DEDICACIÓN Y ESFUERZO." Meritxell Bartomeu CONCEPTOS PROCESAMIENTO ANÁLISIS El procesamiento de datos se centra en transformar datos brutos en un formato utilizable para su almacenamiento, recuperación y posterior análisis. El análisis de datos utiliza los datos procesados para extraer información valiosa, identificar patrones, tendencias y obtener conclusiones. Implica la limpieza de datos (eliminación de errores, valores atípicos, etc.), la conversión de formatos (por ejemplo, de texto a numérico) y la organización de los datos en estructuras adecuadas (tablas, bases de datos). . Implica técnicas estadísticas, modelado, visualización y exploración de datos para identificar patrones, tendencias y relaciones. ¿CUÁL ES EL PROCESO QUE SE SIGUE PARA ANALIZAR CUANTITATIVAMENTE LOS DATOS RECOLECTADOS? El análisis cuantitativo de los datos lo efectúas sobre la matriz que los contiene y utilizando un programa computacional. Por ello, el capítulo se centra en la interpretación de los resultados de los métodos de análisis estadístico, permite transformar los datos recolectados en información útil para tomar decisiones o llegar a conclusiones. FASE 1 SELECCIONAR EL PROGRAMA DE ANÁLISIS O SOFTWARE: Actualmente tienes disponibles diferentes programas para analizar tus datos integrados en la matriz de codificación. El funcionamiento de todos es muy similar y, una parte de definiciones de las variables, que a su vez explican los datos (los elementos de la codificación ítem por ítem o indicador por indicador), y la otra parte, la matriz de datos. Recuerda: que la matriz de datos tiene columnas (variables unidimensionales, ítems o indicadores), filas o renglo nes (casos o unidades de muestreo o análisis) y celdas (intersecciones entre una columna y un renglón). Cada celda contiene un dato (que significa un valor de un caso en una variable unidimensional o ítem). SPSS Es un programa estadístico ampliamente utilizado en las ciencias sociales, salud, educación, administración, y otras áreas para la recolección, organización, análisis e interpretación de datos cuantitativos. Funciones principales: 1. Análisis descriptivo: (medias, moda, desviaciones, frecuencias). 2. Pruebas estadísticas: t de Student, ANOVA, regresión lineal y logística. Pruebas no paramétricas (Chi-cuadrado, Mann-Whitney U, etc.). 3. Estadística multivariada: Análisis factorial, de conglomerados (clusters), discriminante, etc. 4. Análisis de confiabilidad: Alfa de Cronbach. 5. Tratamiento de datos: Limpieza, transformación, recodificación y validación de datos. 6. Realiza Tablas, gráficos y reportes automáticos. VENTAJAS Fácil de usar. Ampliamente aceptado. Potente para análisis multivariado. Compatible. Visualización DESVENTAJAS Licencia costosa. Menor flexibilidad MINITAB Es un software de análisis estadístico creado especialmente para facilitar la toma de decisiones basada en datos. Se utiliza ampliamente en ingeniería, manufactura, calidad, investigación aplicada y también en ciencias sociales y salud. Funciones principales: 1. Estadística descriptiva: Media, moda, mediana, desviación estándar, histogramas, etc. 2. Estadística inferencial: Pruebas t, ANOVA, regresión lineal y logística, Chi-cuadrado. 3. Análisis de regresión: Modelos múltiples, no lineales, paso a paso (stepwise), etc. 4. Estudios de confiabilidad y capacidad: Curvas de supervivencia, análisis de vida útil, análisis de capacidad de procesos. 5. Control estadístico de procesos (SPC): Gráficos de control, análisis de variabilidad, diagramas de Pareto, etc. VENTAJAS 6. Diseños de experimentos (DOE): Diseño factorial completo y fraccional, respuestas optimizadas. 7. Análisis multivariado: Interfaz intuitiva. Análisis de componentes principales (PCA), clúster, Visualización poderosa correlación múltiple. Ideal para ingeniería. DESVENTAJAS Es de pago. Menos extendido en ciencias sociales que SPSS o R. Menor disponibilidad de tutoriales gratuitos en español EXCEL Es una hoja de cálculo ampliamente utilizada para organizar, calcular, analizar y visualizar datos. Aunque no es un software estadístico especializado como SPSS, R o Minitab, sí permite realizar análisis estadísticos básicos e intermedios gracias a sus funciones integradas y complementos. Funciones estadísticas que Excel puede realizar: 1. Estadística descriptiva: Promedio, mediana, moda. Desviación estándar, varianza, rango. Contar datos, frecuencias, porcentajes. 2. Gráficos y visualización: Histogramas, gráficos de barras, líneas, pastel, dispersión (scatter plot), boxplot (con trucos). Tablas dinámicas para resumir y agrupar. 3. Análisis inferencial (con complemento "Herramientas para análisis"): Pruebas t de Student, ANOVA, regresión lineal, correlación. Generación de tablas de análisis y p-valores. Histograma, pruebas de varianza, etc. 4. Simulación y modelamiento básico: Tablas de datos, fórmulas condicionales, análisis de sensibilidad. VENTAJAS Accesible. Fácil de usar. Compatible Visual Funciones sin internet DESVENTAJAS No es específico para estadística avanzada. Puede ser menos preciso en análisis complejos. No automatiza tanto. R - ESTUDIO Funciones Principales: 1. Estadística descriptiva: Media, moda, varianza, desviación estándar, gráficos, etc. 2. Estadística inferencial: t de Student, ANOVA, correlaciones, regresiones, Chi-cuadrado. 3. Modelado avanzado: Modelos lineales, logísticos, de series temporales, survival analysis. 4. Análisis multivariado: Componentes principales (PCA), clúster, análisis factorial, etc. 5. Visualización avanzada de datos: Con paquetes como ggplot2, plotly, lattice, shiny para dashboards interactivos. 6. Limpieza, transformación y manipulación de datos:Paquetes como dplyr, tidyr, readr. 7. Automatización de reportes y gráficos: Puedes crear informes en Word, PDF o HTML con R Markdown. Es una interfaz gráfica que facilita el uso del programa R, actuando como una “máscara” que organiza y visualiza los procesos estadísticos de forma clara y simultánea. Sus principales ventajas son el orden en la presentación del código, resultados y gráficos, y una mejor visualización del análisis, lo que permite una interacción más fluida con el software. VENTAJAS DESVENTAJAS Gratuito y de código abierto. Altamente personalizable. Reproducible y transparente. Excelente visualización. Comunidad muy activa. Curva de aprendizaje inicial. No tiene interfaz de "ventanas y botones" como SPSS. Todo se hace escribiendo comandos. FASE 2 EJECUTAR EL PROGRAMA: La mayoría de los programas son fáciles de usar, pues lo único que tienes que hacer es solicitar los análisis requeridos seleccionando las opciones apropiadas. FASE 3 REVISIÓN DE LA MATRIZ: Verificar la calidad de los datos codificados. Corregir errores de digitación, omisiones o incongruencias. FASE 4 EVALUAR LA CONFIABILIDAD (FIABILIDAD) Y VALIDEZ LOGRADA POR EL INSTRUMENTO DE MEDICIÓN: Confiabilidad: medida del grado en que un instrumento es consistente. Se puede medir con alfa de Cronbach, testretest, mitades partidas, etc. Validez: grado en que el instrumento mide lo que pretende medir. Tipos: de contenido, de criterio y de constructo. FASE 5 EXPLORAR LOS DATOS: Análisis descriptivo por variable: Medidas de tendencia central: media, mediana, moda. Medidas de dispersión: rango, varianza, desviación estándar. Distribuciones de frecuencia. Visualización mediante gráficas. FASE 6 ANALIZAR MEDIANTE PRUEBAS ESTADÍSTICAS LAS HIPÓTESIS PLANTEADAS (ANÁLISIS ESTADÍSTICO INFERENCIAL: ESTUDIOS CORRELACIONALES Y EXPLICATIVOS) Se prueba la hipótesis estadística para generalizar los resultados. Pruebas estadísticas paramétricas (normalidad de datos, escala de razón o intervalo): t de Student, ANOVA, regresión lineal, Pearson. Pruebas no paramétricas (datos ordinales o nominales): Chi-cuadrado, Mann-Whitney U, Spearman, Kendall, etc. FASE 7 REALIZAR ANÁLISIS ADICIONALES: Una vez realizados tus análisis, es posible que decidas ejecutar otros análisis o pruebas extras para confirmar tendencias y evaluar los datos desde diferentes ángulos. Por ejemplo, en una tabla de contingencia puedes calcular primero Chi-cuadrada y luego Phi, Lambda, T de Cramer (C) y el coeficiente de contingencia. O después de un ANOVA, efectuar los contrastes posteriores que consideres apropiados. Resulta este paso un momento clave para verificar que no se te haya olvidado un análisis pertinente. FASE 8 PREPARAR LOS RESULTADOS PARA PRESENTARLOS Tablas, cuadros, gráficas, resúmenes y esquemas claros y pertinentes. Interpretación de los resultados en el contexto del problema investigado. ANÁLISIS DESCRIPTIVA DISTRIBUCION DE FRECUENCIAS Una distribución de frecuencias es un conjunto de puntuaciones respecto de una variable ordenadas en sus respectivas categorías y generalmente se presenta como una tabla MEDIDAS DE TENDENCIA CENTRAL Las medidas de tendencia central son puntos en una distribución obtenida, los valores medios o centrales de ésta, y nos ayudan a ubicarla dentro de la escala de medición de la variable analizada y son 3: Moda: es la categoría o puntuación que ocurre con mayor frecuencia, puede ser multimodal. Mediana: es el valor que divide la distribución por la mitad, si existe 2 medianas se halla el promedio de estas. Media: es el promedio aritmético de una de una distribución. MEDIDAS DE VARIABILIDAD Las medidas de la variabilidad indican la dispersión de los datos en la escala de medición de la variable considerada. Son intervalos que designan distancias o un número de unidades en la escala de medición, son 3 las más utilizadas: Rango: es la diferencia entre la puntuación mayor y la puntuación menor, e indica el número de unidades en la escala de medición que se necesitan para incluir los valores máximo y mínimo La desviación estándar: es el promedio de desviación de las puntuaciones con respecto a la media. Se interpreta como cuánto se desvía, en promedio, de la media un conjunto de puntuaciones. Varianza: es la desviación estándar elevada al cuadrado y se simboliza como s 2 INTERPRETACIÓN Si obtuviéramos los siguientes resultados: Variable: actitud hacia el presidente Moda: 4.0 Mediana: 3.9 Media (X): 4.2 Desviación estándar: 0.7 Puntuación más alta observada (máximo): 5.0 Puntuación más baja observada (mínimo): 2.0 Rango: 3 La actitud hacia el presidente es favorable. La categoría que más se repitió fue 4 (favorable). Cincuenta por ciento de los individuos está por encima del valor 3.9 y el restante 50% se sitúa por debajo de este valor (mediana). En promedio, los participantes se ubican en 4.2 (favorable). Asimismo, se desvían de 4.2, en promedio, 0.7 unidades de la escala. Ninguna persona calificó al presidente de manera muy desfavorable (no hay “1”). Las puntuaciones tienden a ubicarse en valores medios o elevados. ANÁLISIS INFERENCIAL Pretende probar hipótesis y generalizar los resultados obtenidos en la muestra a la población. Análisis paramétrico El análisis paramétrico busca estimar parámetros de una población (como la media o la desviación estándar) utilizando datos de una muestra y haciendo suposiciones sobre la distribución de esos datos. El análisis paramétrico es exclusivo de estudios cuantitativos, ya que requiere trabajar con datos numéricos y distribuidos normalmente. No se utiliza en investigaciones cualitativas. Coeficientes de relación Regresión lineal Prueba T Prueba de la diferencia de proporciones Análisis de varianza Análisis de covarianza Coeficiente de relación de Pearson El coeficiente de correlación de Pearson, a menudo abreviado como "r", es un estadístico descriptivo que mide la fuerza y dirección de la relación lineal entre dos variables cuantitativas. Indica si las variables tienden a moverse juntas (correlación positiva), en sentidos opuestos (correlación negativa) o si no hay relación lineal entre ellas. El valor de "r" oscila entre -1 y +1. Fuerza de la correlación: Cuanto más cercano a -1 o +1 sea "r", mayor es la fuerza de la correlación lineal. Un valor de +1 indica una correlación positiva perfecta, -1 una correlación negativa perfecta, y 0 indica que no hay correlación lineal. Dirección de la correlación: Un valor positivo de "r" indica que las variables tienden a aumentar juntas (correlación positiva), mientras que un valor negativo indica que una variable tiende a aumentar a medida que la otra disminuye (correlación negativa). Variables cuantitativas: El coeficiente de correlación de Pearson solo es apropiado para variables que pueden ser medidas en una escala de intervalo o razón (es decir, que tienen valores numéricos). Interpretación: El coeficiente de correlación de Pearson solo detecta relaciones lineales. No puede detectar relaciones no lineales ni relaciones causales. El cuadrado del coeficiente de correlación (r²) se conoce como el coeficiente de determinación y indica la proporción de la varianza de una variable que puede ser explicada por la otra variable. Regresión lineal Se emplea para describir una variable de respuesta continua como una función de una o varias variables predictoras. Puede ayudar a comprender y predecir el comportamiento de sistemas complejos o a analizar datos experimentales, financieros y biológicos. Las técnicas de regresión lineal permiten crear un modelo lineal. Este modelo describe la relación entre una variable dependiente “y” (también conocida como la respuesta) como una función de una o varias variables independientes “Xi” (denominadas predictores). La ecuación general correspondiente a un modelo de regresión lineal es: Y=β0+∑ βkXk+ϵi donde “β” representa las estimaciones de parámetros lineales que se deben calcular y ϵ representa los términos de error. Tipos de regresión lineal Regresión lineal simple: modelos que utilizan un único predictor. La ecuación general es: Y=β0+β1X+ϵ Ejemplo de regresión lineal simple que muestra cómo predecir el número de accidentes de tráfico mortales en un estado (variable de respuesta, Y) ) en comparación con la población del estado (variable predictora, X). Regresión lineal múltiple: modelos que utilizan múltiples predictores. Esta regresión tiene múltiples Xi para predecir la respuesta, Y. Este es un ejemplo de la ecuación: Y=β0+β1X1+β2X2+ϵ Ejemplo de regresión lineal múltiple, que predice las millas por galón (MPG) de diferentes coches (variable de respuesta, Y) en función del peso y la potencia (variables predictivas, Xj)). Regresión lineal multivariante: modelos para varias variables de respuesta. Esta regresión tiene múltiples Yi que derivan de los mismos datos X. Se expresan con fórmulas diferentes. Este es un ejemplo del sistema con 2 ecuaciones: Y1=β01+β11X1+ϵ1 Y2=β02+β12X1+ϵ2 Ejemplo de regresión lineal multivariante que muestra cómo predecir las estimaciones de gripe en 9 regiones de EE. UU. (variables de respuesta, Yi), basadas en la semana del año (variable predictora, X). Regresión lineal múltiple multivariante: modelos que utilizan varios predictores para múltiples variables de respuesta. Esta regresión tiene múltiples Xi para predecir varias respuestas Yi. Esta es una generalización de las ecuaciones: Ejemplo de regresión lineal múltiple multivariante que calcula las MPG en ciudad y autopista (como variables de respuesta, Y1 and Y2) a partir de tres variables: distancia entre ejes, peso en vacío y tipo de combustible (variables predictoras, X1, X2 and X3). Prueba T La prueba t de Student, es un test estadístico utilizado para determinar si hay una diferencia significativa entre las medias de dos grupos o entre una media muestral y un valor específico. Es especialmente útil cuando el tamaño de la muestra es pequeño o cuando la distribución de la población no es normal. La prueba se usa para: Comparar dos grupos: Determinar si las medias de dos grupos son significativamente diferentes. Comparar una muestra con un valor: Determinar si la media de una muestra es significativamente diferente de un valor conocido. Comparar medidas pareadas: Determinar si hay una diferencia significativa en medidas antes y después de un tratamiento o intervención. Tipos de pruebas t de Student: Prueba t de una muestra: Compara la media de una muestra con un valor específico. Prueba t de dos muestras: Compara las medias de dos grupos independientes. Prueba t pareada: Compara dos grupos de datos relacionados, como medidas antes y después de un tratamiento. Asunciones de la prueba t de Student: Los datos son continuos. La muestra se ha tomado aleatoriamente de la población. Hay homogeneidad en la varianza (si es una prueba t de dos muestras). La distribución es aproximadamente normal (o el tamaño de la muestra es lo suficientemente grande como para que el teorema del límite central se aplique). Interpretación del valor t El valor t se calcula dividiendo la diferencia medida por la dispersión en los datos de la muestra. Cuanto mayor sea la magnitud de t, más se argumenta en contra de la hipótesis nula. Si el valor t calculado es mayor que el valor t crítico, se rechaza la hipótesis nula. Prueba de la diferencia de proporciones (Z) La prueba de la diferencia de proporciones, también conocida como prueba z para dos proporciones o prueba de hipótesis para la diferencia entre dos proporciones, es una prueba estadística utilizada para determinar si existe una diferencia significativa entre las proporciones de dos grupos independientes. Comparación de proporciones: La prueba evalúa si las proporciones de éxito o fracaso de un evento son diferentes entre dos grupos. Hipótesis: La hipótesis nula (H0) generalmente establece que no hay diferencia entre las proporciones, mientras que la hipótesis alternativa (H1) sugiere que sí hay una diferencia. Prueba z: Se utiliza un estadístico de prueba z para calcular la probabilidad de observar una diferencia en las proporciones tan grande o mayor que la observada, bajo la hipótesis de que no hay diferencia en la población. Valor p: La probabilidad (valor p) determina la significancia de los resultados, indicando la probabilidad de obtener los resultados observados si la hipótesis nula fuera verdadera. Pasos generales de la prueba: Formular hipótesis: Establecer la hipótesis nula y la hipótesis alternativa. Recopilar datos: Obtener las proporciones de éxito de los dos grupos. Calcular el estadístico z: Usar la fórmula del estadístico z para dos proporciones. Calcular el valor p: Usar una tabla z o un software estadístico para encontrar el valor p. Decidir: Si el valor p es menor que el nivel de significancia (generalmente 0.05), se rechaza la hipótesis nula, lo que implica que hay una diferencia significativa entre las proporciones. Consideraciones adicionales: Tamaño de la muestra: Se requiere un tamaño de muestra suficiente en cada grupo para que los resultados sean significativos. Independencia: Las muestras deben ser independientes entre sí. Distribución normal: Se asume que la distribución muestral de la diferencia de proporciones sigue una distribución normal. Software estadístico: Se puede utilizar software estadístico (como SPSS, R software) o calculadoras para realizar la prueba. Ejemplo: Imagina que se quiere comparar la proporción de pacientes que se recuperan de una enfermedad en dos hospitales. Se podría realizar una prueba de la diferencia de proporciones para determinar si hay una diferencia significativa en la proporción de recuperación entre los dos hospitales. Hipótesis nula Hipótesis alternativa Análisis de varianza El análisis de varianza (ANOVA) es una prueba estadística que se utiliza para comparar las medias de dos o más grupos. Es una herramienta útil para determinar si las diferencias observadas entre las medias de los grupos son significativas o si simplemente se deben al azar. ¿Cómo funciona el ANOVA? El ANOVA analiza la variabilidad dentro de cada grupo y la variabilidad entre los grupos. Si la variabilidad entre los grupos es significativamente mayor que la variabilidad dentro de los grupos, entonces el ANOVA puede indicar que las medias de los grupos son diferentes. Tipos de ANOVA: ANOVA de un factor: Se utiliza cuando se quiere comparar las medias de dos o más grupos, utilizando una única variable independiente. ANOVA de dos factores: Se utiliza cuando se quiere evaluar el efecto de dos o más variables independientes sobre la variable dependiente. ANOVA de medidas repetidas: Se utiliza cuando se hacen mediciones repetidas en el mismo grupo de individuos a lo largo del tiempo o bajo diferentes condiciones. ¿Cuándo se usa el ANOVA? El ANOVA se usa en una amplia variedad de contextos, incluyendo: Investigación científica: Para evaluar el efecto de tratamientos o intervenciones sobre una variable de interés. Investigación social: Para analizar las diferencias entre grupos de personas. Negocios: Para evaluar la eficacia de diferentes estrategias de marketing. Medicina: Para evaluar la efectividad de diferentes tratamientos. Ejemplo: Supongamos que un investigador quiere determinar si hay una diferencia en la presión arterial entre tres grupos de pacientes, cada uno de los cuales recibe un tratamiento diferente. Podrían utilizar un ANOVA de un factor para comparar las medias de la presión arterial de los tres grupos. Análisis de covarianza El Análisis de Covarianza (ANCOVA) es una técnica estadística que combina elementos del Análisis de Varianza (ANOVA) y el análisis de regresión. Se utiliza para comparar medias de grupos, pero también considera el efecto de una o más variables continuas, llamadas covariables, que pueden influir en la variable dependiente. Controlar el efecto de variables confusoras: Permite aislar el efecto de la variable independiente (tratamiento) sobre la variable dependiente, eliminando la influencia de otras variables que podrían distorsionar los resultados. Aumentar la precisión de los resultados: Al tener en cuenta las covariables, el ANCOVA reduce la varianza dentro de los grupos, lo que puede llevar a conclusiones más precisas sobre las diferencias entre grupos. Comparar grupos ajustando por covariables: Permite comparar las medias de los grupos después de controlar el efecto de las covariables, lo que es útil cuando estas covariables no pueden ser controladas experimentalmente. Ejemplo: Imagina un estudio sobre el efecto de diferentes tipos de fertilizantes (variable independiente categórica) en el rendimiento de un cultivo (variable dependiente). El ANCOVA podría utilizarse para comparar los rendimientos de los diferentes grupos de fertilizantes, pero también para controlar el efecto de la calidad inicial del suelo (covariable) que puede variar entre las parcelas. A. NO PARÁMETRICO Se debe partir de las siguientes consideraciones: No requiere de presupuestos acerca de la forma de la distribución poblacional. Aceptan distribuciones no normales (distribuciones “libres”). Las variables pueden estar medidas por intervalos o razón usando categorías discretas; pueden analizar datos nominales u ordinales. Las variables deben ser categóricas. Las pruebas no paramétricas más utilizadas son: 1. La chi cuadrada 2. Los coeficientes de correlación e independencia para tabulaciones cruzadas. 3. Los coeficientes de correlación por rangos ordenados de Spearman y Kendall CHI CUADRADA Es una prueba estadística para evaluar hipótesis acerca de la relación entre dos variables categóricas. . Hipótesis por probar: correlacionales. Variables involucradas: dos. La prueba Chi cuadrada no considera relaciones causales. Nivel de medición de las variables: nominal u ordinal (o intervalos o razón reducidos a ordinales). Procedimiento: se calcula por medio de una tabla de contingencia, que es un cuadro de dos dimensiones y cada dimensión contiene una variable. A su vez, cada variable se subdi vide en dos o más categorías. A continuación se muestra un ejemplo de una tabla de contingencia 3x2: INTERPRETACIÓN EVALUACIÓN: La prueba parte del supuesto de “no relación entre variables” (hipótesis nula) y el investigador evalúasi en su caso esto es cierto o no, analiza si las frecuencias observadas son diferentes de lo que pudiera esperarse en caso de ausencia de correlación. COEFICIENTES DE CORRELACIÓN Son coeficientes para evaluar si las variables incluidas en la tabla de contingencia están correlacionadas. COEFICIENTES POR RANGOS ORDENADOS Tenemos los coeficientes rho de Spearman (rs), y tau de Kendall (t), los cuales son medidas de correlación para variables en un nivel de medición ordinal (ambas), de tal modo que los individuos, casos o unidades de análisis puedan ordenarse por rangos (jerarquías). Son usadas para analizar datos extraídos de escalas tipo Likert. Se observa una escala ordinal (se ordena de mayor a menor). GRACIAS
0
You can add this document to your study collection(s)
Sign in Available only to authorized usersYou can add this document to your saved list
Sign in Available only to authorized users(For complaints, use another form )