Confiabilidad en una tesina de Psicología (2026): alfa de Cronbach, omega y test-retest paso a paso

Después de que tu instrumento pasa por el juicio de expertos, llega la otra pregunta que el jurado no se olvida de hacer: «¿qué confiabilidad tiene?». La respuesta casi siempre es «un alfa de Cronbach de tanto», pero muchas veces el número se pega en la tesina sin explicar qué es, cómo se calculó, con cuántas personas, si corresponde a la escala total o a cada dimensión y qué significa. Esta guía te muestra cómo hacerlo bien en una tesina de Psicología: qué mide cada coeficiente, un ejemplo de alfa resuelto a mano para que lo entiendas antes de usar el programa, cuándo conviene el omega, cómo se hace un test-retest y qué escribir en la metodología.

Confiabilidad: qué es y qué no es

La confiabilidad es el grado en que un instrumento produce resultados consistentes. Si le tomás la misma escala a la misma persona en condiciones equivalentes, esperás puntajes parecidos; si los ítems que miden el mismo constructo apuntan en la misma dirección, esperás que se correlacionen. Hay varias formas de estudiarla, y cada una responde a una pregunta distinta:

  • Consistencia interna: ¿los ítems de una escala o dimensión miden lo mismo? Se estudia con el alfa de Cronbach, con el omega de McDonald o, si los ítems son dicotómicos, con el coeficiente de Kuder-Richardson (KR-20).
  • Estabilidad temporal (test-retest): ¿el puntaje se mantiene si aplico el instrumento dos veces? Se estudia con una correlación o con un coeficiente de correlación intraclase.
  • Acuerdo entre observadores: ¿dos evaluadores califican de forma similar? Se usa en observaciones o entrevistas codificadas.

No hay que confundir confiabilidad con validez. Un instrumento puede ser muy consistente y medir otra cosa. Por eso en la tesina van los dos pasos: primero la validez de contenido, por ejemplo con juicio de expertos y V de Aiken, y luego la confiabilidad en una prueba piloto o en tu muestra.

El alfa de Cronbach, explicado con un ejemplo a mano

El coeficiente alfa fue presentado por Lee J. Cronbach en 1951, en un artículo de Psychometrika (volumen 16, número 3, pp. 297-334). Su fórmula es:

α = [k / (k − 1)] × [1 − (Σ σ²ᵢ / σ²ₜ)]

donde k es la cantidad de ítems, Σ σ²ᵢ es la suma de las varianzas de cada ítem y σ²ₜ es la varianza de los puntajes totales. Para ver cómo funciona, usamos un ejemplo ilustrativo y chico (seis personas, cuatro ítems, escala de 1 a 5). Los datos son inventados con fines didácticos; una prueba piloto real necesita bastantes más participantes.

Persona Ítem 1 Ítem 2 Ítem 3 Ítem 4 Total
1 4 5 4 4 17
2 3 3 4 3 13
3 5 5 5 4 19
4 2 3 2 3 10
5 4 4 3 4 15
6 3 2 3 2 10

Paso a paso (varianzas muestrales, con n − 1 = 5 en el denominador):

  1. Varianza del ítem 1: 1,10. Del ítem 2: 1,47. Del ítem 3: 1,10. Del ítem 4: 0,67. La suma es 4,33.
  2. Varianza de los totales (17, 13, 19, 10, 15 y 10; media 14): 13,60.
  3. Factor k / (k − 1) = 4 / 3 = 1,333.
  4. Cociente de varianzas: 4,33 / 13,60 = 0,319.
  5. α = 1,333 × (1 − 0,319) = 1,333 × 0,681 = 0,91.

Con esto entendés qué hace el alfa: compara cuánta variabilidad hay en cada ítem por separado con cuánta hay en el total. Cuando los ítems se mueven juntos, la varianza total es mucho mayor que la suma de las individuales y el alfa sube. Después, en la práctica, el programa lo calcula por vos; tu trabajo es entender qué le pasaste y qué te devolvió. Si usás SPSS, jamovi u otro, mirá la comparación de SPSS, jamovi, JASP y R para tu tesina y el paso a paso de cómo analizar datos en SPSS.

Estudiante de Psicología analizando la consistencia interna de un cuestionario en un programa estadístico
El programa calcula el alfa, pero el criterio para interpretarlo es tuyo.

Cómo interpretar el alfa sin caer en recetas

Es común leer que «alfa mayor a 0,70 es aceptable». Ese valor es una convención muy repetida, no una ley, y conviene tratarla con cuidado:

  • Depende del uso. Para describir un grupo se tolera un valor más bajo que para tomar decisiones sobre una persona.
  • Depende del número de ítems. A más ítems, el alfa tiende a subir aunque la escala no mejore; una escala de dos o tres ítems tiende a dar valores bajos.
  • Un alfa muy alto no siempre es bueno. Valores cercanos a 1 pueden señalar ítems redundantes.
  • El alfa no demuestra que la escala sea unidimensional. Para eso se necesita un análisis factorial.

Lo que sí podés hacer es citar el criterio que adoptás y de dónde lo tomás, y reportar el valor con dos decimales junto con la cantidad de ítems y de participantes. Si tu instrumento tiene dimensiones (por ejemplo, estresores, síntomas y afrontamiento), reportá un alfa por dimensión y, si corresponde, uno total. Como referencia de reporte, el estudio de adaptación del inventario SISCO SV publicado en Socialium (2020) informó alfas de 0,92, 0,95 y 0,88 para tres dimensiones; fijate cómo se presentan por dimensión, con la muestra descripta, más que el valor en sí. Podés ver el caso en la guía sobre tesina sobre estrés académico.

Cuándo usar omega en vez de alfa

El alfa asume que todos los ítems aportan por igual al constructo (equivalencia tau). Cuando esa condición no se cumple, el alfa puede subestimar o sobrestimar la confiabilidad. Una alternativa es el coeficiente omega de McDonald, que admite que cada ítem tenga una carga distinta. Dunn, Baguley y Brunsden (2014, British Journal of Psychology, 105[3], 399-412) discuten los problemas del alfa y proponen el omega como solución práctica. Muchos programas (jamovi, JASP, R) lo calculan directamente.

Para una tesina de grado, una política razonable es esta: si tu director o directora o tu cátedra esperan el alfa, reportalo; si tu programa te permite calcular omega, podés informar los dos y dejar claro cuál usás para tus conclusiones. No necesitás sofisticar el análisis, pero sí entender qué estás informando.

Test-retest: la estabilidad en el tiempo

Se aplica el mismo instrumento a las mismas personas en dos momentos, y se calcula el grado de acuerdo entre ambas aplicaciones. Para decidirlo, tené en cuenta:

  • El intervalo. Tiene que ser lo suficientemente largo como para que las personas no recuerden sus respuestas, y lo suficientemente corto como para que el constructo no haya cambiado. Un rasgo estable admite un intervalo más largo; un estado emocional, uno más corto. Justificá tu elección con una referencia.
  • El coeficiente. Se suele usar la correlación de Pearson o el coeficiente de correlación intraclase (CCI). Koo y Li (2016, Journal of Chiropractic Medicine, 15[2], 155-163) publicaron una guía para elegir y reportar el CCI, que podés consultar para decidir el tipo y para interpretar los rangos.
  • La pérdida de participantes. Siempre se pierde gente entre una medición y otra; informá cuántas personas completaron ambas.

El test-retest suma tiempo y complejidad a una tesina de grado. Si no es viable, no lo fuerces: es mejor un alfa bien calculado y bien reportado que un test-retest improvisado. Si tu escala es nueva, en cambio, es un argumento fuerte.

Un grupo de estudiantes universitarios completando un cuestionario en papel durante una prueba piloto
La prueba piloto permite estimar la confiabilidad antes de aplicar el instrumento a toda la muestra.

Prueba piloto: cuántas personas y qué hacer con los resultados

La prueba piloto se hace con personas parecidas a las de tu muestra definitiva, pero que no vayan a participar de la medición final. No hay una cantidad universal; tené en cuenta que con muy pocos participantes el alfa es inestable, y justificá la cifra que elijas con una referencia metodológica. Usá el piloto para tres cosas:

  1. Verificar que las instrucciones y los ítems se entienden.
  2. Estimar el tiempo de aplicación.
  3. Calcular la consistencia interna preliminar y detectar ítems problemáticos (los que bajan el alfa o se correlacionan poco con el total).

Si un ítem baja la confiabilidad, no lo borres sin pensar: evaluá si es un problema de redacción, de dirección (un ítem inverso mal codificado) o si realmente no pertenece a la escala. Y recordá que quitar ítems de un instrumento publicado cambia el instrumento: tenés que decirlo.

Una tabla de reporte modelo

Así se podría presentar la confiabilidad de una escala con tres dimensiones. Los valores son ficticios y están ahí para mostrar el formato: en tu tesina van los tuyos.

Dimensión Ítems Alfa de Cronbach (piloto, n = 30) Alfa de Cronbach (muestra final, n = 180)
Dimensión A 8 0,86 0,88
Dimensión B 6 0,79 0,81
Dimensión C 5 0,72 0,75
Escala total 19 0,90 0,92

Debajo de la tabla, escribí una o dos frases que interpreten los valores con el criterio que elegiste y señalen la dimensión más débil. Si una dimensión quedó por debajo del umbral, decí qué hiciste: revisaste los ítems, la redujiste o la mantuviste con una advertencia en las limitaciones.

Errores clásicos con el alfa

  • No invertir los ítems negativos antes de calcular. Es la causa más común de alfas bajos o negativos.
  • Calcular un solo alfa para una escala con varias dimensiones y suponer que alcanza.
  • Informar el alfa del manual en lugar del que obtuviste en tu muestra. Reportá el tuyo y, si querés, comparalo con el original.
  • Usarlo con ítems de distinto formato (por ejemplo, mezclando escalas de 5 y de 7 puntos) sin estandarizar.
  • Interpretar el alfa como validez. Un alfa alto no prueba que midas lo que querés medir.

Qué escribir en la metodología

Una redacción posible, con números ilustrativos para que veas la estructura (reemplazalos por tus resultados reales):

«La confiabilidad del instrumento se estimó mediante el coeficiente alfa de Cronbach (Cronbach, 1951) a partir de una prueba piloto con 30 participantes de características similares a las de la muestra. Se obtuvo un coeficiente de 0,90 para la escala total y de entre 0,72 y 0,86 para las tres dimensiones. En la muestra definitiva (n = 180) los valores fueron de 0,92 para la escala total y de entre 0,75 y 0,88 para las dimensiones. Se consideró aceptable un coeficiente igual o superior a 0,70, criterio convencional citado por el autor del instrumento».

Además, incluí la tabla de coeficientes por dimensión y, si usaste un programa, mencioná cuál y qué versión. Para elegir el instrumento antes de este paso, revisá el listado de escalas y cuestionarios validados en español y, si tenés que armar la escala de respuesta, cómo diseñar una escala de Likert.

Checklist rápido antes de entregar

  1. ¿Invertí los ítems negativos y verifiqué la codificación?
  2. ¿Calculé el alfa (u omega) por dimensión y para el total, si corresponde?
  3. ¿Informé el tamaño de la muestra de la piloto y de la muestra final?
  4. ¿Cité la fuente del criterio de interpretación?
  5. ¿Aclaré qué hice con los ítems problemáticos?
  6. ¿Reporté la validez de contenido y la confiabilidad como dos pasos distintos?

Preguntas frecuentes

¿Qué alfa de Cronbach es aceptable en una tesina?

No hay un único valor válido. Muchos textos mencionan 0,70 como referencia convencional, pero conviene citar el criterio que adoptás y considerar la cantidad de ítems y el uso del instrumento.

¿Puedo usar el alfa publicado por los autores del instrumento?

Podés mencionarlo como antecedente, pero la confiabilidad tiene que calcularse también en tu propia muestra, porque depende de la población.

¿Qué hago si me da un alfa negativo?

Casi siempre indica un error de codificación, como ítems inversos sin recodificar, o una escala sin coherencia interna. Revisá los datos antes de interpretar nada.

¿Hace falta hacer test-retest?

No siempre. Es una evidencia valiosa para escalas nuevas o cuando importa la estabilidad del constructo, pero no es obligatorio en todas las tesinas de grado. Consultalo con tu director o directora.

¿El alfa se calcula con la muestra piloto o con la definitiva?

Idealmente con las dos: el alfa de la piloto sirve para depurar el instrumento y el de la muestra definitiva es el que informás en los resultados.

Escribí tu tesina con IA

Planificá los capítulos, ordená la bibliografía y revisá cada sección. Cada palabra la escribís vos.

¡Empezá gratis! Sin tarjeta.

Categorías