Respuesta rápida: el p-valor es la probabilidad de obtener un resultado al menos tan extremo como el que obtuviste suponiendo que la hipótesis nula fuera verdadera. No es la probabilidad de que tu hipótesis sea correcta, ni mide cuán grande es el efecto. Por eso «p < 0,05» sola no alcanza: el jurado va a pedirte además el tamaño del efecto.
Corriste el análisis, mirás la salida y ahí está el número que decide todo: 0,032. Suspirás. Dio. Y en el capítulo escribís «la diferencia fue estadísticamente significativa (p < 0,05)» y seguís de largo.
El problema aparece en la defensa, cuando alguien del jurado pregunta qué significa exactamente ese 0,032. Y la explicación que circula en casi todos los apuntes de cátedra —«la probabilidad de que el resultado sea por azar»— es directamente incorrecta.
Esta guía es para el momento exacto en el que tenés el número en pantalla y necesitás escribir la oración correcta debajo: qué significa el p-valor, qué no significa, cómo leerlo en cada programa y por qué el tamaño del efecto es la mitad del reporte que casi todas las tesinas se olvidan.

Qué es exactamente el p-valor
Empecemos por la definición formal, que después desarmamos en castellano:
El p-valor es la probabilidad de observar un resultado al menos tan extremo como el que obtuviste, bajo el supuesto de que la hipótesis nula es verdadera.
Hay dos partes y las dos importan.
«Al menos tan extremo». No es la probabilidad de tu resultado puntual: es la probabilidad de tu resultado y de todos los que estarían todavía más lejos de lo que la hipótesis nula predice. Por eso el p-valor se calcula sobre la cola de una distribución y no sobre un punto.
«Bajo el supuesto de que la hipótesis nula es verdadera». Esta es la parte que casi nadie dice en voz alta, y es la que cambia todo. El cálculo arranca asumiendo que no hay diferencia, que no hay relación, que el efecto es cero. Después pregunta: si ese mundo sin efecto fuera el real, ¿qué tan raro sería lo que acabo de ver?
Un p de 0,032 dice, entonces: «si en la población no hubiera ninguna diferencia, datos como los míos aparecerían en 32 de cada 1.000 muestras». Es una afirmación sobre los datos dado un supuesto, no una afirmación sobre el supuesto dado los datos. Se parecen mucho escritas y son cosas distintas.
Si esta parte te resulta abstracta, conviene repasar antes qué es la hipótesis nula y en qué se diferencia de la alternativa: sin esa distinción clara, el p-valor no tiene dónde apoyarse.

Las cuatro cosas que el p-valor NO es
Casi todas las devoluciones del director sobre este punto se explican por una de estas cuatro confusiones. Leelas ahora y ahorrate la corrección.
1. No es la probabilidad de que la hipótesis nula sea falsa
Un p de 0,03 no significa «hay 97 % de probabilidad de que exista un efecto real». El cálculo asume que la nula es verdadera; no puede después informarte cuán probable es. Para eso hacen falta métodos bayesianos, que son otra cosa y otra tesina.
2. No es la probabilidad de que tu hipótesis de investigación sea correcta
Rechazar la nula no confirma tu explicación: solamente indica que los datos son poco compatibles con la ausencia de efecto. Puede haber otras explicaciones —una variable de confusión, un problema de muestreo, un instrumento mal calibrado— que producen exactamente el mismo p.
3. No dice nada sobre el tamaño ni la importancia del efecto
Un p diminuto puede corresponder a una diferencia clínicamente irrelevante, y un p de 0,08 puede acompañar a una diferencia enorme medida con poca gente. El p-valor mezcla dos cosas —cuán grande es el efecto y cuántos casos tenés— y no permite separarlas. De eso se encarga el tamaño del efecto, más abajo.
4. No garantiza que el resultado se replique
Un p significativo en una muestra no promete que el estudio siguiente vaya a dar lo mismo. La replicación depende del tamaño real del efecto y de la potencia del diseño, no del umbral que cruzaste.
Estas advertencias no son una opinión de este blog: la American Statistical Association publicó en 2016 una declaración institucional sobre los p-valores, justamente porque el uso mecánico del 0,05 se había vuelto un problema transversal a todas las disciplinas. Si tu jurado es de metodología, es muy probable que la conozca.
De dónde salió el 0,05 (y por qué no es una ley)
El 0,05 no está en ninguna norma. Es una convención heredada de Ronald Fisher, que en los años treinta lo propuso como un punto de corte cómodo para trabajo agronómico y aclaró explícitamente que era arbitrario y que el investigador podía elegir otro según el contexto.
Lo que la convención esconde es una decisión: al fijar α = 0,05 estás aceptando equivocarte —rechazar una nula verdadera— en 5 de cada 100 estudios. En una tesina de grado eso es razonable. En un ensayo clínico o en un estudio con implicancias regulatorias, no: ahí se usan umbrales más exigentes.
Consecuencias prácticas para tu escritura:
- El umbral se declara antes, no después. Decís «se adoptó un nivel de significación de 0,05» en el capítulo metodológico y no lo movés cuando ves los resultados.
- No existe «casi significativo». Un p de 0,051 con α = 0,05 no rechaza la nula. Escribir «marginalmente significativo» es una forma elegante de mover el arco después del disparo.
- Reportá el p exacto igual. Aunque uses un umbral, informá el valor concreto (p = 0,032) y no solamente «p < 0,05»: el lector necesita el número para juzgar por su cuenta.
Dónde está el p en SPSS, jamovi, R y Excel
Cada programa lo etiqueta distinto y esa es la primera fuente de confusión al leer una salida ajena. La tabla, para tenerla al lado mientras trabajás:
| Programa | Cómo aparece | Dónde mirar |
|---|---|---|
| SPSS | Sig. o Sig. (bilateral) |
Columna a la derecha del estadístico (t, F, χ²) |
| jamovi / JASP | p |
Columna final de la tabla de resultados |
| R | Pr(>|t|), p-value |
En el summary() del modelo |
| Excel (ToolPak) | Valor p o P(T<=t) dos colas |
Hoja de salida del análisis |
| Stata | P>|t| |
Cuarta columna de la tabla de coeficientes |
Si todavía no llegaste a esta pantalla, el tutorial paso a paso de análisis de datos en SPSS cubre cómo cargar las variables y correr cada prueba hasta obtener esta salida.
Bilateral o unilateral: la casilla que casi nadie toca
SPSS informa por defecto la significación bilateral, que contempla desviaciones en las dos direcciones. Una prueba unilateral solo tiene sentido si tu hipótesis predice la dirección del efecto y la declaraste antes de ver los datos. Pasar de bilateral a unilateral después de mirar la salida, para que el p entre bajo el umbral, es exactamente el tipo de maniobra que el jurado detecta.
El error de reportar «p = 0,000»
SPSS muestra ,000 cuando el p es menor que 0,0005 y no le alcanzan los tres decimales de la celda. Ese cero no es un cero. Una probabilidad de exactamente cero significaría que el resultado es imposible, y ningún cálculo de este tipo devuelve eso.
La forma correcta de escribirlo es p < 0,001. Es el error de reporte más frecuente en las tesinas cuantitativas argentinas y se corrige en dos segundos con buscar y reemplazar.
Un detalle de formato que también cuesta devoluciones: en castellano el separador decimal es la coma, mientras que los programas suelen configurarse en inglés y devuelven punto. Revisá que toda la sección de resultados use el mismo criterio. Las reglas completas de escritura están en las normas APA 7 aplicadas a trabajos en español.
El tamaño del efecto: la mitad que falta
Si hay un solo cambio que te conviene hacer en el capítulo de resultados, es este: al lado de cada p, poné un tamaño del efecto.
El p-valor responde «¿es distinguible del azar?». El tamaño del efecto responde «¿cuán grande es?». Son preguntas independientes y la segunda es la que le interesa a quien lee tu trabajo para decidir si sirve de algo.
| Prueba | Medida usual | Referencias convencionales |
|---|---|---|
| Prueba t (dos grupos) | d de Cohen | 0,20 pequeño · 0,50 mediano · 0,80 grande |
| ANOVA | eta cuadrado parcial (η²p) | 0,01 pequeño · 0,06 mediano · 0,14 grande |
| Correlación | r (es su propio tamaño del efecto) | 0,10 pequeño · 0,30 mediano · 0,50 grande |
| Chi-cuadrado | V de Cramér / phi | Depende de los grados de libertad de la tabla |
| Regresión | R² y los coeficientes estandarizados | Se interpreta contra la literatura del campo, no contra un umbral fijo |
Advertencia sobre esas cifras: los cortes «pequeño / mediano / grande» son referencias generales que el propio Cohen presentó como provisorias y para usar solo cuando no hay nada mejor. Un d de 0,30 puede ser irrelevante en un experimento de laboratorio y muy relevante en una intervención educativa a escala. Siempre que puedas, interpretá el tamaño contra los valores que reporta la literatura de tu campo, y decilo así en el texto.

Por qué «significativo» no quiere decir «importante»
El p-valor depende de tres cosas: el tamaño del efecto, la variabilidad de los datos y el tamaño de la muestra. Esa tercera es la que produce los malentendidos.
Con n suficientemente grande, casi cualquier diferencia se vuelve significativa. Una diferencia de 0,2 puntos en una escala de 1 a 100 puede dar p < 0,001 si medís 5.000 personas, y no le sirve absolutamente a nadie. Al revés, con 25 casos por grupo una diferencia sustantiva puede quedarse en p = 0,09 simplemente porque no tenés potencia para detectarla.
De ahí salen dos frases que conviene tener listas para la defensa:
- «El resultado es estadísticamente significativo, pero el tamaño del efecto es pequeño, por lo que su relevancia práctica es limitada.»
- «La diferencia observada no alcanzó significación estadística; dado el tamaño de la muestra, el estudio tuvo potencia limitada para detectar efectos de esta magnitud.»
Las dos son honestas, las dos se pueden defender, y las dos son mucho mejores que forzar una conclusión. Para dimensionar el segundo punto conviene tener clara la relación entre población, muestra y el criterio con el que definiste el n.
Qué hacer si p es mayor que 0,05
No pasa nada. En serio. Una tesina se aprueba por la calidad del diseño y del razonamiento, no por el signo del resultado. Lo que sí hay que hacer es escribirlo bien:
- Verificá que la prueba sea la correcta para tu tipo de variable y tu diseño antes de concluir nada.
- Revisá los supuestos de esa prueba. Un supuesto violado puede estar inflando el error y escondiendo un efecto real.
- Reportá el resultado tal cual, con su p exacto y su tamaño del efecto. Un efecto pequeño y no significativo sigue siendo información.
- No digas «se demostró que no hay diferencia». No rechazar la nula no es lo mismo que aceptarla: la ausencia de evidencia no es evidencia de ausencia.
- Llevá el punto a limitaciones, no a la conclusión. Ahí es donde se explica la potencia del diseño.
La trampa de salir a pescar significancias
Cuando el resultado principal no da, la tentación es correr veinte pruebas más hasta que alguna cruce el umbral. Es comprensible y es un problema serio: si hacés veinte comparaciones independientes con α = 0,05, esperás una significativa por puro azar aunque no exista ningún efecto.
Cómo mantenerse del lado correcto:
- Definí las hipótesis y las pruebas antes de tocar los datos, y dejalo escrito en el capítulo metodológico.
- Si hacés muchas comparaciones, aplicá una corrección por comparaciones múltiples y decí cuál usaste.
- Distinguí en el texto entre lo confirmatorio (lo que planeaste) y lo exploratorio (lo que encontraste dando vueltas). Lo exploratorio se puede reportar; se reporta como exploratorio.
- Guardá la base cruda y la sintaxis. Si alguien pregunta cuántas pruebas corriste, tenés con qué contestar.
Cómo se escribe en el capítulo de resultados
La oración completa tiene cuatro piezas: el estadístico con sus grados de libertad, el p exacto, el tamaño del efecto y —cuando corresponde— el intervalo de confianza. Un ejemplo armado:
Se observó una diferencia estadísticamente significativa en el puntaje promedio entre ambos grupos, t(58) = 2,41, p = 0,019, d = 0,62, lo que corresponde a un efecto de magnitud mediana según las referencias convencionales.
Fijate lo que hace esa oración: informa la prueba, el resultado, la incertidumbre y la magnitud, y recién después interpreta. Las plantillas exactas para cada prueba, con las cursivas y la puntuación que corresponde, están en la guía de formato APA para el cuerpo del trabajo.
Preguntas frecuentes
¿Qué significa p = 0,03 en palabras simples?
Que si en la población no existiera ninguna diferencia, datos tan extremos como los tuyos aparecerían en aproximadamente 3 de cada 100 muestras. No significa que haya 97 % de probabilidad de que tu hipótesis sea verdadera.
¿Puedo usar 0,10 como nivel de significación?
Podés, si lo justificás y lo declarás antes del análisis. Es habitual en estudios exploratorios o con muestras chicas. Lo que no se puede es elegir el umbral después de ver el p.
¿Es obligatorio reportar el tamaño del efecto?
APA 7 lo pide de manera explícita para resultados inferenciales, y cada vez más cátedras lo exigen. Aunque tu reglamento no lo mencione, incluirlo es una de las mejoras más baratas que podés hacerle al capítulo.
¿Mi tesina cualitativa necesita p-valores?
No. La significación estadística pertenece al razonamiento inferencial sobre muestras. Un diseño cualitativo se evalúa con criterios de rigor propios —credibilidad, transferibilidad, dependabilidad— y no con umbrales de probabilidad.
Antes de escribir la oración, entendé el número
Un capítulo de resultados sólido no es el que tiene más asteriscos: es el que reporta cada prueba con su p exacto, su tamaño del efecto y una interpretación que no promete más de lo que los datos sostienen. Esa combinación es la que hace que la defensa sea una conversación y no un interrogatorio.
Si ya tenés los números y lo que te falta es redactar el capítulo con el formato que espera tu facultad, podés armarlo con Tesify: te acompaña en la redacción, te ordena las citas en APA 7 y tiene plan gratuito, así que probarlo no te cuesta nada. El criterio sobre qué significan tus resultados sigue siendo tuyo — y ahora lo tenés más claro.
