Tabla de contenido
Portafolio de evaluación vs exámenes estandarizados: qué mide cada uno
Los portafolios y los exámenes estandarizados miden cosas genuinamente distintas. Aquí está lo que dice la investigación sobre cada enfoque, sus implicaciones de equidad y cómo funcionan los modelos híbridos.
El debate sobre las pruebas estandarizadas en las escuelas casi siempre se enmarca como político. Eso oscurece algo más útil: los exámenes estandarizados y la evaluación por portafolio no son métodos en competencia para medir lo mismo. Están midiendo cosas genuinamente distintas. Entender qué captura cada uno — y qué no puede capturar — es más útil que ponerse de un lado.
Esta distinción importa más ahora que hace una década. Varios sistemas educativos grandes, incluyendo el de la Universidad de California, cambiaron a políticas de pruebas opcionales durante la pandemia. La Ciudad de Nueva York ha expandido la evaluación por portafolio. Al mismo tiempo, las pruebas estandarizadas siguen siendo la columna vertebral de la rendición de cuentas federal. Los papás que navegan decisiones sobre escuelas, programas y prioridades educativas merecen un análisis claro de lo que dice realmente la investigación.
Puntos clave
- Los exámenes estandarizados miden de manera confiable un conjunto específico de habilidades académicas — principalmente comprensión lectora, cálculo matemático y conocimiento procedimental — y predicen razonablemente el desempeño académico futuro en esas áreas.
- La evaluación por portafolio captura el crecimiento del aprendizaje a lo largo del tiempo, la resolución creativa y aplicada de problemas, la voz del estudiante y el desarrollo de habilidades que los exámenes estandarizados no evalúan.
- Ambos enfoques tienen problemas documentados de equidad, pero operan de manera diferente: los exámenes estandarizados muestran brechas demográficas persistentes en calificaciones; la evaluación por portafolio muestra brechas persistentes de calidad de implementación que perjudican a los estudiantes en escuelas con menos recursos.
- Ningún enfoque solo brinda un panorama completo del aprendizaje. La evidencia más sólida apoya modelos híbridos que usan cada método para lo que genuinamente mide bien.
- La pelea política sobre las pruebas es en parte una pelea de fondo sobre qué habilidades deben priorizar las escuelas — y eso es un desacuerdo legítimo de valores, no una disputa de medición.
Qué miden realmente los exámenes estandarizados
El caso a favor de los exámenes estandarizados
Los exámenes estandarizados fueron diseñados para resolver un problema real: ¿cómo comparas el desempeño de los estudiantes entre distintos maestros, escuelas y distritos cuando los estándares de calificación varían? Un 8 en un salón puede representar un trabajo muy distinto que un 8 en otro. Un examen que todos los estudiantes presentan en condiciones idénticas, calificado con el mismo criterio, proporciona una comparabilidad que las calificaciones asignadas por los maestros no pueden ofrecer.
La investigación sobre qué predicen los exámenes estandarizados es razonablemente sólida. Las calificaciones del SAT y ACT se correlacionan de manera significativa con el promedio de primer año de universidad — la correlación es típicamente de 0.35 a 0.50 en estudios grandes, lo que es modesto pero estadísticamente significativo. Los exámenes estandarizados estatales de 3.° a 8.° grado predicen calificaciones futuras y tasas de graduación a nivel poblacional. Los exámenes sí miden algo real.
¿Qué miden? Los análisis más cuidadosos sugieren que los exámenes estandarizados capturan principalmente:
- Conocimiento declarativo y procedimental (hechos, fórmulas, convenciones)
- Comprensión lectora de textos informativos y literarios bajo presión de tiempo
- Cálculo matemático y razonamiento algebraico
- Familiaridad con el lenguaje académico y las convenciones de los exámenes
- Memoria de trabajo y velocidad de procesamiento (implícitamente, a través de formatos cronometrados)
Nótese lo que falta en esa lista: creatividad, persistencia, resolución colaborativa de problemas, comunicación de ideas complejas a lo largo del tiempo y capacidad de aplicar el conocimiento a problemas reales novedosos. Estas no son fallas de los exámenes estandarizados — son características de lo que fueron diseñados para hacer.
Brechas demográficas en las calificaciones de exámenes estandarizados
Las brechas demográficas persistentes en las calificaciones de exámenes estandarizados están entre los hallazgos más documentados en la investigación educativa. En el SAT, los datos de 2023 del College Board mostraron brechas promedio de aproximadamente 177 puntos entre estudiantes blancos y negros, y 133 puntos entre estudiantes blancos e hispanos. Estas brechas han persistido durante décadas con cambios relativamente modestos.
Las causas son debatidas. Los investigadores distinguen entre exámenes que están sesgados (donde los reactivos favorecen sistemáticamente a un grupo independientemente de la habilidad subyacente), exámenes que reflejan diferencias reales en exposición al contenido evaluado (brechas de oportunidad de aprendizaje), y exámenes que reflejan con precisión diferencias de habilidades que resultan de inequidades sistémicas. La evidencia actual sugiere que el mecanismo dominante es la oportunidad de aprendizaje: los estudiantes que asisten a escuelas mejor equipadas, reciben preparación para exámenes y están expuestos desde pequeños al lenguaje académico y el contenido evaluado obtienen mejores resultados — y estas experiencias están distribuidas de manera desigual según raza e ingreso.
Esto importa para cómo los papás deben interpretar los resultados. Una calificación en un examen estandarizado dice mucho sobre la exposición del estudiante al contenido evaluado y al lenguaje académico. Dice menos sobre su inteligencia o potencial subyacente.
Qué mide realmente la evaluación por portafolio
¿Qué es la evaluación por portafolio?
La evaluación por portafolio, también llamada evaluación auténtica, pide a los estudiantes que compilen evidencia de su aprendizaje a lo largo del tiempo — proyectos terminados, borradores, reflexiones, trabajo creativo — a menudo con comentarios del propio estudiante que explican qué aprendió y cómo cambió su pensamiento. La evaluación se basa típicamente en una rúbrica que evalúa el trabajo en sí mismo, no un desempeño en una sola sesión bajo presión de tiempo.
Cuando se implementa bien, la evaluación por portafolio captura:
- Crecimiento a lo largo del tiempo (un portafolio muestra de dónde partió el estudiante y adónde llegó)
- Resolución creativa y aplicada de problemas (los proyectos requieren aplicar el conocimiento a problemas abiertos)
- Esfuerzo sostenido y revisión (los portafolios a menudo incluyen múltiples borradores)
- Voz del estudiante y metacognición (la autorreflexión es un componente central del portafolio)
- Comunicación de ideas complejas en múltiples formas (escritura, visuales, presentaciones)
La década de 1990 vio un impulso significativo hacia la evaluación por portafolio en varios estados, incluyendo Vermont y Kentucky. El Programa de Portafolio de Escritura de Vermont, estudiado por Koretz et al. (1994) en el Journal of Educational Statistics, encontró que los portafolios medían dimensiones de la habilidad de escritura que los exámenes estandarizados no alcanzaban — particularmente la voz, la organización de argumentos complejos y la calidad de la revisión. Sin embargo, el mismo estudio encontró serios problemas de confiabilidad: el acuerdo entre evaluadores era sustancialmente menor para los portafolios que para las evaluaciones estandarizadas.
El problema de la confiabilidad
Este es el desafío empírico central de la evaluación por portafolio. Los exámenes estandarizados, casi por definición, producen calificaciones confiables — el mismo estudiante tomando el mismo examen dos veces obtendrá resultados similares. Las calificaciones de portafolio dependen del juicio del evaluador, y la confiabilidad entre evaluadores en la evaluación de portafolios a gran escala ha sido consistentemente problemática.
Esta no es una objeción fatal. El diagnóstico médico, los fallos judiciales y las evaluaciones de desempeño laboral dependen del juicio humano experto que es menos perfectamente confiable que un escaneo o un número. La pregunta es si la confiabilidad es suficiente para el propósito. Para decisiones de alto impacto — graduación, admisión a la universidad, identificación de superdotados — el umbral de confiabilidad es más alto que para la retroalimentación en el aula.
Implicaciones de equidad: un conjunto diferente de problemas
Con frecuencia se presenta la evaluación por portafolio como una alternativa más equitativa a los exámenes estandarizados. El panorama de equidad es más complicado que esta idea.
Exámenes estandarizados: las brechas de oportunidad de aprendizaje impulsan las brechas en resultados. Los estudiantes de familias de menores ingresos obtienen calificaciones más bajas en promedio no porque los exámenes estén sesgados en el sentido técnico de medición, sino porque el contenido y el lenguaje que evalúan los exámenes les resultan menos familiares. Las escuelas mejor equipadas brindan más exposición a ese contenido. La brecha es real y refleja diferencias reales en la experiencia educativa — pero atribuir esas diferencias al potencial del estudiante es un error categórico.
Evaluación por portafolio: las brechas de calidad de implementación impulsan las brechas en resultados. Una evaluación por portafolio bien implementada requiere diseño reflexivo de tareas, rúbricas claras, tiempo para que los estudiantes revisen y capacitación de los maestros en evaluación de portafolios. Estos recursos no están distribuidos de manera uniforme. Las escuelas con maestros experimentados y bien respaldados, y grupos más pequeños, implementan la evaluación por portafolio mucho más eficazmente que las escuelas con menos recursos, alta rotación de personal y grupos más grandes. Un estudiante en una escuela con menos recursos y un programa de portafolio mal diseñado puede no recibir ni la retroalimentación ni la evaluación precisa que el enfoque promete.
Cómo se ven los enfoques híbridos en los datos
Algunos sistemas educativos han avanzado hacia modelos híbridos que usan exámenes estandarizados para rendición de cuentas y comparabilidad, mientras usan evaluación por portafolio o auténtica para el aprendizaje y crecimiento dentro de los salones. La investigación sobre estos enfoques es más alentadora que la investigación sobre cualquiera de los enfoques por separado.
La Evaluación del Desempeño de Educación por Competencias (PACE) de New Hampshire, que comenzó en 2015, usa tareas de desempeño desarrolladas localmente (similares a la evaluación por portafolio) para la mayor parte de la evaluación estudiantil, pero incluye evaluaciones estandarizadas como ancla de comparabilidad. La investigación temprana del Centro Nacional para la Mejora de la Evaluación Educativa encontró que las escuelas PACE mantuvieron el desempeño académico en medidas externas mientras reportaron mayor compromiso estudiantil y mayor literacidad de evaluación docente.
A nivel universitario, los experimentos de admisiones de la Universidad de California han proporcionado datos útiles. La propia investigación de la UC encontró que las calificaciones del SAT/ACT añadían validez predictiva más allá del promedio de preparatoria — particularmente para estudiantes de primera generación y minorías subrepresentadas cuyo promedio podría reflejar una inflación de calificaciones o un contexto que los evaluadores de admisiones no pueden interpretar fácilmente.
Portafolio vs exámenes estandarizados: qué mide cada uno
| Dimensión | Exámenes estandarizados | Evaluación por portafolio | Implicaciones de equidad | Mejor uso |
|---|---|---|---|---|
| Conocimiento declarativo | Mide bien | Solo evidencia indirecta | Brechas reflejan disparidades de oportunidad de aprendizaje | Comparabilidad entre escuelas; rendición de cuentas |
| Cálculo matemático | Mide bien | Raramente se evalúa directamente | Brechas por ingreso y raza | Diagnóstico de habilidades; alineación curricular |
| Resolución creativa de problemas | No mide | Mide bien (cuando se implementa bien) | Depende de la calidad de implementación | Aprendizaje en el aula; programas por proyectos |
| Crecimiento a lo largo del tiempo | No mide | Fortaleza principal | Las brechas de implementación perjudican a escuelas con menos recursos | Retroalimentación formativa; documentar progreso |
| Metacognición y reflexión | No mide | Mide cuando las rúbricas incluyen autoevaluación | La capacidad docente afecta la calidad | Apropiación del aprendizaje por el estudiante |
| Aplicación interdisciplinaria | Limitada | Mide cuando los proyectos son integradores | Requiere experiencia en diseño de proyectos | Integración STEM y humanidades |
| Confiabilidad entre evaluadores | Muy alta | Baja a moderada (requiere entrenamiento) | Las brechas de confiabilidad perjudican a estudiantes sin maestros experimentados | Las decisiones de alto impacto requieren anclas estandarizadas |
| Validez predictiva para GPA universitario | Moderada (r ≈ 0.35–0.50) | Datos a gran escala insuficientes | La investigación de UC muestra que GPA + examen predicen mejor que cualquiera solo | Admisión universitaria (como uno de varios factores) |
Qué observar en los próximos 3 meses
- Estados que amplían requisitos de graduación sin pruebas estandarizadas: Varios estados están revisando los requisitos de exámenes estandarizados para graduación post-pandemia. Hay que echar un ojo a los detalles de implementación — las implicaciones de equidad dependen en gran medida de qué reemplaza a los exámenes.
- Revisiones de políticas de pruebas opcionales en universidades: Muchas universidades selectivas prometieron revisar las políticas de pruebas opcionales después de 3 a 5 años. 2026 es el año en que vencen varias de esas revisiones. MIT y Yale ya han regresado a requerir calificaciones; otras siguen decidiendo.
- Expansión de PACE en New Hampshire: El experimento de evaluación híbrida más riguroso en EE.UU. está publicando datos de resultados de 5 años. Esta será la mejor evidencia hasta ahora de si la evaluación auténtica puede implementarse a escala sin sacrificar la rendición de cuentas.
- Componentes de portafolio en AP e IB: Tanto el Advanced Placement como el Bachillerato Internacional han ampliado los componentes de portafolio y tarea de desempeño en rediseños recientes. Hay que esperar datos de resultados comparando estudiantes que usaron y que no usaron estas características.
Preguntas frecuentes
¿Están sesgados los exámenes estandarizados contra los estudiantes de color? Esta es una pregunta que requiere distinción cuidadosa. En el sentido técnico de medición, la mayoría de los exámenes estandarizados de uso común han sido examinados por sesgo a nivel de reactivo y los reactivos que muestran funcionamiento diferencial generalmente se eliminan. Pero los exámenes reflejan experiencias educativas que están distribuidas de manera desigual por raza e ingreso — por lo que los resultados reflejan brechas reales de oportunidad. Si llamas a eso “sesgo” depende de tu definición. Las brechas son reales; la pregunta es qué las causa y qué hacer al respecto.
¿Puede la evaluación por portafolio reemplazar los exámenes estandarizados para la admisión universitaria? No fácilmente, por la razón por la que se inventaron los exámenes estandarizados: proveen comparabilidad entre contextos muy diferentes. Un portafolio de un estudiante de una escuela privada de élite y un portafolio de un estudiante de una escuela pública con menos recursos son extremadamente difíciles de evaluar en la misma escala. Las calificaciones estandarizadas, con todos sus problemas, permiten a las universidades hacer comparaciones entre contextos. Por eso la mayoría de las universidades selectivas, incluso las de pruebas opcionales, siguen considerando las calificaciones estandarizadas cuando los estudiantes las presentan.
¿Qué dice la investigación sobre si los niños aprenden más en salones basados en portafolio? La investigación es mixta y depende mucho de la implementación. El aprendizaje basado en proyectos bien implementado, que a menudo incorpora evaluación por portafolio, muestra efectos positivos en el compromiso estudiantil y la transferencia de conocimiento a problemas novedosos. Las versiones mal implementadas no muestran ventaja sobre la instrucción tradicional. El efecto es real pero contingente a la habilidad del maestro y el diseño del programa.
¿Cómo interactúan las calificaciones de exámenes estandarizados con el promedio para predecir el éxito? Múltiples estudios grandes encuentran que el promedio de preparatoria y las calificaciones de exámenes estandarizados juntos predicen los resultados universitarios mejor que cualquiera por separado. Esto apoya una visión complementaria: las calificaciones reflejan esfuerzo, hábitos de trabajo y conocimiento acumulado a través de muchas tareas; los exámenes reflejan un tipo específico de desempeño de habilidades académicas. Ambos son reales y capturan cosas parcialmente diferentes.
¿Hay escuelas donde la evaluación por portafolio funciona bien a escala? Sí. Las escuelas en la red Coalition of Essential Schools, las escuelas que usan el modelo Expeditionary Learning/EL Education y las escuelas del Bachillerato Internacional han implementado evaluación por portafolio y desempeño a escala con resultados positivos documentados. Estas escuelas tienden a tener infraestructura sólida de desarrollo profesional, baja rotación de maestros y compromiso institucional con la calidad de la evaluación.
¿Qué deben preguntar los papás al evaluar el enfoque de evaluación de una escuela? Preguntas clave: ¿Cuál es el enfoque de la escuela para rastrear el crecimiento individual del estudiante a lo largo del tiempo? ¿Cómo comunica la escuela las áreas donde un estudiante necesita apoyo adicional? ¿Cómo se comparan los resultados de los estudiantes en medidas externas (exámenes estatales, exámenes AP) con los de escuelas con demografía similar? ¿Cuál es la tasa de rotación de maestros — un indicador de la consistencia instruccional que requiere la evaluación por portafolio?
¿Cómo predicen las calificaciones de exámenes estandarizados los resultados a largo plazo más allá del GPA universitario? La validez predictiva de los exámenes estandarizados se debilita significativamente más allá del GPA de primer año universitario. Los ingresos a largo plazo, el desempeño laboral y la satisfacción de vida muestran correlaciones mucho más débiles con las calificaciones de exámenes estandarizados que con habilidades no cognitivas como la persistencia, la colaboración y la comunicación — que la evaluación por portafolio está mejor posicionada para desarrollar y medir.
¿Hay formas equitativas de usar los exámenes estandarizados? Sí. Usar exámenes estandarizados para identificar estudiantes que se desempeñan bien en medidas externas pero tienen un desempeño inferior en las calificaciones del salón — una posible señal de habilidad no reconocida — es un uso positivo de equidad. Usar los datos de los exámenes para identificar escuelas y distritos donde las brechas de rendimiento son mayores y los recursos son más necesarios es otro. El problema de equidad no es con los exámenes per se, sino con tratar las calificaciones como medidas fijas del potencial en vez de medidas de la exposición actual al contenido evaluado.
Sobre el autor
Ricky Flores es el fundador de HiWave Makers e ingeniero eléctrico con más de 15 años de experiencia desarrollando tecnología de consumo en Apple, Samsung y Texas Instruments. Escribe sobre cómo los niños aprenden a construir, pensar y crear en un mundo saturado de tecnología. Lee más en hiwavemakers.com.
Fuentes
- Koretz, D., Stecher, B., Klein, S., & McCaffrey, D. (1994). “The Vermont Portfolio Assessment Program: Findings and Implications.” Educational Measurement: Issues and Practice, 13(3), 5–16.
- College Board. (2023). “SAT Suite of Assessments Annual Report.” collegeboard.org.
- Geiser, S., & Santelices, M. V. (2007). “Validity of High-School Grades in Predicting Student Success Beyond the Freshman Year.” Center for Studies in Higher Education, UC Berkeley.
- National Center for the Improvement of Educational Assessment. (2021). “New Hampshire’s PACE: An Update on the First Five Years.” nciea.org.
- Au, W. (2007). “High-Stakes Testing and Curricular Control: A Qualitative Metasynthesis.” Educational Researcher, 36(5), 258–267.
- Darling-Hammond, L., & Adamson, F. (2010). Beyond Basic Skills: The Role of Performance Assessment in Achieving 21st Century Standards. Stanford Center for Opportunity Policy in Education.
- University of California. (2020). “Standardized Testing and the University of California: A Review.” universityofcalifornia.edu.