Como ya saben nuestros lectores, la Comisión Nacional de Test, perteneciente al Consejo General de la Psicología de España, elabora anualmente una evaluación de los test editados en nuestro país, con la finalidad de ayudar a los y las profesionales en la toma de decisiones de uso de los test, brindándoles información acerca de su calidad mediante criterios teóricos, prácticos y psicométricos.
Dicha Comisión está conformada por psicólogos y psicólogas procedentes del ámbito académico, de las editoras de test y del propio COP, que, desde el año 1995, vienen trabajando de forma conjunta con el objetivo primordial de promocionar y potenciar el uso adecuado de los test en España, mejorando su calidad y, con ello, la práctica profesional.
Muchos de los proyectos y acciones de la Comisión se implementan de forma coordinada con otros grupos y asociaciones internacionales como la Comisión de Test de la EFPA (European Federation of Psycholocial Associations), o la ITC (International Test Commission). Esta coordinación permite el intercambio de conocimientos e inquietudes, al mismo tiempo que se pueden cotejar perspectivas y problemas específicos.

La evaluación de test como respuesta a la necesidad de los y las profesionales de disponer de información técnica sobre la calidad de las pruebas utilizadas en su práctica diaria.
Entre las múltiples tareas conjuntas que se vienen realizando con estas organizaciones internacionales, una de las más destacadas y que, posteriormente, ha tenido amplia repercusión sobre los actuales objetivos de trabajo de la Comisión de test española, fue la puesta en marcha, en el año 1999, de una encuesta europea sobre la opinión de los psicólogos acerca de las pruebas psicológicas -adaptada al contexto español por la Comisión de test del COP-, con el propósito de organizar acciones y proyectos orientados a mejorar su uso.
Si bien esta valoración se repitió nuevamente en el año 2010, los resultados de la primera encuesta pusieron de relieve desde un primer momento, la necesidad por parte de los y las profesionales de la Psicología de disponer de información técnica sobre la calidad de los test que utilizan en su práctica diaria.
Para dar respuesta a esta demanda, la Comisión Nacional de test se propuso, entre sus objetivos, el de comenzar una revisión sistemática de las pruebas editadas en España, en la misma línea que otros países como, por ejemplo, Holanda. Este proceso de evaluación se inició en 2010, valorando pruebas tan conocidas como el WISC-IV, el NEO PI-R o el PROLEC-R, y su éxito ha quedado patente desde entonces hasta la actualidad, con 110 test ya revistados.
En esta decimotercera evaluación de test se han analizado seis instrumentos.
A este respecto, la última edición de la revista Papeles del Psicólogo, correspondiente a septiembre-diciembre de 2026, ha publicado un artículo realizado por Sergio Escorial Martín (Universidad Complutense de Madrid), donde se presentan el proceso seguido y los resultados de la decimotercera evaluación de test, correspondiente a 2024, llevada a cabo por la Comisión, en la que se han evaluado seis instrumentos (cinco comerciales: ATENTO, BFQ-2, EBE, EVT-3, PPVT-5; y uno no comercial: CoPsoQ-Istas21).
Estos test abordan un amplio espectro de dominios que van desde la evaluación comprensiva de aspectos vinculados con el lenguaje, hasta la evaluación de las funciones ejecutivas y el TDAH, pasando por la evaluación de riesgos psicosociales, los cinco grandes rasgos de personalidad o una batería completa para la evaluación del bienestar educativo.
El proceso de evaluación de los test, liderado por la Comisión de Test del COP, sigue un enfoque riguroso y sistemático que garantiza la evaluación integral de las propiedades psicométricas y técnicas de los instrumentos de medición.
En esta decimotercera edición se han revisado los siguientes test psicológicos:
¿Cómo se lleva a cabo el proceso de revisión de test?
Todos estos test pasan por un arduo proceso valorativo que comienza con la selección de las pruebas que serán sometidas a evaluación. En el caso de las pruebas comerciales, son las propias editoriales participantes las que proponen los test a la Comisión de Test, mientras que esta selecciona también una prueba no comercial para su revisión. Una vez seleccionadas las pruebas a evaluar, la Comisión de Test designa a la persona responsable de coordinar la evaluación de esa edición encargada de seleccionar a los posibles revisores, incorporando así, para cada test, dos revisores: uno experto en aspectos técnicos y psicométricos y otro con experiencia en las variables evaluadas por el test.
Una vez configurado el panel definitivo de expertos/as (12 en total) se les envían las pruebas a evaluar a cada uno de ellos, así como el Cuestionario para la Evaluación de Test Revisado (CET-R; Hernández et al., 2016), diseñado específicamente para describir y valorar la calidad técnica y psicométrica de las pruebas, en su versión más actual (i.e., versión V1.1 (CET-R V1.1). En concreto, el COP gestiona el envío de los materiales de las pruebas comerciales, mientras que la persona coordinadora remite a cada revisor el CET-R V1.1 y las instrucciones correspondientes.
En el caso del CoPsoQ-Istas21-V2, la prueba no comercial incluida en esta edición, se aplica un protocolo específico. Dado que su manual técnico carece de los datos psicométricos necesarios para la revisión, se realiza una búsqueda bibliográfica sistemática en Scopus y Web of Science, que permite identificar inicialmente 91 trabajos. Tras un primer cribado, se preseleccionan 35 documentos y, finalmente, 12 estudios clave, que, junto con los materiales originales de la prueba, conforman el dossier técnico facilitado a los revisores. Una vez recopilada esta documentación, el proceso de valoración es idéntico al seguido con los test comerciales.
Un modelo de evaluación basado en el consenso y la evidencia.
Tras la recepción de la documentación, los revisores proceden a la evaluación del test, de forma independiente, a través del CET-R V1.1. La finalidad es que recojan información relativa a la fundamentación y el desarrollo de la prueba, las evidencias de validez y fiabilidad y los baremos e interpretación de las puntuaciones y, a la par, realicen una valoración global, informando sobre la idoneidad del instrumento y señalando sus puntos fuertes y débiles.
De los instrumentos de evaluación se espera que posean determinadas características que justifiquen su uso: las propiedades psicométricas deben ser buenas (se debe evaluar con una precisión adecuada, el cuestionario debe haber mostrado evidencias de validez), la baremación debe ser actual, la muestra empleada, tanto para la baremación como para el cálculo de las propiedades psicométricas, debe ser la adecuada teniendo en mente el uso que se pretende realizar, etc.
Integración de las evaluaciones y elaboración de los informes finales.
Una vez aplicado el CET-R a la prueba que se les ha adjudicado, los revisores lo devuelven cumplimentado al coordinador, que se encarga de integrar, para cada test, las evaluaciones de los dos revisores asignados. Cuando existen discrepancias entre ambas valoraciones, el coordinador determina la valoración final atendiendo al razonamiento de los revisores y a la información recogida en el manual del test. Posteriormente, redacta un informe preliminar para cada una de las pruebas. Los resultados provisionales se presentan a la Comisión de Test del COP y los informes correspondientes a las pruebas comerciales se envían posteriormente a las casas editoriales, ofreciéndoles un plazo para presentar las alegaciones oportunas.
Finalmente, y tras atender a la información brindada por los expertos y expertas y las casas editoriales, el coordinador prepara los informes definitivos, que son revisados por parte de un miembro de la Comisión de Test, antes de su publicación. Sus sugerencias, principalmente de estilo, se incorporan a los informes, cuya versión final se publica en la web del COP.
La revisión crítica de la evidencia psicométrica, clave para un uso adecuado de los test.
Tal y como señala el coordinador de esta decimotercera evaluación en el artículo publicado en Papeles del Psicólogo, los resultados vuelven a poner de manifiesto la utilidad de este proyecto de la Comisión de Test, pero también revelan importantes lagunas en las evidencias de validez de algunos de los instrumentos analizados, especialmente en lo relativo a la estructura interna y al Funcionamiento Diferencial de los Ítems (DIF). Estas carencias rompen, según el autor, con la tendencia observada en ediciones anteriores y subrayan la necesidad de que editoriales y autores/as refuercen la justificación psicométrica de las pruebas.
En este sentido, el coordinador advierte de que una buena calidad formal del manual o de los materiales no garantiza por sí sola la solidez psicométrica de un test. Por ello, insiste en la responsabilidad de los y las profesionales de la Psicología de revisar de forma crítica las evidencias de validez, fiabilidad y baremación antes de utilizar una prueba, recordando que estas evaluaciones no constituyen un ranking, sino una herramienta destinada a facilitar un uso fundamentado de los instrumentos disponibles.
La evaluación de pruebas no comerciales y la adaptación futura del CET-R.
El artículo plantea también la conveniencia de mantener y potenciar la evaluación de pruebas no comerciales, dado su uso frecuente en la práctica profesional y la ausencia, en muchos casos, de respaldo editorial. A este respecto, se apunta la posibilidad de debatir en el futuro el desarrollo de un protocolo específico para este tipo de instrumentos, aunque se subraya que su carácter gratuito no los exime de demostrar su calidad conforme a los mismos estándares exigidos al resto de las pruebas.
Asimismo, el trabajo reconoce algunas limitaciones del procedimiento actual. El CET-R evalúa la calidad de la información reportada en la documentación disponible, pero no realiza una reevaluación psicométrica directa de los instrumentos, de modo que una puntuación baja puede reflejar tanto la ausencia de evidencia como que esta no haya sido incluida en los materiales analizados. El coordinador señala además que el CET-R v1.1 deberá adaptarse próximamente a las nuevas directrices europeas y considera que su informatización podría reducir inconsistencias y facilitar la ponderación de los ítems dentro de cada apartado.
Evaluar para garantizar la calidad y el uso adecuado de los test psicológicos.
Las evaluaciones periódicas de los test publicados en España constituyen un recurso fundamental para favorecer un uso crítico, ético y fundamentado de estas herramientas, permitiendo conocer tanto sus fortalezas como las posibles ausencias o limitaciones de la evidencia psicométrica disponible. El propio artículo recuerda que la utilidad de un test depende de la calidad de sus propiedades psicométricas, de la adecuación de sus baremos y del contexto concreto en el que se pretende utilizar.
En esta decimotercera edición, los resultados muestran una notable heterogeneidad entre las pruebas evaluadas. Mientras que la calidad de los materiales, la fundamentación teórica, la fiabilidad y la baremación obtienen, en general, buenas valoraciones, se detectan carencias más importantes en determinados apartados relacionados con la validez. Por este motivo, el estudio insiste en la necesidad de que los y las profesionales examinen críticamente las evidencias específicas de cada instrumento antes de incorporarlo a su práctica.
Actualmente, han sido objeto de evaluación 116 test, cuyos informes pueden consultarse y descargarse de forma gratuita en la página web de la Comisión de Test del COP. En este mismo portal se incluyen los enlaces a los artículos que documentan el proceso de evaluación de cada edición, publicados en Papeles del Psicólogo desde la primera edición en 2010, lo que permite seguir su evolución a lo largo del tiempo.
Puedes acceder al artículo completo de la presente edición en la página web de la revista Papeles del Psicólogo o bien directamente aquí:
Escorial, S. (2026). Decimotercera evaluación de test editados en España. Papeles del Psicólogo/Psychologist Papers, 47(3), 150-161. https://doi.org/10.70478/pap.psicol.2026.47.17
