Artículo de revisión

Vol. 61 | Núm. 306

53 min

De la radiología convencional al aprendizaje profundo: estado actual y perspectivas de la inteligencia artificial en cirugía ortopédica y traumatología

From conventional radiology to deep learning: current status and perspectives of artificial intelligence in orthopedic surgery and traumatology.

Sergio Pérez Ortiz*, Jesús García Álvarez, Diego Martínez López, María del Sol Gómez Aparicio, Emmanuel Salcedo Maíques, Carlos Guillermo Puig Abbs
Servicio de Cirugía Ortopédica y Traumatología, Hospital Intermutual de Levante, San Antonio de Benagéber, Valencia, España.
Correspondencia:
Sergio Pérez Ortiz - serperort@gmail.com
10.37315/sotocav20263066205
Recepción:
11/04/2026
Aceptación:
12/05/2026
Publicación:
09/10/2026

Cómo citar

Pérez Ortiz S., García Álvarez J., Martínez López D., Gómez Aparicio M., Salcedo Maíques E., Puig Abbs C. De la radiología convencional al aprendizaje profundo: estado actual y perspectivas de la inteligencia artificial en cirugía ortopédica y traumatología. Index. 2026;61(306):-. Disponible en: https://doi.org/


Métricas


1

Visualizaciones


Compartir

Compartir

Resumen (ES)

Introducción: La inteligencia artificial (IA) ha experimentado un crecimiento exponencial en cirugía ortopédica y traumatología, con aplicaciones que abarcan el diagnóstico radiológico, la predicción de complicaciones y la optimización asistencial. El objetivo es revisar críticamente su estado actual e identificar las barreras para su implementación clínica. Material y métodos: Revisión narrativa con búsqueda en PubMed/MEDLINE, Scopus, Cochrane Library y Google Scholar (enero 2020 – febrero 2026). Se incluyeron estudios originales, revisiones sistemáticas, metaanálisis y documentos de consenso sobre aplicaciones de IA, aprendizaje automático (AA) y aprendizaje profundo (AP), priorizando los de validación externa o diseño prospectivo. Resultados: Los algoritmos de AP alcanzan sensibilidades superiores al 90% en detección de fracturas, con plataformas comerciales aprobadas disponibles. La IA supera a los scores clásicos en predicción de mortalidad y complicaciones. Sin embargo, solo el 14,5% de los estudios tienen validación externa y el 3,2%, validación prospectiva. Los modelos de lenguaje grandes presentan limitaciones de seguridad para uso clínico directo. Conclusiones: La IA es relevante en cirugía ortopédica y traumatología, pero su integración exige validación prospectiva multicéntrica, transparencia algorítmica y supervisión clínica permanente.

Palabras clave (ES):

Inteligencia artificial
Aprendizaje profundo
Aprendizaje automático
Detección de fracturas
Diagnóstico asistido por ordenador
Modelos predictivos
Validación clínica
Imagen musculoesquelética
Triaje
seguridad del paciente

Resumen (EN)

Introduction: Artificial intelligence (AI) has experienced exponential growth in orthopedic surgery and traumatology, with applications ranging from radiological diagnosis to complication prediction and care optimization. The aim is to critically review its current state and identify barriers to its clinical implementation. Materials and Methods: Narrative review with searches in PubMed/MEDLINE, Scopus, Cochrane Library, and Google Scholar (January 2020 – February 2026). Original studies, systematic reviews, meta-analyses, and consensus documents on AI applications, machine learning (ML), and deep learning (DL) were included, prioritizing those with external validation or prospective design. Results: DL algorithms achieve sensitivities exceeding 90% in fracture detection, with approved commercial platforms available. AI outperforms classical scores in mortality and complication prediction. However, only 14.5% of the studies have external validation and 3.2% have prospective validation. Large language models present security limitations for direct clinical use. Conclusions: AI is relevant in orthopedic surgery and traumatology, but its integration requires multicenter prospective validation, algorithmic transparency, and ongoing clinical oversight.

Introducción

La inteligencia artificial (IA) ha pasado de ser un objeto de especulación tecnológica a convertirse en una realidad con aplicaciones concretas y crecientes en medicina. En el ámbito de la cirugía ortopédica y la traumatología, este proceso se ha acelerado de manera notable durante los últimos años: el 52,5 % de toda la producción científica sobre IA aplicada a traumatología fue publicada en 2024, según Misir et al. (1), lo que ilustra la velocidad con la que evoluciona este campo. Esta explosión editorial no es inocua. Junto al entusiasmo legítimo que generan los resultados obtenidos, existe el riesgo de sobreestimar la solidez de una evidencia que, en su mayor parte, procede de estudios retrospectivos con validación interna y escasa aplicabilidad directa al entorno clínico real.

La cirugía ortopédica y traumatología es una especialidad con características que hacen especialmente atractiva la aplicación de la IA. El volumen de exploraciones radiológicas es elevado, la variabilidad interobservador en la interpretación de fracturas es un problema documentado, las urgencias trabajan en condiciones de presión asistencial creciente, y las decisiones clínicas en el paciente politraumatizado se toman con frecuencia en escenarios de incertidumbre y tiempo limitado. En este contexto, la IA puede aportar valor en al menos tres grandes dominios: el diagnóstico radiológico asistido, la predicción de complicaciones y la optimización del triaje y la gestión asistencial.

Sin embargo, la translación de los resultados de laboratorio a la práctica clínica diaria encuentra obstáculos relevantes: la falta de validación prospectiva multicéntrica, la escasa transparencia de la mayoría de los algoritmos, la heterogeneidad de los datos utilizados para el entrenamiento y las implicaciones éticas y regulatorias que conlleva la integración de sistemas autónomos de decisión (2).

El objetivo de este trabajo es revisar de forma crítica el estado actual de la inteligencia artificial en cirugía ortopédica y traumatología, analizar la calidad de la evidencia disponible en sus principales aplicaciones e identificar tanto las áreas de mayor potencial clínico como las limitaciones que deben resolverse antes de que su adopción pueda considerarse realmente fundamentada.

Material y métodos

Se realizó una revisión narrativa de la literatura científica con el objetivo de analizar las aplicaciones actuales de la inteligencia artificial (IA) en cirugía ortopédica y traumatología. Se incluyeron artículos publicados entre enero de 2020 y febrero de 2026.

La búsqueda bibliográfica se llevó a cabo en las siguientes bases de datos electrónicas: PubMed/MEDLINE, Scopus, Cochrane Library y Google Scholar. La estrategia de búsqueda combinó términos de vocabulario controlado (MeSH) y palabras clave en texto libre relacionadas con inteligencia artificial y cirugía ortopédica y traumatología. La consulta principal empleada en PubMed fue la siguiente: ("artificial intelligence"[Title/Abstract] OR "machine learning"[Title/Abstract] OR "deep learning"[Title/Abstract]) AND ("orthopedic surgery"[Title/Abstract] OR "orthopaedic"[Title/Abstract] OR "trauma"[Title/Abstract] OR "fracture"[Title/Abstract] OR "musculoskeletal imaging"[Title/Abstract])

Estrategias equivalentes se adaptaron a Scopus, Cochrane Library y Google Scholar. Adicionalmente, se revisaron manualmente las listas de referencias de los artículos y revisiones considerados más relevantes, con el fin de identificar estudios adicionales no recuperados por la búsqueda automatizada.

Se incluyeron estudios que cumplieran los siguientes criterios: artículos de investigación originales, revisiones sistemáticas, metaanálisis o declaraciones de consenso de sociedades científicas o agencias reguladoras; enfocados en la aplicación de IA, aprendizaje automático (AA) o aprendizaje profundo (AP) en cirugía ortopédica, traumatología o imagen musculoesquelética; y que evaluaran aplicaciones diagnósticas, predictivas o relacionadas con la optimización del flujo de trabajo clínico. Se dio preferencia a los estudios que reportaran validación externa, diseño prospectivo o bases de datos multicéntricas, por considerarse los que ofrecen mayor solidez para la aplicabilidad clínica.

Se excluyeron los estudios con tamaño muestral insuficiente para el análisis propuesto, con ausencia de un comparador clínicamente significativo, con algoritmos sin relevancia clínica directa o que presentaran información metodológica insuficiente para valorar la fiabilidad de sus resultados.

No se realizó un metaanálisis cuantitativo, dado que la heterogeneidad entre los estudios incluidos —en cuanto a diseño, población, algoritmos evaluados y métricas de rendimiento reportadas— hacía inviable una síntesis estadística formal. La revisión se estructuró en torno a cuatro áreas temáticas: diagnóstico radiológico asistido por IA, predicción de complicaciones y mortalidad en trauma, aplicaciones en triaje y gestión asistencial, y consideraciones éticas y regulatorias. Para cada área se analizó la solidez de la evidencia disponible según el nivel de validación

Resultados

Diagnóstico radiológico asistido por inteligencia artificial

La detección y clasificación de fracturas mediante algoritmos de aprendizaje profundo (AP) —rama de la inteligencia artificial basada en redes neuronales artificiales de múltiples capas, capaces de identificar patrones complejos a partir de grandes volúmenes de datos de imagen— es, con diferencia, el área más estudiada de la IA en cirugía ortopédica y traumatología. Misir et al. (1), en una revisión de 217 estudios publicados entre 2015 y 2025, identificaron la detección de fracturas (24,4 %) y su clasificación (12,0 %) como las aplicaciones más frecuentes. Las regiones anatómicas más estudiadas fueron la cadera y el fémur (19,4 %), la columna vertebral (18,9 %) y la muñeca (12,0 %).

Los algoritmos de AP, particularmente las redes neuronales convolucionales (RNC), han demostrado un rendimiento comparable o superior al de especialistas en tareas de interpretación radiológica, con sensibilidades y especificidades que superan habitualmente el 90 % en los conjuntos de validación interna (1,3). Sin embargo, la mayor parte de estos resultados procede de estudios retrospectivos con datos del centro donde se entrenó el modelo, lo que limita su extrapolación a contextos diferentes.

En el ámbito de las herramientas comerciales, varias plataformas cuentan actualmente con aprobación de la Administración de Alimentos y Medicamentos de los Estados Unidos (FDA) y marcado CE. Entre las más validadas se encuentra BoneView (Gleamer), que en el estudio de Regnard et al. (4) demostró una sensibilidad del 98,1% para fracturas y del 89,9% para luxaciones en validación multicéntrica. Otros sistemas, como SmartUrgence y Rayvolve, redujeron el tiempo de interpretación entre un 26% y un 30% sin comprometer la precisión diagnóstica en estudios prospectivos recientes, según Prucker et al. (5). En una comparación de tres algoritmos comerciales, Guermazi et al. (6) demostraron que la asistencia de IA mejoró la sensibilidad en un 10,4% y redujo el tiempo de lectura en 6,3 segundos por exploración. Este panorama regulatorio presenta, sin embargo, una paradoja relevante: disponer de aprobación formal no equivale a contar con evidencia clínica sólida. Antonissen et al. (7) documentaron que, de los más de 173 productos de IA con marcado CE en radiología existentes en 2023, solo el 31% disponían de estudios de nivel 3 o superior que demostrasen impacto clínico real. La tabla 1 recoge las características y el nivel de validación de las principales plataformas comerciales disponibles actualmente para la detección de fracturas, permitiendo al lector valorar de forma comparada qué sistemas cuentan con respaldo metodológico suficiente para su uso en la práctica asistencial.

Tabla 1. Principales plataformas comerciales de inteligencia artificial para detección de fracturas con aprobación regulatoria (FDA y/o marcado CE).
SistemaFabricanteAprobación regulatoriaAnatomía validadaSensibilidadReferencia
BoneViewGleamerFDA / Marcado CEExtremidades, pelvis, luxaciones98,1%Regnard et al., 2022
SmartUrgenceGleamerMarcado CERadiografía musculoesquelética89–98%Prucker et al., 2025
RayvolveRésonanceMarcado CERadiografía musculoesquelética89–98%Prucker et al., 2025
RBfractureRBfractureMarcado CEExtremidades89–98%Husarek et al., 2024
IA (3 algoritmos)VariosFDA / Marcado CERadiografía musculoesquelética+10,4% vs baseGuermazi et al., 2022
FDA: Food and Drug Administration (Administración de Alimentos y Medicamentos de los Estados Unidos). CE: Conformité Européenne. Fuentes: Regnard et al. (Eur J Radiol. 2022); Prucker et al. (Int J Med Inform. 2025); Guermazi et al. (Radio‐ logy. 2022); Husarek et al. (Sci Rep. 2024).

En fracturas vertebrales osteoporóticas, Shen et al. (8) desarrollaron y validaron un sistema de AP entrenado con más de 11.000 radiografías convencionales que alcanzó una sensibilidad del 84,1 % y una especificidad del 97,3 % en validación interna, con resultados comparables en la cohorte de validación externa. En fracturas de meseta tibial, van der Gaast et al. (9) mostraron que la detección mediante redes convolucionales obtuvo sensibilidades elevadas (92,7 %), aunque la clasificación según el sistema de Schatzker resultó considerablemente más difícil, con una exactitud del 34,6 %. Este resultado refleja las limitaciones intrínsecas de los sistemas de clasificación clásicos cuando se utilizan como referencia de entrenamiento, dado que la concordancia interobservador del propio sistema de Schatzker sobre radiografía convencional es, en sí misma, moderada.

En traumatismo craneoencefálico (TCE), los algoritmos de AP han demostrado capacidad para detectar automáticamente hemorragia intracraneal, cuantificar volúmenes de hematoma e identificar el desplazamiento de la línea media en tomografía computarizada (TC), mejorando la reproducibilidad de la interpretación radiológica, según Hibi et al. (10) y Uparela-Reyes et al. (11). La integración de neuroimagen avanzada —tractografía por tensor de difusión, resonancia magnética funcional— con datos clínicos mediante aprendizaje automático (AA) —denominación que engloba los métodos estadísticos y computacionales mediante los cuales un sistema aprende a realizar predicciones o clasificaciones a partir de datos, sin seguir reglas explícitamente programadas— muestra resultados prometedores para el diagnóstico y pronóstico del TCE leve, aunque la validación externa sigue siendo escasa, como señala la revisión sistemática de Saludar et al. (12). La amplitud y diversidad de estas aplicaciones —que abarcan desde el diagnóstico radiológico hasta la planificación quirúrgica, pasando por la predicción de complicaciones y la gestión asistencial— queda reflejada en la figura 1, que ofrece una visión de conjunto de los cuatro grandes dominios en los que la IA está transformando la práctica de la cirugía ortopédica y traumatología, con distinto grado de madurez clínica en cada uno de ellos.

Figura 1. Mapa conceptual de las aplicaciones de la inteligencia artificial en cirugía ortopédica y traumatología. RNC: red neuronal convolucional. TCE: traumatismo craneoencefálico. TC: tomografía computarizada. XGBoost: Extreme Gradient Boosting. TEV: tromboembolismo venoso. PLN: procesamiento del lenguaje natural. RM: resonancia magnética. IA: inteligencia artificial.

Predicción de complicaciones y mortalidad en el paciente traumatizado

La IA ha mostrado superioridad consistente sobre los sistemas tradicionales de puntuación en la predicción de complicaciones postoperatorias y mortalidad en el paciente traumatizado. Los modelos basados en Extreme Gradient Boosting (XGBoost) superan a los scores clásicos en la predicción de coagulopatía inducida por trauma, tromboembolismo venoso (TEV) y sepsis, con mejoras en el área bajo la curva receptor-operador (AUC) de entre 0,10 y 0,15, según los trabajos de Misir et al. (1) y Duranteau et al. (13). En politraumatizados, los modelos de XGBoost alcanzaron exactitudes del 90 % para mortalidad con una AUC de 0,91 en validación externa en la serie de Yu et al. (14). Por su parte, El-Menyar et al. (15) demostraron que los modelos de bosque aleatorio o Random Forest son capaces de predecir la activación del protocolo de transfusión masiva con una AUC de 0,95 y la mortalidad con una AUC de 0,99 utilizando únicamente parámetros hemodinámicos al ingreso. Estos resultados, sintetizados en la tabla 2, ilustran con claridad tanto el potencial de los modelos de AA para superar a los scores clásicos como la heterogeneidad en el nivel de validación alcanzado por cada uno de ellos, un aspecto que debe considerarse antes de extrapolar cualquiera de estas cifras a la práctica clínica habitual.

Tabla 2. Rendimiento de los modelos de inteligencia artificial frente a sistemas de puntuación clásicos en la predicción de complicaciones y mortalidad en el paciente traumatizado.
Mortalidad (politraumatizado)XGBoost0,91ISS/TRISS0,76–0,82SíYu et al., 2024
Activación transfusión masivaRandom Forest0,95Shock Index0,78No reportadaEl-Menyar et al., 2024
Mortalidad (hemodinámica)Random Forest0,99Scores convencionales—No reportadaEl-Menyar et al., 2024
Coagulopatía inducida por traumaXGBoost+0,10–0,15ROTEM / scoresBaselineNo reportadaDuranteau et al., 2026
Tromboembolismo venoso y sepsisXGBoost+0,10–0,15Scores de riesgoBaselineNo reportadaMisir et al., 2025
AUC: área bajo la curva receptor-operador. ISS: Injury Severity Score. TRISS: Trauma and Injury Severity Score. XGBoost: Extreme Gradient Boosting. ROTEM: tromboelastometría rotacional. Val.: validación. Fuentes: Yu et al. (Sci Rep. 2024); El-Menyar et al. (Comput Biol Med. 2024); Duranteau et al. (Curr Opin Anaesthesiol. 2026); Misir et al. (Injury. 2025).

Estos resultados, aunque llamativos, deben interpretarse con prudencia. Lee et al. (16), en una revisión sistemática sobre modelos de AA en cirugía de urgencias, señalan que el 85,5 % de estos modelos carecen de validación externa y que solo el 3,2 % cuentan con validación prospectiva. La ausencia de validación externa implica que el rendimiento real en poblaciones diferentes a las de entrenamiento puede diferir sustancialmente de los valores publicados, un fenómeno conocido como sobreajuste u optimismo estadístico.

Triaje, soporte a decisiones y gestión asistencial

En el ámbito del triaje y la toma de decisiones en urgencias, la IA ofrece posibilidades relevantes, aunque con un grado de evidencia heterogéneo. Los sistemas de priorización automática de listas de trabajo en radiología —denominados worklist triage— permiten que los estudios con hallazgos críticos sean interpretados antes que los normales, acelerando la activación de equipos quirúrgicos, tal como describen Bignami et al. (2) y Kalimouttou et al. (17). En escenarios de múltiples víctimas, sensores portátiles combinados con algoritmos de triaje automatizado mantienen una clasificación continua de los pacientes; en entornos de medicina táctica se están explorando drones con visión por computadora para la evaluación de signos vitales sin contacto físico.

Los modelos de lenguaje grandes (MLG) —sistemas de inteligencia artificial entrenados sobre enormes corpus textuales que les permiten comprender y generar lenguaje natural con aparente coherencia—, como ChatGPT (OpenAI), han demostrado una precisión del 76,6% en triaje según el Índice de Severidad de Emergencias (ISE), con una especificidad del 95,6 % para identificar pacientes de alta urgencia, en el estudio de Colakca et al. (18). Sin embargo, estos mismos sistemas presentan tasas documentadas de respuestas incorrectas o potencialmente peligrosas que oscilan entre el 21,6 % y el 43,2 % según la plataforma evaluada, con respuestas clínicamente inseguras en hasta el 13 % de los casos en algunas versiones, según Draelos et al. (19). Ningún MLG ha recibido aprobación de la FDA para uso clínico directo. La supervisión humana no es una recomendación opcional: es una exigencia de seguridad irrenunciable.

En el ámbito de la documentación clínica, aproximadamente 90 plataformas comerciales de transcripción ambiental utilizan MLG para la generación automática de notas clínicas mediante procesamiento del lenguaje natural (PLN), reduciendo la carga administrativa de los clínicos, según la revisión de Kunze et al. (20). En cuanto a la planificación asistencial, la IA facilita la predicción de flujos de pacientes, la optimización de plantillas y la localización geoespacial de nuevos centros de trauma, como describe Stonko et al. (21).

Planificación quirúrgica y navegación intraoperatoria

La segmentación automática de estructuras anatómicas para planificación preoperatoria, la navegación quirúrgica asistida por imagen y la realidad aumentada (RA) constituyen aplicaciones de IA con creciente interés en cirugía ortopédica y traumatología, revisadas por Shariatnia et al. (22). Los modelos de gemelo digital —representaciones virtuales individualizadas del paciente— permiten simular procedimientos quirúrgicos antes de su realización, con potencial para optimizar la selección de implantes y anticipar complicaciones biomecánicas, según Misir et al. (23). La reconstrucción de resonancia magnética (RM) acelerada mediante IA puede reducir los tiempos de adquisición hasta en un 90% manteniendo la calidad diagnóstica, lo que abre la puerta a su integración perioperatoria. Estas aplicaciones se encuentran en fase de desarrollo activo y su evidencia clínica es todavía preliminar.

Discusión

Los resultados de esta revisión confirman que la IA ha alcanzado un grado de madurez suficiente en algunas aplicaciones concretas de la cirugía ortopédica y traumatología para justificar una reflexión clínica rigurosa sobre su integración. Sin embargo, la brecha entre el rendimiento obtenido en condiciones de laboratorio y la utilidad clínica demostrada en la práctica real sigue siendo el problema central que condiciona la adopción de estas tecnologías.

En diagnóstico radiológico, el patrón es consistente en la literatura: los algoritmos funcionan bien cuando se validan sobre datos del centro donde fueron entrenados, y muestran una caída de rendimiento variable al probarse en poblaciones externas. Solo el 14,5 % de los estudios publicados han superado el umbral de la validación externa, y únicamente el 3,2 % han sido evaluados de forma prospectiva, según el análisis de Misir et al. (1). Esta cifra no es un dato menor: significa que el 97 % de los modelos publicados carecen del nivel de evidencia mínimo que exigiríamos a cualquier otro dispositivo (figura 2). La producción científica en IA se acumula masivamente en los escalones inferiores de madurez —desarrollo interno del modelo y, a lo sumo, validación externa— mientras que los niveles que implican demostración de impacto clínico real son prácticamente inexistentes en la literatura actual de cirugía ortopédica y traumatología. La aprobación regulatoria —FDA o marcado CE— no suple esta carencia, dado que los requisitos de validación exigidos por las agencias son en muchos casos inferiores a los estándares de la investigación clínica de alta calidad, tal como señalan Antonissen et al. (7) y Rajpurkar et al. (28).

Figura 2. Pirámide de madurez de la evidencia en inteligencia artificial aplicada a la cirugía ortopédica y traumatología. Los porcentajes de validación externa (14,5 %) y prospectiva (3,2 %) proceden de Misir et al. (Injury. 2025). El resto de categorías refleja la estimación cualitativa derivada de la literatura disponible en el período analizado.

El problema de la validación externa no es exclusivamente técnico. Refleja también una tensión inherente al proceso de publicación científica en este campo: los estudios con resultados favorables se publican con mayor facilidad, mientras que los que muestran caídas de rendimiento al aplicar los modelos en nuevos entornos tienen menos visibilidad. Esta asimetría de publicación debería tenerse en cuenta al interpretar el conjunto de la literatura disponible.

En cuanto a la predicción de complicaciones, las mejoras observadas sobre los scores tradicionales son clínicamente relevantes cuando el modelo ha sido validado de forma adecuada, pero la mayoría de los datos proceden de estudios retrospectivos con optimismo estadístico probable. La utilidad real de estos modelos para cambiar decisiones clínicas —y no solo para clasificar pacientes con mayor exactitud matemática— es una pregunta que, en general, permanece sin responder. Que un algoritmo prediga la mortalidad con una AUC de 0,99, como describen El-Menyar et al. (15), no implica que su incorporación al flujo de trabajo clínico mejore los resultados en la supervivencia del paciente: esa demostración requiere un diseño de estudio diferente, más exigente y más costoso.

Merece especial atención el papel de los modelos de lenguaje grandes en este contexto. Los datos disponibles son ambivalentes: muestran rendimiento aceptable en tareas estructuradas simples y resultados preocupantes cuando se enfrentan a escenarios clínicos con mayor complejidad o ambigüedad (18,19). Las tasas de alucinación documentadas —información fabricada presentada con aparente autoridad— son inaceptables en un contexto de seguridad del paciente, y la ausencia de aprobación regulatoria para ninguno de estos sistemas debería limitar estrictamente su uso a funciones de apoyo administrativo o educativo, nunca diagnóstico.

Desde una perspectiva de práctica clínica, la implementación de herramientas de IA en cirugía ortopédica y traumatología presenta desafíos que van más allá del rendimiento algorítmico. La integración en el flujo de trabajo real requiere compatibilidad con los sistemas de historia clínica electrónica (HCE) existentes, tiempos de respuesta clínicamente asumibles, formación de los profesionales para interpretar correctamente las salidas del sistema —incluyendo sus márgenes de incertidumbre— y protocolos claros de responsabilidad cuando el algoritmo falla o induce a error. La denominada colaboración humano-máquina no se produce de forma espontánea: debe diseñarse, evaluarse y mantenerse, como subrayan Bignami et al. (2).

Las implicaciones éticas y regulatorias son otro pilar que no puede soslayarse. El sesgo algorítmico es un problema crítico y documentado que surge cuando los modelos, entrenados con poblaciones no representativas, pierden eficacia al aplicarse a subgrupos específicos de edad, sexo, etnia o comorbilidad. (2). El Reglamento de Inteligencia Artificial de la Unión Europea (Reglamento IA-UE) y las directrices de la Organización Mundial de la Salud (OMS) establecen principios de seguridad, equidad, transparencia y supervisión humana como condición para una integración responsable, pero su translación a protocolos institucionales concretos está aún en desarrollo en la mayoría de los servicios de cirugía ortopédica y traumatología.

El presente trabajo tiene limitaciones inherentes a su diseño como revisión narrativa. La selección de estudios no siguió un protocolo sistematizado con criterios de los estándares Preferred Reporting Items for Systematic Reviews and Meta-Analyses (PRISMA), lo que introduce inevitablemente un componente de subjetividad en la inclusión de referencias. La velocidad de publicación en este campo es tan elevada que cualquier revisión queda parcialmente desactualizada en el momento de su publicación. Por ello, las conclusiones deben entenderse como una síntesis del estado de conocimiento en el período analizado.

Las áreas de mayor potencial para la investigación futura incluyen el desarrollo de estudios aleatorizados o cuasialeatorizados que evalúen el impacto clínico real de los sistemas de IA en cirugía ortopédica; la creación de repositorios multicéntricos de imágenes traumatológicas anotadas; la estandarización de métricas de rendimiento clínico más allá de la AUC; y el desarrollo de modelos de inteligencia artificial explicable (XAI, del inglés explainable artificial intelligence) que permitan al cirujano entender el razonamiento del sistema antes de actuar sobre su recomendación.

Conclusiones

La inteligencia artificial representa una tecnología con aplicaciones clínicas reales y crecientes en cirugía ortopédica y traumatología, cuyo mayor potencial se concentra actualmente en el diagnóstico radiológico asistido —especialmente la detección de fracturas en urgencias— y en la predicción de complicaciones en el paciente politraumatizado. Los resultados publicados son en general prometedores, pero la solidez de la evidencia es todavía limitada, con una proporción mínima de estudios que alcanzan el nivel de validación prospectiva y multicéntrica necesario para justificar una implementación generalizada.

La integración de la IA en la práctica diaria de la cirugía ortopédica y traumatología debe abordarse con rigor metodológico, supervisión clínica permanente y plena consciencia de las limitaciones actuales. La colaboración humano-máquina, lejos de representar una amenaza para la práctica clínica, puede convertirse en un modelo asistencial más eficiente y seguro, siempre que la responsabilidad del juicio clínico permanezca inequívocamente en manos del especialista.

Financiación

Los autores declaran que no se recibió financiación para la investigación, autoría y/o publicación de este artículo.

Contribución de autoría

SPO: Conceptualización, Validación, Software, Metodología, Recursos, Análisis formal, Redacción - revisión y edición, Administración del proyecto, Supervisión, Visualización, Redacción - borrador inicial, Recopilación de datos, Investigación.

JGA: Conceptualización, Supervisión, Redacción - revisión y edición, Metodología, Validación, Análisis formal.

DML: Redacción - revisión y edición, Conceptualización, Validación, Análisis formal, Supervisión.

MSGA: Supervisión, Redacción - revisión y edición, Validación.

ESM: Supervisión, Redacción - revisión y edición.

CGPA: Redacción - revisión y edición, Supervisión.

Todos los autores han leído y aprobado la versión final del artículo.

Conflictos de interés

Los autores declaran que no hay ningún conflicto de interés comercial o financiero para esta investigación.

Uso de herramientas de inteligencia artificial

La redacción, el análisis crítico, la selección bibliográfica y el contenido intelectual del presente manuscrito son obra exclusiva de los autores firmantes. Con el fin de mejorar la claridad y adecuación estilística del texto a los estándares de la literatura científica biomédica, se empleó el modelo de lenguaje Claude Sonnet 4.6 (Anthropic, San Francisco, CA, EE. UU.) como herramienta de apoyo a la revisión de la expresión escrita. Su uso se limitó a sugerencias de corrección lingüística y ajuste del registro científico, sin intervención alguna en la generación de ideas, interpretación de resultados, selección de referencias ni en ningún aspecto relativo al contenido científico del trabajo. Las figuras que acompañan al artículo fueron elaboradas mediante las herramientas de generación de imágenes Nano Banana 2, integrada en Gemini Advanced (Google LLC, Mountain View, CA, EE. UU.), y Claude Opus 5.5 (Anthropic, San Francisco, CA, EE. UU.).

Referencias

  1. Misir A. Artificial intelligence in orthopedic trauma: a comprehensive review. Injury. 2025;56(8):112570. Disponible en: https://doi.org/10.1016/j.injury.2025.112570.
  2. Bignami EG, Berdini M, Bellini V. Artificial intelligence in trauma care: applications, ethical challenges, and pathways toward responsible integration. Curr Opin Anaesthesiol. 2026;39(2):174-182. Disponible en: https://doi.org/10.1097/ACO.0000000000001615.
  3. Bhatnagar A, Kekatpure AL, Velagala VR, Kekatpure A. A Review on the Use of Artificial Intelligence in Fracture Detection. Cureus. 2024. Disponible en: https://doi.org/10.7759/cureus.58364.
  4. Regnard N-E, Lanseur B, Ventre J, Ducarouge A, Clovis L, Lassalle L, et al. Assessment of performances of a deep learning algorithm for the detection of limbs and pelvic fractures, dislocations, focal bone lesions, and elbow effusions on trauma X-rays. European Journal of Radiology. 2022;154:110447. Disponible en: https://doi.org/10.1016/j.ejrad.2022.110447.
  5. Prucker P, Lemke T, Mertens CJ, Ziegelmayer S, Graf MM, Weller D, et al. Real-world clinical impact of three commercial AI algorithms on musculoskeletal radiography interpretation: A prospective crossover reader study. International Journal of Medical Informatics. 2026;205:106120. Disponible en: https://doi.org/10.1016/j.ijmedinf.2025.106120.
  6. Guermazi A, Tannoury C, Kompel AJ, Murakami AM, Ducarouge A, Gillibert A, et al. Improving Radiographic Fracture Recognition Performance and Efficiency Using Artificial Intelligence. Radiology. 2022;302(3):627-636. Disponible en: https://doi.org/10.1148/radiol.210937.
  7. Antonissen N, Tryfonos O, Houben IB, Jacobs C, de Rooij M, van Leeuwen KG. Artificial intelligence in radiology: 173 commercially available products and their scientific evidence. European Radiology. 2025;36(1):526-536. Disponible en: https://doi.org/10.1007/s00330-025-11830-8.
  8. Shen L, Gao C, Hu S, Kang D, Zhang Z, Xia D, et al. Using Artificial Intelligence to Diagnose Osteoporotic Vertebral Fractures on Plain Radiographs. Journal of Bone and Mineral Research. 2023;38(9):1278-1287. Disponible en: https://doi.org/10.1002/jbmr.4879.
  9. van der Gaast N, Bagave P, Assink N, Broos S, Jaarsma RL, Edwards MJR, et al. Deep learning for tibial plateau fracture detection and classification. The Knee. 2025;54:81-89. Disponible en: https://doi.org/10.1016/j.knee.2025.02.001.
  10. Hibi A, Jaberipour M, Cusimano MD, Bilbily A, Krishnan RG, Aviv RI, et al. Automated identification and quantification of traumatic brain injury from CT scans: Are we there yet?. Medicine. 2022;101(47):e31848. Disponible en: https://doi.org/10.1097/md.0000000000031848.
  11. Uparela-Reyes MJ, Villegas-Trujillo LM, Cespedes J, Velásquez-Vera M, Rubiano AM. Usefulness of Artificial Intelligence in Traumatic Brain Injury: A Bibliometric Analysis and Mini-review. World Neurosurgery. 2024;188:83-92. Disponible en: https://doi.org/10.1016/j.wneu.2024.05.065.
  12. Saludar CJA, Tayebi M, Kwon E, McGeown J, Schierding W, Wang A, et al. Application of Machine Learning in the Diagnosis and Prognosis of Mild Traumatic Brain Injury Using Diffusion Tensor Imaging: A Systematic Review. Journal of Magnetic Resonance Imaging. 2025;63(2):328-345. Disponible en: https://doi.org/10.1002/jmri.70122.
  13. Duranteau O, Leon D. Artificial intelligence-driven predictive analytics for postoperative management and recovery in trauma patients. Current Opinion in Anaesthesiology. 2026;39(2):154-159. Disponible en: https://doi.org/10.1097/aco.0000000000001618.
  14. Yu M, Wang S, He K, Teng F, Deng J, Guo S, et al. Predicting the complexity and mortality of polytrauma patients with machine learning models. Scientific Reports. 2024;14(1). Disponible en: https://doi.org/10.1038/s41598-024-58830-0.
  15. El-Menyar A, Naduvilekandy M, Asim M, Rizoli S, Al-Thani H. Machine learning models predict triage levels, massive transfusion protocol activation, and mortality in trauma utilizing patients hemodynamics on admission. Computers in Biology and Medicine. 2024;179:108880. Disponible en: https://doi.org/10.1016/j.compbiomed.2024.108880.
  16. Lee AH, Chan MK, Narayanan D, Staudenmayer K, Nassar A, Forrester JD, et al. Augmenting decision making in acute care surgery: A systematic review of machine learning–driven risk prediction models. Journal of Trauma and Acute Care Surgery. 2025;100(2):332-338. Disponible en: https://doi.org/10.1097/ta.0000000000004805.
  17. Kalimouttou A, Perkins Z, Gauss T. Artificial intelligence-driven triage and decision-making in trauma systems/settings. Current Opinion in Anaesthesiology. 2026;39(2):129-135. Disponible en: https://doi.org/10.1097/aco.0000000000001619.
  18. Colakca C, Ergın M, Ozensoy HS, Sener A, Guru S, Ozhasenekler A. Emergency department triaging using ChatGPT based on emergency severity index principles: a cross-sectional study. Scientific Reports. 2024;14(1). Disponible en: https://doi.org/10.1038/s41598-024-73229-7.
  19. Draelos RL, Afreen S, Blasko B, Brazile TL, Chase N, Desai DP, et al. Large language models provide unsafe answers to patient-posed medical questions. npj Digital Medicine. 2026;9(1). Disponible en: https://doi.org/10.1038/s41746-026-02428-5.
  20. Kunze KN, Bepple J, Bedi A, Ramkumar PN, Pean CA. Commercial Products Using Generative Artificial Intelligence Include Ambient Scribes, Automated Documentation and Scheduling, Revenue Cycle Management, Patient Engagement and Education, and Prior Authorization Platforms. Arthroscopy. 2025;41(11):4950-4955. Disponible en: https://doi.org/10.1016/j.arthro.2025.05.021.
  21. Stonko DP, Guillamondegui OD, Fischer PE, Dennis BM. Artificial intelligence in trauma systems. Surgery. 2021;169(6):1295-1299. Disponible en: https://doi.org/10.1016/j.surg.2020.07.038.
  22. Shariatnia MM, Bagherieh S, Semnani F, Rafiei N, Avval AH, Ollivier M, et al. Artificial Intelligence Applications in Musculoskeletal Imaging. Current Reviews in Musculoskeletal Medicine. 2025;19(1). Disponible en: https://doi.org/10.1007/s12178-025-09997-0.
  23. Misir A, Yuce A. AI in Orthopedic Research: A Comprehensive Review. Journal of Orthopaedic Research. 2025;43(8):1508-1527. Disponible en: https://doi.org/10.1002/jor.26109.
  24. Lo Mastro A, Grassi E, Berritto D, Russo A, Reginelli A, Guerra E, et al. Artificial intelligence in fracture detection on radiographs: a literature review. Japanese Journal of Radiology. 2024. Disponible en: https://doi.org/10.1007/s11604-024-01702-4.
  25. Husarek J, Hess S, Razaeian S, Ruder TD, Sehmisch S, Müller M, et al. Artificial intelligence in commercial fracture detection products: a systematic review and meta-analysis of diagnostic test accuracy. Scientific Reports. 2024;14(1). Disponible en: https://doi.org/10.1038/s41598-024-73058-8.
  26. Tahernejad A, Sahebi A, Abadi ASS, Safari M. Application of artificial intelligence in triage in emergencies and disasters: a systematic review. BMC Public Health. 2024;24(1). Disponible en: https://doi.org/10.1186/s12889-024-20447-3.
  27. Laur O, Wang B. Musculoskeletal trauma and artificial intelligence: current trends and projections. Skeletal Radiology. 2021;51(2):257-269. Disponible en: https://doi.org/10.1007/s00256-021-03824-6.
  28. Rajpurkar P, Lungren MP. The Current and Future State of AI Interpretation of Medical Images. New England Journal of Medicine. 2023;388(21):1981-1990. Disponible en: https://doi.org/10.1056/nejmra2301725.

Explorar

Artículos


Volúmenes


Sobre la revista


Más leídos

Surgiceloma como complicación de tenodesis extraarticular de Lemaire modificada asociada a ligamentoplastia del cruzado anterior

Revista Española de Cirugía Osteoarticular


Uso de placa puente dorsal: una alternativa en fracturas de muñeca catastróficas

Revista Española de Cirugía Osteoarticular


No todo es "cut-out": reclasificación de las complicaciones mecánicas del tornillo cefálico del clavo intramedular.

Revista Española de Cirugía Osteoarticular


Solución límite para recambio de prótesis total de cadera con cotilo osteointegrado: presentación de casos

Revista Española de Cirugía Osteoarticular


Radioterapia a bajas dosis en artrosis: ¿una opción terapéutica real o un efecto placebo sofisticado?

Revista Española de Cirugía Osteoarticular