← Volver al blog

Inteligencia artificial / Aprendizaje automático / IA generativa / Alfabetización en IA

¿Qué es realmente la IA? Cómo aprende, genera y se equivoca

PetexSpace

Es posible que hayas utilizado inteligencia artificial varias veces antes de terminar el desayuno. Un servicio de correo electrónico apartó un mensaje sospechoso de la vista. Un mapa comparó posibles rutas. Una cámara de teléfono encontró una cara o una planta. Un servicio de música reordenó una lista. Ninguno de esos momentos parecía una máquina de ciencia ficción. Parecían software ordinario tomando una pequeña decisión en tu nombre.

Esa es una razón por la que la IA puede parecer más difícil de entender de lo que debería. La interfaz muestra la respuesta pero oculta la maquinaria: el objetivo que alguien eligió, los ejemplos utilizados para construir el modelo, las señales proporcionadas como entrada y las pruebas que determinaron si el resultado era lo suficientemente bueno. La IA generativa añade otra capa de confusión porque puede explicarse a sí misma en un lenguaje pulido, incluso cuando la explicación es incompleta o incorrecta.

Esta guía abre esa maquinaria sin pretender que todos los sistemas de IA funcionen igual. Sigue una pregunta práctica de principio a fin: ¿qué tiene que suceder antes de que una máquina pueda convertir una entrada en una salida, y qué deberías comprobar antes de confiar en el resultado?

Una definición útil de IA

La definición actualizada de la OCDE describe un sistema de IA como un sistema basado en máquinas que infiere de su entrada cómo generar salidas, como predicciones, contenido, recomendaciones o decisiones, que pueden influir en entornos físicos o virtuales. Los diferentes sistemas varían en autonomía y en si continúan adaptándose después del despliegue.

El verbo importante es inferir. Una calculadora tradicional sigue reglas que especifican completamente cómo convertir números en una respuesta. Un modelo de IA a menudo maneja situaciones donde escribir cada regla a mano sería poco práctico. Estima una salida útil a partir de patrones, restricciones o relaciones aprendidas. Esa salida puede ser excelente, mediocre o peligrosamente engañosa dependiendo de la tarea y las condiciones.

La IA no es, por tanto, un producto, un algoritmo o una mente digital. Es un paraguas que cubre muchos sistemas. Un clasificador de spam, un reconocedor de voz, un predictor de estructuras de proteínas y un modelo de lenguaje pueden encajar en la definición compartiendo poco más que el patrón general entrada-modelo-salida.

Todo sistema de IA es más que un modelo

La discusión pública a menudo trata el modelo como toda la máquina. En la práctica, el modelo es un componente dentro de un sistema. Vale la pena separar cinco partes:

  • Objetivo: para qué se optimiza el sistema para predecir, clasificar, generar o decidir.
  • Entrada: la información disponible en el momento de uso, como píxeles, palabras, lecturas de sensores, ubicación o comportamiento pasado.
  • Modelo: el mecanismo aprendido o diseñado que asigna la entrada a un resultado.
  • Salida e interfaz: la etiqueta, puntuación, ruta, imagen, frase o acción mostrada a una persona o pasada a otro sistema.
  • Evaluación y retroalimentación: las pruebas, el monitoreo, las correcciones y las decisiones humanas utilizadas para juzgar si el sistema funciona en condiciones reales.

Considera la planificación de rutas. El objetivo puede ser minimizar el tiempo de viaje estimado. Las entradas incluyen la red de carreteras, la ubicación actual, los cierres y las señales de tráfico. Un modelo estima el costo de las rutas posibles. La interfaz presenta una o más opciones. La retroalimentación llega a medida que el tráfico cambia y los viajes se completan. El resultado útil proviene de toda la cadena, no de un algoritmo aislado.

El objetivo también merece escrutinio. Un sistema puede optimizar su objetivo asignado y aún así producir un resultado que a la gente no le gusta. Una ruta que es más rápida en promedio puede incluir un giro estresante. Una recomendación optimizada para clics puede no ser la recomendación que deja a alguien mejor informado. Las computadoras no descubren automáticamente el objetivo humano correcto. Las personas definen el objetivo, eligen lo que se puede medir y aceptan las compensaciones.

Cómo aprende una máquina de los ejemplos

Supongamos que un distribuidor de manzanas quiere identificar fruta magullada a partir de imágenes de cámara. Un programa basado en reglas podría verificar el color y la forma usando umbrales escritos por un ingeniero. Eso puede funcionar en un entorno controlado, pero las manzanas reales varían en variedad, madurez, iluminación, ángulo y textura de la superficie. Un enfoque de aprendizaje automático utiliza muchos ejemplos y ajusta un modelo para que sus predicciones coincidan cada vez más con los resultados conocidos.

Un ejemplo de clasificación de manzanas que muestra ejemplos proporcionados por humanos, entrenamiento del modelo, un conjunto de prueba y clasificación de una manzana nueva
Un pipeline de aprendizaje simplificado: los ejemplos dan forma al modelo, un conjunto de prueba separado verifica la generalización y la inferencia maneja un caso nuevo.

Durante el entrenamiento, el modelo hace predicciones sobre ejemplos, mide qué tan lejos están esas predicciones del resultado deseado y actualiza parámetros numéricos para reducir ese error. Los detalles difieren entre algoritmos, pero el bucle es reconocible: predecir, medir, ajustar, repetir. El modelo no está almacenando una regla verbal como cada mancha oscura es un moretón. Está ajustando una relación matemática que puede combinar muchas señales visuales.

Entrenamiento, validación, prueba e inferencia

Estos términos describen momentos diferentes y no deben colapsarse en uno:

  • Los datos de entrenamiento se utilizan para ajustar los parámetros del modelo.
  • Los datos de validación ayudan a elegir configuraciones y comparar versiones mientras el desarrollo aún está en curso.
  • Los datos de prueba se mantienen aparte para estimar cómo maneja el modelo elegido ejemplos de los que no aprendió directamente.
  • La inferencia es el momento en que un modelo entrenado recibe una nueva entrada y produce una salida.

Un modelo que se desempeña brillantemente en ejemplos familiares pero mal en otros nuevos no ha aprendido el patrón previsto lo suficientemente bien. Puede haber sobreajustado detalles incidentales en su conjunto de entrenamiento. El Curso intensivo de aprendizaje automático de Google trata conjuntos de datos, generalización, sobreajuste, evaluación, sistemas de producción y equidad como partes separadas del aprendizaje automático práctico exactamente por esta razón. Una puntuación de entrenamiento por sí sola no es una descripción confiable del comportamiento en el mundo real.

Incluso una buena prueba puede ser demasiado limitada. Un clasificador de manzanas probado con una cámara y una luz de almacén puede fallar después del despliegue bajo otra. Esto es cambio de distribución: las condiciones que rodean las nuevas entradas ya no se parecen a las condiciones representadas durante el desarrollo. Los sistemas reales necesitan monitoreo porque el mundo no promete permanecer como el conjunto de prueba.

Redes neuronales y aprendizaje profundo, sin la mitología

Una red neuronal es un modelo construido a partir de capas conectadas de operaciones numéricas. Cada capa transforma una representación en otra. Las capas tempranas en un modelo de imagen pueden responder a una estructura visual simple; las capas posteriores pueden combinar esas señales en patrones más específicos de la tarea. El aprendizaje profundo se refiere a redes neuronales con muchas de esas capas, entrenadas para aprender representaciones útiles de los datos.

El vocabulario biológico es inspiración histórica, no prueba de que el modelo piense como un cerebro humano. Una red puede contener millones o miles de millones de parámetros ajustables y aún así no tener experiencia personal, intención o comprensión en el sentido humano ordinario. Realiza cálculos moldeados por su arquitectura, objetivo de entrenamiento, datos y entrada actual.

El aprendizaje profundo ha sido especialmente efectivo donde la entrada bruta es compleja, incluyendo imágenes, audio, lenguaje y estructuras científicas. Su fortaleza viene con un costo: puede ser difícil explicar qué combinación de señales aprendidas produjo una salida particular, y el rendimiento puede depender de grandes conjuntos de datos, cómputo extenso y evaluación cuidadosa.

Qué cambia la IA generativa

Un clasificador elige entre categorías definidas. Un modelo generativo produce material nuevo que se asemeja a patrones en su distribución de entrenamiento. Dependiendo del modelo, ese material puede ser texto, una imagen, audio, video, código o una estructura científica. La generación hace que la IA se sienta más creativa y conversacional, pero no elimina la maquinaria estadística subyacente.

Un modelo de lenguaje grande, o LLM, procesa texto como tokens. Un token puede ser una palabra, parte de una palabra, puntuación u otra unidad pequeña. Dados los tokens ya en contexto, el modelo estima una distribución sobre los posibles tokens siguientes, selecciona uno según la configuración de decodificación del sistema, lo agrega y repite. La introducción a los modelos de lenguaje grandes de Google describe esta predicción de secuencia directamente.

Una ilustración mecánica que divide una oración en tokens y selecciona el siguiente token de varias probabilidades
Un modelo de lenguaje construye una respuesta token por token. La ilustración simplifica un proceso numérico mucho más grande, pero la predicción secuencial es real.

Los LLM modernos comúnmente usan la arquitectura Transformer introducida en el artículo de 2017 Attention Is All You Need. Su mecanismo de atención permite que el modelo pondere relaciones entre tokens en el contexto en lugar de procesar cada palabra como un elemento aislado. El entrenamiento en grandes colecciones de texto permite que el modelo capture gramática, estilo, hechos recurrentes, patrones de razonamiento y relaciones entre conceptos en sus parámetros.

Eso no convierte al modelo en una base de datos convencional. Sus parámetros codifican relaciones estadísticas distribuidas, no una biblioteca ordenada de documentos fuente que siempre pueda citar con precisión. El texto en el prompt y cualquier documento proporcionado en tiempo de ejecución se convierte en contexto, pero el contexto tiene límites. Algunas aplicaciones añaden búsqueda, herramientas, calculadoras o recuperación de documentos alrededor del modelo. Esas adiciones pueden mejorar la base, pero la respuesta final aún puede combinar evidencia recuperada con redacción generada e inferencia no respaldada.

La IA más impresionante suele ser altamente especializada

Los modelos conversacionales reciben atención porque cualquiera puede probarlos en segundos. Pero el valor de la IA no se limita a la conversación. Los sistemas de marco estrecho pueden resolver problemas con entradas, salidas y criterios de evaluación más claros:

  • Un reconocedor óptico de caracteres asigna píxeles en una imagen de documento a caracteres editables.
  • Un modelo de fraude clasifica transacciones para revisión adicional en lugar de declarar cada caso marcado como criminal.
  • Un modelo meteorológico estima estados atmosféricos futuros a partir de observaciones y estructura física.
  • Un modelo científico predice una propiedad o estructura molecular que los investigadores pueden comparar con experimentos.

La herramienta de imagen a texto de PetexSpace ilustra el primer tipo de tarea enfocada. La entrada es una imagen, la salida deseada es texto editable y el resultado se puede verificar directamente contra la fuente. Las fotografías borrosas, los diseños inusuales, la escritura a mano y la configuración de idioma incorrecta aún pueden reducir la precisión. La tarea es útil en parte porque el éxito y el fracaso son visibles.

Un ejemplo científico concreto: AlphaFold

Las proteínas se pliegan en estructuras tridimensionales que ayudan a determinar cómo funcionan. La determinación experimental de estructuras es esencial pero puede ser lenta y difícil. En una evaluación ciega conocida como CASP14, el sistema AlphaFold predijo muchas estructuras de proteínas con una precisión competitiva con las estructuras experimentales y superó sustancialmente a otros métodos computacionales. El artículo de AlphaFold revisado por pares en Nature explica el modelo, la evaluación y sus estimaciones de confianza.

Un investigador de biología molecular compara una proteína plegada predicha con evidencia experimental y colores de confianza
La IA especializada puede abordar un problema científico estrechamente definido. Las predicciones aún llevan estimaciones de confianza y siguen siendo parte de un proceso de investigación más amplio.

El ejemplo importa por dos razones. Primero, muestra que la IA puede contribuir a un problema científico difícil sin imitar a un chatbot. Segundo, el sistema informa dónde su predicción es más o menos confiable. Un modelo científico útil no solo produce una estructura hermosa. Da a los investigadores evidencia sobre la incertidumbre y un resultado que puede probarse dentro de un proceso experimental más amplio.

Por qué los sistemas de IA capaces aún fallan

El fracaso no es un defecto misterioso añadido después de la inteligencia real. Se sigue de cómo se construye y se usa el sistema. Varios modos de falla pueden existir al mismo tiempo.

1. El objetivo es incompleto

Un objetivo medible suele ser un proxy del resultado que la gente realmente quiere. Optimizar un proxy puede crear un comportamiento extraño en los bordes. El modelo puede mejorar correctamente su puntuación mientras pierde cualidades que nunca estuvieron representadas en esa puntuación. El juicio humano entra antes del entrenamiento a través de la elección del objetivo, no solo después de que ocurre un error.

2. Los datos omiten algo

Los ejemplos de entrenamiento reflejan decisiones de recopilación y condiciones históricas. Algunos grupos, entornos, idiomas, dispositivos o casos raros pueden estar mal representados. NIST señala que el sesgo dañino puede incrustarse en los sistemas automatizados y puede aumentar en velocidad o escala. Su trabajo sobre identificación y gestión del sesgo en la IA enfatiza que el sesgo es más amplio que un problema de datos puramente técnico y debe considerarse en todo el sistema.

3. Un modelo generativo puede producir falsedades convincentes

NIST usa el término confabulación para contenido generativo falso o erróneo presentado con confianza. Su Perfil de IA generativa explica que este comportamiento se sigue naturalmente de modelos que generan salidas que aproximan patrones en sus datos de entrenamiento. Una oración puede ser estadísticamente plausible sin estar respaldada fácticamente. Las citas fabricadas son especialmente peligrosas porque hacen que una respuesta no respaldada parezca investigada.

4. El mundo cambia

Un modelo evaluado ayer puede encontrar nuevos productos, nuevo lenguaje, nuevo comportamiento o nuevas tácticas adversarias mañana. La precisión no es una propiedad permanente impresa en el modelo. Es una medición hecha sobre datos particulares, en un momento particular, bajo condiciones particulares.

5. Las personas pueden confiar más en la interfaz que en la evidencia

Una respuesta fluida, un tono seguro o un porcentaje preciso pueden crear autoridad que la evidencia subyacente no merece. El diseño de la interfaz puede ocultar la incertidumbre o hacer que una recomendación se sienta obligatoria. El riesgo final depende tanto del comportamiento del modelo como de la forma en que se pide a las personas que usen la salida.

¿Cuánta verificación necesita una salida de IA?

La respuesta debería depender del costo de equivocarse. Tratar cada uso como igualmente peligroso es poco práctico. Tratar cada salida como igualmente confiable es peor. Un modelo simple de tres zonas ayuda.

Exploración de bajo riesgo

Hacer una lluvia de ideas de nombres, cambiar el tono de un borrador, generar preguntas de práctica o explorar varias formas de organizar notas generalmente tiene un bajo costo de error. Puedes inspeccionar el resultado directamente y descartar sugerencias débiles. El modelo es útil como fuente de opciones, no como autoridad.

Trabajo que requiere verificación

Los resúmenes de investigación, traducciones, código, cálculos, comparaciones de productos y explicaciones fácticas pueden ahorrar tiempo, pero los errores pueden sobrevivir a una lectura rápida. Verifica las afirmaciones contra fuentes primarias, ejecuta el código, reproduce el cálculo, compara la traducción con el contexto y confirma que el material citado dice lo que la respuesta afirma.

Decisiones de gran impacto

Las decisiones médicas, legales, financieras, laborales, de seguridad, de identidad y de acceso requieren revisión calificada y un proceso responsable. Una respuesta de IA de propósito general no debería convertirse en la única base para actuar solo porque es rápida o elocuente. En estos contextos, la incertidumbre, la apelación, la documentación, la privacidad y las consecuencias para la persona afectada importan tanto como el rendimiento predictivo bruto.

Una investigadora verifica una respuesta de IA contrastándola con un artículo original, un cálculo y una referencia autorizada
La fluidez no es evidencia. Las salidas importantes solo resultan útiles después de que sus afirmaciones, fuentes y cálculos superan comprobaciones independientes.

Un flujo de verificación que toma minutos

  1. Separa los hechos de las sugerencias. Un esquema propuesto requiere criterio; una afirmación sobre una ley, estudio, precio o evento requiere evidencia.
  2. Pregunta de dónde proviene cada afirmación importante. Luego abre la fuente en lugar de confiar en el texto de la cita.
  3. Prefiere material primario cuando sea posible: el artículo de investigación, la documentación oficial, el conjunto de datos original, el regulador, la norma o el registro directo.
  4. Comprueba si la fuente está actualizada y si respalda la afirmación exacta, no solo el mismo tema general.
  5. Reproduce los cálculos y ejecuta el código generado en un entorno seguro con pruebas representativas.
  6. Compara una conclusión de gran impacto con una fuente independiente o con una persona calificada responsable de ese dominio.
  7. Si la evidencia no se puede comprobar, reduce tu confianza o no uses la salida para esa decisión.

La documentación puede ayudar incluso antes de empezar. El artículo de investigación sobre Model Cards for Model Reporting propone registrar los usos previstos, los procedimientos de evaluación, las limitaciones y el rendimiento en condiciones relevantes. Una demostración pulida te dice lo que el modelo puede hacer una vez. Una buena documentación ayuda a revelar dónde se probó y dónde no debería usarse.

Siete preguntas que hacer sobre cualquier sistema de IA

  1. ¿Qué salida específica produce este sistema?
  2. ¿Qué objetivo se construyó o ajustó para optimizar?
  3. ¿Qué información recibe ahora y qué información falta?
  4. ¿Cómo se probó en casos que difieren de sus ejemplos de entrenamiento?
  5. ¿Expone incertidumbre, fuentes, limitaciones o una forma de impugnar el resultado?
  6. ¿Puedo comprobar la salida de forma independiente antes de actuar?
  7. ¿Quién asume el costo si el sistema se equivoca?

Esas preguntas revelan más que preguntar si una herramienta es inteligente. Desplazan la atención de una etiqueta de marketing al sistema real: su tarea, evidencia, límites y consecuencias.

El modelo mental que vale la pena conservar

La IA es un método para convertir entradas en salidas inferidas bajo un objetivo. El aprendizaje automático construye ese mapeo a partir de ejemplos. El aprendizaje profundo usa redes neuronales en capas para aprender representaciones complejas. La IA generativa crea material nuevo, y los modelos de lenguaje lo hacen prediciendo tokens repetidamente a partir del contexto. Ninguno de estos mecanismos garantiza verdad, equidad, relevancia o buen juicio.

Lo notable no es que una máquina se haya convertido en una persona. Es que sistemas matemáticos cuidadosamente diseñados pueden descubrir patrones útiles a una escala que ninguna persona podría inspeccionar manualmente. La respuesta responsable no es ni la adoración ni el descarte. Es la curiosidad con estándares: entender la tarea, buscar evidencia, respetar la incertidumbre y mantener la responsabilidad humana donde las consecuencias son reales.

Referencias primarias y técnicas

  • OECD, Explanatory memorandum on the updated definition of an AI system, 2024.
  • NIST, Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile, 2024.
  • Vaswani et al., Attention Is All You Need, 2017.
  • Jumper et al., Highly accurate protein structure prediction with AlphaFold, Nature, 2021.
  • Mitchell et al., Model Cards for Model Reporting, 2019.
  • Google for Developers, Machine Learning Crash Course and Introduction to Large Language Models.