Adam (Optimizador)
Un algoritmo de optimización muy utilizado que adapta la tasa de aprendizaje de cada parámetro, haciendo que el entrenamiento de las redes neuronales sea más rápido y estable.
Your session has been flagged for unusual activity.
Confirma que eres una persona para continuar.
Definiciones claras y precisas de todos los términos de IA que importan en 2026, escritas para quienes realmente usan las herramientas, no solo escriben sobre ellas.
Un algoritmo de optimización muy utilizado que adapta la tasa de aprendizaje de cada parámetro, haciendo que el entrenamiento de las redes neuronales sea más rápido y estable.
Un sistema de IA que planifica y ejecuta tareas de varios pasos por sí mismo —llamando a herramientas, leyendo los resultados y decidiendo qué hacer a continuación— en lugar de responder una sola vez.
El trabajo de hacer que el comportamiento de un sistema de IA coincida con la intención y los valores humanos: por qué un modelo sigue las instrucciones de forma fiable y rechaza las solicitudes dañinas.
Una interfaz programática que permite que el software hable directamente con un modelo sin pasar por la interfaz de chat, devolviendo datos estructurados y cobrando por token.
La técnica que permite a un modelo ponderar la importancia de cada parte de la entrada al generar cada parte de la salida: la operación central de todo Transformer.
El algoritmo que entrena las redes neuronales propagando los errores de predicción hacia atrás para ajustar cada peso: el motor detrás de casi todo el aprendizaje profundo.
Una técnica de entrenamiento que normaliza las entradas de cada capa, permitiendo que las redes más profundas se entrenen más rápido y de forma más estable.
Una prueba estandarizada que se usa para medir y comparar modelos en tareas como razonamiento, conocimiento o programación; útil para elaborar clasificaciones, pero nunca un sustituto completo de probar un modelo con tu propio trabajo.
Un Transformer basado únicamente en el codificador, preentrenado para leer texto en ambas direcciones a la vez, muy utilizado en tareas de comprensión como clasificación, búsqueda y extracción.
Una métrica automática consolidada para la traducción automática que puntúa el resultado según cuánto coinciden sus secuencias de palabras con traducciones de referencia humanas.
La tendencia de una red neuronal a perder habilidades aprendidas previamente al entrenarse con datos nuevos: un reto clave para actualizar modelos de forma continua.
Pedirle a un modelo que razone a través de pasos intermedios antes de dar una respuesta final, lo que mejora la precisión en problemas de varios pasos.
El asistente conversacional de OpenAI, lanzado en noviembre de 2022, que llevó los modelos de lenguaje ajustados por instrucciones a un público masivo.
La familia de modelos de lenguaje de gran tamaño de Anthropic, conocida por su contexto extenso, su sólida capacidad de razonamiento y un enfoque de seguridad llamado IA Constitucional.
Una arquitectura neuronal que usa filtros aprendidos para detectar patrones espaciales, base de la visión artificial moderna.
La cantidad total de texto —medida en tokens— que un modelo puede tener en cuenta en una sola llamada, incluyendo el prompt de sistema, el historial de la conversación, los archivos adjuntos y la respuesta que se está generando.
Una medida de cuán similares son dos vectores según el ángulo que forman entre sí: la forma estándar de comparar embeddings en búsqueda y RAG.
El modelo de generación de imágenes a partir de texto de OpenAI, que crea imágenes a partir de descripciones en lenguaje natural y popularizó la creación de imágenes mediante prompts.
Un modelo generativo que aprende a crear datos invirtiendo un proceso gradual de adición de ruido: la tecnología detrás de la mayoría de los generadores de imágenes de IA actuales.
Un método de alineación que entrena a un modelo directamente con pares de preferencias humanas usando una función de pérdida de clasificación simple, evitando el modelo de recompensa independiente que usa RLHF.
Una técnica de regularización que desactiva neuronas de forma aleatoria durante el entrenamiento para evitar el sobreajuste y mejorar la generalización.
Una lista de números que representa el significado de un fragmento de texto, de modo que los elementos semánticamente similares quedan cerca entre sí en el espacio vectorial.
Darle a un modelo un puñado de ejemplos resueltos dentro del prompt para que pueda inferir el patrón antes de responder.
Continuar entrenando un modelo preentrenado con datos adicionales y especializados para que se adapte a un dominio, tarea o estilo concreto sin construirlo desde cero.
Una arquitectura generativa que entrena dos redes una contra la otra: un generador que fabrica datos y un discriminador que intenta detectar las falsificaciones.
La familia de modelos nativamente multimodales de Google DeepMind, diseñados para razonar de forma conjunta sobre texto, imágenes, audio y vídeo.
Una familia de modelos Transformer basados únicamente en el decodificador, preentrenados para predecir el siguiente token en grandes corpus de texto y luego adaptados a tareas concretas.
El modelo de lenguaje de gran tamaño y asistente de xAI, integrado con la plataforma X y orientado a la información en tiempo real y un estilo conversacional.
Cuando un modelo de lenguaje genera texto fluido y seguro pero incorrecto o no respaldado por sus fuentes.
La capacidad de un modelo para aprender una tarea a partir de ejemplos o instrucciones incluidos en el prompt en el momento de la inferencia, sin cambiar sus pesos.
Ajustar un modelo con muchas tareas formuladas como instrucciones en lenguaje natural, de modo que siga bien las instrucciones nuevas incluso en tareas que nunca vio durante el entrenamiento.
Un prompt diseñado para eludir el entrenamiento de seguridad de un modelo y hacer que produzca contenido que se supone debe rechazar.
Entrenar a un modelo “alumno” más pequeño para que imite a un modelo “profesor” más grande, transfiriendo gran parte de su capacidad a un modelo más barato y rápido.
Una red estructurada de entidades y las relaciones entre ellas, que se usa para almacenar hechos de una forma que las máquinas pueden consultar y sobre la que pueden razonar.
El retraso entre el envío de un prompt y la recepción de una respuesta. Los modelos más grandes y los contextos más largos aumentan la latencia: la principal disyuntiva de velocidad en los productos de IA.
La familia de modelos de lenguaje de gran tamaño de Meta publicados de forma abierta, influyente por acercar modelos potentes y ejecutables localmente a investigadores y desarrolladores.
Una red neuronal entrenada con enormes cantidades de texto para predecir el siguiente token, lo que produce comprensión y generación de lenguaje de propósito general.
Un método de ajuste fino eficiente en parámetros que adapta un modelo grande entrenando pequeñas matrices añadidas mientras mantiene congelados los pesos originales.
Un diseño de red neuronal recurrente con compuertas capaz de recordar información a lo largo de secuencias largas: el caballo de batalla del modelado de secuencias antes de los Transformers.
Un estándar abierto para conectar asistentes de IA con herramientas y fuentes de datos externas a través de una interfaz común, de modo que las integraciones se construyen una vez y se reutilizan en distintos modelos.
Una arquitectura que dirige cada entrada hacia unas pocas subredes especializadas en lugar de hacia el modelo completo, lo que ofrece una gran capacidad a un coste menor por consulta.
Un documento breve y estandarizado que describe el uso previsto de un modelo, su rendimiento en distintos grupos y sus limitaciones, para fomentar una publicación transparente y responsable.
Un modelo que funciona con más de un tipo de dato —como texto, imágenes, audio o vídeo— dentro del mismo sistema.
Un método de decodificación que elige el siguiente token del conjunto más pequeño cuyas probabilidades suman p, evitando tanto el texto repetitivo como el incoherente.
Una medida intrínseca estándar de la calidad de un modelo de lenguaje: cuánto le sorprende un texto que no ha visto antes. Cuanto más baja es la perplejidad, mejor predice el modelo un texto real.
El texto de entrada que le das a un modelo para obtener una respuesta. La redacción, los ejemplos y la estructura influyen mucho en la calidad del resultado.
Un ataque que introduce instrucciones maliciosas en la entrada de un modelo —de forma directa o a través de contenido recuperado— para anular su prompt de sistema o secuestrar su comportamiento.
Almacenar los pesos de un modelo con menor precisión numérica para reducir el uso de memoria y acelerar la inferencia, normalmente con poca pérdida de calidad.
Una técnica que recupera documentos relevantes en el momento de la consulta y se los proporciona a un modelo de lenguaje, de modo que su respuesta se basa en fuentes reales y no solo en su memoria.
Poner a prueba deliberadamente un modelo con entradas adversarias para detectar comportamientos dañinos, inseguros o que infrinjan las políticas antes de su despliegue.
Una segunda etapa de recuperación que vuelve a puntuar un conjunto inicial de pasajes candidatos con un modelo más preciso, situando los más relevantes en primer lugar.
Un método de entrenamiento que usa valoraciones de preferencia humanas para enseñar a un modelo qué respuestas prefiere realmente la gente, haciéndolo más útil y mejor alineado.
Una familia de métricas automáticas para la generación de resúmenes que miden la coincidencia entre el texto generado y los resúmenes de referencia humanos.
Relaciones empíricas que muestran cómo el rendimiento de un modelo mejora de forma predecible al aumentar los parámetros, los datos y el cómputo.
Un método de razonamiento que genera varias cadenas de pensamiento para la misma pregunta y devuelve la respuesta en la que coincide la mayoría.
Una arquitectura neuronal de codificador-decodificador que transforma una secuencia en otra: el diseño que hizo posible la traducción automática neuronal y, más tarde, el chat generativo.
Una técnica para acelerar la inferencia en la que un modelo pequeño y rápido redacta varios tokens y un modelo grande los verifica en paralelo, dando una salida más rápida con resultados idénticos.
Un modelo abierto de difusión latente para generar imágenes a partir de texto que hizo posible ejecutar generación de imágenes de alta calidad en hardware de consumo.
Enviar la respuesta de un modelo token a token a medida que se genera, en lugar de esperar a la respuesta completa, de modo que el texto aparece de forma progresiva.
Instrucciones ocultas y de alta prioridad que definen el rol, el tono y las reglas de un modelo antes de que comience la conversación, condicionando todas las respuestas posteriores.
Un parámetro que controla la aleatoriedad de la salida de un modelo: una temperatura baja da respuestas centradas y repetibles; una temperatura alta da respuestas más variadas y creativas.
La unidad que un modelo de lenguaje realmente lee y escribe, normalmente un fragmento de subpalabra, no una palabra completa. Los límites de contexto, el precio y la velocidad se miden todos en tokens.
Ver: Contador de tokens de IA.
Permitir que un modelo active funciones externas —buscar en la web, ejecutar código, consultar una base de datos— y use los resultados devueltos dentro de su respuesta.
La arquitectura de red neuronal que hay detrás de prácticamente todos los modelos de lenguaje de gran tamaño actuales, construida sobre un mecanismo llamado autoatención en lugar de recurrencia o convolución.
Un marco de razonamiento que permite a un modelo explorar varias rutas de solución ramificadas, evaluarlas y retroceder: una búsqueda deliberada en lugar de una única conjetura.
Un modelo generativo que aprende un espacio latente probabilístico, lo que le permite tanto comprimir datos como generar nuevos ejemplos a partir de él.
Una base de datos que indexa y busca por similitud de embeddings en lugar de por coincidencia exacta, lo que le permite encontrar contenido semánticamente relacionado en milisegundos.
Un Transformer aplicado directamente a fragmentos de imagen, lo que demuestra que la arquitectura de los modelos de lenguaje también sobresale en visión artificial.
Incrustar una señal oculta y estadísticamente detectable en el texto generado por IA para poder identificarlo después como producido por una máquina.
El modelo de reconocimiento de voz de OpenAI, entrenado con un conjunto de audio muy amplio y diverso para transcribir y traducir voz de forma fiable en distintos idiomas.
Pedirle a un modelo que realice una tarea sin ejemplos resueltos, apoyándose únicamente en la instrucción y en el conocimiento adquirido durante su preentrenamiento.
Leer sobre los LLM es una cosa; ejecutar el mismo prompt en ChatGPT, Claude, Gemini y Grok es otra muy distinta.
Prueba MultipleChat gratisContinue learning
See the AI subscription that replaces separate ChatGPT, Claude, Gemini and Grok accounts.
Multi-model AIRun the same prompt through ChatGPT, Claude, Gemini and Grok before trusting one answer.
GuideChoose the best model for writing, research, coding, documents, images and business work.
One appUse the major AI models in one workspace for comparison, files and AI Collaboration.
Buyer questionCompare ChatGPT and Claude side by side or let one model review the other.
Buyer intentOne app for several frontier AI models, side-by-side comparison and model collaboration.
PlatformA professional workspace for using several AI models, comparing answers and creating deliverables.
Core conceptUse several frontier models together for stronger answers and fewer blind spots.
ComparisonCompare several AI answers side by side when the output matters.
WorkflowBuild a professional AI stack for documents, research, writing, images and automation.
Free toolsStart with free tools, then upgrade when multi-model workflows save real time.