Modelos lingüísticos de gran tamaño

Modelos lingüísticos de gran tamaño

NVIDIA Nemotron

NVIDIA Nemotron

Nemotron 3 Ultra es un MoE de pesos abiertos con 550.000 millones de parámetros totales y 55.000 millones activos, arquitectura híbrida Mamba-Attention y foco en agentes de larga duración. Su rendimiento y transparencia son excepcionales; también lo son el checkpoint NVFP4 de 352 GB y la dependencia del stack de NVIDIA.

CAPTURA DEL MODELO ACTUAL

Proveedor: NVIDIA
Ancla actual: Nemotron 3 Ultra
Ciclo de vida: actual
Pesos: Peso abierto con datos y recetas publicados
Revisado: 21 Julio de 2026

Degradado abstracto azul y morado

Nemotron 3 Ultra optimiza la economía de los agentes de larga duración

NVIDIA lanzó Nemotron 3 Ultra el 4 de junio de 2026. El modelo tiene 550 mil millones de parámetros totales con alrededor de 55 mil millones activos por token, una arquitectura híbrida de mezcla de expertos Mamba-Attention, soporte nativo NVFP4 y una ventana de contexto de un millón de tokens. NVIDIA publica pesos, información de datos de entrenamiento y recetas, lo que hace que la familia sea inusualmente transparente para un modelo de esta escala.

La arquitectura está optimizada para un rendimiento de inferencia sostenido en lugar de una atención máxima y densa en cada paso. Esto es importante para los agentes que generan grandes rastros, llaman a muchas herramientas o mantienen una larga memoria de trabajo. También se alinea estrechamente con la pila de hardware y software de NVIDIA, lo que puede ser una ventaja para una familia de NVIDIA existente y una dependencia para todos los demás.

El punto de control NVFP4 es de aproximadamente 352 GB. Las ponderaciones abiertas mejoran el control y la auditabilidad; no hacen de Ultra una implementación pequeña.

La evidencia más sólida combina rendimiento y benchmarks agénticos

En el lanzamiento, Artificial Analysis informó una puntuación del Índice de Inteligencia de 47,7 según su metodología vigente en ese momento y un rendimiento superior a 400 tokens de salida por segundo en un Blackbox alojado. configuración. Las páginas del modelo actual pueden mostrar una puntuación normalizada diferente a medida que la suite evoluciona, por lo que los informes deben conservar la fecha y la metodología de la evaluación.

NVIDIA informa 91 en PinchBench, 33 en EnterpriseOps-Gym, 54 en Terminal-Bench 2.0, 82 en IFBench, 1448 en GDPval-AA, 56 en ProfBench Search y 95 en RULER por un millón de tokens. La compañía también informa ventajas sustanciales de rendimiento sobre pares abiertos seleccionados y aproximadamente un 30% menos de costo de tarea en su evaluación.

  • Las pruebas de lanzamiento independientes respaldan la afirmación de que Ultra puede ser extremadamente rápido en una infraestructura optimizada.

  • Las tablas de referencia de proveedores aún requieren hardware, tiempo de ejecución, muestreo y contexto de versión de comparación exactos.

  • El caso de negocio debe incluir la disponibilidad del acelerador y la ingeniería de la plataforma, no solo el precio simbólico.

El caso empresarial: transparencia y potencia con una gran huella de sistemas

Nemotron es atractivo para la orquestación de agentes de larga duración, la codificación y la inferencia privada de alto rendimiento, especialmente donde ya existe la infraestructura y la experiencia de NVIDIA. No es una buena opción para equipos que desean un punto de control compacto, servicio neutral con respecto al proveedor o ingeniería de inferencia mínima.

Cómo lo evaluaríamos

Ejecutar un proceso de agente de varias horas con fallas de herramientas, puntos de control y pruebas de aceptación estrictas en el hardware previsto. Mida los resultados aceptados, la recuperación, los tokens, el rendimiento, el tiempo hasta el primer token, la energía, la ocupación del acelerador y el esfuerzo del revisor. Compare la ruta optimizada de NVIDIA con una alternativa viable, incluidos los costos de personal y la dependencia.

Evidencia utilizada

Estado de soporte de Beam AI

En evaluación. No se adjunta ningún punto de referencia de Beam ni topología de producción aprobada a este registro. Valide el punto de control exacto, el tiempo de ejecución y la infraestructura.

Caso de uso 1

Agente de operaciones de larga duración

Ejecute un proceso de varias horas con API, puntos de control, reanudabilidad, aprobación y fallas deliberadas. Califique los resultados completados, la recuperación, las acciones no admitidas, el total de tokens, la ocupación del acelerador y el tiempo del revisor.

Caso de uso 2

Flota de codificación de alto rendimiento

Evalúe las tareas de repositorio paralelo en la pila NVIDIA prevista. Realice un seguimiento de los parches aceptados, las regresiones, el rendimiento, el tiempo de cola, la energía, la utilización del hardware y el costo por cambio aceptado.

Caso de uso 3

Investigación privada de un millón de tokens

Utilice evidencia interna controlada en un contexto extenso y luego pruebe la recuperación con contradicciones plantadas y dependencias distantes. Califique citas, omisiones, conclusiones no respaldadas, latencia y costo de memoria.

Caso de uso 4

Evaluación de plataforma de modelo abierto

Compare la ruta de servicio completa de NVIDIA con una alternativa neutral del proveedor. Incluya pesos, tiempo de ejecución, cuantificación, observabilidad, seguridad, parches, dotación de personal, suministro de hardware, reversión y costo operativo de tres años.

Otros LLM

Aquí tienes una lista de LLMs que se pueden utilizar con Beam

Empieza hoy

Desarrolle agentes de IA con el modelo idóneo

Descubra cómo Beam puede orquestar flujos de trabajo de IA gobernados a través de la familia de modelos que mejor se adapte a sus requisitos empresariales.

Empieza hoy

Desarrolle agentes de IA con el modelo idóneo

Descubra cómo Beam puede orquestar flujos de trabajo de IA gobernados a través de la familia de modelos que mejor se adapte a sus requisitos empresariales.

Empieza hoy

Desarrolle agentes de IA con el modelo idóneo

Descubra cómo Beam puede orquestar flujos de trabajo de IA gobernados a través de la familia de modelos que mejor se adapte a sus requisitos empresariales.

PREGUNTAS FRECUENTES

Preguntas frecuentes

Respuestas a sus preguntas sobre selección de modelos, despliegue, gobernanza y soporte de Beam.

¿Qué es Nemotron 3 Ultra?

Es el híbrido Mamba-Attention de 550B de parámetros y 550B de activos de NVIDIA MoE para agentes y razonamiento de larga duración, con una ventana de contexto de un millón de tokens y pesos abiertos, información de datos y recetas.

¿Qué tan rápido es Nemotron 3 Ultra?

Artificial Analysis informó más de 400 tokens de salida por segundo en una configuración Blackbox optimizada en el momento del lanzamiento. El rendimiento depende en gran medida del hardware, el tiempo de ejecución, el procesamiento por lotes y la cuantificación, así que reprodúzcalo en la pila deseada.

¿Qué tan sólidos son sus puntos de referencia?

NVIDIA informa resultados sólidos de agente y contexto largo, como 91 en PinchBench y 95 en RULER a 1M. Artificial Analysis informó un índice de inteligencia de 47,7 en el momento de la publicación según su metodología vigente en ese momento. Conserve fechas y configuraciones al comparar.

¿Nemotron es fácil de autohospedar?

Es de peso abierto pero no liviano. El punto de control NVFP4 es de aproximadamente 352 GB, y obtener el rendimiento principal requiere una gran capacidad de acelerador y experiencia en inferencia de NVIDIA.

¿Beam es compatible con Nemotron 3 Ultra en producción?

El soporte de Beam está actualmente bajo evaluación. No se adjunta ninguna topología de producción aprobada ni punto de referencia de Beam a este registro.