Microsoft Phi
Microsoft
Phi-4-reasoning-vision-15B es un especialista multimodal compacto y de pesos abiertos para matemáticas, ciencias, gráficos y comprensión de interfaces. Los resultados publicados por Microsoft son sólidos para su tamaño, pero proceden del proveedor y no convierten a Phi en un modelo generalista de frontera.
CAPTURA DEL MODELO ACTUAL
Proveedor: Microsoft Research
Ancla actual: Phi-4-reasoning-vision-15B
Ciclo de vida: Actual
Pesos: Open-weight
Revisado: 21 de julio de 2026

La ventaja de Phi es la especialización por parámetro
Microsoft lanzó Phi-4-reasoning-vision-15B el 4 de marzo de 2026. El parámetro de 15 mil millones El modelo de peso abierto combina razonamiento de texto e imágenes, con especial énfasis en matemáticas, ciencias, gráficos, diagramas y fundamentos de la interfaz de usuario. Puede alternar entre comportamiento de razonamiento y no razonamiento en lugar de forzar largos seguimientos para cada entrada.
Phi continúa la estrategia de modelo de lenguaje pequeño de Microsoft: concentrar el entrenamiento y la calidad de los datos para que un modelo compacto pueda realizar tareas que normalmente requieren un punto de control mucho más grande. La recompensa práctica es una menor huella de memoria, un menor costo de servicio y una implementación privada o adyacente al borde más realista.
Compacto no significa universalmente capaz. La evidencia más sólida del modelo tiene forma de dominio, y su comprensión de la interfaz de usuario no debe confundirse con el permiso para ejecutar acciones arbitrarias de la GUI sin controles.
Los resultados publicados son fuertes para 15B, pero proceden del proveedor
Microsoft informa 84,8 en AI2D, 83,3 en ChartQA, 64,4 en HalllusionBench y 44,9 en MathVerse en sus reposiciones. El equipo publicó registros de evaluación y detalles técnicos, lo que mejora la inspeccionabilidad, pero las mediciones aún las produce el proveedor del modelo.
Esas tareas se alinean con la tesis del producto: razonamiento visual estructurado, cuadros, diagramas y contenido matemático. No establecen un rendimiento de frontera en investigación abierta, agentes de larga duración, operaciones multilingües o juicio empresarial amplio.
El modelo debe compararse con otros sistemas multimodales compactos, no solo con modelos de frontera de más de 100 mil millones.
La conexión a tierra de la interfaz de usuario debe probarse para determinar la precisión de las coordenadas, la recuperación en estado inactivo y prevención de acciones destructivas.
Los modos de razonamiento y no razonamiento deben compararse por separado en cuanto a latencia y costo.
El caso empresarial: un modelo enfocado en razonamiento visual
Phi es atractivo para el análisis de gráficos y diagramas, la comprensión de la interfaz de usuario, los documentos científicos y los flujos de trabajo multimodales privados donde un modelo 15B es operativamente atractivo. No es el único modelo adecuado para todos los agentes empresariales; enrutar tareas visuales especializadas a Phi puede ser más creíble que pedirle que reemplace un modelo de frontera amplia.
Cómo lo evaluaríamos
Construir un conjunto de pruebas a partir de gráficos reales, tablas escaneadas, interfaces y diagramas, incluidas etiquetas adversas y cambios en el estado de la interfaz de usuario. Mida la precisión de las tareas, los elementos alucinados, los errores de coordinación, la recuperación, la latencia, la memoria y el esfuerzo del revisor. Requerir aprobación antes de cualquier acción consecuente.
Evidencia utilizada
Estado de soporte de Beam AI
En evaluación. Esta página no confirma una integración de Beam, un tiempo de ejecución compatible o un modelo de permiso para acciones de GUI.
Caso de uso 1
Analista de gráficos y diagramas
Pruebe gráficos comerciales reales, cifras científicas y diagramas con leyendas engañosas y etiquetas faltantes. Califique la precisión numérica, las afirmaciones no respaldadas, las citas a regiones visuales, la latencia y el tiempo de revisión.
Caso de uso 2
Asistente de conexión a tierra de la interfaz de usuario
Evalúe la comprensión de las capturas de pantalla y los formularios de la aplicación en diseños modificados, controles deshabilitados y estado obsoleto. Mida la identificación de elementos, la precisión de las coordenadas, la recuperación y las acciones destructivas bloqueadas.
Caso de uso 3
Revisión de documentos científicos privados
Ejecute el modelo 15B en documentos técnicos controlados con ecuaciones e imágenes. Realice un seguimiento de la extracción, la precisión del razonamiento, las omisiones, las alucinaciones, el uso de la memoria y las correcciones del revisor.
Caso de uso 4
Enrutador de modelo compacto
Dirija las tareas de razonamiento visual a Phi y la investigación más amplia a otro modelo. Mida la precisión del enrutamiento, la finalización de un extremo a otro, la latencia y el costo combinados, y si la especialización reduce la deuda de revisión.

Otros LLM
Aquí tienes una lista de LLMs que se pueden utilizar con Beam
PREGUNTAS FRECUENTES
Preguntas frecuentes
Respuestas a sus preguntas sobre selección de modelos, despliegue, gobernanza y soporte de Beam.
¿Qué es Phi-4-reasoning-vision-15B?
Es el modelo compacto de peso abierto 15B de Microsoft para razonamiento multimodal, especialmente matemáticas, ciencias, gráficos, diagramas y fundamentos de la interfaz de usuario, con comportamiento de razonamiento y no razonamiento.
¿Qué tan sólidos son los puntos de referencia visuales de Phi?
Microsoft informa 84,8 en AI2D, 83,3 en ChartQA, 64,4 en HalllusionBench y 44,9 en Matemáticas. Estos son resultados realizados por proveedores con contexto técnico publicado, no evidencia de producción independiente.
¿Microsoft Phi es de peso abierto?
Sí. Los pesos de los modelos están publicados para su descarga. Verifique la licencia exacta, el repositorio, la tarjeta de modelo, los avisos, las dependencias de tiempo de ejecución y la suma de verificación de artefactos antes de la implementación.
¿Puede Phi controlar el software empresarial de forma segura?
La conexión a tierra visual puede admitir agentes de interfaz de usuario, pero no hace que la acción autónoma sea segura. Coordenadas de prueba, estado obsoleto, límites de permisos, confirmación, bloqueo de acciones destructivas, registro y recuperación.
¿Beam admite la visión de razonamiento Phi-4 en producción?
El soporte de Beam está actualmente bajo evaluación. No se adjunta ningún tiempo de ejecución aprobado, patrón de control de GUI ni punto de referencia de Beam a este registro.





