شعار Microsoft Phi
شعار Microsoft Phi

Microsoft Phi

Microsoft

نماذج اللغة الكبيرة

نماذج اللغة الكبيرة

Microsoft Phi

Microsoft Phi

Phi-4-reasoning-vision-15B نموذج مدمج مفتوح الأوزان متخصص في الاستدلال متعدد الوسائط للرياضيات والعلوم والمخططات وفهم واجهات المستخدم. نتائج Microsoft قوية قياساً إلى حجمه، لكنها صادرة عن المزود ولا تجعل Phi نموذجاً عاماً من فئة النماذج المتقدمة.

CURRENT MODEL SNAPSHOT

الموفر: Microsoft Research
المرساة الحالية: Phi-4-reasoning-vision-15B
دورة الحياة: الحالية
الأوزان: الوزن المفتوح
تمت المراجعة: 21 يوليو 2026

تدرج تجريدي أزرق وأرجواني

ميزة Phi هي التخصص العالي مقابل كل معلمة

أصدرت Microsoft Phi-4-reasoning-vision-15B في 4 مارس 2026. يجمع نموذج الوزن المفتوح المكون من 15 مليار معلمة بين تحليل النص والصورة، مع التركيز بشكل خاص على الرياضيات والعلوم والرسوم البيانية والرسوم البيانية وأساس واجهة المستخدم. يمكنه التبديل بين سلوك الاستدلال وغير الاستدلال بدلاً من فرض آثار طويلة لكل إدخال.

يواصل Phi استراتيجية نموذج اللغة الصغيرة من Microsoft: تركيز التدريب وجودة البيانات بحيث يمكن للنموذج المدمج أداء المهام التي تتطلب عادةً نقطة تفتيش أكبر بكثير. وتتمثل النتيجة العملية في بصمة ذاكرة أصغر، وتكلفة خدمة أقل، ونشر أكثر واقعية للقطاع الخاص أو للحافة المجاورة.

لا يعني الحجم الصغير القدرة العالمية. أقوى دليل للنموذج هو على شكل المجال، ويجب عدم الخلط بين فهم واجهة المستخدم الخاصة به والإذن بتنفيذ إجراءات واجهة المستخدم الرسومية التعسفية بدون ضوابط.

النتائج المنشورة قوية بالنسبة لـ 15B، ولكن تقارير Microsoft التي يديرها الموفر 84.8 عن AI2D، 83.3 على ChartQA، و64.4 على HallusionBench، و44.9 على MathVerse في عمليات إعادة التشغيل. نشر الفريق التفاصيل الفنية وسجلات التقييم، مما أدى إلى تحسين إمكانية الفحص، ولكن لا يزال موفر النموذج ينتج القياسات.


تتوافق هذه المهام مع فرضية المنتج: التفكير البصري المنظم، والمخططات، والرسوم البيانية، والمحتوى الرياضي. وهي لا تحدد أداءً حدوديًا في الأبحاث المفتوحة، أو الوكلاء طويلي الأمد، أو العمليات متعددة اللغات، أو الحكم التجاري الواسع.

  • يجب مقارنة النموذج مع أنظمة الوسائط المتعددة المدمجة الأخرى، وليس فقط النماذج الحدودية التي تزيد عن 100B+.

  • يجب اختبار تأريض واجهة المستخدم للتأكد من دقة الإحداثيات، واستعادة الحالة التي لا معنى لها، و منع الإجراءات المدمرة.

  • يجب مقارنة أوضاع الاستدلال وغير الاستدلال بشكل منفصل فيما يتعلق بزمن الاستجابة والتكلفة.

جدوى المؤسسات: نموذج متخصص في الاستدلال البصري

يُعد Phi مقنعًا لتحليل المخططات والمخططات وفهم واجهة المستخدم والمستندات العلمية وسير العمل الخاص متعدد الوسائط حيث يكون نموذج 15B جذابًا من الناحية التشغيلية. إنه ليس النموذج الوحيد المناسب لكل وكيل مؤسسة؛ يمكن أن يكون توجيه المهام المرئية المتخصصة إلى Phi أكثر مصداقية من مطالبتها باستبدال نموذج حدودي واسع.

كيف يمكننا تقييمه

قم ببناء مجموعة اختبار من مخططات حقيقية، وجداول ممسوحة ضوئيًا، وواجهات، ورسوم بيانية، بما في ذلك التسميات المتعارضة وحالة واجهة المستخدم المتغيرة. قياس دقة المهمة، والعناصر المهلوسة، وأخطاء الإحداثيات، والاسترداد، وزمن الوصول، والذاكرة، وجهد المراجع. يلزم الحصول على موافقة قبل اتخاذ أي إجراء لاحق.

الأدلة المستخدمة

حالة دعم Beam AI

قيد التقييم. لا تؤكد هذه الصفحة تكامل Beam، أو وقت التشغيل المدعوم، أو نموذج الإذن لإجراءات واجهة المستخدم الرسومية.

Use case 1

محلل الرسوم البيانية والمخططات

اختبر مخططات الأعمال الحقيقية والأرقام العلمية والرسوم البيانية التي تحتوي على وسائل إيضاح مضللة وتسميات مفقودة. تسجيل الدقة الرقمية، والادعاءات غير المدعومة، والاستشهادات للمناطق المرئية، وزمن الاستجابة، ووقت المراجعة.

Use case 2

مساعد تأريض واجهة المستخدم

تقييم فهم لقطات شاشة التطبيق والنماذج ضمن التخطيطات المتغيرة وعناصر التحكم المعطلة والحالة القديمة. قم بقياس تحديد العناصر ودقة الإحداثيات والاسترداد والإجراءات التدميرية المحظورة.

Use case 3

مراجعة المستندات العلمية الخاصة

قم بتشغيل نموذج 15B على المستندات الفنية الخاضعة للرقابة باستخدام المعادلات والصور. تتبع الاستخراج ودقة الاستدلال والإغفال والهلوسة واستخدام الذاكرة وتصحيحات المراجع.

Use case 4

جهاز التوجيه ذو الطراز المضغوط

توجيه مهام التفكير البصري إلى Phi والبحث الأوسع إلى نموذج آخر. قم بقياس دقة التوجيه، والإكمال الشامل، وزمن الاستجابة المختلط والتكلفة، وما إذا كان التخصص يقلل من ديون المراجعة.

النماذج اللغوية الكبيرة الأخرى

إليك قائمة بنماذج اللغة الكبيرة التي يمكن استخدامها مع Beam

ابدأ اليوم

Build AI agents with the right model

See how Beam can orchestrate governed AI workflows across the model family that fits your requirements.

ابدأ اليوم

Build AI agents with the right model

See how Beam can orchestrate governed AI workflows across the model family that fits your requirements.

ابدأ اليوم

Build AI agents with the right model

See how Beam can orchestrate governed AI workflows across the model family that fits your requirements.

الأسئلة الشائعة

الأسئلة الشائعة

Model selection, deployment, governance, and Beam support questions answered.

ما هو Phi-4-reasoning-vision-15B؟

إنه نموذج Microsoft المدمج ذو الوزن المفتوح 15B للاستدلال متعدد الوسائط، وخاصة الرياضيات والعلوم والمخططات والرسوم البيانية وأسس واجهة المستخدم، مع السلوك المنطقي وغير المنطقي.

ما مدى قوة معايير Phi المرئية؟

سجلت Microsoft 84.8 على AI2D، 83.3 على ChartQA، 64.4 على HallusionBench، و44.9 على MathVerse. هذه هي النتائج التي يديرها الموفر مع سياق تقني منشور، وليست أدلة إنتاج مستقلة.

هل Microsoft Phi ذو وزن مفتوح؟

نعم. تم نشر أوزان النماذج للتحميل. تحقق من الترخيص الدقيق والمستودع وبطاقة النموذج والإشعارات وتبعيات وقت التشغيل والمجموع الاختباري للمنتج قبل النشر.

هل يمكن لـ Phi التحكم في برامج المؤسسة بأمان؟

يمكن أن يدعم التأريض البصري وكلاء واجهة المستخدم، ولكنه لا يجعل الإجراء المستقل آمنًا. إحداثيات الاختبار، والحالة التي لا معنى لها، وحدود الأذونات، والتأكيد، وحظر الإجراءات التدميرية، والتسجيل، والاسترداد.

هل يدعم Beam الرؤية المنطقية Phi-4 في الإنتاج؟

دعم Beam قيد التقييم حاليًا. لا يوجد وقت تشغيل معتمد أو نمط تحكم في واجهة المستخدم الرسومية أو معيار الحزمة مرتبط بهذا السجل.