Microsoft, Karmaşık Akıl Yürütme İçin Yeni Phi-4 Modellerini Açık Kaynak Olarak Yayınladı
Microsoft AI, karmaşık akıl yürütme görevlerinde yüksek performans göstermesi amacıyla geliştirdiği yeni Phi-4 akıl yürütme (reasoning) model ailesini duyurdu.- Yayınlanma: 15:52 - 26 Eylül 202526 Eylül 2025 - 15:52
- Güncelleme: 15:52 - 26 Eylül 2025
- 286 kez okundu

Microsoft AI, karmaşık akıl yürütme görevlerinde yüksek performans göstermesi amacıyla geliştirdiği yeni Phi-4 akıl yürütme (reasoning) model ailesini duyurdu. 14 milyar parametrelik Phi-4 temel modelinden türetilen Phi-4-reasoning ve Phi-4-reasoning-plus modelleri, açık ağırlık (open-weight) lisansıyla araştırmacıların ve geliştiricilerin kullanımına sunuldu.
Yeni Modeller Karmaşık Akıl Yürütme Görevleri İçin Geliştirildi
Büyük dil modellerindeki (LLM) genel ilerlemelere rağmen, matematiksel problem çözme, algoritmik planlama veya kodlama gibi yoğun akıl yürütme gerektiren görevlerdeki performans, genellikle model boyutu, eğitim metodolojisi ve çıkarım zamanı yetenekleri tarafından kısıtlanmaktadır. Microsoft, bu sınırlamaları aşmak ve özellikle çok adımlı çıkarım yapabilen daha küçük boyutlu modeller geliştirmek amacıyla 14 milyar parametrelik Phi-4 tabanlı yeni modellerini tanıttı. Bu modeller, özellikle matematik, bilimsel alanlar ve yazılımla ilgili problem çözmede karmaşık akıl yürütme yeteneklerini geliştirmek üzere optimize edildi.Özel Eğitim Yöntemleri ve Teknik İyileştirmeler Uygulandı
Phi-4 akıl yürütme modellerinin geliştirilmesinde hedefe yönelik eğitim yöntemleri ve mimari iyileştirmeler kullanıldı. Başlıca teknikler şunlardır:- Yapılandırılmış Denetimli İnce Ayar (SFT): Modeller, olgusal bilgiden ziyade çok adımlı akıl yürütmeyi öne çıkaran, özellikle Phi-4'ün temel yeteneklerinin sınırında yer alan (boundary cases) 1.4 milyondan fazla problem içeren bir veri setiyle ince ayarlandı. Yanıtlar, yüksek akıl yürütme modunda çalışan o3-mini modeli kullanılarak sentetik olarak üretildi.
- Düşünce Zinciri (Chain-of-Thought) Formatı: Modelin akıl yürütme adımlarını nihai cevaptan ayırmasını teşvik etmek amacıyla, eğitim sırasında belirgin
<think>etiketleri kullanılarak yapılandırılmış çıktı üretmesi sağlandı. - Genişletilmiş Bağlam Penceresi: RoPE (Rotary Position Embedding) temel frekansı değiştirilerek modelin 32.000 token'lık bir bağlam penceresini desteklemesi sağlandı. Bu, özellikle çok turlu veya uzun formattaki sorularda daha derin çözüm izlerine olanak tanıyor.
- Pekiştirmeli Öğrenme (Phi-4-reasoning-plus için): Phi-4-reasoning-plus modeli, özellikle yarışma seviyesi matematik gibi yüksek varyanslı görevlerde performansı artırmak amacıyla, yaklaşık 6.400 matematik probleminden oluşan özel bir set üzerinde Grup Göreceli Politika Optimizasyonu (GRPO) tekniği ile daha da iyileştirildi. Ödül fonksiyonu, doğru, öz ve iyi yapılandırılmış çıktıları teşvik ederken, gereksiz ayrıntıyı, tekrarları ve format ihlallerini cezalandıracak şekilde tasarlandı.






