Eskişehir Teknopark'ta yazılım geliştirici olarak çalışan bilgisayar mühendisi İrfan Özdemir, Anthropic ve OpenAI'ın aynı gün piyasaya sürdüğü yeni modelleri kendi şirketinin iş akışları üzerinden karşılaştırdı ve sonuçları Türkinform'a özel olarak paylaştı.
Özdemir'in testlerinde hız ve maliyette Anthropic'in Claude Opus 5.5 modeli öne çıktı. Hata payının kabul edilmediği işlerde en güvenilir sonucu ise OpenAI'ın bir önceki nesil modeli GPT-5.5 verdi.
Anthropic, Opus 5.5'i 22 Eylül'de duyurdu. OpenAI de yaklaşık bir buçuk saat sonra GPT-6 Sol ve GPT-6 Luna modellerini tanıttı. Özdemir'in paylaştığı sonuçlar genel bir sıralama değil, şirketinin kendi iş akışlarına göre kurduğu testlere dayanıyor.
OPUS 5.5 İŞİ YARI SÜREDE BİTİRDİ
Opus 5.5'i bu model döneminin açık ara kazananı olarak gören Özdemir, modelin bir önceki sürüme göre işleri yarı sürede tamamladığını anlattı. Özdemir, maliyetin de belirgin biçimde düştüğünü, doğruluk oranının korunduğunu ve bazı testlerde daha iyi sonuç alındığını belirtti.
Anthropic'in açıklamasına göre Opus 5.5, Opus 5'ten yüzde 30'un üzerinde daha hızlı yanıt üretiyor ve tipik iş yüklerinde yüzde 40 daha ucuza mal oluyor. Modelin milyon token başına fiyatı girdi için 4 dolar, çıktı için 20 dolar. GitHub da Opus 5.5'in kodlama görevlerini Opus 5'e yakın başarıyla ama çok daha az adım ve token kullanarak çözdüğünü açıkladı.
GPT-6 SOL DOĞRULUKTA GERİLEDİ
OpenAI'ın yeni modellerinin fiyat ve hız tarafında başarılı olduğunu söyleyen Özdemir, içerik doğruluğunda ise yüzde 20'ye yakın bir gerileme gözlemlediklerini aktardı.
OpenAI, GPT-6 Sol'un fiyatını milyon token başına girdi için 2 dolar, çıktı için 10 dolar olarak açıkladı. Fiyat, önceki GPT-5.6 Sol'un yarısı ve Opus 5.5'in de yarısı düzeyinde. OpenAI ayrıca GPT-6 Sol'un bir önceki modele göre yaklaşık yarı yarıya daha az hata yaptığını duyurdu. Özdemir'in şirket içi testlerinde ortaya çıkan tablo, OpenAI'ın açıklamasıyla örtüşmüyor.
Şirketlerin kendi yayımladığı test sonuçları farklı ölçütlere dayandığı için birbiriyle doğrudan karşılaştırılamıyor.
EN GÜVENİLİR SONUÇ GPT-5.5'TEN GELDİ
Özdemir'e göre testlerin en şaşırtıcı sonucu, en doğru ve en güvenilir yanıtları hâlâ GPT-5.5'in vermesi oldu. Özdemir, özellikle finansal analiz ve doküman inceleme gibi en küçük hatanın bile kabul edilmediği işlerde GPT-5.5'in rakiplerinin önünde kaldığını vurguladı.
FABLE VE ASTRA TESTE ALINMADI
Özdemir, Anthropic'in Fable modelini ve OpenAI'ın Astra modelini teste dahil etmediklerini de açıkladı. Veri saklama politikaları ve yüksek maliyet nedeniyle bu modellerin şirket içi araçlarda kullanılmadığını belirten Özdemir, bu yüzden iki model için karşılaştırma yapılmadığını söyledi.
Anthropic, haziranda Fable 5 ve Mythos sınıfı modellere gönderilen verilerin 30 gün saklanması şartını getirmişti. Microsoft ve GitHub gibi şirketler bu şart nedeniyle Fable 5'e erişimi kısıtlamıştı. OpenAI'ın Astra'sı ise GPT-6 tabanlı ve hukuki araştırma için geliştirilmiş bir model.
YAZILIMCILAR HANGİ ARAÇLARI KULLANIYOR?
Kod yazan yapay zeka ajanları bir görevi tamamlarken modele çok sayıda istek gönderir. Hız ve token fiyatı, bu yüzden yazılım ekipleri için doğrudan maliyet kalemine dönüşür. Yazılım geliştiricilerin yapay zekayla en sık çalıştığı araçlar şunlar.
- GitHub Copilot, Visual Studio Code, JetBrains ve Xcode gibi geliştirme ortamlarında çalışıyor. Opus 5.5 ve GPT-6 Sol, 22 Eylül'den itibaren Copilot'un ücretli planlarında yer alıyor.
- OpenAI'ın kodlama aracı Codex, GPT-6 Sol ile çalışıyor.
- Anthropic'in Claude Code aracı, kod yazma ve düzenleme işlerini terminal üzerinden yürütüyor.
- Cursor gibi yapay zekâ destekli kod editörleri, farklı şirketlerin modellerini aynı ekrandan kullanma imkânı sunuyor.
Türkinform'a daha önce konuşan yazılım mühendisi Burak Keskin de Claude ve Cursor gibi araçların yaygınlaşmasıyla bir haftalık yazılım görevlerinin yarım güne indiğini anlatmıştı. Keskin, yeni modellerin çıktıkları gün şirket sistemlerine geldiğini ancak çok fazla token harcadığını, farklı modelleri tek panelden kullandıran uygulamalar bulunduğunu da belirtmişti.





