IBM Research, yapay zeka ajanlarının kurumsal Java framework geçişlerini ne kadar iyi yönettiğini değerlendirmek için tasarlanmış açık bir kıyaslama aracı olan ScarfBench'i tanıttı. Kıyaslama, en büyük engellerin kod çevirisi değil, yapılandırma ve çalışma zamanı bağımlılıkları olduğunu ortaya koyuyor.
Kodlama ajanlarındaki son gelişmeler, yapay zeka destekli modernizasyon konusunda heyecan yarattı. Ancak önemli bir soru hala yanıt bekliyor: Yapay zeka ajanları gerçek dünyadaki kurumsal uygulamaları güvenilir bir şekilde modernize edebilir mi?
Mevcut yazılım mühendisliği kıyaslamaları, hata düzeltme ve kod üretiminde etkileyici ilerlemeler kaydetti, ancak framework geçişi temelde farklı bir zorluk sunuyor. Başarı, yalnızca kod çevirisini değil, aynı zamanda davranışı korumayı, derleme sistemlerini uyarlamayı ve çalışma zamanı bağımlılıklarını yönetmeyi gerektiriyor.
Bu boşluğu doldurmak için IBM Research, Kurumsal Java'da çerçeveler arası geçiş görevlerinde yapay zeka ajanlarını değerlendirmek üzere ScarfBench (Self-Contained Application Refactoring Benchmark)'i oluşturdu. ScarfBench, üç büyük Java ekosistemi olan Spring, Jakarta EE ve Quarkus arasındaki geçişlere odaklanıyor.
Üretilen kodu referans uygulamalarla karşılaştıran geleneksel kıyaslamaların aksine ScarfBench, geçirilen uygulamaların gerçekten derlenip dağıtılıp dağıtılmadığını ve davranışı koruyup korumadığını değerlendiriyor.
Geçiş Neden Zor
Framework geçişi, anotasyonları değiştirmekten çok daha fazlasıdır. Basit bir depo geçişi, bağımlılık enjeksiyonu, kalıcılık yapılandırması, sorgular ve framework tanımlayıcılarında değişiklikler gerektirebilir. Bu parçalardan herhangi birindeki küçük hatalar, başarılı dağıtımı engelleyebilir.

Şekil: Spring → Jakarta Geçiş Örneği
Framework geçişi, yalnızca kaynak kodunu değil, framework anlambilimini de çevirmeyi gerektirir.
ScarfBench'i Tanıtmak
ScarfBench, yapay zeka ajanlarını kurumsal Java framework geçiş görevlerinde değerlendirmek için sistematik bir yol sunar. Uygulamaların başarıyla derlenmesi, doğru şekilde dağıtılması ve davranışsal doğrulamayı geçmesi gerekir. Bu, modernizasyon kalitesinin çok daha gerçekçi bir ölçüsünü sağlar.
Kıyaslama, hem odaklanmış geçiş görevlerini hem de tüm uygulama geçişlerini içerir.

Şekil: ScarfBench Oluşturma Hattı
JSR tabanlı bir kurumsal Java taksonomisinden başlayarak, uzman geçişleri Spring, Jakarta EE ve Quarkus üzerinde doğrulanmış uygulamalar oluşturur.
Sınır Ajanları Nasıl Performans Gösteriyor?
IBM Research, ScarfBench üzerinde birkaç son teknoloji kodlama ajanını değerlendirdi. Geleneksel yazılım mühendisliği kıyaslamalarındaki güçlü performansa rağmen, framework geçişi zor olmaya devam ediyor. Başarı oranları, framework çiftleri arasında önemli ölçüde farklılık gösteriyor ve tüm uygulama geçişleri özellikle zorlayıcı olmaya devam ediyor.

Şekil: Güncel Lider Tablosu

Şekil: Derleme → Dağıtma → Test İlerlemesi
Derleme başarısı, dağıtma başarısını sürekli olarak aşarken, dağıtma başarısı da davranışsal başarıyı aşıyor. Yalnızca derleme başarısı, geçiş kalitesini önemli ölçüde olduğundan fazla tahmin ediyor.

Şekil: Hedef Framework'e Göre Geçiş Sonuçları
Geçiş zorluğu, hedef framework'e güçlü bir şekilde bağlıdır ve Jakarta EE özellikle zorlayıcı olduğunu kanıtlıyor.
Java Modernizasyonu için Yapay Zeka Ajanları Hakkında Öğrendiklerimiz
Başarı oranlarını ölçmenin ötesinde, ScarfBench ajanların modernizasyon sırasında nasıl davrandığını anlamaya yardımcı olur.
Ajanlar Bir Geçişin Ne Zaman Tamamlandığını Güvenilir Bir Şekilde Söyleyebilir mi?
Geçirilmiş bir uygulama, yalnızca gerçekten derlenip çalışıyorsa kullanışlıdır. IBM Research, ajan tarafından bildirilen sonuçları bağımsız derleme doğrulamasıyla karşılaştırdı.
"Claude Code, 30 tüm uygulamadan 29'u için başarılı derleme bildirdi. Bu uygulamalardan yalnızca 22'si gerçekten başarıyla derlendi. Bu arada, ajan tarafından başarısız olarak sınıflandırılan tek uygulama sonunda doğru şekilde derlendi."
— IBM Research
Bu, ajan öz değerlendirmesinin geçiş tamamlama konusunda güvenilir bir sinyal olarak ele alınmaması gerektiğini gösteriyor. Bağımsız derleme ve test doğrulaması hayati olmaya devam ediyor.
Ajanlar Uygulama Bağımlılıklarında Nasıl Gezinir?
Framework geçişleri nadiren tek bir dosyayı veya katmanı etkiler. Yapılandırma, hizmetler, veritabanları ve web bileşenlerindeki değişiklikler genellikle uygulama genelinde kademeli olarak yayılır.
En sık ziyaret edilen katmanlar yapılandırma, web, veritabanı ve hizmet oldu. Yaygın geçişler arasında yapılandırma ↔ web ve hizmet ↔ veritabanı yer aldı. Bu, geçişin basit bir kaynaktan kaynağa dönüşümden ziyade yinelemeli bir bağımlılık çözme süreci olduğunu gösteriyor.
Ajanlar Çabalarının Çoğunu Nerede Harcıyor?
Araştırmacılar, katman tekrar ziyaret sıklığını geçiş çabasının bir temsilcisi olarak kullanarak, yapılandırmanın geçiş çabasına hakim olduğunu buldu. Doğrusal bir şekilde ilerlemek yerine, ajanlar framework farklılıklarını ve bağımlılık sorunlarını çözerken yapılandırma ile ilgili yapılara tekrar tekrar döndü.
Kod Dönüşümüyle İlgili Olmayan Zorluklar Nelerdir?
Her geçiş sorunu kaynak kodundan kaynaklanmaz. Ajanlar, Docker önbellek tutarsızlıkları, bağlantı noktası bağlantı sorunları ve Maven sarmalayıcı ve derleme araçları sorunları dahil olmak üzere çevresel sorunlarla sık sık mücadele etti. Bu operasyonel endişeler, kaynak kodu geçişi büyük ölçüde tamamlanmış olsa bile doğrulamayı sık sık geciktirdi.

Şekil: Hata Modu Dağılımı
Modernizasyon hataları, derleme sistemleri, dağıtım ortamları, bağımlılık enjeksiyonu, veritabanları, uç noktalar, iddialar ve altyapıyı kapsar.
Önemli Çıkarım
Framework modernizasyonundaki en büyük zorluk, Java kodunu çevirmek değildir. Yapılandırma, altyapı ve çalışma zamanı ortamları arasındaki bağımlılık ağını yönetmektir. Sınır ajanları geçiş sürecinin önemli kısımlarını otomatikleştirebilse de, başarılı sonuçlar elde etmek için güvenilir doğrulama ve mimari akıl yürütme kritik olmaya devam etmektedir.
ScarfBench bu zorlukları ortaya çıkarmaya yardımcı olur ve gerçekten otonom uygulama modernizasyonuna doğru ilerlemeyi ölçmek için standart bir yol sağlar.
ScarfBench'i Keşfedin
ScarfBench, araştırmacılar ve uygulayıcılar için açık bir kaynak olarak tasarlanmıştır. Kaynaklar arasında bir kıyaslama veri kümesi, değerlendirme altyapısı, halka açık lider tablosu, dokümantasyon ve açık kaynak kod bulunur. Araştırmacılar, ajan mimarilerini ve tekniklerini karşılaştırabilir. Uygulayıcılar, modernizasyon çözümlerini üretim ortamlarında dağıtmadan önce değerlendirmek için ScarfBench'i kullanabilir.
- Web Sitesi: https://scarfbench.info
- Veri Kümesi: https://huggingface.co/datasets/ibm-research/ScarfBench
- Space: https://huggingface.co/spaces/ibm-research/ScarfBench
- GitHub Deposu: https://github.com/scarfbench/scarfbench
- Lider Tablosu: https://scarfbench.info/leaderboard
- Makale: https://arxiv.org/abs/2605.06754
Framework geçişi, yapay zeka destekli yazılım mühendisliğindeki en büyük çözülmemiş sorunlardan biri olmaya devam ediyor. IBM Research, ScarfBench'in topluluğun ilerlemeyi ölçmesine ve yapay zeka destekli uygulama modernizasyonunun bir sonraki neslini hızlandırmasına yardımcı olacağını umuyor. Ekip, araştırmacıları, uygulayıcıları ve framework yazarlarını katkıda bulunmaya ve yapay zeka ajanlarının kurumsal yazılım modernizasyonunda neler başarabileceğinin sınırlarını zorlamaya davet ediyor.



