ThinkingBox: Ajanları cümlelerine değil, arkalarında bıraktıkları kayıtlara göre değerlendiren benchmark
Microsoft ve Hugging Face ortak blog yazısında ThinkingBox tanıtılıyor. ThinkingBox, ajanları ürettikleri cümlelere göre değil arkalarında bıraktıkları kayıtlara göre değerlendiriyor ve bunu üst üste yirmi kez yapıp yapamadıklarını sorguluyor. 507 durumlu iş akışını kapsayan benchmark, her iş akışını çeşitli LLM modellerine karşı 20 kez çalıştırıyor. Ortak küme ablasyonunda 121.680 geçerli denemeden 79.853'ü yürütülebilir kontrollerde başarısız oluyor; başarısızlıkların yaklaşık beşte dördü akıl yürütme değil araç kullanımından kaynaklanıyor. ThinkingBox artık Hugging Face üzerinden hem harness hem de veri kümesi olarak erişilebilir durumda.
ThinkingBox nedir?
Microsoft ve Hugging Face ortak blog yazısında ThinkingBox tanıtılıyor. ThinkingBox, ajanları ürettikleri cümlelere göre değil, arkalarında bıraktıkları kayıtlara göre değerlendiriyor. Değerlendirme, ajanların bunu üst üste yirmi kez yapıp yapamadığını sorguluyor.
ThinkingBox, bir ajanı izole MCP araç oturumlarına karşı çalıştırıyor ve ardından bıraktığı terminal arka uç durumunu ve yan etkileri değerlendiriyor. ThinkingBox artık Hugging Face üzerinden erişilebilir durumda ve hem harness hem de veri kümesi olarak bulunuyor.
Blog yazısı Microsoft ve Hugging Face ortak yayını. Yazıda Tommy Guy, Sergio Paniego ve stajyerler Zhuochun Li, Ali Keramati ve Youngmin Ko'nun katkıları özellikle teşekkür edilmektedir.
Örnek vaka: çözüldü denen ticket aslında beklemede
Örnekte müşterinin mutfak aleti 745 dolar değerinde. Mutfak aleti Nashville dağıtım merkezinde kurye istisnası durumunda takılı kalmış ve tahmini teslim tarihini on beş gün geçmiştir.
Örnekteki AI ajanı dokuz araç çağrısı yapmıştır. Buna rağmen örnekte başarısız olan yürütülebilir kontrol, ticket durumunun çözüldü olarak işaretlendiği ancak gerekli son durumun beklemede olduğu tek bir alandır.
Ölçek ve başarısızlık tablosu
ThinkingBox 507 durumlu iş akışını kapsamaktadır. Her iş akışı çeşitli LLM modellerine karşı 20 kez çalıştırılmaktadır. Her görev, aynı temiz arka uçtan başlayarak 20 bağımsız kez çalıştırılmaktadır.
Ortak küme ablasyonu 12 LLM modeli genelinde 121.680 geçerli denemeyi kapsamaktadır. Bu denemelerden 79.853'ü yürütülebilir kontrollerde başarısız olmuştur.
Bu başarısızlıkların %67,24'ü temiz sonlanmış, durum değiştiren bir araç çağırmış ve son araç hatası bildirmemiştir. Yürütülebilir kontroller bu başarısızlıkların %77,61'inde yanlış alan değerleri bulmuştur. Aynı kontroller başarısızlıkların %43,30'unda istenmeyen ek etkiler ve %25,36'sında eksik gerekli etkiler tespit etmiştir.
Üç metrik: pass@1, pass@20 ve observed 20/20
pass@1 tüm denemelerin başarılı olma oranını ölçer. pass@20, 20 denemede en az bir kez çözülen görevlerin oranını ölçer. observed 20/20 ise 20 kayıtlı denemenin tamamını geçen görevleri ifade eder.
Model sıralaması ve tutarlılık
Claude Opus 5.5 genel görev ağırlıklı sıralamada %67,16 ile liderdir ve Claude Opus 5'in yarım puan üzerindedir. Kimi-K3 en güçlü açık ağırlıklı modeldir ve GPT-6-Astra'nın bir puan içindedir. Claude Opus 4.6 perakendede %68,62, otomobil sigortasında %8,30 puan almıştır.
Tek deneme oranının ne kadarının korunduğuna bakıldığında GPT-6 Astra oranının %78'ini korumaktadır. Claude Opus 5.5 ve Claude Opus 5 tek deneme oranlarının her biri %71'ini korumaktadır. GLM-5.1, Kimi-K2.6 ve DeepSeek-V4-Pro ise her biri yaklaşık %8'ini korumaktadır.
Kimi-K3 benchmark'ın en az bir kez %93,89'unu çözmektedir; 507 görevden 476'sını en az bir kez çözer ve Kimi-K3'ü tamamen yenilgiye uğratan yalnızca 31 görev vardır. Kimi-K3 perakende iş akışlarında %82,24 pass@1 ile liderdir. Ancak Kimi-K3'te 507 görevden yalnızca 68'i, yani %13,41'i 20 denemenin tamamında başarılı olmaktadır.
Claude Opus 5 görevlerin en az bir kez %79,09'unu çözmektedir ve Claude Opus 5'i 106 görev tamamen yenilgiye uğratmaktadır. Buna karşın Claude Opus 5 benchmark'ın %47,53'ünü her denemede tamamlamaktadır.
Claude Opus 5.5 her deneme ortalamasında Claude Opus 5'ten yüksektir: %67,16'ya karşı %66,50. Claude Opus 5.5, 20 denemenin tamamında tam olarak aynı sayıda görevi geçmektedir: 241. Kimi-K3, Opus 5'ten 75 daha fazla görevi en az bir kez çözmektedir; Opus 5 ise Kimi-K3'ten 173 daha fazla görevi tutarlı biçimde çözmektedir.
Maliyet: başarı ve güvenilirlik ayrımı
GPT-5.4, 507 deneme için 43,49 dolar maliyetlidir ve %65,36 pass@1 oranına sahiptir. GPT-5.4 başarılı görev denemesi başına 0,131 dolar maliyetlidir. GPT-5.6 Sol başarı başına en düşük maliyete sahiptir: 0,127 dolar. GPT-5.4, başarı başına 0,004 dolar daha fazla karşılığında pass@1'i 3,45 puan yükseltmektedir. Claude Opus 5.5 ise başarı başına 0,276 dolar karşılığında 1,80 puan daha eklemektedir.
Claude Opus 5 başarılı deneme başına 0,475 dolar ve %66,50 pass@1 oranına sahiptir. Claude Opus 5.5 başarılı deneme başına 0,276 dolar ve %67,16 pass@1 oranına sahiptir.
Güvenilir görev başına maliyet tarafında GPT-6-Astra kampanya için 1.720,60 dolar maliyetlidir ve her denemede 231 görevi geçmektedir; bu da güvenilir görev başına 7,45 dolar demektir. GPT-5.4 güvenilir görev başına en ucuz modeldir: 6,80 dolar; ancak GPT-5.4'te yalnızca 128 görev 20/20 barajını karşılamaktadır.
Claude Opus 5.5 ortak en yüksek 241 göreve 7,80 dolarla ulaşmaktadır. Claude Opus 5 de 241 görevi geçmektedir ancak 13,30 dolar maliyetlidir. GPT-5.6 Sol güvenilir görev başına 9,76 dolar maliyetlidir.
Başarısızlık imzaları ve alan farkları
Başarısızlıkların yaklaşık beşte biri akıl yürütme değil araç kullanımıdır. Araç kullanımı başarısızlıkların %79,9'unu oluşturmaktadır. Yanlış durum güncellemeleri başarısızlıkların %10,3'ünü, eksik kullanıcı çözümlemeleri %7,0'sini, durum değiştiren eylem olmaması ise %2,9'unu oluşturmaktadır.
Tablo 2'deki modeller genelinde perakende ortalama %59,52 pass@1 oranına sahiptir; otomobil sigortası ortalaması ise %33,83 pass@1 düzeyindedir.
Nasıl çalışıyor?
Her görev bir başlangıç arka uç durumu, kullanıcı hedefi, mevcut MCP araçları, alan politikası ve terminal durum üzerinde yürütülebilir kontroller tanımlar. Simüle edilmiş bir kullanıcı özel bağlam tutar ve bunu yalnızca istendiğinde paylaşır. Her deneme taze başlatılmış durumla izole bir MCP oturumu alır ve aynı görevin iki denemesi hiçbir zaman bir veritabanı satırını veya önbelleğe alınmış araç durumunu paylaşmaz.
Sonunda bir yan etki çıkarıcı gerçekte neyin değiştiğini türetir ve deterministik yargıçlar bunu gerekli son durumla karşılaştırır. 507 görevden 477'si yalnızca durum üzerinden değerlendirilmektedir; 30 görev yanıt rubrikleri eklemektedir. Model görevleri, diyaloğu ve araç şemalarını görür; altın durum, iddialar, değerlendirme iç işleyişi ve kimlik bilgileri değerlendirici tarafında kalır.
ThinkingBox-Bench veri kümesinde 513 kayıt bulunmaktadır. ThinkingBox-Bench artık OpenEnv arayüzünün arkasında yer almaktadır ve her tamamlanan bölüm ikili geçme/kalma ödülü döndürmektedir.
Kendiniz çalıştırma
Test edilen ortamlar Linux ve WSL'dir ve Python 3.11+, uv ve Docker gerektirmektedir. OpenEnv imajı yalnızca OpenEnv API'sini başlatır; diğer her şeyi kullanıcı kendisi çalıştırır. Typesense 30.1 başlatılmalıdır.
Hazır olma kontrolü gözlemlenebilir veri, yapılandırma ve Session Proxy kontrolleri geçene kadar 503 döndürür. OpenEnv adaptörü operasyonel başarısızlıkları bir hata yan dosyasına yazar. Çalıştırmalar sabitlenmiş bir framework commit'i, sabitlenmiş bir veri sürümü ve bir paket hash'i üzerinde kapılanmaktadır.
OpenRouter maliyet anlık görüntüsü 20 Eylül 2026 tarihinde alınmıştır.