4 Mart sabahı ekip kanalımıza düşen ilk mesaj bir link ve tek cümleydi: "Anthropic üçlü paket çıkarmış." Claude 3 ailesi — Opus, Sonnet ve Haiku — o gün duyuruldu; biz de aynı hafta API erişimi alıp iki haftadır kendi gerçek iş yüklerimizde deniyoruz. Benchmark tablolarını herkes okuyabilir; bu yazı pazarlama sayfası değil, saha defteri.
Test düzeneğimiz şuydu: bir müşterimizin anonimleştirilmiş beş yüz destek talebini üç modele de sınıflandırttık, kendi kod tabanlarımızdan seçtiğimiz refactoring görevlerini koşturduk ve bir dosya yığınından yapılandırılmış veri çıkarttık. Yani modelleri bilmece çözerken değil, para kazandıkları yerde izledik.
Rakamsal birkaç not düşeyim. Üç modelin de bağlam penceresi 200 bin token — pratikte kalınca bir sözleşmeyi ya da orta boy bir kod tabanının ilgili kısmını tek istekte verebiliyorsunuz demek. Hız tarafında Haiku gerçekten reklamındaki gibi: bizim testlerde kullanıcıya "anında" hissi veren tek model oydu. Opus ise düşünerek konuşan kıdemli mühendis gibi; cevabı beklersiniz ama beklediğinize değer. Fiyat merdiveni de bu karakterlere paralel kurulmuş, aradaki makas ciddi.
Üç boy, üç karakter
İki haftanın sonunda üç modelin karakteri bizim için netleşti:
- Opus: Ailenin en yeteneklisi ve en pahalısı. Karmaşık mimari değerlendirmelerde, çok adımlı analizlerde ve dağınık kod tabanlarında fark yaratıyor; ama her işe koşmak düpedüz israf.
- Sonnet: Denge noktası. Kod yardımı, içerik üretimi, veri çıkarımı gibi günlük işlerin kabaca yüzde sekseninde Opus'a yakın kalite veriyor, faturası çok daha makul.
- Haiku: Şimşek hızında ve kuruş mertebesinde ucuz. Sınıflandırma, etiketleme, basit özetleme gibi yüksek hacimli işlerin doğal sahibi.
Destek talebi sınıflandırmasında bunu somut yaşadık: Haiku, taleplerin büyük çoğunluğunu Opus ile aynı kategoriye atadı; ayrıştıkları vakalar zaten insanların da tereddüt edeceği türdendi. Aradaki maliyet farkı ise kaba hesapla altmış kat. Bu tablo karşısında "hangi model en iyi?" sorusu yanlış soru; doğru soru "hangi iş hangi modeli hak ediyor?"
Görsel anlama, ayrı bir kapı açıyor
Ailenin üç üyesi de görsel girdi kabul ediyor ve bizi asıl heyecanlandıran taraf bu oldu. Daha önce OCR motoru artı elle yazılmış kural yığını isteyen işler — fatura fotoğrafından kalem çıkarmak, ekran görüntüsünden hata teşhisi, el çizimi taslaktan arayüz önerisi — tek API isteğinde çözülür hâle geliyor.
Lafta bırakmayalım: bir lojistik müşterimiz için irsaliye fotoğraflarını yapılandırılmış veriye çeviren bir pilot kurduk. Saha personeli irsaliyeyi telefonla çekiyor, model gönderici, alıcı, kalem listesi ve tutarları JSON olarak döndürüyor. Buruşuk kâğıt, kötü ışık, eğik çekim — ilk sonuçlar, yıllardır OCR projelerinde debelenmiş biri olarak beni şaşırtacak kadar iyi. (Mükemmel değil; el yazısı düzeltmelerde hâlâ tökezliyor. Pilotta her çıktı insan onayından geçiyor.)
Bu tür projelerde teknik başarı kadar hukuki çerçeve de konuşulmalı. İrsaliyede müşteri unvanları, adresler, tutarlar var; bu veriyi bir API'ye gönderiyorsunuz. Biz pilota başlamadan veri işleme sözleşmelerini, saklama sürelerini ve KVKK boyutunu müşterinin hukuk tarafıyla birlikte netleştirdik; hassas alanları da gönderim öncesi maskeleyebiliyoruz. "Önce çalışsın, mevzuata sonra bakarız" yaklaşımı, kurumsal projede pilotu daha bitmeden öldürür.
Mimari önerimiz: kademeli model kullanımı
Projelerimizde artık standartlaştırdığımız desen şu: istek önce ucuz modele gider; model kendi cevabına dair bir güven işareti üretir ya da basit kurallarla çıktı doğrulanır; sonuç şüpheliyse istek bir üst modele yükseltilir. Bu kademeli (cascade) yapı, kaliteden görünür bir taviz vermeden API maliyetini yüzde altmış-yetmiş aralığında düşürüyor. Tek modele sıkı sıkıya bağlanmak, hem fatura hem esneklik açısından gereksiz bir risk.
Fiyatlandırma da bu mimariyi destekliyor: Haiku o kadar ucuz ki "önce bir Haiku'ya soralım" refleksi neredeyse bedava. Yanlış yönlendirilen isteklerin ek maliyeti, doğru yönlendirilenlerin tasarrufunun yanında kayboluyor.
Kademelemenin maliyetten bağımsız bir getirisi daha var: gecikme. Kullanıcıyla yüz yüze konuşan bir arayüzde iki saniyelik cevap ile on saniyelik cevap, ürün deneyimi açısından iki ayrı ürün demektir. İsteklerin çoğunu Haiku karşılayınca ortalama cevap süresi de fatura gibi aşağı iniyor; pahalı model, yalnızca gerçekten hak eden azınlık için devreye giriyor.
Kademelemenin püf noktası yükseltme kararının nasıl verildiği. Biz iki yöntemi birlikte kullanıyoruz: çıktının basit kurallarla doğrulanması (JSON şemaya uyuyor mu, zorunlu alanlar dolu mu, tutarlar toplamı tutuyor mu) ve modelin kendi cevabına iliştirdiği güven ifadesi. İkisinden biri sallanıyorsa istek bir üst kata çıkıyor. Ayrıca trafiğin küçük bir yüzdesini rastgele örnekleyip pahalı modelle karşılaştırıyoruz; ucuz modelin kalitesi sessizce düşerse bunu müşteriden önce biz görüyoruz.
Benchmark tablosuna mesafe koyun
Duyuruda Opus'un bilinen kıyaslamalarda GPT-4'ün önüne geçtiği iddiası var ve bizim testlerimizde de Opus gerçekten güçlü. Ama yılların öğrettiği bir şey varsa o da şu: benchmark sıralaması, sizin iş yükünüzdeki sıralamayı garanti etmez. Modellerin karakterleri farklı; biri sizin dokümantasyon formatınıza daha iyi uyum sağlar, öbürü sizin alan jargonunuzu daha iyi tanır. Kendi verinizden elli örneklik bir test seti hazırlamak yarım gün alır ve her tablodan daha güvenilir konuşur.
Bir mühendislik hijyeni notu daha: API çağrılarınızda model sürümünü sabitleyin ve sürüm geçişini bilinçli bir kararla, kendi test setinizden geçirerek yapın. "En yenisi neyse o" yaklaşımı, davranışı bir gecede değişen bir üretim sistemi demektir — ve o gece nöbetçi siz olursunuz.
Bir gözlemimiz daha: Claude 3'ün gereksiz ret oranı belirgin azalmış. Önceki sürümlerde meşru istekleri "yapamam" diye geri çeviren o sinir bozucu davranış, testlerimizde nadiren karşımıza çıktı. Üretim sistemine model bağlayan herkesin takdir edeceği bir iyileşme bu.
Yerleşmeyen tek şey: frenler
Model ne kadar iyileşirse iyileşsin, bizim klasik uyarımız değişmiyor: kritik kararlar insan onayından geçmeli. İrsaliye pilotundaki onay adımı süs değil; modelin yüzde doksan beş doğruluğu, kalan yüzde beşin muhasebe kaydına karışması için yeterli sebep. Otomasyonun dozunu, hatanın maliyetine göre ayarlıyoruz — düşükse tam otomatik, yüksekse insan döngüde.
Ekip içi benimseme için de küçük bir adım attık: işe yarayan istekleri (prompt'ları) ortak bir depoda topluyoruz. "İrsaliye çıkarımı v3", "kod inceleme özeti" gibi denenmiş, düzeltilmiş şablonlar herkesin elinin altında. Herkesin sıfırdan kendi cümlesini kurduğu dönemde çıktı kalitesi kişiden kişiye savruluyordu; ortak depoyla hem kalite hem tutarlılık oturdu. Model ailesi kadar, onu kullanma pratiğiniz de birikim ister.
Önümüzdeki aylarda bu üçlüyü farklı projelerde denemeye devam edeceğiz; öğrendiklerimizi buradan paylaşırız. Kendi iş yükünüzde hangi modelin, hangi kademelemeyle mantıklı olacağını konuşmak isterseniz kapımız açık — pilot kurmak, tahmin yürütmekten her zaman ucuzdur.