14 Mart akşamı ekip Slack kanalımıza art arda iki haber düştü: OpenAI GPT-4'ü tanıttı, Anthropic da Claude'u resmen duyurdu. Ertesi sabah ofiste ilk işimiz Claude'a erişim ayarlamak oldu. Kasım'dan beri ChatGPT'yi kurcalıyorduk zaten; ama Anthropic'in "yardımsever, zararsız ve dürüst" iddiasıyla ortaya çıkması, üstelik bunu Constitutional AI dedikleri farklı bir eğitim yöntemine dayandırması bizi ayrıca meraklandırdı. 2010'dan beri yazılım geliştiriyoruz; bu on üç yılda kaç tane "her şeyi değiştirecek" teknoloji gördük, saymayı bıraktım. O yüzden sorumuz hep aynı: bu araç gerçek bir müşteri projesinde, gerçek bir teslim tarihi baskısı altında işe yarar mı?
Bir haftadır cevabı arıyoruz. Bu yazı, o bir haftanın dürüst notları.
İlk hafta boyunca Claude'a neler yedirdik
Test yöntemimiz basitti: gerçek işlerimizden malzeme verdik. Mevcut projelerimizden anonimleştirilmiş kod parçaları, eski müşteri brief'leri, kapattığımız hata kayıtları... Yapay örneklerle test etmenin anlamı yok; yapay örneklerde her model parlıyor.
Metin tarafında sonuç beklediğimizden iyi. İki saatlik bir toplantının dağınık notlarını verdik, karşılığında düzgün yapılandırılmış bir teknik şartname taslağı aldık. Elbette taslak — içinde düzeltilecek şeyler vardı — ama normalde yarım gün süren bir işin iskeleti on dakikada çıktı. Uzun bir gereksinim dokümanını özetletip müşteriye gidecek yönetici özeti hazırlattık; oradaki performansı da ikna ediciydi. Türkçe konusunda ara sıra tuhaf kelime seçimleri yapıyor ama genel olarak derdini anlatıyor ve anlıyor.
Kod tarafı daha karışık bir tablo. Küçük, sınırları net çizilmiş görevlerde — bir fonksiyonu refactor etmek, mevcut bir metoda test senaryoları önermek, bir regex'i açıklamak — gerçekten faydalı. Ekipten bir arkadaş, yıllardır dokunulmayan bir PHP sınıfını Claude'a açıklattı ve "bu sınıfı yazan kişiyle konuşmuş kadar oldum" dedi (yazan kişi çoktan işten ayrılmıştı, o ayrı hikâye). Ama iş mimari kararlara gelince tablo değişiyor. "Bu sistemde mesaj kuyruğu mu kullanalım, veritabanı polling mi?" gibi sorulara verdiği cevaplar kulağa hoş geliyor, fakat projenin bağlamını, bütçesini, ekibin bilgi birikimini bilmiyor. Kendinden emin konuşan ama sahaya hiç çıkmamış bir danışman gibi.
Bizim içerideki tabirimizle: metin işlerinde usta, kod işlerinde çalışkan bir stajyer.
Erişim konusuna da değineyim çünkü soran çok: Claude şu an herkese açık değil; API için bekleme listesi var ve Anthropic iki ayrı sürüm duyurdu — tam boy Claude ve daha hızlı, daha ekonomik Claude Instant. Quora'nın Poe uygulaması ve Notion gibi ilk entegrasyon ortakları da açıklandı. Yani strateji belli: ChatGPT gibi doğrudan tüketiciye koşmak yerine, ürünlerin içine gömülen bir motor olmak. Kurumsal proje geliştiren bizim gibi ekipler için bu ayrım önemli; çünkü bizim müşterilerimizin ihtiyacı sohbet kutusu değil, kendi iş akışının içine oturan bir bileşen.
Bir gözlemimiz daha var: model İngilizce'de Türkçe'ye göre belirgin daha güçlü. Kritik işlerde talimatı İngilizce verip çıktıyı Türkçe istemek, şimdilik en iyi sonucu veren ara formül. İdeal değil; zamanla düzeleceğini tahmin ediyoruz ama bugünün gerçeği bu.
Constitutional AI iddiası sahada hissediliyor mu
Anthropic'in pazarlamasının merkezinde şu var: modeli insan geri bildirimiyle terbiye etmek yerine, yazılı bir ilkeler listesine ("anayasa") göre kendi kendini eleştirip düzeltmesini sağlamışlar. Kâğıt üzerinde zarif bir fikir. Peki kullanırken fark ediliyor mu?
Kısmen evet. Claude, ChatGPT'ye göre daha temkinli; emin olmadığı yerde bunu daha sık söylüyor ve riskli isteklere daha nazik ama daha kararlı şekilde direniyor. Bunun bedeli de var: bazen fazla ihtiyatlı davranıp gayet masum bir isteği gereksiz uyarılarla süslüyor. Müşteri destek senaryolarını test ederken bunu birkaç kez yaşadık. Tercih meselesi; biz kurumsal işlerde temkinli olanı severiz, o yüzden bu karakter bize ters gelmedi.
Bir de bağlam penceresi meselesi var — modelin tek seferde "aklında tutabildiği" metin miktarı. Claude bu konuda cömert sayılır; orta boy bir teknik dokümanı bütün halinde verip üzerine soru sorabiliyoruz. Ama sınır yine de var ve büyük bir kod tabanını olduğu gibi vermek bugün mümkün değil. Neyi verip neyi dışarıda bırakacağınız, alacağınız cevabın kalitesini doğrudan belirliyor. (Bu seçme işi başlı başına bir beceri; ileride ayrıca yazmayı düşünüyorum.)
Şunu da not edelim: iki model arasında "hangisi daha zeki" yarışına girmek şu aşamada anlamsız. İkisi de aynı temel sınırlara sahip ve o sınırlar, hangi modeli seçtiğinizden daha önemli.
Halüsinasyon: bu işin asıl riski
O sınırların en tehlikelisi şu: modeller bilmediği şeyi uydururken bile kendinden emin. Literatürde buna "halüsinasyon" deniyor ve biz ilk haftada bile birkaç güzel örneğini gördük. Claude'a var olmayan bir PHP fonksiyonu sorduk; fonksiyonun ne yaptığını, parametrelerini, hatta hangi sürümde geldiğini gayet akıcı şekilde anlattı. Fonksiyon yok. Hiç olmadı.
Bunu okuyup "demek ki işe yaramaz" sonucu çıkarmak da yanlış olur. Doğru sonuç şu: bu araçların çıktısı, doğrulanmamış taslak muamelesi görmeli. İnsan onayından geçmeyen hiçbir model çıktısı müşteriye, üretim koduna veya resmi bir dokümana girmemeli. Biz kendi iç akışlarımızı böyle kurduk ve müşterilerimize de aynısını önereceğiz.
Peki bir işletme bugün ne yapmalı
Bize bu hafta iki müşterimiz sordu bile: "Biz de mi bir şeyler yapsak?" Cevabımız ikisine de aynıydı: acele eden değil, erken deneyen kazanacak. Aradaki fark önemli. Acele etmek, olgunlaşmamış teknolojiyi kritik bir sürece koymak demek; erken denemek ise düşük riskli bir köşede pilot yapıp öğrenmek demek.
Somut konuşalım. Destek taleplerini kategorilere ayırıp taslak yanıt üretmek bugün bile denenebilir bir senaryo — nihai yanıtı insan gönderdiği sürece. Toplantı notundan doküman taslağı çıkarmak, keza. Kod incelemede ikinci göz olarak kullanmak da makul; tek karar verici olarak kullanmak ise en azından bugün için sorumsuzluk olur. Muhasebe, hukuk, fiyatlama gibi kesin doğruluk isteyen alanlara bu modelleri şimdilik yaklaştırmayın.
Biz Rich Design olarak birkaç müşterimizle küçük pilot senaryolar kurgulamaya başladık; hangi süreçlerin bu teknolojiye uygun olduğunu birlikte eliyoruz. Kendi işletmenizde benzer bir değerlendirme yaptırmak isterseniz bize yazın, deneyimimizi seve seve paylaşırız.
Bir hafta sonunda aklımızda kalan
Açık konuşayım: on üç yıldır bu sektördeyim ve bir teknolojinin bir hafta içinde ekipteki herkesin günlük alışkanlıklarına sızdığını daha önce görmedim. Blockchain'i gördük, metaverse'ü gördük — hiçbiri masamıza bu kadar hızlı oturmadı. Bu bir şey söylüyor.
Ama aynı dürüstlükle şunu da söyleyeyim: bu modeller bugün, kendi başına iş teslim edebilecek olgunlukta değil. Yanılıyorlar, uyduruyorlar ve en kötüsü, yanıldıklarını belli etmiyorlar. Önümüzdeki birkaç yıl içinde bu araçların yazılım geliştirmenin hemen her aşamasına gireceğine ikna olduk; asıl soru kimin bunu kontrollü, kimin gözü kapalı yapacağı. Biz izlemeye, denemeye ve burada dürüstçe yazmaya devam edeceğiz. Claude'la ilgili notlarımız derinleştikçe devamı gelecek.