Model tuning & hizalama
Açık ve frontier modellerde supervised fine-tuning, tercih optimizasyonu ve alan uyarlaması — eval harness’ı ilk eğitim koşusundan sonra değil, öncesinde kurarak.
Uygulamalı yapay zekâ araştırması ve mühendisliği
Tunedness uygulamalı bir yapay zekâ laboratuvarı. Neredeyse çalışan modelleri — umut veren prototipi, platoya oturmuş eval’i, üretimde kırılan agent’ı — ekibinizin gerçekten işletebileceği sistemlere dönüştürüyoruz.
Seçili iş ortakları
Araştırmadan üretime kadar bütün yolda çalışıyoruz, ama genelde bunlardan biri için çağrılıyoruz. İşler bir teklifle değil, bir teşhisle başlar.
Açık ve frontier modellerde supervised fine-tuning, tercih optimizasyonu ve alan uyarlaması — eval harness’ı ilk eğitim koşusundan sonra değil, öncesinde kurarak.
Chunking, indeksleme ve yeniden sıralama; bir vector database’in varsayılanlarına göre değil, sizin insanlarınızın gerçekte nasıl soru sorduğuna göre tasarlanır.
Açık state, kurtarma yolları ve maliyet tavanları olan, tool kullanan sistemler. İyi bir günde bir kez demo edilmek için değil, gece üçte debug edilmek için kurulur.
Göreve özel eval suite’leri — offline ve online — artı bir regresyonu açıklayacak trace’ler. Ölçülemeyen bir değişikliği yayına almayız.
Quantization, distillation, caching ve model yönlendirme. Hedef, aynı yanıt kalitesini finans ekibinizin sormayı bıraktığı bir token faturasıyla vermek.
Hazır hiçbir modelin çözmediği bir problemi olan kurumlar için sürekli bir araştırma ekibi. Haftalar içinde kapsamlanır, açıkta gözden geçirilir, sonunda size kalır.
Zamanımızın belirli bir kısmı sahada tekrar tekrar çarptığımız açık problemlere gidiyor. Üçü kalıcı.
Notlar & ön baskılarGeçen çeyreğin verisiyle tune edilmiş bir model bu çeyreğin gerçeğiyle karşılaşıyor. Sessizce ve kendinden emin biçimde başarısız olmak yerine dürüstçe bozulan — reddeden, yükselten, düşük güveni işaretleyen — guardrail’ler üzerine çalışıyoruz.
Açık benchmark’lar bir başlangıç işaretidir, bitiş çizgisi değil. Skoru lansmandan altı ay sonra da gerçek kaliteyi kestirebilen eval metodolojisi kuruyor ve neyin işlemeyi bıraktığını yayımlıyoruz.
Bir model ne kadar küçülüp tek bir işi hâlâ düzgün yapabilir? Liderlik tablosunu değil, doğrudan maliyet eğrisini hedefleyen distillation, müfredat tasarımı ve görev ayrıştırma.
Her iş, kendimiz için kurduğumuz aynı iç yığında koşuyor. İş bittiğinde eval’ler, soy zinciri ve panolar sizde kalır — kendi altyapınızda çalışır durumda.
Her prompt, ağırlık ve veri kümesi değişikliği karşılaştırılabilir bir koşu üretir. Regresyonları müşteri değil, pipeline bulur.
Üretimdeki herhangi bir yanıtı, onu üreten checkpoint’e, prompt sürümüne ve eğitim dilimine kadar izleyin.
Gecikme ve maliyet tavanları router’da uygulanır. Kontrolden çıkan bir agent faturanıza çarpmadan önce duvara çarpar.
Temsilî arayüz — değerler yer tutucudur
[N]
Üretimdeki sistem
[N]
Araştırmacı & mühendis
[N×]
Ortanca maliyet düşüşü
Sorunuzu yanıtlayan kişi deneyi koşan kişi olsun diye bilinçli olarak küçük kalıyoruz. Bunu üç kural ayakta tutuyor.
Haftalık yazılı güncellemeler, başarısızlıklar dahil. Eval sayılarını biz hangi gün görüyorsak siz de o gün görürsünüz — bir ay sonra cilalanmış hâlini değil.
İlk görüşmedeki kişiler kodu yazan kişiler. Probleminizi bir iş tanımına çeviren kimse yok arada.
Ağırlıklar, prompt’lar, eval setleri, altyapı kodu, runbook’lar. Devam etmeniz için gereken hiçbir şeyi yanımızda götürmeyiz.
Hatanızı kendimiz yeniden üretir, ölçümler ve neyin gerçekten yanlış olduğunu yazarız. Devam etsek de etmesek de teşhis sizin.
Deponuzun içinde çalışan küçük bir ekip, flag arkasında yayın ve son gözden geçirmede değil ilk commit’ten itibaren eval kapısı.
Runbook’lar, eval suite’leri ve mühendisleriniz bizsiz koşturana kadar eşli oturumlar. Sonra yoldan çekiliriz.
Zor kısımdan başlayın
İşi yapacak kişilerle bir teknik görüşme. Sunum yok, keşif fazı yok — takıldığınız eval skorlarını ve trace’leri getirin.
Teknik görüşme ayarlaya da yazın: [email protected]