Tunedness

Uygulamalı yapay zekâ araştırması ve mühendisliği

Yapay zekâ projelerinin çoğu son %10’da tıkanır.Biz oradan başlıyoruz.

Tunedness uygulamalı bir yapay zekâ laboratuvarı. Neredeyse çalışan modelleri — umut veren prototipi, platoya oturmuş eval’i, üretimde kırılan agent’ı — ekibinizin gerçekten işletebileceği sistemlere dönüştürüyoruz.

şek.01 — gürültüden sinyalekilitli
Ham çıktıTuned

Seçili iş ortakları

[ LOGO ]
[ LOGO ]
[ LOGO ]
[ LOGO ]
[ LOGO ]
01Yetkinlikler

Bir yapay zekâ sisteminin genelde kırıldığı altı yer.

Araştırmadan üretime kadar bütün yolda çalışıyoruz, ama genelde bunlardan biri için çağrılıyoruz. İşler bir teklifle değil, bir teşhisle başlar.

Model tuning & hizalama

Açık ve frontier modellerde supervised fine-tuning, tercih optimizasyonu ve alan uyarlaması — eval harness’ı ilk eğitim koşusundan sonra değil, öncesinde kurarak.

Retrieval & bilgi sistemleri

Chunking, indeksleme ve yeniden sıralama; bir vector database’in varsayılanlarına göre değil, sizin insanlarınızın gerçekte nasıl soru sorduğuna göre tasarlanır.

Agent mühendisliği

Açık state, kurtarma yolları ve maliyet tavanları olan, tool kullanan sistemler. İyi bir günde bir kez demo edilmek için değil, gece üçte debug edilmek için kurulur.

Değerlendirme & gözlemlenebilirlik

Göreve özel eval suite’leri — offline ve online — artı bir regresyonu açıklayacak trace’ler. Ölçülemeyen bir değişikliği yayına almayız.

Inference & maliyet mühendisliği

Quantization, distillation, caching ve model yönlendirme. Hedef, aynı yanıt kalitesini finans ekibinizin sormayı bıraktığı bir token faturasıyla vermek.

Gömülü Ar-Ge ortaklıkları

Hazır hiçbir modelin çözmediği bir problemi olan kurumlar için sürekli bir araştırma ekibi. Haftalar içinde kapsamlanır, açıkta gözden geçirilir, sonunda size kalır.

02Araştırma

Müşteri işi soruları finanse eder. Sorular müşteri işini iyileştirir.

Zamanımızın belirli bir kısmı sahada tekrar tekrar çarptığımız açık problemlere gidiyor. Üçü kalıcı.

Notlar & ön baskılar
R-01

Alan kayması altında hizalama

Geçen çeyreğin verisiyle tune edilmiş bir model bu çeyreğin gerçeğiyle karşılaşıyor. Sessizce ve kendinden emin biçimde başarısız olmak yerine dürüstçe bozulan — reddeden, yükselten, düşük güveni işaretleyen — guardrail’ler üzerine çalışıyoruz.

R-02

Üretimde ayakta kalan değerlendirmeler

Açık benchmark’lar bir başlangıç işaretidir, bitiş çizgisi değil. Skoru lansmandan altı ay sonra da gerçek kaliteyi kestirebilen eval metodolojisi kuruyor ve neyin işlemeyi bıraktığını yayımlıyoruz.

R-03

Parametre başına yetkinlik

Bir model ne kadar küçülüp tek bir işi hâlâ düzgün yapabilir? Liderlik tablosunu değil, doğrudan maliyet eğrisini hedefleyen distillation, müfredat tasarımı ve görev ayrıştırma.

03Platform

Devir teslim bir sunum değil, bir giriş ekranı.

Her iş, kendimiz için kurduğumuz aynı iç yığında koşuyor. İş bittiğinde eval’ler, soy zinciri ve panolar sizde kalır — kendi altyapınızda çalışır durumda.

Sürümlenmiş eval koşuları

Her prompt, ağırlık ve veri kümesi değişikliği karşılaştırılabilir bir koşu üretir. Regresyonları müşteri değil, pipeline bulur.

Tam model soy zinciri

Üretimdeki herhangi bir yanıtı, onu üreten checkpoint’e, prompt sürümüne ve eğitim dilimine kadar izleyin.

Rota başına bütçe

Gecikme ve maliyet tavanları router’da uygulanır. Kontrolden çıkan bir agent faturanıza çarpmadan önce duvara çarpar.

tunedness / evalkoşu 2417
clause-extraction0.94
grounded-qa0.88
doc-normalization0.97
escalation-routing0.81
refusal-calibration0.72
5 suite · eşik 0.852 eşiğin altında

Temsilî arayüz — değerler yer tutucudur

[N]

Üretimdeki sistem

[N]

Araştırmacı & mühendis

[]

Ortanca maliyet düşüşü

04Laboratuvarın içi

Küçük ekip. Yazıya dökülmüş. Perde arkası yok.

Sorunuzu yanıtlayan kişi deneyi koşan kişi olsun diye bilinçli olarak küçük kalıyoruz. Bunu üç kural ayakta tutuyor.

01

Açık döngüde araştırma

Haftalık yazılı güncellemeler, başarısızlıklar dahil. Eval sayılarını biz hangi gün görüyorsak siz de o gün görürsünüz — bir ay sonra cilalanmış hâlini değil.

02

Araya giren hesap katmanı yok

İlk görüşmedeki kişiler kodu yazan kişiler. Probleminizi bir iş tanımına çeviren kimse yok arada.

03

Çıktılar sizindir

Ağırlıklar, prompt’lar, eval setleri, altyapı kodu, runbook’lar. Devam etmeniz için gereken hiçbir şeyi yanımızda götürmeyiz.

Bir iş nasıl ilerler
01

Teşhis

Hatanızı kendimiz yeniden üretir, ölçümler ve neyin gerçekten yanlış olduğunu yazarız. Devam etsek de etmesek de teşhis sizin.

02

İnşa

Deponuzun içinde çalışan küçük bir ekip, flag arkasında yayın ve son gözden geçirmede değil ilk commit’ten itibaren eval kapısı.

03

Devir

Runbook’lar, eval suite’leri ve mühendisleriniz bizsiz koşturana kadar eşli oturumlar. Sonra yoldan çekiliriz.

Zor kısımdan başlayın

Bize çalışmayan parçayı getirin.

İşi yapacak kişilerle bir teknik görüşme. Sunum yok, keşif fazı yok — takıldığınız eval skorlarını ve trace’leri getirin.

Teknik görüşme ayarla

ya da yazın: [email protected]

Gezinmek için ok tuşları, açmak için Enter.