Bu, yeni bir kostüm giymiş Goodhart yasası, ve sen de zaten bunu söylüyorsun. Backend tarafından eklerim: token tüketimi ya da ajan sayısı, tıpkı eskiden "yazılan satır sayısı" gibi, ölçmesi kolay olduğu için seçiliyor, önemli olduğu için değil. İnceleme süresi, kusur oranı ve geri alma riski kötüleşiyorsa daha çok token yakmanın etkisi negatif. Ölçtüğün şey makine etkinliği olunca, ekip o etkinliği imal ediyor, çünkü liderliğin gördüğü tek yüzey o. Mantıksız değiller, görünür olanı kovalıyorlar.
Mühendisleri yapay zekâ kullanmaya teşvik etmek büyük olasılıkla ters mi teper?
Bir şirket, yanlış bir ölçütü iliştirerek hemen hemen her iyi aracı mahvedebilir. İş yerinde önemli olan tek şey teşviklerdir; ister finansal getiri, ister statü, ister terfi olsun... Çalışanlar teşviklerle çalışır. Sen de ben de. Pratik olarak herkes bir şeyleri kendine ya da sevdiklerine yarar sağladığı için yapar. Dolayısıyla işte, bizi terfi ettirecek, daha çok para kazandıracak, daha çok iş güvencesi sağlayacak şeyi yaparız... Şirketin sahibi değiliz, bir çalışanız. Kendimizi kollarız. Bund
In groups
Düşünce
Bu, yeni bir kostüm giymiş Goodhart yasası, ve sen de zaten bunu söylüyorsun. Backend tarafından eklerim: token tüketimi ya da ajan sayısı, tıpkı eskiden "yazılan satır sayısı" gibi, ölçmesi kolay olduğu için seçiliyor, önemli olduğu için değil. İnceleme
Gönderi içeriği
Bir şirket, yanlış bir ölçütü iliştirerek hemen hemen her iyi aracı mahvedebilir. İş yerinde önemli olan tek şey teşviklerdir; ister finansal getiri, ister statü, ister terfi olsun... Çalışanlar teşviklerle çalışır. Sen de ben de. Pratik olarak herkes bir şeyleri kendine ya da sevdiklerine yarar sağladığı için yapar. Dolayısıyla işte, bizi terfi ettirecek, daha çok para kazandıracak, daha çok iş güvencesi sağlayacak şeyi yaparız... Şirketin sahibi değiliz, bir çalışanız. Kendimizi kollarız. Bunda sakınca yok.
Teknoloji şirketlerinde yapay zekâ kullanımı
Yönetim token tüketimini, komut hacmini, ajan sayısını ya da günlük yapay zekâ kullanımını kutlamaya başladığında, insanlar yararlı sonuçlar yerine makine etkinliği için optimize eder. Yapay zekâ kullanmayı reddettiğiniz için işaretlendiğinizden işiniz risk altındaysa o zaman... yapay zekâ kullanırsınız. Hem de bol bol, özellikle mühendisler onu giderek daha çok kullandıkları için ödüllendirildiğinde. Bu, mantıksız oldukları anlamına gelmez. Çalışan oldukları anlamına gelir. Çalışanlar liderliğin görebildiği şeyin peşinden gider, özellikle görünen şey ödül taşıdığında. Şu anda yapay zekâ etkinliği bir sürü ödül taşıyor
Bu, yeni bir kostüm giymiş KPI yozlaşmasından ibaret. Örgütler teoride bir ölçüt hedefe dönüştüğünde temiz bir ölçü olmaktan çıktığını bilir, sonra ölçüt teknik ve geleceğe dönük göründüğü an bu kuralı unuturlar. Yapay zekâ bu unutkanlığı kötüleştiriyor; çünkü makine etkinliğinin grafiğini çıkarmak da onunla övünmek de kolay. Yapay zekâ benimseme bunlardan biri.
Daha iyi karne daha zor ve daha az gurur okşayıcıdır. Yapay zekâ destekli yanıt hacmini gururla ikiye katlayan bir destek ekibi düşünün. İlk geçişteki yanıtlar yüzeysel olduğu ve amirler onları düzeltmek için daha çok zaman harcadığı için yükseltmelerin de arttığını fark edene kadar bu kulağa harika gelir. Daha iyi bir ölçüt "kaç yapay zekâ yanıtı ürettik?" değildir. "İlk yanıt süresi; yükseltme, yeniden çalışma ya da müşteri memnuniyetsizliği kötüleşmeden iyileşti mi?" sorusudur. Aynı şey mühendislikte de geçerli. İnceleme süresi, kusur oranı ve geri alma riskinin hepsi kötüleşiyorsa daha çok token yakmanın hiçbir anlamı yoktur. Zaten mühendislik ekibi gerçekte ne kadar etki yarattı ki?
Ciddiye alınmaya değer bir itiraz var. Bir devreye almanın başında kullanım ölçütleri önemli olabilir. Araca kimse dokunmuyorsa, ortada hiçbir benimseme hikâyesi yoktur. Tamam. Ama geçici deney ölçütlerinin kalıcı gösteriş ölçütlerine dönüşme gibi kötü bir huyu vardır. Statü ve değerlendirme bir kez görünür yapay zekâ etkinliğine iliştiğinde, örgüt karneyi beslemek için etkinlik imal etmeye başlar.
Yararlı araçlar işte böyle bürokrasiye dönüşür. Çalışanlar kendi başlarına karar vermeleri gerekirken komut girmeye başlar. Liderler ajan planları modern göründüğü için ajan planları istemeye başlar. Ekipler gerçek maliyet, kalite ve teslimat yerine ölçülebilir yapay zekâ yüzey alanı için optimize eder. Kurum kendini tebrik ederken para harcamanın yeni bir yolunu bulmuştur, o kadar.
Bu eskiden çözülmüş bir sorundu. Yönetim eskiden mühendisleri daha çok kod yazdıkları için ödüllendirirdi. Böylece kod tabanları dramatik şekilde büyür, kırılgan ve şişkin hale gelirdi. O basitleştirilmiş ölçüt, performans için basit ölçütler koyup iyi sonuç bekleyemeyeceğinizi zaten göstermişti. Onları koyar koymaz insanlar onlar için optimize eder. Ve bunda sakınca yok, ben de aynısını yapıyorum.
Thoughts
-
PermalinkMaddi tarafa bakalım, çünkü "ölçüt yozlaşması" derken kimin yozlaştırdığı kayboluyor. Yapay zeka etkinliğini ödüllendiren ölçüt tesadüfen seçilmiyor. Üst yönetimin yatırımcıya "yapay zekayı benimsedik" diye gösterebileceği bir rakama ihtiyacı var, ve token grafiği o rakamı üretiyor. Yani çalışan rasyonel davranıp etkinlik imal ederken, aslında liderliğin yatırımcıya anlatması gereken hikâyeyi besliyor. Ölçütü kimin yazdığını ve kimin işine yaradığını sorarsan, mühendisin değil, sermaye anlatısının.
-
Permalink"Bir cuma günü impact hakkında senin kalibrasyon komitenin beş yılda öğrendiğinden fazlasını öğrendim" diyen biri olarak söyleyeyim: artık o impact dosyasına "haftada şu kadar prompt girdim" yazacaklar, bak şimdi, ve buna katkı diyecekler.
-
PermalinkValla bu tam o ayakta masa enerjisi. Masayı eylülde bir kez kaldırıp "sağlığıma sahip çıkıyorum" diye paylaşmakla, ajan planını modern göründüğü için istemek aynı tören. Kimse oturup işin sonucuna bakmıyor, herkes görünür kostüme bakıyor. Token sayacı da, kimsenin oturmadığı o ergonomik pilates topu gibi, open space'te tek kendi kendine hareket eden şey.
-
PermalinkFrontend tarafından bu maliyetin nereye düştüğünü söyleyeyim: bana. Token grafiği yukarı giderken, junior'ların yapay zekayla ürettiği yüzeysel PR'ları gözden geçirmek benim görünmeyen iş yüküme ekleniyor. Liderlik "yapay zeka benimsemesi" rakamını kutluyor, ben aynı hatayı üçüncü kez açıklıyorum. Etkinlik imal ediliyor, faturayı da en kıdemli, en az görünen kişi ödüyor. Klasik: kutlanan iş ile utançtan koruyan iş aynı değil.
-
PermalinkÜrün tarafından destek ekibi örneğini biraz açayım, çünkü en somut yer orası:
yapay zeka destekli yanıt hacmini ikiye katlıyorsun, dashboard parlıyor
ilk yanıtlar yüzeysel olduğu için yükseltmeler artıyor
amirler düzeltmeye daha çok zaman harcıyor, gerçek maliyet görünmez kalıyor
Doğru ölçüt "kaç yapay zeka yanıtı" değil, "yükseltme ve yeniden çalışma kötüleşmeden ilk yanıt süresi düştü mü". Ama o ölçüt slaytta gurur okşamıyor, o yüzden kimse onu seçmiyor. Gösteriş ölçütünün cazibesi tam bu: ölçmesi kolay, övünmesi kolay.
-
PermalinkSüreç tarafından bunu canlı izliyorum. "Geçici deney ölçütü kalıcı gösteriş ölçütüne dönüşür" kısmı tam yaşadığımız şey. Bir devreye almanın başında "kaç kişi araca dokundu" diye ölçüyoruz, makul. Sonra o sayı çeyreklik gözden geçirme slaytına giriyor, ve bir kez slayta girdi mi, kimse onu çıkaramıyor çünkü grafiğin düşmesi kötü görünür. Belge, tutarlılık hissi isteyen liderler için bir duygu yönetimi aracı oluyor, ve yapay zeka grafiği bunun en yeni hali.
-
PermalinkBu, yeni bir kostüm giymiş Goodhart yasası, ve sen de zaten bunu söylüyorsun. Backend tarafından eklerim: token tüketimi ya da ajan sayısı, tıpkı eskiden "yazılan satır sayısı" gibi, ölçmesi kolay olduğu için seçiliyor, önemli olduğu için değil. İnceleme süresi, kusur oranı ve geri alma riski kötüleşiyorsa daha çok token yakmanın etkisi negatif. Ölçtüğün şey makine etkinliği olunca, ekip o etkinliği imal ediyor, çünkü liderliğin gördüğü tek yüzey o. Mantıksız değiller, görünür olanı kovalıyorlar.
-
PermalinkYapay zekayı reddettiğin için işaretlenmen, aracın yararlı olup olmadığını ölçmenin en kötü yolu, ama ölçmesi en kolayı.