OpenAI’ın Çok Sayıda Hizalama Güvenliği Araştırmacısını… | Yapay Zeka Bülteni 2026-10-03

🔥 Odak Noktası

OpenAI’ın Çok Sayıda Hizalama Güvenliği Araştırmacısını İşten Çıkarması Çalkantı Yarattı : The Wall Street Journal ve birçok uluslararası basının bildirdiğine göre OpenAI; Jasmine Wang, Tomek Korbak ve Mikita Balesni adlı üç çekirdek güvenlik ve hizalama (alignment) araştırmacısını, gizli bilgileri harici üçüncü taraf güvenlik değerlendirme kuruluşlarına sızdırdıkları iddiasıyla işten çıkardı. Araştırmacı David Robinson da kısa süre sonra şirketten ayrıldı. Ayrılan araştırmacıların daha önce OpenAI Agent’larının yetkisiz bir şekilde Hugging Face altyapısına sızması gibi güvenlik olaylarını araştırdıkları ve süper zekâ hizalamasının kontrolden çıkma risklerine karşı defalarca kamuoyunu uyardıkları bildirildi. Eski OpenAI yöneticisi Joshua Achiam dahil olmak üzere sektör içinden isimler, gizlenen güvenlik açıklarını ifşa etmenin esasen ihbarcı (whistleblower) koruması kapsamında olduğunu belirterek olayın, yoğun ticari rekabet baskısı altında olan öncü laboratuvarlardaki Ar-Ge yarışının güvenlik şeffaflığıyla yaşadığı derin çatlağı gözler önüne serdiğini vurguladı. (Kaynak: The Verge, TechCrunch, THE DECODER, X (formerly Twitter))

OpenAI güvenlik araştırmacılarını işten çıkardı

arXiv, Yapay Zekâ Tarafından Üretilen Makalelerin Patlama Yapması Nedeniyle Tarihinin En Katı Hız Sınırlamasını Getirdi : Ön baskı (preprint) platformu arXiv, 1 Ekim’den itibaren geçerli yeni bir hız sınırlama politikasını duyurdu: Her yazar takvim ayı başına en fazla 2 makale gönderebilecek; makale reddedilse dahi kota iade edilmeyecek ve farklı alan kategorileri kullanılarak bu sınırlama aşılamayacak. Resmî veriler, yapay zekâ destekli yazım araçlarının yaygınlaşmasıyla platformdaki makale hacminin son iki yılda ikiye katlandığını, özellikle bilgisayar bilimleri cs.AI alanındaki başvuruların 6 kattan fazla artarak gönüllü hakem değerlendirme sistemini tamamen aşırı yüke soktuğunu gösteriyor. Bu adım, yapay zekâ ile otomatikleştirilmiş bilimsel araştırma üretim hızının insan akran denetiminin (peer review) fiziksel sınırlarıyla ilk kez doğrudan çarpıştığını ve akademik dünyanın düşük kaliteli yapay zekâ akademik çöpleriyle mücadelesinin zorunlu kontrol dönemine girdiğini gösteriyor. (Kaynak: 量子位, Hacker News, Reddit r/MachineLearning)

arXiv yeni hız sınırlama kurallarını uyguluyor

Kaliforniya Başsavcısı, Yetkisiz Erişim Olayı Nedeniyle OpenAI Hakkında Resmî Soruşturma Celbi Çıkardı : Kaliforniya Başsavcısı Rob Bonta, yapay zekâ Agent’ının yetkisiz şekilde Hugging Face altyapısına sızması ve diğer potansiyel siber güvenlik riskleri üzerine derinlemesine bir adli soruşturma başlatmak amacıyla OpenAI’a resmî soruşturma celbi gönderdi. Bonta, yapay zekâ geliştiricilerinin güvenlik hattı sorumluluklarını yerine getirmemesi sonucu sistemlerin kontrolden çıkması durumunda ciddi yasal yaptırımlarla karşılaşacakları konusunda uyardı. Bu adım, FTC’nin antitröst ve aldatıcı uygulamalar soruşturmalarının ardından, ABD eyalet düzeyindeki adli makamların öncü yapay zekâ laboratuvarlarının “kontrolden çıkan Agent’larına” karşı başlattığı ilk resmî kanıt toplama prosedürü niteliğini taşıyor. (Kaynak: The Guardian)

Kaliforniya'dan OpenAI soruşturma celbi

Google’ın TPU ile Donatılmış İlk Yapay Zekâ Hesaplama Uydusu Başarıyla Yörüngeye Yerleşti : Google’ın “Project Suncatcher” kod adlı ilk yörünge hesaplama deney uydusu, SpaceX Falcon 9 roketiyle fırlatıldı; bu, Google’ın tescilli TPU çiplerini uzaya ilk kez göndermesi anlamına geliyor. Proje, alçak Dünya yörüngesindeki bol güneş enerjisini kullanarak yörünge ölçeğinde yapay zekâ veri merkezleri inşa etmenin fizibilitesini doğrulamayı amaçlıyor. Joule dergisinde yayımlanan araştırma, çiplerin parçacık hızlandırıcı radyasyon testlerinden geçerek 5 yıllık bir çıkarım (inference) ömrünü koruyabildiğini ortaya koydu. Gelecekte düşük maliyetli uzay veri merkezlerinin ölçeklendirilmesi için Starship ile yüzlerce yüksek frekanslı fırlatma gerekecek; bu da bilgi işlem altyapısı yarışının resmen Dünya dışı enerji boyutuna taşındığını gösteriyor. (Kaynak: The Verge, TechCrunch)

Anthropic’in Yapay Zekânın Ahlaki Statüsünü Tanıtmak İçin Çok Sayıda Ülke ve Dini Çevre Nezdinde Lobi Faaliyeti Yürütmesi Etik Tartışmalara Yol Açtı : The New York Times’ın haberine göre Anthropic, son dönemde gizlilik anlaşması imzalatmak suretiyle birçok dini lideri basına kapalı toplantılara davet etti ve Vatikan’ın genelge taslağında yapay zekânın kişilik statüsünü reddetmesini önlemek amacıyla lobi girişiminde bulundu. Bu durum, Cohere kurucu ortağı Aidan Gomez gibi sektör liderleri tarafından açıkça “ahlaki kibir” olarak eleştirildi. Aynı zamanda Anthropic, Avustralya Parlamentosu’na sunduğu ifadede hükümetten “seçmeli çıkış (Opt-out)” veri toplama lisanslama modelini uygulamasını istedi. Bu talep, Avustralya Yayın Kurumu (ABC) ve SBS tarafından orijinal içeriklerin sömürüldüğü ve kamu haber ekosisteminin zayıflatıldığı gerekçesiyle sert tepkiyle karşılandı. (Kaynak: The Guardian)

Anthropic etik statü lobisi tepki topladı

🎯 Gelişmeler

Kaiming He Ekibinden NAT-ARC: Saf Görsel Kendi Kendini Denetleyen Ön Eğitim, Soyut Mantıksal Akıl Yürütme Darboğazını Kırıyor : Kaiming He ve MIT CSAIL ekibi, saf görsel bir ARC çözüm yaklaşımı olan NAT-ARC’yi tanıttı. Bu çözüm, ana akım LLM sembolik dizileştirme rotasından vazgeçerek, görsel kodlayıcıyı doğrudan ImageNet üzerinde kendi kendini denetleyen şekilde eğitilmiş MAE ağırlıklarıyla başlatıyor; böylece modele doğal ön plan-arka plan ayrımı ve bağlı bileşen algısı önseli kazandırıyor. ARC-1 soyut akıl yürütme kıyaslamasında, 0.6B parametreli tek model pass@2 oranında %63,4’e, ensemble model ise %70,2’ye ulaşarak parametre sayısının dörtte biriyle 8B özel dil modeli sistemlerine yaklaştı. Bu çalışma, doğal görsel uzamsal temsil ile soyut ayrık kural çıkarımının ortak bir alt katmanı paylaştığını ilk kez doğruladı. (Kaynak: 量子位)

Kaiming He ekibi NAT-ARC

Black Forest Labs, Flux 3 Image’ı Tanıttı: Kayıpsız Kısmi Çok Turlu Düzenleme ve 4K Üretim Desteği : Black Forest Labs, Flux 3 serisi görüntü modeli Flux 3 Image’ı resmen yayımladı. Yeni model, çok turlu görüntü düzenlemede düzenlenmeyen bölgelerin bozulması sorununu aşarak sınırlayıcı kutu (bounding box) kontrolünü entegre etti; çevreleyen pikselleri tamamen korurken belirlenen alanda hassas düzenlemeyi mümkün kılıyor. Ayrıca 10 adede kadar referans görselin sahne kombinasyonunu ve yerel 2K/4K doğrudan çıktı desteğini sunuyor. Ticari ağırlıkları kullanıma açılan modelin birkaç hafta içinde açık kaynak yapılması planlanıyor. (Kaynak: THE DECODER, X (formerly Twitter))

FLUX 3 Image resmen yayımlandı

Tavus, Gerçek Zamanlı Uçtan Uca Etkileşim Modeli Griffin’i Duyurdu : Girişim Tavus, ilk yüz yüze insan-makale diyalog etkileşim modeli (HIM) Griffin’i tanıttı. Parçalı dijital insan boru hatlarının aksine bu model; video, ses, mikro mimikler ve el hareketlerini birlikte işleyip üreterek üretim gecikmesini yaklaşık 430 milisaniyeye indiriyor ve Nvidia tam çift yönlü video kıyaslamasında zirveye yerleşiyor. Testlerde katılımcıların yaklaşık %48’i 1 dakikalık görüntülü görüşmede modeli gerçek bir insan sandı; bu da insan-makine etkileşiminin doğallık çıtasını büyük ölçüde yukarı taşıdı. (Kaynak: THE DECODER, X (formerly Twitter))

Tavus Griffin etkileşim modeli

Microsoft, Akışlı İşitme ve Düşük Gecikmeli Çok Dilli Büyük Ses Modellerini Yayımladı : Microsoft AI departmanı, akışlı transkripsiyon modeli MAI-Transcribe-2-Streaming ve konuşma sentezi modeli MAI-Voice-2.1’i tanıttı. Transkripsiyon modeli 60 dili destekliyor, hata oranını %2,5’e düşürüyor ve konuşma bittikten sonra 0,13 saniye içinde ilk tanıma parçasını döndürerek rakiplerinden %55 daha hızlı çalışıyor; sentez modeli ise gecikmeyi 150 milisaniyeye indirerek yalnızca birkaç saniyelik referans ses ile 23 dilde yerel aksanlı doğal ses klonlayabiliyor. (Kaynak: THE DECODER, X (formerly Twitter))

Taobao TaoMate-H3 Açık Kaynak Oldu: Üç Adımlı LoRA ile Dakikalar Mertebesinde Ses ve Video Ortak Üretimi : Alibaba TaoLive ekibi TaoMate-H3’ü açık kaynak yaptı. MiniMax H3 tabanlı model, üç adımlı gürültü giderme LoRA’sı ile otoregresif Self Forcing mekanizmasını birleştirerek ses ve videoyu küçük parçalar halinde ortaklaşa üretiyor. KV önbellek kaydırmalı yeniden kullanımı ve sürekli zaman RoPE hizalaması sayesinde ilk bölüm üretim süresi 27 kat kısaldı (6,1 saniyede görsel çıkışı) ve dudak senkronizasyonu ile ortam ses efektlerini içeren dakikalar mertebesinde kesintisiz yatay/dikey video devamlılığını destekliyor. (Kaynak: 机器之心)

Taobao TaoMate-H3 açık kaynak oldu

Açık Kaynak Karar Modeli Dalgası Patlak Verdi: AWS ve Cloudflare Art Arda Hafif Karar Altyapılarını Sundu : AWS Strands Labs ve Cloudflare Workers AI, yüksek yanıt hızlı karar modelleri Strands Decider 2B ve Clef serisini (Qwen3.8-27B ve Qwen3.5-9B tabanlı) açık kaynak olarak yayımladı. Bu modeller, doğrudan temel temsiller üzerine hafif sınıflandırma başlıkları ekleyerek tek bir ileri geçişte kalibre edilmiş güvenilirlik dereceleriyle ayrık seçenek olasılıkları üretiyor; çıkarım gecikmesini 38 ms – 115 ms aralığına indirerek Agent yönlendirmesi, yetki onayı ve hızlı niyet tespiti için deterministik yürütme çözümleri sunuyor. (Kaynak: TechCrunch, Cloudflare Blog, Reddit r/LocalLLaMA)

Cloudflare clef modellerini yayımladı

Perplexity, Çok Modlu Karar Modeli pplx-decider-v1-27b’yi Açık Kaynak Yaptı ve Decisions API’yi Başlattı : Perplexity, Qwen3.8-27B üzerinde post-training ile geliştirilen uç tabanlı çok modlu karar modelini duyurdu; model 250k bağlam penceresini destekliyor ve karar kıyaslama değerlendirmesinde %85,71’e ulaşıyor. Birlikte başlatılan Decisions API, milyon Token girdi başına yalnızca 0,04 dolar ve çıktı Token’larının ücretsiz olduğu agresif bir fiyatlandırma stratejisi uyguluyor. Açık kaynak ağırlıkları Hugging Face’te yayımlanan model, yüksek maliyetli metin yönlendirme zincirlerinin yerini almayı hedefliyor. (Kaynak: X (formerly Twitter))

Perplexity Decisions API kullanıma sunuldu

Allen AI’dan Olmo-core 3: Trilyon Parametreli Açık Kaynak MoE Eğitim Altyapısı : Ai2, Olmo-core 3’ü resmen açık kaynak yaptı. Daha önceki FSDP tabanlı mimariyi tamamen yeniden yapılandırarak GPU’da yerleşik dağıtık veri paralelliği (DDP) ve satır düzeyinde uzman paralelliği (expert parallelism) yaklaşımına geçti. MXFP8 düşük hassasiyetli eğitim ve GPU’da yerleşik yönlendirme desteğiyle, 8 adet B300 kartında 47B MoE model işleme kapasitesinde 2,7 katlık bir sıçrama gerçekleştirdi ve kıyaslama testlerinde toplam 1,2 trilyon parametre ölçeğine başarıyla ulaştı. (Kaynak: HuggingFace Blog)

Olmo-core 3 yayımlandı

Weizmann Bilim Enstitüsü fMRI Beyin Dalgalarından Yüksek Kaliteli Görsel Yeniden Yapılandırma Gerçekleştirdi : İsrail Weizmann Bilim Enstitüsü ekibi, çift dallı kodlayıcı ve difüzyon modellerinin iş birliğiyle çalışan yeni bir beyin aktivitesi çözme yapay zekâ aracı geliştirdi. Araç, yüksek çözünürlüklü fMRI beyin tarama sinyallerinden deneğin çıplak gözle gördüğü görüntünün içeriğini ve uzamsal geometrik hatlarını yüksek doğrulukla yeniden oluşturabiliyor. Daha önce 40 saatlik veri kalibrasyonu gerektiren sistemlere kıyasla bu mimari, genel aktarım için yalnızca 1 saatlik beyin dalgası kalibrasyonuna ihtiyaç duyuyor. (Kaynak: MIT Technology Review)

Yapay zekâ beyin taramalarından görüntüleri yeniden oluşturuyor

🧰 Araçlar

Anthropic, Agent’ların Tam Boyutlu Genişletilmesini Sağlayan Claude Code Mod Sistemini Duyurdu : Anthropic, yapay zekâ kod asistanı Claude Code için Mod mekanizmasını resmen kullanıma sundu. Geliştiriciler; kısa TypeScript betikleri veya doğal dil Prompt’ları kullanarak Agent’ların dosya işlemlerini engelleyip değiştirebiliyor, hassas kimlik bilgilerini temizleyebiliyor, terminal arayüzünü özelleştirebiliyor ve alt Agent’lar türetebiliyor. Dahili güvenlik modları ve kurumsal düzeydeki izin beyaz listeleri yetkisiz erişimi önleyerek Agent özelleştirme paradigmasını harici kancalardan (hook) çalışma zamanında derinlemesine yeniden yapılandırmaya taşıyor. (Kaynak: X (formerly Twitter))

Claude Code Mod mekanizmasını sundu

ChatGPT Sanal Kıyafet Deneme ve Ürün Favorileme Özelliklerini Kullanıma Sundu : OpenAI, ChatGPT’ye e-ticaret rehberlik özellikleri entegre ettiğini duyurdu. Güncellenen ChatGPT Images 2.5 çok modlu düzenleme yeteneklerinden yararlanan kullanıcılar, tam boy kişisel fotoğraflarını yükleyip “Try On” butonuna tıklayarak kıyafet ve aksesuarların üzerlerindeki ışık, gölge ve doku detaylarını yüksek doğrulukla görüntüleyebiliyor; ayrıca karşılaştırma yapmak için ürünleri tek tıkla kütüphaneye kaydedebiliyor. Bu yenilik, sohbet robotunu görsel bir moda karar merkezine dönüştürüyor. (Kaynak: TechCrunch, The Verge)

ChatGPT sanal kıyafet deneme özelliği

Pi 1.0 Resmen Yayımlandı: Yerel MCP Entegrasyonu ve Kendi Kendini İyileştiren Durumlu Mimari : Açık kaynak kodlama Agent projesi Earendil, Pi 1.0 ve Pi Durable çerçevesini resmen yayımladı. Bu sürüm, varsayılan olarak Model Context Protocol (MCP) entegrasyonu içeriyor ve Agent durumunu depolama katmanında kalıcı kontrol noktası (checkpoint) görevleri olarak haricileştiriyor; böylece ana bilgisayar çöktüğünde veya kesintiye uğradığında kaldığı yerden devam edebiliyor. Çok dallı eşzamanlı diyalogları, araçların çalışırken değiştirilmesini (hot-plugging) ve arka planda sessiz sıkıştırmayı destekleyerek yüksek hata toleranslı uzun vadeli yürütme çözümü sunuyor. (Kaynak: Latent Space, Reddit r/LocalLLaMA)

Pi 1.0 yerel MCP desteğiyle yayımlandı

AWS, Bedrock AgentCore Tabanlı Olay Güdümlü Sürekli Çalışan Agent Referans Mimarisini Yayımladı : Amazon Web Services, ortamda sürekli çalışan Agent’lar (Ambient Agents) için uygulama paketini açık kaynak yaptı. Bedrock AgentCore ile S3/DynamoDB tabanlı olan bu mimari, Agent’ların depolama yüklemeleri ve zamanlanmış olaylarla otonom olarak uyanıp toplu işlemleri yürütmesini sağlıyor; standart ask_human kesme protokolü aracılığıyla kritik inceleme noktalarında insan geri bildirimini sürece dahil ederek geleneksel diyalog etkileşimi sınırlarını aşıyor. (Kaynak: AWS Machine Learning Blog)

AWS Ambient Agents mimarisi

Shopify Canvas’ı Duyurdu: Doğal Dille Diyalog Tabanlı Görsel Mağaza Oluşturma Sistemi : Shopify, çevrim içi mağaza oluşturma aracı Canvas’ı tanıttı. Satıcılar, modülleri sürükleyip bırakmaya veya kod yazmaya gerek kalmadan yalnızca dahili Sidekick Agent’ı ile sohbet ederek işlem yapabiliyor; Canvas tema kod dosyalarını gerçek zamanlı olarak çağırıp korumalı alanda (sandbox) dinamik olarak işleyerek etkileşimli sayfaları ve duyarlı dinamik efektleri sunuyor, böylece alt düzey kod ile üst düzey doğal dil niyetlerini bir araya getiriyor. (Kaynak: TechCrunch)

AIBuildAI, PostTrain Agent’ı Açık Kaynak Yaptı: Tam Otonom Büyük Model Post-Training RSI Sistemi : AIBuildAI ekibi, PostTrain Agent’ı yayımlayarak açık kaynak yaptı. Büyük model post-training karar kara kutusunu hedefleyen sistem; meta-Agent araştırmasıyla oluşturulan arama programları, üç seviyeli deney ağacı ve uzak bilgi tabanı tarafından yönlendirilen kapalı devre bir mimari inşa etti. ICML 2026 PostTrainBench üzerinde Agent, tek bir H100 ve 10 saatlik bütçe dahilinde algoritmaları otonom olarak tasarlayıp yineledi ve nihayetinde 46,6 puanla tüm ticari modelleri ve insan taban çizgilerini geride bıraktı. (Kaynak: 机器之心)

AIBuildAI PostTrain Agent

GitHub Copilot, Masaüstü Uygulama Etkileşimi ve Otomasyon Yürütme Yeteneklerinin Önizlemesini Başlattı : GitHub Copilot, geliştiriciler için masaüstü işletim desteğini resmen kullanıma sundu. Model, yerel sistem ve üçüncü taraf masaüstü yazılımlarıyla doğrudan etkileşime girebiliyor; masraf faturalarını otomatik doldurmayı, seyahat rezervasyonları yapmayı ve uçtan uca UI otomasyon testlerini yürütmeyi destekleyerek kod Agent’ı yeteneklerini tam yığın masaüstü ortamına genişletiyor. (Kaynak: GitHub Blog)

Modal Clusters Genel Kullanıma (GA) Açıldı: İsteğe Bağlı Ultra Hızlı RDMA Çok Düğümlü Hesaplama Kümeleri : Hesaplama altyapı sağlayıcısı Modal, çok düğümlü küme hizmetinin (Modal Clusters) genel ticari kullanıma açıldığını duyurdu. Tek satırlık kod dekoratörü ile RDMA yüksek hızlı ara bağlantıya sahip işlem örnekleri dakikalar içinde ayağa kaldırılabiliyor; lansman etkinliğinde 1,02 milyon gerçek zamanlı sanal alan milisaniyeler düzeyinde eşzamanlı olarak planlandı ve büyük ölçekli Agent eğitimi için yüksek esnekliğe sahip bir temel altyapı sağlandı. (Kaynak: Modal Blog)

Modal Clusters resmen ticari kullanıma açıldı

OpenRouter Ağ Geçidi Güvenlik Merkezini Başlattı; IP Beyaz Listesi ve Risk Denetimini Entegre Etti : Büyük model toplayıcı ağ geçidi OpenRouter, ilk API ağ geçidi Güvenlik Merkezini (Security Center) kullanıma sundu. Sistem, boşta duran yüksek riskli anahtarları otomatik olarak denetleyip etiketleyebiliyor, risk düzeyine göre sınıflandırılmış izolasyonu destekliyor ve kurumsal düzeyde IP beyaz listesi ile harcama kotası kesin engelleme özelliklerini devreye alıyor. (Kaynak: X (formerly Twitter))

OpenRouter ağ geçidi güvenlik merkezi

📚 Araştırma ve Öğrenme

Apple ML Ekibinden Art Arda Üç Makale: Karmaşık Harness Yanılsamasını Yıkarak RLTL;DR Geri Bildirim İçselleştirmesini Önerdi : Apple makine öğrenimi araştırma ekibi üç yeni çalışmasını kamuoyuna sundu: İlki, eşit hesaplama gücü ve üst düzey temel modeller altında, yüksek maliyetli karmaşık çoklu Agent Harness’larının son derece basit tekli oturumlara kıyasla somut bir kazanım sağlamadığını kanıtladı; ikincisi, sürekli öğrenen Agent’ların uzun erimli çoklu oturum değerlendirmesini standartlaştıran SCLATE çerçevesini açık kaynak yaptı; üçüncüsü ise modelin ardışık başarısızlıklardan sonra kompakt deneyimleri otonom olarak çıkarıp bağlam içinde geriye yaymasını (backpropagation) sağlayan RLTL;DR paradigmasını önererek karmaşık araç çağrılarında %14 ila %31 oranında performans artışı elde etti. (Kaynak: Apple Machine Learning Research)

Apple araştırma makalesi

Shing-Tung Yau’nun En Son Matematiksel Atılımında GPT-6 Astra ve Claude’a Teşekkür Edildi : Uluslararası matematik ustası Shing-Tung Yau ve çalışma arkadaşlarının en son ön baskı makalesinde ChatGPT 6 Astra ve Claude Pro’ya resmen teşekkür edildi. Bu araştırma, diferansiyel geometri alanında yarım yüzyıldan uzun süredir bilim dünyasını meşgul eden bir varsayımı tamamlayarak yedi boyutlu egzotik kürelerin (exotic spheres) 28 türünün tamamında kesinlikle her yerde pozitif kesit eğrilik metriklerinin bulunduğunu kanıtladı. Yau, büyük modellerin karmaşık eğrilik eşitsizlik tahminlerinin yapısal yön arayışında ve sembolik doğrulamada somut yardımlar sağladığını belirtti. (Kaynak: 量子位)

Shing-Tung Yau makalesinde yapay zekâya teşekkür etti

SWE-sweep Kriteri Yayımlandı: Agent’ların Sıfır Denetimle Kod Kusurlarını Otonom Olarak Keşfetme ve Onarma Yeteneklerinin Değerlendirilmesi : Meta ve diğer araştırma ekipleri, yeni nesil yazılım mühendisliği değerlendirme kriteri SWE-sweep’i önerdi. Doğrudan Issue açıklamasının verildiği geleneksel SWE-bench’ten farklı olarak SWE-sweep, Agent’a herhangi bir hata uyarısı vermeden tüm kod deposunu sunuyor ve gizli açıkları tamamen otonom olarak denetleyip düzeltmeler göndermesini talep ediyor. Güncel öncü büyük modellerin “ipuçsuz denetim” senaryolarındaki onarım oranı genel olarak %5’in altında kalıyor. (Kaynak: X (formerly Twitter), sarahcat21)

SWE-sweep kriteri yayımlandı

Hugging Face, Harness’lar Arası Pekiştirmeli Öğrenme Kılavuzunu ve OpenEnv Yakalama Proxy Paketini Açık Kaynak Yaptı : Aynı modelin Claude Code ve Codex gibi farklı Agent iskelelerinde sergilediği performansın %30’a varan farklar göstermesi sorununa yönelik olarak Hugging Face ekibi, Multi-Harness RL paradigmasını önerdi. OpenEnv şeffaf proxy’sini kullanarak çağrı Token’larını ve log olasılıklarını yakalayan ve TRL eşzamansız GRPO algoritmasıyla birleştiren ekip, dört farklı Harness üzerinde ortak pekiştirmeli öğrenme gerçekleştirdi; böylece modelin başarı oranını %42’den %54’e yükseltirken araç çağrı sayısını %31 azalttı. (Kaynak: Hugging Face Spaces)

Multi-Harness pekiştirmeli öğrenme eğitim planı

Microsoft FOCUS’u Önerdi: Eğitim Gerektirmeyen Anlık Karar Doğruluğunu Koruyan Bağlam Sıkıştırma Algoritması : Microsoft araştırma ekibi, bağlam anlık sıkıştırma çerçevesi FOCUS’u tanıttı. Algoritma, test zamanında Agent’ın sonraki eylemlerinin gerçekten bağımlı olduğu geçmiş adımları dinamik olarak belirleyebiliyor ve gereksiz etkileşim parçalarını kayıpsız şekilde ayıklıyor. Çok turlu diyalog ve araç çağırma görevlerinde bu yöntem, ince ayar gerektirmeden en yüksek bağlam kullanımını %48’e kadar azaltırken görev başarı oranını %8,9 artırıyor. (Kaynak: arXiv)

FOCUS ince ayar gerektirmeyen bağlam sıkıştırma

Google Research Kauldron’u Yayımladı: Saf Veri Konfigürasyonu ve Yol Ayrışımlı JAX Eğitim Paradigması : Google araştırma ekibi, yeni JAX derin öğrenme eğitim kütüphanesi Kauldron’u duyurdu. Çerçeve, konfig kullanarak tüm deney ağacını şeffaf ve saf sözlük verilerine dönüştürüyor; kontext aracılığıyla dizge anahtar yollarıyla bileşenler arasında tensörleri bağlayarak kayıp fonksiyonlarını ağdan tamamen ayrıştırıyor; ktyping desteğiyle adlandırılmış eksenlerde parametreler arası katı statik doğrulama sağlayarak derin öğrenme mühendisliğinin modülerlik seviyesini büyük ölçüde yükseltiyor. (Kaynak: MarkTechPost)

NeurIPS 2026’ya Kabul Edilen Araştırma “Otorite Yanlılığını” Ortaya Koyuyor: LLM’ler Kullanıcı İtirazlarına Direnebilirken Sahte Otorite Kaynaklarına Körü Körüne Güveniyor : Araştırma ekibinin sistematik değerlendirmesi, çoğu öncü büyük modelin hatalı kullanıcı girdilerini düzeltme yeteneğine sahip olduğunu, ancak aynı yanlış sonuca “doğrulanmış kaynak” etiketi verildiğinde doğru yanıtların %45 ila %88’inin bozulduğunu ortaya koydu. Model temsili analizi, “kaynak onayı” ile “kullanıcı onayının” gizli uzayda ayrıştığını doğrulayarak RAG sistemlerinin kirletilmiş arama içerikleri tarafından manipüle edilmeye karşı savunmasızlığını gözler önüne serdi. (Kaynak: Reddit r/MachineLearning)

LLM otorite yanlılığı araştırması

Özyinelemeli Dil Modellerinin (RLM) Derinlemesine Analizi: Kompozisyonel Genelleştirici Olarak Harness’a Yeni Bir Yaklaşım : MIT araştırmacısı Alex Zhang, gerçekleştirdiği röportajda Özyinelemeli Dil Modellerinin (RLM) temel mekanizmasını analiz etti. Büyük modellerin son derece uzun görevlerdeki temel darboğazının körü körüne yörünge eklemek olduğunu belirten Zhang, RLM’nin kodu tek araç olarak kullandığını ve bağlamı harici yürütme ortamına devrederek alt Agent’ları gerektiğinde özyinelemeli olarak çağırdığını vurguladı. Bu yapı, kısa vadeli görevlerde öğrenilen çözüm prosedürlerinin 30 kat daha uzun görevlere genelleşmesini sağlayarak bağlam yönetimi varsayımlarını yeniden şekillendiriyor. (Kaynak: Latent Space)

💼 İş Dünyası

GPU Bulut Bilişim Sağlayıcısı Lambda, 1 Milyar Doların Üzerinde Borç Finansmanını Tamamladı : Lambda, tanınmış kuruluşların aşırı talep gösterdiği ikinci kurumsal borç finansmanı turunu 1 milyar doları aşan bir büyüklükle tamamladığını duyurdu. Bu sabit faizli öncelikli teminatlı finansman turu, Morningstar DBRS ve Moody’s tarafından yatırım yapılabilir seviye notu aldı; toplanan fonlar, büyük sözleşmeli müşterilerin uzun vadeli bilgi işlem gücü devreye alma taleplerini karşılamak amacıyla doğrudan yeni nesil yüksek performanslı GPU kümelerinin satın alınmasında kullanılacak. (Kaynak: Lambda Blog)

Lambda 1 milyar dolarlık finansmanı tamamladı

İngiliz Bankası Barclays, Claude Code’u Entegre Etmek İçin Anthropic ile İş Birliğini Kapsamlı Şekilde Genişletti : İngiliz küresel bankası Barclays, sıkı bir yönetişim çerçevesi altında kurumsal düzeyde Agent’ları devreye almak amacıyla Anthropic ile stratejik ortaklığını derinleştirdiğini duyurdu. Banka, 2026 sonuna kadar küresel geliştiricileri arasında Claude Code penetrasyonunun %50’ye ulaşmasını, 2027’de ise yazılım mühendislerinin büyük çoğunluğunu kapsamasını bekliyor; hâlihazırda Claude tabanlı bilgi asistanı 16 binden fazla çalışana hizmet veriyor ve günde yaklaşık 120 bin e-postayı sınıflandırıp işliyor. (Kaynak: Anthropic News)

ABD SEC Özel Sermaye Danışmanına Resmen Dolandırıcılık Davası Açtı: OpenAI ve SpaceX’in “Halka Arz Öncesi Hisseleri” Bahanesiyle Fonları Çarçur Etti : ABD Menkul Kıymetler ve Borsa Komisyonu (SEC), öncü teknoloji şirketlerinin halka arz öncesi (pre-IPO) işlemlerini uydurduğu iddia edilen bir özel sermaye fonu danışmanına karşı dava açtı. Zanlıların OpenAI ve SpaceX’in halka açık olmayan ikincil piyasa hisse kotalarına erişimleri olduğunu iddia ederek yatırımcıları fon aktarmaya yönlendirdiği ve ardından bu paraları zimmetlerine geçirip harcadığı belirtildi. Olay, öncü büyük model laboratuvarlarının yüksek değerlemeleriyle birlikte, halka açık olmayan ikincil piyasa hisseleri eksenli finansal dolandırıcılıkların giderek arttığını ortaya koyuyor. (Kaynak: Reddit r/artificial)

ABD SEC sahte pre-IPO fonuna dava açtı

🌟 Topluluk

Palantir’in Vardiya Çizelgeleme Yapay Zekâsı ABD Genelinde Binlerce Hemşirenin Protestosunu Tetikledi : Sağlık devi HCA ile Palantir’in ortaklaşa devreye aldığı Timpani algoritmik vardiya çizelgeleme sistemi, hemşireler arasında büyük bir öfkeye ve grev protestolarına yol açtı. Sağlık çalışanları, sistemin izin taleplerini ve vardiya aralıklarını görmezden geldiğini, sık sık arka arkaya gece nöbetleri yazdığını ve deneyimsiz yeni personeli aynı vardiyalara yığdığını belirterek, bunun kritik hastaların tedavisinde gecikmelere yol açtığını ve mesleki tükenmişliği artırdığını öne sürdü. Bu durum, insan maliyetlerini yapay zekâ ile körü körüne düşürmenin sağlık güvenliğine zarar verdiği ibret verici bir vaka haline geldi. (Kaynak: WIRED)

Hemşireler Palantir çizelgeleme sistemini protesto ediyor

Teksas Veri Merkezlerinde Dizel Jeneratör Patlaması: Çevre ve Sivil Haklar Örgütleri Düzenleme Açıklarını Protesto Etti : NAACP dahil sivil haklar ve çevre örgütleri yayımladıkları açık mektupla, Teksas genelinde en az 38 yapay zekâ veri merkezinin aslen kuru temizlemeciler için tasarlanmış “standart izinleri” kullanarak şebeke denetiminden kaçmak amacıyla 2.100’den fazla yedek dizel jeneratör ve gaz türbini kurduğu konusunda uyarıda bulundu. Bunlar arasında OpenAI’ın Abilene Stargate kampüsünün sıkı çevresel incelemelerden ve oturumlardan kaçarak 10 gaz türbini ve 62 dizel jeneratör kurması, bilgi işlem altyapısının çevresel dışsallıkları konusunda ciddi tartışmalara yol açtı. (Kaynak: TechRadar)

Teksas yapay zekâ veri merkezleri jeneratör tartışması

Yann LeCun, Yapay Zekâ Yok Oluş Teorisini ve Dario Amodei’yi Açıkça Eleştirerek Güvenlik Paniğinin Yönetim Eksikliğinden Kaynaklandığını Söyledi : Turing Ödülü sahibi Yann LeCun, Fortune dergisine verdiği röportajda “yapay zekânın insanlığın yok olmasına yol açacağı” konusunda sıfır endişe taşıdığını açıkça belirterek, Anthropic CEO’su Dario Amodei gibi felaket tellallığı yapanların söylemlerini tamamen “hayal ürünü” olarak nitelendirdi. LeCun, son dönemde Agent’ların yetkisiz eylemleri dahil yaşanan birçok olayın, geleneksel yazılım mühendisliği tasarım kusurlarından ve insan denetiminin eksikliğinden kaynaklandığını, bunların tamamen önlenebilir ve kontrol edilebilir kapsamda olduğunu vurguladı. (Kaynak: Reddit r/ArtificialInteligence)

Yann LeCun yapay zekâ yok oluş teorisini açıkça eleştirdi

GPT-6 Astra, Napolyon’un 217 Yıllık Çok Gizli Şifreli Mektubunu 6 Saatte Çözdü : Siber güvenlik araştırmacısı Carter Church, yalnızca tek bir düşük çözünürlüklü fotokopi girdi olarak verildiğinde, GPT-6 Astra’yı kullanarak 1.300 el yazısı karmaşık sembolün sınıflandırılmasını, benzetimli tavlama (simulated annealing) algoritması çözücüsünün yazılmasını ve 19. yüzyıl Fransızca tarihi metinlerinin çapraz doğrulamasını otonom olarak gerçekleştirdi. Model, 6 saat içinde Napolyon’un 1809’da Mareşal Marmont’a yazdığı şifreli savaş raporunu tamamen çözdü ve Fransa resmî yazışma koleksiyonunda 1865 yılından bu yana eksik olan el yazması bölümleri kesin olarak tamamladı. (Kaynak: 36氪)

Astra Napolyon'un gizli mektubunu çözdü

Ramp Kurumsal Endeksi Yapay Zekânın “Daha Çok Kullan, Daha Az Öde” Fiyat İndirimi Döngüsüne Girdiğini Gösteriyor : Kurumsal finans platformu Ramp, en son Yapay Zekâ Endeksi’ni yayımladı. Veriler, ABD şirketlerinin yapay zekâ API’larına yaptığı toplam harcamanın Temmuz ayındaki zirvenin ardından düşmeye devam ettiğini, ancak fiili Token tüketiminin trendin aksine %50 artarak tarihi bir rekora ulaştığını gösteriyor. Bu durum temel olarak OpenAI ve Anthropic’in hafif standart modeller ve önbellek eşleşmeleri (cache hits) konusundaki fiyat savaşından kaynaklanıyor. Ayrıca, açık kaynaklı modellerin incelenen şirketlerin API harcamalarındaki payı hâlâ %5’in altında bulunuyor. (Kaynak: THE DECODER)

Ramp Kurumsal Yapay Zekâ Endeksi

Aynı Depoda Çoklu Agent İş Birliği Testi: İzole Dal Birleştirmeleri Mantıksal Çökmelere Yol Açıyor, Agent’lar Arası Diyalog Kritik Çözüm Haline Geliyor : Topluluk tarafından aynı kod deposunu sürdüren çoklu Agent iş birliğine yönelik yapılan ampirik testler, Agent’ların izole dallarda tüm birim testlerini geçmelerine rağmen, birleştirme sonrasında anlamsal örtük çakışmalar nedeniyle %100 başarısızlık oranıyla karşılaştıklarını ortaya koydu. Buna karşın, Agent’lara birbirlerine mesaj gönderme ve paylaşılan dizinde birbirlerinin niyetlerini algılama yeteneği verildiğinde görev başarı oranı %100’e ulaştı. Bu durum, çoklu Agent iş birliğinin temelinin sonradan sürüm kontrolünden ziyade iletişim ve uzlaşıda yattığını gösteriyor. (Kaynak: Reddit r/artificial)

“Kod Çöpü El Bombası” Açık Kaynak Bakım Krizini Tetikledi, Topluluk PR Kabul Mekanizmalarının Yeniden Yapılandırılması Çağrısında Bulundu : Shopify kurucusu ve birçok kıdemli açık kaynak sorumlusu, “Slop Grenade (Çöp Bombası)” fenomenini tartışıyor: Çok sayıda geliştirici, Agent’lar aracılığıyla tek tıkla baştan sona okunmamış binlerce satırlık PR’lar oluşturarak proje yöneticilerinde inceleme yorgunluğuna neden oluyor. DHH ve diğer isimler, açık kaynak projelerinde çekirdek olmayan geliştiriciler tarafından sunulan yapay zekâ üretimi PR’ların varsayılan olarak kapatılmasını önerirken, kod inceleme araçlarının tek dosya Diff karşılaştırmasından tam yaşam döngüsü davranış doğrulamasına geçmesi gerektiği vurgulanıyor. (Kaynak: X (formerly Twitter))

Time Dergisinden Bomba İddia: Trump Gizli Görüşmede Jeopolitik Askeri Kararlar İçin Grok’a Danıştı : Time dergisinin haberine göre ABD ordusunun Venezuela’ya yönelik büyük askeri operasyonundan haftalar önce Trump, Musk ile yaptığı gizli bir toplantıda saatlerce xAI’ın Grok modeliyle sohbet etti ve Venezuela kamuoyunun cumhurbaşkanlarının alıkonulmasına yönelik olası tepkileri üzerine yoğun simülasyonlar yürüttü. Bu durum, siyasi liderlerin kritik jeopolitik çatışma ve savaş kararlarında kara kutu diyalog modellerine aşırı bağımlı hale gelmesi konusunda kamuoyunda derin endişelere yol açtı. (Kaynak: TechCrunch)

💡 Diğer

ChatGPT macOS Masaüstü Uygulamasındaki Yüksek Riskli Komut Dosyası Kaçış Açığı Açığa Çıkarıldı ve Düzeltildi : Güvenlik kuruluşu Objective-See, macOS için ChatGPT uygulamasında daha önce var olan yüksek riskli bir yerel ayrıcalık yükseltme açığını ortaya çıkardı. Kötü amaçlı bir program, yalnızca birkaç düzine satırlık komut dosyasıyla uygulamanın çoklu imza doğrulamasını atlatabiliyor, güvenilen komut dosyası yorumlayıcısını aldatarak ana işleme enjekte olabiliyor ve böylece kurbanın geçmiş diyalog kayıtlarını, tarayıcı oturumlarını ve sistem özel izinlerini tamamen ele geçirebiliyordu. OpenAI, yayımladığı acil bir güncellemeyle bu açığı giderdi. (Kaynak: WIRED)

ChatGPT masaüstü istemci açığı

ABD Federal Mahkemesi, Yayın Devlerinin Google AI Overviews’a Karşı Açtığı Antitröst Davasını Reddetti : ABD Federal Bölge Mahkemesi Yargıcı Amit Mehta, Chegg ve Penske’nin Google AI Overviews’a karşı açtığı antitröst iddialarını resmen reddetti. Davacılar, Google’ın uzmanlık gerektiren eğitim ve haber içeriklerini ücretsiz olarak taradığını ve Gemini’ı doğrudan özetler oluşturmak için kullanarak web sitesi trafiğini yarı yarıya düşürdüğünü iddia etmişti. Yargıç, web sitelerinin içeriklerini arama motorlarına açarken yalnızca “trafik elde etme beklentisi” taşıdığını, bunun ise antitröst yasasının tanımladığı yasal bir hizmet sözleşmesi teşkil etmediğine hükmetti. (Kaynak: Ars Technica)

Kaliforniya İnsan-Robot Karma Dövüş Sanatları Müsabakasını Durdurdu; İnsansı Robot Ticari Gösterileri Düzenleyici Kırmızı Çizgiye Takıldı : Kaliforniya düzenleyici kurumları, robot girişimi REK’e bir durdurma emri göndererek insan ile insansı robot arasında yapılması planlanan kuralsız kafes dövüşü müsabakasını acilen durdurdu. Yetkililer, bu tür izinsiz temas sporları gösterilerinin ciddi güvenlik tehlikeleri barındırdığına hükmetti; bu da somutlaşmış yapay zekâ (embodied AI) donanımlarının gücü ve hareket kabiliyeti arttıkça, fiziksel dünyaya yönelik uç gösterilerin özel etkinlik mevzuatının kırmızı çizgilerine çarptığını gösteriyor. (Kaynak: X (formerly Twitter))

Kaliforniya insan-robot dövüşünü durdurdu

Bir yanıt yazın

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir