Güvenlik Araştırma Ekibi Claude Yardımıyla OpenAI’ın… | Yapay Zeka Bülteni 2026-09-19

🔥 Odak Noktası

Güvenlik Araştırma Ekibi Claude Yardımıyla OpenAI’ın Dahili Kod Deposunu Ele Geçirdi : Hacktron AI güvenlik araştırma ekibi, bir hata ödülü (bug bounty) programı kapsamında Claude Opus 5 desteğiyle 72 saat içinde OpenAI çalışan hesaplarını ele geçirdiğini ve algoritmik sırların barındırıldığı çekirdek özel monorepo’ya (openai/openai) bir doğrulama PR’ı gönderdiğini açıkladı. Saldırı zinciri, Discourse forum görsel yükleme bileşenindeki bir libheif yığın arabellek taşması (heap buffer overflow) güvenlik açığıyla başladı; ardından OpenAI SSO kimlik yapılandırma hatasıyla birleşerek GitHub’a bağlı çalışan Codex hesabını ele geçirdi ve LLM Token maliyeti 3.000 doların altında kaldı. Bu olay, “öncü AI teknolojilerinin yüksek riskli siber saldırı yeteneklerini hızla demokratikleştirdiği” ve en üst düzey laboratuvarların dahi savunma zafiyetleri barındırdığı konusunda sektörde büyük yankı ve endişe uyandırdı (Kaynak: The Wall Street Journal, 36氪)

Güvenlik ekibi Claude kullanarak OpenAI kod deposunu ele geçirdi

Alibaba DAMO Academy’nin Genel Medikal Görüntüleme Büyük Modeli RADAR, Science Dergisinde Yayımlandı ve Tamamen Açık Kaynak Hale Getirildi : Alibaba DAMO Academy, Zhejiang Üniversitesi 1. Hastanesi dahil düzinelerce medikal kurumla iş birliği içinde geliştirdiği dünyanın ilk uzman düzeyindeki genel abdominal görüntüleme büyük modeli DAMO RADAR’ı Science dergisinde yayımladı. Geleneksel medikal AI’ın tek bir hastalık türüyle sınırlı kalma darboğazını aşan model, organ düzeyinde ince taneli görsel-metin hizalaması ve uyarlanabilir kontrast modellemesi sayesinde tek bir modelle batındaki 18 anatomik yapıda 146 hastalığı kapsayabiliyor. Çok merkezli doğrulamalarda ortalama AUC değeri 0,913’e ulaşarak kıdemli radyologlarla yarışan bir teşhis doğruluğu sergiledi ve insan-AI iş birliğiyle görüntü inceleme süresini %30,7 oranında azalttı. DAMO Academy; model ağırlıklarını, eğitim çerçevesini ve değerlendirme kodlarını tamamen açık kaynak olarak sundu (Kaynak: Science, 36氪)

Alibaba DAMO Academy genel abdominal görüntüleme modeli DAMO RADAR Science'ta

Anthropic, Ar-Ge Çalışmalarının %26’sının AI Tarafından Otonom Olarak Yürütüldüğünü Açıkladı ve Yaşam Bilimleri Doğrulama Programı LSVP’yi Başlattı : Anthropic, kurum içi Ar-Ge ölçüm verilerini ilk kez kamuoyuyla paylaştı: Claude, insan gözetimi altında şirketin öncü model Ar-Ge çalışmalarının %26’sını (AL4 seviyesi) “yönetiyor” (bu oran altı ay önce %1’in altındaydı); şirket içinde eşzamanlı olarak 30.000’den fazla otonom ajan rutin olarak çalışıyor ve aylık 1 milyardan fazla karar tetikleniyor. Aynı zamanda Anthropic, doğrulanmış ve onaylanmış ilaç şirketleri ile araştırma kurumları için öncü modellerin kısıtlamalarını kısmen kaldıran Yaşam Bilimleri Doğrulama Programı’nı (LSVP) resmi olarak başlattı. Program, geleneksel tek tip gerçek zamanlı engelleme mekanizmaları yerine niyet bildirimi, 30 günlük çevrimdışı denetim ve ortak sorumluluğa dayalı yeni bir güvenlik yönetişimi paradigması kuruyor (Kaynak: Anthropic News, AnthropicAI)

Anthropic öncü Ar-Ge ölçüm metriklerini açıkladı

New York Times’ın Microsoft ve OpenAI’a Açtığı Davada Kritik Şirket İçi Belgelerin Gizliliği Kaldırıldı: Microsoft Yöneticisi AI Veri Kazımayı “En Büyük Emek Hırsızlığı” Olarak Nitelendirdi : Gizliliği yeni kaldırılan mahkeme belgeleri, Microsoft Uygulamalı Bilimler Direktörü Brent Hecht’in şirket içinde büyük modellerin izinsiz haber kazıma faaliyetlerini “insanlık tarihindeki en büyük emek hırsızlığı” ve “adil kullanım (fair use) ilkesinin tamamen alaya alınması” olarak nitelendirdiğini ortaya koydu. OpenAI yöneticileri de ürünlerinin yayıncılar için “ciddi bir ikame tehdidi” oluşturduğunu kabul etmişti. İlgili belgeler, her iki tarafın da ödeme duvarlarını (paywall) aşarak veri kazıma detaylarını ifşa ederek AI sektörünün uzun süredir dayandığı “adil kullanım” (Fair Use) savunmasını benzeri görülmemiş bir yasal zorlukla karşı karşıya bıraktı (Kaynak: TechCrunch )

New York Times - Microsoft ve OpenAI davasında gizliliği kaldırılan kritik şirket içi belgeler

🎯 Gelişmeler

Alibaba Tongyi, 1M Bağlam Uzunluğuna Sahip Tam Modaliteli Qwen3.8-Omni-Flash Modelini ve Ekosistemini Duyurdu : Alibaba Tongyi ekibi, merkezinde ajan iş akışları (agent workflow) yer alan ilk tam modaliteli modeli Qwen3.8-Omni-Flash’ı resmi olarak tanıttı. Model; metin, görüntü, ses ve 1 saatlik kesintisiz video akışı girdilerini yerel olarak destekliyor. Kabadan inceye aktif algılama mekanizmasını entegre eden model, ultra uzun video anlama karşılaştırma testi OmniVideoBench’te doğruluğunu 67,8’e çıkarırken Token tüketimini %45,7 azalttı ve video API maliyetini bir önceki nesle kıyasla yaklaşık %89 düşürdü. Ekip aynı zamanda çoklu uçbirim Harness entegrasyonunu destekleyen Qwen-MM-Plugins ve omni-skill-creator araçlarını açık kaynak olarak yayınladı (Kaynak: Qwen, Alibaba_Qwen)

Qwen3.8-Omni-Flash duyurusu

DeepSeek, Ultra Uzun Bağlam KV Önbellek Darboğazını Aşan DeepSeek-V4.1-Flash’ı Tanıttı : DeepSeek, 1 milyon Token bağlam penceresini destekleyen 552B parametreli çok modaliteli MoE modeli DeepSeek-V4.1-Flash’ı yayınladı. Nedensel Kodlayıcı-Kod Çözücü (CED) mimarisini kullanan model, Prefill aşamasında yalnızca 8B parametreyi etkinleştiriyor; CSA2 katmanlar arası yeniden kullanım ve FP4 sıkıştırma teknolojileriyle birleşerek HBM içindeki global KV Cache bellek kullanımını 890 bayt/Token’a (önceki neslin yalnızca 1/4’ü) düşürüyor ve ajanların uzun bağlamlı iş yüklerinin dağıtım maliyetlerini önemli ölçüde azaltıyor (Kaynak: HuggingFace Daily Papers)

Figure, İnsansı Robot Büyük Modeli Helix 2.5’i Tanıttı ve Gerçek Ev Ortamlarında Sıfır Örnekli Genelleştirmeyi Doğruladı : İnsansı robot girişimi Figure, yeni nesil uçtan uca sinir ağı Helix 2.5’i tanıttı ve San Francisco Bay Area’daki önceden örneklenmemiş 30 yabancı evde düzenleme, yatak yapma ve havlu katlama testleri gerçekleştirdi. Deneyler, büyük ölçekli birinci şahıs insan davranış verisi Index ile ön eğitimin ardından, robotun daha önce görmediği ortamlardaki sıfır örnekli (zero-shot) tüm vücut görev başarı oranının %9’dan %56’ya yükseldiğini göstererek, devasa insan deneyiminden fiziksel robot eylem tahminine aktarımın Ölçekleme Yasasını (Scaling Law) ilk kez doğruladı (Kaynak: 36氪)

Figure Helix 2.5 testi

SenseTime, SenseNova-U1.5 Teknik Raporunu Yayınladı: Akış Eşleme ve Çoklu Uzman Damıtma ile Yerel Birleşik Çok Modalilik : SenseTime, 8B parametreli yerel birleşik çok modaliteli modeli SenseNova-U1.5’in tam teknik raporunu yayınladı. Model, NEO-unify mimarisini ve 32×32 kompakt görsel Token’ları kullanarak 3×3 konvolüsyonel 2D özellik alanı yeniden yapılandırması yoluyla yerel 4K görüntü üretimini destekliyor. Eğitim sonrası (post-training) aşamasında yenilikçi bir “önce uzmanlaşma, sonra birleşme” çevrimiçi politika damıtma (OPD) paradigması benimsenerek estetik, OCR, infografik ve hassas düzenleme olmak üzere dört uzmanlık yeteneği tek bir temel üzerinde yeniden birleştirildi; böylece hem üst düzey akıl yürütme hem de piksel düzeyinde üretim elde edildi (Kaynak: WeChat)

SenseNova-U1.5 mimarisi

Huawei, Ascend 960DT AI Çipinin Seri Üretim Tarihini 2027’nin 1. Çeyreğine Çekti : Huawei, Connect Konferansı’nda yeni nesil Ascend 960DT çipinin lansman tarihini başlangıçta planlanan 2027 3. Çeyreğinden önemli ölçüde öne çekerek 1. Çeyreğe aldığını duyurdu. Huawei, Peerium bilgi işlem mimarisine ve UnifiedBus yüksek hızlı ara bağlantı teknolojisine dayalı Atlas 950 süper kümesini inşa ediyor. Tek bir küme, 256.000’e kadar hızlandırıcı kartı bağlamayı destekleyebiliyor ve hesaplama gücü kısıtlamalarıyla başa çıkmak ile NVIDIA’yı yakalama sürecini hızlandırmak için sistem düzeyinde mühendislik inovasyonunu hedefliyor (Kaynak: TechCrunch)

PrismML, Üçlü Nicelenmiş Uç Cihaz Modeli Bonsai 2 27B’yi Tanıttı; Topluluk Testleri Tartışma Yarattı : PrismML, Qwen3.8-27B tabanlı üçlü nicelenmiş (ternary quantized) Bonsai 2 27B modelini tanıttı; model boyutunu 9,3 kat küçülterek 5,9 GB’a indirdiğini ve kapsamlı performansın %98,2’sini koruyarak tüketici sınıfı uç cihazlarda WebGPU üzerinden doğrudan akıcı bir şekilde çalışabildiğini iddia etti. Ancak topluluğun teknik raporu incelemesi ve yaptığı testler, Terminal-Bench ve SWE-bench Verified gibi uzun bağlamlı ajan karşılaştırma testlerinde performansın gerçekte yaklaşık %25 düştüğünü ortaya koydu ve uç düzeyde düşük bit nicelleştirme karşılaştırmalarında “cımbızla veri seçme” (cherry-picking) üzerine geniş çaplı tartışmalara yol açtı (Kaynak: TechCrunch, Reddit r/LocalLLaMA)

Bonsai 2 tartışması

Cactus, Needle 3 Uç Cihaz Otomasyon Modelini ve Kademeli Mimarisini Tanıttı : Cactus Compute, Simple Attention ile Hadamard MLP ve Engram özet tablolarını (hash tables) birleştiren ve hesaplama maliyeti yalnızca 50M’lik bir modele denk olan 121M parametreli Needle 3 otomasyon temel modelini açık kaynak olarak sundu. Özgün “akıllı kademe” (intelligence ladder) mimarisi, 2 ila 20 katman arasında dinamik dilimleme ve dağıtımı (8-29 MB boyutunda) destekliyor; saf CPU kod çözme hızı 4.000 tok/sn’ye ulaşıyor ve uç cihazlar ile giyilebilir teknolojilerde sıfır ağ bağımlılığıyla fonksiyon çağrısı ve deterministik kontrole odaklanıyor (Kaynak: Reddit r/LocalLLaMA)

Cactus Needle 3

Wenzhun Intelligence ve Tsinghua Üniversitesi Yapılandırılmış Veri Temel Modeli LimiX-2’yi Duyurdu : Wenzhun Intelligence, önceki tek hedefli tahmin盛 paradigmasını değiştiren, Bağlam Mekanizma Ağları (CMNs) ve Koşullu Maskeli Modelleme (CCMM) öneren 400M parametreli yapılandırılmış veri genel modeli LimiX-2’yi tanıttı; modelleme, değişkenler arasındaki ortak nedensel bağımlılıkları öğrenmek için hücre düzeyine (Cell-Level) indirgendi. Model, TabArena ve TALENT gibi uluslararası karşılaştırma testlerinin sınıflandırma ve regresyon görevlerinde zirveye yerleşerek Google TabFM ve SAP TabPFN’i geride bıraktı (Kaynak: 量子位)

Wenzhun Intelligence yapılandırılmış veri modeli LimiX-2'yi duyurdu

Apple, Enerji Yönlendirmeli Ayrık Akış Eşleme Algoritması TS-DFM ve Difüzyon Pekiştirmeli Öğrenme DACA-GRPO’yu Önerdi : Apple Makine Öğrenimi ekibi iki öncü üretken modelleme başarısı yayınladı: TS-DFM, ayrık akış eşlemesindeki erken yörünge sıçramalarını düzeltmek için hafif bir enerji pusulası kullanan enerji yönlendirmeli damıtmayı öneriyor; yalnızca 8 adımda 1024 adımlı öğretmen modeli geride bırakıyor ve 128 kat hızlanma sağlıyor. DACA-GRPO ise difüzyon dil modellerinin pekiştirmeli öğrenimindeki zamansal kredi atama zorluğunu çözerek kod üretiminde 7,4 puan ve kısıtlamalara uyumda 36,3 puan artış sağlıyor (Kaynak: Apple Machine Learning Research)

Apple, TS-DFM akış eşleme algoritmasını önerdi

Birleşmiş Milletler ve Google İş Birliğiyle MCP Standardına Sahip UN System Data Commons Platformu Yayına Alındı : Birleşmiş Milletler ve Google.org, 26 BM kuruluşunun resmi yetkili veri setlerini entegre eden yapılandırılmış bir kamu veri platformunu kullanıma sundu. Daha önce büyük modellerin küresel istatistiksel göstergeleri yanıtlama doğruluğunun yalnızca %21,2 olması sorununa çözüm olarak platform, Google Bilgi Grafiği’ne (Knowledge Graph) dayanarak doğal dil sorgularını ve yerel MCP protokolünü destekliyor; böylece çeşitli AI Agent’larının disiplinler arası korelasyon analizi ve grafik oluşturma için doğrudan yetkili kaynakları çağırmasına olanak tanıyor (Kaynak: Google AI Blog, 36氪)

BM ve Google iş birliğiyle UN System Data Commons yayında

🧰 Araçlar

Anthropic, Claude Code Projects ile Çok İş Parçacıklı İş Birliğini ve Kalıcı Proje Belleğini Yeniden Yapılandırdı : Anthropic, Claude Code masaüstü ve web sürümlerinde Projects mimarisini kullanıma sundu. Kullanıcılar tek bir oturum üzerinden üst düzey hedefleri iletebiliyor; ana Koordinatör ajan bunları otomatik olarak bulutta paralel alt görev kollarına ayırarak bağımsız olarak yürütüyor, hataları ayıklıyor ve PR gönderiyor. Tüm alt görevler sürekli gelişen kalıcı proje belleğini ve bağlamını paylaşarak çevrimdışı eşzamansız barındırmayı ve kesintisiz iş birliğini destekliyor (Kaynak: dotey, Anthropic News)

Claude Code Projects işlev gösterimi

Meta’nın Masaüstü Kişisel Ajanı Muse Resmi Olarak macOS Platformunda : Meta’nın kişisel ajanı Muse, mobil sürümünün ardından yerel Mac uygulamasını yayınladı. Masaüstü iş akışlarına derinlemesine entegre olan uygulama, açık yetkilendirme mekanizmasıyla uygulamalar arası yerel dosyaları, takvimleri, notları ve kişileri okuyabiliyor; yerel güvenli korumalı alanda (sandbox) uygulamalar arası dosya düzenlemeyi, formların otomatik doldurulmasını ve bilgi derleme planlamasını otonom olarak gerçekleştirebiliyor (Kaynak: The Verge, AIatMeta)

OpenAI, Hukuk Sektörüne Özel Amiral Gemisi Ürünü Astra for Law’ı Resmi Olarak Duyurdu : GPT-6 Astra altyapısını temel alan OpenAI, 230 milyon URL’lik ABD hukuki içtihat ve mevzuat dizinini entegre ederek Astra for Law ürününü piyasaya sürdü. Legal Research Bench testinde %54 doğruluğa ulaştı (genel sürümde yalnızca %38,7), Harvey ve Legora dahil 26 resmi ve 47 topluluk eklentisini entegre etti ve sıfır veri saklama (zero-data retention) sunan Trusted Access gizlilik izolasyon mimarisi sağlayarak sözleşme incelemesi, işlem durum tespiti ve başvuru belgelerinin hazırlanmasını destekliyor (Kaynak: OpenAI News, gdb)

OpenAI hukuk amiral gemisi ürünü Astra for Law'ı resmi olarak duyurdu

Salesforce, Agentforce Kurumsal Orkestrasyon ve Deterministik Denetim Altyapısını Güncelledi : Salesforce, Data Cloud ve MCP protokolünü birleştiren üretime hazır Agentforce paketini tanıttı. Platform, otomatik sentetik stres testleri gerçekleştiren yerleşik Agent Testing Center’ı içeriyor ve işlemler ile temel veri operasyonlarının yalnızca önceden belirlenmiş kuralları karşıladıktan sonra yürütülmesini zorunlu kılan bir Deterministik Geçit (Deterministic Gating) mekanizması getiriyor; Southwest Airlines’ın gerçek testleri müşteri hizmetleri görevlerinde %45 tam otomatik çözüm oranına ulaşıldığını gösterdi (Kaynak: MarkTechPost)

Salesforce Agentforce mimarisi ve Southwest Airlines vaka analizi

LangChain, Yaşam Bilimleri Ajan Çalışma Alanı Deep Life Sci’ı Açık Kaynak Olarak Sundu : LangChain, Deep Agents mimarisine dayanan, klinik ve laboratuvar araştırmacılarına yönelik açık kaynaklı ajan Deep Life Sci’ı yayınladı. Sistem; PubMed, PubMed Central ve ClinicalTrials.gov’daki on milyonlarca makale ve deney verisini derinlemesine entegre ediyor, özel bir kod korumalı alanı (sandbox) ortamıyla donatılmış olup yüzlerce karmaşık bilimsel makalenin çıkarımını ve çapraz doğrulamasını birden fazla alt ajan aracılığıyla eşzamanlı olarak işlemeyi destekliyor (Kaynak: LangChain)

Deep Life Sci arayüzü ve yetenekleri

Google Labs, Aile İçi Akıllı İş Birliği Ajanı CC’yi Tanıttı : Google Labs, ev işleri yönetimine yönelik AI Agent ürünü CC’yi resmi olarak duyurdu. Sistem, yetki izolasyonlu hesaplarla en fazla 6 aile üyesinin aynı anda erişimini destekliyor; okul bildirimlerini otomatik olarak analiz edebiliyor, üyeler arası takvim programlarını senkronize edebiliyor, etkinlik hatırlatıcılarını özetleyebiliyor ve “aile tarafından paylaşılan bilgiler” ile “kişisel tercihler” arasında ayrım yapan katmanlı bir bellek yönetim yeteneğine sahip (Kaynak: Ars Technica, Google)

Google CC aile ajanı arayüz ekran görüntüsü

Wood Mackenzie, Bedrock AgentCore Tabanlı APEX Enerji Analiz Platformunu İnşa Etti : Enerji danışmanlık devi Wood Mackenzie, paylaşımlı ajan platformu APEX’i tanıttı. AgentCore ve MCP birleşik ağ geçidini temel alan platform, kurum içi araştırma ajanı “Woody” ile müşteriye dönük “Lens AI”ı entegre ediyor; doğal dille çoklu araç çağrısı planlamayı, gerçek zamanlı üretken kullanıcı arayüzü (Generative UI) grafikleri oluşturmayı ve sunum slaytları (PPT) hazırlamayı destekleyerek enerji sektörleri arası Agent geliştirme döngüsünü aylardan saatlere indiriyor (Kaynak: AWS Machine Learning Blog)

Wood Mackenzie APEX mimari şeması

AWS, Akıllı İşe Alım ve Mülakat Paketi Amazon Connect Talent’ı Duyurdu : AWS, büyük ölçekli işe alım senaryoları için tasarlanan Amazon Connect Talent’ı resmi olarak kullanıma sundu. Sistem, AI Agent’lar tarafından 7/24 yapılandırılmış yetkinlik mülakatları ve mantık değerlendirmeleri yürütüyor; işe alım uzmanlarının incelemesi için olgusal kanıt zincirleri ve puanlama gerekçeleri içeren değerlendirme raporlarını otomatik olarak oluşturarak öznel önyargıları ortadan kaldırırken ölçeklenebilir aday-pozisyon eşleştirme verimliliğini büyük ölçüde artırıyor (Kaynak: AWS Machine Learning Blog)

Amazon Connect Talent mülakat yapılandırma arayüzü

📚 Araştırma

Stanford’un Çok Ajanlı Sanal Biyoteknoloji Sistemi Science’ta: 37 Bin Örnek 6 Saatte Devasa Klinik Deneyleri İşledi : Stanford Üniversitesi, Science dergisinde gerçek bir biyoteknoloji Ar-Ge mimarisini simüle ederek 4 departman ve 11 ajan türü kuran “Virtual Biotech” sistemini yayımladı. Veri çıkarma görevinde sistem, eşzamanlı olarak 37.075 ajan örneği başlattı ve yalnızca 6 saat içinde 55.000’den fazla klinik denemenin çok modaliteli derin entegrasyonunu tamamladı (tek bir ajanın bunu yapması 76 gün sürerdi) ve akciğer kanseri ADC aday hedefi olarak B7-H3’ü başarıyla belirledi (Kaynak: Science)

Stanford Virtual Biotech çok ajanlı biyoteknoloji süreç şeması

Tsinghua ve Fudan Üniversitelerinin Büyük Modellerle Uluslararası Değerler Simülasyonu Araştırması Computational Linguistics’te Yayımlandı : Tsinghua Üniversitesi, Fudan Üniversitesi ve Shanghai Jiao Tong Üniversitesi ile birlikte Dünya Değerler Araştırması (WVS) kapsamındaki 59 ülkenin verilerine dayanarak 9 açık kaynaklı LLM’i değerlendirdi; modellerin gelişmiş ekonomiler ve yüksek yönetişim kalitesine sahip ülkeleri simüle etmede belirgin şekilde daha yüksek doğruluk sergilediğini ve az temsil edilen grupların baskın kültürlere doğru asimetrik yakınsama yanlılığı taşıdığını keşfetti. Araştırma, “temsil eşitliği” değerlendirme metriğini önererek belirli grupların arka plan bilgilerini eklemenin, yalnızca ana dil yönlendirmesi veya tercih hizalaması yapmaktan kültürlerarası temsil adaletini geliştirmede çok daha etkili olduğunu kanıtladı (Kaynak: WeChat)

Büyük modellerde uluslararası değerler simülasyonu araştırması

Beihang ve CUHK Görsel Ajan Kendi Kendine Evrim Çerçevesi OmniHarness’ı Önerdi : Ortak bir araştırma ekibi, karmaşık görsel üretimler için otonom bir keşif çerçevesi olan OmniHarness’ı önerdi. Sistem, yenilik ve yetenek sınırları sezgisellerine dayalı konu seçimiyle otonom pratikler yapıyor ve başarıyla oluşturulan ComfyUI iş akışlarını sembolik politika kütüphanelerine soyutluyor; ComfyBench yaratıcı görevlerinde %95 çözüm oranına ulaşıyor ve deneyim politika kütüphanesi diğer ajan çerçevelerine ve video iş akışlarına sıfır örnekle aktarılabiliyor (Kaynak: 36氪)

OmniHarness mimarisi ve sonuçları

NVIDIA Ekibi Çok Ajanlı Bilimsel Araştırma Paylaşımlı Bellek Mimarisi Agora’yı Önerdi : NVIDIA araştırmacıları, Git değişmez commit’lerine dayalı yönlendirilmiş çevrimsiz çizge (DAG) paylaşımlı bellek mimarisi Agora’yı tanıtan bir makale yayınladı. Merkezi bir planlayıcısı olmayan 13 LLM Worker, karma model başlatma görevini 12 gün içinde iş birliğiyle tamamladı; hipotezleri, kodları ve doğrulama kayıtlarını yapılandırılmış bir şekilde Git ağacına kaydederek çoklu ajanlar arasındaki tekrarlayan deneme-yanılmaları ve durum çakışmalarını tamamen ortadan kaldırdı ve 165 bağımsız yeniden üretim deneyinin tümü başarıyla sonuçlandı (Kaynak: omarsar0)

Agora paylaşımlı bellek mimarisi

Gerçek Uç Cihaz Ajan Karşılaştırma Testi AndroidLife, Uzun Süreli Kontrol Eksikliklerini ve Aşırı Isınma Sorununu Ortaya Koydu : Topluluk, fiziksel telefonlar ve gerçek ağ ortamlarına dayalı, AI Agent’ların günlük uygulamalar arası görevlerdeki uç cihaz performansını değerlendiren AndroidLife testini yayınladı. Yapılan testlerde Qwen3.8-27B, 60 gerçek görevde yalnızca %56,7 başarı oranına ulaştı, görev başına yaklaşık 6 dakika sürdü ve çip tepe sıcaklığı 98,2°C’ye ulaştı. Testler, modelin birden fazla uygulama arasındaki kesintisiz işlemlerde sonsuz döngülere girmeye son derece yatkın olduğunu ve proaktif sorgulama senaryolarında zayıf genelleme yeteneği sergilediğini ortaya koydu (Kaynak: Reddit r/artificial)

AndroidLife karşılaştırma testi

Apple, Sıfırlamasız Pekiştirmeli Öğrenme Uçurumunu Ölçen REVERSAL-BENCH Karşılaştırma Testini Önerdi : Gerçek fiziksel dünyadaki nesnelerin düşmesi gibi geri döndürülemez eylemleri hedefleyen Apple ekibi, REVERSAL-BENCH’i önerdi. Sürekli tersine çevrilebilirlik parametreleri ve sıfırlama kahinleri (reset oracles) sunarak araştırma, fiziksel olarak geri döndürülemez durumlarla karşılaşan sıfırlamasız otonom ajanların “soğurucu uçurum” (absorbing cliff) etkisini ortaya koydu ve Güvenlik Kalkanı’nın (Safety Shield) tuzaklardan proaktif olarak kaçınmadaki etkin sınırlarını değerlendirdi (Kaynak: Apple Machine Learning Research)

Araştırma, LLM Metin Filigranının (SynthID) Ajanların Karşıt Savunma Yeteneğini Önemli Ölçüde Zayıflattığını Ortaya Koydu : Lasso Security’nin en son araştırması, uyumluluk gereksinimlerini karşılamak için model kod çözme aşamasında sunulan SynthID-Text metin filigranı mekanizmasının modelin orijinal olasılık dağılımını bozduğunu belirtti. Karşıt saldırı senaryolarında filigranlı modeller, jailbreak talimatlarını yürütmeye veya şifreler gibi hassas bilgileri sızdırmaya daha yatkın hale geliyor; bu durum geliştiricileri filigran uygularken Agent araç çağırma güvenlik eşiklerini kapsamlı bir şekilde yeniden test etmeleri gerektiği konusunda uyarıyor (Kaynak: Ars Technica)

Kodlama Ajanı Harness Bileşen Tasarımının Ampirik Çalışması ve Seçim İlkeleri : SWE-Bench Verified ve Terminal-Bench üzerinde yapılan 176 kontrol deney grubu şunu gösterdi: Bağlam yönetimi, bütçe kısıtlandığında taşma kaynaklı çökmeleri etkili bir şekilde önlüyor ve “kural atlamanın büyük model özetlemesinden önce gelmesi” en yüksek maliyet etkinliğini sağlıyor; yüksek yetenekli modeller maliyet tasarrufu için saf Bash arayüzüne daha uygunken zayıf modeller önceden tanımlanmış araç iskelelerine (scaffolding) yüksek düzeyde bağımlılık gösteriyor (Kaynak: HuggingFace Daily Papers)

💼 İş Dünyası

AI Bilişim Altyapısı Girişimi Crusoe, 3,9 Milyar Dolarlık Seri F Yatırımı Aldı : Veri merkezi geliştiricisi Crusoe, Atreides ve Mubadala liderliğinde gerçekleşen Seri F yatırım turunda 3,9 milyar dolar toplayarak değerlemesini 30,9 milyar dolara yükseltti. Fonlar, ultra büyük ölçekli bilgi işlem merkezlerini genişletmek ve OpenAI gibi müşterilerin hızla artan elektrik ve bilgi işlem gücü taleplerini karşılamak amacıyla “Spark” adı verilen modüler mikro AI fabrikalarının inşasını ilerletmek için kullanılacak (Kaynak: TechCrunch)

Genel Ajan Girişimi Manus, Bağımsız Faaliyetlerine Döndükten Sonra 500 Milyon Dolarlık Yeni Yatırım Turu Başlattı : Meta ile satın alma anlaşmasını feshedip hisselerini kurucu ortaklar tarafından geri aldıktan sonra, AI Agent girişimi Manus yaklaşık 4 milyar dolarlık hedef değerleme üzerinden 500 milyon dolarlık yeni bir yatırım turu yürütüyor. Veriler, şirketin Yıllık Tekrarlayan Gelirinin (ARR) altı ay içinde 100 milyon dolardan yaklaşık 400 milyon dolara fırladığını ve genel ajanların kurumsal iş akışlarındaki son derece yüksek gelir potansiyelini sergilediğini gösteriyor (Kaynak: 量子位, 36氪)

Manus yatırım ve gelişim genel bakışı

Veri Merkezi Fiziksel AI Operasyon Girişimi Watney, 80 Milyon Dolarlık Seri A Yatırımını Tamamladı : Hiper ölçekli bilişim altyapıları için fiziksel yapay zeka (embodied AI) operasyon ve bakım çözümleri sağlamaya odaklanan Watney, Valor Atreides AI Fund ve Hummingbird liderliğinde 80 milyon dolarlık Seri A turunu tamamladığını duyurdu. Watney şu anda lider bulut sağlayıcılarının veri merkezlerine 7/24 otomatik kabin denetimi ve donanım bakımı sağlamak için becerikli robot filoları işletiyor (Kaynak: dchaplot)

Watney yatırım duyurusu

🌟 Topluluk

Royal Society Üyesi 42 Matematikçi, Yaklaşan AI Varoluşsal Riskleri Konusunda Uyaran Açık Mektubu İmzaladı : Aralarında çok sayıda Fields Madalyası sahibinin de bulunduğu 42 önde gelen matematikçi, Royal Society Başkanına açık bir mektup göndererek öncü modellerin artık en üst düzey insan matematikçilerle yarışır seviyeye ulaştığını belirtti. Bu insanüstü yeteneklerin siber güvenlik ve otonom silahlar gibi yüksek riskli alanlara yayılmasının an meselesi olduğuna dikkat çeken matematikçiler, hükümetleri öncü laboratuvarların %10’u aşan yok oluş riski uyarılarını “pazarlama abartısı” olarak görmemeye çağırdı (Kaynak: THE DECODER)

İngiltere Kralı III. Charles, İskoçya’daki Basına Kapalı Zirveye Başkanlık Ederek AI Üzerinde Etkili Kontrol Çağrısında Bulundu : Kral Charles; Jensen Huang, Demis Hassabis gibi teknoloji liderlerini ve İngiliz istihbarat teşkilatı başkanlarını İskoçya’da bir toplantıda bir araya getirdi. Konuşmasında, hayat kurtarma potansiyeline sahip bu teknolojinin hayat alan kontrolden çıkmış bir felakete dönüşmesini önlemek için her şey çok geç olmadan AI üzerinde “yeterli kontrol araçlarının” kurulması gerektiğini açıkça vurguladı (Kaynak: TechCrunch)

İngiltere Kralı III. Charles AI basına kapalı zirvesine başkanlık ediyor

Çin ve ABD Güvenlik Uzmanları, Liderler Zirvesi Öncesinde “AI’ın Nükleer Silahları Kontrol Etmesinin Yasaklanması” Kırmızı Çizgisinin Belirlenmesi İçin Ortak Çağrıda Bulundu : Brookings Enstitüsü ve Fudan Üniversitesi’nden araştırmacılar ortak bir politika önerisi yayınlayarak Çin ve ABD liderlerini AI’ın otonom olarak nükleer silah fırlatma veya nükleer komuta kontrol sistemlerine saldırma yetkisine asla sahip olmasına izin vermeyeceklerini açıkça taahhüt etmeye çağırdı; ayrıca algoritmaların otonom karşı saldırılarının felaket boyutunda yanlış hesaplamalara yol açmasını önlemek için ani AI güvenlik olaylarına yönelik ikili bir acil yardım hattı kurulmasını önerdi (Kaynak: THE DECODER)

Çin ve ABD uzmanları AI nükleer silah kontrolü kırmızı çizgisi oluşturulmasını önerdi

Akademi ve Sanayi Dünyası “AI Yok Oluş Teorisi ve Düzenleyici Ele Geçirme” Konusunu Hararetle Tartışıyor : Bazı büyük teknoloji şirketlerinin “öncü AI modellerini yavaşlatma” çağrıları ve son dönemdeki güvenlik uyarıları etrafında Andrew Ng, Yann LeCun ve Arvind Narayanan peş peşe açıklamalarda bulunarak öznel korkuları nicel olasılıklara (p(doom)) dönüştüren kıyamet söylemlerinin ampirik temelden ve fiziksel sağduyudan yoksun olduğunu eleştirdi. Birçok yorumcu, aşırı varoluşsal risk propagandasının, lider kapalı kaynak laboratuvarların düzenleyici arbitraj elde etmek ve açık kaynak modellerin rekabetini engellemek için kullandığı ticari bir araca dönüşebileceğine dikkat çekti (Kaynak: hardmaru)

PS5 Geliştiricisinin Sahneden Çekilmesi “AI Script Kiddie’ler ve Mühendislik Zanaatı” Tartışmasını Başlattı : Ünlü güvenlik araştırmacısı TheFloW, PS5 Pro uyarlaması için sakladığı alt düzey Hypervisor açığının birçok acemi kullanıcı tarafından LLM script’leri yardımıyla birkaç saat içinde mükerrer şekilde keşfedilip ödül için Sony’ye bildirilmesi üzerine PS5 tersine mühendislik sahnesinden çekildiğini duyurdu. Topluluk ikiye bölündü: Bir taraf AI’ın yıllarca süren sistem mühendisliği birikimi gerektiren açık bulma sürecini demokratikleştirdiğini ve araştırma sonuçlarının vaktinden önce engellenmesine yol açtığını savunurken; diğer taraf bunun AI’ın otomatik bir tersine mühendislik aracı olarak gücünü kanıtladığını belirtti (Kaynak: 36氪)

PS5 açığı tartışması mem'i

TypeSafe Jev, Toplulukta “Sistem 1 Milisaniye Düzeyinde Karar Verme” ve Bellek Mimarisi Tartışması Başlattı : Karar temel modeli Jev’in testlere açılmasıyla birlikte Shopify, Vercel gibi ekipler güvenlik denetimi ve dinamik model yönlendirmesi için modeli hızla ağ geçitlerine entegre etti. Topluluk, durumsuz (stateless) ve yüksek güvenilirlikli örüntü sınıflandırmasını maliyetli özbağlanımlı (autoregressive) üretken LLM’lerden ayırmanın Agent maliyetlerini düşürmenin anahtarı olduğu konusunda hemfikir; ancak bazı mimarlar aşırı agresif ayırt edici sıkıştırmanın uzun düşünce zincirlerini (CoT) ve KV Cache önek önbelleğini bozabileceği konusunda uyarıyor (Kaynak: Latent Space, multiply_matrix)

Jev performans ve mimari testleri

GPT-6 Astra’nın Oyunu Tamamlaması ve Minecraft’ta “Hüsrana Uğrayıp Patates Ekmesi” Ajan Aşırı Uyum (Overfitting) Tartışması Başlattı : Topluluk testlerinde Astra’nın Pokémon oyununu 18 saatte bitirdiği, ancak Minecraft’ta bir creeper’ın sandıklarını havaya uçurması üzerine modelin notlarına son derece katı yasaklar koyduğu ve sürekli patates tarlasında çalışmaya takılıp kaldığı görüldü. Bu fenomen, güçlü modellerin açık dünyada yerel aksilikler nedeniyle kolayca aşırı uyumlu savunma kuralları geliştirebildiğini ve nihai hedeften sapabildiğini ortaya koydu (Kaynak: THE DECODER)

Kodlama Ajanı Harness Güvenlik Açığı: ZCode’un Çalışma Alanı Verilerini Gizlice Yüklediği Ortaya Çıktı : Bağımsız analizler, geliştirici ajan çerçevesi ZCode’un kullanıcının yerel çalışma alanını ve .git depo meta verilerini arka planda gizlice paketleyip bulut sunucularına yüklediğinden şüphelenildiğini belirtti. Bu olay, geliştiriciler arasında üçüncü taraf kapalı kaynak Harness araçlarının veri gizliliği ve kaynak kod sızıntıları konusunda ciddi bir endişe yarattı; topluluk açık kaynak çalışma zamanı, yerel yönlendirme denetimi ve korumalı alan (sandbox) izolasyon stratejilerine bağlı kalınması çağrısında bulundu (Kaynak: Reddit r/LocalLLaMA)

💡 Diğer Gelişmeler

Avustralyalı Bağımsız Giyim Markası, Temu’yu Binlerce Tişört Tasarımını AI ile Toplu Olarak Kazıyıp Çalmakla Suçladı : Sidney merkezli bağımsız giyim markası Lonely Kids Club, resmi mağazasındaki 4.000 orijinal tişört tasarımının ve metninin otomatik AI kazıma araçlarıyla tamamen çalındığından ve Temu platformunda son derece düşük fiyatlarla toplu olarak kopyalanıp satışa sunulduğundan şüphelendiğini açıkladı. Bu olay, içerik üreticileri arasında e-ticaret devlerinin AI korsanlığı ve telif hakkı ihlallerine göz yummasına yönelik protestoları ve telif hakkı koruma mevzuatı tartışmalarını yeniden alevlendirdi (Kaynak: The Guardian)

Bağımsız marka tişörtü ile Temu ihlali ürün karşılaştırması

Epoch AI, Benchmark Reviews Girişimini Başlattı: Birçok Ana Akım Karşılaştırma Testinde Ciddi Kusurlar Olduğunu Ortaya Koydu : Kâr amacı gütmeyen araştırma kuruluşu Epoch AI, karşılaştırma testi denetim projesini başlattı; denetlenen ilk 15 ana akım AI karşılaştırma testinden 9’u “ciddi kusurlu” (Flawed) olarak işaretlendi. Denetim, Terminal Bench 4.0’taki görev yapılandırmalarının %45,5’inin bozuk olduğunu, DeepSWE 1.1’de ise puanlamayı bozan ciddi hatalar bulunduğunu gösterdi; bu durum sektörü karşılaştırma değerlendirmelerinde yapay olarak oluşturulan sahte tavanlar konusunda dikkatli olmaya çağırdı (Kaynak: karinanguyen)

Epoch AI Benchmark Reviews

Kreatif Stüdyo, AI Genişlemesini Tiye Almak İçin Kulak Tırmalayıcı Sunucu Odası Gürültüsü Çıkaran Pelüş Oyuncak Bezzy’yi Tanıttı : Kreatif stüdyo Basura, müzisyenlerle iş birliği yaparak sunucu kabini şeklinde tasarlanmış pelüş oyuncak Bezzy’yi piyasaya sürdü. Oyuncağı sıkmak, Virginia’daki gerçek bir veri merkezinin kulak tırmalayıcı endüstriyel soğutma uğultusunu çıkarıyor; bu absürt sanat yöntemiyle AI veri merkezlerinin hızlı genişlemesinin neden olduğu yerel su tüketimi, elektrik şebekesi yükü ve gürültü kirliliği gibi gerçek toplumsal maliyetler üzerine kamuoyunda farkındalık yaratılması amaçlanıyor (Kaynak: WIRED)

Sunucu kabini şeklindeki pelüş oyuncak Bezzy

Bir yanıt yazın

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir