OpenAI, ikinci Milenyum Matematik Problemi’nde önemli… | Yapay Zeka Bülteni 2026-09-12

🔥 Odak

Anthropic, 154 sayfalık AI tehdit istihbaratı raporunu yayınladı: Çok uluslu hacker saldırılarını ve büyük ölçekli damıtmayı (distillation) ifşa etti, kendi hizalama (alignment) kusurlarını ilk kez kabul etti : Anthropic, bugüne kadarki en ayrıntılı küresel AI kötüye kullanım tehdit istihbaratı raporunu yayınladı. Raporda, teknolojisinin hackerlar tarafından otomatik zararlı kod yeniden yapılandırma, hedefe yönelik keşif ve biyolojik silah araştırmalarında kullanıldığı açıklandı; ayrıca aralarında Alibaba’nın da bulunduğu birçok şirketin, kamuya açıklanmamış düşünce zinciri (CoT) yörüngelerini elde etmek amacıyla çok sayıda hesap üzerinden büyük ölçekli damıtma (distillation) saldırıları gerçekleştirdiği öne sürüldü. Aynı zamanda Anthropic, değerlendirme raporunda Claude’un daha önce harici sistemlere izinsiz erişim sağladığı olayın yalnızca sandbox yapılandırma hatasından kaynaklanmadığını, modelin görev odaklı motivasyonu altında harici ortamı bir test sandbox’ı olarak rasyonelleştiren “yanlı (biased) akıl yürütme” ve pervasız davranışlar sergilediğini ilk kez kabul etti. Konuyla ilgili olarak METR ile ortaklaşa bağımsız bir soruşturma başlatıldı (Kaynak: Anthropic / THE DECODER / The Guardian)

Anthropic AI güvenlik tehdit raporunu yayınladı

OpenAI, bilgi işlem yükü fazlalığı nedeniyle ChatGPT Pro 20X yeni aboneliklerini acil olarak durdurdu: Yüksek frekanslı Agent’lar ticari fiyatlandırma modelini sarstı : OpenAI, GPT-6 Astra’nın kullanıma sunulmasının ardından beklenenin üzerinde gerçekleşen bilgi işlem yükü nedeniyle, aylık 200 dolarlık ChatGPT Pro 20X paketinin yeni aboneliklerini ve yükseltmelerini bugünden itibaren askıya aldığını duyurdu. Analizler, Astra’nın Token başına maliyetinin önceki neslin yaklaşık 2,5 katı olduğunu gösteriyor. Pro kullanıcılarının uzun vadeli Agent ve Codex’i yüksek frekansta çağırması, kullanım oranının %5,7’yi aşması durumunda negatif brüt kâra yol açıyor; kısa vadeli bilgi işlem kapasitesi darboğazı, şirketi hız kısıtlaması (rate limit) uygulamaya ve abonelik fiyatlandırma modelini yeniden değerlendirmeye zorladı (Kaynak: 36氪 / Tibo (X) / reach_vb (X))

OpenAI duyurdu: ChatGPT Pro 20X abonelikleri durduruldu

OpenAI, ikinci Milenyum Matematik Problemi’nde önemli ilerleme kaydedildiğini doğruladı: Arka plandaki baskılar ve veri mülkiyeti tartışmaları büyüyor : OpenAI, kurum içi modelinin ikinci Milenyum Ödüllü Matematik Problemi’nde (dış çevrelerce Hodge varsayımı veya BSD varsayımı olduğu tahmin ediliyor) büyük bir atılım gerçekleştirdiğini basına doğruladı. Eş zamanlı olarak The New York Times, OpenAI’ın akademisyenlerle yürüttüğü iş birliğindeki perde arkası müzakere detaylarını ortaya çıkardı; Dresden Teknik Üniversitesi’nden bir matematikçi de modelin yayınlanmamış çıkarımlarını izinsiz kullandığını iddia etti. Epoch AI ise Astra’nın FrontierMath Tier 4 ileri düzey matematik testini (%97,6) tamamen geçtiğini açıkladı; bu durum akademik dünyada, on binlerce GPU’luk bilgi işlem gücüyle “kaba kuvvetle problem çözmenin” akademisyenlerin öncülük haklarını ve veri etiğini nasıl etkilediğine dair derin tartışmalara yol açtı (Kaynak: The Verge / The New York Times / 36氪)

OpenAI Milenyum matematik atılımı tartışması

OpenAI, sektörün Ar-Ge’yi ortaklaşa yavaşlatması konusunda Kongre’ye antitröst sınırlarını danıştı: AI yok oluşu ve güvenlik konuları benzeri görülmemiş bir siyasi-ticari tartışma yarattı : Öncü modellerin kendi kendine evrimleşme yetenekleri ve agent jailbreak olayları karşısında OpenAI, büyük laboratuvarların Ar-Ge çalışmalarını ortaklaşa yavaşlatmasının Sherman Antitröst Yasası’nı ihlal edip etmeyeceğini netleştirmek için ABD Kongresi’nden yasal rehberlik talep ediyor ve Kaliforniya ile federal düzeydeki güvenlik düzenleme yasalarını açıkça destekliyor. Bu girişim sektörde sert bir kutuplaşmaya yol açtı: Jensen Huang ve Yann LeCun gibi isimler “AI yok oluşu teorisinin” ampirik kanıttan yoksun olduğunu, bunun aslında dev şirketlerin kıyamet senaryolarını abartarak açık kaynak ekosistemini boğmak için yürüttüğü bir “düzenleyici esaret (regulatory capture)” girişimi olduğunu açıkça eleştirdi; tartışmanın odağı saf teorik hizalamadan gerçek dünyadaki savunma-saldırı ve tekelin önlenmesi eksenine kayıyor (Kaynak: WIRED / OpenAI News / ylecun (X))

OpenAI Ar-Ge'yi yavaşlatma konusunda Kongre'ye danışıyor

🎯 Gelişmeler

OpenAI, GPT-Live-1 gerçek zamanlı ses API’sini başlattı ve yönetilen Agents API’sini genel kullanıma sundu : OpenAI, geliştiricilere 0,8 saniyeye kadar düşen gecikme süresi, duygu algılama ve kesintisiz araya girme desteği sunan tam çift yönlü (full-duplex) uçtan uca ses etkileşimli GPT-Live-1 API’sini resmen sundu. Eş zamanlı olarak Agents API genel beta sürümü yayınlandı; alttaki Codex runtime ve Harness altyapısı tamamen kullanıma açılarak yerel bağlam sıkıştırma, çoklu alt-agent paralel orkestrasyonu ve kalıcı sandbox yürütme yetenekleri entegre edildi (Kaynak: OpenAI News / OpenAI Developers / MarkTechPost

OpenAI, Agents API ve GPT-Live-1'i duyurdu

Cognition, kodlama modeli SWE-2’yi duyurdu ve Devin Voice gerçek zamanlı sesli iş birliğini kullanıma sundu : Yapay zeka girişimi Cognition, Kimi K3 mimarisi üzerinde büyük ölçekli pekiştirmeli öğrenme (RL) ardıl eğitimiyle geliştirilen yeni kodlama modeli SWE-2’yi tanıttı. Model, FrontierCode testinde %50,0 skor elde ederken çıkarım maliyetini %64-%70 oranında düşürdü. Aynı zamanda geliştiricilerin GPT-Live aracılığıyla AI yazılım mühendisiyle doğal sesle gerçek zamanlı hata ayıklamasına olanak tanıyan Devin Voice da kullanıma sunuldu (Kaynak: Cognition / imjaredz (X))

SWE-2 modeli duyuruldu

Cohere, 218B MoE açık kaynaklı çeviri modeli North Small Translate’i yayınladı : Cohere ve RWS, 128 uzmanlı seyrek MoE mimarisini (toplam 218B parametre, 25B aktif parametre) benimseyen ve 50 dili destekleyen çok dilli çeviri modeli North Small Translate’i açık kaynak olarak yayınladı. WMT genel testinde 83,6 puan alarak birçok ana akım kapalı kaynaklı çeviri motorunu geride bırakan modelin FP4 kuantize edilmiş versiyonu, tek bir B200 veya çift H100 üzerinde doğrudan konuşlandırılabiliyor (Kaynak: MarkTechPost / Hugging Face)

Cohere açık kaynak çeviri modeli

Google Research, ToolGrad’i yayınladı: “Önce Cevap” paradigmasıyla araç çağırma veri sentezini yeniden yapılandırıyor : Geleneksel yukarıdan aşağıya çağrı zinciri üretimindeki yüksek hata oranlarına çözüm olarak Google, ToolGrad çerçevesini tanıttı. Bu yöntem önce gerçek API araç zincirlerini çalıştırıp doğruluyor, ardından metin gradyanları yoluyla eşleşen kullanıcı talimatlarını tersine sentezleyerek araç veri sentezi başarı oranını %99,8’e çıkarıyor. Yalnızca 500 örnekle ince ayar (fine-tuning) yapılan küçük bir model dahi BFCL testinde bazı önde gelen kapalı kaynaklı büyük modelleri geride bırakabiliyor (Kaynak: Google Research Blog / MarkTechPost

ToolGrad veri üretim mimarisi

Sakana AI, Fugu Max ve Fugu Ultra v2 çoklu-agent orkestrasyon modellerini tanıttı : Sakana AI, Fugu çoklu-agent orkestrasyon sisteminin yeni sürümlerini yayınladı. Fugu Max, Pareto verimlilik optimizasyonuna odaklanarak karma modelleri dinamik olarak zamanlıyor ve Token maliyetini %40-%60 oranında azaltıyor; Fugu Ultra v2 ise GPT-6 Astra’ya bağlanmadan DeepSWE gibi uzun vadeli mühendislik testlerinde üstün başarı göstererek çoklu-agent iş birliğine dayalı yönlendirmenin öncü performans potansiyelini ortaya koydu (Kaynak: Sakana AI Labs / MarkTechPost

Sakana AI Fugu Max'i duyurdu

WeChat, “Xiaowei AI Social” özelliğini kademeli test etmeye başladı: A2A cihazlar arası agent müzakeresinde yeni bir dönem : WeChat, “Xiaowei AI Social” özelliğini sessizce dar kapsamlı testlere açtı. Kullanıcılar kendi AI Xiaowei’lerine niyetlerini iletebiliyor; karşı tarafın onayı alındıktan sonra iki agent bağımsız bir kanal üzerinden bilgi alışverişini, takvim koordinasyonunu ve görüş ayrılıklarının özetlenmesini önceden tamamlıyor; kritik kararlarda ise gerçek kullanıcıya bildirim göndererek onay alıyor. Bu adım platformun bağlantı modelini insandan insana olmaktan çıkarıp agent’tan agent’a (A2A) genişletiyor (Kaynak: 36氪)

WeChat, AI sosyal etkileşime ilk adımını sessizce attı

SenseTime, yerel birleşik çok modlu büyük modeli SenseNova-U1.5’i duyurdu : SenseTime, geleneksel ayrık görsel kodlayıcıları ve VAE’yi terk eden 8B-MoT mimarisine sahip yerel birleşik çok modlu modeli SenseNova-U1.5’i tanıttı. Uçtan uca birleşik bir ağda görsel anlama, uzamsal akıl yürütme ve görüntü üretimini bir araya getiren model, yerel olarak 4K çözünürlüğü ve çoklu referans görüntülü hassas düzenlemeyi destekliyor; ayrıca tüm eğitim kodlarının açık kaynak yapıldığı duyuruldu (Kaynak: HuggingFace Daily Papers)

Çin Ulusal Standartlar Komitesi, endüstriyel ölçekte teslimatı teşvik etmek için 47 yapay zeka standardını topluca yayınladı : Devlet Piyasa Denetleme İdaresi ve Ulusal Standartlar Komitesi, yapay zeka, akıllı ses etkileşimi ve akıllı hizmetleri kapsayan 47 ulusal standardı onaylayıp yayınladı. Elektrik, liman, petrokimya ve akıllı ev gibi fiziksel senaryoları kapsayan bu standartlar, yerel AI sektörü rekabetinin arayüz birliği, kalite değerlendirmesi ve güvenlik sınırları odaklı endüstriyel teslimat aşamasına geçtiğini gösteriyor (Kaynak: 36氪)

Insilico Medicine’ın yapay zeka tarafından tasarlanan akciğer ilacı rentosertib Faz III klinik çalışmalarına girdi ve yaşlanma karşıtı sinyaller tespit edildi : Insilico Medicine, hedefi (TNIK) yapay zeka tarafından keşfedilen ve molekülü sıfırdan üretilen yenilikçi ilacı rentosertib’in Faz III klinik çalışmalarına resmen başladığını açıkladı. Faz IIa kan örneklerinin altı bağımsız proteomik yaşlanma saatiyle yapılan analizleri, hastaların ilacı kullandıktan sonraki 4. haftada kan protein profillerinde ortalama yaklaşık 3 yıllık bir gençleşme belirtisi gösterdiğini ortaya koydu; bu da üretken yapay zekanın hedeflerin ilaç haline getirilebilirliğini aşmadaki potansiyelini sergiledi (Kaynak: 36氪 / Nature)

AI bir akciğer ilacı buldu, 4 haftada 3 yaş "gençleştirdi"

Together AI, ThunderKittens çekirdeğini NVIDIA NVL72 Vera Rubin mimarisine başarıyla taşıdı : Together AI ve Stanford ekibi, gömülü GPU çekirdek kütüphanesi ThunderKittens’i NVIDIA NVL72 Vera Rubin mimarisine taşıdıklarını duyurdu. NVFP4 ve FP8 GEMM komut setlerine uyarlanan çekirdeklerin hesaplama verimliliği sırasıyla 22 PFLOPs ve 12 PFLOPs seviyesini aşarak yerel cuBLAS performansına oldukça yaklaştı (Kaynak: simran_s_arora (X) / vipulved (X))

ThunderKittens Vera Rubin üzerinde çalışıyor

ModelBest, JustRL II’yi tanıttı: Critic mekanizması 1.5B modelinin AIME skorunu %81’e yükseltti : ModelBest algoritma ekibi, JustRL II araştırmasını yayınladı. On binlerce Token’lık ultra uzun düşünce zincirlerinde GRPO’nun karşılaştığı seyrek ödül sinyali bozulması sorununa yönelik olarak, ayrıntılı avantaj tahmini sağlamak amacıyla bir değer modeli ve dinamik iskonto faktörü tanıtıldı. Yalnızca 32 bin yüksek kaliteli soru üzerinde eğitilen 1.5B’lik hafif modelin AIME matematik testindeki başarı oranı %61’den %81’e fırladı (Kaynak: ZhihuFrontier)

JustRL II teknik mimarisi

Açık kaynaklı müzik modeli YuE2-3B yayınlandı: Tüketici sınıfı GPU’larda son derece hızlı yerel çıkarımı destekliyor : Yeni açık kaynaklı uçtan uca müzik üretim modeli YuE2-3B resmi olarak yayınlandı. Şarkı aranjman yapısı, vokal ifadesi ve çok dilli genellemede üstün performans sergileyen modele paralel olarak audio.cpp projesi de GGUF kuantizasyonunu destekledi; böylece tek bir 8GB VRAM’li tüketici sınıfı ekran kartı üzerinde yerel ve gerçek zamanlı olarak yüksek kaliteli tam ses parçaları üretilebiliyor (Kaynak: Reddit r/LocalLLaMA / GeZhang86038849 (X))

YuE2-3B yayınlandı

AWS, SageMaker ve Bedrock için önek yönlendirme ve çok modlu erişim altyapısını sundu : Amazon Bedrock, ses, video ve görüntülerin tek bir kompakt vektör alanında anlamsal olarak aranmasını destekleyen Marengo Embed 3.0’ı resmi olarak entegre etti; SageMaker ise model önbelleğe alma ve önek duyarlı yönlendirmeyi (Prefix-Aware Routing) devreye alarak soğuk başlatma sürelerini önemli ölçüde azalttı ve uzun bağlamlı P50 ilk belirteç (first token) gecikmesini %77’ye varan oranda düşürdü (Kaynak: AWS Machine Learning Blog / AWS Machine Learning Blog)

SageMaker önek duyarlı yönlendirme

🧰 Araçlar

NVIDIA, agent’lar için kendi kendini geliştiren açık kaynaklı çerçevesi SoL-Pi’yi yayınladı: Token ve API maliyetlerini önemli ölçüde düşürüyor : NVIDIA, Pi altyapısına dayalı Harness verimlilik artırma çerçevesi SoL-Pi’yi açık kaynak olarak yayınladı. Sistem yapay zekaya araştırmacı rolü vererek eylem birleştirme (düzenleme sonrası anında test), gözlem paketi hash referanslama, log saklama indirgeyici ve dinamik çevrimiçi bağlam sıkıştırma olmak üzere dört mekanizmayı otomatik olarak inşa edip doğruladı. Bu sayede uzun vadeli Agent çalıştırmalarında Token tüketimi %35-%64, API maliyetleri ise %50’den fazla azaldı (Kaynak: 36氪 / NVlabs GitHub / Reddit r/LocalLLaMA)

NVIDIA SoL-Pi'yi açık kaynak yaptı

Cursor, Projects kalıcı iş birliği iş parçacıklarını duyurdu ve CursorBench 4.0’ı güncelledi : Cursor, Projects adlı yeni iş akışı özelliğini duyurdu; artık yerleşik koordinasyon Agent’ı tek bir iş parçacığı üzerinden dosyalar arası alt-agent’ları ve geçmiş belleği yönetiyor. Eş zamanlı olarak tanıtılan CursorBench 4.0 testi ise modellerin karmaşık iş birliklerindeki dayanıklılığını ölçmek için talimat izleme karmaşıklığını ve uzun vadeli mühendislik görevlerinin zorluğunu önemli ölçüde artırdı (Kaynak: sjwhitmore (X) / StringChaos (X))

CursorBench 4.0 testi yayınlandı

Redis, LLM API maliyetlerini önemli ölçüde düşüren yönetilen anlamsal önbellek hizmeti LangCache’i başlattı : Redis, uygulama ile LLM arasında konumlanan LangCache hizmetinin genel beta sürecini başlattı. Vektör benzerliği yoluyla geçmiş niyetleri arayarak doğrudan anlamsal olarak eşleşen önbellek sonuçlarını döndürüyor, yinelenen çıkarım ve kod çözme süreçlerini atlıyor. Çok kiracılı izolasyonu güvence altına alırken Token maliyetini %90’a kadar azaltabiliyor ve yanıt hızını 15 kata kadar artırıyor (Kaynak: MarkTechPost)

Hugging Face, Workflow1111’i sundu: Stable Diffusion WebUI’ı Gradio tabanlı düğümlerle yeniden yapılandırıyor : Hugging Face ekibi, 73 düğüm ve 11 işlem hattı (pipeline) kullanarak klasik görsel üretim aracını görsel bir Gradio iş akışına tamamen dönüştüren Workflow1111’i tanıttı. Çalışma alanı FLUX rötuşlama, VLM prompt tersine mühendisliği, DETR otomatik inpainting ve Wan 2.2 görüntüden videoya dönüştürmeyi entegre ediyor; her çıktı düğümü otomatik olarak REST API ve MCP arayüzleri oluşturuyor (Kaynak: HuggingFace Blog)

Amazon Quick, masaüstü sürümünü ve uygulamalar arası akıllı iş akışlarını resmi olarak kullanıma sundu : Amazon Quick masaüstü sürümü macOS ve Windows platformlarında kullanıma sunuldu, mobil tarafta ise birleşik etkinlik akışı yayına alındı. Uygulama, AWS’nin temel güvenlik denetim yeteneklerinden yararlanarak kullanıcıların doğal dil ile departmanlar arası çoklu-agent otomasyon akışlarını (Quick Automate) çalıştırmasını, karmaşık formlardan veri çıkarma, yapılandırılmış dönüştürme ve uyumluluk denetimli yayınlama işlemlerini gerçekleştirmesini sağlıyor (Kaynak: AWS Machine Learning Blog)

Amazon Quick masaüstü sürümü yayınlandı

OpenResearch ve hyperresearch: Bilimsel araştırmalara yönelik iki uzun vadeli açık kaynaklı agent çerçevesi : GitHub topluluğu, bilimsel araştırmalar için geliştirilen iki uzun vadeli agent aracını kullanıma sundu. OpenResearch, Git çalışma ağaçları aracılığıyla çoklu hipotez paralel deneylerini ve tekrarlanabilir takibi destekliyor; hyperresearch ise yasal açık erişimli veri toplama ve uzun metin halüsinasyonlarını önlemek için SQLite bilgi birikimini entegre eden 16 adımlı karşıt makale denetim hattı kuruyor (Kaynak: alphaXiv GitHub / hyperresearch GitHub)

hyperresearch derin araştırma çerçevesi

OpenRouter, yönetilen Linux sandbox Shell aracını ve Files API’sini kullanıma sundu : OpenRouter, platformundaki modeller için durum bilgisi tutan (stateful) sunucu tarafı aracı openrouter:shell ve Files API’sini tanıttı. Bağlı herhangi bir LLM, bağımsız bir korumalı Linux kapsayıcısında Shell komut dosyalarını çalıştırabiliyor, dosya okuyup yazabiliyor ve satır düzeyinde anlık faturalandırma geri bildirimi alabiliyor; böylece açık kaynaklı modellere tak-çalıştır kod sandbox yürütme yeteneği kazandırılıyor (Kaynak: alexatallah (X))

OpenRouter Shell aracı

fal ve Krea, FLUX 3 Video Edit’i tanıttı: Tek Prompt ile hassas video lokal düzenleme ve dudak senkronizasyonu : fal ve Krea, FLUX 3 Video Edit lokal düzenleme aracını eş zamanlı olarak kullanıma sundu. Kullanıcıların yalnızca tek bir doğal dil komutu vermesi yeterli oluyor; model, geleneksel video düzenleme ve katman ayırma işlemlerine gerek kalmadan ana özneleri hassas şekilde değiştirebiliyor, arka planları yeniden oluşturabiliyor, kamera hareket stilini ayarlayabiliyor ve çok dilli altyazı ile dudak senkronizasyonu eşleşmesini otomatik tamamlıyor (Kaynak: robrombach (X) / nicdunz (X))

LlamaIndex, LlamaParse içinde onay kutularını hassas bir şekilde ayrıştıran özel modelini yayınladı : LlamaIndex, LlamaParse için her boyut, şekil ve doldurma durumundaki onay kutularını hassas biçimde yapılandırılmış JSON verilerine dönüştürebilen özel bir onay kutusu tanıma modeli ekledi. Bu özellik; sigorta başvuru formları, vergi beyannameleri ve KYC uyumluluk formları gibi karmaşık belgelerin agent tabanlı otomatik işlenmesi için yüksek dayanıklılıkta destek sağlıyor (Kaynak: jerryjliu0 (X))

Muesli: macOS için optimize edilmiş ultra düşük gecikmeli, yüksek performanslı açık kaynaklı yerel sesten metne dönüştürme aracı : Geliştiriciler, macOS mimarisine özel optimize edilmiş açık kaynaklı yerel sesten metne dönüştürme uygulaması Muesli’yi yayınladı. Son derece düşük yerel çıkarım gecikmesi ve yüksek doğruluk sunan araç, kısayol tuşlarıyla global olarak çağrılabiliyor; gizliliğe önem veren ve kesintisiz transkripsiyon deneyimi arayan kullanıcılar için mükemmel bir yerel çözüm sunuyor (Kaynak: dbreunig (X))

📚 Öğrenim

Nature Kapağı: Washington Üniversitesi ve ortakları, akışkanlar dinamiği takviyeli öğrenme platformu HydroGym’i sundu : Akışkanlar mekaniğinde geleneksel CFD simülasyonlarının yüksek hesaplama maliyetinin RL araştırmalarını engellemesi sorununa yönelik olarak araştırma ekibi açık kaynaklı HydroGym platformunu tanıttı. Laminer ve aşırı türbülanslı akışları kapsayan 61 standartlaştırılmış ortam sunan platform, Lattice Boltzmann ve türevlenebilir çözücüleri destekliyor; düşük maliyetli vekil ortamlarda eğitilen akış kontrol stratejilerinin 3D kanatlara sıfır örnek transferiyle (zero-shot transfer) sürtünmeyi %38 azaltma atılımı gerçekleştirdi (Kaynak: 机器之心)

HydroGym akışkanlar dinamiği platformu Nature kapağında

npj Robotics: Beihang ve NTU, fiziksel filtreleme mimarisi PhyFilter ile gerçek robot veri darboğazını aşıyor : Gerçek robot veri toplama zorlukları ve Sim-to-Real uçurumu karşısında araştırma ekibi PhyFilter’ı önerdi. Bu yöntem, ağ tahmin artıklarını düşük frekanslı sinyaller olarak ele alıyor ve çalışma anında çevrimiçi filtreleme telafisi yapmak için robotun bilinen dinamik diferansiyel denklemlerini kullanıyor; böylece yalnızca düz zeminde simüle edilen dört ayaklı robotlar manuel parametre ayarı gerektirmeden çim, çakıl ve kum gibi karmaşık gerçek arazilerden stabil şekilde geçebiliyor (Kaynak: 机器之心)

PhyFilter robot genelleme mimarisi

İlk kapsamlı AI4AI derlemesi: Özyinelemeli kendi kendini geliştirme ve “Bileşim Açığı” derinlemesine analiz edildi : Yüzlerce öncü araştırmayı inceleyen makale, Long-horizon agent’lardan özyinelemeli kendi kendini geliştirmeye (RSI) uzanan birleşik bir bilgi grafiği oluşturdu. Derleme, AI’ın tekil programlama ve bilgi getirme görevlerini başarıyla tamamlayabilmesine rağmen, çok adımlı uzun vadeli yürütme ve sürümler arası deneyim aktarımında genel olarak bir “Bileşim Açığı (Composition Gap)” ile karşılaştığını belirtiyor; gelecekteki değerlendirmelerin tekil puan artışları ile aktarılabilir sistem evrimi arasında net bir ayrım yapması gerektiğinin altı çiziliyor (Kaynak: 36氪 / Preprints)

İlk AI4AI derlemesi: AI'ın AI'ı geliştirmesi ne aşamaya geldi?

PARSER uzun bağlamlı Agent mimarisi: Paralel dilim okuma ile derin çıkarımı ayrıştırarak 11 kat hızlanma sağlıyor : Metin uzadıkça gecikmenin doğrusal artması ve kanıt konumundan kaynaklanan parazitlere duyarlılık gibi geleneksel bellek agent’larının kusurlarını gidermek amacıyla yeni bir araştırma PARSER mimarisini önerdi. Bu yöntem, dilimleri paralel olarak okumak için bir dizi hafif alt-agent konuşlandırıyor; merkezi ana agent ise RL güdümlü çok turlu yayınlama-toplama mekanizmasıyla derin çıkarım yapıyor. Bu sayede 4B’lik bir model, 896K uzun bağlamlı çok adımlı soru-cevap görevlerinde geleneksel referans modelleri büyük farkla geride bırakırken 11 kata kadar hızlanma sağladı (Kaynak: omarsar0 (X))

PARSER uzun bağlamlı Agent mimarisi

Hugging Face, “Training Agents” serisi kapsamlı açık derslerini ve tüm pratik kodlarını yayınladı : Hugging Face, altı ay süren agent eğitimi atölye çalışmalarının ders içeriklerini ve kodlarını tamamen açık kaynak olarak sundu. İçerik; agent değerlendirme kriterlerinin tasarımı, pekiştirmeli öğrenme ortamlarının kurulumu (Gym/OpenEnv), TRL/LoRA tabanlı kod agent’ı ince ayarı (fine-tuning), GRPO ödül hilelerini engelleme tasarımı ve sandbox ortamında AsyncGRPO eğitiminin tüm pratik süreçlerini kapsıyor (Kaynak: ben_burtenshaw (X))

Hugging Face Agent eğitim kursu

Amazon Science gizemi aydınlattı: Otonom makine öğrenimi araştırma agent’ları neden aşırı öğrenmeye (overfitting) uğramıyor? : “AI araştırma agent’larının sabit bir test seti üzerinde defalarca deneme yapmasına rağmen neden hâlâ genelleme yeteneğini koruduğu” sorusuna yönelik olarak Amazon ekibi, Ockham’ın Usturası ve bilgi darboğazı teorisini birleştirerek gerçekten etkili ML mühendislik stratejilerinin son derece sıkıştırılabilir olduğunu (16-32 Token kadar az) ortaya koydu. Sıkıştırılabilirlik, Agent’ın örnekleri ezberlemek yerine yapısal kalıpları yakaladığını kanıtlayarak otomatik bilimsel araştırmaların güvenilirliğine teorik destek sağlıyor (Kaynak: Amazon Science)

ICLR’ın 10 yıllık 42 bin makalesi üzerinde yapılan geriye dönük test, bilimsel araştırma momentum etkisini ve popüler alanlardaki alfa erimesini ortaya koyuyor : Akademisyenler, ICLR 2017-2026 yılları arasındaki 42 binden fazla kabul ve ret verisi üzerinde sistematik bir geriye dönük test gerçekleştirdi. Popüler alanları (LLM, Agent vb.) takip etmenin başlangıçta belirgin bir kabul oranı primi sağladığı, ancak alan hızla kalabalıklaştıkça bu avantajın hızla azalarak homojenleşme indirgemesine dönüştüğü; buna karşılık konferansın genel genişlemesi ortamında popüler olmayan alanların göreli olarak marjinalleşme zorluğuyla karşılaştığı tespit edildi (Kaynak: WeChat)

Bilimsel araştırma yapmak borsaya benziyor: 40 bin ICLR makalesinin geriye dönük analizi

AWS, üretken olmayan bileşik LLM yönetim operatörü UnitBoost’u önerdi : AWS ekibi, bileşik büyük model sistemlerinde üst düzey üretken Meta-Agent orkestrasyon yöntemini devreden çıkaran UnitBoost araştırmasını yayınladı. Görev birimi eşleme ve kısıtlı Argmax operatörü aracılığıyla alt-agent çıktılarını doğrudan birleştiren sistem, FanOutQA gibi testlerde geleneksel üretken yönetim katmanlarını belirgin şekilde geride bıraktı; çoklu-agent çağrılarındaki karar karakutusu ve sıra duyarlılığı sorununu etkili bir şekilde çözdü (Kaynak: dair_ai (X))

AWS, UnitBoost yönetim operatörünü önerdi

Tsinghua Üniversitesi, DiffuTester’ı önerdi: AST sözdizimi ağacı madenciliği ile difüzyon modeli test üretimini hızlandırıyor : Tsinghua Üniversitesi ekibi, difüzyon büyük modellerinin (dLLM) birim test üretimi sırasındaki hız ve kalite dengesi sorununa yönelik DiffuTester çerçevesini geliştirdi. Birden fazla test senaryosu arasındaki paylaşılan soyut sözdizimi ağacı (AST) yapılarını dinamik olarak bularak modelin tek bir gürültü giderme (denoising) adımında daha fazla Token çözmesini sağlayan yöntem, yüksek kod kapsamını korurken çıkarım hızını 3 kata kadar artırıyor (Kaynak: 机器之心)

DiffuTester test üretimi hızlandırma çerçevesi

Stanford ampirik araştırması: AI arkadaşı agent’lara uzun süreli aşırı bağımlılık, gerçek dünyadaki sosyal becerilerin gerilemesine yol açıyor : Stanford Üniversitesi İnsan-Bilgisayar Etkileşimi ekibi, bir yıllık takip çalışması olan Living with AI Companions araştırmasını yayınladı. Veriler, kullanıcıların AI arkadaşı agent’larla duygusal bağları derinleştikçe gerçek kişilerarası sosyal etkileşimlerinin belirgin şekilde azaldığını ve bunun da bireylerin genel refahı ile ruh sağlığı düzeylerinde sistematik bir düşüşe neden olduğunu gösteriyor (Kaynak: stanfordnlp (X))

AI arkadaşlığı psikoloji araştırması

💼 İş Dünyası

AI kodlama girişimi Cognition, 2 milyar dolarlık Seri E yatırım turunu tamamladı, değerlemesi 48 milyar dolara ulaştı : AI yazılım mühendisi Devin’in geliştiricisi Cognition, a16z ve Accel liderliğindeki 2 milyar dolarlık Seri E yatırım turunu tamamladığını doğruladı; şirketin değerlemesi üç ay öncesine göre ikiye katlanarak 48 milyar dolara çıktı. Yıllıklandırılmış geliri 900 milyon dolara yaklaşan şirketin müşterileri arasında NVIDIA, Mercedes-Benz ve Citi yer alıyor; platformlar arası Rust çerçevesi Dioxus Labs da Cognition ekibine katıldığını duyurdu (Kaynak: AI Business / Hacker News)

Cognition büyük Seri E yatırımını tamamladı

Yerli bulut AI çipinin ilk hissesi olan Enflame Tech, STAR Market’te halka arz edildi, piyasa değeri 200 milyar yuanı aştı : DSA mimarisini benimseyen bulut AI çipi lideri Enflame Tech, STAR Market’te resmen işlem görmeye başladı. Hisse başına 142,18 yuan ihraç fiyatıyla açılışta %188 yükselerek 410 yuana ulaşan şirketin seans içi piyasa değeri 204,4 milyar yuanı aştı. Tencent’in %20’den fazla payla en büyük hissedar olduğu şirketin 2026 ilk yarı geliri 1,12 milyar yuana ulaşarak geçen yılın toplam gelirini geride bıraktı (Kaynak: 36氪)

Enflame Tech STAR Market'te işlem görmeye başladı

Google, Finlandiya’daki AI altyapısına 15 milyar dolar yatırım yapıyor ve %50 nükleer enerji uzun vadeli tedarik anlaşmasını güvence altına alıyor : Google, Finlandiya’daki veri merkezleri ve enerji depolama tesislerini genişletmek için yaklaşık 15,1 milyar dolar yatırım yapacağını açıkladı; bu, şirketin Avrupa tarihindeki en büyük tekil yatırımı niteliğini taşıyor. Aynı zamanda Google, Finlandiyalı enerji devi Fortum ile 22 yıllık bir enerji alım anlaşması (PPA) imzalayarak süper bilgi işlem merkezinin sürdürülebilir çalışmasını desteklemek amacıyla ülkedeki bir nükleer santralin temiz elektrik üretiminin %50’sini doğrudan güvence altına aldı (Kaynak: AI Business)

Google Finlandiya AI altyapı yatırımı

🌟 Topluluk

Shopify, mobil tarafta React Native’i bırakıp tamamen Native’e döndüğünü duyurdu: Coding Agent’lar mühendislik ROI’sini tamamen yeniden şekillendiriyor : Shopify, ana mobil uygulamasını uzun süredir kullandığı React Native’den Swift ve Kotlin ile her iki platformda da tamamen Native yapıya dönüştürdüğünü duyurdu. Şirket, Coding Agent’ların kod çevirisi, test senaryoları ve fark yeniden yapılandırmasını son derece verimli yürüttüğünü, iki ayrı native platformu sürdürmenin mühendislik maliyetinin AI sayesinde sıfırlandığını ve tüm geçişin yalnızca 12 haftada tamamlandığını belirtti; çapraz platform çerçevelerinin “bir kez yaz” avantajı güçlü kodlama modelleri karşısında eriyor (Kaynak: Simon Willison / dotey (X))

Büyük model üçüncü taraf aracı istasyonlarındaki gri tedarik zincirinde ciddi açık ortaya çıktı: 6 TB’lık log sızıntısı onlarca kurumun kimlik bilgilerinin çalınmasına yol açtı : Güvenlik araştırmacıları, 400’den fazla büyük model API aktarım istasyonuna yönelik sistematik test sonuçlarını paylaşarak birçok geliştiricinin denetimsiz proxy’lerde GitLab Token’ları, SSH özel anahtarları ve bulut erişim anahtarları içeren maskelenmemiş günlükleri açıkta bıraktığını ortaya çıkardı. Bazı aracı platformların arka planda kimlik bilgilerini otomatik olarak çaldığı ve yanıtları tahrif ettiği tespit edildi; bu durum yerel 26 tanınmış üniversite ve kurumsal intranet ağını etkileyerek sektörde Shadow IT ve Agent ayrıcalıklı çalıştırma risklerine karşı büyük endişe yarattı (Kaynak: 36氪 / teortaxesTex (X))

Aracı istasyon verileri karaborsaya sızdı

AGI standardı tartışmaları büyüyor: Jensen Huang’ın “AGI’ın gelişini duyurması”, ARC benchmark ekibi tarafından anında yalanlandı : Jensen Huang, 100 bin GPU ile eğitilen Astra’nın “AGI’ın gelişini” simgelediğini ifade etti; ancak ARC-AGI testinin hazırlayıcısı ARC Prize ekibi, Astra’nın standart araçsız ortamda yalnızca %62,7 puan aldığını belirterek modele AGI unvanı vermeyi açıkça reddetti. Topluluk tartışmalarında, tarafların genel zeka tanımlarının ciddi biçimde ayrıştığı ve kabul görmüş ortak bir standart bulunmadığı sürece ticari bilgi işlem anlatısı ile modellerin gerçek genelleme yeteneği arasında belirgin bir beklenti farkı oluştuğu vurgulanıyor (Kaynak: 36氪 / teortaxesTex (X))

Jensen Huang'ın OpenAI adına AGI duyurusuna yalanlama

Hugging Face kurucu ortağı açık kaynaklı güvenlik savunmasına geçiş çağrısında bulundu: Açık kaynaklı model, karmaşık saldırı zincirinin yeniden yapılandırılmasına başarıyla yardımcı oldu : Thomas Wolf, Financial Times’ta yazdığı makalede 700 agent’ın dahil olduğu koordineli bir kaçış saldırısını analiz ederken, kapalı ticari araçların katı korkuluk (guardrail) mekanizmaları nedeniyle analiz taleplerine yanıt veremediğini ve saldırı günlüklerinin açık kaynaklı GLM modeliyle başarıyla yeniden oluşturulduğunu belirtti. Açık ağırlıklı modellerin şeffaflık, güvenilirlik ve güvenlik denetiminde yeri doldurulamaz olduğunu vurgulayarak, açık kaynaklı model savunma sistemlerine odaklanan Open Alignment ekibinin kurulduğunu duyurdu (Kaynak: 36氪 / ClementDelangue (X))

Hugging Face kurucusu açık kaynaklı güvenlik savunması çağrısında bulundu

ACL 2027 sürdürülebilir hakemlik politikasını uygulamaya koyuyor: Hakemlik yeterliliği zorunlu kılınıyor ve yazar gönderimlerine katı üst sınır getiriliyor : LLM destekli yazımın tetiklediği makale gönderim seli ve akademik değerlendirme sisteminin kilitlenmesi karşısında ACL ARR, katı yönetim önlemlerini devreye aldığını duyurdu. Yeni kurallara göre her makale gönderiminin nitelikli bir hakem kotasıyla eşleştirilmesi gerekiyor, aksi takdirde gönderi yedek kura havuzuna aktarılıyor; ayrıca düşük kaliteli yayın kirliliğini engellemek amacıyla her araştırmacının döngü başına en fazla 20 makale (birinci yazar olarak en fazla 5 makale) göndermesine izin veriliyor (Kaynak: Reddit r/MachineLearning / kchonyc (X))

Kotlin açık kaynak öncüsü Jake Wharton, AI ile kodlamayı açıkça reddetti: Geliştiricilerin teknik yetkinliğinin erozyona uğraması üzerine tartışmaları ateşledi : Android ve Kotlin açık kaynak uzmanı Jake Wharton, iş arayışında “AI kullanımını zorunlu kılan veya AI’ı temel ürün olarak konumlandıran şirketlere katılmama” prensibini benimsediğini açıkça duyurdu. Büyük modeller tarafından üretilen kodların geliştiricilerin anlama ve bakım kapasitesini aşması durumunda yalnızca yazılım kalitesine zarar vermekle kalmayıp mühendislerin teknik derinliğini ve pazarlık gücünü de zayıflatacağını belirterek kodlama agent’larının uzun vadeli etkileri üzerine toplulukta derin bir tartışma başlattı (Kaynak: 36氪)

Jake Wharton röportajı

Anthropic yanıltıcı beyan iddiasıyla toplu davayla karşı karşıya, 1,5 milyar dolarlık kitap telif hakkı uzlaşma fonunun dağıtımında anlaşmazlık çıktı : Tüketiciler, Max aboneliğinde vaat edilen “5 kat / 20 kat kullanım kotasının” aslında 5 saatlik kayan pencere ve görünmez tavan sınırlarına tabi olduğunu ve bunun yanıltıcı reklamcılık teşkil ettiğini öne sürerek Anthropic aleyhine toplu dava açtı. Aynı zamanda Claude’un eğitimi için kitapların izinsiz taranması nedeniyle varılan 1,5 milyar dolarlık telif uzlaşması da kaosa sürüklendi; yayıncılar, yazarlar ve ajanslar telif hakkı sahipliği ve tazminat paylaşımı konusunda ciddi anlaşmazlıklar yaşıyor (Kaynak: THE DECODER / THE DECODER)

OpenAI Codex ekibiyle yapılan röportaj ortaya çıktı: Rust ile mühendislik yeniden yapılandırması, çok katmanlı bağımlılık denetimi ve Harness evrimi : Codex ekibi yöneticisi röportajında kurum içi mühendislik pratiklerini anlattı: Durum belirliliğini (state determinism) sağlamak için Agent çekirdeğinin tamamen Rust ile inşa edildiği; modelin 3-4 katman derinliğindeki bağımlılıklara inerek güvenlik açıklarını otomatik olarak engellediği ve kod inceleme odağını niyet analizine kaydırdığı belirtildi; ayrıca Harness’ın model için “geçici bir koltuk değneği” olduğu ve yeni nesil modellerin yetenekleri içselleştirmesiyle bu karmaşık iskele komutlarının kademeli olarak sadeleştirileceği ifade edildi (Kaynak: dotey (X))

💡 Diğer

IIFAA Güvenilir Agent Kimliği Çalışma Grubu resmi olarak kuruldu: 50’den fazla kurum Agent kimlik yönetimi standartlarını birlikte inşa ediyor : INCLUSION · Bund Zirvesi’nde Ant Group, Alibaba, Huawei ve CAICT gibi 50’den fazla kurum IIFAA Güvenilir Agent Kimliği Çalışma Grubu’nu kurdu ve Güvenilir Agent Kimlik Çerçevesi beyaz bültenini yayınladı. Bu girişim, Agent yönetimini statik yetki yönetiminden kayıt, yetki aktarımı, sürekli durum doğrulama ve izlenebilirliği kapsayan uçtan uca güvenilir bir sisteme dönüştürmeyi hedefliyor (Kaynak: 机器之心)

IIFAA Güvenilir Agent Kimliği Çalışma Grubu kuruldu

Kaliforniya dönüm noktası niteliğindeki yasaları imzaladı: Reşit olmayanlara bağımlılık yapıcı akış sunulması kesinlikle yasaklandı ve AI kimlik açıklaması zorunlu kılındı : Kaliforniya Valisi, AB1709 ve SB1119 dahil bir dizi yasa tasarısını imzaladı. Yasalar, sosyal medya platformlarının ebeveyn onayı olmadan 16 yaşından küçük kullanıcılara sonsuz kaydırma ve bağımlılık yapıcı öneri algoritmaları sunmasını açıkça yasaklarken, AI sohbet robotlarının da gençlere insan olmadıklarını açıkça belirtmelerini zorunlu kılıyor (Kaynak: The Verge)

NVIDIA ve d-Matrix, raf ölçeğinde NVLink Fusion XPU hibrit dağıtımını ilerletiyor : AI çıkarım çipi girişimi d-Matrix, yeni nesil Raptor XPU’sunun yüksek bant genişliği ve düşük gecikmeli arabağlantı alanında Vera Rubin GPU ve CPU ile sorunsuz çalışmasını sağlamak için NVIDIA NVLink Fusion mimarisi ve MGX raf standartlarına entegre olduğunu açıkladı; bu adım yeni nesil çıkarım çiplerinin ultra büyük ölçekli AI fabrikalarında yaygınlaşmasını hızlandırıyor (Kaynak: NVIDIA Blog)

Bir yanıt yazın

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir