🔥 Fokus
OpenAI Rilis Sekaligus 722 Manuskrip Matematika dari Model yang Belum Diluncurkan, Dobrak Batasan Masalah Abad Ini Termasuk Quasi-Riemann Hypothesis : OpenAI secara resmi merilis 372 kelompok hasil dengan total 722 manuskrip makalah matematika yang dihasilkan oleh model frontier internal yang belum diluncurkan di repositori open-source GitHub openai/math. Hasil-hasil inti mencakup Quasi-Riemann Hypothesis (mengklaim pembuktian bahwa seluruh Dirichlet L-functions tidak memiliki zero pada area dengan bagian riil lebih besar dari 7/8 dan mengeliminasi Siegel zero), pembuktian Hodge conjecture pada varietas Abelian, 4D Kakeya conjecture, masalah kesepuluh Hilbert pada bilangan rasional, serta penetapan ambang batas NP-hardness standar untuk Basic-SDP tanpa bergantung pada Unique Games Conjecture; sekitar 160 di antaranya disertai pembuktian formal Lean. OpenAI mengungkapkan bahwa setiap pencapaian rata-rata menghabiskan daya komputasi inferensi ChatGPT Pro selama sekitar 3 jam. Meskipun dipandang sebagai tonggak sejarah penemuan ilmiah otonom oleh mesin, panel penasihat Institute for Advanced Study di Princeton yang mencakup tiga peraih Fields Medal mengeluarkan pernyataan yang menekankan bahwa keterbukaan publik tidak sama dengan pengakuan akademis, serta memperingatkan bahwa pembuktian yang dihasilkan mesin secara massal memberikan dampak serius terhadap mekanisme penelaahan dan verifikasi oleh ilmuwan manusia (Sumber: JiQiZhiXin, The Verge, Latent Space, Abhishek Saha, openai)

Departemen Energi AS dan NIH Gandeng DeepMind serta Raksasa Teknologi Luncurkan “Virtual Biology Initiative” : Departemen Energi AS (DOE) dan National Institutes of Health (NIH) mengumumkan kemitraan strategis tingkat nasional bersama Google DeepMind, Meta, Isomorphic Labs, NVIDIA, dan institusi lainnya untuk membentuk “Virtual Biology Initiative”. Inisiatif ini bertujuan memetakan atlas biologi seluler skala penuh secara sistematis dan menghasilkan data benchmark terstandarisasi, menggabungkan AI multimodal guna membangun model digital umum pertama di dunia yang mampu memprediksi aktivitas kehidupan seluler secara end-to-end, merevolusi penemuan obat baru dan eksplorasi mekanisme penyakit dari prinsip pertama (first principles) (Sumber: Alex Rives)
Google DeepMind Rilis Open-Source Model Embedding On-Device Seluruh Modalitas EmbeddingGemma 2 : Google DeepMind secara resmi merilis model embedding multimodal pertama berbasis arsitektur Gemma 4 secara open-source, EmbeddingGemma 2, dengan lisensi Apache 2.0. Model dengan parameter 740M ini menyatukan ruang representasi vektor teks, kode, gambar, audio, dan video secara native, serta mendukung konteks 8K. Desain modularnya memungkinkan mode tunggal teks berjalan hanya dengan 270M parameter, membutuhkan memori hanya sekitar 191MB pada perangkat seluler setelah kuantisasi, dan mendukung pemotongan dimensi dinamis hingga di bawah 768 dimensi menggunakan Matryoshka representation learning. Pengujian Qdrant menunjukkan bahwa kombinasi kuantisasi 1-bit mampu memangkas penggunaan VRAM hingga 77 kali lipat dengan tetap mempertahankan akurasi retrieval sebesar 94,5%, mengisi kekosongan infrastruktur untuk RAG seluruh modalitas on-device yang ringan dan pencarian semantik offline (Sumber: Google DeepMind Blog, THE DECODER, GoogleDeepMind)

OpenAI Penuhi Pembaruan Hari ke-2 “Tantangan 28 Hari”: Auto-review Sepenuhnya Gratis dan Uji Publik Decisions API Dimulai : Pada hari kedua tantangan “pengiriman peningkatan praktis setiap hari selama 28 hari”, OpenAI meluncurkan serangkaian pembaruan inti yang difokuskan pada friksi implementasi Agent: fitur audit kontrol risiko otomatis untuk tugas panjang, Auto-review, kini terbuka gratis bagi seluruh pengguna login ChatGPT tanpa memotong kuota; tingkatan berbayar API disederhanakan dari lima tingkatan menjadi tiga tingkatan yaitu Build, Launch, dan Grow, dengan ambang batas tingkat tertinggi diturunkan menjadi $500; Decisions API yang dirancang untuk diskrit routing dan shunting tools resmi memasuki pengujian publik, ditenagai oleh GPT-6 Luna dengan latensi sisi server di bawah 100 milidetik, dibanderol hanya $0,10 per juta token input serta bebas biaya output dan caching; selain itu, plugin ruang kerja rapat Meetings mulai digulirkan secara bertahap pada macOS (Sumber: JiQiZhiXin, OpenAI Developers, )

Meta dan Sierra Bersama Para Raksasa Teknologi Rilis PAP, Standarisasi Interaksi AI Agent Pribadi dengan Bisnis : Menanggapi masalah AI Agent tingkat konsumen yang kerap terblokir oleh mekanisme anti-scraping di situs web komersial, Meta dan platform layanan pelanggan AI Sierra, bersama Stripe, Shopify, Walmart, dan sejumlah perusahaan lainnya, bersama-sama meluncurkan standar industri terbuka “Personal Agent Protocol” (PAP). Protokol ini berbasis pada arsitektur A2A dan OAuth, yang menetapkan batas autentikasi dan kontrol risiko secara jelas ketika asisten AI pribadi mewakili pengguna untuk melakukan pemesanan e-commerce, pencarian tiket, dan pengisian formulir saat berkomunikasi dengan sistem perusahaan; Decagon juga merilis protokol kepercayaan PACT open-source pendukung, mempercepat penghapusan hambatan kepercayaan pada pemanggilan lintas batas oleh agent (Sumber: The Verge, TechCrunch, saranormous)

🎯 Dinamika
Google DeepMind Rilis Model Pembangkitan dan Pengeditan Gambar Nano Banana 2.1 : Google meluncurkan model gambar generatif Nano Banana 2.1 berbasis Gemini 3.6 Flash (pengidentifikasi API: gemini-nano-banana-2.1), yang tersedia secara serentak di Gemini API, AI Studio, dan Google Ads. Model baru ini secara native mendukung desain tata letak yang kompleks, inpainting lokal dengan masking presisi, serta fusi konsistensi karakter hingga 14 gambar referensi, mendukung rendering hingga resolusi 4K dengan biaya pembuatan gambar tunggal turun menjadi $0,034 (penurunan harga sekitar 50%), berfokus pada penyelesaian tantangan konsistensi multi-putaran berkelanjutan dalam desain visual komersial (Sumber: JiQiZhiXin, GoogleAIStudio, THE DECODER)

Claude Pecahkan Masalah Teori Probabilitas, Buktikan Konjektur Transisi Fase Kontinu Perkolasi secara Formal dengan Lean : Model frontier internal Claude yang belum dirilis oleh Anthropic berhasil memecahkan konjektur transisi fase kontinu yang telah membingungkan komunitas matematika selama hampir 70 tahun (probabilitas keterhubungan tak hingga pada probabilitas kritis $p_c$ adalah 0). Berdasarkan kerangka ketimpangan yang dibangun komunitas akademis pada tahun 2024, model ini menyelesaikan ribuan baris penurunan formal melalui asisten pembuktian Lean, menembus kebuntuan panjang pada dimensi fisik kritis 3 hingga 10 dimensi. Kemajuan AI dalam menyelesaikan pembuktian formal konjektur tingkat Fields Medal ini memicu kegemparan mendalam di kalangan akademisi (Sumber: 36Kr)

Anthropic Perluas Cyber Verification Program dan Tetapkan Mekanisme Akses Tiga Tingkat : Anthropic mengumumkan peningkatan Cyber Verification Program (CVP) miliknya menjadi arsitektur akses tiga tingkat permanen (Defensive, Red Team, Dedicated), membuka Claude Opus 5.5, Sonnet 5.5, dan Mythos 5.1 dengan filter keamanan yang dilonggarkan bagi organisasi terverifikasi dan pakar white-hat. Sistem baru ini untuk pertama kalinya menyediakan kemampuan pemanggilan ofensif terotorisasi yang patuh hukum untuk penetration testing dan simulasi red/blue teaming, dengan tujuan menyelesaikan kontradiksi di mana “pihak pembela membutuhkan alat canggih untuk menambal kerentanan tetapi ditolak oleh kebijakan keamanan umum” (Sumber: Anthropic News, AnthropicAI, THE DECODER)
DeepMind Luncurkan AlphaGenome Atlas untuk Menafsirkan Dampak Variasi Seluruh Genom : Google DeepMind merilis model deep learning genomik AlphaGenome beserta database hasil pra-komputasinya, AlphaGenome Atlas. Model ini memiliki resolusi single-base-pair dan konteks panjang 1 juta base-pair. Atlas-nya telah menghitung sebelumnya dampak fenotipe molekuler dari seluruh 9 miliar kemungkinan variasi nukleotida tunggal pada genom manusia, dengan skala data 30 kali lipat dari database AlphaFold, bertujuan untuk mengurai mekanisme kerentanan terhadap mutasi langka dan penyakit kompleks secara sistematis (Sumber: )
vLLM v0.31.0 Hadirkan Mekanisme Snapshot CRIU, Ubah Cold Start Menjadi Pemulihan Proses dalam Hitungan Milidetik : vLLM merilis versi v0.31.0 yang memperkenalkan daemon permanen vllm snapshot dan vllm preload. Mekanisme ini memanfaatkan teknologi Linux CRIU untuk menyimpan checkpoint dan memulihkan image runtime engine inferensi secara cepat, melewati proses pemuatan bobot model dan inisialisasi yang memakan waktu lama saat migrasi instance atau penskalaan kapasitas, secara signifikan memangkas latensi cold start pada penjadwalan elastis klaster inferensi berskala besar (Sumber: vLLM)
Harbin Institute of Technology dan NUS Rilis Open-Source QuantWM, Solusi Kompresi KV Cache 2-bit untuk Video World Models : Menanggapi masalah tingginya konsumsi VRAM pada video world model autoregresif dan flickering parah yang dipicu oleh kuantisasi tradisional, tim gabungan Harbin Institute of Technology (Shenzhen) dan National University of Singapore (NUS) mengajukan metode kuantisasi bebas pelatihan, QuantWM. Studi ini mengungkapkan bahwa dislokasi perhatian spatiotemporal yang disebabkan oleh kuantisasi Key adalah akar penyebab ketidakstabilan temporal. Melalui clustering peka-sensitivitas dan kompensasi galat subruang utama, solusi ini mempertahankan stabilitas temporal visual sekaligus mencapai kompresi memori KV Cache hingga 6,2 kali lipat (Sumber: JiQiZhiXin)
.jpg)
Perplexity Luncurkan Model Pengambilan Keputusan Open-Source Versi Ditingkatkan pplx-decider-v1.1-27b : Perplexity merilis model pengambilan keputusan multimodal versi peningkatan pplx-decider-v1.1-27b secara open-source. Bobot model ini memuncaki evaluasi Hugging Face Decision Index 0.3 terbaru, dengan peningkatan efisiensi inferensi secara signifikan tanpa mengorbankan akurasi keputusan visual dan logika; tarif layanan Decision API pendukungnya juga diturunkan menjadi $0,02 per juta token input (Sumber: AravSrinivas)

Meta Rilis Open-Source Rebalancer, Solver Keputusan Alokasi Skala Produksi : Meta secara resmi merilis Rebalancer, solver inti C++ (dengan antarmuka Python dan lisensi Apache 2.0) yang telah beroperasi secara internal selama lebih dari 9 tahun dan memproses sekitar 40 juta penjadwalan sumber daya per hari. Alat ini mengabstraksikan masalah NP-hard seperti sharding scheduling dan traffic balancing menjadi graf asiklik terarah (DAG) terpadu, menyediakan pencarian lokal efisien dan penyelesaian mixed-integer programming untuk entitas skala ultra-besar hingga jutaan entitas (Sumber: MarkTechPost)
TII Rilis Model Bahasa Besar Dialek UEA Falcon-Emirati-7B : Technology Innovation Institute (TII) UEA meluncurkan Falcon-Emirati-7B, model yang dikhususkan untuk dialek Uni Emirat Arab. Tim membangun pipeline data yang mencakup data web percakapan, latar belakang budaya lokal, dan korpus sintetis terkontrol, mencapai akurasi pilihan ganda sebesar 84,83% pada benchmark lokal Alyah, serta secara signifikan meningkatkan pemahaman metafora budaya dan kesesuaian etiket dalam dialog bebas (Sumber: HuggingFace Blog)

AI Agent Desain Produk Figma Masuk Ketersediaan Umum (GA) Secara Komersial : Figma mengumumkan bahwa AI agent bawaan untuk desain produk UI/UX kini resmi dibuka bagi seluruh pengguna. Versi baru ini menambahkan mekanisme pengikatan pedoman panduan desain tim serta visualisasi kolaborasi tindakan agent lintas tim dalam mode multipemain, memungkinkan agent membangun antarmuka high-fidelity dan prototipe interaktif multi-state langsung berdasarkan pustaka komponen (Sumber: The Verge)

Cohere Rilis Open-Source Keluarga Model Kecil Multibahasa Tiny Aya, Mencakup Lebih dari 70 Bahasa Minoritas : Cohere Labs merilis keluarga model multibahasa ringan Tiny Aya secara open-source pada konferensi COLM 2026. Seri ini menggabungkan fondasi multibahasa umum dengan varian spesialisasi regional yang mencakup lebih dari 70 bahasa di seluruh dunia (termasuk banyak bahasa berkoleksi sumber daya rendah), bertujuan untuk menurunkan batasan penerapan multibahasa di perangkat (on-device) dan meningkatkan kemampuan model kecil dalam menghasilkan semantik lintas budaya (Sumber: sarahookr)

NeurIPS 2026 | Kerangka Kerja SAGE Manfaatkan Sinyal Struktur Topologi untuk Mengoreksi Penalaran Jangka Panjang LLM : Menanggapi masalah kronis di mana penalaran rantai panjang LLM “tersesat di tengah jalan namun tidak dapat dikoreksi akibat tertundanya reward di akhir”, tim dari Virginia Tech dan institusi lainnya mengusulkan metode eksplorasi terpandu penerimaan struktural bernama SAGE. Metode ini mengompresi deviasi eksplorasi melalui sparsifikasi aljabar dan memberikan umpan balik langkah demi langkah menggunakan jarak ruang hiperbolik, secara signifikan meningkatkan akurasi pada beberapa benchmark matematika simbolik dan formal, serta melipatgandakan tingkat kelulusan verifikasi Lean (Sumber: JiQiZhiXin)
.jpg)
Google Luncurkan Playground, Platform Eksperimental Pembuatan Game Bebas Kode : Google merilis platform eksperimental game AI playground.google, di mana pengguna dapat mendesain game ringan dengan aturan fisika kustom, interaksi karakter, dan gaya latar langsung di browser hanya melalui percakapan bahasa alami. Platform ini mendukung gameplay multi-perangkat dan berbagi komunitas, dengan rencana integrasi Unity Spark di masa mendatang untuk menghadirkan dukungan engine 3D yang lebih profesional (Sumber: Google AI Blog)
Replit Luncurkan Konteks Global Lintas Proyek dan Coding Agent Asinkron di Latar Belakang : Replit melakukan pembaruan besar pada lingkungan pengembangannya dengan memperkenalkan konteks global ruang kerja lintas proyek secara resmi. Agent dapat mengindeks semua riwayat proyek dan pedoman desain di bawah akun pengguna, memungkinkan ekstraksi logika warna dan komponen dari proyek referensi untuk dipindahkan ke proyek baru, serta mendukung pembuatan tugas pengeditan asinkron di latar belakang dan peninjauan penggabungan satu klik (Sumber: amasad)
🧰 Alat & Perangkat
Hark Pro: Asisten Pribadi On-Device Berorientasi Privasi Dilengkapi Browser Sandbox Independen : Tim pendiri Figure AI, Brett Adcock, meluncurkan aplikasi desktop dan seluler Hark Pro. Sistem ini dilengkapi agent penggunaan komputer Handoff dan antarmuka interaktif yang dirancang oleh mantan tim Apple, mampu mengelola kredensial pengguna secara aman dalam sandbox terisolasi, menjelajahi web secara mandiri, serta menjalankan pengurusan visa, pembelian tiket, dan pengisian formulir lintas sistem dengan riwayat operasional yang transparan bagi pengguna, menyeimbangkan keandalan agent otonom dengan privasi data on-device (Sumber: TechCrunch, TheRundownAI)
Monid.ai Raih Pendanaan $7,7 Juta untuk Bangun Gateway Penyelesaian Tool Dinamis bagi Agent : Penyedia layanan pengembangan agent Monid.ai meluncurkan gateway agregasi API yang dijuluki sebagai “OpenRouter untuk Agent” dan meraih pendanaan sebesar $7,7 juta. Pengembang hanya memerlukan satu antarmuka agar agent dapat menemukan secara dinamis dan membayar berdasarkan penggunaan ke 2.500 API komersial yang mencakup pemasaran, SEO, pencarian, e-commerce, dan pembuatan konten multimodal, menggantikan model langganan bulanan SaaS korporat konvensional (Sumber: yoheinakajima)
AgentID Diluncurkan: Solusi Kredensial Identitas Independen Khusus untuk AI Agent : AgentMail menghadirkan layanan AgentID. Solusi ini menetapkan alamat email terautentikasi dan kredensial identitas independen yang terikat dengan pemilik manusia untuk setiap agent yang beroperasi secara otonom, memungkinkan platform SaaS pihak ketiga mengizinkan agent eksternal masuk dan melakukan otorisasi lintas platform secara aman tanpa melanggar kontrol risiko akun sembari mempertahankan audit keterlacakan (Sumber: omarsar0)
Spotify Portal AI Plugins: Hadirkan Platform Pengembangan Tingkat Enterprise ke Coding Agent Populer : Spotify merilis kumpulan plugin open-source resmi yang menghubungkan langsung platform pengembang internal Spotify Portal ke Claude Code, Codex, dan Cursor. Agent dapat langsung mencari katalog microservices, memanggil diagnostik layanan, memeriksa status kesehatan melalui CLI, serta mendukung pengalihan tugas intensif I/O ke model yang lebih ringan melalui plugin shunt guna menghemat biaya token (Sumber: GitHub Trending)
T3 Code Luncurkan Rendering UI Real-Time dalam Thread dan Pratinjau Interaktif : Alat coding T3 Code memperkenalkan fitur visualisasi UI dalam aplikasi. Saat agent melakukan refaktorisasi front-end atau peninjauan kode PR, hasil komponen HTML/React interaktif dan prototipe visual dapat langsung dirender secara inline di dalam thread percakapan, mengurangi kehilangan konteks akibat keharusan pengembang beralih keluar dari IDE untuk debugging hot-reload (Sumber: theo)

Overmind Open-Source: Distilasi Otomatis Model Kecil Vertikal Menggunakan Trajektori Eksekusi Agent : Alat open-source Overmind resmi diluncurkan, mendukung ekstraksi dataset fine-tuning dan set evaluasi bernilai tinggi dari log panggilan tools dan trajektori eksekusi coding agent harian atau agent bisnis. Hasil pengujian menunjukkan bahwa model kecil vertikal hasil distilasi mampu menurunkan tingkat fabrikasi sitasi dari 3,36% pada model besar menjadi 0,12% pada skenario ekstraksi klausul kontrak panjang (Sumber: kimmonismus)

Mitchell Hashimoto Rilis Spesifikasi Status Program Terminal Universal OSC 7501 : Pengembang ternama Mitchell Hashimoto merilis spesifikasi kontrol terminal baru OSC 7501, yang memungkinkan program command-line melaporkan status granular seperti idle, running, blocking wait, completed, dan failed secara presisi ke terminal. Spesifikasi ini dirancang untuk menggantikan pemeriksaan heuristik regex yang saat ini digunakan oleh ratusan orkestrator agent, menetapkan protokol standar komunikasi status multi-agent (Sumber: mitchellh)
Scale AI Rilis Framework Open-Source Lingkungan Reinforcement Learning Fidelitas Tinggi AgentEnv : Scale AI bekerja sama dengan Modal merilis rangkaian pembangunan lingkungan AgentEnv secara open-source. Framework ini dirancang khusus untuk post-training reinforcement learning bagi agent tugas panjang yang kompleks, menyediakan pemicu dinamis, virtual clock, dan penjadwalan lingkungan multi-sandbox, yang dapat terhubung mulus ke klaster sandbox cloud terkemuka guna mendukung rollout konkuren masif dan pelatihan adversaris lingkungan (Sumber: Scale AI)
DAIR.AI Luncurkan MCP Suite Eksplorasi Literatur Konferensi Teratas untuk Agent : Organisasi AI open-source terkemuka DAIR.AI merilis plugin MCP khusus yang mendukung integrasi satu klik ke Claude Code, Codex, dan Grok Bot. Agent dapat mengakses database makalah AI yang telah dikurasi secara independen untuk merangkum perkembangan riset terbaru, menulis tinjauan literatur otomatis, dan membandingkan arsitektur metode secara visual (Sumber: DAIR.AI)
ruNNtime Berhasil Jalankan EmbeddingGemma 2 Sepenuhnya di Browser melalui WebGPU : Library inferensi WebGPU ruNNtime berhasil mem-porting tower teks dan visual EmbeddingGemma 2 ke lingkungan front-end murni. Pengguna dapat langsung melakukan pencarian semantik multimodal pada galeri gambar menggunakan GPU browser lokal tanpa keterlibatan server back-end, membuktikan potensi arsitektur retrieval multimodal ringan on-device dalam hal perlindungan privasi dan skenario offline (Sumber: Reddit r/LocalLLaMA)

Anthropic Hadirkan Uji Coba Publik Add-on Claude for Google Workspace : Anthropic meluncurkan plugin sidebar resmi Google Workspace bagi pengguna berlangganan berbayar, memungkinkan pengguna memanggil Claude langsung di Docs, Slides, dan Sheets untuk pengeditan multi-putaran, optimalisasi struktur, dan pemformatan tata letak otomatis, serta mendukung pembacaan konteks lintas dokumen secara langsung (Sumber: The Verge)
📚 Pembelajaran
Tim Yann LeCun Usulkan Model Dunia Hierarkis H-JEPA, Tingkat Keberhasilan Perencanaan Visual Jangka Panjang Melonjak Empat Kali Lipat : Menanggapi keterbatasan perencanaan end-to-end visual yang rentan kehilangan detail lokal, tim Yann LeCun memperkenalkan arsitektur H-JEPA dengan representasi hierarkis top-down. Setiap lapisan memiliki representasi latent space dan skala abstraksi semantik yang independen. Dalam pengujian perencanaan jangka panjang labirin Visual AntMaze yang kompleks, struktur tumpukan tiga lapisan melonjakkan tingkat keberhasilan tugas dari 18% menjadi 73% (Sumber: ylecun)

Meta dan MIT Rilis Coco: Platform Agent Co-Design Hardware dan Model Deep Learning : Meta dan MIT mengusulkan Coco, sistem multi-agent untuk perancangan perangkat keras. Menghadapi ratusan gigabyte data simulasi scanning yang belum pernah dilihat, agent dapat menulis kueri SQL secara mandiri ke database relasional, mengorkestrasi alat analisis, dan membaca status navigasi UI, memangkas separuh jam kerja arsitek TPU dalam membuat konfigurasi simulasi dan atribusi bottleneck performa (Sumber: dair_ai)

Panduan Membangun Asisten Cerdas Berkemampuan Memori Persisten Berbasis AgentCore dan OpenClaw : Tim AWS menerbitkan tutorial arsitektur mendalam yang menunjukkan cara menggabungkan fondasi OpenClaw dengan komponen memori persisten Bedrock AgentCore pada runtime serverless. Artikel ini menguraikan arsitektur memori dua lapis yang terdiri dari penangkapan peristiwa jangka pendek dan ekstraksi fakta jangka panjang secara asinkron, serta memangkas biaya inferensi interaksi multi-putaran dengan memori hingga hampir 90% menggunakan teknologi prompt caching (Sumber: AWS Machine Learning Blog)

Stanford Ajukan Framework Priced Guidance, Kuantifikasi Kemampuan LLM Menghasilkan Hipotesis Ilmiah Orisinal : Tim Percy Liang mengusulkan paradigma evaluasi Priced Guidance berbasis teori informasi. Dengan merancang mekanisme permainan “20 Pertanyaan”, metode ini mengukur secara tepat bit informasi yang dibutuhkan model untuk memulihkan konsep inti makalah baru yang diterbitkan di masa depan dari titik batas pre-training-nya, menetapkan tolok ukur intuisi ilmiah dan kemampuan generalisasi frontier model dari perspektif kompresi (Sumber: percyliang)

Analisis Mekanisme Multi-Teacher On-Policy Distillation (MOPD): Atasi Konflik Kemampuan RL Lintas Domain : Sebuah studi membedah metode Multi-Teacher On-Policy Distillation (MOPD). Untuk mengatasi konflik reward dan beban komputasi berlebih dalam unified RL fine-tuning di berbagai ranah seperti penalaran, pemrograman, dan dialog, metode ini melatih model guru spesialis untuk masing-masing bidang, kemudian memberikan supervisi padat pada tingkat token kepada model siswa melalui reverse KL divergence, menggabungkan kemampuan model serbaguna sekaligus menjaga efisiensi sampel (Sumber: cwolferesearch)

Kerangka Kerja HAD: Tingkatkan Eksekusi Agent Model Bahasa Kecil dengan Distilasi Sadar Lingkungan : Makalah ini mengajukan metode distilasi HAD bagi agent model kecil yang diterapkan bersama harness. Dengan membandingkan perbedaan tindakan model guru dengan dan tanpa informasi status eksternal, model kecil dilatih secara khusus untuk memanfaatkan informasi kerangka kerja, meningkatkan tingkat keberhasilan tugas model kecil hingga 63,4% pada benchmark ALFWorld, serta berhasil melepaskan diri dari kondisi macet pada hampir 60% skenario deadlock (Sumber: omarsar0)

Amazon AGI Rilis Open-Source Model Bahasa Difusi Rekursif Adaptif ALoDLM : Tim peneliti Amazon merilis arsitektur dan skema pelatihan ALoDLM berparameter 8B secara open-source. Dengan memperkenalkan penalaran rekursif adaptif dan mekanisme koreksi kesalahan bertahap ke dalam model bahasa difusi, alokasi sumber daya komputasi untuk sampel-sampel sulit dapat diatur secara dinamis, mengungguli baseline autoregresif dengan skala setara di berbagai benchmark pemahaman dan pembangkitan bahasa komprehensif (Sumber: arankomatsuzaki)

Jay Alammar Bagikan Diagram Arsitektur Sistem Inti “Panduan Bergambar AI Agent” : Penulis teknologi terkemuka Jay Alammar membagikan diagram arsitektur loop tertutup paling krusial dari sistem agent, menguraikan secara mendalam mekanisme rekursif LLM dalam lingkungan agent mulai dari penerimaan tujuan pengguna, pemeliharaan status, pencarian memori, hingga eksekusi aksi lingkungan, menyusun landasan rekayasa inti sistem agent otonom modern bagi para pengembang (Sumber: Jay Alammar)

💼 Bisnis
AMD Umumkan Rencana Akuisisi Startup Spatial Intelligence Fei-Fei Li, World Labs, Senilai $8,2 Miliar dalam Bentuk Saham : AMD mengumumkan kesepakatan definitif untuk mengakuisisi World Labs, startup unicorn world model yang didirikan bersama oleh Fei-Fei Li, melalui transaksi seluruhnya dalam bentuk saham senilai sekitar $8,2 miliar. Analisis industri menunjukkan bahwa seiring model Atlas membuktikan kelayakan rekonstruksi 4D real-time dari sudut pandang terbatas (sparse-view), model embodied dan world model kini mencapai titik balik industrialisasi massal; langkah AMD ini bertujuan menandingi NVIDIA dan membangun benteng pertahanan mendalam dalam arsitektur chip komputasi 4D serta ekosistem simulasi (Sumber: 36Kr)

Kling AI Milik Kuaishou Tunjuk CICC dan Goldman Sachs untuk Persiapan IPO Hong Kong, Targetkan Penggalangan Dana Lebih dari $1 Miliar : Bisnis model besar video milik Kuaishou, Kling AI, telah menetapkan CICC, Goldman Sachs, dan UBS sebagai tim penjamin emisi untuk mendorong proses spin-off dan pencatatan saham di bursa Hong Kong, dengan target penghimpunan dana minimal $1 miliar dan potensi melantai di bursa paling cepat pada tahun 2027. Pendapatan Kling pada kuartal kedua tahun 2026 telah melampaui 850 juta yuan; IPO independen ini bertujuan untuk membuka saluran pendanaan terpisah demi riset dan pengembangan klaster komputasi bernilai tinggi, dengan Kuaishou tetap memegang kendali mutlak (Sumber: 36Kr)

Penyedia Cloud Komputasi AI Lambda Berencana Himpun Dana $4 Miliar pada Valuasi $14,5 Miliar Jelang IPO : Menurut laporan Wall Street Journal, penyedia infrastruktur GPU cloud Lambda tengah menghimpun dana hingga $4 miliar pada valuasi pre-money sebesar $14,5 miliar, dengan Coatue dan Blackstone memimpin putaran tersebut. Didorong oleh kontrak komputasi bernilai fantastis dari pelanggan besar seperti Anthropic, nilai backlog pesanan Lambda melonjak hingga $50 miliar; putaran pendanaan ekuitas ini akan dialokasikan untuk mengamankan pembangunan pusat komputasi generasi baru menjelang IPO (Sumber: TechCrunch)
🌟 Komunitas
Penerapan Agent di Perusahaan Hadapi “Pajak Kolaborasi”: Setiap 1 Jam Penyelesaian Tiket Timbulkan 3 Jam Komunikasi Internal : Survei oleh platform manajemen layanan pelanggan Front terhadap 700 eksekutif perusahaan memicu diskusi hangat. Data mengungkap bahwa integrasi agent di perusahaan tidak serta merta memangkas biaya tenaga kerja, melainkan menimbulkan “pajak kolaborasi” tersembunyi yang sangat besar akibat serah terima di banyak simpul dan eskalasi tiket karena agent gagal menyelesaikan siklus tugas secara mandiri—waktu yang dihabiskan perusahaan untuk serah terima lintas sistem dan verifikasi konteks mencapai 3 kali lipat dari waktu penyelesaian sebenarnya, menyingkap masalah tata kelola yang minim observabilitas end-to-end (Sumber: )
Analisis Mendalam Penyebab Sisipan Iklan Judi di Akhir Judul Obrolan ChatGPT: Kontaminasi Tokenizer dan Kegagalan Pemotongan : Pengembang merekonstruksi mekanisme teknis di balik kemunculan iklan ilegal sesekali pada judul obrolan ChatGPT. Hal ini terjadi karena korpus pre-training tokenizer o200k terkontaminasi sejumlah besar token panjang frekuensi tinggi dari situs web abu-abu, dan model inferensi judul yang ringan mengalami pergeseran probabilitas saat mengeluarkan karakter kontrol penutup EOS, yang pada akhirnya secara keliru mengambil sampel fragmen iklan probabilitas tinggi dari “ruang sampah” token langka yang belum pernah dilihat model sebelumnya (Sumber: 36Kr)
Tren Arsitektur Harness Cloud-Native: Arsitek Awal K8s Eksplorasi Solusi Tata Kelola Agent Terpusat : Stacklok, yang didirikan oleh tim inti awal Kubernetes, meluncurkan proyek Agent Harness cloud-native open-source bernama Mecatl. Komunitas mendiskusikan jalur evolusi agent dari “skrip terminal lokal” menuju “platform tata kelola terpusat perusahaan”, menyerukan pemisahan total antara status agent, tool gateway MCP, dan lingkungan eksekusi sandbox sensitif untuk mencegah aset inti serta hak akses perusahaan terikat pada lingkungan mesin tunggal (Sumber: Latent Space)
Meta Muse Terungkap Buat Profil Sosial 4 Juta Pengguna secara Real-Time, Picu Kekhawatiran Privasi : Laporan komunitas mengungkap bahwa agent Muse milik Meta memperbarui profil terperinci pengguna setiap jam berdasarkan percakapan dan riwayat komunikasi, termasuk relasi sosial, konflik antarpribadi, serta preferensi pribadi. Meskipun Meta menyatakan bahwa VM pengguna merupakan sandbox terisolasi, mekanisme “berbagi pengalaman belajar” lintas instance memicu kewaspadaan tinggi pengguna terhadap pengumpulan data tak kasat mata dan penyalahgunaan iklan bertarget (Sumber: Reddit r/artificial)

Pengembang Diskusikan Fenomena “AI Tidak Berbicara Seperti Manusia”: Dari Kompresi CoT hingga Masalah Keselarasan Korpus : Komunitas developer ramai mengeluhkan model coding terbaru yang sering melontarkan istilah-istilah kaku seperti “15/15 serba hijau, satu kaki mati” saat memberikan laporan. Diskusi menunjukkan bahwa hal ini sebagian disebabkan oleh langkah penyedia model yang memadatkan Chain-of-Thought (CoT) implisit menjadi singkatan-singkatan yang sulit dipahami demi menekan konsumsi token; beberapa pakar juga memanfaatkan momentum ini untuk mengeksplorasi keunggulan rekayasa alami dari bahasa klasik berkepadatan tinggi dalam kompresi token ekstrem (Sumber: QbitAI)

Celah Bypass Enkripsi Prompt Terungkap: Dekripsi Mandiri oleh Agent Jadi Titik Lemah Keamanan : Riset keamanan menunjukkan bahwa penyerang dapat memanfaatkan instruksi berbahaya terenkripsi untuk melewati filter keamanan luar sistem seperti Copilot. Agent secara aktif melakukan dekripsi saat memproses input, mengambil rahasia lokal, dan mengeksekusi transmisi jaringan ke luar. Pengujian menunjukkan bahwa mekanisme routing model otomatis menyebabkan pertahanan keamanan menjadi sangat tidak stabil, membuktikan adanya risiko sistemik jika hanya mengandalkan disiplin mandiri model sebagai benteng keamanan (Sumber: Reddit r/artificial)

Terobosan Batas Miniaturisasi: Pengembang Latih Model Naratif MacroStories Hanya dengan 20 Ribu Parameter : Pengembang independen merilis model bahasa miniatur MacroStories dengan ukuran hanya 81KB (19.969 parameter) secara open-source. Mengusung arsitektur inferensi dekoder tunggal yang berulang 4 kali, model ini mampu berjalan dengan kecepatan kilat pada CPU biasa atau bahkan cache mikrokontroler, serta mempertahankan alur narasi yang jelas dalam batasan kosakata terbatas, mengeksplorasi batas minimum daya komputasi yang dibutuhkan untuk koherensi bahasa (Sumber: Reddit r/LocalLLaMA)

💡 Lainnya
Ekspansi Jaringan Listrik dan Kelangkaan Rantai Pasok Transformator Berpotensi Jadi Rem Darurat Ekspansi AI Sebelum Chip Komputasi : Analisis kebijakan energi menunjukkan bahwa meskipun beban daya pusat data AI di seluruh AS diproyeksikan melonjak hingga 50GW pada tahun 2030, waktu tunggu pengiriman peralatan listrik berat seperti transformator tegangan ultra-tinggi umumnya telah melampaui 5 tahun. Produsen juga enggan memperluas kapasitas secara agresif akibat trauma gelembung kapasitas masa lalu. Ketidaksesuaian pasokan dan permintaan yang kaku pada jaringan listrik fisik dan fasilitas transmisi kini menjadi hambatan fisik paling berat bagi ekspansi komputasi yang tak terkendali (Sumber: Transformer)
Seluruh Rangkaian Alat Desain Adobe Direkayasa Balik secara Open-Source: Model Kode Besar Rombak Benteng Pertahanan Kekayaan Intelektual : Proyek open-source Artcraft, dengan bantuan model coding mutakhir seperti Opus 5.5, melakukan dekompilasi logika rangkaian software desain konvensional dan menyusunnya kembali ke dalam spesifikasi Rust, mewujudkan alternatif open-source clean-room setara Photoshop secara penuh. Komunitas menyoroti bagaimana kemampuan coding agent dalam merekayasa balik software lawas secara kilat mulai meruntuhkan benteng komersial berpenghalang tinggi yang selama ini menopang software berpemilik tradisional (Sumber: dotey, amasad)

McDonald’s Hadapi Gugatan Antimonopoli atas Dugaan Kolusi Harga Waralaba Menggunakan Alat AI Pricing : Konsumen mengajukan gugatan kelompok (class-action) antimonopoli terhadap McDonald’s di Pengadilan Federal Chicago, menuduh bahwa alat AI dynamic pricing yang wajib digunakan oleh para pewaralaba independen sebenarnya merupakan pertukaran horizontal data penjualan non-publik dan manipulasi harga secara algoritmik, diduga merugikan hak konsumen serta mendistorsi tatanan persaingan pasar (Sumber: The Guardian)
