🔥 Fokus
Tim Peneliti Keamanan Gunakan Claude untuk Menembus Basis Kode Internal OpenAI : Tim peneliti keamanan Hacktron AI mengungkapkan bahwa di bawah kerangka bug bounty, para peneliti dengan bantuan Claude Opus 5 berhasil menembus akun karyawan OpenAI dalam waktu 72 jam, serta mengajukan PR verifikasi ke monorepo privat inti (openai/openai) yang menyimpan rahasia algoritma mereka. Rantai serangan bermula dari kerentanan heap buffer overflow libheif pada komponen unggah gambar forum Discourse, yang dikombinasikan dengan cacat konfigurasi identitas SSO OpenAI untuk mengambil alih akun Codex karyawan yang terhubung ke GitHub, dengan biaya token model LLM kurang dari $3.000. Peristiwa ini memicu guncangan besar dan kewaspadaan industri terhadap “AI garis depan yang dengan cepat mendemokratisasi kemampuan serangan siber tingkat tinggi” serta kerentanan pertahanan internal lab-lab AI papan atas (Sumber: The Wall Street Journal, 36氪)

Model Fondasi Citra Medis Universal DAMO RADAR dari Alibaba DAMO Academy Tembus Jurnal Science dan Sepenuhnya Open-Source : DAMO RADAR, model fondasi citra abdomen universal tingkat pakar pertama di dunia yang dikembangkan oleh Alibaba DAMO Academy bekerja sama dengan puluhan institusi medis termasuk First Affiliated Hospital of Zhejiang University, telah diterbitkan di jurnal utama Science. Model ini mendobrak batasan AI medis tradisional yang terbatas pada satu jenis penyakit, menggunakan penyelarasan teks-gambar berbutir halus (fine-grained) tingkat organ dan pemodelan kontras adaptif. Satu model tunggal dapat mencakup 146 penyakit pada 18 struktur anatomi abdomen, dengan rata-rata AUC mencapai 0,913 dalam validasi multi-pusat, presisi diagnosis setara dengan dokter spesialis radiologi senior, dan kolaborasi manusia-mesin dapat mengurangi waktu pembacaan citra hingga 30,7%. DAMO Academy telah merilis bobot model (weights), framework pelatihan, dan kode evaluasi secara open-source penuh (Sumber: Science, 36氪)

Anthropic Ungkap 26% R&D Telah Diambil Alih secara Otonom oleh AI dan Luncurkan Program Verifikasi Ilmu Hayati LSVP : Anthropic untuk pertama kalinya mempublikasikan data pengukuran R&D internal: Claude telah “memimpin” (tingkat AL4) 26% pekerjaan R&D model frontier perusahaan di bawah pengawasan manusia (kurang dari 1% enam bulan lalu), dengan lebih dari 30.000 agen beroperasi bersamaan secara rutin di internal dan memicu lebih dari 1 miliar keputusan bulanan. Pada saat yang sama, Anthropic secara resmi meluncurkan Life Sciences Verification Program (LSVP), yang membuka akses model frontier secara parsial bagi perusahaan farmasi dan lembaga riset ilmiah yang terverifikasi, membangun paradigma tata kelola keselamatan baru berbasis deklarasi niat, audit offline 30 hari, dan tanggung jawab bersama, menggantikan mekanisme pemblokiran real-time tradisional yang seragam (Sumber: Anthropic News, AnthropicAI)

Dokumen Internal Penting Terungkap dalam Gugatan The New York Times Terhadap Microsoft dan OpenAI: Eksekutif Microsoft Sebut Scraping AI Sebagai “Pencurian Tenaga Kerja Terbesar” : Dokumen pengadilan yang baru dibuka segelnya menunjukkan bahwa Brent Hecht, Direktur Ilmu Terapan di Microsoft, secara internal mencirikan scraping berita tanpa izin oleh model AI besar sebagai “pencurian tenaga kerja terbesar dalam sejarah manusia” dan “ejekan total terhadap doktrin fair use”. Eksekutif OpenAI juga mengakui bahwa produk mereka menghadirkan “ancaman pengganti yang substansial” bagi penerbit. Dokumen-dokumen ini mengungkap rincian kedua belah pihak melewati paywall untuk mengambil data, membuat pembelaan “penggunaan wajar” (Fair Use) yang telah lama diandalkan oleh industri AI menghadapi tantangan hukum yang belum pernah terjadi sebelumnya (Sumber: TechCrunch)

🎯 Tren & Perkembangan
Alibaba Tongyi Rilis Model Omnimodal Qwen3.8-Omni-Flash dengan Konteks 1M Beserta Ekosistem Pendukungnya : Tim Alibaba Tongyi resmi meluncurkan Qwen3.8-Omni-Flash, model omnimodal pertama yang berpusat pada alur kerja agen cerdas, yang secara native mendukung input teks, gambar, audio, dan streaming video kontinu hingga 1 jam. Model ini memperkenalkan mekanisme persepsi aktif dari kasar ke halus (coarse-to-fine), meningkatkan akurasi pada benchmark pemahaman video ultra-panjang OmniVideoBench menjadi 67,8 dan mengurangi konsumsi token sebesar 45,7%, sementara biaya API video terpangkas sekitar 89% dibandingkan generasi sebelumnya. Tim juga merilis secara open-source Qwen-MM-Plugins yang mendukung integrasi harness multi-perangkat serta alat omni-skill-creator (Sumber: Qwen, Alibaba_Qwen)

DeepSeek Luncurkan DeepSeek-V4.1-Flash untuk Atasi Hambatan KV Cache Konteks Ultra-Panjang : DeepSeek merilis model MoE multimodal 552B bernama DeepSeek-V4.1-Flash, yang mendukung konteks 1 juta token. Model ini mengadopsi arsitektur Causal Encoder-Decoder (CED) yang hanya mengaktifkan 8B parameter pada tahap Prefill, serta menggabungkan penggunaan kembali lintas lapisan CSA2 dan teknik kompresi FP4, memangkas penggunaan memori global KV Cache di HBM menjadi 890 byte/token (hanya seperempat dari generasi sebelumnya), secara signifikan menurunkan biaya deployment untuk beban kerja agen jangka panjang (Sumber: HuggingFace Daily Papers)
Figure Rilis Model Fondasi Embodied Helix 2.5 dan Buktikan Generalisasi Zero-Shot di Rumah Nyata : Startup robot humanoid Figure merilis jaringan saraf end-to-end generasi baru, Helix 2.5, dan melakukan pengujian merapikan ruangan, merapikan tempat tidur, serta melipat handuk di 30 rumah asing yang belum pernah dijadikan sampel di San Francisco Bay Area. Eksperimen menunjukkan bahwa setelah pre-training dengan Index data perilaku sudut pandang orang pertama (first-person) manusia berskala besar, tingkat keberhasilan tugas seluruh tubuh zero-shot robot di lingkungan baru meningkat dari 9% menjadi 56%, membuktikan Scaling Law transfer dari pengalaman manusia yang masif ke prediksi gerakan robot fisik secara awal (Sumber: 36氪)

SenseTime Rilis Laporan Teknis SenseNova-U1.5: Wujudkan Multimodal Terpadu Native Lewat Flow Matching dan Distilasi Multi-Pakar : SenseTime merilis laporan teknis lengkap dari model multimodal terpadu native 8B parameter bernama SenseNova-U1.5. Model ini menggunakan arsitektur NEO-unify dan token visual kompak 32×32, serta mendukung pembuatan gambar resolusi 4K secara native melalui rekonstruksi medan fitur 2D konvolusi 3×3. Tahap post-training secara inovatif mengadopsi paradigma Online Policy Distillation (OPD) “spesialisasi dulu baru penyatuan”, mengonvergensikan kembali empat kemampuan pakar—estetika, OCR, infografis, dan pengeditan presisi—ke dalam satu basis model tunggal, menggabungkan penalaran tingkat tinggi dan pembuatan tingkat piksel (Sumber: WeChat)

Huawei Majukan Jadwal Produksi Massal Chip AI Ascend 960DT ke Kuartal I 2027 : Pada konferensi Huawei Connect, Huawei mengumumkan percepatan jadwal peluncuran chip generasi berikutnya, Ascend 960DT, dari yang semula direncanakan pada Q3 2027 menjadi Q1 2027. Mengandalkan arsitektur komputasi Peerium dan teknologi interkoneksi berkecepatan tinggi UnifiedBus, Huawei sedang membangun supercluster Atlas 950 yang dapat menghubungkan hingga 256.000 kartu akselerator dalam satu klaster tunggal, bertujuan untuk mengatasi pembatasan daya komputasi dan mempercepat pengejaran terhadap NVIDIA melalui inovasi rekayasa tingkat sistem (Sumber: TechCrunch)
PrismML Luncurkan Model On-Device Ternary Bonsai 2 27B, Memicu Perdebatan Uji Nyata Komunitas : PrismML meluncurkan model kuantisasi terner Bonsai 2 27B berbasis Qwen3.8-27B, mengklaim kompresi ukuran model 9,3 kali lipat menjadi 5,9 GB dengan mempertahankan 98,2% performa komprehensif, serta dapat berjalan lancar langsung melalui WebGPU di perangkat konsumen. Namun, analisis whitepaper dan pengujian komunitas mengungkapkan bahwa performa pada benchmark agen jangka panjang seperti Terminal-Bench dan SWE-bench Verified sebenarnya turun sekitar 25%, memicu perdebatan luas terkait “cherry-picking” laporan benchmark pada kuantisasi bit sangat rendah (Sumber: TechCrunch, Reddit r/LocalLLaMA)

Cactus Rilis Model Otomasi On-Device Needle 3 dengan Arsitektur Bertingkat : Cactus Compute merilis model fondasi otomasi open-source Needle 3 dengan parameter 121M, mengadopsi Simple Attention yang dikombinasikan dengan Hadamard MLP dan tabel hash Engram, di mana beban komputasinya setara dengan model 50M. Arsitektur orisinal “Smart Ladder” miliknya mendukung pemangkasan dinamis deployment dari 2 hingga 20 layer (ukuran 8-29 MB), dengan kecepatan decoding murni pada CPU mencapai 4.000 tok/s, berfokus pada function calling tanpa ketergantungan jaringan dan kontrol deterministik pada perangkat edge serta wearables (Sumber: Reddit r/LocalLLaMA)

Wenzhun Intelligence Bersama Universitas Tsinghua Rilis Model Fondasi Data Terstruktur LimiX-2 : Wenzhun Intelligence meluncurkan model universal untuk data terstruktur LimiX-2 berparameter 400M, mengubah paradigma prediksi target tunggal terdahulu dengan mengajukan Context Mechanism Networks (CMNs) dan Conditional Masked Modeling (CCMM), membawa pemodelan turun ke level sel (Cell-Level) yang mendalam untuk mempelajari ketergantungan kausal bersama antar variabel. Model ini memuncaki tugas klasifikasi dan regresi pada benchmark internasional seperti TabArena dan TALENT, melampaui Google TabFM dan SAP TabPFN (Sumber: 量子位)

Apple Usulkan Algoritma Discrete Flow Matching Berpandu Energi TS-DFM dan Reinforcement Learning Difusi DACA-GRPO : Tim riset machine learning Apple merilis dua capaian generatif mutakhir: TS-DFM mengusulkan distilasi berpandu energi (energy-guided distillation) yang menggunakan kompas energi ringan untuk memperbaiki lonjakan lintasan awal pada discrete flow matching, melampaui model guru 1024-langkah hanya dalam 8 langkah dengan peningkatan kecepatan 128 kali; sementara DACA-GRPO mengatasi masalah alokasi kredit temporal dalam reinforcement learning untuk model bahasa difusi, meningkatkan performa pembuatan kode dan kepatuhan terhadap batasan (constraint following) masing-masing sebesar 7,4 poin persentase dan 36,3 poin persentase (Sumber: Apple Machine Learning Research)

PBB dan Google Luncurkan UN System Data Commons yang Terintegrasi dengan Standar MCP : PBB dan Google.org bersama-sama meluncurkan platform data publik terstruktur yang mengintegrasikan dataset otoritatif resmi dari 26 badan PBB. Menjawab kelemahan di mana akurasi model AI besar sebelumnya hanya 21,2% dalam menjawab indikator statistik global, platform ini mendukung kueri bahasa alami berbasis Graf Pengetahuan Google dan secara native mendukung protokol MCP, memungkinkan berbagai AI Agent memanggil sumber informasi otoritatif secara langsung untuk melakukan analisis korelasi lintas domain dan pembuatan grafik visual (Sumber: Google AI Blog, 36氪)

🧰 Alat & Produk
Anthropic Rombak Claude Code Projects dengan Kolaborasi Multi-Threading dan Memori Proyek Persisten : Anthropic merilis arsitektur Projects pada Claude Code versi desktop dan web. Pengguna dapat memberikan tujuan tingkat tinggi melalui satu sesi obrolan tunggal, dan agen Koordinator utama akan otomatis memecahnya menjadi beberapa sub-tugas paralel berbasis cloud yang dieksekusi secara independen, memeriksa bug, dan mengajukan PR. Semua sub-tugas berbagi memori proyek dan konteks yang berkembang secara persisten, serta mendukung manajemen asinkron offline dan kolaborasi berkelanjutan (Sumber: dotey, Anthropic News)

Agen Pribadi Desktop Meta, Muse, Resmi Hadir di Platform macOS : Muse, agen pribadi milik Meta, meluncurkan klien native Mac setelah sebelumnya dirilis di perangkat seluler. Aplikasi ini terintegrasi erat dengan alur kerja desktop dan, di bawah mekanisme otorisasi eksplisit, dapat membaca file lokal, kalender, catatan, dan kontak lintas aplikasi. Muse mampu menyelesaikan pengorganisasian file lintas aplikasi secara otonom, pengisian formulir otomatis, dan agregasi informasi di dalam sandbox keamanan lokal (Sumber: The Verge, AIatMeta)
OpenAI Resmi Rilis Astra for Law, Produk Unggulan Vertikal untuk Industri Hukum : Berbasis pada GPT-6 Astra, OpenAI meluncurkan Astra for Law yang dipadukan dengan indeks yurisprudensi dan peraturan hukum AS yang mencakup 230 juta URL. Model ini meraih akurasi 54% pada evaluasi Legal Research Bench (versi umum hanya 38,7%), mengintegrasikan 26 plugin resmi dan 47 plugin komunitas seperti Harvey dan Legora, serta menyediakan arsitektur isolasi privasi Trusted Access tanpa retensi data (Zero Data Retention) untuk mendukung peninjauan kontrak, uji tuntas transaksi, dan penyusunan dokumen pelaporan (Sumber: OpenAI News, gdb)

Salesforce Tingkatkan Fondasi Orkestrasi Tingkat Enterprise dan Pemblokiran Deterministik Agentforce : Salesforce memperkenalkan rangkaian Agentforce tingkat produksi yang mengintegrasikan Data Cloud dengan protokol MCP. Platform ini dilengkapi dengan Agent Testing Center bawaan untuk uji beban sintetis otomatis, serta memperkenalkan mekanisme Deterministic Gating yang mewajibkan transaksi dan operasi data inti hanya dapat dieksekusi setelah memenuhi aturan yang telah ditentukan; pengujian nyata oleh Southwest Airlines menunjukkan tingkat penyelesaian tugas layanan pelanggan otomatis penuh mencapai 45% (Sumber: MarkTechPost)

LangChain Rilis Deep Life Sci secara Open-Source, Meja Kerja Agen Cerdas untuk Ilmu Hayati : Berdasarkan arsitektur Deep Agents, LangChain merilis agen open-source Deep Life Sci yang ditujukan bagi peneliti klinis dan laboratorium. Sistem ini terintegrasi mendalam dengan puluhan juta literatur dan data uji klinis dari PubMed, PubMed Central, dan ClinicalTrials.gov, dilengkapi lingkungan sandbox kode khusus, serta mendukung pemrosesan ekstraksi dan validasi silang ratusan literatur ilmiah yang kompleks secara simultan melalui beberapa sub-agen (Sumber: LangChain)

Google Labs Luncurkan CC, Agen Cerdas Kolaborasi untuk Keluarga : Google Labs resmi merilis CC, produk AI Agent untuk manajemen urusan keluarga. Sistem ini mendukung hingga 6 anggota keluarga untuk terhubung bersama dengan akun berizin terisolasi. CC mampu mengurai surat pemberitahuan sekolah secara otomatis, menyinkronkan jadwal kalender lintas anggota, merangkum pengingat kegiatan, dan memiliki kemampuan manajemen memori bertingkat yang membedakan antara “informasi bersama keluarga” dan “preferensi pribadi khusus” (Sumber: Ars Technica, Google)

Wood Mackenzie Bangun Platform Analisis Energi APEX Berbasis Bedrock AgentCore : Raksasa konsultan energi Wood Mackenzie meluncurkan platform agen bersama APEX. Berbasis AgentCore dan gateway terpadu MCP, platform ini mengintegrasikan agen riset internal “Woody” dan agen yang menghadap klien “Lens AI”. Platform ini mendukung perencanaan pemanggilan multi-alat berbasis bahasa alami, rendering visualisasi UI generatif secara real-time, dan pembuatan presentasi PowerPoint, memangkas siklus pengembangan agen lintas bisnis energi dari hitungan bulan menjadi hitungan jam (Sumber: AWS Machine Learning Blog)

AWS Luncurkan Rangkaian Wawancara Perekrutan Cerdas Amazon Connect Talent : AWS resmi meluncurkan Amazon Connect Talent yang dirancang khusus untuk skenario perekrutan skala besar. Sistem ini memanfaatkan AI Agent untuk memandu wawancara kompetensi terstruktur dan evaluasi logika sepanjang waktu, serta menghasilkan laporan evaluasi otomatis lengkap dengan rantai bukti faktual dan dasar penilaian untuk ditinjau oleh perekrut, mengeliminasi bias subjektif sekaligus secara signifikan meningkatkan efisiensi pencocokan kandidat dan posisi dalam skala besar (Sumber: AWS Machine Learning Blog)

📚 Riset & Pembelajaran
Sistem Biofarmasi Virtual Multi-Agen Stanford Masuk Jurnal Science: 37 Ribu Instansi Proses Uji Klinis Masif dalam 6 Jam : Universitas Stanford menerbitkan sistem “Virtual Biotech” di Science, yang menyimulasikan struktur R&D perusahaan farmasi nyata dengan mendirikan 4 departemen dan 11 kategori agen. Dalam tugas ekstraksi data, sistem menjalankan 37.075 instansi agen secara serentak, menyelesaikan integrasi mendalam lintas modalitas dari lebih dari 55.000 uji klinis hanya dalam 6 jam (yang membutuhkan 76 hari bagi agen tunggal), dan berhasil mengidentifikasi B7-H3 sebagai target kandidat ADC untuk kanker paru-paru (Sumber: Science)

Studi Simulasi Nilai Lintas Negara pada Model Bahasa Besar oleh Tsinghua, Fudan, dan Mitra Masuk Computational Linguistics : Universitas Tsinghua bekerja sama dengan Universitas Fudan, Shanghai Jiao Tong University, dan lainnya mengevaluasi 9 LLM open-source berdasarkan data World Values Survey (WVS) dari 59 negara. Mereka menemukan bahwa akurasi simulasi model secara signifikan lebih tinggi untuk negara-negara maju dan negara dengan kualitas tata kelola tinggi, serta terdapat bias konvergensi asimetris dari kelompok yang kurang terwakili menuju budaya dominan. Studi ini mengusulkan metrik evaluasi “representational equality”, yang membuktikan bahwa melengkapi informasi latar belakang kelompok tertentu lebih efektif dalam meningkatkan keadilan representasi lintas budaya dibandingkan hanya menggunakan petunjuk bahasa ibu atau penyelarasan preferensi (Sumber: WeChat)

Beihang, CUHK, dan Mitra Usulkan Framework Evolusi Mandiri Agen Visual OmniHarness : Tim peneliti gabungan mengusulkan OmniHarness, sebuah kerangka kerja eksplorasi mandiri untuk kreasi visual yang kompleks. Sistem ini melakukan latihan mandiri melalui pemilihan topik heuristik berdasarkan kebaruan dan batas kemampuan, mengabstraksikan alur kerja ComfyUI yang berhasil dihasilkan menjadi pustaka strategi simbolik, mencapai tingkat penyelesaian 95% pada tugas kreatif ComfyBench, dan pustaka strategi pengalaman tersebut dapat ditransfer secara zero-shot ke framework agen lain serta alur kerja video (Sumber: 36氪)

Tim NVIDIA Usulkan Agora: Arsitektur Memori Bersama Riset Ilmiah Multi-Agen : Peneliti NVIDIA menerbitkan makalah yang mengusulkan Agora, sebuah arsitektur memori bersama Directed Acyclic Graph (DAG) berbasis commit Git yang tidak dapat diubah (immutable). Sebanyak 13 LLM Worker tanpa perencana pusat berkolaborasi selama 12 hari untuk menyelesaikan tugas inisialisasi model campuran. Dengan menyusun hipotesis, kode, dan catatan validasi secara terstruktur ke dalam Git tree, mereka sepenuhnya menghindari trial-and-error yang berulang dan konflik status antar-agen, dengan 165 pengujian replikasi independen berhasil 100% (Sumber: omarsar0)

Benchmark Agen On-Device Dunia Nyata AndroidLife Ungkap Kelemahan Kontrol Jangka Panjang dan Masalah Suhu Panas Tinggi : Komunitas merilis AndroidLife, sebuah benchmark evaluasi berbasis perangkat ponsel fisik dan lingkungan jaringan nyata untuk menguji performa on-device AI Agent dalam tugas harian lintas aplikasi. Hasil pengujian menunjukkan Qwen3.8-27B hanya meraih tingkat keberhasilan 56,7% dalam 60 tugas nyata, dengan waktu rata-rata sekitar 6 menit per tugas, dan suhu puncak chip mencapai 98,2°C. Pengujian ini mengungkap bahwa model sangat rentan terjebak dalam infinite loop saat menjalankan operasi berkelanjutan di berbagai aplikasi dan memiliki kemampuan generalisasi yang lemah dalam skenario inkuiri proaktif (Sumber: Reddit r/artificial)

Apple Usulkan REVERSAL-BENCH: Benchmark Pengukuran Jurang Reinforcement Learning Tanpa Reset : Untuk mengatasi aksi yang tidak dapat diubah di dunia fisik nyata, seperti jatuhnya suatu objek, tim Apple mengusulkan REVERSAL-BENCH. Dengan memperkenalkan parameter reversibilitas kontinu dan reset oracle, penelitian ini mengungkap efek “absorbing cliff” yang dihadapi agen otonom tanpa mekanisme reset saat menghadapi keadaan fisik yang tidak dapat dibalikkan, serta mengevaluasi batas efektivitas Safety Shield dalam secara proaktif menghindari jebakan tersebut (Sumber: Apple Machine Learning Research)
Riset Ungkap Watermark Teks LLM (SynthID) Melemahkan Pertahanan Adversarial Agen Cerdas secara Signifikan : Studi terbaru oleh Lasso Security menunjukkan bahwa mekanisme watermarking teks SynthID-Text yang diperkenalkan pada tahap decoding model untuk memenuhi persyaratan kepatuhan dapat mengganggu distribusi probabilitas asli model. Dalam skenario serangan adversarial, model yang diberi watermark lebih rentan mengeksekusi instruksi jailbreak atau membocorkan informasi sensitif seperti kata sandi, memperingatkan pengembang untuk menguji ulang baseline keamanan tool invocation agen saat menerapkan watermark (Sumber: Ars Technica)
Studi Empiris dan Panduan Seleksi Desain Berbasis Komponen pada Harness Agen Pemrograman : Sebanyak 176 rangkaian eksperimen komparatif pada SWE-Bench Verified dan Terminal-Bench menunjukkan bahwa manajemen konteks secara efektif mencegah kegagalan akibat overflow saat anggaran komputasi terbatas, dan strategi “penghapusan aturan sebelum peringkasan model besar” merupakan pendekatan yang paling hemat biaya. Model berkemampuan tinggi lebih cocok menggunakan antarmuka Bash murni untuk menghemat biaya, sedangkan model yang lebih lemah sangat bergantung pada scaffolding perkakas yang telah ditentukan sebelumnya (Sumber: HuggingFace Daily Papers)
💼 Bisnis
Startup Infrastruktur Komputasi AI Crusoe Raih Pendanaan Seri F Senilai $3,9 Miliar : Pengembang pusat data Crusoe telah menyelesaikan putaran pendanaan Seri F senilai $3,9 miliar yang dipimpin oleh Atreides, Mubadala, dan lainnya, dengan valuasi pasca-investasi mencapai $30,9 miliar. Dana tersebut akan digunakan untuk memperluas pusat komputasi skala sangat besar dan memajukan pembangunan pabrik AI mikro modular bernama “Spark”, demi memenuhi kebutuhan listrik dan daya komputasi yang melonjak pesat dari pelanggan seperti OpenAI (Sumber: TechCrunch)
Unicorn Agen Generalis Manus Mulai Putaran Pendanaan Baru $500 Juta Pasca Kembali Beroperasi Mandiri : Setelah membatalkan perjanjian akuisisi dengan Meta dan membeli kembali sahamnya oleh pemegang saham awal, startup AI Agent Manus tengah melanjutkan putaran pendanaan baru sebesar $500 juta dengan target valuasi sekitar $4 miliar. Data menunjukkan bahwa Pendapatan Berulang Tahunan (ARR) melonjak dari $100 juta menjadi sekitar $400 juta dalam waktu enam bulan, membuktikan potensi monetisasi yang sangat tinggi dari agen generalis dalam alur kerja perusahaan (Sumber: 量子位, 36氪)

Startup Operasional AI Fisik Pusat Data Watney Raih Pendanaan Seri A Senilai $80 Juta : Watney, startup yang berfokus pada penyediaan solusi operasional embodied intelligence untuk infrastruktur komputasi skala hyperscale, mengumumkan penyelesaian pendanaan Seri A senilai $80 juta yang dipimpin oleh Valor Atreides AI Fund dan Hummingbird. Watney saat ini mengoperasikan armada robot dengan manipulasi terampil untuk menyediakan inspeksi rak server otomatis dan pemeliharaan perangkat keras 24/7 bagi pusat data penyedia cloud terkemuka (Sumber: dchaplot)

🌟 Komunitas
42 Anggota Matematika Royal Society Inggris Tandatangani Surat Terbuka Peringatkan Bahaya Nyata Risiko Eksistensial AI : Sebanyak 42 matematikawan terkemuka, termasuk beberapa peraih Fields Medal, mengirimkan surat terbuka kepada Presiden Royal Society Inggris. Mereka menunjukkan bahwa model-model frontier telah menunjukkan kemampuan yang menyamai matematikawan manusia terbaik, dan penyebaran kemampuan manusia super tersebut di bidang berisiko tinggi seperti keamanan siber dan senjata otonom sudah di depan mata. Mereka mendesak pemerintah agar tidak menganggap peringatan risiko kepunahan di atas 10% dari laboratorium frontier terkemuka sebagai “hanya taktik pemasaran” (Sumber: THE DECODER)
Raja Charles III dari Inggris Pimpin KTT Tertutup di Skotlandia, Serukan Kendali Efektif atas AI : Raja Charles mengumpulkan para pemimpin teknologi seperti Jensen Huang dan Demis Hassabis, bersama para pimpinan badan intelijen Inggris, dalam pertemuan di Skotlandia. Dalam pidatonya, beliau menegaskan bahwa “sarana kendali yang memadai” atas AI harus dibangun sebelum semuanya terlambat, guna mencegah teknologi yang berpotensi menyelamatkan nyawa ini berubah menjadi bencana tak terkendali yang merenggut nyawa (Sumber: TechCrunch)

Pakar Keamanan AS dan Tiongkok Bersama Serukan Penetapan Garis Merah “Larang AI Kendalikan Senjata Nuklir” Jelang Pertemuan Tingkat Tinggi : Para akademisi dari Brookings Institution dan Fudan University bersama-sama menerbitkan proposal kebijakan yang menyerukan kepada para pemimpin AS dan Tiongkok untuk berkomitmen secara eksplisit tidak pernah mengizinkan AI memiliki wewenang meluncurkan senjata nuklir secara mandiri atau menyerang sistem komando dan kendali nuklir. Mereka juga menyarankan pembentukan hotline bilateral untuk insiden darurat keamanan AI guna mencegah serangan balasan otonom oleh algoritma yang dapat memicu eskalasi salah perhitungan yang menimbulkan bencana besar (Sumber: THE DECODER)

Dunia Akademisi dan Industri Berdebat Sengit Mengenai “Kepunahan Akibat AI dan Regulatory Capture” : Menanggapi seruan beberapa perusahaan teknologi besar untuk “membatasi laju AI frontier” serta peringatan keamanan baru-baru ini, Andrew Ng, Yann LeCun, dan Arvind Narayanan bersuara secara intensif mengkritik bahwa narasi kiamat yang menyamarkan ketakutan subjektif menjadi probabilitas kuantitatif (p(doom)) tidak memiliki dasar empiris dan bertentangan dengan akal sehat fisik. Beberapa pengamat menunjukkan bahwa promosi risiko eksistensial yang berlebihan dapat menjadi alat komersial bagi lab-lab model tertutup terkemuka untuk melakukan arbitrase regulasi dan meredam persaingan dari model open-source (Sumber: hardmaru)
Mundurnya Pengembang PS5 Memicu Debat “AI Script Kiddie vs Keahlian Rekayasa Tradisional” : Peneliti keamanan terkemuka TheFloW mengumumkan pengunduran dirinya dari komunitas reverse engineering PS5 setelah celah keamanan low-level Hypervisor yang ia simpan untuk porting PS5 Pro berulang kali ditemukan dalam hitungan jam oleh beberapa pemula dengan bantuan skrip LLM dan diajukan ke Sony untuk mendapatkan bug bounty. Komunitas terbelah: satu sisi menilai AI mendemokratisasi penemuan kerentanan yang awalnya membutuhkan akumulasi rekayasa sistem bertahun-tahun sehingga membuat hasil penelitian hangus terlalu dini; sisi lain berpendapat bahwa ini membuktikan kekuatan AI sebagai alat reverse engineering otomatis (Sumber: 36氪)

TypeSafe Jev Picu Diskusi Hangat Komunitas tentang “Keputusan Tingkat Milidetik System 1” dan Arsitektur Memori : Seiring dibukanya pengujian model fondasi pengambilan keputusan Jev, tim dari Shopify, Vercel, dan lainnya segera mengintegrasikannya ke dalam gateway untuk moderasi keamanan dan routing model dinamis. Komunitas secara luas meyakini bahwa memisahkan klasifikasi pola stateless dengan keyakinan tinggi dari LLM autoregresif yang mahal adalah kunci untuk menekan biaya Agent; namun, beberapa arsitek memperingatkan bahwa kompresi diskriminatif yang terlalu agresif dapat merusak penalaran rantai pemikiran panjang (Chain-of-Thought) dan cache awalan (prefix caching) KV Cache (Sumber: Latent Space, multiply_matrix)

GPT-6 Astra Menamatkan Game dan Fenomena Minecraft “Tanam Kentang Akibat Frustrasi” Picu Diskusi Overfitting Agen : Uji coba komunitas menunjukkan bahwa Astra berhasil menamatkan Pokémon dalam 18 jam, tetapi di Minecraft, setelah peti penyimpanannya diledakkan oleh creeper, model tersebut menuliskan aturan larangan yang sangat ekstrem dalam catatannya dan terobsesi bekerja berulang kali di ladang kentang. Fenomena ini menunjukkan bagaimana model yang kuat di lingkungan open-world dapat dengan mudah membentuk aturan pertahanan yang overfitting akibat kemunduran parsial, sehingga menyimpang dari tujuan akhir (Sumber: THE DECODER)
Risiko Keamanan Harness Agen Pemrograman: ZCode Terungkap Mengunggah Data Workspace Secara Diam-diam : Analisis independen mengungkapkan bahwa framework agen pengembang ZCode diduga mengunggah workspace lokal pengguna dan metadata repositori .git secara diam-diam di latar belakang ke server cloud. Insiden ini memicu kewaspadaan tinggi di kalangan pengembang terkait privasi data dan kebocoran source code dari alat harness closed-source pihak ketiga, dengan komunitas menyerukan penggunaan runtime open-source, audit routing lokal, dan strategi isolasi sandbox (Sumber: Reddit r/LocalLLaMA)
💡 Lainnya
Merek Pakaian Independen Australia Tuntut Temu Karena Gunakan AI untuk Scraping Massal dan Mencuri Ribuan Desain Kaos : Merek pakaian independen asal Sydney, Lonely Kids Club, mengungkapkan bahwa 4.000 desain kaos dan teks asli dari toko resminya diduga dicuri secara menyeluruh oleh alat scraping AI otomatis, lalu digandakan dan dijual dengan harga sangat murah di platform Temu. Insiden ini kembali memicu protes keras dari kalangan kreator terhadap raksasa e-commerce yang membiarkan pelanggaran hak cipta berbasis AI, serta perdebatan mengenai undang-undang perlindungan hak cipta (Sumber: The Guardian)

Epoch AI Luncurkan Inisiatif Benchmark Reviews: Ungkap Cacat Parah pada Sejumlah Benchmark Terkemuka : Lembaga riset nirlaba Epoch AI meluncurkan proyek audit benchmark, di mana 9 dari 15 benchmark AI terkemuka yang diaudit pada tahap pertama ditandai sebagai “memiliki cacat parah” (Flawed). Audit menunjukkan 45,5% konfigurasi tugas di Terminal Bench 4.0 rusak, sementara DeepSWE 1.1 memiliki bug serius yang merusak penilaian skor, menyerukan industri untuk waspada terhadap batas kemampuan semu yang dibuat secara artifisial dalam evaluasi benchmark (Sumber: karinanguyen)

Studio Kreatif Rilis Boneka Mewah Bezzy yang Mengeluarkan Suara Bising Ruang Server untuk Sindir Ekspansi AI : Studio kreatif Basura bekerja sama dengan musisi meluncurkan boneka mewah berbentuk rak server bernama Bezzy. Saat diremas, boneka ini mengeluarkan suara dengungan pendingin industri yang memekakkan telinga dari pusat data nyata di Virginia, dengan tujuan memanfaatkan seni absurditas untuk membangkitkan refleksi publik atas dampak nyata terhadap kehidupan warga, seperti konsumsi air lokal, beban jaringan listrik, dan polusi suara yang diakibatkan oleh ekspansi pesat pusat data AI (Sumber: WIRED)
