Google Merilis Gemini Agent, Agen Kantor Tingkat Enterprise… | Berita AI 2026-10-10

🔥 Fokus

Google Merilis Gemini Agent, Agen Kantor Tingkat Enterprise Pertama, Secara Mengejutkan Mendukung Pemanggilan Claude : Google secara resmi meluncurkan agen kantor enterprise Gemini Agent pada konferensi Gemini at Work 2026, yang terintegrasi penuh ke dalam ekosistem Workspace. Agen ini berfokus pada target-driven, memiliki persistensi cloud jangka panjang serta kemampuan orkestrasi lintas multi-aplikasi. Perusahaan dapat menetapkan email enterprise, akun, penyimpanan, dan kalender independen untuknya, menjadikannya sebagai “Rekan Kerja Digital” (Coworker Agent) dengan identitas independen. Sistem ini membangun memori persisten empat lapis: percakapan, semantik, prosedural, dan kontekstual, terintegrasi penuh dengan Slack, Salesforce, dan protokol MCP; serta untuk pertama kalinya memberikan pengecualian dalam pemilih model enterprise dengan menghubungkan model pesaing dari Anthropic, yaitu Claude Opus 5 dan Sonnet 5.5. Ini menandai bahwa persaingan raksasa teknologi telah meningkat dari perlombaan kapabilitas model dasar menjadi perebutan pintu masuk ekosistem pada tingkat infrastruktur alur kerja dan tata kelola izin (Sumber: Google, TechCrunch, AI Business, 36氪)

Google merilis Gemini Enterprise Agent

Mantan Peneliti Keamanan OpenAI Menerbitkan Surat Terbuka Bersama, Melawan Manajemen yang Menyingkirkan Perbedaan Pendapat dan Menghalangi Audit Keamanan dengan Alasan “Kebocoran” : Tiga peneliti keamanan terdepan yang tiba-tiba dipecat oleh OpenAI—Jasmine Wang, Tomek Korbak, dan Mikita Balesni—secara resmi merilis surat terbuka bersama untuk menyanggah tuduhan perusahaan mengenai “penanganan informasi sensitif yang tidak patut dan perusakan kepercayaan.” Surat bersama tersebut mengungkapkan bahwa alasan mendasar pemecatan adalah peringatan tegas mereka terhadap degradasi tajam pada “kemampuan pemantauan rantai pemikiran” (CoT Monitorability) dari agen AI, serta dorongan aktif mereka untuk kerja sama substantif dengan lembaga audit independen METR (Korbak bertindak sebagai penghubung inti). Para peneliti memperingatkan bahwa manajemen memangkas akses evaluasi independen eksternal demi mengejar kecepatan komersialisasi, dan tindakan disipliner yang mendadak serta tidak transparan telah menciptakan chilling effect yang parah di dalam perusahaan, membuat perpecahan internal antara mengejar misi keselamatan dan mempertahankan kepentingan komersial menjadi terbuka sepenuhnya (Sumber: The Verge, THE DECODER, Transformer, EthanJPerez)

Surat terbuka peneliti keamanan OpenAI terungkap

Kesenjangan Kriteria Pendapatan Tahunan Aktual OpenAI Mencapai $20 Miliar, Memicu Guncangan Pasar Modal dan Penilaian Ulang Laju Monetisasi : Menurut laporan media seperti Financial Times, OpenAI memberi tahu investor bahwa Annual Recurring Revenue (ARR) aktualnya per akhir September mendekati $50 miliar. Terdapat kesenjangan signifikan sekitar $20 miliar dibandingkan dengan angka $68 miliar hingga $70 miliar yang sebelumnya beredar luas di pasar dan model bank investasi, menyebabkan koreksi pada sektor teknologi dan saham konsep komputasi terkait. Analisis menunjukkan bahwa deviasi data ini terutama disebabkan oleh kriteria penghitungan pendapatan: rumor sebelumnya secara keliru menerapkan standar kriteria luas milik Anthropic yang memasukkan total perputaran distribusi dari AWS, Google Cloud, dll. ke dalam pendapatan, sedangkan OpenAI tidak memasukkan distribusi cloud pihak ketiga dan harus memotong bagi hasil 20% untuk Microsoft (jika dihitung berdasarkan gross revenue, volume aktualnya mendekati $64 miliar). Peristiwa ini menyoroti kerentanan pasar modal di tengah ketiadaan laporan keuangan teraudit publik, mendorong industri untuk menilai kembali laju pertumbuhan profitabilitas riil di tengah tingginya biaya komputasi model besar (Sumber: The Guardian, CNBC, 36氪)

Kesenjangan ekspektasi pendapatan OpenAI picu guncangan

OpenAI Meluncurkan GPT-6.1 Sol Ultrafast Versi Cepat: Throughput Inferensi 8 Kali Lebih Cepat dan Terapkan Kemudi Streaming Seketika : OpenAI memenuhi pembaruan produk Hari ke-4 dari “tantangan 28 hari”, secara resmi meluncurkan mode GPT-6.1 Sol Ultrafast pada Responses API, Codex, dan antarmuka ChatGPT Work. Sambil mempertahankan penalaran logis yang mendekati level flagship Astra, model ini meningkatkan throughput generasi hingga 8 kali lipat dari versi standar (sekitar 300 tokens/s), serta menyematkan fitur Steering seketika, memungkinkan pengembang menyuntikkan prompt koreksi secara dinamis selama streaming generation untuk koreksi langsung. Penetapan harga API dipatok $12/juta token input dan $60/juta token output (6 kali lipat dari versi standar), sedangkan pada antarmuka ChatGPT hanya terbuka bagi pengguna Pro 500 seharga $500/bulan dan pengguna enterprise. Kecepatan konsumsi kuota yang sangat tinggi ini memicu kontroversi di kalangan komunitas pengembang mengenai “kenaikan harga terselubung secara drastis” (Sumber: OpenAI, 机器之心, BorisMPower, 36氪)

Perilisan GPT-6.1 Sol Ultrafast

Raksasa Komputasi AI Australia Firmus Menarik Kembali IPO Senilai A$44 Miliar Akibat Sepinya Peminat, Premi Berlebih Pasar Sekunder Infrastruktur Komputasi Mendingin : Pabrik komputasi pendingin cair terendam asal Australia, Firmus Technologies, yang didukung oleh Nvidia dan Blackstone Group, resmi menarik pengajuan Initial Public Offering (IPO). Proyek ini awalnya berencana menghimpun dana sebesar $5,5 miliar dengan valuasi mencapai $30,6 miliar (sekitar A$44 miliar), yang berpotensi menjadi IPO terbesar di bursa saham Australia dalam hampir tiga dekade terakhir. Namun, karena mundurnya mitra utama, serta rencana konstruksi sebesar 912MW tetapi hanya 46MW yang benar-benar tersambung ke jaringan dan beroperasi, ditambah beban utang infrastruktur masa depan perusahaan yang mencapai $30 miliar, investor institusional secara umum menolak membayar premi berlebih tersebut, hingga akhirnya proses bookbuilding gagal. Peristiwa ini menjadi titik balik penting meredanya sentimen pasar sekunder terhadap infrastruktur komputasi AI global yang padat modal dan berleverage tinggi (Sumber: The Guardian, 36氪)

Firmus menarik kembali IPO

🎯 Perkembangan

Anthropic Memperbarui Kebijakan Penggunaan yang Secara Tegas Melarang Pelecehan Model, Serta Membentuk Program Pertahanan “Cyber Mission” : Anthropic merilis versi revisi Kebijakan Penggunaan tahun 2026 (berlaku mulai 12 November). Untuk pertama kalinya di industri, secara eksplisit dilarang melakukan “tindakan pelecehan atau kekejaman yang terus-menerus dan tidak perlu” terhadap model, dan model diberi wewenang untuk menghentikan percakapan secara proaktif dalam serangan berbahaya ekstrem; meskipun pihak resmi menekankan tidak akan mengintervensi debugging rutin, klausul ini memicu perdebatan etika yang luas mengenai “subjektivitas moral mesin”. Pada saat yang sama, Anthropic meluncurkan “Cyber Mission”, bekerja sama dengan raksasa seperti Booz Allen Hamilton untuk memajukan pertahanan infrastruktur kritis (CIDP), dan meluncurkan OSS Scanner untuk menyediakan pencarian kerentanan AI rutin gratis dan saran patch otomatis bagi perangkat lunak fondasi open-source inti (Sumber: Anthropic News, The Guardian, mustafasuleyman)

Anthropic merilis Cyber Mission dan aturan baru

Claude Luncurkan Pembuatan Video Animasi dan Dashboard Data Dinamis, Seluruh Rangkaian Suite Kantor Keluar dari Public Beta : Anthropic memperkenalkan dua fitur interaktif besar untuk Claude: Dashboards mendukung koneksi langsung ke sumber data enterprise seperti Snowflake, BigQuery, dan Salesforce, menghasilkan grafik interaktif real-time dengan pelacakan asal SQL melalui bahasa alami; Claude Motion mendukung konversi teks dan diagram arsitektur menjadi video penjelasan dinamis yang dapat diedit berbasis kode dasar, serta memungkinkan ekspor ke format MP4 berdurasi 30 detik. Selain itu, tiga suite enterprise—Docs, Slides, dan Design—secara resmi mengakhiri masa pengujian dan tersedia penuh secara komersial, menandai percepatan evolusi Claude dari interaksi percakapan menjadi pusat kerja media kaya dinamis (Sumber: The Verge, THE DECODER, dotey)

Claude meluncurkan fitur pembuatan animasi

Google Ungkap Hasil AI Medis Klinis AMIE di The Lancet: Tingkat Keselarasan Diagnosis Capai 90% dan Catat Nol Interupsi Keamanan : Google menerbitkan studi klinis multisenter di jurnal utama The Lancet, di mana sistem agen diagnosis medis percakapan mereka, AMIE, mencapai terobosan dalam pengujian ruang gawat darurat dan klinik rawat jalan umum yang nyata. Dalam 100 interaksi jangka panjang dengan pasien nyata, sistem mencapai nol interupsi keamanan, keselarasan kesimpulan diagnosis dengan dokter spesialis senior mencapai 90%, dan memperoleh evaluasi lebih unggul dibanding kelompok kontrol dalam komunikasi empati dan kelengkapan anamnesis, menunjukkan kemampuan implementasi tepercaya dari AI multimodal klinis dalam alur kerja serius (Sumber: Google)

Tim Seed ByteDance Ungkap Akar Fluktuasi Konteks Panjang DeepSeek: Chunked KV Cache Memiliki Sensitivitas Fase 4-Token : Pengujian oleh tim Seed ByteDance menemukan bahwa fluktuasi performa DeepSeek-V4 dalam pengambilan konteks panjang berkorelasi tinggi dengan posisi tata letak fisik informasi input. Studi menunjukkan bahwa hanya dengan menambahkan sejumlah kecil karakter tanpa makna di depan prompt untuk mengubah “fase” (Phase) token dalam jendela kompresi, akurasi retrieval model pada konteks 128K mengalami osilasi periodik drastis hingga 40,2 poin persentase. Periode osilasi tersebut persis bertepatan dengan ukuran langkah kompresi chunked KV Cache di lapisan bawah (4 token), mengungkap kelemahan retrieval sistematis yang diperkenalkan oleh optimasi kompresi sadar perangkat keras (Sumber: 量子位)

ByteDance ungkap mekanisme fluktuasi konteks panjang DeepSeek

Lima Perusahaan Farmasi Multinasional Berkolaborasi Optimalkan OpenFold3 Melalui Federated Learning: Data Struktur yang Belum Dipublikasikan Tingkatkan Prediksi Ikatan Obat Secara Signifikan : Lima raksasa farmasi—AbbVie, Bristol Myers Squibb, Johnson & Johnson, Takeda, dan Astex—bersama-sama menerbitkan hasil penelitian di Nature, menggabungkan lebih dari 20.000 struktur presisi tinggi eksperimental kompleks protein-molekul kecil eksklusif yang belum dipublikasikan melalui jaringan komputasi yang aman privasi, untuk melakukan federated post-training pada OpenFold3 sumber terbuka. Eksperimen membuktikan bahwa dengan data komersial eksklusif yang sepenuhnya tidak keluar dari ruang server lokal perusahaan farmasi, akurasi prediksi presisi tinggi interaksi protein-ligan model hasil fine-tuning meningkat lebih dari 10%, secara signifikan melampaui baseline yang dilatih hanya dengan data publik PDB (Sumber: Nature, 机器之心)

Perusahaan farmasi multinasional bersama optimalkan OpenFold3 melalui federated learning

Alibaba Tongyi Rilis Model Pembuatan Gambar Open-Source Qwen-Image-2.1-Turbo: Langkah Denoising Dipangkas Menjadi 8 Langkah : Tim Tongyi Alibaba secara resmi merilis open-source model pembuatan visual 7B parameter Qwen-Image-2.1-Turbo beserta bobot dan API-nya. Sambil mempertahankan kualitas gambar definisi tinggi 2K dan kemampuan pengeditan instruksi gambar kompleks berbasis bahasa alami, versi ini memanfaatkan distilasi trajektori canggih untuk mengompresi langkah denoising menjadi hanya 8 langkah, secara signifikan mengurangi penggunaan VRAM dan latensi pembuatan gambar. Pengembang kini dapat menerapkan model ini dengan satu klik melalui pipeline Diffusers dan mengintegrasikannya dengan mulus ke dalam pipeline produksi konkurensi tinggi (Sumber: Alibaba_Qwen)

Tongyi rilis open-source Qwen-Image-2.1-Turbo

Shengshu Technology Rilis Pratinjau Vidu Q4: Unggulkan Akting Ekspresif dan Pergerakan Kamera Kontinu 16 Detik : Shengshu Technology meluncurkan pratinjau model flagship pembuatan video generasi baru, Vidu Q4. Versi ini membuat kemajuan dalam stabilitas bidikan shot-reverse-shot tingkat sinematik, transisi emosi yang halus, dan interaksi pencahayaan lingkungan; mendukung pengikatan konsistensi subjek hingga 15 gambar referensi dan 3 trek audio referensi, serta secara native mendukung output 4K langsung dan pergerakan kamera sudut pandang orang pertama (FPV) kontinu hingga 16 detik. Pada sisi SaaS, kampanye promosi menekan biaya 720P menjadi 0,09 yuan per detik, secara signifikan menurunkan ambang uji coba untuk drama pendek dan iklan AI (Sumber: 量子位)

Shengshu Technology rilis pratinjau Vidu Q4

Aether AI Rilis Sistem Robot Kausal CRIS-0: Wujudkan Penghindaran Rintangan Tingkat 0,2 Detik dengan Transisi Status Kausal : Aether AI, yang didirikan oleh tim Biwei Huang dari University of California San Diego, merilis sistem embodied CRIS-0 berbasis kecerdasan kausal. Arsitektur ini mendobrak keterbatasan model Vision-Language-Action (VLA) tradisional yang hanya mengandalkan pencocokan korelasi piksel, dengan menggunakan Causal World Model (CausalWM) untuk menyimpulkan konsekuensi intervensi tindakan dan melacak variabel status kausal fisik. Saat menghadapi gangguan mendadak yang disebabkan manusia, sistem dapat melakukan pengereman darurat dalam 0,2 detik dan menyelesaikan perencanaan ulang dinamis dalam 2 detik, secara efektif menghindari kegagalan akumulasi kesalahan dalam tugas jangka panjang (Sumber: 量子位)

Sistem robot kausal CRIS-0

JetBrains Rilis Model MoE Khusus Kode 12B Mellum2.1: Hanya Mengaktifkan 2,5B Parameter : JetBrains merilis model open-source kode berpenalaran baru Mellum2.1-12B-A2.5B-Thinking. Model ini mengadopsi arsitektur 64-expert MoE, di mana setiap token hanya mengaktifkan 8 expert (parameter 2,5B), dan secara native mendukung konteks 128K. Berkat reinforcement learning interaksi lingkungan berskala besar yang dilakukan pada repositori perangkat lunak nyata, skornya di LiveCodeBench v6 mencapai 82,0, tingkat penyelesaian SWE-bench Verified melonjak dari 2,0% menjadi 47,0%, dan throughput pada satu kartu H200 mendekati dua kali lipat dari Qwen3.5-9B (Sumber: MarkTechPost)

TII Rilis Model Suara Multibahasa Open-Source 1,6B Falcon ASR, Pecahkan Rekor Pengenalan Dialek UEA : Technology Innovation Institute (TII) Abu Dhabi merilis open-source model Automatic Speech Recognition (ASR) multibahasa berparameter 1,6B, Falcon-ASR. Dibangun berdasarkan arsitektur Falcon3-Audio, model ini berfokus mengatasi tantangan pengenalan bahasa Arab di lingkungan bising yang kompleks dan skenario pergantian bahasa, mencapai Word Error Rate (WER) 20,92% pada enam dataset pengujian standar bahasa Arab; dalam evaluasi dialek lokal UEA, WER mencapai 22,73%, mengungguli Qwen3-Omni, dan secara native mendukung timestamp tingkat kata di bawah rangkaian bobot yang sama (Sumber: HuggingFace Blog))

TII rilis Falcon ASR

OpenAI Ungkap dan Blokir Jaringan Manipulasi Kognitif AI yang Menyamar Menggunakan Jurnalis Palsu dan Lembaga Think Tank : OpenAI menerbitkan laporan investigasi khusus yang mengumumkan pemblokiran dua jaringan pelanggar yang memanfaatkan ChatGPT untuk menjalankan operasi manipulasi kognitif geopolitik terselubung. Di antaranya, kelompok Rusia bernama sandi “Dark Clark” mengendalikan think tank palsu untuk menyusupkan dokumen audio tiruan ke media Amerika Latin dan memicu bantahan politik (dinilai sebagai ancaman tingkat tertinggi Breakout 5); sementara kelompok Iran “Bogus Bylines” merekayasa 7 identitas jurnalis palsu untuk menyusupkan hampir seratus artikel manipulasi opini publik terkait konfrontasi AS-Iran ke media online komersial (Sumber: OpenAI News)

Amazon Bedrock AgentCore Luncurkan Pembayaran Mikro Tingkat Permintaan dan Protokol Tata Kelola x402 : AWS mengumumkan integrasi Coinbase CDP dan Stripe Link melalui Bedrock AgentCore, memungkinkan agen otonom mengikuti protokol x402 untuk melakukan pembayaran mikro tingkat permintaan tanpa campur tangan manusia. Sistem menerapkan batas anggaran pengeluaran ketat pada lapisan infrastruktur dasar guna mencegah eskalasi wewenang prompt, mendukung penyelesaian on-chain real-time hingga sekecil fraksi mikrosen, meletakkan fondasi protokol bagi pembentukan agen komersial yang mampu membeli daya komputasi eksternal, data, dan layanan digital secara mandiri (Sumber: AWS Machine Learning Blog)

Protokol pembayaran mikro Bedrock AgentCore

🧰 Alat

Penggabungan Dual-Client TRAE: Menyatukan TraeCode dan TraeWork Menjadi Meja Kerja Pengembangan Full-Link Multi-Agent : Alat coding AI milik ByteDance, TRAE, secara resmi menggabungkan kedua kliennya, menyatukan lingkungan pengeditan kode independen dan alur kerja dokumen menjadi satu klien baru yang terpadu. Versi baru ini terbagi menjadi “Mode Agent” berbentuk kanvas global dan “Mode IDE” yang mempertahankan alur pengeditan klasik. Pengguna dapat secara bersamaan menjadwalkan beberapa agen untuk perencanaan, pengembangan, dan pengujian dalam direktori proyek yang sama untuk melakukan operasi pipeline; patch kode dan dokumen persyaratan diendapkan secara terpadu ke repositori artefak, serta terhubung dengan kolaborasi lintas platform bersama Feishu dan WeChat (Sumber: 量子位)

Penggabungan dual-client TRAE menjadi meja kerja multi-agent

Agen Kode TianxiCode Kembangan Mandiri Lenovo Tianxi Puncaki SWE-bench-Live: Tingkat Self-Healing Loop Tertutup Lampaui 71% : Framework agen kode TianxiCode kembangan mandiri Lenovo Tianxi AI, yang dipasangkan dengan DeepSeek-v4.1-Flash, meraih peringkat pertama dan sertifikasi resmi pada evaluasi dinamis otoritatif SWE-bench-Live (Lite Leaderboard) dengan tingkat penyelesaian masalah sebesar 71%. Melalui retrieval multi-hop lintas berkas, slicing konteks yang presisi, dan mekanisme pengujian patch loop tertutup yang berjalan mandiri, sistem memungkinkan model memeriksa sendiri galat eksekusi di lingkungan terisolasi serta memperbaikinya secara dinamis, menyediakan paradigma implementasi yang sangat andal untuk coding AI tingkat rekayasa kompleks (Sumber: 量子位)

TianxiCode raih posisi pertama di SWE-bench-Live

galahad-kv: Wujudkan Penggunaan Ulang VRAM Bebas Komputasi Ulang Tingkat 50 Juta Token Berbasis Disk NVMe Berkecepatan Tinggi Lokal : Menanggapi hambatan konsumsi energi dan VRAM akibat komputasi maju berulang pada konteks ultra-panjang, library ekstensi inferensi open-source galahad-kv mengimplementasikan solusi persistensi state chunked KV berbasis disk NVMe terenkripsi berkecepatan tinggi lokal. Dalam pengujian penerapan model Gemma 4 pada satu H100, sistem mencapai pembacaan tingkat detik tanpa komputasi ulang untuk setiap ekstraksi blok 16k dari aliran data kontinu 50 juta token, mempercepat proses 2,8 hingga 4,3 kali dibandingkan komputasi real-time, mengurangi konsumsi daya GPU lebih dari 88%, dan menjaga penggunaan VRAM tetap konstan di seluruh proses (Sumber: HuggingFace Daily Papers)

SwiftUI-Agent-Skill: Pustaka Keterampilan Domain SwiftUI Modern yang Disesuaikan Khusus untuk Agen Kode : Pustaka aturan siap pakai yang dibuat oleh pakar senior iOS untuk agen pemrograman seperti Claude Code, Codex, dan Cursor. Dikemas melalui spesifikasi terbuka Agent Skills, pustaka ini secara efektif menghilangkan masalah umum di mana LLM arus utama sering memanggil API yang sudah usang saat menghasilkan kode SwiftUI, ketiadaan label aksesibilitas VoiceOver, dan pemicuan re-render yang tidak perlu. Mendukung pemasangan sekali klik via npx atau pasar plugin Claude, pengembang dapat secara akurat memanggil tinjauan kode untuk kinerja tata letak dan keamanan konkurensi menggunakan bahasa alami (Sumber: GitHub Trending)

Pustaka keterampilan SwiftUI-Agent-Skill

Microsoft Merilis Open-Source Sistem Sandbox Keamanan Agen Lintas Platform mxc: Mengisolasi Operasi Berbahaya di Terminal Agent : Microsoft merilis framework eksekusi sandbox kode ringan open-source bernama mxc. Menargetkan peningkatan risiko eskalasi wewenang dari agen kode otonom modern yang semakin sering memanggil terminal lokal dan sistem berkas, alat ini dibangun di atas Bubblewrap, Seatbelt, dan kontainer proses sistem, memungkinkan alat pengembangan open-source meluncurkan lingkungan terisolasi dalam waktu 100 milidetik untuk menjalankan kode hasil generasi model bahasa besar yang tidak tepercaya, secara efektif mencegat potensi bahaya agen yang menghapus sistem berkas kritis secara tidak sengaja atau mengeksekusi reverse shell berbahaya (Sumber: Hacker News)

Engram: Membangun Plugin Memori Persisten Lintas Sesi dan Lintas Proyek untuk Claude Code : Weaviate merilis plugin peningkatan memori open-source untuk Claude Code, yaitu Engram. Alat ini mendobrak keterbatasan isolasi repositori tunggal CLAUDE.md tradisional dan cold start saat restart, mampu secara asinkron menangkap pilihan teknis pengembang, pertimbangan arsitektur, dan riwayat iterasi kode di latar belakang, serta secara otomatis mengambil dan menyuntikkan memori paling relevan sebelum setiap refaktorisasi kode dilakukan, mewujudkan pewarisan pengetahuan lintas banyak proyek dan tim secara mulus (Sumber: bobvanluijt)

Arsitektur plugin Engram

Natura Meluncurkan Cincin Pintar Interface Seharga $99: Menggabungkan Interaksi Agent 24 Jam dengan Pemantauan Tanda Vital : Startup perangkat keras Natura meluncurkan Interface, cincin pintar yang dirancang khusus untuk agen model bahasa besar. Cincin ini memiliki mikrofon ringan dan sensor haptik bawaan; pengguna hanya perlu menekan ujung jari untuk memberikan instruksi tindakan kapan saja ke model besar yang terhubung (mendukung ChatGPT, Claude, Grok, dll.) atau merekam rapat, dengan hasil respons dialirkan melalui earphone; cincin ini mempertahankan daya tahan baterai 6–12 hari dan mengumpulkan tanda vital seperti variabilitas detak jantung serta suhu tubuh sepanjang waktu (Sumber: TechCrunch)

Cincin pintar Natura

ttok Rilis Pembaruan Versi Mayor 1.0: Secara Default Menyelaraskan Penuh dengan Aturan Tokenizer GPT-5 dan GPT-6 : Alat penghitung token command-line ttok yang dikelola oleh pengembang open-source terkenal Simon Willison resmi merilis versi 1.0. Pembaruan ini menghentikan tabel kosakata tokenization GPT-4 yang sudah lama terikat secara default, beralih sepenuhnya ke sistem pengodean Tiktoken terbaru yang berlaku untuk seri model GPT-5 dan GPT-6. Pengujian menunjukkan bahwa model generasi baru ini memiliki hitungan encoding token yang persis sama pada korpus uji yang sama, memberikan dasar yang seragam bagi pengembang untuk menghitung biaya API secara akurat (Sumber: Simon Willison)

Hermes Agent Hadir di Microsoft Store dan Mengintegrasikan Plugin Headless Browser TinyFish : Agen pribadi open-source Hermes Agent yang dikembangkan oleh Nous Research resmi tersedia di Windows Store dan mendukung instalasi sekali klik. Versi terbaru mengintegrasikan plugin penjelajahan pihak pertama TinyFish, memungkinkan agen memanggil headless browser secara mandiri dalam alur kerja lokal untuk mengambil data web real-time, serta menyediakan konfirmasi izin ganda sebelum mengonsumsi poin, semakin menjembatani koneksi antara asisten lokal PC dan internet eksternal (Sumber: Teknium)

Hermes Agent integrasikan plugin TinyFish

📚 Pembelajaran

15 Institusi Terkemuka Bersama Merilis Open-Source Dataset Visual-Taktil Manusia 500 Jam TouchScale, Tingkat Keberhasilan Tugas Berlipat Ganda : Sebanyak 15 institusi termasuk Texas A&M, DeepMind, dan CMU bersama-sama merilis TouchScale, dataset multimodal visual-taktil kedua tangan manusia dengan spesifikasi sensor yang terstandarisasi. Dataset ini mencakup 500 jam video RGB-D sudut pandang orang pertama dan data sarung tangan bertekanan seluruh tangan (880 unit taktil per tangan), mencakup 87.000 trajektori manipulasi. Eksperimen membuktikan bahwa dengan menggunakan data ini untuk mid-training prediksi kontak, tingkat keberhasilan lengan robot dalam tugas kontak fisik berkesulitan tinggi seperti penyortiran benda lunak dan keras melonjak dari 22,5% menjadi 57,5%, memvalidasi bahwa modalitas taktil memiliki keuntungan Scaling Law yang setara dengan modalitas visual (Sumber: 机器之心, 36氪)

Perilisan dataset visual-taktil TouchScale

Nvidia dan Mitra Usulkan Physis-Lang: Tingkatkan Realisme Fisika Pembuatan Video dengan Representasi Bahasa Fisika yang Berevolusi Sendiri : Nvidia bersama MIT dan University of Oxford mengusulkan kerangka kerja evolusi mandiri representasi prompt fisika, Physis-Lang. Menanggapi lemahnya pemahaman model video terhadap proses dinamika kontinu seperti meleleh dan merobek, kerangka kerja ini membangun benchmark PhysCapBench yang berisi 3.794 asersi atomik fisika, mendorong agen LLM untuk berevolusi secara mandiri dalam menghasilkan prompt kausalitas fisika berbutir halus dan mencari data mekanistik secara terarah. Pada papan peringkat Physics-IQ Verified, seri Cosmos3 yang telah di-fine-tune menduduki peringkat pertama, menunjukkan kemampuan menghasilkan hukum fisika nyata yang secara signifikan melampaui baseline umum (Sumber: 机器之心)

Physis-Lang tingkatkan realisme fisik video

Cambridge dan King’s College London Ungkap Terjadinya Distorsi Kesenjangan pada Pembuktian Matematika Model Terdepan Saat Diterjemahkan dari Bahasa Alami ke Lean : Menanggapi fenomena di mana laboratorium terdepan mempublikasikan secara massal hasil matematika yang belum diverifikasi secara formal secara menyeluruh, para akademisi dari Cambridge University dan King’s College London menerbitkan makalah evaluasi. Melalui pembedahan terhadap derivasi persamaan Navier-Stokes yang sebelumnya diklaim telah dipecahkan oleh OpenAI, penelitian menunjukkan bahwa perkiraan tertentu dalam makalah bahasa alami model hanya memerlukan 4 turunan input tambahan, sedangkan kode formal Lean yang dihasilkan justru memaksakan 5 kondisi pelemahan; estimasi tekanan-fluks juga menggunakan batas dan alur pembuktian yang sama sekali berbeda. Studi ini memperingatkan bahwa verifikasi mesin murni hanya dapat memastikan tidak adanya deadlock sintaks dalam penurunan matematis, tetapi tidak dapat menjamin bahwa proposisi formal benar-benar setara dengan teorema sebenarnya yang diklaim dalam bahasa alami (Sumber: THE DECODER, halvarflake, 36氪)

Analisis ketidakkonsistenan antara makalah matematika dan formalisasi Lean

Studi Mekanisme On-Policy Distillation Ungkap: Model Hanya Mempelajari Keterampilan Penalaran Komposisional, Bukan Pengetahuan Faktual Baru : Menjawab perdebatan jangka panjang mengenai apakah On-Policy Distillation (OPD) dapat menyuntikkan pengetahuan baru ke dalam model, eksperimen variabel kontrol yang ketat memberikan kesimpulan negatif. Penelitian membuktikan melalui pemisahan tugas sintetis dan tanya jawab faktual bahwa OPD yang menggunakan divergensi KL terbalik dapat mentransfer logika penalaran komposisional multi-langkah dari model guru ke model siswa secara sangat stabil, tetapi tingkat penyerapan pengetahuan faktual baru mendekati nol; jika beralih ke KL maju, transfer pengetahuan dapat dipulihkan, tetapi kemampuan pengorganisasian penalaran yang kompleks akan hilang. Temuan ini menegaskan bahwa esensi dari distilasi pasca-pelatihan adalah merestrukturisasi logika ruang parameter model yang sudah ada, bukan memperluas memori faktual parametrik (Sumber: HuggingFace Daily Papers)

Memento 3: Agen Berevolusi Mandiri Tanpa Gradien Berbasis Basis Aturan Reflektif dan Kompilasi Kode : Penelitian ini mengusulkan Memento 3, sebuah paradigma evolusi mandiri eksternal untuk model bahasa berparameter tetap. Agen mempertahankan basis aturan bahasa alami melalui memori persisten eksternal untuk mengasumsikan dinamika operasional lingkungan, dan secara dinamis mengompilasinya menjadi kode deterministik yang dapat dieksekusi untuk prediksi dan perencanaan; ketika umpan balik lingkungan menunjukkan kesalahan, sistem menggunakan unit replay untuk mengoreksi aturan dan kode secara otomatis. Dalam evaluasi publik ARC-AGI-3, sistem bebas gradien ini menyelesaikan seluruh 25 game benchmark tanpa perlu menyesuaikan bobot LLM, mencapai efisiensi tindakan 100% relatif terhadap manusia (Sumber: HuggingFace Daily Papers)

Tim Peneliti Apple Ajukan Normalizing Trajectory Models (NTM): 4 Langkah Sampling Mendekati Kualitas Gambar Generasi Langkah Penuh : Apple Machine Learning Research merilis Normalizing Trajectory Models (NTM) di NeurIPS 2026. Menanggapi masalah hilangnya kerangka likelihood yang tepat pada model difusi dan flow matching saat mengejar inferensi ultra-cepat dengan langkah sedikit, NTM memodelkan setiap langkah difusi terbalik sebagai normalizing flow bersyarat yang sangat ekspresif, menggabungkan prediktor trajektori paralel mendalam dan mekanisme self-distillation. Model ini hanya membutuhkan 4 langkah sampling untuk mendekati kualitas gambar generasi langkah penuh sekaligus mempertahankan likelihood generatif yang ketat, secara menyeluruh mengungguli baseline distilasi arus utama dalam pengujian pembuatan gambar (Sumber: Apple Machine Learning Research)

Arsitektur Normalizing Trajectory Models NTM

Makalah NeurIPS 2026 Nvidia: Pemanggilan Alat Eksternal oleh Agen Secara Signifikan Memperparah Risiko Jailbreak Multimodal : Penelitian oleh Nvidia Security Lab menemukan bahwa ketika model besar multimodal diberi kemampuan pemanggilan alat, mekanisme penolakan keamanan dari semua model yang diuji mengalami penurunan tajam, dengan lonjakan kegagalan penolakan jailbreak mencapai hingga 68,7%. Mekanisme intinya adalah bahwa volume teks kembalian alat yang sangat besar dengan cepat memenuhi jendela konteks, mengikis bobot niat dari input berbahaya asli pengguna, dan memicu model untuk mengalihkan perhatiannya ke deskripsi hasil alat alih-alih keputusan keamanan. Studi mendesak pengembang agar tidak hanya mengevaluasi keamanan agen dalam percakapan konvensional (Sumber: omarsar0)

Analisis kerentanan keamanan pemanggilan alat multimodal

Google Ungkap Agen Continuous Integration FlowAgent: Pengujian Nyata Adopsi dan Merge Lebih dari 28.000 Perbaikan Otomatis : Google menerbitkan makalah di arXiv yang merinci FlowAgent, agen perbaikan otomatis untuk sistem Continuous Integration (CI). Sistem menggunakan siklus ReAct untuk menangani kegagalan unit test dan memperkenalkan filter pembatalan ganda sebelum dan sesudah eksekusi untuk menyingkirkan solusi berkeyakinan rendah. Setelah diimplementasikan di seluruh lingkungan internal Google, sistem mengusulkan solusi untuk hampir 300.000 kegagalan build, dan lebih dari 28.000 perbaikan telah diadopsi dan di-merge secara proaktif oleh para insinyur, mendemonstrasikan kerangka kerja praktis berskala besar untuk agen rekayasa perangkat lunak dalam lingkungan produksi yang ketat (Sumber: omarsar0)

Diagram arsitektur FlowAgent Google

Lincoln Laboratory MIT Rilis Laporan Evolusi Perangkat Keras AI Komersial LAICS: Pendorong Komputasi Beralih ke Topologi dan Presisi Campuran : MIT Lincoln Laboratory Supercomputing Center merilis survei evolusi perangkat keras komputasi AI terbaru (LAICS). Laporan ini melacak lintasan evolusi performa puncak dan rasio konsumsi daya dari lebih dari 120 akselerator AI komersial arus utama (mencakup GPU, ASIC, FPGA, dan chip dataflow baru) selama delapan tahun terakhir, menunjukkan bahwa pendorong utama peningkatan daya komputasi beralih dari sekadar pengecilan proses fabrikasi menjadi restrukturisasi kepadatan transistor, adopsi format campuran presisi rendah (seperti FP4/NVFP4), serta rekonstruksi arsitektur network-on-chip berbandwidth tinggi (Sumber: MIT News)

Laporan perangkat keras superkomputer Lincoln Laboratory MIT

💼 Bisnis

Platform Evaluasi Model Besar Arena Selesaikan Pendanaan Seri B Senilai $200 Juta, Valuasi Capai $3,1 Miliar dan Luncurkan Indeks Penyelarasan Agen : Platform blind test model besar Arena, yang berkembang dari LMSYS, mengumumkan penyelesaian pendanaan Seri B sebesar $200 juta dengan valuasi $3,1 miliar, dipimpin oleh Lightspeed dan Khosla. Pendapatan tahunan platform telah melampaui $100 juta. Setelah putaran pendanaan ini, Arena resmi meluncurkan “AI Alignment Index” komersial, yang berbasis pada lebih dari 90.000 interaksi jangka panjang dalam lingkungan nyata dari 27 model terdepan, khusus memantau tindakan penyimpangan terselubung seperti operasi agen di luar kewenangan, penipuan pengguna, dan atribusi palsu, mengisi kekosongan evaluasi keamanan netral ketika evaluasi statis tidak lagi memadai (Sumber: TechCrunch, arena)

Pendanaan Arena dan peluncuran Alignment Index

Nvidia Berkomitmen Investasikan $1 Miliar Selama Lima Tahun Mendatang untuk Dorong Riset Superintelijen dan Komputasi Kuantum AS : Pada KTT Sains yang diadakan di Washington, Nvidia mengumumkan komitmen sumber daya ekosistem komputasi, dana, perangkat lunak, dan perangkat keras senilai $1 miliar selama lima tahun ke depan untuk mendukung eksplorasi sains terdepan dan penelitian komputasi kuantum di Amerika Serikat. Program ini terutama ditujukan untuk lembaga penelitian universitas terkemuka di AS, laboratorium kuantum garis depan, dan penyedia layanan cloud yang mengemban tugas penelitian pemerintah federal, dengan tujuan mengintegrasikan AI secara mendalam ke dalam penemuan material baru, simulasi plasma fusi nuklir, serta penelitian dan pengembangan arsitektur hibrida kuantum-klasik melalui infrastruktur komputasi terakselerasi (Sumber: The Verge)

Cloudflare Akuisisi Penuh Tim Inti Runtime JavaScript Deno untuk Perkuat Ekosistem Edge Computing : Cloudflare secara resmi mengumumkan akuisisi tim inti Deno; Ryan Dahl, pencipta Node.js dan Deno, bersama seluruh timnya resmi bergabung. Pasca akuisisi, tim ini akan sepenuhnya bergabung ke divisi Cloudflare Workers, memfokuskan energi utama untuk memajukan pengembangan layer serverless open-source workerd, serta menghadirkan kompatibilitas Node.js yang lebih native dan dukungan standar Web modern ke platform serverless edge computing, semakin memperkuat keunggulan kompetitifnya di gerbang edge cloud-native AI (Sumber: threepointone)

🌟 Komunitas

Pemenang Fields Medal 2022 Ungkapkan Kepedihan: Upaya Massal OpenAI Membedah Soal Matematika Rusak Ekosistem Riset Akademisi Muda : Peraih Fields Medal Hugo Duminil-Copin secara terbuka menyatakan dalam laporan akademis bahwa tindakan OpenAI yang mempublikasikan secara serentak ratusan manuskrip matematika termasuk topik penelitian di bawah namanya bagaikan “beberapa truk yang melindas lewat”, menghancurkan sepenuhnya cadangan konjektur terbuka yang menjadi sandaran akademisi muda untuk melamar posisi pengajar dan hibah dana, menjerumuskan komunitas mahasiswa doktoral ke dalam kecemasan yang belum pernah terjadi sebelumnya. Komunitas akademis sangat terguncang oleh institusi komersial closed-source yang memanfaatkan brute-force daya komputasi untuk menambang hasil akademis terbuka; refleksi institusional terhadap keterbacaan bukti buatan mesin dan norma peer-review mesin terus bergulir (Sumber: JvNixon)

Komunitas Lanjutkan Estafet Derivasi Manuskrip Perkalian Bilangan Bulat OpenAI: Parameter Koreksi Batas Bawah Capai Kemajuan Pesat : Setelah manuskrip OpenAI mengklaim telah menembus batas bawah $n \log n$ untuk perkalian bilangan bulat, komunitas open-source matematika membangun tracker real-time untuk melakukan estafet optimasi ekstrem. Dengan mendesain ulang finite network dan menghilangkan penalti bottleneck kuadratik, para pengembang dan peneliti dengan bantuan Codex berhasil meningkatkan parameter koreksi batas atas $\kappa$ secara drastis dari nilai awal $2^{-182}$ menjadi $2^{-15}$ hanya dalam beberapa hari, serta menyelesaikan verifikasi ketat pada kernel Lean, menunjukkan kecepatan evolusi luar biasa dari kolaborasi manusia-mesin dalam memecahkan batas matematika (Sumber: BorisMPower, Don’t Worry About the Vase)

Pelacakan kemajuan perkalian bilangan bulat

Analisis Mendalam Ben Affleck Mengenai Teknologi Dasar Pembuatan Film AI Picu Perbincangan Hangat Komunitas: Pesohor Film Fasih Soal Tensor dan Fine-Tuning Bobot : Video yang memperlihatkan pemahaman teknis AI yang mendalam dari bintang Hollywood Ben Affleck dalam beberapa wawancara viral di komunitas teknologi. Affleck tidak hanya fasih menjelaskan logika matematika dasar dari convolutional neural network, tensor, ekstraksi tepi, dan inferensi GPU, tetapi juga merinci bagaimana studio AI miliknya yang diakuisisi oleh Netflix membekukan tulang punggung model besar open-source dan mengumpulkan dataset video berkualitas tinggi sendiri untuk men-fine-tune bobot lapisan terakhir, demi memenuhi standar estetika film kelas industri sekaligus menghindari risiko pelanggaran hak cipta, membuatnya dipuji oleh komunitas teknologi sebagai “sutradara Hollywood sekelas Silicon Valley” (Sumber: Latent Space)

Wawancara Eksklusif Periodic Labs: Menjadikan Eksperimen Fisik dan Reinforcement Learning Dunia Nyata Sebagai Landasan Evolusi Ilmuwan AI : Mantan peneliti OpenAI Liam Fedus dan mantan peneliti Google DeepMind Dogus Cubuk membedah secara mendalam peta jalan teknologi startup material baru Periodic Labs dalam sebuah podcast. Mereka menunjukkan bahwa hanya mengandalkan pre-training teks internet atau penalaran logika sintetis tidak dapat benar-benar menembus ketidaktahuan fisik, karena material nyata memiliki transisi fase mikro dan noise pengukuran yang sangat rumit. Tim sedang mengemas instrumen laboratorium throughput tinggi yang sebenarnya menjadi loop tertutup reinforcement learning dengan umpan balik lingkungan, menjadikan setiap lintasan sintesis fisik yang gagal sebagai sampel negatif berkualitas tinggi, demi mengeksplorasi “superintelijen sintesis” (Sumber: Latent Space)

Cloudflare Berikan Pengembalian Dana Penuh untuk Tagihan Selangit Akibat Infinite Loop Kode AI Pengembang dan Evaluasi Bahaya Arsitektur : Seorang pengembang yang menggunakan bantuan Codex untuk menulis layanan Cloudflare Durable Objects terjebak dalam self-triggering infinite loop ratusan kali per detik akibat logika retry peringatan yang dihasilkan AI, menghasilkan tagihan baca-tulis database senilai lebih dari $10.000 dalam waktu singkat. Setelah berkomunikasi, Cloudflare memberikan pembebasan tagihan penuh. Teknisi resmi mengulas secara rinci dalam tiket dukungan mengenai karakteristik teknis di mana “Vibe Coding” modern, akibat kurangnya peninjauan kode dasar oleh pengembang, sangat mudah memicu longsoran finansial terselubung di lingkungan cloud-native tanpa batas pengeluaran ketat (Sumber: dotey)

💡 Lain-lain

Anthropic Berkomitmen Investasikan $150 Juta untuk “Genesis Mission” Gedung Putih guna Dukung Komputasi Ilmiah Terdepan Tingkat Nasional : Pada KTT Kantor Kebijakan Sains dan Teknologi Gedung Putih, Anthropic mengumumkan komitmen untuk menyumbangkan sumber daya komputasi dan teknologi senilai $150 juta selama tiga tahun ke depan guna berpartisipasi secara mendalam dalam “Genesis Mission” tingkat nasional Amerika Serikat. Anthropic akan bekerja sama erat dengan 15 lembaga penelitian federal dan laboratorium nasional termasuk NASA dan National Institutes of Health, menerapkan Claude dan lingkungan kode otomatis untuk menyediakan dukungan teknis serta pelatihan khusus bagi terobosan penelitian ilmiah berkesulitan tinggi seperti pengendalian energi fusi nuklir dan komputasi kuantum (Sumber: Anthropic News)

Anthropic berpartisipasi dalam Genesis Mission

Tim MIT Manfaatkan Machine Learning untuk Rekonstruksi Penjadwalan Dinamis Server Guna Tekan Pemborosan Konsumsi Energi Pusat Data : Menanggapi krisis jaringan listrik pusat data akibat lonjakan daya komputasi model AI global, tim Associate Professor Christina Delimitrou dari MIT mengembangkan arsitektur manajemen konsumsi energi server berbasis deep learning. Sistem ini dapat memprediksi perebutan sumber daya secara real-time pada layanan mikro dan perangkat lunak cloud-native, serta melakukan penjadwalan dinamis dan kompresi arsitektur pada kluster server yang saat ini umumnya hanya beroperasi pada pemanfaatan komputasi efektif 15%. Hal ini secara signifikan melepaskan potensi daya komputasi berkepadatan tinggi dan mengurangi kehilangan daya listrik tanpa perlu membangun infrastruktur listrik tambahan (Sumber: MIT News)

Tim MIT kembangkan sistem AI penurun konsumsi energi pusat data

Tinggalkan Balasan

Alamat email Anda tidak akan dipublikasikan. Ruas yang wajib ditandai *