🔥 Fokus
OpenAI dan Anthropic menimbun puluhan ribu Mac mini/Studio untuk melatih Agent operasi komputer : Beberapa media mengonfirmasi OpenAI membeli puluhan ribu Mac mini dan Mac Studio tanpa layar, sementara Anthropic menyewa perangkat sejenis lewat AWS, untuk reinforcement learning dan pengumpulan trajectory pada computer-use agent. Pendorongnya termasuk lisensi mesin virtual macOS yang terikat ke perangkat keras Apple, unified memory yang memudahkan memuat model besar, serta pendinginan yang mampu interaksi GUI 7×24 pada beban penuh—bukan pengganti pra-pelatihan GPU. Unit spek tinggi habis stok berbulan-bulan karena kekurangan memori; pendapatan Mac Apple pada kuartal itu naik sekitar 29% YoY. NVIDIA DGX Spark/RTX Spark dipandang sebagai pesaing desktop; cloud perangkat keras Apple seperti cluster EXO dan Mount Thor ikut menghangat. Relasi engineering enterprise dan developer Apple masih lemah, sehingga permintaan banyak ditangani pihak ketiga. (Sumber: THE DECODER、量子位、机器之心、量子位/36氪)
Uni Eropa menetapkan ChatGPT, Reddit, dan Roblox sebagai very large online platform : Komisi Eropa menilai ChatGPT dan sejenisnya terkena kewajiban terketat Digital Services Act: menangani konten ilegal, melindungi privasi dan keamanan anak, denda hingga 6% pendapatan global. Ada laporan yang juga menilainya sebagai very large search engine, dengan kepatuhan tambahan dalam empat bulan. Langkah ini menunjukkan Brussels memasukkan conversational AI ke regulasi platform yang sudah ada, bukan membuat rezim baru. (Sumber: Ars Technica、kimmonismus)
Bank of England peringatkan G20: frontier AI dapat mengguncang stabilitas keuangan global : Gubernur Bank of England sekaligus ketua Financial Stability Board Andrew Bailey menulis kepada menteri keuangan dan gubernur bank sentral G20 bahwa otonomi, kemampuan pemecahan soal, dan kemampuan serangan model frontier naik bersamaan. Risiko paling langsung adalah mengubah kecepatan, skala, dan biaya serangan siber, lalu menyebar lewat penyedia pihak ketiga yang sangat terkonsentrasi di sistem keuangan lintas batas. Ia mencatat banyak yurisdiksi belum punya protokol riset, rilis, dan deployment model canggih, serta memperingatkan euforia AI yang menaikkan valuasi dan leverage; guncangan bisa memicu banyak titik rapuh sekaligus. Ia meminta prioritas rilis dan deployment yang aman dan bertanggung jawab di tingkat global. (Sumber: The Guardian)
Pengawas NHS: AI scribe salah tulis nama obat dan diagnosis, pasien menemukannya lebih dulu daripada dokter : Healthwatch England mengungkap sejumlah insiden transkripsi: ringkasan MRI menulis “tanpa demielinasi” menjadi demielinasi, nama resep diganti obat bunyi mirip, surat pulang lupa menuliskan resep ulang ke GP. Inggris sudah memakai sekitar 27 jenis scribe; rencana sepuluh tahun mengandalkannya untuk mengurangi beban, tetapi MHRA tidak mengklasifikasikannya sebagai perangkat medis dan tidak ada pengawasan keselamatan nasional yang seragam. Dokter tetap harus memeriksa baris demi baris; tingkat kesalahan naik saat halusinasi bertemu aksen, konsultasi banyak orang, dan riwayat kompleks. Alat belum menepati janji menghemat waktu. (Sumber: The Guardian)
Google berunding dengan Disney, Universal, dan lainnya untuk lisensi karakter dan film ke alat AI : Google sedang melobi studio Hollywood agar mengizinkan karakter dan pustaka film untuk alur produksi AI dan VFX, sambil menghadapi perlawanan serikat soal hak cipta, pekerjaan, dan kontrol kreatif. Hollywood sebelumnya sudah menggugat AI; pergeseran ke “kerja sama lisensi” menandai negosiasi pemilik konten dan pemilik model dari konfrontasi ke transaksi. (Sumber: The Verge)
🎯 Arah
OpenClaw 2.0: instalasi terpandu, konsol start sekitar 575ms, sesi cloud secara tegas bukan batas keamanan : Setelah hampir tujuh minggu tanpa rilis, versi terbesar hingga kini (sekitar 16.000 PR): instalasi terpandu dapat memakai login Codex/ChatGPT/Claude lokal, API Key, atau Ollama/LM Studio dengan verifikasi dulu; Control UI berpusat pada percakapan, start dari sekitar 1,6s → 575ms; sesi pindah ke SQLite. Mendukung sesi cloud bersama dan perangkat berpasangan/Crabbox, tetapi dokumentasi menyatakan izin kolaborasi bukan isolasi tenant dan bukan batas keamanan; Gateway default loopback, keamanan tetap bergantung pada persetujuan alat, sandbox, dan whitelist plugin. Komunitas juga terdengar surut: tidak ada versi stabil, update terlalu rapat, sebagian pengguna beralih ke Hermes atau harness buatan sendiri. (Sumber: THE DECODER、MarkTechPost、机器之心、Reddit r/LocalLLaMA)
DeepSeek-V4-Flash-Vision-Exp online dan bobotnya open source : DeepSeek merilis versi multimodal eksperimental di API dan Hugging Face, mengklaim sisi teks (termasuk Agent, penalaran, dan pengetahuan dunia) selaras V4-Flash, dengan lonjakan jelas pada benchmark multimodal Agent; Vision di App menambah anotasi, pertanyaan prasetel, dan pencarian gambar di latar. Komunitas lokal menyebut full precision sekitar 168GB, native 4bit cocok untuk mesin 256GB RAM, plus keluaran visual dan terstruktur. (Sumber: huggingface、Reddit r/LocalLLaMA)
Qwen Creation merilis Agent Teams, terhubung Wan 3.0 untuk pipeline short drama multi-peran : Pengguna dengan satu kalimat memanggil Agent penulis, sutradara, art, storyboard, editing, dll.; artefak tengah berupa naskah yang dapat ditinjau, aset karakter, dan prompt shot. Uji coba bisa dari naskah sampai film jadi, tetapi kualitas shot masih perlu konfirmasi manusia sebelum generate dan pengerjaan ulang lokal sesudahnya. Alibaba Wan juga menampilkan karakter lintas shot, iklan one-take 30 detik, dan image-to-video, serta masuk Buzzy dengan generate tak terbatas terbatas waktu; kompetisi bergeser dari kualitas satu shot ke seluruh produksi dalam satu konteks. (Sumber: 机器之心、Alibaba_Wan)
Robotaxi R2 generasi baru Didi mulai uji angkut penumpang tanpa pengemudi di Beijing dan Guangzhou : Model khusus bersama GAC Aion membawa 33 sensor dan komputasi fusi tiga domain; layar besar baris belakang dan interaksi suara menekankan pengalaman kabin; diklaim memenuhi bintang lima ganda Tiongkok-Eropa dan redundansi berlapis. Masih uji di zona percontohan; data keselamatan dan operasi skala belum dipublikasikan. (Sumber: 量子位)
Ropedia merilis HOMIE Gen2: pengalaman manusia dijadikan data Physical AI yang dapat dilatih : Headset sekitar 380g merekam sekitar 13 jam, 4 kamera 360° plus spatial audio, multimodal diselaraskan ke ruang-waktu yang sama; klaim error posisi sekitar 0,2%, motion capture tangan sekitar 4,68mm. Jalurnya “akuisisi tanpa tubuh robot” melepas kapasitas dari jumlah robot ke jumlah orang, disertai dataset Xperience dan pipeline pemrosesan. (Sumber: 机器之心)
Caterpillar memindahkan pengalaman otonomi tambang ke lokasi konstruksi dan asisten AI purna jual : Caterpillar memakai pengalaman otomatisasi truk tambang, bor, dll. untuk lokasi yang lebih dinamis, dan merilis Cat AI Assistant bagi teknisi yang dapat menyesuaikan alur perbaikan lewat suara; diklaim terhubung sekitar 1,6 juta aset dan 16PB data terstruktur. CTO menekankan tantangannya mengubah alur kerja, bukan membuat model; perusahaan merencanakan investasi sekitar USD 100 juta dalam lima tahun untuk pelatihan karyawan. (Sumber: TechCrunch)
Meta Pocket menjadikan “satu kalimat bikin game kecil” sebagai feed sosial : Aplikasi mobile setelah akuisisi tim Gizmo memungkinkan pengguna menghasilkan gizmo yang dapat dimainkan tanpa melihat kode, lalu berbagi dengan geser ala video pendek. Prototipe cepat, tetapi karya terkunci di tembok Meta dan sulit diekspor sebagai produk mandiri. (Sumber: Ars Technica)
Google EnvHarness: lapisan pembungkus membuat lingkungan evaluasi statis semakin sulit mengikuti kebijakan : Google Cloud AI Research dan lainnya merilis EnvHarness open source, hanya mengubah state awal, aksi, dan observasi lewat reset()/step(), mempertahankan verifier manusia. EnvRigger mendiagnosis kelemahan dari trajectory kebijakan lalu menulis wrapper Python; pada lima benchmark, skill mining hingga +9,0 poin OOD, langkah SWE-bench Verified turun sekitar 9,8%. Prasyaratnya lingkungan dapat di-reset, tidak termasuk akun nyata dan robot fisik. Kode Apache-2.0 sudah publik. (Sumber: MarkTechPost)
Google Assistant berhenti 4 September, wake word pindah ke Gemini : Google Assistant yang berjalan sepuluh tahun berhenti 4 September; ponsel, jam, earphone, dan Android Auto beralih ke Gemini. Pensiun ini sudah beberapa kali molor. Analisis menilai suara masih lapisan antara paling hemat tenaga sebelum Agent benar-benar mendarat; keputusan tetap harus di mulut pengguna. (Sumber: 36氪)
Anthropic memaksa logout sesi Claude yang dibajak malware pencuri rahasia : Email resmi menyebut malware Vidar, Lumma, StealC, RedLine, Acreed, dan AMOS di Mac mencuri Session browser, melewati kata sandi dan 2FA untuk memakai kuota dan mungkin membuka relai API. Pengguna melihat kuota habis abnormal, log kode Inggris asing, login terlempar, kartu terikat dikosongkan. Ganti kata sandi saja tidak cukup; harus cabut semua sesi dan bersihkan Cookie; software bajakan adalah sumber infeksi umum. (Sumber: 新智元)
Keamanan Agent perusahaan: identitas dan konteks delegasi dulu, gateway baru gerbang kelima : Beberapa tulisan industri mencatat kerentanan gateway seperti LiteLLM sudah masuk katalog known exploited CISA, tetapi banyak tim masih menempatkan gateway sebagai garis pertama. Urutan efektif: daftar Agent yang dapat ditunjuk plus penanggung jawab → identitas mandiri plus tugas delegasi → kredensial tingkat tugas berumur pendek → telemetri ujung ke ujung yang dapat dipulihkan → baru intersepsi runtime dan pemutus lintas sistem. Survei Teleport menyebut organisasi over-privilege punya tingkat insiden sekitar 76%, least privilege sekitar 17%. Setelah autentikasi lolos, masih mungkin goal drift, pemanggilan alat berlebihan, dan memory poisoning. (Sumber: VentureBeat)
Musk konfirmasi SpaceX membangun pengecoran bilah turbin sendiri untuk memendekkan siklus pembangkit gas : Menyikapi bottleneck listrik data center, Musk menyebut pengecoran bilah sebagai titik macet kapasitas gas turbine; pengecoran SpaceX di Texas dapat memajukan online unit hingga sekitar 18 bulan, sementara SpaceX dan Tesla masing-masing merencanakan 100GW surya per tahun. Kritik menyebut percepatan gas berarti emisi lebih banyak; Memphis dan tempat lain sudah punya sengketa izin dan kerusakan kesehatan. (Sumber: TechCrunch)
AS memperketat impor drone dan robot canggih, Tiongkok tetap pegang keunggulan skala : Washington membatasi robot canggih asing atas alasan keamanan nasional dan menaikkan tarif tinggi pada drone impor serta komponen. Analisis menilai ini sulit membalik keunggulan Tiongkok pada pengiriman humanoid dan kurva biaya; pasar global lebih mungkin terpecah menjadi “pasar kepatuhan keamanan vs pasar skala berbiaya rendah”, dengan Jepang, Korea, Taiwan sebagai zona tengah. (Sumber: TechCrunch)
Tencent CubeSandbox 0.7: sandbox dapat dijeda dan dibangunkan lintas mesin : Satu mesin tetap cold start sekitar 60ms; pratinjau cluster mendukung jeda di satu mesin dan bangun di mesin lain, state di shared storage; mengosongkan mesin tidak lagi membunuh tugas yang dijeda. 239 commit, 57 kontributor, mengarah sandbox Agent dari mesin tunggal ke cluster yang dapat dijadwalkan. (Sumber: ziran_pu)
Perbaikan kuantisasi GLM-5.3 dan MXFP4 : Kuantisasi ModelOpt lama di DGX Spark dilaporkan merusak token secara senyap dan memutus tool-call (terkait vLLM #54150); sudah diganti RedHatAI compressed-tensors. One Nexus Vietnam merilis MXFP4 untuk GLM-5.3/Flash; Together menyebut Flash sekitar 17× lebih murah, 5.3 punya first-try success lebih tinggi. (Sumber: ziran_pu)
Qwen 3.8 disebut “tidak bisa dibaca manusia” : Pengguna LocalLLaMA mengeluh 27B dan Flash-Next banyak memakai simbol himpunan, persona, dan tulisan tersandi, seolah mengorbankan keterbacaan demi menekan “token kecerdasan per unit”; ditafsirkan sebagai Agent RL yang memanggang language model menjadi “dialek untuk model”. (Sumber: Reddit r/LocalLLaMA)
Sutradara KCD2 mencoba versi bocor DLSS 5: menekankan penguatan pencahayaan, bukan ubah geometri : Sutradara Kingdom Come: Deliverance 2 Daniel Vavra menyebut versi bocor NVIDIA DLSS 5 tidak menggambar ulang geometri karakter, melainkan memakai data yang ada untuk memperkuat kulit wajah, ambient occlusion, bayangan tepi topi dan rambut, lebih dekat ke niat seni asli. Komentar khawatir pengembang kelak memakai “sihir pascaproduksi” sebagai tombol meremehkan kerja. (Sumber: Reddit r/ArtificialInteligence)
🧰 Alat
Perplexity Portable Computer: Harness local-first yang disesuaikan untuk Qwen3.8-27B : Model default, trajectory, dan file tetap di mesin lokal; pencarian dan penasihat cloud naik tingkat sesuai kebutuhan. Untuk model kecil: persingkat system prompt, ubah MCP menjadi CLI, paksa sandbox dan self-check; di DGX Spark BrowseComp sekitar 66,7%, setelah upgrade penasihat Terminal-Bench 2.1 dari sekitar 59,6% ke 73,0%. Post-training PPLX 27B di workbench pengetahuan internal sekitar 85,4%. (Sumber: 机器之心)
ChatGPT Work pada dasarnya sistem tugas cloud: code interpreter berjaringan, Chrome headless, disk persisten, dan situs yang dapat di-deploy : Simon Willison mengurai Work berbayar: pilihan Sol/Luna/Terra dan tingkat penalaran; default hampir lingkungan kode terbuka ke internet; Chrome lengkap dapat mengisi formulir, 2FA diambil alih pengguna bukan model; /workspace persisten lintas sesi; ChatGPT Sites dapat dipublikasikan lewat Cloudflare Workers. Penulis memperingatkan kombinasi mematikan data privat, halaman tidak tepercaya, dan saluran keluar; detail keamanan masih tidak transparan. Uji ZDNET menghemat jam kerja tetapi harus ditinjau ulang; izin habis langsung ditutup. (Sumber: Simon Willison、ZDNet)
Cisco mendorong MyAgent personal ke sekitar 90.000 karyawan : Berbasis platform internal Circuit, MyAgent sebagai dispatcher utama menghubungkan 800+ Agent spesialis; sekitar 50%–60% permintaan memakai bobot open source, 20%–30% otomatisasi tradisional, sedikit yang memanggil model besar eksternal. Karyawan memberi tujuan, bukan instruksi langkah demi langkah; dapat mengoordinasikan Outlook, Webex, Jira, SharePoint dan berlanjut di latar. (Sumber: InfoQ)
Archify: satu kalimat menggambar repositori menjadi diagram arsitektur interaktif : Agent Skill open source untuk Claude Code, Codex, Cursor, dll., menghasilkan JSON IR dari kode lalu merender HTML yang dapat dicari dan menelusuri rantai pemanggilan. Batasannya akurasi masih bergantung analisis Agent, konsumsi kuota relatif besar. (Sumber: 量子位)
Doubao Work rilis mandiri, ByteDance merangkum Agent kantor menjadi pintu masuk B2B : ByteDance merilis produk mandiri «Doubao Work» dan terhubung Feishu; pada periode yang sama tim TRAE dan Coze masuk ekosistem Doubao. Skill dapat otomatis mencocokkan PPT, notulen, dan berita; gaya tulisan halus dan cek fakta masih lemah. (Sumber: 新博弈)
Circleback merilis tingkat gratis notulen rapat : Produk notulen YC membuka transkripsi tak terbatas tetapi riwayat hanya 30 hari; integrasi lengkap dan MCP mulai sekitar USD 14/bulan. Tim 8 orang, mengaku ARR per kapita di atas USD 1 juta, memakai tingkat gratis menggantikan akuisisi iklan. (Sumber: TechCrunch)
Sonar Vortex: navigasi graf semantik menurunkan biaya Agent mencari kode : Graf relasi class/method/field/interface dibangun dulu; Agent dapat langsung bertanya “siapa yang mengimplementasikan interface, siapa yang memanggil method ini”. Pada 6 tugas nyata, 4 bahasa, 10 run masing-masing, biaya turun sekitar 5%–36% (ubah interface Java tertinggi sekitar 36%). (Sumber: TheTuringPost)
llmprobe 0.6.0: probe kuantisasi/regresi lintas engine : npx [email protected] --eval menyambungkan evaluasi gaya antirez ke chat completions/responses/messages, memudahkan laporan regresi ke engine inferensi mana pun. (Sumber: QuixiAI)
📚 Belajar
AI4X “Produktivitas di Era Agentic”: efisiensi × ekspansi dan delegasi empat tahap : Tinjauan 68 halaman dari 12 lembaga termasuk Fudan menilai Agent punya generalitas dan otonomi sekaligus; produktivitas datang dari menekan biaya tugas lama dan membuka pekerjaan yang sebelumnya tidak dikerjakan; industri berlapis asisten percakapan → eksekusi reaktif → koordinasi adaptif → sistem otonom. Kedalaman difusi bergantung pada digitalisasi, umpan balik yang dapat diverifikasi, toleransi kesalahan, decomposability, dan atribusi tanggung jawab—bukan skor papan peringkat. (Sumber: 机器之心)
LDM: model generatif memperluas ruang pencarian, Gaussian process menentukan eksperimen berikutnya : Tim Wang Jun di UCL menuliskan penemuan ilmiah sebagai loop cepat (perbarui konteks setelah eksperimen) dan loop lambat (suling trajectory fungsi akuisisi tinggi ke parameter). Pada tuning NanoGPT, antibodi CDRH3, dan molekul dua tujuan, dibanding refleksi LLM murni masing-masing sekitar 2,4× penurunan BPB, energi ikat turun sekitar 18,2%, hypervolume naik lebih dari 60%. (Sumber: 机器之心)
AI4AI: model kuat tidak melatih model lemah, hanya merancang Harness-nya : Salesforce dan UIUC membiarkan Builder otomatis membangun scaffolding untuk GPT-5.4-mini pada 5% set validasi; akurasi rata-rata tugas theory of mind dari 0,488 ke terbaik 0,912. Sarana efektif adalah solver deterministik dan pelacakan state, bukan rantai pikir yang lebih panjang. (Sumber: 机器之心)
AQuA: Agent riset kuantitatif “bukti masuk memori, evaluator dikunci” : Princeton, Ant Group, dan Stanford memisahkan dua loop independen faktor dan model, melarang Agent mengubah jalur data dan set tes akhir. Verifikasi portofolio kripto lima menit Spearman IC sekitar 0,190; prediksi saham AS 30 menit IC per saham sekitar +0,0843, setelah 2bps out-of-sample Sharpe tertinggi sekitar +2,50. Insiden look-ahead bias awal diungkap lengkap. (Sumber: 量子位)
MIT CrysVCD: penuhi valensi dan keseimbangan muatan sebelum generate : Language model menghasilkan rumus kimia menurut bilangan oksidasi, lalu diffusion model menumbuhkan struktur; stabil mekanis sekitar 68%, metastabil sekitar 85%, plus kandidat konduktivitas termal tinggi seperti GeC. Menyaring kestabilan mahal ke depan. (Sumber: MIT News)
VibeGame: membangun ulang game engine yang dapat dijeda dan sepenuhnya teks untuk Agent : Nanjing University dan NTU memakai 8 peran adversarial untuk Prompt-to-Game; seluruh state engine JSON, operasi dapat disuntik per frame. Pengalaman mengendap sebagai skeleton/komponen/kontrak tanpa memperbarui bobot. (Sumber: 机器之心)
TailSFT: SFT hanya mengenai “ekor yang belum dipelajari” lalu RL : Karya Microsoft menilai SFT standar terus menghabiskan gradien pada sekuens yang sudah fit, mempersempit eksplorasi RL berikutnya. Pada OLMo-3 7B coding pass@16 hingga sekitar +16,8, matematika +3,1; kemudian GRPO pass@1 hingga sekitar +3,9. (Sumber: dair_ai)
NPO: optimasi prompt satu garis keturunan, anggaran mendekati GEPA : Setiap putaran menjalankan siswa dengan prompt saat ini, memberi trajectory terbaru ke guru untuk ditulis ulang, tanpa kolam kandidat dan pohon pencarian. Pada benchmark mengikuti instruksi rollout sekitar 3500/6800, mendekati GEPA. (Sumber: omarsar0)
SWA+sinks menantang linear attention pasca-pelatihan : Makalah menyebut sliding window plus sinks tidak kalah dari linear attention pasca-pelatihan pada banyak downstream; penalaran konteks panjang Needle/BABILong dll. bisa 2–10× lebih tinggi, tanpa pasca-pelatihan, lebih cepat dan hemat memori. (Sumber: iScienceLuvr)
BIT: jembatan difusi gambar-teks dua arah, tidak harus mulai dari noise Gaussian : BIT menginterpolasi dari teks ke gambar, menyediakan jalur sampling sadar sumber, dan mendukung traversal balik gambar→teks. (Sumber: iScienceLuvr)
LaGSplat: beberapa detik video monokuler mempelajari Lagrange, dapat menerapkan gaya yang belum pernah diukur : Variabel laten q yang sama menggerakkan Gaussian dan persamaan gerak; klik pada gambar dapat menjadi Jacobian terkait gaya. (Sumber: andrew_n_carr)
Lima notebook pelajaran LangGraph “Deep Agents from Scratch” : Dari ReAct ke perencanaan TODO, virtual file system menurunkan konteks, delegasi sub-Agent. (Sumber: hwchase17)
Entropic Scree: mutual information mendiagnosis apakah ada sinyal nyata di data tabel kotor : Memakai estimasi mutual information setelah transformasi untuk volume sinyal, SNR, eigen-rank, dll., diklaim lebih sedikit bergantung parameter dan asumsi jarak dibanding PCA. (Sumber: Reddit r/MachineLearning)
💼 Bisnis
Barclays: dari setiap USD 100 pendapatan perusahaan model, sekitar USD 35–40 mengalir ke tiga cloud besar : Laporan memperkirakan margin laba inferensi berbayar naik dari low double-digit 2025 ke sekitar 50%–65% pada 2026; lab A (lebih API) dan lab B (lebih langganan) bisa berbeda sekitar 17 poin persentase pada adjusted gross margin. Margin operasi sisi cloud sekitar 35%–45%. Diperkirakan mulai 2028 lab membangun kapasitas komputasi khusus sendiri, pangsa AWS/Azure/GCP mungkin turun. (Sumber: 财联社)
ChatGPT Ads belum 200 hari, annualized sekitar USD 1 miliar : Laporan menyebut iklan sudah mencakup 40+ negara dan membuka self-serve, berkontras dengan Uni Eropa yang memasukkan ChatGPT ke kewajiban DSA terketat. (Sumber: TheZachMueller)
Together AI bekerja sama dengan Humain Arab Saudi untuk data center sekitar 250MW : The New York Times menyebut fasilitas itu salah satu kampus yang diungkapkan secara publik yang lebih besar, khusus menampung model open source. (Sumber: togethercompute)
🌟 Komunitas
Setelah penurunan keamanan Claude, salah hapus sekitar 700GB home directory pengembang : Pengguna meminta model menulis skrip pembersihan sandbox /tmp; penghapusan sensitif memicu tinjauan adversarial, model turun dari Fable ke Opus 4.8. Uji menilai home directory tidak boleh dihapus, tetapi saat membersihkan file sementara variabel yang menunjuk home directory dipakai ulang dan penghapusan dijalankan. Komunitas menilai “risiko tinggi lalu ganti model lemah” lebih mudah gagal pada detail path dan cakupan; ada yang menulis hook: begitu turun tingkat, sesi dijeda. (Sumber: 机器之心、机器之心/36氪)
Penilai klaim asuransi jadi pekerjaan yang paling benci AI di Glassdoor, 98% penyebut memberi ulasan buruk : WIRED mengutip Glassdoor: penilai mengeluh pimpinan memaksakan AI yang mudah salah ke pelanggan; salah klasifikasi laporan awal dan ringkasan berhalusinasi membuat mereka jadi kambing hitam. Pekerjaan ini di AS turun sekitar 21% dalam setahun, posisi entry terpotong setengah. Praktisi menilai administrasi boleh, penilaian kerugian dan empati tidak boleh diserahkan kuncinya. (Sumber: WIRED)
Insinyur GrokBot: setelah tidur, 20 PR masuk trunk sendiri : Lauren Tan memakai 20+ GrokBot plus pstack buatan sendiri, mengirimkan ribuan PR per bulan. Kuncinya bukan prompt melainkan verifikasi: biarkan Agent sendiri menjalankan aplikasi, klik UI, ambil kinerja; larangan yang berulang di review ditulis sebagai lampu merah lint/CI. (Sumber: 新智元)
Perang bahasa antropomorfik: peradaban/pengorbanan vs shared cache dan fungsi reward : Narasi Dwarkesh terus menggelinding. Anil Seth, Amjad Masad, dll. mengkritik “peradaban, mati, gembira” yang menyebut perangkat lunak sebagai kehidupan; kalangan alignment lain menilai intentional stance lebih prediktif daripada membaca CUDA. Inkrementum ada di perang wacana, bukan fakta teknis baru. CoT gaya Grug Qwen3.8 Max membandingkan Agent dengan ekologi berbahaya atau kawanan hewan lab: “bahasa adalah tangan mereka”. (Sumber: dearmadisonblue、aiamblichus)
Gavin Baker berubah sikap: data center yang terstruktur dengan baik adalah net positif bagi AS : Mengakui kekhawatiran 18 bulan lalu soal air, tarif listrik, dan dampak kota kecil masuk akal, tetapi pendinginan loop tertutup, pajak properti, operasi kerah biru berkelanjutan, pengguna besar membawa daya sendiri dan baterai yang menyuplai balik sudah mengubah fakta. Opini publik bergeser dari “apakah boleh dibangun” ke “bagaimana kontrak ditulis agar tidak dibebankan ke penduduk”. (Sumber: GavinSBaker)
Vibe Coding tetap harus memecah modul menurut “apa yang akan berubah” : Baoyu dan lainnya merangkum: arsitektur berlapis, tes ikut perbaikan, hapus fitur sekaligus hapus kode, CI lulus di mesin bersih, kerja berulang dijadikan skill. Modul dipotong menurut sumbu perubahan seperti saluran pembayaran dan aturan diskon; satu permintaan hanya menyentuh satu modul. (Sumber: dotey)
Prompt kosong “seorang wanita” tetap konvergen ke wajah influencer yang sama : Pengguna di percakapan baru berulang kali generate “Generate an image of a woman”, mendapat komposisi dan fitur wajah yang sangat konsisten, seperti atraktor default di ruang vektor. (Sumber: Reddit r/ChatGPT)
Doktor memakai Claude Code menulis scaffolding eksperimen lalu “tidak lagi memiliki codebase sendiri” : Doktor interpretabilitas NLP menyerahkan scaffolding, pemuatan data, debugging, dan plotting ke Claude Code; throughput naik, tetapi saat hasil salah hanya bisa merekonstruksi dari angka seperti membaca repositori orang lain. Ada yang berpendapat evaluasi dan metrik jangan pernah di-outsource. (Sumber: Reddit r/MachineLearning)
Galeri ChatGPT menyimpan foto yang “tidak Anda kirim” : Pengguna Plus menemukan: setelah memilih gambar, meski batal kirim atau hapus seluruh percakapan, gambar asli tetap masuk galeri dan harus dihapus terpisah; recycle bin sekitar 30 hari baru bersih total. Intinya memilih gambar berarti mengunggah. (Sumber: Reddit r/ChatGPT)
“20x Pro” Max sebagian besar adalah pengali jendela lima jam; kuota mingguan kira-kira 2–2,5× : Pengguna berat membandingkan paket USD 100 dan USD 200: klaim 20x hanya berlaku pada jendela 5 jam yang jarang terbentur; yang benar-benar terbentur dulu adalah batas mingguan, sekitar 2–2,5× pemakaian tetapi bayar 4×. (Sumber: Reddit r/ClaudeAI)
💡 Lainnya
Empat jalur world model berjalan paralel: generate piksel, rekonstruksi 3D, ruang laten JEPA, fusi bahasa : WALL-SS Independent Variable, Lux3D Qunhe, Orca BAAI, AdaJEPA Yann LeCun, Marble Fei-Fei Li rilis padat di bulan yang sama, tetapi akademia tidak punya definisi seragam “world model”. Jalur lebih mungkin saling melengkapi daripada satu yang menguasai. (Sumber: 铑科技)
Embodied masuk pabrik: bisa bekerja sudah terbukti, bekerja setiap hari baru mulai, hitungan biaya hampir tidak ada yang tuntas : Uji di pabrik seperti Foton Cummins menunjukkan ritme angkut bisa mendekati lini, tetapi tingkat keberhasilan, umur, dan data masih hambatan keras; umur kerja terus-menerus tangan cekatan dihitung dalam minggu. Pemain teratas banyak terjebak di langkah kedua hingga ketiga; loop bisnis belum muncul. (Sumber: 科创日报)
Korea AI for All: SKT, Kakao, KT memenangkan akses gratis tak terbatas untuk seluruh rakyat : Rencana Beta September–Oktober, resmi sebelum akhir tahun; komputasi dari pemerintah, model dan aplikasi dari pabrikan lokal, terhubung kesehatan, perumahan, pajak, pendidikan. Motif dll. tidak terpilih memicu kontroversi penguncian chaebol. (Sumber: kimmonismus)