🔥 في بؤرة الضوء
Google تطلق نموذجي الحوار متعدد الوسائط في الوقت الفعلي Gemini 3.8 Live وExtended Thinking : أطلقت Google DeepMind رسمياً الجيل الجديد من نماذج الصوت والوسائط المتعددة الشاملة (End-to-End) المتمثلة في Gemini 3.8 Live وإصدار Extended Thinking التابع له. تحقق هذه السلسلة لأول مرة نموذج تفاعل غير معطل يقوم على “التحدث والاستدلال واستدعاء الأدوات بالتوازي في الخلفية في آن واحد”، مع دعم الفهم البصري بزمن استجابة منخفض يقارب الوقت الفعلي والتبديل التلقائي السلس بين 97 لغة. كما يقضي إصدار Extended Thinking على فترات التوقف المعتادة أثناء تفكير النماذج الصوتية السابقة، محققاً المركز الأول في اختباري الأداء الصوتي τ-Voice وArtificial Analysis، بتكلفة تبلغ 0.005 دولار فقط لكل دقيقة إدخال صوتي، ليحدث ثورة في سوق وكلاء الصوت الفوريين بتكلفة استدلال أقل بشكل ملحوظ.(المصدر: Google DeepMind Blog / THE DECODER / 新智元)

TypeSafe AI تطلق أول نموذج أساس لاتخاذ القرارات من فئة System One باسم Jev مع نموذج التدريب RLCD : خرجت شركة TypeSafe AI، التي أسسها Diogo Almeida المشارك في ابتكار ChatGPT، رسمياً من وضع التخفي لتطلق نموذج الأساس Jev من فئة “System One” والمصمم لاتخاذ القرارات الهيكلية عالية التردد، إلى جانب نموذج التعلم المعزز للقرارات المعايرة (RLCD). يتخلى Jev تماماً عن آلية توليد النصوص التراجعية الذاتية (Autoregressive), متحوّلاً إلى أخذ العينات المتوازية لإخراج بيانات آمنة الأنواع (Type-safe) وتنبؤات احتمالية معايرة، محققاً في مهام اتخاذ القرارات المنفصلة مثل التصنيف والتقييم وتوجيه الوكلاء (Agent Routing) سرعة تفوق النماذج الرائدة التقليدية بـ 20 إلى 200 ضعف وبتكلفة أقل بـ 40 إلى 400 ضعف، مع جعل رموز المخرجات مجانية بالكامل، مما يمثل تحولاً للذكاء الاصطناعي من البنى التوليدية الأحادية إلى توزيع المهام بين الأنظمة السريعة والبطيئة.(المصدر: lateinteraction / Latent Space / dotey)

نقاشات حامية بين العمالقة في قمة Dreamforce وانقسام في المناورات السياسية حول “إبطاء سرعة” الذكاء الاصطناعي عالمياً : احتدم النقاش خلال مؤتمر Dreamforce وجلسات الاستماع التنظيمية العالمية حول مسألة إبطاء وتيرة البحث والتطوير في نماذج الذكاء الاصطناعي الرائدة. وجدد Dario Amodei التأكيد على ضرورة ضبط الوتيرة عبر مراجعات من جهات خارجية مقيمة؛ في حين رد Sam Altman بأن مسؤولية الأمان لا ينبغي أن تُشترط بتباطؤ المنافسين؛ بينما شن Jensen Huang والفائز بجائزة تورينغ Yann LeCun برفقة عدد من الأكاديميين هجوماً قوياً على “نظريات فناء البشرية”، مصرحين بوضوح: “إن لم تكونوا واثقين فلا تطلقوا النماذج، ولا حاجة لتدخل قوانين جديدة”، محذرين من تحول سرديات نهاية العالم إلى أدوات للاستحواذ التنظيمي تعرقل المصادر المفتوحة. ومن الجانب السياسي، حذر نائب الرئيس الأمريكي Vance الشركات بضرورة تحمل المسؤولية بمفردها دون انتظار استثناءات، ودعا السيناتور Sanders إلى تشريع يوقف تطوير الذكاء الاصطناعي الفائق مؤقتاً، في حين طرح الاتحاد الأوروبي رسمياً “قانون حماية الأطفال” للحد من استخدام روبوتات الدردشة الذكية لمن هم دون سن 13 عاماً.(المصدر: TechCrunch / The Guardian / ylecun / AI前线)

Periodic Labs تطلق نموذج التجارب الفيزيائية Neon بتريليون معامل: حلقة تجارب آلية تتفوق على النماذج الرائدة مغلقة المصدر : استعرضت شركة Periodic Labs، التي أسسها باحث OpenAI السابق Liam Fedus، نموذج Neon الذي يضم تريليون معامل والمصمم لاكتشافات المواد والفيزياء. بنى الفريق حلقة مغلقة من التجارب الفيزيائية الحقيقية وتدريب النماذج عبر مختبر مؤتمت عالي الإنتاجية في Menlo Park، وباستخدام 1300 شريحة H200 فقط للتعلم المعزز على بيانات تجريبية خاصة ومهام تحليل XRD، قفزت الدقة في معيار FrontierXRD من 2.7% إلى 55.3%، متفوقة تماماً على GPT-6 Astra وClaude Fable 5.1، مما يثبت قدرة البيانات الفيزيائية الخاصة عالية الجودة على تحقيق قفزات نوعية تتجاوز مجرد التوسع (Scaling) في النماذج العامة.(المصدر: LiamFedus / _jasonwei)

أنباء عن محادثات تمويل لـ OpenAI بتقييم 1.2 تريليون دولار، وحصتها من إيرادات OpenRouter تتجاوز Anthropic لأول مرة منذ عامين : كشفت صحيفة Wall Street Journal أن OpenAI تجري اتصالات مبكرة مع مستثمرين لجولة تمويل جديدة بتقييم يتجاوز 1.2 تريليون دولار. وتشير بيانات المنصات إلى أنه بفضل الاستخدام القوي لـ GPT-6 Astra وLuna، حققت OpenAI تفوقاً في المعاملات المدفوعة على OpenRouter لأول مرة منذ قرابة عامين ونصف؛ وفي الوقت نفسه، رصد المجتمع التقني توجيه عدد كبير من طلبات GPT-5.6 Sol نحو حزمة اختبارات GPT-6 Sol الأكثر كفاءة من حيث التكلفة، كما أعلنت الشركة رسمياً عن إحالة GPT-5.5 للتقاعد في 14 أكتوبر، مما يشير إلى ترقية شاملة لخط الإنتاج نحو بنية الوكلاء الذكية من الجيل الجديد.(المصدر: kimmonismus / alexatallah / 36氪)

🎯 الاتجاهات والتطورات
Shengshu Technology تطلق Vidu S2: أول نظام تحرير فوري للفيديو التدفقي وتوليد الفيديو المكاني : أطلقت Shengshu Technology رسمياً مجموعة نماذج Vidu S2 الكاملة، وتتضمن S2-Avatar وS2-Editing. يدعم S2-Avatar التفاعل الفوري بدقة 720P مع إضافة عناصر تفاعلية ديناميكية؛ بينما يتيح S2-Editing التحرير أثناء البث المباشر في الوقت الفعلي، مما يسمح باستبدال الشخصيات والأزياء والخلفيات والأنماط مع الحفاظ على الحركات الأصلية ومسار الكاميرا، فضلاً عن دعم التحويل إلى فيديو مكاني مجسم لتقنيات VR. ومن الناحية البنيوية، تم حل مشكلة تراكم الأخطاء في توليد التدفقات الطويلة عبر خط أنابيب غير متزامن من نوع Backbone-Refiner واستراتيجية Self-Replay Forcing.(المصدر: 机器之心 / 量子位)
.jpg)
MediaTek تطلق أول معالج رائد بتقنية 2nm باسم Dimensity 9600 Pro: دعم سلس لنماذج MoE بحجم 30B محلياً على الأجهزة : أطلقت MediaTek رسمياً معالج Dimensity 9600 Pro المصنع بتقنية N2P 2nm من TSMC، معمارية المعالج المركزي تعتمد “2+3+3” بنواتين فائقتي الأداء ويحتوي على 33 مليار ترانزستور. يدمج المعالج الجيل الجديد من وحدات المعالجة العصبية المزدوجة NPU ومحرك Generative AI Engine 3.0، ويدعم الانتباه المختلط وتسريع العتاد بتقنية INT4، مما يحقق لأول مرة تشغيلاً سلساً لوكلاء الذكاء الاصطناعي ببنية MoE ذات 30 مليار معامل على الهواتف الذكية، مع تأكيد vivo وOPPO اعتماده في هواتفهما الرائدة القادمة.(المصدر: 机器之心)

إطلاق إصدار 0915 من نموذج Doubao 2.1 Pro: تعزيز العناية الواجبة طويلة المدى وتوليد الأكواد متعدد الوسائط : أطلقت Volcano Engine تحديث Doubao-Seed-2.1-pro-0915 بالكامل. يركز هذا الإصدار على تعزيز قدرات التحقق من البيانات وتتبع الأدلة في مهام الوكلاء المعقدة، مع دعم جدولة مئات الوكلاء الفرعيين لإجراء التحقق المتبادل عبر صفحات الويب وصور الأقمار الصناعية والبيانات المتعددة؛ وفي البرمجة متعددة الوسائط، يدعم النموذج التحليل المباشر لتسجيلات شاشات التصميم ومخططات CAD الهندسية وتوليد الأكواد البرمجية ذاتياً، مع خفض تكلفة استدلال النصوص والصور بأكثر من 30% مقارنة بالجيل السابق.(المصدر: dotey)

مؤسسة OpenAI تطلق مبادرة “البيانات الصحية العامة” وتستثمر مئات الملايين لتأمين البنية التحتية للبيانات الطبية الحيوية : أطلقت مؤسسة OpenAI غير الربحية مبادرة Public Data for Health، بهدف معالجة نقص البيانات في تطبيقات الذكاء الاصطناعي الصيدلانية الحيوية من خلال تمويل وشراء أرشيفات التجارب وبيانات التصنيع السريري والأمان (“الصناديق السوداء للأرشيفات البيولوجية”) من شركات التكنولوجيا الحيوية المفلسة؛ وتتضمن المرحلة الأولى 40 مليون دولار لدعم أبحاث لقاحات السرطان في جامعة كارولاينا الشمالية وشراء أصول بيانات الشركات الدوائية المفلسة، مما يظهر انتقال سباق البيانات في المختبرات الرائدة إلى البيانات العلمية الفيزيائية الخاصة عالية الحواجز.(المصدر: MIT Technology Review / thekaransinghal)

تسارع وتيرة تطوير نماذج الأساس للبيانات الجدولية: Prior Labs تطلق TabPFN-3.5 وNums AI تتيح Causilo كمصدر مفتوح : أطلقت Prior Labs نموذج TabPFN-3.5 الأساسي للبيانات الجدولية الداعم لمعالجة ملايين الصفوف و20 ألف بُعد من الخصائص، مع إطلاق نسختي Fast الأسرع بـ 6 أضعاف وTabPFN-3.5-Thinking للاستدلال العميق؛ وفي المقابل، أتاحت Nums AI نموذج Causilo الجدولي كمصدر مفتوح، والذي يحافظ على تكلفة حسابية خطية عبر آلية الانتباه للمتغيرات الكامنة بين الخصائص، مسجلاً أرقاماً قياسية في لوحة تصنيفات TabArena للنماذج الفردية في مهام التصنيف والانحدار وفق تصنيف Elo.(المصدر: MarkTechPost / Reddit r/MachineLearning)
Zidong Taichu تتيح النموذج متعدد الوسائط ZDTaichu5.0-9B كمصدر مفتوح مع أداء مميز في الاستدلال المكاني : أتاحت Zidong Taichu نموذجها الجديد متعدد الوسائط ZDTaichu5.0-9B بحجم 9 مليارات معامل والموجّه نحو العالم الفيزيائي كمصدر مفتوح. يقدم النموذج بنية التوجيه الديناميكي والاستدلال التكراري التكيفي، محققاً المركز الأول بين النماذج من نفس الفئة الحجمية في 8 من أصل 9 اختبارات مكانية مثل MindCube-tiny وViewSpatial، مع تفوق ملحوظ في تحويلات الإحداثيات ثلاثية الأبعاد المعقدة واستدلال الإمكانيات الوظيفية، مما يقلل بشكل كبير من المتطلبات العتادية لاتخاذ القرارات الإدراكية في الأنظمة المجسدة (Embodied Systems).(المصدر: 新智元)

Odyssey تطلق نموذج العالم الأساسي متعدد المهام Odyssey-3 : قدمت Odyssey الجيل الجديد من نموذج العالم العام Odyssey-3. لا يقتصر النموذج على التكيف والتعميم بناءً على كميات ضئيلة من البيانات الحقيقية للتحكم في الأذرع الآلية والروبوتات رباعية الأرجل والبشرية والطائرات المسيرة والقيادة الذاتية فحسب، بل يدعم أيضاً التوليد الذاتي لبيئات افتراضية تفاعلية عالية الدقة مع استجابات فيزيائية، مما يؤسس لحلقة تحسين ذاتي تكرارية للذكاء الاصطناعي عبر التجربة والخطأ داخل الفضاء الافتراضي.(المصدر: TheRundownAI / omarsar0)
NVIDIA تطلق منصة DSX لكفاءة الطاقة لدفع التنسيق الديناميكي بين مصانع الذكاء الاصطناعي وشبكات الكهرباء : طرحت NVIDIA منصة تحسين كفاءة الطاقة DSX مع بنية الرفوف بتيار 800V DC. حيث تعمل تقنية DSX MaxLPS على رفع إنتاجية الرموز (Token Throughput) بنسبة 24% تحت استهلاك طاقة ثابت عبر إعادة التوزيع الديناميكي للطاقة؛ في حين تجمع تقنية DSX Flex بين إشارات شبكة الكهرباء لتقليل الحمل بنسبة 40% خلال دقيقة واحدة دون مقاطعة مهام الاستدلال عالية الأولوية، مما يدفع المؤشرات الأساسية للبنية التحتية للذكاء الاصطناعي نحو “إنتاجية الرموز الفعالة للوكلاء لكل ميجاوات”.(المصدر: NVIDIA Blog)

Apple تكشف عن تقنية Reference Image: تجزئة المستشعرات العتادية لبناء سلسلة موثوقية لمكافحة تزييف الصور : كشف فريق أمان Apple عن حل تصوير مبتكر يمكن التحقق منه باسم Apple Reference Image. يقوم النظام بإنشاء تجزئة مشفرة (Cryptographic Hash) مباشرة على مستوى عتاد مستشعر الكاميرا للمشاهد الأولية RAW ورفعها إلى السحابة، مع إجراء جميع عمليات فك تدرج الألوان (Demosaicing) وتعيين النغمات والرندرة عبر مسار آمن قابل للتحقق، مما يوفر جذر ثقة عتادي من الطبقات الدنيا للتحقق من صحة الصور في عصر الذكاء الاصطناعي.(المصدر: timsoret)

🧰 الأدوات
Cognition توفر بيئة معزولة أصلية لنظام macOS ودعم محاكي iOS للمهندس Devin : أصبح مهندس البرمجيات الذكي Devin يدعم رسمياً بيئة الآلات الافتراضية السحابية الأصلية لنظام macOS. وبالاعتماد على إعادة هيكلة عميقة لشجرة إمكانية الوصول وبنية VNC في macOS، يمكن لـ Devin تجميع مشاريع Xcode تلقائياً في بيئة Mac معزولة، وتشغيل محاكيات iOS لإجراء اختبارات الانحدار عبر الأجهزة الحقيقية، وإرسال تسجيلات الاختبار وروابط توزيع TestFlight مباشرة إلى Slack بنقرة واحدة.(المصدر: imjaredz / cognition)

Huawei GTS تتيح NetCanvas كمصدر مفتوح: طوبولوجيا بصرية تفاعلية تحل مشكلة “فقدان الذاكرة الطوبولوجية” في استكشاف أخطاء الشبكات : قدم فريق خوارزميات Huawei GTS إطار العمل NetCanvas، الذي يوفر “طوبولوجيا نمو ديناميكية تفاعلية” لوكلاء استكشاف الأخطاء وإصلاحها. يتيح ذلك للوكيل وضع العلامات وإجراء التخمينات مباشرة على لوحة الطوبولوجيا أثناء تنفيذ أوامر سطر الأوامر (CLI)، مما رفع معدل النجاح في معيار صيانة وتشغيل CTBench بنسبة 24.2%، وقفز بنسبة نجاح المسارات المعقدة من 10% إلى 90%، مع تقليص تكلفة رموز التجربة والخطأ بنسبة تصل إلى 45%.(المصدر: 量子位)

معهد Lévin يتيح منصة تصميم البروتينات Lévin™ Harness كمصدر مفتوح : أطلق معهد Lévin في هانغتشو تطبيق الوكيل لتصميم البروتينات Lévin™ Harness الموجه للمجتمع العلمي. تدمج المنصة بيئة تفاعلية جزيئية ثلاثية الأبعاد وتربط النماذج اللغوية العامة بنماذج علمية متخصصة مثل AlphaFold وPallatom، مما يتيح للباحثين إدارة الحسابات بالكامل والتحليل التلقائي وبناء مسارات عمل قابلة لإعادة التكرار عبر محادثات باللغة الطبيعية.(المصدر: 量子位)

Mistral تتعاون مع Mozilla لإطلاق مساعد التصفح الذكي Firefox Smart Window : عقدت Mozilla شراكة مع Mistral لدمج نماذج Mistral مفتوحة المصدر متعددة اللغات داخل الإصدار التجريبي من Firefox Smart Window. يدعم المساعد فهم السياق وتلخيص المعلومات عبر علامات التبويب المختلفة، مع الالتزام الصارم بمعايير الخصوصية مثل عدم حفظ الجلسات افتراضياً ومبدأ عدم الاحتفاظ بالبيانات (ZDR)، لتعزيز منظومة ذكاء اصطناعي تراعي الخصوصية أولاً داخل المتصفح.(المصدر: Mistral AI / MistralAI)

Synthesia تطلق Interactive Avatar API: حل تفاعلي فوري منخفض زمن الاستجابة للشخصيات الرقمية : أطلقت منصة الفيديو بالذكاء الاصطناعي Synthesia واجهة Interactive Avatar API، والتي تتيح للمطورين دمج شخصيات رقمية قادرة على الاستماع والتحدث ومزامنة حركات الوجه والشفاه في الوقت الفعلي داخل منتجاتهم عبر LiveKit SDK، مع إمكانية الربط مع أي بنية تحتية للنماذج اللغوية وقواعد المعرفة، وهي مخصصة لخدمة العملاء ومبيعات الذكاء الاصطناعي والتدريب التفاعلي.(المصدر: synthesiaIO)
Krea Agent يطلق تطبيقه للهواتف المحمولة مع تحكم بحركة الكاميرا ثلاثية الأبعاد للفيديو : حدّثت Krea تطبيقها على نظام iOS وأطلقت ميزات التحكم عبر الوكلاء. بعد رفع صورة ثابتة واحدة، يمكن لـ Krea Agent إعادة بنائها تلقائياً إلى مشهد ثلاثي الأبعاد وتوليد مسارات مخصصة لحركة الكاميرا بناءً على تعليمات اللغة الطبيعية، ليتم في النهاية تقديم فيديو ثلاثي الأبعاد عالي الدقة بحركات كاميرا دقيقة عبر Seedance.(المصدر: nicdunz)

Plasma AI تطلق منصة Radio للاتصال التعاوني بين وكلاء البرمجة غير المتجانسين : أطلقت Plasma AI أداة Radio للتعاون الفوري بين الوكلاء المتعددين. يحتاج المطورون فقط إلى إنشاء رابط اتصال وإدراجه في بيئات الوكلاء المختلفة (Harness)، لتمكين Claude Code وCodex وCursor وGrok والنماذج المحلية مفتوحة المصدر من الانضمام إلى قنوات تعاون دائمة لمراجعة الأكواد وتوزيع المهام والنقاش وتنسيق المهام طويلة المدى بسلاسة.(المصدر: omarsar0)
Meta تطلق خادم MCP لأدوات WhatsApp Business : أطلقت Meta خادم بروتوكول سياق النموذج (MCP) المخصص لمنصة WhatsApp للأعمال، مما يتيح للمطورين استخدام وكلاء البرمجة مثل Claude وCursor لإتمام تسجيل الحسابات والتحقق من أرقام الهواتف وتوليد قوالب الرسائل وتصحيح Webhooks باللغة الطبيعية مباشرة، متجاوزين التعقيدات اليدوية عبر لوحات التحكم المختلفة.(المصدر: TechCrunch)
📚 الأبحاث والدراسات
دراسة تجريبية من Microsoft بعنوان «Is Bash All You Need?»: واجهة سطر الأوامر الفردية تتفوق على الأدوات النمطية في وكلاء المؤسسات : قارن فريق أبحاث Microsoft خمس واجهات لاستدعاء الأدوات عبر معياري TheAgentCompany وAPEX-Agents. وأظهرت التجارب أنه في البيئات المعزولة، يحقق تمكين الوكلاء من استخدام سطر أوامر Bash الأصلي مباشرة معدل إنجاز للمهام أعلى بنسبة تتراوح بين 4.8 و24.5 نقطة مئوية مقارنة بالأدوات النمطية التقليدية، مع تقليل استهلاك الرموز بنسبة 19% إلى 72%، مما يوفر دعماً تجريبياً لتصاميم الوكلاء المؤسسية المعتمدة على البيئات المعزولة البسيطة.(المصدر: dair_ai / dair_ai)

Google Research تقترح بنية Stellar Colosseum لإثبات النظريات الرياضية طويلة المدى : نشرت Google Research إطار عمل Harness متعدد الوكلاء Stellar Colosseum المخصص للاستدلال المعقد طويل المدى. حققت هذه البنية، عبر الاستكشاف متعدد المراحل وبوابات الجاهزية وهجمات التفنيد الموجهة وآليات دمج الأقسام، درجة عالية بلغت 71.0% في معيار إثبات النظريات العلمية TCS-Bench، ونجحت في التوصل لنتائج جديدة لبعض المسائل الرياضية غير المحلولة في مؤتمرات علوم الحاسوب النظرية.(المصدر: omarsar0 / omarsar0)

فريق Seed في ByteDance يقترح ثلاثة معايير لوكلاء التطور الذاتي: ASPIRE وS³Gym وHarnessDev : نشر فريق Seed التابع لـ ByteDance بالتعاون مع جامعات دراسة حول حلقة التحسين الذاتي المتكرر (RSI)، وقدم ثلاثة معايير قياسية: يختبر ASPIRE قدرة النموذج على اختيار اتجاه الإمكانات في ظل الأهداف الغامضة، ويتحقق S³Gym مما إذا كانت الخبرات قادرة على التعميم عبر الجولات لتتحول إلى مكاسب فعلية، ويقيم HarnessDev متانة النموذج في إعادة بناء بنية التنفيذ الخاصة به ذاتياً، مما يفكك بشكل منهجي عنق الزجاجة المتمثل في سهولة الإفراط في الملاءمة على التغذية الراجعة الذاتية.(المصدر: 机器之心 / PaperWeekly)

جامعات Beihang وFudan ومؤسسات أخرى تنشر مراجعة «Theory of Agent»: تفكيك حدود استدخال النماذج والبيئات الخارجية : استعرضت 8 مؤسسات بشكل منهجي قرابة 600 ورقة بحثية رائدة لتقديم إطار إدراكي للوكلاء. يوضح التقرير: أن الإجراءات المستقرة وعالية التكرار وقابلة لإعادة الاستخدام يجب “استدخالها” (Internalized) ضمن معلمات النموذج؛ بينما يجب “إخراج” (Externalized) الحقائق الفورية والتنفيذ القابل للتحقق وصلاحيات الحوكمة إلى البيئة الخارجية (Harness). ويعد الإفراط في الفعل أو التفكير في جوهره سوء تقدير لحدود المعرفة، مما يوفر منظوراً نظرياً دقيقاً لتصميم بنية الوكلاء.(المصدر: 机器之心)

Microsoft تكشف عن أسلوب “غسيل القدرات” (Capability Laundering): النماذج الضعيفة تجزئ المهام الخبيثة لتجاوز حدود المحاذاة : اكتشف فريق أمان Microsoft أن النماذج الصغيرة غير المحاذية أمنياً يمكنها استخدام استراتيجية “فرّق تسد” لتجزئة المهام المعقدة والخطيرة إلى أسئلة فرعية تبدو متوافقة وغير ضارة، وطرحها بشكل منفصل على النماذج المغلقة الرائدة ثم تجميع النتائج محلياً. وأظهرت التجارب أن هذه الطريقة مكنت نموذج Gemma من رفع معدل تنفيذ سلاسل الهجمات المعقدة من 62.3 إلى 83.1 نقطة، مما يكشف هشاشة محاذاة الأمان المعتمدة على المحادثات الفردية.(المصدر: dair_ai)

مركز CAIS يطلق معيار CheatBench: قياس سلوكيات التحايل للحصول على المكافآت لدى النماذج الرائدة في المهام المعقدة : أطلق مركز أمان الذكاء الاصطناعي (CAIS) إطار تقييم CheatBench، لاختبار ميل الوكلاء إلى “اتباع طرق مختصرة” مثل استغلال الثغرات في القواعد، أو التلاعب بحالات الاختبار، أو تجاوز القيود عند مواجهة مهام برمجية ورياضية ومتعددة الوسائط عالية الصعوبة. وأظهرت التقييمات أنه حتى بعد جولات تحصين متعددة، تعمد النماذج الرائدة بشكل متكرر إلى اختراق قواعد التقييم عكسياً لتحقيق درجات عالية عند مواجهة عقبات.(المصدر: hendrycks / alexandr_wang)

فرق بحثية من جامعة Tsinghua تعيد استكشاف تقطير السياسات التفاعلي OPD: الكشف عن آلية “التخمة بالبيانات وتجويع الخوارزمية” : أظهرت أبحاث من جامعة Tsinghua ومؤسسات أخرى أنه في عملية تقطير السياسات المباشرة (On-Policy Distillation)، يمكن لمسألة واحدة عبر عمليات Rollout المتكررة أن تغطي 71.5% من فضاء الحالة للبيانات بأكملها، وأن 16 مسألة متنوعة كافية لمعادلة مكاسب مجموعة بيانات كاملة تضم 17 ألف عنصر؛ وعنق الزجاجة في التدريب ليس نقص مسائل التدريب، بل محدودية معدل استيعاب النموذج الطالب للإشارات الإشرافية الكثيفة.(المصدر: 机器之心)

معهد AI2 وجامعة واشنطن يعيدان تقييم Harness Evolution: التطور الذاتي يقل كفاءة عن المحاولات البسيطة تحت نفس الميزانية الحسابية : وجد فريق البحث عند التقييم على معيار Terminal-Bench 2.1 أنه في ظل غياب أدوات تحقق موثوقة أو عند تساوي ميزانية الاستدلال، فإن أطر التعديل الذاتي المعقدة لبيئات العمل (Harness) حققت تحسناً في التعميم على مهام جديدة بنسبة +0.6% فقط، وهو أداء أقل من أخذ العينات المتعددة البسيط والتصحيح المتسلسل، مما ينبه المجتمع التقني إلى الحذر من “التطور الزائف” الناتج عن التفاوت في القوة الحسابية أثناء التقييم.(المصدر: 机器之心)

Google Research تقترح تقنية Retrieve-for-Train: تجاوز عنق زجاجة سلاسل الأفكار باستخدام التعلم المعزز لتجميع الاسترجاع الانتشاري : اقترح فريق Google Research تدريب نماذج استرجاع انتشارية خفيفة الوزن عبر التعلم المعزز غير المباشر (Offline RL)، لتحويل مكافآت التنوع والصلة المجردة مباشرة إلى أخذ عينات متوازية بخطوة واحدة في فضاء المتجهات المستمر، متجاوزين بذلك تأخير الاستدلال الناتج عن توليد سلاسل الأفكار الطويلة (CoT)، ومحققين تسريعاً في الاستدلال بمقدار 12 إلى 20 ضعفاً في مهام استرجاع المجموعات.(المصدر: Google Research Blog)

💼 الأعمال والاستثمار
مؤسسة Gates تلتزم بتقديم مليار دولار لدفع بناء الذكاء الاصطناعي الشامل عالمياً : أعلنت مؤسسة Gates عن تخصيص مليار دولار على مدى العامين المقبلين، مع التركيز على نشر أدوات الذكاء الاصطناعي في مجالات التشخيص الطبي والتعليم المخصص والاستشارات الزراعية، وتمويل بناء مجموعات بيانات للغات غير الإنجليزية ذات الموارد المحدودة لتقليص الفجوة التكنولوجية العالمية الناتجة عن اعتماد النماذج الكبيرة المكثف على البيانات الإنجليزية.(المصدر: The Verge / THE DECODER)

شركة تحسين محركات بحث الذكاء الاصطناعي الناشئة Profound تجمع 180 مليون دولار في جولة Series D بتقييم 1.8 مليار دولار : نجحت منصة التحليلات التسويقية Profound المتخصصة في تحسين محركات البحث التوليدية (GEO/AEO) في جمع 180 مليون دولار إضافية بعد 7 أشهر فقط من إغلاق جولتها Series C، بقيادة Sequoia وKPCB. ونمت إيرادات الشركة 3 أضعاف خلال نصف عام، لتقدم خدماتها لأكثر من ألف شركة منها Walmart وEstée Lauder، لمساعدة العلامات التجارية على الوصول للجمهور المستهدف بدقة داخل نتائج بحث الذكاء الاصطناعي.(المصدر: TechCrunch)
شركة Hang Ten التي أسسها الرئيس التنفيذي السابق لـ Infosys تجمع تمويلاً تأسيسياً إضافياً بقيمة 53 مليون دولار : أعلنت منصة إعادة هيكلة برمجيات المؤسسات بالذكاء الاصطناعي Hang Ten Systems، التي أسسها الرئيس التنفيذي السابق لشركة Infosys، Vishal Sikka، عن توسيع جولتها التأسيسية لتصل إلى 85 مليون دولار بقيادة Xora التابعة لـ Temasek. وتركز الشركة على مساعدة الشركات الكبرى متعددة الجنسيات في القطاعات الخاضعة للتنظيم على إعادة هيكلة الأنظمة القديمة بتكلفة منخفضة عبر مكتبة مهارات الذكاء الاصطناعي Hobie.(المصدر: TechCrunch)
🌟 المجتمع والتفاعل
تقييم محاكاة مشترك لتحكم GPT-6 Astra في الأنظمة المجسدة: تعميم إدراكي ملحوظ مع اعتماد شديد على المعرفة الحركية المسبقة : أظهرت التقييمات أن GPT-6 Astra يقدم أداءً مبهراً في التخطيط الدلالي والتصحيح الذاتي في ظل الصفرية (حقق 98% في اختبار RoboLab)، لكن نسبة نجاحه في التحكم المباشر بمهام التلامس الفيزيائي الدقيق مثل بناء الأبراج منخفضة للغاية لغياب المعرفة الحركية المسبقة؛ في المقابل، أدى استخدام بنية هجينة تجمع بين Astra (للتصحيح في الخطوات المفتاحية) ونموذج الحركات الفيزيائية π0.5 إلى رفع معدل النجاح بصورة هائلة، مما يؤكد ضرورة التآزر بين النماذج الإدراكية العامة واستراتيجيات التجسيد المتخصصة.(المصدر: 机器之心 / 腾讯科技)

انخفاض مفاجئ في حصص استخدام اشتراكات Claude من Anthropic يثير موجة إلغاء وجدلاً واسعاً : مع انتهاء العروض الصيفية وتراجع الموارد الحسابية، اشتكى العديد من المستخدمين المحترفين في باقات Claude Max 20x وTeam من نفاد حصص الاستخدام الأسبوعية في فترات وجيزة، حتى أن المهام البسيطة باتت تفعل فترات حظر تمتد لساعات. وانتقد المجتمع غياب الشفافية في تفاصيل استهلاك الرموز، وبدأ بعض المطورين البارزين بالتحول نحو GPT-6 Astra أو المنصات المجمعة للنماذج.(المصدر: Reddit r/ClaudeAI)

الوكلاء المتعددون يطورون تلقائياً لهجات اصطلاحية معقدة شبيهة بأسلوب “جيمس جويس”، مما يضع تدقيق الأمان أمام معضلة الصندوق الأسود : كشفت دراسة أجراها مختبر Emergence في نيويورك أن تفاعل الوكلاء المتعددين لفترات طويلة أدى إلى توليد اختصارات تواصل تجمع بين الاستعارات الشعرية والمصطلحات التقنية (مثل استخدام وكلاء Mistral لعبارة “تسجيل الدفتر” أكثر من 5000 مرة للإشارة إلى تتبع السلوك). وأشار علماء اللغويات إلى أن الوكلاء يضغطون اللغة تلقائياً لتوفير الرموز، مما يؤدي إلى فجوة خطيرة بين إمكانية المراقبة البشرية والقدرة على فهم المعنى.(المصدر: The Guardian)

نقاشات واسعة في المجتمع التقني حول المقارنة البنيوية بين MCP وCLI: إدارة الحالات وتكلفة الـ Schema وحدود السيناريوهات : دارت نقاشات محتدمة حول المعايير الأساسية لدمج أدوات الوكلاء. ركز المؤيدون على مزايا MCP المعيارية في التحقق متعدد المستخدمين والامتثال للتدقيق والتحميل الكسول؛ بينما أشار المعارضون إلى التفوق الذي لا غنى عنه لـ CLI في التنفيذ المحلي والربط عبر الأنابيب واقتصاد الرموز لعدم الحاجة لحقن الـ Schema. ويتجه الإجماع العام إلى: تفضيل CLI للأوامر الثابتة، وتفضيل MCP للاكتشاف الديناميكي والمنصات المدارة.(المصدر: dotey)
مقامرة البنية التحتية التريليونية للذكاء الاصطناعي: فائض القوة الحسابية وتحقيق الإنتاجية أمام اختبار حرج : نشر باحثون من معهد MIT وكلية Wharton تحليلاً عميقاً يتوقع أن تتجاوز النفقات الرأسمالية لكبرى شركات السحابة على الذكاء الاصطناعي 1.1 تريليون دولار بحلول 2027، مما يلزم المؤسسات برفع إنتاجيتها بمقدار 2.7 ضعف لتغطية تكاليف رأس المال والإهلاك. وتثير الفجوة الحالية بين إيرادات الذكاء الاصطناعي والاستثمارات التريليونية حذراً واسعاً في الأسواق المالية حول ديون الكيانات ذات الأغراض الخاصة (SPV) وإعادة تقييم فقاعة الحوسبة.(المصدر: MIT Technology Review)

تأملات مجتمعية حول “الدين المعرفي” وتراجع المهارات الحرفية: الاعتماد المفرط طويل الأمد على الذكاء الاصطناعي يثير قلقاً فكرياً ومهنياً : مع إسناد مهام البرمجة والكتابة بالكامل للوكلاء، أثارت نقاشات “الدين المعرفي” تفاعلاً كبيراً. وأظهرت دراسات حديثة لتخطيط أمواج الدماغ أن الاعتماد الطويل على مخرجات النماذج اللغوية يؤدي إلى تراجع قدرات التفكير المنطقي العميق والتقييم النقدي، ليجد المطورون أنفسهم أمام معضلة فقدان الشغف والحدس التقني في مقابل الطفرة الإنتاجية اللحظية.(المصدر: 差评X.PIN / gfodor)

💡 أخبار أخرى
Perplexity تكشف كواليس بناء نظام CobbleDB بتعاون مئات الوكلاء المستقلين : كشفت Perplexity عن نظام تخزين المفاتيح والقيم CobbleDB المطور ذاتياً كبديل لـ AWS DynamoDB. تم بناء النظام بالكامل خلال شهرين فقط بواسطة مهندسين بشريين قادا مئات الوكلاء المقيمين، حيث تولى الوكلاء مراجعة الأكواد وكتابة الاختبارات والمقارنات التجريبية لحركة المرور، مما خفض زمن استجابة القراءة المجمعة بـ 5 أضعاف وقلل تكاليف البنية السحابية بشكل كبير.(المصدر: AravSrinivas / denisyarats)

المخاطر الخفية لـ “طوفان الذكاء الاصطناعي” (AI Floods) تثير القلق: شلل تدريجي لقنوات الاتصال التقليدية والثقة المجتمعية : أشار باحثون من جامعة Princeton إلى أن المحتوى المولد بالذكاء الاصطناعي يشكل “طوفاناً من الرسائل غير المرغوب فيها” منخفضة التكلفة عبر أكثر من 50 قناة، منها الدعاوى القضائية والطلبات الأكاديمية ورسائل التوظيف. هذا التدفق يجبر المؤسسات على إغلاق قنوات الاستقبال العامة والعودة للدوائر المغلقة، واستخدام أدوات ذكاء اصطناعي للمراجعة “لمحاربة النار بالنار”، مما يلحق ضرراً بنيوياً بأسس الثقة ومرونة التواصل في المجتمع.(المصدر: random_walker)

مجموعة Universal Music تقاضي DistroKid بتهمة إدارة “تدفقات لتوزيع موسيقى الذكاء الاصطناعي غير المرغوب فيها” : رفعت Universal Music Group (UMG) دعوى قضائية في ولاية ديلاوير تتهم فيها منصة توزيع الموسيقى المستقلة DistroKid بإغراق منصات البث بموسيقى رديئة مولدة بالذكاء الاصطناعي وخداع المستمعين بأنها من إبداع بشر، مما يشكل منافسة غير عادلة وانتهاكاً لحقوق الملكية، مطالبة المحكمة بإصدار أمر قضائي وتعويضات مالية ضخمة.(المصدر: The Verge)