Microsoft MDASH набирає 95,95% на CyberGym, випереджаючи Claude Mythos і GPT-5.6 Sol

Microsoft випустила свою першу спеціалізовану кібербезпекову модель MAI-Cyber-1-Flash 27 липня та інтегрувала її в MDASH — систему пошуку вразливостей, яка набрала 95,95% у бенчмарку CyberGym. Компанія заявляє, що ця конфігурація обганяє Mythos 5 від Anthropic і GPT-5.6 Sol від OpenAI, водночас коштуючи на 50% менше за поточну найкращу збірку MDASH від Microsoft. CyberGym — це бенчмарк, який пропонує агентам ШІ відтворити 1 507 відомих вразливостей у 188 проєктах з відкритим кодом, оцінюючи їх за часткою успішно відтворених випадків у контрольованому середовищі. Генеральний директор Microsoft Сатья Наделла сказав, що об’єднана система забезпечує продуктивність світового рівня за половину вартості провідних моделей — це перша подія, коли ефективніша модель Microsoft обійшла щільні моделі state-of-the-art, створені для загальних можливостей.

MDASH випереджає конкуруючі моделі в бенчмарку CyberGym

Система MDASH від Microsoft набрала 95,95% у CyberGym, повідомляє компанія. Цей результат поставив її вище GPT-5.5 Cyber (85,6%), Mythos 5 (83,8%), GPT-5.6 Sol (83,6%) та Gemini 3.5 Flash Cyber (83,2%). Результат є самозаявленим Microsoft і на час публікації не з’явився в публічному лідерборді CyberGym, хоча бенчмарк використовує публічний тестовий набір і визначену метрику успіху. Оцінка відповідає приблизно на 10 пунктів більше за попередній результат GPT-5.5 Cyber і на 7,5 пункту вище за попередній результат MDASH.

MAI-Cyber-1-Flash виконує 90% навантаження з резервною підтримкою GPT-5.4

MAI-Cyber-1-Flash не працює самостійно. Microsoft каже, що він обробляє до 90% завдань, тоді як MDASH маршрутизує найскладніші 10% до GPT-5.4. Модель — це ШІ, який міркує над кодом, тоді як MDASH — це «оснастка»: механізм, що включає агентів, інструменти, перевірки та робочий процес, які визначають, де шукати, оскаржують підозрілі знахідки, прибирає дублікати й доводить, що баг можна відтворити. MDASH використовує понад 100 спеціалізованих агентів, призначених для аудиту коду, дебатування того, чи є знахідка справжньою, та побудови proof of concept, який демонструє наявність вади.

Microsoft MDASH system architecture

Microsoft відкриває приватний прев’ю через портал Defender

Microsoft переводить MDASH у приватне прев’ю через Microsoft Security Exposure Management у порталі Defender. Клієнти можуть сканувати Git-репозиторії, бачити знахідки, відсортовані від малоймовірних до доведених, і використовувати Defender CLI, щоб генерувати запропоновані виправлення коду для перегляду розробниками. Наразі прев’ю обмежує репозиторії приблизно 256MB і дозволяє один одночасний скан на одного орендаря. Project Perception, як очікується, розширить той самий підхід із багатьма агентами за межі сканування коду — на ширші сценарії моніторингу загроз і ремедіації.

FAQ

Який результат показав MDASH від Microsoft у CyberGym? Microsoft каже, що MDASH набрав 95,95% у CyberGym — бенчмарку, який пропонує агентам ШІ відтворити 1 507 відомих вразливостей у 188 проєктах з відкритим кодом.

Як MAI-Cyber-1-Flash розподіляє своє навантаження? Microsoft каже, що MAI-Cyber-1-Flash обробляє до 90% завдань, тоді як MDASH маршрутизує найскладніші 10% до GPT-5.4. Система використовує понад 100 спеціалізованих агентів, щоб аудити код і валідовувати знахідки.

Які обмеження приватного прев’ю MDASH? Прев’ю наразі обмежує репозиторії приблизно 256MB і дозволяє один одночасний скан на одного орендаря через Microsoft Security Exposure Management у порталі Defender.

Застереження: інформація на цій сторінці може походити зі сторонніх джерел і надається виключно для ознайомлення. Вона не відображає позицію чи думку Gate і не є фінансовою, інвестиційною чи юридичною консультацією. Торгівля віртуальними активами пов’язана з високим ризиком. Будь ласка, не покладайтеся лише на інформацію з цієї сторінки під час прийняття рішень. Детальніше дивіться у Застереженні.
Прокоментувати
0/400
Немає коментарів