Microsoft merilis model keamanan siber khusus pertamanya, MAI-Cyber-1-Flash, pada 27 Juli dan mengintegrasikannya ke MDASH, sebuah sistem berburu kerentanan yang meraih 95,95% di benchmark CyberGym. Perusahaan tersebut mengatakan konfigurasi ini mengungguli Mythos 5 milik Anthropic dan Sol GPT-5.6 milik OpenAI sekaligus dengan biaya 50% lebih rendah daripada setup MDASH terbaik perusahaan saat ini. CyberGym adalah benchmark yang meminta agen AI untuk mereproduksi 1.507 kerentanan yang diketahui di 188 proyek open-source, menilainya berdasarkan persentase yang berhasil direproduksi dalam lingkungan terkontrol. CEO Microsoft Satya Nadella menyatakan sistem gabungan tersebut memberikan performa kelas dunia dengan biaya setara setengah dari model-model terdepan, sekaligus menandai pertama kalinya model yang berfokus pada efisiensi dari Microsoft mengalahkan model state-of-the-art yang padat dan dibangun untuk kapabilitas umum.
MDASH Mengungguli Model Saingan di Benchmark CyberGym
Sistem MDASH milik Microsoft mencetak 95,95% di CyberGym, menurut perusahaan. Hasil ini menempatkannya di depan Cyber GPT-5.5 sebesar 85,6%, Mythos 5 sebesar 83,8%, Sol GPT-5.6 sebesar 83,6%, dan Gemini 3.5 Flash Cyber sebesar 83,2%. Hasil tersebut dilaporkan sendiri oleh Microsoft dan belum muncul di papan peringkat publik CyberGym pada waktu publikasi, meskipun benchmark ini menggunakan public test set dan metrik keberhasilan yang ditetapkan. Skor tersebut setara dengan kira-kira 10 poin di atas Cyber GPT-5.5 dan 7,5 poin di atas hasil sebelumnya MDASH.
MAI-Cyber-1-Flash Menangani 90% Beban Kerja dengan Cadangan GPT-5.4
MAI-Cyber-1-Flash tidak bekerja sendirian. Microsoft mengatakan ia menangani hingga 90% tugas, sementara MDASH mengarahkan 10% paling sulit ke GPT-5.4. Model ini adalah AI yang bernalar atas kode, sedangkan MDASH adalah wadah—mesin yang mencakup agent, tools, checks, dan workflow untuk memutuskan ke mana harus melihat, menantang temuan yang dicurigai, menghapus duplikat, dan membuktikan apakah bug dapat dipicu. MDASH menggunakan lebih dari 100 agent khusus yang ditugaskan untuk mengaudit kode, berdebat apakah sebuah temuan benar-benar nyata, dan menyusun proof of concept yang menunjukkan kelemahannya ada.

Microsoft Membuka Pratinjau Pribadi lewat Portal Defender
Microsoft memosisikan MDASH untuk pratinjau pribadi melalui Microsoft Security Exposure Management di portal Defender. Pelanggan dapat memindai repositori Git, melihat temuan yang diberi peringkat dari yang tidak mungkin hingga terbukti, serta menggunakan Defender CLI untuk menghasilkan usulan perbaikan kode untuk ditinjau pengembang. Pratinjau ini saat ini membatasi repositori hingga sekitar 256MB dan mengizinkan satu pemindaian secara bersamaan per tenant. Project Perception diperkirakan akan memperluas pendekatan multi-agent yang sama melampaui pemindaian kode menjadi pemantauan ancaman dan alur kerja mitigasi yang lebih luas.
FAQ
Berapa skor yang dicapai MDASH milik Microsoft di CyberGym?
Microsoft mengatakan MDASH meraih 95,95% di CyberGym, sebuah benchmark yang meminta agen AI untuk mereproduksi 1.507 kerentanan yang diketahui di 188 proyek open-source.
Bagaimana MAI-Cyber-1-Flash mendistribusikan beban kerjanya?
Microsoft mengatakan MAI-Cyber-1-Flash menangani hingga 90% tugas, sementara MDASH mengarahkan 10% paling sulit ke GPT-5.4. Sistem ini menggunakan lebih dari 100 agent khusus untuk mengaudit kode dan memvalidasi temuan.
Apa batasan untuk pratinjau pribadi MDASH?
Pratinjau ini saat ini membatasi repositori hingga sekitar 256MB dan mengizinkan satu pemindaian secara bersamaan per tenant melalui Microsoft Security Exposure Management di portal Defender.