Photon-1 від Induction Labs перевершує Google Gemini, використовуючи на 30× менше обчислень

Induction Labs представила Photon-1 23 липня 2026 року — першу з того, що компанія називає «моделями уяви»: новий клас базової архітектури, створений, щоб навчатися на відео інтернет-масштабу без участі пре-тренінгу мічених прикладів дій. Трансформер на 106 мільярдів параметрів із розрідженою сумішшю експертів (sparse mixture-of-experts) і 5 мільярдами активних параметрів навчали на приблизно 575 мільйонах кадрів записів комп’ютерних екранів — це еквівалент 18 років відео, взятого з частотою один кадр за секунду. Компанія стверджує, що Photon-1 перевершує Gemini 3.1 Flash-Lite від Google на внутрішніх бенчмарках використання комп’ютера, попри те, що його навчали щонайменше у 30 разів меншим обсягом обчислень, а вартість обслуговування становить приблизно утричі менше за мільйон токенів: $0,11 проти $0,36 у Gemini. Модель кидає виклик давущому припущенню в ШІ: що для навчання машин діяти потрібні ретельно розмічені приклади кожної дії, яку вони мають виконувати. Підхід Induction Labs усуває критичну «вузьку горловину», даючи змогу машинам опановувати процедурні знання просто спостерігаючи немарковане відео з комп’ютерних інтерфейсів у використанні.

Архітектура Photon-1 і специфікації тренування

Photon-1 навчали з нуля за один епох на наборі даних, зведеному з початкового індексу у 2 мільярди публічних відео: їх відфільтрували до приблизно 2 мільйонів записів екрана та прибрали надлишкові кадри внутрішньою моделлю виявлення ключових кадрів. Процес навчання вимагав приблизно 30 000 GPU-годин NVIDIA H200 і 4,4 × 10²² FLOPs. Кожен кадр відео стискають до 960 дискретних токенів через скалярне скінченне квантування, що займає лише 2,2 кілобайта — приблизно в 100 разів менше, ніж наявні OCR та мультимодальні представлення, — зберігаючи текст, макет і зміни стану. Диференціальний латентний енкодер обробляє кадри як пари, кодує різниці між послідовними станами, а не абсолютний вміст кадрів. Модель прогнозує майбутні кадри автoрегресійно в навчальному просторі представлень, використовуючи objective «наступний латентний токен». Наведені Induction Labs результати бенчмарку містять важливі застереження: сам бенчмарк є внутрішнім і не опублікованим, тож результати неможливо незалежно відтворити, а оцінка обчислень для Gemini є власною консервативною проєкцією Induction Labs, а не підтвердженими даними.

Стиснення моделей уяви та процес донавчання (finetuning)

Перетворення спостережних знань на робочого агента вимагало другого етапу. Induction Labs донавчала Photon-1 на менш ніж 35 000 розмічених траєкторій використання комп’ютера, щоб навчити коректному формату дій, додаючи спеціальні токени, які дозволяють моделі генерувати команди клавіатури та миші. Під час інференсу система працює у два кроки: спершу уявляє наступний стан, який просуватиме виконання задачі, а потім генерує дію, призначену для досягнення цього стану. Далі відбувалося онлайн-навчання з підкріпленням: реальні прогонки (rollouts) у середовищах Linux для п’яти робочих столів, програмна верифікація результатів і сигнали винагороди, що спрямовували подальше покращення. Коли модель донавчили на 20 000 партій турнірної гри в checkers, Photon-1 показала кращі результати, ніж обидва базові варіанти — з візуальним енкодером і базовий варіант мовної моделі такого ж розміру — і на моделюванні світу, і на якості ходів. На 10 000 синтетично згенерованих більярдних іграх вона досягла середньої абсолютної похибки 0,47 у прогнозуванні позиції кулі — проти 1,15 для базового LLM і 1,44 для візуального базового варіанту. Модель також перейняла патерни людської поведінки з даних пре-тренінгу: вона навчилася підказувати в «у-віртуальній-машині» клон ChatGPT, перевіряти свої виходи та скеровувати розмову, доки задача не буде завершена.

Розвиток world model у 2026 році

Photon-1 з’являється в момент, коли індустрія ШІ переходить до того, що дослідники загалом називають «world models» — систем, які будують внутрішні уявлення про те, як середовище змінюється у відповідь на дії, а не просто передбачають текст або генерують ізольовані відеофрагменти. У травні Google DeepMind випустила Genie 3 — реальну інтерактивну world model у реальному часі, здатну генерувати стійкі 3D-середовища зі швидкістю 24 кадри за секунду з тексту або зображень, з самонавченою фізикою замість жорстко прописаних правил. Платформа NVIDIA Cosmos, що пропонує відкритовагові world foundation models, натренована на 20 мільйонах годин реальних даних, перевищила два мільйони завантажень і впроваджується робототехнічними компаніями, зокрема 1X, Figure AI та Agility, для генерації синтетичних тренувальних даних. World Labs Фей-Фей Лі запустила Marble — комерційно доступну систему для створення редагованих 3D-світів з тексту, зображень або відео. AMI Labs Янна ЛеКуна — за повідомленнями, оцінювана у €3 мільярди до випуску продукту — залучила €500 мільйонів, щоб працювати над архітектурами у стилі JEPA, де абстрактні представлення вивчаються шляхом прогнозування в латентному просторі, а не в пікселях. Інші помітні розробки включають Gen-4.5 від Runway, яку компанія прямо позиціонує як «world model» із реалістичною фізикою, та DreamZero — world action model із 14 мільярдами параметрів, яка продемонструвала сильне крос-перенесення між «тілесностями» (cross-embodiment transfer) від людського відео до керування роботом, використовуючи лише візуальну інформацію без розмічених міток дій.

Поширені запитання

Що Induction Labs представила 23 липня 2026 року?

Induction Labs представила Photon-1 — першу «модель уяви»: трансформер на 106 мільярдів параметрів із розрідженою сумішшю експертів (sparse mixture-of-experts) і 5 мільярдами активних параметрів, навчений приблизно на 575 мільйонах кадрів немаркованих записів комп’ютерних екранів. Модель вчиться користуватися комп’ютером, дивлячись відео без мічених дій під час пре-тренінгу.

Як продуктивність Photon-1 порівнюється з Google Gemini 3.1 Flash-Lite?

Induction Labs стверджує, що Photon-1 перевершує Gemini 3.1 Flash-Lite від Google на внутрішніх бенчмарках використання комп’ютера, попри те, що його навчали щонайменше у 30 разів меншим обсягом обчислень. Компанія повідомляє про витрати на інференс у $0,11 за мільйон токенів проти $0,36 для Gemini. Бенчмарк внутрішній і не опублікований, а оцінка обчислень для Gemini є власною проєкцією Induction Labs.

Які події у сфері world model відбулися у 2026 році?

У травні Google DeepMind випустила Genie 3 — реальну інтерактивну world model, що генерує стійкі 3D-середовища зі швидкістю 24 кадри за секунду. Платформа NVIDIA Cosmos перевищила два мільйони завантажень і впроваджується робототехнічними компаніями, зокрема 1X, Figure AI та Agility. World Labs Фей-Фей Лі запустила Marble для створення редагованих 3D-світів. AMI Labs Янна ЛеКуна залучила €500 мільйонів, щоб працювати над архітектурами у стилі JEPA.

Застереження: інформація на цій сторінці може походити зі сторонніх джерел і надається виключно для ознайомлення. Вона не відображає позицію чи думку Gate і не є фінансовою, інвестиційною чи юридичною консультацією. Торгівля віртуальними активами пов’язана з високим ризиком. Будь ласка, не покладайтеся лише на інформацію з цієї сторінки під час прийняття рішень. Детальніше дивіться у Застереженні.
Прокоментувати
0/400
Немає коментарів