Компанія AMD представила Instella-MoE-16B-A3B — повністю відкриту мовну модель штучного інтелекту з архітектурою Mixture-of-Experts (MoE), яка використовує 16 мільярдів параметрів, але активує лише 2,8 мільярда на кожен токен. Модель була навчена з нуля на графічних процесорах AMD Instinct MI300X та MI325X.
Інновації в архітектурі Mixture-of-Experts
Instella-MoE-16B-A3B застосовує технологію Mixture-of-Experts, що дозволяє динамічно активувати лише частину параметрів під час обробки кожного токена. Це значно підвищує ефективність обчислень і знижує енергоспоживання без втрати точності. В основі моделі лежать механізми Gated MLA та FarSkip-Collective, які оптимізують маршрутизацію експертів і покращують продуктивність.
Відкритість і доступність для дослідників
AMD оприлюднила не тільки ваги моделі, але й всі етапи навчання, суміші даних, конфігурації та код для інференсу. Це відкриває широкі можливості для науковців та розробників, які можуть досліджувати, адаптувати та вдосконалювати модель без обмежень ліцензій. Такий підхід сприяє демократизації доступу до потужних LLM і підтримує розвиток українських AI-стартапів та наукових ініціатив.
Використання GPU AMD Instinct для машинного навчання
Навчання нейромережі Instella-MoE-16B-A3B проводилось на спеціалізованих графічних процесорах AMD Instinct MI300X та MI325X, які оптимізовані для високопродуктивних обчислень і машинного навчання. Це демонструє зростання ролі AMD у сегменті AI-апаратного забезпечення, що може посилити конкуренцію на ринку та надати нові можливості для українських дата-центрів і компаній, які працюють з AI.
Ключові факти
- Instella-MoE-16B-A3B — це модель із 16 млрд параметрів, з яких 2,8 млрд активуються на кожен токен.
- Використовується архітектура Mixture-of-Experts із Gated MLA та FarSkip-Collective для оптимізації роботи.
- Модель навчена з нуля на GPU AMD Instinct MI300X та MI325X.
- AMD оприлюднила ваги, дані, конфігурації та код для інференсу моделі.
- Проєкт підвищує доступність потужних LLM для дослідників і розробників.
Що це означає
Відкриття Instella-MoE-16B-A3B дозволяє українським дослідникам та компаніям працювати з передовою технологією AI без обмежень пропрієтарних рішень. Це сприятиме розвитку штучного інтелекту в Україні, зокрема у сфері автоматизації, машинного навчання та робототехніки. Крім того, використання AMD GPU відкриває можливості для локалізації інфраструктури та зниження залежності від іноземних апаратних платформ.
FAQ
Що таке модель Mixture-of-Experts?
Це архітектура нейромережі, яка динамічно активує лише частину параметрів (експертів) для кожного вхідного елемента, що підвищує ефективність і знижує обчислювальні витрати.
Чому важливо, що модель повністю відкрита?
Відкритість моделі дає змогу дослідникам і розробникам вільно використовувати, модифікувати та впроваджувати її без ліцензійних обмежень, сприяючи швидкому розвитку AI-технологій.
Як це вплине на український ринок AI?
Відкриті рішення та локалізація апаратної бази допоможуть розвивати власні AI-продукти, підвищувати кваліфікацію фахівців і зменшувати залежність від закордонних технологій.
Для читачів, які паралельно вивчають фінансові сервіси у крипторинку, корисним буде окремий гід про криптозайми онлайн та критерії вибору платформи.
Джерело: www.marktechpost.com
- Юридичні справи у криптосфері: розвиток розслідувань пов’язаних з FTX, Polymarket та маніпуляціями на ринку - 8 Серпня, 2026
- Мінфін США запровадив санкції проти іранських компаній, що приймали біткоїни за прохід через Ормузьку протоку - 8 Серпня, 2026
- AMD представила відкриту нейромережу Instella-MoE-16B-A3B на базі власних GPU - 7 Серпня, 2026




