ASUS ExpertCenter Pro ET900N G3: локальные модели за $100 тысяч (Рубрика #AI4SDLC)
Посмотрел опубликованный 30 июля 2026 года тест Алекса Зискинда «This was a data center a year ago… Now it's on my desk». Кажется, свои локальные модели никогда ещё не были так близко. Осталась мелочь: найти $100 тысяч на собственный настольный суперкомпьютер ASUS ExpertCenter Pro ET900N G3.
И это почти не преувеличение. Один из американских продавцов указал для системы цену $99,999.99. За эти деньги получаем башню на архитектуре NVIDIA DGX Station: 72-ядерный Grace CPU, Blackwell Ultra GPU, до 20 PFLOPS в FP4 по спецификациям NVIDIA и 748 ГБ когерентной памяти. Год назад такой объём AI-вычислений ассоциировался скорее со стойкой, а теперь коробку можно поставить рядом со столом. Правда, с максимальным энергопотреблением системы до 1,6 кВт это всё-таки больше сервер в офисе, чем новый домашний PC:)
Самое интересное здесь - память. В рекламной строке 748 ГБ выглядят как один огромный общий пул, но физически он состоит из двух очень разных частей:
- 252 ГБ HBM3e с пропускной способностью до 7,1 ТБ/с;
- 496 ГБ LPDDR5X с пропускной способностью до 396 ГБ/с;
- между Grace и Blackwell - когерентный NVLink-C2C, поэтому GPU может обращаться к обеим областям в общем адресном пространстве.
Это снимает жёсткую границу «модель не поместилась в VRAM - запуск невозможен», но не отменяет физику. В тесте квантованная до NVFP4 GLM-5.2 занимает около 465 ГБ и целиком в HBM не помещается. Она запускается локально, однако части весов приходится читать из более медленной памяти, поэтому скорость заметно уступает моделям, которые полностью остаются в HBM. Когерентная память - это не магические 748 ГБ одинаково быстрой VRAM.
Вторая важная часть видео - это не скорость одного чата, а конкурентный режим работы моделей. На NVIDIA Nemotron 3 Super 120B Алекс запускает до 128 параллельных агентов. В зависимости от модели и числа запросов суммарная производительность доходит до нескольких тысяч токенов в секунду. Это работает за счёт continuous batching: GPU собирает много запросов и эффективнее обрабатывает их вместе. При этом отдельный агент ждёт дольше - общий throughput растёт не бесплатно.
И вот здесь система становится интересной не богатому любителю, а команде. Один локальный узел может обслуживать coding agents, исследовательские задачи и внутренние AI-сервисы, не отправляя код и данные во внешний API. Можно держать десятки долгоживущих агентов, экспериментировать с большими open models и получать предсказуемую инфраструктуру под высокой постоянной нагрузкой.
Но я бы поспорил с формулировкой «нулевая цена токена». Цена просто переезжает из API-счёта в капитальные затраты, электричество, охлаждение, хранение, обновления и эксплуатацию. А ещё локальная модель должна пройти тот же quality gate, что и облачная: 128 агентов бесполезны, если каждый из них быстро производит посредственный результат.
Для меня главный вывод такой: локальный AI действительно сменил класс. Теперь «локально» может означать не маленькую модель на ноутбуке, а сотни миллиардов параметров и целую команду агентов на одной машине. Железо не спроектирует за нас агентную архитектуру и не решит задачу качества, но резко поднимает потолок того, что можно собрать в собственном контуре.
Свои локальные модели ещё никогда не были так близко. Особенно если у вас завалялись $100 тысяч, отдельная линия питания и очень убедительный бизнес-кейс:)
P.S.
А моя жаба раскошелилась только на комп "Beelink GTR9 Pro AMD Ryzen™ AI Max+ 395" (или вот он же, но уже в России), которого тоже хватает для экспериментов:)
#AI #AI4SDLC #Agents #Engineering #Architecture #Hardware