# Steelman Labs
Мы попробовали сделать агента для QA мобильных игр, уперлись в качество моделей и пошли работать на своих работах. Не обучать же свои модели, в конце-концов! Но что если... обучать свои модели?
Мы не настолько безумцы, чтобы в 2026 пытаться делать лабу со своими VLM. Конкурировать с Антропиком и Гуглом на их территории? Мы недостаточно Stanford drop-outs для этого. Но я продолжал изучать.
Видели гуманоидных роботов, которые с недавних пор хайпуют? Танцуют, исполняют кунфу и вроде как вот-вот должны заменить всех рабочих? Они появились когда в робототехнике придумали Visual-Language-Action модели или VLA. Это способ сделать из VLM модель для плавной и быстрой манипуляции.
Последний раз я трогал робототехнику несколько лет назад, когда работал в Planet Farms, и тогда VLA были на уровне ранних прототипов. Вчитавшись я узнал, что с тех пор многое изменилось. VLA стали в сто раз более семпл-эффективными. Обучить VLA управлять роботом стало возможно буквально в домашних условиях, ведь каждый может скачать SmolVLA на 700m параметров и обучать её хоть на одной A100.
Что если рассмотреть навигацию по GUI как робототехнику в 2D и обучать для этого VLA?
Сейчас весь computer use работает на том, что к LLM изолентой прикрутили тулы для работы с экраном. Все решения, от Claude Computer Use до специальных моделей вроде MobileAgentv3 и UI-TARS, построены на цикле скриншот-ризонинг-туллколл. Датасеты и бенчмарки так же заточены под этот сетап: статичные картинки, ограниченный набор действий (в некоторых browser use бенчмарках вообще нет никаких действий кроме кликнуть и писать текст!), простыни DOM и Accessibility tree в промпте. И главное: задачи подобраны так, чтобы такой агент мог их решить.
В итоге в топе лидербордов скоры 80%+, а когда сам пробуешь запустить, или ничего не работает совсем, или абсурдно медленно и дорого. Демо-видео всех computer use продуктов ускорены в 2-3 раза, потому что иначе это невозможно смотреть. Чем дольше я в это закапывался, тем больше приходил к выводу: сообщество построило из задачи computer use соломенное чучело. С точки зрения тогдашних бенчмарков (OSWorld, WebArena, WebVoyager) интерфейсы это скриншоты над которыми можно думать сколько угодно долго. В такой постановке задача была быстро решена – все лабы выпустили по computer use продукту и отчитались о высоких результатах. Однако за этим не последовало внедрений или пользователей. OpenAI даже закрыли свой агентский браузер.
Потому что это соломенное чучело не похоже на реальные интерфейсы. В противоположность соломенному чучелу (starwman) есть меметичный обратный прием: steelman. Это когда ты берешь чужой аргумент и споришь с его сильнейшей версией. Как сделать steelman задачи computer use?
Я пришел к простому принципу: computer use агент должен иметь возможность использовать любой интерфейс, который использует человек, и таким же образом, как его использует человек. Если агент не видит анимации, то фундаментально не может использовать целый класс интерфейсов. Значит тебе всегда нужны будут костыли, чтобы обходить эти ограничения и это не заработает на масштабе. Если твой агент ломается без accessibility tree, то он не заработает на масштабе. Если он не может нажимать те же кнопки, что ты нажимаешь на своей клавиатуре, то... думаю вы поняли.
И вот здесь очень быстро приходишь к идее, что невозможно построить computer use на скриншотах и тулколлах большой моделью. Никогда не заработает достаточно быстро. Необходимо воспринимать экран как видео, управлять девайсом через клавиатуру и курсор, иметь сопоставимую с человеком реакцию. Ответ: VLA для computer use.
Тогда картинка сложилась. LLM отличные планировщики, но у них проблемы с кликами и прочими манипуляциями. В современных computer use бенчмарках (OSWorld V2 и Agent's Last Exam) это хорошо видно: модели решают только те задачи, где могут избежать интерфейса вообще. Использовать фронтир LLM для интерфейсов ещё и безумно дорого: мы заставляем 10Т модели отвечать (текстом!) куда они хотят кликнуть на экране.
Можно получить human-level computer use не отказываясь от той основы, что дают LLM. Можно сделать VLA, которая встраивается в оркестратор и служит для него манипулятором. Клод думает и занимается планированием, а наша модель занимается зрением и манипуляцией. System 2 и System 1. Раз нашей модели не надо думать наперед, то она может быть не очень большой. Раз Клоду не надо делать клики, то его контекст не забивается. Значит весь сетап будет в целом дешевле и быстрее, а может даже и лучше по качеству. И создание такой VLA не потребует фандрейзить на конкурента Антропика.
Я пришел с этой идей к Максу. Мы оба загорелись ей гораздо больше, чем Tapagent. Потому что это путь к технологической компании. Продавая computer use по API, MCP для computer use в каждый Клод и всё такое, можно стать чем-то вроде Eleven Labs (которые продают text-to-speech по API и стоят 11 миллиардов). А ведь рынок computer use потенциально гораздо больше, чем любой TTS.
Мы стали вечерами и выходными заниматься этой идеей. В безработный период я писал в канале, что уже не уверен, могу ли я работать по много часов. Теперь знаю: оказывается я могу работать и по 16 часов в день. Моя позиция в PLATA требовала вкладываться и эту идею я хотел основательно докопать. В результате это был довольно трудный период для моей кукушки. Параллельно ещё и книгу надо было редактировать по редким правкам от моего издательства. Я просто жил работой.
Со Steelman Labs с самого начала пошло гораздо лучше, чем было с TapAgent. Я никогда в жизни не видел, чтобы в ML что-то так быстро заводилось: имея лишь вечера и выходные мы сделали прототип VLA для computer use и она сходу побила первый бенчмарк. Затем мы провели несколько экспериментов и увидели, что доливание разных данных увеличивает качество. Это можно скейлить!
Мы всюду натыкались на людей, которые готовы помочь. Я позвал своего бывшего босса из Planet Farms (associate professor Oxford, руководит лабой CV и робототехники) эдвайзить нас по технической части. Несколько знакомых ребят из CV мира оказались готовы вписаться в проект в расчете на будущую перспективу. Начался бесконечный поток знакомств с разными фондами. Мы пообщались с СЕО Strawberry и услышали что да, у них есть такая проблема и манипуляцию приходится решать костылями. Когда мы получили первый ангельский чек и на горизонте замаячил полноценный pre-seed фандрейзинг, я принял решение об уходе из PLATA.
И вот мы здесь! В моей жизни началась арка стартапера, я самопровозглашенный СТО steelmanlabs.com и мне это очень нравится. Я как никогда чувствую себя на своём месте и максимальную сонаправленность между тем, что я делаю, что мне интересно и что мне выгодно.