Canal sobre desenvolvimento de produtos baseados em LLM/ChatGPT. Espremendo notícias importantes e estudos de caso.
This channel is part of the discussion
LLM под капотом appears in 24 event pages on TGListТаблица Agentic LLM Benchmark July 2026 Самые интересные модели для агентных задач в бизнесе - подсвечены в таблице и на Pareto графиках. В таблице есть и Pro версии Luna/Sol/Terra! Но если кратко. Современные AI агенты для бизнес задач - это обычно пайплайны из блоков (router,…
Бенчмарк Anthropic Fable на бизнес задачах после лоботомии @AigizK успел сделать бенчмарк Anthropic Fable до того, как модель закрыли. Тем интереснее стало сравнить на том же бенчмарке новую экспортную версию после открытия заново. И там получается грустная картинка. Новый…
100 миллионов AI Tool Calls совершили ваши агенты на платформе BitGN! Это примерно по 50 tool calls на решение одной задачи. Всего на платформе 1089 инженеров и 103 города. Несмотря на то, что соревнования закончились уже давно, счетчик работы агентов на сайте не останавливался…
Бенчмарк Deepseek V4 Flash 0731 - попадание на Парето-фронтир по стоимости Новая версия Deepseek V4 стала получше своего предшественника. Возможно, там что-то подкрутили с reasoning, т.к. бенчмарк новой версии работал в 2.5 раза дольше и потратил больше денег. Но это стоило…
LLM Benchmark Opus 5 на агентских задачах в бизнесе Я померил два варианта Anthropic Opus 5 - обычный и Fast. Последний работает раза в два быстрее, но стоит раза в два дороже. Уровень ответов при этом идентичный. Очень высокий уровень AI Code (tool generation/use) и всего по…
Бенчмарк GPT-5.6 Sol/Terra/Luna - двигают фронтир Это тест новых моделей OpenAI на нашем новом агентском бенчмарке. Под капотом бенчмарка - паттерны из топовых харнесов с BitGN соревнований, которые мы разобрали и заново прогнали через ECOM1 под трейсом с лупой, анализируя…