🧠 В продолжении поста о том, «как ИИ думает», как ИИ может писать сложные ответы, не очень понимая, о чём речь, но также как ИИ может начать понимать и делать намного больше, чем люди ожидают. Давайте обсудим эмерджентный эффект «генерализации знаний» у ИИ, который всегда работает очень мощно.
Вернёмся к модели после pretraining и SFT-обучения. Там модель по факту научилась быть гениальным интерполятором между кейсами из dataset и запросом пользователя. Теорема Цыбенко как раз и говорит о суперсиле крупных нейросетей в интерполяции между примерами из байесовского разнообразия кейсов из обучения.
Однако неверно упрощать всё до ситуации, когда модель в реале пишет о том, что не понимает до конца. Хотя такое есть, особенно у SLM, которые могут писать правдоподобные ответы, но мало понимают, о чём пишут.
Тем не менее даже SLM, а тем более LLM обладают очень мощным свойством абстрагироваться от кейсов из dataset и выводить абстракции за ними, которые люди часто и не понимают, и не видят. Это происходит у ИИ всегда, т.к. это ему нужно для того, чтобы в бюджете своих весов сохранить как можно больше знаний. Максимальная упаковка этого семантического ZIP-архива получится, если в весах модель не будет хранить сами тексты, а отрежет паттерны синтаксиса от смысла, а также сформулирует абстракции за самим текстом. Повторюсь, это происходит всегда и называется «генерализацией» моделей.
Однако это даёт много интересных свойств ИИ:
1. ИИ — не текстовой процессор, а семантический процессор, ему выгоднее делать процессинг смысла абстракций из генерализации, чем текстовые паттерны.
2. Текстовые паттерны для аналогичных концепций разделены у ИИ с концепциями, что позволяет ИИ легко менять языки с английского на русский или переходить с Python на Rust, т.к. синтаксис языков и семантика у модели разделены, а абстракции семантики обобщены. Как полиглот ИИ намного мощнее людей.
3. ИИ намного лучше ожиданий людей понимает общность каких-то понятий, т.к. сформулировал эти общности.
4. ИИ понимает законы лингвистики, а также ввёл сам по себе массу «ИИ-стандартов программирования», которые люди не понимают и не знают, но для ИИ это способ лучше понимать и лучше писать.
Поэтому, рассуждая о «Попугае Попке», который на pretraining и SFT лишь учился повторять токен-в-токен, надо быть осторожным. В абстрактном мышлении ИИ намного мощнее людей в силу его архитектуры обучения. Однако это же может стать причиной того, что недостоверные факты и гипотезы из datasets будут выучены ИИ не как текстовые паттерны, а как очень высокие абстракции, поэтому в таком случае ИИ может вас очень логично вводить в заблуждение. Тут всё в руках авторов datasets.
https://t.me/turboproject/4924