01
Кто такие модели ИИ?
Слово «ИИ» ты слышал много раз: в новостях, в телефоне, от друзей. Но за ним стоит много разных вещей — от роботов из фильмов до подсказок в поиске. Мы будем говорить о том, с чем ты, скорее всего, уже общался: о чатах, которые отвечают как люди.
Тот, кто отвечает в таком чате, — не весь ИИ, а программа одного типа. Называется она языковой моделью, а коротко — LLM, большая языковая модель. Учили её на огромном количестве текстов: на книгах, статьях, переписках. Поэтому она так похожа на человека — она видела, как пишут люди.
Но «учили» не значит «запомнила». Модель не хранит эти тексты — она хранит настройки, которые подбирала во время обучения, чтобы лучше предсказывать следующий кусочек. Настроек очень много — миллиарды, поэтому модель и называется «большой». Именно поэтому она не «знает» тексты, как база данных: у неё есть только настройки и умение продолжать.
Подражание — это всё, что она умеет. Когда модель отвечает, она не думает, как мы. Она смотрит на уже написанное и выбирает, какой кусочек текста написать следующим. Это как подсказка следующего слова в телефоне, только гораздо сильнее: она подбирает не слова, а целые фразы. Вот как это выглядит:
Модель видит
Ты наверняка общался с чатом, который отвечает как
выбирает следующий кусочек
Модель не знает ответ заранее — она взвешивает варианты и выбирает один. Так собирается каждая фраза.
На схеме — три варианта, но на самом деле их тысячи: модель взвешивает все возможные кусочки и выбирает один. Кусочки, из которых модель собирает текст, называются токенами — обычно это часть слова или целое слово. О токенах поговорим в следующей секции, а сейчас соберёшь ответ сам — так же, как это делает модель.
Интерактив
Собери ответ как модель
На каждом шаге модель выбирает следующий токен из вероятностей. Кликай — и собирай фразу.
Промпт
Лучший способ войти в AI-инженерию —
Ответ модели
…
Шаг 1 из 5
Выбери следующий токен
Где живёт такая модель? На сервере — как и другие программы, о которых ты узнал на первом уровне. Ты общаешься с ней через интерфейс: чат, приложение. За интерфейсом стоит API: он отправляет твой запрос модели и возвращает ответ. Модель можно запустить у себя на компьютере или пользоваться облачной через API — принцип один.
И ещё: LLM — это не один продукт, а семейство. Модели отличаются ценой, скоростью и характером ответов, и выбор модели под задачу — инженерное решение. Современные модели умеют не только текст: видят картинки, слышат голос — но принцип тот же: предсказание следующего кусочка.
Вывод
ИИ в чате — это языковая модель (LLM): она не понимает, а предсказывает следующий кусочек текста.
02
Из чего модель собирает текст
В первой секции ты узнал, что модель собирает текст из кусочков — токенов. Теперь разберёмся, что это за кусочки и почему от них зависит, сколько стоит запрос и сколько модель помнит.
Токен — это кусочек текста, с которым работает модель. Чаще всего это часть слова или целое слово, но бывает и отдельный знак — точка или запятая. Модель не читает текст буквами, как мы. Она видит его как цепочку таких кусочков и собирает ответ по одному.
Почему это важно? В токенах модель считает две вещи: цену запроса и свою память. Чем длиннее твой текст, тем больше токенов — и тем дороже запрос, и тем больше места он занимает в памяти модели.
Есть и неожиданный нюанс: русский текст обычно разбивается на больше токенов, чем английский. У модели есть словарь частых кусочков: то, что встречается часто, она берёт целиком, а редкое режет на части. У русских слов много редких окончаний, поэтому их приходится резать — и один и тот же смысл на русском «стоит» дороже, чем на английском.
Чтобы почувствовать масштаб: страница обычного текста — это примерно 1000–2000 токенов. Код плотнее — в нём больше знаков и коротких слов. Поэтому длинный документ или большой файл — это десятки тысяч токенов.
Вот как это выглядит на практике. Фраза «Привет! Как дела?» разбивается на кусочки так: Привет ! Как дела ? — пять токенов, хотя слов всего три. Посмотри, как текст режется на токены, и вставь свою фразу:
Интерактив
Разбивка на токены
Токен — не всегда слово. Нажми на токен, чтобы рассмотреть его.
11 токенов ≈ 7 слов
Для ощущения цены: обычный запрос стоит копейки, а длинный диалог с файлами — уже заметные деньги.
Каждый токен занимает место в памяти модели. У запроса есть предел: модель принимает максимум токенов за раз — и всё, что не поместилось, она не увидит. А память не бесконечная — об этом следующая секция.
Вывод
Токены — кусочки текста, из которых модель собирает ответы. В них считают цену и память — и русский текст «дороже» английского.
03
Память модели
В прошлой секции ты узнал, что каждый токен занимает место в памяти модели. Теперь разберёмся, сколько этой памяти и что происходит, когда она заканчивается.
Когда ты отправляешь запрос, модель получает не только твоё сообщение, но и всю историю диалога, служебную инструкцию и приложенные файлы. Всё это вместе — контекст. У памяти, в которой он живёт, есть название — context window, окно контекста. В диалоге три роли: служебная инструкция (системный промпт) задаёт поведение и стиль модели, твои сообщения — запросы, ответы модели — реплики.
У окна есть предел. Всё, что в него не поместилось, модель не видит вообще: это не «забыто» в человеческом смысле — этого просто нет. Поэтому длинные диалоги «распадаются»: модель перестаёт помнить, о чём вы говорили в начале.
И вот что важно понять: модель не помнит тебя между запросами. Каждый раз, когда ты отправляешь сообщение, ей заново отправляется весь контекст — вся история, инструкция, файлы. Поэтому чем длиннее диалог, тем дороже каждый следующий запрос: он платит за всё, что было раньше.
Служебная инструкция и приложенные файлы тоже занимают место в окне. Чем длиннее инструкция и больше файлов, тем меньше остаётся для диалога. Большой файл может «съесть» всё окно — и модель забудет, о чём вы говорили.
Размер окна — важная характеристика модели. 8k токенов — это примерно 15 страниц текста, 32k — около 60, 128k — около 250, а 512k — около 1000. Чем больше окно, тем больше текста модель может учесть, но и тем дороже каждый запрос.
Посмотри, как это работает: переключай размер окна и смотри, что модель помнит, а что забыла.
Интерактив
Ползунок окна
История общения: системный промпт, твои сообщения и ответы модели. Переключай размер окна — что остаётся в памяти?
8k ≈ 15 страниц текста
В окне 1 из 17 сообщений · остальные «забыты»
Когда окно заполняется, на практике старые сообщения отбрасываются или сжимаются в краткое резюме — иначе диалог просто не поместится. Поэтому длинные диалоги с вставками — дорого и «забывчиво»: важное лучше выносить в отдельные запросы или файлы.
Модель видит только то, что помещается в окно. Но как она собирает ответ? Об этом следующая секция.
Вывод
Модель видит только то, что помещается в её память — context window. Остального для неё не существует.
04
Как модель отвечает
Когда модель «отвечает», она не достаёт готовый ответ из базы. Она собирает его по токену — и на каждом шаге есть элемент случайности.
Процесс генерации ответа называется inference. Модель берёт контекст, вычисляет вероятности всех возможных следующих токенов из своего словаря и выбирает один. Потом добавляет его к тексту и повторяет — снова и снова. Каждый следующий кусочек она выбирает, глядя на всё, что уже написала: и на твой запрос, и на свои предыдущие кусочки. Останавливается модель, когда выбирает особый кусочек — знак конца ответа.
Выбор не всегда «самый вероятный» токен. Модель может выбрать и менее вероятный — это делает ответы живыми. Насколько часто она «рискует», задаёт параметр temperature.
При низкой temperature (например, 0.2) ответы предсказуемые и сухие. При высокой (1.2) — разнообразные, но менее стабильные. Поэтому на один и тот же вопрос модель может дать разные ответы.
Интерактив
Переключатель temperature
Один и тот же вопрос — три «настроения» модели.
Промпт
Придумай название для сервиса, который следит за поливом растений.
«GreenCare» — умный помощник по уходу за растениями: напоминает о поливе, подсказывает, когда растение пересыхает, и ведёт историю ухода.
Баланс точности и разнообразия: ответ живой, но по делу.
Работает это быстро: десятки токенов в секунду — поэтому ответ на страницу текста занимает минуты.
Вывод
Каждый ответ собирается по токену, и на каждом шаге модель «бросает кубик». Temperature — степень риска этого броска.
05
Как разговаривать с моделью
Ты узнал, как модель отвечает: токен за токеном, с элементом случайности. Но от чего зависит, насколько хорош будет ответ? Всё начинается с того, как ты её попросишь.
Промпт — это задача
То, что ты пишешь модели, называется промптом — формулировкой задачи. От того, как ты её напишешь, зависит, что модель сделает. Расплывчатая задача — расплывчатый результат.
Хороший промпт отвечает на три вопроса: что есть (контекст), что сделать (задача) и в каком виде нужен результат (формат). «Сделай сайт» не отвечает ни на один. «Сделай страницу цветочного магазина: заголовок, описание трёх букетов, кнопка „Заказать“. Тёмный фон, белый текст» — отвечает на все.
Сравни сам: один и тот же запрос, две формулировки — и два очень разных ответа.
Интерактив
Плохой и хороший промпт
Одна и та же задача — две формулировки.
Промпт
Сделай страницу цветочного магазина: заголовок, описание трёх букетов, кнопка «Заказать». Тёмный фон, белый текст.
Ответ модели
Вот структура страницы: 1) Заголовок «Цветы с доставкой»; 2) Три карточки букетов с описанием; 3) Кнопка «Заказать» под каждой. Тёмный фон, белый текст.
Конкретная задача — конкретный результат. Модель знает, что делать.
Промпт задаёт поведение
Промпт — это не только «что сделать», но и «как себя вести». Можно попросить отвечать коротко, как в телеграмме, или подробно, как учитель. Можно задать роль: «ты — опытный редактор». Модель подстроится.
Помнишь служебную инструкцию из секции про память? Это тоже промпт — только постоянный: он задаёт поведение модели на весь диалог. Стиль, тон и правила можно зафиксировать заранее.
Запомни эту мысль: промпт управляет поведением модели. На следующем уровне она станет главной — инструкции для агента это тоже промпты, только большие и постоянные.
Вывод
Промпт — формулировка задачи. Чем конкретнее и яснее, тем лучше результат — и тем понятнее модели, как себя вести.
06
Модель выбирает действие
Ты научился правильно просить модель. Но текст — не единственное, что она умеет «выбирать». Иногда вместо следующего слова она выбирает действие.
Модель умеет не только говорить
Модель в чате отвечает текстом. Но ту же модель можно научить выбирать не слово, а действие — например, «вызвать инструмент». Инструмент — это готовая команда: прочитать файл, найти в интернете, отправить сообщение.
Модель не выполняет команду сама — она «пишет» её как текст: имя инструмента и аргументы, например прочитать_файл("config.json"). Среда читает команду и выполняет. Это как заказ в приложении доставки: ты нажимаешь кнопку, а готовит и везёт сервис.
Модель может вызвать только те инструменты, которые ей дали. Набор команд определяет человек — какие дал, те и есть.
Как модель выбирает действие
Выбор действия выглядит так же, как выбор следующего токена: модель смотрит на запрос и взвешивает варианты. Только варианты — не слова, а команды.
«Какая сейчас погода в Москве?» — свежих данных модель не знает, поэтому выбирает действие «узнать погоду». «Объясни, что такое токен» — это вопрос про знания, модель отвечает текстом.
Сейчас посмотришь, как модель выбирает: ответить текстом или вызвать инструмент.
Интерактив
Что выберет модель?
Угадай: модель ответит текстом или вызовет инструмент?
Верно: 0 из 5
Объясни, что такое токен
Какая сейчас погода в Москве?
Прочитай файл config.json из проекта
Напиши стихотворение про кота
Отправь это письмо клиенту
Выбор действия — это тоже предсказание следующего кусочка. Только кусочек — не слово, а команда. Результат команды возвращается модели и занимает место в её окне — помнишь context window? Поэтому модель не «помнит» файл: прочитала, использовала, а когда понадобится — прочитает снова. И ещё: моделью пользуются не только люди в чате — программы обращаются к ней через API: отправляют запрос, получают ответ. Агент со следующего уровня — это как раз такая программа. Эта мысль понадобится, когда будем собирать агента.
Вывод
Модель умеет выбирать не только слова, но и действия — вызов инструмента. Это и есть зародыш агента.
07
Сценарии и ограничения
Ты умеешь просить модель и знаешь, что она может действовать. Но у неё есть чёткие границы. Понимать их — значит использовать модель правильно.
Модель не хранит факты
Модель не достаёт факты из базы данных. Она генерирует правдоподобный текст. Иногда правдоподобный текст не совпадает с реальностью — это называется галлюцинацией. Модель не различает «знаю» и «выдумал»: для неё это один процесс — продолжить текст по вероятности. Она не «врёт» — она честно генерирует, не сверяясь с фактами.
Модель не знает свежего
У модели есть cutoff — дата, до которой собраны данные для её обучения. Что было после — она не знает. У неё нет доступа к интернету, курсам валют и новостям, если это не подключено отдельно.
Поэтому есть сценарии, где модель сильна: черновики, перевод, саммари, код, структура. И сценарии, где ей доверять нельзя: точные факты, цифры, цитаты, свежие данные. Всё критичное — проверять.
Проверь, где модели можно доверять, а где — обязательно проверять:
Интерактив
Доверяй, но проверяй
Оцени сценарий: можно доверять ответу модели или нужно проверять?
Верно: 0 из 8
Написать черновик письма клиенту
Кратко пересказать длинную статью
Найти причину бага в коде
Перевести абзац текста
Привести точную цитату закона с номером статьи
Назвать дату исторического события
Назвать сегодняшний курс валют
Перечислить научные работы по теме с авторами
Границы — причина, по которой нужны инструменты
И вот ключевая мысль. Именно из-за этих границ модели дают инструменты. Модель не знает свежих данных — ей дают инструмент поиска. Модель не видит твои файлы — ей дают инструмент чтения. Так ограничения превращаются в повод для агента.
На следующем уровне ты соберёшь из модели агента — и инструменты станут его руками.
Вывод
LLM — сильный генератор черновиков и слабый источник фактов. Именно поэтому ей дают инструменты — и это путь к агенту.
08
Итог
Проверь себя: отметь термины, которые теперь можешь объяснить своими словами.
Чек-лист
Базовые термины
Отметь термины, которые теперь можешь объяснить своими словами.
Отмечено: 0 из 8
Попробуй сам — это займёт десять минут. Открой любой чат с нейросетью и проведи три эксперимента.
Первый: один и тот же вопрос сформулируй расплывчато и конкретно — сравни ответы. Второй: задавай вопросы в одном диалоге, пока он не станет длинным, — и проверь, помнит ли модель его начало. Третий: попроси одно и то же дважды — и посмотри, отличаются ли ответы.
Вывод
Ты собрал базовый словарь модели, понимаешь, где LLM сильна, а где её нужно проверять, — применяй его и двигайся к агентам.
Дальше
Уровень 2: AI-агенты
Агент — это LLM, которой дали «руки»: она выполняет команды, читает файлы и ходит во внешние сервисы. Документ уже готов.