Магия без слов
В 2026 году ты пишешь вопрос нейросети в поле ввода на клавиатуре. Кнопка «Enter» нажата. Через пару секунд на экране появляется ответ — связный текст, который выглядит как будто написан человеком. Тебе кажется, что компьютер прочитал твои слова, понял их смысл и решил задачу. Но это иллюзия.
Компьютер не знает, что такое «смысл». Он даже не понимает разницы между словом и картинкой. Для него есть только числа. Когда ты пишешь фразу, нейросеть не воспринимает её как поток слов. Она видит массив цифр — векторы. Твоя фраза превращается в последовательность чисел, которые проходят через сложную математическую машину и выдают другую последовательность чисел. Эта новая последовательность декодируется обратно в текст.
Вопрос звучит просто: как числа могут передать смысл? Ответ кроется в том, что нейросети не учат язык так, как его изучают люди. Они не запоминают определения слов. Они учатся видеть связи между ними.
Токенизация — первая ступень
Текст для нейросети начинается с токенизации. Это процесс разбиения текста на части — токены. На первый взгляд кажется, что токен — это просто слово. Но всё сложнее.
Современные модели используют алгоритмы вроде Byte Pair Encoding (BPE) или SentencePiece. Они разбивают текст не только по словам, но и по частям слов. Например, фраза «Привет, мир!» может быть разбита на токены: [Прив] [ет] [,] [мир] [!]. В английском это будет иначе: [Hello] [,] [world] [!].
Это важно. Русский язык требует больше токенов для той же длины текста. Один токен в русском языке — это примерно одна буква. В английском — несколько символов вместе. Если у модели лимит в 100 тысяч токенов, то на английском это километры текста, а на русском — в четыре раза меньше.
Почему так? Потому что нейросети работают с частями слов. Слово «невероятно» может быть разбито на [не] [вероят] [но]. Общий кусок «при» в словах «привет» и «пример» будет одним токеном, но его смысл меняется в зависимости от соседей.
В векторном представлении этот общий токен нейтрален сам по себе. Смысл формируется только в контексте. Когда модель видит «при-вет», она добавляет информацию о соседних токенах и получает конкретное значение. Если же это «пример», то другой контекст даст другое значение.
Важно: словарь модели ограничен. LLaMA 3 имеет около 128 тысяч токенов, Gemma 3 — около 262 тысяч. Чем больше словарь, тем меньше нужно разбивать слова на части. Но больше объём эмбеддингов — памяти, которую модель должна держать в уме.
Эмбеддинги — числа с смыслом
После токенизации каждый токен превращается в вектор. Это набор чисел — обычно от 768 до 12 тысяч элементов. Представь себе многомерное пространство, где каждое слово имеет свои координаты. Слово «кот» — это одна точка в этом пространстве. «Кошка» — другая, но близкая к первой. «Асфальт» будет далеко от обеих.
Эти векторы вычисляются в процессе обучения. Модель видит миллиарды слов и учится помещать похожие по смыслу слова рядом. Это называется word embedding. Процесс похож на то, как ты запоминаешь друзей: тех, кто часто встречается вместе, ты помнишь ближе друг к другу.
Когда модель видит фразу «Вечером дома смотрят фильм», она преобразует каждое слово в вектор и проверяет их близость. «Вечером» и «дома» будут рядом — оба описывают обстановку. «Смотрят» и «фильм» тоже близки — действие и объект. Модель видит эти связи и понимает контекст.
Механизм внимания — как слова общаются
Главный прорыв в архитектуре трансформеров — механизм внимания (attention). Раньше нейросети читали текст последовательно, слово за словом, как мы читаем книгу. Современные модели видят весь текст сразу и понимают связи между всеми словами одновременно.
Представь детектив: дворецкий был в саду, про отравленный чай, мёртвый хозяин. Твой мозг автоматически связывает эти факты. Он смотрит на каждое слово и спрашивает: «С какими другими словами это связано?»
Возьмём фразу «Банк реки был крутым». Слово «банк» может означать финансовое учреждение или берег реки. Если рядом стоит «реки», модель понимает, что речь о берегу. Если же рядом «процентные ставки» — то о банке как организации. Модель проверяет все связи одновременно, не по порядку.
Это self-attention — само-внимание. Модель берёт один токен и проверяет его связь со всеми остальными в тексте. Потом берёт следующий токен и снова со всеми. Получается карта взаимодействий.
Но одного механизма внимания мало. Придумали multi-head attention — несколько механизмов параллельно. Каждая «голова» смотрит на текст с другой стороны: одна ищет грамматические связи, другая — семантические, третья — синтаксические. Потом все результаты объединяются. Это как смотреть на картину с разных углов. Вместе получается полная картина.
GPT-3 использует 96 таких голов внимания. Claude 3.5 — ещё больше. Каждая голова ищет свои паттерны в данных.
Позиционное кодирование — порядок слов
Если бы модель видела текст сразу целиком без учёта порядка, она бы путала «Кот съел мышь» и «Мышь съела кота». Оба предложения имели бы одинаковые слова. Чтобы сохранить порядок, используется позиционное кодирование.
Каждому токену добавляется число, которое говорит: «Ты первый», «Ты второй», «Ты десятый». Эти числа закодированы через синусоиды, чтобы модель понимала не только абсолютную позицию, но и относительную — например, что токен стоит через два слова от начала.
Слои трансформера — конвейер понимания
Трансформер — это стек из множества слоёв. Каждый слой добавляет новый уровень понимания. Представь конвейер на заводе: сырьё проходит через десятки станций и на выходе получается готовый продукт.
Первый слой видит простые связи: существительное связано с прилагательным. Второй — фразы, например «красный автомобиль». Третий — предложения, логика текста. Четвёртый — абзацы и переходы между мыслями. GPT-3 имеет 96 таких слоёв. Каждый копает глубже.
В энкодере (части для чтения) каждый слой состоит из self-attention и feed-forward сетей. В декодере (для генерации текста) есть masked attention — он не видит будущее, только уже написанное. Это ключевая деталь: модель учится предсказывать следующее слово на основе предыдущих.
Обучение — статистика в огромных масштабах
Как модель учится? Она получает огромный текст — триллионы слов из интернета, книг, кода. Задача: предсказать следующее слово. Модель видит фразу «Кот сидел на...» и пытается угадать: «заборе». Проверяет ответ в тексте. Если ошибка — корректирует свои веса. Повторяет миллионы раз.
Постепенно модель учится грамматике, смыслу, стилю, фактам. Всё это из статистики. В 90% случаев после «столица Франции» идёт слово «Париж». Значит, это правильный ответ. Обучение GPT-3 стоило $4,6 миллиона в электричестве. GPT-4 — десятки миллионов. Это недели работы суперкомпьютеров.
Промпт-инжиниринг — как общаться с моделью
Ты уже понимаешь, как работает модель. Теперь научимся правильно с ней взаимодействовать. Промпт — это не просто запрос. Это инструкция для AI. И от того, как ты её напишешь, зависит качество ответа.
Базовые принципы хорошего промпта: будь конкретным, указывай контекст, давай примеры, структурируй запрос. Например, вместо «Напиши статью» лучше «Напиши статью на 1000 слов про промпт-инжиниринг для начинающих программистов, стиль разговорный, с практическими примерами».
Один из мощнейших приёмов — few-shot промптинг: дать модели примеры того, что ты хочешь. Например, классифицировать настроение отзывов: «Отличный товар, быстрая доставка!» → позитивный; «Товар разбился при доставке» → негативный. Модель сразу видит паттерн и повторяет стиль.
РAG — актуальность без переобучения
Данные, на которых обучается модель LLM, устаревают. Как получить свежие ответы? Есть методы: Retrieval-Augmented Generation (RAG), параметр-эффективное дообучение LoRA, целевое редактирование весов MEMIT/ROME. RAG ищет релевантную информацию из внешней базы знаний при запросе и использует её контекст при генерации ответа. Так можно получать свежую информацию без перетренировки основной сети.
Что дальше
Трансформеры произвели революцию в обработке естественного языка, но у них есть ограничения: фиксированный контекст, зависимость от качества данных, высокие затраты на обучение и вывод. Исследователи продолжают искать способы увеличить размер контекста, улучшить энергоэффективность и адаптировать модели для специфических задач.
Модели не «помнят» тебя как человека. Они просто обрабатывают весь предыдущий диалог как входной текст. Это и называется контекст. Размер контекста напрямую влияет на способность модели помнить предыдущие сообщения в диалоге. Gemma 3 поддерживает 128 тысяч токенов, Qwen 2.5 — до 131 тысячи.
Компьютер не понимает слов. Он видит числа. Но эти числа, обученные на огромных объёмах данных, могут передать смысл так точно, что мы забываем о том, что за этим стоит математика. Вопрос «а что бы сделал ты на её месте» — не риторический. Ровно то же самое сейчас происходит с десятком компаний, чьими продуктами мы пользуемся ежедневно.