Large Language Model — модели, лежащие в основе популярных ИИ-ассистентов, таких как ChatGPT, Claude, Gemini, Llama, Copilot или Le Chat. Общаясь с ассистентом, вы взаимодействуете с LLM, которая обрабатывает запрос напрямую или с помощью инструментов (веб-поиск, интерпретатор кода). LLM — это глубокие нейросети из миллиардов числовых параметров (весов), которые выучивают связи между словами и создают своего рода многомерную карту языка. Модели формируются на закономерностях из миллиардов книг, статей и расшифровок; получив запрос, модель генерирует наиболее вероятное продолжение.
Многослойная алгоритмическая структура, лежащая в основе глубокого обучения и всего бума генеративного ИИ. Идея, вдохновленная связями нейронов мозга, восходит к 1940-м годам, но раскрыть ее потенциал позволило появление графических процессоров (GPU) из игровой индустрии. Эти чипы хорошо подошли для обучения алгоритмов с гораздо большим числом слоев, что резко повысило качество работы ИИ во многих областях — от распознавания речи до автономной навигации и поиска лекарств.
Подмножество самообучающегося машинного обучения, где алгоритмы построены на многослойной искусственной нейронной сети. Это позволяет находить более сложные корреляции по сравнению с простыми моделями вроде линейной регрессии или деревьев решений. Структура вдохновлена взаимосвязанными путями нейронов человеческого мозга. Модели глубокого обучения способны сами выявлять важные признаки в данных, не требуя, чтобы инженеры задавали их вручную. Однако таким системам нужны миллионы и более точек данных, а обучение занимает больше времени — поэтому стоимость разработки обычно выше.
Архитектура модели, разбивающая нейросеть на множество меньших специализированных подсетей — «экспертов», — из которых для каждой задачи активируется лишь несколько. Встроенный «маршрутизатор» выбирает нужных специалистов, а не прогоняет запрос через всю модель. Это позволяет строить огромные модели, оставаясь относительно быстрыми и дешевыми в работе. Известный пример — Mixtral от Mistral AI; предполагается, что новые модели OpenAI также используют этот подход.
Технология в основе многих моделей, генерирующих изображения, музыку и текст. Вдохновленные физикой, диффузионные системы постепенно «разрушают» структуру данных, добавляя шум, пока от исходных данных ничего не остается. В физике диффузия спонтанна и необратима (растворенный сахар не собрать обратно в кубик), но ИИ-системы учатся своего рода «обратной диффузии» — восстановлению данных из шума.
Generative Adversarial Network — тип фреймворка машинного обучения, лежащий в основе ряда достижений генеративного ИИ, включая инструменты для дипфейков. GAN использует пару нейросетей: одна генерирует результат, другая его оценивает. Модели фактически соревнуются: генератор пытается «обмануть» дискриминатор, а дискриминатор — распознать искусственные данные. Такое состязание делает результаты реалистичнее без дополнительного вмешательства человека, но GAN лучше работают в узких задачах, а не в универсальных.
Процесс, при котором в модель подаются данные, чтобы она училась на закономерностях и выдавала полезные результаты. По сути, система реагирует на характеристики данных и адаптирует выводы под нужную цель — будь то распознавание изображений котов или создание хайку по запросу. Обучение может быть дорогим, поскольку требует огромных объемов данных, объем которых растет, — поэтому гибридные подходы (например, тонкая настройка на целевых данных) помогают снижать затраты.
Дополнительное обучение модели для оптимизации под более конкретную задачу или область, чем при исходном обучении, — как правило, за счет подачи новых специализированных данных. Многие ИИ-стартапы берут большую языковую модель за основу и повышают ее полезность для целевой отрасли, дополняя обучение собственными предметными знаниями.
Способ обучения ИИ, при котором система учится, пробуя действия и получая вознаграждение за верные ответы — как дрессировка питомца лакомствами, только «питомец» здесь нейросеть, а «лакомство» — математический сигнал успеха. В отличие от обучения с учителем на фиксированном размеченном наборе, модель исследует среду, совершает действия и обновляет поведение по обратной связи. Подход особенно силен в играх, управлении роботами и в развитии способности LLM к рассуждению. Методы вроде RLHF сегодня центральны для настройки моделей.
Техника, при которой ранее обученная модель служит отправной точкой для новой модели под другую, но обычно смежную задачу, — позволяя повторно применить полученные знания. Перенос обучения экономит ресурсы и полезен при ограниченном объеме данных для новой задачи. Однако у подхода есть ограничения: моделям, полагающимся на перенос ради обобщенных способностей, как правило, нужны дополнительные данные для хорошей работы в целевой области.
Техника извлечения знаний из большой модели по схеме «учитель — ученик». Разработчики отправляют запросы модели-учителю и записывают ее ответы, иногда сверяя их с эталонным набором данных. Затем на этих ответах обучают модель-ученика, приближая ее поведение к учителю. Дистилляция позволяет создать меньшую и более эффективную модель с минимальными потерями. Дистилляция из модели конкурента обычно нарушает условия использования API и чат-ассистентов.
Ключевой элемент обучения ИИ: веса определяют, какую важность придать разным признакам входных данных, формируя тем самым результат модели. Это числовые параметры, задающие наиболее значимое в наборе данных; они действуют через умножение входных значений. Обучение обычно начинается со случайных весов, которые по ходу корректируются, приближая результат к целевому.
Число, показывающее, насколько хорошо модель обучается, — и чем оно ниже, тем лучше. Исследователи следят за ним как за табелем успеваемости в реальном времени: решают, когда остановить обучение, скорректировать гиперпараметры или искать проблему. Один из главных вопросов, который оно помогает выявить, — переобучение, когда модель запоминает обучающие данные вместо усвоения обобщаемых закономерностей.
Процесс запуска ИИ-модели — использование обученной модели для предсказаний или выводов на основе ранее увиденных данных. Инференс невозможен без обучения: сначала модель должна выучить закономерности. Выполнять инференс может разное оборудование — от процессоров смартфонов до мощных GPU и специализированных ИИ-ускорителей, но не все справляются одинаково хорошо: очень большие модели на ноутбуке работали бы крайне медленно по сравнению с облачным сервером.
Базовые «строительные блоки» общения человека и ИИ — дискретные фрагменты данных, обработанные или произведенные LLM. Они создаются в процессе токенизации, разбивающей исходный текст на удобоваримые для модели единицы, подобно тому как компилятор переводит текст в машинный код. В корпоративной среде токены определяют и стоимость: большинство компаний берут плату за использование LLM потокенно — чем больше используешь, тем больше платишь.
Токены — небольшие фрагменты текста (часто части слов), на которые модель разбивает язык перед обработкой; условно их можно считать «словами» для оценки нагрузки. Пропускная способность — сколько можно обработать за единицу времени. Высокая пропускная способность по токенам — ключевая цель инфраструктурных команд, ведь она определяет, скольких пользователей модель обслуживает одновременно и как быстро каждый получает ответ.
Процесс, ускоряющий инференс. Кэширование — техника оптимизации: ИИ выполняет тяжелые математические вычисления, каждое из которых расходует ресурсы, а кэширование сокращает их число, сохраняя определенные вычисления для будущих запросов. Один из известных видов — KV-кэширование (key-value), работающее в трансформерных моделях и ускоряющее генерацию ответов за счет снижения объема вычислений.
Инструмент, который использует технологии ИИ для выполнения серии задач за вас — сверх возможностей простого чат-бота: оформление расходов, бронирование билетов или столика, написание и поддержка кода. Термин может означать разное для разных людей, а инфраструктура для реализации всех возможностей еще строится. Базовая идея — автономная система, способная опираться на несколько ИИ-моделей для выполнения многошаговых задач.
Более узкое понятие, чем «ИИ-агент». Это специализированная программа для разработки ПО. Вместо простого предложения кода для проверки человеком кодовый агент способен писать, тестировать и отлаживать код автономно, выполняя итеративную работу методом проб и ошибок. Такие агенты могут работать со всей кодовой базой, находить ошибки, запускать тесты и вносить исправления при минимальном контроле человека. Это как очень быстрый стажер, который не спит и не теряет концентрацию, — но его работу все равно нужно проверять.
Своего рода «кнопки» на обратной стороне программного обеспечения, которые другие программы могут «нажимать», чтобы заставить его что-то сделать. Разработчики используют эти интерфейсы для интеграций — например, чтобы одно приложение получало данные из другого или чтобы ИИ-агент напрямую управлял сторонними сервисами. По мере развития ИИ-агенты все чаще находят и используют такие точки самостоятельно, открывая мощные, а иногда и неожиданные возможности автоматизации.
Открытый стандарт, позволяющий ИИ-моделям подключаться к внешним инструментам и данным — файлам, базам данных, приложениям вроде Slack и Google Drive — без создания отдельного коннектора под каждую пару. Своего рода «порт USB-C для ИИ». Anthropic представила MCP в 2024 году и позже передала его Linux Foundation; стандарт переняли OpenAI, Google и Microsoft, что сделало его одним из самых быстрораспространяющихся в истории ИИ.
Artificial General Intelligence (AGI) — размытый термин, обычно обозначающий ИИ, превосходящий среднего человека в большинстве задач. Сэм Альтман (OpenAI) как-то описал AGI как «эквивалент среднего человека, которого можно нанять коллегой». В уставе OpenAI AGI определяется как «высокоавтономные системы, превосходящие людей в большинстве экономически значимых видов работы». Google DeepMind понимает AGI как «ИИ, не уступающий человеку в большинстве когнитивных задач». Единого определения нет — в этом путаются даже ведущие исследователи.
В контексте ИИ рассуждение «по цепочке» для больших языковых моделей означает разбиение задачи на меньшие промежуточные шаги для повышения качества результата. Ответ обычно получается дольше, но с большей вероятностью оказывается верным — особенно в задачах логики или программирования. Модели рассуждений создаются на основе обычных LLM и оптимизируются под такое пошаговое мышление с помощью обучения с подкреплением.
Предпочитаемый в отрасли термин для ситуации, когда модель выдумывает информацию — попросту генерирует неверные сведения. Это серьезная проблема качества: галлюцинации могут вводить в заблуждение и приводить к реальным рискам (например, вредный медицинский совет). Считается, что причина — пробелы в обучающих данных. Это одна из причин перехода к специализированным, отраслевым моделям, снижающим вероятность таких пробелов и риск дезинформации.
Как и AGI, это порог того, насколько «умным» может стать ИИ и как мало он будет зависеть от людей. В сценарии RSI модели начинают улучшать сами себя без вмешательства человека, что ведет к резкому росту возможностей и автономности. В некоторых трактовках это катастрофический момент, схожий с сингулярностью, но RSI описывает и базовую способность — может ли модель спроектировать своего преемника. Ряд стартапов создают такие модели, но большинство отвергает апокалиптические трактовки, представляя RSI как следующий рубеж исследований.
Термин обычно обозначает вычислительную мощность, позволяющую работать ИИ-моделям. Именно она питает всю отрасль, давая возможность обучать и развертывать мощные модели. Часто это сокращение для аппаратного обеспечения, обеспечивающего вычисления, — GPU, CPU, TPU и другой инфраструктуры, лежащей в основе современной индустрии ИИ.
Выполнение множества операций одновременно, а не последовательно, — как если бы над разными частями проекта работали десять сотрудников сразу. В ИИ параллелизация фундаментальна и для обучения, и для инференса: современные GPU созданы для тысяч параллельных вычислений, что и сделало их основой отрасли. По мере роста моделей способность распределять работу между множеством чипов и машин стала одним из важнейших факторов скорости и стоимости разработки.
Шутливый термин для нешуточной тенденции: растущего дефицита оперативной памяти (RAM), которая питает практически всю технику. С развитием ИИ крупнейшие компании и лаборатории скупают столько памяти для своих дата-центров, что остальным ее почти не остается, а оставшаяся дорожает. Это бьет по игровой индустрии, потребительской электронике и корпоративным вычислениям. Ожидается, что цены снизятся лишь после окончания дефицита, признаков которого пока нет.
ПО — и все чаще ИИ-модели, — где исходный код открыт для использования, изучения и изменения. Яркий пример в мире ИИ — семейство моделей Llama от Meta; исторический аналог в ОС — Linux. Открытый подход позволяет исследователям и компаниям развивать работы друг друга, ускоряя прогресс и обеспечивая независимый аудит безопасности. Закрытый код (как у GPT от OpenAI) означает, что продуктом можно пользоваться, но нельзя увидеть, как он устроен, — это одна из ключевых дискуссий в отрасли.
Ответим в течение рабочего дня. Для сложных задач соберем встречу с архитектором.