[AI03]
AI-агент: что обычно имеется в виду на практике
Под “AI-агентом” обычно понимается не отдельная модель, а система, в которой модель встроена в контур принятия и исполнения решений.
В современных AI-приложениях в роли ядра часто используется модель, но сама система обычно строится как многослойный контур.
На практике чаще всего встречаются несколько вариантов:
• Large Language Model (LLM, text-to-text) — ядро для текста, кода, диалога и формализованных рассуждений
• speech-контур — отдельные модели для распознавания речи (Automatic Speech Recognition, ASR) и синтеза речи (Text-to-Speech, TTS), которые подключаются вокруг LLM
• Computer Vision (CV) и другие мультимодальные модели — если в систему входят изображения, видео или смешанные типы входа
• нативно мультимодальные модели, где часть этих функций уже объединена внутри одной модели
Для простоты дальше в серии будет рассматриваться прежде всего LLM-based контур, потому что именно он сегодня чаще всего имеется в виду, когда говорят об “AI-агентах”. При этом важно понимать, что голос, зрение и другие модальности обычно либо подключаются как внешние слои, либо постепенно встраиваются в более мультимодальные модели.
Ключевой момент состоит в том, что сама по себе Large Language Model ещё не образует агентную систему.
Чтобы появился агентный контур, вокруг модели обычно добавляются следующие слои:
• context — информация, доступная модели в момент вызова
• memory / state — накопленное состояние процесса и история предыдущих шагов
• tools — внешние функции, базы данных, сервисы и API
• guardrails — ограничения, проверки, policy-слой, допустимые границы действий
• execution — фактическое выполнение команд
• audit / logs — журнал данных, решений и действий
Поэтому агент обычно описывается не как “одна модель”, а как цикл:
получить контекст → интерпретировать → выбрать действие → выполнить → обновить состояние
На практике значительная часть того, что сегодня строится вокруг Large Language Models, сводится к управлению контекстом. Именно контекст определяет:
• что модели известно в данный момент
• какие данные считаются релевантными
• какими инструментами разрешено пользоваться
• в каком формате должен быть выдан результат
• какие ограничения должны быть учтены до и после ответа
В этом смысле современная LLM-based система во многом представляет собой архитектуру управления контекстом:
нужно не просто вызвать модель, а правильно собрать, отфильтровать, упорядочить и ограничить информацию, которая ей доступна.
Что с этим всем делать?
С одной стороны, продолжается гонка за более сильные foundation models:
выше качество, длиннее контекст, ниже стоимость, лучше мультимодальность, надёжнее поведение.
(OpenAI, Anthropic, Google gemini, Alibaba)
С другой — строятся прикладные системы вокруг моделей:
управление контекстом, инструменты, память, ограничения, интеграция в реальные процессы.
Практический смысл этого различия особенно важен в финансах, коде и операционных системах.
Качество текста — только верхний слой.
Ключевое значение имеют:
• доступ к данным
• корректность контекста
• набор доступных инструментов
• ограничения на действия
• возможность восстановить причинно-следственную цепочку после выполнения
$YDEX $SBER $ASTR
#инвестиции #технологии #искусственныйинтеллект #llm #машинноеобучение #datascience