Архитектурный слой, решающий, когда и как звать LLM, какой контекст ей давать и что делать с ответом.
LLM orchestration — слой кода, координирующий вызовы языковых моделей внутри большей системы. Обрабатывает: когда вызывать модель, какой контекст собирать, как валидировать вывод, когда ретраить или фолбэчить, как комбинировать вызовы модели с детерминированной логикой, и как держать получающийся workflow observable. Orchestration — то, что превращает model API в production AI-фичу.
Orchestration — там, где теряется больше всего production AI-стоимости и надёжности. Agent loops без iteration caps вызывают runaway cost-всплески. Модели, которым поручают оркестрировать workflow, которыми они не должны владеть, вызывают тихий quality drift. По AI-внедрениям, которые Skopa аудировала, чистка оркестрации обычно даёт самое крупное одиночное снижение стоимости — около 30% общей экономии.
Модель должна быть наименьшим возможным компонентом workflow, а не его оркестратором. Здоровая оркестрация отделяет планирование от исполнения, выносит детерминированную логику из модели полностью, ставит жёсткие caps на итерации и tool-вызовы на ход, валидирует выводы структурно до действия, и трассирует каждый span end-to-end. Фреймворки вроде LangGraph и CrewAI помогают, но реальная победа — архитектурная дисциплина решения, какие шаги реально требуют вероятностного рассуждения, а какие нет.