AI-инфраструктура, R&D в области мультиагентных систем
Агентная среда, где законы исполняются кодом, а не промптом
За четыре дня собрали и открыли под MIT агентную среду, где правила исполняются кодом: криптография, византийский консенсус, воспроизводимые эксперименты.
- Статус
- Исследовательский проект
- Срок
- 4 дня
- Стек
- TypeScript / Node.js
- Криптография stdlib: Ed25519, X25519, AES-256-GCM
- Собственный PBFT-style византийский консенсус
- Event sourcing, hash-chained JSONL, детерминированный RNG
- Адаптеры LLM: OpenAI-compatible, Anthropic, Ollama
- Docker, GitHub Actions, GHCR
Задача
Мультиагентные LLM-системы обычно держатся на просьбах в системном промпте — модель может их нарушить. Агент способен бесконтрольно тратить токены и деньги, консенсус держится на честности одного координатора, а эксперименты по эмерджентному поведению нельзя ни повторить, ни доказать третьей стороне. Мы решили перенести эти гарантии из промптов в исполняемый код.
Что сделали
- Собрали четырёхслойный рантайм на голом Node.js без runtime-зависимостей: агенты, stateful-связи и инварианты, исполняемые кодом — вплоть до запрета отрицательного баланса.
- Реализовали криптографию и сетевой византийский консенсус: идентичность Ed25519, шифрование каналов, кворум с сертификатами коммита и смена лидера при отказе.
- Добавили экономику с двойной записью и эскроу обеих сторон: резервирование, атомарный сеттлмент, возврат остатка. Вызовы LLM метируются внутри неё — три адаптера за одним интерфейсом.
- Построили детерминированную лабораторию экспериментов: event sourcing, hash-chained журнал, точный реплей, sha256-аттестация, read-only наблюдатель с API и UI без внешних зависимостей.
- Открыли код под MIT — github.com/AndrewHakmi/agent-native-universe: тегированный релиз, CI/CD, контейнерный образ в публичном реестре, hardened-профиль запуска.
Результат
- 64 × 10 000
- агентов × тиков в референс-эксперименте: 131 372 события, 0 нарушений инвариантов; sha256-аттестация прошла независимую верификацию
- до 3,9×
- ускорение тика политики на референс-нагрузке (1 126,7 → 286,5 мс) без изменения хешей; замер профилировочным скриптом из репозитория
- 135
- автотестов, все проходят за ~56 с; проверено локальным прогоном; 89 из них покрывают детерминированную лабораторию
- 4 дня
- от пустого репозитория до открытого релиза: ~20,6 тыс. строк TypeScript, CI/CD и аттестованный эксперимент; подсчёт по git-истории и коду
Направления
Мультиагентные системы: когда один агент уже не справляется
Мультиагентные архитектуры · LLM · Автономия
НИОКР в области программного обеспечения и искусственного интеллекта
Наука · Исследования · Разработка
Инфраструктура и DevOps: чтобы прод был предсказуемым
DevOps · Kubernetes · CI/CD · Наблюдаемость
Другие кейсы
Маркетплейсы · Ценообразование
ПилотРепрайсинг без ручного контроля цен: пилот с договорными гарантиями
Сервис следит за ценами конкурентов на маркетплейсе и считает цену в коридоре. Ни одна цена не применяется без подтверждения. Пилот: 10 SKU, настройка до 14 дней.
- 10 SKU · 2 сценария
- объём пилота; лимит SKU и оба сценария зашиты в код и проверяются контрактными тестами — превысить лимит нельзя
- до 14 дней
- договорной срок настройки от получения входных данных до запуска, затем 1 месяц пилота; даты считает сервис, по окончании доступ закрывается
Производство · Стройматериалы
MVP в эксплуатацииСпецификация сэндвич-панелей из чертежа за секунды вместо часов
Приложение читает DWG/DXF-раскладку и собирает спецификацию в Excel: 10–30 секунд вместо 2–15 часов вручную. 784 панели объекта сошлись с ручной спецификацией построчно.
- 784/784 и 189/189
- панелей на одном объекте и стеновых на втором совпали с ручной спецификацией построчно, с типоразмерами; расхождение площади — 0,001 м²
- 2–15 ч → 10–30 с
- подготовка спецификации объекта: вручную против обработки приложением — по замерам на реальных проектах
Маркетплейсы · Аналитика продаж
В продакшенеПрибыль по каждому SKU на трёх маркетплейсах со сверкой 0,00 %
Пять кабинетов на WB, Ozon и Яндекс Маркете свели в одну юнит-экономику по SKU. Расхождение с расчётом заказчика — 0,00 %, прогноз спроса в 2,7 раза точнее наивного.
- 0,00 %
- расхождение с ручным расчётом заказчика по штукам, выручке, себестоимости, прибыли и марже на контрольном SKU за месяц; порог приёмки — 1 %
- в 2,7 раза
- точнее наивного прогноза: недельный WAPE по SKU с 80 % выручки — 29,6 % против 81,4 %. Цель 25 % пока не взята: история есть по 66,9 % SKU
Посчитать эффект на своих цифрах
AVA — калькулятор экономики процесса. За пару минут он покажет, окупается ли похожая задача в вашем случае, ещё до разговора с нами и без обязательств.
Оценить эффект с AVAПохожая задача?
Опишите процесс и данные, которые у вас есть. Скажем, что из этого считается в деньгах, а что — нет, до начала работ.
или напишите напрямую: hello@xteam.pro