Observability: что произошло
Наблюдаемость показывает последовательность вызовов, задержки, ошибки, работу с памятью и расходы. Автор сравнивает её с камерой: она фиксирует ход запуска.
Наблюдаемость восстанавливает ход работы. Eval проверяет, подходит ли результат для выпуска. Два запуска показывают, как связать эти задачи.
Наблюдаемость показывает последовательность вызовов, задержки, ошибки, работу с памятью и расходы. Автор сравнивает её с камерой: она фиксирует ход запуска.
Оценка проверяет результат по заданным критериям. «Судьёй» может быть код, модель или человек. Проверки помогают решить, выпускать ли ответ или новую версию продукта.
Удобный дашборд нужен человеку, а исходная трасса — ещё и агенту: по подробным записям он может разбирать сбои и искать дорогие или медленные шаги.
Первое исследование: пять циклов, десять вызовов инструментов, около $0,29.
Второе исследование: шесть циклов, семь вызовов Treg, около $0,54.
Расходы на модель во втором запуске. Все семь вызовов Treg стоили около $0,01.
Это измерения демонстраций из видео, а не тарифы или прогноз стоимости других задач.
Harness — среда, которая управляет циклом агента: отправляет запрос модели, вызывает инструменты и возвращает их ответы в следующий шаг. В демонстрации эту роль выполняет Waku Agent.
Перед вызовами модели и внешних инструментов автор ставит gateway / metering proxy: шлюз проверяет бюджет и записывает расходы. У модели учитываются токены, у инструмента — API-вызовы. Обращения к памяти тоже должны оставлять записи, хотя хранилище часто подключается отдельно.
Trace, или трасса, связывает шаги одного запуска. Детали отдельного шага можно раскрыть до исходных данных; сводное представление показывает, где потеряно время и на что ушли деньги.
В схеме автора после анализа и eval стоит release gate: решение о выпуске. Если проверка не пройдена, нужно исправить причину, повторить запуск и снова оценить результат.
Смысл схемы: каждый шаг оставляет запись, из которой можно восстановить ход работы агента.
Пересказ объяснения автора · 06:59 ↗
Автор использует Treg как единый доступ к инструментам через один API-ключ, а Waku Memory — как переносимое хранилище контекста. В начале видео он называет более 3 800 endpoints и 108 провайдеров; эти числа относятся к моменту записи.
Первое исследование сохраняет отчёт о средствах наблюдаемости и eval. Затем автор открывает Claude Code, подключённый к Waku через MCP, и спрашивает, что тот помнит об исследовании и использованных инструментах. Ответ восстанавливает endpoint tinyfish.web.search и найденные платформы.
Здесь показаны две разные записи: память сохраняет содержание исследования для повторного использования, а трасса хранит ход его выполнения. Перенос памяти не заменяет учёт вызовов и расходов.
Первый запрос — исследовать инструменты observability и eval, их возможности и пробелы. Агент ищет инструменты в каталоге Treg, выполняет веб-поиск, составляет отчёт и сохраняет его в память.
Дашборд показывает пять циклов, десять вызовов инструментов, 70 секунд и около $0,29. Четыре вызова tinyfish.web.search в этой демонстрации бесплатны. Счётчик всех инструментов включает также служебные действия и обращения к памяти; это не десять внешних поисковых запросов.
Второй цикл ищет подходящий инструмент в каталоге Treg.
Третий цикл запрашивает сведения каталога и готовит поиск.
Пятый цикл пишет ответ. Это самый долгий цикл первого запуска.
После ответа отдельно видны сохранение отчёта и консолидация памяти. Разбор по шагам позволяет оценить, что стоит оптимизировать: поиск, выбор инструментов, генерацию ответа или служебную работу с контекстом.
Проверки запуска сопоставляют ответ с трассой и выходами инструментов. Пять строк содержат конкретные условия, шестая запускает модель-судью по запросу.
Заявленная пользователю стоимость должна совпадать с учётом расходов в трассе. В первом запуске проверка прошла. Во втором на экране стоит N/A.
Один исследовательский запрос должен создать ровно один отчёт, даже если работа длинная. Проверка прошла в обоих запусках.
Числа из ответа должны встречаться в выходе инструмента, памяти или сообщении. В первом запуске N/A, во втором PASS. Такая проверка подтверждает наличие источника числа, но сама по себе не доказывает его истинность.
Каждый неудачный вызов должен быть повторён либо упомянут в ответе. В первом запуске ошибок не было; во втором это условие прошло после сбоя поиска в X.
Стоимость запуска должна быть ниже заданного лимита на ход агента. Проверка прошла в обоих примерах.
Модель читает ответ и результаты инструментов по запросу. Автор не запускает её в показанном разборе; зелёные статусы других проверок не заменяют эту оценку.
Следующий запрос просит найти публикации в X и Reddit о конкуренции с Langfuse и дать разбор архитектур. Агент делает пять вызовов scrapecreators.reddit.search.posts и два вызова anyapi.x.search.posts; один из вызовов X завершается ошибкой.
Запуск занимает около 129 секунд и стоит около $0,54: $0,53 на модель и $0,01 на семь вызовов Treg. Самым медленным оказывается шестой цикл, который формирует финальный ответ.
В трассе есть status 400 у поиска в X. Проверка errors handled прошла; автор показывает, что ответ упоминает отсутствие найденных публикаций в X.
Автор предполагает, что доступ к X строже, чем к Reddit, но не диагностирует причину ошибки. По показанному статусу нельзя установить, почему вызов не сработал.
Введение в учёт работы и оценку результата.
Один API-ключ Treg и сохранение отчёта в Waku Memory.
Наблюдаемость фиксирует события; eval проверяет результат.
Как учитывать вызовы и собирать трассу.
Проверка переноса контекста через MCP.
Связь среды агента, учёта расходов и отдельных хранилищ.
Трасса с вызовами модели, инструментов и памяти.
Самый медленный цикл пишет ответ за 34,8 секунды.
PASS, N/A и ещё не запущенный judge.
3 218 детерминированных оценок кода перед выпуском.
Поиск публикаций в Reddit и X о конкуренции с Langfuse.
Status 400 в третьем цикле; финальный ответ — самый медленный шаг.
Неудачный вызов должен быть повторён или отражён в ответе.
Автор предлагает изучить исходную трассу и простой код.
Автор завершает видео советом изучать трассы и простой исходный код руками. По его демонстрациям можно составить такую практику:
Практика составлена по содержанию видео. Для неё не обязательно использовать Waku или Treg: автор прямо допускает другие инструменты.