МЕТОДИКА · ВЕРСИИ И ОГРАНИЧЕНИЯ
Что мы меряем
и чего не утверждаем.
Что AuditLLM измеряет, как из измерений получается уровень вывода и где проходит граница того, что можно утверждать.
Что означает проверка
Подробная методика ↓Отправляем задачи
На указанный вами API идут проверяемые запросы; ответы, ошибки и задержки измеряются.
Сравниваем с эталоном, когда он есть
Для точного ID модели нужен собранный снимок официального API. Без него показываем только измерения.
Показываем основания и границы вывода
Один запуск описывает конкретное время и выборку. Он не доказывает, какая модель скрыта за адресом.
Что меряем
AuditLLM отправляет проверяемые задачи через указанный вами API и показывает долю верных ответов, поддержку параметров и задержки. Если для точного ID модели собран снимок напрямую у владельца, дополнительно сравниваем результаты с этим эталоном. Снимок неизменен и хранит дату, параметры и размер выборки.
| Категория | Как проверяется |
|---|---|
| Способности | Арифметика и многошаговая логика, вывод кода, точный JSON, ограничения на формат ответа, поиск маркера в длинном тексте. У каждой задачи есть однозначно проверяемый ответ. Задачи генерируются из seed, а не берутся из публичных бенчмарков. |
| Учёт токенов | Число входных и выходных токенов, которое насчитал провайдер, делится на значение эталона при одинаковом входе. Отношение 1,00 значит, что счёт совпадает. |
| Параметры API | max_tokens, stop, temperature: 0, seed, logprobs, response_format, вызов инструментов. Итог по каждому: поддерживается, игнорируется или ошибка. |
| Отпечаток | Частоты ответов на короткие вопросы с вариантами. Расхождение с эталоном считается как среднее Jensen–Shannon divergence, значимость проверяется перестановочным тестом. |
| Повторяемость | При temperature: 0 сравниваются SHA-256 нормализованных ответов с эталоном. Сами тексты не хранятся. |
| Стабильность | Доля ошибок, ответов 429, таймаутов и оборванных потоков. |
| Задержки | Время до первого текстового токена (TTFT) и полное время ответа, медиана и p90. Если провайдер не прислал поток, TTFT не измеряется и показывается как «Не измерено». |
Доли верных ответов показываются с 95% интервалом Уилсона. При малой выборке интервал широкий, и это видно на графике.
Уровни вывода
Итог проверки выражается одним из четырёх уровней. Уровень всегда идёт вместе с основаниями и ссылками на записи, по которым он выставлен. Баллов доверия и рейтингов провайдеров нет.
Без эталона отчёт показывает результаты задач и задержки с уровнем «Измерено». Это не означает совпадения с оригиналом: сравнивать было не с чем.
Статус оценки
AuditLLM проводит независимую техническую проверку указанного endpoint, ID модели и момента времени. Отчёт не является аккредитованным сертификатом, оценкой соответствия AI Act или сертификацией системы управления по ISO/IEC 42001. Статус провайдера и модель в ответе API сами по себе не подтверждают происхождение модели.
ШКАЛА SUMMARY-V1
Шкала одна для всех проверок. Отметка появляется только тогда, когда итоговая оценка посчитана; без неё показаны пороги, а не выдуманное число.
Итоговая оценка считается по ответам с проверяемым результатом. Ответов меньше пяти — оценка не выставляется, и на её месте стоит «Мало данных»: по трём задачам нельзя построить шкалу от 0 до 100.
- 0–49 — «Слабый результат».
- 50–69 — «Есть замечания».
- 70–84 — «Хорошо».
- 85–100 — «Отлично».
- Ответов меньше 5 — «Мало данных», число не показывается.
Для будущей собственной программы оценки нужны опубликованные критерии, область действия, версии проб, контроль эталонов, калибровка ошибок, повторные проверки, независимое рассмотрение спорных результатов и проверяемый отчёт. Пока этих элементов нет, мы не выдаём знак соответствия.
Основания: ISO/IEC 42001 описывает систему управления организации; статья 53 AI Act задаёт обязанности поставщика GPAI-модели, а статья 43 — процедуры оценки соответствия высокорисковых AI-систем; NIST AI RMF — добровольный подход к управлению рисками.
Чего AuditLLM не утверждает
- Мы не называем модель, которая стоит за API. Различие распределений говорит, что ответы отличаются от эталона, но не говорит, от какой модели они получены.
- Одна проверка не доказывает подмену. Провайдер мог сменить регион, версию модели, квантование или системный промпт. Уровень «Есть сигнал для повторной проверки» означает, что несколько независимых показателей разошлись, и это повод для серии проверок.
- Совпадение с эталоном не гарантирует, что провайдер всегда отдаёт ту же модель. Проверка описывает момент и выборку.
- TTFT и один проваленный тест сами по себе ничего не доказывают.
- Статус «не верифицирован» у провайдера означает, что мы не подтверждали его имя и адреса. Имя взято из хоста API.
Как этот API ответил на конкретный набор задач в конкретное время: долю верных ответов, поддержку параметров, задержки, долю ошибок и — когда для модели собран эталон — совпадение с ответами оригинала по этим измерениям.
Версии методик
У каждого отчёта и каждого агрегата указана версия методики. Точки, собранные по разным версиям, на графиках разделены пунктиром и напрямую не сравниваются.
| Версия | Что входит | Состояние |
|---|---|---|
| capability-probes-v0 | Три задачи: арифметика, вывод JavaScript, точный JSON. Без эталона. | Работает, базовая проверка |
| capability-probes-v1 | Проверяемые задачи и параметры API; сравнение со снимком эталона, если он собран. | Работает на странице расширенной проверки |
| paired-run | Одинаковые задачи двум API, которые указывает пользователь. Эталон предоставляет пользователь, мы его не удостоверяем. | Работает, парное сравнение |
| categorical-fingerprint | Профиль частот ответов на четыре типа вопросов, JSD и перестановочный p-value. | Работает, распределения ответов |
Статус калибровки
Пометка стоит рядом с уровнем в каждом отчёте, пока API передаёт calibrated: false.
Пороги уровней пока не откалиброваны на размеченных сценариях: та же модель, другая версия, квантование, другая модель, частичная подмена трафика. До калибровки каждый отчёт с уровнем несёт пометку «пороги не откалиброваны». Это значит, что доля ложных срабатываний ещё не измерена.
Несколько независимых показателей расходятся с эталоном. Это повод провести серию повторных проверок, а не утверждение о подмене: уровень не называет другую модель и не доказывает её использование.
Показаны измерения этого запуска. Этот уровень не подтверждает личность модели или надёжность провайдера.
После калибровки для каждого бюджета запросов будут опубликованы доля ложных срабатываний, полнота и доверительные интервалы. Заявлений вроде «98% точности» до этого мы не делаем.
Что хранится
Ключ API используется только во время проверки: он не пишется в базу, журналы, адрес страницы и хранилище браузера. Сохраняются результаты проб, задержки, отношения токенов и хэши ответов для проверки повторяемости; промпты, тексты и полный сырой поток ответов не сохраняются. Гостевые отчёты публичны. После входа в аккаунт подробную проверку можно сделать личной: она не попадает в открытый архив.
Источники
Откуда берутся идеи задач и методы сравнения. Публичные задачи могут быть известны провайдерам, поэтому для проверок мы генерируем собственные варианты.
| Источник | Для чего | Ограничение |
|---|---|---|
| LiveBench | Обновляемые задачи с объективной проверкой: математика, код, анализ данных, инструкции. | Публичные задачи могут быть известны провайдеру. Лицензия Apache 2.0 по datasheet проекта. |
| LiveCodeBench | Кодовые задачи с разделением по дате публикации. | Нужно проверять лицензии задач и исполнять решения в изоляции. |
| IFEval | Проверяемые ограничения на структуру и формат ответа. | Меряет следование инструкции, а не идентичность весов. |
| LM Evaluation Harness | Единый запуск эталонных прогонов для разных задач и моделей. | Инфраструктура оценки, не детектор подмены. |
| LLM API Audit, статья | Статистические проверки подмены, включая смесь моделей и logprobs. | Авторы показывают пределы тестов по одним текстовым ответам. |
| One Token Is Enough, реализация | Распределения однотокенных ответов и Jensen–Shannon divergence. | Статья сообщает 7,3% equal error rate для полного набора. Реализация под MIT, примеры данных под CC BY 4.0. |
| LeaFBench, SoK | Устойчивость методов fingerprinting к изменениям модели. | Исследовательский набор для сравнения методов, не профиль конкретного API. |