Проверить API

МЕТОДИКА · ВЕРСИИ И ОГРАНИЧЕНИЯ

Что мы меряем
и чего не утверждаем.

Что AuditLLM измеряет, как из измерений получается уровень вывода и где проходит граница того, что можно утверждать.

Что означает проверка

Подробная методика ↓

Отправляем задачи

На указанный вами API идут проверяемые запросы; ответы, ошибки и задержки измеряются.

Сравниваем с эталоном, когда он есть

Для точного ID модели нужен собранный снимок официального API. Без него показываем только измерения.

Показываем основания и границы вывода

Один запуск описывает конкретное время и выборку. Он не доказывает, какая модель скрыта за адресом.

Что меряем

AuditLLM отправляет проверяемые задачи через указанный вами API и показывает долю верных ответов, поддержку параметров и задержки. Если для точного ID модели собран снимок напрямую у владельца, дополнительно сравниваем результаты с этим эталоном. Снимок неизменен и хранит дату, параметры и размер выборки.

Категории проб
КатегорияКак проверяется
Способности Арифметика и многошаговая логика, вывод кода, точный JSON, ограничения на формат ответа, поиск маркера в длинном тексте. У каждой задачи есть однозначно проверяемый ответ. Задачи генерируются из seed, а не берутся из публичных бенчмарков.
Учёт токенов Число входных и выходных токенов, которое насчитал провайдер, делится на значение эталона при одинаковом входе. Отношение 1,00 значит, что счёт совпадает.
Параметры API max_tokens, stop, temperature: 0, seed, logprobs, response_format, вызов инструментов. Итог по каждому: поддерживается, игнорируется или ошибка.
Отпечаток Частоты ответов на короткие вопросы с вариантами. Расхождение с эталоном считается как среднее Jensen–Shannon divergence, значимость проверяется перестановочным тестом.
Повторяемость При temperature: 0 сравниваются SHA-256 нормализованных ответов с эталоном. Сами тексты не хранятся.
Стабильность Доля ошибок, ответов 429, таймаутов и оборванных потоков.
Задержки Время до первого текстового токена (TTFT) и полное время ответа, медиана и p90. Если провайдер не прислал поток, TTFT не измеряется и показывается как «Не измерено».

Доли верных ответов показываются с 95% интервалом Уилсона. При малой выборке интервал широкий, и это видно на графике.

Уровни вывода

Итог проверки выражается одним из четырёх уровней. Уровень всегда идёт вместе с основаниями и ссылками на записи, по которым он выставлен. Баллов доверия и рейтингов провайдеров нет.

Без эталона отчёт показывает результаты задач и задержки с уровнем «Измерено». Это не означает совпадения с оригиналом: сравнивать было не с чем.

Цвет никогда не идёт без значка и слова: уровни различаются формой значка (● ▲ ■ ◆ ○) и подписью, а не только цветом.

Статус оценки

AuditLLM проводит независимую техническую проверку указанного endpoint, ID модели и момента времени. Отчёт не является аккредитованным сертификатом, оценкой соответствия AI Act или сертификацией системы управления по ISO/IEC 42001. Статус провайдера и модель в ответе API сами по себе не подтверждают происхождение модели.

ШКАЛА SUMMARY-V1

summary-v1 Мало данных

Шкала одна для всех проверок. Отметка появляется только тогда, когда итоговая оценка посчитана; без неё показаны пороги, а не выдуманное число.

Итоговая оценка считается по ответам с проверяемым результатом. Ответов меньше пяти — оценка не выставляется, и на её месте стоит «Мало данных»: по трём задачам нельзя построить шкалу от 0 до 100.

  • 0–49 — «Слабый результат».
  • 50–69 — «Есть замечания».
  • 70–84 — «Хорошо».
  • 85–100 — «Отлично».
  • Ответов меньше 5 — «Мало данных», число не показывается.

Для будущей собственной программы оценки нужны опубликованные критерии, область действия, версии проб, контроль эталонов, калибровка ошибок, повторные проверки, независимое рассмотрение спорных результатов и проверяемый отчёт. Пока этих элементов нет, мы не выдаём знак соответствия.

Основания: ISO/IEC 42001 описывает систему управления организации; статья 53 AI Act задаёт обязанности поставщика GPAI-модели, а статья 43 — процедуры оценки соответствия высокорисковых AI-систем; NIST AI RMF — добровольный подход к управлению рисками.

Чего AuditLLM не утверждает

Чего нельзя утверждать
  • Мы не называем модель, которая стоит за API. Различие распределений говорит, что ответы отличаются от эталона, но не говорит, от какой модели они получены.
  • Одна проверка не доказывает подмену. Провайдер мог сменить регион, версию модели, квантование или системный промпт. Уровень «Есть сигнал для повторной проверки» означает, что несколько независимых показателей разошлись, и это повод для серии проверок.
  • Совпадение с эталоном не гарантирует, что провайдер всегда отдаёт ту же модель. Проверка описывает момент и выборку.
  • TTFT и один проваленный тест сами по себе ничего не доказывают.
  • Статус «не верифицирован» у провайдера означает, что мы не подтверждали его имя и адреса. Имя взято из хоста API.
Что можно утверждать

Как этот API ответил на конкретный набор задач в конкретное время: долю верных ответов, поддержку параметров, задержки, долю ошибок и — когда для модели собран эталон — совпадение с ответами оригинала по этим измерениям.

Версии методик

У каждого отчёта и каждого агрегата указана версия методики. Точки, собранные по разным версиям, на графиках разделены пунктиром и напрямую не сравниваются.

Версии методик
ВерсияЧто входитСостояние
capability-probes-v0 Три задачи: арифметика, вывод JavaScript, точный JSON. Без эталона. Работает, базовая проверка
capability-probes-v1 Проверяемые задачи и параметры API; сравнение со снимком эталона, если он собран. Работает на странице расширенной проверки
paired-run Одинаковые задачи двум API, которые указывает пользователь. Эталон предоставляет пользователь, мы его не удостоверяем. Работает, парное сравнение
categorical-fingerprint Профиль частот ответов на четыре типа вопросов, JSD и перестановочный p-value. Работает, распределения ответов

Статус калибровки

calibrated: false пороги не откалиброваны

Пометка стоит рядом с уровнем в каждом отчёте, пока API передаёт calibrated: false.

Пороги уровней пока не откалиброваны на размеченных сценариях: та же модель, другая версия, квантование, другая модель, частичная подмена трафика. До калибровки каждый отчёт с уровнем несёт пометку «пороги не откалиброваны». Это значит, что доля ложных срабатываний ещё не измерена.

Несколько независимых показателей расходятся с эталоном. Это повод провести серию повторных проверок, а не утверждение о подмене: уровень не называет другую модель и не доказывает её использование.

Показаны измерения этого запуска. Этот уровень не подтверждает личность модели или надёжность провайдера.

После калибровки для каждого бюджета запросов будут опубликованы доля ложных срабатываний, полнота и доверительные интервалы. Заявлений вроде «98% точности» до этого мы не делаем.

Что хранится

Ключ API используется только во время проверки: он не пишется в базу, журналы, адрес страницы и хранилище браузера. Сохраняются результаты проб, задержки, отношения токенов и хэши ответов для проверки повторяемости; промпты, тексты и полный сырой поток ответов не сохраняются. Гостевые отчёты публичны. После входа в аккаунт подробную проверку можно сделать личной: она не попадает в открытый архив.

Источники

Откуда берутся идеи задач и методы сравнения. Публичные задачи могут быть известны провайдерам, поэтому для проверок мы генерируем собственные варианты.

Источники тестов и эталонов
ИсточникДля чегоОграничение
LiveBench Обновляемые задачи с объективной проверкой: математика, код, анализ данных, инструкции. Публичные задачи могут быть известны провайдеру. Лицензия Apache 2.0 по datasheet проекта.
LiveCodeBench Кодовые задачи с разделением по дате публикации. Нужно проверять лицензии задач и исполнять решения в изоляции.
IFEval Проверяемые ограничения на структуру и формат ответа. Меряет следование инструкции, а не идентичность весов.
LM Evaluation Harness Единый запуск эталонных прогонов для разных задач и моделей. Инфраструктура оценки, не детектор подмены.
LLM API Audit, статья Статистические проверки подмены, включая смесь моделей и logprobs. Авторы показывают пределы тестов по одним текстовым ответам.
One Token Is Enough, реализация Распределения однотокенных ответов и Jensen–Shannon divergence. Статья сообщает 7,3% equal error rate для полного набора. Реализация под MIT, примеры данных под CC BY 4.0.
LeaFBench, SoK Устойчивость методов fingerprinting к изменениям модели. Исследовательский набор для сравнения методов, не профиль конкретного API.