Китайский исследователь из Пекинского университета представил на архиве arXiv принципиально новый способ оценки количества параметров в закрытых ИИ-моделях. Вместо традиционного анализа экономики инференса, который даёт погрешность до 200%, учёный предложил использовать бенчмарк на основе фактических знаний.
Метод основан на том, что способность модели хранить факты ограничена энтропией Шеннона и не поддаётся дистилляции, в отличие от рассуждений. Бенчмарк включает 1400 вопросов, распределённых по 7 уровням редкости — от широко известных фактов до узкоспециализированных. Исследователь откалибровал метод на 89 открытых моделях с известным числом параметров и выявил чёткую лог-линейную зависимость между результатами теста и размером модели (коэффициент детерминации R²=0,917). Проецируя закрытые модели на калибровочную кривую, учёный получил оценки: GPT-5.5 содержит около 9,7 трлн параметров, Claude Opus 4.6 — 5,3 трлн, Claude Sonnet 4.6 — 1,7 трлн, а Gemini 2.5 Pro — 1,2 трлн.
По теме: Клауд от Anthropic обходят китайские модели: как GLM 5.1 и 5.2 работают быстрее, дешевле и без…
Исследователь отмечает, что эти цифры могут быть нижними границами из-за настроек безопасности, ограничивающих ответы моделей на некоторые вопросы.
Новый метод открывает возможности для независимой оценки масштабов закрытых моделей, что ранее было невозможно из-за отсутствия доступа к их архитектуре. В то же время точность метода остаётся ограниченной из-за субъективности вопросов и вариативности ответов. Тем не менее, результаты вызывают интерес в научном сообществе и могут стимулировать дальнейшие исследования в области бенчмаркинга ИИ.
Исследование опубликовано на arXiv 28 апреля 2026 года и доступно для свободного скачивания.