Реестр измерений / 14 августа 2026
Бенчмарк моделей для извлечения данных
Четыре сценария, точные маршруты OpenRouter и проверка фактической модели. Fallback-ответ или результат без подтвержденного LLM-вызова остается без оценки.
B1
CRM CSV
5 строк
B2
Финансовый CSV
332 строки
B3
Русский счет
OCR + кириллица
B4
Инвесторская таблица
32 строки
Новая группа моделей
OpenRouter agent-session
Все 28 запросов завершены: 21 сценарий прошел строгий runtime-аудит, семь остались без оценки. Звездочка - среднее по принятым сценариям.
| Модель / маршрут | B1 | B2 | B3 | B4 | Принято | Качество | Принятое время | Расч. стоимость | Аудит |
|---|---|---|---|---|---|---|---|---|---|
DeepSeek V4 Flash deepseek/deepseek-v4-flash-0731 | 100% | Без оценки | Без оценки | 60% | 2 / 4 | 80,0%* | 198,57 с | $0,003084 | частично |
Gemini 3.7 Flash google/gemini-3.7-flash | 100% | 90% | Без оценки | 80% | 3 / 4 | 90,0%* | 231,77 с | $0,148371 | частично |
GLM 5.2 z-ai/glm-5.2 | 100% | 90% | Без оценки | 80% | 3 / 4 | 90,0%* | 187,35 с | $0,133615 | частично |
GPT-5.6 Terra openai/gpt-5.6-terra | 100% | 90% | Без оценки | 80% | 3 / 4 | 90,0%* | 79,46 с | $0,220568 | частично |
Gemini 3.6 Flash google/gemini-3.6-flash | 100% | 90% | Без оценки | 80% | 3 / 4 | 90,0%* | 410,10 с | $0,312994 | частично |
Muse Spark 1.2 meta/muse-spark-1.2 | 100% | 90% | 0% | 80% | 4 / 4 | 67,5% | 94,67 с | $0,246303 | проверено |
Claude Sonnet 5 anthropic/claude-sonnet-5 | 100% | 90% | Без оценки | 60% | 3 / 4 | 83,3%* | 368,18 с | $0,769854 | частично |
Строгий неполный прогон / 13 августа 2026
Muse, Gemma и Qwen
Звездочкой отмечено среднее только по принятым сценариям. Отклоненные сценарии не превращаются в нулевую оценку.
| Модель / маршрут | B1 | B2 | B3 | B4 | Принято | Качество | Принятое время | Расч. стоимость | Аудит |
|---|---|---|---|---|---|---|---|---|---|
Muse Glimmer 30B meta/muse-glimmer-30b | 100% | 90% | Без оценки | 80% | 3 / 4 | 90,0%* | 239,63 с | $0,078254 | частично |
Gemma 4 31B google/gemma-4-31b-it | 100% | 90% | Без оценки | 100% | 3 / 4 | 96,7%* | 731,96 с | $0,028575 | частично |
Qwen3.6 27B qwen/qwen3.6-27b | 100% | 90% | Без оценки | Без оценки | 2 / 4 | 95,0%* | 630,88 с | $0,029375 | частично |
Правила оценки
Только измеренные результаты
- 01 / модельЗапрошенный маршрут должен присутствовать в runtime-аудите.
- 02 / вызовИзвлечение должно содержать хотя бы один подтвержденный LLM-вызов.
- 03 / качествоДля каждого сценария сравниваются строки, колонки и значения.
- 04 / ошибкиПодмены и ошибки видны, но никогда не получают балл.
Проверить модели на ваших документах
Запустим тот же аудируемый контур на репрезентативной выборке.