Разметка данных

Разметка на объёме, где важна предсказуемость потока.

Разметка — это работа, которая должна идти ровно и не требовать внимания. Всё, что здесь важно, — чтобы поток не спотыкался и результат приходил в вашей схеме.

Форма работы

Это не задача на рассуждение, а задача на объём: много однотипных элементов, к каждому нужно приписать метку по понятному правилу. Здесь ценится не глубина, а ровность — чтобы тысячный элемент обрабатывался так же, как первый.

Правило вы задаёте

Категории, критерии и спорные случаи описываете вы. Модель применяет правило, а не придумывает своё.

  • От вас
  • Схема разметки

Поток идёт ровно

Лимит одновременных запросов 2 500 позволяет держать постоянную пропускную способность без очередей на пиках.

  • Лимит
  • 2 500 одновременных

Ответ сразу размечен

Метка приходит в вашей схеме. Раскладывать результат по полям кодом не нужно.

  • Выход
  • Ваша схема

Как понять, что это работает

Возьмите выборку, которую ваши специалисты уже разметили вручную, и прогоните через модель. Сравните. Это единственный честный способ понять, годится ли подход, и его стоит делать до того, как переводить на модель весь поток.

  • Сверяйте не общую точность, а расхождение по каждой категории — ошибки почти всегда скапливаются в одной-двух
  • Отдельно смотрите пограничные случаи: там, где ваши специалисты сами расходятся во мнении, модель будет расходиться тоже
  • Заложите в процесс выборочную проверку человеком — на объёме сплошная проверка не нужна, достаточно выборки
  • Если правило меняется со временем, фиксируйте его версию — иначе сравнение старых и новых результатов ничего не значит

Что стоит учесть

Разметка — это тот случай, где важно заранее договориться о критерии приёмки. Не о «хорошо/плохо», а о конкретном числе: какая доля расхождений с ручной разметкой для вас приемлема. Этот критерий стоит зафиксировать до старта, потому что после — договориться о нём уже сложно.

Частые вопросы

Можно ли размечать данные на другом языке?

Да. Модель читает документы на разных языках в одном потоке, отдельный маршрут под каждый язык не нужен.

Что делать со спорными случаями?

Их стоит выделить в отдельную категорию и отдавать человеку, а не пытаться заставить модель выбрать между двумя вариантами. Так и точность выше, и разбираться потом проще.

Как считается объём?

По токенам — входным и выходным. Это видно по вашему API-ключу, а ежемесячно приходит в счёте с расшифровкой.

КЛАССИФИКАЦИЯ И МАРШРУТИЗАЦИЯ

Схема процесса: три этапа, соединённые стрелками; средний этап выделен.

Вход

Обращение, письмо, документ

высокий объём, простая логика

DeepSeek V4.1 Flash

Выход

Очередь, метка, приоритет

по каждому элементу

  • Раскладываются по вашим очередям
  • Поток идёт ровно на объёме
  • Правило разметки задаёте вы
Ровный поток на объёме — и метка сразу в вашей схеме.Схема профиля нагрузки. Не скриншот.

Расскажите, какой объём и что используете сейчас.

Обычно ответим в течение одного рабочего дня: условия и персональный менеджер.