Услуга · ПОЛЕЗНЫЕ ЦИФРЫ

Очистка данных и подготовка датасетов для ИИ

Превращаем накопленные CRM, 1С, Excel и документы в рабочую базу для ИИ: аудит, очистка, обогащение и сборка AI-ready датасета или базы знаний для RAG и ассистентов — за 2–6 недель.

  • МСБ
  • Крупный бизнес
  • Госсектор
  • Стартапы

Без обязательств: сначала разбираем ситуацию, затем предлагаем формат работы.

Что вы получаете

  • AI-аудит данных за 3–7 дней. Инвентаризируем все источники, считаем Data Quality Score, находим риск по 152-ФЗ и честно говорим, какой сценарий окупится первым — очистка, RAG, аналитика или fine-tuning. Это первый шаг, чтобы не переплатить.
  • Очистка CRM, 1С и таблиц. Убираем дубли, нормализуем ФИО, телефоны, адреса, ИНН и даты. Возвращаем машинный вид, в котором ИИ перестаёт ошибаться на входе. Спорные слияния — на подтверждение вам, а не «как решили мы».
  • База знаний для RAG из ваших документов. OCR для сканов, извлечение текста из PDF/DOCX, удаление устаревших версий и мусора. Команда перестаёт искать в архиве — ассистент отвечает по регламенту и FAQ.
  • Обогащение данных. Добавляем атрибуты из внешних источников: ОКВЭД, статус компании, гео, адреса. Это усиливает и аналитику, и точность поиска.
  • Структура под целевой ИИ-сценарий. Отдаём Markdown-корпус, JSONL-датасет, CSV/SQL или RAG-ready структуру с метаданными, чанками 300–800 токенов и golden set. Не «архив файлов», а рабочий контур.
  • Контроль качества. Golden set, проверка точности retrieval и метрики «полнота > 95%, дубли чанков < 2%». Вы получаете не обещания, а отчёт — что было и что стало.

Результат в цифрах

Это проверяемые ориентиры по типовым контурам (объём и формат данных влияют на финальную смету — фиксируем её до старта):

Этап Цена «от» Срок Что на выходе
AI-аудит данных 50–150 тыс. ₽ 3–7 дней карта источников, Data Quality Score, legal-check, маршрут
Очистка CRM / 1С / таблиц 100–500 тыс. ₽ 1–4 недели дедубликация, нормализация, отчёт «было → стало»
База знаний для RAG 250–900 тыс. ₽ 2–6 недель OCR, Markdown-корпус, чанки, метаданные, golden set
RAG-ассистент 400 тыс. – 1,5 млн ₽ 4–10 недель работающий контур под ваши данные
LoRA / fine-tuning 700 тыс. – 3 млн ₽ 6–14 недель дообучение под стиль, классификацию или отрасль

Ориентир по малому пилоту: очистка CRM на 10 000 записей укладывается примерно в 200 000 ₽ при прозрачной декомпозиции по людям, API и срокам.

Правило входа: почти всегда начинаем с аудита — он дешёвый и снижает риск лишних трат. Достаточно сэмпла 100–1000 строк или 20–50 документов, чтобы оценить масштаб.


Почему мы

Начинаем с аудита, а не с продажи модели.

За 3–7 дней покажем, что у вас готово для ИИ, где риск по 152-ФЗ и какой сценарий окупится первым.

Работаем в российском правовом контуре.

Учитываем 152-ФЗ, режим коммерческой тайны, деперсонализацию и ограничения на передачу данных во внешние облачные API. Данные не «утекают за границу» без вашего согласия.

Не «чёрный ящик».

На выходе — README, отчёт по качеству, метрики, правила версионирования и критерии приёмки. Вы знаете, что делали и как это воспроизвести.

Работаем и с таблицами, и с документами.

В одном проекте приводим в порядок CRM, 1С, Excel, PDF, DOCX и файловые хранилища.

Markdown-first, где это повышает качество.

Для документов собираем Markdown-корпус: он лучше сохраняет структуру, легче чанкуется и проще версионируется.

Не навязываем fine-tuning, где он не нужен.

Для большинства клиентов МСП разумнее стартовать с RAG и чистой базы знаний, а дообучение подключать только при реальной необходимости.

Вендорно-независимый совет.

Рекомендуем решение под вашу задачу, а не то, что выгоднее нам.

Для кого

Кому это быстро закроет вопрос:

МСБ без data-команды

— есть CRM, 1С, Excel и ручные процессы; нужен первый ИИ-сценарий без найма инженеров.

Стартап

— есть идея AI-продукта, но нет чистого датасета; нужно быстро собрать рабочий набор под MVP или RAG.

Крупная компания

— пилоты уже есть, но данные по подразделениям разрознены и не готовы к масштабированию.

Госструктура и регулируемые отрасли

— ПДн, регламенты и локализация в российском контуре без нарушения требований.

Когда это не ваш случай

  • Данные совсем не структурированы и не систематизированы. Если это «коробка с бумагами» без системы, сначала нужна базовая оцифровка, а не подготовка к ИИ — честно обсудим это на аудите.
  • Вы не готовы передавать даже сэмпл. Минимум 100–1000 строк или 20–50 документов нужен, чтобы оценить масштаб и риски. Без этого мы не будем гадать.
  • ИИ вам пока вообще не нужен. Тогда скажем прямо: не тратьте бюджет. Иногда правильный ответ — не запускать проект.

С чего начать

Основной шаг — бесплатный AI-аудит данных. На короткой консультации уточняем объём, источники и риск по ПДн до того, как вы заплатите. Вы получаете инструменты для решения: что реально готово для ИИ, какой путь окупится быстрее.

Вторичный шаг — демо на вашем сэмпле: покажем на 100–1000 строках ваш Data Quality Score и как выглядит результат, без обещаний на словах.

Дальше по цепочке, если данные готовы, идём в ИИ-консалтинг — чтобы не останавливаться на чистой базе, а довести до работающего ассистента, RAG или аналитики через план с ROI.

[Запросить бесплатный AI-аудит данных] · [Посмотреть, как считаем Data Quality Score] · [ИИ-консалтинг — следующий шаг]


FAQ

С чего лучше начать, если мы только думаем про ИИ?

С AI-аудита данных. Он показывает, какие источники уже есть, где главные проблемы качества и какой сценарий даст самый быстрый эффект.

Вы работаете только с таблицами или разбираете документы?

С обоими типами. CRM, 1С, Excel, SQL-выгрузки чистим и нормализуем, а из PDF/DOCX/сканов собираем корпус: OCR, извлечение текста, удаление мусора, рабочая структура.

Что в большинстве случаев лучше: RAG или fine-tuning?

Для большинства клиентов МСП разумнее стартовать с RAG: если задача на документах, регламентах и FAQ — он запускается быстрее, дешевле и проще обновляется. Fine-tuning подключаем под стиль, классификацию или глубокую адаптацию.

Что делать, если в данных есть персональные данные или коммерческая тайна?

Учитываем ещё на этапе аудита: NDA, поручение на обработку ПДн, деперсонализация, работа в защищённом контуре клиента или согласованной российской инфраструктуре.

Какой объём данных нужен, чтобы проект имел смысл?

Для оценки хватает сэмпла 100–1000 строк или 20–50 документов. Для RAG — от 100+ осмысленных документов, для fine-tuning — instruction dataset от 200+ качественных пар.

От чего сильнее всего зависит стоимость?

От объёма и формата данных, доли дублей и ошибок, необходимости OCR, объёма ручной валидации, наличия ПДн и того, нужен ли просто clean dataset или полноценная база знаний под RAG/fine-tuning.

Вы отдаёте только датасет или доводите до работающего решения?

Можем закрыть полный цикл: после подготовки переводим проект в RAG, AI-ассистента, LoRA/fine-tuning или режим постоянного сопровождения.

---

Не нашли ответ? Обсудить задачу

Регуляторный контекст

152-ФЗ «О персональных данных»

— законный контур обработки, контроль доступа, локализация в РФ, деперсонализация при необходимости.

Коммерческая тайна

— NDA, ограничение круга лиц, защищённое хранение, запрет на передачу во внешние сервисы без согласия.

Облачные API и внешние модели

— проверяем согласия, политику поставщика и нужен ли on-prem или российское облако.

Следующий шаг

Обсудим вашу задачу без лишнего риска

На первом шаге разберём ситуацию, покажем, где эффект, а где риски, и предложим формат работы под ваш масштаб.

Ответим в течение 1 рабочего дня. info@right-digits.ru

Обсудить задачу

Опишите ситуацию — вернёмся с вариантами и ориентиром по бюджету. Обычно отвечаем в течение 1 рабочего дня.