Очистка данных и подготовка датасетов для ИИ
Превращаем накопленные CRM, 1С, Excel и документы в рабочую базу для ИИ: аудит, очистка, обогащение и сборка AI-ready датасета или базы знаний для RAG и ассистентов — за 2–6 недель.
- МСБ
- Крупный бизнес
- Госсектор
- Стартапы
Без обязательств: сначала разбираем ситуацию, затем предлагаем формат работы.
Что вы получаете
- AI-аудит данных за 3–7 дней. Инвентаризируем все источники, считаем Data Quality Score, находим риск по 152-ФЗ и честно говорим, какой сценарий окупится первым — очистка, RAG, аналитика или fine-tuning. Это первый шаг, чтобы не переплатить.
- Очистка CRM, 1С и таблиц. Убираем дубли, нормализуем ФИО, телефоны, адреса, ИНН и даты. Возвращаем машинный вид, в котором ИИ перестаёт ошибаться на входе. Спорные слияния — на подтверждение вам, а не «как решили мы».
- База знаний для RAG из ваших документов. OCR для сканов, извлечение текста из PDF/DOCX, удаление устаревших версий и мусора. Команда перестаёт искать в архиве — ассистент отвечает по регламенту и FAQ.
- Обогащение данных. Добавляем атрибуты из внешних источников: ОКВЭД, статус компании, гео, адреса. Это усиливает и аналитику, и точность поиска.
- Структура под целевой ИИ-сценарий. Отдаём Markdown-корпус, JSONL-датасет, CSV/SQL или RAG-ready структуру с метаданными, чанками 300–800 токенов и golden set. Не «архив файлов», а рабочий контур.
- Контроль качества. Golden set, проверка точности retrieval и метрики «полнота > 95%, дубли чанков < 2%». Вы получаете не обещания, а отчёт — что было и что стало.
Результат в цифрах
Это проверяемые ориентиры по типовым контурам (объём и формат данных влияют на финальную смету — фиксируем её до старта):
| Этап | Цена «от» | Срок | Что на выходе |
|---|---|---|---|
| AI-аудит данных | 50–150 тыс. ₽ | 3–7 дней | карта источников, Data Quality Score, legal-check, маршрут |
| Очистка CRM / 1С / таблиц | 100–500 тыс. ₽ | 1–4 недели | дедубликация, нормализация, отчёт «было → стало» |
| База знаний для RAG | 250–900 тыс. ₽ | 2–6 недель | OCR, Markdown-корпус, чанки, метаданные, golden set |
| RAG-ассистент | 400 тыс. – 1,5 млн ₽ | 4–10 недель | работающий контур под ваши данные |
| LoRA / fine-tuning | 700 тыс. – 3 млн ₽ | 6–14 недель | дообучение под стиль, классификацию или отрасль |
Ориентир по малому пилоту: очистка CRM на 10 000 записей укладывается примерно в 200 000 ₽ при прозрачной декомпозиции по людям, API и срокам.
Правило входа: почти всегда начинаем с аудита — он дешёвый и снижает риск лишних трат. Достаточно сэмпла 100–1000 строк или 20–50 документов, чтобы оценить масштаб.
Почему мы
Начинаем с аудита, а не с продажи модели.
За 3–7 дней покажем, что у вас готово для ИИ, где риск по 152-ФЗ и какой сценарий окупится первым.
Работаем в российском правовом контуре.
Учитываем 152-ФЗ, режим коммерческой тайны, деперсонализацию и ограничения на передачу данных во внешние облачные API. Данные не «утекают за границу» без вашего согласия.
Не «чёрный ящик».
На выходе — README, отчёт по качеству, метрики, правила версионирования и критерии приёмки. Вы знаете, что делали и как это воспроизвести.
Работаем и с таблицами, и с документами.
В одном проекте приводим в порядок CRM, 1С, Excel, PDF, DOCX и файловые хранилища.
Markdown-first, где это повышает качество.
Для документов собираем Markdown-корпус: он лучше сохраняет структуру, легче чанкуется и проще версионируется.
Не навязываем fine-tuning, где он не нужен.
Для большинства клиентов МСП разумнее стартовать с RAG и чистой базы знаний, а дообучение подключать только при реальной необходимости.
Вендорно-независимый совет.
Рекомендуем решение под вашу задачу, а не то, что выгоднее нам.
Для кого
Кому это быстро закроет вопрос:
МСБ без data-команды
— есть CRM, 1С, Excel и ручные процессы; нужен первый ИИ-сценарий без найма инженеров.
Стартап
— есть идея AI-продукта, но нет чистого датасета; нужно быстро собрать рабочий набор под MVP или RAG.
Крупная компания
— пилоты уже есть, но данные по подразделениям разрознены и не готовы к масштабированию.
Госструктура и регулируемые отрасли
— ПДн, регламенты и локализация в российском контуре без нарушения требований.
Когда это не ваш случай
- Данные совсем не структурированы и не систематизированы. Если это «коробка с бумагами» без системы, сначала нужна базовая оцифровка, а не подготовка к ИИ — честно обсудим это на аудите.
- Вы не готовы передавать даже сэмпл. Минимум 100–1000 строк или 20–50 документов нужен, чтобы оценить масштаб и риски. Без этого мы не будем гадать.
- ИИ вам пока вообще не нужен. Тогда скажем прямо: не тратьте бюджет. Иногда правильный ответ — не запускать проект.
С чего начать
Основной шаг — бесплатный AI-аудит данных. На короткой консультации уточняем объём, источники и риск по ПДн до того, как вы заплатите. Вы получаете инструменты для решения: что реально готово для ИИ, какой путь окупится быстрее.
Вторичный шаг — демо на вашем сэмпле: покажем на 100–1000 строках ваш Data Quality Score и как выглядит результат, без обещаний на словах.
Дальше по цепочке, если данные готовы, идём в ИИ-консалтинг — чтобы не останавливаться на чистой базе, а довести до работающего ассистента, RAG или аналитики через план с ROI.
[Запросить бесплатный AI-аудит данных] · [Посмотреть, как считаем Data Quality Score] · [ИИ-консалтинг — следующий шаг]
FAQ
С чего лучше начать, если мы только думаем про ИИ?
С AI-аудита данных. Он показывает, какие источники уже есть, где главные проблемы качества и какой сценарий даст самый быстрый эффект.
Вы работаете только с таблицами или разбираете документы?
С обоими типами. CRM, 1С, Excel, SQL-выгрузки чистим и нормализуем, а из PDF/DOCX/сканов собираем корпус: OCR, извлечение текста, удаление мусора, рабочая структура.
Что в большинстве случаев лучше: RAG или fine-tuning?
Для большинства клиентов МСП разумнее стартовать с RAG: если задача на документах, регламентах и FAQ — он запускается быстрее, дешевле и проще обновляется. Fine-tuning подключаем под стиль, классификацию или глубокую адаптацию.
Что делать, если в данных есть персональные данные или коммерческая тайна?
Учитываем ещё на этапе аудита: NDA, поручение на обработку ПДн, деперсонализация, работа в защищённом контуре клиента или согласованной российской инфраструктуре.
Какой объём данных нужен, чтобы проект имел смысл?
Для оценки хватает сэмпла 100–1000 строк или 20–50 документов. Для RAG — от 100+ осмысленных документов, для fine-tuning — instruction dataset от 200+ качественных пар.
От чего сильнее всего зависит стоимость?
От объёма и формата данных, доли дублей и ошибок, необходимости OCR, объёма ручной валидации, наличия ПДн и того, нужен ли просто clean dataset или полноценная база знаний под RAG/fine-tuning.
Вы отдаёте только датасет или доводите до работающего решения?
Можем закрыть полный цикл: после подготовки переводим проект в RAG, AI-ассистента, LoRA/fine-tuning или режим постоянного сопровождения.
---
Не нашли ответ? Обсудить задачу
Регуляторный контекст
152-ФЗ «О персональных данных»
— законный контур обработки, контроль доступа, локализация в РФ, деперсонализация при необходимости.
Коммерческая тайна
— NDA, ограничение круга лиц, защищённое хранение, запрет на передачу во внешние сервисы без согласия.
Облачные API и внешние модели
— проверяем согласия, политику поставщика и нужен ли on-prem или российское облако.
Обсудим вашу задачу без лишнего риска
На первом шаге разберём ситуацию, покажем, где эффект, а где риски, и предложим формат работы под ваш масштаб.
Ответим в течение 1 рабочего дня. info@right-digits.ru