# Пятый подвиг Геракла: цифровая конюшня

*Царь Авгий получил от богов огромные стада скота. Скот был божественный — не болел, плодился, накапливался. Конюшни не чистились годами. Геракл справился за один день — направил через них две реки.*

У всех нас есть цифровая конюшня. Называется она по-разному: "АРХИВ 2012", "Старый ноут", "Диск D — разобрать потом". Файлы тоже накапливаются сами — мессенджер автосохраняет, скриншоты делаются одной кнопкой, почта тянет вложения, торрент качает про запас. Не болеют, не пахнут, места почти не занимают — вот и лежат.

## 1. Кто вероятный потребитель

**Человек с дисками в шкафу.** Снаружи написано "ВАЖНОЕ". Внутри — несколько копий одного и того же, папка "фото разобрать" с тысячами файлов, архивы с неизвестным содержимым. Не выбросить, потому что вдруг там что-то ценное. Не разобрать, потому что когда?

**Маркетолог в десятках чатов одновременно.** Рабочие чаты с клиентами, тематические каналы, профессиональные сообщества. Где-то там — живые клиенты, незакрытые запросы, чужие боли. Но поток такой плотный, что читать некогда, а нанять аналитика дорого.

**Специалист с профессиональной библиотекой.** Инженер, исследователь, врач. Годами собирал книги, даташиты, схемы по своей теме — десятки гигабайт. В облако нельзя: конфиденциально или просто не хочет кормить чужой датацентр своими знаниями. Половина книг — без распознавания текста, то есть для поиска они просто не существуют.

**Хранитель аудио- и видеоархива.** Концертные записи, оцифрованные кассеты, голосовые из мессенджеров, видео с телефонов. Знает, что там уникальное. Не знает, что именно и где.

## 2. Что делает продукт

Три инструмента под одной крышей — три потока воды через три разные конюшни.

**Поток первый: библиотека.** Берёт папку с файлами любого типа — книги, даташиты, схемы, документы — и просит локальную нейросеть написать аннотацию к каждому. Нераспознанные PDF готовит к OCR. На выходе: нормальный индекс, в котором можно искать по смыслу, а не гадать по имени файла `doc_final_FINAL_v3_USE_THIS.pdf`.

**Поток второй: аудио и видео.** Берёт записи — концерты, голосовые, переговоры, кружочки из мессенджеров — и превращает их в текст с таймкодами. Если это музыка — пытается определить, что именно исполнялось. Если это разговоры — суммаризирует, о чём говорили.

**Поток третий: переписка.** Берёт полную выгрузку канала или чата, собирает весь текст, скачивает голосовые и видео, распознаёт их, складывает в длинный документ и суммаризирует. На выходе: кто эти люди, что их волнует, есть ли среди них потенциальные клиенты — плюс готовое задание для любой нейросети: вот аудитория, вот её язык, вот что ей предложить.

Всё работает локально. Файлы никуда не уходят.

## 3. К какой категории он относится

**Локальный ИИ-разведчик для личных коллекций** — новая категория без устоявшегося названия. Не облачный транскрибатор. Не корпоративный документооборот. Не поисковик по файлам. Не медиасервер. Что-то между — но с принципиальным отличием: работает на вашем железе, с вашими данными, выдаёт не список, а заключение.

## 4. Чем это лучше других близких вещей

Организаторы файлов с ИИ переименовывают и раскладывают по папкам, но не умеют аудио, видео и переписку. Десктопный поиск быстро ищет по содержимому, но не понимает смысл. Системы документооборота с OCR хороши с документами, но не с аудио/видео. Транскрипция распознаёт речь, но не связывает результат с остальным архивом и не дообучается под конкретный голос.

Ни один инструмент не делает всего одновременно: смешанный архив (текст + аудио + видео + сканы) в одном пайплайне, обучение под специфику коллекции, рекомендация что делать дальше — полностью локально.

## 5. Какие задачи он может исполнить

| Задача | Результат |
|---|---|
| Разобраться, что на диске | Карта архива с аннотациями к каждой группе файлов |
| Убрать дубли и очевидный мусор | Дедупликация без потери ничего важного |
| Сделать библиотеку searchable | Аннотации + OCR → поиск по смыслу |
| Расшифровать часы записей | Текст с таймкодами, суммаризация, идентификация |
| Понять, кто в чате | Портрет аудитории + промпт для следующего шага |
| Оценить, что уникально, а что мусор | Редкое / типовое / устаревшее / требует внимания |

## 6. Как это помогает

**Человек с дисками в шкафу** запускает инструмент, указывает папку, уходит пить чай. Через несколько часов: вот мусор — удалить? Вот семейные фото. Вот рабочие документы — осторожно, может быть конфиденциальное.

**Маркетолог** загружает выгрузки каналов. Получает: эти — шум, не тратить время. Этот — там живут потенциальные клиенты, вот их боли, вот готовый промпт для следующего разговора.

**Инженер** впервые видит свою библиотеку целиком: что есть, что устарело, что нигде больше не найти. Аннотации написаны на его языке — потому что инструмент обучился на его же коллекции.

---

Отдельная, эмоционально другая ситуация — когда архив не свой, а достался от кого-то. Об этом отдельно: [Унаследованный архив](/inherited-archive/).

*Обе ключевые технологии уже работают: инженерная библиотека — стабильно, в продакшне; аудиоархив бардовской песни — 107 часов расшифрованы, модель дообучается. Это не концепция — это инструмент, у которого есть доказательства.*
