El quinto trabajo de Hércules: los establos digitales

El rey Augías recibió de los dioses un rebaño divino inmenso. El ganado nunca enfermaba, y se multiplicaba sin cesar. Los establos llevaban años sin limpiarse. Hércules lo resolvió en un solo día — desvió dos ríos a través de ellos.

Todos tenemos un establo digital. Recibe distintos nombres: "ARCHIVO 2012", "Portátil viejo", "Disco D — ordenar más adelante". Los ficheros también se acumulan solos — la mensajería guarda automáticamente, las capturas de pantalla se hacen con un botón, el correo arrastra adjuntos, el cliente de torrents descarga cosas "por si acaso". No enferman, no huelen, apenas ocupan espacio — así que ahí se quedan.

Aquí están las pruebas en archivos reales:

800.000+
archivos procesados
~85 TB
volumen de origen
66.000+ h
de audio (~7,5 años)
1,8 TB
liberado por deduplicación
3.507 h
dedicadas al procesamiento
~430
intérpretes identificados en vídeo

Por el canal disponible (~30 Mbit/s, medido) subir este volumen a la nube tardaría unos 262 días — frente a los 96 que realmente llevó procesarlo en el sitio. El almacenamiento costaría desde $84/mes, y el procesamiento en una GPU comparable costaría desde $150–190/mes. Y eso sin contar el siguiente paso: los datos igualmente hay que moverlos del almacenamiento a la propia máquina con GPU para procesarlos — incluso por una conexión tres veces más rápida (100 Mbit/s), un lote de varios terabytes tarda unos 3 días.

1. Quién es el usuario probable

La persona con discos en el armario. Por fuera pone "IMPORTANTE". Por dentro — varias copias de lo mismo, una carpeta de "fotos por ordenar" con miles de ficheros, archivos de contenido desconocido. No se pueden tirar, porque quizá haya algo valioso ahí dentro. No se pueden ordenar, porque ¿cuándo?

El especialista de marketing en decenas de chats a la vez. Chats de trabajo con clientes, canales temáticos, comunidades profesionales. En algún punto de todo eso — clientes reales, solicitudes sin resolver, problemas ajenos. Pero el flujo es tan denso que no hay tiempo de leerlo, y contratar a un analista sale caro.

El estudiante. Años de apuntes, apuntes escaneados, grabaciones de clases y seminarios — a menudo en varios idiomas a la vez. Repartido en carpetas con nombres como "clases 3er año" y "repasar". Encontrar el fragmento correcto antes de un examen es toda una investigación.

El profesor, de colegio o universidad. El material docente se acumula durante décadas: apuntes de cursos, grabaciones de clases, correspondencia con estudiantes, borradores de guías en distintos idiomas. El archivo crece más rápido de lo que da tiempo a revisarlo y actualizarlo.

Un profesor se dirige a estudiantes que toman apuntes en un aula universitaria
Décadas de material docente, una clase a la vez.

El ingeniero. Hojas de datos, planos, cálculos, documentación técnica — acumulados durante años, decenas de gigabytes. La nube está descartada: es confidencial, o simplemente no quiere alimentar el centro de datos de otro con su propio conocimiento. La mitad de los ficheros no tiene reconocimiento de texto, es decir, para la búsqueda simplemente no existen — y en algún lugar ahí fuera, otro ingeniero ya resolvió exactamente el problema en el que está atascado, en una carpeta tan privada como esta. (Más sobre esto.)

El músico o compositor. Grabaciones de conciertos, borradores, tomas duplicadas de la misma pieza en distintas interpretaciones, cintas de casete, digitalizaciones. Sabe que en algún lugar ahí dentro hay una interpretación única o una grabación inédita. No sabe en cuál de los cientos de ficheros — ni sabe que alguien entre el público esa noche tiene el ángulo que le falta a su propia grabación. (Más sobre esto.)

El club musical o literario. Noche tras noche se acumulan grabaciones de conciertos, veladas creativas y lecturas de poesía, pero ya no queda nadie que pueda ordenar quién actuó y qué se dijo o se tocó exactamente — la formación cambia, y el archivo sigue siendo colectivo, de nadie en particular. A menudo varios socios grabaron la misma velada desde asientos distintos, y nadie ha cotejado nunca esas grabaciones entre sí. (Más sobre esto.)

Cámara de vídeo sobre un trípode apuntando a un escenario iluminado
Un ángulo entre muchos esa noche — nadie ha cotejado el resto entre sí.

El archivista de una escena musical, poética o cultural. El guardián autoproclamado de las grabaciones de los eventos de todo un género o comunidad — un círculo de canción de autor es solo un ejemplo, ni mucho menos el único. Conciertos, lecturas, veladas de décadas atrás, que se sostienen porque alguien todavía recuerda quién actuó, qué y cuándo. El archivo está tan completo como las propias grabaciones de una sola persona — aunque es muy probable que otros asistentes, a lo largo de los años, hayan grabado esas mismas veladas desde sus propios asientos.

El archivista. El guardián de un fondo — personal, familiar o de un archivo ajeno confiado a su cuidado. Soportes, documentos y grabaciones de distintas épocas mezclados, sin un sistema de descripción único. La tarea no es "borrar" — es entender qué hay en realidad antes de decidir nada.

2. Qué hace el producto

Cuatro herramientas bajo un mismo techo — cuatro ríos desviados a través de cuatro establos distintos.

Flujo uno: la biblioteca. Toma una carpeta con ficheros de cualquier tipo — libros, hojas de datos, planos, documentos — y le pide a una red neuronal local que escriba una anotación de cada uno. Prepara los PDF sin reconocer para el OCR. El resultado: un índice de verdad en el que se puede buscar por significado, en lugar de adivinar por el nombre de archivo doc_final_FINAL_v3_USAR_ESTE.pdf.

Flujo dos: audio y vídeo. Toma grabaciones — conciertos, mensajes de voz, llamadas, audios de mensajería — y las convierte en texto con marcas de tiempo. Si es música, intenta identificar exactamente qué se interpretó. Si es una conversación o entrevista con varios participantes, separa las intervenciones por hablante y resume quién dijo qué.

Flujo tres: correspondencia. Toma una exportación completa de un canal o chat, recopila todo el texto, descarga mensajes de voz y vídeos, los transcribe, lo compila en un documento largo y lo resume. El resultado: quiénes son estas personas, qué les preocupa, si hay clientes potenciales entre ellas — más una tarea lista para cualquier red neuronal: aquí está la audiencia, aquí su idioma, aquí qué ofrecerle.

Flujo cuatro: fotografías. Toma grupos de fotos similares — por ejemplo, todas las fotos de un evento o periodo — y le pide a una red neuronal local con visión que describa qué hay en ellas: quién aparece y cuántas personas hay en la toma, el lugar, la escena. No foto por foto entre miles, sino sobre una muestra representativa dentro de cada grupo — para que la descripción del archivo esté lista en un tiempo razonable, no en semanas de GPU.

Todo funciona de forma local. Los ficheros no salen de ahí.

3. A qué categoría pertenece

Un explorador local de IA para colecciones personales — una categoría nueva sin nombre asentado todavía: no es un transcriptor en la nube, ni gestión documental corporativa, ni un buscador de archivos, ni un servidor multimedia, sino algo intermedio — con una diferencia clave: funciona en tu propio hardware, con tus propios datos, y el resultado no es una lista de ficheros — es una biblioteca estructurada. Por cada archivo — un tema, un idioma, un tipo de documento, entidades clave, un resumen breve. Esto se hace de antemano, sin prisas ni plazos, antes de que a nadie le urja — no en el último momento bajo presión por una tarea concreta. La biblioteca terminada puede alimentar a cualquier red neuronal, base de datos o sistema de búsqueda — a partir de ahí ellos mismos encuentran lo necesario y construyen la interfaz; Digercules no reemplaza ese siguiente paso, lo hace posible desde el principio, asumiendo esa preparación laboriosa para la que nunca hay recursos suficientes.

4. Por qué supera a las alternativas más cercanas

Todas estas herramientas — organizadores de ficheros con IA, búsqueda de escritorio, sistemas de gestión documental con OCR, transcripción convencional — solo funcionan cuando el archivo ya está en forma legible por máquina: el texto reconocido, los ficheros descritos, todo ordenado. Esa preparación es justamente lo que no hacen ni pueden hacer — la dan por sentada.

Digercules hace exactamente esa parte que falta: un archivo mixto (texto + audio + vídeo + fotos + escaneos) se convierte en una sola biblioteca estructurada, entrenada según las particularidades de la colección concreta — completamente en local. A partir de ahí, cualquiera de las herramientas anteriores, cualquier red neuronal o cualquier sistema de búsqueda puede trabajar con esa biblioteca — Digercules no compite con ellos, les da lo único sin lo cual son inútiles.

5. Qué tareas puede resolver

Tarea Resultado
Entender qué hay en el disco Un mapa del archivo con anotaciones para cada grupo de ficheros
Eliminar duplicados y basura evidente Deduplicación sin perder nada importante
Hacer la biblioteca buscable Anotaciones + OCR → búsqueda por significado
Transcribir horas de grabaciones Texto con marcas de tiempo, resumen, identificación
Entender quién está en un chat Retrato de la audiencia + guion para el siguiente paso
Evaluar qué es único frente a lo prescindible Raro / típico / obsoleto / requiere atención
Dar sentido a un archivo de fotos Descripciones sobre una muestra representativa dentro de cada grupo de fotos

6. Cómo ayuda

La persona con discos en el armario ejecuta la herramienta, la apunta a una carpeta, se va a tomar un café. Unas horas después: aquí está el desecho — ¿lo borramos? Aquí las fotos familiares. Aquí documentos de trabajo — cuidado, puede ser confidencial.

El especialista de marketing carga las exportaciones de los canales. Recibe: estos son ruido, no pierdas tiempo. Este otro — aquí hay clientes potenciales, aquí sus puntos de dolor, aquí un guion listo para la próxima conversación.

El ingeniero ve por primera vez toda su biblioteca de una vez: qué existe, qué está desactualizado, qué no se encuentra en ningún otro sitio. Las anotaciones están escritas en su propio idioma — porque la herramienta se entrenó con su propia colección.

Estudiantes y profesores obtienen un archivo buscable de apuntes, escaneos y grabaciones de clases incluso en varios idiomas a la vez — lo que antes requería hojear ficheros a mano ahora se busca por significado.

Músicos y compositores obtienen una transcripción y un catálogo de grabaciones de conciertos con la identificación exacta de lo que se interpretó en cada una — incluidas tomas y borradores que nadie más habría vuelto a escuchar jamás.

Un club obtiene un catálogo de sus propias veladas: quién actuó, qué leyó o interpretó, en qué grabación buscar qué — en lugar de un archivo que se sostiene solo en la memoria de un par de socios veteranos.

Los archivistas obtienen, en lugar de una lista de ficheros, una valoración estructurada de todo el fondo: qué es valioso, qué duplica algo ya conocido, qué requiere atención inmediata.

7. Cuánto cuesta y qué hace falta

Gratis — solo la valoración preliminar. A partir de una descripción de su archivo o una captura de la carpeta, le decimos si es viable ordenarlo y cuánto tiempo llevaría aproximadamente. La herramienta en sí es de pago — una compra única sin límite de volumen ni de tiempo: la instala en su propio equipo y ordena el archivo entero en local, sea cual sea su tamaño. Si su hardware también aguanta el procesamiento pesado (transcripción, identificación), la licencia no le impide ejecutarlo usted mismo.

Cuando su propia capacidad no basta. El procesamiento adicional se alquila en una máquina GPU externa a su elección y a su cargo (como referencia de mercado, vea las cifras más arriba en esta página), o bien asumimos nosotros esa coordinación de varios días. En ese caso el precio se fija según el volumen realmente encontrado — hoy no hay una cifra fija ni un techo; es un acuerdo aparte para su archivo.

Lo que necesitamos de usted. El archivo en sí (disco, carpeta, exportación de un chat) y una respuesta a qué quiere averiguar u obtener de él.

Si coordinamos nosotros. Lo que sale no es el archivo, sino su exportación de trabajo compacta (ejemplo: 2 TB de grabaciones de vídeo → unos 2,7 GB), directamente a una máquina acordada — nunca a una nube pública.

Si algo sale mal. La ventana de soporte para reintentar tras un fallo es de 48–72 horas desde el aviso; una nueva ejecución es un acuerdo aparte.

Aún no descrito en esta web: el formulario de encargo, un modelo de contrato, dónde exactamente se sube la información, el calendario de procesamiento y de pago, y los criterios de aceptación del resultado.


Hay una situación aparte, emocionalmente distinta — cuando el archivo no es propio, sino que llegó de otra persona. Se trata por separado: Archivo heredado.


La misma tecnología no solo funciona para archivos personales — si representas a una organización (una empresa, un estudio, un despacho, una clínica, una biblioteca), consulta Digercules para organizaciones.