Formateo, resumen e indexación de texto con IA en C#

2026-09-02 08:55:39 jie zou
AI Summarize:
ChatGPT
ChatGPT
Claude
Grok
Perplexity
Quick
Quick
Concise overview
Highlights
Key takeaways
Detailed
Structured explanation
Brief
One sentence summary
Summarize |

Formato, resumen e indexación de documentos de Word con IA

Las organizaciones a menudo acumulan cientos o incluso miles de documentos de Word con el paso del tiempo. Estos archivos pueden provenir de diferentes departamentos, empleados, proveedores o sistemas heredados, lo que resulta en fuentes, estructuras de títulos, numeración, espaciado, encabezados y otros formatos inconsistentes.

Preparar dichos documentos para su publicación, migración o archivo es más que una simple tarea de formato. En muchos casos, las organizaciones también necesitan identificar de qué trata cada documento, extraer metadatos clave, crear resúmenes concisos y organizar los resultados en un índice de documentos que se pueda buscar.

La automatización tradicional de Word puede manejar bien las reglas de formato fijas, pero se vuelve difícil cuando las estructuras de los documentos varían. Un enfoque basado en IA puede primero comprender el papel lógico del contenido (como títulos, encabezados, cuerpo del texto, fechas y tipos de documentos) y luego aplicar las operaciones de documento adecuadas.

En este artículo, utilizaremos Spire.Agent.Office para .NET para construir un flujo de trabajo de procesamiento de Word en tres etapas en C#:

Documentos de Word → Estandarización de formato → Extracción de metadatos y resúmenes → Índice de documentos

Por qué es importante la estandarización de documentos de Word con IA

Estandarizar una colección de documentos de Word no siempre es tan simple como configurar cada párrafo con la misma fuente.

Una organización típica puede tener documentos como:

Input/
├── Employee_Travel_Policy.docx
├── Vendor_Onboarding_Guide.docx
├── Security_Incident_Report.docx
└── Remote_Work_Policy.docx

Incluso cuando estos documentos cubren procesos de negocio similares, su estructura interna puede diferir considerablemente.

Por ejemplo, un documento puede usar un estilo real de Título 1 de Word para los títulos de sección, mientras que otro simplemente usa texto en negrita de 16 puntos. Algunos documentos pueden usar secciones numeradas como:

1. Propósito
2. Alcance
3. Responsabilidades

mientras que otros pueden usar una numeración inconsistente como:

I. Propósito
Sección 2 - Alcance
3) Responsabilidades

La automatización de documentos tradicional generalmente requiere que los desarrolladores inspeccionen las posiciones de los párrafos, los estilos o los patrones de texto y escriban reglas para cada variación.

El procesamiento de documentos asistido por IA cambia el enfoque. En lugar de especificar que "el párrafo 3 debe ser un título", los desarrolladores pueden describir el resultado deseado:

Identificar el título del documento y la jerarquía de encabezados, normalizar los estilos y la numeración de los encabezados, y preservar el contenido original.

La capa de IA interpreta la estructura del documento, mientras que el motor de documentos de Word subyacente realiza el procesamiento real del documento.

Esto hace que el enfoque sea particularmente útil para colecciones de documentos empresariales semiestructurados donde el contenido es diferente pero el estándar de salida deseado es consistente.

Qué automatizará este ejemplo

Nuestro flujo de trabajo de muestra contiene tres etapas de procesamiento.

Etapa 1: Estandarizar el formato de Word

Cada documento de origen se analiza y se vuelve a formatear de acuerdo con un estilo corporativo compartido. El procesamiento incluye:

  • Normalización de fuentes y tamaños de fuente
  • Identificación de títulos de documentos
  • Aplicación de niveles de encabezado consistentes
  • Normalización de la numeración de encabezados
  • Estandarización del espaciado entre párrafos
  • Adición de un encabezado común
  • Adición de números de página al pie de página
  • Preservación del texto original, tablas, imágenes e hipervínculos

El resultado es una versión estandarizada de cada documento de entrada.

Etapa 2: Extraer metadatos y resúmenes

Los documentos estandarizados se analizan individualmente para extraer información como:

  • Título del documento
  • Departamento
  • Tipo de documento
  • Fecha de vigencia o emisión
  • Palabras clave
  • Resumen

Cada resultado se guarda como un pequeño documento de metadatos de Word estructurado.

Etapa 3: Crear un índice de documentos

Finalmente, los archivos de metadatos se combinan y se convierten en un único índice de documentos de Word.

El índice final puede contener información similar a:

N.º Título Departamento Tipo Fecha Resumen
1 Política de viajes de empleados Recursos Humanos Política 15 de julio de 2026 Define los requisitos de aprobación y reembolso de viajes.
2 Guía de incorporación de proveedores Adquisiciones Procedimiento 3 de junio de 2026 Describe el proceso para registrar y aprobar nuevos proveedores.
3 Informe de incidentes de seguridad TI Informe 8 de agosto de 2026 Resume un incidente de seguridad y las acciones tomadas en respuesta.

Esto produce no solo archivos de Word más limpios, sino también una descripción general útil de toda la colección de documentos.

Configurar Spire.Agent.Office para C#

Primero, cree un proyecto .NET e instale Spire.Agent.Office a través de NuGet.

Puede instalar el paquete desde el Administrador de paquetes NuGet de Visual Studio o usar la CLI de .NET:

dotnet add package Spire.Agent.Office

Luego, importe los espacios de nombres necesarios:

using System;
using System.IO;
using Spire.Agent.Office.AI;
using Spire.Agent.Office.Extensions;
using Spire.Doc;

El procesamiento de documentos con IA sigue un patrón simple.

Primero, configure una instancia de AIOptions con un SpireToken:

AIOptions options = new AIOptions();
options.SpireToken = "su SpireToken";

Puede solicitar un SpireToken temporal para pruebas desde la página de licencias temporales de Spire. Después de obtener el token, asígnelo a la propiedad SpireToken antes de llamar a las API de procesamiento de IA.

A continuación, cargue un documento de Word y cree un AIDocumentProcessor:

using (Document doc = new Document())
{
    doc.LoadFromFile("input.docx");

    AIDocumentProcessor processor = doc.AI(options);

    processor.ExecuteInstruction(
        doc,
        "Su instrucción en lenguaje natural",
        "output.docx"
    );
}

La parte importante es la instrucción. En lugar de escribir manualmente una larga secuencia de llamadas a la API de Word, describimos cómo debería verse el documento y dejamos que el agente realice las operaciones correspondientes.

En las siguientes secciones, aplicaremos este enfoque a un directorio completo de archivos de Word.

Estandarizar el formato de Word con IA

Supongamos que los documentos recopilados de diferentes departamentos utilizan fuentes, encabezados, numeración y diseños de página inconsistentes.

Queremos que todos sigan el mismo estilo de documento corporativo:

  • Arial para todo el texto
  • Texto del cuerpo de 11 pt
  • Título del documento en negrita de 20 pt
  • Título 1 en negrita de 16 pt
  • Título 2 en negrita de 13 pt
  • Numeración multinivel consistente
  • Interlineado de 1.15
  • Un encabezado corporativo
  • Números de página centrados
  • Sin cambios en la redacción original

El siguiente código procesa cada archivo .docx en un directorio de entrada y guarda versiones estandarizadas en un nuevo directorio.

using System;
using System.IO;
using Spire.Agent.Office.AI;
using Spire.Agent.Office.Extensions;
using Spire.Doc;

string inputFolder = @"E:\Documents\Input";
string outputFolder = @"E:\Documents\Standardized";
string spireToken = "su SpireToken";
Directory.CreateDirectory(outputFolder);

string aiRule = """
Analice la estructura de este documento de Word y estandarice su formato de acuerdo con las siguientes reglas corporativas:

1. Preserve toda la redacción original. No reescriba, resuma, acorte ni elimine ningún contenido del documento.
2. Utilice Arial como fuente predeterminada y 11 pt para el cuerpo del texto normal.
3. Identifique el título principal del documento y formatéelo como negrita de 20 pt.
4. Identifique la jerarquía lógica de encabezados y aplique los estilos de encabezado de Word adecuados. Utilice negrita de 16 pt para el Título 1 y negrita de 13 pt para el Título 2.
5. Normalice la numeración de secciones en una jerarquía consistente como 1, 1.1 y 1.1.1 cuando corresponda.
6. Utilice un interlineado de 1.15 para los párrafos del cuerpo normal y mantenga el espaciado entre párrafos visualmente consistente.
7. Agregue 'Biblioteca de documentos corporativos' al encabezado del documento.
8. Agregue números de página centrados al pie de página.
9. Preserve todas las tablas, imágenes, hipervínculos y otros objetos del documento existentes.
10. Mantenga la estructura general del documento y el significado original sin cambios.
""";

var aiOpts = new AIOptions { SpireToken = spireToken };

foreach (var file in Directory.GetFiles(inputFolder, "*.docx"))
{
    var fileName = Path.GetFileName(file);
    var savePath = Path.Combine(outputFolder, fileName);

    using var doc = new Document();
    doc.LoadFromFile(file);

    var res = doc.AI(aiOpts).ExecuteInstruction(doc, aiRule, savePath);
    Console.WriteLine(res.Success ? $"Procesado: {fileName}" : $"Fallido: {fileName} - {res.ErrorMessage}");
}

Un detalle importante en la instrucción es el requisito de identificar la jerarquía lógica de encabezados.

Esto es diferente de simplemente cambiar la fuente de cada párrafo en negrita. El agente puede analizar qué representa un párrafo y determinar si funciona como un título de documento, un encabezado de sección principal, una subsección o un cuerpo de texto normal.

Para los flujos de trabajo de gestión de documentos, los estilos de encabezado adecuados son especialmente útiles porque pueden mejorar la navegación, la generación automática de tablas de contenido, los marcadores PDF, la accesibilidad y el análisis posterior de documentos.

Otra regla importante es:

Preserve toda la redacción original.

El formato y la reescritura de contenido normalmente deben tratarse como tareas separadas. Cuando el propósito de esta etapa es la estandarización de documentos, la IA no debe reescribir ni resumir simultáneamente el texto de origen.

Después de la ejecución, el directorio de salida contiene copias estandarizadas:

Standardized/
├── Employee_Travel_Policy.docx
├── Vendor_Onboarding_Guide.docx
├── Security_Incident_Report.docx
└── Remote_Work_Policy.docx

El siguiente ejemplo muestra cómo se ve un documento de Word con formato inconsistente antes y después de la estandarización con IA.

Antes y después de la estandarización del formato del documento

Extraer metadatos y generar resúmenes de documentos

Una vez que se ha estandarizado el formato, el siguiente paso es comprender qué contiene cada documento.

Abrir manualmente cientos de archivos y registrar sus títulos, departamentos, fechas, categorías y resúmenes requiere mucho tiempo. Esta es una tarea en la que la comprensión de documentos por IA es particularmente útil.

Para este ejemplo, extraeremos seis campos de cada documento:

  • Título
  • Departamento
  • Tipo de documento
  • Fecha
  • Palabras clave
  • Resumen

En lugar de devolver prosa de forma libre, la instrucción requiere una estructura predecible. Esto hace que los resultados sean más fáciles de procesar más adelante.

using System;
using System.IO;
using Spire.Agent.Office.AI;
using Spire.Agent.Office.Extensions;
using Spire.Doc;

string inputFolder = @"E:\Documents\Standardized";
string outputFolder = @"E:\Documents\Metadata";
string spireToken = "su SpireToken";

Directory.CreateDirectory(outputFolder);

string aiRule = """
Analice este documento de Word y cree un informe de metadatos conciso.

Extraiga la siguiente información del contenido real del documento:
- Título
- Departamento o función comercial responsable
- Tipo de documento, como Política, Procedimiento, Informe, Guía o Memorando
- Fecha de vigencia o fecha de emisión
- 3 a 5 palabras clave
- Resumen de aproximadamente 80 a 120 palabras

Cree un nuevo documento conciso que contenga solo estos campos.
Utilice exactamente las siguientes etiquetas:

Título:
Departamento:
Tipo de documento:
Fecha:
Palabras clave:
Resumen:

No invente información que no pueda determinarse razonablemente a partir de la fuente. Si no hay una fecha o departamento específico, utilice 'No especificado'. Mantenga el resumen basado únicamente en hechos y en el documento de origen.
""";

var aiOpts = new AIOptions { SpireToken = spireToken };

foreach (var file in Directory.GetFiles(inputFolder, "*.docx"))
{
    var fileName = Path.GetFileNameWithoutExtension(file);
    var savePath = Path.Combine(outputFolder, $"{fileName}_Metadata.docx");

    using var doc = new Document();
    doc.LoadFromFile(file);

    var res = doc.AI(aiOpts).ExecuteInstruction(doc, aiRule, savePath);
    Console.WriteLine(res.Success ? $"Metadatos extraídos: {fileName}" : $"Fallido: {fileName} - {res.ErrorMessage}");
}

Un documento de metadatos generado se ve así:

Metadatos extraídos y resumen generado por IA

El requisito de utilizar etiquetas fijas es importante.

Si el aviso simplemente dice "resuma el documento", diferentes documentos pueden producir estructuras de salida sustancialmente diferentes. Requerir campos consistentes hace que los archivos intermedios sean mucho más fáciles de combinar en un índice final.

La instrucción también le dice explícitamente al agente que no invente metadatos faltantes. Para los registros comerciales, "No especificado" es generalmente más útil que adivinar un departamento o una fecha que el documento nunca menciona.

Crear un índice de documentos a partir de múltiples archivos de Word

En este punto, tenemos un archivo de metadatos para cada documento procesado:

Metadata/
├── Employee_Travel_Policy_Metadata.docx
├── Vendor_Onboarding_Guide_Metadata.docx
├── Security_Incident_Report_Metadata.docx
└── Remote_Work_Policy_Metadata.docx

El paso final es consolidar estos archivos de metadatos individuales en un único índice de documentos basado en Word.

En lugar de abrir manualmente cada documento de metadatos, extraer su texto y fusionar los resultados en C#, podemos pasar todos los archivos de metadatos directamente a Spire.Agent.Office a través del parámetro attachments. El agente de IA lee los documentos adjuntos, extrae los campos etiquetados de cada uno y crea un nuevo documento de Word que contiene un índice consolidado.

El parámetro attachments es útil cuando la tarea de IA depende de múltiples archivos de soporte en lugar de un único documento de entrada principal. En este ejemplo, no existe un documento de Word que deba modificarse. Por lo tanto, creamos un objeto Document vacío y utilizamos los archivos de metadatos como fuentes de información para generar el índice final.

using System;
using System.IO;
using Spire.Agent.Office.AI;
using Spire.Agent.Office.Extensions;
using Spire.Doc;

string metadataFolder = @"E:\Documents\Metadata";
string outputPath = @"E:\Documents\Document_Index.docx";
string spireToken = "su SpireToken";
var attachments = Directory.GetFiles(metadataFolder, "*_Metadata.docx");

string aiRule = """
Lea todos los documentos de metadatos proporcionados en los archivos adjuntos y cree un índice de documentos de Word consolidado.

Cree el título 'Índice de documentos' en la parte superior del documento.

Cree una tabla con las siguientes columnas:
N.º | Título | Departamento | Tipo de documento | Fecha | Palabras clave | Resumen

Requisitos:
1. Cree una fila para cada documento de metadatos.
2. Numere los registros secuencialmente comenzando desde 1.
3. Extraiga los valores de los campos etiquetados en cada archivo adjunto.
4. Preserve la información extraída y no invente datos faltantes.
5. Utilice 'No especificado' cuando un campo no esté disponible.
6. Haga que el encabezado de la tabla esté en negrita.
7. Dé a la columna Resumen más ancho que a las otras columnas.
8. Utilice un estilo profesional limpio adecuado para un registro de documentos interno.
9. Produzca un documento de Word independiente que contenga solo el índice de documentos final.
""";

var aiOpts = new AIOptions { SpireToken = spireToken };

using var doc = new Document();
var res = doc.AI(aiOpts).ExecuteInstruction(doc, aiRule, outputPath, attachments);

Console.WriteLine(res.Success
    ? $"Índice de documentos creado: {outputPath}"
    : $"Error al crear el índice de documentos: {res.ErrorMessage}");

La salida final se guarda como:

Document_Index.docx

En lugar de abrir cada documento original individualmente, los empleados ahora pueden usar un índice consolidado para comprender rápidamente qué documentos están disponibles y qué contiene cada archivo.

Índice de documentos consolidado generado a partir de múltiples archivos de Word

Este tipo de índice puede ser particularmente útil antes de migrar archivos a un sistema de gestión de documentos, preparar una base de conocimientos interna, revisar colecciones de documentos heredados u organizar registros para su retención a largo plazo.

Mejores prácticas para el procesamiento confiable de documentos con IA

La IA hace que el procesamiento de documentos semiestructurados sea más flexible, pero los resultados confiables aún dependen en gran medida de cómo se diseñe la tarea.

Separar el formato del análisis de contenido

Evite pedirle al agente que estandarice el formato, reescriba el texto, resuma el documento y extraiga metadatos en una sola instrucción grande.

Estas son operaciones diferentes con objetivos diferentes.

Un flujo de trabajo más seguro es:

Documento original
        ↓
Estandarización de formato
        ↓
Documento estandarizado
        ↓
Extracción de metadatos
        ↓
Metadatos estructurados
        ↓
Índice de documentos

Esto también hace que los problemas sean más fáciles de identificar y depurar.

Definir las reglas de formato explícitamente

Instrucciones como:

Haga que el documento se vea profesional.

dejan demasiado margen para la interpretación.

Siempre que la consistencia sea importante, especifique las reglas corporativas reales:

Arial, cuerpo de texto de 11 pt
Título de documento de 20 pt
Título 1 de 16 pt
Título 2 de 13 pt
Interlineado de 1.15
Numeración 1 / 1.1 / 1.1.1

El mismo principio se aplica a los encabezados, pies de página, formato de tablas y diseño de página.

Proteger el contenido original

Para las tareas de formato, incluya explícitamente requisitos como:

Preserve toda la redacción original.

y:

No reescriba, resuma, acorte ni elimine el contenido del documento.

Los archivos de origen también deben conservarse en lugar de sobrescribirse durante el procesamiento por lotes automatizado.

Una estructura de carpetas práctica es:

Documents/
├── Input/
├── Standardized/
├── Metadata/
└── Document_Index.docx

Solicitar metadatos estructurados

Cuando la información extraída se reutilizará mediante programación, la salida predecible es más valiosa que la salida creativa.

En lugar de:

Dígame de qué trata este documento.

utilice un esquema fijo:

Título:
Departamento:
Tipo de documento:
Fecha:
Palabras clave:
Resumen:

Esto hace que el procesamiento posterior sea considerablemente más fácil.

Manejar la información faltante explícitamente

No todos los documentos contienen un nombre de departamento, fecha de vigencia, número de documento o propietario.

Dígale a la IA qué hacer cuando falta información:

Utilice "No especificado" en lugar de adivinar.

Esto es especialmente importante para la gestión de documentos, legal, financiera, cumplimiento y otros flujos de trabajo sensibles a los registros.

Revisar resultados de alta importancia

Los metadatos y resúmenes generados por IA no deben tratarse automáticamente como registros autorizados en flujos de trabajo de alto riesgo.

Para la organización interna ordinaria de documentos, los resultados automatizados pueden ser suficientes. Para archivos regulados, registros legales, documentos de cumplimiento o sistemas de retención oficiales, los campos extraídos y las clasificaciones aún deben validarse de acuerdo con los requisitos de revisión de la organización.

Conclusión

El procesamiento de Word por lotes a menudo implica dos problemas diferentes.

El primero es la automatización de documentos: cambiar fuentes, aplicar estilos, crear encabezados y pies de página, gestionar la numeración y generar archivos de Word.

El segundo es la comprensión de documentos: determinar qué representa el contenido, identificar tipos de documentos, encontrar fechas y departamentos, extraer palabras clave y producir resúmenes.

Las API tradicionales de Word son altamente efectivas cuando los desarrolladores ya saben exactamente qué contenido modificar. El procesamiento asistido por IA se vuelve particularmente útil cuando los documentos son inconsistentes y el software primero debe comprender su estructura antes de decidir cómo procesarlos.

Usando Spire.Agent.Office en C#, estas dos capacidades se pueden combinar en un solo flujo de trabajo:

Analizar → Estandarizar → Extraer → Organizar

En el ejemplo anterior, una carpeta que contiene documentos de Word inconsistentes se transforma en una colección de documentos estandarizada, un conjunto de registros de metadatos estructurados y, finalmente, un índice de documentos de Word centralizado.

La misma arquitectura se puede extender a otros flujos de trabajo empresariales, como bibliotecas de políticas, manuales de procedimientos, documentación de cumplimiento, archivos de proyectos, registros de RR. HH., documentación de proveedores y migración de documentos heredados.

En lugar de revisar y organizar archivos manualmente uno por uno, los desarrolladores pueden definir las reglas de documento y la estructura de información requeridas en lenguaje natural y automatizar las partes repetitivas del flujo de trabajo, mientras siguen produciendo documentos de Word reales y editables.

Ver también