Carga un archivo PDF en una biblioteca de documentos de SharePoint, pero los resultados de búsqueda no lo muestran durante horas o incluso días. Esta demora ocurre porque la búsqueda de SharePoint se basa en un proceso de rastreo programado, no en la indexación en tiempo real de archivos nuevos. En este artículo, aprenderá por qué los archivos PDF no son buscables de inmediato y cómo forzar la indexación o ajustar las programaciones de rastreo para solucionar el problema.
Puntos clave: Solución de la búsqueda retrasada de PDF en SharePoint
- Centro de administración de SharePoint > Búsqueda > Programaciones de rastreo: Configure los tiempos de rastreo incremental y completo para los orígenes de contenido a fin de reducir el retraso de la búsqueda.
- Configuración del sitio > Búsqueda y disponibilidad sin conexión > Reindexar biblioteca: Fuerce una reindexación inmediata de una biblioteca de documentos para los archivos PDF nuevos.
- Configuración del IFilter de PDF: Asegúrese de que el IFilter de PDF esté instalado y habilitado en el servidor de SharePoint para una extracción de texto adecuada.
Por qué la búsqueda de SharePoint no encuentra los archivos PDF nuevos de inmediato
La búsqueda de SharePoint no indexa los archivos en el momento en que se cargan. En su lugar, el servicio de búsqueda se ejecuta según una programación. Rastrea los orígenes de contenido a intervalos establecidos, procesa el contenido y actualiza el índice de búsqueda. Este proceso se denomina rastreo.
De forma predeterminada, SharePoint Server realiza un rastreo incremental cada 15 minutos y un rastreo completo diario. SharePoint Online en Microsoft 365 usa una programación similar pero menos transparente. Los archivos PDF nuevos cargados entre rastreos no aparecerán en los resultados de búsqueda hasta que finalice el siguiente rastreo incremental.
Los archivos PDF también requieren un filtro especial llamado IFilter para extraer el texto del formato binario. Si el IFilter de PDF falta, está desactualizado o no está configurado correctamente, el rastreador de búsqueda no puede leer el contenido del PDF. Es posible que el archivo se indexe pero no devuelva texto que se pueda buscar.
Una tercera causa es el esquema de búsqueda. Si los metadatos del archivo PDF no coinciden con las propiedades administradas que se usan para la búsqueda, es posible que el archivo se omita o no se devuelva en los resultados. Este problema es menos común, pero puede afectar a bibliotecas personalizadas con columnas únicas.
Pasos para solucionar que la búsqueda no encuentre archivos PDF nuevos
- Forzar una reindexación de la biblioteca de documentos
Vaya a la biblioteca de documentos donde se almacenan los archivos PDF. Haga clic en el icono de engranaje de Configuración y seleccione Configuración de la biblioteca. En Permisos y administración, haga clic en el vínculo etiquetado como Configuración avanzada. Desplácese hacia abajo hasta la sección Reindexar biblioteca de documentos y haga clic en el botón Reindexar biblioteca de documentos. Esto desencadena una reindexación completa de todos los archivos de esa biblioteca en el siguiente rastreo. - Solicitar un rastreo inmediato en SharePoint Server
Si usa SharePoint Server local, abra Administración central. Vaya a Administración de aplicaciones > Administrar aplicaciones de servicio y haga clic en la aplicación de servicio de búsqueda. En la navegación izquierda, haga clic en Orígenes de contenido. Seleccione el origen de contenido que incluye su colección de sitios y haga clic en Iniciar rastreo completo o Iniciar rastreo incremental. El rastreo comienza de inmediato y actualizará el índice. - Comprobar que el IFilter de PDF esté instalado y habilitado
En el servidor de SharePoint, abra el Editor del Registro. Navegue a HKEY_LOCAL_MACHINE\SOFTWARE\Microsoft\Office Server\16.0\Search\Setup\ContentIndexCommon\Filters\Extension\.pdf. Verifique que el valor predeterminado apunte a un CLSID de IFilter válido. Para el IFilter de Adobe PDF, el CLSID suele ser {E8978DA6-047F-4E3D-9C78-CDBE46041603}. Si falta la clave, descargue e instale el IFilter de Adobe PDF desde el sitio web de Adobe y, a continuación, reinicie el servicio de búsqueda de SharePoint. - Verificar el esquema de búsqueda para los metadatos de PDF
En el centro de administración de SharePoint, vaya a Búsqueda > Esquema de búsqueda. Busque las propiedades administradas que se asignan a los campos de metadatos de PDF como Título, Autor o Palabras clave. Si la asignación es incorrecta, edite la propiedad administrada o cree una nueva. Asegúrese de que la propiedad esté configurada como Searchable y Queryable. - Probar con un archivo de texto simple
Cargue un archivo de texto sin formato (.txt) en la misma biblioteca. Espere al siguiente rastreo y busque una palabra de ese archivo de texto. Si el archivo de texto aparece en los resultados de búsqueda pero el PDF no, el problema es específico del manejo de PDF. Si no aparece ninguno de los dos archivos, la programación de rastreo o la configuración del origen de contenido es la causa raíz.
Si la búsqueda sigue sin encontrar archivos PDF nuevos
Los archivos PDF aparecen en la búsqueda pero no muestran vista previa del contenido
Esto indica que el IFilter de PDF no está extrayendo texto. Reinstale el IFilter de PDF y verifique que esté registrado en la canalización de filtros. En SharePoint Server, puede ejecutar el comando regsvr32 pdfilter.dll desde un símbolo del sistema con privilegios elevados para forzar el registro.
La búsqueda devuelve archivos PDF antiguos pero no los nuevos
Es posible que el rastreo incremental esté omitiendo la biblioteca debido a un problema con el registro de cambios. En SharePoint Server, ejecute un rastreo completo en el origen de contenido. Esto restablece el registro de cambios y fuerza al rastreador a reprocesar todos los archivos.
Los resultados de búsqueda no muestran ningún archivo PDF
Es posible que el tipo de archivo esté excluido del índice de búsqueda. En SharePoint Server, vaya a Administración central > Aplicación de servicio de búsqueda > Tipos de archivo. Asegúrese de que pdf esté en la lista y configurado como Indexar. Si no es así, agréguelo y ejecute un rastreo completo.
La búsqueda funciona en una colección de sitios pero no en otra
Es posible que la colección de sitios no esté incluida en el origen de contenido. En SharePoint Server, compruebe las direcciones de inicio del origen de contenido en la aplicación de servicio de búsqueda. Agregue la URL de la colección de sitios que falta y ejecute un rastreo completo.
Reindexación manual vs. programación de rastreo: comparación
| Elemento | Reindexación manual | Programación de rastreo |
|---|---|---|
| Método de activación | Configuración de la biblioteca > botón Reindexar | Administración central > Orígenes de contenido > Iniciar rastreo completo |
| Ámbito | Una sola biblioteca de documentos | Todo el origen de contenido (una o más colecciones de sitios) |
| Efecto en otros archivos | Reindexa todos los archivos de esa biblioteca | Reindexa todos los archivos del origen de contenido |
| Velocidad | Rápida para bibliotecas pequeñas | Lenta para orígenes de contenido grandes |
| Caso de uso recomendado | Archivos PDF nuevos que no aparecen después de la carga | Problemas de búsqueda en todo el sistema o cambios de esquema |
Después de seguir los pasos anteriores, puede confirmar que la búsqueda de SharePoint ahora encuentra los archivos PDF recién cargados. Para una confiabilidad continua, programe un rastreo completo nocturno en SharePoint Server o supervise el panel de estado de búsqueda en SharePoint Online. Si administra una granja grande, considere ajustar el intervalo de rastreo incremental a 5 minutos para los orígenes de contenido que requieren indexación casi en tiempo real.