Saltar a contenido

Recuperar el contenido del documento

GET /documents/{document_id}/contents/

Retrieve contents of a document by its ID.

Returns the content of the document with the specified ID, along with the index of the latest retrieved chunk. Each call fetches up to 20 chunks. To get more, use the end_chunk value from the response as the start_chunk for the next call.

Parameter In Type Required Description
document_id path integer yes The ID of the document to retrieve contents for.
start_chunk query integer Indicate the starting chunk that you want to retrieve. If not specified, the default value is 0.
end_chunk query integer Indicate the ending chunk that you want to retrieve. If not specified, the default value is start_chunk + 20.

Responses

  • 200 — Content of the document and index of the latest retrieved chunk.
  • 404 — Document not found.
  • 500 — Internal server error.

Ejemplos de Solicitudes

curl -X GET   
  "https://api.rememberizer.ai/api/v1/documents/12345/contents/?start_chunk=0&end_chunk=20"   
  -H "Authorization: Bearer YOUR_JWT_TOKEN"

Info

Reemplace YOUR_JWT_TOKEN con su token JWT real y 12345 con un ID de documento real.

const getDocumentContents = async (documentId, startChunk = 0, endChunk = 20) => {
  const url = new URL(`https://api.rememberizer.ai/api/v1/documents/${documentId}/contents/`);
  url.searchParams.append('start_chunk', startChunk);
  url.searchParams.append('end_chunk', endChunk);

  const response = await fetch(url.toString(), {
    method: 'GET',
    headers: {
      'Authorization': 'Bearer YOUR_JWT_TOKEN'
    }
  });

  const data = await response.json();
  console.log(data);

  // Si hay más fragmentos, puede obtenerlos
  if (data.end_chunk < totalChunks) {
    // Obtener el siguiente conjunto de fragmentos
    await getDocumentContents(documentId, data.end_chunk, data.end_chunk + 20);
  }
};

getDocumentContents(12345);

Info

Reemplace YOUR_JWT_TOKEN con su token JWT real y 12345 con un ID de documento real.

import requests

def get_document_contents(document_id, start_chunk=0, end_chunk=20):
    headers = {
        "Authorization": "Bearer YOUR_JWT_TOKEN"
    }

    params = {
        "start_chunk": start_chunk,
        "end_chunk": end_chunk
    }

    response = requests.get(
        f"https://api.rememberizer.ai/api/v1/documents/{document_id}/contents/",
        headers=headers,
        params=params
    )

    data = response.json()
    print(data)

    # Si hay más fragmentos, puede obtenerlos
    # Este es un ejemplo simplista - puede que desee implementar una verificación de recursión adecuada
    if 'end_chunk' in data and data['end_chunk'] < total_chunks:
        get_document_contents(document_id, data['end_chunk'], data['end_chunk'] + 20)

get_document_contents(12345)

Info

Reemplace YOUR_JWT_TOKEN con su token JWT real y 12345 con un ID de documento real.

Parámetros de Ruta

Parámetro Tipo Descripción
document_id entero Requerido. El ID del documento para el cual recuperar contenidos.

Parámetros de Consulta

Parámetro Tipo Descripción
start_chunk entero El índice del fragmento inicial. El valor predeterminado es 0.
end_chunk entero El índice del fragmento final. El valor predeterminado es start_chunk + 20.

Formato de Respuesta

{
  "content": "El texto completo del contenido de los fragmentos del documento...",
  "end_chunk": 20
}

Respuestas de Error

Código de Estado Descripción
404 Documento no encontrado
500 Error interno del servidor

Paginación para Documentos Grandes

Para documentos grandes, el contenido se divide en fragmentos. Puedes recuperar el documento completo haciendo múltiples solicitudes:

  1. Haz una solicitud inicial con start_chunk=0
  2. Usa el valor end_chunk devuelto como start_chunk para la siguiente solicitud
  3. Continúa hasta que hayas recuperado todos los fragmentos

Este endpoint devuelve el contenido de texto sin procesar de un documento, lo que te permite acceder a toda la información para un procesamiento o análisis detallado.