---
title: "Packaging & Context Handling (PT)"
source: "https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)"
wiki: "systems-analysis.info/int"
article: "Packaging_&_Context_Handling_(PT)"
language: "pt"
categories:
  - "Category:Large language models"
  - "Category:Portuguese"
  - "Category:Prompt engineering"
revision_id: 5392
wiki_created_at: 2026-09-06T23:48:38Z
wiki_modified_at: 2026-09-06T23:48:38Z
downloaded_at: 2026-09-07T23:08:14Z
---

# Packaging & Context Handling (PT)

**Packaging & Context Handling** — é um conjunto de técnicas para seleção, compressão, organização e fornecimento de fragmentos de conhecimento extraídos para o contexto de LLMs como parte da Geração Aumentada por Recuperação (RAG). O objetivo é maximizar a utilidade de um orçamento de tokens limitado, aumentar a precisão e a robustez das respostas e garantir a citação rastreável das fontes. Por "empacotamento" (packaging) entende-se não apenas a formação de uma lista de fragmentos, mas também sua compressão, ordenação, agrupamento e as instruções para o modelo, incluindo as estratégias *stuff*, *map‑reduce*, *refine* e *tree‑of‑chunks*.<sup>[\[1\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-lewis2020-1)[\[2\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-langchain-sum-2)</sup>

## Definição e Motivação

Em sistemas RAG, a qualidade da resposta final é determinada não apenas pela recuperação (retrieval), mas também por *como* os fragmentos selecionados são inseridos no prompt. As limitações de contexto e o custo dos tokens forçam um equilíbrio entre completude e precisão: fragmentos desnecessários aumentam o risco de "se perder no meio" (*lost‑in‑the‑middle*) e aumentam a latência, enquanto uma filtragem/compressão agressiva pode remover evidências cruciais.<sup>[\[3\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-lostmiddle-3)</sup> No RAG clássico, as fontes servem como uma "memória não paramétrica" externa, garantindo atualidade e citabilidade, desde que o empacotamento permita que o LLM opere de forma confiável com fatos e referências.<sup>[\[1\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-lewis2020-1)</sup>

## Chunking e Extração de Conteúdo

A política de segmentação (*chunking*) define o tamanho/sobreposição dos chunks, a normalização e a granularidade (*document*→*passage*→*sentence*). Abordagens típicas incluem:

- **Regra de tamanho fixo** (por caracteres/tokens) com sobreposição para manter a coesão entre os chunks;<sup>[\[4\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-lc-splitters-4)[\[5\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-llama-splitters-5)</sup>
- **Chunking semântico** (limites baseados na proximidade dos embeddings), que reduz as "quebras de sentido".<sup>[\[6\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-llama-sem-6)</sup>
- **Sentence‑window retrieval** — inicialmente, as sentenças são indexadas; durante a recuperação, são extraídas as sentenças relevantes com uma *janela* de sentenças vizinhas (antes/depois) para restaurar o contexto local.<sup>[\[7\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-haystack-sentwin-7)</sup>
- **Indexação em nível de passagem** (Passage‑level) — a divisão da Wikipédia em passagens de aproximadamente 100 palavras tornou-se um padrão em QA de domínio aberto (DPR), o que reflete a utilidade de uma granularidade fina nos estágios iniciais.<sup>[\[8\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-dpr-8)</sup>
- **Normalização e limpeza** (remoção de lixo, cabeçalhos/rodapés, unificação de espaços), rastreamento de fontes/páginas/deslocamentos em nível de metadados para rastreabilidade.<sup>[\[9\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-haystack-pre-9)</sup>
- **Desduplicação** de chunks candidatos (exatos e *near‑duplicate*): shingles + MinHash/LSH para reduzir repetições.<sup>[\[10\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-broder1997-10)</sup>

## Diversificação e Seleção (MMR e outros)

Ao formar o conjunto de contexto, são necessárias alta relevância e baixa redundância. A função clássica de Relevância Marginal Máxima (Maximal Marginal Relevance) seleciona o próximo fragmento levando em conta sua proximidade com a consulta e a *maior* similaridade com os já selecionados (penalidade por duplicatas):

${MMR}(d_{i}) = \arg\max\limits_{d_{i} \in D \smallsetminus S}\left\lbrack \lambda \cdot {sim}(q,d_{i}) - (1 - \lambda) \cdot \max\limits_{d_{j} \in S}{sim}(d_{i},d_{j}) \right\rbrack,\ \lambda \in \lbrack 0,1\rbrack$.<sup>[\[11\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-mmr-11)</sup>

A combinação de sinais: recuperação híbrida (BM25 + dense) → fusão (por exemplo, Reciprocal Rank Fusion, RRF) → reclassificação com cross‑encoder/ColBERT:

- **RRF**: um esquema simples e eficaz, não supervisionado, para fundir classificações de diferentes recuperadores.<sup>[\[12\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-rrf-12)</sup>
- **Reclassificadores cross‑encoder** (BERT/MonoT5/APIs comerciais modernas) aumentam significativamente a precisão do top‑k, mas adicionam latência.<sup>[\[13\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-nogueira2019-13)[\[14\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-cohere-rerank-14)</sup>
- **Recuperador multivetor** ColBERT (*late interaction*) frequentemente serve como um reclassificador/recuperador de primeiro nível eficaz em grandes corpus.<sup>[\[15\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-colbert-15)</sup>
- **Busca híbrida** (BM25F+vetor) é implementada em motores e bibliotecas industriais com peso/fusão configuráveis (alfa, RRF, etc.).<sup>[\[16\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-weav-hybrid-16)[\[17\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-pine-hybrid-17)</sup>

## Compressão de Contexto

A redução do volume de contexto sem perda de fatos é crucial para o custo e a latência:

- **Compressão extrativa** (extração de sentenças/frases-chave); **sumarização abstrativa** (refraseamento/condensação). Uma perspectiva clássica é a de Nenkova & McKeown.<sup>[\[18\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-nenkova2011-18)</sup>
- **Compressão guiada por consulta/instrução** (Query‑guided / instruction‑guided): sumarização orientada à consulta/tarefa (destacando evidências e removendo o que for irrelevante).
- **Compressão de prompt/contexto** por meio de filtragem/poda de tokens via LLM (ex., LLMLingua/LLMLingua‑2) reduz o orçamento de tokens com pouca perda de qualidade, mas requer uma validação cuidadosa da *faithfulness* (fidelidade).<sup>[\[19\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-llmlingua-19)</sup>
- A compressão é um compromisso *qualidade↔custo↔latência*: uma compressão agressiva aumenta o risco de omitir nuances/premissas e piora a atribuição de fatos.<sup>[\[20\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-ji2023-20)</sup>

## Estratégias de Empacotamento (stuff/map‑reduce/refine/tree)

Abaixo estão quatro esquemas básicos para organizar as fontes no prompt e cenários típicos de sua aplicação (veja também a tabela de comparação).

**Stuff** (alimentação direta)  
Concatenar os fragmentos selecionados (após possível compressão) e fornecê-los inteiramente. Simples e rápido, mas limitado em volume e suscetível ao efeito *lost‑in‑the‑middle* em entradas longas.<sup>[\[2\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-langchain-sum-2)</sup>

**Map‑Reduce**  
Na etapa *map*, responder/sumarizar localmente para cada fragmento/documento, e em seguida, *reduce* agrega os resultados (comparação, votação, fusão). Escala bem com o número de fontes, reduzindo a carga em um único prompt; risco de perder conexões cruzadas entre fontes com uma agregação ingênua.<sup>[\[2\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-langchain-sum-2)[\[21\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-fid-21)</sup>

**Refine**  
Melhoria sequencial: uma resposta inicial é gerada com o primeiro fragmento, e depois é iterativamente *refinada* considerando o próximo fragmento (adicionando/corrigindo). Útil quando a ordem das fontes é importante; risco de "ficar preso" em erros iniciais e acumular distorções.<sup>[\[22\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-llama-refine-22)</sup>

**Tree‑of‑chunks**  
Compressão/resumo hierárquico: resumos locais por chunks → consolidações em nível de seção → resumo final. Útil para documentos longos; requer a passagem cuidadosa de identificadores de fontes entre os níveis para uma atribuição correta.<sup>[\[23\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-llama-tree-23)</sup>

| Estratégia         | Ideia                                             | Custo/Latência                   | Risco de perda de contexto                      | Quando aplicar                                   | Fontes                                                                                                                                                                                                                   |
|--------------------|---------------------------------------------------|----------------------------------|-------------------------------------------------|--------------------------------------------------|--------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------|
| **Stuff**          | Todos os fragmentos de uma vez em um único prompt | Baixo (até o limite de contexto) | Alto em entradas longas (*lost‑in‑the‑middle*)  | Volume pequeno, perguntas simples                | <sup>[\[2\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-langchain-sum-2)[\[3\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-lostmiddle-3)</sup> |
| **Map‑Reduce**     | Respostas locais → agregação                      | Médio/Alto (muitas chamadas)     | Médio (depende da qualidade do reduce)          | Muitas fontes, necessidade de escalabilidade     | <sup>[\[2\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-langchain-sum-2)[\[21\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-fid-21)</sup>      |
| **Refine**         | Melhoria sequencial da resposta                   | Médio                            | Dependência da ordem, risco de fixação de erros | Quando a ordem/evolução da resposta é importante | <sup>[\[22\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-llama-refine-22)</sup>                                                                                                     |
| **Tree‑of‑chunks** | Resumos hierárquicos                              | Médio/Alto                       | Perda de detalhes nos níveis superiores         | Documentos/coleções longas                       | <sup>[\[23\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-llama-tree-23)</sup>                                                                                                       |

Comparação das estratégias de empacotamento

## Ordem e Posicionamento das Fontes

Os LLMs utilizam menos eficientemente as informações do meio de um contexto longo; fatos úteis devem ser posicionados no início/fim, agrupados por tópico/fonte e marcados com títulos e IDs. A reclassificação que leva em conta a importância *query‑aware* e a diversificação ajuda a mover os fragmentos-chave para mais perto do início.<sup>[\[3\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-lostmiddle-3)[\[13\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-nogueira2019-13)</sup>

## Integração no Pipeline RAG (fusion → rerank → packaging)

Um pipeline típico de múltiplos estágios: **hybrid retrieval** (BM25 + dense) → **fusion** (RRF/mistura ponderada) → **rerank** (Cross‑Encoder/ColBERT) → **packaging** (uma das estratégias) → **geração** + **citação**. A busca híbrida e o RRF são robustos à incomparabilidade das pontuações de diferentes recuperadores; o cross‑encoder aumenta a precisão da entrada para o LLM, economizando tokens.<sup>[\[16\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-weav-hybrid-16)[\[12\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-rrf-12)[\[14\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-cohere-rerank-14)[\[15\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-colbert-15)</sup>

## Avaliação de Qualidade e Ablações

A avaliação é realizada nos níveis de recuperação, empacotamento e geração:

- **Recuperação**: Recall@k, nDCG@k, MRR — métricas padrão de RI.<sup>[\[24\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-manning2008-24)</sup>
- **Faithfulness/groundedness**: proporção de afirmações apoiadas por citações; frameworks automáticos (RAGAS, TruLens) + validação manual da atribuição.<sup>[\[25\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-ragas-25)[\[26\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-trulens-26)[\[27\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-rashkin2023-27)</sup>
- **End‑to‑end QA**: EM/F1/ROUGE dependendo da tarefa/dataset (NQ/HotpotQA, etc.).<sup>[\[1\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-lewis2020-1)</sup>
- **Eficiência**: latência p50/p95, número de tokens, custo em \$; comparação de estratégias de empacotamento e níveis de compressão em termos de *qualidade↔custo*.
- **Ablações**: desativar MMR/desduplicação/compressão/alterar a ordem para medir a contribuição de cada componente (em 2025‑09‑10, a prática de pesquisa em RAG recomenda registrar claramente k, λ, tamanhos de chunk e limites de tokens).<sup>[\[28\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-rag-survey-28)</sup>

## Recomendações Práticas e Checklist

- **k e diversificação**: comece com k=20–40 candidatos da recuperação híbrida; aplique MMR com λ≈0.5–0.8; penalize rigorosamente duplicatas por URL/ID/hash de texto.<sup>[\[11\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-mmr-11)[\[16\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-weav-hybrid-16)</sup>
- **Chunking**: 200–400 tokens com 10–20% de sobreposição (overlap) para chunking de tamanho fixo; para documentos técnico-jurídicos, o esquema de sentence/window costuma ser mais útil.<sup>[\[4\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-lc-splitters-4)[\[7\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-haystack-sentwin-7)</sup>
- **Compressão**: use filtragem extrativa baseada na consulta e abstração com cautela; métodos como LLMLingua devem ser ajustados (aumentados/diminuídos) com base na *faithfulness* em seus dados (validação A/B obrigatória).<sup>[\[19\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-llmlingua-19)[\[27\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-rashkin2023-27)</sup>
- **Ordem**: fragmentos importantes/de alta confiança no início do prompt; agrupe por fonte/tópico, marcando explicitamente IDs e títulos; considere o efeito *lost‑in‑the‑middle* (duplicar um fato-chave no início e no fim pode ajudar).<sup>[\[3\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-lostmiddle-3)</sup>
- **Rerank**: se o orçamento permitir, adicione um Cross‑Encoder/ColBERT no top‑k (k≈50–200) antes do empacotamento — isso economiza tokens de geração e aumenta a precisão.<sup>[\[13\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-nogueira2019-13)[\[15\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-colbert-15)</sup>
- **Estratégias de fallback**: (1) falta de fatos → solicitar fontes adicionais; (2) exceder o limite de tokens → mudar de *stuff→refine* ou ativar a compressão; (3) baixa confiança/contradições → responder com uma recusa e uma lista explícita dos IDs ausentes (veja o template abaixo).

### Pseudocódigo do pipeline de empacotamento

    # Entrada: consulta q
    cands = retrieve(q, K_sparse, K_dense)          # busca BM25, DPR etc.
    cands = diversify_MMR(cands, lambda=0.7)        # diversificação (MMR)
    snips = compress(query=q, items=cands, mode="extractive|abstractive", budget=tokens)
    pkg   = package(snips, strategy="stuff|map_reduce|refine|tree")
    resp  = generate(prompt=build_prompt(q, pkg), citations=True)  # LLM com citações

### Esqueleto de template de prompt (fragmento)

    [CONSULTA DO USUÁRIO]
    {q}

    [FONTES]
    {# Cada fragmento com ID, título e link #}
    - [{id}] {title} — {url}
    {content_snippet}

    [REQUISITOS]
    1) Use apenas fatos das fontes, referenciando-os por [ID].
    2) Se os dados não forem suficientes, informe e peça esclarecimentos/fontes adicionais.
    3) Mantenha a estrutura da resposta e liste os [ID]s utilizados.

## Limitações e Questões Abertas

- **Alucinações e agregação** em map‑reduce/refine: resumos abstrativos podem introduzir novos fatos; são cruciais instruções claras sobre atribuição e mecanismos de verificação de citações.<sup>[\[20\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-ji2023-20)[\[27\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-rashkin2023-27)</sup>
- **Perda de detalhes** com compressão agressiva/hierárquica; é importante manter links de volta para a fonte original/página/deslocamento.
- **Portabilidade de domínio** de recuperadores/reclassificadores e compressores; requer adaptação/ajuste fino em corpus de domínio.<sup>[\[28\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-rag-survey-28)</sup>
- **Privacidade/PII** e memorização de LLMs: durante a geração sem um *grounding* estrito, pode ocorrer o vazamento de strings privadas; aplique filtros, repositórios privados e uma política de recusa.<sup>[\[29\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-carlini-29)[\[30\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-shokri-30)</sup>
- **"Empacotadores" treináveis**, ordem/disposição adaptativa, RLHF/loops de feedback para aumentar a *faithfulness*, contexto multilíngue e ultralongo — são áreas de pesquisa ativas.<sup>[\[28\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-rag-survey-28)[\[3\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_note-lostmiddle-3)</sup>

## Ligações externas

- LangChain: *Summarization* (stuff/map_reduce/refine). <a href="https://python.langchain.com/docs/tutorials/summarization/" class="external autonumber" rel="nofollow">[29]</a>
- LangChain: *Text splitters*. <a href="https://python.langchain.com/docs/concepts/text_splitters/" class="external autonumber" rel="nofollow">[30]</a>
- LlamaIndex: *Response Synthesizers (refine/tree)*. <a href="https://docs.llamaindex.ai/en/stable/module_guides/deploying/response_synthesizers/" class="external autonumber" rel="nofollow">[31]</a>
- LlamaIndex: *Node Parsers / SentenceSplitter / SemanticSplitter*. <a href="https://docs.llamaindex.ai/en/stable/module_guides/loading/node_parsers/modules/" class="external autonumber" rel="nofollow">[32]</a>
- Haystack: *SentenceWindowRetriever*. <a href="https://docs.haystack.deepset.ai/docs/sentencewindowretrieval" class="external autonumber" rel="nofollow">[33]</a>
- Haystack: *PreProcessors / DocumentSplitter*. <a href="https://docs.haystack.deepset.ai/docs/preprocessors" class="external autonumber" rel="nofollow">[34]</a>
- Weaviate: *Hybrid search*. <a href="https://docs.weaviate.io/weaviate/concepts/search/hybrid-search" class="external autonumber" rel="nofollow">[35]</a>
- Pinecone: *Hybrid search*. <a href="https://docs.pinecone.io/docs/hybrid-search" class="external autonumber" rel="nofollow">[36]</a>
- Cohere: *Rerank API*. <a href="https://docs.cohere.com/docs/rerank-overview" class="external autonumber" rel="nofollow">[37]</a>
- RAGAS (repo/docs). <a href="https://arxiv.org/abs/2309.15217" class="external autonumber" rel="nofollow">[38]</a> <a href="https://github.com/explodinggradients/ragas" class="external autonumber" rel="nofollow">[39]</a>
- TruLens (docs). <a href="https://www.trulens.org/trulens_eval/getting_started/evaluation/" class="external autonumber" rel="nofollow">[40]</a>

## Literatura

- Manning, C. D., Raghavan, P., Schütze, H. (2008). *Introduction to Information Retrieval*. Cambridge University Press. ISBN 978‑0521865715.
- Nenkova, A., McKeown, K. (2011). *Automatic Summarization*. FnT IR, 5(2–3), 103–233. DOI:10.1561/1500000015.
- Lewis, P., et al. (2020). *Retrieval‑Augmented Generation for Knowledge‑Intensive NLP Tasks*. NeurIPS. arXiv:2005.11401.
- Khattab, O., Zaharia, M. (2020). *ColBERT*. SIGIR’20. DOI:10.1145/3397271.3401075.
- Izacard, G., Grave, E. (2021). *Fusion‑in‑Decoder*. EACL. arXiv:2007.01282.
- Ji, Z., et al. (2023). *Survey of Hallucination in NLG*. ACM CS. DOI:10.1145/3571730.
- Gao, S., et al. (2024). *RAG for LLM: A Survey*. arXiv:2312.10997.

## Notas

1.  <span id="cite_note-lewis2020-1">↑ <sup>[1.0](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-lewis2020_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-lewis2020_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-lewis2020_1-2)</sup> Lewis, P., Perez, E., Piktus, A., Petroni, F., Karpukhin, V., et al. (2020). *Retrieval‑Augmented Generation for Knowledge‑Intensive NLP Tasks*. NeurIPS. arXiv:2005.11401. <a href="https://arxiv.org/abs/2005.11401" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-langchain-sum-2">↑ <sup>[2.0](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-langchain-sum_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-langchain-sum_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-langchain-sum_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-langchain-sum_2-3)</sup> <sup>[2.4](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-langchain-sum_2-4)</sup> LangChain Docs. *Summarization* (stuff/map_reduce/refine/map_rerank). (acesso: 2025‑09‑10). <a href="https://python.langchain.com/docs/tutorials/summarization/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-lostmiddle-3">↑ <sup>[3.0](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-lostmiddle_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-lostmiddle_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-lostmiddle_3-2)</sup> <sup>[3.3](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-lostmiddle_3-3)</sup> <sup>[3.4](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-lostmiddle_3-4)</sup> Liu, N. F., Lin, K., Hewitt, J., Paranjape, A., Bevilacqua, M., Petroni, F., Liang, P. (2024). *Lost in the Middle: How Language Models Use Long Contexts*. TACL. arXiv:2307.03172. <a href="https://arxiv.org/abs/2307.03172" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-lc-splitters-4">↑ <sup>[4.0](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-lc-splitters_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-lc-splitters_4-1)</sup> LangChain Docs. *Text splitters* (RecursiveCharacter/TokenTextSplitter). (acesso: 2025‑09‑10). <a href="https://python.langchain.com/docs/concepts/text_splitters/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-llama-splitters-5">[↑](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-llama-splitters_5-0) LlamaIndex Docs. *SentenceSplitter / TokenTextSplitter / SemanticSplitter*. (acesso: 2025‑09‑10). <a href="https://docs.llamaindex.ai/en/stable/api_reference/node_parsers/sentence_splitter/" class="external autonumber" rel="nofollow">[5]</a> <a href="https://docs.llamaindex.ai/en/stable/api_reference/node_parsers/token_text_splitter/" class="external autonumber" rel="nofollow">[6]</a> <a href="https://docs.llamaindex.ai/en/stable/api_reference/node_parsers/semantic_splitter/" class="external autonumber" rel="nofollow">[7]</a></span>
6.  <span id="cite_note-llama-sem-6">[↑](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-llama-sem_6-0) LlamaIndex Docs. *SemanticSplitterNodeParser*. (acesso: 2025‑09‑10). <a href="https://docs.llamaindex.ai/en/stable/api_reference/node_parsers/semantic_splitter/" class="external autonumber" rel="nofollow">[8]</a></span>
7.  <span id="cite_note-haystack-sentwin-7">↑ <sup>[7.0](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-haystack-sentwin_7-0)</sup> <sup>[7.1](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-haystack-sentwin_7-1)</sup> Haystack Docs. *SentenceWindowRetriever*. (acesso: 2025‑09‑10). <a href="https://docs.haystack.deepset.ai/docs/sentencewindowretrieval" class="external autonumber" rel="nofollow">[9]</a></span>
8.  <span id="cite_note-dpr-8">[↑](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-dpr_8-0) Karpukhin, V., Oguz, B., Min, S., Lewis, P., Wu, L., Edunov, S., Chen, D., Yih, W.‑T. (2020). *Dense Passage Retrieval for Open‑Domain Question Answering*. EMNLP. arXiv:2004.04906. <a href="https://arxiv.org/abs/2004.04906" class="external autonumber" rel="nofollow">[10]</a></span>
9.  <span id="cite_note-haystack-pre-9">[↑](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-haystack-pre_9-0) Haystack Docs. *PreProcessors / DocumentSplitter*. (acesso: 2025‑09‑10). <a href="https://docs.haystack.deepset.ai/docs/preprocessors" class="external autonumber" rel="nofollow">[11]</a> <a href="https://docs.haystack.deepset.ai/docs/documentsplitter" class="external autonumber" rel="nofollow">[12]</a></span>
10. <span id="cite_note-broder1997-10">[↑](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-broder1997_10-0) Broder, A. Z. (1997). *On the Resemblance and Containment of Documents*. Compression and Complexity of Sequences. <a href="https://www.cs.princeton.edu/courses/archive/spring13/cos598C/broder97resemblance.pdf" class="external autonumber" rel="nofollow">[13]</a></span>
11. <span id="cite_note-mmr-11">↑ <sup>[11.0](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-mmr_11-0)</sup> <sup>[11.1](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-mmr_11-1)</sup> Carbonell, J., Goldstein, J. (1998). *The Use of MMR, Diversity‑Based Reranking for Reordering Documents and Producing Summaries*. SIGIR’98, pp. 335–336. DOI:10.1145/290941.291025.</span>
12. <span id="cite_note-rrf-12">↑ <sup>[12.0](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-rrf_12-0)</sup> <sup>[12.1](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-rrf_12-1)</sup> Cormack, G. V., Clarke, C. L. A., Büttcher, S. (2009). *Reciprocal Rank Fusion outperforms Condorcet and Individual Rank Learning Methods*. SIGIR’09, pp. 758–759. DOI:10.1145/1571941.1572114. <a href="https://cormack.uwaterloo.ca/cormacksigir09-rrf.pdf" class="external autonumber" rel="nofollow">[14]</a></span>
13. <span id="cite_note-nogueira2019-13">↑ <sup>[13.0](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-nogueira2019_13-0)</sup> <sup>[13.1](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-nogueira2019_13-1)</sup> <sup>[13.2](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-nogueira2019_13-2)</sup> Nogueira, R., Cho, K. (2019). *Passage Re‑ranking with BERT*. arXiv:1901.04085. <a href="https://arxiv.org/abs/1901.04085" class="external autonumber" rel="nofollow">[15]</a></span>
14. <span id="cite_note-cohere-rerank-14">↑ <sup>[14.0](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-cohere-rerank_14-0)</sup> <sup>[14.1](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-cohere-rerank_14-1)</sup> Cohere Docs. *Rerank API overview*. (acesso: 2025‑09‑10). <a href="https://docs.cohere.com/docs/rerank-overview" class="external autonumber" rel="nofollow">[16]</a></span>
15. <span id="cite_note-colbert-15">↑ <sup>[15.0](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-colbert_15-0)</sup> <sup>[15.1](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-colbert_15-1)</sup> <sup>[15.2](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-colbert_15-2)</sup> Khattab, O., Zaharia, M. (2020). *ColBERT: Efficient and Effective Passage Search via Contextualized Late Interaction over BERT*. SIGIR’20, pp. 39–48. DOI:10.1145/3397271.3401075. arXiv:2004.12832.</span>
16. <span id="cite_note-weav-hybrid-16">↑ <sup>[16.0](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-weav-hybrid_16-0)</sup> <sup>[16.1](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-weav-hybrid_16-1)</sup> <sup>[16.2](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-weav-hybrid_16-2)</sup> Weaviate Docs. *Hybrid search (BM25F + vector)*. (acesso: 2025‑09‑10). <a href="https://docs.weaviate.io/weaviate/concepts/search/hybrid-search" class="external autonumber" rel="nofollow">[17]</a></span>
17. <span id="cite_note-pine-hybrid-17">[↑](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-pine-hybrid_17-0) Pinecone Docs. *Hybrid search*. (acesso: 2025‑09‑10). <a href="https://docs.pinecone.io/docs/hybrid-search" class="external autonumber" rel="nofollow">[18]</a></span>
18. <span id="cite_note-nenkova2011-18">[↑](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-nenkova2011_18-0) Nenkova, A., McKeown, K. (2011). *Automatic Summarization*. Foundations and Trends in Information Retrieval, 5(2–3), 103–233. DOI:10.1561/1500000015.</span>
19. <span id="cite_note-llmlingua-19">↑ <sup>[19.0](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-llmlingua_19-0)</sup> <sup>[19.1](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-llmlingua_19-1)</sup> Zhu, Y., Shao, Z., Li, M., et al. (2023). *LLMLingua: Compressing Prompts for Accelerating LLM Inference*. arXiv:2310.05736. <a href="https://arxiv.org/abs/2310.05736" class="external autonumber" rel="nofollow">[19]</a></span>
20. <span id="cite_note-ji2023-20">↑ <sup>[20.0](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-ji2023_20-0)</sup> <sup>[20.1](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-ji2023_20-1)</sup> Ji, Z., Lee, N., Frieske, R., et al. (2023). *Survey of Hallucination in Natural Language Generation*. ACM Computing Surveys, 55(12), Art.248. DOI:10.1145/3571730.</span>
21. <span id="cite_note-fid-21">↑ <sup>[21.0](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-fid_21-0)</sup> <sup>[21.1](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-fid_21-1)</sup> Izacard, G., Grave, E. (2021). *Leveraging Passage Retrieval with Generative Models for Open‑Domain QA (Fusion‑in‑Decoder)*. EACL. arXiv:2007.01282. <a href="https://arxiv.org/abs/2007.01282" class="external autonumber" rel="nofollow">[20]</a></span>
22. <span id="cite_note-llama-refine-22">↑ <sup>[22.0](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-llama-refine_22-0)</sup> <sup>[22.1](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-llama-refine_22-1)</sup> LlamaIndex Docs. *Response Synthesizers: refine*. (acesso: 2025‑09‑10). <a href="https://docs.llamaindex.ai/en/stable/module_guides/deploying/response_synthesizers/#refine" class="external autonumber" rel="nofollow">[21]</a></span>
23. <span id="cite_note-llama-tree-23">↑ <sup>[23.0](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-llama-tree_23-0)</sup> <sup>[23.1](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-llama-tree_23-1)</sup> LlamaIndex Docs. *Tree Summarize*. (acesso: 2025‑09‑10). <a href="https://docs.llamaindex.ai/en/stable/module_guides/deploying/response_synthesizers/#tree-summarize" class="external autonumber" rel="nofollow">[22]</a></span>
24. <span id="cite_note-manning2008-24">[↑](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-manning2008_24-0) Manning, C. D., Raghavan, P., Schütze, H. (2008). *Introduction to Information Retrieval*. Cambridge Univ. Press. (ver capítulos sobre nDCG/MRR). <a href="https://nlp.stanford.edu/IR-book/" class="external autonumber" rel="nofollow">[23]</a></span>
25. <span id="cite_note-ragas-25">[↑](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-ragas_25-0) Es, S., et al. (2023). *RAGAS: Automated Evaluation of Retrieval‑Augmented Generation*. arXiv:2309.15217. <a href="https://arxiv.org/abs/2309.15217" class="external autonumber" rel="nofollow">[24]</a></span>
26. <span id="cite_note-trulens-26">[↑](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-trulens_26-0) TruLens Docs. *Evaluating RAG (groundedness, relevance)*. (acesso: 2025‑09‑10). <a href="https://www.trulens.org/trulens_eval/getting_started/evaluation/" class="external autonumber" rel="nofollow">[25]</a></span>
27. <span id="cite_note-rashkin2023-27">↑ <sup>[27.0](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-rashkin2023_27-0)</sup> <sup>[27.1](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-rashkin2023_27-1)</sup> <sup>[27.2](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-rashkin2023_27-2)</sup> Rashkin, H., Nakov, P., et al. (2023). *Measuring Attribution in Natural Language Generation*. Computational Linguistics, 49(4), 1207–1261. DOI:10.1162/coli_a_00486.</span>
28. <span id="cite_note-rag-survey-28">↑ <sup>[28.0](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-rag-survey_28-0)</sup> <sup>[28.1](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-rag-survey_28-1)</sup> <sup>[28.2](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-rag-survey_28-2)</sup> Gao, S., et al. (2024). *Retrieval‑Augmented Generation for Large Language Models: A Survey*. arXiv:2312.10997. <a href="https://arxiv.org/abs/2312.10997" class="external autonumber" rel="nofollow">[26]</a></span>
29. <span id="cite_note-carlini-29">[↑](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-carlini_29-0) Carlini, N., Tramèr, F., et al. (2021). *Extracting Training Data from Large Language Models*. USENIX Security. <a href="https://www.usenix.org/system/files/sec21-carlini-extracting.pdf" class="external autonumber" rel="nofollow">[27]</a></span>
30. <span id="cite_note-shokri-30">[↑](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(PT)#cite_ref-shokri_30-0) Shokri, R., Stronati, M., Song, C., Shmatikov, V. (2017). *Membership Inference Attacks Against ML Models*. IEEE S&P. <a href="https://www.cs.cornell.edu/~shmat/shmat_oak17.pdf" class="external autonumber" rel="nofollow">[28]</a></span>
