Task-Specific Marginal Utility in Resource-Constrained Local RAG: Retrieval, Memory, and Safety Trade-offs
Abstract
Local retrieval-augmented generation (RAG) systems accumulate fusion, reranking, grading, memory, and safety layers, each adding latency or context cost. We measure their task-specific marginal utility—incremental quality and cost under a fixed local stack (Qwen3.6:27b generator, Qwen3-Embedding:8B retriever, two RTX 4090s). MIRACL Korean and MTRAG separate retrieval from answer evaluation; LongMemEval-S compares memory representations; a BIPIA External Validation measures attack blocking and legitimate-task utility. Results are non-monotonic: reciprocal rank fusion helps Korean retrieval while Dense remains strongest on English multi-turn retrieval, and later filtering can reduce recall or answer quality while adding latency. Episodic Memory gives the largest long-term QA gain; combining all four memory forms adds a smaller significant gain at 3.4 times the tokens. A document guardrail blocks 99.8% of injected instructions but preserves the intended task in only 68.0% of cases. System complexity should be chosen by task-specific quality-cost and safety-utility trade-offs, not module count.