{
  "benchmark": "FlowMemory external-baseline cache-pressure test",
  "date": "2026-09-12",
  "scope": "Final reused-prefix request in a controlled 96 MiB cache-pressure workload; not general inference throughput.",
  "model": "llama3.2:1b",
  "workload": {
    "cache_mib": 96,
    "repetitions": 3,
    "sequence": [
      "hot A",
      "short displacement",
      "hot A promotion",
      "cold B",
      "cold C",
      "cold D",
      "cold E",
      "hot A final"
    ],
    "generation_tokens": 1
  },
  "upstream_llama_cpp": {
    "commit": "cb295bf59663cd3577389315636772f4060bd1f5",
    "baseline": "clean detached upstream build",
    "baseline_final_ms": [
      8567.64,
      8697.21,
      9706.21
    ],
    "flowmemory_final_ms": [
      177.17,
      172.88,
      172.12
    ],
    "speedup": [
      48.36,
      50.31,
      56.39
    ],
    "median_speedup": 50.31,
    "outputs_equal": true
  },
  "official_ollama": {
    "version": "0.34.0",
    "baseline": "official installed Ollama",
    "baseline_final_ms": [
      9371.73,
      7807.14,
      6577.58
    ],
    "flowmemory_final_ms": [
      386.58,
      376.05,
      376.1
    ],
    "speedup": [
      24.24,
      20.76,
      17.49
    ],
    "median_speedup": 20.76,
    "outputs_equal": true
  },
  "caveats": [
    "Cache pressure and repeated-prefix reuse are intentionally present.",
    "FlowMemory does not accelerate raw token generation.",
    "Results should not be interpreted as universal end-to-end speedups."
  ]
}
