Loaded 27 instances from benchmarks/opendb/benchmark/codemem_dataset.json



=== LongMemEval-S Results (k=5) ===

Questions evaluated: 27

R@5:  0.5302

NDCG@5: 0.7880

Store:  2703.8 docs/s (1.1s)

Recall: 0.3 q/s (106.5s)



--- By Question Type ---

  code-architecture               n=  6  R@5=0.5556  NDCG@5=0.6667

  code-convention                 n=  4  R@5=0.6917  NDCG@5=0.8742

  code-location                   n=  4  R@5=0.3750  NDCG@5=0.5540

  knowledge-update                n=  4  R@5=0.3750  NDCG@5=0.9255

  api-signature                   n=  3  R@5=0.5000  NDCG@5=0.6609

  bug-fix                         n=  3  R@5=0.8222  NDCG@5=0.9597

  multi-session                   n=  3  R@5=0.4167  NDCG@5=1.0000



Results saved to benchmarks/opendb/benchmark/codemem_result_hybrid.json


