← Back to all news
arXiv AI October 5, 2026 By Nickil Maveli, Antonio Vergari, Shay B. Cohen

Are you Synthesizing or Recalling? Evaluating LLMs on Algorithmic Code Retrieval

Read the original on arXiv AI →

The Flow has not summarised this story yet — read it at arXiv AI.

  • llms
  • fine-tuning
  • benchmarks

One email a morning, machine-written

One email a day, machine-written, one click to leave. We never share your address.

Related stories

arXiv AI
Aug 14

CangjieBench: Benchmarking LLMs on a Low-Resource General-Purpose Programming Language

arXiv:2603. 14501v2 Announce Type: replace-cross Abstract: Large Language Models excel in high-resource programming languages but struggle with low-resource ones.

By Junhang Cheng, Fang Liu, Jia Li, Chengru Wu, Nanxiang Jiang, Li Zhang
llmsragagentsbenchmarks
More like this →
arXiv AI
Jun 16

FasterPy: An LLM-based Code Execution Efficiency Optimization Framework

arXiv:2512. 22827v2 Announce Type: replace-cross Abstract: Code often suffers from performance bugs.

By Yue Wu, Minghao Han, Ruiyin Li, Peng Liang, Amjed Tahir, Zengyang Li, Qiong Feng, Mojtaba Shahin
llmsragfine-tuningbenchmarks
More like this →
arXiv Machine Learning
Jun 10

CodeAlchemy: Synthetic Code Rewriting at Scale

arXiv:2606. 10087v1 Announce Type: cross Abstract: Pre-training on raw code teaches syntax but provides sparse signal for diverse real-world task formats.

By Ankit Gupta, Aditya Prasad, Rameswar Panda
llmsbenchmarks
More like this →
arXiv AI
Jul 3

XSearch: Explainable Code Search via Concept-to-Code Alignment

arXiv:2605. 16046v2 Announce Type: replace-cross Abstract: Semantic code search has been widely adopted in both academia and industry.

By Yiming Liu, Ruofan Liu, Yun Lin, Zicong Zhang, Weiyu Kong, Pengnian Qi, Xiao Cheng, Weinan Zhang, Qianxiang Wang, Linpeng Huang
ragbenchmarkssafety
More like this →
arXiv AI
Aug 13

Program Semantic Inequivalence Game with Large Language Models

arXiv:2505. 03818v3 Announce Type: replace-cross Abstract: Large Language Models (LLMs) can achieve strong performance on everyday coding tasks, but they can fail on complex tasks that require non-trivial reasoning about program semantics.

By Antonio Valerio Miceli-Barone, Vaishak Belle, Ali Payani
llmsagentsfine-tuningbenchmarks
More like this →
arXiv AI
Jul 22

SciCodePile: A 128GB Corpus and Executable Benchmark for Challenging Scientific Code Generation

arXiv:2607. 19104v1 Announce Type: cross Abstract: Large language models (LLMs) excel at general-purpose code generation, yet how well they handle scientific code remains an open question.

By Weifeng Sun, Ye Fan, Yuchen Chen, Gou Tan, Jieke Shi, Yuan Yidi, Swee Liang Wong, Jonathan Pan, David Lo
llmsfine-tuningbenchmarks
More like this →
About Pricing API Newsletter Sources Privacy Terms Refunds Accessibility Provider info Contact RSS

The Flow links to publishers and never republishes their articles. Summaries are machine-generated.

v1.1.0 · 5f852ea