arXiv:2608. 03527v1 Announce Type: cross Abstract: Retrieval systems help deep research agents generate high-quality answers by providing relevant documents.
By Wenhan Liu, Yu Lu, Qiaolin Xia, Hui Xu, Tong Zhao, Jian Xi, Yutao Zhu, Haijin Liang, Haibo Shi, Hao Wang, Zhicheng Dou
Large Language Models (LLMs) have become increasingly adopted in daily applications, with deep research standing out as a particularly important capability. Unlike traditional question-answering (QA) tasks, deep research report generation lacks definitive ground-truth, making reward design inherently unverifiable and limiting effective reinforcement learning.
The paper introduces F$^{2}$DR, a fine‑grained reward framework designed to evaluate end‑to‑end DeepSearch workflows, which involve planning, reflection, retrieval, and answer generation. F$^{2}$DR assesses workflows along three dimensions—Content, Trajectory, and Answer—to provide a comprehensive process‑level evaluation. The authors also present DeepSearch RM‑Bench, a benchmark that tests reward models in DeepSearch scenarios and shows strong discriminative power over existing open‑source models.
By Bojian Xiong (Tianjin University), Wentao Ding (Baidu Inc.), Yujing Lu (Baidu Inc.), Shaowei Zhang (Tianjin University), Ling Shi (Tianjin University), Jing Liao (Baidu Inc.), Yan Wang (Baidu Inc.), Yueyang Zhang (Baidu Inc.), Long Xia (Baidu Inc.), Zhiyuan Sun (Baidu Inc.), Daiting Shi (Baidu Inc.), Jingzhou He (Baidu Inc.), Yuqi Ren (Tianjin University), Deyi Xiong (Tianjin University)
arXiv:2606. 04507v1 Announce Type: cross Abstract: Large Language Models (LLMs) have become increasingly adopted in daily applications, with deep research standing out as a particularly important capability.
By Han Zhu, Chengkun Cai, Yuanfeng Song, Xing Chen, Sirui Han, Yike Guo
arXiv:2610.00389v1 Announce Type: cross
Abstract: Open-ended query generation lacks standard answers, thus necessitating an effective reward mechanism. Pointwise scoring rubrics provide limited infor...
By Zihan Shen, Qi Liu, Zixuan Yang, Yiqun Chen, Chenglong Zhao, Xiaozhao Wang, Lei He
arXiv:2607. 24850v2 Announce Type: replace-cross Abstract: Recent advances in large language models (LLMs) have enabled search agents to autonomously tackle complex tasks across extended search and reasoning horizons.
By Lang Mei, Xiaohan Yu, Chong Chen, Liyan Liu, Xiangnan Chen, Jinchao Ma, Chao Feng, Li Huang, Siyu Mo, Sichen Kang, Yunkun Xu, Zhihan Yang, Zhujun Xue, Jingren Zhang, Qing He, Yingdi Huang, Hao Jiang, Ziao Ma, Zewei Pan, Minhao Sun, Zhuo Tao, Jinzhao Xiao, Gangtao Xin, Huanyao Zhang, Wenjian Zhang, Jiangshan Zhang, Guojie Zhu, Fangzhou Zou, Jiaxin Mao, Wentao Zhang