arXiv AI By Shiyin Lu, Yinglun Li, Yu Xia, Yuhui Chen, An-Yang Ji, Jun-Peng Jiang, Qing-Guo Chen, Jianshan Zhao, En Lin, Haijun Li, Cheng Qin, Zhao Xu, Weihua Luo

OvisOCR2 Technical Report

Read the original on arXiv AI →

arXiv:2607. 13639v1 Announce Type: cross Abstract: We introduce OvisOCR2, a 0.

Machine-generated by The Flow from the publisher's headline and feed description — not written or checked by a human. The full article lives at arXiv AI.

arXiv AI
4d ago

PolyOCR-Venus: Unified OCR Foundation Models for Text-Centric Visual Intelligence

arXiv:2609.37712v1 Announce Type: cross Abstract: Optical Character Recognition (OCR) is evolving from plain-text transcription toward general visual intelligence, requiring models to recognize, loca...

By GuangJian Team, Kaili Huang, Yongshuo Zhang, Bingtao Fu, Changjiang Jiang, Chenfan Qu, Chenfeng Zhang, Fangming Cui, Gaoyang Zhang, Jiangwei Xie, Jianshu Li, Jing Huang, Jingwen Bai, Mingqi Fang, Tao Fang, Weihong Zhang, Wenbo Du, Xiongfei Bai, Xuekang Zhu, Yinan Xia, Zhenming Wang, Jian Liu, Jingjing Liu, Xiang Qi, Weiqiang Wang
arXiv AI
Jul 10

Infinity-Parser2 Technical Report

arXiv:2607. 07836v1 Announce Type: new Abstract: We present Infinity-Parser2, a large multimodal model that couples a controllable data-synthesis pipeline with multi-task reinforcement learning for end-to-end document parsing, addressing the persistent scarcity of faithfully annotated parsing corpora.

By Zuming Huang, Jun Huang, Kexuan Ren, Baode Wang, Weizhen Li, Jianming Feng, Yu Wang, Yichen Yao, Shijun Lin, Yige Tang, Cheng Peng, Weidi Xu, Wei Chu, Yinghui Xu, Yuan Qi
arXiv Computation and Language
Sep 4

Jina-OCR-v1: Efficient Document Parsing with Speculative Decoding and Dense Verifiable Rewards

Jina-OCR-v1 is an end‑to‑end document parsing model designed for low‑budget GPUs, combining a compressed‑vision encoder with a 3B mixture‑of‑experts decoder that activates about 570 M parameters per token. It uses a FastMTP speculative decoding head that shares a single draft block across three prediction steps, with greedy verification ensuring lossless decoding. Post‑training includes instruction alignment, robustness fine‑tuning on difficult documents, and GRPO with dense verifiable rewards, achieving 91.14 on OmniDocBench v1.6 and 83.4 on olmOCR‑Bench while delivering the highest page throughput at 2.57 pages per second on an NVIDIA L4 GPU.

By Alejandro Bar\'on Garc\'ia, Feng Wang, Emilia Garcia Casademont, Han Xiao