arXiv AI

Measuring What Matters: Synthetic Benchmarks for Concept Bottleneck Models

arXiv:2606. 04326v1 Announce Type: cross Abstract: Concept bottleneck models predict outcomes from high-level concepts detected in inputs.

arXiv AI
Jun 2

Mixture of Concept Bottleneck Experts

arXiv:2602. 02886v3 Announce Type: replace-cross Abstract: Concept Bottleneck Models (CBMs) promote interpretability by grounding predictions in human-understandable concepts.

By Francesco De Santis, Gabriele Ciravegna, Giovanni De Felice, Arianna Casanova, Francesco Giannini, Michelangelo Diligenti, Johannes Schneider, Danilo Giordano, Mateo Espinosa Zarlenga, Pietro Barbiero
arXiv AI
2d ago

Don't Claim Benchmark-Oriented Optimization Improves General Coding Capability -- Diverse Evaluation Is Required

arXiv:2608. 13566v1 Announce Type: cross Abstract: Post-training papers, model cards, and blog posts often treat scores on a small set of coding benchmarks (e.

By Egor Shibaev, Vera Kudrevskaia, Timur Galimzyanov, Mikhail Evtikhiev, Ana Terna, Rastislav Rabatin, Timur Kudashev, Timofey Bryksin, Arina Puchkova, Patrik Bartak, Egor Bogomolov, Sergey Titov