Skip to yearly menu bar Skip to main content


JARVIS-Bench: Benchmarking Personal Intelligence Agents on Long-Horizon Real-User Daily Traces

Weizhi Zhang ⋅ Wei-Chieh Huang ⋅ Yueqing Liang ⋅ Liwei Jiang ⋅ Zhengxiang Wang ⋅ Liangwei Yang ⋅ Zechen Li ⋅ Yuchen Wu ⋅ Haozhen Zhang ⋅ Yu Wang ⋅ Yuanchen Bei ⋅ Yue Zhou ⋅ Siqi Zhu ⋅ Henry P Zou ⋅ Jiahong Liu ⋅ Xinni Zhang ⋅ Paul Martin ⋅ Joseph Marvin Imperial ⋅ Yuyang Luo ⋅ Xiongxiao Xu ⋅ Baixiang Huang ⋅ Shanglin Wu ⋅ Lucas Resck ⋅ Yibo Wang ⋅ Yuqing Liu ⋅ Langzhou He ⋅ Chengze Li ⋅ Yuxin Tian ⋅ Kening Zheng ⋅ Enze Ma ⋅ Boi Huynh ⋅ Zheng Hui ⋅ Rui Yang ⋅ Tao Feng ⋅ Cheng Qian ⋅ Jie Yang ⋅ Shanghao Li ⋅ Haoran Wang ⋅ Wooseong Yang ⋅ Hanrong Zhang ⋅ Huanhuan Ma ⋅ Daye Yoon ⋅ Yaozu Wu ⋅ Shikan Lian ⋅ Xiaoqian Ruan ⋅ Fangxin Wang ⋅ Hyeonjeong Park ⋅ Hins Hu ⋅ Wenzhe Fan ⋅ Chen Wang ⋅ Yifan Gu ⋅ Dongyuan Li ⋅ Song Wang ⋅ Aylin Caliskan ⋅ Jindong Wang ⋅ Xiao Luo ⋅ Yankai Chen ⋅ Kai Shu ⋅ Steve Liu ⋅ Philip S Yu

Abstract

Chat is not available.