* denotes equal contribution.
-
EvoHarness-RL: Learning Self-Evolving Runtime Harness for Long-Horizon LLM Agents
COLM 2026 LLA Workshop
Work in Progress
Xuying Ning, Dongqi Fu, Tianxin Wei, Hanqing Zeng, Yuanchen Bei, Bingxuan Li, Zihao Li, Qifan Wang, Xiang Shen, Yifan Wu, Jiayi Liu, Hong Li, Yinglong Xia, Xiangjun Fan, Hanghang Tong, Jingrui He
Key Insight: Optimizes agent harness coordination with reinforcement learning for sustained self-improvement on long-horizon tasks.
agent
llm
memory
-
Code as Agent Harness
arXiv 2026
Xuying Ning, Katherine Tieu, Dongqi Fu, Tianxin Wei, Zihao Li, Yuanchen Bei, Jiaru Zou, Mengting Ai, Zhining Liu, Ting-Wei Li, Lingjie Chen, Yanjun Zhao, Ke Yang, Bingxuan Li, Cheng Qian, Gaotang Li, Xiao Lin, Zhichen Zeng, Ruizhong Qiu, Sirui Chen, Yifan Sun, Xiyuan Yang, Ruida Wang, Rui Pan, Chenyuan Yang, Dylan Zhang, Liri Fang, Zikun Cui, Yang Cao, Pan Chen, Dorothy Sun, Ren Chen, Mahesh Srinivasan, Nipun Mathur, Yinglong Xia, Hong Li, Hong Yan, Pan Lu, Lingming Zhang, Tong Zhang, Hanghang Tong, Jingrui He
Key Insight: Treats executable code as a harness for agent deployment, evaluation, and improvement.
agent
llm
survey
-
MC-Search: Evaluating and Enhancing Multimodal Agentic Search with Structured Long Reasoning Chains
ICLR 2026 Oral (Top 1%)
Xuying Ning*, Dongqi Fu*, Tianxin Wei*, Mengting Ai, Jiaru Zou, Ting-Wei Li, Hanghang Tong, Yada Zhu, Hendrik Hamann, Jingrui He
Key Insight: Structured long reasoning chains for multimodal agentic search.
agentic search
multimodal
llm
-
Evo-Memory: Benchmarking LLM Agent Test-time Learning with Self-Evolving Memory
arXiv 2025
Tianxin Wei, Noveen Sachdeva, Benjamin Coleman, Zhankui He, Yuarchen Bei, Xuying Ning, Mengting Ai, Yunzhe Li, Jingrui He, Ed H. Chi, Chi Wang, Shuo Chen, Fernando Pereira, Wang-Cheng Kang, Derek Zhiyuan Cheng
Key Insight: LLM agents that autonomously build and refine memory from experience at test time.
agent
memory
-
Mem-Gallery: Benchmarking Multimodal Long-Term Conversational Memory for MLLM Agents
ACL 2026 Main
Yuanchen Bei, Tianxin Wei, Xuying Ning, Yanjun Zhao, Zhining Liu, Xiao Lin, Yada Zhu, Hendrik Hamann, Jingrui He, Hanghang Tong
Key Insight: Benchmark exposing MLLM agents' failure in long-term multimodal conversational memory.
agent
multimodal
memory
-
PaperMind: Benchmarking Agentic Reasoning and Critique over Scientific Papers in Multimodal LLMs
ACL 2026 Findings
Yanjun Zhao*, Tianxin Wei, Jiaru Zou, Xuying Ning, Yuanchen Bei, Lingjie Chen, Simmi Rana, Wendy H. Yang, Hanghang Tong, Jingrui He
Key Insight: Benchmark for evaluating multimodal LLM reasoning and critique over scientific papers.
agent
multimodal
-
AdaFuse: Adaptive Ensemble Decoding with Test-Time Scaling for LLMs
ACL 2026 Main
Chengming Cui*, Tianxin Wei, Ziyi Chen, Ruizhong Qiu, Zhichen Zeng, Zhining Liu, Xuying Ning, Duo Zhou, Jingrui He
Key Insight: Fuses multiple LLM outputs adaptively at decode time via test-time scaling.
llm
reasoning
-
CoFiRec: Coarse-to-Fine Tokenization for Generative Recommendation
RecSys 2026
Tianxin Wei*, Xuying Ning*, Xuxing Chen, Ruizhong Qiu, Yupeng Hou, Yan Xie, Shuang Yang, Zhigang Hua, Jingrui He
Key Insight: Hierarchical tokenization bridging semantics and collaboration for generative recommendation.
recommendation
generative
-
Graph4MM: Weaving Multimodal Learning with Structural Information
ICML 2025
Xuying Ning, Dongqi Fu, Tianxin Wei, Wujiang Xu, Jingrui He
Key Insight: Graph structure as inductive bias for richer multimodal representations.
multimodal
graph
-
I²VAE: Interest Information Augmentation with Variational Regularizers for Cross-Domain Sequential Recommendation
UAI 2025
Xuying Ning, Wujiang Xu, Tianxin Wei, Xiaolei Liu
Key Insight: Variational interest augmentation for cross-domain sequential recommendation.
recommendation
-
AlphaOne: Reasoning Models Thinking Slow and Fast at Test Time
EMNLP 2025 Main
Junyu Zhang, Runpei Dong, Han Wang, Xuying Ning, Haoran Geng, Peihao Li, Xialin He, Yutong Bai, Jitendra Malik, Saurabh Gupta, Huan Zhang
Key Insight: Modulates slow-to-fast reasoning at test time to improve both reasoning accuracy and efficiency.
llm
reasoning
-
SLMRec: Empowering Small Language Models for Sequential Recommendation
ICLR 2025
Wujiang Xu, Qitian Wu, Zujie Liang, Jiaojiao Han, Xuying Ning, Wenfang Lin, Linxun Chen, Feng Wei, Yongfeng Zhang
Key Insight: Distills large language models into efficient small models for sequential recommendation.
recommendation
llm