Agent Reinforcement Learning via Pivotal-Aware Self-Feedback Retry
Weiyang Guo, Zesheng Shi, Longhui Zhang, Zeen Zhu, Min Zhang, Jing Li. (2026). "Agent Reinforcement Learning via Pivotal-Aware Self-Feedback Retry." arXiv preprint arXiv:2607.03702.
Weiyang Guo, Zesheng Shi, Longhui Zhang, Zeen Zhu, Min Zhang, Jing Li. (2026). "Agent Reinforcement Learning via Pivotal-Aware Self-Feedback Retry." arXiv preprint arXiv:2607.03702.
Weiyang Guo, Zesheng Shi, Zeen Zhu, Yuan Zhou, Min Zhang, Jing Li. (2026). "Backdoors in RLVR: Jailbreak Backdoors in LLMs From Verifiable Reward." ACL 2026.
Weiyang Guo, Zesheng Shi, Liye Zhao, Jiayuan Ma, Zeen Zhu, Junxian He, Min Zhang, Jing Li. (2026). "E3-TIR: Enhanced Experience Exploitation for Tool-Integrated Reasoning." Findings of ACL 2026.
Weiyang Guo, et al. (2025). "LLMs are Noisy Oracles! LLM-based Noise-aware Graph Active Learning for Node Classification." KDD 2025.
Weiyang Guo, Jing Li, Wenya Wang, Yu Li, Daojing He, Jun Yu, Min Zhang. (2025). "MTSA: Multi-turn Safety Alignment for LLMs through Multi-round Red-teaming." ACL 2025.
Weiyang Guo, et al. (2024). "IntFair: Graph Neural Networks for Fair Recommendations with Interest Awareness." DASFAA 2024.