Group Sequence Policy Optimization
Chujie Zheng, Shixuan Liu, Mingze Li, et al.
GSPO defines sequence-level importance ratios and clipping for stable, efficient RL training of LLMs, outperforming GRPO and stabilizing MoE training.
A comprehensive index of artificial intelligence and machine-learning research with AI-generated summaries, citation metrics, and direct links to papers and code.
Chujie Zheng, Shixuan Liu, Mingze Li, et al.
GSPO defines sequence-level importance ratios and clipping for stable, efficient RL training of LLMs, outperforming GRPO and stabilizing MoE training.
Mukhtiar Ali, Harsh Dubey, Sugam Mishra, et al.
Introduces CLIP-CC-Bench, an evaluation suite for long-form video description using 90-second movie clips and expert-written paragraph references, with an ensemble of five LLM embeddings and coarse/fine-grained semantic matching to rank 17 video-lang
Hans J. Briegel, Gemma De las Cuevas
Proposes a learning agent model using simulation-based projection via a random walk through a dynamic network of episodic memory clips, linking reinforcement learning and quantum computation.
Unknown
OWL ViT enables open-vocabulary object detection by adapting Vision Transformers with CLIP-style pre-training and bipartite matching loss.
Unknown
CLIP learns visual representations from 400M image-text pairs via contrastive pre-training, enabling zero-shot transfer to diverse tasks.
Unknown
Llava-Mini reduces vision tokens by pre-fusing CLIP visual information into text tokens and using query-based compression for efficient multimodal processing.
Unknown
LLaVA 1.5 enhances multimodal AI by integrating CLIP-ViT-L-336px with MLP projection and academic VQA data, achieving state-of-the-art results.
Unknown
LLaVA connects CLIP and Vicuna via end-to-end training on GPT-4-generated instruction-following data from image-text pairs.
Zhicheng Cai, Xinyuan Guo, Hanlin Wu, et al.
Reveals PPO-Clip's Euclidean geometry flaw causing exploration collapse in LLM RL and proposes Riemannian Isometric Policy Optimization (RIPO) for balanced exploration.