Submitted by myownskyW7 93 InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output · 27 authors 5
Submitted by msadat97 23 No Training, No Problem: Rethinking Classifier-Free Guidance for Diffusion Models · 4 authors 1
Submitted by sunshine-lwt 22 TokenPacker: Efficient Visual Projector for Multimodal LLM · 7 authors 283 4
Submitted by akhaliq 19 PicoAudio: Enabling Precise Timestamp and Frequency Controllability of Audio Events in Text-to-audio Generation · 4 authors 45 5
Submitted by AaronXyl 12 DisCo-Diff: Enhancing Continuous Diffusion Models with Discrete Latents · 5 authors 94 1
Submitted by chaoweihuang 9 Investigating Decoder-only Large Language Models for Speech-to-text Translation · 7 authors 1
Submitted by wzq016 7 Eliminating Position Bias of Language Models: A Mechanistic Approach · 9 authors 23 1
Submitted by iliashum 6 A False Sense of Safety: Unsafe Information Leakage in 'Safe' AI Responses · 5 authors 1