🌴
On vacation
Pinned Loading
-
VITA-MLLM/Long-VITA
VITA-MLLM/Long-VITA Public✨✨Long-VITA: Scaling Large Multi-modal Models to 1 Million Tokens with Leading Short-Context Accuracy
-
VITA-MLLM/VITA-Audio
VITA-MLLM/VITA-Audio Public✨✨[NeurIPS 2025] VITA-Audio: Fast Interleaved Cross-Modal Token Generation for Efficient Large Speech-Language Model
-
TencentCloudADP/youtu-parsing
TencentCloudADP/youtu-parsing PublicYoutu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding && Youtu-Parsing-Omni: One Encoder, One Schema, Every Modality
-
facebookresearch/detectron2
facebookresearch/detectron2 PublicDetectron2 is a platform for object detection, segmentation and other visual recognition tasks.
-
open-compass/VLMEvalKit
open-compass/VLMEvalKit PublicOpen-source evaluation toolkit of large multi-modality models (LMMs), support 220+ LMMs, 80+ benchmarks
Something went wrong, please refresh the page to try again.
If the problem persists, check the GitHub status page or contact support.
If the problem persists, check the GitHub status page or contact support.



