← all plugins

Curation Bench

by @jiachen-t-wang · plugin · 99 skills

Curation Bench from Jiachen-T-Wang/curation-bench-pro.

Install the whole plugin (CLI)
npx skillmds add jiachen-t-wang/segment-anything-arxiv-2304-02643v1 npx skillmds add jiachen-t-wang/visual-prompt-tuning-arxiv-2203-12119v2 npx skillmds add jiachen-t-wang/demystifying-clip-data-arxiv-2309-16671v4 npx skillmds add jiachen-t-wang/gpt-4vision-system-card-openai-gpt4v-2023 npx skillmds add jiachen-t-wang/visual-instruction-tuning-arxiv-2304-08485v2 npx skillmds add jiachen-t-wang/sbu-captions-dataset-crossref-nips-2011-sbu npx skillmds add jiachen-t-wang/pali-3-smaller-faster-stronger-arxiv-2310-09199v2 npx skillmds add jiachen-t-wang/instruction-tuning-with-gpt-4-arxiv-2304-03277v1 npx skillmds add jiachen-t-wang/lima-less-is-more-for-alignment-arxiv-2305-11206v1 npx skillmds add jiachen-t-wang/curriculum-learning-crossref-icml-2009-curriculum npx skillmds add jiachen-t-wang/dclm-datacomp-for-language-models-arxiv-2406-11794v3 npx skillmds add jiachen-t-wang/nemotron-4-340b-technical-report-arxiv-2406-11704v1 npx skillmds add jiachen-t-wang/phi-1-textbooks-are-all-you-need-arxiv-2306-11644v2 npx skillmds add jiachen-t-wang/llama-3-the-llama-3-herd-of-models-arxiv-2407-21783v2 npx skillmds add jiachen-t-wang/matryoshka-representation-learning-arxiv-2205-13147v4 npx skillmds add jiachen-t-wang/el2n-deep-learning-on-a-data-diet-arxiv-2107-07075v2 npx skillmds add jiachen-t-wang/vqav2-making-the-v-in-vqa-matter-arxiv-1612-00837v3 npx skillmds add jiachen-t-wang/snli-ve-visual-entailment-dataset-arxiv-1901-06706v1 npx skillmds add jiachen-t-wang/influence-functions-in-deep-learning-arxiv-2002-08484v3 npx skillmds add jiachen-t-wang/phi-15-textbooks-are-all-you-need-ii-arxiv-2309-05463v2 npx skillmds add jiachen-t-wang/asr-whisper-for-video-transcription-arxiv-2212-04356v1 npx skillmds add jiachen-t-wang/dinov2-for-dense-prediction-tasks-arxiv-dinov2-dense-2024 npx skillmds add jiachen-t-wang/imagenet-21k-pretraining-for-the-masses-arxiv-2104-10972v4 npx skillmds add jiachen-t-wang/pixtral-12b-a-frontier-multimodal-model-arxiv-pixtral-2024 npx skillmds add jiachen-t-wang/scaling-laws-for-neural-language-models-arxiv-2001-08361v1 npx skillmds add jiachen-t-wang/glip-grounded-language-image-pre-training-arxiv-2112-03857v2 npx skillmds add jiachen-t-wang/llava-onevision-easy-visual-task-transfer-arxiv-2408-03326v2 npx skillmds add jiachen-t-wang/deita-what-makes-good-data-for-alignment-arxiv-2312-15685v2 npx skillmds add jiachen-t-wang/scaling-data-constrained-language-models-arxiv-2305-16264v3 npx skillmds add jiachen-t-wang/trak-attributing-model-behavior-at-scale-arxiv-2303-14186v2 npx skillmds add jiachen-t-wang/mixup-beyond-empirical-risk-minimization-arxiv-1710-09412v2 npx skillmds add jiachen-t-wang/towards-open-world-segmentation-of-parts-arxiv-2305-06914v3 npx skillmds add jiachen-t-wang/nocaps-novel-object-captioning-at-scale-arxiv-1812-08658v2 npx skillmds add jiachen-t-wang/idefics2-an-8b-parameters-multimodal-model-arxiv-2405-02246v npx skillmds add jiachen-t-wang/dall-e-zero-shot-text-to-image-generation-arxiv-2102-12092v2 npx skillmds add jiachen-t-wang/segment-everything-everywhere-all-at-once-arxiv-2304-06718v2 npx skillmds add jiachen-t-wang/svit-scaling-up-visual-instruction-tuning-arxiv-2307-04087v2 npx skillmds add jiachen-t-wang/grit-general-robust-image-task-benchmark-arxiv-2306-14818v2 npx skillmds add jiachen-t-wang/minicpm-v-a-gpt-4v-level-mllm-on-your-phone-arxiv-2408-01800 npx skillmds add jiachen-t-wang/sigmoid-loss-for-language-image-pre-training-arxiv-2303-1534 npx skillmds add jiachen-t-wang/synthtext-synthetic-data-for-text-detection-arxiv-1604-06646 npx skillmds add jiachen-t-wang/coyo-700m-image-text-pair-dataset-github-kakaobrain-coyo-700 npx skillmds add jiachen-t-wang/data-centric-artificial-intelligence-a-survey-arxiv-2303-101 npx skillmds add jiachen-t-wang/scaling-instruction-finetuned-language-models-arxiv-2210-114 npx skillmds add jiachen-t-wang/scaling-vision-with-sparse-mixture-of-experts-arxiv-2106-059 npx skillmds add jiachen-t-wang/glamm-pixel-grounding-large-multimodal-model-arxiv-2311-0335 npx skillmds add jiachen-t-wang/docvqa-a-dataset-for-vqa-on-document-images-arxiv-2007-00398 npx skillmds add jiachen-t-wang/emu-generative-pretraining-in-multimodality-arxiv-2307-05222 npx skillmds add jiachen-t-wang/sa-1b-segment-anything-1-billion-masks-dataset-arxiv-sa1b-20 npx skillmds add jiachen-t-wang/webvid-10m-a-large-scale-video-text-dataset-arxiv-2104-00650 npx skillmds add jiachen-t-wang/multimodal-learning-with-transformers-a-survey-arxiv-2206-06 npx skillmds add jiachen-t-wang/openclip-an-open-source-implementation-of-clip-arxiv-2212-07 npx skillmds add jiachen-t-wang/hard-negative-mixing-for-contrastive-learning-arxiv-2010-010 npx skillmds add jiachen-t-wang/coco-microsoft-coco-common-objects-in-context-arxiv-1405-031 npx skillmds add jiachen-t-wang/open-vocabulary-object-detection-using-captions-arxiv-2011-1 npx skillmds add jiachen-t-wang/vila-on-pre-training-for-visual-language-models-arxiv-2312-0 npx skillmds add jiachen-t-wang/training-compute-optimal-large-language-models-arxiv-2203-15 npx skillmds add jiachen-t-wang/capsfusion-rethinking-image-text-data-at-scale-arxiv-2310-20 npx skillmds add jiachen-t-wang/dolphins-multimodal-language-model-for-driving-arxiv-2312-00 npx skillmds add jiachen-t-wang/masked-autoencoders-are-scalable-vision-learners-arxiv-2111- npx skillmds add jiachen-t-wang/multimodal-neurons-in-artificial-neural-networks-arxiv-2103- npx skillmds add jiachen-t-wang/cogagent-a-visual-language-model-for-gui-agents-arxiv-2312-0 npx skillmds add jiachen-t-wang/textvqa-towards-reasoning-about-text-in-images-arxiv-1904-08 npx skillmds add jiachen-t-wang/improved-baselines-with-visual-instruction-tuning-arxiv-2310 npx skillmds add jiachen-t-wang/lora-low-rank-adaptation-of-large-language-models-arxiv-2106 npx skillmds add jiachen-t-wang/copy-paste-augmentation-for-instance-segmentation-arxiv-2012 npx skillmds add jiachen-t-wang/mantis-interleaved-multi-image-instruction-tuning-arxiv-2405 npx skillmds add jiachen-t-wang/mosaic-augmentation-for-detection-and-segmentation-arxiv-yol npx skillmds add jiachen-t-wang/kinetics-400-a-large-video-understanding-dataset-arxiv-1705- npx skillmds add jiachen-t-wang/cogvlm-visual-expert-for-pretrained-language-models-arxiv-23 npx skillmds add jiachen-t-wang/dataperf-benchmarks-for-data-centric-ai-development-arxiv-22 npx skillmds add jiachen-t-wang/gemini-a-family-of-highly-capable-multimodal-models-arxiv-23 npx skillmds add jiachen-t-wang/chameleon-mixed-modal-early-fusion-foundation-models-arxiv-2 npx skillmds add jiachen-t-wang/longva-long-context-transfer-from-language-to-vision-arxiv-2 npx skillmds add jiachen-t-wang/scaling-vision-transformers-to-22-billion-parameters-arxiv-2 npx skillmds add jiachen-t-wang/llava-critic-learning-to-evaluate-multimodal-models-arxiv-24 npx skillmds add jiachen-t-wang/llava-next-improved-reasoning-ocr-and-world-knowledge-arxiv- npx skillmds add jiachen-t-wang/refinedweb-a-falcons-recipe-for-high-quality-web-data-arxiv- npx skillmds add jiachen-t-wang/donut-document-understanding-transformer-without-ocr-arxiv-2 npx skillmds add jiachen-t-wang/drivelm-driving-with-graph-visual-question-answering-arxiv-2 npx skillmds add jiachen-t-wang/lisa-reasoning-segmentation-via-large-language-model-arxiv-2 npx skillmds add jiachen-t-wang/probing-multimodal-llms-as-world-models-for-driving-arxiv-24 npx skillmds add jiachen-t-wang/laclip-improving-clip-training-with-language-rewrites-arxiv- npx skillmds add jiachen-t-wang/nuscenes-a-multimodal-dataset-for-autonomous-driving-arxiv-1 npx skillmds add jiachen-t-wang/eva-clip-improved-training-techniques-for-clip-at-scale-arxi npx skillmds add jiachen-t-wang/label-noise-sgd-provably-prefers-flat-global-minimizers-arxi npx skillmds add jiachen-t-wang/autoaugment-learning-augmentation-strategies-from-data-arxiv npx skillmds add jiachen-t-wang/deduplicating-training-data-makes-language-models-better-arx npx skillmds add jiachen-t-wang/dreamlip-language-image-pre-training-with-long-captions-arxi npx skillmds add jiachen-t-wang/flamingo-a-visual-language-model-for-few-shot-learning-arxiv npx skillmds add jiachen-t-wang/imagenet-a-large-scale-hierarchical-image-database-crossref- npx skillmds add jiachen-t-wang/mmbench-is-your-multi-modal-model-an-all-around-player-arxiv npx skillmds add jiachen-t-wang/no-robots-a-dataset-of-personally-written-instructions-arxiv npx skillmds add jiachen-t-wang/emu2-generative-multimodal-models-are-in-context-learners-ar npx skillmds add jiachen-t-wang/3d-llm-injecting-the-3d-world-into-large-language-models-arx npx skillmds add jiachen-t-wang/alpaca-a-strong-replicable-instruction-following-model-stanf npx skillmds add jiachen-t-wang/dall-e-3-improving-image-generation-with-better-captions-arx npx skillmds add jiachen-t-wang/multimodal-few-shot-learning-with-frozen-language-models-arx npx skillmds add jiachen-t-wang/nlvr2-a-visual-reasoning-benchmark-for-natural-language-arxi
⬇ Download

Skills in this plugin

  1. segment-anything-arxiv-2304-02643v1 · jiachen-t-wang
    Segment Anything
    6
    repo stars
  2. visual-prompt-tuning-arxiv-2203-12119v2 · jiachen-t-wang
    Visual Prompt Tuning
    6
    repo stars
  3. demystifying-clip-data-arxiv-2309-16671v4 · jiachen-t-wang
    Demystifying CLIP Data
    6
    repo stars
  4. gpt-4vision-system-card-openai-gpt4v-2023 · jiachen-t-wang
    GPT-4V(ision) System Card
    6
    repo stars
  5. visual-instruction-tuning-arxiv-2304-08485v2 · jiachen-t-wang
    Visual Instruction Tuning
    6
    repo stars
  6. sbu-captions-dataset-crossref-nips-2011-sbu · jiachen-t-wang
    SBU Captions Dataset
    6
    repo stars
  7. pali-3-smaller-faster-stronger-arxiv-2310-09199v2 · jiachen-t-wang
    PaLI-3: Smaller, Faster, Stronger
    6
    repo stars
  8. instruction-tuning-with-gpt-4-arxiv-2304-03277v1 · jiachen-t-wang
    Instruction Tuning with GPT-4
    6
    repo stars
  9. lima-less-is-more-for-alignment-arxiv-2305-11206v1 · jiachen-t-wang
    LIMA: Less Is More for Alignment
    6
    repo stars
  10. curriculum-learning-crossref-icml-2009-curriculum · jiachen-t-wang
    Curriculum Learning
    6
    repo stars
  11. dclm-datacomp-for-language-models-arxiv-2406-11794v3 · jiachen-t-wang
    DCLM: DataComp for Language Models
    6
    repo stars
  12. nemotron-4-340b-technical-report-arxiv-2406-11704v1 · jiachen-t-wang
    Nemotron-4 340B Technical Report
    6
    repo stars
  13. phi-1-textbooks-are-all-you-need-arxiv-2306-11644v2 · jiachen-t-wang
    Phi-1: Textbooks Are All You Need
    6
    repo stars
  14. llama-3-the-llama-3-herd-of-models-arxiv-2407-21783v2 · jiachen-t-wang
    Llama 3: The Llama 3 Herd of Models
    6
    repo stars
  15. matryoshka-representation-learning-arxiv-2205-13147v4 · jiachen-t-wang
    Matryoshka Representation Learning
    6
    repo stars
  16. el2n-deep-learning-on-a-data-diet-arxiv-2107-07075v2 · jiachen-t-wang
    EL2N: Deep Learning on a Data Diet
    6
    repo stars
  17. vqav2-making-the-v-in-vqa-matter-arxiv-1612-00837v3 · jiachen-t-wang
    VQAv2: Making the V in VQA Matter
    6
    repo stars
  18. snli-ve-visual-entailment-dataset-arxiv-1901-06706v1 · jiachen-t-wang
    SNLI-VE: Visual Entailment Dataset
    6
    repo stars
  19. influence-functions-in-deep-learning-arxiv-2002-08484v3 · jiachen-t-wang
    Influence Functions in Deep Learning
    6
    repo stars
  20. phi-15-textbooks-are-all-you-need-ii-arxiv-2309-05463v2 · jiachen-t-wang
    Phi-1.5: Textbooks Are All You Need II
    6
    repo stars
  21. asr-whisper-for-video-transcription-arxiv-2212-04356v1 · jiachen-t-wang
    ASR: Whisper for Video Transcription
    6
    repo stars
  22. dinov2-for-dense-prediction-tasks-arxiv-dinov2-dense-2024 · jiachen-t-wang
    DINOv2 for Dense Prediction Tasks
    6
    repo stars
  23. imagenet-21k-pretraining-for-the-masses-arxiv-2104-10972v4 · jiachen-t-wang
    ImageNet-21K Pretraining for the Masses
    6
    repo stars
  24. pixtral-12b-a-frontier-multimodal-model-arxiv-pixtral-2024 · jiachen-t-wang
    Pixtral 12B: A Frontier Multimodal Model
    6
    repo stars
  25. scaling-laws-for-neural-language-models-arxiv-2001-08361v1 · jiachen-t-wang
    Scaling Laws for Neural Language Models
    6
    repo stars
  26. glip-grounded-language-image-pre-training-arxiv-2112-03857v2 · jiachen-t-wang
    GLIP: Grounded Language-Image Pre-training
    6
    repo stars
  27. llava-onevision-easy-visual-task-transfer-arxiv-2408-03326v2 · jiachen-t-wang
    LLaVA-OneVision: Easy Visual Task Transfer
    6
    repo stars
  28. deita-what-makes-good-data-for-alignment-arxiv-2312-15685v2 · jiachen-t-wang
    Deita: What Makes Good Data for Alignment
    6
    repo stars
  29. scaling-data-constrained-language-models-arxiv-2305-16264v3 · jiachen-t-wang
    Scaling Data-Constrained Language Models
    6
    repo stars
  30. trak-attributing-model-behavior-at-scale-arxiv-2303-14186v2 · jiachen-t-wang
    TRAK: Attributing Model Behavior at Scale
    6
    repo stars
  31. mixup-beyond-empirical-risk-minimization-arxiv-1710-09412v2 · jiachen-t-wang
    Mixup: Beyond Empirical Risk Minimization
    6
    repo stars
  32. towards-open-world-segmentation-of-parts-arxiv-2305-06914v3 · jiachen-t-wang
    Towards Open-World Segmentation of Parts
    6
    repo stars
  33. nocaps-novel-object-captioning-at-scale-arxiv-1812-08658v2 · jiachen-t-wang
    Nocaps: Novel Object Captioning at Scale
    6
    repo stars
  34. idefics2-an-8b-parameters-multimodal-model-arxiv-2405-02246v · jiachen-t-wang
    Idefics2: An 8B Parameters Multimodal Model
    6
    repo stars
  35. dall-e-zero-shot-text-to-image-generation-arxiv-2102-12092v2 · jiachen-t-wang
    DALL-E: Zero-Shot Text-to-Image Generation
    6
    repo stars
  36. segment-everything-everywhere-all-at-once-arxiv-2304-06718v2 · jiachen-t-wang
    Segment Everything Everywhere All at Once
    6
    repo stars
  37. svit-scaling-up-visual-instruction-tuning-arxiv-2307-04087v2 · jiachen-t-wang
    SVIT: Scaling up Visual Instruction Tuning
    6
    repo stars
  38. grit-general-robust-image-task-benchmark-arxiv-2306-14818v2 · jiachen-t-wang
    Grit: General Robust Image Task Benchmark
    6
    repo stars
  39. minicpm-v-a-gpt-4v-level-mllm-on-your-phone-arxiv-2408-01800 · jiachen-t-wang
    MiniCPM-V: A GPT-4V Level MLLM on Your Phone
    6
    repo stars
  40. sigmoid-loss-for-language-image-pre-training-arxiv-2303-1534 · jiachen-t-wang
    Sigmoid Loss for Language Image Pre-Training
    6
    repo stars
  41. synthtext-synthetic-data-for-text-detection-arxiv-1604-06646 · jiachen-t-wang
    SynthText: Synthetic Data for Text Detection
    6
    repo stars
  42. coyo-700m-image-text-pair-dataset-github-kakaobrain-coyo-700 · jiachen-t-wang
    COYO-700M: Image-Text Pair Dataset
    6
    repo stars
  43. data-centric-artificial-intelligence-a-survey-arxiv-2303-101 · jiachen-t-wang
    Data-Centric Artificial Intelligence: A Survey
    6
    repo stars
  44. scaling-instruction-finetuned-language-models-arxiv-2210-114 · jiachen-t-wang
    Scaling Instruction-Finetuned Language Models
    6
    repo stars
  45. scaling-vision-with-sparse-mixture-of-experts-arxiv-2106-059 · jiachen-t-wang
    Scaling Vision with Sparse Mixture of Experts
    6
    repo stars
  46. glamm-pixel-grounding-large-multimodal-model-arxiv-2311-0335 · jiachen-t-wang
    GLaMM: Pixel Grounding Large Multimodal Model
    6
    repo stars
  47. docvqa-a-dataset-for-vqa-on-document-images-arxiv-2007-00398 · jiachen-t-wang
    DocVQA: A Dataset for VQA on Document Images
    6
    repo stars
  48. emu-generative-pretraining-in-multimodality-arxiv-2307-05222 · jiachen-t-wang
    Emu: Generative Pretraining in Multimodality
    6
    repo stars
  49. sa-1b-segment-anything-1-billion-masks-dataset-arxiv-sa1b-20 · jiachen-t-wang
    SA-1B: Segment Anything 1 Billion Masks Dataset
    6
    repo stars
  50. webvid-10m-a-large-scale-video-text-dataset-arxiv-2104-00650 · jiachen-t-wang
    WebVid-10M: A Large-Scale Video-Text Dataset
    6
    repo stars
  51. multimodal-learning-with-transformers-a-survey-arxiv-2206-06 · jiachen-t-wang
    Multimodal Learning with Transformers: A Survey
    6
    repo stars
  52. openclip-an-open-source-implementation-of-clip-arxiv-2212-07 · jiachen-t-wang
    OpenCLIP: An Open Source Implementation of CLIP
    6
    repo stars
  53. hard-negative-mixing-for-contrastive-learning-arxiv-2010-010 · jiachen-t-wang
    Hard Negative Mixing for Contrastive Learning
    6
    repo stars
  54. coco-microsoft-coco-common-objects-in-context-arxiv-1405-031 · jiachen-t-wang
    COCO: Microsoft COCO: Common Objects in Context
    6
    repo stars
  55. open-vocabulary-object-detection-using-captions-arxiv-2011-1 · jiachen-t-wang
    Open-Vocabulary Object Detection Using Captions
    6
    repo stars
  56. vila-on-pre-training-for-visual-language-models-arxiv-2312-0 · jiachen-t-wang
    VILA: On Pre-training for Visual Language Models
    6
    repo stars
  57. training-compute-optimal-large-language-models-arxiv-2203-15 · jiachen-t-wang
    Training Compute-Optimal Large Language Models
    6
    repo stars
  58. capsfusion-rethinking-image-text-data-at-scale-arxiv-2310-20 · jiachen-t-wang
    CapsFusion: Rethinking Image-Text Data at Scale
    6
    repo stars
  59. dolphins-multimodal-language-model-for-driving-arxiv-2312-00 · jiachen-t-wang
    Dolphins: Multimodal Language Model for Driving
    6
    repo stars
  60. masked-autoencoders-are-scalable-vision-learners-arxiv-2111- · jiachen-t-wang
    Masked Autoencoders Are Scalable Vision Learners
    6
    repo stars
  61. multimodal-neurons-in-artificial-neural-networks-arxiv-2103- · jiachen-t-wang
    Multimodal Neurons in Artificial Neural Networks
    6
    repo stars
  62. cogagent-a-visual-language-model-for-gui-agents-arxiv-2312-0 · jiachen-t-wang
    CogAgent: A Visual Language Model for GUI Agents
    6
    repo stars
  63. textvqa-towards-reasoning-about-text-in-images-arxiv-1904-08 · jiachen-t-wang
    TextVQA: Towards Reasoning about Text in Images
    6
    repo stars
  64. improved-baselines-with-visual-instruction-tuning-arxiv-2310 · jiachen-t-wang
    Improved Baselines with Visual Instruction Tuning
    6
    repo stars
  65. lora-low-rank-adaptation-of-large-language-models-arxiv-2106 · jiachen-t-wang
    LoRA: Low-Rank Adaptation of Large Language Models
    6
    repo stars
  66. copy-paste-augmentation-for-instance-segmentation-arxiv-2012 · jiachen-t-wang
    Copy-Paste Augmentation for Instance Segmentation
    6
    repo stars
  67. mantis-interleaved-multi-image-instruction-tuning-arxiv-2405 · jiachen-t-wang
    Mantis: Interleaved Multi-Image Instruction Tuning
    6
    repo stars
  68. mosaic-augmentation-for-detection-and-segmentation-arxiv-yol · jiachen-t-wang
    Mosaic Augmentation for Detection and Segmentation
    6
    repo stars
  69. kinetics-400-a-large-video-understanding-dataset-arxiv-1705- · jiachen-t-wang
    Kinetics-400: A Large Video Understanding Dataset
    6
    repo stars
  70. cogvlm-visual-expert-for-pretrained-language-models-arxiv-23 · jiachen-t-wang
    CogVLM: Visual Expert for Pretrained Language Models
    6
    repo stars
  71. dataperf-benchmarks-for-data-centric-ai-development-arxiv-22 · jiachen-t-wang
    DataPerf: Benchmarks for Data-Centric AI Development
    6
    repo stars
  72. gemini-a-family-of-highly-capable-multimodal-models-arxiv-23 · jiachen-t-wang
    Gemini: A Family of Highly Capable Multimodal Models
    6
    repo stars
  73. chameleon-mixed-modal-early-fusion-foundation-models-arxiv-2 · jiachen-t-wang
    Chameleon: Mixed-Modal Early-Fusion Foundation Models
    6
    repo stars
  74. longva-long-context-transfer-from-language-to-vision-arxiv-2 · jiachen-t-wang
    LongVA: Long Context Transfer from Language to Vision
    6
    repo stars
  75. scaling-vision-transformers-to-22-billion-parameters-arxiv-2 · jiachen-t-wang
    Scaling Vision Transformers to 22 Billion Parameters
    6
    repo stars
  76. llava-critic-learning-to-evaluate-multimodal-models-arxiv-24 · jiachen-t-wang
    LLaVA-Critic: Learning to Evaluate Multimodal Models
    6
    repo stars
  77. llava-next-improved-reasoning-ocr-and-world-knowledge-arxiv- · jiachen-t-wang
    LLaVA-NeXT: Improved Reasoning, OCR, and World Knowledge
    6
    repo stars
  78. refinedweb-a-falcons-recipe-for-high-quality-web-data-arxiv- · jiachen-t-wang
    RefinedWeb: A Falcon's Recipe for High-Quality Web Data
    6
    repo stars
  79. donut-document-understanding-transformer-without-ocr-arxiv-2 · jiachen-t-wang
    Donut: Document Understanding Transformer without OCR
    6
    repo stars
  80. drivelm-driving-with-graph-visual-question-answering-arxiv-2 · jiachen-t-wang
    DriveLM: Driving with Graph Visual Question Answering
    6
    repo stars
  81. lisa-reasoning-segmentation-via-large-language-model-arxiv-2 · jiachen-t-wang
    LISA: Reasoning Segmentation via Large Language Model
    6
    repo stars
  82. probing-multimodal-llms-as-world-models-for-driving-arxiv-24 · jiachen-t-wang
    Probing Multimodal LLMs as World Models for Driving
    6
    repo stars
  83. laclip-improving-clip-training-with-language-rewrites-arxiv- · jiachen-t-wang
    LaCLIP: Improving CLIP Training with Language Rewrites
    6
    repo stars
  84. nuscenes-a-multimodal-dataset-for-autonomous-driving-arxiv-1 · jiachen-t-wang
    nuScenes: A Multimodal Dataset for Autonomous Driving
    6
    repo stars
  85. eva-clip-improved-training-techniques-for-clip-at-scale-arxi · jiachen-t-wang
    EVA-CLIP: Improved Training Techniques for CLIP at Scale
    6
    repo stars
  86. label-noise-sgd-provably-prefers-flat-global-minimizers-arxi · jiachen-t-wang
    Label Noise SGD Provably Prefers Flat Global Minimizers
    6
    repo stars
  87. autoaugment-learning-augmentation-strategies-from-data-arxiv · jiachen-t-wang
    AutoAugment: Learning Augmentation Strategies from Data
    6
    repo stars
  88. deduplicating-training-data-makes-language-models-better-arx · jiachen-t-wang
    Deduplicating Training Data Makes Language Models Better
    6
    repo stars
  89. dreamlip-language-image-pre-training-with-long-captions-arxi · jiachen-t-wang
    DreamLIP: Language-Image Pre-training with Long Captions
    6
    repo stars
  90. flamingo-a-visual-language-model-for-few-shot-learning-arxiv · jiachen-t-wang
    Flamingo: A Visual Language Model for Few-Shot Learning
    6
    repo stars
  91. imagenet-a-large-scale-hierarchical-image-database-crossref- · jiachen-t-wang
    ImageNet: A Large-Scale Hierarchical Image Database
    6
    repo stars
  92. mmbench-is-your-multi-modal-model-an-all-around-player-arxiv · jiachen-t-wang
    MMBench: Is Your Multi-modal Model an All-around Player?
    6
    repo stars
  93. no-robots-a-dataset-of-personally-written-instructions-arxiv · jiachen-t-wang
    No Robots: A Dataset of Personally Written Instructions
    6
    repo stars
  94. emu2-generative-multimodal-models-are-in-context-learners-ar · jiachen-t-wang
    Emu2: Generative Multimodal Models are In-Context Learners
    6
    repo stars
  95. 3d-llm-injecting-the-3d-world-into-large-language-models-arx · jiachen-t-wang
    3D-LLM: Injecting the 3D World into Large Language Models
    6
    repo stars
  96. alpaca-a-strong-replicable-instruction-following-model-stanf · jiachen-t-wang
    Alpaca: A Strong, Replicable Instruction-Following Model
    6
    repo stars
  97. dall-e-3-improving-image-generation-with-better-captions-arx · jiachen-t-wang
    DALL-E 3: Improving Image Generation with Better Captions
    6
    repo stars
  98. multimodal-few-shot-learning-with-frozen-language-models-arx · jiachen-t-wang
    Multimodal Few-Shot Learning with Frozen Language Models
    6
    repo stars
  99. nlvr2-a-visual-reasoning-benchmark-for-natural-language-arxi · jiachen-t-wang
    NLVR2: A Visual Reasoning Benchmark for Natural Language
    6
    repo stars