Curation Bench
by @jiachen-t-wang · plugin · 99 skills
Curation Bench from Jiachen-T-Wang/curation-bench-pro.
Install the whole plugin (CLI)
npx skillmds add jiachen-t-wang/segment-anything-arxiv-2304-02643v1
npx skillmds add jiachen-t-wang/visual-prompt-tuning-arxiv-2203-12119v2
npx skillmds add jiachen-t-wang/demystifying-clip-data-arxiv-2309-16671v4
npx skillmds add jiachen-t-wang/gpt-4vision-system-card-openai-gpt4v-2023
npx skillmds add jiachen-t-wang/visual-instruction-tuning-arxiv-2304-08485v2
npx skillmds add jiachen-t-wang/sbu-captions-dataset-crossref-nips-2011-sbu
npx skillmds add jiachen-t-wang/pali-3-smaller-faster-stronger-arxiv-2310-09199v2
npx skillmds add jiachen-t-wang/instruction-tuning-with-gpt-4-arxiv-2304-03277v1
npx skillmds add jiachen-t-wang/lima-less-is-more-for-alignment-arxiv-2305-11206v1
npx skillmds add jiachen-t-wang/curriculum-learning-crossref-icml-2009-curriculum
npx skillmds add jiachen-t-wang/dclm-datacomp-for-language-models-arxiv-2406-11794v3
npx skillmds add jiachen-t-wang/nemotron-4-340b-technical-report-arxiv-2406-11704v1
npx skillmds add jiachen-t-wang/phi-1-textbooks-are-all-you-need-arxiv-2306-11644v2
npx skillmds add jiachen-t-wang/llama-3-the-llama-3-herd-of-models-arxiv-2407-21783v2
npx skillmds add jiachen-t-wang/matryoshka-representation-learning-arxiv-2205-13147v4
npx skillmds add jiachen-t-wang/el2n-deep-learning-on-a-data-diet-arxiv-2107-07075v2
npx skillmds add jiachen-t-wang/vqav2-making-the-v-in-vqa-matter-arxiv-1612-00837v3
npx skillmds add jiachen-t-wang/snli-ve-visual-entailment-dataset-arxiv-1901-06706v1
npx skillmds add jiachen-t-wang/influence-functions-in-deep-learning-arxiv-2002-08484v3
npx skillmds add jiachen-t-wang/phi-15-textbooks-are-all-you-need-ii-arxiv-2309-05463v2
npx skillmds add jiachen-t-wang/asr-whisper-for-video-transcription-arxiv-2212-04356v1
npx skillmds add jiachen-t-wang/dinov2-for-dense-prediction-tasks-arxiv-dinov2-dense-2024
npx skillmds add jiachen-t-wang/imagenet-21k-pretraining-for-the-masses-arxiv-2104-10972v4
npx skillmds add jiachen-t-wang/pixtral-12b-a-frontier-multimodal-model-arxiv-pixtral-2024
npx skillmds add jiachen-t-wang/scaling-laws-for-neural-language-models-arxiv-2001-08361v1
npx skillmds add jiachen-t-wang/glip-grounded-language-image-pre-training-arxiv-2112-03857v2
npx skillmds add jiachen-t-wang/llava-onevision-easy-visual-task-transfer-arxiv-2408-03326v2
npx skillmds add jiachen-t-wang/deita-what-makes-good-data-for-alignment-arxiv-2312-15685v2
npx skillmds add jiachen-t-wang/scaling-data-constrained-language-models-arxiv-2305-16264v3
npx skillmds add jiachen-t-wang/trak-attributing-model-behavior-at-scale-arxiv-2303-14186v2
npx skillmds add jiachen-t-wang/mixup-beyond-empirical-risk-minimization-arxiv-1710-09412v2
npx skillmds add jiachen-t-wang/towards-open-world-segmentation-of-parts-arxiv-2305-06914v3
npx skillmds add jiachen-t-wang/nocaps-novel-object-captioning-at-scale-arxiv-1812-08658v2
npx skillmds add jiachen-t-wang/idefics2-an-8b-parameters-multimodal-model-arxiv-2405-02246v
npx skillmds add jiachen-t-wang/dall-e-zero-shot-text-to-image-generation-arxiv-2102-12092v2
npx skillmds add jiachen-t-wang/segment-everything-everywhere-all-at-once-arxiv-2304-06718v2
npx skillmds add jiachen-t-wang/svit-scaling-up-visual-instruction-tuning-arxiv-2307-04087v2
npx skillmds add jiachen-t-wang/grit-general-robust-image-task-benchmark-arxiv-2306-14818v2
npx skillmds add jiachen-t-wang/minicpm-v-a-gpt-4v-level-mllm-on-your-phone-arxiv-2408-01800
npx skillmds add jiachen-t-wang/sigmoid-loss-for-language-image-pre-training-arxiv-2303-1534
npx skillmds add jiachen-t-wang/synthtext-synthetic-data-for-text-detection-arxiv-1604-06646
npx skillmds add jiachen-t-wang/coyo-700m-image-text-pair-dataset-github-kakaobrain-coyo-700
npx skillmds add jiachen-t-wang/data-centric-artificial-intelligence-a-survey-arxiv-2303-101
npx skillmds add jiachen-t-wang/scaling-instruction-finetuned-language-models-arxiv-2210-114
npx skillmds add jiachen-t-wang/scaling-vision-with-sparse-mixture-of-experts-arxiv-2106-059
npx skillmds add jiachen-t-wang/glamm-pixel-grounding-large-multimodal-model-arxiv-2311-0335
npx skillmds add jiachen-t-wang/docvqa-a-dataset-for-vqa-on-document-images-arxiv-2007-00398
npx skillmds add jiachen-t-wang/emu-generative-pretraining-in-multimodality-arxiv-2307-05222
npx skillmds add jiachen-t-wang/sa-1b-segment-anything-1-billion-masks-dataset-arxiv-sa1b-20
npx skillmds add jiachen-t-wang/webvid-10m-a-large-scale-video-text-dataset-arxiv-2104-00650
npx skillmds add jiachen-t-wang/multimodal-learning-with-transformers-a-survey-arxiv-2206-06
npx skillmds add jiachen-t-wang/openclip-an-open-source-implementation-of-clip-arxiv-2212-07
npx skillmds add jiachen-t-wang/hard-negative-mixing-for-contrastive-learning-arxiv-2010-010
npx skillmds add jiachen-t-wang/coco-microsoft-coco-common-objects-in-context-arxiv-1405-031
npx skillmds add jiachen-t-wang/open-vocabulary-object-detection-using-captions-arxiv-2011-1
npx skillmds add jiachen-t-wang/vila-on-pre-training-for-visual-language-models-arxiv-2312-0
npx skillmds add jiachen-t-wang/training-compute-optimal-large-language-models-arxiv-2203-15
npx skillmds add jiachen-t-wang/capsfusion-rethinking-image-text-data-at-scale-arxiv-2310-20
npx skillmds add jiachen-t-wang/dolphins-multimodal-language-model-for-driving-arxiv-2312-00
npx skillmds add jiachen-t-wang/masked-autoencoders-are-scalable-vision-learners-arxiv-2111-
npx skillmds add jiachen-t-wang/multimodal-neurons-in-artificial-neural-networks-arxiv-2103-
npx skillmds add jiachen-t-wang/cogagent-a-visual-language-model-for-gui-agents-arxiv-2312-0
npx skillmds add jiachen-t-wang/textvqa-towards-reasoning-about-text-in-images-arxiv-1904-08
npx skillmds add jiachen-t-wang/improved-baselines-with-visual-instruction-tuning-arxiv-2310
npx skillmds add jiachen-t-wang/lora-low-rank-adaptation-of-large-language-models-arxiv-2106
npx skillmds add jiachen-t-wang/copy-paste-augmentation-for-instance-segmentation-arxiv-2012
npx skillmds add jiachen-t-wang/mantis-interleaved-multi-image-instruction-tuning-arxiv-2405
npx skillmds add jiachen-t-wang/mosaic-augmentation-for-detection-and-segmentation-arxiv-yol
npx skillmds add jiachen-t-wang/kinetics-400-a-large-video-understanding-dataset-arxiv-1705-
npx skillmds add jiachen-t-wang/cogvlm-visual-expert-for-pretrained-language-models-arxiv-23
npx skillmds add jiachen-t-wang/dataperf-benchmarks-for-data-centric-ai-development-arxiv-22
npx skillmds add jiachen-t-wang/gemini-a-family-of-highly-capable-multimodal-models-arxiv-23
npx skillmds add jiachen-t-wang/chameleon-mixed-modal-early-fusion-foundation-models-arxiv-2
npx skillmds add jiachen-t-wang/longva-long-context-transfer-from-language-to-vision-arxiv-2
npx skillmds add jiachen-t-wang/scaling-vision-transformers-to-22-billion-parameters-arxiv-2
npx skillmds add jiachen-t-wang/llava-critic-learning-to-evaluate-multimodal-models-arxiv-24
npx skillmds add jiachen-t-wang/llava-next-improved-reasoning-ocr-and-world-knowledge-arxiv-
npx skillmds add jiachen-t-wang/refinedweb-a-falcons-recipe-for-high-quality-web-data-arxiv-
npx skillmds add jiachen-t-wang/donut-document-understanding-transformer-without-ocr-arxiv-2
npx skillmds add jiachen-t-wang/drivelm-driving-with-graph-visual-question-answering-arxiv-2
npx skillmds add jiachen-t-wang/lisa-reasoning-segmentation-via-large-language-model-arxiv-2
npx skillmds add jiachen-t-wang/probing-multimodal-llms-as-world-models-for-driving-arxiv-24
npx skillmds add jiachen-t-wang/laclip-improving-clip-training-with-language-rewrites-arxiv-
npx skillmds add jiachen-t-wang/nuscenes-a-multimodal-dataset-for-autonomous-driving-arxiv-1
npx skillmds add jiachen-t-wang/eva-clip-improved-training-techniques-for-clip-at-scale-arxi
npx skillmds add jiachen-t-wang/label-noise-sgd-provably-prefers-flat-global-minimizers-arxi
npx skillmds add jiachen-t-wang/autoaugment-learning-augmentation-strategies-from-data-arxiv
npx skillmds add jiachen-t-wang/deduplicating-training-data-makes-language-models-better-arx
npx skillmds add jiachen-t-wang/dreamlip-language-image-pre-training-with-long-captions-arxi
npx skillmds add jiachen-t-wang/flamingo-a-visual-language-model-for-few-shot-learning-arxiv
npx skillmds add jiachen-t-wang/imagenet-a-large-scale-hierarchical-image-database-crossref-
npx skillmds add jiachen-t-wang/mmbench-is-your-multi-modal-model-an-all-around-player-arxiv
npx skillmds add jiachen-t-wang/no-robots-a-dataset-of-personally-written-instructions-arxiv
npx skillmds add jiachen-t-wang/emu2-generative-multimodal-models-are-in-context-learners-ar
npx skillmds add jiachen-t-wang/3d-llm-injecting-the-3d-world-into-large-language-models-arx
npx skillmds add jiachen-t-wang/alpaca-a-strong-replicable-instruction-following-model-stanf
npx skillmds add jiachen-t-wang/dall-e-3-improving-image-generation-with-better-captions-arx
npx skillmds add jiachen-t-wang/multimodal-few-shot-learning-with-frozen-language-models-arx
npx skillmds add jiachen-t-wang/nlvr2-a-visual-reasoning-benchmark-for-natural-language-arxiSkills in this plugin
- ▌
- ▌
- ▌
- ▌
- ▌
- ▌
- ▌ pali-3-smaller-faster-stronger-arxiv-2310-09199v2 · jiachen-t-wangPaLI-3: Smaller, Faster, Stronger
- ▌
- ▌ lima-less-is-more-for-alignment-arxiv-2305-11206v1 · jiachen-t-wangLIMA: Less Is More for Alignment
- ▌
- ▌ dclm-datacomp-for-language-models-arxiv-2406-11794v3 · jiachen-t-wangDCLM: DataComp for Language Models
- ▌ nemotron-4-340b-technical-report-arxiv-2406-11704v1 · jiachen-t-wangNemotron-4 340B Technical Report
- ▌ phi-1-textbooks-are-all-you-need-arxiv-2306-11644v2 · jiachen-t-wangPhi-1: Textbooks Are All You Need
- ▌ llama-3-the-llama-3-herd-of-models-arxiv-2407-21783v2 · jiachen-t-wangLlama 3: The Llama 3 Herd of Models
- ▌ matryoshka-representation-learning-arxiv-2205-13147v4 · jiachen-t-wangMatryoshka Representation Learning
- ▌ el2n-deep-learning-on-a-data-diet-arxiv-2107-07075v2 · jiachen-t-wangEL2N: Deep Learning on a Data Diet
- ▌ vqav2-making-the-v-in-vqa-matter-arxiv-1612-00837v3 · jiachen-t-wangVQAv2: Making the V in VQA Matter
- ▌ snli-ve-visual-entailment-dataset-arxiv-1901-06706v1 · jiachen-t-wangSNLI-VE: Visual Entailment Dataset
- ▌ influence-functions-in-deep-learning-arxiv-2002-08484v3 · jiachen-t-wangInfluence Functions in Deep Learning
- ▌ phi-15-textbooks-are-all-you-need-ii-arxiv-2309-05463v2 · jiachen-t-wangPhi-1.5: Textbooks Are All You Need II
- ▌ asr-whisper-for-video-transcription-arxiv-2212-04356v1 · jiachen-t-wangASR: Whisper for Video Transcription
- ▌ dinov2-for-dense-prediction-tasks-arxiv-dinov2-dense-2024 · jiachen-t-wangDINOv2 for Dense Prediction Tasks
- ▌ imagenet-21k-pretraining-for-the-masses-arxiv-2104-10972v4 · jiachen-t-wangImageNet-21K Pretraining for the Masses
- ▌ pixtral-12b-a-frontier-multimodal-model-arxiv-pixtral-2024 · jiachen-t-wangPixtral 12B: A Frontier Multimodal Model
- ▌ scaling-laws-for-neural-language-models-arxiv-2001-08361v1 · jiachen-t-wangScaling Laws for Neural Language Models
- ▌ glip-grounded-language-image-pre-training-arxiv-2112-03857v2 · jiachen-t-wangGLIP: Grounded Language-Image Pre-training
- ▌ llava-onevision-easy-visual-task-transfer-arxiv-2408-03326v2 · jiachen-t-wangLLaVA-OneVision: Easy Visual Task Transfer
- ▌ deita-what-makes-good-data-for-alignment-arxiv-2312-15685v2 · jiachen-t-wangDeita: What Makes Good Data for Alignment
- ▌ scaling-data-constrained-language-models-arxiv-2305-16264v3 · jiachen-t-wangScaling Data-Constrained Language Models
- ▌ trak-attributing-model-behavior-at-scale-arxiv-2303-14186v2 · jiachen-t-wangTRAK: Attributing Model Behavior at Scale
- ▌ mixup-beyond-empirical-risk-minimization-arxiv-1710-09412v2 · jiachen-t-wangMixup: Beyond Empirical Risk Minimization
- ▌ towards-open-world-segmentation-of-parts-arxiv-2305-06914v3 · jiachen-t-wangTowards Open-World Segmentation of Parts
- ▌ nocaps-novel-object-captioning-at-scale-arxiv-1812-08658v2 · jiachen-t-wangNocaps: Novel Object Captioning at Scale
- ▌ idefics2-an-8b-parameters-multimodal-model-arxiv-2405-02246v · jiachen-t-wangIdefics2: An 8B Parameters Multimodal Model
- ▌ dall-e-zero-shot-text-to-image-generation-arxiv-2102-12092v2 · jiachen-t-wangDALL-E: Zero-Shot Text-to-Image Generation
- ▌ segment-everything-everywhere-all-at-once-arxiv-2304-06718v2 · jiachen-t-wangSegment Everything Everywhere All at Once
- ▌ svit-scaling-up-visual-instruction-tuning-arxiv-2307-04087v2 · jiachen-t-wangSVIT: Scaling up Visual Instruction Tuning
- ▌ grit-general-robust-image-task-benchmark-arxiv-2306-14818v2 · jiachen-t-wangGrit: General Robust Image Task Benchmark
- ▌ minicpm-v-a-gpt-4v-level-mllm-on-your-phone-arxiv-2408-01800 · jiachen-t-wangMiniCPM-V: A GPT-4V Level MLLM on Your Phone
- ▌ sigmoid-loss-for-language-image-pre-training-arxiv-2303-1534 · jiachen-t-wangSigmoid Loss for Language Image Pre-Training
- ▌ synthtext-synthetic-data-for-text-detection-arxiv-1604-06646 · jiachen-t-wangSynthText: Synthetic Data for Text Detection
- ▌ coyo-700m-image-text-pair-dataset-github-kakaobrain-coyo-700 · jiachen-t-wangCOYO-700M: Image-Text Pair Dataset
- ▌ data-centric-artificial-intelligence-a-survey-arxiv-2303-101 · jiachen-t-wangData-Centric Artificial Intelligence: A Survey
- ▌ scaling-instruction-finetuned-language-models-arxiv-2210-114 · jiachen-t-wangScaling Instruction-Finetuned Language Models
- ▌ scaling-vision-with-sparse-mixture-of-experts-arxiv-2106-059 · jiachen-t-wangScaling Vision with Sparse Mixture of Experts
- ▌ glamm-pixel-grounding-large-multimodal-model-arxiv-2311-0335 · jiachen-t-wangGLaMM: Pixel Grounding Large Multimodal Model
- ▌ docvqa-a-dataset-for-vqa-on-document-images-arxiv-2007-00398 · jiachen-t-wangDocVQA: A Dataset for VQA on Document Images
- ▌ emu-generative-pretraining-in-multimodality-arxiv-2307-05222 · jiachen-t-wangEmu: Generative Pretraining in Multimodality
- ▌ sa-1b-segment-anything-1-billion-masks-dataset-arxiv-sa1b-20 · jiachen-t-wangSA-1B: Segment Anything 1 Billion Masks Dataset
- ▌ webvid-10m-a-large-scale-video-text-dataset-arxiv-2104-00650 · jiachen-t-wangWebVid-10M: A Large-Scale Video-Text Dataset
- ▌ multimodal-learning-with-transformers-a-survey-arxiv-2206-06 · jiachen-t-wangMultimodal Learning with Transformers: A Survey
- ▌ openclip-an-open-source-implementation-of-clip-arxiv-2212-07 · jiachen-t-wangOpenCLIP: An Open Source Implementation of CLIP
- ▌ hard-negative-mixing-for-contrastive-learning-arxiv-2010-010 · jiachen-t-wangHard Negative Mixing for Contrastive Learning
- ▌ coco-microsoft-coco-common-objects-in-context-arxiv-1405-031 · jiachen-t-wangCOCO: Microsoft COCO: Common Objects in Context
- ▌ open-vocabulary-object-detection-using-captions-arxiv-2011-1 · jiachen-t-wangOpen-Vocabulary Object Detection Using Captions
- ▌ vila-on-pre-training-for-visual-language-models-arxiv-2312-0 · jiachen-t-wangVILA: On Pre-training for Visual Language Models
- ▌ training-compute-optimal-large-language-models-arxiv-2203-15 · jiachen-t-wangTraining Compute-Optimal Large Language Models
- ▌ capsfusion-rethinking-image-text-data-at-scale-arxiv-2310-20 · jiachen-t-wangCapsFusion: Rethinking Image-Text Data at Scale
- ▌ dolphins-multimodal-language-model-for-driving-arxiv-2312-00 · jiachen-t-wangDolphins: Multimodal Language Model for Driving
- ▌ masked-autoencoders-are-scalable-vision-learners-arxiv-2111- · jiachen-t-wangMasked Autoencoders Are Scalable Vision Learners
- ▌ multimodal-neurons-in-artificial-neural-networks-arxiv-2103- · jiachen-t-wangMultimodal Neurons in Artificial Neural Networks
- ▌ cogagent-a-visual-language-model-for-gui-agents-arxiv-2312-0 · jiachen-t-wangCogAgent: A Visual Language Model for GUI Agents
- ▌ textvqa-towards-reasoning-about-text-in-images-arxiv-1904-08 · jiachen-t-wangTextVQA: Towards Reasoning about Text in Images
- ▌ improved-baselines-with-visual-instruction-tuning-arxiv-2310 · jiachen-t-wangImproved Baselines with Visual Instruction Tuning
- ▌ lora-low-rank-adaptation-of-large-language-models-arxiv-2106 · jiachen-t-wangLoRA: Low-Rank Adaptation of Large Language Models
- ▌ copy-paste-augmentation-for-instance-segmentation-arxiv-2012 · jiachen-t-wangCopy-Paste Augmentation for Instance Segmentation
- ▌ mantis-interleaved-multi-image-instruction-tuning-arxiv-2405 · jiachen-t-wangMantis: Interleaved Multi-Image Instruction Tuning
- ▌ mosaic-augmentation-for-detection-and-segmentation-arxiv-yol · jiachen-t-wangMosaic Augmentation for Detection and Segmentation
- ▌ kinetics-400-a-large-video-understanding-dataset-arxiv-1705- · jiachen-t-wangKinetics-400: A Large Video Understanding Dataset
- ▌ cogvlm-visual-expert-for-pretrained-language-models-arxiv-23 · jiachen-t-wangCogVLM: Visual Expert for Pretrained Language Models
- ▌ dataperf-benchmarks-for-data-centric-ai-development-arxiv-22 · jiachen-t-wangDataPerf: Benchmarks for Data-Centric AI Development
- ▌ gemini-a-family-of-highly-capable-multimodal-models-arxiv-23 · jiachen-t-wangGemini: A Family of Highly Capable Multimodal Models
- ▌ chameleon-mixed-modal-early-fusion-foundation-models-arxiv-2 · jiachen-t-wangChameleon: Mixed-Modal Early-Fusion Foundation Models
- ▌ longva-long-context-transfer-from-language-to-vision-arxiv-2 · jiachen-t-wangLongVA: Long Context Transfer from Language to Vision
- ▌ scaling-vision-transformers-to-22-billion-parameters-arxiv-2 · jiachen-t-wangScaling Vision Transformers to 22 Billion Parameters
- ▌ llava-critic-learning-to-evaluate-multimodal-models-arxiv-24 · jiachen-t-wangLLaVA-Critic: Learning to Evaluate Multimodal Models
- ▌ llava-next-improved-reasoning-ocr-and-world-knowledge-arxiv- · jiachen-t-wangLLaVA-NeXT: Improved Reasoning, OCR, and World Knowledge
- ▌ refinedweb-a-falcons-recipe-for-high-quality-web-data-arxiv- · jiachen-t-wangRefinedWeb: A Falcon's Recipe for High-Quality Web Data
- ▌ donut-document-understanding-transformer-without-ocr-arxiv-2 · jiachen-t-wangDonut: Document Understanding Transformer without OCR
- ▌ drivelm-driving-with-graph-visual-question-answering-arxiv-2 · jiachen-t-wangDriveLM: Driving with Graph Visual Question Answering
- ▌ lisa-reasoning-segmentation-via-large-language-model-arxiv-2 · jiachen-t-wangLISA: Reasoning Segmentation via Large Language Model
- ▌ probing-multimodal-llms-as-world-models-for-driving-arxiv-24 · jiachen-t-wangProbing Multimodal LLMs as World Models for Driving
- ▌ laclip-improving-clip-training-with-language-rewrites-arxiv- · jiachen-t-wangLaCLIP: Improving CLIP Training with Language Rewrites
- ▌ nuscenes-a-multimodal-dataset-for-autonomous-driving-arxiv-1 · jiachen-t-wangnuScenes: A Multimodal Dataset for Autonomous Driving
- ▌ eva-clip-improved-training-techniques-for-clip-at-scale-arxi · jiachen-t-wangEVA-CLIP: Improved Training Techniques for CLIP at Scale
- ▌ label-noise-sgd-provably-prefers-flat-global-minimizers-arxi · jiachen-t-wangLabel Noise SGD Provably Prefers Flat Global Minimizers
- ▌ autoaugment-learning-augmentation-strategies-from-data-arxiv · jiachen-t-wangAutoAugment: Learning Augmentation Strategies from Data
- ▌ deduplicating-training-data-makes-language-models-better-arx · jiachen-t-wangDeduplicating Training Data Makes Language Models Better
- ▌ dreamlip-language-image-pre-training-with-long-captions-arxi · jiachen-t-wangDreamLIP: Language-Image Pre-training with Long Captions
- ▌ flamingo-a-visual-language-model-for-few-shot-learning-arxiv · jiachen-t-wangFlamingo: A Visual Language Model for Few-Shot Learning
- ▌ imagenet-a-large-scale-hierarchical-image-database-crossref- · jiachen-t-wangImageNet: A Large-Scale Hierarchical Image Database
- ▌ mmbench-is-your-multi-modal-model-an-all-around-player-arxiv · jiachen-t-wangMMBench: Is Your Multi-modal Model an All-around Player?
- ▌ no-robots-a-dataset-of-personally-written-instructions-arxiv · jiachen-t-wangNo Robots: A Dataset of Personally Written Instructions
- ▌ emu2-generative-multimodal-models-are-in-context-learners-ar · jiachen-t-wangEmu2: Generative Multimodal Models are In-Context Learners
- ▌ 3d-llm-injecting-the-3d-world-into-large-language-models-arx · jiachen-t-wang3D-LLM: Injecting the 3D World into Large Language Models
- ▌ alpaca-a-strong-replicable-instruction-following-model-stanf · jiachen-t-wangAlpaca: A Strong, Replicable Instruction-Following Model
- ▌ dall-e-3-improving-image-generation-with-better-captions-arx · jiachen-t-wangDALL-E 3: Improving Image Generation with Better Captions
- ▌ multimodal-few-shot-learning-with-frozen-language-models-arx · jiachen-t-wangMultimodal Few-Shot Learning with Frozen Language Models
- ▌ nlvr2-a-visual-reasoning-benchmark-for-natural-language-arxi · jiachen-t-wangNLVR2: A Visual Reasoning Benchmark for Natural Language