Plugins

4 plugins

Results for “wan”

1,246 skills
jiachen-t-wang
svit-scaling-up-visual-instruction-tuning-arxiv-2307-04087v2
SVIT: Scaling up Visual Instruction Tuning
6
jiachen-t-wang
grit-general-robust-image-task-benchmark-arxiv-2306-14818v2
Grit: General Robust Image Task Benchmark
6
jiachen-t-wang
synthtext-synthetic-data-for-text-detection-arxiv-1604-06646
SynthText: Synthetic Data for Text Detection
6
jiachen-t-wang
data-centric-artificial-intelligence-a-survey-arxiv-2303-101
Data-Centric Artificial Intelligence: A Survey
6
jiachen-t-wang
glamm-pixel-grounding-large-multimodal-model-arxiv-2311-0335
GLaMM: Pixel Grounding Large Multimodal Model
6
jiachen-t-wang
multimodal-learning-with-transformers-a-survey-arxiv-2206-06
Multimodal Learning with Transformers: A Survey
6
jiachen-t-wang
hard-negative-mixing-for-contrastive-learning-arxiv-2010-010
Hard Negative Mixing for Contrastive Learning
6
jiachen-t-wang
open-vocabulary-object-detection-using-captions-arxiv-2011-1
Open-Vocabulary Object Detection Using Captions
6
jiachen-t-wang
training-compute-optimal-large-language-models-arxiv-2203-15
Training Compute-Optimal Large Language Models
6
jiachen-t-wang
dolphins-multimodal-language-model-for-driving-arxiv-2312-00
Dolphins: Multimodal Language Model for Driving
6
jiachen-t-wang
masked-autoencoders-are-scalable-vision-learners-arxiv-2111-
Masked Autoencoders Are Scalable Vision Learners
6
jiachen-t-wang
multimodal-neurons-in-artificial-neural-networks-arxiv-2103-
Multimodal Neurons in Artificial Neural Networks
6
jiachen-t-wang
improved-baselines-with-visual-instruction-tuning-arxiv-2310
Improved Baselines with Visual Instruction Tuning
6
jiachen-t-wang
copy-paste-augmentation-for-instance-segmentation-arxiv-2012
Copy-Paste Augmentation for Instance Segmentation
6
jiachen-t-wang
mantis-interleaved-multi-image-instruction-tuning-arxiv-2405
Mantis: Interleaved Multi-Image Instruction Tuning
6
jiachen-t-wang
mosaic-augmentation-for-detection-and-segmentation-arxiv-yol
Mosaic Augmentation for Detection and Segmentation
6
jiachen-t-wang
donut-document-understanding-transformer-without-ocr-arxiv-2
Donut: Document Understanding Transformer without OCR
6
jiachen-t-wang
autoaugment-learning-augmentation-strategies-from-data-arxiv
AutoAugment: Learning Augmentation Strategies from Data
6
jiachen-t-wang
coyo-700m-image-text-pair-dataset-github-kakaobrain-coyo-700
COYO-700M: Image-Text Pair Dataset
6
manu14357
triage-issue
Triage a bug or issue by exploring the codebase to find root cause, then create a GitHub issue with a TDD-based fix plan. Use when user reports a bug, wants to file an issue, mentions "triage", or wants to investigate and plan a fix for a problem.
16
jiachen-t-wang
phi-1-textbooks-are-all-you-need-arxiv-2306-11644v2
Phi-1: Textbooks Are All You Need
6
jiachen-t-wang
el2n-deep-learning-on-a-data-diet-arxiv-2107-07075v2
EL2N: Deep Learning on a Data Diet
6
jiachen-t-wang
vqav2-making-the-v-in-vqa-matter-arxiv-1612-00837v3
VQAv2: Making the V in VQA Matter
6
jiachen-t-wang
deita-what-makes-good-data-for-alignment-arxiv-2312-15685v2
Deita: What Makes Good Data for Alignment
6
jiachen-t-wang
sigmoid-loss-for-language-image-pre-training-arxiv-2303-1534
Sigmoid Loss for Language Image Pre-Training
6
jiachen-t-wang
scaling-vision-with-sparse-mixture-of-experts-arxiv-2106-059
Scaling Vision with Sparse Mixture of Experts
6
jiachen-t-wang
openclip-an-open-source-implementation-of-clip-arxiv-2212-07
OpenCLIP: An Open Source Implementation of CLIP
6
jiachen-t-wang
coco-microsoft-coco-common-objects-in-context-arxiv-1405-031
COCO: Microsoft COCO: Common Objects in Context
6
jiachen-t-wang
capsfusion-rethinking-image-text-data-at-scale-arxiv-2310-20
CapsFusion: Rethinking Image-Text Data at Scale
6
jiachen-t-wang
textvqa-towards-reasoning-about-text-in-images-arxiv-1904-08
TextVQA: Towards Reasoning about Text in Images
6
jiachen-t-wang
kinetics-400-a-large-video-understanding-dataset-arxiv-1705-
Kinetics-400: A Large Video Understanding Dataset
6
jiachen-t-wang
cogvlm-visual-expert-for-pretrained-language-models-arxiv-23
CogVLM: Visual Expert for Pretrained Language Models
6
jiachen-t-wang
dataperf-benchmarks-for-data-centric-ai-development-arxiv-22
DataPerf: Benchmarks for Data-Centric AI Development
6
jiachen-t-wang
chameleon-mixed-modal-early-fusion-foundation-models-arxiv-2
Chameleon: Mixed-Modal Early-Fusion Foundation Models
6
jiachen-t-wang
scaling-vision-transformers-to-22-billion-parameters-arxiv-2
Scaling Vision Transformers to 22 Billion Parameters
6
jiachen-t-wang
llava-critic-learning-to-evaluate-multimodal-models-arxiv-24
LLaVA-Critic: Learning to Evaluate Multimodal Models
6