Plugins

4 plugins

Results for “wan”

409 skills
jiachen-t-wang
Nocaps Novel Object Captioning At Scale Arxiv 1812 08658v2
Nocaps: Novel Object Captioning at Scale
6
jiachen-t-wang
Segment Everything Everywhere All At Once Arxiv 2304 06718v2
Segment Everything Everywhere All at Once
6
jiachen-t-wang
Svit Scaling Up Visual Instruction Tuning Arxiv 2307 04087v2
SVIT: Scaling up Visual Instruction Tuning
6
jiachen-t-wang
Synthtext Synthetic Data For Text Detection Arxiv 1604 06646
SynthText: Synthetic Data for Text Detection
6
jiachen-t-wang
Data Centric Artificial Intelligence A Survey Arxiv 2303 101
Data-Centric Artificial Intelligence: A Survey
6
jiachen-t-wang
Multimodal Learning With Transformers A Survey Arxiv 2206 06
Multimodal Learning with Transformers: A Survey
6
jiachen-t-wang
Hard Negative Mixing For Contrastive Learning Arxiv 2010 010
Hard Negative Mixing for Contrastive Learning
6
jiachen-t-wang
Open Vocabulary Object Detection Using Captions Arxiv 2011 1
Open-Vocabulary Object Detection Using Captions
6
jiachen-t-wang
Training Compute Optimal Large Language Models Arxiv 2203 15
Training Compute-Optimal Large Language Models
6
jiachen-t-wang
Masked Autoencoders Are Scalable Vision Learners Arxiv 2111
Masked Autoencoders Are Scalable Vision Learners
6
jiachen-t-wang
Multimodal Neurons In Artificial Neural Networks Arxiv 2103
Multimodal Neurons in Artificial Neural Networks
6
jiachen-t-wang
Improved Baselines With Visual Instruction Tuning Arxiv 2310
Improved Baselines with Visual Instruction Tuning
6
jiachen-t-wang
Copy Paste Augmentation For Instance Segmentation Arxiv 2012
Copy-Paste Augmentation for Instance Segmentation
6
jiachen-t-wang
Mantis Interleaved Multi Image Instruction Tuning Arxiv 2405
Mantis: Interleaved Multi-Image Instruction Tuning
6
jiachen-t-wang
Mosaic Augmentation For Detection And Segmentation Arxiv Yol
Mosaic Augmentation for Detection and Segmentation
6
jiachen-t-wang
Autoaugment Learning Augmentation Strategies From Data Arxiv
AutoAugment: Learning Augmentation Strategies from Data
6
manu14357
Triage Issue
Triage a bug or issue by exploring the codebase to find root cause, then create a GitHub issue with a TDD-based fix plan. Use when user reports a bug, wants to file an issue, mentions "triage", or wants to investigate and plan a fix for a problem.
16
jiachen-t-wang
Phi 1 Textbooks Are All You Need Arxiv 2306 11644v2
Phi-1: Textbooks Are All You Need
6
jiachen-t-wang
El2n Deep Learning On A Data Diet Arxiv 2107 07075v2
EL2N: Deep Learning on a Data Diet
6
jiachen-t-wang
Vqav2 Making The V In Vqa Matter Arxiv 1612 00837v3
VQAv2: Making the V in VQA Matter
6
jiachen-t-wang
Deita What Makes Good Data For Alignment Arxiv 2312 15685v2
Deita: What Makes Good Data for Alignment
6
jiachen-t-wang
Sigmoid Loss For Language Image Pre Training Arxiv 2303 1534
Sigmoid Loss for Language Image Pre-Training
6
jiachen-t-wang
Scaling Vision With Sparse Mixture Of Experts Arxiv 2106 059
Scaling Vision with Sparse Mixture of Experts
6
jiachen-t-wang
Openclip An Open Source Implementation Of Clip Arxiv 2212 07
OpenCLIP: An Open Source Implementation of CLIP
6
jiachen-t-wang
Coco Microsoft Coco Common Objects In Context Arxiv 1405 031
COCO: Microsoft COCO: Common Objects in Context
6
jiachen-t-wang
Capsfusion Rethinking Image Text Data At Scale Arxiv 2310 20
CapsFusion: Rethinking Image-Text Data at Scale
6
jiachen-t-wang
Textvqa Towards Reasoning About Text In Images Arxiv 1904 08
TextVQA: Towards Reasoning about Text in Images
6
jiachen-t-wang
Cogvlm Visual Expert For Pretrained Language Models Arxiv 23
CogVLM: Visual Expert for Pretrained Language Models
6
jiachen-t-wang
Dataperf Benchmarks For Data Centric AI Development Arxiv 22
DataPerf: Benchmarks for Data-Centric AI Development
6
jiachen-t-wang
Chameleon Mixed Modal Early Fusion Foundation Models Arxiv 2
Chameleon: Mixed-Modal Early-Fusion Foundation Models
6
jiachen-t-wang
Scaling Vision Transformers To 22 Billion Parameters Arxiv 2
Scaling Vision Transformers to 22 Billion Parameters
6
jiachen-t-wang
Llava Critic Learning To Evaluate Multimodal Models Arxiv 24
LLaVA-Critic: Learning to Evaluate Multimodal Models
6
jiachen-t-wang
Drivelm Driving With Graph Visual Question Answering Arxiv 2
DriveLM: Driving with Graph Visual Question Answering
6
jiachen-t-wang
Laclip Improving Clip Training With Language Rewrites Arxiv
LaCLIP: Improving CLIP Training with Language Rewrites
6
jiachen-t-wang
Deduplicating Training Data Makes Language Models Better Arx
Deduplicating Training Data Makes Language Models Better
6
jiachen-t-wang
Imagenet A Large Scale Hierarchical Image Database Crossref
ImageNet: A Large-Scale Hierarchical Image Database
6