Plugins
4 plugins@brycewang-stanford
42 Wanshuiyin ARIS
42 Wanshuiyin ARIS from brycewang-stanford/Auto-Empirical-Research-Skills.
38 skills · plugin
@jiachen-t-wang
Curation Bench
Curation Bench from Jiachen-T-Wang/curation-bench-pro.
99 skills · plugin
curated
Agent Interview and Planning
For developers who want to clarify project requirements through structured interviews and generate actionable plans.
9 skills · plugin
curated
Email Productivity Toolkit
For professionals who want to manage their inbox, draft replies, and send emails with delivery confirmation.
12 skills · plugin
Results for “wan”
409 skillsNocaps Novel Object Captioning At Scale Arxiv 1812 08658v2
Nocaps: Novel Object Captioning at Scale
6
Segment Everything Everywhere All At Once Arxiv 2304 06718v2
Segment Everything Everywhere All at Once
6
Svit Scaling Up Visual Instruction Tuning Arxiv 2307 04087v2
SVIT: Scaling up Visual Instruction Tuning
6
Synthtext Synthetic Data For Text Detection Arxiv 1604 06646
SynthText: Synthetic Data for Text Detection
6
Data Centric Artificial Intelligence A Survey Arxiv 2303 101
Data-Centric Artificial Intelligence: A Survey
6
Multimodal Learning With Transformers A Survey Arxiv 2206 06
Multimodal Learning with Transformers: A Survey
6
Hard Negative Mixing For Contrastive Learning Arxiv 2010 010
Hard Negative Mixing for Contrastive Learning
6
Open Vocabulary Object Detection Using Captions Arxiv 2011 1
Open-Vocabulary Object Detection Using Captions
6
Training Compute Optimal Large Language Models Arxiv 2203 15
Training Compute-Optimal Large Language Models
6
Masked Autoencoders Are Scalable Vision Learners Arxiv 2111
Masked Autoencoders Are Scalable Vision Learners
6
Multimodal Neurons In Artificial Neural Networks Arxiv 2103
Multimodal Neurons in Artificial Neural Networks
6
Improved Baselines With Visual Instruction Tuning Arxiv 2310
Improved Baselines with Visual Instruction Tuning
6
Copy Paste Augmentation For Instance Segmentation Arxiv 2012
Copy-Paste Augmentation for Instance Segmentation
6
Mantis Interleaved Multi Image Instruction Tuning Arxiv 2405
Mantis: Interleaved Multi-Image Instruction Tuning
6
Mosaic Augmentation For Detection And Segmentation Arxiv Yol
Mosaic Augmentation for Detection and Segmentation
6
Autoaugment Learning Augmentation Strategies From Data Arxiv
AutoAugment: Learning Augmentation Strategies from Data
6
Triage Issue
Triage a bug or issue by exploring the codebase to find root cause, then create a GitHub issue with a TDD-based fix plan. Use when user reports a bug, wants to file an issue, mentions "triage", or wants to investigate and plan a fix for a problem.
16
Phi 1 Textbooks Are All You Need Arxiv 2306 11644v2
Phi-1: Textbooks Are All You Need
6
El2n Deep Learning On A Data Diet Arxiv 2107 07075v2
EL2N: Deep Learning on a Data Diet
6
Vqav2 Making The V In Vqa Matter Arxiv 1612 00837v3
VQAv2: Making the V in VQA Matter
6
Deita What Makes Good Data For Alignment Arxiv 2312 15685v2
Deita: What Makes Good Data for Alignment
6
Sigmoid Loss For Language Image Pre Training Arxiv 2303 1534
Sigmoid Loss for Language Image Pre-Training
6
Scaling Vision With Sparse Mixture Of Experts Arxiv 2106 059
Scaling Vision with Sparse Mixture of Experts
6
Openclip An Open Source Implementation Of Clip Arxiv 2212 07
OpenCLIP: An Open Source Implementation of CLIP
6
Coco Microsoft Coco Common Objects In Context Arxiv 1405 031
COCO: Microsoft COCO: Common Objects in Context
6
Capsfusion Rethinking Image Text Data At Scale Arxiv 2310 20
CapsFusion: Rethinking Image-Text Data at Scale
6
Textvqa Towards Reasoning About Text In Images Arxiv 1904 08
TextVQA: Towards Reasoning about Text in Images
6
Cogvlm Visual Expert For Pretrained Language Models Arxiv 23
CogVLM: Visual Expert for Pretrained Language Models
6
Dataperf Benchmarks For Data Centric AI Development Arxiv 22
DataPerf: Benchmarks for Data-Centric AI Development
6
Chameleon Mixed Modal Early Fusion Foundation Models Arxiv 2
Chameleon: Mixed-Modal Early-Fusion Foundation Models
6
Scaling Vision Transformers To 22 Billion Parameters Arxiv 2
Scaling Vision Transformers to 22 Billion Parameters
6
Llava Critic Learning To Evaluate Multimodal Models Arxiv 24
LLaVA-Critic: Learning to Evaluate Multimodal Models
6
Drivelm Driving With Graph Visual Question Answering Arxiv 2
DriveLM: Driving with Graph Visual Question Answering
6
Laclip Improving Clip Training With Language Rewrites Arxiv
LaCLIP: Improving CLIP Training with Language Rewrites
6
Deduplicating Training Data Makes Language Models Better Arx
Deduplicating Training Data Makes Language Models Better
6
Imagenet A Large Scale Hierarchical Image Database Crossref
ImageNet: A Large-Scale Hierarchical Image Database
6