Latest Agent Skills

25788 skills

jiachen-t-wang
Lora Low Rank Adaptation Of Large Language Models Arxiv 2106
LoRA: Low-Rank Adaptation of Large Language Models
6
jiachen-t-wang
Improved Baselines With Visual Instruction Tuning Arxiv 2310
Improved Baselines with Visual Instruction Tuning
6
jiachen-t-wang
Textvqa Towards Reasoning About Text In Images Arxiv 1904 08
TextVQA: Towards Reasoning about Text in Images
6
jiachen-t-wang
Cogagent A Visual Language Model For Gui Agents Arxiv 2312 0
CogAgent: A Visual Language Model for GUI Agents
6
jiachen-t-wang
Multimodal Neurons In Artificial Neural Networks Arxiv 2103
Multimodal Neurons in Artificial Neural Networks
6
jiachen-t-wang
Masked Autoencoders Are Scalable Vision Learners Arxiv 2111
Masked Autoencoders Are Scalable Vision Learners
6
jiachen-t-wang
Dolphins Multimodal Language Model For Driving Arxiv 2312 00
Dolphins: Multimodal Language Model for Driving
6
jiachen-t-wang
Capsfusion Rethinking Image Text Data At Scale Arxiv 2310 20
CapsFusion: Rethinking Image-Text Data at Scale
6
jiachen-t-wang
Training Compute Optimal Large Language Models Arxiv 2203 15
Training Compute-Optimal Large Language Models
6
jiachen-t-wang
Vila On Pre Training For Visual Language Models Arxiv 2312 0
VILA: On Pre-training for Visual Language Models
6
jiachen-t-wang
Open Vocabulary Object Detection Using Captions Arxiv 2011 1
Open-Vocabulary Object Detection Using Captions
6
jiachen-t-wang
Coco Microsoft Coco Common Objects In Context Arxiv 1405 031
COCO: Microsoft COCO: Common Objects in Context
6
jiachen-t-wang
Hard Negative Mixing For Contrastive Learning Arxiv 2010 010
Hard Negative Mixing for Contrastive Learning
6
jiachen-t-wang
Openclip An Open Source Implementation Of Clip Arxiv 2212 07
OpenCLIP: An Open Source Implementation of CLIP
6
jiachen-t-wang
Multimodal Learning With Transformers A Survey Arxiv 2206 06
Multimodal Learning with Transformers: A Survey
6
jiachen-t-wang
Webvid 10m A Large Scale Video Text Dataset Arxiv 2104 00650
WebVid-10M: A Large-Scale Video-Text Dataset
6
jiachen-t-wang
Sa 1b Segment Anything 1 Billion Masks Dataset Arxiv Sa1b 20
SA-1B: Segment Anything 1 Billion Masks Dataset
6
jiachen-t-wang
Emu Generative Pretraining In Multimodality Arxiv 2307 05222
Emu: Generative Pretraining in Multimodality
6
jiachen-t-wang
Docvqa A Dataset For Vqa On Document Images Arxiv 2007 00398
DocVQA: A Dataset for VQA on Document Images
6
jiachen-t-wang
Glamm Pixel Grounding Large Multimodal Model Arxiv 2311 0335
GLaMM: Pixel Grounding Large Multimodal Model
6
jiachen-t-wang
Scaling Vision With Sparse Mixture Of Experts Arxiv 2106 059
Scaling Vision with Sparse Mixture of Experts
6
jiachen-t-wang
Scaling Instruction Finetuned Language Models Arxiv 2210 114
Scaling Instruction-Finetuned Language Models
6
jiachen-t-wang
Data Centric Artificial Intelligence A Survey Arxiv 2303 101
Data-Centric Artificial Intelligence: A Survey
6
jiachen-t-wang
Coyo 700m Image Text Pair Dataset Github Kakaobrain Coyo 700
COYO-700M: Image-Text Pair Dataset
6
jiachen-t-wang
Synthtext Synthetic Data For Text Detection Arxiv 1604 06646
SynthText: Synthetic Data for Text Detection
6
jiachen-t-wang
Sigmoid Loss For Language Image Pre Training Arxiv 2303 1534
Sigmoid Loss for Language Image Pre-Training
6
jiachen-t-wang
Minicpm V A Gpt 4v Level Mllm On Your Phone Arxiv 2408 01800
MiniCPM-V: A GPT-4V Level MLLM on Your Phone
6
jiachen-t-wang
Grit General Robust Image Task Benchmark Arxiv 2306 14818v2
Grit: General Robust Image Task Benchmark
6
jiachen-t-wang
Svit Scaling Up Visual Instruction Tuning Arxiv 2307 04087v2
SVIT: Scaling up Visual Instruction Tuning
6
jiachen-t-wang
Segment Everything Everywhere All At Once Arxiv 2304 06718v2
Segment Everything Everywhere All at Once
6
jiachen-t-wang
Dall E Zero Shot Text To Image Generation Arxiv 2102 12092v2
DALL-E: Zero-Shot Text-to-Image Generation
6
jiachen-t-wang
Idefics2 An 8b Parameters Multimodal Model Arxiv 2405 02246v
Idefics2: An 8B Parameters Multimodal Model
6
jiachen-t-wang
Nocaps Novel Object Captioning At Scale Arxiv 1812 08658v2
Nocaps: Novel Object Captioning at Scale
6
jiachen-t-wang
Towards Open World Segmentation Of Parts Arxiv 2305 06914v3
Towards Open-World Segmentation of Parts
6
jiachen-t-wang
Mixup Beyond Empirical Risk Minimization Arxiv 1710 09412v2
Mixup: Beyond Empirical Risk Minimization
6
jiachen-t-wang
Trak Attributing Model Behavior At Scale Arxiv 2303 14186v2
TRAK: Attributing Model Behavior at Scale
6
jiachen-t-wang
Scaling Data Constrained Language Models Arxiv 2305 16264v3
Scaling Data-Constrained Language Models
6
jiachen-t-wang
Deita What Makes Good Data For Alignment Arxiv 2312 15685v2
Deita: What Makes Good Data for Alignment
6
jiachen-t-wang
Llava Onevision Easy Visual Task Transfer Arxiv 2408 03326v2
LLaVA-OneVision: Easy Visual Task Transfer
6
jiachen-t-wang
Glip Grounded Language Image Pre Training Arxiv 2112 03857v2
GLIP: Grounded Language-Image Pre-training
6
jiachen-t-wang
Scaling Laws For Neural Language Models Arxiv 2001 08361v1
Scaling Laws for Neural Language Models
6
jiachen-t-wang
Pixtral 12b A Frontier Multimodal Model Arxiv Pixtral 2024
Pixtral 12B: A Frontier Multimodal Model
6
jiachen-t-wang
Imagenet 21k Pretraining For The Masses Arxiv 2104 10972v4
ImageNet-21K Pretraining for the Masses
6
jiachen-t-wang
Dinov2 For Dense Prediction Tasks Arxiv Dinov2 Dense 2024
DINOv2 for Dense Prediction Tasks
6
jiachen-t-wang
Asr Whisper For Video Transcription Arxiv 2212 04356v1
ASR: Whisper for Video Transcription
6
jiachen-t-wang
Phi 15 Textbooks Are All You Need Ii Arxiv 2309 05463v2
Phi-1.5: Textbooks Are All You Need II
6
jiachen-t-wang
Influence Functions In Deep Learning Arxiv 2002 08484v3
Influence Functions in Deep Learning
6
jiachen-t-wang
Snli Ve Visual Entailment Dataset Arxiv 1901 06706v1
SNLI-VE: Visual Entailment Dataset
6
jiachen-t-wang
Vqav2 Making The V In Vqa Matter Arxiv 1612 00837v3
VQAv2: Making the V in VQA Matter
6
jiachen-t-wang
El2n Deep Learning On A Data Diet Arxiv 2107 07075v2
EL2N: Deep Learning on a Data Diet
6
jiachen-t-wang
Matryoshka Representation Learning Arxiv 2205 13147v4
Matryoshka Representation Learning
6
jiachen-t-wang
Llama 3 The Llama 3 Herd Of Models Arxiv 2407 21783v2
Llama 3: The Llama 3 Herd of Models
6
jiachen-t-wang
Phi 1 Textbooks Are All You Need Arxiv 2306 11644v2
Phi-1: Textbooks Are All You Need
6
jiachen-t-wang
Nemotron 4 340b Technical Report Arxiv 2406 11704v1
Nemotron-4 340B Technical Report
6
jiachen-t-wang
Dclm Datacomp For Language Models Arxiv 2406 11794v3
DCLM: DataComp for Language Models
6
jiachen-t-wang
Curriculum Learning Crossref Icml 2009 Curriculum
Curriculum Learning
6
jiachen-t-wang
Lima Less Is More For Alignment Arxiv 2305 11206v1
LIMA: Less Is More for Alignment
6
jiachen-t-wang
Instruction Tuning With Gpt 4 Arxiv 2304 03277v1
Instruction Tuning with GPT-4
6
jiachen-t-wang
Pali 3 Smaller Faster Stronger Arxiv 2310 09199v2
PaLI-3: Smaller, Faster, Stronger
6
jiachen-t-wang
Sbu Captions Dataset Crossref Nips 2011 Sbu
SBU Captions Dataset
6