Results for “image-modeling”

22 skills
More results
github
Image Manipulation Image Magick
Process and manipulate images using ImageMagick: resize, convert formats, batch process, and retrieve metadata.
36.2k
jiachen-t-wang
Chameleon Mixed Modal Early Fusion Foundation Models Arxiv 2
Chameleon: Mixed-Modal Early-Fusion Foundation Models
6
jiachen-t-wang
Mantis Interleaved Multi Image Instruction Tuning Arxiv 2405
Mantis: Interleaved Multi-Image Instruction Tuning
6
jiachen-t-wang
Imagenet A Large Scale Hierarchical Image Database Crossref
ImageNet: A Large-Scale Hierarchical Image Database
6
rootcastleco
Imagen
|
6
jiachen-t-wang
Emu2 Generative Multimodal Models Are In Context Learners Ar
Emu2: Generative Multimodal Models are In-Context Learners
6
neuralblitz
Advanced Optics Modeling
Advanced Optics Modeling Skill
1 · bundle
k-dense-ai
Generate Image
Generate and edit high-quality images using OpenRouter's AI models including FLUX.2 Pro and Gemini 3.1 Flash Image Preview.
30.2k · bundle
orchestra-research
Blip 2 Vision Language
Generate image captions, answer visual questions, and perform image-text retrieval using BLIP-2's Q-Former architecture with frozen vision encoders and LLMs.
10.4k · bundle
jiachen-t-wang
Capsfusion Rethinking Image Text Data At Scale Arxiv 2310 20
CapsFusion: Rethinking Image-Text Data at Scale
6
jiachen-t-wang
Nocaps Novel Object Captioning At Scale Arxiv 1812 08658v2
Nocaps: Novel Object Captioning at Scale
6
jiachen-t-wang
Masked Autoencoders Are Scalable Vision Learners Arxiv 2111
Masked Autoencoders Are Scalable Vision Learners
6
jiachen-t-wang
Nlvr2 A Visual Reasoning Benchmark For Natural Language Arxi
NLVR2: A Visual Reasoning Benchmark for Natural Language
6
jiachen-t-wang
Coco Microsoft Coco Common Objects In Context Arxiv 1405 031
COCO: Microsoft COCO: Common Objects in Context
6
tianhao909
Blip 2 Vision Language
Vision-language pre-training framework bridging frozen image encoders and LLMs. Use when you need image captioning, visual question answering, image-text retrieval, or multimodal chat with state-of-the-art zero-shot performance.
1 · bundle
neuralblitz
Applied Optics Modeling
Applied Optics Modeling Skill
1 · bundle
iterationlayer
Watermark An Image
Apply a text watermark to a photo using layer-based image composition for brand protection and copyright.
2
iterationlayer
Convert Image Format
Convert an image between PNG, JPEG, and WebP formats with quality control for web optimization.
2
jiachen-t-wang
Copy Paste Augmentation For Instance Segmentation Arxiv 2012
Copy-Paste Augmentation for Instance Segmentation
6
q2805187159
Image Generation
Use this skill when the user requests to generate, create, imagine, or visualize images including characters, scenes, products, or any visual content. Supports structured prompts and reference images for guided generation.
3 · bundle
jiachen-t-wang
Glip Grounded Language Image Pre Training Arxiv 2112 03857v2
GLIP: Grounded Language-Image Pre-training
6