Overview
InSight-o3 addresses VLM weakness with dense, complex visuals requiring both advanced reasoning and precise visual perception.
Core Technique
Generalized Visual Search:
class VisualSearcher:
def search_conceptual_regions(self, image, query):
"""Find relational/fuzzy/conceptual regions from free-form language."""
# e.g., "regions where trend changes" not just object names
regions = model.predict_regions(image, query)
return regions
RL-Trained vSearcher: Hybrid RL with in-loop feedback (vReasoner) and IoU supervision.
Performance
- GPT-5-mini: 39.0% → 61.5% on O3-Bench
- Plug-and-play enhancement
References
- Generalized visual search capability
- O3-Bench benchmark for dense visuals