2026-07 Multimodal 分类最佳 AI 开源项目
We write your reusable computer vision tools. 💜
Diffusion model(SD,Flux,Wan,Qwen Image,Z-Image,...) inference in pure C/C++
Open Source Computer Vision Library
A scalable generative AI framework built for researchers and developers working on Large Language Models, Multimodal, and Speech AI (Automatic Speech Recognition and Text-to-Speech)
allenai/olmocr(项目数据尚未同步)
Open-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.
Visualize, query, and stream to train on multimodal robotics data.
π RuView turns commodity WiFi signals into real-time spatial intelligence, vital sign monitoring, and presence detection — all without a single pixel of video.
Cross-platform, customizable ML solutions for live and streaming media.
COLMAP - Structure-from-Motion and Multi-View Stereo