AI & ML interests

Multimodal AI, Vision-Language Models, Document Intelligence, OCR, Handwriting Recognition, Compact VLMs, Multimodal Post-Training, SFT, GRPO

Recent Activity

Dizzar  updated a dataset 9 days ago
multimodal-vision-ai/mvai-doctag-r3-v1
gptan75  updated a Space 15 days ago
multimodal-vision-ai/README
gptan75  published a Space 15 days ago
multimodal-vision-ai/README
View all activity

Organization Card

Multimodal Vision AI Lab

Hohai University

The Multimodal Vision AI Lab focuses on research in multimodal artificial intelligence, vision-language models, document intelligence, OCR, handwriting recognition, compact multimodal models, and multimodal post-training.

Research Areas

  • Multimodal Vision-Language Models
  • Document Intelligence
  • OCR and Handwriting Recognition
  • Compact Vision-Language Models
  • Multimodal Post-Training
  • Supervised Fine-Tuning (SFT)
  • Reinforcement Learning and GRPO
  • Multimodal Benchmarking and Evaluation

Open Research

We develop open datasets, models, benchmarks, evaluation tools, and educational resources for multimodal vision and document intelligence research.

Projects

Projects, datasets, models, and benchmarks will be released progressively through this organization.

Links

  • Hohai University
  • GitHub: multimodal-vision-ai

models 0

None public yet