Academic profile / Publication archive

Publications

The complete publication record, arranged chronologically and searchable by title, author, venue, year, or research keyword.

Google Scholar ↗
Unique publications
Publication years
Years represented
Archive sections

Full record

Loading publications…

Patents

System and Method for Video Instance Segmentation via Multi-Scale Spatio-Temporal Transformers
Omkar Thawakar, Sanath Narayan, Hisham Cholakkal, Rao Muhammad Anwer, Muhammad Haris, Salman Khan, Fahad Khan
US Patent App. 17/983,841 GRANTED
System and method for video instance segmentation via recurrent encoder-based transformers
Omkar Thawakar, Alexandre Rivkind, Ehud Ahissar, Fahad Khan
US Patent App. 18/435,537 GRANTED

Conferences & Journals

Paying More Attention to Visual Tokens in Self-Evolving Large Multimodal Models
Shravan Venkatraman, Ritesh Thawkar, Omkar Thawakar, Rao Muhammad Anwer, Hisham Cholakkal, Salman Khan, Fahad Shahbaz Khan
ECCV 2026 arXiv GitHub
EvoLMM: Self-Evolving Large Multimodal Models with Continuous Rewards
Omkar Thawakar, Shravan Venkatraman, Ritesh Thawkar, Abdelrahman M. Shaker, Hisham Cholakkal, Rao Muhammad Anwer, Salman H. Khan, Fahad Shahbaz Khan
CVPR 2026 (findings) arXiv GitHub
20+ Citations 2.5k+ Model Downloads
CoVR-R: Reason-Aware Composed Video Retrieval
Omkar Thawakar, Dmitry Demidov, Vaishnav Potlapalli, Bogireddy Sai Prasanna Teja, Viswanatha Reddy Gajjala, Alaa Mostafa Lasheen, Rao Muhammad Anwer, Fahad Shahbaz Khan
CVPR 2026 (findings) arXiv GitHub
6+ Citations 3.1K+ Dataset Downloads
LLM Post-Training: A Deep Dive into Reasoning Large Language Models
Komal Kumar, Tajamul Ashraf, Omkar Thawakar, Rao Muhammad Anwer, Hisham Cholakkal, Mubarak Shah, Ming-Hsuan Yang, Phillip H. S. Torr, Salman H. Khan, Fahad Shahbaz Khan
2.2K+ GitHub Stars 100+ Citations
Thinking Beyond Labels: Vocabulary-Free Fine-Grained Recognition using Reasoning-Augmented LMMs
Dmitry Demidov, Zaigham Zaheer, Zongyan Han, Omkar Thawakar, Rao Muhammad Anwer
CVPR 2026 (Main) arXiv GitHub
DuwatBench: Bridging Language and Visual Heritage through an Arabic Calligraphy Benchmark for Multimodal Understanding
Shubham Patle, Sara Ghaboura, Hania Tariq, Mohammad Usman Khan, Omkar Thawakar, Rao Muhammad Anwer, Salman H. Khan
EACL 2026 (Main) arXiv GitHub
500+ Dataset Downloads
Beyond Simple Edits: Composed Video Retrieval with Dense Modifications
Omkar Thawakar, Dmitry Demidov, Ritesh Thawkar, Rao Muhammad Anwer, Mubarak Shah, Fahad Shahbaz Khan, Salman Khan
ICCV 2025 arXiv GitHub
7.1K+ Dataset Downloads 522 Model Downloads 2 Citations
LlamaV-o1: Rethinking Step-by-Step Visual Reasoning in LLMs
Omkar Thawakar, Dinura Dissanayake, Ketan Pravin More, Ritesh Thawkar, Ahmed Heakl, Noor Ahsan, Yuhao Li, Mohammed Zumri, Jean Lahoud, Rao Muhammad Anwer, Hisham Cholakkal, Ivan Laptev, Mubarak Shah, Fahad Shahbaz Khan, Salman H. Khan
300+ GitHub Stars 130+ Citations 7.3K+ Dataset Downloads 31K+ Model Downloads
TimeTravel: A Benchmark for Historical & Cultural Artifact Understanding
Sara Ghaboura, Ketan Pravin More, Ritesh Thawkar, Wafa Al Ghallabi, Omkar Thawakar, Fahad Shahbaz Khan, Hisham Cholakkal, Salman H. Khan, Rao Muhammad Anwer
10+ Citations 3.1K+ Dataset Downloads
MobiLLaMA: Towards Accurate & Lightweight Fully Transparent GPT
Omkar Thawakar, Ashmal Vayani, Salman H. Khan, Hisham Cholakkal, Rao Muhammad Anwer, Michael Felsberg, Tim Baldwin, Eric P. Xing, Fahad Shahbaz Khan
ICLR 2025 (Spotlight, Top-2%) arXiv GitHub
600+ GitHub Stars 50+ Citations 320K+ Model Downloads
All Languages Matter: Evaluating LMMs on 100 Culturally Diverse Languages
A Vayani, D Dissanayake, H Watawana, N Ahsan, N Sasikumar, Omkar Thawakar ...
CVPR 2025 (Highlight) arXiv GitHub
40+ Citations 9.8K+ Dataset Downloads
Composed Video Retrieval via Enriched Context and Discriminative Embeddings
Omkar Thawakar, Muzammal Naseer, Rao Muhammad Anwer, Salman H. Khan, Michael Felsberg, Mubarak Shah, Fahad Shahbaz Khan
CVPR 2024 arXiv GitHub
25+ Citations
CAMEL-Bench: A Comprehensive Arabic LMM Benchmark
Sara Ghaboura, Ahmed Heakl, Omkar Thawakar, Ali Husain Salem Abdulla Alharthi, Ines Riahi, Abduljalil Radman, Jorma Laaksonen, Fahad Shahbaz Khan, Salman Khan, Rao Muhammad Anwer
NAACL 2025 arXiv GitHub
15+ Citations 7.7K+ Dataset Downloads
Fann or Flop: A Benchmark for Arabic Poetry Understanding
Wafa Al Ghallabi, Ritesh Thawkar, Sara Ghaboura, Ketan Pravin More, Omkar Thawakar, Hisham Cholakkal, Salman Khan, Rao Muhammad Anwer
EMNLP 2025 (Main Track) arXiv GitHub
8+ Citations 3.2K+ Dataset Downloads
XrayGPT: Chest Radiograph Summarization using Medical VLMs
Omkar Thawakar, Abdelrahman M. Shaker, Sahal Shaji Mullappilly, Hisham Cholakkal, Rao Muhammad Anwer, Salman H. Khan, Jorma Laaksonen, Fahad Shahbaz Khan
ACL-Workshop 2024 arXiv GitHub
500+ GitHub Stars 300+ Citations 352K+ Model Downloads
3D Mitochondria Instance Segmentation with Spatio-Temporal Transformers
Omkar Thawakar, Rao Muhammad Anwer, Jorma Laaksonen, Orly Reiner, Mubarak Shah, Fahad Shahbaz Khan
MICCAI 2023 arXiv GitHub
Fast Video Instance Segmentation via Recurrent Encoder Transformers
Omkar Thawakar, Alexandre Rivkind, Ehud Ahissar, Fahad Shahbaz Khan
CAIP 2023 arXiv GitHub
Video Instance Segmentation via Multi-Scale Spatio-Temporal Attention
Omkar Thawakar, Sanath Narayan, Jiale Cao, Hisham Cholakkal, Rao Muhammad Anwer, Muhammad Haris Khan, Salman Khan, Michael Felsberg, Fahad Shahbaz Khan
ECCV 2022 arXiv GitHub
20+ Citations
Video Instance Segmentation in an Open-World
Omkar Thawakar, Sanath Narayan, Hisham Cholakkal, Rao Muhammad Anwer, Salman H. Khan, Jorma Laaksonen, Mubarak Shah, Fahad Shahbaz Khan
International Journal of Computer Vision (IJCV), 2024 arXiv GitHub
8 Citations
Image and video super resolution using recurrent generative adversarial network
Omkar Thawakar, Prashant W. Patil, Akshay Dudhane, Subrahmanyam Murala, Uday Kulkarni
IEEE international conference on advanced video and signal based surveillance (AVSS), 2019 arXiv GitHub
25+ Citations
Motion saliency based generative adversarial network for underwater moving object segmentation
Prashant W. Patil, Omkar Thawakar, Akshay Dudhane, Subrahmanyam Murala
IEEE international conference on image processing (ICIP), 2019 arXiv GitHub
35+ Citations

Under Review / Preprints

Mobile-O: Unified Multimodal Understanding & Generation on Mobile
Abdelrahman M. Shaker, Ahmed Heakl, Jaseel Muhammad Kaithakkodan, Ritesh Thawkar, Omkar Thawakar, Senmao Li, Hisham Cholakkal, Ian Reid, Eric P. Xing, Salman H. Khan, Fahad Shahbaz Khan
Ain: The arabic inclusive large multimodal model
Ahmed Heakl, Sara Ghaboura, Omkar Thawakar, Fahad Shahbaz Khan, Hisham Cholakkal, Rao Muhammad Anwer, Salman H. Khan
Preprint 2025 arXiv GitHub
50+ GitHub Stars 8+ Citations 192K+ Model Downloads
Dynamic pre-training: Towards efficient and scalable all-in-one image restoration
Akshay Dudhane, Omkar Thawakar, Syed Waqas Zamir, Salman H. Khan, Fahad Shahbaz Khan, Ming-Hsuan Yang
Preprint 2024 arXiv GitHub
70+ GitHub Stars 22+ Citations