CV
Research Focus
Multimodal generative AI, controllable visual generation, diffusion models, multimodal reasoning, LLM/MLLM post-training, and agentic AI systems.
Education
- Georgetown University, Ph.D. in Computer Science, Computer Vision Group, 2021–May 2027 (expected). Advisor: Sarah A. Bargal.
- Georgetown University, M.S. in Computer Science, 2019–2021.
- Beihang University, B.E. in Computer Science and Technology, 2015–2019.
Industry Research Experience
- Siemens, Data and AI Team, Cloud & Industrial GenAI Intern, May–Aug. 2026.
- Siemens Digital Industries Software, GenX Team, Cloud & Industrial GenAI Intern, May–Aug. 2025.
- ByteDance, Applied Machine Learning Team, Research Scientist Intern, May–Aug. 2023.
Additional Research Experience
- Beihang University, Engineering Research Center, Undergraduate Thesis: Automatic Scoring Method for Essay Review, Sep. 2018–Jun. 2019.
- University of California, Berkeley, Visual Computing Lab, Eyeglasses-free Vision Correcting Display, Jul.–Sep. 2018.
- Beihang University, Institute of Advanced Computing Technology, Real-Time Video Dehazing Based on Spatio-Temporal Markov Random Fields, Jan.–Apr. 2017.
Technical Skills
- Research: Multimodal generative AI, diffusion models, visual storytelling, vision-language and multimodal LLMs, agentic LLMs, reinforcement learning and post-training, text-to-SQL.
- Programming & frameworks: Python, C++; PyTorch, TensorFlow, Hugging Face Transformers, Diffusers; Apache Calcite.
- Languages: Mandarin Chinese (native), English (fluent).
Publications
ViSTA: Visual Storytelling using Multi-modal Adapters for Text-to-Image Diffusion Models
2026Sibo Dong, Ismail Shaheen, Maggie Shen, Rupayan Mallick, and Sarah Adel Bargal
IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) · Oral
[Proceedings] [arXiv]
Sidecar: Training-Free Semantic Reuse for Character-Consistent Free-form Visual Storytelling
2026Sibo Dong and Sarah Adel Bargal
Under review
[arXiv]
FreeStory: Training-Free Character Consistency for Free-Form Visual Storytelling
2026Sibo Dong, Ismail Shaheen, and Sarah Adel Bargal
Under review
[arXiv] [Code] [Project Page]
D-Feat Occlusions: Diffusion Features for Robustness to Partial Visual Occlusions in Object Recognition
2025Rupayan Mallick, Sibo Dong, Nataniel Ruiz, and Sarah Adel Bargal
CVPR Workshop on Uncertainty Quantification for Computer Vision
[Proceedings] [arXiv]
Predicting Missing Response with BERT Model in Process Data
2024Qiwei He and Sibo Dong
International Meeting of the Psychometric Society (IMPS)
SEINE: SEgment-based Indexing for NEural Information Retrieval
2022Sibo Dong, Justin Goldstein, and Grace Hui Yang
SIGIR Workshop on Reaching Efficiency in Neural Information Retrieval (ReNeuIR)
[Proceedings] [arXiv]
Do We Really Need Everything Everywhere All at Once? Query-Specific Fine-Tuning for Transformer-Based Neural Retrievers
2022Sibo Dong and Grace Hui Yang
Text REtrieval Conference (TREC)
GazBy: Gaze-Based BERT Model to Incorporate Human Attention in Neural Information Retrieval
2022Sibo Dong, Justin Goldstein, and Grace Hui Yang
ACM SIGIR International Conference on Theory of Information Retrieval (ICTIR)
[Proceedings] [arXiv]
Professional Service & Honors
- Reviewer: NeurIPS, ICLR, WACV, BMVC, SIGIR, CIKM, ICTIR, TOIS (2020–present).
- Teaching assistant: Science of AI (2026); Deep Learning (2025–2026); Deep Reinforcement Learning (2021–2023), Georgetown University.
- Honors: 2026 Conference Travel Grant; 2024 Outstanding Teaching Assistant.