About Me
I am a Ph.D. student in Computer Science at Georgetown University, advised by Professor Sarah A. Bargal. My research focuses on multimodal generative AI, controllable and character-consistent visual generation, diffusion models, multimodal reasoning, LLM/MLLM post-training, and agentic AI systems.
Education
Ph.D. in Computer Science
Computer Vision Group
Advisor: Sarah A. Bargal
M.S. in Computer Science
B.E. in Computer Science and Technology
Publications
ViSTA: Visual Storytelling using Multi-modal Adapters for Text-to-Image Diffusion Models
2026IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) · Oral
Sidecar: Training-Free Semantic Reuse for Character-Consistent Free-form Visual Storytelling
2026Under review
FreeStory: Training-Free Character Consistency for Free-Form Visual Storytelling
2026Under review
D-Feat Occlusions: Diffusion Features for Robustness to Partial Visual Occlusions in Object Recognition
2025CVPR Workshop on Uncertainty Quantification for Computer Vision
Predicting Missing Response with BERT Model in Process Data
2024International Meeting of the Psychometric Society (IMPS)
SEINE: SEgment-based Indexing for NEural Information Retrieval
2022SIGIR Workshop on Reaching Efficiency in Neural Information Retrieval (ReNeuIR)
Do We Really Need Everything Everywhere All at Once? Query-Specific Fine-Tuning for Transformer-Based Neural Retrievers
2022Text REtrieval Conference (TREC)
GazBy: Gaze-Based BERT Model to Incorporate Human Attention in Neural Information Retrieval
2022ACM SIGIR International Conference on Theory of Information Retrieval (ICTIR)
Industry Research Experience
Data and AI Team
Cloud & Industrial GenAI Intern
GenX Team
Cloud & Industrial GenAI Intern
Applied Machine Learning Team
Research Scientist Intern
Additional Research Experience
Engineering Research Center
Undergraduate Thesis: Automatic Scoring Method for Essay Review
Visual Computing Lab
Eyeglasses-free Vision Correcting Display
Institute of Advanced Computing Technology
Real-Time Video Dehazing Based on Spatio-Temporal Markov Random Fields
Technical Skills
Research: Multimodal generative AI, diffusion models, visual storytelling, vision-language and multimodal LLMs, agentic LLMs, reinforcement learning and post-training, text-to-SQL.
Programming & frameworks: Python, C++; PyTorch, TensorFlow, Hugging Face Transformers, Diffusers; Apache Calcite.
Languages: Mandarin Chinese (native), English (fluent).
Professional Service & Honors
Reviewer: NeurIPS, ICLR, WACV, BMVC, SIGIR, CIKM, ICTIR, TOIS (2020–present).
Teaching assistant: Science of AI (2026); Deep Learning (2025–2026); Deep Reinforcement Learning (2021–2023), Georgetown University.
Honors: 2026 Conference Travel Grant; 2024 Outstanding Teaching Assistant.
