Publication Archive
Other Publications
Additional papers grouped by year. For selected works, return to the homepage publications section.
Publications by Year
2026
-
Staying VIGILant: Mitigating Visual Laziness via Counterfactual Visual Alignment in MLLMs
-
Layer-Specific Prompt Fusion Discovery via Differentiable Search in Vision Foundation Models
-
FOCUS: Fused Observation of Channels for Unveiling Spectra
-
RoadBench: A Vision-Language Foundation Model and Benchmark for Road Damage Understanding
-
Self-Supervised Visual Prompting for Cross-Domain Road Damage Detection
-
Learning Straight Flows: Variational Flow Matching for Efficient Generation
-
CAD-VAE: Leveraging Correlation-Aware Latents for Comprehensive Fair Disentanglement
-
GeoPriorCLIP: A Foundational Remote Sensing Vision-Language Model Enhanced with Cascaded Geographic Information Priors
-
Drift Flow Matching
-
SpaMem: Benchmarking Dynamic Spatial Reasoning via Perception-Memory Integration in Embodied Environments
-
Detail Consistent Stage-Wise Distillation for Efficient 3D MRI Segmentation
-
fMRI-LM: Towards a Universal Foundation Model for Language-Aligned fMRI Understanding
-
HIERAMP: Coarse-to-Fine Autoregressive Amplification for Generative Dataset Distillation
-
KG-SAM: Injecting Anatomical Knowledge into Segment Anything Models via Conditional Random Fields
-
CTR-LoRA: Curvature-Aware and Trust-Region Guided Low-Rank Adaptation for Large Language Models
-
4D Multimodal Co-Attention Fusion Network with Latent Contrastive Alignment for Alzheimer's Diagnosis
-
Geometric Multi-Instance Learning for Weakly Supervised Gastric Cancer Segmentation
-
Leveraging Latent Visual Reasoning in Silence
-
HyperAdaLoRA: Accelerating LoRA Rank Allocation During Training via Hypernetworks without Sacrificing Performance
-
Less Tokens, Better Forecasts: Sparse Residual Routing for Efficient Weather Prediction
-
Personalize Your Large Vision-Language Models With In-Context Prompt Tuning
-
Do LLMs Build World Models From Text? A Multilingual Diagnostic of Spatial Reasoning
-
Information-Theoretic Graph Fusion with Vision-Language-Action Model for Policy Reasoning and Dual Robotic Control
-
ComfySearch: Autonomous Exploration and Reasoning for ComfyUI Workflows
2025
-
TD-RD: A Top-Down Benchmark with Real-Time Framework for Road Damage Detection
-
Describe Anything in Medical Images
-
Visual Variational Autoencoder Prompt Tuning
-
TASAM: Terrain-and-Aware Segment Anything Model for Temporal-Scale Remote Sensing Segmentation
-
Boosting Active Learning with Knowledge Transfer
-
Stochastic Interpolants via Conditional Dependent Coupling
-
CIBR: Cross-Modal Information Bottleneck Regularization for Robust CLIP Generalization
-
Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions
-
MoRE-Brain: Routed Mixture of Experts for Interpretable and Generalizable Cross-Subject fMRI Visual Decoding
-
Sensitivity-LoRA: Low-Load Sensitivity-Based Fine-Tuning for Large Language Models
-
E2CB2former: Effective and Explainable Transformer for CB2 Receptor Ligand Activity Prediction
-
Tailoring Adversarial Attacks on Deep Neural Networks for Targeted Class Manipulation Using DeepFool Algorithm
-
Dispersing Embeddings in Transformer Layers Improves Generalization of Language Models
-
MGD-YOLO: An Enhanced Road Defect Detection Algorithm Based on Multi-Scale Attention Feature Fusion
-
M²IV: Towards Efficient and Fine-Grained Multimodal In-Context Learning via Representation Engineering
-
Towards Foundation Models for Cryo-ET Subtomogram Analysis
-
ETT-CKGE: Efficient Task-Driven Tokens for Continual Knowledge Graph Embedding
-
CryoCCD: Conditional Cycle-Consistent Diffusion with Biophysical Modeling for Cryo-EM Synthesis
2024
-
HGTDP-DTA: Hybrid Graph-Transformer with Dynamic Prompt for Drug-Target Binding Affinity Prediction
-
Multi-Dimension Transformer with Attention-Based Filtering for Medical Image Segmentation
-
Cycle-YOLO: An Efficient and Robust Framework for Pavement Damage Detection
-
TWIG: Two-Step Image Generation Using Segmentation Masks as an Intermediary in Diffusion Models to Prevent Copyright Infringement
2022
-
An Image Data Augmentation Algorithm Based on YOLOv5s-DA for Pavement Distress Detection