# Auto-generated: ICCV2025 paper notes ignore
# 由 src/sync_notes.py 根据 TODO.md 自动生成

# 默认忽略所有笔记
*.md
**/*.md

# 保留元数据文件
!TODO.md
!INDEX.md
!index.md

# 排除已完成笔记所在的子目录
!3d_vision/
!ai_safety/
!audio_speech/
!autonomous_driving/
!causal_inference/
!code_intelligence/
!computational_biology/
!graph_learning/
!hallucination/
!human_understanding/
!image_generation/
!image_restoration/
!information_retrieval/
!interpretability/
!llm_agent/
!llm_alignment/
!llm_efficiency/
!llm_evaluation/
!llm_nlp/
!llm_pretraining/
!llm_reasoning/
!llm_safety/
!medical_imaging/
!model_compression/
!multilingual_mt/
!multimodal_vlm/
!nlp_generation/
!nlp_understanding/
!object_detection/
!optimization/
!others/
!physics/
!reinforcement_learning/
!remote_sensing/
!robotics/
!segmentation/
!self_supervised/
!signal_comm/
!social_computing/
!time_series/
!video_generation/
!video_understanding/
!vlm_efficiency/
!vlm_reasoning/

# 已完成笔记 (1315 篇)
!3d_vision/2d_gaussian_splattingbased_sparseview_transparent_object_dep.md
!3d_vision/3d_gaussian_map_with_openset_semantic_grouping_for_visionlan.md
!3d_vision/3d_mesh_editing_using_masked_lrms.md
!3d_vision/3d_testtime_adaptation_via_graph_spectral_driven_point_shift.md
!3d_vision/3dgraphllm_combining_semantic_graphs_and_large_language_models_for_3d_scene_unde.md
!3d_vision/3dgs_lm_faster_gaussian_splatting_optimization_with_levenberg_marquardt.md
!3d_vision/3dgslm_faster_gaussiansplatting_optimization_with_levenbergm.md
!3d_vision/4d_gaussian_splatting_slam.md
!3d_vision/4d_visual_pretraining_for_robot_learning.md
!3d_vision/7dgs_unified_spatial-temporal-angular_gaussian_splatting.md
!3d_vision/a3gs_arbitrary_artistic_style_into_arbitrary_3d_gaussian_spl.md
!3d_vision/a_lesson_in_splats_teacher-guided_diffusion_for_3d_gaussian_splats_generation_wi.md
!3d_vision/a_recipe_for_generating_3d_worlds_from_a_single_image.md
!3d_vision/a_simple_yet_mighty_hartley_diffusion_versatilist_for_genera.md
!3d_vision/a_unified_interpretation_of_training-time_out-of-distribution_detection.md
!3d_vision/aaa-gaussians_anti-aliased_and_artifact-free_3d_gaussian_rendering.md
!3d_vision/aaa_gaussians_anti_aliased_artifact_free_3d_gaussian_rendering.md
!3d_vision/accelerate_3d_object_detection_models_via_zero-shot_attention_key_pruning.md
!3d_vision/adahuman_animatable_detailed_3d_human_generation_with_compositional_multiview_di.md
!3d_vision/advancing_text-to-3d_generation_with_linearized_lookahead_variational_score_dist.md
!3d_vision/adversarial_exploitation_of_data_diversity_improves_visual_localization.md
!3d_vision/ajahr_amputated_joint_aware_3d_human_mesh_recovery.md
!3d_vision/amodal3r_amodal_3d_reconstruction_from_occluded_2d_images.md
!3d_vision/amodal_depth_anything_amodal_depth_estimation_in_the_wild.md
!3d_vision/animateanymesh_a_feedforward_4d_foundation_model_for_textdri.md
!3d_vision/anyi2v_animating_any_conditional_image_with_motion_control.md
!3d_vision/ar1to3_single_image_to_consistent_3d_object_via_nextview_pre.md
!3d_vision/articulate3d_holistic_understanding_of_3d_scenes_as_universal_scene_description.md
!3d_vision/atlas_decoupling_skeletal_and_shape_parameters_for_expressive_parametric_human_m.md
!3d_vision/auto-regressively_generating_multi-view_consistent_images.md
!3d_vision/autoocc_automatic_openended_semantic_occupancy_annotation_vi.md
!3d_vision/back_on_track_bundle_adjustment_for_dynamic_scene_reconstruction.md
!3d_vision/baking_gaussian_splatting_into_diffusion_denoiser_for_fast_and_scalable_single-s.md
!3d_vision/banet_bilateral_aggregation_network_for_mobile_stereo_matching.md
!3d_vision/benchmarking_and_learning_multi-dimensional_quality_evaluator_for_text-to-3d_gen.md
!3d_vision/benchmarking_egocentric_visualinertial_slam_at_city_scale.md
!3d_vision/beziergs_dynamic_urban_scene_reconstruction_with_bezier_curve_gaussian_splatting.md
!3d_vision/billboard_splatting_bbsplat_learnable_textured_primitives_fo.md
!3d_vision/blended_point_cloud_diffusion_for_localized_textguided_shape.md
!3d_vision/bokehdiff_neural_lens_blur_with_one-step_diffusion.md
!3d_vision/bolt3d_generating_3d_scenes_in_seconds.md
!3d_vision/boost_3d_reconstruction_using_diffusion-based_monocular_camera_calibration.md
!3d_vision/boosting_multiview_indoor_3d_object_detection_via_adaptive_3.md
!3d_vision/bootstrap3d_improving_multi-view_diffusion_model_with_synthetic_data.md
!3d_vision/boxdreamer_dreaming_box_corners_for_generalizable_object_pose_estimation.md
!3d_vision/bridging_3d_anomaly_localization_and_repair_via_high-qualit.md
!3d_vision/bridging_diffusion_models_and_3d_representations_a_3d_consistent_super-resolutio.md
!3d_vision/bring_your_rear_cameras_for_egocentric_3d_human_pose_estimation.md
!3d_vision/bufferx_towards_zeroshot_point_cloud_registration_in_diverse.md
!3d_vision/ca-i2p_channel-adaptive_registration_network_with_global_optimal_selection.md
!3d_vision/can3tok_canonical_3d_tokenization_and_latent_modeling_of_scene-level_3d_gaussian.md
!3d_vision/casp_improving_semi-dense_feature_matching_pipeline_leveraging_cascaded_correspo.md
!3d_vision/catsplat_contextaware_transformer_with_spatial_guidance_for.md
!3d_vision/cf3_compact_and_fast_3d_feature_fields.md
!3d_vision/charm3r_towards_unseen_camera_height_robust_monocular_3d_detector.md
!3d_vision/cl-splats_continual_learning_of_gaussian_splatting_with_local_optimization.md
!3d_vision/clip-gs_unifying_vision-language_representation_with_3d_gaussian_splatting.md
!3d_vision/cmt_a_cascade_mar_with_topology_predictor_for_multimodal_conditional_cad_generat.md
!3d_vision/comogaussian_continuous_motionaware_gaussian_splatting_from.md
!3d_vision/compression_of_3d_gaussian_splatting_with_optimized_feature_planes_and_standard_.md
!3d_vision/constraint-aware_feature_learning_for_parametric_point_cloud.md
!3d_vision/contact-aware_amodal_completion_for_human-object_interaction_via_multi-regional_.md
!3d_vision/curve-aware_gaussian_splatting_for_3d_parametric_curve_reconstruction.md
!3d_vision/cuts3d_cutting_semantics_in_3d_for_2d_unsupervised_instance_segmentation.md
!3d_vision/dap-mae_domain-adaptive_point_cloud_masked_autoencoder_for_effective_cross-domai.md
!3d_vision/david_data-efficient_and_accurate_vision_models_from_synthetic_data.md
!3d_vision/deepmesh_auto-regressive_artist-mesh_creation_with_reinforcement_learning.md
!3d_vision/degauss_dynamic-static_decomposition_with_gaussian_splatting_for_distractor-free.md
!3d_vision/demeter_a_parametric_model_of_crop_plant_morphology_from_the_real_world.md
!3d_vision/depth_anyevent_a_cross-modal_distillation_paradigm_for_event-based_monocular_dep.md
!3d_vision/describe_adapt_and_combine_empowering_clip_encoders_for_open-set_3d_object_retri.md
!3d_vision/diorama_unleashing_zeroshot_singleview_3d_indoor_scene_model.md
!3d_vision/discretized_gaussian_representation_for_tomographic_reconstruction.md
!3d_vision/disentangling_instance_and_scene_contexts_for_3d_semantic_scene_completion.md
!3d_vision/diving_into_the_fusion_of_monocular_priors_for_generalized_stereo_matching.md
!3d_vision/dmesh_an_efficient_differentiable_mesh_for_complex_shapes.md
!3d_vision/do_it_yourself_learning_semantic_correspondence_from_pseudo-labels.md
!3d_vision/driving_view_synthesis_on_free-form_trajectories_with_generative_prior.md
!3d_vision/dso_aligning_3d_generators_with_simulation_feedback_for_physical_soundness.md
!3d_vision/dynamic_point_maps_a_versatile_representation_for_dynamic_3d_reconstruction.md
!3d_vision/easi3r_estimating_disentangled_motion_from_dust3r_without_training.md
!3d_vision/easy3d_a_simple_yet_effective_method_for_3d_interactive_segmentation.md
!3d_vision/efficient_spiking_point_mamba_for_point_cloud_analysis.md
!3d_vision/egocentric_action-aware_inertial_localization_in_point_clouds_with_vision-langua.md
!3d_vision/egom2p_egocentric_multimodal_multitask_pretraining.md
!3d_vision/embodiedsplat_personalized_real-to-sim-to-real_navigation_with_gaussian_splats_f.md
!3d_vision/estimating_2d_camera_motion_with_hybrid_motion_basis.md
!3d_vision/etch_generalizing_body_fitting_to_clothed_humans_via_equivariant_tightness.md
!3d_vision/evagaussians_event_stream_assisted_gaussian_splatting_from_blurry_images.md
!3d_vision/event-based_tiny_object_detection_a_benchmark_dataset_and_baseline.md
!3d_vision/event-boosted_deformable_3d_gaussians_for_dynamic_scene_reconstruction.md
!3d_vision/event-driven_storytelling_with_multiple_lifelike_humans_in_a_3d_scene.md
!3d_vision/excap3d_expressive_3d_scene_understanding_via_object_captioning_with_varying_det.md
!3d_vision/facelift_learning_generalizable_single_image_3d_face_reconstruction_from_synthet.md
!3d_vision/faster_and_better_3d_splatting_via_group_training.md
!3d_vision/fiffdepth_feed-forward_transformation_of_diffusion-based_generators_for_detailed.md
!3d_vision/find_any_part_in_3d.md
!3d_vision/fish2mesh_transformer_3d_human_mesh_recovery_from_egocentric_vision.md
!3d_vision/flashdepth_real-time_streaming_video_depth_estimation_at_2k_resolution.md
!3d_vision/flexgen_flexible_multi-view_generation_from_text_and_image_inputs.md
!3d_vision/from_gallery_to_wrist_realistic_3d_bracelet_insertion_in_videos.md
!3d_vision/from_image_to_video_an_empirical_study_of_diffusion_representations.md
!3d_vision/from_one_to_more_contextual_part_latents_for_3d_generation.md
!3d_vision/fross_faster-than-real-time_online_3d_semantic_scene_graph_generation_from_rgb-d.md
!3d_vision/g2sf_geometry-guided_score_fusion_for_multimodal_industrial_anomaly_detection.md
!3d_vision/gas_generative_avatar_synthesis_from_a_single_image.md
!3d_vision/gaussian_splatting_with_discretized_sdf_for_relightable_assets.md
!3d_vision/gaussian_variation_field_diffusion_for_high-fidelity_video-to-4d_synthesis.md
!3d_vision/gaussianproperty_integrating_physical_properties_to_3d_gaussians_with_lmms.md
!3d_vision/gaussianupdate_continual_3d_gaussian_splatting_update_for_changing_environments.md
!3d_vision/gazegaussian_high-fidelity_gaze_redirection_with_3d_gaussian_splatting.md
!3d_vision/generating_physically_stable_and_buildable_brick_structures_from_text.md
!3d_vision/geo4d_leveraging_video_generators_for_geometric_4d_scene_reconstruction.md
!3d_vision/geometry_distributions.md
!3d_vision/geoprog3d_compositional_visual_reasoning_for_city-scale_3d_language_fields.md
!3d_vision/geosplatting_towards_geometry_guided_gaussian_splatting_for_physically-based_inv.md
!3d_vision/global-aware_monocular_semantic_scene_completion_with_state_space_models.md
!3d_vision/global_motion_corresponder_for_3d_point-based_scene_interpolation_under_large_mo.md
!3d_vision/gsot3d_towards_generic_3d_single_object_tracking_in_the_wild.md
!3d_vision/guava_generalizable_upper_body_3d_gaussian_avatar.md
!3d_vision/guiding_diffusion-based_articulated_object_generation_by_partial_point_cloud_ali.md
!3d_vision/haircup_hair_compositional_universal_prior_for_3d_gaussian_avatars.md
!3d_vision/hi3dgen_high-fidelity_3d_geometry_generation_from_images_via_normal_bridging.md
!3d_vision/hierarchical_material_recognition_from_local_appearance.md
!3d_vision/hineus_high-fidelity_neural_surface_mitigating_low-texture_and_reflective_ambigu.md
!3d_vision/his-gpt_towards_3d_human-in-scene_multimodal_understanding.md
!3d_vision/hort_monocular_hand-held_objects_reconstruction_with_transformers.md
!3d_vision/housetour_a_virtual_real_estate_aigent.md
!3d_vision/how_far_are_ai-generated_videos_from_simulating_the_3d_visual_world_a_learned_3d.md
!3d_vision/humanolat_a_large-scale_dataset_for_full-body_human_relighting_and_novel-view_sy.md
!3d_vision/identity_preserving_3d_head_stylization_with_multiview_score_distillation.md
!3d_vision/im360_large-scale_indoor_mapping_with_360_cameras.md
!3d_vision/image-guided_shape-from-template_using_mesh_inextensibility_constraints.md
!3d_vision/image_as_an_imu_estimating_camera_motion_from_a_single_motion-blurred_image.md
!3d_vision/insideout_integrated_rgb-radiative_gaussian_splatting_for_comprehensive_3d_objec.md
!3d_vision/instascene_towards_complete_3d_instance_decomposition_and_reconstruction_from_cl.md
!3d_vision/jointdit_enhancing_rgb-depth_joint_modeling_with_diffusion_transformers.md
!3d_vision/kh_symmetry_understanding_of_3d_shapes_via_chirality_disentanglement.md
!3d_vision/laconic_a_3d_layout_adapter_for_controllable_image_creation.md
!3d_vision/layerlock_non-collapsing_representation_learning_with_progressive_freezing.md
!3d_vision/learning_3d_object_spatial_relationships_from_pre-trained_2d_diffusion_models.md
!3d_vision/learning_3d_scene_analogies_with_neural_contextual_scene_maps.md
!3d_vision/learning_robust_stereo_matching_in_the_wild_with_selective_mixture-of-experts.md
!3d_vision/lightweight_gradient-aware_upscaling_of_3d_gaussian_splatting_images.md
!3d_vision/linr-pcgc_lossless_implicit_neural_representations_for_point_cloud_geometry_comp.md
!3d_vision/llava-3d_a_simple_yet_effective_pathway_to_empowering_lmms_with_3d_capabilities.md
!3d_vision/localdygs_multi-view_global_dynamic_scene_modeling_via_adaptive_local_implicit_f.md
!3d_vision/long3r_long_sequence_streaming_3d_reconstruction.md
!3d_vision/longsplat_robust_unposed_3d_gaussian_splatting_for_casual_long_videos.md
!3d_vision/maskhand_generative_masked_modeling_for_robust_hand_mesh_reconstruction_in_the_w.md
!3d_vision/materialmvp_illumination-invariant_material_generation_via_multi-view_pbr_diffus.md
!3d_vision/mega_memory-efficient_4d_gaussian_splatting_for_dynamic_scenes.md
!3d_vision/memorytalker_personalized_speech-driven_3d_facial_animation_via_audio-guided_sty.md
!3d_vision/meshanything_v2_artist-created_mesh_generation_with_adjacent_mesh_tokenization.md
!3d_vision/meshmamba_state_space_models_for_articulated_3d_mesh_generation_and_reconstructi.md
!3d_vision/meshpad_interactive_sketch-conditioned_artist-reminiscent_mesh_generation_and_ed.md
!3d_vision/mincd-pnp_learning_2d-3d_correspondences_with_approximate_blind_pnp.md
!3d_vision/moga_3d_generative_avatar_prior_for_monocular_gaussian_avatar_reconstruction.md
!3d_vision/momentum-gs_momentum_gaussian_self-distillation_for_high-quality_large_scene_rec.md
!3d_vision/monocular_semantic_scene_completion_via_masked_recurrent_networks.md
!3d_vision/monomobility_zero-shot_3d_mobility_analysis_from_monocular_videos.md
!3d_vision/mugs_multi-baseline_generalizable_gaussian_splatting_reconstruction.md
!3d_vision/multi-view_3d_point_tracking.md
!3d_vision/mv-adapter_multi-view_consistent_image_generation_made_easy.md
!3d_vision/mvgbench_a_comprehensive_benchmark_for_multi-view_generation_models.md
!3d_vision/nautilus_locality-aware_autoencoder_for_scalable_mesh_generation.md
!3d_vision/neural_compression_for_3d_geometry_sets.md
!3d_vision/neuraleaf_neural_parametric_leaf_models_with_shape_and_deformation_disentangleme.md
!3d_vision/no_pose_at_all_self-supervised_pose-free_3d_gaussian_splatting_from_sparse_views.md
!3d_vision/noise2score3d_tweedies_approach_for_unsupervised_point_cloud_denoising.md
!3d_vision/not_all_frame_features_are_equal_video-to-4d_generation_via_decoupling_dynamic-s.md
!3d_vision/occlugaussian_occlusion-aware_gaussian_splatting_for_large_scene_reconstruction_.md
!3d_vision/omni-dc_highly_robust_depth_completion_with_multiresolution_depth_integration.md
!3d_vision/one_look_is_enough_seamless_patchwise_refinement_for_zero-shot_monocular_depth_e.md
!3d_vision/online_language_splatting.md
!3d_vision/open-vocabulary_octree-graph_for_3d_scene_understanding.md
!3d_vision/outdoor_monocular_slam_with_global_scale-consistent_3d_gaussian_pointmaps.md
!3d_vision/panst3r_multi-view_consistent_panoptic_segmentation.md
!3d_vision/pcr-gs_colmap-free_3d_gaussian_splatting_via_pose_co-regularizations.md
!3d_vision/perspose_3d_human_pose_estimation_with_perspective_encoding_and_perspective_rota.md
!3d_vision/phd_personalized_3d_human_body_fitting_with_point_diffusion.md
!3d_vision/placeit3d_language-guided_object_placement_in_real_3d_scenes.md
!3d_vision/plmp_-_point-line_minimal_problems_for_projective_sfm.md
!3d_vision/predict-optimize-distill_a_self-improving_cycle_for_4d_object_understanding.md
!3d_vision/proactive_scene_decomposition_and_reconstruction.md
!3d_vision/pseudomaptrainer_learning_online_mapping_without_hd_maps.md
!3d_vision/radiant_foam_real-time_differentiable_ray_tracing.md
!3d_vision/rapverse_coherent_vocals_and_whole-body_motion_generation_from_text.md
!3d_vision/rayletdf_raylet_distance_fields_for_generalizable_3d_surface_reconstruction_from.md
!3d_vision/rayzer_a_self-supervised_large_view_synthesis_model.md
!3d_vision/reggs_unposed_sparse_views_gaussian_splatting_with_3dgs_registration.md
!3d_vision/relative_illumination_fields_learning_medium_and_light_independent_underwater_sc.md
!3d_vision/reparo_compositional_3d_assets_generation_with_differentiable_3d_layout_alignmen.md
!3d_vision/reposed_efficient_relative_pose_estimation_with_known_depth_information.md
!3d_vision/representing_3d_shapes_with_64_latent_vectors_for_3d_diffusion_models.md
!3d_vision/repurposing_2d_diffusion_models_with_gaussian_atlas_for_3d_generation.md
!3d_vision/resgs_residual_densification_of_3d_gaussian_for_efficient_detail_recovery.md
!3d_vision/revisiting_point_cloud_completion_are_we_ready_for_the_real-world.md
!3d_vision/ri3d_few-shot_gaussian_splatting_with_repair_and_inpainting_diffusion_priors.md
!3d_vision/robopearls_editable_video_simulation_for_robot_manipulation.md
!3d_vision/robotron-mani_all-in-one_multimodal_large_model_for_robotic_manipulation.md
!3d_vision/robust_and_efficient_3d_gaussian_splatting_for_urban_scene_reconstruction.md
!3d_vision/robustereo_robust_zero-shot_stereo_matching_under_adverse_weather.md
!3d_vision/robustsplat_decoupling_densification_and_dynamics_for_transient-free_3dgs.md
!3d_vision/roco-sim_enhancing_roadside_collaborative_perception_through_foreground_simulati.md
!3d_vision/ross3d_reconstructive_visual_instruction_tuning_with_3d-awareness.md
!3d_vision/s3e_self-supervised_state_estimation_for_radar-inertial_system.md
!3d_vision/s3r-gs_streamlining_the_pipeline_for_large-scale_street_scene_reconstruction.md
!3d_vision/sas_segment_any_3d_scene_with_integrated_2d_priors.md
!3d_vision/sat2city_3d_city_generation_from_a_single_satellite_image_with_cascaded_latent_d.md
!3d_vision/scene_coordinate_reconstruction_priors.md
!3d_vision/scenemi_motion_in-betweening_for_modeling_human-scene_interaction.md
!3d_vision/seeing_and_seeing_through_the_glass_real_and_synthetic_data_for_multi-layer_dept.md
!3d_vision/segmentdreamer_towards_high-fidelity_text-to-3d_synthesis_with_segmented_consist.md
!3d_vision/sehdr_single-exposure_hdr_novel_view_synthesis_via_3d_gaussian_bracketing.md
!3d_vision/self-ensembling_gaussian_splatting_for_few-shot_novel_view_synthesis.md
!3d_vision/sequential_gaussian_avatars_with_hierarchical_motion_context.md
!3d_vision/shape_of_motion_4d_reconstruction_from_a_single_video.md
!3d_vision/sheap_self-supervised_head_geometry_predictor_learned_via_2d_gaussians.md
!3d_vision/sim3d_single-instance_multiview_multimodal_and_multisetup_3d_anomaly_detection_b.md
!3d_vision/simulating_dual-pixel_images_from_ray_tracing_for_depth_estimation.md
!3d_vision/single-scanline_relative_pose_estimation_for_rolling_shutter_cameras.md
!3d_vision/sl2a-inr_single-layer_learnable_activation_for_implicit_neural_representation.md
!3d_vision/sparfels_fast_reconstruction_from_sparse_unposed_imagery.md
!3d_vision/spatial-temporal_aware_visuomotor_diffusion_policy_learning.md
!3d_vision/spatialsplat_efficient_semantic_3d_from_sparse_unposed_images.md
!3d_vision/spinmeround_consistent_multi-view_identity_generation_using_diffusion_models.md
!3d_vision/splattalk_3d_vqa_with_gaussian_splatting.md
!3d_vision/stable_score_distillation.md
!3d_vision/stealthattack_robust_3d_gaussian_splatting_poisoning_via_density-guided_illusion.md
!3d_vision/stereo_any_video_temporally_consistent_stereo_matching.md
!3d_vision/stochasticsplats_stochastic_rasterization_for_sorting-free_3d_gaussian_splatting.md
!3d_vision/strandhead_text_to_hair-disentangled_3d_head_avatars_using_human-centric_priors.md
!3d_vision/strumamba3d_exploring_structural_mamba_for_self-supervised_point_cloud_represent.md
!3d_vision/superdec_3d_scene_decomposition_with_superquadrics_primitives.md
!3d_vision/supermat_physically_consistent_pbr_material_estimation_at_interactive_rates.md
!3d_vision/surfacesplat_connecting_surface_reconstruction_and_gaussian_splatting.md
!3d_vision/svg-head_hybrid_surface-volumetric_gaussians_for_high-fidelity_head_reconstructi.md
!3d_vision/tapnext_tracking_any_point_tap_as_next_token_prediction.md
!3d_vision/tar3d_creating_high-quality_3d_assets_via_next-part_prediction.md
!3d_vision/text2vdm_text_to_vector_displacement_maps_for_expressive_and_interactive_3d_scul.md
!3d_vision/textured_3d_regenerative_morphing_with_3d_diffusion_prior.md
!3d_vision/thermal_polarimetric_multi-view_stereo.md
!3d_vision/timeformer_capturing_temporal_relationships_of_deformable_3d_gaussians_for_robus.md
!3d_vision/tokenunify_scaling_up_autoregressive_pretraining_for_neuron_segmentation.md
!3d_vision/towards_more_diverse_and_challenging_pre-training_for_point_cloud_learning_self-.md
!3d_vision/towards_scalable_spatial_intelligence_via_2d-to-3d_data_lifting.md
!3d_vision/trace3d_consistent_segmentation_lifting_via_gaussian_instance_tracing.md
!3d_vision/trace_learning_3d_gaussian_physical_dynamics_from_multi-view_videos.md
!3d_vision/tridi_trilateral_diffusion_of_3d_humans_objects_and_interactions.md
!3d_vision/tune-your-style_intensity-tunable_3d_style_transfer_with_gaussian_splatting.md
!3d_vision/turboreg_turboclique_for_robust_and_efficient_point_cloud_registration.md
!3d_vision/uniegomotion_a_unified_model_for_egocentric_motion_reconstruction_forecasting_an.md
!3d_vision/unified_category-level_object_detection_and_pose_estimation_from_rgb_images_usin.md
!3d_vision/unleashing_vecset_diffusion_model_for_fast_shape_generation.md
!3d_vision/upp_unified_point-level_prompting_for_robust_point_cloud_analysis.md
!3d_vision/ust-ssm_unified_spatio-temporal_state_space_models_for_point_cloud_video_modelin.md
!3d_vision/vertexregen_mesh_generation_with_continuous_level_of_detail.md
!3d_vision/vit-split_unleashing_the_power_of_vision_foundation_models_via_efficient_splitti.md
!3d_vision/vivid4d_improving_4d_reconstruction_from_monocular_video_by_video_inpainting.md
!3d_vision/volume_-_authentic_3d_video_calls_from_live_gaussian_splat_prediction.md
!3d_vision/volumetricsmpl_a_neural_volumetric_body_model_for_efficient_interactions_contact.md
!3d_vision/wildseg3d_segment_any_3d_objects_in_the_wild_from_2d_images.md
!3d_vision/wonderplay_dynamic_3d_scene_generation_from_a_single_image_and_actions.md
!3d_vision/wonderturbo_generating_interactive_3d_world_in_072_seconds.md
!3d_vision/zero-shot_inexact_cad_model_alignment_from_a_single_image.md
!3d_vision/zerostereo_zero-shot_stereo_matching_from_single_images.md
!ai_safety/a_framework_for_doubleblind_federated_adaptation_of_foundati.md
!ai_safety/active_membership_inference_test_amint_enhancing_model_auditability_with_multi-t.md
!ai_safety/ask_and_remember_a_questions-only_replay_strategy_for_continual_visual_question_.md
!ai_safety/ask_and_remember_a_questions_only_replay_strategy_for_continual_visual_question_answering.md
!ai_safety/backdoor_attacks_on_neural_networks_via_one_bit_flip.md
!ai_safety/backdoor_mitigation_by_distance-driven_detoxification.md
!ai_safety/backdooring_self-supervised_contrastive_learning_by_noisy_alignment.md
!ai_safety/client2vec_improving_federated_learning_by_distribution_shifts_aware_client_inde.md
!ai_safety/controllable_feature_whitening_for_hyperparameter-free_bias_mitigation.md
!ai_safety/failure_cases_are_better_learned_but_boundary_says_sorry_facilitating_smooth_per.md
!ai_safety/fakeradar_probing_forgery_outliers_to_detect_unknown_deepfake_videos.md
!ai_safety/fedmenf_privacy-preserving_federated_meta-learning_for_neural_fields.md
!ai_safety/fedvla_federated_vision-language-action_learning_with_dual_gating_mixture-of-exp.md
!ai_safety/find_a_scapegoat_poisoning_membership_inference_attack_and_defense_to_federated_.md
!ai_safety/fret_feature_redundancy_elimination_for_test_time_adaptation.md
!ai_safety/iap_invisible_adversarial_patch_attack_through_perceptibility-aware_localization.md
!ai_safety/lora-fair_federated_lora_fine-tuning_with_aggregation_and_initialization_refinem.md
!ai_safety/membership_inference_attacks_with_false_discovery_rate_control.md
!ai_safety/mind_the_cost_of_scaffold_benign_clients_may_even_become_accomplices_of_backdoor.md
!ai_safety/semantic_alignment_and_reinforcement_for_data-free_quantization_of_vision_transf.md
!ai_safety/specguard_spectral_projection-based_advanced_invisible_watermarking.md
!ai_safety/staining_and_locking_computer_vision_models_without_retraining.md
!ai_safety/towards_adversarial_robustness_via_debiased_high-confidence_logit_alignment.md
!ai_safety/vulnerability-aware_spatio-temporal_learning_for_generalizable_deepfake_video_de.md
!audio_speech/25_years_in_class_a_multimodal_textbook_for_visionlanguage_p.md
!audio_speech/align_your_rhythm_generating_highly_aligned_dance_poses_with_gating-enhanced_rhy.md
!audio_speech/everything_is_a_video_unifying_modalities_through_next-frame_prediction.md
!audio_speech/how_would_it_sound_material-controlled_multimodal_acoustic_profile_generation_fo.md
!audio_speech/latent_swap_joint_diffusion_for_2d_long-form_latent_generation.md
!audio_speech/learning_to_see_inside_opaque_liquid_containers_using_speckle_vibrometry.md
!audio_speech/lyra_an_efficient_and_speechcentric_framework_for_omnicognit.md
!audio_speech/mug_pseudo_labeling_augmented_audio-visual_mamba_network_for_audio-visual_video_.md
!audio_speech/understanding_co-speech_gestures_in-the-wild.md
!audio_speech/vggsounder_audio-visual_evaluations_for_foundation_models.md
!audio_speech/zero-avsr_zero-shot_audio-visual_speech_recognition_with_llms_by_learning_langua.md
!autonomous_driving/3d_gaussian_splatting_driven_multiview_robust_physical_adver.md
!autonomous_driving/3drealcar_an_in-the-wild_rgb-d_car_dataset_with_360-degree_views.md
!autonomous_driving/4dsegstreamer_streaming_4d_panoptic_segmentation_via_dual_threads.md
!autonomous_driving/6dopegs_online_6d_object_pose_estimation_using_gaussian_spla.md
!autonomous_driving/a_constrained_optimization_approach_for_gaussian_splatting_from_coarsely-posed_i.md
!autonomous_driving/ad-gs_object-aware_b-spline_gaussian_splatting_for_self-supervised_autonomous_dr.md
!autonomous_driving/ad_gs_object_aware_bspline_gaussian_splatting_self_supervised_autonomous_driving.md
!autonomous_driving/adadrive_self-adaptive_slow-fast_system_for_language-grounded_autonomous_driving.md
!autonomous_driving/adaptive_dual_uncertainty_optimization_boosting_monocular_3d_object_detection_un.md
!autonomous_driving/ago_adaptive_grounding_for_open_world_3d_occupancy_predictio.md
!autonomous_driving/alocc_adaptive_lifting-based_3d_semantic_occupancy_and_cost_volume-based_flow_pr.md
!autonomous_driving/beyond_one_shot_beyond_one_perspective_cross-view_and_long-horizon_distillation_.md
!autonomous_driving/ccl-lgs_contrastive_codebook_learning_for_3d_language_gaussian_splatting.md
!autonomous_driving/coda-4dgs_dynamic_gaussian_splatting_with_context_and_deformation_awareness_for_.md
!autonomous_driving/colmdriver_llm-based_negotiation_benefits_cooperative_autonomous_driving.md
!autonomous_driving/controllable_3d_outdoor_scene_generation_via_scene_graphs.md
!autonomous_driving/cooptrack_exploring_end-to-end_learning_for_efficient_cooperative_sequential_per.md
!autonomous_driving/counting_stacked_objects.md
!autonomous_driving/cvfusion_cross-view_fusion_of_4d_radar_and_camera_for_3d_object_detection.md
!autonomous_driving/damap_distance-aware_mapnet_for_high_quality_hd_map_construction.md
!autonomous_driving/dchm_depth-consistent_human_modeling_for_multiview_detection.md
!autonomous_driving/decoupled_diffusion_sparks_adaptive_scene_generation.md
!autonomous_driving/despite_exploring_contrastive_deep_skeletonpointcloudimutext.md
!autonomous_driving/detect_anything_3d_in_the_wild.md
!autonomous_driving/dist-4d_disentangled_spatiotemporal_diffusion_with_metric_depth_for_4d_driving_s.md
!autonomous_driving/distilling_diffusion_models_to_efficient_3d_lidar_scene_completion.md
!autonomous_driving/donut_a_decoder-only_model_for_trajectory_prediction.md
!autonomous_driving/drivex_omni_scene_modeling_for_learning_generalizable_world_knowledge_in_autonom.md
!autonomous_driving/duet_dual_incremental_object_detection_via_exemplar-free_task_arithmetic.md
!autonomous_driving/embodiedocc_embodied_3d_occupancy_prediction_for_vision-based_online_scene_under.md
!autonomous_driving/emd_explicit_motion_modeling_for_high-quality_street_gaussian_splatting.md
!autonomous_driving/epona_autoregressive_diffusion_world_model_for_autonomous_driving.md
!autonomous_driving/eta_efficiency_through_thinking_ahead_a_dual_approach_to_self-driving_with_large.md
!autonomous_driving/evt_efficient_view_transformation_for_multi-modal_3d_object_detection.md
!autonomous_driving/extrapolated_urban_view_synthesis_benchmark.md
!autonomous_driving/foresight_in_motion_reinforcing_trajectory_prediction_with_reward_heuristics.md
!autonomous_driving/free-running_vs_synchronous_single-photon_lidar_for_high-flux_3d_imaging.md
!autonomous_driving/future-aware_interaction_network_for_motion_forecasting.md
!autonomous_driving/gaussianflowocc_sparse_and_weakly_supervised_occupancy_estimation_using_gaussian.md
!autonomous_driving/gaussrender_learning_3d_occupancy_with_gaussian_rendering.md
!autonomous_driving/generative_active_learning_for_long-tail_trajectory_prediction_via_controllable_.md
!autonomous_driving/gm-moe_low-light_enhancement_with_gated-mechanism_mixture-of-experts.md
!autonomous_driving/gs-livm_real-time_photo-realistic_lidar-inertial-visual_mapping_with_gaussian_sp.md
!autonomous_driving/gs-occ3d_scaling_vision-only_occupancy_reconstruction_with_gaussian_splatting.md
!autonomous_driving/hermes_a_unified_self-driving_world_model_for_simultaneous_3d_scene_understandin.md
!autonomous_driving/igl-nav_incremental_3d_gaussian_localization_for_image-goal_navigation.md
!autonomous_driving/instinct_instance-level_interaction_architecture_for_query-based_collaborative_p.md
!autonomous_driving/langtraj_diffusion_model_and_dataset_for_language-conditioned_trajectory_simulat.md
!autonomous_driving/language_driven_occupancy_prediction.md
!autonomous_driving/leveraging_2d_priors_and_sdf_guidance_for_urban_scene_rendering.md
!autonomous_driving/leveraging_bev_paradigm_for_ground-to-aerial_image_synthesis.md
!autonomous_driving/lightsout_diffusion-based_outpainting_for_enhanced_lens_flare_removal.md
!autonomous_driving/long-term_traffic_simulation_with_interleaved_autoregressive_motion_and_scenario.md
!autonomous_driving/lookout_real-world_humanoid_egocentric_navigation.md
!autonomous_driving/maestro_task-relevant_optimization_via_adaptive_feature_enhancement_and_suppress.md
!autonomous_driving/mcam_multimodal_causal_analysis_model_for_ego-vehicle-level_driving_video_unders.md
!autonomous_driving/mgsfm_multi-camera_geometry_driven_global_structure-from-motion.md
!autonomous_driving/mixed_signals_a_diverse_point_cloud_dataset_for_heterogeneous_lidar_v2x_collabor.md
!autonomous_driving/monosowa_scalable_monocular_3d_object_detector_without_human_annotations.md
!autonomous_driving/occupancy_learning_with_spatiotemporal_memory.md
!autonomous_driving/od-rase_ontology-driven_risk_assessment_and_safety_enhancement_for_autonomous_dr.md
!autonomous_driving/passing_the_driving_knowledge_test.md
!autonomous_driving/pbcat_patch-based_composite_adversarial_training_against_physically_realizable_a.md
!autonomous_driving/recondreamer_harmonizing_generative_and_reconstructive_models_for_driving_scene_.md
!autonomous_driving/referring_expression_comprehension_for_small_objects.md
!autonomous_driving/rescue_crowd_evacuation_simulation_via_controlling_sdm-united_characters.md
!autonomous_driving/resonance_learning_to_predict_social-aware_pedestrian_trajectories_as_co-vibrati.md
!autonomous_driving/robotron-sim_improving_real-world_driving_via_simulated_hard-case.md
!autonomous_driving/robust_3d_object_detection_using_probabilistic_point_clouds_from_single-photon_l.md
!autonomous_driving/rtmap_real-time_recursive_mapping_with_change_detection_and_localization.md
!autonomous_driving/sa-occ_satellite-assisted_3d_occupancy_prediction_in_real_world.md
!autonomous_driving/saliency-aware_quantized_imitation_learning_for_efficient_robotic_control.md
!autonomous_driving/sam4d_segment_anything_in_camera_and_lidar_streams.md
!autonomous_driving/self-supervised_sparse_sensor_fusion_for_long_range_perception.md
!autonomous_driving/semantic_causality-aware_vision-based_3d_occupancy_prediction.md
!autonomous_driving/seqgrowgraph_learning_lane_topology_as_a_chain_of_graph_expansions.md
!autonomous_driving/sparselanestp_leveraging_spatio-temporal_priors_with_sparse_transformers_for_3d_.md
!autonomous_driving/splat-loam_gaussian_splatting_lidar_odometry_and_mapping.md
!autonomous_driving/srefiner_soft-braid_attention_for_multi-agent_trajectory_refinement.md
!autonomous_driving/tars_traffic-aware_radar_scene_flow_estimation.md
!autonomous_driving/towards_open-world_generation_of_stereo_images_and_unsupervised_matching.md
!autonomous_driving/trackany3d_transferring_pretrained_3d_models_for_category-unified_3d_point_cloud.md
!autonomous_driving/trafficloc_localizing_traffic_surveillance_cameras_in_3d_scenes.md
!autonomous_driving/uavscenes_a_multi-modal_dataset_for_uavs.md
!autonomous_driving/uniocc_a_unified_benchmark_for_occupancy_forecasting_and_prediction_in_autonomou.md
!autonomous_driving/unleashing_the_temporal_potential_of_stereo_event_cameras_for_continuous-time_3d.md
!autonomous_driving/unraveling_the_effects_of_synthetic_data_on_end-to-end_autonomous_driving.md
!autonomous_driving/wavelet_policy_lifting_scheme_for_policy_learning_in_long-horizon_tasks.md
!autonomous_driving/where_am_i_cross-view_geo-localization_with_natural_language_descriptions.md
!autonomous_driving/where_what_why_towards_explainable_driver_attention_prediction.md
!autonomous_driving/world4drive_end-to-end_autonomous_driving_via_intention-aware_physical_latent_wo.md
!causal_inference/a_visual_leap_in_clip_compositionality_reasoning_through_gen.md
!causal_inference/social_debiasing_for_fair_multi-modal_llms.md
!code_intelligence/tikzero_zero-shot_text-guided_graphics_program_synthesis.md
!computational_biology/cryofastar_fast_cryoem_ab_initio_reconstruction_made_easy.md
!computational_biology/g2pdiffusion_cross-species_genotype-to-phenotype_prediction_via_evolutionary_dif.md
!computational_biology/integrating_biological_knowledge_for_robust_microscopy_image_profiling_on_de_nov.md
!computational_biology/molparser_end-to-end_visual_recognition_of_molecule_structures_in_the_wild.md
!graph_learning/pasta_part-aware_sketch-to-3d_shape_generation_with_text-aligned_prior.md
!hallucination/chartcap_mitigating_hallucination_of_dense_chart_captioning.md
!hallucination/dash_detection_and_assessment_of_systematic_hallucinations_of_vlms.md
!hallucination/mitigating_object_hallucinations_via_sentence-level_early_intervention.md
!hallucination/only_onelayer_intervention_sufficiently_mitigates_hallucinat.md
!hallucination/why_lvlms_are_more_prone_to_hallucinations_in_longer_responses_the_role_of_conte.md
!human_understanding/ar-vrm_imitating_human_motions_for_visual_robot_manipulation_with_analogical_rea.md
!human_understanding/avat3r_large_animatable_gaussian_reconstruction_model_for_hi.md
!human_understanding/bi-level_optimization_for_self-supervised_ai-generated_face_detection.md
!human_understanding/cargait_cross_attention_based_re_ranking_for_gait_recognition.md
!human_understanding/cleanpose_category-level_object_pose_estimation_via_causal_learning_and_knowledg.md
!human_understanding/contact-aware_refinement_of_human_pose_pseudo-ground_truth_via_bioimpedance_sens.md
!human_understanding/controllable_and_expressive_one-shot_video_head_swapping.md
!human_understanding/dadm_dual_alignment_of_domain_and_modality_for_face_anti-spoofing.md
!human_understanding/dreamactor-m1_holistic_expressive_and_robust_human_image_animation_with_hybrid_g.md
!human_understanding/dynamic_reconstruction_of_hand-object_interaction_with_distributed_force-aware_c.md
!human_understanding/dynfacerestore_balancing_fidelity_and_quality_in_diffusion-guided_blind_face_res.md
!human_understanding/egoagent_a_joint_predictive_agent_model_in_egocentric_worlds.md
!human_understanding/genm3_generative_pretrained_multi-path_motion_model_for_text_conditional_human_m.md
!human_understanding/genmo_a_generalist_model_for_human_motion.md
!human_understanding/gesturehydra_semantic_co-speech_gesture_synthesis_via_hybrid_modality_diffusion_.md
!human_understanding/ggtalker_talking_head_systhesis_with_generalizable_gaussian_priors_and_identity-.md
!human_understanding/hcceposebf_predicting_front_back_surfaces_to_construct_ultra-dense_2d-3d_corresp.md
!human_understanding/high-resolution_spatiotemporal_modeling_with_global-local_state_space_models_for.md
!human_understanding/humoto_a_4d_dataset_of_mocap_human_object_interactions.md
!human_understanding/idface_face_template_protection_for_efficient_and_secure_identification.md
!human_understanding/imhead_a_large-scale_implicit_morphable_model_for_localized_head_modeling.md
!human_understanding/kinmo_kinematic-aware_human_motion_understanding_and_generation.md
!human_understanding/lvface_progressive_cluster_optimization_for_large_vision_models_in_face_recognit.md
!human_understanding/magshield_towards_better_robustness_in_sparse_inertial_motion_capture_under_magn.md
!human_understanding/mdd_a_dataset_for_text-and-music_conditioned_duet_dance_generation.md
!human_understanding/mixri_mixing_features_of_reference_images_for_novel_object_pose_estimation.md
!human_understanding/monocular_facial_appearance_capture_in_the_wild.md
!human_understanding/multi-view_gaze_target_estimation.md
!human_understanding/ngd_neural_gradient_based_deformation_for_monocular_garment_reconstruction.md
!human_understanding/one-shot_knowledge_transfer_for_scalable_person_re-identification.md
!human_understanding/openanimals_revisiting_person_re-identification_for_animals_towards_better_gener.md
!human_understanding/posesyn_synthesizing_diverse_3d_pose_data_from_in-the-wild_2d_data.md
!human_understanding/raypose_ray_bundling_diffusion_for_template_views_in_unseen_6d_object_pose_estim.md
!human_understanding/semges_semantics-aware_co-speech_gesture_generation_using_semantic_coherence_and.md
!human_understanding/semtalk_holistic_co-speech_motion_generation_with_frame-level_semantic_emphasis.md
!human_understanding/sequential_keypoint_density_estimator_an_overlooked_baseline_of_skeleton-based_v.md
!human_understanding/signs_as_tokens_a_retrieval-enhanced_multilingual_sign_language_generator.md
!human_understanding/synfer_towards_boosting_facial_expression_recognition_with_synthetic_data.md
!human_understanding/udc-vit_a_real-world_video_dataset_for_under-display_cameras.md
!human_understanding/weakly_supervised_visible-infrared_person_re-identification_via_heterogeneous_ex.md
!human_understanding/whats_making_that_sound_right_now_video-centric_audio-visual_localization.md
!image_generation/a0_affordance_aware_hierarchical_model_robotic_manipulation.md
!image_generation/a0_an_affordance-aware_hierarchical_model_for_general_robotic_manipulation.md
!image_generation/a_unified_framework_for_motion_reasoning_and_generation_in_human_interaction.md
!image_generation/accelerating_diffusion_sampling_via_exploiting_local_transition_coherence.md
!image_generation/adaptive_routing_of_text-to-image_generation_requests_between_large_cloud_model_.md
!image_generation/adaptive_routing_of_text_to_image_generation_requests_between_large_cloud_model_and_light_weight_edge_model.md
!image_generation/addressing_text_embedding_leakage_in_diffusion-based_image_editing.md
!image_generation/adiee_automatic_dataset_creation_and_scorer_for_instruction-guided_image_editing.md
!image_generation/adiee_automatic_dataset_creation_and_scorer_for_instruction_guided_image_editing_evaluation.md
!image_generation/aether_geometric-aware_unified_world_modeling.md
!image_generation/aicomposer_any_style_and_content_image_composition_via_feature_integration.md
!image_generation/aid_adapting_image2video_diffusion_models_for_instruction-guided_video_predictio.md
!image_generation/ale_attribute_leakage_free_editing.md
!image_generation/anchor_token_matching_implicit_structure_locking_for_training-free_ar_image_edit.md
!image_generation/animegamer_infinite_anime_life_simulation_with_next_game_state_prediction.md
!image_generation/anti-tamper_protection_for_unauthorized_individual_image_generation.md
!image_generation/anyportal_zero-shot_consistent_video_background_replacement.md
!image_generation/attention_to_neural_plagiarism_diffusion_models_can_plagiarize_your_copyrighted_.md
!image_generation/autoprompt_automated_red-teaming_of_text-to-image_models_via_llm-driven_adversar.md
!image_generation/balanced_image_stylization_with_style_matching_score.md
!image_generation/bitrate-controlled_diffusion_for_disentangling_motion_and_content_in_video.md
!image_generation/bridging_diffusion_models_and_3d_representations_a_3d_consis.md
!image_generation/bridging_the_skeleton_text_modality_gap_diffusion_powered_modality_alignment_for.md
!image_generation/bvinet_unlocking_blind_video_inpainting_with_zero_annotations.md
!image_generation/cao2_rectifying_inconsistencies_in_diffusion-based_dataset_distillation.md
!image_generation/cap_evaluation_of_persuasive_and_creative_image_generation.md
!image_generation/characonsist_fine-grained_consistent_character_generation.md
!image_generation/chords_diffusion_sampling_accelerator_with_multi-core_hierarchical_ode_solvers.md
!image_generation/cns-bench_benchmarking_image_classifier_robustness_under_continuous_nuisance_shi.md
!image_generation/compass_enhancing_spatial_understanding_in_text-to-image_diffusion_models.md
!image_generation/completeme_reference-based_human_image_completion.md
!image_generation/compression-aware_one-step_diffusion_model_for_jpeg_artifact_removal.md
!image_generation/compslider_compositional_slider_for_disentangled_multiple-attribute_image_genera.md
!image_generation/contrastive_flow_matching.md
!image_generation/csd-var_content-style_decomposition_in_visual_autoregressive_models.md
!image_generation/cure_cultural_gaps_in_the_long_tail_of_text-to-image_systems.md
!image_generation/cycle_consistency_as_reward_learning_imagetext_alignment_wit.md
!image_generation/dc-ar_efficient_masked_autoregressive_image_generation_with_deep_compression_hyb.md
!image_generation/dct-shield_a_robust_frequency_domain_defense_against_malicious_image_editing.md
!image_generation/deeply_supervised_flow-based_generative_models.md
!image_generation/deepshield_fortifying_deepfake_video_detection_with_local_and_global_forgery_ana.md
!image_generation/dense2moe_restructuring_diffusion_transformer_to_moe_for_efficient_text-to-image.md
!image_generation/dense_policy_bidirectional_autoregressive_learning_of_actions.md
!image_generation/describe_dont_dictate_semantic_image_editing_with_natural_language_intent.md
!image_generation/dia_the_adversarial_exposure_of_deterministic_inversion_in_diffusion_models.md
!image_generation/dice_staleness-centric_optimizations_for_parallel_diffusion_moe_inference.md
!image_generation/diffdoctor_diagnosing_image_diffusion_models_before_treating.md
!image_generation/diffsim_taming_diffusion_models_for_evaluating_visual_similarity.md
!image_generation/diffumatch_category-agnostic_spectral_diffusion_priors_for_robust_non-rigid_shap.md
!image_generation/diffusion-based_3d_hand_motion_recovery_with_intuitive_physics.md
!image_generation/diffusion_image_prior.md
!image_generation/discovering_divergent_representations_between_text-to-image_models.md
!image_generation/disrupting_model_merging_a_parameter-level_defense_without_sacrificing_accuracy.md
!image_generation/ditfastattnv2_head-wise_attention_compression_for_multi-modality_diffusion_trans.md
!image_generation/dmq_dissecting_outliers_of_diffusion_models_for_post-training_quantization.md
!image_generation/domain_generalizable_portrait_style_transfer.md
!image_generation/dposer-x_diffusion_model_as_robust_3d_whole-body_human_pose_prior.md
!image_generation/dreamdance_animating_human_images_by_enriching_3d_geometry_cues_from_2d_poses.md
!image_generation/dual_recursive_feedback_on_generation_and_appearance_latents_for_pose-robust_tex.md
!image_generation/dynamicid_zero-shot_multi-id_image_personalization_with_flexible_facial_editabil.md
!image_generation/early_timestep_zero-shot_candidate_selection_for_instruction-guided_image_editin.md
!image_generation/ec-flow_enabling_versatile_robotic_manipulation_from_action-unlabeled_videos_via.md
!image_generation/edit_efficient_diffusion_transformers_with_linear_compressed_attention.md
!image_generation/eedit_rethinking_the_spatial_and_temporal_redundancy_for_efficient_image_editing.md
!image_generation/efficient_autoregressive_shape_generation_via_octree-based_adaptive_tokenization.md
!image_generation/efficient_input-level_backdoor_defense_on_text-to-image_synthesis_via_neuron_act.md
!image_generation/emoticrafter_text-to-emotional-image_generation_based_on_valence-arousal_model.md
!image_generation/end-to-end_multi-modal_diffusion_mamba.md
!image_generation/enhancing_reward_models_for_high-quality_image_generation_beyond_text-image_alig.md
!image_generation/erasing_more_than_intended_how_concept_erasure_degrades_the_generation_of_non-ta.md
!image_generation/exploring_multimodal_diffusion_transformers_for_enhanced_prompt-based_image_edit.md
!image_generation/facecraft4d_animated_3d_facial_avatar_generation_from_a_single_image.md
!image_generation/fair_generation_without_unfair_distortions_debiasing_text-to-image_generation_wi.md
!image_generation/feddifrc_unlocking_the_potential_of_text-to-image_diffusion_models_in_heterogene.md
!image_generation/fewer_denoising_steps_or_cheaper_per-step_inference_towards_compute-optimal_diff.md
!image_generation/ficgen_frequency-inspired_contextual_disentanglement_for_layout-driven_degraded_.md
!image_generation/fix-clip_dual-branch_hierarchical_contrastive_learning_via_synthetic_captions_fo.md
!image_generation/float_generative_motion_latent_flow_matching_for_audio-driven_talking_portrait.md
!image_generation/flowdps_flow-driven_posterior_sampling_for_inverse_problems.md
!image_generation/flowedit_inversion-free_text-based_editing_using_pre-trained_flow_models.md
!image_generation/flowtok_flowing_seamlessly_across_text_and_image_tokens.md
!image_generation/forgelens_data-efficient_forgery_focus_for_generalizable_forgery_image_detection.md
!image_generation/free4d_tuning-free_4d_scene_generation_with_spatial-temporal_consistency.md
!image_generation/freecus_free_lunch_subject-driven_customization_in_diffusion_transformers.md
!image_generation/freemorph_tuning-free_generalized_image_morphing_with_diffusion_model.md
!image_generation/freescale_unleashing_the_resolution_of_diffusion_models_via_tuning-free_scale_fu.md
!image_generation/from_reusing_to_forecasting_accelerating_diffusion_models_with_taylorseers.md
!image_generation/gamefactory_creating_new_games_with_generative_interactive_videos.md
!image_generation/gap_gaussianize_any_point_clouds_with_text_guidance.md
!image_generation/generating_multi-image_synthetic_data_for_text-to-image_customization.md
!image_generation/generative_modeling_of_shape-dependent_self-contact_human_poses.md
!image_generation/genflowrl_shaping_rewards_with_generative_object-centric_flow_in_visual_reinforc.md
!image_generation/genhancer_imperfect_generative_models_are_secretly_strong_vision-centric_enhance.md
!image_generation/golden_noise_for_diffusion_models_a_learning_framework.md
!image_generation/grouped_speculative_decoding_for_autoregressive_image_generation.md
!image_generation/guiding_noisy_label_conditional_diffusion_models_with_score-based_discriminator_.md
!image_generation/holistic_tokenizer_for_autoregressive_image_generation.md
!image_generation/holistic_unlearning_benchmark_a_multi-faceted_evaluation_for_text-to-image_diffu.md
!image_generation/hpsv3_towards_wide-spectrum_human_preference_score.md
!image_generation/hypdae_hyperbolic_diffusion_autoencoders_for_hierarchical_few-shot_image_generat.md
!image_generation/illume_illuminating_your_llms_to_see_draw_and_self-enhance.md
!image_generation/imagegem_in-the-wild_generative_image_interaction_dataset_for_generative_model_p.md
!image_generation/improved_noise_schedule_for_diffusion_training.md
!image_generation/inference-time_diffusion_model_distillation.md
!image_generation/infgen_a_resolution-agnostic_paradigm_for_scalable_image_synthesis.md
!image_generation/infinidreamer_arbitrarily_long_human_motion_generation_via_segment_score_distill.md
!image_generation/inpaint4drag_repurposing_inpainting_models_for_drag-based_image_editing_via_bidi.md
!image_generation/introstyle_training-free_introspective_style_attribution_using_diffusion_feature.md
!image_generation/invisible_watermarks_visible_gains_steering_machine_unlearning_with_bi-level_wat.md
!image_generation/irgpt_understanding_real-world_infrared_image_with_bi-cross-modal_curriculum_on_.md
!image_generation/joint_diffusion_models_in_continual_learning.md
!image_generation/larender_training-free_occlusion_control_in_image_generation_via_latent_renderin.md
!image_generation/latent_diffusion_models_with_masked_autoencoders.md
!image_generation/latino-pro_latent_consistency_inverse_solver_with_prompt_optimization.md
!image_generation/lay-your-scene_natural_scene_layout_generation_with_diffusion_transformers.md
!image_generation/lazymar_accelerating_masked_autoregressive_models_via_feature_caching.md
!image_generation/ld-rps_zero-shot_unified_image_restoration_via_latent_diffusion_recurrent_poster.md
!image_generation/learning_deblurring_texture_prior_from_unpaired_data_with_diffusion_model.md
!image_generation/learning_few-step_diffusion_models_by_trajectory_distribution_matching.md
!image_generation/learning_to_see_in_the_extremely_dark.md
!image_generation/less-to-more_generalization_unlocking_more_controllability_by_in-context_generat.md
!image_generation/less_is_more_improving_motion_diffusion_models_with_sparse_keyframes.md
!image_generation/lift_latent_implicit_functions_for_task-_and_data-agnostic_encoding.md
!image_generation/lit_delving_into_a_simple_linear_diffusion_transformer_for_image_generation.md
!image_generation/looking_in_the_mirror_a_faithful_counterfactual_explanation_method_for_interpret.md
!image_generation/loraverse_a_submodular_framework_to_retrieve_diverse_adapters_for_diffusion_mode.md
!image_generation/lusd_localized_update_score_distillation_for_text-guided_image_editing.md
!image_generation/m2sformer_multi-spectral_and_multi-scale_attention_with_edge-aware_difficulty_gu.md
!image_generation/make_me_happier_evoking_emotions_through_image_diffusion_models.md
!image_generation/mamtiff-cad_multi-scale_latent_diffusion_with_mamba_for_complex_parametric_seque.md
!image_generation/maskcontrol_spatio-temporal_control_for_masked_motion_synthesis.md
!image_generation/matchdiffusion_training-free_generation_of_match-cuts.md
!image_generation/mavflow_preserving_paralinguistic_elements_with_conditional_flow_matching_for_ze.md
!image_generation/meta-unlearning_on_diffusion_models_preventing_relearning_unlearned_concepts.md
!image_generation/mind_the_gap_aligning_vision_foundation_models_to_image_feature_matching.md
!image_generation/mmaif_multi-task_and_multi-degradation_all-in-one_for_image_fusion_with_language.md
!image_generation/mofrr_mixture_of_diffusion_models_for_face_retouching_restoration.md
!image_generation/mosaicdiff_training-free_structural_pruning_for_diffusion_model_acceleration_ref.md
!image_generation/motiondiff_training-free_zero-shot_interactive_motion_editing_via_flow-assisted_.md
!image_generation/motionstreamer_streaming_motion_generation_via_diffusion-based_autoregressive_mo.md
!image_generation/multi-turn_consistent_image_editing.md
!image_generation/multimodal_latent_diffusion_model_for_complex_sewing_pattern_generation.md
!image_generation/music-aligned_holistic_3d_dance_generation_via_hierarchical_motion_modeling.md
!image_generation/nuiscene_exploring_efficient_generation_of_unbounded_outdoor_scenes.md
!image_generation/nullswap_proactive_identity_cloaking_against_deepfake_face_swapping.md
!image_generation/omegance_a_single_parameter_for_various_granularities_in_diffusion-based_synthes.md
!image_generation/ominicontrol_minimal_and_universal_control_for_diffusion_transformer.md
!image_generation/omnipaint_mastering_object-oriented_editing_via_disentangled_insertion-removal_i.md
!image_generation/omnivton_training-free_universal_virtual_try-on.md
!image_generation/ouroboros_single-step_diffusion_models_for_cycle-consistent_forward_and_inverse_.md
!image_generation/panollama_generating_endless_and_coherent_panoramas_with_next-token-prediction_l.md
!image_generation/patchscaler_an_efficient_patch-independent_diffusion_model_for_image_super-resol.md
!image_generation/penalizing_boundary_activation_for_object_completeness_in_diffusion_models.md
!image_generation/personalvideo_high_id-fidelity_video_customization_without_dynamic_and_semantic_.md
!image_generation/pino_person-interaction_noise_optimization_for_long-duration_and_customizable_mo.md
!image_generation/pla_prompt_learning_attack_against_text-to-image_generative_models.md
!image_generation/polaranything_diffusion-based_polarimetric_image_synthesis.md
!image_generation/pretrained_reversible_generation_as_unsupervised_visual_representation_learning.md
!image_generation/randomized_autoregressive_visual_generation.md
!image_generation/reducio_generating_1k_video_within_16_seconds_using_extremely_compressed_motion_.md
!image_generation/reflex_text-guided_editing_of_real_images_in_rectified_flow_via_mid-step_feature.md
!image_generation/regen_learning_compact_video_embedding_with_re-generative_decoder.md
!image_generation/repa-e_unlocking_vae_for_end-to-end_tuning_of_latent_diffusion_transformers.md
!image_generation/rethink_sparse_signals_for_pose-guided_text-to-image_generation.md
!image_generation/rethinking_cross-modal_interaction_in_multimodal_diffusion_transformers.md
!image_generation/rethinking_layered_graphic_design_generation_with_a_top-down_approach.md
!image_generation/rethinking_the_embodied_gap_in_vision-and-language_navigation_a_holistic_study_o.md
!image_generation/revelio_interpreting_and_leveraging_semantic_information_in_diffusion_models.md
!image_generation/sa-lut_spatial_adaptive_4d_look-up_table_for_photorealistic_style_transfer.md
!image_generation/sana-sprint_one-step_diffusion_with_continuous-time_consistency_distillation.md
!image_generation/scflow_implicitly_learning_style_and_content_disentanglement_with_flow_models.md
!image_generation/scorehoi_physically_plausible_reconstruction_of_human-object_interaction_via_sco.md
!image_generation/sdmatte_grafting_diffusion_models_for_interactive_matting.md
!image_generation/semantic_discrepancy-aware_detector_for_image_forgery_identification.md
!image_generation/semantic_watermarking_reinvented_enhancing_robustness_and_generation_quality_wit.md
!image_generation/shortft_diffusion_model_alignment_via_shortcut-based_fine-tuning.md
!image_generation/sliderspace_decomposing_the_visual_capabilities_of_diffusion_models.md
!image_generation/smgdiff_soccer_motion_generation_using_diffusion_probabilistic_models.md
!image_generation/spectral_image_tokenizer.md
!image_generation/straighten_viscous_rectified_flow_via_noise_optimization.md
!image_generation/streamdiffusion_a_pipeline-level_solution_for_real-time_interactive_generation.md
!image_generation/structure-guided_diffusion_models_for_high-fidelity_portrait_shadow_removal.md
!image_generation/stylekeeper_prevent_content_leakage_using_negative_visual_query_guidance.md
!image_generation/stylemotif_multi-modal_motion_stylization_using_style-content_cross_fusion.md
!image_generation/summdiff_generative_modeling_of_video_summarization_with_diffusion.md
!image_generation/superedit_rectifying_and_facilitating_supervision_for_instruction-based_image_ed.md
!image_generation/synthesizing_near-boundary_ood_samples_for_out-of-distribution_detection.md
!image_generation/taxadiffusion_progressively_trained_diffusion_model_for_fine-grained_species_gen.md
!image_generation/teefusion_blending_text_embeddings_to_distill_classifier-free_guidance.md
!image_generation/tera_rethinking_text-guided_realistic_3d_avatar_generation.md
!image_generation/text_embedding_knows_how_to_quantize_text-guided_diffusion_models.md
!image_generation/the_curse_of_conditions_analyzing_and_improving_optimal_transport_for_conditiona.md
!image_generation/the_silent_assistant_noisequery_as_implicit_guidance_for_goal-driven_image_gener.md
!image_generation/timestep-aware_diffusion_model_for_extreme_image_rescaling.md
!image_generation/tlb-vfi_temporal-aware_latent_brownian_bridge_diffusion_for_video_frame_interpol.md
!image_generation/towards_robust_defense_against_customization_via_protective_perturbation_resista.md
!image_generation/trade-offs_in_image_generation_how_do_different_dimensions_interact.md
!image_generation/trans-adapter_a_plug-and-play_framework_for_transparent_image_inpainting.md
!image_generation/transformed_low-rank_adaptation_via_tensor_decomposition_and_its_applications_to.md
!image_generation/trce_towards_reliable_malicious_concept_erasure_in_text-to-image_diffusion_model.md
!image_generation/understanding_flatness_in_generative_models_its_role_and_benefits.md
!image_generation/unicombine_unified_multi-conditional_combination_with_diffusion_transformer.md
!image_generation/univg_a_generalist_diffusion_model_for_unified_image_generation_and_editing.md
!image_generation/unlocking_the_potential_of_diffusion_priors_in_blind_face_restoration.md
!image_generation/unsupervised_imaging_inverse_problems_with_diffusion_distribution_matching.md
!image_generation/video_color_grading_via_look-up_table_generation.md
!image_generation/video_motion_graphs.md
!image_generation/vigface_virtual_identity_generation_for_privacy-free_face_recognition_dataset.md
!image_generation/visualcloze_a_universal_image_generation_framework_via_visual_in-context_learnin.md
!image_generation/vsc_visual_search_compositional_text-to-image_diffusion_model.md
!image_generation/what_makes_for_text_to_360-degree_panorama_generation_with_stable_diffusion.md
!image_generation/whats_in_a_latent_leveraging_diffusion_latent_space_for_domain_generalization.md
!image_generation/your_text_encoder_can_be_an_object-level_watermarking_controller.md
!image_restoration/afunet_crossiterative_alignmentfusion_synergy_for_hdr_recons.md
!image_restoration/benchmarking_burst_super-resolution_for_polarization_images_noise_dataset_and_an.md
!image_restoration/blind2sound_self-supervised_image_denoising_without_residual_noise.md
!image_restoration/blind_noisy_image_deblurring_using_residual_guidance_strateg.md
!image_restoration/closed-loop_transfer_for_weakly-supervised_affordance_grounding.md
!image_restoration/consistent_time-of-flight_depth_denoising_via_graph-informed_geometric_attention.md
!image_restoration/cwnet_causal_wavelet_network_for_low-light_image_enhancement.md
!image_restoration/decouple_to_reconstruct_high_quality_uhd_restoration_via_active_feature_disentan.md
!image_restoration/devil_is_in_the_uniformity_exploring_diverse_learners_within_transformer_for_ima.md
!image_restoration/eamamba_efficient_all-around_vision_state_space_model_for_image_restoration.md
!image_restoration/efficient_concertormer_for_image_deblurring_and_beyond.md
!image_restoration/emulating_self-attention_with_convolution_for_efficient_image_super-resolution.md
!image_restoration/enhancing_image_restoration_transformer_via_adaptive_translation_equivariance.md
!image_restoration/exploiting_diffusion_prior_for_task-driven_image_restoration.md
!image_restoration/foundir_unleashing_million-scale_training_data_to_advance_foundation_models_for_.md
!image_restoration/generic_event_boundary_detection_via_denoising_diffusion.md
!image_restoration/idf_iterative_dynamic_filtering_networks_for_generalizable_image_denoising.md
!image_restoration/im-lut_interpolation_mixing_look-up_tables_for_image_super-resolution.md
!image_restoration/learning_pixel-adaptive_multi-layer_perceptrons_for_real-time_image_enhancement.md
!image_restoration/lightweight_and_fast_real-time_image_enhancement_via_decomposition_of_the_spatia.md
!image_restoration/low-light_image_enhancement_using_event-based_illumination_estimation.md
!image_restoration/metric_convolutions_a_unifying_theory_to_adaptive_image_convolutions.md
!image_restoration/mobileie_an_extremely_lightweight_and_effective_convnet_for_real-time_image_enha.md
!image_restoration/mp-hsir_a_multi-prompt_framework_for_universal_hyperspectral_image_restoration.md
!image_restoration/outlier-aware_post-training_quantization_for_image_super-resolution.md
!image_restoration/pre-mamba_a_4d_state_space_model_for_ultra-high-frequent_event_camera_deraining.md
!image_restoration/robust_adverse_weather_removal_via_spectral-based_spatial_grouping.md
!image_restoration/self-calibrated_variance-stabilizing_transformations_for_real-world_image_denois.md
!image_restoration/towards_a_universal_image_degradation_model_via_content-degradation_disentanglem.md
!image_restoration/uniphys_unified_planner_and_controller_with_diffusion_for_flexible_physics-based.md
!image_restoration/unires_universal_image_restoration_for_complex_degradations.md
!information_retrieval/aligning_information_capacity_between_vision_and_language_via_dense-to-sparse_fe.md
!information_retrieval/external_knowledge_injection_for_clip-based_class-incremental_learning.md
!information_retrieval/langbridge_interpreting_image_as_a_combination_of_language_embeddings.md
!information_retrieval/monster_a_unified_model_for_motion_scene_text_retrieval.md
!information_retrieval/ocr_hinders_rag_evaluating_the_cascading_impact_of_ocr_on_retrieval-augmented_ge.md
!interpretability/aim_amending_inherent_interpretability_via_self-supervised_masking.md
!interpretability/argotweak_towards_self-updating_hd_maps_through_structured_priors.md
!interpretability/cad-recode_reverse_engineering_cad_code_from_point_clouds.md
!interpretability/ce-fam_concept-based_explanation_via_fusion_of_activation_maps.md
!interpretability/granular_concept_circuits_toward_a_fine-grained_circuit_discovery_for_concept_re.md
!interpretability/learnable_fractional_reaction-diffusion_dynamics_for_under-display_tof_imaging_a.md
!interpretability/minerva_evaluating_complex_video_reasoning.md
!interpretability/principal_components_enable_a_new_language_of_images.md
!interpretability/svip_semantically_contextualized_visual_patches_for_zero-shot_learning.md
!interpretability/vital_more_understandable_feature_visualization_through_distribution_alignment_a.md
!llm_agent/embodied_image_captioning_self-supervised_learning_agents_for_spatially_coherent.md
!llm_agent/gtr_guided_thought_reinforcement_prevents_thought_collapse_i.md
!llm_agent/less_is_more_empowering_gui_agent_with_context-aware_simplification.md
!llm_agent/uipro_unleashing_superior_interaction_capability_for_gui_agents.md
!llm_alignment/heuristic-induced_multimodal_risk_distribution_jailbreak_attack_for_multimodal_l.md
!llm_alignment/magicid_hybrid_preference_optimization_for_id-consistent_and_dynamic-preserved_v.md
!llm_efficiency/mixant_observation-dependent_memory_propagation_for_stochastic_dense_action_anti.md
!llm_evaluation/3dsrbench_a_comprehensive_3d_spatial_reasoning_benchmark.md
!llm_evaluation/a_conditional_probability_framework_for_compositional_zerosh.md
!llm_evaluation/a_real-world_display_inverse_rendering_dataset.md
!llm_evaluation/batclip_bimodal_online_test-time_adaptation_for_clip.md
!llm_evaluation/combinative_matching_for_geometric_shape_assembly.md
!llm_evaluation/degradation-modeled_multipath_diffusion_for_tunable_metalens_photography.md
!llm_evaluation/discontinuity-aware_normal_integration_for_generic_central_camera_models.md
!llm_evaluation/discopatch_taming_adversarially-driven_batch_statistics_for_improved_out-of-dist.md
!llm_evaluation/dista-net_dynamic_closely-spaced_infrared_small_target_unmixing.md
!llm_evaluation/few-shot_pattern_detection_via_template_matching_and_regression.md
!llm_evaluation/forcennet_foreground-centric_network_for_document_image_rectification.md
!llm_evaluation/generative_zoo.md
!llm_evaluation/hiero_understanding_the_hierarchy_of_human_behavior_enhances_reasoning_on_egocen.md
!llm_evaluation/imbalance_in_balance_online_concept_balancing_in_generation_models.md
!llm_evaluation/intersyn_interleaved_learning_for_dynamic_motion_synthesis_in_the_wild.md
!llm_evaluation/lay2story_extending_diffusion_transformers_for_layout-togglable_story_generation.md
!llm_evaluation/neural_multi-view_self-calibrated_photometric_stereo_without_photometric_stereo_.md
!llm_evaluation/odp-bench_benchmarking_out-of-distribution_performance_prediction.md
!llm_evaluation/omnidiff_a_comprehensive_benchmark_for_fine-grained_image_difference_captioning.md
!llm_evaluation/on_the_robustness_tradeoff_in_fine-tuning.md
!llm_evaluation/phatnet_a_physics-guided_haze_transfer_network_for_domain-adaptive_real-world_im.md
!llm_evaluation/rethinking_few_shot_clip_benchmarks_a_critical_analysis_in_the_inductive_setting.md
!llm_evaluation/sketchsplat_3d_edge_reconstruction_via_differentiable_multi-view_sketch_splattin.md
!llm_evaluation/spectral_sensitivity_estimation_with_an_uncalibrated_diffraction_grating.md
!llm_evaluation/streammind_unlocking_full_frame_rate_streaming_video_dialogue_through_event-gate.md
!llm_evaluation/supercharging_floorplan_localization_with_semantic_rays.md
!llm_evaluation/svtrv2_ctc_beats_encoder-decoder_models_in_scene_text_recognition.md
!llm_nlp/any-ssr_how_recursive_least_squares_works_in_continual_learning_of_large_languag.md
!llm_nlp/any_ssr_how_recursive_least_squares_works_in_continual_learning_of_large_language_models.md
!llm_nlp/fw-merging_scaling_model_merging_with_frank-wolfe_optimization.md
!llm_nlp/shadowhack_hacking_shadows_via_luminance-color_divide_and_conquer.md
!llm_nlp/va_gpt_aligning_effective_tokens_video_anomaly.md
!llm_nlp/vim_versatile_interactive_motion_language_model.md
!llm_pretraining/aceg_improving_generalization_of_scene_coordinate_regression.md
!llm_pretraining/conststyle_robust_domain_generalization_with_unified_style_transformation.md
!llm_pretraining/dataset_ownership_verification_for_pre-trained_masked_models.md
!llm_pretraining/eta_energy-based_test-time_adaptation_for_depth_completion.md
!llm_pretraining/flow_to_the_mode_mode-seeking_diffusion_autoencoders_for_state-of-the-art_image_.md
!llm_pretraining/image_intrinsic_scale_assessment_bridging_the_gap_between_quality_and_resolution.md
!llm_pretraining/make_your_training_flexible_towards_deployment-efficient_video_models.md
!llm_pretraining/synchronization_of_multiple_videos.md
!llm_pretraining/syncity_training-free_generation_of_3d_worlds.md
!llm_reasoning/corvid_improving_multimodal_large_language_models_towards_chain-of-thought_reaso.md
!llm_reasoning/unsupervised_visual_chain-of-thought_reasoning_via_preference_optimization.md
!llm_reasoning/video-t1_test-time_scaling_for_video_generation.md
!llm_safety/adversarial_robust_memory-based_continual_learner.md
!llm_safety/asynchronous_event_error-minimizing_noise_for_safeguarding_event_dataset.md
!llm_safety/cooperative_pseudo_labeling_for_unsupervised_federated_classification.md
!llm_safety/enhancing_adversarial_transferability_by_balancing_exploration_and_exploitation_.md
!llm_safety/forgetting_through_transforming_enabling_federated_unlearning_via_class-aware_re.md
!llm_safety/geminio_language-guided_gradient_inversion_attacks_in_federated_learning.md
!llm_safety/latte_collaborative_test-time_adaptation_of_vision-language_models_in_federated_.md
!llm_safety/munba_machine_unlearning_via_nash_bargaining.md
!llm_safety/sauce_selective_concept_unlearning_in_vision-language_models_with_sparse_autoenc.md
!llm_safety/temporal_unlearnable_examples_preventing_personal_video_data_from_unauthorized_e.md
!medical_imaging/aczerots_active_learning_for_zeroshot_tissue_segmentation_in.md
!medical_imaging/alleviating_textual_reliance_in_medical_language-guided_segmentation_via_prototy.md
!medical_imaging/an_openmind_for_3d_medical_vision_selfsupervised_learning.md
!medical_imaging/beyond_brain_decoding_visualsemantic_reconstructions_to_ment.md
!medical_imaging/boosting_vision_semantic_density_with_anatomy_normality_modeling_for_medical_vis.md
!medical_imaging/coin_confidence_score-guided_distillation_for_annotation-free_cell_segmentation.md
!medical_imaging/controllable_latent_space_augmentation_for_digital_pathology.md
!medical_imaging/coordinate-based_speed_of_sound_recovery_for_aberration-corrected_photoacoustic_.md
!medical_imaging/cumperlay_learning_cubical_multiparameter_persistence_vectorizations.md
!medical_imaging/gdkvm_echocardiography_video_segmentation_via_spatiotemporal_key-value_memory_wi.md
!medical_imaging/gecko_gigapixel_vision-concept_contrastive_pretraining_in_histopathology.md
!medical_imaging/gemex_a_large-scale_groundable_and_explainable_medical_vqa_benchmark_for_chest_x.md
!medical_imaging/m-net_mri_brain_tumor_sequential_segmentation_network_via_mesh-cast.md
!medical_imaging/mrgen_segmentation_data_engine_for_underrepresented_mri_modalities.md
!medical_imaging/multiverseg_scalable_interactive_segmentation_of_biomedical_imaging_datasets_wit.md
!medical_imaging/neurons_emulating_the_human_visual_cortex_improves_fidelity_and_interpretability.md
!medical_imaging/progait_a_multi-purpose_video_dataset_and_benchmark_for_transfemoral_prosthesis_.md
!medical_imaging/progressive_test_time_energy_adaptation_for_medical_image_segmentation.md
!medical_imaging/pvchat_personalized_video_chat_with_one-shot_learning.md
!medical_imaging/radgpt_constructing_3d_image-text_tumor_datasets.md
!medical_imaging/scaling_tumor_segmentation_best_lessons_from_real_and_synthetic_data.md
!medical_imaging/scivid_cross-domain_evaluation_of_video_models_in_scientific_applications.md
!medical_imaging/seganypet_universal_promptable_segmentation_from_positron_emission_tomography_im.md
!medical_imaging/semi-supervised_deep_transfer_for_regression_without_domain_alignment.md
!medical_imaging/sic_similarity-based_interpretable_image_classification_with_neural_networks.md
!medical_imaging/simmlm_a_simple_framework_for_multi-modal_learning_with_missing_modality.md
!medical_imaging/teethgenerator_a_two-stage_framework_for_paired_pre-_and_post-orthodontic_3d_den.md
!medical_imaging/ukbob_one_billion_mri_labeled_masks_for_generalizable_3d_medical_image_segmentat.md
!medical_imaging/vector_contrastive_learning_for_pixel-wise_pretraining_in_medical_vision.md
!medical_imaging/victr_vital_consistency_transfer_for_pathology_aware_image_synthesis.md
!medical_imaging/visual_surface_wave_elastography_revealing_subsurface_physical_properties_via_vi.md
!model_compression/a_good_teacher_adapts_their_knowledge_for_distillation.md
!model_compression/acam-kd_adaptive_and_cooperative_attention_masking_for_knowledge_distillation.md
!model_compression/achieving_more_with_less_additive_prompt_tuning_for_rehearsal-free_class-increme.md
!model_compression/argmatch_adaptive_refinement_gathering_for_efficient_dense_matching.md
!model_compression/b-vllm_a_vision_large_language_model_with_balanced_spatio-temporal_tokens.md
!model_compression/beyond_low-rank_tuning_model_prior-guided_rank_allocation_for_effective_transfer.md
!model_compression/bridging_continuous_and_discrete_tokens_for_autoregressive_visual_generation.md
!model_compression/ciard_cyclic_iterative_adversarial_robustness_distillation.md
!model_compression/color_matching_using_hypernetwork-based_kolmogorov-arnold_networks.md
!model_compression/colors_see_colors_ignore_clothes_changing_reid_with_color_disentanglement.md
!model_compression/competitive_distillation_a_simple_learning_strategy_for_improving_visual_classif.md
!model_compression/context_guided_transformer_entropy_modeling_for_video_compression.md
!model_compression/cross-architecture_distillation_made_simple_with_redundancy_suppression.md
!model_compression/dataset_distillation_via_the_wasserstein_metric.md
!model_compression/dlf_extreme_image_compression_with_dual-generative_latent_fusion.md
!model_compression/duolora_cycle-consistent_and_rank-disentangled_content-style_personalization.md
!model_compression/ea-kd_entropy-based_adaptive_knowledge_distillation.md
!model_compression/ea-vit_efficient_adaptation_for_elastic_vision_transformer.md
!model_compression/efficient_adaptation_of_pre-trained_vision_transformer_underpinned_by_approximat.md
!model_compression/fastvar_linear_visual_autoregressive_modeling_via_cached_token_pruning.md
!model_compression/free-merging_fourier_transform_for_efficient_model_merging.md
!model_compression/frequency-aligned_knowledge_distillation_for_lightweight_spatiotemporal_forecast.md
!model_compression/fuse_before_transfer_knowledge_fusion_for_heterogeneous_distillation.md
!model_compression/gain-mlp_improving_hdr_gain_map_encoding_via_a_lightweight_mlp.md
!model_compression/generalized_tensor-based_parameter-efficient_fine-tuning_via_lie_group_transform.md
!model_compression/gradient_short-circuit_efficient_out-of-distribution_detection_via_feature_inter.md
!model_compression/heavy_labels_out_dataset_distillation_with_label_space_lightening.md
!model_compression/integrating_task-specific_and_universal_adapters_for_pre-trained_model-based_cla.md
!model_compression/knowledge_distillation_with_refined_logits.md
!model_compression/learned_image_compression_with_hierarchical_progressive_context_modeling.md
!model_compression/local_dense_logit_relations_for_enhanced_knowledge_distillation.md
!model_compression/mixa-q_revisiting_activation_sparsity_for_vision_transformers_from_a_mixed-preci.md
!model_compression/motionfollower_editing_video_motion_via_score-guided_diffusion.md
!model_compression/msq_memory-efficient_bit_sparsification_quantization.md
!model_compression/multi-object_sketch_animation_by_scene_decomposition_and_motion_planning.md
!model_compression/ouromamba_a_data-free_quantization_framework_for_vision_mamba.md
!model_compression/partial_forward_blocking_a_novel_data_pruning_paradigm_for_lossless_training_acc.md
!model_compression/perspective-aware_teaching_adapting_knowledge_for_heterogeneous_distillation.md
!model_compression/plan_proactive_low-rank_allocation_for_continual_learning.md
!model_compression/representation_shift_unifying_token_compression_with_flashattention.md
!model_compression/samo_a_lightweight_sharpness-aware_approach_for_multi-task_optimization_with_joi.md
!model_compression/scheduling_weight_transitions_for_quantization-aware_training.md
!model_compression/soft_separation_and_distillation_toward_global_uniformity_in_federated_unsupervi.md
!model_compression/ssvq_unleashing_the_potential_of_vector_quantization_with_sign-splitting.md
!model_compression/stolenlora_exploring_lora_extraction_attacks_via_synthetic_data.md
!model_compression/task_vector_quantization_for_memory-efficient_model_merging.md
!model_compression/time-aware_auto_white_balance_in_mobile_photography.md
!model_compression/tr-pts_task-relevant_parameter_and_token_selection_for_efficient_tuning.md
!model_compression/uniconvnet_expanding_effective_receptive_field_while_maintaining_asymptotically_.md
!model_compression/variance-based_pruning_for_accelerating_and_compressing_trained_networks.md
!model_compression/vit-linearizer_distilling_quadratic_knowledge_into_linear-time_vision_models.md
!model_compression/vq-sgen_a_vector_quantized_stroke_representation_for_creative_sketch_generation.md
!multilingual_mt/signrep_enhancing_self-supervised_sign_representations.md
!multimodal_vlm/a_qualityguided_mixture_of_scorefusion_experts_framework_for.md
!multimodal_vlm/acknowledging_focus_ambiguity_in_visual_questions.md
!multimodal_vlm/adaptive_prompt_learning_via_gaussian_outlier_synthesis_for_out-of-distribution_.md
!multimodal_vlm/adaptive_prompt_learning_via_gaussian_outlier_synthesis_for_out_of_distribution_detection.md
!multimodal_vlm/advancing_textual_prompt_learning_with_anchored_attributes.md
!multimodal_vlm/advdreamer_unveils_are_visionlanguage_models_truly_ready_for.md
!multimodal_vlm/aigi-holmes_towards_explainable_and_generalizable_ai-generated_image_detection_v.md
!multimodal_vlm/aigi_holmes_towards_explainable_and_generalizable_ai_generated_image_detection_via_mllm.md
!multimodal_vlm/aligning_information_capacity_between_vision_and_language_via_dense_to_sparse_feature_distillation.md
!multimodal_vlm/analyzing_finetuning_representation_shift_for_multimodal_llms_steering.md
!multimodal_vlm/are_they_the_same_exploring_visual_correspondence_shortcomings_of_multimodal_llm.md
!multimodal_vlm/attention_to_the_burstiness_in_visual_prompt_tuning.md
!multimodal_vlm/autocompose_automatic_generation_of_pose_transition_descriptions_for_composed_po.md
!multimodal_vlm/babyvlm_data-efficient_pretraining_of_vlms_inspired_by_infant_learning.md
!multimodal_vlm/background_invariance_testing_according_to_semantic_proximity.md
!multimodal_vlm/basic_boosting_visual_alignment_with_intrinsic_refined_embeddings_in_multimodal_.md
!multimodal_vlm/bidirectional_likelihood_estimation_with_multi-modal_large_language_models_for_t.md
!multimodal_vlm/cad-assistant_tool-augmented_vllms_as_generic_cad_task_solvers.md
!multimodal_vlm/calibrating_mllm-as-a-judge_via_multimodal_bayesian_prompt_ensembles.md
!multimodal_vlm/capellm_support-free_category-agnostic_pose_estimation_with_multimodal_large_lan.md
!multimodal_vlm/captionsmiths_flexibly_controlling_language_pattern_in_image_captioning.md
!multimodal_vlm/capture_evaluating_spatial_reasoning_in_vision_language_models_via_occluded_obje.md
!multimodal_vlm/causal_disentanglement_and_cross-modal_alignment_for_enhanced_few-shot_learning.md
!multimodal_vlm/chimera_improving_generalist_model_with_domain-specific_experts.md
!multimodal_vlm/clipsym_delving_into_symmetry_detection_with_clip.md
!multimodal_vlm/coavla_improving_visionlanguageaction_models_via_visualtext.md
!multimodal_vlm/compcap_improving_multimodal_large_language_models_with_composite_captions.md
!multimodal_vlm/controlling_multimodal_llms_via_rewardguided_decoding.md
!multimodal_vlm/cvpt_cross_visual_prompt_tuning.md
!multimodal_vlm/disenq_disentangling_q-former_for_activity-biometrics.md
!multimodal_vlm/dita_scaling_diffusion_transformer_for_generalist_visionlang.md
!multimodal_vlm/docthinker_explainable_multimodal_large_language_models_with.md
!multimodal_vlm/dogr_towards_versatile_visual_document_grounding_and_referring.md
!multimodal_vlm/dynamic_group_detection_using_vlm-augmented_temporal_groupness_graph.md
!multimodal_vlm/dynamic_multimodal_prototype_learning_in_vision-language_models.md
!multimodal_vlm/effective_training_data_synthesis_for_improving_mllm_chart_understanding.md
!multimodal_vlm/enhancing_few-shot_vision-language_classification_with_large_multimodal_model_fe.md
!multimodal_vlm/enrich_and_detect_video_temporal_grounding_with_multimodal_llms.md
!multimodal_vlm/evading_data_provenance_in_deep_neural_networks.md
!multimodal_vlm/evev2_improved_baselines_for_encoderfree_visionlanguage_mode.md
!multimodal_vlm/exploiting_vision_language_model_for_training-free_3d_point_cloud_ood_detection_.md
!multimodal_vlm/fa_forced_prompt_learning_of_vision-language_models_for_out-of-distribution_dete.md
!multimodal_vlm/falcon_resolving_visual_redundancy_and_fragmentation_in_high.md
!multimodal_vlm/fedmvp_federated_multimodal_visual_prompt_tuning_for_vision-language_models.md
!multimodal_vlm/fine-grained_evaluation_of_large_vision-language_models_in_autonomous_driving.md
!multimodal_vlm/free-moref_instantly_multiplexing_context_perception_capabilities_of_video-mllms.md
!multimodal_vlm/from_holistic_to_localized_local_enhanced_adapters_for_efficient_visual_instruct.md
!multimodal_vlm/g2d_boosting_multimodal_learning_with_gradient-guided_distillation.md
!multimodal_vlm/gendop_auto-regressive_camera_trajectory_generation_as_a_director_of_photography.md
!multimodal_vlm/generalizable_object_re-identification_via_visual_in-context_prompting.md
!multimodal_vlm/generate_transduct_adapt_iterative_transduction_with_vlms.md
!multimodal_vlm/geobench-vlm_benchmarking_vision-language_models_for_geospatial_tasks.md
!multimodal_vlm/global_and_local_entailment_learning_for_natural_world_imagery.md
!multimodal_vlm/grab_a_challenging_graph_analysis_benchmark_for_large_multimodal_models.md
!multimodal_vlm/gtr_guided_thought_reinforcement_prevents_thought_collapse_in_rl-based_vlm_agent.md
!multimodal_vlm/harmonizing_visual_representations_for_unified_multimodal_un.md
!multimodal_vlm/hints_of_prompt_enhancing_visual_representation_for_multimodal_llms_in_autonomou.md
!multimodal_vlm/hrscene_how_far_are_vlms_from_effective_high-resolution_image_understanding.md
!multimodal_vlm/ideator_jailbreaking_and_benchmarking_large_visionlanguage_m.md
!multimodal_vlm/information_density_principle_for_mllm_benchmarks.md
!multimodal_vlm/instruction-grounded_visual_projectors_for_continual_learning_of_generative_visi.md
!multimodal_vlm/instruction-oriented_preference_alignment_for_enhancing_multi-modal_comprehensio.md
!multimodal_vlm/interpretable_zero-shot_learning_with_locally-aligned_vision-language_model.md
!multimodal_vlm/iris_breaking_gui_complexity_with_adaptive_focus_and_self-refining.md
!multimodal_vlm/is_less_more_exploring_token_condensation_as_training-free_test-time_adaptation.md
!multimodal_vlm/jailbreaking_multimodal_large_language_models_via_shuffle_inconsistency.md
!multimodal_vlm/large_multi-modal_models_can_interpret_features_in_large_multi-modal_models.md
!multimodal_vlm/llava-kd_a_framework_of_distilling_multimodal_large_language_models.md
!multimodal_vlm/mastering_collaborative_multi-modal_data_selection_a_focus_on_informativeness_un.md
!multimodal_vlm/mavias_mitigate_any_visual_bias.md
!multimodal_vlm/mc-bench_a_benchmark_for_multi-context_visual_grounding_in_the_era_of_mllms.md
!multimodal_vlm/metamorph_multimodal_understanding_and_generation_via_instruction_tuning.md
!multimodal_vlm/mm-ifengine_towards_multimodal_instruction_following.md
!multimodal_vlm/mm-spatial_exploring_3d_spatial_understanding_in_multimodal_llms.md
!multimodal_vlm/mmone_representing_multiple_modalities_in_one_scene.md
!multimodal_vlm/multi-cache_enhanced_prototype_learning_for_test-time_generalization_of_vision-l.md
!multimodal_vlm/multimodal_llms_as_customized_reward_models_for_text-to-image_generation.md
!multimodal_vlm/multiverse_a_multi-turn_conversation_benchmark_for_evaluating_large_vision_and_l.md
!multimodal_vlm/musevl_modeling_unified_vlm_through_semantic_discrete_encodi.md
!multimodal_vlm/negrefine_refining_negative_label-based_zero-shot_ood_detection.md
!multimodal_vlm/oasis_one_image_is_all_you_need_for_multimodal_instruction_data_synthesis.md
!multimodal_vlm/on_large_multimodal_models_as_open-world_image_classifiers.md
!multimodal_vlm/one_perturbation_is_enough_on_generating_universal_adversarial_perturbations_aga.md
!multimodal_vlm/openvision_a_fully-open_cost-effective_family_of_advanced_vision_encoders_for_mu.md
!multimodal_vlm/oraclefusion_assisting_the_decipherment_of_oracle_bone_script_with_structurally_.md
!multimodal_vlm/orderchain_towards_general_instruct-tuning_for_stimulating_the_ordinal_understan.md
!multimodal_vlm/physsplat_efficient_physics_simulation_for_3d_scenes_via_mllm-guided_gaussian_sp.md
!multimodal_vlm/pi-gps_enhancing_geometry_problem_solving_by_unleashing_the_power_of_diagrammati.md
!multimodal_vlm/pro-vpt_distribution-adaptive_visual_prompt_tuning_via_prompt_relocation.md
!multimodal_vlm/probres_probabilistic_jump_diffusion_for_open-world_egocentric_activity_recognit.md
!multimodal_vlm/safeguarding_vision-language_models_mitigating_vulnerabilities_to_gaussian_noise.md
!multimodal_vlm/sc-captioner_improving_image_captioning_with_self-correction_by_reinforcement_le.md
!multimodal_vlm/scaling_inference-time_search_with_vision_value_model_for_improved_visual_compre.md
!multimodal_vlm/scaling_inferencetime_search_with_vision_value_model_for_imp.md
!multimodal_vlm/scaling_laws_for_native_multimodal_models.md
!multimodal_vlm/scan_bootstrapping_contrastive_pre-training_for_data_efficiency.md
!multimodal_vlm/simplevqa_multimodal_factuality_evaluation_for_multimodal_large_language_models.md
!multimodal_vlm/smolora_exploring_and_defying_dual_catastrophic_forgetting_in_continual_visual_i.md
!multimodal_vlm/sparsemm_head_sparsity_emerges_from_visual_concept_responses_in_mllms.md
!multimodal_vlm/sparsity_outperforms_low-rank_projections_in_few-shot_adaptation.md
!multimodal_vlm/spatial_preference_rewarding_for_mllms_spatial_understanding.md
!multimodal_vlm/sti-bench_are_mllms_ready_for_precise_spatial-temporal_world_understanding.md
!multimodal_vlm/synergistic_prompting_for_robust_visual_recognition_with_missing_modalities.md
!multimodal_vlm/tab_transformer_attention_bottlenecks_enable_user_intervention_and_debugging_in_.md
!multimodal_vlm/the_inter-intra_modal_measure_a_predictive_lens_on_fine-tuning_outcomes_in_visio.md
!multimodal_vlm/training-free_generation_of_temporally_consistent_rewards_from_vlms.md
!multimodal_vlm/trust_but_verify_programmatic_vlm_evaluation_in_the_wild.md
!multimodal_vlm/unified_multimodal_understanding_via_byte-pair_visual_encoding.md
!multimodal_vlm/viewsrd_3d_visual_grounding_via_structured_multi-view_decomposition.md
!multimodal_vlm/vilu_learning_vision-language_uncertainties_for_failure_prediction.md
!multimodal_vlm/vision-language_models_cant_see_the_obvious.md
!multimodal_vlm/visnumbench_evaluating_number_sense_of_multimodal_large_language_models.md
!multimodal_vlm/visual-oriented_fine-grained_knowledge_editing_for_multimodal_large_language_mod.md
!multimodal_vlm/visual_chronicles_using_multimodal_llms_to_analyze_massive_collections_of_images.md
!multimodal_vlm/visual_intention_grounding_for_egocentric_assistants.md
!multimodal_vlm/visual_interestingness_decoded_how_gpt-4o_mirrors_human_interests.md
!multimodal_vlm/vq-vla_improving_vision-language-action_models_via_scaling_vector-quantized_acti.md
!multimodal_vlm/vq_focusambiguity_acknowledging_focus_ambiguity_visual_questions.md
!multimodal_vlm/wikiautogen_towards_multi-modal_wikipedia-style_article_generation.md
!nlp_generation/beyond_isolated_words_diffusion_brush_for_handwritten_text-line_generation.md
!nlp_understanding/balancing_task-invariant_interaction_and_task-specific_adaptation_for_unified_im.md
!object_detection/3dmood_lifting_2d_to_3d_for_monocular_openset_object_detecti.md
!object_detection/adversarial_attention_perturbations_for_large_object_detection_transformers.md
!object_detection/augmenting_moment_retrieval_zero-dependency_two-stage_learning.md
!object_detection/automated_model_evaluation_for_object_detection_via_prediction_consistency_and_r.md
!object_detection/diffusion_curriculum_synthetic-to-real_data_curriculum_via_image-guided_diffusio.md
!object_detection/distil_data-free_inversion_of_suspicious_trojan_inputs_via_latent_diffusion.md
!object_detection/dynamicdino_finegrained_mixture_of_experts_tuning_for_realti.md
!object_detection/evrt-detr_latent_space_adaptation_of_image_detectors_for_event-based_vision.md
!object_detection/from_easy_to_hard_progressive_active_learning_framework_for_infrared_small_targe.md
!object_detection/intervening_in_black_box_concept_bottleneck_model_for_enhancing_human_neural_net.md
!object_detection/kaputt_a_large-scale_dataset_for_visual_defect_detection.md
!object_detection/large-scale_pre-training_for_grounded_video_caption_generation.md
!object_detection/lmm-det_make_large_multimodal_models_excel_in_object_detection.md
!object_detection/measuring_the_impact_of_rotation_equivariance_on_aerial_object_detection.md
!object_detection/openrsd_towards_open-prompts_for_object_detection_in_remote_sensing_images.md
!object_detection/revisiting_adversarial_patch_defenses_on_object_detectors_unified_evaluation_lar.md
!object_detection/sfuod_source-free_unknown_object_detection.md
!object_detection/sim-detr_unlock_detr_for_temporal_sentence_grounding.md
!object_detection/the_devil_is_in_the_spurious_correlations_boosting_moment_retrieval_with_dynamic.md
!object_detection/toward_long-tailed_online_anomaly_detection_through_class-agnostic_concepts.md
!object_detection/uncertainty-aware_gradient_stabilization_for_small_object_detection.md
!object_detection/upre_zero-shot_domain_adaptation_for_object_detection_via_unified_prompt_and_rep.md
!object_detection/visrl_intention-driven_visual_perception_via_reinforced_reasoning.md
!object_detection/visual-rft_visual_reinforcement_fine-tuning.md
!object_detection/visual_modality_prompt_for_adapting_vision-language_object_detectors.md
!object_detection/voccl3d_a_video_benchmark_dataset_for_3d_human_pose_and_shape_estimation_under_r.md
!object_detection/yolo-count_differentiable_object_counting_for_text-to-image_generation.md
!object_detection/yoloe_realtime_seeing_anything.md
!optimization/addressing_representation_collapse_in_vector_quantized_models_with_one_linear_la.md
!optimization/class-wise_federated_averaging_for_efficient_personalization.md
!optimization/federated_continual_instruction_tuning.md
!optimization/federated_prompt-tuning_with_heterogeneous_and_incomplete_multimodal_client_data.md
!optimization/learning_interpretable_queries_for_explainable_image_classification_with_informa.md
!optimization/memory-efficient_4-bit_preconditioned_stochastic_optimization.md
!optimization/zeroth-order_fine-tuning_of_llms_in_random_subspaces.md
!others/a_hyperdimensional_one_place_signature_to_represent_them_all_stackable_descripto.md
!others/a_linear_n-point_solver_for_structure_and_motion_from_asynchronous_tracks.md
!others/adaptiveae_an_adaptive_exposure_strategy_for_hdr_capturing_i.md
!others/adversarial_data_augmentation_for_single_domain_generalization_via_lyapunov_expo.md
!others/autoregressively_generating_multiview_consistent_images.md
!others/c4d_4d_made_from_3d_through_dual_correspondences.md
!others/doodle_your_keypoints_sketch-based_few-shot_keypoint_detection.md
!others/edffdnet_towards_accurate_and_efficient_unsupervised_multi-grid_image_registrati.md
!others/fixtalk_taming_identity_leakage_for_high-quality_talking_head_generation_in_extr.md
!others/hytip_hybrid_temporal_information_propagation_for_masked_conditional_residual_vi.md
!others/i_am_big_you_are_little_i_am_right_you_are_wrong.md
!others/intra-view_and_inter-view_correlation_guided_multi-view_novel_class_discovery.md
!others/is_meta-learning_out_rethinking_unsupervised_few-shot_classification_with_limite.md
!others/jigsaw_imagining_complete_shape_priors_for_object_reassembly.md
!others/joint_asymmetric_loss_for_learning_with_noisy_labels.md
!others/lacoot_layer_collapse_through_optimal_transport.md
!others/layerd_decomposing_raster_graphic_designs_into_layers.md
!others/layertracer_cognitive-aligned_layered_svg_synthesis_via_diffusion_transformer.md
!others/learning_visual_hierarchies_in_hyperbolic_space_for_image_retrieval.md
!others/loss_functions_for_predictor-based_neural_architecture_search.md
!others/magic_insert_style-aware_drag-and-drop.md
!others/nappure_adversarial_purification_for_robust_image_classification_under_non-addit.md
!others/on_the_complexity-faithfulness_trade-off_of_gradient-based_explanations.md
!others/ph-gan_physics-inspired_gan_for_generating_sar_images_under_limited_data.md
!others/processing_and_acquisition_traces_in_visual_encoders_what_does_clip_know_about_y.md
!others/recover_biological_structure_from_sparse-view_diffraction_images_with_neural_vol.md
!others/recovering_parametric_scenes_from_very_few_time-of-flight_pixels.md
!others/revisiting_image_fusion_for_multi-illuminant_white-balance_correction.md
!others/stroke2sketch_harnessing_stroke_attributes_for_training-free_sketch_generation.md
!others/switch-a-view_view_selection_learned_from_unlabeled_in-the-wild_videos.md
!others/syncdiff_synchronized_motion_diffusion_for_multi-body_human-object_interaction_s.md
!others/toward_material-agnostic_system_identification_from_videos.md
!others/you_share_beliefs_i_adapt_progressive_heterogeneous_collaborative_perception.md
!physics/jpeg_processing_neural_operator_for_backward-compatible_coding.md
!physics/resq_a_novel_framework_to_implement_residual_neural_networks_on_analog_rydberg_a.md
!reinforcement_learning/embodied_navigation_with_auxiliary_task_of_action_description_prediction.md
!reinforcement_learning/mdp3_a_training-free_approach_for_list-wise_frame_selection_in_video-llms.md
!reinforcement_learning/navq_learning_a_q-model_for_foresighted_vision-and-language_navigation.md
!reinforcement_learning/progressor_a_perceptually_guided_reward_estimator_with_self-supervised_online_re.md
!reinforcement_learning/r1-onevision_advancing_generalized_multimodal_reasoning_through_cross-modal_form.md
!reinforcement_learning/reinforcement_learning-guided_data_selection_via_redundancy_assessment.md
!reinforcement_learning/robofactory_exploring_embodied_agent_collaboration_with_compositional_constraint.md
!remote_sensing/astroloc_robust_space_to_ground_image_localizer.md
!remote_sensing/citynav_a_large-scale_dataset_for_real-world_aerial_navigation.md
!remote_sensing/geodistill_geometry-guided_self-distillation_for_weakly_supervised_cross-view_lo.md
!remote_sensing/geoexplorer_active_geo-localization_with_curiosity-driven_exploration.md
!remote_sensing/information-bottleneck_driven_binary_neural_network_for_change_detection.md
!remote_sensing/pan-crafter_learning_modality-consistent_alignment_for_pan-sharpening.md
!remote_sensing/rs-vheat_heat_conduction_guided_efficient_remote_sensing_foundation_model.md
!remote_sensing/skysense_v2_a_unified_foundation_model_for_multi-modal_remote_sensing.md
!remote_sensing/smarties_spectrum-aware_multi-sensor_auto-encoder_for_remote_sensing_images.md
!remote_sensing/towards_a_unified_copernicus_foundation_model_for_earth_vision.md
!remote_sensing/wildsat_learning_satellite_image_representations_from_wildlife_observations.md
!robotics/adaptive_articulated_object_manipulation_on_the_fly_with_foundation_model_reason.md
!robotics/anybimanual_transferring_unimanual_policy_for_general_bimanual_manipulation.md
!robotics/beyond_losses_reweighting_empowering_multi-task_learning_via_the_generalization_.md
!robotics/bridging_domain_generalization_to_multimodal_domain_generalization_via_unified_r.md
!robotics/certifiably_optimal_anisotropic_rotation_averaging.md
!robotics/combatvla_an_efficient_vision-language-action_model_for_combat_tasks_in_3d_actio.md
!robotics/cosmo_combination_of_selective_memorization_for_low-cost_vision-and-language_nav.md
!robotics/dexvlg_dexterous_vision-language-grasp_model_at_scale.md
!robotics/embodied_representation_alignment_with_mirror_neurons.md
!robotics/evolvinggrasp_evolutionary_grasp_generation_via_efficient_preference_alignment.md
!robotics/guiodyssey_a_comprehensive_dataset_for_cross-app_gui_navigation_on_mobile_device.md
!robotics/imanip_skill-incremental_learning_for_robotic_manipulation.md
!robotics/interaction-merged_motion_planning_effectively_leveraging_diverse_motion_dataset.md
!robotics/learning_4d_embodied_world_models.md
!robotics/moto_latent_motion_token_as_the_bridging_language_for_learning_robot_manipulatio.md
!robotics/navmorph_a_self-evolving_world_model_for_vision-and-language_navigation_in_conti.md
!robotics/pacgdc_label-efficient_generalizable_depth_completion_with_projection_ambiguity_.md
!robotics/pasg_a_closed-loop_framework_for_automated_geometric_primitive_extraction_and_se.md
!robotics/rep-mtl_unleashing_the_power_of_representation-level_task_saliency_for_multi-tas.md
!robotics/resolving_token-space_gradient_conflicts_token_space_manipulation_for_transforme.md
!robotics/selective_contrastive_learning_for_weakly_supervised_affordance_grounding.md
!robotics/self-supervised_learning_of_hybrid_part-aware_3d_representations_of_2d_gaussians.md
!robotics/site_towards_spatial_intelligence_thorough_evaluation.md
!robotics/transit_transient_transformer_for_non-line-of-sight_videography.md
!robotics/unziplora_separating_content_and_style_from_a_single_image.md
!robotics/weakly-supervised_learning_of_dense_functional_correspondences.md
!segmentation/2handedafforder_learning_precise_actionable_bimanual_affordances_from_human_vide.md
!segmentation/a_plugandplay_physical_motion_restoration_approach_for_inthe.md
!segmentation/advancing_visual_large_language_model_for_multi-granular_versatile_perception.md
!segmentation/animalclue_recognizing_animals_by_their_traces.md
!segmentation/auto-vocabulary_semantic_segmentation.md
!segmentation/beyond_single_images_retrieval_self-augmented_unsupervised_camouflaged_object_de.md
!segmentation/can_generative_geospatial_diffusion_models_excel_as_discriminative_geospatial_fo.md
!segmentation/cavis_context-aware_video_instance_segmentation.md
!segmentation/clot_closed_loop_optimal_transport_for_unsupervised_action_segmentation.md
!segmentation/conformalsam_unlocking_the_potential_of_foundational_segmentation_models_in_semi.md
!segmentation/corrclip_reconstructing_patch_correlations_in_clip_for_openv.md
!segmentation/correspondence_as_video_test-time_adaption_on_sam2_for_reference_segmentation_in.md
!segmentation/ddb_diffusion_driven_balancing_to_address_spurious_correlations.md
!segmentation/deris_decoupling_perception_and_cognition_for_enhanced_referring_image_segmentat.md
!segmentation/dictas_a_framework_for_class-generalizable_few-shot_anomaly_segmentation_via_dic.md
!segmentation/dynamic_dictionary_learning_for_remote_sensing_image_segmentation.md
!segmentation/e-sam_training-free_segment_every_entity_model.md
!segmentation/enhancing_transformers_through_conditioned_embedded_tokens.md
!segmentation/ensemble_foreground_management_for_unsupervised_object_discovery.md
!segmentation/exploiting_domain_properties_in_language-driven_domain_generalization_for_semant.md
!segmentation/exploring_probabilistic_modeling_beyond_domain_generalization_for_semantic_segme.md
!segmentation/floss_free_lunch_in_openvocabulary_semantic_segmentation.md
!segmentation/harnessing_massive_satellite_imagery_with_efficient_masked_image_modeling.md
!segmentation/hierarchical_visual_prompt_learning_for_continual_video_instance_segmentation.md
!segmentation/himtok_learning_hierarchical_mask_tokens_for_image_segmentation_with_large_multi.md
!segmentation/how_do_optical_flow_and_textual_prompts_collaborate_to_assist_in_audio-visual_se.md
!segmentation/hybrid-tta_continual_test-time_adaptation_via_dynamic_domain_shift_detection.md
!segmentation/implicit_counterfactual_learning_for_audio-visual_segmentation.md
!segmentation/inter2former_dynamic_hybrid_attention_for_efficient_high-precision_interactive_s.md
!segmentation/joint_self-supervised_video_alignment_and_action_segmentation.md
!segmentation/know_no_better_a_data-driven_approach_for_enhancing_negation_awareness_in_clip.md
!segmentation/know_your_attention_maps_class-specific_token_masking_for_weakly_supervised_sema.md
!segmentation/latent_expression_generation_for_referring_image_segmentation_and_grounding.md
!segmentation/lawdis_language-window-based_controllable_dichotomous_image_segmentation.md
!segmentation/layeranimate_layer-level_control_for_animation.md
!segmentation/learn2synth_learning_optimal_data_synthesis_using_hypergradients_for_brain_image.md
!segmentation/learning_precise_affordances_from_egocentric_videos_for_robotic_manipulation.md
!segmentation/legion_learning_to_ground_and_explain_for_synthetic_image_detection.md
!segmentation/legrad_an_explainability_method_for_vision_transformers_via_feature_formation_se.md
!segmentation/move_motion-guided_few-shot_video_object_segmentation.md
!segmentation/o-mama_learning_object_mask_matching_between_egocentric_and_exocentric_views.md
!segmentation/object-level_correlation_for_few-shot_segmentation.md
!segmentation/omnisam_omnidirectional_segment_anything_model_for_uda_in_panoramic_semantic_seg.md
!segmentation/on_the_generalization_of_representation_uncertainty_in_earth_observation.md
!segmentation/online_generic_event_boundary_detection.md
!segmentation/online_reasoning_video_segmentation_with_just-in-time_digital_twins.md
!segmentation/open-world_skill_discovery_from_unsegmented_demonstration_videos.md
!segmentation/partfield_learning_3d_feature_fields_for_part_segmentation_and_beyond.md
!segmentation/prompt_guidance_and_human_proximal_perception_for_hot_prediction_with_regional_j.md
!segmentation/ragnet_large-scale_reasoning-based_affordance_segmentation_benchmark_towards_gen.md
!segmentation/refer_to_any_segmentation_mask_group_with_vision-language_prompts.md
!segmentation/referdino_referring_video_object_segmentation_with_visual_grounding_foundations.md
!segmentation/refereverything_towards_segmenting_everything_we_can_speak_of_in_videos.md
!segmentation/region-based_cluster_discrimination_for_visual_representation_learning.md
!segmentation/rethinking_detecting_salient_and_camouflaged_objects_in_unconstrained_scenes.md
!segmentation/roadwork_a_dataset_and_benchmark_for_learning_to_recognize_observe_analyze_and_d.md
!segmentation/sam2long_enhancing_sam_2_for_long_video_segmentation_with_a.md
!segmentation/score_scene_context_matters_in_openvocabulary_remote_sensing.md
!segmentation/skeleton_motion_words_for_unsupervised_skeleton-based_temporal_action_segmentati.md
!segmentation/spade_spatial-aware_denoising_network_for_open-vocabulary_panoptic_scene_graph_g.md
!segmentation/stepping_out_of_similar_semantic_space_for_open-vocabulary_segmentation.md
!segmentation/tavis_text-bridged_audio-visual_segmentation_with_foundation_models.md
!segmentation/temporal_rate_reduction_clustering_for_human_motion_segmentation.md
!segmentation/tinyvim_frequency_decoupling_for_tiny_hybrid_vision_mamba.md
!segmentation/topotta_topology-enhanced_test-time_adaptation_for_tubular_structure_segmentatio.md
!segmentation/towards_omnimodal_expressions_and_reasoning_in_referring_audio-visual_segmentati.md
!segmentation/training-free_class_purification_for_open-vocabulary_semantic_segmentation.md
!segmentation/understanding_personal_concept_in_open-vocabulary_semantic_segmentation.md
!segmentation/uniglyph_unified_segmentation-conditioned_diffusion_for_precise_visual_text_synt.md
!segmentation/veggie_instructional_editing_and_reasoning_video_concepts_with_grounded_generati.md
!segmentation/vssd_vision_mamba_with_non-causal_state_space_duality.md
!segmentation/what_if_understanding_motion_through_sparse_interactions.md
!segmentation/zim_zero-shot_image_matting_for_anything.md
!self_supervised/a_hidden_stumbling_block_in_generalized_category_discovery_d.md
!self_supervised/a_tokenlevel_text_image_foundation_model_for_document_unders.md
!self_supervised/always_skip_attention.md
!self_supervised/cobl_toward_zero-shot_ordinal_layering_without_user_prompting.md
!self_supervised/from_linearity_to_non-linearity_how_masked_autoencoders_capture_spatial_correlat.md
!self_supervised/generate_refine_and_encode_leveraging_synthesized_novel_samples_for_on-the-fly_f.md
!self_supervised/improving_large_vision_and_language_models_by_learning_from_a_panel_of_peers.md
!self_supervised/loftup_learning_a_coordinatebased_feature_upsampler_for_visi.md
!self_supervised/manual-pa_learning_3d_part_assembly_from_instruction_diagrams.md
!self_supervised/mosic_optimal-transport_motion_trajectory_for_dense_self-supervised_learning.md
!self_supervised/scaling_languagefree_visual_representation_learning.md
!self_supervised/to_label_or_not_to_label_palm_-_a_predictive_model_for_evaluating_sample_efficie.md
!self_supervised/wir3d_visually-informed_and_geometry-aware_3d_shape_abstraction.md
!signal_comm/boosting_multimodal_learning_via_disentangled_gradient_learning.md
!signal_comm/generalizable_non-line-of-sight_imaging_with_learnable_physical_priors.md
!signal_comm/rectifying_magnitude_neglect_in_linear_attention.md
!social_computing/gradient_extrapolation_for_debiased_representation_learning.md
!social_computing/learning_visual_proxy_for_compositional_zero-shot_learning.md
!social_computing/no_more_sibling_rivalry_debiasing_human-object_interaction_detection.md
!social_computing/propvg_end-to-end_proposal-driven_visual_grounding_with_multi-granularity_discri.md
!time_series/i2-world_intra-inter_tokenization_for_efficient_dynamic_4d_scene_forecasting.md
!time_series/v2xpnp_vehicle-to-everything_spatio-temporal_fusion_for_multi-agent_perception_a.md
!time_series/va-moe_variables-adaptive_mixture_of_experts_for_incremental_weather_forecasting.md
!time_series/vlrmbench_a_comprehensive_and_challenging_benchmark_for_vision-language_reward_m.md
!video_generation/adversarial_distribution_matching_for_diffusion_distillation_towards_efficient_i.md
!video_generation/adversarial_distribution_matching_for_diffusion_distillation_towards_efficient_image_and_video_synthesis.md
!video_generation/aligning_moments_in_time_using_video_queries.md
!video_generation/badvideo_stealthy_backdoor_attack_against_text-to-video_generation.md
!video_generation/causal-entity_reflected_egocentric_traffic_accident_video_synthesis.md
!video_generation/d3_training-free_ai-generated_video_detection_using_second-order_features.md
!video_generation/dacon_dino_for_anime_paint_bucket_colorization_with_any_number_of_reference_imag.md
!video_generation/decouple_and_track_benchmarking_and_improving_video_diffusion_transformers_for_m.md
!video_generation/dh-facevid-1k_a_large-scale_high-quality_dataset_for_face_video_generation.md
!video_generation/disentangled_world_models_learning_to_transfer_semantic_knowledge_from_distracti.md
!video_generation/dive_taming_dino_for_subject-driven_video_editing.md
!video_generation/dollar_fewstep_video_generation_via_distillation_and_latent.md
!video_generation/dreamrelation_relation-centric_video_customization.md
!video_generation/dual-expert_consistency_model_for_efficient_and_high-quality_video_generation.md
!video_generation/dualreal_adaptive_joint_training_for_lossless_identity-motion_fusion_in_video_cu.md
!video_generation/efficientmt_efficient_temporal_adaptation_for_motion_transfer_in_text-to-video_d.md
!video_generation/etva_evaluation_of_text-to-video_alignment_via_fine-grained_question_generation_.md
!video_generation/free-form_motion_control_controlling_the_6d_poses_of_camera_and_objects_in_video.md
!video_generation/fuxi-rtm_a_physics-guided_prediction_framework_with_radiative_transfer_modeling.md
!video_generation/fvgen_accelerating_novel-view_synthesis_with_adversarial_video_diffusion_distill.md
!video_generation/generating_fast_and_slow_scalable_parallel_video_generation_with_video_interface.md
!video_generation/leanvae_an_ultra-efficient_reconstruction_vae_for_video_diffusion_models.md
!video_generation/long-context_state-space_video_world_models.md
!video_generation/long_context_tuning_for_video_generation.md
!video_generation/magicdrive-v2_high-resolution_long_video_generation_for_autonomous_driving_with_.md
!video_generation/magicmirror_id-preserved_video_generation_in_video_diffusion_transformers.md
!video_generation/motionagent_fine-grained_controllable_video_generation_via_motion_field_agent.md
!video_generation/motionshot_adaptive_motion_transfer_across_arbitrary_objects_for_text-to-video_g.md
!video_generation/multi-identity_human_image_animation_with_structural_video_diffusion.md
!video_generation/normalcrafter_learning_temporally_consistent_normals_from_video_diffusion_priors.md
!video_generation/ock_unsupervised_dynamic_video_prediction_with_object-centric_kinematics.md
!video_generation/omnihuman-1_rethinking_the_scaling-up_of_one-stage_conditioned_human_animation_m.md
!video_generation/prompt-a-video_prompt_your_video_diffusion_model_via_preference-aligned_llm.md
!video_generation/quantifying_and_narrowing_the_unknown_interactive_text-to-video_retrieval_via_un.md
!video_generation/realcam-i2v_real-world_image-to-video_generation_with_interactive_complex_camera.md
!video_generation/reangle-a-video_4d_video_generation_as_video-to-video_translation.md
!video_generation/recammaster_camera-controlled_generative_rendering_from_a_single_video.md
!video_generation/steerx_creating_any_camera-free_3d_and_4d_scenes_with_geometric_steering.md
!video_generation/stiv_scalable_text_and_image_conditioned_video_generation.md
!video_generation/sweettok_semantic-aware_spatial-temporal_tokenizer_for_compact_video_discretizat.md
!video_generation/tip-i2v_a_million-scale_real_text_and_image_prompt_dataset_for_image-to-video_ge.md
!video_generation/vace_all-in-one_video_creation_and_editing.md
!video_generation/versatile_transition_generation_with_image-to-video_diffusion.md
!video_generation/vip_iterative_online_preference_distillation_for_efficient_video_diffusion_model.md
!video_generation/vmbench_a_benchmark_for_perception-aligned_video_motion_generation.md
!video_generation/vpo_aligning_text-to-video_generation_models_with_prompt_optimization.md
!video_generation/vsrm_a_robust_mamba-based_framework_for_video_super-resolution.md
!video_generation/worldscore_a_unified_evaluation_benchmark_for_world_generation.md
!video_generation/x-dancer_expressive_music_to_human_dance_video_generation.md
!video_understanding/4d_bench_benchmarking_multimodal_llms_for_4d_object_understanding.md
!video_understanding/4dbench_benchmarking_multimodal_large_language_models_for_4d.md
!video_understanding/adaptive_hyper-graph_convolution_network_for_skeleton-based_human_action_recogni.md
!video_understanding/adaptive_hyper_graph_convolution_network_skeleton_action_recognition.md
!video_understanding/aim_adaptive_inference_multimodal_llms_token_merging_pruning.md
!video_understanding/aim_adaptive_inference_of_multi-modal_llms_via_token_merging_and_pruning.md
!video_understanding/aligning_effective_tokens_with_video_anomaly_in_large_language_models.md
!video_understanding/alltracker_efficient_dense_point_tracking_at_high_resolution.md
!video_understanding/an_empirical_study_of_autoregressive_pre-training_from_videos.md
!video_understanding/attention_to_trajectory_trajectory-aware_open-vocabulary_tracking.md
!video_understanding/beyond_label_semantics_language-guided_action_anatomy_for_few-shot_action_recogn.md
!video_understanding/beyond_the_frame_generating_360deg_panoramic_videos_from_perspective_videos.md
!video_understanding/blinktrack_feature_tracking_over_80_fps_via_events_and_images.md
!video_understanding/breaking_the_encoder_barrier_for_seamless_video-language_understanding.md
!video_understanding/despite_exploring_contrastive_deep_skeleton-pointcloud-imu-text_embeddings_for_a.md
!video_understanding/distime_distribution-based_time_representation_for_video_large_language_models.md
!video_understanding/dynimg_key_frames_with_visual_prompts_are_good_representation_for_multi-modal_vi.md
!video_understanding/egoadapt_adaptive_multisensory_distillation_and_policy_learning_for_efficient_eg.md
!video_understanding/egoppg_heart_rate_estimation_from_eye-tracking_cameras_in_egocentric_systems_to_.md
!video_understanding/emotive_event-guided_trajectory_modeling_for_3d_motion_estimation.md
!video_understanding/factorized_learning_for_temporally_grounded_video-language_models.md
!video_understanding/fine-grained_spatiotemporal_grounding_on_egocentric_videos.md
!video_understanding/flow4agent_long-form_video_understanding_via_motion_prior_from_optical_flow.md
!video_understanding/flowseek_optical_flow_made_easier_with_depth_foundation_models_and_motion_bases.md
!video_understanding/frequency-semantic_enhanced_variational_autoencoder_for_zero-shot_skeleton-based.md
!video_understanding/general_compression_framework_for_efficient_transformer_object_tracking.md
!video_understanding/hermes_temporal-coherent_long-form_understanding_with_episodes_and_semantics.md
!video_understanding/hierarchical_event_memory_for_accurate_and_low-latency_online_video_temporal_gro.md
!video_understanding/learning_to_generalize_without_bias_for_open-vocabulary_action_recognition.md
!video_understanding/memfof_high-resolution_training_for_memory-efficient_multi-frame_optical_flow_es.md
!video_understanding/mikudance_animating_character_art_with_mixed_motion_dynamics.md
!video_understanding/miore_var-miore_benchmarks_to_push_the_boundaries_of_restoration.md
!video_understanding/mobileviclip_an_efficient_video-text_model_for_mobile_devices.md
!video_understanding/moment_quantization_for_video_temporal_grounding.md
!video_understanding/multi-modal_multi-platform_person_re-identification_benchmark_and_method.md
!video_understanding/online_dense_point_tracking_with_streaming_memory.md
!video_understanding/ovg-hq_online_video_grounding_with_hybrid-modal_queries.md
!video_understanding/prior-flow_enhancing_primitive_panoramic_optical_flow_with_orthogonal_view.md
!video_understanding/q-frame_query-aware_frame_selection_and_multi-resolution_adaptation_for_video-ll.md
!video_understanding/rainbowprompt_diversity-enhanced_prompt-evolving_for_continual_learning.md
!video_understanding/residualvit_for_efficient_temporally_dense_video_encoding.md
!video_understanding/simultaneous_motion_and_noise_estimation_with_event_cameras.md
!video_understanding/sparse-dense_side-tuner_for_efficient_video_temporal_grounding.md
!video_understanding/timeexpert_an_expert-guided_video_llm_for_video_temporal_grounding.md
!video_understanding/toga_temporally_grounded_open-ended_video_qa_with_weak_supervision.md
!video_understanding/towards_efficient_general_feature_prediction_in_masked_skeleton_modeling.md
!video_understanding/towards_video_thinking_test_a_holistic_benchmark_for_advanced_video_reasoning_an.md
!video_understanding/trokens_semantic-aware_relational_trajectory_tokens_for_few-shot_action_recognit.md
!video_understanding/umdatrack_unified_multi-domain_adaptive_tracking_under_adverse_weather_condition.md
!video_understanding/unsupervised_joint_learning_of_optical_flow_and_intensity_with_event_cameras.md
!video_understanding/vamba_understanding_hour-long_videos_with_hybrid_mamba-transformers.md
!video_understanding/videollamb_long_streaming_video_understanding_with_recurrent_memory_bridges.md
!video_understanding/videominer_iteratively_grounding_key_frames_of_hour-long_videos_via_tree-based_g.md
!video_understanding/vtimecot_thinking_by_drawing_for_video_temporal_grounding_and_reasoning.md
!video_understanding/what_you_have_is_what_you_track_adaptive_and_robust_multimodal_tracking.md
!video_understanding/xtrack_multimodal_training_boosts_rgb-x_video_object_trackers.md
!vlm_efficiency/aircache_activating_inter-modal_relevancy_kv_cache_compression_for_efficient_lar.md
!vlm_efficiency/aircache_activating_inter_modal_relevancy_kv_cache_compression_for_efficient_large_vision_language_model.md
!vlm_efficiency/dynamic-vlm_simple_dynamic_visual_token_compression_for_videollm.md
!vlm_efficiency/feather_the_throttle_revisiting_visual_token_pruning_for_vision-language_model_a.md
!vlm_efficiency/folder_accelerating_multi-modal_large_language_models_with_enhanced_performance.md
!vlm_efficiency/growing_a_twig_to_accelerate_large_vision-language_models.md
!vlm_efficiency/llava-prumerge_adaptive_token_reduction_for_efficient_large_multimodal_models.md
!vlm_efficiency/matvlm_hybrid_mamba-transformer_for_efficient_vision-language_modeling.md
!vlm_efficiency/meteor_multi-encoder_collaborative_token_pruning_for_efficient_vision_language_m.md
!vlm_efficiency/shortv_efficient_multimodal_large_language_models_by_freezing_visual_tokens_in_i.md
!vlm_efficiency/sparsevila_decoupling_visual_sparsity_for_efficient_vlm_inference.md
!vlm_reasoning/boosting_mllm_reasoning_with_text-debiased_hint-grpo.md
!vlm_reasoning/chartpoint_guiding_mllms_with_grounding_reflection_for_chart_reasoning.md
!vlm_reasoning/dwim_towards_tool-aware_visual_reasoning_via_discrepancy-aware_workflow_generati.md
!vlm_reasoning/finmmr_make_financial_numerical_reasoning_more_multimodal_comprehensive_and_chal.md
!vlm_reasoning/from_easy_to_hard_the_mir_benchmark_for_progressive_interleaved_multi-image_reas.md
!vlm_reasoning/llava-cot_let_vision_language_models_reason_step-by-step.md
!vlm_reasoning/mmat1m_a_large_reasoning_dataset_for_multimodal_agent_tuning.md
!vlm_reasoning/perspective-aware_reasoning_in_vision-language_models_via_mental_imagery_simulat.md
!vlm_reasoning/physics_context_builders_a_modular_framework_for_physical_reasoning_in_vision-la.md
!vlm_reasoning/r1-vl_learning_to_reason_with_multimodal_large_language_models_via_step-wise_gro.md
!vlm_reasoning/reasonvqa_a_multi-hop_reasoning_benchmark_with_structural_knowledge_for_visual_q.md
!vlm_reasoning/taming_the_untamed_graph-based_knowledge_retrieval_and_reasoning_for_mllms_to_co.md
!vlm_reasoning/toolvqa_a_dataset_for_multistep_reasoning_vqa_with_external.md
!vlm_reasoning/training-free_personalization_via_retrieval_and_reasoning_on_fingerprints.md
!vlm_reasoning/understanding_museum_exhibits_using_vision-language_reasoning.md
