# Auto-generated: CVPR2026 paper notes ignore
# 由 src/sync_notes.py 根据 TODO.md 自动生成

# 默认忽略所有笔记
*.md
**/*.md

# 保留元数据文件
!TODO.md
!INDEX.md
!index.md

# 排除已完成笔记所在的子目录
!3d_vision/
!ai_safety/
!aigc_detection/
!anomaly_detection/
!audio_speech/
!autonomous_driving/
!causal_inference/
!computational_biology/
!earth_science/
!federated_learning/
!graph_learning/
!hallucination/
!human_understanding/
!image_generation/
!image_restoration/
!interpretability/
!knowledge_editing/
!llm_agent/
!llm_alignment/
!llm_efficiency/
!llm_nlp/
!llm_pretraining/
!llm_reasoning/
!llm_safety/
!medical_imaging/
!medical_nlp/
!model_compression/
!multi_agent/
!multimodal_vlm/
!object_detection/
!optimization/
!others/
!physics/
!reinforcement_learning/
!remote_sensing/
!robotics/
!scientific_computing/
!segmentation/
!self_supervised/
!signal_comm/
!social_computing/
!time_series/
!video_generation/
!video_understanding/
!vlm_efficiency/
!vlm_reasoning/

# 已完成笔记 (4064 篇)
!3d_vision/240fps_stereo_vision_from_monocular_mixed_spikes.md
!3d_vision/2d-lfm_lifting_foundation_model_without_3d_supervision.md
!3d_vision/3d-aware_multi-task_learning_with_cross-view_correlations_for_dense_scene_unders.md
!3d_vision/3d-fixer_coarse-to-fine_in-place_completion_for_3d_scenes_from_a_single_image.md
!3d_vision/3d-ide_3d_implicit_depth_emergent.md
!3d_vision/3d-latte_latent_space_3d_editing_from_textual_instructions.md
!3d_vision/3d-object_perception_transformer_3pt.md
!3d_vision/3d-vcd_hallucination_mitigation_in_3d-llm_embodied_agents_through_visual_contras.md
!3d_vision/3d_gaussian_splatting_at_arbitrary_resolutions_with_compact_proxy_anchors.md
!3d_vision/3d_gaussian_splatting_from_unposed_spike_stream.md
!3d_vision/3d_gaussian_splatting_with_self-constrained_priors_for_high_fidelity_surface_rec.md
!3d_vision/3d_sans_3d_scans_scalable_pre-training_from_video-generated_point_clouds.md
!3d_vision/3drawagent_teaching_llm_to_draw_in_3d_with_early_contrastive_experience.md
!3d_vision/3dreflecnet_a_large-scale_dataset_for_3d_reconstruction_of_reflective_transparen.md
!3d_vision/4c4d_4_camera_4d_gaussian_splatting.md
!3d_vision/4d_local_modeling_toward_dynamic_global_perception_for_ambiguity-free_rotation-i.md
!3d_vision/4d_primitive-mache_glueing_primitives_for_persistent_4d_scene_reconstruction.md
!3d_vision/4dequine_disentangling_motion_and_appearance_for_4d_equine_reconstruction_from_m.md
!3d_vision/a_geometric_algebra-informed_3dgs_framework_for_wireless_channel_prediction.md
!3d_vision/action-geometry_prediction_with_3d_geometric_prior_for_bimanual_manipulation.md
!3d_vision/actionmesh_animated_3d_mesh_generation_with_temporal_3d_diffusion.md
!3d_vision/activepolicy_active_gaussian_reconstruction_and_optimization_strategy_based_on_g.md
!3d_vision/adapting_point_cloud_analysis_via_multimodal_bayesian_distribution_learning.md
!3d_vision/adaptive_3d_perception_for_small_aerial_targets_under_sparse_sampling_via_reinfo.md
!3d_vision/adaptive_spatial-temporal_window_unlocking_the_potential_of_event_cameras_in_het.md
!3d_vision/aergs-slam_auto-exposure-robust_stereo_3d_gaussian_splatting_slam.md
!3d_vision/aerodgs_physically_consistent_dynamic_gaussian_splatting_for_single-sequence_aer.md
!3d_vision/aerogs_scale-aware_gaussian_splatting_for_pose-free_dynamic_uav_scene_reconstruc.md
!3d_vision/aesthetic_camera_viewpoint_suggestion_with_3d_aesthetic_field.md
!3d_vision/affine_perspective-three-point_problem.md
!3d_vision/affordgrasp_cross-modal_diffusion_for_affordance-aware_grasp_synthesis.md
!3d_vision/affordmatcher_affordance_learning_in_3d_scenes_from_visual_signifiers.md
!3d_vision/affostruction_3d_affordance_grounding_with_generative_reconstruction.md
!3d_vision/aimdepth_asymmetric_image-event_mamba_for_monocular_depth_estimation.md
!3d_vision/aligning_text_images_and_3d_structure_token-by-token.md
!3d_vision/alignpose_generalizable_6d_pose_estimation_via_multi-view_feature-metric_alignme.md
!3d_vision/amb3r_accurate_feed-forward_metric-scale_3d_reconstruction_with_backend.md
!3d_vision/anatomical_domain_shifts_test-time_heterogeneous_adaptation_for_3d_human_pose_pr.md
!3d_vision/anchorflow_training-free_3d_editing_via_latent_anchor-aligned_flows.md
!3d_vision/anchorsplat_feed-forward_3d_gaussian_splatting_with_3d_geometric_priors.md
!3d_vision/animator-centric_skeleton_generation_on_objects_with_fine-grained_details.md
!3d_vision/animimic_imitating_3d_animation_from_video_priors.md
!3d_vision/anthrotap_learning_point_tracking_with_real-world_motion.md
!3d_vision/any4d_unified_feed-forward_metric_4d_reconstruction.md
!3d_vision/any_resolution_any_geometry_from_multi-view_to_multi-patch.md
!3d_vision/anylift_scaling_motion_reconstruction_from_internet_videos_via_2d_diffusion.md
!3d_vision/anypcc_compressing_any_point_cloud_with_a_single_universal_model.md
!3d_vision/archsym_detecting_3d-grounded_architectural_symmetries_in_the_wild.md
!3d_vision/are_we_ready_for_rl_in_text-to-3d_generation_a_progressive_investigation.md
!3d_vision/area3d_active_reconstruction_agent_with_unified_feed-forward_3d_perception_and_v.md
!3d_vision/ares_unifying_asymmetric_rgb-event_stereo_for_probabilistic_scene_flow_estimatio.md
!3d_vision/armflow_autoregressive_meanflow_for_online_3d_human_reaction_generation.md
!3d_vision/art_articulated_reconstruction_transformer.md
!3d_vision/arthoi_taming_foundation_models_for_monocular_4d_reconstruction_of_hand-articula.md
!3d_vision/artiverse_a_diverse_and_physically_grounded_dataset_for_articulated_objects.md
!3d_vision/artllm_generating_articulated_assets_via_3d_llm.md
!3d_vision/artpro_self-supervised_articulated_object_reconstruction_with_adaptive_integrati.md
!3d_vision/assemblybench_physics-aware_assembly_of_complex_industrial_objects.md
!3d_vision/asymloc_towards_asymmetric_feature_matching_for_efficient_visual_localization.md
!3d_vision/autoregressive_generation_with_b-rep_holistic_token_sequence_representation.md
!3d_vision/ava-bench_atomic_visual_ability_benchmark_for_vision_foundation_models.md
!3d_vision/avatarpointillist_autoregressive_4d_gaussian_avatarization.md
!3d_vision/avggt_rethinking_global_attention_for_accelerating_vggt.md
!3d_vision/b3-seg_camera-free_training-free_3dgs_segmentation_via_analytic_eig_and_beta-ber.md
!3d_vision/ba-gs_bayesian_adaptive_gaussian_splatting_for_sfm-free_3d_reconstruction.md
!3d_vision/bea-gs_beyond_radiance_supervision_in_3dgs_for_precise_object_extraction.md
!3d_vision/benchmarking_phd-level_coding_in_3d_geometric_computer_vision.md
!3d_vision/best_segmentation_buddies_for_image-shape_correspondence.md
!3d_vision/beyond_geometry_artistic_disparity_synthesis_for_immersive_2d-to-3d.md
!3d_vision/beyond_reassembly_fractured_object_recovery_with_missing_parts.md
!3d_vision/bidirectional_cross-modal_prompting_for_event-frame_asymmetric_stereo.md
!3d_vision/block-sparse_global_attention_for_efficient_multi-view_geometry_transformers.md
!3d_vision/breaking_the_3d_dataset_bottleneck_fast_scalable_generation_of_aligned_3d_assets.md
!3d_vision/breaking_the_scalability_limit_of_multi-projector_calibration_with_embedded_came.md
!3d_vision/brepgaussian_cad_reconstruction_from_multi-view_images_with_gaussian_splatting.md
!3d_vision/bricknet_graph-backed_generative_brick_assembly.md
!3d_vision/bringing_your_portrait_to_3d_presence.md
!3d_vision/buildinggpt_auto-regressive_building_wireframe_reconstruction_model_with_reinfor.md
!3d_vision/c-genreg_training-free_3d_point_cloud_registration_by_multi-view-consistent_geom.md
!3d_vision/calitex_geometry-calibrated_attention_for_view-coherent_3d_texture_generation.md
!3d_vision/can_natural_image_autoencoders_compactly_tokenize_fmri_volumes_for_long-range_dy.md
!3d_vision/cari4d_category_agnostic_4d_reconstruction_of_human_object_interaction.md
!3d_vision/cat-gs_efficient_3dgs_rendering_for_large-scale_scenes_with_inter-frame_caching_.md
!3d_vision/catalyst4d_highfidelity_3dto4d_scene_editing_via_d.md
!3d_vision/cghair_compact_gaussian_hair_reconstruction_with_card_clustering.md
!3d_vision/changes_in_real_time_online_scene_change_detection_with_multi-view_fusion.md
!3d_vision/charge_a_comprehensive_novel_view_synthesis_benchmark_and_dataset_to_bind_them_a.md
!3d_vision/choreographing_a_world_of_dynamic_objects.md
!3d_vision/chorus_multi-teacher_pretraining_for_holistic_3d_gaussian_scene_encoding.md
!3d_vision/chronogs_disentangling_invariants_and_changes_in_multi-period_scenes.md
!3d_vision/circular-dpo_aligning_multi-stage_3d_generative_models_via_preference_feedback_l.md
!3d_vision/clay-to-stone_phase-wise_3d_gaussian_splatting_for_monocular_articulated_hand-ob.md
!3d_vision/clipgstream_clip-stream_gaussian_splatting_for_any_length_and_any_motion_multi-v.md
!3d_vision/clipoint3d_language-grounded_few-shot_unsupervised_3d_point_cloud_domain_adaptat.md
!3d_vision/color-encoded_illumination_for_high-speed_volumetric_scene_reconstruction.md
!3d_vision/color_the_devil_is_in_scene_coordinate_regression_for_large-scale_visual_localiz.md
!3d_vision/competitorformer_mitigating_query_conflicts_for_3d_instance_segmentation_via_com.md
!3d_vision/complet4r_geometric_complete_4d_reconstruction.md
!3d_vision/compose_a_unified_completion-pose_framework_for_robust_category-level_object_pos.md
!3d_vision/computational_speckle_pattern_interferometry.md
!3d_vision/conceptpose_training-free_zero-shot_object_pose_estimation_using_concept_vectors.md
!3d_vision/confidence-guided_multi-scale_aggregation_for_sparse-view_high-resolution_3d_gau.md
!3d_vision/consistent_instance_field_for_dynamic_scene_understanding.md
!3d_vision/consisvla-4d_advancing_spatiotemporal_consistency_in_efficient_3d-perception_and.md
!3d_vision/content-aware_frequency_encoding_for_implicit_neural_representations_with_fourie.md
!3d_vision/context-nav_context-driven_exploration_and_viewpoint-aware_3d_spatial_reasoning_.md
!3d_vision/copy-transform-paste_zero-shot_object-object_alignment_guided_by_vision-language.md
!3d_vision/corogs_contextual_gaussian_splatting_for_robust_large-deviation_view_synthesis.md
!3d_vision/cosmo3d_open-world_promptable_3d_semantic_segmentation_through_llm-guided_canoni.md
!3d_vision/cov2pose_leveraging_spatial_covariance_for_direct_manifold-aware_6-dof_object_po.md
!3d_vision/coverage_optimization_for_camera_view_selection.md
!3d_vision/craftmesh_high-fidelity_generative_mesh_manipulation_via_poisson_seamless_fusion.md
!3d_vision/cross-instance_gaussian_splatting_registration_via_geometry-aware_feature-guided.md
!3d_vision/cross-view_splatter_feed-forward_view_synthesis_with_georeferenced_images.md
!3d_vision/crosshoi_learning_cross-view_representations_for_monocular_3d_human-object_inter.md
!3d_vision/crowdgaussian_reconstructing_high-fidelity_3d_gaussians_for_human_crowd_from_a_s.md
!3d_vision/cube_bspline_3d_faces.md
!3d_vision/cupid_generative_3d_reconstruction_via_joint_object_and_pose_modeling.md
!3d_vision/curvature-aware_captioning_leveraging_geodesic_attention_for_3d_scene_understand.md
!3d_vision/customtex_high-fidelity_indoor_scene_texturing_via_multi-reference_customization.md
!3d_vision/d-prism_differentiable_primitives_for_structured_dynamic_modeling.md
!3d_vision/dark3r_learning_structure_from_motion_in_the_dark.md
!3d_vision/deep_feature_deformation_weights.md
!3d_vision/deformation-based_in-context_learning_for_point_cloud_understanding.md
!3d_vision/dehallu3d_hallucination-mitigated_3d_generation_from_a_single_image_via_cyclic_v.md
!3d_vision/denali_a_dataset_enabling_non-line-of-sight_spatial_reasoning_with_low-cost_lida.md
!3d_vision/dense_metric_depth_completion_from_sparse_direct_time-of-flight_sensors.md
!3d_vision/depth_any_panoramas_a_foundation_model_for_panoramic_depth_estimation.md
!3d_vision/depth_hypothesis_guided_iterative_refinement_for_event-image_monocular_depth_est.md
!3d_vision/depth_peeling_for_high-fidelity_gaussian-enhanced_surfel_rendering.md
!3d_vision/depthfocus_controllable_depth_estimation_for_see-through_scenes.md
!3d_vision/detany4d_detect_anything_4d_temporally_in_a_streaming_rgb_video.md
!3d_vision/dicart_advancing_category-level_articulated_object_pose_estimation_in_discrete_s.md
!3d_vision/differentiable_adaptive_4d_structured_illumination_for_joint_capture_of_shape_an.md
!3d_vision/diffsoup_direct_differentiable_rasterization_of_triangle_soup_for_extreme_radian.md
!3d_vision/diffusionharmonizer_bridging_neural_reconstruction_and_photorealistic_simulation.md
!3d_vision/dino_eats_clip_adapting_beyond_knowns_for_open-set_3d_object_retrieval.md
!3d_vision/directfisheye-gs_enabling_native_fisheye_input_in_gaussian_splatting_with_cross-.md
!3d_vision/disco-gs_gaussian_splatting_in_dynamic_color_lighting.md
!3d_vision/distilling_unsigned_distance_function_for_surface_reconstruction_from_3d_gaussia.md
!3d_vision/dmaligner_enhancing_image_alignment_via_diffusion_model_based_view_synthesis.md
!3d_vision/droid-slam_in_the_wild.md
!3d_vision/dropping_anchor_and_spherical_harmonics_for_sparse-view_gaussian_splatting.md
!3d_vision/dualprim_compact_3d_reconstruction_with_positive_and_negative_primitives.md
!3d_vision/dualsplat_robust_3d_gaussian_splatting_via_pseudo-mask_bootstrapping_from_recons.md
!3d_vision/duomo_dual_motion_diffusion_for_world-space_human_reconstruction.md
!3d_vision/dvgt_driving_visual_geometry_transformer.md
!3d_vision/dynamic-static_decomposition_for_novel_view_synthesis_of_dynamic_scenes_with_spi.md
!3d_vision/dynamic_black-hole_emission_tomography_with_physics-informed_neural_fields.md
!3d_vision/dynamic_visual_slam_using_a_general_3d_prior.md
!3d_vision/dynamictree_interactive_real_tree_animation_via_sparse_voxel_spectrum.md
!3d_vision/dynamicvggt_learning_dynamic_point_maps_for_4d_scene_reconstruction_in_autonomou.md
!3d_vision/e-rayzer_self-supervised_3d_reconstruction_as_spatial_visual_pre-training.md
!3d_vision/e2egs_event-to-edge_gaussian_splatting_for_pose-free_3d_reconstruction.md
!3d_vision/easy3e_feed-forward_3d_asset_editing_via_rectified_voxel_flow.md
!3d_vision/ecosplat_efficiency-controllable_feed-forward_3d_gaussian_splatting_from_multi-v.md
!3d_vision/edges_compete_for_trust_group_relative_edge_optimization_for_building_reconstruc.md
!3d_vision/edgs_eliminating_densification_for_efficient_convergence_of_3dgs.md
!3d_vision/edit2perceive_image_editing_diffusion_models_are_strong_dense_perceivers.md
!3d_vision/efficient_hybrid_se3-equivariant_visuomotor_flow_policy_via_spherical_harmonics_.md
!3d_vision/efficiently_reconstructing_dynamic_scenes_one_d4rt_at_a_time.md
!3d_vision/efficientmonohair_fast_strand-level_reconstruction_from_monocular_video_via_mult.md
!3d_vision/efficientvpr_toward_efficient_visual_place_recognition_via_scene-aware_prompt_tu.md
!3d_vision/eg-3dvg_expression_and_geometry_aware_grounding_decoder_for_3d_visual_grounding.md
!3d_vision/ego-1k_--_a_large-scale_multiview_video_dataset_for_egocentric_vision.md
!3d_vision/egocentric_visibility-aware_human_pose_estimation.md
!3d_vision/ei-partexplode_for_completion_and_implode_for_refinement.md
!3d_vision/elastic3d_controllable_stereo_video_conversion_with_guided_latent_decoding.md
!3d_vision/electromagnetic_inverse_scattering_from_a_single_transmitter.md
!3d_vision/elite_efficient_gaussian_head_avatar_from_a_monocular_video_via_learned_initiali.md
!3d_vision/embodiedsplat_online_feed-forward_semantic_3dgs_for_open-vocabulary_3d_scene_und.md
!3d_vision/embodmocap_in-the-wild_4d_human-scene_reconstruction_for_embodied_agents.md
!3d_vision/emergent_extreme-view_geometry_in_3d_foundation_models.md
!3d_vision/emergent_outlier_view_rejection_in_visual_geometry_grounded_transformers.md
!3d_vision/emgauss_continuous_slice-to-3d_reconstruction_via_dynamic_gaussian_modeling_in_v.md
!3d_vision/emodifftalk_emotion-aware_diffusion_for_editable_3d_gaussian_talking_head.md
!3d_vision/emotag_emotion-aware_talking_head_synthesis_on_gaussian_splatting_with_few-shot_.md
!3d_vision/energy-gs_image_energy-guided_pose_alignment_gaussian_splatting_with_redesigned_.md
!3d_vision/enhancing_hands_in_3d_whole-body_pose_estimation_with_conditional_hands_modulato.md
!3d_vision/eretinexgs_retinex_modeling_for_low-light_scene_enhancement_via_event_streams_an.md
!3d_vision/esam_efficient_online_3d_perception_on_the_edge.md
!3d_vision/eulerian_gaussian_splatting_using_hashed_probability_pyramids.md
!3d_vision/ev-cgnet_co-visible_focused_3d-guided_2d_event_keypoint_detection_network.md
!3d_vision/event-based_visual_deformation_measurement.md
!3d_vision/event_stream_filtering_via_probability_flux_estimation.md
!3d_vision/event_structural_valley_a_unified_theoretical_and_practical_framework_for_event_.md
!3d_vision/eventhub_data_factory_for_generalizable_event-based_stereo_networks_without_acti.md
!3d_vision/evidential_neural_radiance_fields.md
!3d_vision/evobj_learning_evolving_object-centric_representations_for_3d_instance_segmentat.md
!3d_vision/exact-gs_mathematically_rigorous_and_accurate_3d_gaussian_splatting_for_3d_x-ray.md
!3d_vision/exmesh_explicit_mesh_reconstruction_with_topology_adaptation.md
!3d_vision/exploring_6d_object_pose_estimation_with_deformation.md
!3d_vision/extend3d_town-scale_3d_generation.md
!3d_vision/extrinsplat_decoupling_geometry_and_semantics_for_open-vocabulary_understanding_.md
!3d_vision/face_a_face-based_autoregressive_representation_for_high-fidelity_and_efficient_.md
!3d_vision/faithful_contouring_near-lossless_3d_voxel_representation_free_from_iso-surface.md
!3d_vision/fast-foundationstereo_real-time_zero-shot_stereo_matching.md
!3d_vision/fast3dcache_training-free_3d_geometry_synthesis_acceleration.md
!3d_vision/fast_markov_random_field_optimisation_for_topologically_noisy_3d_shape_matching.md
!3d_vision/fast_scenescript_fast_and_accurate_language-based_3d_scene_understanding_via_mul.md
!3d_vision/fast_spatial_tracking_with_visual_geometry_transformer.md
!3d_vision/faster-gs_analyzing_and_improving_gaussian_splatting_optimization.md
!3d_vision/fasteventdgs_deformable_gaussian_splatting_for_fast_dynamic_scenes_from_a_single.md
!3d_vision/fastgs_training_3d_gaussian_splatting_in_100_seconds.md
!3d_vision/featurising_pixels_from_dynamic_3d_scenes_with_linear_in-context_learners.md
!3d_vision/feed-forward_gaussian_registration_for_head_avatar_creation_and_editing.md
!3d_vision/feed-forward_one-shot_animatable_textured_mesh_avatar_reconstruction.md
!3d_vision/few-shot_incremental_3d_object_detection_in_dynamic_indoor_environments.md
!3d_vision/fhavatar_fast_and_high-fidelity_reconstruction_of_face-and-hair_composable_3d_he.md
!3d_vision/filtergs_traversal-free_parallel_filtering_and_adaptive_shrinking_for_large-scal.md
!3d_vision/filtr_extracting_topological_features_from_pretrained_3d_models.md
!3d_vision/fishuman_fine-grained_single-image_3d_human_reconstruction_via_multi-view_4d_rem.md
!3d_vision/flashmesh_faster_and_better_autoregressive_mesh_synthesis_via_structured_specula.md
!3d_vision/flashvggt_efficient_and_scalable_visual_geometry_transformers_with_compressed_descr.md
!3d_vision/flexavatar_flexible_large_reconstruction_model_for_animatable_gaussian_head_avat.md
!3d_vision/flow3r_factored_flow_prediction_for_scalable_visual_geometry_learning.md
!3d_vision/flow4dgs-slam_optical_flow-guided_4d_gaussian_splatting_slam.md
!3d_vision/fluidgaussian_propagating_simulation-based_uncertainty_toward_functionally-intel.md
!3d_vision/forehoi_feed-forward_3d_object_reconstruction_from_daily_hand-object_interaction.md
!3d_vision/foundry_distilling_3d_foundation_models_for_the_edge.md
!3d_vision/freeartgs_articulated_gaussian_splatting_under_free-moving_scenario.md
!3d_vision/freeform_reduced-order_deformable_simulation_from_particle-based_skinning_eigenm.md
!3d_vision/freescale_scaling_3d_scenes.md
!3d_vision/fresco_frequency-spatial_consistent_optimization_for_fine-grained_head_avatar_mo.md
!3d_vision/from_corners_to_fiducial_tags_revisiting_checkerboard_calibration_for_event_came.md
!3d_vision/from_editor_to_dense_geometry_estimator.md
!3d_vision/from_feature_learning_to_spectral_basis_learning_a_unifying_and_flexible_framewo.md
!3d_vision/from_none_to_all_self-supervised_3d_reconstruction_via_novel_view_synthesis.md
!3d_vision/from_pairs_to_sequences_track-aware_policy_gradients_for_keypoint_detection.md
!3d_vision/from_rays_to_projections_better_inputs_for_feed-forward_view_synthesis.md
!3d_vision/fsfsplatter_geometrically_accurate_reconstruction_with_free_sparse-view_images_w.md
!3d_vision/funfact_building_probabilistic_functional_3d_scene_graphs_via_factor-graph_reaso.md
!3d_vision/funrec_reconstructing_functional_3d_scenes_from_egocentric_interaction_videos.md
!3d_vision/fuser_feed-forward_multiview_3d_registration_transformer_and_se3n_diffusion_refi.md
!3d_vision/fusion_of_depth_and_semantics_for_probabilistic_floorplan_localization.md
!3d_vision/gaumvc_generative_decoupled_gaussian_representation_for_human-centric_multi-view.md
!3d_vision/gaussfusion_improving_3d_reconstruction_in_the_wild_with_a_geometry-informed_vid.md
!3d_vision/gaussian_mapping_for_evolving_scenes.md
!3d_vision/gaussianfluent_gaussian_simulation_for_dynamic_scenes_with_mixed_materials.md
!3d_vision/gaussiangrow_geometry-aware_gaussian_growing_from_3d_point_clouds_with_text_guid.md
!3d_vision/gaussianzoom_progressive_zoom-in_generative_3d_gaussian_splatting_with_geometric.md
!3d_vision/geco_geometry-consistent_regularization_for_domain_generalized_semantic_segmenta.md
!3d_vision/gen3r_3d_scene_generation_meets_feed-forward_reconstruction.md
!3d_vision/generalizable_radio-frequency_radiance_fields_for_spatial_spectrum_synthesis.md
!3d_vision/generalizable_sparse-view_3d_reconstruction_from_unconstrained_images.md
!3d_vision/generalizable_structure-aware_keypoint_correspondence_for_category-unified_3d_si.md
!3d_vision/generalized-cvo_fast_and_correspondence-free_local_point_cloud_registration_with.md
!3d_vision/generative_diffusion_priors_for_3d_mapping_of_the_dark_universe.md
!3d_vision/genmatter_perceiving_physical_objects_with_generative_matter_models.md
!3d_vision/gensplat_bridging_the_generalization_gap_in_3dgs_language_comprehension.md
!3d_vision/geodesicnvs_probability_density_geodesic_flow_matching_for_novel_view_synthesis.md
!3d_vision/geodiff4d_geometry-aware_diffusion_for_4d_head_avatar_reconstruction.md
!3d_vision/geofree-coseg_unsupervised_point_cloud-image_cross-modal_co-segmentation_without.md
!3d_vision/geometric-aware_hypergraph_reasoning_for_novel_class_discovery_in_point_cloud_se.md
!3d_vision/geometric-photometric_event-based_3d_gaussian_ray_tracing.md
!3d_vision/geometry-aligned_and_anomaly-aware_reconstruction_for_3d_anomaly_detection.md
!3d_vision/geometry-aware_cross-modal_graph_alignment_for_referring_segmentation_in_3d_gaus.md
!3d_vision/geometry-guided_3d_visual_token_pruning_for_video-language_models.md
!3d_vision/geosam2_unleashing_the_power_of_sam2_for_3d_part_segmentation.md
!3d_vision/ggpt_geometry_grounded_point_transformer.md
!3d_vision/ghosts_in_the_point_clouds_de-glaring_lidar_in_the_transient_domain.md
!3d_vision/ghpt_real-time_relightable_gaussian_splatting_using_hybrid_path_tracing.md
!3d_vision/gifsplat_generative_prior-guided_iterative_feed-forward_3d_gaussian_splatting_fr.md
!3d_vision/glint_modeling_scene-scale_transparency_via_gaussian_radiance_transport.md
!3d_vision/global-aware_edge_prioritization_for_pose_graph_initialization.md
!3d_vision/global_structure-from-motion_meets_feedforward_reconstruction.md
!3d_vision/globally_optimal_pose_from_orthographic_silhouettes.md
!3d_vision/glove2hand_synthesizing_natural_hand-object_interaction_from_multi-modal_sensing.md
!3d_vision/gm-r2_generative_matching_learning_for_unsupervised_geometric_representation_and.md
!3d_vision/gor-is_3d_gaussian_object_removal_in_the_intrinsic_space.md
!3d_vision/gp-4dgs_probabilistic_4d_gaussian_splatting_from_monocular_video_via_variational.md
!3d_vision/grounded_latents_for_entity-centric_4d_scene_generation.md
!3d_vision/gs-asm_2dgs-supervised_active_stereo_matching.md
!3d_vision/gs2_graph-based_spatial_distribution_optimization_for_compact_3d_gaussian_splatt.md
!3d_vision/gsv2x_geometry-aware_uncertainty_modeling_and_orthogonal_fusion_for_robust_roads.md
!3d_vision/guardians_of_the_hair_rescuing_soft_boundaries_in_depth_stereo_and_novel_views.md
!3d_vision/h2a2_homogeneity-aware_and_heterogeneity-aware_feature_perception_for_unified_in.md
!3d_vision/had_hallucination-aware_diffusion_priors_for_3d_reconstruction.md
!3d_vision/handdreamer_zero-shot_text_to_3d_hand_model_generation_using_corrective_hand_sha.md
!3d_vision/haptic_neural_fields_bringing_tactile_interactions_to_3d_rendered_scenes.md
!3d_vision/hermite_radial_basis_function_for_surface_reconstruction_via_differentiable_rend.md
!3d_vision/herogs_hierarchical_guidance_for_robust_3d_gaussian_splatting_under_sparse_views.md
!3d_vision/hg-i2p_bridging_modalities_for_generalizable_image-to-point-cloud_registration_v.md
!3d_vision/hierarchical_point-patch_fusion_with_adaptive_patch_codebook_for_3d_shape_anomal.md
!3d_vision/hierarchical_visual_relocalization_with_nearest_view_synthesis_from_feature_gaus.md
!3d_vision/hifi-brep_high-fidelity_latent_representation_for_robust_b-rep_generation.md
!3d_vision/high-fidelity_mobile_avatars_with_pruned_local_blendshapes.md
!3d_vision/homaloidal_parametrization_for_detecting_critical_two-view_configurations.md
!3d_vision/human_geometry_distribution_for_3d_animation_generation.md
!3d_vision/human_interaction-aware_3d_reconstruction_from_a_single_image.md
!3d_vision/humanba_human-aware_bundle_adjustment_via_global_human-camera_decoupling.md
!3d_vision/humannova_photorealistic_universal_and_rapid_3d_human_avatar_modeling_from_a_sin.md
!3d_vision/hyper-pcn_hypergraph-based_point_cloud_completion_via_high-order_correlation_mod.md
!3d_vision/hypergaussians_high-dimensional_gaussian_splatting_for_high-fidelity_animatable_.md
!3d_vision/i-scene_3d_instance_models_are_implicit_generalizable_spatial_learners.md
!3d_vision/ictpolarreal_a_polarized_reflection_and_material_dataset_of_real_world_objects.md
!3d_vision/idesplat_iterative_depth_probability_estimation_for_generalizable_3d_gaussian_sp.md
!3d_vision/illumination-consistent_human-scene_reconstruction_from_monocular_video.md
!3d_vision/ilrm_an_iterative_large_3d_reconstruction_model.md
!3d_vision/image-guided_geometric_stylization_of_3d_meshes.md
!3d_vision/image-to-point_cloud_feature_back-projection_for_multimodal_training_of_3d_seman.md
!3d_vision/inferring_compositional_4d_scenes_without_ever_seeing_one.md
!3d_vision/infinidepth_arbitrary-resolution_and_fine-grained_depth_estimation_with_neural_i.md
!3d_vision/intrinsic_geometry-appearance_consistency_optimization_for_sparse-view_gaussian_.md
!3d_vision/intrinsic_image_fusion_for_multi-view_3d_material_reconstruction.md
!3d_vision/ir-hgp_physically-aware_gaussian_inverse_rendering_for_high-illumination_scenes_.md
!3d_vision/iris_bringing_realworld_priors_into_diffusion_model_for_monocular_depth_estimation.md
!3d_vision/iris_integrating_language_into_diffusion-based_monocular_depth_estimation.md
!3d_vision/isplat_iterative_learning_for_fine-grained_gaussian_splatting.md
!3d_vision/jrm_joint_reconstruction_model_for_multiple_objects_without_alignment.md
!3d_vision/kaleidoscopic_scintillation_event_imaging.md
!3d_vision/kasalv2_fully_automatic_3d_rotational_symmetry_classification_and_axis_localizat.md
!3d_vision/kv-tracker_real-time_pose_tracking_with_transformers.md
!3d_vision/l2dgs_low-light_dynamic_gaussian_splatting.md
!3d_vision/lafite_a_generative_latent_field_for_3d_native_texturing.md
!3d_vision/lagernvs_latent_geometry_for_fully_neural_real-time_novel_view_synthesis.md
!3d_vision/lam_language_articulated_object_modelers.md
!3d_vision/landscape-awareness_for_geometric_view_diffusion_model.md
!3d_vision/langfield4d_learning_identity-adaptive_and_spatio-temporal_continuous_4d_languag.md
!3d_vision/langref3dgs_natural_language-guided_3d_referential_segmentation_from_partial_obs.md
!3d_vision/las-comp_zero-shot_3d_completion_with_latent-spatial_consistency.md
!3d_vision/laser_layer-wise_scale_alignment_for_training-free_streaming_4d_reconstruction.md
!3d_vision/lattice_democratize_high-fidelity_3d_generation_at_scale.md
!3d_vision/layered_4d-rotor_gaussian_splatting_a_compressed_representation_for_long_dynamic.md
!3d_vision/learning_3d_representations_for_spatial_intelligence_from_unposed_multi-view_ima.md
!3d_vision/learning_3d_shape_fidelity_metric_from_real-world_distortions.md
!3d_vision/learning_compact_3d_representations_from_feed-forward_novel_view_synthesis.md
!3d_vision/learning_convex_decomposition_via_feature_fields.md
!3d_vision/learning_coordinate-based_convolutional_kernels_for_continuous_se3_equivariant_a.md
!3d_vision/learning_differentiable_hierarchies_in_3d_gaussian_splatting.md
!3d_vision/learning_explicit_continuous_motion_representation_for_dynamic_gaussian_splattin.md
!3d_vision/learning_hierarchical_hyperbolic_mixture_model_for_part-aware_3d_generation.md
!3d_vision/learning_multi-view_spatial_reasoning_from_cross-view_relations.md
!3d_vision/learning_scene_coordinate_reconstruction_from_unposed_images_via_pose_graph_opti.md
!3d_vision/learning_spatial-temporal_consistency_for_3d_semantic_scene_completion.md
!3d_vision/learning_to_infer_parameterized_representations_of_plants_from_3d_scans.md
!3d_vision/learning_to_solve_pdes_on_neural_shape_representations.md
!3d_vision/lens_component_deletion_based_on_differentiable_ray_tracing.md
!3d_vision/let_it_snow_animating_3d_gaussian_scenes_with_dynamic_weather_effects_via_physic.md
!3d_vision/lidar_prompted_spatio-temporal_multi-view_stereo_for_autonomous_driving.md
!3d_vision/lifting_unlabeled_internet-level_data_for_3d_scene_understanding.md
!3d_vision/lighting-grounded_video_generation_with_renderer-based_agent_reasoning.md
!3d_vision/lighting_in_motion_spatiotemporal_hdr_lighting_estimation.md
!3d_vision/lightsplat_fast_and_memory-efficient_open-vocabulary_3d_scene_understanding_in_f.md
!3d_vision/linear_fundamental_matrix_estimation_from_7_or_5_points.md
!3d_vision/lite_any_stereo_efficient_zero-shot_stereo_matching.md
!3d_vision/litept_lighter_yet_stronger_point_transformer.md
!3d_vision/litesense_lifting_lightweight_tof_with_rgb_for_high-resolution_metric_depth_esti.md
!3d_vision/locateanything3d_vision-language_3d_detection_with_chain-of-sight.md
!3d_vision/log3d_ultra-high-resolution_3d_shape_modeling_via_local-to-global_partitioning.md
!3d_vision/long-tail_internet_photo_reconstruction.md
!3d_vision/long_scope_fully_sparse_long_range_cooperative_3d_perception.md
!3d_vision/longstream_long-sequence_streaming_autoregressive_visual_geometry.md
!3d_vision/lost_level_of_semantics_tokenization_for_3d_shapes.md
!3d_vision/low-rank_test-time_training_for_pre-trained_point_cloud_models.md
!3d_vision/lumimotion_gaussian_relighting_dynamics.md
!3d_vision/lumosaic_hyperspectral_video_via_active_illumination_and_coded-exposure_pixels.md
!3d_vision/luxremix_lighting_decomposition_and_remixing_for_indoor_scenes.md
!3d_vision/m3dlayout_a_multi-source_dataset_of_3d_indoor_layouts_and_structured_description.md
!3d_vision/magician_efficient_long-term_planning_with_imagined_gaussians_for_active_mapping.md
!3d_vision/majutsucity_language-driven_aesthetic-adaptive_city_generation_with_controllable.md
!3d_vision/mamba_learns_in_context_structure-aware_domain_generalization_for_multi-task_poi.md
!3d_vision/manifoldneus_manifold-aware_view_optimizability_for_pose-free_neural_surface_rec.md
!3d_vision/mansion_multi-floor_language-to-3d_scene_generation_for_long-horizon_tasks.md
!3d_vision/mapo_motion-aware_partitioning_of_deformable_3d_gaussian_splatting_for_high-fide.md
!3d_vision/marco_semantic_correspondence.md
!3d_vision/mark4d_temporally-consistent_watermarking_for_4d_gaussian_splatting.md
!3d_vision/masking_matters_unlocking_the_spatial_reasoning_capabilities_of_llms_for_3d_scen.md
!3d_vision/mate_material_extraction_from_single-image_via_geometric_prior.md
!3d_vision/material_magic_wand_material-aware_grouping_of_3d_parts_in_untextured_meshes.md
!3d_vision/matlat_material_latent_space_for_pbr_texture_generation.md
!3d_vision/matmart_material_reconstruction_of_3d_objects_via_diffusion.md
!3d_vision/matspray_fusing_2d_material_world_knowledge_on_3d_geometry.md
!3d_vision/md2e_modeling_depth-to-edge_cues_for_monocular_metric_depth_estimation.md
!3d_vision/merg3r_a_divide-and-conquer_approach_to_large-scale_neural_visual_geometry.md
!3d_vision/mesh-pro_asynchronous_advantage-guided_ranking_preference_optimization_for_artis.md
!3d_vision/mesh4d_4d_mesh_reconstruction_and_tracking_from_monocular_video.md
!3d_vision/meshflow_efficient_artistic_mesh_generation_via_meshvae_and_flow-based_diffusion.md
!3d_vision/meshmosaic_scaling_artist_mesh_generation_via_local-to-global_assembly.md
!3d_vision/meshripple_structured_autoregressive_generation_of_artist-meshes.md
!3d_vision/meshsplatting_differentiable_rendering_with_opaque_meshes.md
!3d_vision/meshweaver_sparse-voxel-guided_surface_weaving_for_autoregressive_mesh_generatio.md
!3d_vision/meta-learning_in-context_enables_training-free_cross_subject_brain_decoding.md
!3d_vision/metrichmsr_metric_human_mesh_and_scene_recovery_from_monocular_images.md
!3d_vision/metrogs_efficient_and_stable_reconstruction_of_geometrically_accurate_high-fidel.md
!3d_vision/mhopreg_efficient_hierarchical_multi-hop_graph_search_for_point_cloud_registrati.md
!3d_vision/mimicat_mimic_with_correspondence-aware_cascade-transformer_for_category-free_3d.md
!3d_vision/mind_the_hitch_dynamic_calibration_and_articulated_perception_for_autonomous_tru.md
!3d_vision/minimal_constraint_relaxation_for_multiview_autocalibration.md
!3d_vision/mirror_illusion_art.md
!3d_vision/mllmsplat_a_2d_mllm-powered_framework_for_3d_gaussian_splatting_understanding_ge.md
!3d_vision/mmwaveflow_unified_enhancement_and_generation_of_mmwave_human_point_clouds.md
!3d_vision/mocapanything_unified_3d_motion_capture_for_arbitrary_skeletons_from_monocular_v.md
!3d_vision/modeling_spatiotemporal_neural_frames_for_high_resolution_brain_dynamic.md
!3d_vision/monosaod_monocular_3d_object_detection_with_sparsely_annotated_label.md
!3d_vision/monovlm_monocular_3d_visual_grounding_with_vision_language_models.md
!3d_vision/more-stem_long-short_memory_recall_and_spatio-temporal_consistency_model_for_que.md
!3d_vision/more_3d_visual_geometry_reconstruction_meets_mixture-of-experts.md
!3d_vision/more_motion-aware_feed-forward_4d_reconstruction_transformer.md
!3d_vision/more_natural_more_real_object-aware_gaussian_splatting_for_3d_visual_decoding_fr.md
!3d_vision/morel_long-range_flicker-free_4d_motion.md
!3d_vision/morgs_efficient_per-gaussian_motion_reasoning_for_streamable_dynamic_3d_scenes.md
!3d_vision/mosaic-gs_monocular_scene_reconstruction_via_advanced_initialization_for_complex.md
!3d_vision/motion-aware_animatable_gaussian_avatars_deblurring.md
!3d_vision/motion_3-to-4_3d_motion_reconstruction_for_4d_synthesis.md
!3d_vision/motioncrafter_dense_geometry_and_motion_reconstruction_with_a_4d_vae.md
!3d_vision/motionscale_reconstructing_appearance_geometry_and_motion_of_dynamic_scenes_with.md
!3d_vision/movies_motion-aware_4d_dynamic_view_synthesis_in_one_second.md
!3d_vision/moving_border_ownership_for_event-based_motion_segmentation.md
!3d_vision/mscd-gs_motion-separated_cooperative_deblurring_dynamic_reconstruction_via_gauss.md
!3d_vision/msgnav_unleashing_the_power_of_multi-modal_3d_scene_graph_for_zero-shot_embodied.md
!3d_vision/mu-generf_multi-view_uncertainty-guided_generalizable_neural_radiance_fields_for.md
!3d_vision/multi-modal_frequency_decomposition_network_for_semantic_scene_completion.md
!3d_vision/multi-scale_gaussian-language_map_for_zero-shot_embodied_navigation_and_reasonin.md
!3d_vision/multi-view_consistent_3d_gaussian_head_avatars_without_multi-view_generation.md
!3d_vision/multi-view_pyramid_transformer_look_coarser_to_see_broader.md
!3d_vision/multimodal_semantic_bias_mitigation_for_diverse_text-to-3d_generation.md
!3d_vision/mum_multi-view_masked_image_modeling_for_3d_vision.md
!3d_vision/muses_designing_composing_generating_nonexistent_fantasy_3d_creatures_without_tr.md
!3d_vision/mv-roma_from_pairwise_matching_into_multi-view_track_reconstruction.md
!3d_vision/mv2uv_generating_high-quality_uv_texture_maps_with_multiview_prompts.md
!3d_vision/mv3dis_multi-view_mask_matching_via_3d_guides_for_zero-shot_3d_instance_segmenta.md
!3d_vision/mvggt_multimodal_visual_geometry_grounded_transformer_for_multiview_3d_referring.md
!3d_vision/mvinverse_feed-forward_multiview_inverse_rendering_in_seconds.md
!3d_vision/nanosd_edge_efficient_foundation_model_for_real_time_image_restoration.md
!3d_vision/natex_seamless_texture_generation_as_latent_color_diffusion.md
!3d_vision/native_and_compact_structured_latents_for_3d_generation.md
!3d_vision/natural_human_motion_recovery_by_aligning_high-order_temporal_dynamics_from_mono.md
!3d_vision/near_coupled_neural_asset-renderer_stack.md
!3d_vision/neoverse_enhancing_4d_world_model_with_in-the-wild_monocular_videos.md
!3d_vision/nerfify_multiagent_nerf_paper_to_code.md
!3d_vision/nestwork_conditional_3d_furnished_house_layout_generation_through_latent_heterog.md
!3d_vision/neu-pig_neural_preconditioned_grids_for_fast_dynamic_surface_reconstruction_on_l.md
!3d_vision/neural_dynamic_gi_random-access_neural_compression_for_temporal_lightmaps_in_dyn.md
!3d_vision/neural_field-based_3d_surface_reconstruction_of_microstructures_from_multi-detec.md
!3d_vision/neural_gabor_splatting.md
!3d_vision/neurok_generative_4d_neural_object_kinematics.md
!3d_vision/ng_gs_nerf_guided_3d_gaussian_splatting_segmentation.md
!3d_vision/ni-tex_non-isometric_image-based_garment_texture_generation.md
!3d_vision/nimbusgs_unified_3d_scene_reconstruction_under_hybrid_weather.md
!3d_vision/no_calibration_no_depth_no_problem_cross-sensor_view_synthesis_with_3d_consisten.md
!3d_vision/node-rf_learning_generalized_continuous_space-time_scene_dynamics_with_neural_od.md
!3d_vision/ntk-guided_implicit_neural_teaching.md
!3d_vision/nvgs_neural_visibility_for_occlusion_culling_in_3d_gaussian_splatting.md
!3d_vision/objectmorpher_3d-aware_image_editing_via_deformable_3dgs.md
!3d_vision/odgs-slam_omnidirectional_gaussian_splatting_slam.md
!3d_vision/off_the_grid_detection_of_primitives_for_feed-forward_3d_gaussian_splatting.md
!3d_vision/olatverse_a_large-scale_real-world_object_dataset_with_precise_lighting_control.md
!3d_vision/omg-avatar_one-shot_multi-lod_gaussian_head_avatar.md
!3d_vision/omgtex_one-stage_multi-style_facial_texture_reconstruction_without_geometry_guid.md
!3d_vision/omni-3dedit_generalized_versatile_3d_editing_in_one-pass.md
!3d_vision/omnivggt_omni-modality_driven_visual_geometry_grounded_transformer.md
!3d_vision/online3r_online_learning_for_consistent_sequential_reconstruction_based_on_geome.md
!3d_vision/onlinehmr_video-based_online_world-grounded_human_mesh_recovery.md
!3d_vision/onlinepg_online_open-vocabulary_panoptic_mapping_with_3d_gaussian_splatting.md
!3d_vision/openvo_open-world_visual_odometry_with_temporal_dynamics_awareness.md
!3d_vision/openvoxel_training-free_grouping_and_captioning_voxels_for_open-vocabulary_3d_sc.md
!3d_vision/opti-neus_neural_reconstruction_for_dual-layered_transparent_and_opaque_objects.md
!3d_vision/optical_flow_matching_reframing_optical_flow_as_continuous_transport_dynamics.md
!3d_vision/orbit_benchmarking_sfm_in_the_wild_with_360deg_video.md
!3d_vision/orbital_video_3d_foundation_priors.md
!3d_vision/ord_object-relation_decoupling_for_generalized_3d_visual_grounding.md
!3d_vision/orienpose_orientation-guided_novel_view_synthesis_for_single-image_unseen_object.md
!3d_vision/ov3r_open-vocabulary_semantic_3d_reconstruction_from_rgb_videos.md
!3d_vision/ovi-map_open-vocabulary_instance-semantic_mapping.md
!3d_vision/p2gs_physical_prior-guided_gaussian_splatting_for_photometrically_consistent_urb.md
!3d_vision/packuv_packed_gaussian_uv_maps_for_4d_volumetric_video.md
!3d_vision/pad-hand_physics-aware_diffusion_for_hand_motion_recovery.md
!3d_vision/pam_a_pose-appearance-motion_engine_for_sim-to-real_hoi_video_generation.md
!3d_vision/pandas_learnable_shape_interpolation_modeling_with_localized_control.md
!3d_vision/pano360_perspective_to_panoramic_vision_with_geometric_consistency.md
!3d_vision/pano3dcomposer_feed-forward_compositional_3d_scene_generation_from_single_panora.md
!3d_vision/panovggt_feed-forward_3d_reconstruction_from_panoramic_imagery.md
!3d_vision/paparazzo_active_mapping_of_moving_3d_objects.md
!3d_vision/parallel_rigidity_matters_for_bundle_adjustment.md
!3d_vision/parallelised_differentiable_straightest_geodesics_for_3d_meshes.md
!3d_vision/parse_part-aware_relational_spatial_modeling.md
!3d_vision/part2gs_part-aware_modeling_of_articulated_objects_using_3d_gaussian_splatting.md
!3d_vision/partdiffuser_part-wise_3d_mesh_generation_via_discrete_diffusion.md
!3d_vision/particlegs_learning_neural_gaussian_particle_dynamics_from_videos_for_prior-free.md
!3d_vision/particulate_feed-forward_3d_object_articulation.md
!3d_vision/patchalign3d_local_feature_alignment_for_dense_3d_shape_understanding.md
!3d_vision/patchscene_patch-based_voxel_diffusion_model_for_large-scale_scene_completion.md
!3d_vision/pe3r_perception-efficient_3d_reconstruction.md
!3d_vision/perceptual_3d_simulation_with_physical_world_modeling.md
!3d_vision/perchead_perceptual_head_model_for_single-image_3d_head_reconstruction_editing.md
!3d_vision/perpetualwonder_long-horizon_action-conditioned_4d_scene_generation.md
!3d_vision/photo-guided_tooth_segmentation_on_3d_oral_scan_model.md
!3d_vision/photo3d_advancing_photorealistic_3d_generation_through_structure-aligned_detail_.md
!3d_vision/phygap_physically-grounded_gaussians_with_polarization_cues.md
!3d_vision/physgaia_a_physics-aware_benchmark_with_multi-body_interactions_for_dynamic_nove.md
!3d_vision/physgm_large_physical_gaussian_4d_synthesis.md
!3d_vision/physgs_bayesian-inferred_gaussian_splatting_for_physical_property_estimation.md
!3d_vision/physhead_simulation-ready_gaussian_head_avatars.md
!3d_vision/physho_physics-based_dynamic_3d_gaussian_human_and_object_from_monocular_video.md
!3d_vision/physically_inspired_gaussian_splatting_for_hdr_novel_view_synthesis.md
!3d_vision/physir-splat_physically_consistent_thermal_infrared_radiative_transfer_in_3d_gau.md
!3d_vision/physx-anything_simulation-ready_physical_3d_assets_from_single_image.md
!3d_vision/pip-stereo_progressive_iterations_pruner_for_iterative_optimization_based_stereo.md
!3d_vision/pixarmesh_autoregressive_mesh-native_single-view_scene_reconstruction.md
!3d_vision/plug-and-play_pde_optimization_for_3d_gaussian_splatting_toward_high-quality_ren.md
!3d_vision/point4cast_streaming_dynamic_scene_reconstruction_and_forecasting.md
!3d_vision/pointcnn_performant_convolution_on_native_points.md
!3d_vision/pointgs_semantic-consistent_unsupervised_3d_point_cloud_segmentation_with_3d_gau.md
!3d_vision/pointnsp_autoregressive_3d_point_cloud_generation_with_next-scale_level-of-detai.md
!3d_vision/pointtpa_dynamic_network_parameter_adaptation_for_3d_scene_understanding.md
!3d_vision/pointworld_scaling_3d_world_models_for_in-the-wild_robotic_manipulation.md
!3d_vision/polarguide-gsdr_3d_gaussian_splatting_driven_by_polarization_priors_and_deferred.md
!3d_vision/pose-free_omnidirectional_gaussian_splatting_for_360-degree_videos_with_consiste.md
!3d_vision/posegam_robust_unseen_object_pose_estimation_via_geometry-aware_multi-view_reaso.md
!3d_vision/posegaussian_6d_pose_estimation_for_unseen_objects_via_sparse-view_object-level_.md
!3d_vision/posemaster_a_unified_3d_native_framework_for_stylized_pose_generation.md
!3d_vision/pp-brep_few-shot_b-rep_classification_with_hybrid_graph_representation.md
!3d_vision/ppisp_physically-plausible_compensation_and_control_of_photometric_variations_in.md
!3d_vision/pqdt_pseudo-query_dual_transformer_for_robust_point_cloud_restoration.md
!3d_vision/pr-iqa_partial-reference_image_quality_assessment_for_diffusion-based_novel_view.md
!3d_vision/primu_uncertainty_estimation_for_novel_views_in_gaussian_splatting_from_primitiv.md
!3d_vision/pritti_primitive-based_generation_of_controllable_and_editable_3d_semantic_urban.md
!3d_vision/progressiveavatars_progressive_animatable_3d_gaussian_avatars.md
!3d_vision/promptdepth_efficient_and_promptable_geometric_3d_vision_model_for_embodied_inte.md
!3d_vision/promptstereo_zero-shot_stereo_matching_via_structure_and_motion_prompts.md
!3d_vision/proxy-gs_unified_occlusion_priors_for_training_and_inference_in_structured_3d_ga.md
!3d_vision/prune_wisely_reconstruct_sharply_compact_3d_gaussian_splatting_via_adaptive_prun.md
!3d_vision/pv-ground_text-guided_point-voxel_interaction_for_3d_visual_grounding.md
!3d_vision/qd-pcqa_quality-aware_domain_adaptation_for_point_cloud_quality_assessment.md
!3d_vision/quadsync_quadrifocal_tensor_synchronization_via_tucker_decomposition.md
!3d_vision/query2uncertainty_robust_uncertainty_quantification_and_calibration_for_3d_objec.md
!3d_vision/queryme_query-driven_open-vocabulary_3d_object_affordances_grounding_from_multim.md
!3d_vision/r3-pcqa_ray-reprojection-reinforcement_for_no-reference_3d_point_cloud_quality_a.md
!3d_vision/radar-guided_polynomial_fitting_for_metric_depth_estimation.md
!3d_vision/radiance_meshes_for_volumetric_reconstruction.md
!3d_vision/rags_unleashing_3d_gaussian_splatting_from_4d_radar_and_monocular_cue_for_3d_obj.md
!3d_vision/random_wins_all_rethinking_grouping_strategies_for_vision_tokens.md
!3d_vision/rap_fast_feedforward_rendering-free_attribute-guided_primitive_importance_score_.md
!3d_vision/raynova_scale-temporal_autoregressive_world_modeling_in_ray_space.md
!3d_vision/real-time_dynamic_scene_rendering_with_controlled_compressibility_and_contact_aw.md
!3d_vision/real2edit2real_generating_robotic_demonstrations_via_a_3d_control_interface.md
!3d_vision/realiz3d_3d_generation_made_photorealistic_via_domain-aware_learning.md
!3d_vision/reartgs_generalizable_articulation_reconstruction_with_temporal_geometry_constra.md
!3d_vision/recovering_physically_plausible_human-object_interactions_from_monocular_videos.md
!3d_vision/reflow_self-correction_motion_learning_for_dynamic_scene_reconstruction.md
!3d_vision/regenhoi_unifying_reconstruction_and_generation_for_3d_human-object_interaction_.md
!3d_vision/registration-free_learnable_multi-view_capture_of_faces_in_dense_semantic_corres.md
!3d_vision/relags_relational_language_gaussian_splatting.md
!3d_vision/reliev3r_relieving_feed-forward_3d_reconstruction_from_multi-view_geometric_annot.md
!3d_vision/relightable_holoported_characters_capturing_and_relighting_dynamic_human_perform.md
!3d_vision/relightanyone_a_generalized_relightable_3d_gaussian_head_model.md
!3d_vision/reparameterized_tensor_ring_functional_decomposition_for_multi-dimensional_data_.md
!3d_vision/repurposing_3d_generative_model_for_autoregressive_layout_generation.md
!3d_vision/residual_primitive_fitting_of_3d_shapes_with_superfrusta.md
!3d_vision/resihmr_residual-limb_aware_single-image_3d_human_mesh_recovery_for_individuals_.md
!3d_vision/rethinking_2d-3d_registration_a_novel_network_for_high-value_zone_selection_and_.md
!3d_vision/rethinking_pose_refinement_in_3d_gaussian_splatting_under_pose_prior_and_geometr.md
!3d_vision/retimegs_continuous-time_reconstruction_of_4d_gaussian_splatting.md
!3d_vision/revisiting_3d_reconstruction_kernels_as_low-pass_filters.md
!3d_vision/revisiting_monocular_slam_with_spatio-temporal_scene_modeling.md
!3d_vision/revisiting_optimal_coding_for_i-tof_under_practical_sensor_constraints.md
!3d_vision/revisiting_pose_sensitivity_in_splat-based_computed_tomography_under_sparse-view.md
!3d_vision/revisiting_token_compression_for_accelerating_vit-based_sparse_multi-view_3d_obj.md
!3d_vision/revive_3d_refinement_via_encoded_voluminous_inflated_prior_for_volume_enhancemen.md
!3d_vision/reweaver_towards_simulation-ready_and_topology-accurate_garment_reconstruction.md
!3d_vision/rewis3d_reconstruction_improves_weaklysupervised_s.md
!3d_vision/rf4dneural_radar_fields_for_novel_view_synthesis_in_outdoor_dynamic_scenes.md
!3d_vision/rhino_reconstructing_human_interactions_with_novel_objects_from_monocular_videos.md
!3d_vision/ri-mamba_rotation-invariant_mamba_for_robust_text-to-shape_retrieval.md
!3d_vision/rigmo_unifying_rig_and_motion_learning_for_generative_animation.md
!3d_vision/rino_rotation-invariant_non-rigid_correspondences.md
!3d_vision/rise_single_static_radar-based_indoor_scene_understanding.md
!3d_vision/rng_a_unified_transformer_for_complete_3d_modeling_from_partial_observations.md
!3d_vision/robust3dgsw_toward_robust_watermarking_for_quantization-aware_3d_gaussian_splatt.md
!3d_vision/rosamdepth_robust_self-supervised_depth_estimation_leveraging_segment_anything_m.md
!3d_vision/routing_on_demand_dsnet_for_efficient_progressive_point_cloud_denoising.md
!3d_vision/rt-splatting_joint_reflection-transmission_modeling_with_gaussian_splatting.md
!3d_vision/s2-mllm_boosting_spatial_reasoning_capability_of_mllms_for_3d_visual_grounding_w.md
!3d_vision/s2am3d_scale-controllable_part_segmentation_of_3d_point_cloud.md
!3d_vision/s2d_sparse_to_dense_lifting_for_3d_reconstruction_with_minimal_inputs.md
!3d_vision/sag-gnn_semantic-aware_guided_gnn_for_descriptor-free_2d-3d_matching.md
!3d_vision/sage_scalable_agentic_3d_scene_generation_for_embodied_ai.md
!3d_vision/sam_3d_3dfy_anything_in_images.md
!3d_vision/samosaic3d_modular_scene_assembly_for_real-time_3d_segment_anything.md
!3d_vision/saqn_semantic-based_adaptive_query_network_for_3d_referring_expression_segmentat.md
!3d_vision/sasnet_spatially_adaptive_sinusoidal_networks_for_inrs.md
!3d_vision/scal3r_scalable_test-time_training_for_large-scale_3d_reconstruction.md
!3d_vision/scalable_feature_matching_via_state_space_modeling_and_sparse_correlation.md
!3d_vision/scalable_object_relation_encoding_for_better_3d_spatial_reasoning_in_large_langu.md
!3d_vision/scaling4d_pushing_the_frontier_of_video_novel_view_synthesis_through_large-scale.md
!3d_vision/scaling_view_synthesis_transformers.md
!3d_vision/scapo_self-supervised_category-level_articulated_pose_estimation_from_a_single_3.md
!3d_vision/sce-depth_a_spherical_compound_eye_framework_for_wide_fov_depth_estimation.md
!3d_vision/sce-slam_scale-consistent_monocular_slam_via_scene_coordinate_embeddings.md
!3d_vision/scene_grounding_in_the_wild.md
!3d_vision/scene_reconstruction_as_mapping_priors_for_3d_detection.md
!3d_vision/scenemaker_open-set_3d_scene_generation_with_decoupled_de-occlusion_and_pose_est.md
!3d_vision/scenes_as_tokens_multi-scale_normal_distributions_transform_tokenizer_for_genera.md
!3d_vision/scenescribe-1m_a_large-scale_video_dataset_with_comprehensive_geometric_and_sema.md
!3d_vision/scenetok_a_compressed_diffusable_token_space_for_3d_scenes.md
!3d_vision/sculpt4d_generating_4d_shapes_via_sparse-attention_diffusion_transformers.md
!3d_vision/sdgs_spatial_difference_guided_gaussian_splatting_for_simultaneous_localization_.md
!3d_vision/se3-equivariance_with_geometric_and_topological_guidance_for_category-level_obje.md
!3d_vision/sea-flow3d_simplified_efficient_and_accurate_scene_flow_via_spatial_vector_sampl.md
!3d_vision/seegroup_multi-layer_depth_estimation_of_transparent_surfaces_via_self-determine.md
!3d_vision/seeing_depth_through_frequency_and_motion_a_progressive_training_paradigm_for_mo.md
!3d_vision/seeing_through_boxes_non-line-of-sight_3d_reconstruction_from_radar_signals.md
!3d_vision/seeing_through_light_and_darkness_sensor-physics_grounded_deblurring_hdr_nerf_fr.md
!3d_vision/seele_a_unified_acceleration_framework_for_real-time_gaussian_splatting_on_mobil.md
!3d_vision/selfi_self-improving_reconstruction_engine_via_3d_geometric_feature_alignment.md
!3d_vision/semantic_foam_unifying_spatial_and_semantic_scene_decomposition.md
!3d_vision/semlt3d_semantic-guided_expert_distillation_for_camera-only_long-tailed_3d_objec.md
!3d_vision/sgad-slam_splatting_gaussians_at_adjusted_depth_for_better_radiance_fields_in_rg.md
!3d_vision/sgi_structured_2d_gaussians_for_efficient_and_compact_large_image_representation.md
!3d_vision/sgs-intrinsic_semantic-invariant_gaussian_splatting_for_sparse-view_indoor_invers.md
!3d_vision/sgsoft_learning_fused_semantic-geometric_features_for_3d_shape_correspondence_vi.md
!3d_vision/shaper_robust_conditional_3d_shape_generation_from_casual_captures.md
!3d_vision/sharptimegs_sharp_and_stable_dynamic_gaussian_splatting_via_lifespan_modulation.md
!3d_vision/simple_but_effective_triplet-based_compression_strategies_for_compact_visual_loc.md
!3d_vision/sketchfacegs_real-time_sketch-driven_face_editing_and_generation_with_gaussian_s.md
!3d_vision/skullptor_high_fidelity_3d_head_reconstruction_in_seconds_with_multi-view_normal.md
!3d_vision/sky2ground_a_benchmark_for_site_modeling_under_varying_altitude.md
!3d_vision/slarm_streaming_and_language-aligned_reconstruction_model_for_dynamic_scenes.md
!3d_vision/smokesvd_smoke_reconstruction_from_a_single_view_via_progressive_novel_view_synt.md
!3d_vision/smvrt_implicit_human_3d_modeling.md
!3d_vision/so3-equivariant_vit-adapter_for_data-efficient_zero-shot_sim-to-real_indoor_pano.md
!3d_vision/solvability_of_the_viewing_graph_under_the_affine_camera_model.md
!3d_vision/solving_minimal_problems_without_matrix_inversion_using_fft-based_interpolation.md
!3d_vision/sonoworld_from_one_image_to_a_3d_audio-visual_scene.md
!3d_vision/sope_spherical_coordinate-based_positional_embedding_for_enhancing_spatial_perce.md
!3d_vision/space-time_forecasting_of_dynamic_scenes_with_motion-aware_gaussian_grouping.md
!3d_vision/span_spatial-projection_alignment_for_monocular_3d_object_detection.md
!3d_vision/spark_sim-ready_part-level_articulated_reconstruction_with_vlm_knowledge.md
!3d_vision/sparse-view_localization_via_online_neural_3d_regression.md
!3d_vision/sparsecam4d_spatio-temporally_consistent_4d_reconstruction_from_sparse_cameras.md
!3d_vision/sparseoit_improving_order-independent_transparency_3dgs_via_active_set_method.md
!3d_vision/sparsesplat_towards_applicable_feed-forward_3d_gaussian_splatting_with_pixel-una.md
!3d_vision/spatial-sam_spatially_consistent_3d_electron_microscopy_segmentation_with_sdf_me.md
!3d_vision/spatial_matters_position-guided_3d_referring_expression_segmentation.md
!3d_vision/spatialvid_a_large-scale_video_dataset_with_spatial_annotations.md
!3d_vision/spe-mvs_spatial_position_encoding_enhanced_multi-view_stereo_with_monocular_dept.md
!3d_vision/spectrum_from_defocus_fast_spectral_imaging_with_chromatic_focal_stack.md
!3d_vision/speede3dgs_speedy_deformable_3d_gaussian_splatting_with_temporal_pruning_and_mot.md
!3d_vision/speeding_up_the_learning_of_3d_gaussians_with_much_shorter_gaussian_lists.md
!3d_vision/spherical_voronoi_directional_appearance_as_a_differentiable_partition_of_the_sp.md
!3d_vision/spidercam_low-power_snapshot_depth_from_differential_defocus.md
!3d_vision/splatent_splatting_diffusion_latents_for_novel_view_synthesis.md
!3d_vision/splatsure_selective_super-resolution_for_multi-view_consistent_3d_gaussian_splat.md
!3d_vision/sr3r_rethinking_super-resolution_3d_reconstruction_with_feed-forward_gaussian_sp.md
!3d_vision/srgcd_stability-driven_region_growth_framework_for_3d_change_detection.md
!3d_vision/st4r-splat_spatio-temporal_referring_segmentation_in_4d_gaussian_splatting.md
!3d_vision/stabilizing_streaming_video_geometry_via_dynamic_feature_normalization.md
!3d_vision/stablemtl_repurposing_latent_diffusion_models_for_multi-task_learning_from_parti.md
!3d_vision/stac_plug-and-play_spatio-temporal_aware_cache_compression_for_streaming_3d_reco.md
!3d_vision/stavatar_soft_binding_and_temporal_density_control_for_monocular_3d_head_avatars.md
!3d_vision/stochastic_ray_tracing_for_the_reconstruction_of_3d_gaussian_splatting.md
!3d_vision/sunfaded_illumination-aware_gaussian_splatting_for_dark_scenes_with_camera-mount.md
!3d_vision/sup_sub-cloud_driven_point_cloud_registration.md
!3d_vision/sv-gs_sparse_view_4d_reconstruction_with_skeleton-driven_gaussian_splatting.md
!3d_vision/swifttailor_efficient_3d_garment_generation_with_geometry_image_representation.md
!3d_vision/tagsplat_topology-aware_gaussian_splatting_for_dynamic_mesh_modeling_and_trackin.md
!3d_vision/task-driven_implicit_representations_for_automated_design_of_lidar_systems.md
!3d_vision/tavatar_topology-aware_gaussian_attribute_derivation_for_animatable_human_avatar.md
!3d_vision/tco_learning_3d_reconstruction_with_priors_in_test_time.md
!3d_vision/tehor_text-guided_3d_human_and_object_reconstruction_with_textures.md
!3d_vision/teso_online_tracking_of_essential_matrix_by_stochastic_optimization.md
!3d_vision/text-driven_3d_hand_motion_generation_from_sign_language_data.md
!3d_vision/text-image_conditioned_3d_generation.md
!3d_vision/textfm_robust_semi-dense_feature_matching_with_language_guidance.md
!3d_vision/textrix_latent_attribute_grid_for_native_texture_generation_and_beyond.md
!3d_vision/tgsformer_scalable_temporal_gaussian_splatting_for_embodied_semantic_scene_compl.md
!3d_vision/the_midas_touch_for_metric_depth.md
!3d_vision/thermal_is_always_wild_characterizing_and_addressing_challenges_in_thermal-only_.md
!3d_vision/think-then-generate_structural_chain-of-thought_reasoning_for_consistent_3d_gene.md
!3d_vision/tokengs_decoupling_3d_gaussian_prediction_from_pixels_with_learnable_tokens.md
!3d_vision/tokenhand_discrete_token_representation_for_efficient_hand_mesh_reconstruction.md
!3d_vision/tokensplat_token-aligned_3d_gaussian_splatting_for_feed-forward_pose-free_recons.md
!3d_vision/topology-aware_feature_propagation_for_unsupervised_non-rigid_point_cloud_corres.md
!3d_vision/topoma_topology-guided_multi-agent_dense_rgb_3d_reconstruction_via_distributed_i.md
!3d_vision/topomesh_high-fidelity_mesh_autoencoding_via_topological_unification.md
!3d_vision/touchdream_3d_object_completion_through_imagined_touch.md
!3d_vision/towards_foundation_models_for_3d_scene_understanding_instance-aware_self-supervi.md
!3d_vision/towards_generalized_multimodal_homography_estimation.md
!3d_vision/towards_intrinsic-aware_monocular_3d_object_detection.md
!3d_vision/towards_visual_query_localization_in_the_3d_world.md
!3d_vision/tr2m_transferring_monocular_relative_depth_to_metric_depth_with_language_descrip.md
!3d_vision/tracking-guided_4d_generation_foundation-tracker_motion_priors_for_3d_model_anim.md
!3d_vision/tracking_by_predicting_3-d_gaussians_over_time.md
!3d_vision/trophies_temporal_reconstruction_of_places_humans_and_cameras_from_multi-view_vi.md
!3d_vision/tttlrm_test-time_training_for_long_context_and_autoregressive_3d_reconstruction.md
!3d_vision/turbo-gs_accelerating_3d_gaussian_fitting_for_high-quality_radiance_fields.md
!3d_vision/twings_thin_plate_splines_warp-aligned_initialization_for_sparse-view_gaussian_s.md
!3d_vision/uavlight_a_benchmark_for_illumination-robust_3d_reconstruction_in_unmanned_aeria.md
!3d_vision/uika_fast_universal_head_avatar_from_pose-free_images.md
!3d_vision/ulf-loc_unbiased_landmark_feature_for_robust_visual_localization_with_3d_gaussia.md
!3d_vision/unblur-slam_dense_neural_slam_for_blurry_inputs.md
!3d_vision/uncertainty-driven_3d_gaussian_splatting_active_mapping_via_anisotropic_visibili.md
!3d_vision/underground_plant_exploration_non-destructive_3d_root_assessment_with_gpr_based_.md
!3d_vision/uni3r_unified_3d_reconstruction_and_semantic_understanding_via_generalizable_gau.md
!3d_vision/unicorrn_unified_correspondence_transformer_across_2d_and_3d.md
!3d_vision/unidac_universal_metric_depth_estimation_for_any_camera.md
!3d_vision/unified_primitive_proxies_for_structured_shape_completion.md
!3d_vision/unilight_a_unified_representation_for_lighting.md
!3d_vision/unipart_part-level_3d_generation_with_unified_3d_geom-seg_latents.md
!3d_vision/unipixie_unified_and_probabilistic_3d_physics_learning_via_flow_matching.md
!3d_vision/unipr_unified_object-level_real-to-sim_perception_and_reconstruction_from_a_sing.md
!3d_vision/unish_unifying_scene_and_human_reconstruction_in_a_feed-forward_pass.md
!3d_vision/unitex_universal_high_fidelity_generative_texturing_for_3d_shapes.md
!3d_vision/unleashing_the_power_of_chain-of-prediction_for_monocular_3d_object_detection.md
!3d_vision/unlocking_3d_affordance_segmentation_with_2d_semantic_knowledge.md
!3d_vision/unlocking_the_power_of_critical_factors_for_3d_visual_geometry_estimation.md
!3d_vision/unsupervised_3d_motion_estimation_using_event_camera.md
!3d_vision/unsupervised_monocular_3d_keypoint_discovery_from_multi-view_diffusion_priors.md
!3d_vision/unsupervised_multi-scale_segmentation_of_3d_subcellular_world_with_stable_diffus.md
!3d_vision/urban-gs_a_unified_3d_gaussian_splatting_framework_for_compact_and_high-fidelity.md
!3d_vision/ust-hand_an_uncertainty-aware_spatiotemporal_point_cloud_interaction_network_for.md
!3d_vision/uz3dvg_unaided_zero-shot_3d_visual_grounding_with_generated_language_conditions.md
!3d_vision/v-dpm_4d_video_reconstruction_with_dynamic_point_maps.md
!3d_vision/vad-gs_visibility-aware_densification_for_3d_gaussian_splatting_in_dynamic_urban.md
!3d_vision/variational_graph-based_normal_integration.md
!3d_vision/varsplat_uncertainty-aware_3d_gaussian_splatting_for_robust_rgb-d_slam.md
!3d_vision/vdfe_difference-aware_3d_scene_editing_with_non-intrusive_video_diffusion_priors.md
!3d_vision/velox_learning_representations_of_4d_geometry_and_appearance.md
!3d_vision/veni_variational_encoder_for_natural_illumination.md
!3d_vision/vga_empowering_aerial-ground_localization_by_visual_geometry_alignment.md
!3d_vision/vgg-t3_offline_feed-forward_3d_reconstruction_at_scale.md
!3d_vision/vggt-360_geometry-consistent_zero-shot_panoramic_depth_estimation.md
!3d_vision/vggt-det_mining_vggt_internal_priors_for_sensor-geometry-free_multi-view_indoor_.md
!3d_vision/vggt-ω.md
!3d_vision/viaformer_voxel-image_alignment_transformer_for_high-fidelity_voxel_refinement.md
!3d_vision/vimcan_visual-inertial_3d_human_pose_estimation_with_hybrid_mamba-cross-attentio.md
!3d_vision/vista4d_video_reshooting_with_4d_point_clouds.md
!3d_vision/volumetric_functional_maps.md
!3d_vision/voxify3d_pixel_art_meets_volumetric_rendering.md
!3d_vision/wanderland_geometrically_grounded_simulation_for_open-world_embodied_ai.md
!3d_vision/wave-former_through-occlusion_3d_reconstruction_via_wireless_shape_completion.md
!3d_vision/wavelet-driven_3d_anomaly_detection_under_pose-agnostic_and_sparse-view.md
!3d_vision/weathercity_urban_scene_reconstruction_with_controllable_multi-weather_transform.md
!3d_vision/what_makes_good_synthetic_training_data_for_zero-shot_stereo_matching.md
!3d_vision/where_what_why_toward_explainable_3d-gs_watermarking.md
!3d_vision/wildpose_a_unified_framework_for_robust_pose_estimation_in_the_wild.md
!3d_vision/wildrayzer_self-supervised_large_view_synthesis_in_dynamic_environments.md
!3d_vision/wonderzoom_multi-scale_3d_world_generation.md
!3d_vision/worldgen_from_text_to_traversable_and_interactive_3d_worlds.md
!3d_vision/worldstereo_bridging_camera-guided_video_generation_and_scene_reconstruction_via.md
!3d_vision/write_where_it_matters_policy-guided_watermarks_for_3d_gaussian_splatting.md
!3d_vision/x-band_radar_non-line-of-sight_imaging.md
!3d_vision/x-part_high_fidelity_and_structure_coherent_shape_decomposition_and_completion.md
!3d_vision/xpaintnet_an_extreme_lightweight_framework_for_stereoscopic_conversion_without_i.md
!3d_vision/yocity_personalized_and_boundless_3d_realistic_city_scene_generation_via_self-cr.md
!3d_vision/z-order_transformer_for_feed-forward_gaussian_splatting.md
!3d_vision/zero-shot_depth_completion_with_vision-language_model.md
!3d_vision/zero-shot_reconstruction_of_animatable_3d_avatars_with_cloth_dynamics_from_a_sin.md
!3d_vision/zipmap_linear-time_stateful_3d_reconstruction_via_test-time_training.md
!3d_vision/zoo3d_zero-shot_3d_object_detection_at_scene_level.md
!ai_safety/a_combination_of_noise_and_bilateral_filters_achieve_supralinear_and_scalable_ad.md
!ai_safety/a_provable_energy-guided_test-time_defense_boosting_adversarial_robustness_of_la.md
!ai_safety/a_sanity_check_for_multi-in-domain_face_forgery_detection_in_the_real_world.md
!ai_safety/a_unified_perspective_on_adversarial_membership_manipulation_in_vision_models.md
!ai_safety/advfm_lookahead_flow-matching_velocity-field_attacks_for_imperceptible_and_trans.md
!ai_safety/all_vehicles_can_lie_efficient_adversarial_defense_in_fully_untrusted-vehicle_co.md
!ai_safety/antistyler_defending_object_detection_models_against_adversarial_patch_attacks_u.md
!ai_safety/avfakebench_a_comprehensive_audio-video_forgery_detection_benchmark_for_av-lmms.md
!ai_safety/batman_benign_knowledge_alignment_through_malicious_null_space_in_federated_back.md
!ai_safety/beyond_cls_token_query-driven_token-level_forgery_purification_for_generalizable.md
!ai_safety/bias_at_the_end_of_the_score.md
!ai_safety/bridging_privacy_and_provenance_traceable_virtual_identity_generation.md
!ai_safety/bypassing_the_transport_plan_dynamic_reweighting_for_out-of-distribution_detecti.md
!ai_safety/campi_physical_adversarial_examples_through_camera_power_signal_injection.md
!ai_safety/clustermark_towards_robust_watermarking_for_autoregressive_image_generators_with.md
!ai_safety/computation_and_communication_efficient_federated_unlearning_via_on-server_gradi.md
!ai_safety/copylens_towards_copyrighted_characters_infringement_detection_via_copyright-awa.md
!ai_safety/cross-modal_representation_learning_for_diffusion-generated_image_detection.md
!ai_safety/dash_a_meta-attack_framework_for_synthesizing_effective_and_stealthy_adversarial.md
!ai_safety/decoupling_bias_aligning_distributions_synergistic_fairness_optimization_for_dee.md
!ai_safety/decoupling_defense_strategies_for_robust_image_watermarking.md
!ai_safety/deepfakeimpact_a_two-stage_benchmark_with_real-world_impact_in_deepfake_detectio.md
!ai_safety/deepprotect_proactive_face-swapping_defense_using_identity_blending_and_attribut.md
!ai_safety/detect_any_ai-counterfeited_text_image.md
!ai_safety/detecting_compressed_ai-generated_images_via_phase_spectrum_robustness.md
!ai_safety/dfd-hr_generalizable_deepfake_detection_via_hierarchical_routing_learning.md
!ai_safety/diffusionff_a_diffusion-based_framework_for_joint_face_forgery_detection_and_fin.md
!ai_safety/domain-skewed_federated_learning_with_feature_decoupling_and_calibration.md
!ai_safety/dso_direct_steering_optimization_for_bias_mitigation.md
!ai_safety/dualmirage_hunting_stealthy_multimodal_llm_agents_via_captchas_with_contour_and_.md
!ai_safety/editprint_general_digital_image_forensics_via_editing_fingerprint_with_self-augm.md
!ai_safety/eliminate_distance_differences_induced_by_backdoor_attacks_layer-selective_train.md
!ai_safety/enhancing_out-of-distribution_detection_with_extended_logit_normalization.md
!ai_safety/enhancing_the_security_of_visual_speaker_authentication_based_on_dynamic_lip-pri.md
!ai_safety/exposing_functional_fusion_a_new_class_of_strategic_backdoor_in_dynamic_prompt_a.md
!ai_safety/featurefool_zero-query_fooling_of_video_models_via_feature_map.md
!ai_safety/fedafd_multimodal_federated_learning_via_adversarial_fusion_and_distillation.md
!ai_safety/fedcart_tackling_long-tailed_distributions_in_federated_adversarial_training_via.md
!ai_safety/feddap_domain-aware_prototype_learning_for_federated_learning_under_domain_shift.md
!ai_safety/federated_active_learning_extreme_noniid.md
!ai_safety/fedmop_achieving_enhanced_privacy_and_performance_in_federated_learning_via_mome.md
!ai_safety/fedre_a_representation_entanglement_framework_for_model-heterogeneous_federated_.md
!ai_safety/flowhijack_a_dynamics-aware_backdoor_attack_on_flow-matching_vision-language-act.md
!ai_safety/forensic-friendly_image_manipulation_via_controllable_latent_diffusion.md
!ai_safety/fractal_camouflage_a_bio-inspired_approach_for_multi-scale_adversarial_attacks_i.md
!ai_safety/frequency-domain_manipulation_for_face_obfuscation.md
!ai_safety/from_measurement_to_mitigation_quantifying_and_reducing_identity_leakage_in_imag.md
!ai_safety/fvbench_benchmarking_deepfake_video_detection_capability_of_large_multimodal_mod.md
!ai_safety/genbreak_red_teaming_text-to-image_generation_using_large_language_models.md
!ai_safety/generative_adversarial_perturbations_with_cross-paradigm_transferability_on_loca.md
!ai_safety/good_can_sometimes_be_bad_a_unified_attack_against_3d_point_cloud_classifier_by_.md
!ai_safety/grow_watermark_generation_with_progressive_guidance_for_diffusion_models.md
!ai_safety/guardtrace-vl_detecting_unsafe_multimodel_reasoning_via_iterative_safety_supervi.md
!ai_safety/gvis_generative_vector_image_steganography.md
!ai_safety/hidden_dangers_of_compositional_generation_diagnosing_semantic_safety_failures_i.md
!ai_safety/hierarchically_robust_zero-shot_vision-language_models.md
!ai_safety/image-based_outlier_synthesis_with_training_data.md
!ai_safety/immunizing_models_against_harmful_long-horizon_fine-tuning_via_contractive_optim.md
!ai_safety/improving_adversarial_transferability_with_local_perturbation_augmentation.md
!ai_safety/jailbreaking_vision-language_models_via_dissonance-guided_suffix_optimization_an.md
!ai_safety/janus_a_lightweight_framework_for_jailbreaking_text-to-image_models_via_distribu.md
!ai_safety/lasm_layer-wise_scaling_mechanism_for_defending_pop-up_attack_on_gui_agents.md
!ai_safety/ldp-slicing_local_differential_privacy_for_images_via_randomized_bit-plane_slici.md
!ai_safety/learning_latent_concepts_for_detecting_out-of-distribution_objects.md
!ai_safety/logit-margin_repulsion_for_backdoor_defense.md
!ai_safety/maxmark_high-capacity_diffusion-native_watermarking_via_robust_and_invertible_la.md
!ai_safety/meta-fc_meta-learning_with_feature_consistency_for_robust_and_generalizable_wate.md
!ai_safety/mitigating_error_amplification_in_fast_adversarial_training.md
!ai_safety/mitigating_simplicity_bias_in_ood_detection_through_object_co-occurrence_analysi.md
!ai_safety/models_as_lego_builders_assembling_malice_from_benign_blocks_via_semantic_bluepr.md
!ai_safety/multi-paradigm_collaborative_adversarial_attack_against_multi-modal_large_langua.md
!ai_safety/no_way_to_steal_my_face_proactive_defense_against_identity-preserving_personaliz.md
!ai_safety/omni-fake_benchmarking_unified_multimodal_social_media_deepfake_detection.md
!ai_safety/one-to-more_high-fidelity_training-free_anomaly_generation_with_attention_control.md
!ai_safety/pa-attack_guiding_gray-box_attacks_on_lvlm_vision_encoders_with_prototypes_and_a.md
!ai_safety/peccvai_overcoming_the_brittleness_of_ai_image_watermarking_under_visual_paraphr.md
!ai_safety/pga_prior-free_generative_attack_for_practical_no-box_scenario.md
!ai_safety/phantom_physical_object_interactions_as_dynamic_triggers_for_nms-exploited_backd.md
!ai_safety/physical_adversarial_clothing_evades_visible-thermal_detectors_via_non-overlappi.md
!ai_safety/pinpoint_evaluation_of_composed_image_retrieval_with_explicit_negatives_multi-im.md
!ai_safety/poinit-of-view_poisoning_initialization_of_views_transfers_across_multiple_3d_re.md
!ai_safety/pour_a_provably_optimal_method_for_unlearning_representations_via_neural_collaps.md
!ai_safety/privateeyes_gaze-preserving_anonymization_for_data_sharing.md
!ai_safety/privsynth_alternating_and_control-based_optimization_for_privacy_and_utility_in_.md
!ai_safety/promptminer_black-box_prompt_stealing_against_text-to-image_generative_models_vi.md
!ai_safety/protego_user-centric_pose-invariant_privacy_protection_against_face_recognition-.md
!ai_safety/proxyfl_a_proxy-guided_framework_for_federated_semi-supervised_learning.md
!ai_safety/pureproof_diffusion-resistant_black-box_targeted_attack_on_large_vision-language.md
!ai_safety/r2tua_reconstruction-residual_based_targeted_and_untargeted_attack_against_text-.md
!ai_safety/rankood_-_class_ranking-based_out-of-distribution_detection.md
!ai_safety/rapa_enhancing_transferable_targeted_attacks_via_random_parameter_pruning.md
!ai_safety/raven_erasing_invisible_watermarks_via_novel_view_synthesis.md
!ai_safety/recovermark_robust_watermarking_for_localization_and_recovery_of_manipulated_fac.md
!ai_safety/red-teaming_retrieval-augmented_diffusion_models_via_poisoning_knowledge_bases.md
!ai_safety/reinforcement-guided_synthetic_data_generation_for_privacy-sensitive_identity_re.md
!ai_safety/remedygs_defend_3d_gaussian_splatting_against_computation_cost_attacks.md
!ai_safety/remoe_region-mixture_experts_for_adversarially-robust_vision_transformers.md
!ai_safety/revinn_an_end-to-end_invertible_neural_network_for_reversible_adversarial_exampl.md
!ai_safety/robustness_under_data_scarcity_few-shot_continual_adversarial_training_for_evolv.md
!ai_safety/roots_beneath_the_cut_uncovering_the_risk_of_concept_revival_in_pruning-based_un.md
!ai_safety/runawayevil_jailbreaking_the_image-to-video_generative_models.md
!ai_safety/safelogo_turning_your_logos_into_jailbreak_shields_via_micro-regional_adversaria.md
!ai_safety/saferope_risk-specific_head-wise_embedding_rotation_for_safe_generation_in_recti.md
!ai_safety/saga_source_attribution_of_generative_ai_videos.md
!ai_safety/saido_generalizable_detection_of_ai-generated_images_via_scene-aware_and_importa.md
!ai_safety/scaling_up_ai-generated_image_detection_with_generator-aware_prototypes.md
!ai_safety/seba_sample-efficient_black-box_attacks_on_visual_reinforcement_learning.md
!ai_safety/selective_amnesia_using_contrastive_subnet_erasure_for_class_level_unlearning_in.md
!ai_safety/shedding_light_on_vln_robustness_a_black-box_framework_for_indoor_lighting-based.md
!ai_safety/sif_semantically_in-distribution_fingerprints_for_large_vision-language_models.md
!ai_safety/skyra_ai-generated_video_detection_via_grounded_artifact_reasoning.md
!ai_safety/sparsity_as_a_key_unlocking_new_insights_from_latent_structures_for_out-of-distr.md
!ai_safety/stealing_split_learning_bottom_models_by_recovering_embedding_geometry.md
!ai_safety/taming_the_long_tail_rebalancing_adversarial_training_via_adaptive_perturbation.md
!ai_safety/the_coherence_trap_when_mllm-crafted_narratives_exploit_manipulated_visual_conte.md
!ai_safety/thermally_activated_dual-modal_adversarial_clothing_against_ai_surveillance_syst.md
!ai_safety/tokentrace_multi-concept_attribution_through_watermarked_token_recovery.md
!ai_safety/towards_highly_transferable_vision-language_attack_via_semantic-augmented_dynami.md
!ai_safety/towards_human-imperceptible_backdoor_attacks_on_text-to-image_diffusion_models.md
!ai_safety/towards_reliable_evaluation_of_adversarial_robustness_for_spiking_neural_network.md
!ai_safety/towards_robust_multimodal_large_language_models_against_jailbreak_attacks.md
!ai_safety/towards_robust_vision_transformers_path_dependency_analysis_and_a_simple_two-sta.md
!ai_safety/towards_stealthy_and_effective_backdoor_attacks_on_lane_detection_a_naturalistic.md
!ai_safety/transform_to_transfer_boosting_adversarial_attack_transferability_on_vision-lang.md
!ai_safety/ttp_test-time_padding_for_adversarial_detection_and_robust_adaptation_on_vision-.md
!ai_safety/tutor-student_reinforcement_learning_a_dynamic_curriculum_for_robust_deepfake_de.md
!ai_safety/unidef_universal_defense_against_unauthorized_image_manipulation.md
!ai_safety/unigame_turning_a_unified_multimodal_model_into_its_own_adversary.md
!ai_safety/unlearning_without_forgetting_securely_removing_targeted_concepts_from_large-sca.md
!ai_safety/unleashing_stealthy_backdoor_pandemic_by_infecting_a_single_diffusion_model.md
!ai_safety/unsafe2safe_controllable_image_anonymization_for_downstream_utility.md
!ai_safety/v-attack_targeting_disentangled_value_features_for_controllable_adversarial_atta.md
!ai_safety/vcp-attack_visual-contrastive_projection_for_transferable_black-box_targeted_att.md
!ai_safety/verifying_neural_network_robustness_with_dual_perturbations.md
!ai_safety/visilock_authorizing_instruction-based_image_editing_with_dual_score_distillatio.md
!ai_safety/vmd-fact_a_new_video_dataset_and_mllm-based_method_for_detecting_realistic_ai-ge.md
!ai_safety/waterflow_watermark_temporal_robustness_via_flow_consistency.md
!ai_safety/what_your_features_reveal_data-efficient_black-box_feature_inversion_attack_for_.md
!ai_safety/when_clip_sees_more_it_fights_back_harder_multi-view_guided_adaptive_counteratta.md
!ai_safety/when_lora_betrays_backdooring_text-to-image_models_by_masquerading_as_benign_ada.md
!ai_safety/when_robots_obey_the_patch_universal_transferable_patch_attacks_on_vision-langua.md
!ai_safety/when_understanding_becomes_a_risk_authenticity_and_safety_risks_in_the_emerging_.md
!ai_safety/x-avdt_audio-visual_cross-attention_for_robust_deepfake_detection.md
!ai_safety/your_classifier_can_do_more_towards_balancing_the.md
!ai_safety/φ-dpo_fairness_direct_preference_optimization_approach_to_continual_learning_in_.md
!aigc_detection/common_inpainted_objects_in-n-out_of_context.md
!aigc_detection/enabling_supervised_learning_of_generative_signatures_for_generalized_ai-generat.md
!aigc_detection/fine-grained_image_aesthetic_assessment_learning_discriminative_scores_from_rela.md
!aigc_detection/inconsistency-aware_multimodal_schrodinger_bridge_for_deepfake_localization.md
!aigc_detection/investigating_self-supervised_representations_for_audio-visual_deepfake_detectio.md
!aigc_detection/learning_forgery-aware_lip_representations_without_forgery_priors.md
!aigc_detection/learning_where_to_look_and_how_to_judge_resolution-agnostic_image_quality_assess.md
!aigc_detection/locate-then-examine_grounded_region_reasoning_improves_detection_of_ai-generated.md
!aigc_detection/nowa_null-space_optical_watermark_for_invisible_capture_fingerprinting_and_tampe.md
!aigc_detection/ppm-clip_probabilistic_prompt_modeling_for_generalizable_ai-generated_image_dete.md
!anomaly_detection/anomaly-related_residual_fields_for_cross-domain_anomaly_detection.md
!anomaly_detection/defect_cue-preserved_structural_feature_refinement_for_few-shot_anomaly_detectio.md
!anomaly_detection/dual-prototype-guided_multi-task_learning_for_unsupervised_anomaly_detection_and.md
!anomaly_detection/hunting_normality_from_query_sample_via_residual_learning_for_generalist_anomaly.md
!anomaly_detection/layoutad_exploring_semantic-geometric_misalignment_reasoning_for_scene_layout_an.md
!anomaly_detection/multi-prototype_compactness_and_boundary-aware_synthesis_for_unsupervised_anomal.md
!anomaly_detection/raid_retrieval-augmented_anomaly_detection.md
!audio_speech/amuse_audio-visual_benchmark_and_alignment_framework_for_agentic_multi-speaker_u.md
!audio_speech/audiostory_generating_long-form_narrative_audio_with_large_language_models.md
!audio_speech/babyvlm-v2_toward_developmentally_grounded_pretraining_and_benchmarking_of_visio.md
!audio_speech/cleaning_the_pool_progressive_filtering_of_unlabeled_pools_in_deep_active_learni.md
!audio_speech/echoes_over_time_unlocking_length_generalization_in_video-to-audio_generation_mo.md
!audio_speech/echofoley_event-centric_hierarchical_control_for_video_grounded_creative_sound_g.md
!audio_speech/foleydirector_fine-grained_temporal_steering_for_video-to-audio_generation_via_s.md
!audio_speech/gem-tfl_bridging_weak_and_full_supervision_for_forgery_localization_through_em-g.md
!audio_speech/hear_what_you_see_video-to-audio_generation_with_diffusion_transformer_and_seman.md
!audio_speech/hierarchical_codec_diffusion_for_video-to-speech_generation.md
!audio_speech/how_far_can_we_go_with_synthetic_data_for_audio-visual_sound_source_localization.md
!audio_speech/infinityhuman_towards_long-term_audio-driven_human_animation.md
!audio_speech/omni-mmsi_toward_identity-attributed_social_interaction_understanding.md
!audio_speech/omniret_efficient_and_high-fidelity_omni_modality_retrieval.md
!audio_speech/omnisonic_towards_universal_and_holistic_audio_generation_from_video_and_text.md
!audio_speech/pavas_physics-aware_video-to-audio_synthesis.md
!audio_speech/pushing_the_frontier_of_audiovisual_perception_with_large-scale_multimodal_corre.md
!audio_speech/save_speech-aware_video_representation_learning_for_video-text_retrieval.md
!audio_speech/tape_task-adaptive_prototype_evolution_in_audio-language_models_for_fully_few-sh.md
!audio_speech/tri-subspaces_disentanglement_for_multimodal_sentiment_analysis.md
!audio_speech/unim_a_unified_any-to-any_interleaved_multimodal_benchmark.md
!audio_speech/unlocking_strong_supervision_a_data-centric_study_of_general-purpose_audio_pre-t.md
!autonomous_driving/activead_planning-oriented_active_learning_for_end-to-end_autonomous_driving.md
!autonomous_driving/adaradar_rate_adaptive_spectral_compression_for_radar-based_perception.md
!autonomous_driving/amap_distilling_future_priors_for_ahead-aware_online_hd_map_construction.md
!autonomous_driving/an_instance-centric_panoptic_occupancy_prediction_benchmark_for_autonomous_drivi.md
!autonomous_driving/bev-car_enhancing_monocular_birds_eye_view_segmentation_with_context-aware_raste.md
!autonomous_driving/bev-sld_self-supervised_scene_landmark_detection_for_global_localization_with_li.md
!autonomous_driving/beyond_rule-based_agents_active_markov_games_for_realistic_multi-agent_interacti.md
!autonomous_driving/bezier_degradation_modeling_for_lidar-based_human_motion_capture.md
!autonomous_driving/buildanypoint_3d_building_structured_abstraction_from_diverse_point_clouds.md
!autonomous_driving/c-lav_conditional_latent_velocity_field_denoising_for_weather-robust_lidar_place.md
!autonomous_driving/card_a_multi-modal_automotive_dataset_for_dense_3d_reconstruction_in_challenging.md
!autonomous_driving/catnet_collaborative_alignment_and_transformation_network_for_cooperative_percep.md
!autonomous_driving/causalvad_de-confounding_end-to-end_autonomous_driving_via_causal_intervention.md
!autonomous_driving/ccf_complementary_collaborative_fusion_for_domain_generalized_multi-modal_3d_obj.md
!autonomous_driving/climaood_improving_anomaly_segmentation_via_physically_realistic_synthetic_data.md
!autonomous_driving/cogdriver_integrating_cognitive_inertia_for_temporally_coherent_planning_in_auto.md
!autonomous_driving/coin3d_revisiting_configuration-invariant_multi-camera_3d_object_detection.md
!autonomous_driving/colavla_leveraging_cognitive_latent_reasoning_for_hierarchical_parallel_trajecto.md
!autonomous_driving/colc_communication-efficient_collaborative_perception_with_lidar_completion.md
!autonomous_driving/coopdiff_a_diffusion-guided_approach_for_cooperation_under_corruptions.md
!autonomous_driving/counterfactual_vla_self-reflective_vision-language-action_model_with_adaptive_re.md
!autonomous_driving/cyclebev_regularizing_view_transformation_networks_via_view_cycle_consistency_fo.md
!autonomous_driving/deformable_gaussian_occupancy_decoupling_rigid_and_nonrigid_motion_with_factoriz.md
!autonomous_driving/den_tp_a_density_balanced_data_curation_and_evaluation_framework_for_trajectory.md
!autonomous_driving/dggt_feedforward_4d_reconstruction_of_dynamic_driving_scenes_using_unposed_image.md
!autonomous_driving/diffusion_forcing_planner_history-annealed_planning_with_time-dependent_guidance.md
!autonomous_driving/dlwm_dual_latent_world_models_enable_holistic_gaussian-centric_pre-training_in_a.md
!autonomous_driving/drive_my_way_preference_alignment_of_vision-language-action_model_for_personaliz.md
!autonomous_driving/drivecombo_benchmarking_compositional_traffic_rule_reasoning_in_autonomous_drivi.md
!autonomous_driving/drivemoe_mixture-of-experts_for_vision-language-action_model_in_end-to-end_auton.md
!autonomous_driving/drivepi_spatial-aware_4d_mllm_for_unified_autonomous_driving_understanding_perce.md
!autonomous_driving/drivepts_a_progressive_learning_framework_with_textual_and_structural_enhancemen.md
!autonomous_driving/drivergaze360_omnidirectional_driver_attention_with_object-level_guidance.md
!autonomous_driving/drivevln_towards_mapless_vision-and-language_navigation_in_autonomous_driving.md
!autonomous_driving/driving_on_registers.md
!autonomous_driving/drocc_depth_region_guided_3d_occupancy.md
!autonomous_driving/dsert-roll_robust_multi-modal_perception_for_diverse_driving_conditions_with_ste.md
!autonomous_driving/e3ad_an_emotion-aware_vision-language-action_model_for_human-centric_end-to-end_.md
!autonomous_driving/ee-rl_vision_language_guided_reinforcement_learning_with_explorer_and_expert_mod.md
!autonomous_driving/efficient_equivariant_transformer_for_self-driving_agent_modeling.md
!autonomous_driving/elic_efficient_lidar_geometry_compression_via_cross-bit-depth_feature_propagatio.md
!autonomous_driving/eventdrive_event_cameras_for_vision-language_driving_intelligence.md
!autonomous_driving/expanding_mmwave_datasets_for_human_pose_estimation_with_unlabeled_data_and_lida.md
!autonomous_driving/failure_modes_for_deep_learning-based_online_mapping_how_to_measure_and_address_.md
!autonomous_driving/fedbprompt_federated_domain_generalization_person_re-identification_via_body_dis.md
!autonomous_driving/flashcap_millisecond-accurate_human_motion_capture_via_flashing_leds_and_event-b.md
!autonomous_driving/foss_modeling_long_range_dependencies_and_multimodal_uncertainty_in_trajectory_p.md
!autonomous_driving/gau-occ_geometry-completed_gaussians_for_multi-modal_3d_occupancy_prediction.md
!autonomous_driving/gaussiandwm_3d_gaussian_driving_world_model_for_unified_scene_understanding_and_.md
!autonomous_driving/gem_generating_lidar_world_model_via_deformable_mamba.md
!autonomous_driving/generalizing_visual_geometry_priors_to_sparse_gaussian_occupancy_prediction.md
!autonomous_driving/geniedrive_towards_physics-aware_driving_world_model_with_4d_occupancy_guided_vi.md
!autonomous_driving/ghost-fwl_a_large-scale_full-waveform_lidar_dataset_for_ghost_detection_and_remo.md
!autonomous_driving/guideflow_constraint-guided_flow_matching_for_planning_in_end-to-end_autonomous_.md
!autonomous_driving/hg-lane_high-fidelity_generation_of_lane_scenes_under_adverse_weather_and_lighti.md
!autonomous_driving/holo_homography-guided_pose_estimator_network_for_fine-grained_visual_localizati.md
!autonomous_driving/horizonforge_driving_scene_editing_with_any_trajectories_and_any_vehicles.md
!autonomous_driving/hybrid_robust_collaborative_perception_with_lidar-4d_radar_fusion_under_adverse_.md
!autonomous_driving/hybriddrivevla_vision-language-action_model_with_visual_cot_reasoning.md
!autonomous_driving/intrinsicweather_controllable_weather_editing_in_intrinsic_space.md
!autonomous_driving/knowval_a_knowledge-augmented_and_value-guided_autonomous_driving_system.md
!autonomous_driving/l3dr_3d-aware_lidar_diffusion_and_rectification.md
!autonomous_driving/la-pose_latent_action_pretraining_meets_pose_estimation.md
!autonomous_driving/lead_minimizing_learner-expert_asymmetry_in_end-to-end_driving.md
!autonomous_driving/leader_lidar_relocalization.md
!autonomous_driving/learnability-driven_submodular_optimization_for_active_roadside_3d_detection.md
!autonomous_driving/learning_mutual_view_information_graph_for_adaptive_adversarial_collaborative_pe.md
!autonomous_driving/learning_to_drive_is_a_free_gift_large-scale_label-free_autonomy_pretraining_fro.md
!autonomous_driving/learning_to_identify_out-of-distribution_objects_for_3d_lidar_anomaly_segmentati.md
!autonomous_driving/lidar-to-4dradar_diffusion_bridge_via_cross-modal_alignment_and_translation_in_l.md
!autonomous_driving/lidas_lighting-driven_dynamic_active_sensing_for_nighttime_perception.md
!autonomous_driving/lipschitz_optimization_for_formal_verification_of_homographies.md
!autonomous_driving/lirec-net_a_target-free_and_learning-based_network_for_lidar_rgb_and_event_calib.md
!autonomous_driving/look_before_you_fuse_2d-guided_cross-modal_alignment_for_robust_3d_detection.md
!autonomous_driving/mad_motion_appearance_decoupling_for_efficient_driving_world_models.md
!autonomous_driving/meanfuser_fast_one-step_multi-modal_trajectory_generation_and_adaptive_reconstru.md
!autonomous_driving/minddriver_introducing_progressive_multimodal_reasoning_for_autonomous_driving.md
!autonomous_driving/monocular_open_vocabulary_occupancy_prediction_for_indoor_scenes.md
!autonomous_driving/mta_multimodal_task_alignment_for_bev_perception_and_captioning.md
!autonomous_driving/neural_distribution_prior_for_lidar_ood_detection.md
!autonomous_driving/neuro-cognitive_reward_modeling_for_human-centered_autonomous_vehicle_control.md
!autonomous_driving/nord_a_data-efficient_vision-language-action_model_that_drives_without_reasoning.md
!autonomous_driving/occany_generalized_unconstrained_urban_3d_occupancy.md
!autonomous_driving/occufly_a_3d_vision_benchmark_for_semantic_scene_completion_from_the_aerial_pers.md
!autonomous_driving/oneocc_semantic_occupancy_prediction_for_legged_robots_with_a_single_panoramic_c.md
!autonomous_driving/open-ended_instruction_realization_with_llm-enabled_multi-planner_scheduling_in_.md
!autonomous_driving/open-vocabulary_domain_generalization_in_urban-scene_segmentation.md
!autonomous_driving/optimvmap_offline_vectorized_map_construction_via_optimal_multi-vehicle_perspect.md
!autonomous_driving/panda_unsupervised_domain_adaptation_for_multimodal_3d_panoptic_segmentation_in_.md
!autonomous_driving/parkgaussian_surround-view_3d_gaussian_splatting_for_autonomous_parking.md
!autonomous_driving/perceiving_the_near_reasoning_the_distant_coherent_long-horizon_trajectory_predi.md
!autonomous_driving/percept-wam_perception-enhanced_world-awareness-action_model_for_robust_end-to-e.md
!autonomous_driving/perception_characteristics_distance_measuring_stability_and_robustness_of_percep.md
!autonomous_driving/plant_taxonomy_meets_plant_counting_a_fine-grained_taxonomic_dataset_for_countin.md
!autonomous_driving/points-to-3d_structure-aware_3d_generation_with_point_cloud_priors.md
!autonomous_driving/probabilistic_discrepancy_learning_for_roadside_lidar_scene_completion.md
!autonomous_driving/proood_prototype-guided_out-of-distribution_3d_occupancy_prediction.md
!autonomous_driving/ptc-depth_pose-refined_monocular_depth_estimation_with_temporal_consistency.md
!autonomous_driving/queryocc_query-based_self-supervision_for_3d_semantic_occupancy.md
!autonomous_driving/r4det_4d_radar-camera_fusion_for_high-performance_3d_object_detection.md
!autonomous_driving/rag-tp_a_general_framework_for_vehicle_trajectory_prediction_via_retrieval-augme.md
!autonomous_driving/rascene_high-fidelity_3d_scene_imaging_with_mmwave_communication_signals.md
!autonomous_driving/recover_to_predict_progressive_retrospective_learning_for_variable-length_trajec.md
!autonomous_driving/refav_towards_planning-centric_scenario_mining.md
!autonomous_driving/reliable_policy_transfer_for_safety-aware_end-to-end_driving_with_deep_reinforce.md
!autonomous_driving/remannet_a_riemannian_manifold_network_for_monocular_3d_lane_detection.md
!autonomous_driving/remot_reinforcement_learning_with_motion_contrast_triplets.md
!autonomous_driving/resad_normalized_residual_trajectory_modeling_for_end-to-end_autonomous_driving.md
!autonomous_driving/rescene4d_temporally_consistent_semantic_instance_segmentation_of_evolving_indoo.md
!autonomous_driving/rlftsim_realistic_and_controllable_multi-agent_traffic_simulation_via_reinforcem.md
!autonomous_driving/roadscenebench_a_lightweight_benchmark_for_mid-level_road_scene_understanding.md
!autonomous_driving/rpgfusion_4d_radar_prior-guided_multi-modal_fusion_for_3d_detection.md
!autonomous_driving/saber_spatially_consistent_3d_universal_adversarial_objects_for_bev_detectors.md
!autonomous_driving/scaling-aware_data_selection_for_end-to-end_autonomous_driving_systems.md
!autonomous_driving/searchad_large-scale_rare_image_retrieval_dataset_for_autonomous_driving.md
!autonomous_driving/sensor2sensor_cross-embodiment_sensor_conversion_for_autonomous_driving.md
!autonomous_driving/sgdrive_scene-to-goal_hierarchical_world_cognition_for_autonomous_driving.md
!autonomous_driving/sgnlf_spectralgeometric_neural_fields_for_posefre.md
!autonomous_driving/sharp_short-window_streaming_for_accurate_and_robust_prediction_in_motion_foreca.md
!autonomous_driving/shelfocc_native_3d_supervision_beyond_lidar_for_vision-based_occupancy_estimatio.md
!autonomous_driving/simscale_learning_to_drive_via_real-world_simulation_at_scale.md
!autonomous_driving/spacedrive_infusing_spatial_awareness_into_vlm-based_autonomous_driving.md
!autonomous_driving/sparseworld_tc_trajectory_conditioned_sparse_occupancy_world_model.md
!autonomous_driving/sparsity-aware_voxel_attention_and_foreground_modulation_for_3d_semantic_scene_c.md
!autonomous_driving/spatial_retrieval_augmented_autonomous_driving.md
!autonomous_driving/spe-bevhead_rethinking_the_detection_head_design_for_birds-eye-view_object_detec.md
!autonomous_driving/store3d_sparse_token_relevance_in_vits_for_efficient_multi-view_3d_object_detect.md
!autonomous_driving/streamvlo_streaming_visual-lidar_odometry_with_cumulative_drift_compensation.md
!autonomous_driving/strnet_visual_navigation_with_spatio-temporal_representation_through_dynamic_gra.md
!autonomous_driving/structure-to-intensity_diffusion_for_adverse-weather_lidar_generation.md
!autonomous_driving/stur3d_spatio-temporal_unified_representation_learning_for_3d_object_detection.md
!autonomous_driving/taco_task-aware_contrastive_learning_for_joint_lidar_localization_and_3d_object_.md
!autonomous_driving/terraseg_self-supervised_ground_segmentation_for_any_lidar.md
!autonomous_driving/test-time_3d_occupancy_prediction.md
!autonomous_driving/test-time_training_for_lidar_semantic_segmentation_under_corruption_via_geometri.md
!autonomous_driving/think_before_you_drive_world_model-inspired_multimodal_grounding.md
!autonomous_driving/topohr_hierarchical_centerline_representation_for_cyclic_topology_reasoning_in_d.md
!autonomous_driving/towards_balanced_multi-modal_learning_in_3d_human_pose_estimation.md
!autonomous_driving/trafficalign_aligning_large_language_models_for_traffic_scenario_generation.md
!autonomous_driving/truckdrive_long-range_autonomous_highway_driving_dataset.md
!autonomous_driving/u4d_uncertainty-aware_4d_world_modeling_from_lidar_sequences.md
!autonomous_driving/ufo_unifying_feed-forward_and_optimization-based_methods_for_large_driving_scene.md
!autonomous_driving/unifying_language-action_understanding_and_generation_for_autonomous_driving.md
!autonomous_driving/unleashing_vla_potentials_in_autonomous_driving_via_explicit_learning_from_failu.md
!autonomous_driving/unposed-to-3d_learning_simulation-ready_vehicles_from_real-world_images.md
!autonomous_driving/unsupervised_multi-agent_and_single-agent_perception_from_cooperative_views.md
!autonomous_driving/urscenes_a_multi-scenario_dataset_for_unstructured_road_environments.md
!autonomous_driving/v2u4real_a_real-world_large-scale_dataset_for_vehicle-to-uav_cooperative_percept.md
!autonomous_driving/vggdrive_empowering_vision-language_models_with_cross-view_geometric_grounding_f.md
!autonomous_driving/vird_view-invariant_representation_through_dual-axis_transformation_for_cross-vi.md
!autonomous_driving/w2w_language-model-based_trajectory_prediction_with_reinforcement_learning.md
!autonomous_driving/walkgpt_grounded_vision-language_conversation_with_depth-aware_segmentation_for_.md
!autonomous_driving/wam-flow_parallel_coarse-to-fine_motion_planning_via_discrete_flow_matching_for_.md
!autonomous_driving/whispernet_a_scalable_solution_for_bandwidth-efficient_collaboration.md
!autonomous_driving/wod-e2e_waymo_open_dataset_for_end-to-end_driving_in_challenging_long-tail_scena.md
!autonomous_driving/worldlens_full-spectrum_evaluations_of_driving_world_models_in_real_world.md
!autonomous_driving/x2-fusion_cross-modality_and_cross-dimension_flow_estimation_in_event_edge_space.md
!causal_inference/a_polynomial_chaos_framework_for_causal_discovery_in_nonlinear_uncertain_systems.md
!causal_inference/cgu-bayes_causal_graph_uncertainty-guided_bayesian_inference_for_domain_generali.md
!causal_inference/maskdime_adaptive_masked_diffusion_for_precise_and_efficient_visual_counterfactu.md
!causal_inference/retrieving_counterfactuals_improves_visual_in-context_learning.md
!computational_biology/adapting_a_pre-trained_single-cell_foundation_model_to_spatial_gene_expression_g.md
!computational_biology/advancing_cancer_prognosis_with_hierarchical_fusion_of_genomic_proteomic_and_pat.md
!computational_biology/bigmint_biologically-guided_hierarchical_multimodal_integration_for_modeling_mul.md
!computational_biology/bulk_rna-seq_guided_multi-modal_detection_of_anomalous_regions_in_human_cancer_v.md
!computational_biology/care_a_molecular-guided_foundation_model_with_adaptive_region_modeling_for_whole.md
!computational_biology/cell-type_prototype-informed_neural_network_for_gene_expression_estimation_from_.md
!computational_biology/cross-slice_knowledge_transfer_via_masked_multi-modal_heterogeneous_graph_contra.md
!computational_biology/cryohype_reconstructing_a_thousand_cryo-em_structures_with_transformer-based_hyp.md
!computational_biology/cryokraqen_kernel-regularized_annealing_for_quantized_embedding_networks_in_cryo.md
!computational_biology/cryosense_compressive_sensing_enables_high-throughput_microscopy_with_sparse_and.md
!computational_biology/deciphering_genotype-phenotype_mechanisms_from_high-content_profiling_via_knowle.md
!computational_biology/feast_fully_connected_expressive_attention_for_spatial_transcriptomics.md
!computational_biology/from_spots_to_pixels_dense_spatial_gene_expression_prediction_from_histology_ima.md
!computational_biology/hyperbolic_busemann_neural_networks.md
!computational_biology/hyperst_hierarchical_hyperbolic_learning_for_spatial_transcriptomics_prediction.md
!computational_biology/mmcp-gen_a_modality-extensible_diffusion_language_model_for_conditional_protein_.md
!computational_biology/multi-view_hierarchical_alignment_learning_for_spatial_transcriptomics.md
!computational_biology/multimodal_protein_language_models_for_enzyme_kinetic_parameters_from_substrate_.md
!computational_biology/predicting_spatial_transcriptomics_from_histology_images_via_high-order_multi-ce.md
!computational_biology/stronger_normalization-free_transformers.md
!computational_biology/trident_a_trimodal_cascade_generative_framework_for_drug_and_rna-conditioned_cel.md
!earth_science/phyoceancast_global_ocean_forecasting_with_physics-informed_diffusion.md
!earth_science/sigma_a_physics-based_benchmark_for_gas_chimney_understanding_in_seismic_images.md
!federated_learning/domain_sensitive_federated_learning_with_fisher-informed_pruning.md
!federated_learning/fedadamom_adaptive_momentum_for_improved_generalization_in_federated_optimizatio.md
!federated_learning/fedalign_differentially_private_distribution_alignment_for_non-iid_federated_lea.md
!federated_learning/fedara_resource-adaptive_low-rank_personalized_federated_learning_via_anchor-dri.md
!federated_learning/fedharmony_harmonizing_heterogeneous_label_correlations_in_federated_multi-label.md
!federated_learning/fedrac_rolling_submodel_allocation_for_collaborative_fairness_in_federated_learn.md
!federated_learning/fedrg_unleashing_the_representation_geometry_for_federated_learning_with_noisy_c.md
!federated_learning/fine-tuning_impairs_the_balancedness_of_foundation_models_in_long-tailed_persona.md
!federated_learning/from_selection_to_scheduling_federated_geometry-aware_correction_makes_exemplar_.md
!federated_learning/fully_decentralized_certified_unlearning.md
!federated_learning/gdfa_geometry-driven_federated_unlearning_with_directional_task_vector_alignment.md
!federated_learning/generalized_and_personalized_federated_learning_with_black-box_foundation_models.md
!federated_learning/hilora_hierarchical_low-rank_adaptation_for_personalized_federated_learning.md
!federated_learning/os-fed_one_snapshot_is_all_you_need.md
!federated_learning/personalized_federated_training_of_diffusion_models_with_privacy_guarantees.md
!federated_learning/single-round_scalable_analytic_federated_learning.md
!federated_learning/submodel_extraction_for_efficient_and_personalized_federated_learning_via_optima.md
!federated_learning/taming_noise-induced_prototype_degradation_for_privacy-preserving_personalized_f.md
!federated_learning/towards_stable_federated_continual_test-time_adaptation_in_wild_world.md
!graph_learning/adaptive_learned_image_compression_with_graph_neural_networks.md
!graph_learning/graph2eval_automatic_multimodal_task_generation_for_agents_via_knowledge_graphs.md
!graph_learning/m3kg_rag_multi_hop_multimodal_knowledge_graph_enhanced_retrieval_augmented_genera.md
!graph_learning/mario_multimodal_graph_reasoning_with_large_language_models.md
!graph_learning/mixture-of-experts_based_feature_decoupling_for_open_vocabulary_scene_graph_gene.md
!graph_learning/r2g_multi_view_circuit_graph_benchmark_suite_from_rtl_to_gdsii.md
!graph_learning/robo-sgg_exploiting_layout-oriented_normalization_and_restitution_can_improve_ro.md
!graph_learning/viterbiplannet_injecting_procedural_knowledge_via_differentiable_viterbi_for_pla.md
!hallucination/adaiat_adaptively_increasing_attention_to_generated_text_to_alleviate_hallucinat.md
!hallucination/beyond_global_scores_fine_grained_token_grounding_as_robust_detector_of_lvlm_hallucinations.md
!hallucination/causallens_sensitivity-guided_multi-head_causal_intervention_for_hallucination_m.md
!hallucination/copo_causal-oriented_policy_optimization_for_hallucinations_of_mllms.md
!hallucination/cross-modal_attention_calibration_for_lvlm_hallucination_mitigation.md
!hallucination/envision_attend_then_respond_counterfactual_hallucination_mitigation_in_large_vi.md
!hallucination/exposing_and_evaluating_hallucinations_for_gui_grounding.md
!hallucination/fighting_hallucinations_with_counterfactuals_diffusion-guided_perturbations_for_.md
!hallucination/fine-grained_multi_image_object_hallucination_benchmark.md
!hallucination/finer_mllms_hallucinate_under_fine-grained_negative_queries.md
!hallucination/first_logit_boosting_visual_grounding_method_to_mitigate_object_hallucination_in.md
!hallucination/hallugen_synthesizing_realistic_and_controllable_hallucinations_for_evaluating_i.md
!hallucination/hulluedit_single-pass_evidence-consistent_subspace_editing_for_mitigating_halluc.md
!hallucination/kvsmooth_mitigating_hallucination_in_multi-modal_large_language_models_through_k.md
!hallucination/locate-then-sparsify_attribution_guided_sparse_strategy_for_visual_hallucination.md
!hallucination/lyapunov_probes_for_hallucination_detection_in_large_foundation_models.md
!hallucination/mad_modality-adaptive_decoding_for_mitigating_cross-modal_hallucinations_in_mult.md
!hallucination/mitigating_multimodal_hallucinations_via_gradient-based_self-reflection.md
!hallucination/mod-dpo_towards_mitigating_cross-modal_hallucinations_in_omni_llms_using_modalit.md
!hallucination/one_token_two_fates_a_unified_framework_via_vision_token_manipulation_against_ml.md
!hallucination/pas_prelim_attention_score_for_detecting_object_hallucinations_in_large_vision-l.md
!hallucination/prefill-time_intervention_for_mitigating_hallucination_in_large_vision-language_.md
!hallucination/reallocating_attention_across_layers_to_reduce_multimodal_hallucination.md
!hallucination/residual_decoding_mitigating_hallucinations_in_large_vision-language_models_via_.md
!hallucination/same_attention_different_truths_put_logit-lens_over_visual_attention_to_detect_a.md
!hallucination/svhalluc_benchmarking_speech-vision_hallucination_in_audio-visual_large_language.md
!hallucination/tell_model_where_to_look_mitigating_hallucinations_in_mllms_by_vision-guided_att.md
!hallucination/thinking_in_uncertainty_mitigating_hallucinations_in_mlrms_with_latent_entropy-a.md
!hallucination/tridf_evaluating_perception_detection_and_hallucination_for_interpretable_deepfa.md
!hallucination/understanding_and_mitigating_hallucinations_in_multimodal_chain-of-thought_model.md
!hallucination/understanding_the_role_of_hallucination_in_reinforcement_post-training_of_multim.md
!hallucination/ves-rft_rewarding_visual_evidence_sensitivity_to_mitigate_hallucinations_in_larg.md
!hallucination/zina_multimodal_fine-grained_hallucination_detection_and_editing.md
!human_understanding/actavatar_temporally-aware_precise_action_control_for_talking_avatars.md
!human_understanding/action_motifs_self-supervised_hierarchical_representation_of_human_body_movement.md
!human_understanding/all_in_one_unifying_deepfake_detection_tampering_localization_and_source_tracing.md
!human_understanding/audioavatar_personalized_audio-driven_whole-body_talking_avatars.md
!human_understanding/avatar_forcing_real-time_interactive_head_avatar_generation_for_natural_conversa.md
!human_understanding/avatar_reinforcement_learning_to_see_hear_and_reason_over_video.md
!human_understanding/barbiegait_an_identity-consistent_synthetic_human_dataset_with_versatile_cloth-c.md
!human_understanding/beyond_scanpaths_graph-based_gaze_simulation_in_dynamic_scenes.md
!human_understanding/beyond_single-view_sufficiency_cvbench_for_cross-view_human_understanding.md
!human_understanding/bit_matching-based_bi-directional_interaction_transformation_network_for_visible.md
!human_understanding/boostslt_boosting_sign_language_translation_via_a_plug-and-play_diffusion-based_.md
!human_understanding/breaking_spurious_correlations_uncertainty-driven_causal_transformers_for_au_det.md
!human_understanding/bridging_facial_understanding_and_animation_via_language_models.md
!human_understanding/causal_motion_diffusion_models_for_autoregressive_motion_generation.md
!human_understanding/cigpose_causal_intervention_graph_neural_network_for_whole-body_pose_estimation.md
!human_understanding/clex_complementary_label_exchange_learning_for_noisy_facial_expression_recogniti.md
!human_understanding/clothe_and_pose.md
!human_understanding/cog_confidence-aware_optimal_geometric_correspondence_for_unsupervised_single-re.md
!human_understanding/composite-attribute_person_re-identification_via_pose-guided_disentanglement.md
!human_understanding/coordspeaker_exploiting_gesture_captioning_for_coordinated_caption-empowered_co-.md
!human_understanding/cope_consistent_occlusion_and_prompt_enhancement_network_for_occluded_person_re-.md
!human_understanding/d3fer_dual_channel_and_dual_branch_network_for_robust_facial_expression_recognit.md
!human_understanding/decoupled_generative_modeling_for_human-object_interaction_synthesis.md
!human_understanding/decovln_decoupling_observation_reasoning_and_correction_for_vision-and-language_.md
!human_understanding/dex-portrait_disentangled_and_expressive_portrait_animation_via_explicit_and_lat.md
!human_understanding/differentially_private_2d_human_pose_estimation.md
!human_understanding/dyadit_a_multi-modal_diffusion_transformer_for_socially_favorable_dyadic_gesture.md
!human_understanding/dynamic_label_noise_suppression_with_optimal_teacher_pool_for_facial_expression_.md
!human_understanding/dynamic_magic_unleashing_restricted_knowledge_for_lifelong_person_re-identificat.md
!human_understanding/e-3dpsm_a_state_machine_for_event-based_egocentric_3d_human_pose_estimation.md
!human_understanding/egoposeformer_v2_accurate_egocentric_human_motion_estimation_for_arvr.md
!human_understanding/eventgait_towards_robust_gait_recognition_with_event_streams.md
!human_understanding/facecot_cot_reasoning_face_anti_spoofing.md
!human_understanding/fisherposer_human_motion_estimation_from_sparse_observations_with_hierarchical_r.md
!human_understanding/flexavatar_learning_complete_3d_head_avatars_with_partial_supervision.md
!human_understanding/flooddiffusion_tailored_diffusion_forcing_for_streaming_motion_generation.md
!human_understanding/flow_optimal_transport-driven_feature_warping_for_generalized_remote_physiologic.md
!human_understanding/flowpalm_optical_flow_driven_non-rigid_deformation_for_geometrically_diverse_pal.md
!human_understanding/fmpose3d_monocular_3d_pose_estimation_via_flow_matching.md
!human_understanding/focal-general_diffusion_model_with_semantic_consistent_guidance_for_sign_languag.md
!human_understanding/forecasting_3d_scanpaths_in_egocentric_video.md
!human_understanding/frankenmotion_part-level_human_motion_generation_and_composition.md
!human_understanding/from_intuition_to_investigation_a_tool-augmented_reasoning_mllm_framework_for_ge.md
!human_understanding/fusionagent_a_multimodal_agent_with_dynamic_model_selection_for_human_recognitio.md
!human_understanding/gaussian-mixture_latent_flow_for_stochastic_3d_human_motion_prediction.md
!human_understanding/gaze_target_estimation_anywhere_with_concepts.md
!human_understanding/gazeonce360_fisheye-based_360deg_multi-person_gaze_estimation_with_global-local_.md
!human_understanding/gazeshift_unsupervised_gaze_estimation_and_dataset_for_vr.md
!human_understanding/geometric_neural_distance_fields_for_learning_human_motion_priors.md
!human_understanding/goldilocks_test_sets_for_face_verification.md
!human_understanding/ground_reaction_inertial_poser_physics-based_human_motion_capture_from_sparse_im.md
!human_understanding/hamipose_hamiltonian_optimization_for_unsupervised_domain_adaptive_pose_estimati.md
!human_understanding/handx_scaling_bimanual_motion_and_interaction_generation.md
!human_understanding/hierarchical_enhancement_of_semantic_priors_for_disentangled_text-driven_motion_.md
!human_understanding/how_to_take_a_memorable_picture_empowering_users_with_actionable_feedback.md
!human_understanding/hsi-gpt2_a_dual-granularity_large_motion_reasoning_model_with_diffusion_refineme.md
!human_understanding/humaps-4d_a_multimodal_dataset_for_human_motion_analysis_with_physiological_and_.md
!human_understanding/hypergait_unleashing_the_power_of_parsing_for_gait_recognition_in_the_wild_via_h.md
!human_understanding/imu-hoi_a_symbiotic_framework_for_coherent_human-object_interaction_and_motion_c.md
!human_understanding/interact2ar_full-body_human-human_interaction_generation_via_autoregressive_diff.md
!human_understanding/interagent_physics-based_multi-agent_command_execution_via_diffusion_on_interaction_graphs.md
!human_understanding/interphys_physics-aware_human_motion_synthesis_in_a_dynamic_scene.md
!human_understanding/interprior_scaling_generative_control_for_physics-based_human-object_interaction.md
!human_understanding/lamogen_language_to_motion_generation_through_llm-guided_symbolic_inference.md
!human_understanding/lamp_localization_aware_multi-camera_people_tracking_in_metric_3d_world.md
!human_understanding/lca_large-scale_codec_avatars_the_unreasonable_effectiveness_of_large-scale_avata.md
!human_understanding/learning_effective_sign_features_without_text_for_gloss-free_sign_language_trans.md
!human_understanding/learning_to_diversify_and_focus_a_reinforcement_framework_for_open-vocabulary_ho.md
!human_understanding/livegesture_streamable_co-speech_gesture_generation_model.md
!human_understanding/llamo_scaling_pretrained_language_models_for_unified_motion_understanding_and_ge.md
!human_understanding/m4human_a_large-scale_multimodal_mmwave_radar_benchmark_for_human_mesh_reconstru.md
!human_understanding/mamma_markerless_accurate_multi-person_motion_acquisition.md
!human_understanding/matched_crisp_edge_detection_using_end-to-end_matching-based_supervision.md
!human_understanding/mfen_multi-frequency_expert_network_for_visible-infrared_person_re-id.md
!human_understanding/mgdhand_multi-granularity_prior-to-inertial_distillation_framework_for_sequentia.md
!human_understanding/miburi_towards_expressive_interactive_gesture_synthesis.md
!human_understanding/mimictalker_a_multimodal_interactive_and_memory-enhanced_framework_for_real-time.md
!human_understanding/mmgait_multi_modal_gait_recognition.md
!human_understanding/mobile_vton_ondevice_virtual_tryon.md
!human_understanding/mobind_motion_binding_for_fine-grained_imu-video_pose_alignment.md
!human_understanding/mocap-2-to-3_multi-view_lifting_for_monocular_motion_recovery_with_2d_pretrainin.md
!human_understanding/mofa-vton_more_fashion_possibilities_with_fine-grained_adaptations_in_virtual_tr.md
!human_understanding/molingo_motion-language_alignment_for_text-to-motion_generation.md
!human_understanding/motionhiflow_text-to-motion_via_hierarchical_flow_matching.md
!human_understanding/motionmaster_generalizable_text-driven_motion_generation_and_editing.md
!human_understanding/ms2gait_a_multi-scale_spatio-temporal_fusion_network_for_lidar-based_gait_recogn.md
!human_understanding/multi-level_causal_llm-based_text-to-motion_generation_with_human_alignment.md
!human_understanding/mv-fashion_towards_enabling_virtual_try-on_and_size_estimation_with_multi-view_p.md
!human_understanding/next-scale_autoregressive_models_for_text-to-motion_generation.md
!human_understanding/occluded_human_body_capture_with_frequency_domain_denoising_prior.md
!human_understanding/omg-bench_a_new_challenging_benchmark_for_skeleton-based_online_micro_hand_gestu.md
!human_understanding/omni-supervised_motion_editing_balancing_change_and_invariance_through_positive-.md
!human_understanding/open_the_motion_door_atomic_motion_decomposition_and_recomposition_for_open-voca.md
!human_understanding/opendance_multimodal_controllable_3d_dance_generation_with_large-scale_internet_.md
!human_understanding/openfs_multi-hand-capable_fingerspelling_recognition_with_implicit_signing-hand_.md
!human_understanding/opent2m_no-frill_motion_generation_with_open-source_large-scale_high-quality_dat.md
!human_understanding/osmo_open-vocabulary_self-emotion_tracking.md
!human_understanding/pamotion_physics-aware_motion_generation_for_full-body_interaction_with_multiple.md
!human_understanding/party_part-guidance_for_expressive_text-to-motion_synthesis.md
!human_understanding/pc-talk_precise_facial_animation_control_for_audio-driven_talking_face_generatio.md
!human_understanding/phase-net_physics-grounded_harmonic_attention_system_for_efficient_remote_photop.md
!human_understanding/polyslgen_online_multimodal_speaking-listening_reaction_generation_in_polyadic_i.md
!human_understanding/pose-guided_enriched_feature_learning_for_federated-by-camera_person_re-identifi.md
!human_understanding/pressure2motion_hierarchical_human_motion_reconstruction_from_ground_pressure_wi.md
!human_understanding/prism_learning_a_shared_primitive_space_for_transferable_skeleton_action_represe.md
!human_understanding/progressive_guessing_to_fixed_point_rethinking_human_motion_prediction_with_deep.md
!human_understanding/prompt-anchored_vision-text_distillation_for_lifelong_person_re-identification.md
!human_understanding/push-and-step_from_rl-based_balance_recovery_to_physical_simulation_of_dense_cro.md
!human_understanding/ram_recover_any_3d_human_motion_in-the-wild.md
!human_understanding/real-time_multimodal_fingertip_contact_detection_via_depth_and_motion_fusion_for.md
!human_understanding/refton_reference_person_shot_assist_virtual_try-on.md
!human_understanding/regformer_transferable_relational_grounding_for_weakly-supervised_hoi_detection.md
!human_understanding/region-aware_instance_consistency_learning_for_micro-expression_recognition.md
!human_understanding/remogen_real-time_human_interaction-to-reaction_generation_via_modular_learning_.md
!human_understanding/render-to-adapt_unsupervised_personal_adaptation_for_gaze_estimation.md
!human_understanding/rgb-event_based_pedestrian_attribute_recognition_a_benchmark_dataset_and_an_asym.md
!human_understanding/romo_a_large-scale_richly_organized_dataset_and_semantic_taxonomy_for_human_moti.md
!human_understanding/rppg_vqa_video_quality_assessment.md
!human_understanding/sam_3d_body_robust_full-body_human_mesh_recovery.md
!human_understanding/scemos_scene-aware_3d_human_motion_synthesis_by_planning_with_geometry-grounded_.md
!human_understanding/see_through_the_noise_improving_domain_generalization_in_gaze_estimation.md
!human_understanding/seeing_without_pixels_perception_from_camera_trajectories.md
!human_understanding/signpr_a_progressive_vector-quantized_diffusion_framework_for_sign_language_prod.md
!human_understanding/sketch2colab_sketch-conditioned_multi-human_animation_via_controllable_flow_dist.md
!human_understanding/spatial-frequency_collaborative_learning_for_occluded_visible-infrared_person_re.md
!human_understanding/ssm-aware_token-efficient_vmamba_via_adaptive_patch_pruning_and_merging_for_pers.md
!human_understanding/stake_the_points_structure-faithful_instance_unlearning.md
!human_understanding/superman_unifying_skeleton_and_vision_for_human_motion_perception_and_generation.md
!human_understanding/syncdreamer_controllable_and_expressive_avatar_generation_beyond_the_talking_hea.md
!human_understanding/syncmos_scalable_motion_synchronisation_for_multi-agent_scene_interaction.md
!human_understanding/talking_together_synthesizing_co-located_3d_conversations_from_audio.md
!human_understanding/text-guided_feature_disentanglement_for_cross-modal_gait_recognition.md
!human_understanding/textit4dsurf_high-fidelity_dynamic_scene_surface_reconstruction.md
!human_understanding/through_the_frequency_lens_cross-domain_generalisable_gaze_estimation_with_adapt.md
!human_understanding/towards_cross-modal_preservation_consistency_and_alignment_for_privacy-preservin.md
!human_understanding/towards_decompositional_human_motion_generation_with_energy-based_diffusion_mode.md
!human_understanding/towards_highly-constrained_human_motion_generation_with_retrieval-guided_diffusi.md
!human_understanding/towards_storytelling_animations_joint_synthesis_of_human_and_camera_motions.md
!human_understanding/translating_signals_to_languages_for_semg-based_activity_recognition.md
!human_understanding/trilite_efficient_weakly_supervised_object_localization_with_universal_visual_fe.md
!human_understanding/unidex_a_robot_foundation_suite_for_universal_dexterous_hand_control_from_egocen.md
!human_understanding/unified_number-free_text-to-motion_generation_via_flow_matching.md
!human_understanding/unifying_precise_keyframes_and_semantic_control_via_multi-level_diffusion.md
!human_understanding/unils_end-to-end_audio-driven_avatars_for_unified_listening_and_speaking.md
!human_understanding/unleashing_vision-language_semantics_for_deepfake_video_detection.md
!human_understanding/unlocking_motion_from_large_vision_models_with_a_semantic_and_kinematic_duality_.md
!human_understanding/vibes_a_conversational_agent_with_behaviorally_intelligent_3d_virtual_body.md
!human_understanding/view-aware_semantic_alignment_for_aerial-ground_person_re-identification.md
!human_understanding/vision-language_attribute_disentanglement_and_reinforcement_for_lifelong_person_.md
!human_understanding/vrclip_multimodal_canonical_correlation_alignment_for_clip-driven_vision-radio_p.md
!human_understanding/wildcap_facial_albedo_capture_in_the_wild_via_hybrid_inverse_rendering.md
!image_generation/2ndmatch_finetuning_pruned_diffusion_models_via_second-order_jacobian_matching.md
!image_generation/3d_space_as_a_scratchpad_for_editable_text-to-image_generation.md
!image_generation/a_self-conditioned_representation_guided_diffusion_model_for_realistic_text-to-l.md
!image_generation/a_style_is_worth_one_code_unlocking_code-to-style_image_generation_with_discrete.md
!image_generation/a_temporal_and_content_co-awareness_latent_diffusion_for_controllable_hand_image.md
!image_generation/a_training-free_style-personalization_via_svd-based_feature_decomposition.md
!image_generation/accelerating_diffusion_via_hybrid_data-pipeline_parallelism_based_on_conditional.md
!image_generation/adapter_shield_a_unified_framework_with_built-in_authentication_for_preventing_u.md
!image_generation/adaptive_auxiliary_prompt_blending_for_target-faithful_diffusion_generation.md
!image_generation/adaptive_spectral_feature_forecasting_for_diffusion_sampling_acceleration.md
!image_generation/advancing_image_classification_with_discrete_diffusion_classification_modeling.md
!image_generation/ae2vid_event-based_video_reconstruction_via_aperture_modulation.md
!image_generation/agentic_retoucher_for_texttoimage_generation.md
!image_generation/ahs_adaptive_head_synthesis.md
!image_generation/align_images_before_you_generate.md
!image_generation/aligning_multi-character_narrative_image_generation_with_multi-aspect_human_pref.md
!image_generation/all_in_one_slider_attribute_manipulation.md
!image_generation/anchoring_and_rescaling_attention_for_semantically_coherent_inbetweening.md
!image_generation/ani3dhuman_photorealistic_3d_human_animation_with_self-guided_stochastic_samplin.md
!image_generation/ar2can_an_architect_and_an_artist_leveraging_a_canvas_for_multi-human_generation.md
!image_generation/attention_may_i_have_your_decision_localizing_generative_choices_in_diffusion_mo.md
!image_generation/attribute-preserving_pseudo-labeling_for_diffusion-based_face_swapping.md
!image_generation/attribution_as_retrieval_modelagnostic_aigenerated.md
!image_generation/back_to_basics_let_denoising_generative_models_denoise.md
!image_generation/beautygrpo_aesthetic_alignment_for_face_retouching_via_dynamic_path_guidance_and.md
!image_generation/beyond_fixed_formulas_data-driven_linear_predictor_for_efficient_diffusion_model.md
!image_generation/beyond_objects_contextual_synthetic_data_generation_for_fine-grained_classificat.md
!image_generation/beyond_patches_global-aware_autoregressive_model_for_multimodal_few-shot_font_ge.md
!image_generation/beyond_pixel_simulation_pathology_image_generation_via_diagnostic_semantic_token.md
!image_generation/beyond_text_prompts_precise_concept_erasure_through_text-image_collaboration.md
!image_generation/beyond_the_golden_data_resolving_the_motion-vision_quality_dilemma_via_timestep_.md
!image_generation/bidirectional_normalizing_flow_from_data_to_noise_and_back.md
!image_generation/bifm_bidirectional_flow_matching_for_few-step_image_editing_and_generation.md
!image_generation/bigain_unified_token_compression_for_joint_generation_and_classification.md
!image_generation/bimotion_b-spline_motion_for_text-guided_dynamic_3d_character_generation.md
!image_generation/biovita_biological_dataset_model_and_benchmark_for_visual-textual-acoustic_align.md
!image_generation/black-box_membership_inference_attacks_on_the_pre-training_data_of_image-generat.md
!image_generation/blackmirror_black-box_backdoor_detection_for_text-to-image_models_via_instructio.md
!image_generation/breaking_semantic_boundaries_distribution-guided_semantic_exploration_for_creati.md
!image_generation/bridging_fidelity-reality_with_controllable_one-step_diffusion_for_image_super-r.md
!image_generation/c2fg_control_classifier-free_guidance_via_score_discrepancy_analysis.md
!image_generation/camera_control_for_text-to-image_generation_via_learning_viewpoint_tokens.md
!image_generation/card_correlation_aware_restoration_with_diffusion.md
!image_generation/care-edit_condition-aware_routing_of_experts_for_contextual_image_editing.md
!image_generation/careflow_cyclic_adaptive_rectified_flow_for_multimodal_fusion.md
!image_generation/caricharmony_contrastive_diffusion_paths_for_identity-preserving_caricature_synt.md
!image_generation/cast_context-aware_dynamic_latent_space_transformation_for_interactive_text-to-i.md
!image_generation/catok_taming_mean_flows_for_one-dimensional_causal_image_tokenization.md
!image_generation/cfg-ctrl_control-based_classifier-free_diffusion_guidance.md
!image_generation/cg-floor_centroid-guided_diffusion_for_large-scale_floorplan_generation.md
!image_generation/chartist_generating_pictorial_charts_with_unified_spatial_and_subject_control.md
!image_generation/chimeralora_multi-head_lora-guided_synthetic_datasets.md
!image_generation/chordedit_one-step_low-energy_transport_for_image_editing.md
!image_generation/cinematic_audio_source_separation_using_visual_cues.md
!image_generation/circuit_mechanisms_for_spatial_relation_generation_in_diffusion_models.md
!image_generation/closed-form_concept_erasure_via_double_projections.md
!image_generation/cod_a_diffusion_foundation_model_for_image_compression.md
!image_generation/cogniedit_dense_gradient_flow_optimization_for_fine-grained_image_editing.md
!image_generation/cologen_progressive_learning_of_concept-localization_duality_for_unified_image_g.md
!image_generation/compbench_benchmarking_complex_instruction-guided_image_editing.md
!image_generation/compositional_text-to-image_generation_via_region-aware_bimodal_direct_preferenc.md
!image_generation/consistcompose_multimodal_layout_control.md
!image_generation/correspondence-attention_alignment_for_multi-view_diffusion_models.md
!image_generation/coupled_diffusion_sampling_for_training-free_multi-view_image_editing.md
!image_generation/craft-lora_content-style_personalization_via_rank-constrained_adaptation_and_tra.md
!image_generation/craft_aligning_diffusion_models_with_finetuning_is_easier_than_you_think.md
!image_generation/creval_an_automated_interpretable_evaluation_for_creative_image_manipulation_und.md
!image_generation/cross-axis_feature_fusion_with_joint-wise_motion_difference_prediction_for_text-.md
!image_generation/cross-modal_emotion_transfer_for_emotion_editing_in_talking_face_video.md
!image_generation/csf_black-box_fingerprinting_via_compositional_semantics_for_text-to-image_model.md
!image_generation/ctcal_rethinking_text-to-image_diffusion_models_via_cross-timestep_self-calibrat.md
!image_generation/curriculum_group_policy_optimization_adaptive_sampling_for_unleashing_the_potent.md
!image_generation/cycle-consistent_tuning_for_layered_image_decomposition.md
!image_generation/d2c_diffusion_dataset_condensation.md
!image_generation/da-vae_plug-in_latent_compression_for_diffusion_via_detail_alignment.md
!image_generation/dbmsolver_a_training-free_diffusion_bridge_sampler_for_high-quality_image-to-ima.md
!image_generation/dcoar_deep_concept_injection_into_unified_autoregressive_models_for_personalized.md
!image_generation/dcw_snr_t_bias_diffusion.md
!image_generation/ddit_dynamic_patch_scheduling_for_efficient_diffusion_transformers.md
!image_generation/ddt_decoupled_diffusion_transformer.md
!image_generation/deco_frequency-decoupled_pixel_diffusion_for_end-to-end_image_generation.md
!image_generation/decoupled_residual_denoising_diffusion_models_for_unified_and_data_efficient_ima.md
!image_generation/delta_rectified_flow_sampling_for_text-to-image_editing.md
!image_generation/denoising_fast_and_slow_difficulty-aware_adaptive_sampling_for_image_generation.md
!image_generation/design_your_ad_personalized_advertising_image_and_text_generation_with_unified_a.md
!image_generation/designing_instance-level_sampling_schedules_via_reinforce_with_james-stein_shrin.md
!image_generation/diff-semier_transparency-aware_adaptive_fusion_diffusion_model_with_generative_p.md
!image_generation/diffgraph_an_automated_agent-driven_model_merging_framework_for_in-the-wild_text.md
!image_generation/diffusion-based_makeup_transfer_with_facial_region-aware_makeup_features.md
!image_generation/diffusion_mental_averages.md
!image_generation/diffusion_probe_generated_image_result_prediction_using_cnn_probes.md
!image_generation/diffusion_sampling_path_tells_more_an_efficient_plug-and-play_strategy_for_sampl.md
!image_generation/dip_taming_diffusion_models_in_pixel_space.md
!image_generation/disentangling_to_re-couple_resolving_the_similarity-controllability_paradox_in_s.md
!image_generation/dit360_high-fidelity_panoramic_image_generation_via_hybrid_training.md
!image_generation/ditic_aligned_diffusion_transformer_for_efficient.md
!image_generation/diversegrpo_mitigating_mode_collapse_in_image_generation_via_diversity-aware_grp.md
!image_generation/diversity_over_uniformity_rethinking_representation_in_generated_image_detection.md
!image_generation/do_less_achieve_more_do_we_need_every-step_optimization_for_rl_fine-tuning_of_di.md
!image_generation/dpar_dynamic_patchification_for_efficient_autoregressive_visual_generation.md
!image_generation/dpcache_denoising_path_planning_diffusion_accel.md
!image_generation/dreamingcomics_a_story_visualization_pipeline_via_subject_and_layout_customized_.md
!image_generation/dreamomni2_multimodal_instruction-based_generation_and_editing.md
!image_generation/dreamstereo_towards_real-time_stereo_inpainting_for_hd_videos.md
!image_generation/driffusion_draft-and-refine_process_parallelizes_diffusion_models_with_ease.md
!image_generation/dtg-restore_training-free_diffusion_refinement_for_generative_video_super-resolu.md
!image_generation/duo-vsr_dual-stream_distillation_for_one-step_video_super-resolution.md
!image_generation/dynamic-editor_training-free_text-driven_4d_scene_editing_with_multimodal_diffus.md
!image_generation/dynavid_learning_to_generate_highly_dynamic_videos_using_synthetic_motion_data.md
!image_generation/dynfusion_rethinking_condition_fusion_for_adaptive_multi-conditional_text-to-ima.md
!image_generation/eda_arbitrary_noise_diffusion_design_space.md
!image_generation/editmgt_unleashing_potentials_of_masked_generative_transformers_in_image_editing.md
!image_generation/effecterase_joint_video_object_removal_and_insertion_for_high-quality_effect_era.md
!image_generation/efficient_and_training-free_single-image_diffusion_models.md
!image_generation/efficient_real-time_raw-to-raw_denoising_for_extreme_low-light_ultra_hd_video_on.md
!image_generation/efficient_weighted_sampling_via_score-based_generative_models.md
!image_generation/egoflow_gradient-guided_flow_matching_for_egocentric_6dof_object_motion_generati.md
!image_generation/emf_meanflow_text_to_image.md
!image_generation/emma_concept_erasure_benchmark_with_comprehensive_semantic_metrics_and_diverse_c.md
!image_generation/emostyle_emotion-driven_image_stylization.md
!image_generation/emr-diff_edge-aware_multimodal_residual_diffusion_model_for_hyperspectral_image_.md
!image_generation/enhancing_spatial_understanding_in_image_generation_via_reward_modeling.md
!image_generation/erasing_thousands_of_concepts_towards_scalable_and_practical_concept_erasure_for.md
!image_generation/evaluating_generative_models_via_one-dimensional_code_distributions.md
!image_generation/expand_and_prune_maximizing_trajectory_diversity_for_effective_grpo_in_generativ.md
!image_generation/exploring_conditions_for_diffusion_models_in_robotic_control.md
!image_generation/exploring_spatial_intelligence_from_a_generative_perspective.md
!image_generation/expportrait_expressive_portrait_generation_via_personalized_representation.md
!image_generation/fabricgen_microstructure-aware_woven_fabric_generation.md
!image_generation/face2scene_using_facial_degradation_as_an_oracle_for_diffusion-based_scene_resto.md
!image_generation/failureatlas_mapping_the_failure_landscape_of_t2i_models_via_active_exploration.md
!image_generation/faithfusion_harmonizing_reconstruction_and_generation_via_pixel-wise_information.md
!image_generation/farmer_flow_autoregressive_transformer_over_pixels.md
!image_generation/fasthybrid_accelerating_hybrid_autoregressive_image_generation_with_lookahead_an.md
!image_generation/feat_fashion_editing_and_try-on_from_any_design.md
!image_generation/few-shot_acoustic_synthesis_with_multimodal_flow_matching.md
!image_generation/few-step_diffusion_sampling_through_instance-aware_discretizations.md
!image_generation/fg-portrait_3d_flow_guided_editable_portrait_animation.md
!image_generation/fine-grained_grpo_for_precise_preference_alignment_in_flow_models.md
!image_generation/fine_factorizing_knowledge_for_initialization_of_variable-sized_diffusion_models.md
!image_generation/flash-dmd_towards_high-fidelity_few-step_image_generation_with_efficient_distill.md
!image_generation/flashdecoder_real-time_latent-to-pixel_streaming_decoder_with_transformers.md
!image_generation/flashin_fast_and_accurate_image_inversion_for_real-time_image_editing.md
!image_generation/flow_map_distillation_without_data.md
!image_generation/flow_matching_for_multimodal_distributions.md
!image_generation/flowdc_flow-based_decoupling-decay_for_complex_image_editing.md
!image_generation/flowfixer_towards_detail-preserving_subject-driven_generation.md
!image_generation/flowsteer_guiding_few-step_image_synthesis_with_authentic_trajectories.md
!image_generation/fontcrafter_high-fidelity_element-driven_artistic_font_creation_with_visual_in-c.md
!image_generation/forecast_the_principal_stabilize_the_residual_subspace-aware_feature_caching_for.md
!image_generation/framer_frequency-aligned_self-distillation_with_adaptive_modulation_leveraging_d.md
!image_generation/freqedit_preserving_high-frequency_features_for_robust_multi-turn_image_editing.md
!image_generation/freqflow_frequency_aware_flow_matching.md
!image_generation/from_inpainting_to_layer_decomposition_repurposing_generative_inpainting_models_.md
!image_generation/from_scale_to_speed_adaptive_test-time_scaling_for_image_editing.md
!image_generation/from_sketch_to_fresco_efficient_diffusion_transformer_with_progressive_resolutio.md
!image_generation/functional_mean_flow_in_hilbert_space.md
!image_generation/fusion_in_your_way_aligning_image_fusion_with_heterogeneous_demands_via_direct_p.md
!image_generation/fvar_next-focus_prediction_for_visual_autoregressive_modeling.md
!image_generation/garments2look_a_multi-reference_dataset_for_high-fidelity_outfit-level_virtual_t.md
!image_generation/gated_condition_injection_without_multimodal_attention_towards_controllable_line.md
!image_generation/gdro_group-level_reward_post-training_suitable_for_diffusion_models.md
!image_generation/gencolorbench_a_color_evaluation_benchmark_for_text-to-image_generation.md
!image_generation/generase_generalizable_and_semantically-aware_concept_erasure_in_diffusion_model.md
!image_generation/georelight_learning_joint_geometrical_relighting_and_reconstruction_with_flexibl.md
!image_generation/geork2_geometry-guided_runge-kutta_integration_for_diffusion_transformer_acceler.md
!image_generation/glyphprinter_region-grouped_direct_preference_optimization_for_glyph-accurate_vi.md
!image_generation/goal-driven_reward_by_video_diffusion_models_for_reinforcement_learning.md
!image_generation/gqir_generative_quanta_image_reconstruc_tion.md
!image_generation/groce_graph-guided_online_concept_erasure_for_text-to-image_diffusion_models.md
!image_generation/group_diffusion_enhancing_image_generation_by_unlocking_cross-sample_collaborati.md
!image_generation/group_editing_edit_multiple_images_in_one_go.md
!image_generation/grpo-guard_mitigating_implicit_over-optimization_in_flow_matching_via_regulated_.md
!image_generation/guiding_a_diffusion_model_by_swapping_its_tokens.md
!image_generation/guiding_a_diffusion_transformer_with_the_internal_dynamics_of_itself.md
!image_generation/guiding_diffusion_models_with_fine-grained_conditions_and_semantics-preserving_s.md
!image_generation/guiding_diffusion_models_with_semantically_degraded_conditions.md
!image_generation/guiding_token-sparse_diffusion_models.md
!image_generation/harmonic_canvas_inversion-free_editing_for_visually-guided_music_style_transfer.md
!image_generation/harmony_harmonizing_audio_and_video_generation_through_cross-task_synergy.md
!image_generation/head-wise_adaptive_rotary_positional_encoding_for_fine-grained_image_generation.md
!image_generation/heterogeneous_decentralized_diffusion_models.md
!image_generation/hicogen_hierarchical_compositional_text-to-image_generation_in_diffusion_models_.md
!image_generation/hieredit_region-aware_hierarchical_diffusion_for_efficient_high-resolution_editi.md
!image_generation/hifi-inpaint_towards_high-fidelity_reference-based_inpainting_for_generating_det.md
!image_generation/high-fidelity_diffusion_face_swapping_with_id-constrained_facial_conditioning.md
!image_generation/high-fidelity_virtual_try-on_beyond_paired_data_scarcity_via_diffusion-based_cyc.md
!image_generation/hint2gen_bridging_understanding_and_generation_via_code-structured_hints.md
!image_generation/hist2style_histogram-guided_stylization_with_bilateral_grids.md
!image_generation/hp-edit_a_human-preference_post-training_framework_for_image_editing.md
!image_generation/identity-preserving_image-to-video_generation_via_reward-guided_optimization.md
!image_generation/idperturb_enhancing_variation_in_synthetic_face_generation_via_angular_perturbat.md
!image_generation/illustrators_depth_monocular_layer_index_prediction_for_image_decomposition.md
!image_generation/image_diffusion_preview_with_consistency_solver.md
!image_generation/image_generation_from_contextually-contradictory_prompts.md
!image_generation/imageragturbo_towards_one-step_text-to-image_generation_with_retrieval-augmented.md
!image_generation/imagine_before_concentration_diffusion-guided_registers_enhance_partially_releva.md
!image_generation/imontage_unified_versatile_highly_dynamic_many-to-many_image_generation.md
!image_generation/improved_mean_flows_on_the_challenges_of_fastforward_generative_models.md
!image_generation/improving_controllable_generation_faster_training_and_better_performance_via_x0-.md
!image_generation/improving_diffusion_generalization_with_weak-to-strong_segmented_guidance.md
!image_generation/increfa_breaking_the_static_wall_of_generative_model_attribution.md
!image_generation/innoads-composer_efficient_condition_composition_for_e-commerce_poster_generatio.md
!image_generation/instructmix2mix_consistent_sparse-view_editing_through_multi-view_model_personal.md
!image_generation/inter-edit_first_benchmark_for_interactive_instruction-based_image_editing.md
!image_generation/interpretable_and_steerable_concept_bottleneck_sparse_autoencoders.md
!image_generation/interpretable_prompts_made_edit-friendly_token-to-token_similarity_reduction_in_.md
!image_generation/intrinsic_concept_extraction_based_on_compositional_interpretability.md
!image_generation/introsvg_learning_from_rendering_feedback_for_text-to-svg_generation_via_an_intr.md
!image_generation/inverfill_one-step_inversion_for_enhanced_few-step_diffusion_inpainting.md
!image_generation/its_never_too_late_noise_optimization_for_collapse_recovery_in_trained_diffusion.md
!image_generation/just-in-time_training-free_spatial_acceleration_for_diffusion_transformers.md
!image_generation/kontinuous_kontext_continuous_strength_control_for_instruction-based_image_editi.md
!image_generation/lactokgen_latent_consistency_tokenizer_for_1024-pixel_image_generation_by_256_to.md
!image_generation/language-free_generative_editing_from_one_visual_example.md
!image_generation/larp_efficient_multi-view_inpainting_with_latent_reprojection_priors.md
!image_generation/latent_diffusion_inversion_requires_understanding_the_latent_space.md
!image_generation/layer-wise_instance_binding_for_regional_and_occlusion_control_in_text-to-image_.md
!image_generation/layer_consistency_matters_elegant_latent_transition_discrepancy_for_generalizabl.md
!image_generation/leapalign_post_training_flow_matching_models_at_any_generation_step.md
!image_generation/learnability-guided_diffusion_for_dataset_distillation.md
!image_generation/learning_latent_proxies_for_controllable_single-image_relighting.md
!image_generation/learning_latent_transmission_and_glare_maps_for_lens_veiling_glare_removal.md
!image_generation/learning_straight_flows_variational_flow_matching_for_efficient_generation.md
!image_generation/learning_to_generate_via_understanding_understanding-driven_intrinsic_rewarding_.md
!image_generation/learning_what_to_trust_bayesian_prior-guided_optimization_for_visual_generation.md
!image_generation/lesa_learnable_stage-aware_predictors_for_diffusion_model_acceleration.md
!image_generation/leveraging_multispectral_sensors_for_color_correction_in_mobile_cameras.md
!image_generation/leveraging_verifier-based_reinforcement_learning_in_image_editing.md
!image_generation/linear_image_generation_by_synthesizing_exposure_brackets.md
!image_generation/lofa_learning_to_predict_personalized_prior_for_fast_adaptation_of_visual_genera.md
!image_generation/logcd_local-to-global_consistency_distillation_for_few-step_image_generation.md
!image_generation/low-rank_residual_diffusion_models.md
!image_generation/low-resolution_editing_is_all_you_need_for_high-resolution_editing.md
!image_generation/lumix_structured_and_coherent_text-to-intrinsic_generation.md
!image_generation/mactok_robust_continuous_tokenization_for_image_generation.md
!image_generation/magicfuse_single_image_fusion_for_visual_and_semantic_reinforcement.md
!image_generation/magicquill_v2_precise_and_interactive_image_editing_with_layered_visual_cues.md
!image_generation/makeanything_harnessing_diffusion_transformers_for_multi-domain_procedural_seque.md
!image_generation/mapreduce_lora_advancing_the_pareto_front_in_multi-preference_optimization_for_g.md
!image_generation/maproute_semantic_routing_concept_erasure.md
!image_generation/markovian_scale_prediction_a_new_era_of_visual_autoregressive_generation.md
!image_generation/maskfocus_focusing_policy_optimization_on_critical_steps_for_masked_image_genera.md
!image_generation/match-and-fuse_consistent_generation_from_unstructured_image_sets.md
!image_generation/matpedia_a_universal_generative_foundation_for_high-fidelity_material_synthesis.md
!image_generation/meanflow_transformers_with_representation_autoencoders.md
!image_generation/memory-efficient_fine-tuning_diffusion_transformers_via_dynamic_patch_sampling_a.md
!image_generation/merit_multi-domain_efficient_raw_image_translation.md
!image_generation/meta-cot_enhancing_granularity_and_generalization_in_image_editing.md
!image_generation/mico-150k_a_comprehensive_dataset_advancing_multi-image_composition.md
!image_generation/micon-bench_benchmarking_and_enhancing_multi-image_context_image_generation_in_u.md
!image_generation/mirai_autoregressive_visual_generation_needs_foresight.md
!image_generation/mixflow_training_alleviating_exposure_bias_with_slowed_interpolation_mixture.md
!image_generation/mixture_of_states_routing_token-level_dynamics_for_multimodal_generation.md
!image_generation/mixture_of_style_experts_for_diverse_image_stylization.md
!image_generation/mmface-dit_a_dual-stream_diffusion_transformer_for_high-fidelity_multimodal_face.md
!image_generation/mocodiff_a_controllable_autoregressive_diffusion_model_for_expressive_motion_gen.md
!image_generation/morphany3d_unleashing_the_power_of_structured_latent_in_3d_morphing.md
!image_generation/mos_mitigating_optical-sar_modality_gap_for_cross-modal_ship_re-identification.md
!image_generation/motionedit_benchmarking_and_learning_motion-centric_image_editing.md
!image_generation/mpdit_multi-patch_global-to-local_transformer_architecture_for_efficient_flow_ma.md
!image_generation/mrt_masked_region_transformer_for_layered_image_generation_and_editing_at_scale.md
!image_generation/multi-scale_local_speculative_decoding_for_image_generation.md
!image_generation/multibanana_a_challenging_benchmark_for_multi_reference_text_to_image_generation.md
!image_generation/multicrafter_high-fidelity_multi-subject_generation_via_disentangled_attention_a.md
!image_generation/nami_efficient_image_generation_via_bridged_progressive_rectified_flow_transform.md
!image_generation/neaf_natural_image_editing_with_attention_fusion_for_generalizable_test-time_opt.md
!image_generation/neighbor-aware_localized_concept_erasure_in_text-to-image_diffusion_models.md
!image_generation/neighbor_grpo_contrastive_ode_policy_optimization_aligns_flow_models.md
!image_generation/nonlinear_color_transfer_via_learnable_bezier_flows.md
!image_generation/not_all_birds_look_the_same_identity-preserving_generation_for_birds.md
!image_generation/nova_sparse_control_dense_synthesis_for_pair-free_video_editing.md
!image_generation/object-wiper_training-free_object_and_associated_effect_removal_in_videos.md
!image_generation/octot2i_a_self-evolving_agentic_text-to-image_router.md
!image_generation/omni-attribute_open-vocabulary_attribute_encoder_for_visual_concept_personalizat.md
!image_generation/omni2sound_towards_unified_video-text-to-audio_generation.md
!image_generation/omni_iie_bench_benchmarking_the_practical_capabilities_of_image_editing_models.md
!image_generation/omnigen2_towards_instruction-aligned_multimodal_generation.md
!image_generation/one_algorithm_to_align_them_all.md
!image_generation/one_model_many_budgets_elastic_latent_interfaces_for_diffusion_transformers.md
!image_generation/onehoi_unifying_human-object_interaction_generation_and_editing.md
!image_generation/ontoaug_rethinking_generative_data_augmentation_via_ontology_guidance.md
!image_generation/opendpr_open-vocabulary_change_detection_via_vision-centric_diffusion-guided_pro.md
!image_generation/opro_orthogonal_panel-relative_operators_for_panel-aware_in-context_image_genera.md
!image_generation/orionedit_bridging_reference_and_source_images_for_generalized_cross-image_editi.md
!image_generation/orthofuse_training-free_riemannian_fusion_of_orthogonal_style-concept_adapters_f.md
!image_generation/ospo_object-centric_self-improving_preference_optimization_for_text-to-image_gen.md
!image_generation/paco-rl_advancing_reinforcement_learning_for_consistent_image_generation_with_pa.md
!image_generation/parallel_jacobi_decoding_for_fast_autoregressive_image_generation.md
!image_generation/parauni_enhance_generation_in_unified_multimodal_model_with_reinforcement-driven.md
!image_generation/pg-vton_single-pass_training-free_virtual_try-on_via_patch-guided_reference_alig.md
!image_generation/photoframer_multi-modal_image_composition_instruction.md
!image_generation/phyco_learning_controllable_physical_priors_for_generative_motion.md
!image_generation/physgen_physically_grounded_3d_shape_generation_for_industrial_design.md
!image_generation/physics-consistent_diffusion_for_efficient_fluid_super-resolution_via_multiscale.md
!image_generation/pico-banana-400k_a_large-scale_dataset_for_text-guided_image_editing.md
!image_generation/pixel_motion_diffusion_is_what_we_need_for_robot_control.md
!image_generation/pixeldit_pixel_diffusion_transformers_for_image_generation.md
!image_generation/pixelrush_ultrafast_trainingfree_highresolution_im.md
!image_generation/pluggable_pruning_with_contiguous_layer_distillation_for_diffusion_transformers.md
!image_generation/poca_pareto-optimal_curriculum_alignment_for_visual_text_generation.md
!image_generation/polar_a_portrait_olat_dataset_and_generative_framework_for_illumination-aware_fa.md
!image_generation/portraitdirector_a_hierarchical_disentanglement_framework_for_controllable_and_r.md
!image_generation/posed-flow_versatile_and_guided_flow_matching_model_of_human_pose.md
!image_generation/positionic_unified_position_and_identity_consistency_for_image_customization.md
!image_generation/posteromni_generalized_artistic_poster_creation_via_task_distillation_and_unifie.md
!image_generation/posterreward_unlocking_accurate_evaluation_for_high-quality_graphic_design_gener.md
!image_generation/precise_object_and_effect_removal_with_adaptive_target-aware_attention.md
!image_generation/premier_personalized_preference_modulation_with_learnable_user_embedding_in_text.md
!image_generation/preserving_source_video_realism_high-fidelity_face_swapping_for_cinematic_qualit.md
!image_generation/probing_and_bridging_geometry-interaction_cues_for_affordance_reasoning_in_visio.md
!image_generation/processmaker_a_generalized_process_visualization_framework_with_adaptive_sequenc.md
!image_generation/progress_by_pieces_test-time_scaling_for_autoregressive_image_generation.md
!image_generation/projflow_projection_sampling_with_flow_matching_for_zero-shot_exact_spatial_moti.md
!image_generation/promo_promptable_virtual_tryon_efficient.md
!image_generation/prompt_yourself_awakening_textual_semantics_in_1d_visual_tokenizers.md
!image_generation/promptenhancer_taming_your_rewriter_for_text-to-image_generation_via_fine-graine.md
!image_generation/promptloop_plug-and-play_prompt_refinement_via_latent_feedback_for_diffusion_mod.md
!image_generation/property-informed_diffusion-based_text-to-microstructure_generation.md
!image_generation/prototype-guided_concept_erasure_in_diffusion_models.md
!image_generation/proxy-tuning_tailoring_multimodal_autoregressive_models_for_subject-driven_image.md
!image_generation/psdesigner_automated_graphic_design_with_a_human-like_creative_workflow.md
!image_generation/psr_scaling_multi-subject_personalized_image_generation_with_pairwise_subject-co.md
!image_generation/purecc_pure_learning_for_text-to-image_concept_customization.md
!image_generation/qwen-image-layered_towards_inherent_editability_via_layer_decomposition.md
!image_generation/raise_requirement-adaptive_evolutionary_refinement_for_training-free_text-to-ima.md
!image_generation/rdf-mig_a_robust_diffusion_framework_for_masked_image_generation_to_augment_sema.md
!image_generation/re-align_structured_reasoning-guided_alignment_for_in-context_image_generation_a.md
!image_generation/realunify_do_unified_models_truly_benefit_from_unification_a_comprehensive_bench.md
!image_generation/reasonedit_towards_reasoning-enhanced_image_editing_models.md
!image_generation/rebrl_reinforcing_discrete_visual_diffusion_models_with_rebalanced_timestep_cred.md
!image_generation/rectok_reconstruction_distillation_along_rectified_flow.md
!image_generation/refacade_editing_object_with_given_reference_texture.md
!image_generation/refining_few-step_text-to-multiview_diffusion_via_reinforcement_learning.md
!image_generation/refracting_reality_generating_images_with_realistic_transparent_objects.md
!image_generation/region-adaptive_sampling_for_diffusion_transformers.md
!image_generation/regionroute_regional_style_transfer_with_diffusion_model.md
!image_generation/rel-zero_harnessing_patch-pair_invariance_for_robust_zero-watermarking_against_a.md
!image_generation/renderflow_single-step_neural_rendering_via_flow_matching.md
!image_generation/resca_residual_caching_for_diffusion_transformers_acceleration.md
!image_generation/resdit_evoking_the_intrinsic_resolution_scalability_in_diffusion_transformers.md
!image_generation/residual_decoder_adapter_id-preserving_tokenizer_adaption_for_autoregressive_tex.md
!image_generation/residual_diffusion_bridge_model_for_image_restoration.md
!image_generation/resolving_endpoint_underfitting_in_diffusion_bridges_via_noise_alignment.md
!image_generation/resolving_the_identity_crisis_in_text-to-image_generation.md
!image_generation/rethinking_glyph_spatial_information_in_font_generation.md
!image_generation/rethinking_prompt_design_for_inference-time_scaling_in_text-to-visual_generation.md
!image_generation/rethinking_umm_visual_generation_masked_modeling_for_efficient_image-only_pre-tr.md
!image_generation/reviving_convnext_for_efficient_convolutional_diffusion_models.md
!image_generation/reward_sharpness-aware_fine-tuning_for_diffusion_models.md
!image_generation/rewardflow_generate_images_by_optimizing_what_you_reward.md
!image_generation/say_cheese_detail-preserving_portrait_collection_generation_via_natural_language.md
!image_generation/scale_space_diffusion.md
!image_generation/scaling_multi-identity_consistency_for_image_customization_via_multi-to-multi_ma.md
!image_generation/scendi_3d-to-2d_scene_diffusion_cascades_for_urban_generation.md
!image_generation/scieval_evaluating_and_benchmarking_the_faithfulness_of_scientific_image_generat.md
!image_generation/scone_bridging_composition_and_distinction_in_subject-driven_image_generation_vi.md
!image_generation/score2instruct_scaling_up_video_quality-centric_instructions_via_automated_dimen.md
!image_generation/seacache_spectral-evolution-aware_cache_for_accelerating_diffusion_models.md
!image_generation/seeing_what_matters_visual_preference_policy_optimization_for_visual_generation.md
!image_generation/seethrough3d_occlusion_aware_3d_control_in_text-to-image_generation.md
!image_generation/segquant_a_semantics-aware_and_generalizable_quantization_framework_for_diffusio.md
!image_generation/selectively_extracting_and_injecting_visual_attributes_into_text-to-image_models.md
!image_generation/self-corrected_image_generation_with_explainable_latent_rewards.md
!image_generation/self-evaluation_unlocks_any-step_text-to-image_generation.md
!image_generation/semantic_alignment_for_pose-invariant_identity_preserving_diffusion.md
!image_generation/semantic_context_matters_improving_conditioning_for_autoregressive_models.md
!image_generation/semantic_derivative_flow_graph-guided_diffusion_for_controllable_instance_intera.md
!image_generation/semantic_scale_space_a_framework_for_controllable_image_abstraction.md
!image_generation/semantics_lead_the_way_harmonizing_semantic_and_texture_modeling_with_asynchrono.md
!image_generation/sencache_accelerating_diffusion_model_inference_via_sensitivity-aware_caching.md
!image_generation/shadowdraw_from_any_object_to_shadow-drawing_compositional_art.md
!image_generation/shapear_generating_editable_shape_layers_via_autoregressive_diffusion.md
!image_generation/showtable_unlocking_creative_table_visualization_with_collaborative_reflection_a.md
!image_generation/showui-p_flow-based_generative_models_as_gui_dexterous_hands.md
!image_generation/sigma_selective-interleaved_generation_with_multi-attribute_tokens.md
!image_generation/simlbr_learning_to_detect_fake_images_by_learning_to_detect_real_images.md
!image_generation/simpleposter_a_simple_baseline_for_product_poster_generation.md
!image_generation/sjd-pac_accelerating_speculative_jacobi_decoding_via_proactive_drafting_and_adap.md
!image_generation/sketchassist_a_practical_assistant_for_semantic_edits_and_precise_local_redrawin.md
!image_generation/sketchdeco_training-free_latent_composition_for_precise_sketch_colourisation.md
!image_generation/sketchrevive_fine-grained_pixel-to-vector_sketch_completion_with_diffusion-prior.md
!image_generation/skyreels-text_fine-grained_font-controllable_text_editing_for_poster_design.md
!image_generation/slideredit_continuous_image_editing_with_fine-grained_instruction_control.md
!image_generation/smoothing_the_score_function_to_enhance_generalization_in_diffusion_models.md
!image_generation/solace_self_confidence_rewards_t2i.md
!image_generation/soundit_geo-contextual_soundscape-to-landscape_generation.md
!image_generation/sparvar_exploring_sparsity_in_visual_autoregressive_modeling_for_training-free_a.md
!image_generation/spatial-ssrl_enhancing_spatial_understanding_via_self-supervised_reinforcement_l.md
!image_generation/spatialdiff_3d-aware_object_movement_via_implicit_spatial_modeling.md
!image_generation/spatialreward_verifiable_spatial_reward_modeling_for_fine-grained_spatial_consis.md
!image_generation/spatiotemporal_pyramid_flow_matching_for_climate_emulation.md
!image_generation/spdmark_selective_parameter_displacement_for_robust_video_watermarking.md
!image_generation/speediff_scalable_pixel-anchored_end-to-end_latent_diffusion_model.md
!image_generation/spherical_leech_quantization_for_visual_tokenization_and_generation.md
!image_generation/spk2vidnet_a_hierarchical_recurrent_architecture_for_high-fidelity_video_reconstr.md
!image_generation/splitflux_learning_to_decouple_content_and_style_from_a_single_image.md
!image_generation/spotedit_selective_region_editing_in_diffusion_transformers.md
!image_generation/spread_spatial-physical_reasoning_via_geometry_aware_diffusion.md
!image_generation/sra_2_variational_autoencoder_self-representation_alignment_for_efficient_diffus.md
!image_generation/stability-driven_motion_generation_for_object-guided_human-human_co-manipulation.md
!image_generation/stable_mean_flow_lyapunov-inspired_one-step_flow_matching.md
!image_generation/stablematerials_enhancing_diversity_in_material_generation_via_semi-supervised_l.md
!image_generation/stcdit_spatio-temporally_consistent_diffusion_transformer_for_high-quality_video.md
!image_generation/steering_where_to_diffuse_generative_modeling_of_phenotypic_response_simulation_.md
!image_generation/stepwise_credit_assignment_for_grpo_on_flow-matching_models.md
!image_generation/streamavatar_streaming_diffusion_models_for_real-time_interactive_human_avatars.md
!image_generation/streamdit_real-time_streaming_text-to-video_generation.md
!image_generation/streaming_diffusion_model_for_fast_infrared_and_visible_video_fusion.md
!image_generation/style-grpo_semantic-aware_preference_optimization_for_image_style_transfer_guide.md
!image_generation/styledoctor_towards_specialist_reward_model_for_style-centric_generation_tasks.md
!image_generation/stylegallery_training-free_and_semantic-aware_personalized_style_transfer_from_a.md
!image_generation/styletextgen_style-conditioned_multilingual_scene_text_generation.md
!image_generation/synthetic_curriculum_reinforces_compositional_text-to-image_generation.md
!image_generation/synthrgb-t_language-vision_guided_image_translation_for_diversity_synthesis.md
!image_generation/tag-moe_task-aware_gating_for_unified_generative_mixture-of-experts.md
!image_generation/taming_generative_diffusion_model_for_task-oriented_infrared_imaging.md
!image_generation/taming_preference_mode_collapse_via_directional_decoupling_alignment_in_diffusio.md
!image_generation/taming_sampling_perturbations_with_variance_expansion_loss_for_latent_diffusion_.md
!image_generation/taming_video_models_for_3d_and_4d_generation_via_zero-shot_camera_control.md
!image_generation/tap_a_token-adaptive_predictor_framework_for_training-free_diffusion_acceleratio.md
!image_generation/tc-padé_trajectory-consistent_padé_approximation_for_diffusion_acceleration.md
!image_generation/temporal_equilibrium_meanflow_bridging_the_scale_gap_for_one-step_generation.md
!image_generation/test-time_alignment_of_text-to-image_diffusion_models_via_null-text_embedding_op.md
!image_generation/test-time_instance-specific_parameter_composition_a_new_paradigm_for_adaptive_ge.md
!image_generation/textpecker_rewarding_structural_anomaly_quantification_for_enhancing_visual_text.md
!image_generation/texvent_asynchronous_event_data_simulation_via_text_prompt.md
!image_generation/the_consistency_critic_correcting_inconsistencies_in_generated_images_via_refere.md
!image_generation/the_devil_is_in_attention_sharing_improving_complex_non-rigid_image_editing_fait.md
!image_generation/the_drift_kernel_why_diffusion_models_change_even_when_told_not_to.md
!image_generation/the_image_as_its_own_reward_reinforcement_learning_with_adversarial_reward_for_i.md
!image_generation/the_universal_normal_embedding.md
!image_generation/thera_thermal-aware_visual-language_prompting_for_controllable_rgb-to-thermal_in.md
!image_generation/thinkgen_generalized_thinking_for_visual_generation.md
!image_generation/thinking-while-generating_interleaving_textual_reasoning_throughout_visual_gener.md
!image_generation/tina_text-free_inversion_attack_for_unlearned_text-to-image_diffusion_models.md
!image_generation/tokenlight_precise_lighting_control_in_images_using_attribute_tokens.md
!image_generation/too_vivid_to_be_real_benchmarking_and_calibrating_generative_color_fidelity.md
!image_generation/toward_diffusible_high-dimensional_latent_spaces_a_frequency_perspective.md
!image_generation/toward_early_quality_assessment_of_text-to-image_diffusion_models.md
!image_generation/towards_fine-grained_attribution_instance-aware_preference_optimization_for_alig.md
!image_generation/towards_high-resolution_and_disentangled_reference-based_sketch_colorization.md
!image_generation/towards_photorealistic_and_efficient_bokeh_rendering_via_diffusion_framework.md
!image_generation/towards_robust_sequential_decomposition_for_complex_image_editing.md
!image_generation/training-free_detection_of_generated_videos_via_spatial-temporal_likelihoods.md
!image_generation/training-free_mixed-resolution_latent_upsampling_for_spatially_accelerated_diffu.md
!image_generation/training-free_motion_factorization_for_compositional_video_generation.md
!image_generation/training-free_perceptually_consistent_low-resolution_previews.md
!image_generation/transition_models_rethinking_the_generative_learning_objective.md
!image_generation/ultra_diffusion_poser_diffusion-based_human_motion_tracking_from_sparse_inertial.md
!image_generation/ultraflux_data-model_co-design_for_high-quality_native_4k_text-to-image_generati.md
!image_generation/understanding_accelerating_and_improving_meanflow_training.md
!image_generation/uni-dad_unified_distillation_and_adaptation_of_diffusion_models_for_few-step_few.md
!image_generation/unicedit-10m_a_dataset_and_benchmark_breaking_the_scale-quality_barrier_via_unif.md
!image_generation/uniedit-i_training-free_image_editing_for_unified_vlm_via_iterative_understandin.md
!image_generation/unified_customized_generation_by_disentangled_reward_modeling.md
!image_generation/unified_latent_space_for_understanding_and_generation_via_semantic_auto-encoder.md
!image_generation/unified_vector_floorplan_generation_via_markup_representation.md
!image_generation/unigen-15_enhancing_image_generation_and_editing_through_reward_unification_in_r.md
!image_generation/unigendet_a_unified_generative-discriminative_framework_for_co-evolutionary_imag.md
!image_generation/unipercept_a_unified_diffusion_model_for_generalizable_visual_perception.md
!image_generation/universe_a_unified_modulation_framework_for_segmentation-free_disentangled_multi.md
!image_generation/universe_empower_unified_generation_with_reasoning_and_knowledge.md
!image_generation/va-p_variational_policy_alignment_for_pixel-aware_autoregressive_generation.md
!image_generation/var_rl_done_right_tackling_asynchronous_policy_conflicts_in_visual_autoregressiv.md
!image_generation/vde_training-free_accelerating_rectified_flow_model_via_velocity_decomposition_a.md
!image_generation/vecglypher_unified_vector_glyph_generation_with_language_models.md
!image_generation/vectorark_learning_practical_image_vectorization_with_rounded_polygon_representa.md
!image_generation/vfm-vae_vision_foundation_models_can_be_good_tokenizers_for_latent_diffusion_mod.md
!image_generation/vibe_spaces_for_creatively_connecting_and_expressing_visual_concepts.md
!image_generation/vibetoken_scaling_1d_image_tokenizers_and_autoregressive_models_for_dynamic_reso.md
!image_generation/videocof_unified_video_editing_with_temporal_reasoner.md
!image_generation/vihoi_human-object_interaction_synthesis_with_visual_priors.md
!image_generation/vinedresser3d_agentic_text-guided_3d_editing.md
!image_generation/vins-120k_ultra_high-resolution_image_editing_with_a_large-scale_dataset.md
!image_generation/visiondirector_vision-language_guided_closed-loop_refinement_for_generative_imag.md
!image_generation/vistorybench_comprehensive_benchmark_suite_for_story_visualization.md
!image_generation/visual_diffusion_models_are_geometric_solvers.md
!image_generation/visual_personalization_turing_test.md
!image_generation/vosr_a_vision_only_generative_model_for_image_super_resolution.md
!image_generation/wadi_weight_direction-aware_distillation_for_one-step_image_synthesis.md
!image_generation/what_is_it_like_to_be_a_noise_an_entropy-based_gaussian_noise_regularization_for.md
!image_generation/when_anonymity_breaks_identifying_models_behind_text-to-image_leaderboards.md
!image_generation/when_local_rules_create_global_order_self-organized_representation_learning_for_.md
!image_generation/when_pretty_isnt_useful_investigating_why_modern_text-to-image_models_fail_as_re.md
!image_generation/when_safety_collides_resolving_multi-category_harmful_conflicts_in_text-to-image.md
!image_generation/wiseedit_benchmarking_cognition-_and_creativity-informed_image_editing.md
!image_generation/wiser_wider_search_deeper_thinking_and_adaptive_fusion_for_training-free_zero-sh.md
!image_generation/you_only_erase_once_erasing_anything_without_bringing_unexpected_content.md
!image_generation/your_latent_mask_is_wrong_pixel-equivalent_latent_compositing_for_diffusion_mode.md
!image_restoration/2-shots_in_the_dark_low-light_denoising_with_minimal_data_acquisition.md
!image_restoration/a_bit_is_all_you_need_efficient_video_capture_via_single_bit_imaging.md
!image_restoration/acetone_bridging_words_and_colors_for_conditional_image_grading.md
!image_restoration/beyond_ground-truth_leveraging_image_quality_priors_for_real-world_image_restora.md
!image_restoration/beyond_strict_pairing_arbitrarily_paired_training_for_high-performance_infrared_.md
!image_restoration/beyond_the_ground_truth_enhanced_supervision_for_image_restoration.md
!image_restoration/bhcast_unlocking_black_hole_plasma_dynamics_from_a_single_blurry_image_with_long.md
!image_restoration/bi-bridge_bidirectional_diffusion_bridges_for_low-light_image_enhancement.md
!image_restoration/bievlight_bi-level_learning_of_task-aware_event_refinement_for_low-light_image_e.md
!image_restoration/biprolora_bilevel_prompt_lora_for_real_scene_recovery.md
!image_restoration/bluref_unsupervised_image_deblurring_with_dense-matching_references.md
!image_restoration/bridging_the_perception_gap_in_image_super-resolution_evaluation.md
!image_restoration/canoncgt_reference-based_color_grading_via_canonical_pivot_representation.md
!image_restoration/casr_a_robust_cyclic_framework_for_arbitrary_large-scale_super-resolution_with_d.md
!image_restoration/colorflux_a_structure-color_decoupling_framework_for_old_photo_colorization.md
!image_restoration/convexity-aware_noise_calibration_a_self-supervised_framework_for_noise-level-un.md
!image_restoration/coordinate_denoising_for_non-equilibrium_molecular_representation_learning.md
!image_restoration/degradation-consistent_test-time_adaptation_for_all-in-one_image_restoration.md
!image_restoration/degradation-robust_fusion_an_efficient_degradation-aware_diffusion_framework_for.md
!image_restoration/detectsci_toward_object-guided_roi_reconstruction_for_high-resolution_video_snap.md
!image_restoration/diffdecompose_layer-wise_decomposition_of_alpha-composited_images_via_diffusion_.md
!image_restoration/diffusion-based_srgb_real_noise_generation_via_prompt-driven_noise_representatio.md
!image_restoration/disentangled_textual_priors_for_diffusion-based_image_super-resolution.md
!image_restoration/disentanglement-wise_image_dehazing_through_cross-domain_manifold_consensus.md
!image_restoration/distilling_quasi-conformal_mapping_a_generalizable_and_efficient_solution_for_wi.md
!image_restoration/dnf-sr_dual-input_and_negative-aware_feature_fine-tuning_for_real-world_image_su.md
!image_restoration/dpgf-net_dual-prior_guided_fusion_network_for_joint_assessment_of_perceptual_qua.md
!image_restoration/dreamsr_towards_ultra-high-resolution_image_super-resolution_via_a_receptive-fie.md
!image_restoration/dual_ascent_diffusion_for_inverse_problems.md
!image_restoration/dual_graph_regularized_deep_unfolding_network_for_guided_depth_map_super-resolut.md
!image_restoration/dvar_dynamic_visual_autoregressive_modeling_for_image_super-resolution.md
!image_restoration/dynamic_exposure_burst_image_restoration.md
!image_restoration/edge-focused_super-resolution_for_omnidirectional_images_with_spherical_geometri.md
!image_restoration/edit-aware_raw_reconstruction.md
!image_restoration/enhancing_unregistered_hyperspectral_image_super-resolution_via_unmixing-based_a.md
!image_restoration/event-based_motion_deblurring_using_task-oriented_3d_gaussian_event_representati.md
!image_restoration/event-based_motion_deblurring_with_unpaired_data.md
!image_restoration/event-illumination_collaborative_low-light_image_enhancement_with_a_high-resolut.md
!image_restoration/evlf_early_vision-language_fusion_for_generative_dataset_distillation.md
!image_restoration/expocm_exposure-aware_one-step_generative_single-image_hdr_reconstruction.md
!image_restoration/fape-ir_frequency-aware_planning_and_execution_framework_for_all-in-one_image_re.md
!image_restoration/fastgamer_efficient_gainmap_learning_for_practical_inverse_tone_mapping.md
!image_restoration/fidesr_high-fidelity_and_detail-preserving_one-step_diffusion_super-resolution.md
!image_restoration/finpercep_rm_a_fine_grained_reward_model_and_co_evolutionary_curriculum_for_rl_ba.md
!image_restoration/foundir-v2_optimizing_pre-training_data_mixtures_for_image_restoration_foundatio.md
!image_restoration/from_events_to_clarity_the_event-guided_diffusion_framework_for_dehazing.md
!image_restoration/fusionregister_every_infrared_and_visible_image_fusion_deserves_registration.md
!image_restoration/gaussian_splatting-based_low-rank_tensor_representation_for_multi-dimensional_im.md
!image_restoration/gdpo-sr_group_direct_preference_optimization_for_one-step_generative_image_super.md
!image_restoration/gfrrn_explore_the_gaps_in_single_image_reflection_removal.md
!image_restoration/gsnr_graph_smooth_null_space_representation_for_inverse_problems.md
!image_restoration/gyro-based_deep_video_deblurring.md
!image_restoration/hdw-sr_high-frequency_guided_diffusion_model_based_on_wavelet_decomposition_for_.md
!image_restoration/hfr_and_hdr_video_from_multi-attenuated_spikes_using_a_rapidly_rotating_spokend_.md
!image_restoration/hidra_hierarchical_degradation_representation_and_adaptation_with_generative_pri.md
!image_restoration/human-centric_multi-exposure_fusion_benchmark_and_bi-level_cognition_distillatio.md
!image_restoration/hybrid_agents_for_image_restoration.md
!image_restoration/iafmnet_information-aware_feature_modulation_for_efficient_super-resolution.md
!image_restoration/ifcsr_inference-free_fidelity-realism_control_for_one-step_diffusion-based_real-.md
!image_restoration/it_takes_two_a_duet_of_periodicity_and_directionality_for_burst_flicker_removal.md
!image_restoration/language-guided_one-step_diffusion_model_for_nighttime_flare_removal.md
!image_restoration/learned_image_compression_via_sparse_attention_and_adaptive_frequency.md
!image_restoration/learning_personalized_photographic_style_from_pairwise_user_preferences.md
!image_restoration/lf-bvn_blind-view_network_for_self-supervised_light_field_denoising.md
!image_restoration/life-iqa_boosting_blind_image_quality_assessment_through_gcn-enhanced_layer_inte.md
!image_restoration/lightrr_a_lightweight_network_for_single_image_reflection_removal.md
!image_restoration/lrdun_a_low-rank_deep_unfolding_network_for_efficient_spectral_compressive_imagi.md
!image_restoration/lrhdr_learning_representation-enhanced_hdr_video_reconstruction.md
!image_restoration/mmdir_multimodal_instruction-driven_framework_for_mixed-degradation_document_ima.md
!image_restoration/mr_illuminate_zero-shot_low-light_image_enhancement_with_diffusion_prior.md
!image_restoration/multi-scale_gradient-guided_unrolling_architecture_with_adaptive_mamba_for_compr.md
!image_restoration/multinex_lightweight_low-light_image_enhancement_via_multi-prior_retinex.md
!image_restoration/nec-diff_noise-robust_event-raw_complementary_diffusion_for_seeing_motion_in_ext.md
!image_restoration/next-scale_prediction_a_self-supervised_approach_for_real-world_image_denoising.md
!image_restoration/omoblur_an_object_motion_blur_dataset_and_benchmark_for_real-world_local_motion_.md
!image_restoration/one-step_diffusion_transformer_for_controllable_real-world_image_super-resolutio.md
!image_restoration/outlier-robust_diffusion_solvers_for_inverse_problems.md
!image_restoration/phasr_generalized_image_shadow_removal_with_physically_aligned_priors.md
!image_restoration/physically-grounded_turbulence_mitigation_with_frame-shared_degradation_paramete.md
!image_restoration/physics-guided_multistep_deformation_reversal_for_ancient_bamboo_slip_restoratio.md
!image_restoration/pnp-cm_consistency_models_as_plug-and-play_priors_for_inverse_problems.md
!image_restoration/polarization_state_tracing_for_reflection_removal_and_color-consistent_reconstru.md
!image_restoration/radar_vq-vae_decoder_of_var_is_a_good_student_for_restoring_against_degradation_.md
!image_restoration/rawdomain_degradation_models_smartphone_sr.md
!image_restoration/rawmetadiff_unlocking_extreme_darkness_from_dual-exposure_raw_with_meta-guided_d.md
!image_restoration/real_iisr_infrared_image_super_resolution_autoregressive.md
!image_restoration/reasonx_mllm-guided_intrinsic_image_decomposition.md
!image_restoration/rectifying_latent_space_for_generative_single-image_reflection_removal.md
!image_restoration/reflection_separation_from_a_single_image_via_joint_latent_diffusion.md
!image_restoration/reflexsplit_single_image_reflection_separation_via_layer_fusion-separation.md
!image_restoration/regionfuse_region-adaptive_pixel_distribution_learning_for_infrared_and_visible_.md
!image_restoration/restore_assess_repeat_a_unified_framework_for_iterative_image_restoration.md
!image_restoration/restore_text_first_enhance_image_later_two-stage_scene_text_image_super-resoluti.md
!image_restoration/rethinking_diffusion_model-based_video_super-resolution_leveraging_dense_guidanc.md
!image_restoration/rethinking_knowledge_transfer_in_image_quality_assessment_a_perceptual_preferenc.md
!image_restoration/retrieve-to-restore_efficient_all-in-one_image_restoration_with_a_retrieval-base.md
!image_restoration/rl-scaniqa_reinforcement-learned_scanpaths_for_blind_360deg_image_quality_assess.md
!image_restoration/scan_clusters_not_pixels_a_cluster-centric_paradigm_for_efficient_ultra-high-def.md
!image_restoration/sduie_semi-supervised_diffusion_for_underwater_image_enhancement_with_quant-text.md
!image_restoration/seeing_through_blur_tackling_defocus_in_spike-based_imaging.md
!image_restoration/self-attention_driven_tensor_representation_for_high-order_data_recovery.md
!image_restoration/self-diffusion_driven_blind_imaging.md
!image_restoration/self-supervised_dynamic_heterogeneous_degradation_modeling_for_unified_zero-shot.md
!image_restoration/selfhvd_self-supervised_handheld_video_deblurring.md
!image_restoration/sgde_self-supervised_geometry_degradation_estimation_framework_for_coded_apertur.md
!image_restoration/shiftlut_spatial_shift_enhanced_look-up_tables_for_efficient_image_restoration.md
!image_restoration/shreddingnet_coarse-to-fine_restoration_for_multi-source_shredded_manuscripts.md
!image_restoration/similarity-consistent_likelihood_diffusion_enables_hidden_person_detection_from_.md
!image_restoration/spatio-temporal_difference_guided_motion_deblurring_with_the_complementary_visio.md
!image_restoration/spectral_super-resolution_via_adversarial_unfolding_and_data-driven_spectrum_reg.md
!image_restoration/statistical_characteristic-guided_denoising_for_rapid_high-resolution_transmissi.md
!image_restoration/task-aware_image_signal_processor_for_advanced_visual_perception.md
!image_restoration/textovsr_text-guided_real-world_opera_video_super-resolution.md
!image_restoration/the_surprising_effectiveness_of_noise_pretraining_for_implicit_neural_representa.md
!image_restoration/tiacam_text-anchored_invariant_feature_learning_with_auto-augmentation_for_camer.md
!image_restoration/time-aware_one_step_diffusion_network_for_real-world_image_super-resolution.md
!image_restoration/time-specialized_event-image_alignment_for_blur-to-video_decomposition.md
!image_restoration/time_without_time_pseudo-temporal_representation_for_space-time_super-resolution.md
!image_restoration/tm-bsn_triangular-masked_blind-spot_network_for_real-world_self-supervised_image.md
!image_restoration/towards_generalized_representations_for_low-light_understanding_when_signal_cons.md
!image_restoration/tudsr_twice_upsampling-diffusion_for_higher_super-resolution.md
!image_restoration/ucan_unified_convolutional_attention_lightweight_sr.md
!image_restoration/ucmnet_uncertainty-aware_context_memory_network_for_under-display_camera_image_r.md
!image_restoration/udapose_unsupervised_domain_adaptation_for_low_light_human_pose_estimation.md
!image_restoration/unicac_universal_computational_aberration_correction_benchmark.md
!image_restoration/unildiff_unlocking_the_power_of_diffusion_priors_for_all-in-one_image_restoratio.md
!image_restoration/unirain_unified_image_deraining_rag_dataset_distillation.md
!image_restoration/uniser_a_foundation_model_for_unified_soft_effects_removal.md
!image_restoration/unpaired_image_deraining_using_reward-guided_self-reinforcement_strategy.md
!image_restoration/unreflectanything_rgb-only_highlight_removal_by_rendering_synthetic_specular_sup.md
!image_restoration/vemamba_efficient_isotropic_reconstruction_of_volume_electron_microscopy_with_ax.md
!image_restoration/vodasure_a_large-scale_dataset_revealing_domain_shift_in_volumetric_super-resolu.md
!image_restoration/white-balance_first_adjust_later_cross-camera_color_constancy_via_vision-languag.md
!image_restoration/zero-shot_image_denoising_via_hybrid_prior-guided_pseudo_sample_generation.md
!image_restoration/zeroidir_zero-reference_illumination_degradation_image_restoration_with_perturbe.md
!interpretability/align_once_to_explain_feature_alignment_for_scalable_b-cosification_of_foundatio.md
!interpretability/back_to_the_feature_explaining_video_classifiers_with_video_counterfactual_expla.md
!interpretability/beyond_top_activations_efficient_and_reliable_crowdsourced_evaluation_of_automat.md
!interpretability/cigma_causal_information-gain_mechanistic_attribution_of_attention_heads_in_visi.md
!interpretability/creward_a_type-specific_creativity_reward_model.md
!interpretability/cut_to_the_chase_training-free_multimodal_summarization_via_chain-of-events.md
!interpretability/draft_and_refine_with_visual_experts.md
!interpretability/edit-as-act_goal-regressive_planning_for_open-vocabulary_3d_indoor_scene_editing.md
!interpretability/ermoe_eigen-reparameterized_mixture-of-experts_for_stable_routing.md
!interpretability/h-sets_hessian-guided_discovery_of_set-level_feature_interactions_in_image_class.md
!interpretability/hidden_monotonicity_explaining_deep_neural_networks_via_their_dc_decomposition.md
!interpretability/hierarchical_concept_embedding_pursuit_for_interpretable_image_classification.md
!interpretability/humorchain_theory-guided_multi-stage_reasoning_for_interpretable_multimodal_humo.md
!interpretability/improving_sparse_autoencoder_with_dynamic_attention.md
!interpretability/inside-out_measuring_generalization_in_vision_transformers_through_inner_working.md
!interpretability/language_models_can_explain_visual_features_via_steering.md
!interpretability/make_it_sing_analyzing_semantic_invariants_in_classifiers.md
!interpretability/making_the_classification_explanation_faithful_to_the_confidence_score.md
!interpretability/measuring_the_unfaithfulness_of_concept-based_explanations.md
!interpretability/medlime_a_distribution-aligned_and_evidence-supported_framework_for_medical_sali.md
!interpretability/missing_no_more_dictionary-guided_cross-modal_image_fusion_under_missing_infrare.md
!interpretability/neurodynamics-driven_coupled_neural_p_systems_for_multi-focus_image_fusion.md
!interpretability/phasewin_search_framework_enable_efficient_object-level_interpretation.md
!interpretability/pixel2phys_distilling_governing_laws_from_visual_dynamics.md
!interpretability/prism_prototype-based_reasoning_with_inter-modal_semantic_mining_for_interpretab.md
!interpretability/rethinking_concept_bottleneck_models_from_pitfalls_to_solutions.md
!interpretability/riskprop_collision-anchored_self-supervised_risk_propagation_for_early_accident_.md
!interpretability/rounded_or_streamlined_head_bridging_concept_bottleneck_models_and_attribute-des.md
!interpretability/safedrive_fine-grained_safety_reasoning_for_end-to-end_driving_in_a_sparse_world.md
!interpretability/selection-as-nonlinearity_bridging_attention_and_activation_via_a_joint_game-dec.md
!interpretability/tdatr_improving_end-to-end_table_recognition_via_table_detail-aware_learning_and.md
!interpretability/viro_robust_and_efficient_neuro-symbolic_reasoning_with_verification_for_referri.md
!interpretability/when_do_models_actually_decide_mapping_the_layer-wise_decision_timeline_in_pretr.md
!interpretability/where_culture_fades_revealing_the_cultural_gap_in_text-to-image_generation.md
!knowledge_editing/attribution-guided_model_rectification_of_unreliable_neural_network_behaviors.md
!knowledge_editing/same_sparse_and_anchored_model_editing_for_heterogeneous_incremental_learning_un.md
!llm_agent/adapaction_adaptive_target_action_backdoor_attack_against_gui_agents.md
!llm_agent/aeroagent_a_vision-physics-decision_framework_for_aerodynamic_vehicle_design.md
!llm_agent/agent4faceforgery_multi-agent_llm_framework_for_realistic_face_forgery_detection.md
!llm_agent/bami_training-free_bias_mitigation_in_gui_grounding.md
!llm_agent/bridgeeqa_virtual_embodied_agents_for_real_bridge_inspections.md
!llm_agent/cgl_advancing_continual_gui_learning_via_reinforcement_fine-tuning.md
!llm_agent/drama_next-gen_dynamic_orchestration_for_resilient_multi-agent_ecosystems_in_flu.md
!llm_agent/ego2web_a_web_agent_benchmark_grounded_in_egocentric_videos.md
!llm_agent/epiagent_agent_centric_system_for_ancient_inscription_restoration.md
!llm_agent/experience_transfer_for_multimodal_llm_agents_in_minecraft_game.md
!llm_agent/gui-ceval_a_hierarchical_and_comprehensive_chinese_benchmark_for_mobile_gui_agen.md
!llm_agent/hats_hardness-aware_trajectory_synthesis_for_gui_agents.md
!llm_agent/haven_hierarchical_long_video_understanding_with_audiovisual_entity_cohesion.md
!llm_agent/history_to_future_evolving_agent_with_experience_and_thought_for_zero-shot_visio.md
!llm_agent/ishift_lightweight_slow-fast_gui_agent_with_adaptive_perception.md
!llm_agent/jarvisevo_towards_a_self-evolving_photo_editing_agent_with_synergistic_editor-ev.md
!llm_agent/learning_to_adapt_self-improving_web_agent_via_cognitive-aware_exploration.md
!llm_agent/learning_to_select_visual_tools_from_experience.md
!llm_agent/mmbench-gui_a_unified_hierarchical_evaluation_framework_for_multi-platform_gui_a.md
!llm_agent/modularagent_a_task-aware_modular_framework_for_joint_optimization_of_multimodal.md
!llm_agent/orca_orchestrated_reasoning_with_collaborative_agents_for_document_visual_questi.md
!llm_agent/os-oracle_a_comprehensive_framework_for_cross-platform_gui_critic_models.md
!llm_agent/paper2figure_a_multi-agent_collaborative_system_for_figure_generation_towards_ac.md
!llm_agent/proactivemobile_a_comprehensive_benchmark_for_boosting_proactive_intelligence_on.md
!llm_agent/raas_llm_agentic_system_architecture_search_with_grpo.md
!llm_agent/realm_mllm_agent_3d_reasoning_gaussian.md
!llm_agent/refact_empowering_multimodal_web_agents_with_visual_and_context_focusing.md
!llm_agent/refer-agent_a_collaborative_multi-agent_system_with_reasoning_and_reflection_for.md
!llm_agent/resolving_evidence_sparsity_agentic_context_engineering_for_long-document_unders.md
!llm_agent/retouchiq_mllm_agents_for_instruction-based_image_retouching_with_generalist_rew.md
!llm_agent/sage_training_smart_any-horizon_agents_for_long_video_reasoning_with_reinforceme.md
!llm_agent/scieducator_scientific_video_understanding_and_educating_via_deming-cycle_multi-.md
!llm_agent/seeing_as_experts_do_a_knowledge-augmented_agent_for_open-set_fine-grained_visua.md
!llm_agent/simple_agents_outperform_experts_in_biomedical_imaging_workflow_optimization.md
!llm_agent/symphony_a_cognitively-inspired_multi-agent_system_for_long-video_understanding.md
!llm_agent/think_then_verify_a_hypothesis-verification_multi-agent_framework_for_long_video.md
!llm_agent/towards_gui_agents_vision-language_diffusion_models_for_gui_grounding.md
!llm_agent/universal_guideline-driven_image_clustering_via_a_hybrid_llm_agent.md
!llm_agent/vilomem_agentic_learner_with_grow-and-refine_multimodal_semantic_memory.md
!llm_agent/vulcan_tool-augmented_multi_agents_for_iterative_3d_object_arrangement.md
!llm_agent/webchain_a_large-scale_human-annotated_dataset_of_real-world_web_interaction_tra.md
!llm_agent/webgym_scaling_training_environments_for_long-horizon_visual_web_agents_with_rea.md
!llm_alignment/anchoring_the_mind_of_multimodal_reasoners_cognitive_bias_as_a_vector_for_jailbr.md
!llm_alignment/bridging_human_evaluation_to_infrared_and_visible_image_fusion.md
!llm_alignment/drm_diffusion-based_reward_model_with_step-wise_guidance.md
!llm_alignment/ecoalign_an_economically_rational_framework_for_efficient_lvlm_alignment.md
!llm_alignment/from_pixel_to_precision_enhancing_handwritten_mathematical_expression_recognitio.md
!llm_alignment/morphseek_fine-grained_latent_representation-level_policy_optimization_for_defor.md
!llm_alignment/principled_steering_via_null-space_projection_for_jailbreak_defense_in_vision-la.md
!llm_alignment/safegrpo_self-rewarded_multimodal_safety_alignment_via_rule-governed_policy_opti.md
!llm_alignment/thinking_with_frames_generative_video_distortion_evaluation_via_frame_reward_mod.md
!llm_alignment/uncertainty-aware_exploratory_direct_preference_optimization_for_multimodal_larg.md
!llm_alignment/unlocking_token_rewards_via_training-free_reward_attribution.md
!llm_alignment/video-coe_reinforcing_video_event_prediction_via_chain_of_events.md
!llm_efficiency/e2-sci_elastic_edge-cloud_speculative_decoding_via_credit_inertia.md
!llm_efficiency/few-shot_hybrid_incremental_learningcontinually_learning_under_data_scarcity_and.md
!llm_efficiency/gated_kalmanet_a_fading_memory_layer_through_test-time_ridge_regression.md
!llm_efficiency/generalizable_video_quality_assessment_via_weak-to-strong_learning.md
!llm_efficiency/jump-hand_learning_joint-wise_uncertainty_to_gate_mixture_of_view_experts_for_mu.md
!llm_efficiency/parallelvlm_lossless_video-llm_acceleration_with_visual_alignment_aware_parallel.md
!llm_efficiency/quietprune_query-guided_early_token_pruning_for_vision-language_models.md
!llm_efficiency/rejection_mixing_fast_semantic_propagation_of_mask_tokens_for_efficient_dllm_inf.md
!llm_nlp/llm-guided_probabilistic_fusion_for_label-efficient_document_layout_analysis.md
!llm_nlp/omnidoclayout_towards_diverse_document_layout_generation_via_coarse-to-fine_llm_.md
!llm_nlp/single-step_diffusion-based_video_coding_with_semantic-temporal_guidance.md
!llm_pretraining/exploring_visual_pretraining_for_learning_language_intelligence.md
!llm_pretraining/linking_modality_isolation_in_heterogeneous_collaborative_perception.md
!llm_pretraining/reconstructing_clip_for_open-vocabulary_dense_perception.md
!llm_pretraining/unlocking_pre-trained_weights_parameter_inheritance_for_zero-shot_initialization.md
!llm_pretraining/watch_and_learn_learning_to_use_computers_from_online_videos.md
!llm_reasoning/agile_deliberation_concept_deliberation_for_subjective_visual_classification.md
!llm_reasoning/appo_attention-guided_perception_policy_optimization_for_video_reasoning.md
!llm_reasoning/dynamic_important_example_mining_for_reinforcement_finetuning.md
!llm_reasoning/e-comiq-zh_a_human-aligned_dataset_and_benchmark_for_fine-grained_evaluation_of_.md
!llm_reasoning/eaglevision_a_dual-stage_framework_with_bev-grounding-based_chain-of-thought_for.md
!llm_reasoning/firescope_wildfire_risk_raster_prediction_with_a_chain-of-thought_oracle.md
!llm_reasoning/hilbert-geo_solving_solid_geometric_problems_by_neural-symbolic_reasoning.md
!llm_reasoning/human-like_abstract_visual_reasoning_via_understanding_and_solving_reasoning_loo.md
!llm_reasoning/latent_chain-of-thought_world_modeling_for_end-to-end_autonomous_driving.md
!llm_reasoning/rationale-enhanced_decoding_for_multi-modal_chain-of-thought.md
!llm_reasoning/reasoning_palette_modulating_reasoning_via_latent_contextualization_for_controll.md
!llm_reasoning/relax_reasoning_with_latent_exploration_for_large_reasoning_models.md
!llm_reasoning/revisiting_the_necessity_of_lengthy_chain-of-thought_in_vision-centric_reasoning.md
!llm_reasoning/scaling_agentic_reinforcement_learning_for_tool-integrated_reasoning_in_vlms.md
!llm_reasoning/think-as-you-see_streaming_chain-of-thought_reasoning_for_large_vision-language_.md
!llm_reasoning/visref_visual_refocusing_test_time_scaling.md
!llm_safety/autodebias_automated_framework_for_debiasing_text-to-image_models.md
!llm_safety/blind_spot_of_adaptation_quantifying_and_mitigating_forgetting_in_fine_tuned_driving_models.md
!llm_safety/designing_to_forget_deep_semi-parametric_models_for_unlearning.md
!llm_safety/elastic_weight_consolidation_done_right_for_continual_learning.md
!llm_safety/learning_from_oblivion_predicting_knowledge_overflowed_weights_via_retrodiction_.md
!llm_safety/machine_unlearning_via_adaptive_gradient_reweighting_and_multi-stage_objective_o.md
!llm_safety/omni-attack_adversarial_attacks_on_open-ended_vqa_in_black-box_multimodal_llms.md
!llm_safety/oslash_source_models_leak_what_they_shouldnt_nrightarrow_unlearning_zero-shot_tr.md
!llm_safety/ph-strips_for_selective_forgetting_a_blunt_but_fast_diagnostic_baseline_for_mach.md
!llm_safety/revisiting_learning_with_noisy_labels_active_forgetting_and_noise_suppression.md
!llm_safety/select_hypothesize_and_verify_towards_verified_neuron_concept_interpretation.md
!llm_safety/sineproject_machine_unlearning_for_stable_vision_language_alignment.md
!medical_imaging/a_supervised_multi-task_framework_for_joint_cryo-et_restoration_enabled_by_gener.md
!medical_imaging/act_like_a_pathologist_tissue-aware_whole_slide_image_reasoning.md
!medical_imaging/active_inference_for_micro-gesture_recognition_efe-guided_temporal_sampling_and_.md
!medical_imaging/ad-gbc_anisotropic_granular-ball_skip-connection_refiner_for_unet-based_medical_image_seg.md
!medical_imaging/adaptive_anisotropic_gaussian_splatting_for_multi-contrast_mri_arbitrary-scale_s.md
!medical_imaging/adaptive_confidence_regularization_for_multimodal_failure_detection.md
!medical_imaging/anatomica_localized_control_over_geometric_and_topological_properties_for_anatom.md
!medical_imaging/any2any_3d_diffusion_models_with_knowledge_transfer_a_radiotherapy_planning_stud.md
!medical_imaging/backsplit_the_importance_of_sub-dividing_the_background_in_biomedical_lesion_seg.md
!medical_imaging/benchmarking_endoscopic_surgical_image_restoration_and_beyond.md
!medical_imaging/better_than_average_spatially-aware_aggregation_of_segmentation_uncertainty_impr.md
!medical_imaging/beyond_the_static-world_lifelong_learning_for_all-in-one_medical_image_restorati.md
!medical_imaging/biotprompt_bidirectional_optimal_transport_guided_prompting_for_disease_evolutio.md
!medical_imaging/breaking_the_continuum_discrete_distribution_learning_for_structural_mri_reconst.md
!medical_imaging/bridging_brain_and_semantics_a_hierarchical_framework_for_semantically_enhanced_.md
!medical_imaging/bridging_rgb_and_hematoxylin_components_an_interleaved_guidance_and_fusion_frame.md
!medical_imaging/building_robust_vision_encoders_for_cross-dataset_evaluation_in_immunofluorescen.md
!medical_imaging/cg-reasoner_centroid-guided_positional_reasoning_segmentation_for_medical_imagin.md
!medical_imaging/chips_efficient_clip_adaptation_via_curvature-aware_hybrid_influence-based_data_.md
!medical_imaging/clinically-grounded_counterfactual_reasoning_for_medical_video_diagnosis.md
!medical_imaging/cmr-rd_long-tailed_adaptive_vlm_for_explainable_cmr_diagnosis.md
!medical_imaging/cofida-m_concept-aware_feature_modulation_for_cross-domain_adaptation_with_image.md
!medical_imaging/contrastive_cross-bag_augmentation_for_multiple_instance_learning-based_whole_sl.md
!medical_imaging/crft_consistent-recurrent_feature_flow_transformer_for_cross-modal_image_registr.md
!medical_imaging/cross-domain_dual-stream_feature_disentanglement_for_brain_disorder_prediction_w.md
!medical_imaging/cross-modal_guided_visual_synthesis_for_data-efficient_multimodal_depression_rec.md
!medical_imaging/crown_a_unified_framework_for_anti-aliased_downsampling_and_phase-calibrated_fus.md
!medical_imaging/cure_curriculum-guided_multi-task_training_for_reliable_anatomy_grounded_report_.md
!medical_imaging/d-convexity_a_unified_differentiable_convex_shape_prior_via_quasi-concavity_for_.md
!medical_imaging/d2-fosa_dual-diffusion_guided_eeg-to-image_reconstruction_with_frequency-oriente.md
!medical_imaging/d2t2_-_multimodal_automated_planning_for_brachytherapy.md
!medical_imaging/darc_dual_adjustment_reasoning_with_counterfactuals_for_trustworthy_chest_x-ray_.md
!medical_imaging/decoding_3d_perception_via_brainssd_synergistic_fusion_of_eeg_representations_fr.md
!medical_imaging/decoupling_vision_and_language_codebook_anchored_visual_adaptation.md
!medical_imaging/delving_aleatoric_uncertainty_in_medical_image_segmentation_via_vision_foundatio.md
!medical_imaging/depth_any_endoscopy_towards_self-supervised_generalizable_depth_estimation_in_mo.md
!medical_imaging/diffusion-based_native_adversarial_synthesis_for_enhanced_medical_segmentation_g.md
!medical_imaging/diffusion_mri_transformer_with_a_diffusion_space_rotary_positional_embedding_d-r.md
!medical_imaging/diffusion_with_a_linguistic_compass_steering_the_generation_of_clinically_plausi.md
!medical_imaging/divide_conquer_and_aggregate_asymmetric_experts_for_class-imbalanced_semi-superv.md
!medical_imaging/dk-ddil_adaptive_knowledge_retention_for_dynamic_domain-incremental_learning_in_.md
!medical_imaging/dual-level_confidence_based_implicit_self-refinement_for_medical_visual_question.md
!medical_imaging/dual-level_hypergraph_generation_for_addressing_feature_scarcity_in_whole-slide_.md
!medical_imaging/duala_dual-level_alignment_of_subjects_and_stimuli_for_cross-subject_fmri_decodi.md
!medical_imaging/dynamic_stream_network_for_combinatorial_explosion_problem_in_deformable_medical.md
!medical_imaging/echopose_6d_pose_estimation_of_sparse_echocardiograms_for_left-ventricular_3d_sh.md
!medical_imaging/echovdiff_cardiac-cycle_echocardiography_video_generation_from_arbitrary_single_.md
!medical_imaging/eegit_teaching_vision_transformers_to_understand_the_eeg_signal.md
!medical_imaging/efficient_unrolled_networks_for_large-scale_3d_inverse_problems.md
!medical_imaging/emad_evidence-centric_grounded_multimodal_diagnosis_for_alzheimers_disease.md
!medical_imaging/every_error_has_its_magnitude_asymmetric_mistake_severity_training_for_multiclas.md
!medical_imaging/f2-assist_multi-phase_fetal_growth_forecast_and_report_generation_from_ultrasoun.md
!medical_imaging/factorized_context_aggregation_for_robust_cancer_risk_estimation_via_soft_re-ran.md
!medical_imaging/fbta_enabling_single-gpu_end-to-end_gigapixel_wsi_classification_with_feature_br.md
!medical_imaging/fmri-lm_towards_a_universal_foundation_model_for_language-aligned_fmri_understan.md
!medical_imaging/focus-to-perceive_representation_learning_a_cognition-inspired_hierarchical_fram.md
!medical_imaging/focus_on_background_exploring_sams_potential_in_few-shot_medical_image_segmentat.md
!medical_imaging/forge_continual_learning_for_fmri_based_brain_disorder_diagnosis.md
!medical_imaging/forging_a_dynamic_memory_retrieval-guided_continual_learning_for_generalist_medi.md
!medical_imaging/from_infusion_to_assimilation_distillation_for_medical_image_segmentation.md
!medical_imaging/from_panel_to_pixel_zoom-in_vision-language_pretraining_from_biomedical_scientif.md
!medical_imaging/gastric-x_a_multimodal_multi-phase_benchmark_dataset_for_advancing_vision-langua.md
!medical_imaging/gaussianpile_a_unified_sparse_gaussian_splatting_framework_for_slice-based_volum.md
!medical_imaging/genevar_causal_meanflow_for_autoregressive_gene-to-wsi_tile_synthesis.md
!medical_imaging/gentract_generative_global_tractography.md
!medical_imaging/geosemba_reconstructing_state_space_model_for_cross_paradigm_representation_in_m.md
!medical_imaging/gh-naf_grid-adaptive_hash-level-attended_neural_attenuation_fields_for_discrepan.md
!medical_imaging/graphformer_a_multimodal_graph_persistent_homology_transformer_for_the_analysis_.md
!medical_imaging/h2-surv_hierarchical_hyperbolic_multimodal_representation_learning_for_survival_.md
!medical_imaging/harmonized_feature_conditioning_and_frequency-prompt_personalization_for_multi-r.md
!medical_imaging/hyperbolic_relational_prompts_for_intersectional_fairness_in_medical_vlms.md
!medical_imaging/ibisagent_reinforcing_pixel-level_visual_reasoning_in_mllms_for_universal_biomed.md
!medical_imaging/iebglan_interpretability-enhanced_brain_graph_learning_framework_with_llm-instru.md
!medical_imaging/instruction-guided_lesion_segmentation_for_chest_x-rays_with_automatically_gener.md
!medical_imaging/interpretable_cross-domain_few-shot_learning_with_rectified_target-domain_local_.md
!medical_imaging/invcoss_inversion-driven_continual_self-supervised_learning_in_medical_multi-mod.md
!medical_imaging/ivaan_instance-level_vision-language_alignment_via_attribute-guided_text_prompts.md
!medical_imaging/kamp_knowledge-anchored_multimodal_pretraining_framework_for_medical_image_repre.md
!medical_imaging/keep_it_frozen_domain-routed_conditional_residual_modulation_for_multi-domain_vi.md
!medical_imaging/klip_localized_distribution_shift_detection_via_kl-divergence_with_diffusion_pri.md
!medical_imaging/lata_laplacian-assisted_transductive_adaptation_for_conformal_uncertainty_in_med.md
!medical_imaging/learning_diffeomorphism_for_medical_image_registration_with_time-embedded_archit.md
!medical_imaging/learning_generalizable_3d_medical_image_representations_from_mask-guided_self-su.md
!medical_imaging/lemon_a_large_endoscopic_monocular_dataset_and_foundation_model_for_perception_in.md
!medical_imaging/llada-medv_exploring_large_language_diffusion_models_for_biomedical_image_unders.md
!medical_imaging/lumina_a_multi-vendor_mammography_benchmark_with_energy_harmonization_protocol.md
!medical_imaging/mambaliteunet_cross-gated_adaptive_feature_fusion_for_robust_skin_lesion_segment.md
!medical_imaging/masked-diffusion_autoencoders_for_3d_medical_vision_representation_learning.md
!medical_imaging/mdcs-moame_multi-directional_composite_scanning_with_mixture_of_attention_and_ma.md
!medical_imaging/med-cmr_a_fine-grained_benchmark_integrating_visual_evidence_and_clinical_logic_.md
!medical_imaging/medclipseg_probabilistic_vision-language_adaptation_for_data-efficient_and_gener.md
!medical_imaging/medfg-vqa_low-frequency_memory_and_graph_attention_for_lightweight_medical_vqa.md
!medical_imaging/medgrpo_multi-task_reinforcement_learning_for_heterogeneous_medical_video_unders.md
!medical_imaging/medkco_medical_vision-language_pretraining_via_knowledge-driven_cognitive_orches.md
!medical_imaging/medloc-r1_performance-aware_curriculum_reward_scheduling_for_grpo-based_medical_.md
!medical_imaging/medmo_grounding_and_understanding_multimodal_large_language_model_for_medical_im.md
!medical_imaging/medtvt-r1_a_multimodal_llm_empowering_medical_reasoning_and_diagnosis.md
!medical_imaging/microfm_physics-guided_flow_matching_for_isotropic_microscopy_reconstruction.md
!medical_imaging/mind_the_discriminability_trap_in_source-free_cross-domain_few-shot_learning.md
!medical_imaging/mllm-hwsi_a_multimodal_large_language_model_for_hierarchical_whole_slide_image_u.md
!medical_imaging/modeling_the_brains_grammar_roi-guided_fmri_pretraining_for_transferable_and_int.md
!medical_imaging/momentum_memory_for_knowledge_distillation_in_computational_pathology.md
!medical_imaging/mr-rag_multimodal_relevance-aware_retrieval-augmented_generation_for_medical_vis.md
!medical_imaging/mri_contrast_enhancement_kinetics_world_model.md
!medical_imaging/multimodal_causal-driven_representation_learning_for_generalizable_medical_image.md
!medical_imaging/multimodalpfn_extending_prior-data_fitted_networks_for_multimodal_tabular_learni.md
!medical_imaging/muse_harnessing_precise_and_diverse_semantics_for_few-shot_whole_slide_image_cla.md
!medical_imaging/must_modality-specific_representation-aware_transformer_for_diffusion-enhanced_s.md
!medical_imaging/muvit_multi-resolution_vision_transformers_for_learning_across_scales_in_microsc.md
!medical_imaging/neuroflow_toward_unified_visual_encoding_and_decoding_from_neural_activity.md
!medical_imaging/neuroseg_meets_dinov3_transferring_2d_self-supervised_visual_priors_to_3d_neuron.md
!medical_imaging/octomed_data_recipes_for_state-of-the-art_multimodal_medical_reasoning.md
!medical_imaging/omnibrainbench_a_comprehensive_multimodal_benchmark_for_brain_imaging_analysis_a.md
!medical_imaging/omnifm_toward_modality-robust_and_task-agnostic_federated_learning_for_heterogen.md
!medical_imaging/oralgpt-omni_a_versatile_dental_multimodal_large_language_model.md
!medical_imaging/oralgpt-plus_learning_to_use_visual_tools_via_reinforcement_learning_for_panoram.md
!medical_imaging/orapo_oracle-educated_reinforcement_learning_for_data-efficient_and_factual_radi.md
!medical_imaging/osa_echocardiography_video_segmentation_via_orthogonalized_state_update_and_anat.md
!medical_imaging/pdd_manifold-prior_diverse_distillation_for_medical_anomaly_detection.md
!medical_imaging/personalized_longitudinal_medical_report_generation_via_temporally-aware_federat.md
!medical_imaging/petar_localized_findings_generation_with_mask-aware_vision-language_modeling_for.md
!medical_imaging/pgr-net_prior-guided_roi_reasoning_network_for_brain_tumor_mri_segmentation.md
!medical_imaging/phrase-grounded_apo_for_improving_chest_x-ray_report_generation.md
!medical_imaging/pmrnet_physics-informed_multi-scale_refinement_network_for_medical_image_segment.md
!medical_imaging/post-training_feature_pruning_for_fundus_images_classification.md
!medical_imaging/prospective_dynamic_3d_mri_reconstruction_via_latent-space_motion_tracking_from_.md
!medical_imaging/r2-seg_training-free_ood_medical_tumor_segmentation_via_anatomical_reasoning_and.md
!medical_imaging/rdface_a_benchmark_dataset_for_rare_disease_facial_image_analysis_under_extreme_.md
!medical_imaging/real2sim2real_retinaldepth-64k_for_depth_estimation_in_posterior_segment_ophthal.md
!medical_imaging/reclaiming_lost_text_layers_for_source-free_cross-domain_few-shot_learning.md
!medical_imaging/revisiting_2d_foundation_models_for_scalable_3d_medical_image_classification.md
!medical_imaging/sar2net_learning_spatially_anchored_representations_for_retrieval-guided_cross-s.md
!medical_imaging/sat-rrg_llm-guided_self-adaptive_training_for_radiology_report_generation_with_t.md
!medical_imaging/scaling_self-supervised_and_cross-modal_pretraining_for_volumetric_ct_transforme.md
!medical_imaging/sd_fsmis_adapting_stable_diffusion_for_few_shot_medical_image_segmentation.md
!medical_imaging/segmote_token-level_mixture_of_experts_for_medical_image_segmentation.md
!medical_imaging/semi-supervised_echocardiography_video_segmentation_via_anchor_semantic_awarenes.md
!medical_imaging/semigda_generative_dual-distribution_alignment_for_semi-supervised_medical_image.md
!medical_imaging/shape_structure-aware_hierarchical_unsupervised_domain_adaptation_with_plausibil.md
!medical_imaging/simple-vilmedsam_simple_text_prompts_meet_vision-language_models_for_medical_ima.md
!medical_imaging/simspine_a_biomechanics-aware_simulation_framework_for_3d_spine_motion_annotatio.md
!medical_imaging/sketch2ct_multimodal_diffusion_for_structure-aware_3d_medical_volume_generation.md
!medical_imaging/solving_a_nonlinear_blind_inverse_problem_for_tagged_mri_with_physics_and_deep_g.md
!medical_imaging/sparse_task_vector_mixup_wsi_prognosis.md
!medical_imaging/spegc_continual_test-time_adaptation_via_semantic-prompt-enhanced_graph_clusteri.md
!medical_imaging/splat-based_metal_artifact_reduction_in_cone-beam_ct_via_compact_attenuation_mod.md
!medical_imaging/surgcot_advancing_spatiotemporal_reasoning_in_surgical_videos_through_a_chain-of.md
!medical_imaging/synergistic_bleeding_region_and_point_detection_in_laparoscopic_surgical_videos.md
!medical_imaging/taligndiff_automatic_tooth_alignment_assisted_by_diffusion-based_transformation_.md
!medical_imaging/tamer_a_tri-modal_contrastive_alignment_and_multi-scale_embedding_refinement_fra.md
!medical_imaging/tango_learning_distribution-wise_foundation_prior_consistency_and_instance-wise_.md
!medical_imaging/tell2adapt_a_unified_framework_for_source_free_unsupervised_domain_adaptation_vi.md
!medical_imaging/temporal_inversion_for_learning_interval_change_in_chest_x-rays.md
!medical_imaging/the_invisible_gorilla_effect_in_out-of-distribution_detection.md
!medical_imaging/tim_temporal_decoupling_with_iterative_mutual-refinement_model_for_longitudinal_.md
!medical_imaging/topocl_topological_contrastive_learning_for_medical_imaging.md
!medical_imaging/toposlide_topologically-informed_histopathology_whole_slide_image_representation.md
!medical_imaging/trcorsurg_temporal-relational_co-reasoning_for_surgical_video_triplet_recognitio.md
!medical_imaging/turning_pre-trained_vision_transformers_into_end-to-end_histopathology_whole_sli.md
!medical_imaging/ultrasound-clip_semantic-aware_contrastive_pre-training_for_ultrasound_image-tex.md
!medical_imaging/uni-encoder_meets_multi-encoders_representation_before_fusion_for_brain_tumor_se.md
!medical_imaging/uni-hema_unified_model_for_digital_hematopathology.md
!medical_imaging/universal-to-specific_dynamic_knowledge-guided_multiple_instance_learning_for_fe.md
!medical_imaging/unlocking_positive_transfer_in_incrementally_learning_surgical_instruments_a_sel.md
!medical_imaging/urica_a_uniformity_region_affine_identifier_capture_algorithm_for_arbitrary_regi.md
!medical_imaging/vesmamba_3d_pulmonary_vessel_segmentation_from_ct_images_via_mamba_with_structur.md
!medical_imaging/virtual_full-stack_scanning_of_brain_mri_via_imputing_any_quantised_code.md
!medical_imaging/virtual_immunohistochemistry_staining_with_dual-aligned_multi-task_feature_guida.md
!medical_imaging/virtual_nodes_guided_dynamic_graph_neural_network_for_brain_tumor_segmentation_w.md
!medical_imaging/voxtell_free-text_promptable_universal_3d_medical_image_segmentation.md
!medical_imaging/x-pcr_a_benchmark_for_cross-modality_progressive_clinical_reasoning_in_ophthalmi.md
!medical_imaging/x-win_building_chest_radiograph_world_model_via_predictive_sensing.md
!medical_nlp/towards_efficient_medical_reasoning_with_minimal_fine-tuning_data.md
!model_compression/4d_rgpt_toward_region_level_4d_understanding_via_perceptual_distillation.md
!model_compression/a_unified_framework_for_knowledge_transfer_in_bidirectional_model_scaling.md
!model_compression/adabet_gradient-free_layer_selection_for_efficient_training_of_deep_neural_netwo.md
!model_compression/adaptive_depth_lightweight_rgb-t_tracking_with_holistic_token_routing.md
!model_compression/adaptive_video_distillation_mitigating_oversaturation_and_temporal_collapse_in_f.md
!model_compression/adasvd_singular_value_decomposition_with_adaptive_mechanisms_for_large_multimoda.md
!model_compression/back_to_source_open-set_continual_test-time_adaptation_via_domain_compensation.md
!model_compression/balanced_dataset_distillation_via_modeling_multiple_visual_pattern_distribution.md
!model_compression/batch_loss_score_for_dynamic_data_pruning.md
!model_compression/beyond_soft_label_dataset_distillation_via_orthogonal_gradient_matching.md
!model_compression/bilevel_layer-positioning_lora_for_real_image_dehazing.md
!model_compression/binaryattention_one-bit_qk-attention_for_vision_and_diffusion_transformers.md
!model_compression/block-based_learned_image_compression_without_blocking_artifacts.md
!model_compression/bridging_domains_through_subspace-aware_model_merging.md
!model_compression/cadc_content_adaptive_diffusion-based_generative_image_compression.md
!model_compression/car-sam_cross-attention_reconstruction_for_post-training_quantization_of_the_seg.md
!model_compression/carlos_retrieval_via_concise_assessment_representation_of_loras_at_scale.md
!model_compression/collaborative_multi-mode_pruning_for_vision-language_models.md
!model_compression/content-adaptive_hierarchical_hyperprior_for_neural_video_coding.md
!model_compression/continual_distillation_of_teachers_from_different_domains.md
!model_compression/critical_patch-aware_sparse_prompting_with_decoupled_training_for_continual_lear.md
!model_compression/cross-architecture_adaptation_cloud-edge_continual_test-time_adaptation_with_dyn.md
!model_compression/cross-view_distillation_and_adaptive_masking_for_incomplete_multi-view_multi-lab.md
!model_compression/dage_dual-stream_architecture_for_efficient_and_fine-grained_geometry_estimation.md
!model_compression/dataset_distillation_by_influence_matching.md
!model_compression/decompose_mix_adapt_a_unified_framework_for_parameter-efficient_neural_network_r.md
!model_compression/deltaquant_4-bit_video_diffusion_models_with_spatiotemporal_delta_smoothing.md
!model_compression/discovering_adaptive_task_dependencies_for_efficient_multi-task_representation_c.md
!model_compression/distilling_balanced_knowledge_from_a_biased_teacher.md
!model_compression/distributed_image_compression_with_multimodal_side_information_at_extremely_low_.md
!model_compression/dit-distill_open-set_fine-grained_retrieval_via_generative_curriculum_knowledge.md
!model_compression/dmgd_train-free_dataset_distillation_with_semantic-distribution_matching_in_diff.md
!model_compression/dual-branch_distilled_transformer_for_efficient_asymmetric_uav_tracking.md
!model_compression/dualreg_dual-space_filtering_and_reinforcement_for_rigid_registration.md
!model_compression/duetmerging_synergizing_dynamic_and_static_strategies_for_mitigating_task_interf.md
!model_compression/edge-recvit_efficient_vision_transformer_via_semantic-refined_dynamic_recursion.md
!model_compression/efficiency_follows_global-local_decoupling.md
!model_compression/enhancing_mixture_of_experts_specialization_via_cluster_aware_upcycling.md
!model_compression/evidential_transformation_network_post_hoc_uncertainty_estimation.md
!model_compression/f2hdr_two-stage_hdr_video_reconstruction_via_flow_adapter_and_physical_motion_mo.md
!model_compression/faar_efficient_frequency-aware_multi-task_fine-tuning_via_automatic_rank_selecti.md
!model_compression/fast_topology-aware_frequency-domain_distribution_matching_for_coreset_selection.md
!model_compression/fixed_anchors_are_not_enough_dynamic_retrieval_and_persistent_homology_for_datas.md
!model_compression/fozo_forward-only_zeroth-order_prompt_optimization_for_test-time_adaptation.md
!model_compression/freqsic_frequency-aware_stereo_image_compression_with_bi-directional_checkerboar.md
!model_compression/frequency_switching_mechanism_for_parameter-ecient_multi-task_learning.md
!model_compression/generative_video_compression_with_one-dimensional_latent_representation.md
!model_compression/gradient_knows_best_mixed-precision_quantization_via_gradient-guided_bit_allocat.md
!model_compression/grid_distillation_compositional_image_distillation_via_structured_generative_gri.md
!model_compression/hess_head_sensitivity_score_for_sparsity_redistribution_in_vggt.md
!model_compression/hieramp_coarse-to-fine_autoregressive_amplification_for_generative_dataset_disti.md
!model_compression/high_resolution_neural_video_coding_with_bi-directional_confidence-guided_refere.md
!model_compression/id-sim_an_identity-focused_similarity_metric.md
!model_compression/ims3_breaking_distributional_aggregation_in_diffusion-based_dataset_distillation.md
!model_compression/instantvir_real-time_video_inverse_problem_solver_with_distilled_diffusion_prior.md
!model_compression/is_bin_generation_indispensable_a_bin-generation-free_dataset_quantization_via_s.md
!model_compression/lidere_a_lightweight_readout_for_fast_and_data-efficient_dense_prediction.md
!model_compression/loprune_efficient_data_pruning_for_lora-based_fine-tuning_of_vision_transformer.md
!model_compression/mambasic_mamba-based_stereo_image_compression_with_bi-directional_multi-referenc.md
!model_compression/manifoldgd_training-free_hierarchical_manifold_guidance_for_diffusion-based_data.md
!model_compression/masking_teacher_and_reinforcing_student_for_distilling_vision-language_models.md
!model_compression/memo_human-like_crisp_edge_detection_using_masked_edge_prediction.md
!model_compression/memory_efficient_transfer_learning_with_fading_side_networks.md
!model_compression/mining_attribute_subspaces_for_efficient_fine-tuning_of_3d_foundation_models.md
!model_compression/mitigating_the_distribution_shift_of_diffusion-based_dataset_distillation.md
!model_compression/neural_differentiation_in_deep_networks_a_theoretical_framework_for_expressivity.md
!model_compression/onesparse_a_unified_framework_for_sparse_activation_layers_in_vision_models.md
!model_compression/otil_accelerating_diffusion_model_inference_via_communication-efficient_multi-gp.md
!model_compression/parallax_to_align_them_all_an_omniparallax_attention_mechanism_for_distributed_m.md
!model_compression/perceptual_neural_video_compression_with_color_separation_and_rank_chain.md
!model_compression/phased_dmd_few-step_distribution_matching_distillation_via_score_matching_within.md
!model_compression/planareloc_camera_relocalization_in_3d_planar_primitives_via_region-based_struct.md
!model_compression/planning_in_8_tokens_a_compact_discrete_tokenizer_for_latent_world_model.md
!model_compression/preference-aligned_lora_merging_preserving_subspace_coverage_and_addressing_dire.md
!model_compression/prism_video_dataset_condensation_with_progressive_refinement_and_insertion_for_s.md
!model_compression/privi_towards_a_general-purpose_video_model_for_primate_behavior_in_the_wild.md
!model_compression/progressive_supernet_training_for_efficient_visual_autoregressive_modeling.md
!model_compression/pyramidalwan_on_making_pretrained_video_model_pyramidal_for_efficient_inference.md
!model_compression/qkd_quantum_gated_incremental_learning.md
!model_compression/rank-guided_pseudo-bias_learning_for_robust_black-box_adaptation.md
!model_compression/real-time_neural_video_compression_with_unified_intra_and_inter_coding.md
!model_compression/refta_breaking_the_weight_reconstruction_bottleneck_in_tensorized_parameter-effi.md
!model_compression/rethinking_dataset_distillation_hard_truths_about_soft_labels.md
!model_compression/s2ft_parameter-efficient_fine-tuning_in_sparse_spectrum_domain.md
!model_compression/sampling-aware_quantization_for_diffusion_models.md
!model_compression/saner_switchable_adapter_with_non-parametric_enhanced_routing_for_person_de-reid.md
!model_compression/selectkd_selective_token-weighted_knowledge_distillation_for_llms.md
!model_compression/sg-lora_semantic-guided_lora_parameters_generation.md
!model_compression/siglino_efficient_multi-teacher_distillation_for_agglomerative_vision_foundation.md
!model_compression/streamlined_knowledge_distillation.md
!model_compression/talon_test-time_adaptive_learning_for_on-the-fly_category_discovery.md
!model_compression/tas-lora_transformer_architecture_search_with_mixture-of-lora_experts.md
!model_compression/taskit_memory-efficient_fine-tuning_of_multi-lora_llms_via_cross-task_importance.md
!model_compression/teacher-guided_routing_for_sparse_vision_mixture-of-experts.md
!model_compression/test-time_sparsity_for_extreme_fast_action_diffusion.md
!model_compression/thinkingvit_matryoshka_thinking_vision_transformer_for_elastic_inference.md
!model_compression/timeripples_accelerating_vdits_by_understanding_the_spatio-temporal_correlations.md
!model_compression/towards_generalizable_ai-generated_image_detection_via_image-adaptive_prompt_lea.md
!model_compression/towards_unified_human_perception_and_machine_understanding_token_flow_guided_com.md
!model_compression/trainable_log-linear_sparse_attention_for_efficient_diffusion_transformers.md
!model_compression/tweo_transformers_without_extreme_outliers_enables_fp8_training_and_quantization.md
!model_compression/ultra-fast_neural_video_compression.md
!model_compression/ultra-low_bitrate_perceptual_image_compression_with_shallow_encoder.md
!model_compression/understanding_and_enforcing_weight_disentanglement_in_task_arithmetic.md
!model_compression/unicomp_rethinking_video_compression_through_informational_uniqueness.md
!model_compression/what_matters_in_practical_learned_image_compression.md
!model_compression/when_lines_meet_textures_spatial-frequency_aligned_diffusion_features_for_cross-.md
!model_compression/wpt_world-to-policy_transfer_via_online_world_model_distillation.md
!multi_agent/agentdet_a_shared-blackboard_multi-agent_framework_for_zero-few-shot_object_dete.md
!multi_agent/visual_document_understanding_and_reasoning_a_multi-agent_collaboration_framewor.md
!multimodal_vlm/4dp-qa_scalable_qa_for_4d_perception_in_vision_language_models.md
!multimodal_vlm/4dworldbench_a_comprehensive_evaluation_framework_for_3d4d_world_generation_mode.md
!multimodal_vlm/a3_towards_advertising_aesthetic_assessment.md
!multimodal_vlm/a_closedform_solution_for_debiasing_visionlanguage.md
!multimodal_vlm/a_more_word-like_image_tokenization_for_mllms.md
!multimodal_vlm/abstract_3d_perception_for_spatial_intelligence_in_vision-language_models.md
!multimodal_vlm/activation_matters_test-time_activated_negative_labels_for_ood_detection_with_vi.md
!multimodal_vlm/active_perceptual_inference_a_corticothalamic-inspired_dynamic_nested_recurrent_.md
!multimodal_vlm/adapting_in-context_generation_for_enhanced_composed_image_retrieval.md
!multimodal_vlm/addressing_exacerbated_attention_sink_for_source-free_cross-domain_few-shot_lear.md
!multimodal_vlm/adseeker_a_knowledge-grounded_reasoning_framework_for_industry_anomaly_detection.md
!multimodal_vlm/ag-vas_anchor-guided_zero-shot_visual_anomaly_segmentation_with_large_multimodal.md
!multimodal_vlm/agft_alignment-guided_fine-tuning_for_zero-shot_adversarial_robustness_of_vision.md
!multimodal_vlm/aif_adaptive_information_flow_vlm.md
!multimodal_vlm/air-know_arbiter-calibrated_knowledge-internalizing_robust_network_for_composed_.md
!multimodal_vlm/anchor-guided_gradient_alignment_for_incomplete_multimodal_learning.md
!multimodal_vlm/anti-degradation_lifelong_multi-view_clustering.md
!multimodal_vlm/arc_is_a_vision_problem.md
!multimodal_vlm/argus_defending_against_multimodal_indirect_prompt_injection_via_steering_instru.md
!multimodal_vlm/artimuse_fine-grained_image_aesthetics_assessment_with_joint_scoring_and_expert-.md
!multimodal_vlm/atoken_a_unified_tokenizer_for_vision.md
!multimodal_vlm/authorize-on-demand_dynamic_authorization_with_legality-aware_intellectual_prope.md
!multimodal_vlm/autotraces_autoregressive_trajectory_forecasting_via_multimodal_large_language_m.md
!multimodal_vlm/b-clip_text-conditioned_contrastive_learning_for_multi-granular_vision-language_.md
!multimodal_vlm/balm_a_model-agnostic_framework_for_balanced_multimodal_learning_under_imbalance.md
!multimodal_vlm/benchmarking_single-factor_physical_video-to-audio_generation.md
!multimodal_vlm/beyond_global_similarity_multi-conditional_retrieval_for_fine-grained_cross-moda.md
!multimodal_vlm/beyond_graph_model_reliable_vlm_fine-tuning_via_random_graph_adapter.md
!multimodal_vlm/beyond_heuristic_prompting_a_concept-guided_bayesian_framework_for_zero-shot_ima.md
!multimodal_vlm/beyond_missing_modalities_hypergraph_conditioned_diffusion_for_uncertainty-aware.md
!multimodal_vlm/beyond_sequential_tools_a_unified_vlm_agent_system_for_photographic_post-process.md
!multimodal_vlm/beyond_single_images_a_comprehensive_benchmark_for_album-level_vision-language_u.md
!multimodal_vlm/beyond_weak_supervision_mllms-guided_graded_knowledge_distillation_for_unsupervi.md
!multimodal_vlm/beyond_whats_shared_recovering_lost_unique_information_from_intermediate_layers_.md
!multimodal_vlm/bias_is_a_subspace_not_a_coordinate_a_geometric_rethinking_of_post-hoc_debiasing.md
!multimodal_vlm/biomedccpl_causal_conditional_prompt_learning_for_biomedical_vision-language_mod.md
!multimodal_vlm/boosting_document_parsing_efficiency_and_performance_with_coarse-to-fine_visual_.md
!multimodal_vlm/boosting_vision-language_models_towards_cross-domain_incremental_object_detectio.md
!multimodal_vlm/boosting_visual_reprogramming_for_clip_with_dual_granularity_alignment.md
!multimodal_vlm/breaking_multimodal_llm_safety_via_video-driven_prompting.md
!multimodal_vlm/breaking_the_illusion_when_positive_meets_negative_in_multimodal_decoding.md
!multimodal_vlm/bridging_the_modality_gap_in_compositional_zero-shot_learning_via_sparse_alignme.md
!multimodal_vlm/brima_bridged_modality_adaptation_for_multi-modal_continual_action_quality_asses.md
!multimodal_vlm/cad-refiner_a_unified_framework_for_cad_generation_and_iterative_editing.md
!multimodal_vlm/cadfs_a_big_cad_program_dataset_and_framework_for_computer-aided_design_with_lar.md
!multimodal_vlm/camouflage-aware_image-text_retrieval_via_expert_collaboration.md
!multimodal_vlm/can_we_build_scene_graphs_not_classify_them_flowsg_progressive_image-conditioned.md
!multimodal_vlm/capnav_benchmarking_vision_language_models_on_capability-conditioned_indoor_navi.md
!multimodal_vlm/capt_confusion-aware_prompt_tuning_for_reducing_vision-language_misalignment.md
!multimodal_vlm/captionqa_is_your_caption_as_useful_as_the_image_itself.md
!multimodal_vlm/caspa_graph-structured_concept_anchors_for_modality-agnostic_adaptation_in_visio.md
!multimodal_vlm/cc-vqa_conflict-_and_correlation-aware_method_for_mitigating_knowledge_conflict_.md
!multimodal_vlm/cf-ipt_cross-modal_fusion_interactive_prompt_tuning_of_vision-language_pre-train.md
!multimodal_vlm/chartnet_a_million-scale_high-quality_multimodal_dataset_for_robust_chart_unders.md
!multimodal_vlm/cica_coupling_confidence-aware_pretraining_with_confidence-informed_attention_fo.md
!multimodal_vlm/clep_contrastive_language-pose_pretraining.md
!multimodal_vlm/clip-like_model_as_a_foundational_density_ratio_estimator.md
!multimodal_vlm/cluster-aware_anchor_learning_for_multi-view_clustering.md
!multimodal_vlm/cluster-aware_neural_collapse_prompt_tuning_for_long-tailed_generalization_of_vi.md
!multimodal_vlm/codemmr_bridging_natural_language_code_and_image_for_unified_retrieval.md
!multimodal_vlm/codepercept_code-grounded_visual_stem_perception_for_mllms.md
!multimodal_vlm/concept-aware_batch_sampling_improves_language-image_pretraining.md
!multimodal_vlm/concept_regions_matter_benchmarking_clip_with_a_new_cluster-importance_approach.md
!multimodal_vlm/condensed_test-time_adaptation_of_vlms_for_action_recognition.md
!multimodal_vlm/conesep_cone-based_robust_noise-unlearning_compositional_network_for_composed_im.md
!multimodal_vlm/conflict-aware_adaptive_cross-reconstruction_for_multimodal_sentiment_analysis.md
!multimodal_vlm/controllable_federated_prompt_learning_at_test_time.md
!multimodal_vlm/corim_conflict-driven_risk_minimization_for_dynamic_multimodal_fusion.md
!multimodal_vlm/countgd_generalized_prompting_for_open-world_counting.md
!multimodal_vlm/cov-align_efficient_fine-grained_cross-modal_alignment_with_cohesive_visual_sema.md
!multimodal_vlm/covft_context-aware_visual_fine-tuning_for_multimodal_large_language_models.md
!multimodal_vlm/crosshoi-bench_a_unified_benchmark_for_hoi_evaluation_across_vision-language_mod.md
!multimodal_vlm/cubic_discrete_diffusion_discrete_visual_generation_on_high-dimensional_represen.md
!multimodal_vlm/dear_fine-grained_vlm_adaptation_by_decomposing_attention_head_roles.md
!multimodal_vlm/decoupled_and_reusable_adaptation_for_efficient_cross-modal_transfer.md
!multimodal_vlm/decoupling_stability_and_plasticity_for_multi-modal_test-time_adaptation.md
!multimodal_vlm/deepalign_mitigating_modality_conflict_through_modality-specific_alignment.md
!multimodal_vlm/demo2tutorial_from_human_experience_to_multimodal_software_tutorials.md
!multimodal_vlm/describe_anything_anywhere_at_any_moment.md
!multimodal_vlm/deva_fine-tuning_multimodal_large_language_models_for_visual_perception_tasks.md
!multimodal_vlm/diagnosing_and_repairing_unsafe_channels_in_vision-language_models_via_causal_di.md
!multimodal_vlm/diagram2structure_unlocking_llms_diagram_comprehension_through_diagramdiff_a_fra.md
!multimodal_vlm/dialoguevpr_towards_conversational_visual_place_recognition.md
!multimodal_vlm/dictionary_aligned_concept_control_for_safeguarding_multimodal_llms.md
!multimodal_vlm/differences_that_matter_auditing_models_for_capability_gap_discovery_and_rectifi.md
!multimodal_vlm/diffusion_guided_chain-of-vision_for_large_autoregressive_vision_models.md
!multimodal_vlm/dig_differential_grounding_for_enhancing_fine-grained_perception_in_multimodal_l.md
!multimodal_vlm/digraphhal-bench_evaluating_multimodal_large_language_models_on_complex_directed.md
!multimodal_vlm/direction-aware_3d_large_multimodal_models.md
!multimodal_vlm/disentangle-then-align_non-iterative_hybrid_multimodal_image_registration_via_cr.md
!multimodal_vlm/do_vision-language_models_measure_up_benchmarking_visual_measurement_reading_wit.md
!multimodal_vlm/do_vlms_perceive_or_recall_probing_visual_perception_vs_memory_with_classic_visu.md
!multimodal_vlm/dpl_decoupled_prototype_learning_for_enhancing_robustness_of_vision-language_tra.md
!multimodal_vlm/drs-gui_dynamic_region_search_for_training-free_gui_grounding.md
!multimodal_vlm/dsca_dynamic_subspace_concept_alignment_for_lifelong_vlm_editing.md
!multimodal_vlm/duetsvg_unified_multimodal_svg_generation_with_internal_visual_guidance.md
!multimodal_vlm/duogen_towards_autonomous_interleaved_multimodal_generation.md
!multimodal_vlm/dynamic_logits_adjustment_and_exploration_for_test-time_adaptation_in_vision_lan.md
!multimodal_vlm/dynamicgtr_leveraging_graph_topology_representation_preferences_to_boost_vlm_cap.md
!multimodal_vlm/dynamics-aware_preference_optimization_for_vision-language_models.md
!multimodal_vlm/eaglenet_energy-aware_fine-grained_relationship_learning_network_for_text-video_.md
!multimodal_vlm/echoes_of_ownership_adversarial-guided_dual_injection_for_copyright_protection_i.md
!multimodal_vlm/efficient_encoder-free_fourier-based_3d_large_multimodal_model.md
!multimodal_vlm/ego_embedding-guided_personalization_of_vision-language_models.md
!multimodal_vlm/egoavu_egocentric_audio-visual_understanding.md
!multimodal_vlm/egosound_benchmarking_sound_understanding_in_egocentric_videos.md
!multimodal_vlm/emma_extracting_multiple_physical_parameters_from_multimodal_data.md
!multimodal_vlm/enc-bench_a_benchmark_for_evaluating_multimodal_large_language_models_in_electro.md
!multimodal_vlm/enhance-then-balance_modality_collaboration_for_robust_multimodal_sentiment_anal.md
!multimodal_vlm/enhancing_continual_learning_of_vision-language_models_via_dynamic_prefix_weight.md
!multimodal_vlm/enhancing_descriptive_captions_with_visual_attributes_for_multimodal_perception.md
!multimodal_vlm/enhancing_part-level_point_grounding_for_any_open-source_mllms.md
!multimodal_vlm/evo-retriever_llm-guided_curriculum_evolution_with_viewpoint-pathway_collaborati.md
!multimodal_vlm/evograph-r1_self-evolving_multimodal_knowledge_hypergraphs_for_agentic_retrieval.md
!multimodal_vlm/evolutionary_multimodal_reasoning_via_hierarchical_semantic_representation_for_i.md
!multimodal_vlm/explaining_clip_zero-shot_predictions_through_concepts.md
!multimodal_vlm/explore_with_long-term_memory_a_benchmark_and_multimodal_llm-based_reinforcement.md
!multimodal_vlm/face-guided_sentiment_boundary_enhancement_for_weakly-supervised_temporal_sentim.md
!multimodal_vlm/factorize_reconstruct_enhance_a_unified_framework_for_multimodal_sentiment_analy.md
!multimodal_vlm/fairllava_fairness-aware_parameter-efficient_fine-tuning_for_large_vision-langua.md
!multimodal_vlm/fave_a_structured_benchmark_for_fine-grained_audio-visual_temporal_evaluation_in.md
!multimodal_vlm/fedmpt_federated_multi-label_prompt_tuning_of_vision-language_models.md
!multimodal_vlm/finding_distributed_object-centric_properties_in_self-supervised_transformers.md
!multimodal_vlm/flat-pack_bench_evaluating_spatio-temporal_understanding_in_large_vision-languag.md
!multimodal_vlm/flowcomposer_composable_flows_for_compositional_zeroshot_learning.md
!multimodal_vlm/fluoclip_stain-aware_focus_quality_assessment_in_fluorescence_microscopy.md
!multimodal_vlm/focus_dont_prune_identifying_instruction-relevant_regions_for_information-rich_i.md
!multimodal_vlm/foundation_encoders_are_all_you_need_for_preference-aware_personalization.md
!multimodal_vlm/from_3d_pose_to_prose_biomechanics-grounded_vision-language_coaching.md
!multimodal_vlm/from_attraction_to_equilibrium_physics-inspired_semantic_gravitons_for_zero-shot.md
!multimodal_vlm/from_failure_to_feedback_group_revision_unlocks_hard_cases_in_object-level_groun.md
!multimodal_vlm/from_observation_to_action_latent_action-based_primitive_segmentation_for_vla_pr.md
!multimodal_vlm/from_weights_to_concepts_data-free_interpretability_of_clip_via_singular_vector_.md
!multimodal_vlm/from_where_things_are_to_what_they_are_for_benchmarking_spatial-functional_intel.md
!multimodal_vlm/g_mixer_geodesic_mixup_based_implicit_semantic_expansion_for_zero_shot_cir.md
!multimodal_vlm/gaussianvision_vision-language_alignment_from_compressed_image_representations_u.md
!multimodal_vlm/geoagent_learning_to_geolocate_everywhere_with_reinforced_geographic_characteris.md
!multimodal_vlm/geometrically-constrained_agent_for_spatial_reasoning.md
!multimodal_vlm/geotikzbridge_advancing_multimodal_code_generation_for_geometric_perception_and_.md
!multimodal_vlm/global-graph_guided_and_local-graph_weighted_contrastive_learning_for_unified_cl.md
!multimodal_vlm/granulon_awakening_pixel-level_visual_encoders_with_adaptive_multi-granularity_s.md
!multimodal_vlm/graphvlm_benchmark_vlm_graph_learning.md
!multimodal_vlm/gravitation-driven_semantic_alignment_for_text_video_retrieval.md
!multimodal_vlm/grounded_3d-aware_spatial_vision-language_modeling.md
!multimodal_vlm/grounding_everything_in_tokens_for_multimodal_large_language_models.md
!multimodal_vlm/groundingme_exposing_the_visual_grounding_gap_in_mllms_through_multi-dimensional.md
!multimodal_vlm/gtr_turbo_merged_checkpoint_free_teacher.md
!multimodal_vlm/gui-sage_enhancing_gui_automation_with_self-explanatory_learning.md
!multimodal_vlm/guide_a_benchmark_for_understanding_and_assisting_users_in_open-ended_gui_tasks.md
!multimodal_vlm/guiding_diffusion-based_reconstruction_with_contrastive_signals_for_balanced_vis.md
!multimodal_vlm/hammer_harnessing_mllm_via_cross-modal_integration_for_intention-driven_3d_affor.md
!multimodal_vlm/handyvqa_a_video_qa_benchmark_for_fine-grained_hand-object_interaction_dynamics.md
!multimodal_vlm/harmonious_parameter_adaptation_in_continual_visual_instruction_tuning_for_safet.md
!multimodal_vlm/have-bench_hierarchical_audio-visual_evaluation_from_perception_to_interaction.md
!multimodal_vlm/hbridge_h-shape_bridging_of_heterogeneous_experts_for_unified_multimodal_underst.md
!multimodal_vlm/hdr-vlm_hdr-domain_adaptation_of_vlms_and_preference-aligned_quality_assessment_.md
!multimodal_vlm/hiconagent_history_context-aware_policy_optimization_for_gui_agents.md
!multimodal_vlm/hierarchical_attacks_for_multi-modal_multi-agent_reasoning.md
!multimodal_vlm/hificl_highfidelity_incontext_learning_for_multimo.md
!multimodal_vlm/hispatial_taming_hierarchical_3d_spatial_understanding_in_vision-language_models.md
!multimodal_vlm/hog_layout_hierarchical_3d_scene_generation_optimization_and_editing.md
!multimodal_vlm/housemind_tokenization_mllm_floor_plan.md
!multimodal_vlm/hugging_visual_prompt_and_segmentation_tokens_consistency_learning_for_fine-grai.md
!multimodal_vlm/humanvbench_probing_human_centric_video_understanding_in_mllms_with_automatica.md
!multimodal_vlm/hyperbolic_gramian_volumes_for_multimodal_alignment.md
!multimodal_vlm/iag_input-aware_backdoor_attack_on_vlm-based_visual_grounding.md
!multimodal_vlm/if-bench_benchmarking_and_enhancing_mllms_for_infrared_images_with_generative_vi.md
!multimodal_vlm/illuminating_visual_identity_in_universal_multimodal_embeddings.md
!multimodal_vlm/imbalanced_view_contribution_evaluation_and_refinement_for_deep_incomplete_multi.md
!multimodal_vlm/improving_calibration_in_test-time_prompt_tuning_for_vision-language_models_via_.md
!multimodal_vlm/information-theoretic_decomposition_for_multimodal_interaction_learning.md
!multimodal_vlm/instap_instance-aware_vision-language_pre-train_for_spatial-temporal_understandi.md
!multimodal_vlm/interactive_episodic_memory_with_user_feedback.md
!multimodal_vlm/interpretable_debiasing_of_vision-language_models_for_social_fairness.md
!multimodal_vlm/intervention-aware_multiscale_representation_learning_from_imaging_phenomics_and.md
!multimodal_vlm/intra-class_distribution-guided_generative_hashing_with_neighbor_refinement_for_.md
!multimodal_vlm/is_the_modality_gap_a_bug_or_a_feature_a_robustness_perspective.md
!multimodal_vlm/is_your_vlm_sky-ready_a_comprehensive_spatial_intelligence_benchmark_for_uav_nav.md
!multimodal_vlm/isoclip_decomposing_clip_projectors_for_efficient_intramodal_alignment.md
!multimodal_vlm/joint-aligned_latent_action_towards_scalable_vla_pretraining_in_the_wild.md
!multimodal_vlm/label_what_matters_modality-balanced_and_difficulty-aware_multimodal_active_lear.md
!multimodal_vlm/language-driven_fine-grained_retrieval.md
!multimodal_vlm/language-guided_frequency_modulation_for_large_vision-language_models.md
!multimodal_vlm/lasar_towards_spatio-temporal_reasoning_with_latent_cognitive_map.md
!multimodal_vlm/learning_anchor_in_dual_orthogonal_space_for_fast_multi-view_clustering.md
!multimodal_vlm/learning_complete_and_explainable_visual_representations_from_itemized_text_supe.md
!multimodal_vlm/learning_from_itself_mining_internal_knowledge_from_vision_language_models_for_c.md
!multimodal_vlm/learning_to_focus_and_precise_croppinga_reinforcement_learning_framework_with_in.md
!multimodal_vlm/learning_to_see_through_illumination_extremes_with_event_streaming_in_multimodal.md
!multimodal_vlm/learning_what_matters_prioritized_concept_learning_via_relative_error-driven_sam.md
!multimodal_vlm/lenses_toward_polysemous_vision-language_understanding.md
!multimodal_vlm/lifeeval_a_multimodal_benchmark_for_assistive_ai_in_egocentric_daily_life_tasks.md
!multimodal_vlm/linguistic_priors_for_visual_decoupling_towards_symmetric_vision-brain_alignment.md
!multimodal_vlm/linking_perception_confidence_and_accuracy_in_mllms.md
!multimodal_vlm/llada-v_large_language_diffusion_models_with_visual_instruction_tuning.md
!multimodal_vlm/llavashield_multimodal_multiturn_safety.md
!multimodal_vlm/llmind_bio-inspired_training-free_adaptive_visual_representations_for_vision-lan.md
!multimodal_vlm/loreal_mitigating_low-resolution_challenges_in_vision-language_models_with_attri.md
!multimodal_vlm/love_me_love_my_label_rethinking_the_role_of_labels_in_prompt_retrieval_for_visu.md
!multimodal_vlm/lvlm-aided_alignment_of_task-specific_vision_models.md
!multimodal_vlm/m3docdep_multi-modal_multi-page_multi-document_dependency_chunking_with_large_vi.md
!multimodal_vlm/m3grounder_mask-based_multi-span_and_multi-granular_grounding_for_document_qa.md
!multimodal_vlm/m4-rag_a_massive-scale_multilingual_multi-cultural_multimodal_rag.md
!multimodal_vlm/markushgrapher-2_end-to-end_multimodal_recognition_of_chemical_structures.md
!multimodal_vlm/mask_to_align_weight_to_disambiguate_reliable_unsupervised_cross-modal_hashing_w.md
!multimodal_vlm/mchdoc_a_comprehensive_benchmark_for_reading_multi-carrier_chinese_historical_do.md
!multimodal_vlm/mechanisms_of_object_localization_in_vision-language_models.md
!multimodal_vlm/medic-ad_towards_medical_vision-language_models_clinical_intelligence.md
!multimodal_vlm/merlin_building_low-snr_robust_multimodal_llms_for_electromagnetic_signals.md
!multimodal_vlm/meteorpred_a_meteorological_multimodal_large_model_and_dataset_for_severe_weathe.md
!multimodal_vlm/mind_the_way_you_select_negative_texts_pursuing_the_distance_consistency_in_ood_.md
!multimodal_vlm/mm-recoder_advancing_chart-to-code_generation_with_reinforcement_learning_and_se.md
!multimodal_vlm/mmlandmarks_a_cross-view_instance-level_benchmark_for_geo-spatial_understanding.md
!multimodal_vlm/mmsd30_a_multi-image_benchmark_for_real-world_multimodal_sarcasm_detection.md
!multimodal_vlm/modeling_cross-vision_synergy_for_unified_large_vision_model.md
!multimodal_vlm/modix_a_training-free_multimodal_information-driven_positional_index_scaling_for.md
!multimodal_vlm/molmo2_open_weights_and_data_for_vision-language_models_with_video_understanding.md
!multimodal_vlm/moon20_dynamic_modality-balanced_multimodal_representation_learning_for_e-commer.md
!multimodal_vlm/more_than_the_sum_panorama-language_models_for_adverse_omni-scenes.md
!multimodal_vlm/mostly_text_smart_visuals_asymmetric_text-visual_pruning_for_large_vision-langua.md
!multimodal_vlm/msjoe_jointly_evolving_mllm_and_sampler_for_efficient_long-form_video_understand.md
!multimodal_vlm/muco_multi-turn_contrastive_learning_for_multimodal_embedding_model.md
!multimodal_vlm/multi-crit_benchmarking_multimodal_judges_on_pluralistic_criteria-following.md
!multimodal_vlm/multi-hierarchical_contrastive_spectral_fusion_for_multi-view_clustering.md
!multimodal_vlm/multi-metric_representation_learning_strategy_based_on_clustering_for_fine-grain.md
!multimodal_vlm/multi-modal_image_fusion_via_intervention-stable_feature_learning.md
!multimodal_vlm/multi-modal_representation_learning_via_semi-supervised_rate_reduction_for_gener.md
!multimodal_vlm/multi-modal_test-time_adaptation_via_adaptive_probabilistic_gaussian_calibration.md
!multimodal_vlm/multi-spatialmllm_multi-frame_spatial_understanding_with_multi-modal_large_langu.md
!multimodal_vlm/multi-speaker_attention_alignment_for_multimodal_social_interaction.md
!multimodal_vlm/multimodal_continual_instruction_tuning_with_dynamic_gradient_guidance.md
!multimodal_vlm/multimodal_distribution_matching_for_vision-language_dataset_distillation.md
!multimodal_vlm/multimodal_learning_on_low-quality_data_with_conformal_predictive_self-calibrati.md
!multimodal_vlm/multimodal_rewardbench_2_evaluating_omni_reward_models_for_interleaved_text_and_.md
!multimodal_vlm/mvlm_a_vision_language_model_for_mnpus.md
!multimodal_vlm/mvlm_template-free_tracking_via_vision-language_margin_confidence_and_memory-gat.md
!multimodal_vlm/mvp_multiple_view_prediction_improves_gui_grounding.md
!multimodal_vlm/nano-emox_unifying_multimodal_emotional_intelligence_from_perception_to_empathy.md
!multimodal_vlm/narrative_weaver_towards_controllable_long-range_visual_consistency_with_multi-m.md
!multimodal_vlm/no_hard_negatives_required_concept_centric_learning_leads_to_compositionality_wi.md
!multimodal_vlm/noise-aware_few-shot_learning_through_bi-directional_multi-view_prompt_alignment.md
!multimodal_vlm/octopus_history-free_gradient_orthogonalization_for_continual_learning_in_multim.md
!multimodal_vlm/oddgridbench_exposing_the_lack_of_fine-grained_visual_discrepancy_sensitivity_in.md
!multimodal_vlm/omnifood8k_nutrition_estimation.md
!multimodal_vlm/on_tokens_dilemma_dynamic_moe_with_drift-aware_token_assignment_for_continual_le.md
!multimodal_vlm/one_patch_to_caption_them_all_a_unified_zero-shot_captioning_framework.md
!multimodal_vlm/onecat_decoder-only_auto-regressive_model_for_unified_understanding_and_generati.md
!multimodal_vlm/oric_benchmarking_object_recognition_under_contextual_incongruity_in_large_visio.md
!multimodal_vlm/orion_orthonormal_text_encoding_for_universal_vlm_adaptation.md
!multimodal_vlm/p-flow_prompting_visual_effects_generation.md
!multimodal_vlm/pact_phase-like_transition_constraints_in_adapter-based_continual_learning_of_vi.md
!multimodal_vlm/parameter-efficient_adaptation_for_mllms_via_implicit_modality_decomposition.md
!multimodal_vlm/pas_a_training-free_stabilizer_for_temporal_encoding_in_video_llms.md
!multimodal_vlm/personalized_image_descriptions_from_attention_sequences.md
!multimodal_vlm/personavlm_long_term_personalized_multimodal_llms.md
!multimodal_vlm/phrase-grounding-aware_supervised_fine-tuning_for_chart_recognition_via_side-mas.md
!multimodal_vlm/phycritic_multimodal_critic_models_for_physical_ai.md
!multimodal_vlm/pixels_dont_lie_but_your_detector_might_bootstrapping_mllm-as-a-judge_for_trustw.md
!multimodal_vlm/poga_paraphrased_and_oppositional_graph_alignment_for_fine-grained_cross-modal_r.md
!multimodal_vlm/point_cloud_as_a_foreign_language_for_multi-modal_large_language_model.md
!multimodal_vlm/pointalign_feature-level_alignment_regularization_for_3d_vision-language_models.md
!multimodal_vlm/pointing_at_parts_training-free_few-shot_grounding_in_multimodal_llms.md
!multimodal_vlm/posteriq_a_design_perspective_benchmark_for_poster_understanding_and_generation.md
!multimodal_vlm/powerclip_powerset_alignment_for_contrastive_pre-training.md
!multimodal_vlm/pp-ocrv5_a_specialized_5m-parameter_model_rivaling_billion-parameter_vision-lang.md
!multimodal_vlm/predictive_regularization_against_visual_representation_degradation_in_multimoda.md
!multimodal_vlm/prime_once_then_reprogram_locally_an_efficient_alternative_to_black-box_service_.md
!multimodal_vlm/probabilistic_prompt_adaptation_for_unified_image_aesthetics_and_quality_assessm.md
!multimodal_vlm/prom3e_probabilistic_masked_multimodal_embedding_model_for_ecology.md
!multimodal_vlm/prosoftarena_benchmarking_hierarchical_capabilities_of_multi-modal_agents_in_pro.md
!multimodal_vlm/protect_to_adapt_orthogonal_subspace_control_with_ranked_negative-prompt_curricu.md
!multimodal_vlm/prototype-as-prompt_multimodal_sentiment_prototypes_endowing_large_language_mode.md
!multimodal_vlm/proxy3d_efficient_3d_representations_for_vision-language_models_via_semantic_clu.md
!multimodal_vlm/quota-calibrated_fine-grained_alignment_with_context-aware_marginals_for_text-ba.md
!multimodal_vlm/r4-cgqa_retrieval-based_vision_language_models_for_computer_graphics_image_quali.md
!multimodal_vlm/re-evaluating_continual_vqa_toward_fair_and_robust_evaluation_for_multimodal_con.md
!multimodal_vlm/re-vlm_event-augmented_vision-language_model_for_scene_understanding.md
!multimodal_vlm/realbirdid_benchmarking_bird_species_identification_in_the_era_of_mllms.md
!multimodal_vlm/rebapl_repulsive_bayesian_prompt_learning.md
!multimodal_vlm/recall_recalibrating_capability_degradation_for_mllm-based_composed_image_retrie.md
!multimodal_vlm/recofuse_ultra-robust_image_fusion_via_restorative_multi-modal_diffusion_recipro.md
!multimodal_vlm/reevaluating_the_intra-modal_misalignment_hypothesis_in_clip.md
!multimodal_vlm/relational_visual_similarity.md
!multimodal_vlm/reliable_clustering_number_estimation_for_contrastive_multi-view_clustering.md
!multimodal_vlm/rematch_boosting_representation_through_matching_for_multimodal_retrieval.md
!multimodal_vlm/remora_multimodal_large_language_model_based_on_refined_motion_representation_fo.md
!multimodal_vlm/retformer_multimodal_retrieval_for_enhancing_image_recognition.md
!multimodal_vlm/rethinking_bce_loss_for_multi-label_image_recognition_with_fine-tuning.md
!multimodal_vlm/rethinking_cross-modal_anchor_alignment_for_mitigating_error_accumulation.md
!multimodal_vlm/rethinking_mllm_itself_as_a_segmenter_with_a_single_segmentation_token.md
!multimodal_vlm/rethinking_model_selection_in_vlm_through_the_lens_of_gromov-wasserstein_distanc.md
!multimodal_vlm/revisiting_model_stitching_in_the_foundation_model.md
!multimodal_vlm/revisiting_visual_corruptions_in_lvlms_a_shape-texture_perspective_on_model_fail.md
!multimodal_vlm/rned_rotary_number_encoding_and_decoding_for_medical_vlms.md
!multimodal_vlm/robustvisrag_causality-aware_vision-based_retrieval-augmented_generation_under_v.md
!multimodal_vlm/role-synthclip_a_role-play_driven_diverse_synthetic_data_approach.md
!multimodal_vlm/rose_rotate_your_large_language_model_to_see.md
!multimodal_vlm/rosetta_stone_for_unified_mllms_a_unified_tokenizer_to_decipher_understanding_an.md
!multimodal_vlm/rxncaption_reformulating_reaction_diagram_parsing_as_visual_prompt_guided_captio.md
!multimodal_vlm/salmubench_a_benchmark_for_sensitive_association-level_multimodal_unlearning.md
!multimodal_vlm/same_content_different_answers_cross-modal_inconsistency_in_mllms.md
!multimodal_vlm/same_or_not_enhancing_visual_perception_in_vision-language_models.md
!multimodal_vlm/sapave_active_perception_manipulation_vla_roboti.md
!multimodal_vlm/scaling_spatial_intelligence_with_multimodal_foundation_models.md
!multimodal_vlm/scaling_the_long_video_understanding_of_multimodal_large_language_models_via_vis.md
!multimodal_vlm/scene-vlm_multimodal_video_scene_segmentation_via_vision-language_models.md
!multimodal_vlm/sea-vision_a_multilingual_benchmark_for_comprehensive_document_and_scene_text_un.md
!multimodal_vlm/sea_evaluating_sketch_abstraction_efficiency_via_element-level_commonsense_visua.md
!multimodal_vlm/seatrack_multimodal_tracker.md
!multimodal_vlm/sed-ud_an_influence-driven_and_hierarchically-decoupled_information_bottleneck_f.md
!multimodal_vlm/see_and_fix_the_flaws_enabling_vlms_and_diffusion_models_to_comprehend_visual_ar.md
!multimodal_vlm/see_what_i_mean_aligning_vision_and_language_representations_for_video_fine-grai.md
!multimodal_vlm/seeing_through_touch_tactile_localization.md
!multimodal_vlm/self-guided_semantic_inspection_for_zero-shot_composed_image_retrieval.md
!multimodal_vlm/semantic_noise_reduction_via_teacher-guided_dual-path_audio-visual_representatio.md
!multimodal_vlm/sensesearch_empowering_vision-language_models_with_high-resolution_agentic_searc.md
!multimodal_vlm/similarity-as-evidence_calibrating_overconfident_vlms_for_interpretable_and_labe.md
!multimodal_vlm/simpact_simulation-enabled_action_planning_using_vision-language_models.md
!multimodal_vlm/sketchvl_policy_optimization_via_fine-grained_credit_assignment_for_chart_unders.md
!multimodal_vlm/small_object_great_challenge_a_benchmark_for_small_object_visual_grounding.md
!multimodal_vlm/smap_semantic_route_planning_with_map-grounded_multimodal_alignment.md
!multimodal_vlm/smoes_soft_modality-guided_expert_specialization_in_moe-vlms.md
!multimodal_vlm/so-bench_a_structural_output_evaluation_of_multimodal_llm.md
!multimodal_vlm/soc_semantic_orthogonal_calibration_for_test-time_prompt_tuning.md
!multimodal_vlm/socratic-geo_synthetic_data_generation_and_cross-modal_geometric_reasoning_via_m.md
!multimodal_vlm/sota_self-adaptive_optimal_transport_for_zero-shot_classification_with_multiple_.md
!multimodal_vlm/sparrow_learning_spatial_precision_and_temporal_referential_consistency_in_pixel.md
!multimodal_vlm/sparse-lavida_sparse_multimodal_discrete_diffusion_language_models.md
!multimodal_vlm/sparse_spectral_lora_routed_experts_for_medical_vlms.md
!multimodal_vlm/spatialscore_towards_comprehensive_evaluation_for_spatial_intelligence.md
!multimodal_vlm/spatialtree_how_spatial_intelligence_branches_out_in_mllms.md
!multimodal_vlm/spot_the_ball_a_benchmark_for_visual_social_inference.md
!multimodal_vlm/star_test-time_adaptation_can_enhance_universal_prompt_learning_for_vision-langu.md
!multimodal_vlm/stitch_semantic_transition_and_transportation_in_collaboration_for_training-free.md
!multimodal_vlm/streaming_video_instruction_tuning.md
!multimodal_vlm/structural_graph_probing_of_vision-language_models.md
!multimodal_vlm/structxlip_enhancing_vision-language_models_with_multimodal_structural_cues.md
!multimodal_vlm/synclip_synonym-coherent_language-image_pretraining_for_robust_open-vocabulary_d.md
!multimodal_vlm/synthesizing_visual_concepts_as_vision-language_programs.md
!multimodal_vlm/tackling_alignment_ambiguity_in_person_retrieval_through_conversational_attribut.md
!multimodal_vlm/tackling_model_bias_via_game-theoretic_multi-agent_collaboration_framework_for_h.md
!multimodal_vlm/tango_text-anchored_guided_optimization_for_robust_fine-tuning_vision-language_m.md
!multimodal_vlm/taxonomy-aware_representation_alignment_for_hierarchical_visual_recognition_with.md
!multimodal_vlm/tempr1_improving_temporal_understanding_of_mllms_via_temporal-aware_multi-task_r.md
!multimodal_vlm/test-time_attention_purification_for_backdoored_large_vision_language_models.md
!multimodal_vlm/text-printed_image_bridging_the_image-text_modality_gap_for_text-centric_trainin.md
!multimodal_vlm/the_geometry_of_robustness_optimizing_loss_landscape_curvature_and_feature_manif.md
!multimodal_vlm/the_llm_bottleneck_why_open-source_vision_llms_struggle_with_hierarchical_visual.md
!multimodal_vlm/the_more_the_merrier_contrastive_fusion_for_higher-order_multimodal_alignment.md
!multimodal_vlm/tiger_a_unified_framework_for_time_images_and_geo-location_retrieval.md
!multimodal_vlm/timelens_rethinking_video_temporal_grounding_with_multimodal_llms.md
!multimodal_vlm/tipsv2_patch_text_alignment.md
!multimodal_vlm/token_warping_helps_mllms_look_from_nearby_viewpoints.md
!multimodal_vlm/towards_calibrating_prompt_tuning_of_vision-language_models.md
!multimodal_vlm/towards_dynamic_modality_alignment_in_multimodal_continual_learning.md
!multimodal_vlm/towards_multimodal_domain_generalization_with_few_labels.md
!multimodal_vlm/towards_open-vocabulary_industrial_defect_understanding_with_a_large-scale_multi.md
!multimodal_vlm/towards_policy-adaptive_image_guardrail_benchmark_and_method.md
!multimodal_vlm/towards_real-world_document_parsing_via_realistic_scene_synthesis_and_document-a.md
!multimodal_vlm/towards_reasoning-preserving_unlearning_in_multimodal_large_language_models.md
!multimodal_vlm/training-only_heterogeneous_image-patch-text_graph_supervision_for_advancing_few.md
!multimodal_vlm/training_high-level_schedulers_with_execution-feedback_reinforcement_learning_fo.md
!multimodal_vlm/transporter_transferring_visual_semantics_from_vlm_manifolds.md
!multimodal_vlm/treeteaming_autonomous_red-teaming_of_vision-language_models_via_hierarchical_s.md
!multimodal_vlm/trivia_self-supervised_fine-tuning_of_vision-language_models_for_table_recogniti.md
!multimodal_vlm/ttl_test-time_textual_learning_for_ood_detection_with_pretrained_vision-language.md
!multimodal_vlm/ttrv_test-time_reinforcement_learning_for_vision_language_models.md
!multimodal_vlm/tuna_taming_unified_visual_representations_for_native_unified_multimodal_models.md
!multimodal_vlm/twin-t_twintvqa_a_reliable_structure-detail_separating_vlm_and_a_comprehensive_b.md
!multimodal_vlm/uare_a_unified_vision-language_model_for_image_quality_assessment_restoration_an.md
!multimodal_vlm/ui-lens_assessing_general_mllms_potential_to_automate_ui_display_quality_assuran.md
!multimodal_vlm/uncertainty-aware_knowledge_distillation_for_multimodal_large_language_models.md
!multimodal_vlm/uncertainty-guided_compositional_alignment_with_part-to-whole_semantic_represent.md
!multimodal_vlm/understanding_counting_mechanisms_in_large_language_and_vision-language_models.md
!multimodal_vlm/understanding_task_transfer_in_vision-language_models.md
!multimodal_vlm/uni-ood_unified_object-_and_image-level_out-of-distribution_detection_via_cross-.md
!multimodal_vlm/unicbench_unified_counting_benchmark_for_mllm.md
!multimodal_vlm/unified_multimodal_models_as_auto-encoders.md
!multimodal_vlm/unified_personalized_understanding_generating_and_editing.md
!multimodal_vlm/unleashing_the_intrinsic_visual_representation_capability_of_multimodal_large_la.md
!multimodal_vlm/uvu_improving_multimodal_understanding_via_vision-language_unified_autoregressiv.md
!multimodal_vlm/vcu-bridge_hierarchical_visual_connotation_understanding_via_semantic_bridging.md
!multimodal_vlm/venus_benchmarking_and_empowering_multimodal_large_language_models_for_aesthetic.md
!multimodal_vlm/video-only_tom_enhancing_theory_of_mind_in_multimodal_large_language_models.md
!multimodal_vlm/videofusion_a_spatio-temporal_collaborative_network_for_multi-modal_video_fusion.md
!multimodal_vlm/vikey_enhancing_temporal_understanding_in_videos_via_visual_prompting.md
!multimodal_vlm/vinqa_visual_elements_interleaved_long-form_answer_generation_for_real-world_mul.md
!multimodal_vlm/vision-language_model_guided_source-free_domain_adaptation_via_optimal_transport.md
!multimodal_vlm/vision-speech_models_teaching_speech_models_to_converse_about_images.md
!multimodal_vlm/vision_on_request_enhanced_vllm_efficiency_with_sparse_dynamically_selected_visi.md
!multimodal_vlm/vismem_latent_vision_memory_unlocks_potential_of_vision-language_models.md
!multimodal_vlm/visplay_self-evolving_vision-language_models.md
!multimodal_vlm/visual_grounding_for_object_questions.md
!multimodal_vlm/visualoverload_probing_visual_understanding_of_vlms_in_really_dense_scenes.md
!multimodal_vlm/vital_vision-encoder-centered_pre-training_for_lmms_in_visual_quality_assessment.md
!multimodal_vlm/vkg-qa_visual_knowledge_graph-based_question_answer_for_large_multimodal_models.md
!multimodal_vlm/vl-eraser_vacuum_distillation_for_machine_unlearning_in_vision-language_models.md
!multimodal_vlm/vl-routerbench_a_benchmark_for_vision-language_model_routing.md
!multimodal_vlm/vlic_vision-language_models_as_perceptual_judges_for_human-aligned_image_compres.md
!multimodal_vlm/vlm-3r_vision-language_models_augmented_with_instruction-aligned_3d_reconstructi.md
!multimodal_vlm/vlm-guided_group_preference_alignment_for_diffusion-based_human_mesh_recovery.md
!multimodal_vlm/vlm-loc_localization_in_point_cloud_maps_via_vision-language_models.md
!multimodal_vlm/vlm4rsdet_collaborative_optimization_with_vision-language_model_for_enhancing_re.md
!multimodal_vlm/vlm_model_inversion_adaptive_token_weight.md
!multimodal_vlm/vocabulary_scaling_law_tuning_open-vocabulary_predictors_for_their_openness.md
!multimodal_vlm/vq-va_world_towards_high-quality_visual_question-visual_answering.md
!multimodal_vlm/vs_bench_evaluating_vlms_for_strategic_abilities_in_multi_agent_environments.md
!multimodal_vlm/wan-weaver_interleaved_multi-modal_generation_via_decoupled_training.md
!multimodal_vlm/weave_unleashing_and_benchmarking_the_in-context_interleaved_comprehension_and_g.md
!multimodal_vlm/weavetime_streaming_video_llm_memory.md
!multimodal_vlm/wemmu_enhanced_bridging_of_vision-language_models_and_diffusion_models_via_noisy.md
!multimodal_vlm/where_does_vision_meet_language_understanding_and_refining_visual_fusion_in_mllm.md
!multimodal_vlm/where_mllms_attend_and_what_they_rely_on_explaining_autoregressive_token_generat.md
!multimodal_vlm/which_concepts_to_forget_and_how_to_refuse_decomposing_concepts_for_continual_un.md
!multimodal_vlm/why_does_rl_generalize_better_than_sft_a_data-centric_perspective_on_vlm_post-tr.md
!multimodal_vlm/widget2code_from_visual_widgets_to_ui_code_via_multimodal_llms.md
!multimodal_vlm/wikiclip_an_efficient_contrastive_baseline_for_open-domain_visual_entity_recogni.md
!multimodal_vlm/will_multimodal_models_be_dazzled_by_multi-image_visual_puzzles.md
!multimodal_vlm/world_in_a_frame_understanding_culture_mixing_as_a_new_challenge_for_vision-lang.md
!object_detection/a_closer_look_at_cross-domain_few-shot_object_detection_fine-tuning_matters_and_.md
!object_detection/a_semantically_disentangled_unified_model_for_multi-category_3d_anomaly_detectio.md
!object_detection/akcmamba-yolo_selective_state_space_models_for_real-time_object_detection.md
!object_detection/anomaly_as_non-conformity_via_training-free_graph_laplacian_energy_minimization.md
!object_detection/anomalyvfm_--_transforming_vision_foundation_models_into_zero-shot_anomaly_detec.md
!object_detection/ar2-4fv_anchored_referring_and_re-identification_for_long-term_grounding_in_fixe.md
!object_detection/audio-sync_video_instance_editing_with_granularity-aware_mask_refiner.md
!object_detection/back_to_point_exploring_point-language_models_for_zero-shot_3d_anomaly_detection.md
!object_detection/balanced_hierarchical_contrastive_learning_with_decoupled_queries_for_fine-grain.md
!object_detection/bdnetbio-inspired_dual-backbone_small_object_detection_network.md
!object_detection/beyond_caption-based_queries_for_video_moment_retrieval.md
!object_detection/beyond_duality_a_hybrid_framework_of_leveraging_shared_and_private_features_for_.md
!object_detection/beyond_prompt_degradation_prototype-guided_dual-pool_prompting_for_incremental_o.md
!object_detection/beyond_semantic_search_towards_referential_anchoring_in_composed_image_retrieval.md
!object_detection/bidirectional_multimodal_prompt_learning_with_scale-aware_training_for_few-shot_.md
!object_detection/black-box_domain_adaptation_for_object_detection_with_retention-driven_knowledge.md
!object_detection/boosting_quantitive_and_spatial_awareness_for_zero-shot_object_counting.md
!object_detection/bridge_basis-driven_causal_inference_marries_vfms_for_domain_generalization.md
!object_detection/bussard_normalizing_flows_for_bijective_universal_scene-specific_anomalous_relat.md
!object_detection/cd-buffer_complementary_dual-buffer_framework_for_test-time_adaptation_in_advers.md
!object_detection/chal_causal-guided_hierarchical_anomaly-aware_learning_for_moving_infrared_small.md
!object_detection/complementary_prototype_mapping_for_efficient_multimodal_anomaly_detection.md
!object_detection/consistency_beyond_contrast_enhancing_open-vocabulary_object_detection_robustnes.md
!object_detection/crossvl_complexity-aware_feature_routing_and_paired_curriculum_for_cross-view_vi.md
!object_detection/da-mamba_learning_domain-aware_state_space_model_for_global-local_alignment_in_d.md
!object_detection/detect_anything_via_next_point_prediction.md
!object_detection/detecting_unknown_objects_via_energy-based_separation.md
!object_detection/distribution-aligned_multimodal_fusion_for_robust_object_detection.md
!object_detection/dlvp-clip_enhancing_fine-grained_zero-shot_anomaly_detection_via_dynamic_local_v.md
!object_detection/does_yolo_really_need_to_see_every_training_image_in_every_epoch.md
!object_detection/dyfclt_dynamic_frequency-decoupled_cross-modal_learning_transformer_for_multimod.md
!object_detection/elasticformer_detecting_objects_in_hrw_shots_via_elastic_computing_vision_transf.md
!object_detection/ew-detr_evolving_world_object_detection_via_incremental_low-rank_detection_trans.md
!object_detection/expert-teacher-student_collaborative_learning_for_domain_adaptive_object_detecti.md
!object_detection/explaining_object_detectors_via_collective_contribution_of_pixels.md
!object_detection/falcon_false-negative_aware_learning_of_contrastive_negatives_in_vision-language.md
!object_detection/fastref_fast_prototype_refinement_for_few-shot_industrial_anomaly_detection.md
!object_detection/fb-clip_fine-grained_zero-shot_anomaly_detection_with_foreground-background_dise.md
!object_detection/foundation_model_priors_enhance_object_focus_in_feature_space_for_source-free_ob.md
!object_detection/fourier_angle_alignment_for_oriented_object_detection_in_remote_sensing.md
!object_detection/from_detection_to_association_learning_discriminative_object_embeddings_for_mult.md
!object_detection/fslora_harmonizing_detection_and_re-identification_via_freq-spatial_low-rank_ada.md
!object_detection/gmt_effective_global_framework_for_multi-camera_multi-target_tracking.md
!object_detection/gpflow_gaussian_prototype_probability_flow_for_unsupervised_multi-modal_anomaly_.md
!object_detection/gs-clip_zero-shot_3d_anomaly_detection_by_geometry-aware_prompt_and_synergistic_.md
!object_detection/heuristic-inspired_reasoning_priors_facilitate_data-efficient_referring_object_d.md
!object_detection/incremental_object_detection_via_future-aware_decoupled_cross-head_distillation.md
!object_detection/inscal_calibrated_multi-source_fully_test-time_prompt_tuning_for_object_detectio.md
!object_detection/invad_inversion-based_reconstruction-free_anomaly_detection_with_diffusion_model.md
!object_detection/learning_to_track_instance_from_single_nature_language_description.md
!object_detection/mind_the_gap_transferring_labels_to_align_object_detection_datasets.md
!object_detection/mining_instance-centric_vision-language_contexts_for_human-object_interaction_de.md
!object_detection/mmrad_multimodal_anomaly_detection.md
!object_detection/moeclip_patch-specialized_experts_for_zero-shot_anomaly_detection.md
!object_detection/mrd_multi-resolution_retrieval-detection_fusion_for_high-resolution_image_unders.md
!object_detection/noovd_novel_category_discovery_and_embedding_for_open-vocabulary_object_detectio.md
!object_detection/object-generalized_re-identification_a_step_towards_universal_instance_perceptio.md
!object_detection/omni-ad_a_large-scale_and_versatile_benchmark_for_industrial_anomaly_detection.md
!object_detection/online_data_curation_for_object_detection_via_marginal_contributions_to_dataset-.md
!object_detection/palm_progress-aware_policy_learning_via_affordance_reasoning_for_long-horizon_ro.md
!object_detection/paq-detr_learning_pattern_and_quality-aware_dynamic_queries_for_object_detection.md
!object_detection/parameter-efficient_semantic_augmentation_for_enhancing_open-vocabulary_object_d.md
!object_detection/parameterized_prompt_for_incremental_object_detection.md
!object_detection/partial_weakly-supervised_oriented_object_detection.md
!object_detection/pet-dino_unifying_visual_cues_into_grounding_dino_with_prompt-enriched_training.md
!object_detection/phac_promptable_human_amodal_completion.md
!object_detection/portable_active_learning_for_object_detection.md
!object_detection/prompt-free_universal_region_proposal_network.md
!object_detection/rare_learn_to_rank_and_retrieve_for_monocular_3d_object_detection.md
!object_detection/rc-nf_robot-conditioned_normalizing_flow_for_real-time_anomaly_detection_in_robo.md
!object_detection/reasoning-driven_anomaly_detection_and_localization_with_image-level_supervision.md
!object_detection/remedying_target-domain_astigmatism_for_cross-domain_few-shot_object_detection.md
!object_detection/rhcnet_residual-guided_hierarchical_calibration_network_for_robust_underwater_ob.md
!object_detection/rotation_invariant_and_symmetry_aware_pixel_difference_network_for_remote_sensin.md
!object_detection/saliency-r1_enforcing_interpretable_and_faithful_vision-language_reasoning_via_s.md
!object_detection/see_what_we_cannot_see_a_geo-guided_reasoning_benchmark_for_object_counting_unde.md
!object_detection/seeing_through_the_noise_improving_infrared_small_target_detection_and_segmentat.md
!object_detection/sfr-net_steering-fusion-refining_network_in_multi-label_zero-shot_sewer_defect_d.md
!object_detection/spike-driven_discrete_aggregation_for_event-based_object_detection.md
!object_detection/spiraldiff_spiral_diffusion_with_lora_for_rgb-to-raw_conversion_across_cameras.md
!object_detection/sra-det_learning_omni-grained_open-vocabulary_detection_beyond_category_names.md
!object_detection/streamlined_open-vocabulary_human-object_interaction_detection.md
!object_detection/subspacead_training-free_few-shot_anomaly_detection_via_subspace_modeling.md
!object_detection/target-aware_invertible_encoder_with_reconstruction_guidance_for_infrared_small_.md
!object_detection/thermal-det_language-guided_cross-modal_distillation_for_open-vocabulary_thermal.md
!object_detection/toward_generalizable_whole_brain_representations_with_high-resolution_light-shee.md
!object_detection/towards_an_incremental_unified_multimodal_anomaly_detection_augmenting_multimoda.md
!object_detection/towards_persistence_learning_topological_constraints_for_event-based_small_objec.md
!object_detection/tri-modal_fusion_transformers_for_uav-based_object_detection.md
!object_detection/uav-cb_a_complex-background_rgb-t_dataset_and_local_frequency_bridge_network_for.md
!object_detection/unimmad_unified_multi-modal_and_multi-class_anomaly_detection_via_moe-driven_fea.md
!object_detection/unispector_towards_universal_open-set_defect_recognition_via_spectral-contrastiv.md
!object_detection/visual_prototype_conditioned_focal_region_generation_for_uav-based_object_detect.md
!object_detection/visualad_language-free_zero-shot_anomaly_detection_via_vision_transformer.md
!object_detection/vitprompt_training-free_prompt_refinement_with_visual_tokens_for_open-vocabulary.md
!object_detection/wedetect_fast_open-vocabulary_object_detection_as_retrieval.md
!object_detection/when_transformers_meet_mamba_a_hybrid_transformer-mamba_network_for_video_object.md
!object_detection/yolo-master_moe-accelerated_with_specialized_transformers_for_enhanced_real-time.md
!object_detection/yolo-ulm_ultra-lightweight_models_for_real-time_object_detection.md
!optimization/ace-merging_data-free_model_merging_with_adaptive_covariance_estimation.md
!optimization/bd-merging_bias-aware_dynamic_model_merging_with_evidence-guided_contrastive_lea.md
!optimization/beyond_single_solution_multi-hypothesis_collaborative_deep_unfolding_network_for.md
!optimization/conditional_factuality_controlled_llms_with_generalization_certificates_via_conf.md
!optimization/dabo_difficulty-aware_bayesian_optimization_with_diffusion-learned_priors.md
!optimization/dc-merge_improving_model_merging_with_directional_consistency.md
!optimization/defending_unauthorized_model_merging_via_dual-stage_weight_protection.md
!optimization/dynamic_momentum_recalibration_in_online_gradient_learning.md
!optimization/end-to-end_hyper-relational_information_extraction_for_engineering_diagrams_via_.md
!optimization/enhancing_visual_representation_with_textual_semantics_textual_semantics_powered_p.md
!optimization/fed-ade_adaptive_learning_rate_for_federated_post-adaptation_under_distribution_.md
!optimization/few-for-many_personalized_federated_learning.md
!optimization/globscope_toward_a_global_view_of_the_loss_landscape.md
!optimization/gr-gauge_cost-efficient_training_configuration_by_gauging_the_gradient_redundanc.md
!optimization/hfedatm_hierarchical_federated_domain_generalization_via_optimal_transport_and_r.md
!optimization/label-free_cross-task_lora_merging_with_null-space_compression.md
!optimization/learning_to_learn_weight_generation_via_local_consistency_diffusion.md
!optimization/mapping_networks.md
!optimization/model_merging_in_the_essential_subspace.md
!optimization/semi-supervised_conformal_prediction_with_unlabeled_nonconformity_score.md
!optimization/the_power_of_decaying_steps_enhancing_attack_stability_and_transferability_for_s.md
!optimization/unifusion_a_unified_image_fusion_framework_with_robust_representation_and_source.md
!others/a2gc_asymmetric_aggregation_with_geometric_constraints_for_locally_aggregated_de.md
!others/a_debiased_reconstruction-based_framework_for_training-free_detection_of_ai-gene.md
!others/a_difference-in-difference_approach_to_detecting_ai-generated_images.md
!others/adaptive_bayesian_early-exit_networks_for_efficient_non-transferable_learning.md
!others/adaptive_data_augmentation_with_multi-armed_bandit_sample-efficient_embedding_ca.md
!others/adasformer_adaptive_serialized_transformers_for_monocular_semantic_scene_complet.md
!others/allnet_multi-task_dense_prediction_for_degraded_images.md
!others/basis-oriented_low-rank_transfer_for_few-shot_and_test-time_adaptation.md
!others/beyond_euclidean_gossip_kl-barycentric_consensus_on_heterogeneous_and_imbalanced.md
!others/bi-directional_autoregressive_diffusion_for_large_complex_motion_interpolation.md
!others/bias_in_bias_out_finding_unbiased_subnetworks_in_vanilla_models.md
!others/bidirectional_query-driven_generation_of_parametric_cad_sketch.md
!others/bootstrapping_multi-view_learning_for_test-time_noisy_correspondence.md
!others/brepvgae_variational_graph_autoencoder_with_unified_latent_representation_for_b-.md
!others/bridging_domain_expertise_and_generalization_for_performance_estimation.md
!others/chirp_dataset_towards_long-term_individual-level_behavioral_monitoring_of_bird_p.md
!others/clair_obscur_an_illumination-aware_method_for_real-world_image_vectorization.md
!others/coded-e2lf_coded_aperture_light_field_imaging_from_events.md
!others/computer_vision_with_a_superpixelation_camera.md
!others/confusion-aware_spectral_regularizer_for_long-tailed_recognition.md
!others/consensus_vs_controversy_mapping_the_decision_space_where_architectures_diverge.md
!others/convolutional_neural_networks_driven_by_content_similarity.md
!others/coupling_liquid_time-constant_encoders_with_modern_hopfield_memory.md
!others/customized_fusion_a_closed-loop_dynamic_network_for_adaptive_multi-task-aware_in.md
!others/dance_across_shifts_forward-facilitation_continual_test-time_adaptation_through_.md
!others/data-centric_meta-learning_for_robust_few-shot_generalization.md
!others/debiased_sample_selection_for_learning_with_noisy_labels.md
!others/deconstructing_the_failure_of_ideal_noise_correction_a_three-pillar_diagnosis.md
!others/df2-vb_dual-level_fuzzy_fusion_with_view-specific_boosting_for_multi-view_multi-.md
!others/diffbmp_differentiable_rendering_with_bitmap_primitives.md
!others/differentiable_stroke_planning_with_dual_parameterization_for_efficient_and_high.md
!others/dp-fedadamw_an_efficient_optimizer_for_differentially_private_federated_large_mo.md
!others/drainage_a_unifying_framework_for_addressing_class_uncertainty.md
!others/dream_document_recognition_with_explicit_adaptive_memory.md
!others/dual_band_thermal_videography_separating_time-varying_reflection_and_emission_ne.md
!others/evidential_deep_partial_label_learning_to_quantify_disambiguation_uncertainty.md
!others/exotic_external_vision-driven_incomplete_multi-view_classification.md
!others/fedsdr_federated_graph_learning_with_structural_noise_detection_and_reconstructi.md
!others/fedsst_rethinking_fair_federated_graph_learning_under_structural_shift.md
!others/flashvsr_towards_real-time_diffusion-based_streaming_video_super_resolution.md
!others/foleydesigner_immersive_stereo_foley_generation_with_precise_spatio-temporal_ali.md
!others/gardendesigner_encoding_aesthetic_principles_into_jiangnan_garden_construction_v.md
!others/global_information_thresholding_for_sufficient_and_necessary_circuits.md
!others/global_underwater_geolocation_from_time-lapse_polarization_imagery.md
!others/graph_attention_prototypical_network_for_robust_few-shot_classification.md
!others/hearing_the_room_through_the_shape_of_the_drum_modal-guided_sound_recovery_from_.md
!others/hieruq_hierarchical_uncertainty_quantification_with_adaptive_granularity_reconci.md
!others/hyperbolic_defect_feature_synthesis_for_few-shot_defect_classification.md
!others/hypernas_enhancing_architecture_representation_for_nas_predictor_via_hypernetwor.md
!others/hypevpr_exploring_hyperbolic_space_for_perspective_to_equirectangular_visual_pla.md
!others/immeriris_a_large-scale_dataset_and_benchmark_for_off-axis_and_unconstrained_iri.md
!others/instantretouch_efficient_and_high-fidelity_instruction-guided_image_retouching_w.md
!others/inter-photon-limited_videography.md
!others/intrain_intrinsic_trainability_for_zero-cost_neural_architecture_search.md
!others/irisfp_adversarial-example-based_model_fingerprinting_with_enhanced_uniqueness_a.md
!others/language_does_matter_for_cross-domain_few-shot_visual_feature_enhancement.md
!others/large-scale_robust_enhanced_ensemble_clustering_via_outlier_decoupling.md
!others/learning_long-term_motion_embeddings_for_efficient_kinematics_generation.md
!others/learning_what_helps_task-aligned_context_selection_for_vision_tasks.md
!others/mitigating_instance_entanglement_in_instance-dependent_partial_label_learning.md
!others/mmvip_a_visible-infrared_paired_dataset_for_multi-weather_marine_vision.md
!others/modeling_the_visual_ambiguity_of_human_sketches.md
!others/moocap_a_multi-view_benchmark_for_cow-object-human_interaction_and_behavior_dyna.md
!others/more_than_meets_the_eye_a_unified_image_fusion_framework_via_semantic-pixel_entr.md
!others/mspt_efficient_large-scale_physical_modeling_via_parallelized_multi-scale_attent.md
!others/mufasa_a_multi-layer_framework_for_slot_attention.md
!others/multi-view_crowd_tracking_transformer_with_view-ground_interactions_under_large_.md
!others/naf_zero-shot_feature_upsampling_via_neighborhood_attention_filtering.md
!others/negative_binomial_variational_autoencoders_for_overdispersed_latent_modeling.md
!others/neural_collapse_in_test-time_adaptation.md
!others/neural_mixture_density_processes.md
!others/neurorule_bridging_vision_and_logic_with_differentiable_rule_induction.md
!others/nexusflow_unifying_disparate_tasks_under_partial_supervision_via_invertible_flow.md
!others/optical_diffraction-based_convolution_for_semiconductor_lithography.md
!others/order_matters_3d_shape_generation_from_sequential_vr_sketches.md
!others/pai-bench_a_comprehensive_benchmark_for_physical_ai.md
!others/paul_uncertainty-guided_partition_and_augmentation_for_robust_cross-view_geo-loc.md
!others/physskin_real-time_and_generalizable_physics-based_animation_via_self-supervised.md
!others/plug-and-play_incomplete_multi-view_clustering_via_janus-faced_affinity_learning.md
!others/progressive_neural_architecture_generation.md
!others/prototype-based_causal_intervention_for_multi-label_image_classification.md
!others/rauf_learning_the_spatial_uncertainty_field_of_radar.md
!others/region-wise_correspondence_prediction_between_manga_line_art_images.md
!others/revisiting_f-measure_optimization_in_multi-label_classification_a_sampling-based.md
!others/revisiting_sparsity_constraint_under_high-rank_property_in_partial_multi-label_l.md
!others/rnn_as_linear_transformer_a_closer_investigation_into_representational_potential.md
!others/scalable_multi-view_subspace_clustering_with_tensorized_anchor_guidance.md
!others/shoe_style-invariant_and_ground-aware_learning_for_dense_foot_contact_estimation.md
!others/simrecon_simready_compositional_scene_reconstruction_from_real_videos.md
!others/spectral_conformal_risk_control_distribution-free_tail_guarantees_via_bayesian_q.md
!others/teamhoi_learning_a_unified_policy_for_cooperative_human-object_interactions_with.md
!others/the_missing_gap_from_solving_square_jigsaw_puzzles_to_handling_real_world_archae.md
!others/the_sa-fari_dataset_segment_anything_in_footage_of_animals_for_recognition_and_i.md
!others/towards_knowledge-augmented_bayesian_deep_learning_for_computer_vision.md
!others/unimernet_a_universal_network_for_real-world_mathematical_expression_recognition.md
!others/upsample_anything_a_simple_and_hard_to_beat_baseline_for_feature_upsampling.md
!others/videomama_mask-guided_video_matting_via_generative_prior.md
!others/videoworld_2_learning_transferable_knowledge_from_real-world_videos.md
!others/vit3_unlocking_test_time_training_in_vision.md
!others/what_is_the_optimal_ranking_score_between_precision_and_recall_we_can_always_fin.md
!others/what_is_wrong_with_synthetic_data_for_scene_text_recognition_a_strong_synthetic_.md
!others/when_avsr_meets_video_conferencing_dataset_degradation_and_the_hidden_mechanism_.md
!others/why_not_hyperparameter-friendly_optimisation_a_monotonic_adaptive_norm_rescaling.md
!others/witta-bench_benchmarking_test-time_adaptation_for_wifi_sensing.md
!others/zero-shot_detection_of_ai-generated_image_via_raw-rgb_alignment.md
!physics/aviasafe_a_physics-informed_data-driven_model_for_aviation_safety-critical_cloud.md
!physics/spatial-spectral_residuals_informed_diffusion_neural_operator_for_pan-sharpening.md
!reinforcement_learning/anydoc_enhancing_document_generation_via_large-scale_htmlcss_data_synthesis_and_.md
!reinforcement_learning/cccaption_dual-reward_reinforcement_learning_for_complete_and_correct_image_capt.md
!reinforcement_learning/cloning_deterministic_worlds_the_critical_role_of_latent_geometry_in_long-horizo.md
!reinforcement_learning/cme-cad_heterogeneous_collaborative_multi-expert_reinforcement_learning_for_cad_code_gen.md
!reinforcement_learning/cross-modal_identity_mapping_minimizing_information_loss_in_modality_conversion_.md
!reinforcement_learning/dreamsac_learning_hamiltonian_world_models_via_symmetry_exploration.md
!reinforcement_learning/eva_efficient_reinforcement_learning_for_end-to-end_video_agent.md
!reinforcement_learning/geoworld_geometric_world_models.md
!reinforcement_learning/incentivizing_generative_zero-shot_learning_via_outcome-reward_reinforcement_lea.md
!reinforcement_learning/joppo_hierarchical_photography_assessment_via_contrastive_joint_conditional_prob.md
!reinforcement_learning/local_motion_matters_a_deconstruct-recompose_paradigm_for_reinforcement_learning.md
!reinforcement_learning/mangobench_a_benchmark_for_multi-agent_goal-conditioned_offline_reinforcement_le.md
!reinforcement_learning/masked_auto-regressive_variational_acceleration_fast_inference_makes_practical_r.md
!reinforcement_learning/msrl_scaling_generative_multimodal_reward_modeling.md
!reinforcement_learning/panoenv_exploring_3d_spatial_intelligence_in_panoramic_environments_with_reinfor.md
!reinforcement_learning/plannerrft_reinforcing_diffusion_planners.md
!reinforcement_learning/reag_reasoning-augmented_generation_for_knowledge-based_visual_question_answerin.md
!reinforcement_learning/resolving_the_stability-plasticity_dilemma_in_reinforcement_learning_via_complem.md
!reinforcement_learning/saliency-guided_representation_with_consistency_policy_learning_for_visual_unsup.md
!reinforcement_learning/see_it_say_it_sorted_an_iterative_training-free_framework_for_visually-grounded_.md
!reinforcement_learning/seeing_is_improving_visual_feedback_for_iterative_text_layout_refinement.md
!reinforcement_learning/specificity-aware_reinforcement_learning_for_fine-grained_open-world_classificat.md
!reinforcement_learning/talk2move_reinforcement_learning_for_text-instructed_object-level_geometric_tran.md
!reinforcement_learning/taskforce_cooperative_multi-agent_reinforcement_learning_for_multi-task_optimiza.md
!reinforcement_learning/tstm_temporal_segmentation_for_task-relevant_mask_in_visual_reinforcement_learni.md
!remote_sensing/acpv-net_all-class_polygonal_vectorization_for_seamless_vector_map_generation_fr.md
!remote_sensing/apex_a_decoupled_memory-based_explorer_for_asynchronous_aerial_object_goal_navig.md
!remote_sensing/asking_like_socrates_socrates_helps_vlms_understand_remote_sensing_images.md
!remote_sensing/avion_aerial_visionlanguage_instruction_from_offli.md
!remote_sensing/beyond_endpoints_path-centric_reasoning_for_vectorized_off-road_network_extracti.md
!remote_sensing/beyond_matching_to_tiles_bridging_unaligned_aerial_and_satellite_views_for_visio.md
!remote_sensing/beyond_tie_points_satellite_image_block_adjustment_based_on_dense_feature_consis.md
!remote_sensing/changebridge_spatiotemporal_image_generation_with_multimodal_controls_for_remote.md
!remote_sensing/cross-modal_fuzzy_alignment_network_for_text-aerial_person_retrieval_and_a_large.md
!remote_sensing/cross-scale_pansharpening_via_scaleformer_and_the_panscale_benchmark.md
!remote_sensing/crossearth-gate_fisher-guided_adaptive_tuning_engine_for_efficient_adaptation_of.md
!remote_sensing/data_leakage_detection_and_de-duplication_in_large_scale_geospatial_image_datase.md
!remote_sensing/exploring_spatiotemporal_feature_propagation_for_video-level_compressive_spectra.md
!remote_sensing/fusar-gpt_a_spatiotemporal_feature-embedded_and_two-stage_decoupled_visual_langu.md
!remote_sensing/geo2_geometry-guided_cross-view_geo-localization_and_image_synthesis.md
!remote_sensing/geobridge_a_semantic-anchored_multi-view_foundation_model_bridging_images_and_te.md
!remote_sensing/geocot_towards_reliable_remote_sensing_reasoning_with_manifold_perspective.md
!remote_sensing/geodit_a_diffusion-based_vision-language_model_for_geospatial_understanding.md
!remote_sensing/geoflow_real-time_fine-grained_cross-view_geolocalization.md
!remote_sensing/geommbench_and_geommagent_toward_expert_level_multimodal_intelligence_in_geoscience_and_remote_sensing.md
!remote_sensing/geosane_learning_geospatial_representations_from_models_not_data.md
!remote_sensing/geovis_geospatially_rewarded_visual_search_for_remote_sensing_visual_grounding.md
!remote_sensing/imaia_interactive_maps_ai_assistant_for_travel_planning_and_geo-spatial_intellig.md
!remote_sensing/lnem_lunar_neural_elevation_model.md
!remote_sensing/local_precise_refinement_a_dual-gated_mixture-of-experts_for_enhancing_foundatio.md
!remote_sensing/lookasidevln_direction-aware_aerial_vision-and-language_navigation.md
!remote_sensing/metaspectra_a_compact_broadband_metasurface_camera_for_snapshot_hyperspectral_im.md
!remote_sensing/mm-ovseg_multimodal_optical-sar_fusion_for_open-vocabulary_segmentation_in_remot.md
!remote_sensing/mogeo_beyond_one-to-one_cross-view_object_geo-localization.md
!remote_sensing/multigrain-aware_semantic_prototype_scanning_and_tri-token_prompt_learning_embra.md
!remote_sensing/neighbormae_exploiting_spatial_dependencies_between_neighboring_earth_observatio.md
!remote_sensing/no_labels_no_look-ahead_unsupervised_online_video_stabilization_with_classical_p.md
!remote_sensing/olbedo_an_albedo_and_shading_aerial_dataset_for_large-scale_outdoor_environments.md
!remote_sensing/olmoearth_stable_latent_image_modeling_for_multimodal_earth_observation.md
!remote_sensing/orsatr-x_a_foundation_model_based_on_differential-and-excitation_networks_for_op.md
!remote_sensing/orthogonal_spatial-aware_multi-view_anchor_graph_clustering_for_incomplete_remot.md
!remote_sensing/phenoyieldnet_learning_crop-aware_phenological_responses_for_multi-crop_yield_pr.md
!remote_sensing/pilot_neural_pixel-to-3d_registration_for_uav-based_ego_and_target_geo-localizat.md
!remote_sensing/prompt-free_unknown_label_generation_for_open_world_detection_in_remote_sensing.md
!remote_sensing/qucnet_quantum_deep_learning_driven_multi-circuit_network_for_remote_sensing_ima.md
!remote_sensing/ramen_resolution-adjustable_multimodal_encoder_for_earth_observation.md
!remote_sensing/recs4r_bridging_semantics_and_geometry_for_referring_remote_sensing_interpretati.md
!remote_sensing/regulating_rather_than_constraining_adaptive_guidance_for_complex_spectral_recon.md
!remote_sensing/remote_sensing_image_super-resolution_for_imbalanced_textures_a_texture-aware_di.md
!remote_sensing/revisiting_the_necessity_of_full_accuracy_weakly_supervised_object-level_offset_.md
!remote_sensing/rho_robust_holistic_osm-based_metric_cross-view_geo-localization.md
!remote_sensing/roadgie_towards_a_global-scale_aerial_benchmark_for_generalizable_interactive_ro.md
!remote_sensing/robust_remote_sensing_image-text_retrieval_with_noisy_correspondence.md
!remote_sensing/segearth-r2_towards_comprehensive_language-guided_segmentation_for_remote_sensin.md
!remote_sensing/semantic-adaptive_diffusion_for_dynamic_spatiotemporal_fusion.md
!remote_sensing/singeo_unlock_single_models_potential_for_robust_cross-view_geo-localization.md
!remote_sensing/skysense-vita_towards_universal_in-context_segmentation_of_multi-modal_remote_se.md
!remote_sensing/sparsely_timing_the_change_a_spiking_temporal_framework_for_remote_sensing_inter.md
!remote_sensing/spectrally_distilled_representations_aligned_with_instruction-augmented_llms_for.md
!remote_sensing/tessera_temporal_embeddings_of_surface_spectra_for_earth_representation_and_anal.md
!remote_sensing/trisim_tri-dimensional_similarity_modeling_with_extreme_value_theory_for_false-n.md
!remote_sensing/unichange_unifying_change_detection_with_multimodal_large_language_model.md
!remote_sensing/unigeors_a_unified_benchmark_for_tri-view_geo-localization.md
!remote_sensing/unigeoseg_towards_unified_open-world_segmentation_for_geospatial_scenes.md
!remote_sensing/whu-mars_a_multispectral_aerial-ground_benchmark_towards_any-scenario_person_re-.md
!remote_sensing/wrivinder_towards_spatial_intelligence_for_geo-locating_ground_images_onto_satel.md
!remote_sensing/yieldsat_a_multimodal_benchmark_dataset_for_high-resolution_crop_yield_predictio.md
!remote_sensing/zoomearth_active_perception_for_ultra-high-resolution_geospatial_vision-language.md
!robotics/a_cross-view_fusion_framework_for_robust_6-dof_grasp_pose_estimation.md
!robotics/acot-vla_action_chain-of-thought_for_vision-language-action_models.md
!robotics/action-sketcher_from_reasoning_to_action_via_visual_sketches_for_robotic_manipul.md
!robotics/activegrasp_information-guided_active_grasping_with_calibrated_energy-based_mode.md
!robotics/activevla_injecting_active_perception_into_vision-language-action_models_for_pre.md
!robotics/adadextrack_dynamic_modulation_for_adaptive_and_generalizable_dexterous_manipula.md
!robotics/adaptive_action_chunking_at_inference-time_for_vision-language-action_models.md
!robotics/affordance_field_intervention_enabling_vlas_to_escape_memory_traps_in_robotic_ma.md
!robotics/affordgen_generating_diverse_demonstrations_for_generalizable_object_manipulatio.md
!robotics/agentsafe_benchmarking_the_safety_of_embodied_agents_on_hazardous_instructions.md
!robotics/agile_learning_robust_long-horizon_manipulation_via_affordance-grounded_bidirect.md
!robotics/airsim360_a_panoramic_simulation_platform_within_drone_view.md
!robotics/align_while_search_belief-guided_exploratory_inference_for_world-grounded_embodi.md
!robotics/arcadia_toward_a_full-lifecycle_framework_for_embodied_lifelong_learning.md
!robotics/astranav-memory_contexts_compression_for_long_memory.md
!robotics/at-vla_adaptive_tactile_injection_for_enhanced_feedback_reaction_in_vision-langu.md
!robotics/atomicvla_unlocking_the_potential_of_atomic_skill_learning_in_robots.md
!robotics/aura_multi-modal_shared_autonomy_for_urban_navigation.md
!robotics/ava_vla_improving_vision_language_action_models_with_active_visual_attention.md
!robotics/awarevln_reasoning_with_self-awareness_for_vision-language_navigation.md
!robotics/beyond_mimicry_learning_whole-body_human-humanoid_interaction_from_human-human_d.md
!robotics/beyond_success_refining_elegant_robot_manipulation_from_mixed-quality_data_via_j.md
!robotics/bipremanip_learning_affordance-based_bimanual_preparatory_manipulation_through_a.md
!robotics/boosting_vision-language-action_finetuning_with_feasible_action_neighborhood_pri.md
!robotics/bridging_the_2d-3d_gap_a_hierarchical_semantic-geometric_map_for_vision_language.md
!robotics/chain_of_world_world_model_thinking_in_latent_motion.md
!robotics/clad_planning_with_grounded_foresight_via_cross-modal_latent_dynamics.md
!robotics/como_learning_continuous_latent_motion_from_internet_videos_for_scalable_robot_l.md
!robotics/contact-aware_neural_dynamics.md
!robotics/cross-domain_demo-to-code_via_neurosymbolic_counterfactual_reasoning.md
!robotics/cross-hand_latent_representation_for_vision-language-action_models.md
!robotics/cross_from_left_to_right_brain_adaptive_text_dreamer_for_vision-and-language_nav.md
!robotics/cubic_coordinated_unified_bimanual_perception_and_control_framework.md
!robotics/cyclemanip_enabling_cycle-based_manipulation_via_effective_history_perception_an.md
!robotics/d3d-vlp_dynamic_3d_vision-language-planning_model_for_embodied_grounding_and_nav.md
!robotics/dejavu_towards_experience_feedback_learning_for_embodied_intelligence.md
!robotics/demofungrasp_universal_dexterous_functional_grasping_via_demonstration-editing_r.md
!robotics/dexter_language-driven_dexterous_grasp_generation_with_embodied_reasoning.md
!robotics/dexterous_world_models.md
!robotics/diagnose_correct_and_learn_from_manipulation_failures_via_visual_symbols.md
!robotics/diffuview_multi-view_diffusion_pretraining_for_3d_aware_robotic_manipulation.md
!robotics/do_you_have_freestyle_expressive_humanoid_locomotion_via_audio_control.md
!robotics/dynbridge_bridging_imagination_and_control_through_interaction_dynamics_for_robo.md
!robotics/egoroc_towards_egocentric_robotic_control_via_task-agnostic_visual_alignment.md
!robotics/end-to-end_language-action_model_for_humanoid_whole_body_control.md
!robotics/energyaction_unimanual_to_bimanual_composition_with_energy-based_models.md
!robotics/evo-1_lightweight_vision-language-action_model_with_preserved_semantic_alignment.md
!robotics/expanding_spatial_and_temporal_context_for_robotic_imitation_learning_with_scene.md
!robotics/extending_embodied_question_answering_from_perception_to_decision.md
!robotics/fantasyvln_unified_multimodal_chain-of-thought_reasoning_for_vision-and-language.md
!robotics/fast-thinkact_efficient_vision-language-action_reasoning_via_verbalizable_latent.md
!robotics/flare_a_failure-aware_framework_for_autonomous_correction_and_recovery_in_visual.md
!robotics/floverse_floor_plan-guided_multi-modal_navigation.md
!robotics/fm-steer_enhance_generalist_policies_with_value-guided_cascaded_denoising.md
!robotics/force_transferable_visual_jailbreaking_attacks_via_feature_over_reliance_correct.md
!robotics/forcevla2_unleashing_hybrid_force-position_control_with_force_awareness_for_cont.md
!robotics/foreact_steering_your_vla_with_efficient_visual_foresight_planning.md
!robotics/from_manuals_to_actions_a_unified_vla_model_for_chain-of-thought_manual_generati.md
!robotics/ga-vln_geometry-aware_bev_representation_for_efficient_vision-language_navigatio.md
!robotics/gallant_voxel_grid-based_humanoid_locomotion_and_local-navigation_across_3-d_con.md
!robotics/geco-srt_geometry-aware_continual_adaptation_for_cross-task_sim-to-real_transfer.md
!robotics/general_process_reward_modeling_for_robotic_reinforcement_learning.md
!robotics/geninav_generative_model_driven_image-goal_navigation_via_imagination-guided_con.md
!robotics/geodexgrasp_geometry-aware_generation_for_data-efficient_and_physics-plausible_d.md
!robotics/geopredict_leveraging_predictive_kinematics_and_3d_gaussian_geometry_for_precise.md
!robotics/global_prior_meets_local_consistency_dual-memory_augmented_vision-language-actio.md
!robotics/graspall_adaptive_structural_compensation_from_illumination_variation_for_roboti.md
!robotics/graspgen-x_cross-embodiment_6-dof_diffusion-based_grasping.md
!robotics/graspldp_towards_generalizable_grasping_policy_via_latent_diffusion.md
!robotics/hif-vla_hindsight_insight_and_foresight_through_motion_representation_for_vision.md
!robotics/hoi_-_a_multimodal_dataset_for_force-grounded_cross-view_articulated_manipulatio.md
!robotics/hqc-nbv_a_hybrid_quantum-classical_view_planning_approach.md
!robotics/htnav_a_hybrid_navigation_framework_with_tiered_structure_for_urban_aerial_visio.md
!robotics/humanoid_generative_pre-training_for_zero-shot_motion_tracking.md
!robotics/igen_scalable_data_generation_for_robot_learning_from_open-world_images.md
!robotics/insight_bench_towards_grounded_in-situ_guidance_for_robotic_manipulation.md
!robotics/interndata-a1_pioneering_high-fidelity_synthetic_data_for_pre-training_generalis.md
!robotics/iterative_closed-loop_motion_synthesis_for_scaling_the_capabilities_of_humanoid_.md
!robotics/lada_robotic_manipulation.md
!robotics/learning_a_unified_latent_action_space_from_videos_with_action-centric_cycle_con.md
!robotics/learning_surgical_robotic_manipulation_with_3d_spatial_priors.md
!robotics/learning_to_act_robustly_with_view-invariant_latent_actions.md
!robotics/learning_to_control_physically-simulated_3d_characters_via_generating_and_mimick.md
!robotics/learning_to_see_and_act_task-aware_virtual_view_exploration_for_robotic_manipula.md
!robotics/libero-plus_a_progressive_robustness_benchmark_for_visual-language-action_models.md
!robotics/lifelong_imitation_learning_multimodal_latent_rep.md
!robotics/localizing_structuring_and_rendering_bridging_3d_and_2d_vision-language-action_m.md
!robotics/mantis_a_versatile_vision-language-action_model_with_disentangled_visual_foresig.md
!robotics/maps_preserving_vision-language_representations_via_module-wise_proximity_schedu.md
!robotics/maskdexgrasp_generative_masked_modeling_for_part-aware_dexterous_grasp_synthesis.md
!robotics/memory-augmented_scene_understanding_and_exploration_for_open-world_aerial_objec.md
!robotics/mergevla_cross-skill_model_merging_toward_a_generalist_vision-language-action_ag.md
!robotics/mm-act_learn_from_multimodal_parallel_generation_to_act.md
!robotics/moeactok_a_moe-based_action_tokenizer_for_vision-language-action_models.md
!robotics/motus_a_unified_latent_action_world_model.md
!robotics/navforesee_a_unified_vision-language_world_model_for_hierarchical_planning_and_d.md
!robotics/nil_no-data_imitation_learning.md
!robotics/obstruction_reasoning_for_robotic_grasping.md
!robotics/octonav_towards_generalist_embodied_navigation.md
!robotics/opening_the_sim-to-real_door_for_humanoid_pixel-to-action_policy_transfer.md
!robotics/orv_4d_occupancy-centric_robot_video_generation.md
!robotics/parse_search_and_confirmation_training-free_aerial_vision-and-dialog_navigation_.md
!robotics/physically_ground_commonsense_knowledge_for_articulated_object_manipulation_with.md
!robotics/predict_before_you_explore_predictive_planning_with_specialized_memory_for_embod.md
!robotics/probabilistic_concept_graph_reasoning_for_multimodal_misinformation_detection.md
!robotics/profocus_proactive_perception_and_focused_reasoning_in_vision-and-language_navig.md
!robotics/pvp_data-efficient_humanoid_robot_learning_with_proprioceptive-privileged_contra.md
!robotics/quantvla_scale-calibrated_post-training_quantization_for_vision-language-action_.md
!robotics/reach_explicit_recovery_behavior_for_diffusion_policies.md
!robotics/realappiance_let_high-fidelity_appliance_assets_controllable_and_workable_as_ali.md
!robotics/recurrent_reasoning_with_vision-language_models_for_estimating_long-horizon_embo.md
!robotics/rehearsevla_simulated_post-training_for_vlas_with_physically-consistent_world_mo.md
!robotics/rethinking_camera_choice_an_empirical_study_on_fisheye_camera_properties_in_robo.md
!robotics/rethinking_intermediate_representation_for_vlm-based_robot_manipulation.md
!robotics/rethinking_visual_rearrangement_from_a_diffusion_perspective.md
!robotics/roboagent_chaining_basic_capabilities_for_embodied_task_planning.md
!robotics/robotag_end-to-end_robot_pose_estimation_via_topological_alignment_graph.md
!robotics/robowheel_a_data_engine_from_real-world_human_demonstrations_for_cross-embodimen.md
!robotics/scalable_trajectory_generation_for_whole-body_mobile_manipulation.md
!robotics/semantic_audio-visual_navigation_in_continuous_environments.md
!robotics/semanticvla_towards_semantic_reasoning_over_action_memorization_via_synergistic_.md
!robotics/sir_structured_image_representations_for_explainable_robot_learning.md
!robotics/socialnav_training_human-inspired_foundation_model_for_socially-aware_embodied_n.md
!robotics/spatial-aware_vla_pretraining_through_visual-physical_alignment_from_human_video.md
!robotics/spear-1_scaling_beyond_robot_demonstrations_via_3d_understanding.md
!robotics/srpo_self-referential_policy_optimization_for_vision-language-action_models.md
!robotics/stamo_unsupervised_learning_of_generalizable_robot_motion_from_compact_state_rep.md
!robotics/structural_action_transformer_for_3d_dexterous_manipulation.md
!robotics/swiftvla_unlocking_spatiotemporal_dynamics_for_lightweight_vla_models_at_minimal.md
!robotics/test-time_ego-exo-centric_adaptation_for_action_anticipation_via_multi-label_pro.md
!robotics/test-time_perturbation_tuning_with_delayed_feedback_for_vision-language-action_m.md
!robotics/towards_human-like_robot_handwriting_via_contour-aware_generation.md
!robotics/towards_motion_turing_test_evaluating_human-likeness_in_humanoid_robots.md
!robotics/towards_open_environments_and_instructions_general_vision-language_navigation_vi.md
!robotics/towards_training-free_scene_text_editing.md
!robotics/tracegen_world_modeling_in_3d_trace_space_enables_learning_from_cross-embodiment.md
!robotics/training_one_model_to_master_cross-level_agentic_actions_via_reinforcement_learn.md
!robotics/trajrag_retrieving_geometric-semantic_experience_for_zero-shot_object_navigation.md
!robotics/trm-vla_temporal-aware_chain-of-thought_reasoning_and_memorization_for_vision-la.md
!robotics/uast_unified_active_search_and_tracking_for_arbitrary_targets_with_uavs.md
!robotics/unifying_perception_and_action_a_hybrid-modality_pipeline_with_implicit_visual_c.md
!robotics/video2robo_3dgs-based_synthetic_data_from_one_video_enables_scalable_robot_learn.md
!robotics/viral_visual_sim-to-real_at_scale_for_humanoid_loco-manipulation.md
!robotics/visual-rrt_finding_paths_toward_visual-goals_via_differentiable_rendering.md
!robotics/vla_models_are_more_generalizable_than_you_think_revisiting_physical_and_spatial.md
!robotics/when_robots_should_say_i_dont_know_benchmarking_abstention_in_embodied_question_.md
!scientific_computing/continuous_exposure-time_modeling_for_realistic_atmospheric_turbulence_synthesis.md
!scientific_computing/high-quality_and_efficient_turbulence_mitigation_with_events.md
!scientific_computing/nestor_a_nested_moe-based_neural_operator_for_large-scale_pde_pre-training.md
!segmentation/3m-ti_high-quality_mobile_thermal_imaging_via_calibration-free_multi-camera_cros.md
!segmentation/a_mixed_diet_makes_dino_an_omnivorous_vision_encoder.md
!segmentation/annotation-efficient_coreset_selection_for_context-dependent_segmentation.md
!segmentation/attack_for_defense_adversarial_agents_for_point_prompt_optimization_empowering_s.md
!segmentation/bayesian_decomposition_and_semantic_completion_for_few-shot_semantic_segmentatio.md
!segmentation/beyond_appearance_camouflaged_object_detection_via_geometric_structure.md
!segmentation/beyond_text_visual_description_assembly_by_probabilistic_model_for_clip-based_we.md
!segmentation/bipa_bilevel_prompt_adaptation_for_underwater_instance_segmentation.md
!segmentation/bootstrap_dynamic-aware_3d_visual_representation_for_scalable_robot_learning.md
!segmentation/bootstrap_your_own_av-proxies_adaptive_contrastive_and_prototype_learning_for_au.md
!segmentation/boundary-responsive_differentiable_gating_for_superpixel-based_segmentation.md
!segmentation/brewing_stronger_features_dual-teacher_distillation_for_multispectral_earth_obse.md
!segmentation/cdics_delving_into_fine-grained_attribute_for_in-context_segmentation_via_compos.md
!segmentation/clip_shortsighted_beyond_first_sentence.md
!segmentation/clp_a_real-world_dataset_of_contaminated_lens_protectors_for_robust_semantic_seg.md
!segmentation/concept-aware_lora_for_domain-aligned_segmentation_dataset_generation.md
!segmentation/concept-guided_fine-tuning_steering_vits_away_from_spurious_correlations_to_impr.md
!segmentation/conceptprism_concept_disentanglement_in_personalized_diffusion_models_via_residu.md
!segmentation/conversational_image_segmentation_grounding_abstract_concepts_with_scalable_supe.md
!segmentation/crackssm_reviving_ssms_for_crack_segmentation_via_dynamic_scanning.md
!segmentation/cross-domain_few-shot_segmentation_via_multi-view_progressive_adaptation.md
!segmentation/dedelayed_deleting_remote_inference_delay_via_on-device_correction.md
!segmentation/denoise_and_align_towards_source-free_uda_for_robust_panoramic_semantic_segmenta.md
!segmentation/detecting_ai-generated_forgeries_via_iterative_manifold_deviation_amplification.md
!segmentation/differentiable_laplacian_matrix_guided_superpixel_segmentation.md
!segmentation/dimos_disentangling_instance-level_moving_object_segmentation.md
!segmentation/direct_segmentation_without_logits_optimization_for_training-free_open-vocabular.md
!segmentation/discover_segment_and_select_a_progressive_mechanism_for_zero-shot_camouflaged_ob.md
!segmentation/dsflash_panoptic_scene_graph_realtime.md
!segmentation/dual-level_adapter_boosting_prompt-free_curvilinear_structure_segmentation.md
!segmentation/efficient_video_object_segmentation_and_tracking_with_recurrent_dynamic_submodel.md
!segmentation/elvis_enhance_low-light_for_video_instance_segmentation_in_the_dark.md
!segmentation/erecu_pseudolabel_evolution_unsupervised_camouflage.md
!segmentation/exploring_the_underwater_world_segmentation_without_extra_training.md
!segmentation/f2net_a_frequency-fused_network_for_ultra-high_resolution_remote_sensing_segment.md
!segmentation/flowdis_language-guided_dichotomous_image_segmentation_with_flow_matching.md
!segmentation/follow_the_saliency_supervised_saliency_for_retrieval-augmented_dense_video_capt.md
!segmentation/fov-net_rotation-invariant_cad_b-rep_learning_via_field-of-view_ray_casting.md
!segmentation/frequency-aware_affinity_for_weakly_supervised_semantic_segmentation.md
!segmentation/from_2d_alignment_to_3d_plausibility_unifying_heterogeneous_2d_priors_and_penetr.md
!segmentation/from_softmax_to_dirichlet_evidential_learning_for_semi-supervised_semantic_segme.md
!segmentation/generalizable_co-salient_object_detection_via_mixed_content-style_modulation.md
!segmentation/genmask_adapting_dit_for_segmentation_via_direct_mask_generation.md
!segmentation/geoguide_hierarchical_geometric_guidance_for_open-vocabulary_3d_semantic_segment.md
!segmentation/geomotion_rethinking_motion_segmentation_via_latent_4d_geometry.md
!segmentation/geosurge_geo-localization_using_semantic_fusion_with_hierarchy_of_geographic_emb.md
!segmentation/gkd_generalizable_knowledge_distillation_vfm.md
!segmentation/heuristic_self-paced_learning_for_domain_adaptive_semantic_segmentation_under_ad.md
!segmentation/high-precision_dichotomous_image_segmentation_via_depth_integrity-prior_and_fine.md
!segmentation/hilbert_curve-based_attention_enabling_topology-preserving_image_tensor_represen.md
!segmentation/hops_hierarchical_open-vocabulary_part_segmentation_with_attention-aware_filteri.md
!segmentation/hyperbolic_prototype_learning_with_uncertainty-aware_consistency_for_continual_t.md
!segmentation/hyseg_learning_generative_priors_for_structure-aware_remote_sensing_segmentation.md
!segmentation/insid3_training-free_in-context_segmentation_with_dinov3.md
!segmentation/joint_spectral_image_reconstruction_and_semantic_segmentation_with_cooperative_u.md
!segmentation/kαlos_finds_consensus_a_meta-algorithm_for_evaluating_inter-annotator_agreement_.md
!segmentation/learning_and_aligning_click-aware_shape_prior_for_interactive_amodal_instance_se.md
!segmentation/learning_cross-view_object_correspondence_via_cycle-consistent_mask_prediction.md
!segmentation/leveraging_class_distributions_in_clip_for_weakly_supervised_semantic_segmentati.md
!segmentation/live_interactive_training_for_video_segmentation.md
!segmentation/lod-loc_v3_generalized_aerial_localization_in_dense_cities_using_instance_silhou.md
!segmentation/looking_beyond_the_window_global-local_aligned_clip_for_training-free_open-vocab.md
!segmentation/making_training-free_diffusion_segmentors_scale_with_the_generative_power.md
!segmentation/maris_marine_open-vocabulary_instance_segmentation.md
!segmentation/marss_radar_semantic_segmentation_via_modular_attention_and_state_space_models.md
!segmentation/matanyone_2_scaling_video_matting_via_a_learned_quality_evaluator.md
!segmentation/matchmask_mask-centric_generative_data_augmentation_for_label-scarce_semantic_se.md
!segmentation/mitigating_objectness_bias_and_region-to-text_misalignment_for_open-vocabulary_p.md
!segmentation/mixercseg_an_efficient_mixer_architecture_for_crack_segmentation_via_decoupled_m.md
!segmentation/mixture_of_prototypes_for_test-time_adaptive_segmentation.md
!segmentation/mrm_masked_representation_modeling_domain_adaptive.md
!segmentation/pca-seg_revisiting_cost_aggregation_for_openvocabulary_semantic_and_part_segmentat.md
!segmentation/pearl_geometry_aligns_semantics_for_training-free_open-vocabulary_semantic_segme.md
!segmentation/pix-tab_efficient_pixel-precise_table_structure_recognition_approach_with_specul.md
!segmentation/pixdlm_uav_reasoning_segmentation.md
!segmentation/pointer-cad_unifying_b-rep_and_command_sequences_via_pointer-based_edges_faces_s.md
!segmentation/pr-magic_prompt_refinement_via_mask_decoder_gradient_flow_for_in-context_segment.md
!segmentation/promptmoe_a_segmentation_refinement_framework_leveraging_mixture_of_experts_for_.md
!segmentation/prue_a_practical_recipe_for_field_boundary_segmentation_at_scale.md
!segmentation/raven_radar_adaptive_vision_encoders_for_efficient_chirp-wise_object_detection_a.md
!segmentation/realvlg-r1_a_large-scale_real-world_visual-language_grounding_benchmark_for_robo.md
!segmentation/reattnclip_training-free_open-vocabulary_remote_sensing_image_segmentation_via_r.md
!segmentation/rel-sf4pass_panoramic_semantic_segmentation_with_rel_depth_representation_and_sp.md
!segmentation/resam_refine_requery_and_reinforce_self-prompting_point-supervised_segmentation_.md
!segmentation/rethinking_box_supervision_bias-free_weakly_supervised_medical_segmentation.md
!segmentation/retrieve_and_segment_are_a_few_examples_enough_to_bridge_the_supervision_gap_in_.md
!segmentation/revisiting_geometric_obfuscation_with_dual_convergent_lines_for_privacy-preservi.md
!segmentation/rmae-progress_advancing_semantic_segmentation_in_unstructured_environments.md
!segmentation/robotseg_a_model_and_dataset_for_segmenting_robots_in_image_and_video.md
!segmentation/rs-ssm_refining_forgotten_specifics_in_state_space_model_for_video_semantic_segm.md
!segmentation/s2c2seg_semantic-spatial_consistency_and_category_optimization_for_open-vocabula.md
!segmentation/sage_style-adaptive_generalization_for_privacy-constrained_semantic_segmentation.md
!segmentation/samix_reinforcing_sam2_with_semantic_adapter_and_reference_selecting_policy_for_.md
!segmentation/samtok_representing_any_mask_with_two_words.md
!segmentation/sarmae_masked_autoencoder_for_sar_representation_learning.md
!segmentation/sddf_specificity-driven_dynamic_focusing_for_open-vocabulary_camouflaged_object.md
!segmentation/seeing_beyond_extrapolative_domain_adaptive_panoramic_segmentation.md
!segmentation/seeing_both_sides_towards_bidirectional_semantic_alignment_for_open-vocabulary_c.md
!segmentation/seggbc_justifiable_coarse-to-fine_granular-ball_computing_for_enhancing_clusteri.md
!segmentation/selective_regularized_and_calibrated_harnessing_vision_foundation_models_for_cro.md
!segmentation/semlayer_semantic-aware_generative_segmentation_and_layer_construction_for_abstr.md
!segmentation/souple_enhancing_audio-visual_localization_and_segmentation_with_learnable_promp.md
!segmentation/spar_single-pass_any-resolution_vit_for_open-vocabulary_segmentation.md
!segmentation/structure-aware_representation_distillation_for_tiny-dense_object_segmentation.md
!segmentation/synthetic_object_compositions_for_scalable_and_accurate_learning_in_detection_se.md
!segmentation/task-oriented_data_synthesis_and_control-rectify_sampling_for_remote_sensing_sem.md
!segmentation/test-time_multi-prompt_adaptation_for_open-vocabulary_remote_sensing_image_segme.md
!segmentation/tf-ssd_a_strong_pipeline_via_synergic_mask_filter_for_training-free_co-salient_o.md
!segmentation/the_golden_subspace_where_efficiency_meets_generalization_in_continual_test-time.md
!segmentation/the_missing_point_in_vision_transformers_for_universal_image_segmentation.md
!segmentation/the_power_of_prior_training-free_open-vocabulary_semantic_segmentation_with_llav.md
!segmentation/towards_high-quality_image_segmentation_improving_topology_accuracy_by_penalizin.md
!segmentation/towards_robust_multi-modal_semantic_segmentation_with_teacher-student_framework_.md
!segmentation/training-free_open-vocabulary_camouflaged_object_segmentation_via_fine-grained_o.md
!segmentation/uncertainty-aware_modality_fusion_for_unaligned_rgb-t_salient_object_detection.md
!segmentation/unified_spherical_frontend_learning_rotation-equivariant_representations_of_sphe.md
!segmentation/universal_3d_shape_matching_via_coarse-to-fine_language_guidance.md
!segmentation/v2-sam_marrying_sam2_with_multi-prompt_experts_for_cross-view_object_corresponde.md
!segmentation/vggt-segmentor_geometry-enhanced_cross-view_segmentation.md
!segmentation/videomt_your_vit_is_secretly_also_a_video_segmentation_model.md
!segmentation/virst_video-instructed_reasoning_assistant_for_spatiotemporal_segmentation.md
!segmentation/xseg_a_large-scale_x-ray_contraband_segmentation_benchmark_for_real-world_securi.md
!self_supervised/a_faster_path_to_continual_learning.md
!self_supervised/adaprior_bayesian-inspired_adaptive_prior_correction_for_long-tailed_continual_l.md
!self_supervised/an_optimal_transport_driven_approach_for_cultivating_latent_space_in_online_incr.md
!self_supervised/assignment-driven_hash_learning_in_a_hyper-semantic_space_for_on-the-fly_categor.md
!self_supervised/beyond_binary_contrast_modeling_continuous_skeleton_action_spaces_with_transitio.md
!self_supervised/beyond_myopic_alignment_lookahead_optimization_for_online_class-incremental_lear.md
!self_supervised/beyond_the_static_world_continual_category_discovery_under_visual_drift.md
!self_supervised/can_you_learn_to_see_without_images_procedural_warm-up_for_vision_transformers.md
!self_supervised/cheem_continual_learning_by_reuse_new_adapt_and_skip_--_a_hierarchical_explorati.md
!self_supervised/com_pt_chain_of_models_pretraining.md
!self_supervised/cue_concept-aware_multi-label_expansion_to_mitigate_concept_confusion_in_long-ta.md
!self_supervised/d2dewarp_dual_dimensions_geometric_representation_learning_based_document_image_.md
!self_supervised/ddsf_robust_few-shot_learning_via_disentangled_subspaces_with_determinantal_poin.md
!self_supervised/decision_boundary-aware_generation_for_long-tailed_learning.md
!self_supervised/decouple_your_discovery_and_memory_in_continual_generalized_category_discovery.md
!self_supervised/dgs_dual_gradient_and_semantic-shift_guided_low-rank_adaptation_for_class_increm.md
!self_supervised/diversedit_towards_diverse_representation_learning_in_diffusion_transformers.md
!self_supervised/dual-estimator_decoupling_global_and_local_semantic_shift_for_drift_compensation.md
!self_supervised/easy2hard_from_partially_to_fully_unmatched_modalities_as_negative_samples_in_co.md
!self_supervised/energy_waveify_and_redistribution_for_test-time_adaptation_a_control_system_pers.md
!self_supervised/exemplar-free_class_incremental_learning_via_preserving_class-discriminative_str.md
!self_supervised/exemplar-free_continual_learning_for_state_space_models.md
!self_supervised/franca_nested_matryoshka_clustering_for_scalable_visual_representation_learning.md
!self_supervised/free-grained_hierarchical_visual_recognition.md
!self_supervised/from_few-way_to_many-way_rethinking_few-shot_fine-grained_image_classification.md
!self_supervised/gaussianmatch_semi-supervised_regression_with_pseudo-label_filtering_via_multi-v.md
!self_supervised/geometry-driven_ood_detectors_are_class-incremental_learners.md
!self_supervised/had_heterogeneity-aware_distillation_for_lifelong_heterogeneous_learning.md
!self_supervised/harnessing_the_power_of_foundation_models_for_accurate_material_classification.md
!self_supervised/hcl-ff_hierarchical_and_contrastive_learning_for_forward-forward_algorithm.md
!self_supervised/hier-cos_making_deep_features_hierarchy-aware_via_composition_of_orthogonal_subs.md
!self_supervised/how_much_3d_do_video_foundation_models_encode.md
!self_supervised/hycal_training_free_prototype_calibration_for_cross_discipline_fscil.md
!self_supervised/in_pursuit_of_pixel_supervision_for_visual_pre-training.md
!self_supervised/is_parameter_isolation_better_for_prompt-based_continual_learning.md
!self_supervised/learning_by_analogy_a_causal_framework_for_compositional_generalization.md
!self_supervised/learning_eigenstructures_of_unstructured_data_manifolds.md
!self_supervised/learning_from_semantic_dictionaries_discriminative_codebook_contrastive_learning.md
!self_supervised/learning_like_humans_analogical_concept_learning_for_generalized_category_discov.md
!self_supervised/learning_to_see_through_a_babys_eyes_early_visual_diets_enable_robust_visual_int.md
!self_supervised/measure_the_feature_universe_topology-based_pseudo_labeling_and_gravity_consiste.md
!self_supervised/memflow_a_lightweight_forward_memorizing_framework_for_quick_domain_adaptive_fea.md
!self_supervised/momo_mars_orbital_model_foundation_model_for_mars_orbital_applications.md
!self_supervised/nitrogen_an_open_foundation_model_for_generalist_gaming_agents.md
!self_supervised/nonparametric_deep_fine-grained_clustering_with_low-rank_guided_vision-language_.md
!self_supervised/on_the_role_of_temporal_granularity_in_the_robustness_of_spiking_neural_networks.md
!self_supervised/openvision_2_a_family_of_generative_pretrained_visual_encoders_for_multimodal_le.md
!self_supervised/paf_perturbation-aware_filtering_for_open-set_semi-supervised_learning.md
!self_supervised/parameter-efficient_continual_learning_for_enhancing_plasticity_without_forgetti.md
!self_supervised/pointcsp_cross-sample_semantic_propagation_and_stability_preservation_in_self-su.md
!self_supervised/progressive_mask_distillation_for_self-supervised_video_representation.md
!self_supervised/quantized_residuals_to_continuous_prompts_for_few-shot_class_incremental_learning.md
!self_supervised/reading_your_actions_learning_generalizable_action_representations_via_pre-train.md
!self_supervised/reconstructing_spiking_neural_networks_using_a_single_neuron_with_autapses.md
!self_supervised/recurrent_video_masked_autoencoders.md
!self_supervised/reframing_long-tailed_learning_via_loss_landscape_geometry.md
!self_supervised/representation-steered_incremental_adapter-tuning_for_class-incremental_learning.md
!self_supervised/residual_connections_harm_generative_representation_learning.md
!self_supervised/rethinking_snn_online_training_and_deployment_grad.md
!self_supervised/robust_spiking_neural_networks_by_temporal_mutual_information.md
!self_supervised/scaling_dense_event-stream_pretraining_from_visual_foundation_models.md
!self_supervised/scaling_parallel_sequence_models_to_vision_foundation_models.md
!self_supervised/secos_semantic_capture_for_rigorous_classification_in_open-world_semi-supervised.md
!self_supervised/seeing_through_the_shift_causality-inspired_robust_generalized_category_discover.md
!self_supervised/semantic-guided_global-local_collaborative_prompt_learning_for_few-shot_class_in.md
!self_supervised/shape-of-you_fused_gromov-wasserstein_optimal_transport_for_semantic_corresponde.md
!self_supervised/smart_replay_adaptive_scheduling_of_memory_rehearsal_for_computational_resource-.md
!self_supervised/spectral_mixture-of-experts_for_continual_learning.md
!self_supervised/stabilizing_feature_geometry_in_noisy_pretrained_models_for_robust_downstream_ta.md
!self_supervised/subspace_alignment_for_clip-based_continual_learning_via_canonical_correlation_a.md
!self_supervised/suppressing_non-semantic_noise_in_masked_image_modeling_representations.md
!self_supervised/talo_pushing_3d_vision_foundation_models_towards_globally_consistent_online_reco.md
!self_supervised/tar_token-aware_refinement_for_fine-grained_generalized_category_discovery.md
!self_supervised/teaching_dinov3_about_partial_3d_geometry_a_self-supervised_geometry-aware_appro.md
!self_supervised/teflow_enabling_multi-frame_supervision_for_self-supervised_feed-forward_scene_f.md
!self_supervised/temporal_imbalance_of_positive_and_negative_supervision_in_class-incremental_lea.md
!self_supervised/temporal_interaction_in_spiking_transformers_with_multi-delay_mixer.md
!self_supervised/temporal_representation_enhancement_tre_learning_to_forget_dominant_patterns_for.md
!self_supervised/text-phase_synergy_network_with_dual_priors_for_unsupervised_cross-domain_image_.md
!self_supervised/the_devil_is_in_gradient_entanglement_energy-aware_gradient_coordinator_for_robu.md
!self_supervised/towards_stable_self-supervised_object_representations_in_unconstrained_egocentri.md
!self_supervised/trackmae_video_representation_learning_via_track_mask_and_predict.md
!self_supervised/trust-calibrated_collaborative_learning_for_long-tailed_visual_recognition.md
!self_supervised/tunable_soft_equivariance_with_guarantees.md
!self_supervised/unique_lives_shared_world_learning_from_single-life_videos.md
!self_supervised/unirefiner_teaching_pre-trained_vits_to_self-dispose_dross_via_contrastive_regis.md
!self_supervised/uplift_efficient_pixel-dense_feature_upsampling_with_local_attenders.md
!self_supervised/videossr_video_self-supervised_reinforcement_learning.md
!self_supervised/vision_transformers_need_more_than_registers.md
!self_supervised/vt-intrinsic_physics-based_decomposition_of_reflectance_and_shading_using_a_sing.md
!self_supervised/weight_space_representation_learning_via_neural_field_adaptation.md
!self_supervised/your_dissimilarities_define_you_complementary_learning_exploiting_class_diversit.md
!signal_comm/actta_rethinking_test-time_adaptation_via_dynamic_activation.md
!signal_comm/clay_conditional_visual_similarity.md
!social_computing/bridging_pixels_and_words_mask-aware_local_semantic_fusion_for_multimodal_media_.md
!social_computing/instance-level_visual_active_tracking_with_occlusion-aware_planning.md
!social_computing/revisiting_unknowns_towards_effective_and_efficient_open-set_active_learning.md
!time_series/pfgnet_a_fully_convolutional_frequency-guided_peripheral_gating_network_for_effi.md
!time_series/probabilistic_precipitation_nowcasting_with_rectified_flow_transformers.md
!time_series/real-time_long_horizon_air_quality_forecasting_via_group-relative_policy_optimiz.md
!time_series/sattc_structure-aware_label-free_test-time_calibration_for_cross-subject_eeg-to-.md
!time_series/stable_spike_dual_consistency_optimization_via_bitwise_and_operations_for_spikin.md
!time_series/stcast_adaptive_boundary_alignment_for_global_and_regional_weather_forecasting.md
!time_series/towards_uncertainty-aware_unsupervised_domain_adaptation_for_videos_and_time-ser.md
!video_generation/3d-aware_implicit_motion_control_for_view-adaptive_human_video_generation.md
!video_generation/a_frame_is_worth_one_token_efficient_generative_world_modeling_with_delta_tokens.md
!video_generation/accelerating_autoregressive_video_diffusion_via_history-guided_cache_and_residua.md
!video_generation/accelerating_diffusion-based_video_editing_via_heterogeneous_caching_beyond_full.md
!video_generation/activityforensics_a_comprehensive_benchmark_for_localizing_manipulated_activity_.md
!video_generation/adacluster_adaptive_query-key_clustering_for_sparse_attention_in_video_generatio.md
!video_generation/adaptok_learning_adaptive_and_temporally_causal_video_tokenization_in_a_1d_laten.md
!video_generation/alchemint_fine-grained_temporal_control_for_multi-reference_consistent_video_gen.md
!video_generation/anti-i2v_safeguarding_your_photos_from_malicious_image-to-video_generation.md
!video_generation/anyid_ultra-fidelity_universal_identity-preserving_video_generation_from_any_vis.md
!video_generation/archon_a_unified_multimodal_model_for_holistic_digital_human_generation.md
!video_generation/are_image-to-video_models_good_zero-shot_image_editors.md
!video_generation/attention_surgery_an_efficient_recipe_to_linearize_your_video_diffusion_transfor.md
!video_generation/bagger_backwards_aggregation_for_mitigating_drift_in_autoregressive_video_diffus.md
!video_generation/bullettime_decoupled_control_of_time_and_camera_pose_for_video_generation.md
!video_generation/camdirector_towards_long-term_coherent_video_trajectory_editing.md
!video_generation/captain_safari_a_world_engine_with_pose-aligned_3d_memory.md
!video_generation/causality_in_video_diffusers_is_separable_from_denoising.md
!video_generation/chain_of_event-centric_causal_thought_for_physically_plausible_video_generation.md
!video_generation/ci-vid_a_coherent_interleaved_text-video_dataset.md
!video_generation/cinebrain_a_large-scale_multi-modal_audiovisual_brain_dataset_for_brain-conditio.md
!video_generation/cinescene_implicit_3d_as_effective_scene_representation_for_cinematic_video_gene.md
!video_generation/composing_concepts_from_images_and_videos_via_concept-prompt_binding.md
!video_generation/compressed-domain-aware_online_video_super-resolution.md
!video_generation/consid-gen_view-consistent_and_identity-preserving_image-to-video_generation.md
!video_generation/content-aware_dynamic_patchification_for_efficient_video_diffusion.md
!video_generation/cot-edit_let_cot_guide_instruction_video_editing.md
!video_generation/cross-subject_eeg-to-video_reconstruction_and_beyond.md
!video_generation/cubecomposer_spatio-temporal_autoregressive_4k_360_video_generation_from_perspec.md
!video_generation/d2cache_second-order_delta_caching_for_higher_video_diffusion_acceleration.md
!video_generation/diff4splat_controllable_4d_scene_generation_with_latent_dynamic_reconstruction_m.md
!video_generation/disca_accelerating_video_diffusion_transformers_wi.md
!video_generation/diverse_video_generation_with_determinantal_point_process-guided_policy_optimiza.md
!video_generation/dreamshot_storyboard_synthesis.md
!video_generation/dreamstyle_a_unified_framework_for_video_stylization.md
!video_generation/drivelaw_unifying_planning_and_video_generation_in_a_latent_driving_world.md
!video_generation/dual-granularity_memory_for_efficient_video_generation.md
!video_generation/dynamicsboost_dynamic_plausible_video_generation_via_annotation-free_continuatio.md
!video_generation/easyomnimatte_taming_pretrained_inpainting_diffusion_models_for_end-to-end_video.md
!video_generation/easyv2v_a_high-quality_instruction-based_video_editing_framework.md
!video_generation/editctrl_disentangled_local_and_global_control_for_real-time_generative_video_ed.md
!video_generation/effectmaker_unifying_reasoning_and_generation_for_customized_visual_effect_creat.md
!video_generation/efficient_training_for_human_video_generation_with_entropy-guided_prioritized_pr.md
!video_generation/ego-inbetween_generating_object_state_transitions_in_ego-centric_videos.md
!video_generation/egocontrol_controllable_egocentric_video_generation_via_3d_full-body_poses.md
!video_generation/egoedit_dataset_real-time_streaming_model_and_benchmark_for_egocentric_video_edi.md
!video_generation/egox_egocentric_video_generation_from_a_single_exocentric_video.md
!video_generation/endless_world_real-time_3d-aware_long_video_generation.md
!video_generation/evoid_reinforced_evolution_for_identity-preserving_video_generation.md
!video_generation/expose_reinforcing_video_generation_models_for_extreme_pose_estimation.md
!video_generation/facecam_portrait_video_camera_control_via_scale-aware_conditioning.md
!video_generation/fastlightgen_fast_and_light_video_generation_with_fewer_steps_and_parameters.md
!video_generation/ffp-300k_scaling_first-frame_propagation_for_generalizable_video_editing.md
!video_generation/flashlips_100-fps_mask-free_latent_lip-sync_using_reconstruction_instead_of_diff.md
!video_generation/flashportrait_6x_faster_infinite_portrait_animation_with_adaptive_latent_predict.md
!video_generation/flextraj_image-to-video_generation_with_flexible_point_trajectory_control.md
!video_generation/flowception_temporally_expansive_flow_matching_for_video_generation.md
!video_generation/flowdirector_training-free_flow_steering_for_precise_text-to-video_editing.md
!video_generation/flowmotion_training-free_flow_guidance_for_video_motion_transfer.md
!video_generation/flowportal_residual-corrected_flow_for_training-free_video_relighting_and_backgr.md
!video_generation/free-lunch_long_video_generation_via_layer-adaptive_ood_correction.md
!video_generation/from_static_to_dynamic_exploring_self-supervised_image-to-video_representation_t.md
!video_generation/generating_humanless_environment_walkthroughs_from_egocentric_walking_tour_video.md
!video_generation/generative_neural_video_compression_via_video_diffusion_prior.md
!video_generation/generative_video_motion_editing_with_3d_point_tracks.md
!video_generation/genhoi_towards_object-consistent_hand-object_interaction_with_temporally_balance.md
!video_generation/geometry-as-context_modulating_explicit_3d_in_scene-consistent_video_generation_.md
!video_generation/gt-svj_generative-transformer-based_self-supervised_video_judge.md
!video_generation/handworld_hand-centric_unified_video_action_generation.md
!video_generation/harmovid_relightful_video_portrait_harmonization.md
!video_generation/holocine_holistic_generation_of_cinematic_multi-shot_long_video_narratives.md
!video_generation/hvg-3d_bridging_real_and_simulation_domains_for_3d-conditional_hand-object_inter.md
!video_generation/id-crafter_vlm-grounded_online_rl_for_compositional_multi-subject_video_generati.md
!video_generation/improving_motion_in_image-to-video_models_via_adaptive_low-pass_guidance.md
!video_generation/inference-time_physics_alignment_of_video_generative_models_with_latent_world_mo.md
!video_generation/infinity-rope_action-controllable_infinite_video_generation_emerges_from_autoreg.md
!video_generation/interpretable_motion-attentive_maps_spatio-temporally_localizing_concepts_in_vid.md
!video_generation/ip-adapter_is_all_you_need_towards_fine-tuning-free_diffusion-based_talking_face.md
!video_generation/lamp_language-assisted_motion_planning_for_controllable_video_generation.md
!video_generation/lavr_scene_latent_conditioned_generative_video_trajectory_re-rendering_using_lar.md
!video_generation/less_is_more_data-efficient_adaptation_for_controllable_text-to-video_generation.md
!video_generation/let_your_image_move_with_your_motion_--_implicit_multi-object_multi-motion_trans.md
!video_generation/lightmover_generative_light_movement_with_color_and_intensity_controls.md
!video_generation/linvideo_a_post-training_framework_towards_on_attention_in_efficient_video_gener.md
!video_generation/lol_longer_than_longer_scaling_video_generation_to_hour.md
!video_generation/lottiegpt_vector_animation_generation.md
!video_generation/lynx_towards_high-fidelity_personalized_video_generation.md
!video_generation/m4v_multimodal_mamba_for_efficient_text-to-video_generation.md
!video_generation/mind_the_generative_details_direct_localized_detail_preference_optimization_for_.md
!video_generation/mocha_end-to-end_video_character_replacement_without_structural_guidance.md
!video_generation/moregen_multi-agent_motion-reasoning_engine_for_code-based_text-to-video_synthes.md
!video_generation/motionv2v_editing_motion_in_a_video.md
!video_generation/multianimate_pose-guided_image_animation_made_extensible.md
!video_generation/multishotmaster_a_controllable_multi-shot_video_generation_framework.md
!video_generation/musicinfuser_making_video_diffusion_listen_and_dance.md
!video_generation/ns-diff_fluid_navier-stokes_guided_video_diffusion_via_reinforcement_learning.md
!video_generation/omnilottie_generating_vector_animations_via_parameterized_lottie_tokens.md
!video_generation/one-to-all_animation_alignment-free_character_animation_and_image_pose_transfer.md
!video_generation/onestory_coherent_multi-shot_video_generation_with_adaptive_memory.md
!video_generation/open-world_hand-object_interaction_video_generation_based_on_structure_and_conta.md
!video_generation/pantheon360_taming_digital_twin_generation_via_3d-aware_360_video_diffusion.md
!video_generation/performrecast_expression_and_head_pose_disentanglement_for_portrait_video_editin.md
!video_generation/personalive_expressive_portrait_image_animation_for_live_streaming.md
!video_generation/phantom_physics-infused_video_generation_via_joint_modeling_of_visual_and_latent.md
!video_generation/physical_object_understanding_with_a_physically_controllable_world_model.md
!video_generation/physical_simulator_in-the-loop_video_generation.md
!video_generation/physvid_physics_aware_local_conditioning_for_generative_video_models.md
!video_generation/placid_identity-preserving_multi-object_compositing_via_video_diffusion_with_syn.md
!video_generation/plenoptic_video_generation.md
!video_generation/poseanything_general_pose-guided_video_generation_with_part-aware_temporal_coher.md
!video_generation/propfly_learning_to_propagate_via_on-the-fly_supervision_from_pre-trained_video_.md
!video_generation/prophy_progressive_physical_alignment_for_dynamic_world_simulation.md
!video_generation/rapid_reusing_attention_sparsity_with_inter-step_adaptation_for_efficient_video_.md
!video_generation/real-time_generation_of_streamable_talking_portrait_video_with_reference-guided_.md
!video_generation/reasoning_diffusion_for_unpaired_test_time_out-of-distribution_text-image_to_vid.md
!video_generation/recedit-drive_3d_reconstruction-guided_spatiotemporal_video_editing_for_autonomo.md
!video_generation/redirector_creating_any-length_video_retakes_with_rotary_camera_encoding.md
!video_generation/ref4d-videobench_four-dimensional_reference-based_evaluation_of_text-to-video_ge.md
!video_generation/rehyat_recurrent_hybrid_attention_for_video_diffusion_transformers.md
!video_generation/rethinking_position_embedding_as_a_context_controller_for_multi-reference_and_mu.md
!video_generation/reward_forcing_efficient_streaming_video_generation_with_rewarded_distribution_m.md
!video_generation/rfdm_residual_flow_diffusion_models_for_video_editing.md
!video_generation/scaling_instruction-based_video_editing_with_a_high-quality_synthetic_dataset.md
!video_generation/scaling_zero-shot_reference-to-video_generation.md
!video_generation/seeu_seeing_the_unseen_world_via_4d_dynamics-aware_generation.md
!video_generation/semvideo_reconstructs_what_you_watch_from_brain_activity_via_hierarchical_semant.md
!video_generation/shotdirector_directorially_controllable_multi-shot_video_generation_with_cinemat.md
!video_generation/slvmeval_synthetic_meta_evaluation_benchmark_for_text-to-long_video_generation.md
!video_generation/smrabooth_subject_and_motion_representation_alignment_for_customized_video_gener.md
!video_generation/solireward_mitigating_susceptibility_to_reward_hacking_and_annotation_noise_in_v.md
!video_generation/soul_breathe_life_into_digital_human_for_high-fidelity_long-term_multimodal_anim.md
!video_generation/spacetimepilot_generative_rendering_of_dynamic_scenes_across_space_and_time.md
!video_generation/spatia_video_generation_with_updatable_spatial_memory.md
!video_generation/stage_storyboard-anchored_generation_for_cinematic_multi-shot_narrative.md
!video_generation/stand-in_a_lightweight_and_plug-and-play_identity_control_for_video_generation.md
!video_generation/starflow-v_end-to-end_video_generative_modeling_with_autoregressive_normalizing_.md
!video_generation/stereo_world_model_camera-guided_stereo_video_generation.md
!video_generation/stereoworld_geometry-aware_monocular-to-stereo_video_generation.md
!video_generation/storytailora_zero-shot_pipeline_for_action-rich_multi-subject_visual_narratives.md
!video_generation/surf_signature-retained_fast_video_generation.md
!video_generation/svbench_evaluation_of_video_generation_models_on_social_reasoning.md
!video_generation/swift_sliding_window_reconstruction_for_few-shot_training-free_generated_video_a.md
!video_generation/switchcraft_training-free_multi-event_video_generation_with_attention_controls.md
!video_generation/symphomotion_joint_control_of_camera_motion_and_object_dynamics_for_coherent_vid.md
!video_generation/synmotion_semantic-visual_adaptation_for_motion_customized_video_generation.md
!video_generation/tea-adapter_teacher_adapter_for_efficient_conditional_generation.md
!video_generation/tear_temporal-aware_automated_red-teaming_for_text-to-video_models.md
!video_generation/tempocontrol_temporal_attention_guidance_for_text-to-video_models.md
!video_generation/tempomaster_efficient_long_video_generation_via_next-frame-rate_prediction.md
!video_generation/tgt_text-grounded_trajectories_for_locally_controlled_video_generation.md
!video_generation/the_devil_is_in_the_details_enhancing_video_virtual_try-on_via_keyframe-driven_d.md
!video_generation/thermal_diffusion_matters_infrared_spatial-temporal_video_super-resolution_throu.md
!video_generation/thinking_with_video_video_generation_as_a_promising_multimodal_reasoning_paradig.md
!video_generation/tivibench_benchmarking_think-in-video_reasoning_for_video_generation.md
!video_generation/towards_holistic_modeling_for_video_frame_interpolation_with_auto-regressive_dif.md
!video_generation/transition_matching_distillation_for_fast_video_generation.md
!video_generation/tv2tv_a_unified_framework_for_interleaved_language_and_video_generation.md
!video_generation/u-mind_a_unified_framework_for_real-time_multimodal_interaction_with_audiovisual.md
!video_generation/uniavgen_unified_audio_and_video_generation_with_asymmetric_cross-modal_interact.md
!video_generation/unified_camera_positional_encoding_for_controlled_video_generation.md
!video_generation/unityvideo_unified_multi-modal_multi-task_learning_for_enhancing_world-aware_vid.md
!video_generation/v-rgbx_video_editing_with_accurate_controls_over_intrinsic_properties.md
!video_generation/vabench_a_comprehensive_benchmark_for_audio-video_generation.md
!video_generation/vanast_virtual_try-on_with_human_image_animation_via_synthetic_triplet_supervisi.md
!video_generation/vdot_efficient_unified_video_creation_via_optimal_transport_distillation.md
!video_generation/vector_prism_animating_vector_graphics_by_stratifying_semantic_structure.md
!video_generation/versecrafter_dynamic_realistic_video_world_model_with_4d_geometric_control.md
!video_generation/vga-bench_a_unified_benchmark_and_multi-model_framework_for_video_aesthetics_and.md
!video_generation/video-as-answer_predict_and_generate_next_video_event_with_joint-grpo.md
!video_generation/video_generation_with_stable_transparency_via_shiftable_rgb-a_distribution_learn.md
!video_generation/videorealbench_a_chain-of-thought_realism_evaluation_benchmark_for_generated_hum.md
!video_generation/videoweaver_multimodal_multi-view_video-to-video_transfer_for_embodied_agents.md
!video_generation/vidtag_temporally_aligned_video_to_gps_geolocalization_with_denoising_sequence_p.md
!video_generation/vista_a_test-time_self-improving_video_generation_agent.md
!video_generation/viva_vlm-guided_instruction-based_video_editing_with_reward_optimization.md
!video_generation/vmonarch_efficient_video_diffusion_transformers_with_structured_attention.md
!video_generation/vsrell_a_simple_baseline_for_video_super-resolution_and_enhancement_in_low-light.md
!video_generation/what_are_you_doing_a_closer_look_at_controllable_human_video_generation.md
!video_generation/when_numbers_speak_aligning_textual_numerals_and_visual_instances_in_text-to-vid.md
!video_generation/worldreel_4d_video_generation_with_consistent_geometry_and_motion_modeling.md
!video_generation/yose_you_only_select_essential_tokens_for_efficient_dit-based_video_object_remov.md
!video_generation/yume15_a_text-controlled_interactive_world_generation_model.md
!video_understanding/a_stitch_in_time_learning_procedural_workflow_via_self_supervised_plackett_luce_r.md
!video_understanding/active_intelligence_in_video_avatars_via_closed-loop_world_modeling.md
!video_understanding/adaptive_capacity_autoregressive_visual_tracking.md
!video_understanding/adaspark_adaptive_sparsity_for_efficient_long_video_understanding.md
!video_understanding/adaspot_spend_resolution_where_it_matters_for_precise_event_spotting.md
!video_understanding/affordance-first_decomposition_for_continual_learning_in_video-language_understa.md
!video_understanding/alert-clip_abnormality-aware_latent-enhanced_representation_tuning_of_clip_for_v.md
!video_understanding/alphamatte4k_mumatting_dataset_and_model_for_ultra-micro_precision_alpha_video_m.md
!video_understanding/an_efficient_token_compression_framework_for_visual_object_tracking.md
!video_understanding/an_empirical_study_on_how_video-llms_answer_video_questions.md
!video_understanding/asynchronous_temporal_modeling_with_two-agent_framework_for_streaming_dense_vide.md
!video_understanding/autocut_end-to-end_advertisement_video_editing_based_on_multimodal_discretizatio.md
!video_understanding/autogaze_attend_before_attention_efficient_video.md
!video_understanding/beyond_explicit_language_plug-and-play_visual-to-linguistic_modeling_toward_gene.md
!video_understanding/beyond_static_frames_temporal_aggregate-and-restore_vision_transformer_for_human.md
!video_understanding/boosting_self-supervised_tracking_with_contextual_prompts_and_noise_learning.md
!video_understanding/bootstrapping_video_semantic_segmentation_model_via_distillation-assisted_test-t.md
!video_understanding/breaking_smooth-motion_assumptions_a_uav_benchmark_for_multi-object_tracking_in_.md
!video_understanding/building_a_precise_video_language_with_human-ai_oversight.md
!video_understanding/captionformer_unified_segmentation_tracking_and_captioning_for_spatio-temporal_o.md
!video_understanding/cinesrd_leveraging_visual_acoustic_and_linguistic_cues_for_open-world_visual_med.md
!video_understanding/clcr_cross-level_semantic_collaborative_representation_for_multimodal_learning.md
!video_understanding/cluster-wise_spatio-temporal_masking_for_efficient_video-language_pretraining.md
!video_understanding/cocovideo_the_high-quality_commercial-model-based_contrastive_benchmark_for_ai-g.md
!video_understanding/color_when_it_counts_grayscale-guided_online_triggering_for_always-on_streaming_.md
!video_understanding/cowtracker_tracking_by_warping_instead_of_correlation.md
!video_understanding/cva_context-aware_video-text_alignment_for_video_temporal_grounding.md
!video_understanding/d2fanet_enhancing_video_object_detection_with_dual-domain_feature_aggregation_ne.md
!video_understanding/darkact_a_rgb-thermal_dataset_and_fusion_framework_for_multimodal_low-light_acti.md
!video_understanding/darkshake-dvs_event-based_human_action_recognition_under_low-light_and_shaking_c.md
!video_understanding/dervos_decoupling_consistent_trajectory_generation_and_multimodal_understanding_.md
!video_understanding/detach_decomposed_spatio-temporal_alignment_for_exocentric_video_and_ambient_sen.md
!video_understanding/divide_then_ground_adapting_frame_selection_to_query_types_for_long-form_video_u.md
!video_understanding/do_you_see_what_i_am_pointing_at_gesture-based_egocentric_video_question_answeri.md
!video_understanding/drift-resilient_temporal_priors_for_visual_tracking.md
!video_understanding/dual-agent_reinforcement_learning_for_adaptive_and_cost-aware_visual-inertial_od.md
!video_understanding/dynamics_language-based_representation_for_inferring_rigid-body_dynamics_from_vi.md
!video_understanding/earlytom_early_token_compression_completes_fast_video_understanding.md
!video_understanding/efficient_all-pairs_correlation_volume_sampling_for_optical_flow_estimation.md
!video_understanding/efficient_frame_selection_for_long_video_understanding_via_reinforcement_learnin.md
!video_understanding/ego-grounding_for_personalized_question-answering_in_egocentric_videos.md
!video_understanding/egoxtreme_a_dataset_for_robust_object_pose_estimation_in_egocentric_views_under_.md
!video_understanding/elv-halluc_benchmarking_semantic_aggregation_hallucinations_in_video_understandi.md
!video_understanding/enhancing_accuracy_of_uncertainty_estimation_in_appearance-based_gaze_tracking_w.md
!video_understanding/enhancing_video_vision_language_model_with_hippocampal_sensing.md
!video_understanding/envisioning_the_future_one_step_at_a_time.md
!video_understanding/ethoclip_ontology-enhanced_video-language_pretraining_for_animal_behavior_unders.md
!video_understanding/evatok_adaptive_length_video_tokenization_for_eff.md
!video_understanding/event6d_event-based_novel_object_6d_pose_tracking.md
!video_understanding/exploring_adaptive_masked_reconstruction_for_self-supervised_skeleton-based_acti.md
!video_understanding/fine-vad_towards_fine-grained_video_anomaly_detection_via_progressive_cross-gran.md
!video_understanding/first_frame_is_the_place_to_go_for_video_content_customization.md
!video_understanding/flashmotion_fewstep_controllable_video_generation.md
!video_understanding/flexivideo_variation-aware_temporal_dynamics_modeling_for_efficient_video_unders.md
!video_understanding/flowfm_advancing_dark_optical_flow_estimation_with_flow_matching.md
!video_understanding/fluxmem_adaptive_hierarchical_memory_for_streaming_video_understanding.md
!video_understanding/fps-bench_a_benchmark_for_high_frame-rate_video_understanding.md
!video_understanding/frame2freq_spectral_adapters_for_fine-grained_video_understanding.md
!video_understanding/from_contrast_to_consistency_rethinking_event-based_continuous-time_optical_flow.md
!video_understanding/gamba_mamba-based_graph_convolutional_network_with_dynamic_graph_topology_learni.md
!video_understanding/generative_point_tracking_and_forecasting.md
!video_understanding/gift_global_irreplaceability_frame_targeting_for_efficient_video_understanding.md
!video_understanding/gloria_consistent_character_video_generation_via_content_anchors.md
!video_understanding/goal_force_teaching_video_models_to_accomplish_physics-conditioned_goals.md
!video_understanding/hear_what_matters_text-conditioned_selective_video-to-audio_generation.md
!video_understanding/herbench_a_benchmark_for_multi-evidence_integration_in_video_question_answering.md
!video_understanding/hero_hierarchical_embedding-refinement_for_open-vocabulary_temporal_sentence_gro.md
!video_understanding/hieramamba_video_temporal_grounding_via_hierarchical_anchor-mamba_pooling.md
!video_understanding/hierarchical_action_learning_for_weakly-supervised_action_segmentation.md
!video_understanding/hypergraph-state_collaborative_reasoning_for_multi-object_tracking.md
!video_understanding/image_guides_images_consistent_video_amodal_completion_with_rectified_in-context.md
!video_understanding/interactive_tracking_a_human-in-the-loop_paradigm_with_memory-augmented_adaptati.md
!video_understanding/internvideo-next_towards_world-understanding_video_models.md
!video_understanding/interrvos_interaction-aware_referring_video_object_segmentation.md
!video_understanding/joint_learning_of_general_and_diverse_patterns_with_mixture_of_memory_experts_fo.md
!video_understanding/lady_lagrangian-dynamic_informed_network_for_skeleton-based_action_segmentation_.md
!video_understanding/laof_robust_latent_action_learning_with_optical_flow_constraints.md
!video_understanding/learnable_motion-focused_tokenization_for_effective_and_efficient_video_unsuperv.md
!video_understanding/learning_from_noisy_supervision_a_denoising-debiasing_framework_for_weakly_super.md
!video_understanding/learning_from_synthetic_data_via_provenance-based_input_gradient_guidance.md
!video_understanding/learning_to_assist_physics-grounded_human-human_control_via_multi-agent_reinforc.md
!video_understanding/learning_to_refuse_refusal-aware_reinforcement_fine-tuning_for_hard-irrelevant_q.md
!video_understanding/lenswalk_agentic_video_understanding_by_planning_how_you_see_in_videos.md
!video_understanding/long-rvos_a_comprehensive_benchmark_for_long-term_referring_video_object_segment.md
!video_understanding/longvideo-r1_smart_navigation_for_low-cost_long_video_understanding.md
!video_understanding/m4-sam_multi-modal_mixture-of-experts_with_memory-augmented_sam_for_rgb-d_video_.md
!video_understanding/ma-bench_towards_fine-grained_micro-action_understanding.md
!video_understanding/maskadapt_learning_flexible_motion_adaptation_via_mask-invariant_prior_for_physi.md
!video_understanding/matching_every_pair_to_track_every_point_pairformer_for_all-pairs_tracking_and_v.md
!video_understanding/mds-vqa_model-informed_data_selection_for_video_quality_assessment.md
!video_understanding/memory_matters_boosting_training-free_zero-shot_temporal_action_localization_wit.md
!video_understanding/mer-tracker_towards_high-speed_3d_point_tracking_via_multi-view_event-rgb_hybrid.md
!video_understanding/meta_meta_evolution_of_tool_trajectory_adaptation_for_long-video_understanding.md
!video_understanding/minerva-ego_spatiotemporal_hints_for_egocentric_video_understanding.md
!video_understanding/mistake_attribution_fine-grained_mistake_understanding_in_egocentric_videos.md
!video_understanding/motionenhancer_leveraging_video_diffusion_for_motion-enhanced_vision-language_mo.md
!video_understanding/movie_broaden_your_views_with_human_motion_for_action_detection.md
!video_understanding/movierecapsqa_a_multimodal_open-ended_video_question-answering_benchmark.md
!video_understanding/mpl_match-guided_prototype_learning_for_few-shot_action_recognition.md
!video_understanding/ms-temba_multi-scale_temporal_mamba_for_understanding_long_untrimmed_videos.md
!video_understanding/mukv_multi-grained_kv_cache_compression_for_long_streaming_video_question-answer.md
!video_understanding/mv-tap_tracking_any_point_in_multi-view_videos.md
!video_understanding/neural-centric_video_processing_pipeline_for_unified_multi-task_inference.md
!video_understanding/no_need_for_real_anomaly_mllm_empowered_zero-shot_video_anomaly_detection.md
!video_understanding/occlusion-aware_sort_observing_occlusion_for_robust_multi-object_tracking.md
!video_understanding/omniground_a_comprehensive_spatio-temporal_grounding_benchmark_for_real-world_co.md
!video_understanding/omnivtg_a_large-scale_dataset_and_training_paradigm_for_open-world_video_tempora.md
!video_understanding/one-shot_flow_any-time_frame_a_bidirectional_warping_framework_for_event-based_v.md
!video_understanding/openmarcie_dataset_for_multimodal_action_recognition_in_industrial_environments.md
!video_understanding/out_of_sight_out_of_track_adversarial_attacks_on_propagation-based_multi-object_.md
!video_understanding/polyphony_diffusion-based_dual-hand_action_segmentation_with_alternating_vision_.md
!video_understanding/progressive_cross-modal_causal_intervention_for_long-term_action_recognition.md
!video_understanding/progressive_multi-cue_alignment_for_unaligned_rgbt_tracking.md
!video_understanding/progtrack_a_multi-object_tracking_algorithm_with_progressive_matching_strategy.md
!video_understanding/pyratok_language-aligned_pyramidal_tokenizer_for_video_understanding_and_generat.md
!video_understanding/question-guided_visual_compression_with_memory_feedback_for_long-term_video_unde.md
!video_understanding/ragtrack_language-aware_rgbt_tracking_with_retrieval-augmented_generation.md
!video_understanding/realworld_point_tracking_with_verifierguided_pseud.md
!video_understanding/reconstruction-guided_slot_curriculum_addressing_object_over-fragmentation_in_vi.md
!video_understanding/rethinking_occlusion_modeling_for_uav_tracking.md
!video_understanding/rethinking_two-stage_referring-by-tracking_in_referring_multi-object_tracking_ma.md
!video_understanding/robust_promptable_video_object_segmentation.md
!video_understanding/sail_similarity-aware_guidance_and_inter-caption_augmentation-based_learning_for.md
!video_understanding/sam2text_towards_prompt-free_and_multi-resolution_video_scene_text_segmentation.md
!video_understanding/sarl-stg_a_spatially_aware_reinforcement_learning_framework_for_refining_mllms_i.md
!video_understanding/savax_egotoexo_imitation_error_detection_via_scene.md
!video_understanding/scene-centric_unsupervised_video_panoptic_segmentation.md
!video_understanding/sdtrack_a_baseline_for_event-based_tracking_via_spiking_neural_networks.md
!video_understanding/season_mitigating_temporal_hallucination_in_video_large_language_models_via_self.md
!video_understanding/seeing_beyond_8bits_subjective_and_objective_quality_assessment_of_hdr-ugc_video.md
!video_understanding/seeing_conversations_communication_context_identification_in_egocentric_video.md
!video_understanding/seeing_motion_through_polarity_for_event-based_action_recognition.md
!video_understanding/seeing_the_scene_matters_revealing_forgetting_in_video_understanding_models_with.md
!video_understanding/self-paced_and_self-corrective_masked_prediction_for_movie_trailer_generation.md
!video_understanding/shands_a_multi-view_dataset_and_benchmark_for_surgical_hand-gesture_and_error_re.md
!video_understanding/show3d_capturing_scenes_of_3d_hands_and_objects_in_the_wild.md
!video_understanding/skeletoncontext_skeleton-side_context_prompt_learning_for_zero-shot_skeleton-bas.md
!video_understanding/skillsight_efficient_first-person_skill_assessment_with_gaze.md
!video_understanding/smv-ear_bring_spatiotemporal_multi-view_representation_learning_into_efficient_e.md
!video_understanding/soccermaster_a_vision_foundation_model_for_soccer_understanding.md
!video_understanding/spatio-temporal_conditional_denoising_transformer_for_modality-missing_rgbt_trac.md
!video_understanding/spectral_scalpel_amplifying_adjacent_action_discrepancy_via_frequency-selective_.md
!video_understanding/spiketrack_a_spike-driven_framework_for_efficient_visual_tracking.md
!video_understanding/spiketrack_high-performance_and_energy-efficient_event-based_object_tracking_wit.md
!video_understanding/spot_spatiotemporal_prompt_optimization_for_motion-stabilized_mllm-guided_video_.md
!video_understanding/stay_in_your_lane_role_specific_queries_with_overlap_suppression_loss_for_dense_.md
!video_understanding/stitch-a-demo_creating_video_demonstrations_from_multistep_descriptions.md
!video_understanding/streamingtom_streaming_token_compression_for_efficient_video_understanding.md
!video_understanding/streamrag_enhancing_real-time_video_understanding_with_retrieval_augmentation.md
!video_understanding/streamready_learning_what_to_answer_and_when_in_long_streaming_videos.md
!video_understanding/svagent_storyline_guided_long_video_understanding_via_cross_modal_multi_agent_collaboration.md
!video_understanding/t2sgrid_temporal-to-spatial_gridification_for_video_temporal_grounding.md
!video_understanding/tacsim_a_dataset_and_benchmark_for_football_tactical_style_imitation.md
!video_understanding/tcei_test_time_calibration_experience_intuition_mot.md
!video_understanding/tf-cade_foreground-concentrated_text-video_alignment_for_zero-shot_temporal_acti.md
!video_understanding/tgtrack_temporal_generative_learning_for_unified_single_object_tracking.md
!video_understanding/the_road_less_seen_segment_exploration_for_weakly_supervised_video_anomaly_detec.md
!video_understanding/time_blindness_why_video-language_models_cant_see_what_humans_can.md
!video_understanding/timebridge_self-supervised_video_representation_learning_via_start-end_joint_emb.md
!video_understanding/tlma_mitigating_the_impact_of_weakly_labeled_information_for_video_anomaly_detec.md
!video_understanding/token_reduction_via_local_and_global_contexts_optimization_for_efficient_video_l.md
!video_understanding/toward_low-cost_yet_effective_temporal_learning_for_uav_tracking.md
!video_understanding/towards_streaming_referring_video_segmentation_via_large_language_model.md
!video_understanding/tracking_through_severe_occlusion_via_event-derived_transient_cues.md
!video_understanding/trajtok_learning_trajectory_tokens_enables_better_video_understanding.md
!video_understanding/ttapformer_robust_arbitrary_point_tracking_via_transient_asynchronous_fusion_of_.md
!video_understanding/tvhighlights_llm-guided_human-free_collaborative_training_for_video_highlight_de.md
!video_understanding/u2flow_uncertainty_aware_unsupervised_optical_flow_estimation.md
!video_understanding/uetrack_a_unified_and_efficient_framework_for_single_object_tracking.md
!video_understanding/ufvideo_towards_unified_fine-grained_video_cooperative_understanding_with_large_.md
!video_understanding/understanding_temporal_logic_consistency_in_video-language_models_through_cross-.md
!video_understanding/unified_spatiotemporal_token_compression_for_video-llms_at_ultra-low_retention.md
!video_understanding/univbench_towards_unified_evaluation_for_video_foundation_models.md
!video_understanding/unstitching_the_chimera_frame-level_risk_and_train-free_mitigation_for_video_hal.md
!video_understanding/utptrack_towards_simple_and_unified_token_pruning_for_visual_tracking.md
!video_understanding/vecattention_vector-wise_sparse_attention_for_accelerating_long_context_inferenc.md
!video_understanding/video_panels_for_long_video_understanding.md
!video_understanding/videochatm1_collaborative_policy_planning_for_vide.md
!video_understanding/videoitg_multimodal_video_understanding_with_instructed_temporal_grounding.md
!video_understanding/videonet_a_large-scale_dataset_for_domain-specific_action_recognition.md
!video_understanding/videoseek_long-horizon_video_agent_with_tool-guided_seeking.md
!video_understanding/vidprism_heterogeneous_mixture_of_experts_for_image-to-video_transfer.md
!video_understanding/virtuebench_evaluating_trustworthiness_under_uncertainty_in_long_video_understan.md
!video_understanding/wavelet-based_frame_selection_by_detecting_semantic_boundary_for_long_video_unde.md
!video_understanding/weakly_supervised_video_anomaly_detection_with_anomaly-connected_components_and_.md
!video_understanding/worldmm_dynamic_multimodal_memory_agent_for_long_video_reasoning.md
!video_understanding/your_one-stop_solution_for_ai-generated_video_detection.md
!vlm_efficiency/accelerating_streaming_video_large_language_models_via_hierarchical_token_compre.md
!vlm_efficiency/adapting_lightweight_image-based_counting_models_for_video_crowd_counting.md
!vlm_efficiency/adaptvision_efficient_vision-language_models_via_adaptive_visual_acquisition.md
!vlm_efficiency/apet_approximation-error_guided_token_compression_for_efficient_vlms.md
!vlm_efficiency/attention-aware_inference_optimizations_for_large_vision-language_models_with_me.md
!vlm_efficiency/better_stronger_faster_tackling_the_trilemma_in_mllm-based_segmentation_with_sim.md
!vlm_efficiency/blink_dynamic_visual_token_resolution_for_enhanced_multimodal_understanding.md
!vlm_efficiency/co-me_confidence_guided_token_merging_for_visual_geometric_transformers.md
!vlm_efficiency/coin_coverage_and_informativeness-guided_token_reduction_for_efficient_large_mul.md
!vlm_efficiency/core_compact_object-centric_representations_as_a_new_paradigm_for_token_merging_.md
!vlm_efficiency/curvature-aware_zeroth-order_optimization_for_memory-efficient_test-time_adaptat.md
!vlm_efficiency/differentiable_vector_quantization_for_rate-distortion_optimization_of_generativ.md
!vlm_efficiency/docpruneefficient_document_question_answering_via_background_question_and_compre.md
!vlm_efficiency/duet-vlm_dual_stage_unified_efficient_token_reduction_for_vlm_training_and_infer.md
!vlm_efficiency/dynamic_token_reweighting_for_robust_vision-language_models.md
!vlm_efficiency/evocomp_learning_visual_token_compression_for_multimodal_large_language_models_v.md
!vlm_efficiency/fine-grained_post-training_quantization_for_large_vision_language_models_with_qu.md
!vlm_efficiency/flashcache_frequency_kv_cache_compression.md
!vlm_efficiency/focusui_efficient_ui_grounding_via_position-preserving_visual_token_selection.md
!vlm_efficiency/groundvts_visual_token_sampling_in_multimodal_large_language_models_for_video_te.md
!vlm_efficiency/hawk_head_importance-aware_visual_token_pruning_in_multimodal_models.md
!vlm_efficiency/hi-lo_prune_look_at_what_youll_lose_before_pruning_with_hierarchical_token_selec.md
!vlm_efficiency/httm_head-wise_temporal_token_merging_for_faster_vggt.md
!vlm_efficiency/hybrid_token_compression_for_vision-language_models.md
!vlm_efficiency/if-prune_information-flow_guided_token_pruning_for_efficient_vision-language_mod.md
!vlm_efficiency/lazyvar_accelerating_visual_autoregressive_models_via_scale-wise_token_pruning_a.md
!vlm_efficiency/lift_and_place_a_simple_stable_and_effective_knowledge_distillation_framework_fo.md
!vlm_efficiency/litevggt_boosting_vanilla_vggt_via_geometry-aware_cached_token_merging.md
!vlm_efficiency/ls-vit_least-squares_hessian_based_block_reconstruction_for_low-bit_post-trainin.md
!vlm_efficiency/masquant_modality-aware_smoothing_quantization_for_multimodal_large_language_mod.md
!vlm_efficiency/merge3d_efficient_3d_multimodal_llms_via_joint_2d-3d_token_merging.md
!vlm_efficiency/metom_metadata-guided_token_merging_for_efficient_video_llms.md
!vlm_efficiency/minicpm-v_45_cooking_efficient_mllms_via_architecture_data_and_training_recipe.md
!vlm_efficiency/mm-ser_multimodal_self-refinement_for_lightweight_image_captioning.md
!vlm_efficiency/modes_accelerating_mixture-of-experts_multimodal_large_language_models_via_dynam.md
!vlm_efficiency/nuwa_deriving_lightweight_class-specific_vision_transformers_for_edge_devices.md
!vlm_efficiency/omnizip_audio-guided_dynamic_token_compression_for_fast_omnimodal_large_language.md
!vlm_efficiency/omnizip_learning_a_unified_and_lightweight_lossless_compressor_for_multi-modal_d.md
!vlm_efficiency/one_layers_trash_is_another_layers_treasure_adaptive_layer-wise_visual_token_sel.md
!vlm_efficiency/prune2drive_a_plug-and-play_framework_for_accelerating_vision-language_models_in.md
!vlm_efficiency/ps-sr_pseudo-single-step_video_super-resolution_via_speculative_diffusion.md
!vlm_efficiency/quant_experts_token_aware_vlm_quantization.md
!vlm_efficiency/qvggt_post-training_quantized_visual_geometry_grounded_transformer.md
!vlm_efficiency/rethinking_asymmetric_quantization_hidden_symmetry_in_vision_model_weights.md
!vlm_efficiency/rethinking_token_reduction_for_large_vision-language_models.md
!vlm_efficiency/s2d_selective_spectral_decay_for_quantization-friendly_conditioning_of_neural_ac.md
!vlm_efficiency/saliency-driven_token_merging_for_vision_transformers.md
!vlm_efficiency/score_salience-coverage_reduction_for_vision_token_pruning_in_vision-language_mo.md
!vlm_efficiency/segmo_co-designing_content-aware_sparsity_and_locally-cohesive_segment_paralleli.md
!vlm_efficiency/soda_sensitivity-oriented_dynamic_acceleration_for_diffusion_transformer.md
!vlm_efficiency/timeviper_a_hybrid_mamba-transformer_vision-language_model_for_efficient_long_vi.md
!vlm_efficiency/transprune_token_transition_pruning_for_efficient_large_vision-language_model.md
!vlm_efficiency/unicompress_token_compression_for_unified_vision-language_understanding_and_gene.md
!vlm_efficiency/variation-aware_vision_token_dropping_for_faster_large_vision-language_models.md
!vlm_efficiency/vilearn_accelerating_training_convergence_of_image-to-3d_generation_via_visibili.md
!vlm_efficiency/vision-oriented_lightweight_neural_architecture_search_with_budget-adaptive_eval.md
!vlm_efficiency/vlm-pruner_buffering_for_spatial_sparsity_in_an_efficient_vlm_centrifugal_token_.md
!vlm_efficiency/vlm-ptq_efficient_post-training_quantization_for_large_vision-language_models.md
!vlm_efficiency/vqrae_representation_quantization_autoencoders_for_multimodal_understanding_gene.md
!vlm_efficiency/vvs_accelerating_speculative_decoding_for_visual_autoregressive_generation_via_p.md
!vlm_efficiency/what_do_visual_tokens_really_encode_uncovering_sparsity_and_redundancy_in_multim.md
!vlm_efficiency/when_token_pruning_is_worse_than_random_understanding_visual_token_information_i.md
!vlm_efficiency/zoo-prune_training-free_token_pruning_via_zeroth-order_gradient_estimation_in_vi.md
!vlm_reasoning/a_causal_marriage_between_vlm_and_irm_from_understanding_to_reasoning.md
!vlm_reasoning/a_multi-agent_perception-action_alliance_for_efficient_long_video_reasoning.md
!vlm_reasoning/act2see_emergent_active_visual_perception_for_video_reasoning.md
!vlm_reasoning/adversarial_style_optimization_enhancing_vlm_jailbreaks_by_grpo-based_stylistic_.md
!vlm_reasoning/agentic_video_summarization_via_self-reflecting_multimodal_understanding.md
!vlm_reasoning/all_roads_lead_to_rome_incentivizing_divergent_thinking_in_vision-language_model.md
!vlm_reasoning/ants_adaptive_negative_textual_space_shaping_for_ood_detection_via_test-time_mll.md
!vlm_reasoning/arm-thinker_reinforcing_multimodal_generative_reward_models_with_agentic_tool_us.md
!vlm_reasoning/av-reasoner_improving_and_benchmarking_clue-grounded_audio-visual_counting_for_m.md
!vlm_reasoning/axg-reasoner_error_detection_and_explanation_in_long_task_videos_with_vision-lan.md
!vlm_reasoning/beyond_3d_vqas_injecting_3d_spatial_priors_into_vision-language_models_for_enhan.md
!vlm_reasoning/beyond_multiple_choice_verifiable_openqa_for_robust_vision-language_rft.md
!vlm_reasoning/beyond_perceptual_shortcuts_causal-inspired_debiasing_optimization_for_generaliz.md
!vlm_reasoning/boosting_reasoning_in_large_multimodal_models_via_activation_replay.md
!vlm_reasoning/bop-ask_object-interaction_reasoning_for_vision-language_models.md
!vlm_reasoning/breaking_the_regional_perception_bottleneck_of_multimodal_large_language_models_.md
!vlm_reasoning/can_a_second-view_image_be_a_language_geometric_and_semantic_cross-modal_reasoni.md
!vlm_reasoning/care_what_fails_contrastive_anchored-reflection_for_verifiable_multimodal_reason.md
!vlm_reasoning/cast-bench_benchmarking_causal_chain-grounded_spatio-temporal_reasoning_for_vide.md
!vlm_reasoning/chain-of-frames_advancing_video_understanding_in_multimodal_llms_via_frame-aware.md
!vlm_reasoning/chain-of-thought_guided_multi-modal_object_re-identification.md
!vlm_reasoning/chart-fr1_visual_focus-driven_fine-grained_reasoning_on_dense_charts.md
!vlm_reasoning/chartr_evaluating_reasoning_accuracy_and_robustness_in_chart_question_answering.md
!vlm_reasoning/clivis_unleashing_cognitive_map_through_linguistic-visual_synergy_for_embodied_v.md
!vlm_reasoning/codedance_a_dynamic_tool-integrated_mllm_for_executable_visual_reasoning.md
!vlm_reasoning/codev_code_with_images_for_faithful_visual_reasoning_via_tool-aware_policy_optim.md
!vlm_reasoning/cogniverse_revolutionizing_multi-modal_retrieval-augmented_generation_with_cogni.md
!vlm_reasoning/compositional_transformation_reasoning_for_composed_video_retrieval.md
!vlm_reasoning/conan_progressive_learning_to_reason_like_a_detective_over_multi-scale_visual_ev.md
!vlm_reasoning/consensus_entropy_harnessing_multi-vlm_agreement_for_self-verifying_and_self-imp.md
!vlm_reasoning/cot-fm_cluster-wise_optimal_transport_flow_matching.md
!vlm_reasoning/crit_graph-based_automatic_data_synthesis_to_enhance_cross-modal_multi-hop_reaso.md
!vlm_reasoning/decompose_and_transfer_cot-prompting_enhanced_alignment_for_open-vocabulary_temp.md
!vlm_reasoning/decouple_to_generalize_context-first_self-evolving_learning_for_data-scarce_visi.md
!vlm_reasoning/deeper_thought_weaker_aim_understanding_and_mitigating_perceptual_impairment_dur.md
!vlm_reasoning/deepscan_a_training-free_framework_for_visually_grounded_reasoning_in_large_visi.md
!vlm_reasoning/discriminative_perception_via_anchored_description_for_reasoning_segmentation.md
!vlm_reasoning/dmllm-tts_self-verified_and_efficient_test-time_scaling_for_diffusion_multi-moda.md
!vlm_reasoning/docseeker_long_document_understanding.md
!vlm_reasoning/dont_show_pixels_show_cues_unlocking_visual_tool_reasoning_in_language_models_vi.md
!vlm_reasoning/downscaling_intelligence_exploring_perception_and_reasoning_bottlenecks_in_small.md
!vlm_reasoning/dr_seg_revisiting_grpo_training_for_visual_large_language_models_through_percept.md
!vlm_reasoning/edudiag_a_benchmark_for_educational_diagnostic_reasoning_with_error_tracing_and_.md
!vlm_reasoning/egomind_activating_spatial_cognition_through_linguistic_reasoning_in_mllms.md
!vlm_reasoning/egoprox_evaluating_mllms_on_egocentric_3d_proximity_reasoning_across_a_cognitive.md
!vlm_reasoning/eliciting_complex_spatial_reasoning_in_mllms_through_wide-baseline_matching.md
!vlm_reasoning/emo-r3_reflective_reinforcement_learning_for_emotional_reasoning_in_multimodal_l.md
!vlm_reasoning/emothinker_advancing_visual-acoustic_emotion_analysis_via_structural_token_selec.md
!vlm_reasoning/evolving_contextual_safety_in_multi-modal_large_language_models_via_inference-ti.md
!vlm_reasoning/fast_reasoning_segmentation_for_images_and_videos.md
!vlm_reasoning/from_exploration_to_exploitation_a_two-stage_entropy_rlvr_approach_for_noise-tol.md
!vlm_reasoning/from_indoor_to_open_world_revealing_the_spatial_reasoning_gap_in_mllms.md
!vlm_reasoning/fuel_gauge_estimating_chain-of-thought_length_ahead_of_time_in_large_multimodal_.md
!vlm_reasoning/g2vlm_geometry_grounded_vision_language_model_with_unified_3d_reconstruction_and.md
!vlm_reasoning/generate_analyze_and_refine_training-free_sound_source_localization_via_mllm_met.md
!vlm_reasoning/geoint-r1_formalizing_multimodal_geometric_reasoning_with_dynamic_auxiliary_cons.md
!vlm_reasoning/ggbench_a_geometric_generative_reasoning_benchmark_for_unified_multimodal_models.md
!vlm_reasoning/graph-to-frame_rag_visual-space_knowledge_fusion_for_training-free_and_auditable.md
!vlm_reasoning/grounded_chain-of-thought_for_multimodal_large_language_models.md
!vlm_reasoning/gthinker_towards_general_multimodal_reasoning_via_cue-guided_rethinking.md
!vlm_reasoning/handvqa_diagnosing_and_improving_fine-grained_spatial_reasoning_about_hands_in_v.md
!vlm_reasoning/hear_you_are_teaching_llms_spatial_reasoning_with_vision_and_spatial_sound.md
!vlm_reasoning/hierarchical_process_reward_models_are_symbolic_vision_learners.md
!vlm_reasoning/honeybee_data_recipes_for_vision-language_reasoners.md
!vlm_reasoning/improving_vision-language_models_with_perception-centric_process_reward_models.md
!vlm_reasoning/incentivizing_versatile_video_reasoning_in_mllms_via_data-efficient_reinforcemen.md
!vlm_reasoning/infinibench_infinite_benchmarking_for_visual_spatial_reasoning_with_customizable.md
!vlm_reasoning/ipr-1_interactive_physical_reasoner.md
!vlm_reasoning/keep_it_sympl_symbolic_projective_layout_for_allocentric_spatial_reasoning_in_vi.md
!vlm_reasoning/latent_implicit_visual_reasoning.md
!vlm_reasoning/learning_to_reason_in_4d_dynamic_spatial_understanding_for_vision_language_model.md
!vlm_reasoning/learning_transferable_temporal_primitives_for_video_reasoning_via_synthetic_vide.md
!vlm_reasoning/let_vlms_grade_their_own_thoughts_a_self-quantification_approach_to_reasoning-aw.md
!vlm_reasoning/longvt_incentivizing_thinking_with_long_videos_via_native_tool_calling.md
!vlm_reasoning/machine_mental_imagery_empower_multimodal_reasoning_with_latent_visual_tokens.md
!vlm_reasoning/mimic_human_cognition_master_multi-image_reasoning_a_meta-action_framework_for_e.md
!vlm_reasoning/mindpower_enabling_theoryofmind_reasoning_in_vlmba.md
!vlm_reasoning/minerva-cultural_a_benchmark_for_cultural_and_multilingual_long_video_reasoning.md
!vlm_reasoning/mmtit-bench_a_multilingual_and_multi-scenario_benchmark_with_cognition-perceptio.md
!vlm_reasoning/moe-grpo_optimizing_mixture-of-experts_via_reinforcement_learning_in_vision-lang.md
!vlm_reasoning/monet_reasoning_in_latent_visual_space_beyond_image_and_language.md
!vlm_reasoning/oasis_on-demand_hierarchical_event_memory_for_streaming_video_reasoning.md
!vlm_reasoning/onethinker_all-in-one_reasoning_model_for_image_and_video.md
!vlm_reasoning/openmmreasoner_pushing_the_frontiers_in_multimodal_reasoning_with_an_open_and_ge.md
!vlm_reasoning/ovod-agent_a_markov-bandit_framework_for_proactive_visual_reasoning_and_self-evo.md
!vlm_reasoning/pdcr_perception-decomposed_confidence_reward_for_vision-language_reasoning.md
!vlm_reasoning/perceptual-evidence_anchored_reinforced_learning_for_multimodal_reasoning.md
!vlm_reasoning/physisinone_visual_physics_learning_and_reasoning_in_one_suite.md
!vlm_reasoning/points-long_adaptive_dual-mode_visual_reasoning_in_mllms.md
!vlm_reasoning/pointthinker_point-incentivized_parallel_thinking_for_multimodal_large_language_.md
!vlm_reasoning/pop_proof_of_perception_conformal_reasoning.md
!vlm_reasoning/progress-think_semantic_progress_reasoning_for_vision-language_navigation.md
!vlm_reasoning/prototypical_action_reasoning_facilitated_by_vision-language_alignment_for_egoce.md
!vlm_reasoning/quantiphy_a_quantitative_benchmark_evaluating_physical_reasoning_abilities_of_vi.md
!vlm_reasoning/r-4b_incentivizing_general-purpose_auto-thinking_in_mllms_via_bi-mode_annealing_.md
!vlm_reasoning/r-c2_cycle-consistent_reinforcement_learning_improves_multimodal_reasoning.md
!vlm_reasoning/r4_retrieval-augmented_reasoning_for_vision-language_models_in_4d_spatio-tempora.md
!vlm_reasoning/reading_or_reasoning_format_decoupled_reinforcement_learning_for_document_ocr.md
!vlm_reasoning/reagen_adaptive_generation_of_structured_chains-of-thought_for_efficient_multimo.md
!vlm_reasoning/realign_generalizable_image_forgery_detection_via_reasoning-aligned_representati.md
!vlm_reasoning/reasonmap_towards_fine-grained_visual_reasoning_from_transit_maps.md
!vlm_reasoning/reinforce_to_learn_elect_to_reason_a_dual_paradigm_for_video_reasoning.md
!vlm_reasoning/reinforcing_structured_chain-of-thought_for_video_understanding.md
!vlm_reasoning/reinforcing_video_object_segmentation_to_think_before_it_segments.md
!vlm_reasoning/revisor_beyond_textual_reflection_towards_multimodal_introspective_reasoning_in_.md
!vlm_reasoning/rmir_a_benchmark_dataset_for_reasoning-intensive_multimodal_image_retrieval.md
!vlm_reasoning/scaling_test-time_robustness_of_vision-language_models_via_self-critical_inferen.md
!vlm_reasoning/see_further_think_deeper_advancing_vlms_reasoning_ability_with_low-level_visual_.md
!vlm_reasoning/see_less_see_right_bi-directional_perceptual_shaping_for_multimodal_reasoning.md
!vlm_reasoning/see_think_act_teaching_multimodal_agents_to_effectively_interact_with_gui_by_ide.md
!vlm_reasoning/seeing_clearly_reasoning_confidently_plug-and-play_remedies_for_vision_language_.md
!vlm_reasoning/seeing_what_matters_a_training-free_self-guided_framework_for_multimodal_detail_.md
!vlm_reasoning/segcompass_exploring_interpretable_alignment_with_sparse_autoencoders_for_enhanc.md
!vlm_reasoning/select_less_reason_more_prioritizing_evidence_purity_for_video_reasoning.md
!vlm_reasoning/self-consistency_for_llm-based_motion_trajectory_generation_and_verification.md
!vlm_reasoning/self-critical_distillation_network_for_video-based_commonsense_captioning.md
!vlm_reasoning/spacetools_tool-augmented_spatial_reasoning_via_double_interactive_rl.md
!vlm_reasoning/spatialqa_a_benchmark_for_evaluating_spatial_logical_reasoning_in_vision-languag.md
!vlm_reasoning/spatialstack_layered_geometry-language_fusion_for_3d_vlm_spatial_reasoning.md
!vlm_reasoning/stable_and_efficient_single-rollout_rl_for_multimodal_reasoning.md
!vlm_reasoning/star-kvqa_structured_reasoning_traces_for_implicit-knowledge_visual_question_ans.md
!vlm_reasoning/star-r1_multi-view_spatial_transformation_reasoning_by_reinforcing_multimodal_ll.md
!vlm_reasoning/streaming_video_crime_anticipation_with_spatio-temporal_causal_reasoning.md
!vlm_reasoning/tablemix_enhancing_multimodal_table_reasoning_in_mllms_from_a_data-centric_persp.md
!vlm_reasoning/terrascope_pixel-grounded_visual_reasoning_for_earth_observation.md
!vlm_reasoning/think_360_evaluating_the_width-centric_reasoning_capability_of_mllms_beyond_dept.md
!vlm_reasoning/think_visually_reason_textually_vision-language_synergy_in_abstract_reasoning.md
!vlm_reasoning/think_with_3d_geometric_imagination_grounded_spatial_reasoning_from_limited_view.md
!vlm_reasoning/thinking_beyond_labels_vocabulary-free_fine-grained_recognition_using_reasoning-.md
!vlm_reasoning/thinking_diffusion_penalize_and_guide_visual-grounded_reasoning_in_diffusion_mul.md
!vlm_reasoning/thinking_in_360deg_humanoid_visual_search_in_the_wild.md
!vlm_reasoning/thinking_in_dynamics_how_multimodal_large_language_models_perceive_track_and_rea.md
!vlm_reasoning/thinking_with_drafts_speculative_temporal_reasoning_for_efficient_long_video_und.md
!vlm_reasoning/thinking_with_programming_vision_towards_a_unified_view_for_thinking_with_images.md
!vlm_reasoning/thinking_with_videos_multimodal_tool-augmented_reinforcement_learning_for_long_v.md
!vlm_reasoning/towards_sparse_video_understanding_and_reasoning.md
!vlm_reasoning/unified_generation_and_self-verification_for_vision-language_models_via_advantag.md
!vlm_reasoning/unit_unified_multimodal_chain-of-thought_test-time_scaling.md
!vlm_reasoning/vast_video_ability-stratified_taxonomy_for_data-efficient_video_reasoning.md
!vlm_reasoning/vgent_visual_grounding_via_modular_design_for_disentangling_reasoning_and_predic.md
!vlm_reasoning/videoarm_agentic_reasoning_over_hierarchical_memory_for_long-form_video_understa.md
!vlm_reasoning/videoauto-r1_video_auto_reasoning_via_thinking_once_answering_twice.md
!vlm_reasoning/virc_enhancing_visual_interleaved_mathematical_cot_with_reason_chunking.md
!vlm_reasoning/visionleaf_entropy-guided_leaf-first_reasoning_for_efficient_and_accurate_think-.md
!vlm_reasoning/visres_bench_on_evaluating_the_visual_reasoning_capabilities_of_vlms.md
!vlm_reasoning/visual-aware_cot_achieving_high-fidelity_visual_consistency_in_unified_models.md
!vlm_reasoning/vold_reasoning_transfer_from_llms_to_vision-language_models_via_on-policy_distil.md
!vlm_reasoning/vrr-qa_visual_relational_reasoning_in_videos_beyond_explicit_cues.md
!vlm_reasoning/when_to_think_and_when_to_look_uncertainty-guided_lookback.md
!vlm_reasoning/when_visualizing_is_the_first_step_to_reasoning_mira_a_benchmark_for_visual_chai.md
