PyPI - transformers - Versions diffs - 5.0.0rc1__py3-none-any.whl → 5.0.0rc3__py3-none-any.whl - Mend

transformers 5.0.0rc1py3-none-any.whl → 5.0.0rc3py3-none-any.whl

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.

Files changed (1584) hide show

transformers/__init__.py +27 -27
transformers/activations.py +1 -1
transformers/audio_utils.py +32 -33
transformers/cache_utils.py +32 -139
transformers/cli/chat.py +3 -3
transformers/cli/serve.py +2 -2
transformers/cli/transformers.py +2 -1
transformers/configuration_utils.py +143 -101
transformers/conversion_mapping.py +73 -6
transformers/convert_slow_tokenizer.py +3 -8
transformers/core_model_loading.py +215 -50
transformers/data/processors/glue.py +0 -1
transformers/data/processors/utils.py +0 -1
transformers/data/processors/xnli.py +0 -1
transformers/dependency_versions_table.py +5 -5
transformers/distributed/configuration_utils.py +1 -2
transformers/dynamic_module_utils.py +23 -23
transformers/feature_extraction_sequence_utils.py +19 -23
transformers/feature_extraction_utils.py +63 -31
transformers/generation/candidate_generator.py +80 -33
transformers/generation/configuration_utils.py +186 -131
transformers/generation/continuous_batching/__init__.py +0 -1
transformers/generation/continuous_batching/cache.py +81 -24
transformers/generation/continuous_batching/cache_manager.py +155 -45
transformers/generation/continuous_batching/continuous_api.py +152 -84
transformers/generation/continuous_batching/requests.py +51 -3
transformers/generation/continuous_batching/scheduler.py +127 -52
transformers/generation/logits_process.py +0 -128
transformers/generation/stopping_criteria.py +1 -1
transformers/generation/streamers.py +0 -1
transformers/generation/utils.py +107 -119
transformers/generation/watermarking.py +8 -6
transformers/hf_argparser.py +9 -13
transformers/hyperparameter_search.py +1 -2
transformers/image_processing_base.py +11 -21
transformers/image_processing_utils.py +11 -12
transformers/image_processing_utils_fast.py +68 -57
transformers/image_transforms.py +29 -29
transformers/image_utils.py +30 -32
transformers/initialization.py +37 -0
transformers/integrations/__init__.py +12 -0
transformers/integrations/accelerate.py +44 -111
transformers/integrations/aqlm.py +3 -5
transformers/integrations/awq.py +3 -8
transformers/integrations/bitnet.py +5 -8
transformers/integrations/bitsandbytes.py +16 -15
transformers/integrations/deepspeed.py +19 -4
transformers/integrations/eetq.py +3 -6
transformers/integrations/fbgemm_fp8.py +2 -3
transformers/integrations/finegrained_fp8.py +14 -23
transformers/integrations/flash_attention.py +2 -2
transformers/integrations/flex_attention.py +1 -1
transformers/integrations/fp_quant.py +4 -6
transformers/integrations/ggml.py +0 -1
transformers/integrations/higgs.py +2 -5
transformers/integrations/hub_kernels.py +23 -5
transformers/integrations/integration_utils.py +37 -3
transformers/integrations/mistral.py +12 -0
transformers/integrations/moe.py +240 -0
transformers/integrations/mxfp4.py +9 -16
transformers/integrations/peft.py +5 -0
transformers/integrations/quanto.py +5 -2
transformers/integrations/quark.py +2 -4
transformers/integrations/spqr.py +3 -5
transformers/integrations/tensor_parallel.py +167 -221
transformers/integrations/torchao.py +4 -6
transformers/integrations/vptq.py +3 -5
transformers/loss/loss_lw_detr.py +356 -0
transformers/loss/loss_utils.py +2 -0
transformers/masking_utils.py +47 -51
transformers/model_debugging_utils.py +4 -5
transformers/modelcard.py +14 -192
transformers/modeling_attn_mask_utils.py +19 -19
transformers/modeling_flash_attention_utils.py +27 -27
transformers/modeling_gguf_pytorch_utils.py +71 -24
transformers/modeling_layers.py +21 -22
transformers/modeling_outputs.py +242 -253
transformers/modeling_rope_utils.py +110 -113
transformers/modeling_utils.py +633 -576
transformers/models/__init__.py +23 -0
transformers/models/afmoe/configuration_afmoe.py +26 -29
transformers/models/afmoe/modeling_afmoe.py +37 -49
transformers/models/afmoe/modular_afmoe.py +21 -31
transformers/models/aimv2/configuration_aimv2.py +2 -5
transformers/models/aimv2/modeling_aimv2.py +24 -21
transformers/models/aimv2/modular_aimv2.py +11 -9
transformers/models/albert/configuration_albert.py +0 -1
transformers/models/albert/modeling_albert.py +70 -69
transformers/models/albert/tokenization_albert.py +1 -4
transformers/models/align/configuration_align.py +0 -1
transformers/models/align/modeling_align.py +73 -68
transformers/models/align/processing_align.py +2 -30
transformers/models/altclip/configuration_altclip.py +0 -1
transformers/models/altclip/modeling_altclip.py +83 -80
transformers/models/altclip/processing_altclip.py +2 -15
transformers/models/apertus/__init__.py +0 -1
transformers/models/apertus/configuration_apertus.py +18 -21
transformers/models/apertus/modeling_apertus.py +35 -36
transformers/models/apertus/modular_apertus.py +32 -31
transformers/models/arcee/configuration_arcee.py +20 -23
transformers/models/arcee/modeling_arcee.py +32 -35
transformers/models/arcee/modular_arcee.py +20 -23
transformers/models/aria/configuration_aria.py +20 -23
transformers/models/aria/image_processing_aria.py +25 -27
transformers/models/aria/modeling_aria.py +71 -70
transformers/models/aria/modular_aria.py +85 -88
transformers/models/aria/processing_aria.py +28 -35
transformers/models/audio_spectrogram_transformer/configuration_audio_spectrogram_transformer.py +0 -1
transformers/models/audio_spectrogram_transformer/feature_extraction_audio_spectrogram_transformer.py +3 -6
transformers/models/audio_spectrogram_transformer/modeling_audio_spectrogram_transformer.py +6 -8
transformers/models/audioflamingo3/__init__.py +0 -1
transformers/models/audioflamingo3/configuration_audioflamingo3.py +0 -1
transformers/models/audioflamingo3/modeling_audioflamingo3.py +22 -23
transformers/models/audioflamingo3/modular_audioflamingo3.py +12 -17
transformers/models/audioflamingo3/processing_audioflamingo3.py +33 -30
transformers/models/auto/auto_factory.py +5 -6
transformers/models/auto/configuration_auto.py +53 -5
transformers/models/auto/feature_extraction_auto.py +12 -10
transformers/models/auto/image_processing_auto.py +17 -28
transformers/models/auto/modeling_auto.py +38 -188
transformers/models/auto/processing_auto.py +6 -1
transformers/models/auto/tokenization_auto.py +147 -169
transformers/models/auto/video_processing_auto.py +12 -10
transformers/models/autoformer/configuration_autoformer.py +4 -7
transformers/models/autoformer/modeling_autoformer.py +98 -100
transformers/models/aya_vision/configuration_aya_vision.py +0 -1
transformers/models/aya_vision/modeling_aya_vision.py +42 -40
transformers/models/aya_vision/modular_aya_vision.py +26 -29
transformers/models/aya_vision/processing_aya_vision.py +25 -53
transformers/models/bamba/configuration_bamba.py +29 -32
transformers/models/bamba/modeling_bamba.py +78 -83
transformers/models/bamba/modular_bamba.py +68 -71
transformers/models/bark/configuration_bark.py +4 -7
transformers/models/bark/generation_configuration_bark.py +3 -5
transformers/models/bark/modeling_bark.py +49 -55
transformers/models/bark/processing_bark.py +19 -41
transformers/models/bart/configuration_bart.py +0 -2
transformers/models/bart/modeling_bart.py +122 -117
transformers/models/barthez/tokenization_barthez.py +1 -4
transformers/models/bartpho/tokenization_bartpho.py +6 -7
transformers/models/beit/configuration_beit.py +0 -11
transformers/models/beit/image_processing_beit.py +53 -56
transformers/models/beit/image_processing_beit_fast.py +8 -10
transformers/models/beit/modeling_beit.py +51 -53
transformers/models/bert/configuration_bert.py +0 -1
transformers/models/bert/modeling_bert.py +114 -122
transformers/models/bert/tokenization_bert.py +2 -4
transformers/models/bert/tokenization_bert_legacy.py +3 -5
transformers/models/bert_generation/configuration_bert_generation.py +0 -1
transformers/models/bert_generation/modeling_bert_generation.py +49 -49
transformers/models/bert_generation/tokenization_bert_generation.py +2 -3
transformers/models/bert_japanese/tokenization_bert_japanese.py +5 -6
transformers/models/bertweet/tokenization_bertweet.py +1 -3
transformers/models/big_bird/configuration_big_bird.py +0 -1
transformers/models/big_bird/modeling_big_bird.py +110 -109
transformers/models/big_bird/tokenization_big_bird.py +1 -4
transformers/models/bigbird_pegasus/configuration_bigbird_pegasus.py +0 -1
transformers/models/bigbird_pegasus/modeling_bigbird_pegasus.py +116 -111
transformers/models/biogpt/configuration_biogpt.py +0 -1
transformers/models/biogpt/modeling_biogpt.py +69 -71
transformers/models/biogpt/modular_biogpt.py +59 -61
transformers/models/biogpt/tokenization_biogpt.py +3 -5
transformers/models/bit/configuration_bit.py +0 -1
transformers/models/bit/image_processing_bit.py +21 -24
transformers/models/bit/image_processing_bit_fast.py +0 -1
transformers/models/bit/modeling_bit.py +14 -12
transformers/models/bitnet/configuration_bitnet.py +18 -21
transformers/models/bitnet/modeling_bitnet.py +32 -35
transformers/models/bitnet/modular_bitnet.py +4 -6
transformers/models/blenderbot/configuration_blenderbot.py +0 -1
transformers/models/blenderbot/modeling_blenderbot.py +71 -95
transformers/models/blenderbot/tokenization_blenderbot.py +6 -8
transformers/models/blenderbot_small/configuration_blenderbot_small.py +0 -1
transformers/models/blenderbot_small/modeling_blenderbot_small.py +73 -68
transformers/models/blenderbot_small/tokenization_blenderbot_small.py +1 -3
transformers/models/blip/configuration_blip.py +0 -1
transformers/models/blip/image_processing_blip.py +17 -20
transformers/models/blip/image_processing_blip_fast.py +0 -1
transformers/models/blip/modeling_blip.py +62 -71
transformers/models/blip/modeling_blip_text.py +71 -65
transformers/models/blip/processing_blip.py +5 -36
transformers/models/blip_2/configuration_blip_2.py +0 -1
transformers/models/blip_2/modeling_blip_2.py +72 -71
transformers/models/blip_2/processing_blip_2.py +8 -38
transformers/models/bloom/configuration_bloom.py +0 -1
transformers/models/bloom/modeling_bloom.py +71 -103
transformers/models/blt/configuration_blt.py +71 -74
transformers/models/blt/modeling_blt.py +235 -78
transformers/models/blt/modular_blt.py +225 -62
transformers/models/bridgetower/configuration_bridgetower.py +0 -1
transformers/models/bridgetower/image_processing_bridgetower.py +34 -35
transformers/models/bridgetower/image_processing_bridgetower_fast.py +7 -10
transformers/models/bridgetower/modeling_bridgetower.py +113 -109
transformers/models/bridgetower/processing_bridgetower.py +2 -16
transformers/models/bros/configuration_bros.py +0 -1
transformers/models/bros/modeling_bros.py +86 -80
transformers/models/bros/processing_bros.py +2 -12
transformers/models/byt5/tokenization_byt5.py +4 -6
transformers/models/camembert/configuration_camembert.py +0 -1
transformers/models/camembert/modeling_camembert.py +196 -195
transformers/models/camembert/modular_camembert.py +51 -54
transformers/models/camembert/tokenization_camembert.py +1 -4
transformers/models/canine/configuration_canine.py +0 -1
transformers/models/canine/modeling_canine.py +79 -75
transformers/models/canine/tokenization_canine.py +2 -1
transformers/models/chameleon/configuration_chameleon.py +24 -27
transformers/models/chameleon/image_processing_chameleon.py +21 -24
transformers/models/chameleon/image_processing_chameleon_fast.py +0 -1
transformers/models/chameleon/modeling_chameleon.py +62 -60
transformers/models/chameleon/processing_chameleon.py +16 -41
transformers/models/chinese_clip/configuration_chinese_clip.py +0 -1
transformers/models/chinese_clip/image_processing_chinese_clip.py +21 -24
transformers/models/chinese_clip/image_processing_chinese_clip_fast.py +0 -1
transformers/models/chinese_clip/modeling_chinese_clip.py +71 -69
transformers/models/chinese_clip/processing_chinese_clip.py +2 -15
transformers/models/clap/configuration_clap.py +0 -1
transformers/models/clap/feature_extraction_clap.py +11 -12
transformers/models/clap/modeling_clap.py +113 -104
transformers/models/clap/processing_clap.py +2 -15
transformers/models/clip/configuration_clip.py +0 -1
transformers/models/clip/image_processing_clip.py +21 -24
transformers/models/clip/image_processing_clip_fast.py +0 -1
transformers/models/clip/modeling_clip.py +47 -46
transformers/models/clip/processing_clip.py +2 -14
transformers/models/clip/tokenization_clip.py +2 -5
transformers/models/clipseg/configuration_clipseg.py +0 -1
transformers/models/clipseg/modeling_clipseg.py +90 -87
transformers/models/clipseg/processing_clipseg.py +8 -39
transformers/models/clvp/configuration_clvp.py +1 -3
transformers/models/clvp/feature_extraction_clvp.py +7 -10
transformers/models/clvp/modeling_clvp.py +133 -118
transformers/models/clvp/number_normalizer.py +1 -2
transformers/models/clvp/processing_clvp.py +3 -20
transformers/models/clvp/tokenization_clvp.py +0 -1
transformers/models/code_llama/tokenization_code_llama.py +4 -7
transformers/models/codegen/configuration_codegen.py +0 -1
transformers/models/codegen/modeling_codegen.py +61 -52
transformers/models/codegen/tokenization_codegen.py +5 -6
transformers/models/cohere/configuration_cohere.py +20 -23
transformers/models/cohere/modeling_cohere.py +36 -39
transformers/models/cohere/modular_cohere.py +24 -28
transformers/models/cohere/tokenization_cohere.py +5 -6
transformers/models/cohere2/configuration_cohere2.py +21 -24
transformers/models/cohere2/modeling_cohere2.py +35 -38
transformers/models/cohere2/modular_cohere2.py +39 -41
transformers/models/cohere2_vision/image_processing_cohere2_vision_fast.py +6 -8
transformers/models/cohere2_vision/modeling_cohere2_vision.py +35 -33
transformers/models/cohere2_vision/modular_cohere2_vision.py +21 -23
transformers/models/cohere2_vision/processing_cohere2_vision.py +6 -36
transformers/models/colpali/configuration_colpali.py +0 -1
transformers/models/colpali/modeling_colpali.py +14 -16
transformers/models/colpali/modular_colpali.py +11 -51
transformers/models/colpali/processing_colpali.py +14 -52
transformers/models/colqwen2/modeling_colqwen2.py +20 -22
transformers/models/colqwen2/modular_colqwen2.py +29 -68
transformers/models/colqwen2/processing_colqwen2.py +16 -52
transformers/models/conditional_detr/configuration_conditional_detr.py +1 -2
transformers/models/conditional_detr/image_processing_conditional_detr.py +64 -66
transformers/models/conditional_detr/image_processing_conditional_detr_fast.py +22 -22
transformers/models/conditional_detr/modeling_conditional_detr.py +82 -81
transformers/models/conditional_detr/modular_conditional_detr.py +1 -3
transformers/models/convbert/configuration_convbert.py +0 -1
transformers/models/convbert/modeling_convbert.py +88 -87
transformers/models/convbert/tokenization_convbert.py +0 -1
transformers/models/convnext/configuration_convnext.py +0 -1
transformers/models/convnext/image_processing_convnext.py +20 -23
transformers/models/convnext/image_processing_convnext_fast.py +14 -19
transformers/models/convnext/modeling_convnext.py +5 -8
transformers/models/convnextv2/configuration_convnextv2.py +0 -1
transformers/models/convnextv2/modeling_convnextv2.py +5 -8
transformers/models/cpm/tokenization_cpm.py +6 -7
transformers/models/cpm/tokenization_cpm_fast.py +3 -5
transformers/models/cpmant/configuration_cpmant.py +0 -1
transformers/models/cpmant/modeling_cpmant.py +38 -40
transformers/models/cpmant/tokenization_cpmant.py +1 -3
transformers/models/csm/configuration_csm.py +49 -51
transformers/models/csm/generation_csm.py +31 -35
transformers/models/csm/modeling_csm.py +81 -82
transformers/models/csm/modular_csm.py +58 -58
transformers/models/csm/processing_csm.py +25 -68
transformers/models/ctrl/configuration_ctrl.py +0 -1
transformers/models/ctrl/modeling_ctrl.py +52 -43
transformers/models/ctrl/tokenization_ctrl.py +0 -1
transformers/models/cvt/configuration_cvt.py +0 -1
transformers/models/cvt/modeling_cvt.py +18 -16
transformers/models/cwm/__init__.py +0 -1
transformers/models/cwm/configuration_cwm.py +3 -5
transformers/models/cwm/modeling_cwm.py +33 -35
transformers/models/cwm/modular_cwm.py +10 -12
transformers/models/d_fine/configuration_d_fine.py +3 -5
transformers/models/d_fine/modeling_d_fine.py +127 -121
transformers/models/d_fine/modular_d_fine.py +23 -13
transformers/models/dab_detr/configuration_dab_detr.py +2 -3
transformers/models/dab_detr/modeling_dab_detr.py +69 -71
transformers/models/dac/configuration_dac.py +0 -1
transformers/models/dac/feature_extraction_dac.py +6 -9
transformers/models/dac/modeling_dac.py +21 -23
transformers/models/data2vec/configuration_data2vec_audio.py +0 -1
transformers/models/data2vec/configuration_data2vec_text.py +0 -1
transformers/models/data2vec/configuration_data2vec_vision.py +0 -1
transformers/models/data2vec/modeling_data2vec_audio.py +52 -56
transformers/models/data2vec/modeling_data2vec_text.py +98 -93
transformers/models/data2vec/modeling_data2vec_vision.py +41 -42
transformers/models/data2vec/modular_data2vec_audio.py +6 -1
transformers/models/data2vec/modular_data2vec_text.py +58 -54
transformers/models/dbrx/configuration_dbrx.py +27 -20
transformers/models/dbrx/modeling_dbrx.py +40 -43
transformers/models/dbrx/modular_dbrx.py +31 -33
transformers/models/deberta/configuration_deberta.py +0 -1
transformers/models/deberta/modeling_deberta.py +59 -60
transformers/models/deberta/tokenization_deberta.py +2 -5
transformers/models/deberta_v2/configuration_deberta_v2.py +0 -1
transformers/models/deberta_v2/modeling_deberta_v2.py +65 -65
transformers/models/deberta_v2/tokenization_deberta_v2.py +1 -4
transformers/models/decision_transformer/configuration_decision_transformer.py +0 -1
transformers/models/decision_transformer/modeling_decision_transformer.py +56 -55
transformers/models/deepseek_v2/configuration_deepseek_v2.py +34 -37
transformers/models/deepseek_v2/modeling_deepseek_v2.py +39 -37
transformers/models/deepseek_v2/modular_deepseek_v2.py +44 -44
transformers/models/deepseek_v3/configuration_deepseek_v3.py +35 -38
transformers/models/deepseek_v3/modeling_deepseek_v3.py +40 -38
transformers/models/deepseek_v3/modular_deepseek_v3.py +10 -7
transformers/models/deepseek_vl/configuration_deepseek_vl.py +2 -3
transformers/models/deepseek_vl/image_processing_deepseek_vl.py +25 -26
transformers/models/deepseek_vl/image_processing_deepseek_vl_fast.py +7 -7
transformers/models/deepseek_vl/modeling_deepseek_vl.py +40 -36
transformers/models/deepseek_vl/modular_deepseek_vl.py +14 -43
transformers/models/deepseek_vl/processing_deepseek_vl.py +10 -41
transformers/models/deepseek_vl_hybrid/configuration_deepseek_vl_hybrid.py +3 -5
transformers/models/deepseek_vl_hybrid/image_processing_deepseek_vl_hybrid.py +35 -35
transformers/models/deepseek_vl_hybrid/image_processing_deepseek_vl_hybrid_fast.py +16 -20
transformers/models/deepseek_vl_hybrid/modeling_deepseek_vl_hybrid.py +42 -38
transformers/models/deepseek_vl_hybrid/modular_deepseek_vl_hybrid.py +80 -99
transformers/models/deepseek_vl_hybrid/processing_deepseek_vl_hybrid.py +12 -44
transformers/models/deformable_detr/configuration_deformable_detr.py +2 -3
transformers/models/deformable_detr/image_processing_deformable_detr.py +59 -61
transformers/models/deformable_detr/image_processing_deformable_detr_fast.py +17 -17
transformers/models/deformable_detr/modeling_deformable_detr.py +67 -68
transformers/models/deformable_detr/modular_deformable_detr.py +1 -3
transformers/models/deit/configuration_deit.py +0 -1
transformers/models/deit/image_processing_deit.py +18 -21
transformers/models/deit/image_processing_deit_fast.py +0 -1
transformers/models/deit/modeling_deit.py +16 -18
transformers/models/depth_anything/configuration_depth_anything.py +2 -4
transformers/models/depth_anything/modeling_depth_anything.py +5 -8
transformers/models/depth_pro/configuration_depth_pro.py +0 -1
transformers/models/depth_pro/image_processing_depth_pro.py +22 -23
transformers/models/depth_pro/image_processing_depth_pro_fast.py +6 -8
transformers/models/depth_pro/modeling_depth_pro.py +21 -23
transformers/models/detr/configuration_detr.py +1 -2
transformers/models/detr/image_processing_detr.py +64 -66
transformers/models/detr/image_processing_detr_fast.py +22 -23
transformers/models/detr/modeling_detr.py +78 -73
transformers/models/dia/configuration_dia.py +5 -8
transformers/models/dia/feature_extraction_dia.py +6 -9
transformers/models/dia/generation_dia.py +42 -45
transformers/models/dia/modeling_dia.py +73 -65
transformers/models/dia/modular_dia.py +63 -54
transformers/models/dia/processing_dia.py +39 -29
transformers/models/dia/tokenization_dia.py +3 -6
transformers/models/diffllama/configuration_diffllama.py +20 -23
transformers/models/diffllama/modeling_diffllama.py +44 -47
transformers/models/diffllama/modular_diffllama.py +17 -19
transformers/models/dinat/configuration_dinat.py +0 -1
transformers/models/dinat/modeling_dinat.py +40 -42
transformers/models/dinov2/configuration_dinov2.py +0 -1
transformers/models/dinov2/modeling_dinov2.py +11 -13
transformers/models/dinov2_with_registers/configuration_dinov2_with_registers.py +1 -1
transformers/models/dinov2_with_registers/modeling_dinov2_with_registers.py +12 -13
transformers/models/dinov2_with_registers/modular_dinov2_with_registers.py +5 -7
transformers/models/dinov3_convnext/configuration_dinov3_convnext.py +4 -7
transformers/models/dinov3_convnext/modeling_dinov3_convnext.py +3 -6
transformers/models/dinov3_vit/configuration_dinov3_vit.py +5 -8
transformers/models/dinov3_vit/image_processing_dinov3_vit_fast.py +5 -7
transformers/models/dinov3_vit/modeling_dinov3_vit.py +17 -16
transformers/models/dinov3_vit/modular_dinov3_vit.py +14 -13
transformers/models/distilbert/configuration_distilbert.py +0 -1
transformers/models/distilbert/modeling_distilbert.py +55 -55
transformers/models/distilbert/tokenization_distilbert.py +0 -1
transformers/models/doge/__init__.py +0 -1
transformers/models/doge/configuration_doge.py +25 -28
transformers/models/doge/modeling_doge.py +43 -46
transformers/models/doge/modular_doge.py +57 -58
transformers/models/donut/configuration_donut_swin.py +0 -1
transformers/models/donut/image_processing_donut.py +26 -29
transformers/models/donut/image_processing_donut_fast.py +5 -11
transformers/models/donut/modeling_donut_swin.py +60 -58
transformers/models/donut/processing_donut.py +5 -26
transformers/models/dots1/configuration_dots1.py +27 -29
transformers/models/dots1/modeling_dots1.py +45 -39
transformers/models/dots1/modular_dots1.py +0 -1
transformers/models/dpr/configuration_dpr.py +0 -1
transformers/models/dpr/modeling_dpr.py +37 -39
transformers/models/dpr/tokenization_dpr.py +7 -9
transformers/models/dpr/tokenization_dpr_fast.py +7 -9
transformers/models/dpt/configuration_dpt.py +1 -2
transformers/models/dpt/image_processing_dpt.py +65 -66
transformers/models/dpt/image_processing_dpt_fast.py +14 -16
transformers/models/dpt/modeling_dpt.py +19 -21
transformers/models/dpt/modular_dpt.py +11 -13
transformers/models/edgetam/configuration_edgetam.py +1 -2
transformers/models/edgetam/modeling_edgetam.py +44 -43
transformers/models/edgetam/modular_edgetam.py +17 -20
transformers/models/edgetam_video/__init__.py +0 -1
transformers/models/edgetam_video/configuration_edgetam_video.py +0 -1
transformers/models/edgetam_video/modeling_edgetam_video.py +131 -120
transformers/models/edgetam_video/modular_edgetam_video.py +29 -37
transformers/models/efficientloftr/configuration_efficientloftr.py +4 -5
transformers/models/efficientloftr/image_processing_efficientloftr.py +14 -16
transformers/models/efficientloftr/image_processing_efficientloftr_fast.py +5 -6
transformers/models/efficientloftr/modeling_efficientloftr.py +41 -30
transformers/models/efficientloftr/modular_efficientloftr.py +1 -3
transformers/models/efficientnet/configuration_efficientnet.py +0 -1
transformers/models/efficientnet/image_processing_efficientnet.py +28 -32
transformers/models/efficientnet/image_processing_efficientnet_fast.py +15 -17
transformers/models/efficientnet/modeling_efficientnet.py +17 -15
transformers/models/electra/configuration_electra.py +0 -1
transformers/models/electra/modeling_electra.py +108 -103
transformers/models/emu3/configuration_emu3.py +5 -7
transformers/models/emu3/image_processing_emu3.py +44 -39
transformers/models/emu3/modeling_emu3.py +67 -64
transformers/models/emu3/modular_emu3.py +39 -35
transformers/models/emu3/processing_emu3.py +18 -43
transformers/models/encodec/configuration_encodec.py +2 -4
transformers/models/encodec/feature_extraction_encodec.py +10 -13
transformers/models/encodec/modeling_encodec.py +39 -29
transformers/models/encoder_decoder/configuration_encoder_decoder.py +0 -1
transformers/models/encoder_decoder/modeling_encoder_decoder.py +17 -19
transformers/models/eomt/configuration_eomt.py +0 -1
transformers/models/eomt/image_processing_eomt.py +53 -55
transformers/models/eomt/image_processing_eomt_fast.py +59 -28
transformers/models/eomt/modeling_eomt.py +23 -18
transformers/models/eomt/modular_eomt.py +18 -13
transformers/models/ernie/configuration_ernie.py +0 -1
transformers/models/ernie/modeling_ernie.py +127 -132
transformers/models/ernie/modular_ernie.py +97 -103
transformers/models/ernie4_5/configuration_ernie4_5.py +18 -20
transformers/models/ernie4_5/modeling_ernie4_5.py +32 -34
transformers/models/ernie4_5/modular_ernie4_5.py +1 -3
transformers/models/ernie4_5_moe/configuration_ernie4_5_moe.py +27 -29
transformers/models/ernie4_5_moe/modeling_ernie4_5_moe.py +52 -51
transformers/models/ernie4_5_moe/modular_ernie4_5_moe.py +16 -44
transformers/models/ernie4_5_vl_moe/__init__.py +31 -0
transformers/models/ernie4_5_vl_moe/configuration_ernie4_5_vl_moe.py +329 -0
transformers/models/ernie4_5_vl_moe/image_processing_ernie4_5_vl_moe.py +455 -0
transformers/models/ernie4_5_vl_moe/image_processing_ernie4_5_vl_moe_fast.py +231 -0
transformers/models/ernie4_5_vl_moe/modeling_ernie4_5_vl_moe.py +1895 -0
transformers/models/ernie4_5_vl_moe/modular_ernie4_5_vl_moe.py +1901 -0
transformers/models/ernie4_5_vl_moe/processing_ernie4_5_vl_moe.py +249 -0
transformers/models/ernie4_5_vl_moe/video_processing_ernie4_5_vl_moe.py +593 -0
transformers/models/esm/configuration_esm.py +2 -4
transformers/models/esm/modeling_esm.py +38 -34
transformers/models/esm/modeling_esmfold.py +48 -45
transformers/models/esm/openfold_utils/chunk_utils.py +6 -6
transformers/models/esm/openfold_utils/loss.py +1 -2
transformers/models/esm/openfold_utils/protein.py +13 -13
transformers/models/esm/openfold_utils/tensor_utils.py +6 -6
transformers/models/esm/tokenization_esm.py +2 -4
transformers/models/evolla/configuration_evolla.py +29 -32
transformers/models/evolla/modeling_evolla.py +67 -62
transformers/models/evolla/modular_evolla.py +53 -47
transformers/models/evolla/processing_evolla.py +23 -35
transformers/models/exaone4/configuration_exaone4.py +19 -22
transformers/models/exaone4/modeling_exaone4.py +33 -36
transformers/models/exaone4/modular_exaone4.py +40 -42
transformers/models/falcon/configuration_falcon.py +22 -25
transformers/models/falcon/modeling_falcon.py +75 -78
transformers/models/falcon_h1/configuration_falcon_h1.py +40 -43
transformers/models/falcon_h1/modeling_falcon_h1.py +80 -78
transformers/models/falcon_h1/modular_falcon_h1.py +54 -50
transformers/models/falcon_mamba/configuration_falcon_mamba.py +0 -1
transformers/models/falcon_mamba/modeling_falcon_mamba.py +50 -47
transformers/models/falcon_mamba/modular_falcon_mamba.py +16 -14
transformers/models/fast_vlm/configuration_fast_vlm.py +1 -0
transformers/models/fast_vlm/modeling_fast_vlm.py +43 -39
transformers/models/fast_vlm/modular_fast_vlm.py +2 -3
transformers/models/fastspeech2_conformer/configuration_fastspeech2_conformer.py +2 -5
transformers/models/fastspeech2_conformer/modeling_fastspeech2_conformer.py +68 -57
transformers/models/fastspeech2_conformer/tokenization_fastspeech2_conformer.py +2 -3
transformers/models/flaubert/configuration_flaubert.py +0 -1
transformers/models/flaubert/modeling_flaubert.py +138 -143
transformers/models/flaubert/tokenization_flaubert.py +3 -5
transformers/models/flava/configuration_flava.py +5 -6
transformers/models/flava/image_processing_flava.py +66 -67
transformers/models/flava/image_processing_flava_fast.py +42 -45
transformers/models/flava/modeling_flava.py +111 -107
transformers/models/flava/processing_flava.py +2 -12
transformers/models/flex_olmo/__init__.py +0 -1
transformers/models/flex_olmo/configuration_flex_olmo.py +23 -25
transformers/models/flex_olmo/modeling_flex_olmo.py +44 -43
transformers/models/flex_olmo/modular_flex_olmo.py +35 -37
transformers/models/florence2/configuration_florence2.py +0 -1
transformers/models/florence2/modeling_florence2.py +59 -43
transformers/models/florence2/modular_florence2.py +65 -81
transformers/models/florence2/processing_florence2.py +18 -47
transformers/models/fnet/configuration_fnet.py +0 -1
transformers/models/fnet/modeling_fnet.py +76 -80
transformers/models/fnet/tokenization_fnet.py +0 -1
transformers/models/focalnet/configuration_focalnet.py +0 -1
transformers/models/focalnet/modeling_focalnet.py +39 -41
transformers/models/fsmt/configuration_fsmt.py +0 -1
transformers/models/fsmt/modeling_fsmt.py +47 -48
transformers/models/fsmt/tokenization_fsmt.py +3 -5
transformers/models/funnel/configuration_funnel.py +0 -1
transformers/models/funnel/modeling_funnel.py +91 -93
transformers/models/funnel/tokenization_funnel.py +2 -5
transformers/models/fuyu/configuration_fuyu.py +23 -26
transformers/models/fuyu/image_processing_fuyu.py +29 -31
transformers/models/fuyu/image_processing_fuyu_fast.py +12 -13
transformers/models/fuyu/modeling_fuyu.py +29 -30
transformers/models/fuyu/processing_fuyu.py +23 -34
transformers/models/gemma/configuration_gemma.py +20 -23
transformers/models/gemma/modeling_gemma.py +42 -46
transformers/models/gemma/modular_gemma.py +37 -40
transformers/models/gemma/tokenization_gemma.py +3 -6
transformers/models/gemma2/configuration_gemma2.py +25 -28
transformers/models/gemma2/modeling_gemma2.py +35 -38
transformers/models/gemma2/modular_gemma2.py +56 -58
transformers/models/gemma3/configuration_gemma3.py +28 -29
transformers/models/gemma3/image_processing_gemma3.py +29 -31
transformers/models/gemma3/image_processing_gemma3_fast.py +9 -11
transformers/models/gemma3/modeling_gemma3.py +112 -94
transformers/models/gemma3/modular_gemma3.py +110 -91
transformers/models/gemma3/processing_gemma3.py +5 -5
transformers/models/gemma3n/configuration_gemma3n.py +12 -10
transformers/models/gemma3n/feature_extraction_gemma3n.py +9 -11
transformers/models/gemma3n/modeling_gemma3n.py +127 -98
transformers/models/gemma3n/modular_gemma3n.py +117 -84
transformers/models/gemma3n/processing_gemma3n.py +12 -26
transformers/models/git/configuration_git.py +0 -1
transformers/models/git/modeling_git.py +250 -197
transformers/models/git/processing_git.py +2 -14
transformers/models/glm/configuration_glm.py +19 -21
transformers/models/glm/modeling_glm.py +33 -36
transformers/models/glm/modular_glm.py +4 -7
transformers/models/glm4/configuration_glm4.py +19 -21
transformers/models/glm4/modeling_glm4.py +36 -38
transformers/models/glm4/modular_glm4.py +8 -10
transformers/models/glm46v/configuration_glm46v.py +0 -1
transformers/models/glm46v/image_processing_glm46v.py +35 -40
transformers/models/glm46v/image_processing_glm46v_fast.py +7 -7
transformers/models/glm46v/modeling_glm46v.py +54 -52
transformers/models/glm46v/modular_glm46v.py +4 -3
transformers/models/glm46v/processing_glm46v.py +7 -41
transformers/models/glm46v/video_processing_glm46v.py +9 -11
transformers/models/glm4_moe/configuration_glm4_moe.py +25 -28
transformers/models/glm4_moe/modeling_glm4_moe.py +41 -40
transformers/models/glm4_moe/modular_glm4_moe.py +27 -30
transformers/models/glm4_moe_lite/__init__.py +28 -0
transformers/models/glm4_moe_lite/configuration_glm4_moe_lite.py +235 -0
transformers/models/glm4_moe_lite/modeling_glm4_moe_lite.py +740 -0
transformers/models/glm4_moe_lite/modular_glm4_moe_lite.py +304 -0
transformers/models/glm4v/configuration_glm4v.py +14 -17
transformers/models/glm4v/image_processing_glm4v.py +34 -40
transformers/models/glm4v/image_processing_glm4v_fast.py +6 -7
transformers/models/glm4v/modeling_glm4v.py +148 -156
transformers/models/glm4v/modular_glm4v.py +142 -185
transformers/models/glm4v/processing_glm4v.py +7 -41
transformers/models/glm4v/video_processing_glm4v.py +9 -11
transformers/models/glm4v_moe/configuration_glm4v_moe.py +119 -122
transformers/models/glm4v_moe/modeling_glm4v_moe.py +275 -319
transformers/models/glm4v_moe/modular_glm4v_moe.py +66 -163
transformers/models/glm_image/__init__.py +31 -0
transformers/models/glm_image/configuration_glm_image.py +352 -0
transformers/models/glm_image/image_processing_glm_image.py +503 -0
transformers/models/glm_image/image_processing_glm_image_fast.py +296 -0
transformers/models/glm_image/modeling_glm_image.py +1590 -0
transformers/models/glm_image/modular_glm_image.py +1480 -0
transformers/models/glm_image/processing_glm_image.py +217 -0
transformers/models/glmasr/__init__.py +29 -0
transformers/models/glmasr/configuration_glmasr.py +196 -0
transformers/models/glmasr/modeling_glmasr.py +511 -0
transformers/models/glmasr/modular_glmasr.py +431 -0
transformers/models/glmasr/processing_glmasr.py +331 -0
transformers/models/glpn/configuration_glpn.py +0 -1
transformers/models/glpn/image_processing_glpn.py +11 -12
transformers/models/glpn/image_processing_glpn_fast.py +8 -10
transformers/models/glpn/modeling_glpn.py +10 -12
transformers/models/got_ocr2/configuration_got_ocr2.py +5 -8
transformers/models/got_ocr2/image_processing_got_ocr2.py +22 -24
transformers/models/got_ocr2/image_processing_got_ocr2_fast.py +6 -8
transformers/models/got_ocr2/modeling_got_ocr2.py +48 -45
transformers/models/got_ocr2/modular_got_ocr2.py +31 -34
transformers/models/got_ocr2/processing_got_ocr2.py +42 -63
transformers/models/gpt2/configuration_gpt2.py +0 -1
transformers/models/gpt2/modeling_gpt2.py +114 -113
transformers/models/gpt2/tokenization_gpt2.py +6 -9
transformers/models/gpt_bigcode/configuration_gpt_bigcode.py +0 -1
transformers/models/gpt_bigcode/modeling_gpt_bigcode.py +76 -88
transformers/models/gpt_neo/configuration_gpt_neo.py +0 -1
transformers/models/gpt_neo/modeling_gpt_neo.py +77 -66
transformers/models/gpt_neox/configuration_gpt_neox.py +19 -22
transformers/models/gpt_neox/modeling_gpt_neox.py +71 -73
transformers/models/gpt_neox/modular_gpt_neox.py +64 -66
transformers/models/gpt_neox/tokenization_gpt_neox.py +2 -5
transformers/models/gpt_neox_japanese/configuration_gpt_neox_japanese.py +15 -18
transformers/models/gpt_neox_japanese/modeling_gpt_neox_japanese.py +42 -45
transformers/models/gpt_neox_japanese/tokenization_gpt_neox_japanese.py +1 -3
transformers/models/gpt_oss/configuration_gpt_oss.py +38 -24
transformers/models/gpt_oss/modeling_gpt_oss.py +40 -44
transformers/models/gpt_oss/modular_gpt_oss.py +22 -26
transformers/models/gpt_sw3/tokenization_gpt_sw3.py +4 -4
transformers/models/gptj/configuration_gptj.py +0 -1
transformers/models/gptj/modeling_gptj.py +96 -86
transformers/models/granite/configuration_granite.py +23 -26
transformers/models/granite/modeling_granite.py +40 -42
transformers/models/granite/modular_granite.py +29 -31
transformers/models/granite_speech/configuration_granite_speech.py +0 -1
transformers/models/granite_speech/feature_extraction_granite_speech.py +1 -3
transformers/models/granite_speech/modeling_granite_speech.py +36 -24
transformers/models/granite_speech/processing_granite_speech.py +11 -4
transformers/models/granitemoe/configuration_granitemoe.py +26 -29
transformers/models/granitemoe/modeling_granitemoe.py +37 -40
transformers/models/granitemoe/modular_granitemoe.py +22 -25
transformers/models/granitemoehybrid/__init__.py +0 -1
transformers/models/granitemoehybrid/configuration_granitemoehybrid.py +41 -40
transformers/models/granitemoehybrid/modeling_granitemoehybrid.py +92 -86
transformers/models/granitemoehybrid/modular_granitemoehybrid.py +29 -21
transformers/models/granitemoeshared/configuration_granitemoeshared.py +27 -30
transformers/models/granitemoeshared/modeling_granitemoeshared.py +50 -55
transformers/models/granitemoeshared/modular_granitemoeshared.py +19 -21
transformers/models/grounding_dino/configuration_grounding_dino.py +2 -4
transformers/models/grounding_dino/image_processing_grounding_dino.py +60 -62
transformers/models/grounding_dino/image_processing_grounding_dino_fast.py +17 -18
transformers/models/grounding_dino/modeling_grounding_dino.py +95 -97
transformers/models/grounding_dino/modular_grounding_dino.py +2 -3
transformers/models/grounding_dino/processing_grounding_dino.py +10 -38
transformers/models/groupvit/configuration_groupvit.py +0 -1
transformers/models/groupvit/modeling_groupvit.py +75 -71
transformers/models/helium/configuration_helium.py +20 -22
transformers/models/helium/modeling_helium.py +34 -37
transformers/models/helium/modular_helium.py +3 -7
transformers/models/herbert/tokenization_herbert.py +4 -6
transformers/models/hgnet_v2/configuration_hgnet_v2.py +0 -1
transformers/models/hgnet_v2/modeling_hgnet_v2.py +16 -9
transformers/models/hgnet_v2/modular_hgnet_v2.py +16 -9
transformers/models/hiera/configuration_hiera.py +0 -1
transformers/models/hiera/modeling_hiera.py +60 -62
transformers/models/hubert/configuration_hubert.py +0 -1
transformers/models/hubert/modeling_hubert.py +39 -37
transformers/models/hubert/modular_hubert.py +12 -11
transformers/models/hunyuan_v1_dense/configuration_hunyuan_v1_dense.py +21 -24
transformers/models/hunyuan_v1_dense/modeling_hunyuan_v1_dense.py +31 -34
transformers/models/hunyuan_v1_dense/modular_hunyuan_v1_dense.py +4 -6
transformers/models/hunyuan_v1_moe/__init__.py +1 -1
transformers/models/hunyuan_v1_moe/configuration_hunyuan_v1_moe.py +25 -28
transformers/models/hunyuan_v1_moe/modeling_hunyuan_v1_moe.py +44 -39
transformers/models/hunyuan_v1_moe/modular_hunyuan_v1_moe.py +9 -9
transformers/models/ibert/configuration_ibert.py +0 -1
transformers/models/ibert/modeling_ibert.py +76 -62
transformers/models/ibert/quant_modules.py +0 -1
transformers/models/idefics/configuration_idefics.py +0 -1
transformers/models/idefics/image_processing_idefics.py +13 -15
transformers/models/idefics/modeling_idefics.py +70 -61
transformers/models/idefics/perceiver.py +1 -3
transformers/models/idefics/processing_idefics.py +32 -48
transformers/models/idefics/vision.py +22 -24
transformers/models/idefics2/configuration_idefics2.py +0 -1
transformers/models/idefics2/image_processing_idefics2.py +31 -32
transformers/models/idefics2/image_processing_idefics2_fast.py +7 -8
transformers/models/idefics2/modeling_idefics2.py +63 -59
transformers/models/idefics2/processing_idefics2.py +10 -68
transformers/models/idefics3/configuration_idefics3.py +0 -1
transformers/models/idefics3/image_processing_idefics3.py +42 -43
transformers/models/idefics3/image_processing_idefics3_fast.py +11 -12
transformers/models/idefics3/modeling_idefics3.py +57 -55
transformers/models/idefics3/processing_idefics3.py +15 -69
transformers/models/ijepa/configuration_ijepa.py +0 -1
transformers/models/ijepa/modeling_ijepa.py +10 -11
transformers/models/ijepa/modular_ijepa.py +5 -7
transformers/models/imagegpt/configuration_imagegpt.py +0 -1
transformers/models/imagegpt/image_processing_imagegpt.py +17 -18
transformers/models/imagegpt/image_processing_imagegpt_fast.py +9 -14
transformers/models/imagegpt/modeling_imagegpt.py +66 -60
transformers/models/informer/configuration_informer.py +6 -9
transformers/models/informer/modeling_informer.py +84 -86
transformers/models/informer/modular_informer.py +13 -16
transformers/models/instructblip/configuration_instructblip.py +0 -1
transformers/models/instructblip/modeling_instructblip.py +45 -44
transformers/models/instructblip/processing_instructblip.py +10 -36
transformers/models/instructblipvideo/configuration_instructblipvideo.py +0 -1
transformers/models/instructblipvideo/modeling_instructblipvideo.py +107 -105
transformers/models/instructblipvideo/modular_instructblipvideo.py +34 -36
transformers/models/instructblipvideo/processing_instructblipvideo.py +14 -33
transformers/models/instructblipvideo/video_processing_instructblipvideo.py +4 -6
transformers/models/internvl/configuration_internvl.py +0 -1
transformers/models/internvl/modeling_internvl.py +52 -51
transformers/models/internvl/modular_internvl.py +24 -30
transformers/models/internvl/processing_internvl.py +12 -45
transformers/models/internvl/video_processing_internvl.py +8 -10
transformers/models/jais2/__init__.py +27 -0
transformers/models/jais2/configuration_jais2.py +150 -0
transformers/models/jais2/modeling_jais2.py +484 -0
transformers/models/jais2/modular_jais2.py +194 -0
transformers/models/jamba/configuration_jamba.py +0 -1
transformers/models/jamba/modeling_jamba.py +67 -65
transformers/models/jamba/modular_jamba.py +54 -55
transformers/models/janus/configuration_janus.py +0 -1
transformers/models/janus/image_processing_janus.py +35 -37
transformers/models/janus/image_processing_janus_fast.py +12 -14
transformers/models/janus/modeling_janus.py +56 -50
transformers/models/janus/modular_janus.py +76 -70
transformers/models/janus/processing_janus.py +17 -43
transformers/models/jetmoe/configuration_jetmoe.py +20 -23
transformers/models/jetmoe/modeling_jetmoe.py +41 -44
transformers/models/jetmoe/modular_jetmoe.py +31 -33
transformers/models/kosmos2/configuration_kosmos2.py +0 -1
transformers/models/kosmos2/modeling_kosmos2.py +159 -148
transformers/models/kosmos2/processing_kosmos2.py +40 -55
transformers/models/kosmos2_5/__init__.py +0 -1
transformers/models/kosmos2_5/configuration_kosmos2_5.py +0 -1
transformers/models/kosmos2_5/image_processing_kosmos2_5.py +10 -12
transformers/models/kosmos2_5/image_processing_kosmos2_5_fast.py +4 -13
transformers/models/kosmos2_5/modeling_kosmos2_5.py +118 -110
transformers/models/kosmos2_5/processing_kosmos2_5.py +8 -29
transformers/models/kyutai_speech_to_text/configuration_kyutai_speech_to_text.py +23 -25
transformers/models/kyutai_speech_to_text/feature_extraction_kyutai_speech_to_text.py +12 -14
transformers/models/kyutai_speech_to_text/modeling_kyutai_speech_to_text.py +67 -68
transformers/models/kyutai_speech_to_text/modular_kyutai_speech_to_text.py +28 -22
transformers/models/kyutai_speech_to_text/processing_kyutai_speech_to_text.py +2 -8
transformers/models/lasr/configuration_lasr.py +5 -3
transformers/models/lasr/feature_extraction_lasr.py +10 -12
transformers/models/lasr/modeling_lasr.py +21 -23
transformers/models/lasr/modular_lasr.py +16 -11
transformers/models/lasr/processing_lasr.py +12 -8
transformers/models/lasr/tokenization_lasr.py +2 -4
transformers/models/layoutlm/configuration_layoutlm.py +0 -1
transformers/models/layoutlm/modeling_layoutlm.py +72 -72
transformers/models/layoutlmv2/configuration_layoutlmv2.py +0 -1
transformers/models/layoutlmv2/image_processing_layoutlmv2.py +18 -21
transformers/models/layoutlmv2/image_processing_layoutlmv2_fast.py +5 -7
transformers/models/layoutlmv2/modeling_layoutlmv2.py +60 -50
transformers/models/layoutlmv2/processing_layoutlmv2.py +14 -44
transformers/models/layoutlmv2/tokenization_layoutlmv2.py +64 -74
transformers/models/layoutlmv3/configuration_layoutlmv3.py +0 -1
transformers/models/layoutlmv3/image_processing_layoutlmv3.py +24 -26
transformers/models/layoutlmv3/image_processing_layoutlmv3_fast.py +7 -9
transformers/models/layoutlmv3/modeling_layoutlmv3.py +78 -56
transformers/models/layoutlmv3/processing_layoutlmv3.py +14 -46
transformers/models/layoutlmv3/tokenization_layoutlmv3.py +64 -75
transformers/models/layoutxlm/configuration_layoutxlm.py +0 -1
transformers/models/layoutxlm/modular_layoutxlm.py +0 -1
transformers/models/layoutxlm/processing_layoutxlm.py +14 -44
transformers/models/layoutxlm/tokenization_layoutxlm.py +65 -76
transformers/models/led/configuration_led.py +1 -4
transformers/models/led/modeling_led.py +119 -267
transformers/models/levit/configuration_levit.py +0 -1
transformers/models/levit/image_processing_levit.py +19 -21
transformers/models/levit/image_processing_levit_fast.py +0 -1
transformers/models/levit/modeling_levit.py +35 -19
transformers/models/lfm2/configuration_lfm2.py +22 -23
transformers/models/lfm2/modeling_lfm2.py +43 -45
transformers/models/lfm2/modular_lfm2.py +29 -29
transformers/models/lfm2_moe/__init__.py +0 -1
transformers/models/lfm2_moe/configuration_lfm2_moe.py +1 -2
transformers/models/lfm2_moe/modeling_lfm2_moe.py +58 -49
transformers/models/lfm2_moe/modular_lfm2_moe.py +13 -37
transformers/models/lfm2_vl/configuration_lfm2_vl.py +4 -1
transformers/models/lfm2_vl/image_processing_lfm2_vl_fast.py +34 -5
transformers/models/lfm2_vl/modeling_lfm2_vl.py +42 -38
transformers/models/lfm2_vl/modular_lfm2_vl.py +28 -29
transformers/models/lfm2_vl/processing_lfm2_vl.py +96 -76
transformers/models/lightglue/image_processing_lightglue.py +16 -15
transformers/models/lightglue/image_processing_lightglue_fast.py +5 -6
transformers/models/lightglue/modeling_lightglue.py +28 -30
transformers/models/lightglue/modular_lightglue.py +28 -28
transformers/models/lighton_ocr/__init__.py +28 -0
transformers/models/lighton_ocr/configuration_lighton_ocr.py +128 -0
transformers/models/lighton_ocr/modeling_lighton_ocr.py +460 -0
transformers/models/lighton_ocr/modular_lighton_ocr.py +403 -0
transformers/models/lighton_ocr/processing_lighton_ocr.py +229 -0
transformers/models/lilt/configuration_lilt.py +0 -1
transformers/models/lilt/modeling_lilt.py +72 -70
transformers/models/llama/configuration_llama.py +21 -24
transformers/models/llama/modeling_llama.py +32 -35
transformers/models/llama/tokenization_llama.py +2 -4
transformers/models/llama4/configuration_llama4.py +20 -22
transformers/models/llama4/image_processing_llama4_fast.py +9 -11
transformers/models/llama4/modeling_llama4.py +78 -75
transformers/models/llama4/processing_llama4.py +33 -57
transformers/models/llava/configuration_llava.py +0 -1
transformers/models/llava/image_processing_llava.py +25 -28
transformers/models/llava/image_processing_llava_fast.py +6 -8
transformers/models/llava/modeling_llava.py +47 -44
transformers/models/llava/processing_llava.py +18 -51
transformers/models/llava_next/configuration_llava_next.py +0 -1
transformers/models/llava_next/image_processing_llava_next.py +43 -45
transformers/models/llava_next/image_processing_llava_next_fast.py +5 -7
transformers/models/llava_next/modeling_llava_next.py +49 -47
transformers/models/llava_next/processing_llava_next.py +18 -47
transformers/models/llava_next_video/configuration_llava_next_video.py +0 -1
transformers/models/llava_next_video/modeling_llava_next_video.py +60 -58
transformers/models/llava_next_video/modular_llava_next_video.py +51 -49
transformers/models/llava_next_video/processing_llava_next_video.py +21 -63
transformers/models/llava_next_video/video_processing_llava_next_video.py +0 -1
transformers/models/llava_onevision/configuration_llava_onevision.py +0 -1
transformers/models/llava_onevision/image_processing_llava_onevision.py +40 -42
transformers/models/llava_onevision/image_processing_llava_onevision_fast.py +6 -8
transformers/models/llava_onevision/modeling_llava_onevision.py +67 -65
transformers/models/llava_onevision/modular_llava_onevision.py +58 -56
transformers/models/llava_onevision/processing_llava_onevision.py +21 -53
transformers/models/llava_onevision/video_processing_llava_onevision.py +0 -1
transformers/models/longcat_flash/__init__.py +0 -1
transformers/models/longcat_flash/configuration_longcat_flash.py +32 -35
transformers/models/longcat_flash/modeling_longcat_flash.py +32 -32
transformers/models/longcat_flash/modular_longcat_flash.py +18 -19
transformers/models/longformer/configuration_longformer.py +1 -4
transformers/models/longformer/modeling_longformer.py +99 -101
transformers/models/longt5/configuration_longt5.py +0 -1
transformers/models/longt5/modeling_longt5.py +43 -48
transformers/models/luke/configuration_luke.py +0 -1
transformers/models/luke/modeling_luke.py +179 -181
transformers/models/luke/tokenization_luke.py +99 -105
transformers/models/lw_detr/__init__.py +27 -0
transformers/models/lw_detr/configuration_lw_detr.py +374 -0
transformers/models/lw_detr/modeling_lw_detr.py +1698 -0
transformers/models/lw_detr/modular_lw_detr.py +1611 -0
transformers/models/lxmert/configuration_lxmert.py +0 -1
transformers/models/lxmert/modeling_lxmert.py +63 -74
transformers/models/m2m_100/configuration_m2m_100.py +0 -1
transformers/models/m2m_100/modeling_m2m_100.py +79 -71
transformers/models/m2m_100/tokenization_m2m_100.py +8 -8
transformers/models/mamba/configuration_mamba.py +0 -1
transformers/models/mamba/modeling_mamba.py +44 -44
transformers/models/mamba2/configuration_mamba2.py +0 -1
transformers/models/mamba2/modeling_mamba2.py +67 -68
transformers/models/marian/configuration_marian.py +1 -2
transformers/models/marian/modeling_marian.py +87 -86
transformers/models/marian/tokenization_marian.py +6 -6
transformers/models/markuplm/configuration_markuplm.py +0 -1
transformers/models/markuplm/feature_extraction_markuplm.py +1 -2
transformers/models/markuplm/modeling_markuplm.py +65 -70
transformers/models/markuplm/processing_markuplm.py +31 -38
transformers/models/markuplm/tokenization_markuplm.py +67 -77
transformers/models/mask2former/configuration_mask2former.py +5 -8
transformers/models/mask2former/image_processing_mask2former.py +84 -85
transformers/models/mask2former/image_processing_mask2former_fast.py +30 -33
transformers/models/mask2former/modeling_mask2former.py +99 -92
transformers/models/mask2former/modular_mask2former.py +6 -8
transformers/models/maskformer/configuration_maskformer.py +6 -9
transformers/models/maskformer/configuration_maskformer_swin.py +0 -1
transformers/models/maskformer/image_processing_maskformer.py +84 -85
transformers/models/maskformer/image_processing_maskformer_fast.py +29 -33
transformers/models/maskformer/modeling_maskformer.py +65 -59
transformers/models/maskformer/modeling_maskformer_swin.py +34 -32
transformers/models/mbart/configuration_mbart.py +1 -1
transformers/models/mbart/modeling_mbart.py +118 -113
transformers/models/mbart/tokenization_mbart.py +2 -4
transformers/models/mbart50/tokenization_mbart50.py +3 -5
transformers/models/megatron_bert/configuration_megatron_bert.py +0 -1
transformers/models/megatron_bert/modeling_megatron_bert.py +141 -150
transformers/models/metaclip_2/modeling_metaclip_2.py +48 -46
transformers/models/metaclip_2/modular_metaclip_2.py +21 -21
transformers/models/mgp_str/configuration_mgp_str.py +0 -1
transformers/models/mgp_str/modeling_mgp_str.py +14 -16
transformers/models/mgp_str/processing_mgp_str.py +3 -20
transformers/models/mgp_str/tokenization_mgp_str.py +1 -3
transformers/models/mimi/configuration_mimi.py +38 -40
transformers/models/mimi/modeling_mimi.py +100 -82
transformers/models/minimax/__init__.py +0 -1
transformers/models/minimax/configuration_minimax.py +32 -36
transformers/models/minimax/modeling_minimax.py +57 -47
transformers/models/minimax/modular_minimax.py +62 -54
transformers/models/minimax_m2/__init__.py +28 -0
transformers/models/minimax_m2/configuration_minimax_m2.py +211 -0
transformers/models/minimax_m2/modeling_minimax_m2.py +704 -0
transformers/models/minimax_m2/modular_minimax_m2.py +369 -0
transformers/models/ministral/configuration_ministral.py +20 -22
transformers/models/ministral/modeling_ministral.py +32 -34
transformers/models/ministral/modular_ministral.py +27 -29
transformers/models/ministral3/configuration_ministral3.py +19 -22
transformers/models/ministral3/modeling_ministral3.py +32 -34
transformers/models/ministral3/modular_ministral3.py +4 -5
transformers/models/mistral/configuration_mistral.py +19 -22
transformers/models/mistral/modeling_mistral.py +32 -34
transformers/models/mistral/modular_mistral.py +11 -12
transformers/models/mistral3/configuration_mistral3.py +0 -1
transformers/models/mistral3/modeling_mistral3.py +53 -46
transformers/models/mistral3/modular_mistral3.py +38 -36
transformers/models/mixtral/configuration_mixtral.py +24 -27
transformers/models/mixtral/modeling_mixtral.py +47 -42
transformers/models/mixtral/modular_mixtral.py +32 -31
transformers/models/mlcd/configuration_mlcd.py +0 -1
transformers/models/mlcd/modeling_mlcd.py +16 -12
transformers/models/mlcd/modular_mlcd.py +13 -11
transformers/models/mllama/configuration_mllama.py +5 -8
transformers/models/mllama/image_processing_mllama.py +23 -25
transformers/models/mllama/image_processing_mllama_fast.py +5 -6
transformers/models/mllama/modeling_mllama.py +94 -86
transformers/models/mllama/processing_mllama.py +6 -55
transformers/models/mluke/tokenization_mluke.py +97 -103
transformers/models/mm_grounding_dino/configuration_mm_grounding_dino.py +1 -3
transformers/models/mm_grounding_dino/modeling_mm_grounding_dino.py +95 -97
transformers/models/mm_grounding_dino/modular_mm_grounding_dino.py +1 -3
transformers/models/mobilebert/configuration_mobilebert.py +0 -1
transformers/models/mobilebert/modeling_mobilebert.py +77 -85
transformers/models/mobilebert/tokenization_mobilebert.py +0 -1
transformers/models/mobilenet_v1/configuration_mobilenet_v1.py +0 -1
transformers/models/mobilenet_v1/image_processing_mobilenet_v1.py +20 -23
transformers/models/mobilenet_v1/image_processing_mobilenet_v1_fast.py +0 -1
transformers/models/mobilenet_v1/modeling_mobilenet_v1.py +13 -16
transformers/models/mobilenet_v2/configuration_mobilenet_v2.py +0 -1
transformers/models/mobilenet_v2/image_processing_mobilenet_v2.py +48 -51
transformers/models/mobilenet_v2/image_processing_mobilenet_v2_fast.py +10 -12
transformers/models/mobilenet_v2/modeling_mobilenet_v2.py +17 -20
transformers/models/mobilevit/configuration_mobilevit.py +0 -1
transformers/models/mobilevit/image_processing_mobilevit.py +46 -49
transformers/models/mobilevit/image_processing_mobilevit_fast.py +9 -11
transformers/models/mobilevit/modeling_mobilevit.py +21 -19
transformers/models/mobilevitv2/configuration_mobilevitv2.py +0 -1
transformers/models/mobilevitv2/modeling_mobilevitv2.py +21 -20
transformers/models/modernbert/configuration_modernbert.py +34 -34
transformers/models/modernbert/modeling_modernbert.py +135 -126
transformers/models/modernbert/modular_modernbert.py +167 -156
transformers/models/modernbert_decoder/configuration_modernbert_decoder.py +30 -32
transformers/models/modernbert_decoder/modeling_modernbert_decoder.py +54 -48
transformers/models/modernbert_decoder/modular_modernbert_decoder.py +78 -71
transformers/models/moonshine/configuration_moonshine.py +22 -24
transformers/models/moonshine/modeling_moonshine.py +64 -66
transformers/models/moonshine/modular_moonshine.py +72 -73
transformers/models/moshi/configuration_moshi.py +18 -21
transformers/models/moshi/modeling_moshi.py +150 -183
transformers/models/mpnet/configuration_mpnet.py +0 -1
transformers/models/mpnet/modeling_mpnet.py +57 -57
transformers/models/mpnet/tokenization_mpnet.py +1 -4
transformers/models/mpt/configuration_mpt.py +1 -9
transformers/models/mpt/modeling_mpt.py +58 -60
transformers/models/mra/configuration_mra.py +0 -1
transformers/models/mra/modeling_mra.py +58 -57
transformers/models/mt5/configuration_mt5.py +2 -4
transformers/models/mt5/modeling_mt5.py +75 -87
transformers/models/musicgen/configuration_musicgen.py +0 -1
transformers/models/musicgen/modeling_musicgen.py +113 -120
transformers/models/musicgen/processing_musicgen.py +3 -21
transformers/models/musicgen_melody/configuration_musicgen_melody.py +0 -1
transformers/models/musicgen_melody/feature_extraction_musicgen_melody.py +8 -9
transformers/models/musicgen_melody/modeling_musicgen_melody.py +110 -109
transformers/models/musicgen_melody/processing_musicgen_melody.py +3 -22
transformers/models/mvp/configuration_mvp.py +0 -1
transformers/models/mvp/modeling_mvp.py +122 -119
transformers/models/myt5/tokenization_myt5.py +8 -10
transformers/models/nanochat/configuration_nanochat.py +0 -1
transformers/models/nanochat/modeling_nanochat.py +33 -36
transformers/models/nanochat/modular_nanochat.py +12 -14
transformers/models/nemotron/configuration_nemotron.py +20 -23
transformers/models/nemotron/modeling_nemotron.py +51 -54
transformers/models/nllb/tokenization_nllb.py +7 -9
transformers/models/nllb_moe/configuration_nllb_moe.py +1 -1
transformers/models/nllb_moe/modeling_nllb_moe.py +77 -69
transformers/models/nougat/image_processing_nougat.py +29 -32
transformers/models/nougat/image_processing_nougat_fast.py +4 -6
transformers/models/nougat/processing_nougat.py +37 -39
transformers/models/nougat/tokenization_nougat.py +16 -23
transformers/models/nystromformer/configuration_nystromformer.py +0 -1
transformers/models/nystromformer/modeling_nystromformer.py +68 -63
transformers/models/olmo/configuration_olmo.py +18 -21
transformers/models/olmo/modeling_olmo.py +32 -35
transformers/models/olmo/modular_olmo.py +5 -9
transformers/models/olmo2/configuration_olmo2.py +18 -21
transformers/models/olmo2/modeling_olmo2.py +33 -36
transformers/models/olmo2/modular_olmo2.py +29 -31
transformers/models/olmo3/__init__.py +0 -1
transformers/models/olmo3/configuration_olmo3.py +20 -23
transformers/models/olmo3/modeling_olmo3.py +32 -35
transformers/models/olmo3/modular_olmo3.py +31 -33
transformers/models/olmoe/configuration_olmoe.py +24 -26
transformers/models/olmoe/modeling_olmoe.py +49 -43
transformers/models/olmoe/modular_olmoe.py +16 -15
transformers/models/omdet_turbo/configuration_omdet_turbo.py +2 -3
transformers/models/omdet_turbo/modeling_omdet_turbo.py +42 -40
transformers/models/omdet_turbo/processing_omdet_turbo.py +19 -67
transformers/models/oneformer/configuration_oneformer.py +5 -8
transformers/models/oneformer/image_processing_oneformer.py +83 -84
transformers/models/oneformer/image_processing_oneformer_fast.py +33 -34
transformers/models/oneformer/modeling_oneformer.py +130 -162
transformers/models/oneformer/processing_oneformer.py +28 -43
transformers/models/openai/configuration_openai.py +0 -1
transformers/models/openai/modeling_openai.py +62 -51
transformers/models/openai/tokenization_openai.py +2 -5
transformers/models/opt/configuration_opt.py +0 -1
transformers/models/opt/modeling_opt.py +74 -75
transformers/models/ovis2/__init__.py +0 -1
transformers/models/ovis2/configuration_ovis2.py +0 -1
transformers/models/ovis2/image_processing_ovis2.py +22 -24
transformers/models/ovis2/image_processing_ovis2_fast.py +6 -8
transformers/models/ovis2/modeling_ovis2.py +58 -48
transformers/models/ovis2/modular_ovis2.py +38 -32
transformers/models/ovis2/processing_ovis2.py +12 -40
transformers/models/owlv2/configuration_owlv2.py +0 -1
transformers/models/owlv2/image_processing_owlv2.py +20 -21
transformers/models/owlv2/image_processing_owlv2_fast.py +7 -10
transformers/models/owlv2/modeling_owlv2.py +89 -90
transformers/models/owlv2/modular_owlv2.py +6 -9
transformers/models/owlv2/processing_owlv2.py +20 -49
transformers/models/owlvit/configuration_owlvit.py +0 -1
transformers/models/owlvit/image_processing_owlvit.py +21 -22
transformers/models/owlvit/image_processing_owlvit_fast.py +2 -3
transformers/models/owlvit/modeling_owlvit.py +88 -89
transformers/models/owlvit/processing_owlvit.py +20 -48
transformers/models/paddleocr_vl/__init__.py +0 -1
transformers/models/paddleocr_vl/configuration_paddleocr_vl.py +19 -19
transformers/models/paddleocr_vl/image_processing_paddleocr_vl.py +37 -37
transformers/models/paddleocr_vl/image_processing_paddleocr_vl_fast.py +12 -12
transformers/models/paddleocr_vl/modeling_paddleocr_vl.py +104 -90
transformers/models/paddleocr_vl/modular_paddleocr_vl.py +90 -80
transformers/models/paddleocr_vl/processing_paddleocr_vl.py +1 -3
transformers/models/paligemma/configuration_paligemma.py +0 -1
transformers/models/paligemma/modeling_paligemma.py +73 -67
transformers/models/paligemma/processing_paligemma.py +13 -66
transformers/models/parakeet/configuration_parakeet.py +1 -4
transformers/models/parakeet/feature_extraction_parakeet.py +10 -12
transformers/models/parakeet/modeling_parakeet.py +23 -22
transformers/models/parakeet/modular_parakeet.py +21 -18
transformers/models/parakeet/processing_parakeet.py +12 -5
transformers/models/parakeet/{tokenization_parakeet_fast.py → tokenization_parakeet.py} +5 -7
transformers/models/patchtsmixer/configuration_patchtsmixer.py +5 -8
transformers/models/patchtsmixer/modeling_patchtsmixer.py +64 -62
transformers/models/patchtst/configuration_patchtst.py +6 -9
transformers/models/patchtst/modeling_patchtst.py +77 -78
transformers/models/pe_audio/__init__.py +29 -0
transformers/models/pe_audio/configuration_pe_audio.py +204 -0
transformers/models/pe_audio/feature_extraction_pe_audio.py +160 -0
transformers/models/pe_audio/modeling_pe_audio.py +819 -0
transformers/models/pe_audio/modular_pe_audio.py +298 -0
transformers/models/pe_audio/processing_pe_audio.py +23 -0
transformers/models/pe_audio_video/__init__.py +28 -0
transformers/models/pe_audio_video/configuration_pe_audio_video.py +223 -0
transformers/models/pe_audio_video/modeling_pe_audio_video.py +971 -0
transformers/models/pe_audio_video/modular_pe_audio_video.py +763 -0
transformers/models/pe_audio_video/processing_pe_audio_video.py +24 -0
transformers/models/pe_video/__init__.py +29 -0
transformers/models/pe_video/configuration_pe_video.py +209 -0
transformers/models/pe_video/modeling_pe_video.py +635 -0
transformers/models/pe_video/modular_pe_video.py +218 -0
transformers/models/pe_video/processing_pe_video.py +10 -0
transformers/models/pe_video/video_processing_pe_video.py +64 -0
transformers/models/pegasus/configuration_pegasus.py +1 -1
transformers/models/pegasus/modeling_pegasus.py +66 -65
transformers/models/pegasus/tokenization_pegasus.py +1 -4
transformers/models/pegasus_x/configuration_pegasus_x.py +0 -1
transformers/models/pegasus_x/modeling_pegasus_x.py +51 -52
transformers/models/perceiver/configuration_perceiver.py +0 -1
transformers/models/perceiver/image_processing_perceiver.py +22 -25
transformers/models/perceiver/image_processing_perceiver_fast.py +5 -7
transformers/models/perceiver/modeling_perceiver.py +140 -137
transformers/models/perceiver/tokenization_perceiver.py +3 -6
transformers/models/perception_lm/configuration_perception_lm.py +0 -1
transformers/models/perception_lm/image_processing_perception_lm_fast.py +8 -10
transformers/models/perception_lm/modeling_perception_lm.py +45 -43
transformers/models/perception_lm/modular_perception_lm.py +38 -36
transformers/models/perception_lm/processing_perception_lm.py +13 -47
transformers/models/perception_lm/video_processing_perception_lm.py +0 -1
transformers/models/persimmon/configuration_persimmon.py +18 -21
transformers/models/persimmon/modeling_persimmon.py +40 -43
transformers/models/phi/configuration_phi.py +19 -22
transformers/models/phi/modeling_phi.py +36 -38
transformers/models/phi/modular_phi.py +23 -23
transformers/models/phi3/configuration_phi3.py +23 -26
transformers/models/phi3/modeling_phi3.py +34 -37
transformers/models/phi3/modular_phi3.py +13 -17
transformers/models/phi4_multimodal/configuration_phi4_multimodal.py +25 -26
transformers/models/phi4_multimodal/feature_extraction_phi4_multimodal.py +7 -9
transformers/models/phi4_multimodal/image_processing_phi4_multimodal_fast.py +7 -7
transformers/models/phi4_multimodal/modeling_phi4_multimodal.py +58 -57
transformers/models/phi4_multimodal/modular_phi4_multimodal.py +62 -60
transformers/models/phi4_multimodal/processing_phi4_multimodal.py +7 -44
transformers/models/phimoe/configuration_phimoe.py +26 -29
transformers/models/phimoe/modeling_phimoe.py +47 -42
transformers/models/phimoe/modular_phimoe.py +1 -2
transformers/models/phobert/tokenization_phobert.py +4 -6
transformers/models/pix2struct/configuration_pix2struct.py +0 -1
transformers/models/pix2struct/image_processing_pix2struct.py +15 -19
transformers/models/pix2struct/image_processing_pix2struct_fast.py +7 -10
transformers/models/pix2struct/modeling_pix2struct.py +42 -45
transformers/models/pix2struct/processing_pix2struct.py +5 -30
transformers/models/pixio/__init__.py +29 -0
transformers/models/pixio/configuration_pixio.py +150 -0
transformers/models/pixio/modeling_pixio.py +505 -0
transformers/models/pixio/modular_pixio.py +401 -0
transformers/models/pixtral/configuration_pixtral.py +11 -14
transformers/models/pixtral/image_processing_pixtral.py +26 -28
transformers/models/pixtral/image_processing_pixtral_fast.py +5 -6
transformers/models/pixtral/modeling_pixtral.py +23 -26
transformers/models/pixtral/processing_pixtral.py +21 -53
transformers/models/plbart/configuration_plbart.py +1 -1
transformers/models/plbart/modeling_plbart.py +107 -102
transformers/models/plbart/modular_plbart.py +36 -32
transformers/models/plbart/tokenization_plbart.py +4 -5
transformers/models/poolformer/configuration_poolformer.py +0 -1
transformers/models/poolformer/image_processing_poolformer.py +21 -24
transformers/models/poolformer/image_processing_poolformer_fast.py +6 -8
transformers/models/poolformer/modeling_poolformer.py +21 -13
transformers/models/pop2piano/configuration_pop2piano.py +0 -2
transformers/models/pop2piano/feature_extraction_pop2piano.py +6 -9
transformers/models/pop2piano/modeling_pop2piano.py +22 -23
transformers/models/pop2piano/processing_pop2piano.py +25 -33
transformers/models/pop2piano/tokenization_pop2piano.py +15 -23
transformers/models/prompt_depth_anything/configuration_prompt_depth_anything.py +3 -3
transformers/models/prompt_depth_anything/image_processing_prompt_depth_anything.py +28 -28
transformers/models/prompt_depth_anything/image_processing_prompt_depth_anything_fast.py +14 -15
transformers/models/prompt_depth_anything/modeling_prompt_depth_anything.py +9 -10
transformers/models/prompt_depth_anything/modular_prompt_depth_anything.py +9 -10
transformers/models/prophetnet/configuration_prophetnet.py +26 -28
transformers/models/prophetnet/modeling_prophetnet.py +111 -131
transformers/models/prophetnet/tokenization_prophetnet.py +14 -16
transformers/models/pvt/configuration_pvt.py +0 -1
transformers/models/pvt/image_processing_pvt.py +17 -20
transformers/models/pvt/image_processing_pvt_fast.py +0 -1
transformers/models/pvt/modeling_pvt.py +19 -21
transformers/models/pvt_v2/configuration_pvt_v2.py +2 -4
transformers/models/pvt_v2/modeling_pvt_v2.py +21 -23
transformers/models/qwen2/configuration_qwen2.py +18 -21
transformers/models/qwen2/modeling_qwen2.py +32 -34
transformers/models/qwen2/modular_qwen2.py +11 -12
transformers/models/qwen2/tokenization_qwen2.py +2 -5
transformers/models/qwen2_5_omni/configuration_qwen2_5_omni.py +20 -23
transformers/models/qwen2_5_omni/modeling_qwen2_5_omni.py +239 -192
transformers/models/qwen2_5_omni/modular_qwen2_5_omni.py +174 -127
transformers/models/qwen2_5_omni/processing_qwen2_5_omni.py +41 -49
transformers/models/qwen2_5_vl/configuration_qwen2_5_vl.py +22 -25
transformers/models/qwen2_5_vl/modeling_qwen2_5_vl.py +112 -101
transformers/models/qwen2_5_vl/modular_qwen2_5_vl.py +72 -107
transformers/models/qwen2_5_vl/processing_qwen2_5_vl.py +7 -43
transformers/models/qwen2_audio/configuration_qwen2_audio.py +0 -1
transformers/models/qwen2_audio/modeling_qwen2_audio.py +29 -31
transformers/models/qwen2_audio/processing_qwen2_audio.py +13 -42
transformers/models/qwen2_moe/configuration_qwen2_moe.py +28 -31
transformers/models/qwen2_moe/modeling_qwen2_moe.py +48 -43
transformers/models/qwen2_moe/modular_qwen2_moe.py +7 -10
transformers/models/qwen2_vl/configuration_qwen2_vl.py +22 -24
transformers/models/qwen2_vl/image_processing_qwen2_vl.py +41 -42
transformers/models/qwen2_vl/image_processing_qwen2_vl_fast.py +8 -9
transformers/models/qwen2_vl/modeling_qwen2_vl.py +108 -96
transformers/models/qwen2_vl/processing_qwen2_vl.py +7 -44
transformers/models/qwen2_vl/video_processing_qwen2_vl.py +35 -13
transformers/models/qwen3/configuration_qwen3.py +20 -23
transformers/models/qwen3/modeling_qwen3.py +32 -35
transformers/models/qwen3/modular_qwen3.py +4 -6
transformers/models/qwen3_moe/configuration_qwen3_moe.py +25 -28
transformers/models/qwen3_moe/modeling_qwen3_moe.py +48 -43
transformers/models/qwen3_moe/modular_qwen3_moe.py +10 -13
transformers/models/qwen3_next/configuration_qwen3_next.py +31 -34
transformers/models/qwen3_next/modeling_qwen3_next.py +43 -48
transformers/models/qwen3_next/modular_qwen3_next.py +33 -34
transformers/models/qwen3_omni_moe/configuration_qwen3_omni_moe.py +89 -88
transformers/models/qwen3_omni_moe/modeling_qwen3_omni_moe.py +199 -156
transformers/models/qwen3_omni_moe/modular_qwen3_omni_moe.py +170 -152
transformers/models/qwen3_omni_moe/processing_qwen3_omni_moe.py +40 -48
transformers/models/qwen3_vl/configuration_qwen3_vl.py +21 -24
transformers/models/qwen3_vl/modeling_qwen3_vl.py +91 -81
transformers/models/qwen3_vl/modular_qwen3_vl.py +86 -112
transformers/models/qwen3_vl/processing_qwen3_vl.py +6 -42
transformers/models/qwen3_vl/video_processing_qwen3_vl.py +10 -12
transformers/models/qwen3_vl_moe/configuration_qwen3_vl_moe.py +21 -25
transformers/models/qwen3_vl_moe/modeling_qwen3_vl_moe.py +174 -195
transformers/models/qwen3_vl_moe/modular_qwen3_vl_moe.py +65 -117
transformers/models/rag/configuration_rag.py +0 -9
transformers/models/rag/modeling_rag.py +123 -127
transformers/models/rag/retrieval_rag.py +2 -4
transformers/models/rag/tokenization_rag.py +0 -50
transformers/models/recurrent_gemma/configuration_recurrent_gemma.py +21 -24
transformers/models/recurrent_gemma/modeling_recurrent_gemma.py +34 -36
transformers/models/reformer/configuration_reformer.py +0 -1
transformers/models/reformer/modeling_reformer.py +76 -69
transformers/models/reformer/tokenization_reformer.py +3 -6
transformers/models/regnet/configuration_regnet.py +0 -1
transformers/models/regnet/modeling_regnet.py +11 -9
transformers/models/rembert/configuration_rembert.py +0 -1
transformers/models/rembert/modeling_rembert.py +115 -111
transformers/models/rembert/tokenization_rembert.py +1 -4
transformers/models/resnet/configuration_resnet.py +0 -1
transformers/models/resnet/modeling_resnet.py +16 -13
transformers/models/roberta/configuration_roberta.py +0 -1
transformers/models/roberta/modeling_roberta.py +94 -93
transformers/models/roberta/modular_roberta.py +58 -58
transformers/models/roberta/tokenization_roberta.py +2 -5
transformers/models/roberta/tokenization_roberta_old.py +2 -4
transformers/models/roberta_prelayernorm/configuration_roberta_prelayernorm.py +0 -1
transformers/models/roberta_prelayernorm/modeling_roberta_prelayernorm.py +94 -93
transformers/models/roc_bert/configuration_roc_bert.py +0 -1
transformers/models/roc_bert/modeling_roc_bert.py +122 -121
transformers/models/roc_bert/tokenization_roc_bert.py +88 -94
transformers/models/roformer/configuration_roformer.py +0 -1
transformers/models/roformer/modeling_roformer.py +79 -81
transformers/models/roformer/tokenization_roformer.py +3 -6
transformers/models/roformer/tokenization_utils.py +0 -1
transformers/models/rt_detr/configuration_rt_detr.py +1 -2
transformers/models/rt_detr/configuration_rt_detr_resnet.py +0 -1
transformers/models/rt_detr/image_processing_rt_detr.py +54 -55
transformers/models/rt_detr/image_processing_rt_detr_fast.py +15 -15
transformers/models/rt_detr/modeling_rt_detr.py +84 -82
transformers/models/rt_detr/modeling_rt_detr_resnet.py +10 -7
transformers/models/rt_detr/modular_rt_detr.py +14 -14
transformers/models/rt_detr_v2/configuration_rt_detr_v2.py +2 -4
transformers/models/rt_detr_v2/modeling_rt_detr_v2.py +86 -81
transformers/models/rt_detr_v2/modular_rt_detr_v2.py +10 -7
transformers/models/rwkv/configuration_rwkv.py +0 -1
transformers/models/rwkv/modeling_rwkv.py +30 -32
transformers/models/sam/configuration_sam.py +1 -1
transformers/models/sam/image_processing_sam.py +59 -60
transformers/models/sam/image_processing_sam_fast.py +21 -23
transformers/models/sam/modeling_sam.py +37 -36
transformers/models/sam/processing_sam.py +39 -27
transformers/models/sam2/configuration_sam2.py +1 -2
transformers/models/sam2/image_processing_sam2_fast.py +14 -15
transformers/models/sam2/modeling_sam2.py +50 -48
transformers/models/sam2/modular_sam2.py +48 -45
transformers/models/sam2/processing_sam2.py +31 -47
transformers/models/sam2_video/configuration_sam2_video.py +0 -1
transformers/models/sam2_video/modeling_sam2_video.py +119 -112
transformers/models/sam2_video/modular_sam2_video.py +91 -97
transformers/models/sam2_video/processing_sam2_video.py +49 -66
transformers/models/sam2_video/video_processing_sam2_video.py +1 -4
transformers/models/sam3/configuration_sam3.py +21 -2
transformers/models/sam3/image_processing_sam3_fast.py +17 -20
transformers/models/sam3/modeling_sam3.py +77 -56
transformers/models/sam3/modular_sam3.py +3 -8
transformers/models/sam3/processing_sam3.py +29 -48
transformers/models/sam3_tracker/__init__.py +0 -1
transformers/models/sam3_tracker/configuration_sam3_tracker.py +0 -1
transformers/models/sam3_tracker/modeling_sam3_tracker.py +36 -36
transformers/models/sam3_tracker/modular_sam3_tracker.py +2 -1
transformers/models/sam3_tracker/processing_sam3_tracker.py +31 -47
transformers/models/sam3_tracker_video/__init__.py +0 -1
transformers/models/sam3_tracker_video/configuration_sam3_tracker_video.py +25 -1
transformers/models/sam3_tracker_video/modeling_sam3_tracker_video.py +96 -85
transformers/models/sam3_tracker_video/modular_sam3_tracker_video.py +27 -6
transformers/models/sam3_tracker_video/processing_sam3_tracker_video.py +50 -66
transformers/models/sam3_video/configuration_sam3_video.py +14 -1
transformers/models/sam3_video/modeling_sam3_video.py +32 -34
transformers/models/sam3_video/processing_sam3_video.py +26 -46
transformers/models/sam_hq/__init__.py +1 -1
transformers/models/sam_hq/configuration_sam_hq.py +1 -1
transformers/models/sam_hq/modeling_sam_hq.py +65 -64
transformers/models/sam_hq/modular_sam_hq.py +17 -19
transformers/models/sam_hq/{processing_samhq.py → processing_sam_hq.py} +39 -28
transformers/models/seamless_m4t/configuration_seamless_m4t.py +0 -1
transformers/models/seamless_m4t/feature_extraction_seamless_m4t.py +8 -11
transformers/models/seamless_m4t/modeling_seamless_m4t.py +207 -193
transformers/models/seamless_m4t/processing_seamless_m4t.py +18 -39
transformers/models/seamless_m4t/tokenization_seamless_m4t.py +15 -20
transformers/models/seamless_m4t_v2/configuration_seamless_m4t_v2.py +0 -1
transformers/models/seamless_m4t_v2/modeling_seamless_m4t_v2.py +199 -195
transformers/models/seed_oss/configuration_seed_oss.py +23 -25
transformers/models/seed_oss/modeling_seed_oss.py +31 -33
transformers/models/seed_oss/modular_seed_oss.py +3 -4
transformers/models/segformer/configuration_segformer.py +0 -10
transformers/models/segformer/image_processing_segformer.py +39 -42
transformers/models/segformer/image_processing_segformer_fast.py +7 -9
transformers/models/segformer/modeling_segformer.py +26 -28
transformers/models/segformer/modular_segformer.py +5 -7
transformers/models/seggpt/configuration_seggpt.py +0 -1
transformers/models/seggpt/image_processing_seggpt.py +38 -41
transformers/models/seggpt/modeling_seggpt.py +28 -30
transformers/models/sew/configuration_sew.py +0 -1
transformers/models/sew/modeling_sew.py +33 -35
transformers/models/sew/modular_sew.py +10 -12
transformers/models/sew_d/configuration_sew_d.py +0 -1
transformers/models/sew_d/modeling_sew_d.py +28 -30
transformers/models/shieldgemma2/configuration_shieldgemma2.py +0 -1
transformers/models/shieldgemma2/modeling_shieldgemma2.py +16 -17
transformers/models/shieldgemma2/processing_shieldgemma2.py +3 -5
transformers/models/siglip/configuration_siglip.py +0 -1
transformers/models/siglip/image_processing_siglip.py +17 -20
transformers/models/siglip/image_processing_siglip_fast.py +0 -1
transformers/models/siglip/modeling_siglip.py +62 -41
transformers/models/siglip/processing_siglip.py +2 -14
transformers/models/siglip/tokenization_siglip.py +6 -7
transformers/models/siglip2/configuration_siglip2.py +1 -1
transformers/models/siglip2/image_processing_siglip2.py +15 -16
transformers/models/siglip2/image_processing_siglip2_fast.py +4 -5
transformers/models/siglip2/modeling_siglip2.py +114 -92
transformers/models/siglip2/modular_siglip2.py +23 -25
transformers/models/siglip2/processing_siglip2.py +2 -14
transformers/models/smollm3/configuration_smollm3.py +23 -26
transformers/models/smollm3/modeling_smollm3.py +32 -35
transformers/models/smollm3/modular_smollm3.py +27 -29
transformers/models/smolvlm/configuration_smolvlm.py +1 -1
transformers/models/smolvlm/image_processing_smolvlm.py +42 -43
transformers/models/smolvlm/image_processing_smolvlm_fast.py +12 -12
transformers/models/smolvlm/modeling_smolvlm.py +56 -53
transformers/models/smolvlm/modular_smolvlm.py +15 -17
transformers/models/smolvlm/processing_smolvlm.py +15 -76
transformers/models/smolvlm/video_processing_smolvlm.py +7 -9
transformers/models/speech_encoder_decoder/configuration_speech_encoder_decoder.py +0 -1
transformers/models/speech_encoder_decoder/modeling_speech_encoder_decoder.py +20 -23
transformers/models/speech_to_text/configuration_speech_to_text.py +0 -1
transformers/models/speech_to_text/feature_extraction_speech_to_text.py +10 -13
transformers/models/speech_to_text/modeling_speech_to_text.py +62 -54
transformers/models/speech_to_text/processing_speech_to_text.py +4 -30
transformers/models/speech_to_text/tokenization_speech_to_text.py +5 -6
transformers/models/speecht5/configuration_speecht5.py +0 -1
transformers/models/speecht5/feature_extraction_speecht5.py +16 -37
transformers/models/speecht5/modeling_speecht5.py +200 -174
transformers/models/speecht5/number_normalizer.py +0 -1
transformers/models/speecht5/processing_speecht5.py +3 -37
transformers/models/speecht5/tokenization_speecht5.py +4 -5
transformers/models/splinter/configuration_splinter.py +0 -1
transformers/models/splinter/modeling_splinter.py +63 -59
transformers/models/splinter/tokenization_splinter.py +2 -4
transformers/models/squeezebert/configuration_squeezebert.py +0 -1
transformers/models/squeezebert/modeling_squeezebert.py +62 -62
transformers/models/squeezebert/tokenization_squeezebert.py +0 -1
transformers/models/stablelm/configuration_stablelm.py +20 -23
transformers/models/stablelm/modeling_stablelm.py +40 -43
transformers/models/starcoder2/configuration_starcoder2.py +19 -22
transformers/models/starcoder2/modeling_starcoder2.py +34 -37
transformers/models/starcoder2/modular_starcoder2.py +13 -15
transformers/models/superglue/configuration_superglue.py +3 -3
transformers/models/superglue/image_processing_superglue.py +15 -15
transformers/models/superglue/image_processing_superglue_fast.py +5 -7
transformers/models/superglue/modeling_superglue.py +32 -33
transformers/models/superpoint/image_processing_superpoint.py +15 -15
transformers/models/superpoint/image_processing_superpoint_fast.py +5 -7
transformers/models/superpoint/modeling_superpoint.py +13 -14
transformers/models/swiftformer/configuration_swiftformer.py +0 -1
transformers/models/swiftformer/modeling_swiftformer.py +16 -14
transformers/models/swin/configuration_swin.py +0 -1
transformers/models/swin/modeling_swin.py +74 -82
transformers/models/swin2sr/configuration_swin2sr.py +0 -1
transformers/models/swin2sr/image_processing_swin2sr.py +10 -13
transformers/models/swin2sr/image_processing_swin2sr_fast.py +2 -6
transformers/models/swin2sr/modeling_swin2sr.py +75 -61
transformers/models/swinv2/configuration_swinv2.py +0 -1
transformers/models/swinv2/modeling_swinv2.py +96 -100
transformers/models/switch_transformers/configuration_switch_transformers.py +0 -1
transformers/models/switch_transformers/modeling_switch_transformers.py +34 -41
transformers/models/switch_transformers/modular_switch_transformers.py +31 -38
transformers/models/t5/configuration_t5.py +7 -2
transformers/models/t5/modeling_t5.py +76 -84
transformers/models/t5/tokenization_t5.py +1 -3
transformers/models/t5gemma/configuration_t5gemma.py +33 -34
transformers/models/t5gemma/modeling_t5gemma.py +97 -100
transformers/models/t5gemma/modular_t5gemma.py +117 -118
transformers/models/t5gemma2/configuration_t5gemma2.py +59 -96
transformers/models/t5gemma2/modeling_t5gemma2.py +109 -103
transformers/models/t5gemma2/modular_t5gemma2.py +375 -91
transformers/models/table_transformer/configuration_table_transformer.py +1 -2
transformers/models/table_transformer/modeling_table_transformer.py +47 -49
transformers/models/tapas/configuration_tapas.py +0 -1
transformers/models/tapas/modeling_tapas.py +64 -66
transformers/models/tapas/tokenization_tapas.py +115 -153
transformers/models/textnet/configuration_textnet.py +0 -1
transformers/models/textnet/image_processing_textnet.py +22 -25
transformers/models/textnet/image_processing_textnet_fast.py +5 -7
transformers/models/textnet/modeling_textnet.py +13 -14
transformers/models/time_series_transformer/configuration_time_series_transformer.py +5 -8
transformers/models/time_series_transformer/modeling_time_series_transformer.py +79 -81
transformers/models/timesfm/configuration_timesfm.py +0 -1
transformers/models/timesfm/modeling_timesfm.py +29 -19
transformers/models/timesfm/modular_timesfm.py +28 -18
transformers/models/timesformer/configuration_timesformer.py +0 -1
transformers/models/timesformer/modeling_timesformer.py +13 -16
transformers/models/timm_backbone/configuration_timm_backbone.py +0 -1
transformers/models/timm_backbone/modeling_timm_backbone.py +17 -15
transformers/models/timm_wrapper/configuration_timm_wrapper.py +5 -3
transformers/models/timm_wrapper/image_processing_timm_wrapper.py +4 -5
transformers/models/timm_wrapper/modeling_timm_wrapper.py +32 -28
transformers/models/trocr/configuration_trocr.py +0 -1
transformers/models/trocr/modeling_trocr.py +39 -42
transformers/models/trocr/processing_trocr.py +5 -25
transformers/models/tvp/configuration_tvp.py +5 -2
transformers/models/tvp/image_processing_tvp.py +50 -52
transformers/models/tvp/image_processing_tvp_fast.py +9 -10
transformers/models/tvp/modeling_tvp.py +25 -27
transformers/models/tvp/processing_tvp.py +2 -14
transformers/models/udop/configuration_udop.py +1 -1
transformers/models/udop/modeling_udop.py +63 -70
transformers/models/udop/processing_udop.py +7 -26
transformers/models/udop/tokenization_udop.py +80 -93
transformers/models/umt5/configuration_umt5.py +2 -3
transformers/models/umt5/modeling_umt5.py +80 -87
transformers/models/unispeech/configuration_unispeech.py +0 -1
transformers/models/unispeech/modeling_unispeech.py +47 -49
transformers/models/unispeech/modular_unispeech.py +20 -22
transformers/models/unispeech_sat/configuration_unispeech_sat.py +0 -1
transformers/models/unispeech_sat/modeling_unispeech_sat.py +63 -65
transformers/models/unispeech_sat/modular_unispeech_sat.py +21 -23
transformers/models/univnet/feature_extraction_univnet.py +14 -14
transformers/models/univnet/modeling_univnet.py +7 -8
transformers/models/upernet/configuration_upernet.py +0 -1
transformers/models/upernet/modeling_upernet.py +10 -13
transformers/models/vaultgemma/__init__.py +0 -1
transformers/models/vaultgemma/configuration_vaultgemma.py +24 -26
transformers/models/vaultgemma/modeling_vaultgemma.py +35 -37
transformers/models/vaultgemma/modular_vaultgemma.py +29 -31
transformers/models/video_llama_3/image_processing_video_llama_3.py +43 -42
transformers/models/video_llama_3/image_processing_video_llama_3_fast.py +8 -8
transformers/models/video_llama_3/modeling_video_llama_3.py +77 -66
transformers/models/video_llama_3/modular_video_llama_3.py +110 -112
transformers/models/video_llama_3/processing_video_llama_3.py +5 -39
transformers/models/video_llama_3/video_processing_video_llama_3.py +18 -18
transformers/models/video_llava/configuration_video_llava.py +0 -1
transformers/models/video_llava/image_processing_video_llava.py +35 -38
transformers/models/video_llava/modeling_video_llava.py +59 -57
transformers/models/video_llava/processing_video_llava.py +38 -78
transformers/models/video_llava/video_processing_video_llava.py +0 -1
transformers/models/videomae/configuration_videomae.py +0 -1
transformers/models/videomae/image_processing_videomae.py +31 -34
transformers/models/videomae/modeling_videomae.py +13 -15
transformers/models/videomae/video_processing_videomae.py +0 -1
transformers/models/vilt/configuration_vilt.py +2 -3
transformers/models/vilt/image_processing_vilt.py +29 -30
transformers/models/vilt/image_processing_vilt_fast.py +9 -10
transformers/models/vilt/modeling_vilt.py +83 -78
transformers/models/vilt/processing_vilt.py +2 -14
transformers/models/vipllava/configuration_vipllava.py +0 -1
transformers/models/vipllava/modeling_vipllava.py +45 -42
transformers/models/vipllava/modular_vipllava.py +30 -32
transformers/models/vision_encoder_decoder/configuration_vision_encoder_decoder.py +0 -1
transformers/models/vision_encoder_decoder/modeling_vision_encoder_decoder.py +18 -21
transformers/models/vision_text_dual_encoder/configuration_vision_text_dual_encoder.py +0 -1
transformers/models/vision_text_dual_encoder/modeling_vision_text_dual_encoder.py +18 -21
transformers/models/vision_text_dual_encoder/processing_vision_text_dual_encoder.py +2 -16
transformers/models/visual_bert/configuration_visual_bert.py +0 -1
transformers/models/visual_bert/modeling_visual_bert.py +92 -92
transformers/models/vit/configuration_vit.py +0 -1
transformers/models/vit/image_processing_vit.py +19 -22
transformers/models/vit/image_processing_vit_fast.py +0 -1
transformers/models/vit/modeling_vit.py +13 -15
transformers/models/vit_mae/configuration_vit_mae.py +0 -1
transformers/models/vit_mae/modeling_vit_mae.py +21 -23
transformers/models/vit_msn/configuration_vit_msn.py +0 -1
transformers/models/vit_msn/modeling_vit_msn.py +10 -12
transformers/models/vitdet/configuration_vitdet.py +0 -1
transformers/models/vitdet/modeling_vitdet.py +12 -14
transformers/models/vitmatte/configuration_vitmatte.py +2 -5
transformers/models/vitmatte/image_processing_vitmatte.py +15 -18
transformers/models/vitmatte/image_processing_vitmatte_fast.py +14 -16
transformers/models/vitmatte/modeling_vitmatte.py +13 -11
transformers/models/vitpose/configuration_vitpose.py +4 -7
transformers/models/vitpose/image_processing_vitpose.py +24 -25
transformers/models/vitpose/image_processing_vitpose_fast.py +9 -11
transformers/models/vitpose/modeling_vitpose.py +10 -12
transformers/models/vitpose_backbone/configuration_vitpose_backbone.py +0 -1
transformers/models/vitpose_backbone/modeling_vitpose_backbone.py +8 -10
transformers/models/vits/configuration_vits.py +0 -1
transformers/models/vits/modeling_vits.py +34 -35
transformers/models/vits/tokenization_vits.py +3 -4
transformers/models/vivit/configuration_vivit.py +0 -1
transformers/models/vivit/image_processing_vivit.py +36 -39
transformers/models/vivit/modeling_vivit.py +5 -7
transformers/models/vjepa2/__init__.py +0 -1
transformers/models/vjepa2/configuration_vjepa2.py +0 -1
transformers/models/vjepa2/modeling_vjepa2.py +30 -32
transformers/models/vjepa2/video_processing_vjepa2.py +0 -1
transformers/models/voxtral/__init__.py +0 -1
transformers/models/voxtral/configuration_voxtral.py +0 -1
transformers/models/voxtral/modeling_voxtral.py +19 -27
transformers/models/voxtral/modular_voxtral.py +12 -21
transformers/models/voxtral/processing_voxtral.py +25 -48
transformers/models/wav2vec2/configuration_wav2vec2.py +0 -1
transformers/models/wav2vec2/feature_extraction_wav2vec2.py +7 -10
transformers/models/wav2vec2/modeling_wav2vec2.py +67 -122
transformers/models/wav2vec2/processing_wav2vec2.py +6 -35
transformers/models/wav2vec2/tokenization_wav2vec2.py +20 -332
transformers/models/wav2vec2_bert/configuration_wav2vec2_bert.py +0 -1
transformers/models/wav2vec2_bert/modeling_wav2vec2_bert.py +65 -62
transformers/models/wav2vec2_bert/modular_wav2vec2_bert.py +52 -48
transformers/models/wav2vec2_bert/processing_wav2vec2_bert.py +6 -35
transformers/models/wav2vec2_conformer/configuration_wav2vec2_conformer.py +0 -1
transformers/models/wav2vec2_conformer/modeling_wav2vec2_conformer.py +84 -77
transformers/models/wav2vec2_conformer/modular_wav2vec2_conformer.py +37 -30
transformers/models/wav2vec2_phoneme/tokenization_wav2vec2_phoneme.py +16 -17
transformers/models/wav2vec2_with_lm/processing_wav2vec2_with_lm.py +36 -55
transformers/models/wavlm/configuration_wavlm.py +0 -1
transformers/models/wavlm/modeling_wavlm.py +45 -48
transformers/models/wavlm/modular_wavlm.py +4 -5
transformers/models/whisper/configuration_whisper.py +0 -1
transformers/models/whisper/english_normalizer.py +3 -4
transformers/models/whisper/feature_extraction_whisper.py +9 -24
transformers/models/whisper/generation_whisper.py +27 -48
transformers/models/whisper/modeling_whisper.py +73 -73
transformers/models/whisper/processing_whisper.py +3 -20
transformers/models/whisper/tokenization_whisper.py +9 -30
transformers/models/x_clip/configuration_x_clip.py +0 -1
transformers/models/x_clip/modeling_x_clip.py +70 -69
transformers/models/x_clip/processing_x_clip.py +2 -14
transformers/models/xcodec/configuration_xcodec.py +4 -6
transformers/models/xcodec/modeling_xcodec.py +20 -17
transformers/models/xglm/configuration_xglm.py +0 -1
transformers/models/xglm/modeling_xglm.py +59 -55
transformers/models/xglm/tokenization_xglm.py +1 -4
transformers/models/xlm/configuration_xlm.py +0 -1
transformers/models/xlm/modeling_xlm.py +139 -144
transformers/models/xlm/tokenization_xlm.py +3 -5
transformers/models/xlm_roberta/configuration_xlm_roberta.py +0 -1
transformers/models/xlm_roberta/modeling_xlm_roberta.py +195 -194
transformers/models/xlm_roberta/modular_xlm_roberta.py +50 -53
transformers/models/xlm_roberta/tokenization_xlm_roberta.py +1 -4
transformers/models/xlm_roberta_xl/configuration_xlm_roberta_xl.py +0 -1
transformers/models/xlm_roberta_xl/modeling_xlm_roberta_xl.py +94 -93
transformers/models/xlm_roberta_xl/modular_xlm_roberta_xl.py +67 -70
transformers/models/xlnet/configuration_xlnet.py +0 -11
transformers/models/xlnet/modeling_xlnet.py +152 -163
transformers/models/xlnet/tokenization_xlnet.py +1 -4
transformers/models/xlstm/configuration_xlstm.py +3 -5
transformers/models/xlstm/modeling_xlstm.py +62 -65
transformers/models/xmod/configuration_xmod.py +0 -1
transformers/models/xmod/modeling_xmod.py +101 -100
transformers/models/yolos/configuration_yolos.py +0 -1
transformers/models/yolos/image_processing_yolos.py +60 -62
transformers/models/yolos/image_processing_yolos_fast.py +18 -18
transformers/models/yolos/modeling_yolos.py +12 -14
transformers/models/yolos/modular_yolos.py +2 -4
transformers/models/yoso/configuration_yoso.py +0 -1
transformers/models/yoso/modeling_yoso.py +64 -63
transformers/models/zamba/configuration_zamba.py +0 -1
transformers/models/zamba/modeling_zamba.py +70 -70
transformers/models/zamba2/configuration_zamba2.py +36 -37
transformers/models/zamba2/modeling_zamba2.py +87 -89
transformers/models/zamba2/modular_zamba2.py +43 -45
transformers/models/zoedepth/configuration_zoedepth.py +1 -2
transformers/models/zoedepth/image_processing_zoedepth.py +28 -29
transformers/models/zoedepth/image_processing_zoedepth_fast.py +12 -15
transformers/models/zoedepth/modeling_zoedepth.py +21 -16
transformers/pipelines/__init__.py +59 -55
transformers/pipelines/any_to_any.py +14 -22
transformers/pipelines/audio_utils.py +1 -2
transformers/pipelines/automatic_speech_recognition.py +20 -12
transformers/pipelines/base.py +13 -17
transformers/pipelines/deprecated/__init__.py +0 -1
transformers/pipelines/document_question_answering.py +1 -1
transformers/pipelines/image_text_to_text.py +0 -1
transformers/pipelines/image_to_text.py +4 -44
transformers/pipelines/question_answering.py +5 -44
transformers/pipelines/text_classification.py +1 -14
transformers/pipelines/text_to_audio.py +2 -2
transformers/pipelines/token_classification.py +1 -22
transformers/pipelines/video_classification.py +1 -9
transformers/pipelines/zero_shot_audio_classification.py +0 -1
transformers/pipelines/zero_shot_classification.py +0 -6
transformers/pipelines/zero_shot_image_classification.py +0 -7
transformers/processing_utils.py +222 -151
transformers/quantizers/auto.py +2 -4
transformers/quantizers/base.py +19 -64
transformers/quantizers/quantizer_aqlm.py +1 -18
transformers/quantizers/quantizer_auto_round.py +1 -10
transformers/quantizers/quantizer_awq.py +3 -8
transformers/quantizers/quantizer_bitnet.py +1 -6
transformers/quantizers/quantizer_bnb_4bit.py +9 -49
transformers/quantizers/quantizer_bnb_8bit.py +9 -19
transformers/quantizers/quantizer_compressed_tensors.py +1 -4
transformers/quantizers/quantizer_eetq.py +2 -12
transformers/quantizers/quantizer_fbgemm_fp8.py +5 -14
transformers/quantizers/quantizer_finegrained_fp8.py +15 -10
transformers/quantizers/quantizer_fp_quant.py +4 -4
transformers/quantizers/quantizer_gptq.py +1 -4
transformers/quantizers/quantizer_higgs.py +2 -6
transformers/quantizers/quantizer_mxfp4.py +2 -28
transformers/quantizers/quantizer_quanto.py +14 -14
transformers/quantizers/quantizer_quark.py +0 -1
transformers/quantizers/quantizer_spqr.py +3 -8
transformers/quantizers/quantizer_torchao.py +31 -127
transformers/quantizers/quantizer_vptq.py +1 -10
transformers/testing_utils.py +31 -49
transformers/tokenization_mistral_common.py +554 -902
transformers/tokenization_utils_base.py +112 -124
transformers/tokenization_utils_sentencepiece.py +5 -6
transformers/tokenization_utils_tokenizers.py +30 -7
transformers/trainer.py +30 -11
transformers/trainer_callback.py +8 -0
transformers/trainer_jit_checkpoint.py +1 -2
transformers/trainer_seq2seq.py +4 -0
transformers/training_args.py +11 -13
transformers/utils/__init__.py +4 -0
transformers/utils/attention_visualizer.py +5 -5
transformers/utils/auto_docstring.py +598 -37
transformers/utils/doc.py +1 -1
transformers/utils/dummy_pt_objects.py +0 -42
transformers/utils/generic.py +21 -1
transformers/utils/import_utils.py +51 -9
transformers/utils/kernel_config.py +71 -18
transformers/utils/loading_report.py +3 -3
transformers/utils/quantization_config.py +16 -18
transformers/video_processing_utils.py +35 -32
transformers/video_utils.py +18 -22
{transformers-5.0.0rc1.dist-info → transformers-5.0.0rc3.dist-info}/METADATA +23 -24
transformers-5.0.0rc3.dist-info/RECORD +2067 -0
transformers-5.0.0rc1.dist-info/RECORD +0 -2003
{transformers-5.0.0rc1.dist-info → transformers-5.0.0rc3.dist-info}/WHEEL +0 -0
{transformers-5.0.0rc1.dist-info → transformers-5.0.0rc3.dist-info}/entry_points.txt +0 -0
{transformers-5.0.0rc1.dist-info → transformers-5.0.0rc3.dist-info}/licenses/LICENSE +0 -0
{transformers-5.0.0rc1.dist-info → transformers-5.0.0rc3.dist-info}/top_level.txt +0 -0

transformers/models/glm_image/modular_glm_image.py ADDED Viewed

@@ -0,0 +1,1480 @@
+# Copyright 2025 the HuggingFace Team. All rights reserved.
+#
+# Licensed under the Apache License, Version 2.0 (the "License");
+# you may not use this file except in compliance with the License.
+# You may obtain a copy of the License at
+#
+#     http://www.apache.org/licenses/LICENSE-2.0
+#
+# Unless required by applicable law or agreed to in writing, software
+# distributed under the License is distributed on an "AS IS" BASIS,
+# WITHOUT WARRANTIES OR CONDITIONS OF ANY KIND, either express or implied.
+# See the License for the specific language governing permissions and
+# limitations under the License.
+import math
+from collections.abc import Callable
+from typing import Any
+import numpy as np
+import torch.nn as nn
+import torch.nn.functional as F
+from ...cache_utils import Cache
+from ...configuration_utils import PreTrainedConfig
+from ...feature_extraction_utils import BatchFeature
+from ...generation import GenerationMixin
+from ...image_utils import ImageInput
+from ...modeling_utils import ALL_ATTENTION_FUNCTIONS, PreTrainedModel
+from ...processing_utils import ImagesKwargs, ProcessorMixin, Unpack
+from ...tokenization_utils_base import PreTokenizedInput, TextInput
+from ...utils import TransformersKwargs, is_torch_available, logging
+from ..chameleon.modeling_chameleon import ChameleonVQVAE, ChameleonVQVAEVectorQuantizer
+from ..glm4v.configuration_glm4v import Glm4vTextConfig, Glm4vVisionConfig
+from ..glm4v.modeling_glm4v import (
+    Glm4vCausalLMOutputWithPast,
+    Glm4vModel,
+    Glm4vModelOutputWithPast,
+    Glm4vPreTrainedModel,
+    Glm4vTextModel,
+    Glm4vVisionAttention,
+    Glm4vVisionBlock,
+    Glm4vVisionEmbeddings,
+    Glm4vVisionModel,
+    Glm4vVisionPatchEmbed,
+)
+from ..glm4v_moe.modeling_glm4v_moe import Glm4vMoeTextAttention, eager_attention_forward
+from ..qwen2_vl.image_processing_qwen2_vl import Qwen2VLImageProcessor
+from ..qwen2_vl.image_processing_qwen2_vl_fast import Qwen2VLImageProcessorFast
+from ..qwen2_vl.processing_qwen2_vl import Qwen2VLProcessorKwargs
+from ..siglip.modeling_siglip import SiglipMLP
+if is_torch_available():
+    import torch
+logger = logging.get_logger(__name__)
+class GlmImageVQVAEConfig(PreTrainedConfig):
+    r"""
+    This is the configuration class to store the configuration of a [`GlmImageVQModel`]. It is used to instantiate a
+    `GlmImageVQModel` according to the specified arguments, defining the model architecture.
+    Configuration objects inherit from [`PreTrainedConfig`] and can be used to control the model outputs. Read the
+    documentation from [`PreTrainedConfig`] for more information. Instantiating a
+    configuration with the defaults will yield a similar configuration to the VQModel of the
+    [zai-org/GLM-Image](https://huggingface.co/zai-org/GLM-Image) architecture.
+    Args:
+        embed_dim (`int`, *optional*, defaults to 2048):
+            Dimensionality of each embedding vector.
+        num_embeddings (`int`, *optional*, defaults to 16384):
+            Number of codebook embeddings.
+        latent_channels (`int`, *optional*, defaults to 1536):
+            Number of channels for the latent space.
+        in_channels (`int`, *optional*, defaults to 3):
+            Number of input channels.
+        initializer_range (`float`, *optional*, defaults to 0.02):
+            The standard deviation of the truncated_normal_initializer for initializing all weight matrices.
+    """
+    model_type = "glm_image_vqmodel"
+    base_config_key = "vq_config"
+    def __init__(
+        self,
+        embed_dim: int = 2048,
+        num_embeddings: int = 16384,
+        latent_channels: int = 1536,
+        in_channels: int = 3,
+        initializer_range=0.02,
+        **kwargs,
+    ):
+        super().__init__(**kwargs)
+        self.embed_dim = embed_dim
+        self.num_embeddings = num_embeddings
+        self.latent_channels = latent_channels
+        self.in_channels = in_channels
+        self.initializer_range = initializer_range
+class GlmImageVisionConfig(Glm4vVisionConfig):
+    r"""
+    This is the configuration class to store the configuration of a [`GlmImageVisionModel`]. It is used to instantiate an GlmImageVisionModel
+    model according to the specified arguments, defining the model architecture. Instantiating a configuration with the defaults will yield
+    a similar configuration to that of
+    GLM-Image [zai-org/GLM-Image](https://huggingface.co/zai-org/GLM-Image).
+    Args:
+        depth (`int`, *optional*, defaults to 40):
+            Number of layers (depth) in the model.
+        hidden_size (`int`, *optional*, defaults to 1536):
+            Dimensionality of the encoder layers and the pooler layer.
+        hidden_act (`str` or `function`, *optional*, defaults to `"gelu"`):
+            The non-linear activation function (function or string) in the encoder and pooler. If string, `"gelu"`,
+            `"relu"`, `"selu"` and `"gelu_new"` are supported.
+        attention_bias (`bool`, *optional*, defaults to `True`):
+            Whether to add a bias to the queries, keys and values.
+        attention_dropout (`float`, *optional*, defaults to 0.0):
+            Dropout probability for attention weights.
+        num_heads (`int`, *optional*, defaults to 16):
+            Number of attention heads for each attention layer in the Transformer architecture.
+        in_channels (`int`, *optional*, defaults to 3):
+            Number of input channels.
+        image_size (`int` or `list[int]`, *optional*, defaults to 2048):
+                The size (resolution) of each image.
+        patch_size (`int`, *optional*, defaults to 16):
+            The size (resolution) of each patch.
+        layer_norm_eps (`float`, *optional*, defaults to 1e-06):
+            The epsilon used by the layer normalization layers.
+        spatial_merge_size (`int`, *optional*, defaults to 1):
+            The size used for merging spatial dimensions.
+        intermediate_size (`int`, *optional*, defaults to 6144):
+            Dimensionality of the "intermediate" (i.e., feed-forward) layer in the Transformer encoder.
+        initializer_range (`float`, *optional*, defaults to 0.02):
+            The standard deviation of the truncated_normal_initializer for initializing all weight matrices.
+    """
+    model_type = "glm_image_vision"
+    base_config_key = "vision_config"
+    def __init__(
+        self,
+        depth=40,
+        hidden_size=1536,
+        hidden_act="gelu",
+        attention_bias=True,
+        attention_dropout=0.0,
+        num_heads=16,
+        in_channels=3,
+        image_size=2048,
+        patch_size=16,
+        layer_norm_eps=1e-06,
+        spatial_merge_size=1,
+        intermediate_size=6144,
+        initializer_range=0.02,
+        **kwargs,
+    ):
+        super().__init__(**kwargs)
+        del self.out_hidden_size
+        del self.rms_norm_eps
+        del self.temporal_patch_size
+        self.layer_norm_eps = layer_norm_eps
+class GlmImageTextConfig(Glm4vTextConfig):
+    r"""
+    This is the configuration class to store the configuration of a [`GlmImageTextModel`]. It is used to instantiate a
+    GLM-Image model according to the specified arguments, defining the model architecture. Instantiating a
+    configuration with the defaults will yield a similar configuration to that of
+    GLM-Image [zai-org/GLM-Image](https://huggingface.co/zai-org/GLM-Image).
+    Configuration objects inherit from [`PreTrainedConfig`] and can be used to control the model outputs. Read the
+    documentation from [`PreTrainedConfig`] for more information.
+    Args:
+        vocab_size (`int`, *optional*, defaults to 168064):
+            Vocabulary size of the GlmImage model. Defines the number of different tokens that can be represented by the
+            `inputs_ids` passed when calling [`GlmImageModel`]
+        hidden_size (`int`, *optional*, defaults to 4096):
+            Dimension of the hidden representations.
+        intermediate_size (`int`, *optional*, defaults to 13696):
+            Dimension of the MLP representations.
+        num_hidden_layers (`int`, *optional*, defaults to 40):
+            Number of hidden layers in the Transformer encoder.
+        num_attention_heads (`int`, *optional*, defaults to 32):
+            Number of attention heads for each attention layer in the Transformer encoder.
+        num_key_value_heads (`int`, *optional*, defaults to 2):
+            This is the number of key_value heads that should be used to implement Grouped Query Attention. If
+            `num_key_value_heads=num_attention_heads`, the model will use Multi Head Attention (MHA), if
+            `num_key_value_heads=1` the model will use Multi Query Attention (MQA) otherwise GQA is used. When
+            converting a multi-head checkpoint to a GQA checkpoint, each group key and value head should be constructed
+            by meanpooling all the original heads within that group. For more details checkout [this
+            paper](https://huggingface.co/papers/2305.13245). If it is not specified, will default to `32`.
+        hidden_act (`str` or `function`, *optional*, defaults to `"silu"`):
+            The non-linear activation function (function or string) in the decoder.
+        max_position_embeddings (`int`, *optional*, defaults to 32768):
+            The maximum sequence length that this model might ever be used with.
+        initializer_range (`float`, *optional*, defaults to 0.02):
+            The standard deviation of the truncated_normal_initializer for initializing all weight matrices.
+        rms_norm_eps (`float`, *optional*, defaults to 1e-05):
+            The epsilon used by the rms normalization layers.
+        use_cache (`bool`, *optional*, defaults to `True`):
+            Whether or not the model should return the last key/values attentions (not used by all models). Only
+            relevant if `config.is_decoder=True`.
+        tie_word_embeddings (`bool`, *optional*, defaults to `False`):
+            Whether the model's input and output word embeddings should be tied.
+        attention_dropout (`float`, *optional*, defaults to 0.0):
+            The dropout ratio for the attention probabilities.
+        rope_parameters (`RopeParameters`, *optional*):
+            Dictionary containing the configuration parameters for the RoPE embeddings. The dictionary should contain
+            a value for `rope_theta` and optionally parameters used for scaling in case you want to use RoPE
+            with longer `max_position_embeddings`.
+        vision_vocab_size (`int`, *optional*, defaults to 16512):
+            Vision vocabulary size of the GlmImage model. Defines the number of different tokens that can be represented
+            by the `inputs_ids` passed when calling [`GlmImageVisionModel`]
+        attention_bias (`bool`, *optional*, defaults to `True`):
+            Whether to add a bias to the queries, keys and values.
+    ```python
+    >>> from transformers import GlmImageTextModel, GlmImageConfig
+    >>> # Initializing a GlmImageConfig style configuration
+    >>> configuration = GlmImageConfig()
+    >>> # Initializing a model from the GlmImageConfig style configuration
+    >>> model = GlmImageTextModel(configuration)
+    >>> # Accessing the model configuration
+    >>> configuration = model.config
+    ```"""
+    def __init__(
+        self,
+        vocab_size: int | None = 168064,
+        vision_vocab_size: int | None = 16512,
+        attention_bias: bool | None = True,
+        tie_word_embeddings: bool | None = False,
+        **super_kwargs,
+    ):
+        self.vocab_size = vocab_size
+        self.vision_vocab_size = vision_vocab_size
+        self.attention_bias = attention_bias
+        super().__init__(
+            tie_word_embeddings=tie_word_embeddings, ignore_keys_at_rope_validation={"mrope_section"}, **super_kwargs
+        )
+class GlmImageConfig(PreTrainedConfig):
+    r"""
+    This is the configuration class to store the configuration of a [`GlmImageModel`]. It is used to instantiate a
+    GLM-Image model according to the specified arguments, defining the model architecture. Instantiating a
+    configuration with the defaults will yield a similar configuration to that of
+    GLM-Image [zai-org/GLM-Image](https://huggingface.co/zai-org/GLM-Image) architecture.
+    Configuration objects inherit from [`PreTrainedConfig`] and can be used to control the model outputs. Read the
+    documentation from [`PreTrainedConfig`] for more information.
+    Args:
+        text_config (`Union[PreTrainedConfig, dict]`, *optional*, defaults to `GlmImageTextConfig`):
+            The config object or dictionary of the text backbone.
+        vision_config (`Union[PreTrainedConfig, dict]`,  *optional*, defaults to `GlmImageVisionConfig`):
+            The config object or dictionary of the vision backbone.
+        vq_config (`Union[Dict, GlmImageVQVAEConfig]`, *optional*):
+            GlmImageVQVAEConfig instance containing the configuration for the VQ-VAE model.
+        image_token_id (`int`, *optional*, defaults to 167855):
+            The image token index to encode the image prompt.
+        image_start_token_id (`int`, *optional*, defaults to 16384):
+            The image start token index to encode the start of image.
+        image_end_token_id (`int`, *optional*, defaults to 16385):
+            The image end token index to encode the end of image.
+    ```python
+    >>> from transformers import Glm4vForConditionalGeneration, Glm4vConfig
+    >>> # Initializing a GLM-Image style configuration
+    >>> configuration = Glm4vConfig()
+    >>> # Initializing a model from the GLM-Image style configuration
+    >>> model = Glm4vForConditionalGeneration(configuration)
+    >>> # Accessing the model configuration
+    >>> configuration = model.config
+    ```"""
+    model_type = "glm_image"
+    sub_configs = {
+        "vision_config": GlmImageVisionConfig,
+        "text_config": GlmImageTextConfig,
+        "vq_config": GlmImageVQVAEConfig,
+    }
+    keys_to_ignore_at_inference = ["past_key_values"]
+    def __init__(
+        self,
+        text_config=None,
+        vision_config=None,
+        vq_config=None,
+        image_token_id=167855,
+        image_start_token_id=16384,
+        image_end_token_id=16385,
+        **kwargs,
+    ):
+        if isinstance(vision_config, dict):
+            vision_config = self.sub_configs["vision_config"](**vision_config)
+        elif vision_config is None:
+            vision_config = self.sub_configs["vision_config"](**kwargs)
+        if isinstance(vq_config, dict):
+            vq_config = self.sub_configs["vq_config"](**vq_config)
+        elif vq_config is None:
+            vq_config = self.sub_configs["vq_config"](**kwargs)
+        if isinstance(text_config, dict):
+            text_config = self.sub_configs["text_config"](**text_config)
+        elif text_config is None:
+            text_config = self.sub_configs["text_config"](**kwargs)
+        self.image_token_id = image_token_id
+        self.image_start_token_id = image_start_token_id
+        self.image_end_token_id = image_end_token_id
+        self.text_config = text_config
+        self.vision_config = vision_config
+        self.vq_config = vq_config
+        super().__init__(**kwargs)
+class GlmImageVisionMLP(SiglipMLP):
+    pass
+class GlmImageVisionAttention(Glm4vVisionAttention):
+    def __init__(self, config: GlmImageVisionConfig) -> None:
+        super().__init__(config)
+        self.qkv = nn.Linear(config.hidden_size, config.hidden_size * 3, bias=config.attention_bias)
+        self.proj = nn.Linear(config.hidden_size, config.hidden_size, bias=config.attention_bias)
+    def forward(
+        self,
+        hidden_states: torch.Tensor,
+        cu_seqlens: torch.Tensor,
+        **kwargs,
+    ) -> torch.Tensor:
+        seq_length = hidden_states.shape[0]
+        query_states, key_states, value_states = (
+            self.qkv(hidden_states).reshape(seq_length, 3, self.num_heads, -1).permute(1, 0, 2, 3).unbind(0)
+        )
+        query_states = query_states.transpose(0, 1).unsqueeze(0)
+        key_states = key_states.transpose(0, 1).unsqueeze(0)
+        value_states = value_states.transpose(0, 1).unsqueeze(0)
+        attention_interface: Callable = eager_attention_forward
+        if self.config._attn_implementation != "eager":
+            attention_interface = ALL_ATTENTION_FUNCTIONS[self.config._attn_implementation]
+        if "flash" in self.config._attn_implementation:
+            # Flash Attention: Use cu_seqlens for variable length attention
+            max_seqlen = (cu_seqlens[1:] - cu_seqlens[:-1]).max()
+            attn_output, _ = attention_interface(
+                self,
+                query_states,
+                key_states,
+                value_states,
+                attention_mask=None,
+                scaling=self.scaling,
+                dropout=0.0 if not self.training else self.attention_dropout,
+                cu_seq_lens_q=cu_seqlens,
+                cu_seq_lens_k=cu_seqlens,
+                max_length_q=max_seqlen,
+                max_length_k=max_seqlen,
+                is_causal=False,
+                **kwargs,
+            )
+        else:
+            # Other implementations: Process each chunk separately
+            lengths = cu_seqlens[1:] - cu_seqlens[:-1]
+            splits = [
+                torch.split(tensor, lengths.tolist(), dim=2) for tensor in (query_states, key_states, value_states)
+            ]
+            attn_outputs = [
+                attention_interface(
+                    self,
+                    q,
+                    k,
+                    v,
+                    attention_mask=None,
+                    scaling=self.scaling,
+                    dropout=0.0 if not self.training else self.attention_dropout,
+                    is_causal=False,
+                    **kwargs,
+                )[0]
+                for q, k, v in zip(*splits)
+            ]
+            attn_output = torch.cat(attn_outputs, dim=1)
+        attn_output = attn_output.reshape(seq_length, -1).contiguous()
+        attn_output = self.proj(attn_output)
+        return attn_output
+class GlmImageVisionPatchEmbed(Glm4vVisionPatchEmbed):
+    def __init__(self, config: GlmImageVisionConfig) -> None:
+        super().__init__(config)
+        del self.temporal_patch_size
+        kernel_size = [self.patch_size, self.patch_size]
+        self.proj = nn.Conv2d(self.in_channels, self.embed_dim, kernel_size=kernel_size, stride=kernel_size)
+    def forward(self, hidden_states):
+        target_dtype = self.proj.weight.dtype
+        hidden_states = hidden_states.view(-1, self.in_channels, self.patch_size, self.patch_size)
+        hidden_states = self.proj(hidden_states.to(dtype=target_dtype)).view(-1, self.embed_dim)
+        return hidden_states
+class GlmImageVisionEmbeddings(Glm4vVisionEmbeddings):
+    def __init__(self, config: GlmImageVisionConfig) -> None:
+        super().__init__(config)
+        self.interpolated_method = "bilinear"
+class GlmImageVisionBlock(Glm4vVisionBlock):
+    def __init__(self, config: GlmImageVisionConfig):
+        super().__init__(config)
+        self.norm1 = nn.LayerNorm(config.hidden_size, eps=config.layer_norm_eps)
+        self.norm2 = nn.LayerNorm(config.hidden_size, eps=config.layer_norm_eps)
+        self.attn = GlmImageVisionAttention(config)
+        self.mlp = GlmImageVisionMLP(config)
+    def forward(
+        self,
+        hidden_states: torch.Tensor,
+        cu_seqlens: torch.Tensor,
+        **kwargs: Unpack[TransformersKwargs],
+    ) -> torch.Tensor:
+        r"""
+        cu_seqlens (`torch.Tensor` of shape `(num_images_or_videos + 1,)`):
+            The cumulative sequence lengths of each image or video feature.
+        position_embeddings (`tuple(torch.Tensor, torch.Tensor)` of shape `(num_patches, head_dim // 2)`):
+            The cosine and sine position embeddings for vision attention.
+        """
+        residual = hidden_states
+        hidden_states = self.norm1(hidden_states)
+        hidden_states = self.attn(
+            hidden_states,
+            cu_seqlens=cu_seqlens,
+            **kwargs,
+        )
+        hidden_states = residual + hidden_states
+        residual = hidden_states
+        hidden_states = self.norm2(hidden_states)
+        hidden_states = self.mlp(hidden_states)
+        hidden_states = residual + hidden_states
+        return hidden_states
+class GlmImageTextAttention(Glm4vMoeTextAttention):
+    pass
+class GlmImagePreTrainedModel(Glm4vPreTrainedModel):
+    config: GlmImageConfig
+    input_modalities = ("image", "text")
+    @torch.no_grad()
+    def _init_weights(self, module):
+        PreTrainedModel._init_weights(module)
+class GlmImageModelOutputWithPast(Glm4vModelOutputWithPast):
+    pass
+class GlmImageVQVAEVectorQuantizer(ChameleonVQVAEVectorQuantizer):
+    def __init__(self, config: GlmImageVQVAEConfig):
+        super().__init__(config)
+        self.num_embeddings = config.num_embeddings
+        self.embedding_dim = config.embed_dim
+        self.beta = getattr(config, "beta", 0.25)
+        self.embedding = nn.Embedding(self.num_embeddings, self.embedding_dim)
+    def forward(self, hidden_state: torch.Tensor):
+        hidden_state = hidden_state.permute(0, 2, 3, 1).contiguous()
+        hidden_state_flattened = hidden_state.view(-1, self.embedding_dim)
+        # L2 normalize
+        hidden_state = F.normalize(hidden_state, p=2, dim=-1)
+        hidden_state_flattened = F.normalize(hidden_state_flattened, p=2, dim=-1)
+        embedding = F.normalize(self.embedding.weight, p=2, dim=-1)
+        # distances from z to embeddings e_j (z - e)^2 = z^2 + e^2 - 2 e * z
+        distances = (
+            torch.sum(hidden_state_flattened**2, dim=1, keepdim=True)
+            + torch.sum(embedding**2, dim=1)
+            - 2 * torch.einsum("bd,dn->bn", hidden_state_flattened, embedding.transpose(0, 1))
+        )
+        min_encoding_indices = torch.argmin(distances, dim=1)
+        hidden_state_quant = embedding[min_encoding_indices].view(hidden_state.shape)
+        # compute loss for embedding
+        loss = torch.mean((hidden_state_quant.detach() - hidden_state) ** 2) + self.beta * torch.mean(
+            (hidden_state_quant - hidden_state.detach()) ** 2
+        )
+        # preserve gradients
+        hidden_state_quant = hidden_state + (hidden_state_quant - hidden_state).detach()
+        # reshape back to match original input shape
+        hidden_state_quant = hidden_state_quant.permute(0, 3, 1, 2).contiguous()
+        return hidden_state_quant, loss, min_encoding_indices
+class GlmImageVQVAE(ChameleonVQVAE):
+    _no_split_modules = [
+        "GlmImageVQVAEVectorQuantizer",
+    ]
+    def __init__(self, config: GlmImageVQVAEConfig):
+        super().__init__(config)
+        del self.encoder
+    def encode(self, hidden_states):
+        hidden_states = self.quant_conv(hidden_states)
+        quant, emb_loss, indices = self.quantize(hidden_states)
+        return quant, emb_loss, indices
+class GlmImageVisionModel(Glm4vVisionModel):
+    config: GlmImageVisionConfig
+    main_input_name = "pixel_values"
+    input_modalities = ("image",)
+    def __init__(self, config: GlmImageVisionConfig):
+        super().__init__(config)
+        head_dim = config.hidden_size // config.num_heads
+        self.head_dim = head_dim
+        del self.merger
+        del self.rotary_pos_emb
+        del self.post_conv_layernorm
+        del self.downsample
+        del self.post_layernorm
+    def rot_pos_emb(self, grid_thw):
+        pos_ids = []
+        for t, h, w in grid_thw:
+            hpos_ids = torch.arange(h).unsqueeze(1).expand(-1, w)
+            hpos_ids = hpos_ids.reshape(
+                h // self.spatial_merge_size,
+                self.spatial_merge_size,
+                w // self.spatial_merge_size,
+                self.spatial_merge_size,
+            )
+            hpos_ids = hpos_ids.permute(0, 2, 1, 3)
+            hpos_ids = hpos_ids.flatten()
+            wpos_ids = torch.arange(w).unsqueeze(0).expand(h, -1)
+            wpos_ids = wpos_ids.reshape(
+                h // self.spatial_merge_size,
+                self.spatial_merge_size,
+                w // self.spatial_merge_size,
+                self.spatial_merge_size,
+            )
+            wpos_ids = wpos_ids.permute(0, 2, 1, 3)
+            wpos_ids = wpos_ids.flatten()
+            pos_ids.append(torch.stack([hpos_ids, wpos_ids], dim=-1).repeat(t, 1))
+        pos_ids = torch.cat(pos_ids, dim=0)
+        return pos_ids
+    def forward(self, pixel_values: torch.Tensor, grid_thw: torch.Tensor, **kwargs) -> torch.Tensor:
+        """
+        Args:
+            pixel_values (`torch.Tensor` of shape `(total_patches, num_channels * patch_size * patch_size)`):
+                Packed pixel values.
+            grid_thw (`torch.Tensor` of shape `(num_images, 3)`):
+                The temporal, height and width of feature shape of each image.
+        Returns:
+            `torch.Tensor` of shape `(total_patches, hidden_size)`: Hidden states.
+        """
+        hidden_states = self.patch_embed(pixel_values)
+        image_type_ids = self.rot_pos_emb(grid_thw)
+        cu_seqlens = torch.repeat_interleave(grid_thw[:, 1] * grid_thw[:, 2], grid_thw[:, 0]).cumsum(
+            dim=0,
+            dtype=grid_thw.dtype if torch.jit.is_tracing() else torch.int32,
+        )
+        cu_seqlens = F.pad(cu_seqlens, (1, 0), value=0)
+        seqlens = (cu_seqlens[1:] - cu_seqlens[:-1]).tolist()
+        hidden_states = self.embeddings(
+            hidden_states,
+            seqlens,
+            grid_thw,
+            image_type_ids[:, 0].to(hidden_states.device),
+            image_type_ids[:, 1].to(hidden_states.device),
+        )
+        # Transformer blocks (no position_embeddings needed, already added above)
+        for blk in self.blocks:
+            hidden_states = blk(
+                hidden_states,
+                cu_seqlens=cu_seqlens,
+            )
+        return hidden_states
+class GlmImageTextModel(Glm4vTextModel):
+    pass
+class GlmImageModel(Glm4vModel):
+    def __init__(self, config):
+        super().__init__(config)
+        self.visual = GlmImageVisionModel._from_config(config.vision_config)
+        self.language_model = GlmImageTextModel._from_config(config.text_config)
+        self.vqmodel = GlmImageVQVAE._from_config(config.vq_config)
+        self.rope_deltas = None  # cache rope_deltas here
+        # Initialize weights and apply final processing
+        self.post_init()
+    def get_rope_index(
+        self,
+        input_ids: torch.LongTensor | None = None,
+        image_grid_thw: torch.LongTensor | None = None,
+        attention_mask: torch.LongTensor | None = None,
+    ) -> tuple[torch.Tensor, torch.Tensor]:
+        """
+        Calculate the 3D rope index for image generation task.
+        Explanation:
+            Each embedding sequence may contain image tokens (for generation) and text tokens,
+            or just text tokens.
+            Input format:
+                - Text-to-Image: [text tokens] + <|dit_token_16384|>
+                - Image-to-Image: <|dit_token_16384|> [image tokens] <|dit_token_16385|> + [text tokens] + <|dit_token_16384|>
+            For pure text embedding sequence, the rotary position embedding is the same across all 3 dimensions.
+            Examples:
+                input_ids: [T T T T T], here T is for text.
+                temporal position_ids: [0, 1, 2, 3, 4]
+                height position_ids: [0, 1, 2, 3, 4]
+                width position_ids: [0, 1, 2, 3, 4]
+            For sequences with image tokens, we use special markers to denote image regions:
+                - <|dit_token_16384|>: image start marker
+                - <|dit_token_16385|>: image end marker
+                - Image tokens between these markers use 2D spatial position encoding.
+            For image tokens:
+                - temporal: stays constant at (image_start_pos + 1)
+                - height: increments every w tokens, representing row position
+                - width: cycles from 0 to w-1, representing column position
+            After each image region, the next position jumps to: image_start_pos + 1 + max(h, w)
+            This ensures sufficient positional separation between images and subsequent tokens.
+            Examples:
+                === Case 1: Image-to-Image Generation ===
+                Source image with grid [1, 3, 2], followed by text, then generation.
+                input_ids: [<|dit_token_16384|> V V V V V V <|dit_token_16385|> T T T T <|dit_token_16384|>]
+                image_grid_thw: [[1, 3, 2], [1, 4, 4]]  # first is source, second is target
+                For source image (h=3, w=2, 6 tokens):
+                    Start marker at position 0
+                    Image tokens at temporal=1, height=[1,1,2,2,3,3], width=[1,2,1,2,1,2]
+                    End marker at position 4 (= 0 + 1 + max(3,2))
+                Text tokens and trailing start marker continue from position 5.
+                Full prefill position_ids:
+                temporal: [0, 1,1,1,1,1,1, 4, 5,6,7,8, 9]
+                height:   [0, 1,1,2,2,3,3, 4, 5,6,7,8, 9]
+                width:    [0, 1,2,1,2,1,2, 4, 5,6,7,8, 9]
+                Decode stage: use image_grid_thw[-1] = [1, 4, 4] to build cached position_ids,
+                starting from gen_st_idx = 10.
+                === Case 2: Text-to-Image Generation (multi-resolution) ===
+                Pure text input with two image_grids for progressive generation.
+                input_ids: [hello<sop>3 3<eop><sop>3 2<eop><|dit_token_16384|>]
+                Assume "hello<sop>3 3<eop><sop>3 2<eop>" = 4 tokens (positions 0-3)
+                <|dit_token_16384|> at position 4
+                image_grid_thw: [[1, 3, 3], [1, 3, 2]]
+                    - image_grid_thw[-1] = [1, 3, 2]: first generated image (smaller/draft)
+                    - image_grid_thw[-2] = [1, 3, 3]: second generated image (larger/final)
+                Prefill position_ids (5 tokens: 4 text + 1 start marker):
+                temporal: [0, 1, 2, 3, 4]
+                height:   [0, 1, 2, 3, 4]
+                width:    [0, 1, 2, 3, 4]
+                Decode stage builds position_ids in reverse order of image_grid_thw:
+                First: image_grid_thw[-1] = [1, 3, 2] (6 tokens), starting at position 5:
+                temporal: [5, 5, 5, 5, 5, 5]
+                height:   [5, 5, 6, 6, 7, 7]
+                width:    [5, 6, 5, 6, 5, 6]
+                next_pos = 5 + max(3, 2) = 8
+                Then: image_grid_thw[-2] = [1, 3, 3] (9 tokens), starting at position 8:
+                temporal: [8, 8, 8, 8, 8, 8, 8, 8, 8]
+                height:   [8, 8, 8, 9, 9, 9, 10, 10, 10]
+                width:    [8, 9, 10, 8, 9, 10, 8, 9, 10]
+                next_pos = 8 + max(3, 3) = 11
+                Finally: <|dit_token_16385|> end marker at position 11
+                Full sequence position_ids (prefill + decode):
+                temporal: [0,1,2,3, 4, 5,5,5,5,5,5, 8,8,8,8,8,8,8,8,8, 11]
+                height:   [0,1,2,3, 4, 5,5,6,6,7,7, 8,8,8,9,9,9,10,10,10, 11]
+                width:    [0,1,2,3, 4, 5,6,5,6,5,6, 8,9,10,8,9,10,8,9,10, 11]
+                _cached_decode_position_ids shape: [3, 6 + 9 + 1] = [3, 16]
+                (includes all generated image tokens + end marker)
+        Args:
+            input_ids (`torch.LongTensor` of shape `(batch_size, sequence_length)`):
+                Indices of input sequence tokens in the vocabulary. Padding will be ignored by default
+                should you provide it.
+            image_grid_thw (`torch.LongTensor` of shape `(num_images, 3)`, *optional*):
+                The temporal, height and width of feature shape of each image. For image generation,
+                temporal is typically 1.
+                - For image-to-image: includes source image grids + target image grid(s)
+                - For text-to-image with multi-resolution: includes multiple target grids,
+                  processed in reverse order (last grid first, second-to-last grid second, etc.)
+            attention_mask (`torch.Tensor` of shape `(batch_size, sequence_length)`, *optional*):
+                Mask to avoid performing attention on padding token indices. Mask values selected in `[0, 1]`:
+                - 1 for tokens that are **not masked**,
+                - 0 for tokens that are **masked**.
+        Returns:
+            position_ids (`torch.LongTensor` of shape `(3, batch_size, sequence_length)`):
+                Position IDs for temporal, height, and width dimensions.
+            mrope_position_deltas (`torch.Tensor` of shape `(batch_size, 1)`):
+                Position deltas for multi-modal rotary position embedding (zeros for this task).
+        """
+        batch_size, seq_len = input_ids.shape
+        device = input_ids.device
+        dtype = input_ids.dtype
+        image_start_token_id = self.config.image_start_token_id
+        image_end_token_id = self.config.image_end_token_id
+        num_complete_images = (input_ids == image_end_token_id).sum().item()
+        position_ids = torch.ones(
+            3, input_ids.shape[0], input_ids.shape[1], dtype=input_ids.dtype, device=input_ids.device
+        )
+        text_positions = torch.arange(seq_len)[None, :].repeat(3, 1)
+        for batch_idx in range(batch_size):
+            curr_input_ids = input_ids[batch_idx]
+            if attention_mask is not None:
+                curr_input_ids = curr_input_ids[attention_mask[batch_idx] == 1]
+            image_end = torch.where(curr_input_ids == image_end_token_id)[0]
+            image_start = torch.where(curr_input_ids == image_start_token_id)[0] + 1
+            current_pos = 0  # track the current position value
+            prev_image_end = 0
+            curr_position_ids = []
+            for start, end, grid in zip(image_start, image_end, image_grid_thw):
+                _, num_width_grid, num_height_grid = grid
+                # Create text position ids first if there are text tokens before image
+                llm_pos_length = start - prev_image_end
+                llm_position_ids = text_positions[:, current_pos : current_pos + llm_pos_length].to(
+                    device=input_ids.device
+                )
+                current_pos += llm_position_ids.shape[-1]
+                # Now create image position ids for each grid
+                image_seq_length = num_height_grid * num_width_grid
+                h_grids = image_seq_length // num_height_grid + current_pos
+                w_grids = image_seq_length // num_width_grid + current_pos
+                position_width = torch.arange(current_pos, w_grids, device=input_ids.device).repeat(num_width_grid)
+                position_height = torch.arange(current_pos, h_grids, device=input_ids.device).repeat_interleave(
+                    num_height_grid
+                )
+                position_temporal = torch.full(
+                    (image_seq_length,), current_pos, device=input_ids.device, dtype=torch.long
+                )
+                vision_position_ids = torch.stack([position_temporal, position_height, position_width], dim=0)
+                current_pos += max(num_height_grid, num_width_grid)
+                prev_image_end = end
+                curr_position_ids.append(torch.cat([llm_position_ids, vision_position_ids], dim=-1))
+            # Add position ids for the last text tokens if any
+            end_position = len(curr_input_ids) - prev_image_end
+            llm_position_ids = text_positions[:, current_pos : current_pos + end_position].to(device=input_ids.device)
+            current_pos += llm_position_ids.shape[-1]
+            curr_position_ids.append(llm_position_ids)
+            curr_position_ids = torch.cat(curr_position_ids, dim=-1)
+            if attention_mask is not None:
+                position_ids[:, batch_idx, attention_mask[batch_idx] == 1] = curr_position_ids.to(position_ids.device)
+            else:
+                position_ids[:, batch_idx, :] = curr_position_ids.to(position_ids.device)
+        # Build and store position ids for tokens that will be generated. Later we will just
+        # slice these instead of computing each decoding step
+        self._prefill_len = seq_len
+        if image_grid_thw is not None and len(image_grid_thw) > 0:
+            num_decode_grids = len(image_grid_thw) - num_complete_images
+            num_decode_grids = max(num_decode_grids, 0)
+            decode_pos = current_pos
+            decode_temporal_list = []
+            decode_height_list = []
+            decode_width_list = []
+            for i in range(1, num_decode_grids + 1):
+                grid_idx = -i
+                h = image_grid_thw[grid_idx, 1].item()
+                w = image_grid_thw[grid_idx, 2].item()
+                total_tokens = h * w
+                h_indices = torch.arange(h, device=device).unsqueeze(1).expand(h, w).flatten()
+                w_indices = torch.arange(w, device=device).unsqueeze(0).expand(h, w).flatten()
+                decode_temporal_list.append(torch.full((total_tokens,), decode_pos, device=device, dtype=torch.long))
+                decode_height_list.append(decode_pos + h_indices)
+                decode_width_list.append(decode_pos + w_indices)
+                decode_pos = decode_pos + max(h, w)
+            decode_temporal_list.append(torch.tensor([decode_pos], device=device, dtype=torch.long))
+            decode_height_list.append(torch.tensor([decode_pos], device=device, dtype=torch.long))
+            decode_width_list.append(torch.tensor([decode_pos], device=device, dtype=torch.long))
+            self._cached_decode_position_ids = torch.stack(
+                [
+                    torch.cat(decode_temporal_list, dim=0),
+                    torch.cat(decode_height_list, dim=0),
+                    torch.cat(decode_width_list, dim=0),
+                ],
+                dim=0,
+            )
+        else:
+            self._cached_decode_position_ids = None
+        mrope_position_deltas = torch.zeros([batch_size, 1], dtype=dtype, device=device)
+        return position_ids, mrope_position_deltas
+    def get_image_tokens(
+        self,
+        hidden_states: torch.FloatTensor,
+        image_grid_thw: torch.LongTensor,
+    ) -> torch.LongTensor:
+        """
+        Tokenizes image features into discrete tokens with VQVAE module.
+        Args:
+            hidden_states (`torch.FloatTensor` of shape `(total_patches, hidden_size)`):
+                The packed image features from vision encoder.
+            image_grid_thw (`torch.LongTensor` of shape `(num_images, 3)`):
+                The temporal, height and width of feature shape of each image.
+        Returns:
+            image_tokens (`torch.LongTensor` of shape `(total_patches,)`):
+                Discrete token indices from the VQVAE codebook.
+        """
+        hidden_size = hidden_states.shape[-1]
+        split_sizes = (image_grid_thw.prod(dim=-1)).tolist()
+        hidden_states_list = torch.split(hidden_states, split_sizes, dim=0)
+        all_image_toks = []
+        for i, hs in enumerate(hidden_states_list):
+            grid_t, grid_h, grid_w = image_grid_thw[i].tolist()
+            hs = hs.view(grid_t, grid_h, grid_w, hidden_size)
+            hs = hs.permute(0, 3, 1, 2).contiguous()
+            _, _, image_toks = self.vqmodel.encode(hs)
+            all_image_toks.append(image_toks)
+        return torch.cat(all_image_toks, dim=0)
+    def get_video_features(self):
+        raise AttributeError("Not needed for GlmImage")
+    def get_placeholder_mask(
+        self,
+        input_ids: torch.LongTensor,
+        image_ids: torch.LongTensor,
+    ):
+        """
+        Replace image placeholder tokens in input_ids with actual image token ids from VQVAE.
+        Args:
+            input_ids (`torch.LongTensor` of shape `(batch_size, seq_len)`):
+                Input token ids with image placeholders.
+            image_ids (`torch.LongTensor` of shape `(num_images, num_tokens_per_image)` or flattened):
+                Discrete token indices from the VQVAE codebook.
+        Returns:
+            special_image_mask (`torch.LongTensor` of shape `(batch_size, seq_len)`):
+                Mask indicating positions in input ids that will be replaced by actual image tokens.
+        """
+        special_image_mask = input_ids == self.config.image_token_id
+        n_placeholder_tokens = special_image_mask.sum().item()
+        n_image_tokens = image_ids.shape[0]
+        if n_placeholder_tokens != n_image_tokens:
+            raise ValueError(
+                f"Number of image placeholder tokens ({n_placeholder_tokens}) does not match "
+                f"number of image tokens from VQVAE ({n_image_tokens})"
+            )
+        return special_image_mask
+    def forward(
+        self,
+        input_ids: torch.LongTensor | None = None,
+        attention_mask: torch.Tensor | None = None,
+        position_ids: torch.LongTensor | None = None,
+        past_key_values: Cache | None = None,
+        inputs_embeds: torch.FloatTensor | None = None,
+        pixel_values: torch.Tensor | None = None,
+        image_grid_thw: torch.LongTensor | None = None,
+        rope_deltas: torch.LongTensor | None = None,
+        cache_position: torch.LongTensor | None = None,
+        **kwargs: Unpack[TransformersKwargs],
+    ) -> tuple | GlmImageModelOutputWithPast:
+        r"""
+        image_grid_thw (`torch.LongTensor` of shape `(num_images, 3)`, *optional*):
+            The temporal, height and width of feature shape of each image in LLM.
+        rope_deltas (`torch.LongTensor` of shape `(batch_size, )`, *optional*):
+            The rope index difference between sequence length and multimodal rope.
+        """
+        if (input_ids is None) ^ (inputs_embeds is not None):
+            raise ValueError("You must specify exactly one of input_ids or inputs_embeds")
+        if pixel_values is not None:
+            image_embeds = self.get_image_features(pixel_values, image_grid_thw[:-1])
+            image_embeds = torch.cat(image_embeds, dim=0)
+            image_ids = self.get_image_tokens(image_embeds, image_grid_thw[:-1])
+            image_ids = image_ids.view(-1).to(input_ids.device)
+            special_image_mask = self.get_placeholder_mask(input_ids, image_ids)
+            input_ids = input_ids.masked_scatter(special_image_mask, image_ids)
+        if inputs_embeds is None:
+            inputs_embeds = self.get_input_embeddings()(input_ids)
+        if position_ids is None:
+            attention_mask_2d = attention_mask
+            if attention_mask is not None and attention_mask.ndim == 4:
+                attention_mask_2d = torch.diagonal(attention_mask[:, 0], dim1=1, dim2=2)
+                # Only apply conversion for floating point tensors (inverted masks)
+                if attention_mask_2d.dtype.is_floating_point:
+                    attention_mask_2d = attention_mask_2d / torch.finfo(attention_mask_2d.dtype).min
+                    attention_mask_2d = (1.0 - attention_mask_2d).int()
+            # Calculate RoPE index once per generation in the pre-fill stage only.
+            # It is safe to assume that `length!=1` means we're in pre-fill because the
+            # model is used only by DiT pipeline without assisted decoding, etc. techniques
+            is_prefill_stage = (input_ids is not None and input_ids.shape[1] != 1) or (
+                inputs_embeds is not None and inputs_embeds.shape[1] != 1
+            )
+            if is_prefill_stage or self.rope_deltas is None:
+                position_ids, rope_deltas = self.get_rope_index(
+                    input_ids,
+                    image_grid_thw,
+                    attention_mask=attention_mask_2d,
+                )
+                self.rope_deltas = rope_deltas
+            # then use the prev pre-calculated rope-deltas to get the correct position ids
+            else:
+                batch_size, seq_length, _ = inputs_embeds.shape
+                # Use prefill token length, not position value
+                step = cache_position[0].item() - self._prefill_len
+                # Direct lookup - no tensor creation overhead
+                position_ids = self._cached_decode_position_ids[:, step : step + seq_length]
+                position_ids = position_ids.unsqueeze(1).expand(-1, batch_size, -1)
+        outputs = self.language_model(
+            input_ids=None,
+            position_ids=position_ids,
+            attention_mask=attention_mask,
+            past_key_values=past_key_values,
+            inputs_embeds=inputs_embeds,
+            cache_position=cache_position,
+            **kwargs,
+        )
+        return GlmImageModelOutputWithPast(
+            last_hidden_state=outputs.last_hidden_state,
+            past_key_values=outputs.past_key_values,
+            hidden_states=outputs.hidden_states,
+            attentions=outputs.attentions,
+            rope_deltas=self.rope_deltas,
+        )
+class GlmImageCausalLMOutputWithPast(Glm4vCausalLMOutputWithPast):
+    pass
+class GlmImageForConditionalGeneration(GlmImagePreTrainedModel, GenerationMixin):
+    _checkpoint_conversion_mapping = {}
+    _tied_weights_keys = {}
+    # Reference: fix gemma3 grad acc #37208
+    accepts_loss_kwargs = False
+    base_model_prefix = "model"
+    config: GlmImageConfig
+    def __init__(self, config):
+        super().__init__(config)
+        self.model = GlmImageModel(config)
+        self.lm_head = nn.Linear(config.text_config.hidden_size, config.text_config.vision_vocab_size, bias=False)
+        # Initialize weights and apply final processing
+        self.post_init()
+    def get_image_features(self, pixel_values: torch.FloatTensor, image_grid_thw: torch.LongTensor | None = None):
+        return self.model.get_image_features(pixel_values, image_grid_thw)
+    def get_image_tokens(self, hidden_states: torch.FloatTensor, image_grid_thw: torch.LongTensor | None = None):
+        return self.model.get_image_tokens(hidden_states, image_grid_thw)
+    def forward(
+        self,
+        input_ids: torch.LongTensor | None = None,
+        attention_mask: torch.Tensor | None = None,
+        position_ids: torch.LongTensor | None = None,
+        past_key_values: Cache | None = None,
+        inputs_embeds: torch.FloatTensor | None = None,
+        labels: torch.LongTensor | None = None,
+        pixel_values: torch.Tensor | None = None,
+        image_grid_thw: torch.LongTensor | None = None,
+        cache_position: torch.LongTensor | None = None,
+        logits_to_keep: int | torch.Tensor = 0,
+        **kwargs: Unpack[TransformersKwargs],
+    ) -> tuple | GlmImageCausalLMOutputWithPast:
+        r"""
+        labels (`torch.LongTensor` of shape `(batch_size, sequence_length)`, *optional*):
+            Labels for computing the masked language modeling loss. Indices should either be in `[0, ...,
+            config.vocab_size]` or -100 (see `input_ids` docstring). Tokens with indices set to `-100` are ignored
+            (masked), the loss is only computed for the tokens with labels in `[0, ..., config.vocab_size]`.
+        image_grid_thw (`torch.LongTensor` of shape `(num_images, 3)`, *optional*):
+            The temporal, height and width of feature shape of each image in LLM.
+        Example:
+        ```python
+        >>> from PIL import Image
+        >>> import requests
+        >>> from transformers import AutoProcessor, GlmImageForConditionalGeneration
+        >>> model = GlmImageForConditionalGeneration.from_pretrained("zai-org/GLM-Image")
+        >>> processor = AutoProcessor.from_pretrained("zai-org/GLM-Image")
+        >>> messages = [
+            {
+                "role": "user",
+                "content": [
+                    {"type": "image"},
+                    {"type": "text", "text": "Add a truck of this photo.<sop>28 40<eop>"},
+                ],
+            },
+        ]
+        >>> url = "https://www.ilankelman.org/stopsigns/australia.jpg"
+        >>> image = Image.open(requests.get(url, stream=True).raw)
+        >>> text = processor.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
+        >>> inputs = processor(text=[text], images=[image], vision_infos=[vision_infos])
+        >>> # Generate
+        >>> generate_ids = model.generate(inputs.input_ids, max_length=30)
+        >>> tokenizer.batch_decode(generate_ids, skip_special_tokens=True, clean_up_tokenization_spaces=False)[0]
+        "The image shows a street scene with a red stop sign in the foreground. In the background, there is a large red gate with Chinese characters ..."
+        ```"""
+        outputs = self.model(
+            input_ids=input_ids,
+            pixel_values=pixel_values,
+            image_grid_thw=image_grid_thw,
+            position_ids=position_ids,
+            attention_mask=attention_mask,
+            past_key_values=past_key_values,
+            inputs_embeds=inputs_embeds,
+            cache_position=cache_position,
+            **kwargs,
+        )
+        hidden_states = outputs[0]
+        # Only compute necessary logits, and do not upcast them to float if we are not computing the loss
+        slice_indices = slice(-logits_to_keep, None) if isinstance(logits_to_keep, int) else logits_to_keep
+        logits = self.lm_head(hidden_states[:, slice_indices, :])
+        loss = None
+        if labels is not None:
+            loss = self.loss_function(logits=logits, labels=labels, vocab_size=self.config.text_config.vocab_size)
+        return GlmImageCausalLMOutputWithPast(
+            loss=loss,
+            logits=logits,
+            past_key_values=outputs.past_key_values,
+            hidden_states=outputs.hidden_states,
+            attentions=outputs.attentions,
+            rope_deltas=outputs.rope_deltas,
+        )
+    def prepare_inputs_for_generation(
+        self,
+        input_ids,
+        past_key_values=None,
+        attention_mask=None,
+        inputs_embeds=None,
+        cache_position=None,
+        position_ids=None,
+        use_cache=True,
+        pixel_values=None,
+        image_grid_thw=None,
+        is_first_iteration=False,
+        **kwargs,
+    ):
+        model_inputs = super().prepare_inputs_for_generation(
+            input_ids,
+            past_key_values=past_key_values,
+            attention_mask=attention_mask,
+            inputs_embeds=inputs_embeds,
+            cache_position=cache_position,
+            position_ids=position_ids,
+            pixel_values=pixel_values,
+            image_grid_thw=image_grid_thw,
+            is_first_iteration=is_first_iteration,
+            use_cache=use_cache,
+            **kwargs,
+        )
+        model_inputs["position_ids"] = None
+        if not is_first_iteration and use_cache:
+            model_inputs["pixel_values"] = None
+        return model_inputs
+    def _get_image_nums(
+        self,
+        input_ids: torch.LongTensor | None,
+    ) -> torch.Tensor:
+        """
+        Get the number of images for each sample.
+        For GLM-Image, only input_ids allow us to get the number of images.
+        Returns:
+            image_counts (`torch.LongTensor` of shape `(batch_size,)`)
+        """
+        is_image = input_ids == self.config.image_start_token_id
+        return is_image.sum(dim=1)
+    def _expand_inputs_for_generation(
+        self,
+        expand_size: int = 1,
+        is_encoder_decoder: bool = False,
+        input_ids: torch.LongTensor | None = None,
+        **model_kwargs,
+    ) -> tuple[torch.LongTensor, dict[str, Any]]:
+        # Overwritten -- Support for expanding tensors without a batch size dimension
+        # e.g., pixel_values, image_grid_thw
+        # pixel_values.shape[0] is sum(seqlen_images for samples)
+        # image_grid_thw.shape[0] is sum(num_images for samples)
+        if expand_size == 1:
+            return input_ids, model_kwargs
+        visual_keys = ["pixel_values", "image_grid_thw"]
+        def _expand_dict_for_generation_visual(dict_to_expand):
+            image_grid_thw = model_kwargs.get("image_grid_thw", None)
+            image_nums = self._get_image_nums(input_ids)
+            def _repeat_interleave_samples(x, lengths, repeat_times):
+                samples = torch.split(x, lengths)
+                repeat_args = [repeat_times] + [1] * (x.dim() - 1)
+                result = torch.cat([sample.repeat(*repeat_args) for sample in samples], dim=0)
+                return result
+            for key in dict_to_expand:
+                if key == "pixel_values":
+                    # split images into samples
+                    samples = torch.split(image_grid_thw[: sum(image_nums)], list(image_nums))
+                    # compute the sequence length of images for each sample
+                    lengths = [torch.prod(sample, dim=1).sum() for sample in samples]
+                    dict_to_expand[key] = _repeat_interleave_samples(
+                        dict_to_expand[key], lengths=lengths, repeat_times=expand_size
+                    )
+                elif key == "image_grid_thw":
+                    # get the num of images for each sample and +1 for the image being generated
+                    lengths = list(image_nums)
+                    last_image = dict_to_expand[key][:-1]
+                    dict_to_expand[key] = _repeat_interleave_samples(
+                        dict_to_expand[key][: sum(image_nums)], lengths=lengths, repeat_times=expand_size
+                    )
+                    dict_to_expand[key] = torch.cat([dict_to_expand[key], last_image], dim=0)
+            return dict_to_expand
+        def _expand_dict_for_generation(dict_to_expand):
+            for key in dict_to_expand:
+                if (
+                    key != "cache_position"
+                    and dict_to_expand[key] is not None
+                    and isinstance(dict_to_expand[key], torch.Tensor)
+                    and key not in visual_keys
+                ):
+                    dict_to_expand[key] = dict_to_expand[key].repeat_interleave(expand_size, dim=0)
+            return dict_to_expand
+        model_kwargs = _expand_dict_for_generation_visual(model_kwargs)
+        if input_ids is not None:
+            input_ids = input_ids.repeat_interleave(expand_size, dim=0)
+        model_kwargs = _expand_dict_for_generation(model_kwargs)
+        if is_encoder_decoder:
+            if model_kwargs.get("encoder_outputs") is None:
+                raise ValueError("If `is_encoder_decoder` is True, make sure that `encoder_outputs` is defined.")
+            model_kwargs["encoder_outputs"] = _expand_dict_for_generation(model_kwargs["encoder_outputs"])
+        return input_ids, model_kwargs
+def smart_resize(
+    height: int,
+    width: int,
+    factor: int = 16,
+    min_pixels: int = 512 * 512,
+    max_pixels: int = 2048 * 2048,
+) -> tuple[int, int]:
+    if height < factor or width < factor:
+        raise ValueError(f"height:{height} or width:{width} must be larger than factor:{factor}")
+    elif max(height, width) / min(height, width) > 4:
+        raise ValueError(
+            f"absolute aspect ratio must be smaller than 4, got {max(height, width) / min(height, width)}"
+        )
+    shortest_edge = int(round(math.sqrt(min_pixels)))
+    longest_edge = int(round(math.sqrt(max_pixels)))
+    min_side = min(height, width)
+    max_side = max(height, width)
+    scale = 1.0
+    if min_side < shortest_edge:
+        scale = shortest_edge / min_side
+    if max_side * scale > longest_edge:
+        scale = longest_edge / max_side
+    height = height // 2
+    width = width // 2
+    h_bar = max(factor, int(round(height * scale / factor)) * factor)
+    w_bar = max(factor, int(round(width * scale / factor)) * factor)
+    if max(h_bar, w_bar) > longest_edge:
+        beta = max(h_bar, w_bar) / longest_edge
+        h_bar = max(factor, int(math.floor((h_bar / beta) / factor)) * factor)
+        w_bar = max(factor, int(math.floor((w_bar / beta) / factor)) * factor)
+    return h_bar, w_bar
+class GlmImageImageProcessor(Qwen2VLImageProcessor):
+    pass
+class GlmImageImageProcessorFast(Qwen2VLImageProcessorFast):
+    pass
+class GlmImageImagesKwargs(ImagesKwargs, total=False):
+    """
+    target_h (`int`):
+        Height of the target image to be generated.
+    target_w (`int`):
+        Width of the target image to be generated.
+    """
+    target_h: int
+    target_w: int
+class GlmImageProcessorKwargs(Qwen2VLProcessorKwargs):
+    images_kwargs: GlmImageImagesKwargs
+    _defaults = {
+        "text_kwargs": {
+            "padding": False,
+            "return_mm_token_type_ids": False,
+        },
+        "images_kwargs": {
+            "target_h": 1152,
+            "target_w": 768,
+        },
+    }
+class GlmImageProcessor(ProcessorMixin):
+    r"""
+    Constructs a GLM-Image processor which wraps a GLM-Image image processor and a GLM-Image tokenizer into a single processor.
+    [`~GlmImageProcessor.__call__`] and [`~GlmImageProcessor.decode`] for more information.
+    Args:
+        image_processor ([`GlmImageProcessor`], *optional*):
+            The image processor is a required input.
+        tokenizer ([`PreTrainedTokenizerFast`], *optional*):
+            The tokenizer is a required input.
+        chat_template (`str`, *optional*): A Jinja template which will be used to convert lists of messages
+            in a chat into a tokenizable string.
+    """
+    def __init__(self, image_processor=None, tokenizer=None, chat_template=None, **kwargs):
+        self.image_token = tokenizer.image_token
+        self.grid_bos_token = tokenizer.grid_bos_token
+        self.grid_eos_token = tokenizer.grid_eos_token
+        self.bos_token = tokenizer.bos_token
+        self.image_token_id = tokenizer.convert_tokens_to_ids(self.image_token)
+        super().__init__(image_processor, tokenizer, chat_template=chat_template)
+    def __call__(
+        self,
+        images: ImageInput | None = None,
+        text: TextInput | PreTokenizedInput | list[TextInput] | list[PreTokenizedInput] = None,
+        **kwargs: Unpack[GlmImageProcessorKwargs],
+    ) -> BatchFeature:
+        """
+        Main method to prepare for the model one or several sequences(s) and image(s). This method forwards the `text`
+        and `kwargs` arguments to PreTrainedTokenizerFast's [`~PreTrainedTokenizerFast.__call__`] if `text` is not `None` to encode
+        the text.
+        Args:
+            images (`PIL.Image.Image`, `np.ndarray`, `torch.Tensor`, `List[PIL.Image.Image]`, `List[np.ndarray]`, `List[torch.Tensor]`):
+                The image or batch of images to be prepared. Each image can be a PIL image, NumPy array or PyTorch
+                tensor. Both channels-first and channels-last formats are supported.
+            text (`str`, `List[str]`, `List[List[str]]`):
+                The sequence or batch of sequences to be encoded. Each sequence can be a string or a list of strings
+                (pretokenized string). If the sequences are provided as list of strings (pretokenized), you must set
+                `is_split_into_words=True` (to lift the ambiguity with a batch of sequences).
+            return_tensors (`str` or [`~utils.TensorType`], *optional*):
+                If set, will return tensors of a particular framework. Acceptable values are:
+                - `'pt'`: Return PyTorch `torch.Tensor` objects.
+                - `'np'`: Return NumPy `np.ndarray` objects.
+        Returns:
+            [`BatchFeature`]: A [`BatchFeature`] with the following fields:
+            - **input_ids** -- List of token ids to be fed to a model. Returned when `text` is not `None`.
+            - **attention_mask** -- List of indices specifying which tokens should be attended to by the model (when
+              `return_attention_mask=True` or if *"attention_mask"* is in `self.model_input_names` and if `text` is not
+              `None`).
+            - **pixel_values** -- Pixel values to be fed to a model. Returned when `images` is not `None`.
+            - **image_grid_thw** -- List of image 3D grid in LLM. Returned when `images` is not `None`.
+        """
+        output_kwargs = self._merge_kwargs(
+            GlmImageProcessorKwargs,
+            tokenizer_init_kwargs=self.tokenizer.init_kwargs,
+            **kwargs,
+        )
+        target_h = output_kwargs["images_kwargs"].pop("target_h", None)
+        target_w = output_kwargs["images_kwargs"].pop("target_w", None)
+        is_text_to_image = images is None
+        if images is not None:
+            image_inputs = self.image_processor(images=images, **output_kwargs["images_kwargs"])
+            image_grid_thw = image_inputs["image_grid_thw"]
+        else:
+            image_inputs = {}
+            image_grid_thw = None
+        if not isinstance(text, list):
+            text = [text]
+        if len(text) > 1:
+            raise ValueError("The model does not support batch size > 1")
+        text = text.copy()  # below lines change text in-place
+        if not is_text_to_image:
+            index = 0
+            for i in range(len(text)):
+                while self.image_token in text[i]:
+                    grid = image_grid_thw[index]
+                    num_image_tokens = int(grid[1] * grid[2])
+                    text[i] = text[i].replace(self.image_token, "<|placeholder|>" * num_image_tokens, 1)
+                    index += 1
+                text[i] = text[i].replace("<|placeholder|>", self.image_token)
+        text[0], token_h, token_w, prev_h, prev_w = self._build_prompt_with_target_shape(
+            text[0], height=target_h, width=target_w, is_text_to_image=is_text_to_image
+        )
+        image_inputs["image_grid_thw"] = self._build_target_image_grid_thw(
+            token_h=token_h,
+            token_w=token_w,
+            prev_token_h=prev_h,
+            prev_token_w=prev_w,
+            image_grid_thw=image_grid_thw if not is_text_to_image else None,
+        )
+        return_tensors = output_kwargs["text_kwargs"].pop("return_tensors", None)
+        return_mm_token_type_ids = output_kwargs["text_kwargs"].pop("return_mm_token_type_ids", False)
+        text_inputs = self.tokenizer(text, **output_kwargs["text_kwargs"])
+        self._check_special_mm_tokens(text, text_inputs, modalities=["image"])
+        if return_mm_token_type_ids:
+            array_ids = np.array(text_inputs["input_ids"])
+            mm_token_type_ids = np.zeros_like(text_inputs["input_ids"])
+            mm_token_type_ids[array_ids == self.image_token_id] = 1
+            text_inputs["mm_token_type_ids"] = mm_token_type_ids.tolist()
+        return BatchFeature(data={**text_inputs, **image_inputs}, tensor_type=return_tensors)
+    def _build_prompt_with_target_shape(
+        self,
+        prompt: str,
+        height: int,
+        width: int,
+        is_text_to_image: bool,
+    ) -> tuple[str, int, int, int, int]:
+        factor = 32
+        height = (height // factor) * factor
+        width = (width // factor) * factor
+        token_h = height // factor
+        token_w = width // factor
+        ratio = token_h / token_w
+        prev_token_h = int(math.sqrt(ratio) * (factor // 2))
+        prev_token_w = int(math.sqrt(1 / ratio) * (factor // 2))
+        if is_text_to_image:
+            expanded_prompt = f"{prompt}{self.grid_bos_token}{token_h} {token_w}{self.grid_eos_token}{self.grid_bos_token}{prev_token_h} {prev_token_w}{self.grid_eos_token}{self.bos_token}"
+        else:
+            expanded_prompt = f"{prompt}{self.grid_bos_token}{token_h} {token_w}{self.grid_eos_token}{self.bos_token}"
+        return expanded_prompt, token_h, token_w, prev_token_h, prev_token_w
+    @staticmethod
+    def _build_target_image_grid_thw(
+        token_h: int,
+        token_w: int,
+        prev_token_h: int,
+        prev_token_w: int,
+        image_grid_thw: None,
+    ):
+        if image_grid_thw is None:
+            return torch.tensor(
+                [
+                    [1, token_h, token_w],
+                    [1, prev_token_h, prev_token_w],
+                ],
+            )
+        else:
+            return torch.cat(
+                [image_grid_thw, torch.tensor([[1, token_h, token_w]], device=image_grid_thw.device)], dim=0
+            )
+__all__ = [
+    "GlmImageVQVAEConfig",
+    "GlmImageVisionConfig",
+    "GlmImageTextConfig",
+    "GlmImageConfig",
+    "GlmImagePreTrainedModel",
+    "GlmImageVQVAE",
+    "GlmImageVisionModel",
+    "GlmImageTextModel",
+    "GlmImageModel",
+    "GlmImageForConditionalGeneration",
+    "GlmImageImageProcessor",
+    "GlmImageImageProcessorFast",
+    "GlmImageProcessor",
+]

transformers 5.0.0rc1__py3-none-any.whl → 5.0.0rc3__py3-none-any.whl

transformers 5.0.0rc1py3-none-any.whl → 5.0.0rc3py3-none-any.whl