From d9f9d2ba1291ebc35ea3cce445f2f0c64deaceb2 Mon Sep 17 00:00:00 2001 From: comfyanonymous <121283862+comfyanonymous@users.noreply.github.com> Date: Tue, 11 Aug 2026 12:54:15 -0700 Subject: [PATCH] Fix some clip vision regression. (#15506) --- comfy/clip_model.py | 7 ++++++- 1 file changed, 6 insertions(+), 1 deletion(-) diff --git a/comfy/clip_model.py b/comfy/clip_model.py index d7d3f994c..26cc5d7ee 100644 --- a/comfy/clip_model.py +++ b/comfy/clip_model.py @@ -314,13 +314,18 @@ class CLIPVisionModelProjection(torch.nn.Module): if "projection_dim" in config_dict: self.visual_projection = operations.Linear(config_dict["hidden_size"], config_dict["projection_dim"], bias=False) else: - self.visual_projection = lambda a: a + self.visual_projection = torch.nn.Identity() if "llava3" == config_dict.get("projector_type", None): self.multi_modal_projector = LlavaProjector(config_dict["hidden_size"], 4096, dtype, device, operations) else: self.multi_modal_projector = None + def _load_from_state_dict(self, state_dict, prefix, *args, **kwargs): + if "{}visual_projection.weight".format(prefix) not in state_dict: + self.visual_projection = torch.nn.Identity() + super()._load_from_state_dict(state_dict, prefix, *args, **kwargs) + def forward(self, *args, **kwargs): x = self.vision_model(*args, **kwargs) out = self.visual_projection(x[2])