diff --git a/CHANGELOG.md b/CHANGELOG.md index 87712b734..71e25b5ed 100644 --- a/CHANGELOG.md +++ b/CHANGELOG.md @@ -14,9 +14,6 @@ *note*: this is a [gated model](https://vladmandic.github.io/sdnext-docs/Gated/) - [VIBE Image Edit](https://huggingface.co/iitolstykh/VIBE-Image-Edit) visual instruction based image editing model combines *Sana1.5-1.6B* diffusion backbone with *Qwen3-VL-2B* multimodal conditioning - - [Lumina-DiMOO](https://huggingface.co/Alpha-VLLM/Lumina-DiMOO) omni diffusion large language model for multimodal generation and understanding - supports *text-to-image*, *image editing*, and *image understanding* in a unified discrete diffusion framework - uses a VQ-VAE backed token space with any-to-any task coverage - [Step1X-Edit v1.2](https://huggingface.co/stepfun-ai/Step1X-Edit-v1p2) image editing model using Step1X transformer integrates Qwen2.5-VL text encoder and Flow Matching scheduler for high-quality in-context edits enables multimodal understanding and conditional image refinement diff --git a/TODO.md b/TODO.md index 81c04b080..a3e26daa1 100644 --- a/TODO.md +++ b/TODO.md @@ -12,7 +12,8 @@ - Test: Bria-FIBO - Port: ERNIE-Image (merged, unpublished) - Port: NucleusMoE-Image (merged, unpublished) -- Port: JoyAI-Image-Edit (in-progress, need conversion) +- Port: JoyAI-Image-Edit (in-progress) +- Port: Lumina-DiMOO(in-progress) - Code: Bria-FIBO edit requires image handling - Issues: ROCm script with LoRA? @@ -62,6 +63,7 @@ TODO: Investigate which models are diffusers-compatible and prioritize! ### Image +- [Lumina-DiMOO](https://huggingface.co/Alpha-VLLM/Lumina-DiMOO) - [UltraFlux](https://huggingface.co/Owen777/UltraFlux-v1) - [Mugen](https://huggingface.co/CabalResearch/Mugen) - [Liquid](https://github.com/FoundationVision/Liquid) diff --git a/data/reference.json b/data/reference.json index 52b1f2e7d..0d80ddeb9 100644 --- a/data/reference.json +++ b/data/reference.json @@ -621,15 +621,6 @@ "size": 20.75, "date": "2025 January" }, - "AlphaVLLM Lumina DiMOO": { - "path": "Alpha-VLLM/Lumina-DiMOO", - "desc": "Lumina-DiMOO is an omni diffusion large language model for multimodal generation and understanding with text-to-image, image editing and understanding capabilities.", - "preview": "Alpha-VLLM--Lumina-DiMOO.jpg", - "skip": true, - "extras": "sampler: Default", - "size": 0, - "date": "2025 September" - }, "HiDream-I1 Fast": { "path": "HiDream-ai/HiDream-I1-Fast", diff --git a/modules/shared_items.py b/modules/shared_items.py index 913c6fa75..8d2c6af40 100644 --- a/modules/shared_items.py +++ b/modules/shared_items.py @@ -30,7 +30,7 @@ pipelines = { 'Chroma': getattr(diffusers, 'ChromaPipeline', None), 'Sana': getattr(diffusers, 'SanaPipeline', None), 'Lumina-Next': getattr(diffusers, 'LuminaText2ImgPipeline', None), - 'Lumina-DiMOO': getattr(diffusers, 'LuminaDiMOOPipeline', None), + # 'Lumina-DiMOO': getattr(diffusers, 'LuminaDiMOOPipeline', None), 'Lumina 2': getattr(diffusers, 'Lumina2Pipeline', None), 'AuraFlow': getattr(diffusers, 'AuraFlowPipeline', None), 'Kandinsky 2.1': getattr(diffusers, 'KandinskyCombinedPipeline', None), diff --git a/pipelines/model_lumina.py b/pipelines/model_lumina.py index b0f1ad795..c55d8281b 100644 --- a/pipelines/model_lumina.py +++ b/pipelines/model_lumina.py @@ -84,3 +84,15 @@ def load_lumina_dimoo(checkpoint_info, diffusers_load_config=None): devices.torch_gc(force=True, reason='load') return pipe + +""" Reference + "AlphaVLLM Lumina DiMOO": { + "path": "Alpha-VLLM/Lumina-DiMOO", + "desc": "Lumina-DiMOO is an omni diffusion large language model for multimodal generation and understanding with text-to-image, image editing and understanding capabilities.", + "preview": "Alpha-VLLM--Lumina-DiMOO.jpg", + "skip": true, + "extras": "sampler: Default", + "size": 0, + "date": "2025 September" + }, +"""