Signed-off-by: vladmandic <mandic00@live.com>
This commit is contained in:
vladmandic
2026-04-13 16:22:56 +02:00
parent defe85df6d
commit 0b4deb80a4
5 changed files with 16 additions and 14 deletions
-3
View File
@@ -14,9 +14,6 @@
*note*: this is a [gated model](https://vladmandic.github.io/sdnext-docs/Gated/)
- [VIBE Image Edit](https://huggingface.co/iitolstykh/VIBE-Image-Edit) visual instruction based image editing model
combines *Sana1.5-1.6B* diffusion backbone with *Qwen3-VL-2B* multimodal conditioning
- [Lumina-DiMOO](https://huggingface.co/Alpha-VLLM/Lumina-DiMOO) omni diffusion large language model for multimodal generation and understanding
supports *text-to-image*, *image editing*, and *image understanding* in a unified discrete diffusion framework
uses a VQ-VAE backed token space with any-to-any task coverage
- [Step1X-Edit v1.2](https://huggingface.co/stepfun-ai/Step1X-Edit-v1p2) image editing model using Step1X transformer
integrates Qwen2.5-VL text encoder and Flow Matching scheduler for high-quality in-context edits
enables multimodal understanding and conditional image refinement
+3 -1
View File
@@ -12,7 +12,8 @@
- Test: Bria-FIBO
- Port: ERNIE-Image (merged, unpublished) <https://github.com/huggingface/diffusers/blob/main/docs/source/en/api/pipelines/ernie_image.md>
- Port: NucleusMoE-Image (merged, unpublished)
- Port: JoyAI-Image-Edit (in-progress, need conversion)
- Port: JoyAI-Image-Edit (in-progress)
- Port: Lumina-DiMOO(in-progress)
- Code: Bria-FIBO edit requires image handling
- Issues: ROCm script with LoRA?
@@ -62,6 +63,7 @@ TODO: Investigate which models are diffusers-compatible and prioritize!
### Image
- [Lumina-DiMOO](https://huggingface.co/Alpha-VLLM/Lumina-DiMOO)
- [UltraFlux](https://huggingface.co/Owen777/UltraFlux-v1)
- [Mugen](https://huggingface.co/CabalResearch/Mugen)
- [Liquid](https://github.com/FoundationVision/Liquid)
-9
View File
@@ -621,15 +621,6 @@
"size": 20.75,
"date": "2025 January"
},
"AlphaVLLM Lumina DiMOO": {
"path": "Alpha-VLLM/Lumina-DiMOO",
"desc": "Lumina-DiMOO is an omni diffusion large language model for multimodal generation and understanding with text-to-image, image editing and understanding capabilities.",
"preview": "Alpha-VLLM--Lumina-DiMOO.jpg",
"skip": true,
"extras": "sampler: Default",
"size": 0,
"date": "2025 September"
},
"HiDream-I1 Fast": {
"path": "HiDream-ai/HiDream-I1-Fast",
+1 -1
View File
@@ -30,7 +30,7 @@ pipelines = {
'Chroma': getattr(diffusers, 'ChromaPipeline', None),
'Sana': getattr(diffusers, 'SanaPipeline', None),
'Lumina-Next': getattr(diffusers, 'LuminaText2ImgPipeline', None),
'Lumina-DiMOO': getattr(diffusers, 'LuminaDiMOOPipeline', None),
# 'Lumina-DiMOO': getattr(diffusers, 'LuminaDiMOOPipeline', None),
'Lumina 2': getattr(diffusers, 'Lumina2Pipeline', None),
'AuraFlow': getattr(diffusers, 'AuraFlowPipeline', None),
'Kandinsky 2.1': getattr(diffusers, 'KandinskyCombinedPipeline', None),
+12
View File
@@ -84,3 +84,15 @@ def load_lumina_dimoo(checkpoint_info, diffusers_load_config=None):
devices.torch_gc(force=True, reason='load')
return pipe
""" Reference
"AlphaVLLM Lumina DiMOO": {
"path": "Alpha-VLLM/Lumina-DiMOO",
"desc": "Lumina-DiMOO is an omni diffusion large language model for multimodal generation and understanding with text-to-image, image editing and understanding capabilities.",
"preview": "Alpha-VLLM--Lumina-DiMOO.jpg",
"skip": true,
"extras": "sampler: Default",
"size": 0,
"date": "2025 September"
},
"""