mirror of
https://github.com/vladmandic/automatic
synced 2026-09-19 01:04:32 +02:00
@@ -14,9 +14,6 @@
|
||||
*note*: this is a [gated model](https://vladmandic.github.io/sdnext-docs/Gated/)
|
||||
- [VIBE Image Edit](https://huggingface.co/iitolstykh/VIBE-Image-Edit) visual instruction based image editing model
|
||||
combines *Sana1.5-1.6B* diffusion backbone with *Qwen3-VL-2B* multimodal conditioning
|
||||
- [Lumina-DiMOO](https://huggingface.co/Alpha-VLLM/Lumina-DiMOO) omni diffusion large language model for multimodal generation and understanding
|
||||
supports *text-to-image*, *image editing*, and *image understanding* in a unified discrete diffusion framework
|
||||
uses a VQ-VAE backed token space with any-to-any task coverage
|
||||
- [Step1X-Edit v1.2](https://huggingface.co/stepfun-ai/Step1X-Edit-v1p2) image editing model using Step1X transformer
|
||||
integrates Qwen2.5-VL text encoder and Flow Matching scheduler for high-quality in-context edits
|
||||
enables multimodal understanding and conditional image refinement
|
||||
|
||||
@@ -12,7 +12,8 @@
|
||||
- Test: Bria-FIBO
|
||||
- Port: ERNIE-Image (merged, unpublished) <https://github.com/huggingface/diffusers/blob/main/docs/source/en/api/pipelines/ernie_image.md>
|
||||
- Port: NucleusMoE-Image (merged, unpublished)
|
||||
- Port: JoyAI-Image-Edit (in-progress, need conversion)
|
||||
- Port: JoyAI-Image-Edit (in-progress)
|
||||
- Port: Lumina-DiMOO(in-progress)
|
||||
- Code: Bria-FIBO edit requires image handling
|
||||
- Issues: ROCm script with LoRA?
|
||||
|
||||
@@ -62,6 +63,7 @@ TODO: Investigate which models are diffusers-compatible and prioritize!
|
||||
|
||||
### Image
|
||||
|
||||
- [Lumina-DiMOO](https://huggingface.co/Alpha-VLLM/Lumina-DiMOO)
|
||||
- [UltraFlux](https://huggingface.co/Owen777/UltraFlux-v1)
|
||||
- [Mugen](https://huggingface.co/CabalResearch/Mugen)
|
||||
- [Liquid](https://github.com/FoundationVision/Liquid)
|
||||
|
||||
@@ -621,15 +621,6 @@
|
||||
"size": 20.75,
|
||||
"date": "2025 January"
|
||||
},
|
||||
"AlphaVLLM Lumina DiMOO": {
|
||||
"path": "Alpha-VLLM/Lumina-DiMOO",
|
||||
"desc": "Lumina-DiMOO is an omni diffusion large language model for multimodal generation and understanding with text-to-image, image editing and understanding capabilities.",
|
||||
"preview": "Alpha-VLLM--Lumina-DiMOO.jpg",
|
||||
"skip": true,
|
||||
"extras": "sampler: Default",
|
||||
"size": 0,
|
||||
"date": "2025 September"
|
||||
},
|
||||
|
||||
"HiDream-I1 Fast": {
|
||||
"path": "HiDream-ai/HiDream-I1-Fast",
|
||||
|
||||
@@ -30,7 +30,7 @@ pipelines = {
|
||||
'Chroma': getattr(diffusers, 'ChromaPipeline', None),
|
||||
'Sana': getattr(diffusers, 'SanaPipeline', None),
|
||||
'Lumina-Next': getattr(diffusers, 'LuminaText2ImgPipeline', None),
|
||||
'Lumina-DiMOO': getattr(diffusers, 'LuminaDiMOOPipeline', None),
|
||||
# 'Lumina-DiMOO': getattr(diffusers, 'LuminaDiMOOPipeline', None),
|
||||
'Lumina 2': getattr(diffusers, 'Lumina2Pipeline', None),
|
||||
'AuraFlow': getattr(diffusers, 'AuraFlowPipeline', None),
|
||||
'Kandinsky 2.1': getattr(diffusers, 'KandinskyCombinedPipeline', None),
|
||||
|
||||
@@ -84,3 +84,15 @@ def load_lumina_dimoo(checkpoint_info, diffusers_load_config=None):
|
||||
|
||||
devices.torch_gc(force=True, reason='load')
|
||||
return pipe
|
||||
|
||||
""" Reference
|
||||
"AlphaVLLM Lumina DiMOO": {
|
||||
"path": "Alpha-VLLM/Lumina-DiMOO",
|
||||
"desc": "Lumina-DiMOO is an omni diffusion large language model for multimodal generation and understanding with text-to-image, image editing and understanding capabilities.",
|
||||
"preview": "Alpha-VLLM--Lumina-DiMOO.jpg",
|
||||
"skip": true,
|
||||
"extras": "sampler: Default",
|
||||
"size": 0,
|
||||
"date": "2025 September"
|
||||
},
|
||||
"""
|
||||
|
||||
Reference in New Issue
Block a user