Jinho Jang lanza modelo local 27B con el comportamiento de rechazo eliminado

Dealign.ai describe el lanzamiento como un modelo de 27 mil millones de parámetros con siete cuantizaciones GGUF y un proyector de visión para inferencia multimodal local.

By · Published

Primary source: Aligned News - AI Intelligence

Why it matters

Downloadable weights let independent researchers modify safety behavior and distribute locally runnable builds, accelerating reproducible safety research while also making weakened safeguards easier to obtain.

A detailed vintage illustration of a complex analysis engine processing film and photographs, with barriers to information removed.

Jinho Jang, el investigador independiente detrás de dealign.ai, ha publicado un modelo que su proyecto describe como una derivación modificada en seguridad de 27 mil millones de parámetros de Qwen3.8-27B que empaqueta procesamiento de imágenes, video y texto para uso local a través de llama.cpp. El repositorio identifica la versión como Qwen3.8-27B-CRACK-GGUF. Los metadatos de Hugging Face reproducidos por dealign.ai listan el repositorio como creado el 12 de agosto de 2026.

El repositorio Qwen3.8-27B-CRACK-GGUF describe el modelo como "abliterated", un proceso de modificación de pesos destinado a eliminar el comportamiento de rechazo. La ficha del modelo dice que el sistema resultante completará solicitudes que una versión estándar rechazaría, conservando capacidades de codificación, razonamiento y multimodalidad. Esas afirmaciones sobre conservación y los resultados de benchmark del repositorio provienen de las propias pruebas de dealign.ai.

El lanzamiento combina investigación sobre eliminación de rechazos con un paquete práctico de distribución local: siete cuantizaciones, un proyector de visión y comandos para llama.cpp. Jang alteró el comportamiento de seguridad del modelo y preparó el resultado para inferencia local sin requerir una API hospedada.

Publicación original en X

Jang se describe como un investigador de ML y ingeniero de sistemas en Irvine, California. Sus proyectos públicos incluyen MLX Studio, una aplicación de IA local para Apple Silicon, y JANGQ, un proyecto de cuantización de bits variables para Apple Silicon.

Dealign.ai se presenta como un esfuerzo de investigación operado de forma independiente. Sus páginas públicas no divulgan rondas de financiamiento, inversores nombrados, precios, ingresos ni número de clientes.

The repository supplies a local multimodal package

La ficha del modelo de Dealign.ai describe Qwen3.8-27B-CRACK como un híbrido denso de visión y lenguaje de 27 mil millones de parámetros con 64 capas, una ventana de contexto declarada de 262K tokens, comprensión nativa de imágenes y comprensión de video, y una cabeza Multi-Token-Prediction en cada cuantización GGUF. Estas son especificaciones reportadas por el proyecto, no una validación independiente. La ficha especifica 48 capas de atención lineal GatedDeltaNet y 16 capas de atención completa, un tamaño oculto de 5,120, esfuerzo de razonamiento ajustable y un proyector de visión incluido.

El lanzamiento de Jang empaqueta sus componentes en archivos GGUF para llama.cpp. Según la tabla de archivos del repositorio, ofrece siete cuantizaciones de modelo de lenguaje que van desde un archivo IQ2_M de 10.5 GB hasta un archivo Q8_0 de 29.0 GB. Dealign.ai recomienda la versión Q4_K_M de 17.0 GB como su equilibrio entre tamaño y rendimiento retenido. La misma tabla lista un proyector de visión F16 separado de 0.9 GB que se empareja con cualquier cuantización para uso en imagen y video.

Las instrucciones de uso de la ficha del modelo proporcionan comandos para el cliente de terminal de llama.cpp y un servidor local compatible con OpenAI. Requieren un runtime compatible y emparejan el modelo cuantizado con el proyector para uso multimodal.

Dealign.ai reporta más de 200 experimentos controlados, más de 40 hallazgos y trabajo en nueve modelos que abarcan de 0.8 mil millones a 397 mil millones de parámetros. Estas son cifras de investigación auto-reportadas.

The benchmarks measure willingness as much as capability

En HarmBench-240, la ficha del modelo reporta 98.8% de cumplimiento para las builds Q8_0, Q6_K_L, Q6_K y la recomendada Q4_K_M. El informe de investigación también registra 97.5% de cumplimiento para la build IQ2_M.

Un resultado alto en HarmBench aquí mide el éxito de la modificación para provocar respuestas a solicitudes que el sistema estándar estaba configurado para rechazar. No es una puntuación convencional de calidad o seguridad. La ficha del modelo etiqueta el lanzamiento como un artefacto de investigación con salvaguardas de seguridad reducidas, limita su uso previsto declarado a investigación y red teaming autorizado, y coloca la responsabilidad del uso legal en el operador.

La misma tabla de benchmarks reportada por el proyecto lista resultados de MMLU post-modificación que van desde 76.0% para IQ2_M hasta 83.4% para IQ4_XS. Esas cifras no establecen el rendimiento en aplicaciones reales, videos largos o tareas extendidas de agentes. No se localizó ninguna evaluación independiente de los resultados reportados de HarmBench o MMLU.

El lanzamiento pertenece a un conjunto más amplio de herramientas open-source para eliminación de rechazos. Heretic automatiza la abliteration mientras optimiza para menos rechazos y menor divergencia KL. OBLITERATUS empaqueta la eliminación de rechazos y estudios de ablación en un kit de herramientas de código abierto. Orion-zhen's Abliteration toolkit implementa la eliminación de direcciones de rechazo y variantes que preservan la norma. El trabajo de Dealign.ai aplica métodos relacionados a una arquitectura híbrida multimodal cuantizada distribuida para llama.cpp.

La investigación de Jang se centra en cómo el comportamiento de seguridad se distribuye a través de las capas del modelo y cómo la cuantización puede debilitarlo, preservarlo o restaurarlo. Su investigación Safety Across Scale sostiene que los mecanismos de seguridad se enredan cada vez más con el razonamiento a medida que aumentan la escala del modelo y la complejidad arquitectónica. Eso es un hallazgo reportado por el proyecto de Jang, más que un consenso establecido. El nuevo lanzamiento da a la investigación un caso de prueba multimodal grande que dealign.ai distribuye como una build local recomendada de 17 GB.

Open weights shorten the safety-modification cycle

El lanzamiento demuestra una consecuencia estructural de pesos de modelo descargables. El acceso permite a los desarrolladores inspeccionar, comprimir y adaptar un modelo. También permite a los investigadores eliminar mecanismos de rechazo y redistribuir los pesos alterados. El soporte multimodal amplía el alcance del análisis local y del trabajo de red team porque la derivación está diseñada para procesar imágenes y video junto con texto.

Qwen3.8-27B-CRACK-GGUF convierte la investigación de seguridad de dealign.ai en un artefacto ejecutable. Sus siete builds locales permiten a otros investigadores examinar cómo interactúan la eliminación de rechazos, la cuantización y la inferencia multimodal sin enrutar peticiones a través de un proveedor hospedado. El mismo paquete de distribución hace que las salvaguardas debilitadas estén fácilmente disponibles para cualquiera que pueda ejecutar los archivos.

Reader comments

Conversation for this story loads after sign-in.