<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Colab on lucianodlf -v</title><link>https://lucianodlf.is-a.dev/tags/colab/</link><description>Recent content in Colab on lucianodlf -v</description><generator>Hugo</generator><language>es</language><copyright>© [Luciano Delfino](https://github.com/lucianodlf) · hecho con ❤️ + [Hugo](https://gohugo.io/) y [Risotto](https://github.com/joeroe/risotto)</copyright><lastBuildDate>Tue, 21 Jul 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://lucianodlf.is-a.dev/tags/colab/index.xml" rel="self" type="application/rss+xml"/><item><title>Benchmarking de modelos de visión con Ollama: CPU local vs GPU en Colab para OCR y extracción de facturas</title><link>https://lucianodlf.is-a.dev/posts/benchmarking-ia-ollama---cpu-vs-gpu/</link><pubDate>Tue, 21 Jul 2026 00:00:00 +0000</pubDate><guid>https://lucianodlf.is-a.dev/posts/benchmarking-ia-ollama---cpu-vs-gpu/</guid><description>&lt;h2 id="vista-previa"&gt;Vista previa&lt;/h2&gt;
&lt;h5 id="informe-completo"&gt;Informe completo&lt;/h5&gt;
&lt;p&gt;El informe completo, con todas las tablas y el detalle de metodología, está disponible en &lt;a href="https://gitlab.com/lucianodlf/inn-ia-benchmark-pub/-/blob/fcbeadbf9197a9abcfa0be3f214a4559d8192a8b/docs/informe-benchmarking-ia-ollama-v1.md"&gt;&lt;code&gt;informe-benchmarking-ia-ollama-v1.md&lt;/code&gt;&lt;/a&gt;.&lt;/p&gt;
&lt;h5 id="hardware-de-los-dos-entornos"&gt;Hardware de los dos entornos&lt;/h5&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;Componente&lt;/th&gt;
					&lt;th&gt;PC Local&lt;/th&gt;
					&lt;th&gt;PC Colab&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;Hostname&lt;/td&gt;
					&lt;td&gt;local-cpu-host&lt;/td&gt;
					&lt;td&gt;ed355698b496&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Sistema Operativo&lt;/td&gt;
					&lt;td&gt;Linux 6.16.3-76061603-generic&lt;/td&gt;
					&lt;td&gt;Linux 6.6.105+&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Procesador (CPU)&lt;/td&gt;
					&lt;td&gt;Intel(R) Core(TM) i7-14700&lt;/td&gt;
					&lt;td&gt;Intel(R) Xeon(R) CPU @ 2.00GHz&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;CPU - Cores / Threads&lt;/td&gt;
					&lt;td&gt;&lt;strong&gt;20 físicos&lt;/strong&gt; / 28 totales&lt;/td&gt;
					&lt;td&gt;1 físico / 2 totales&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;CPU - Frecuencia Máx.&lt;/td&gt;
					&lt;td&gt;5400.0000 MHz&lt;/td&gt;
					&lt;td&gt;—&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Memoria RAM - Total&lt;/td&gt;
					&lt;td&gt;31 Gi&lt;/td&gt;
					&lt;td&gt;12 Gi&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Memoria RAM - Velocidad&lt;/td&gt;
					&lt;td&gt;1305MHz&lt;/td&gt;
					&lt;td&gt;—&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;GPU - Tipo/Modelo&lt;/td&gt;
					&lt;td&gt;Intel / Intel Corporation Device a780 (rev 04)&lt;/td&gt;
					&lt;td&gt;NVIDIA / Tesla T4&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;GPU - VRAM&lt;/td&gt;
					&lt;td&gt;—&lt;/td&gt;
					&lt;td&gt;15360 MiB&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;GPU - Driver/CUDA&lt;/td&gt;
					&lt;td&gt;—&lt;/td&gt;
					&lt;td&gt;Driver: 550.54.15 / CUDA: 12.4&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Aceleración Ollama&lt;/td&gt;
					&lt;td&gt;Experimental (&lt;code&gt;OLLAMA_INTEL_GPU=1&lt;/code&gt;). &lt;em&gt;(Advertencia: &amp;ldquo;No se detectó GPU - Se usará CPU&amp;rdquo;)&lt;/em&gt;&lt;/td&gt;
					&lt;td&gt;CUDA (incluido en Ollama). Uso automático de GPU.&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Almacenamiento (Disco raíz)&lt;/td&gt;
					&lt;td&gt;/dev/nvme0n1p3 (Tipo: HDD)&lt;/td&gt;
					&lt;td&gt;overlay (Uso: 89%)&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Versión de Ollama&lt;/td&gt;
					&lt;td&gt;0.12.7&lt;/td&gt;
					&lt;td&gt;0.12.10&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Variables de Ollama relevantes&lt;/td&gt;
					&lt;td&gt;&lt;code&gt;OLLAMA_NUM_PARALLEL=2&lt;/code&gt;, &lt;code&gt;OLLAMA_MAX_LOADED_MODELS=2&lt;/code&gt;, &lt;code&gt;OLLAMA_KV_CACHE_TYPE=q8_0&lt;/code&gt;, &lt;code&gt;OLLAMA_FLASH_ATTENTION=true&lt;/code&gt;, &lt;code&gt;OLLAMA_KEEP_ALIVE=0&lt;/code&gt;&lt;/td&gt;
					&lt;td&gt;&lt;code&gt;OLLAMA_KEEP_ALIVE: 0&lt;/code&gt;&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;hr&gt;
&lt;div class="callout callout--important"&gt;
 &lt;div class="callout__title"&gt;
 &lt;i class="fa-solid fa-star" aria-hidden="true"&gt;&lt;/i&gt; Importante
 &lt;/div&gt;
 &lt;div class="callout__body"&gt;&lt;p&gt;Este benchmark se corrió en noviembre de 2025. Desde entonces el panorama de modelos de visión cambió bastante rápido, tanto para correr local como para usar vía API cloud. Para OCR y extracción de documentos estructurados hoy hay opciones más eficaces que las evaluadas acá: modelos locales más nuevos y mejor optimizados para VLM (versiones más recientes de Qwen-VL, entre otros), y servicios cloud especializados en extracción de documentos como &lt;strong&gt;Mistral OCR&lt;/strong&gt; o &lt;strong&gt;Mistral Document AI&lt;/strong&gt;, pensados específicamente para este tipo de tarea y con mejor relación precisión/velocidad que armar el pipeline con modelos generalistas vía Ollama. Los números y conclusiones de este post siguen siendo válidos como métodología y como fotografía de ese momento, pero si el objetivo es resolver el caso de uso hoy, vale la pena evaluar primero esas alternativas más recientes antes de replicar este setup tal cual.&lt;/p&gt;</description></item></channel></rss>