Mostrando entradas con la etiqueta ddr3. Mostrar todas las entradas
Mostrando entradas con la etiqueta ddr3. Mostrar todas las entradas

jueves, 2 de febrero de 2017

BIOS y ahorro de energía memoria en DDR3 o DDR4 – LowLevelHardware

Si somos usuarios de un sistema con una placa base de gama media o gama alta tendremos a nuestra disposición cientos de ajustes en BIOS para optimizar nuestra máquina.

20151130_085658Ajustes manuales DDR3.

Estos ajustes finos ciertamente pueden marcar la diferencia y hacer que nuestro sistema sea muy superior en todos los aspectos a uno configurado con los mismos componentes por defecto:

  • Rendimiento y velocidad de proceso muy superior (más del 50%).
  • Temperaturas mucho más controladas en cada componente.
  • Menor nivel de ruido de refrigeración.
  • Consumo total de la máquina muy reducido (en ocasiones en cientos de watt).

Sería fácilmente cuestión de cientos de artículos y cientos de miles de palabras detallar estos ajustes y todas sus posibles combinaciones en función del hardware específico, requiere un minucioso estudio de los whitepapers de cada procesador, chipset, placa base e implementación específica de cada BIOS.

En este artículo me referiré a una máquina con un procesador Core i7 3770K hand picked (seleccionado entre decenas de samples) configurada a 4.4 GHz a un voltaje muy reducido de solo 0.020 V superior al nominal mediante offset y con estabilidad absoluta con estos ajustes.

DRAM Power Management and Initialization

Aquí dejo enlaces a los Datasheet PDF relativos a:

La tercera generación Intel Core, Ivy Bridge 22 nm. (parte 1, parte 2).

La cuarta generación Intel Core, Haswell 22 nm. (parte 1, parte 2).

La quinta generación Intel Core, Broadwell 14 nm. (parte 1, parte 2).

La sexta generación Intel Core, Skylake 14 nm. (parte 1, parte 2).

En la sección 4.3.2 del manual en PDF 3rd-gen-core-desktop-vol-1-datasheet.pdf se detallan los ajustes que nos interesan relativos a la gestión de energía de las controladoras de memoria del procesador y de los módulos DDR3.

DRAM_Power_Management_and_Initialization_01DRAM Power Management and Initialization

En síntesis, los ajustes posibles serían:

Deshabilitar totalmente la gestión de energía para obtener las máximas prestaciones (opción 1 de la captura inferior).

Buscar un compromiso óptimo entre prestaciones y consumo (APD – PPD, opción 5).

Ir al máximo ahorro energético, menor consumo y disipación térmica (opción 4).

DRAM_Power_Management_and_Initialization_02DIMM Power Down modes.

En todas las máquinas que diseño me decanto por el ajuste central, el punto 5, APD – PPD, el óptimo compromiso.

DDR3_APD-PPDEl modo APD – PPD ofrece el compromiso perfecto.

En el caso que nos ocupa se consiguen ahorrar 6W de consumo en reposo (idle) y en uso normal (internet, compresión de datos, …) se mantiene en valores similares.

Es importante configurar el siguiente ajuste:

DDR3_Fast_ExitDDR DIMM Fast Exit Mode proporciona ahorro de energía con baja latencia de salida.

Con el ajuste de ahorro de energía deshabilitado no se consigue más velocidad de proceso ni mejores tiempos de cálculo en coma flotante o compresión de datos… pese a lo que sea lógico pensar.

Por ejemplo en WinRAR 5.21 x64, las velocidades y consumos son los siguientes:

Ajuste APD – PPD. Consumo de 94 a 109W y velocidad máxima 10459 KB/s.

Ajuste disabled. Consumo de 98 a 112 W y velocidad máxima 10467 KB/s.

Como podéis ver, no hay cambios significativos en la velocidad de compresión de datos y en cambio se ahorran 3 – 4 W en este test intensivo de memoria.

WinRARWinRAR en modo APD – PPD.

Como antes he señalado, en modo de reposo en el escritorio de Windows, se consiguen 6 W de bajada de consumo en el enchufe para un total de 48W (con 16 GB DDR3 2133 y el ajuste @ 4.4 GHz, SSD Samsung Evo 850 250 GB, disco duro 4 TB WD Caviar Black, tarjeta gráfica AMD 260X GCN 2 GB, tarjeta de sonido SB X-Fi y unidad óptica) desde los 54W con el ahorro de energía de la memoria DDR deshabilitado.

Si consideras útil el contenido de este Blog, ayuda a mantenerlo ojeando algunas de las ofertas que consideres interesantes de nuestros anunciantes. Gracias de antemano.

El que tenga dudas o aportaciones tiene para ello la sección de comentarios, intentaré responder a todos y con la máxima claridad. Los Blogs deben de ser lugares de intercambio y agradezco vuestro feedback.

MEMCON10: DDR4 y roadmap de memoria 2015 - LowLevelHardware

El pasado mes de Julio se celebró la convención MEMCON10, donde acuden los principales fabricantes y diseñadores de chips de memoria así como otros expertos en la materia. En este congreso se definieron los roadmaps futuros en el campo de las memorias de acceso aleatorio para sistemas de todos los segmentos y se analizaron las previsiones pasadas y sus desviaciones con la realidad actual.

 7 Roadmap RAM hasta 2015. Fuente: MEMCON10.

En los sistemas actuales la memoria de uso generalizado es DDR3 en frecuencias desde los 1.066 GHz hasta los 1.6 GHz y en modelos concretos llegamos hasta los 2.5 GHz, se estima que el zenit de la memoria DDR3 se alcanzará en los 2.133 GHz a 1.5 V en módulos estándar (como ahora lo son los DDR3 1.333 GHz) a finales de 2014.

b  El cruce en producción DDR2 vs. DDR3 se produjo a principios de 2010.

El desarrollo de DDR4 se ha dilatado en el tiempo más de lo esperado, y esto ha creado la necesidad de crear bins de mayor velocidad en DDR3, lo que nos llevará hasta los 2.133 GHz. La previsión inicial detallaba la DDR4 en sistemas ya en 2013:

6  Roadmap inicial, posicionaba DDR4 en 2013.

El tiempo ha demostrado que es más prudente asegurar el desarrollo de DDR4 y mientras tanto seguir con DDR3 poniendo énfasis en la reducción de voltaje para moderar el consumo.

1  El estado presente de las tecnología RAM.

Como todos sabemos, en el segmento de GPUs la memoria estrella es la GDDR5 en frecuencias que rondan ya los 5 GHz en productos finales (ATI de la serie HD5000) y hasta 7 GHz en chips discretos que serán integrados en la siguiente generación (ATI Southern Islands, ATI HD6000).

m  Proyecciones para DDR4.

En 2015 llega DDR4 con frecuencias iniciales de 2.133 GHz y 1.20 V. Con posibilidad de llegar en futuro sobre los 4.266 GHz. En 2013 se estima estar sobre los 3.2 GHz. Más allá se abre el terreno a la especulación, pero estaremos ya en 2018…

8  Consumos estimados para cada generación de DRAM.

Como vemos, la disipación térmica obliga a ir reduciendo constantemente el voltaje de los chips y con ello su consumo pero con ello se incrementa la sensibilidad al ruido de los canales de transferencia de datos obligando a los diseñadores a agudizar el ingenio con soluciones innovadoras.

Se estima que la DDR3 irá reduciendo su voltaje hasta los 1.25 V en el final de su evolución y la DDR4 empezará en 1.20 V e irá paulatinamente reduciéndolo hasta los 1.05 V.

En las primeras versiones, DDR4 disipará más calor que la DDR3 de voltaje reducido, para, en sucesivas revisiones ir reduciendo su consumo.

d  Conforme avanzan los procesadores multicore aumenta la necesidad de mayor ancho de banda.

La preocupación principal de los expertos estriba en los voraces requerimientos de los procesadores multicore actuales y en su desmedido crecimiento año a año.

La industria de la memoria no es capaz de proporcionar incrementos prestacionales de tal calibre y aumenta cada vez más el vacío de velocidad y latencia entre los cores y la memoria principal.

Para paliar este fenómeno cada vez se integran cachés multinivel de estructura y gestión más compleja y mayores tamaños, así como se amplia en la medida de lo posible el acceso multicanal a los bancos de memoria RAM.

Si consideras útil el contenido de este Blog, ayuda a mantenerlo ojeando algunas de las ofertas que consideres interesantes de nuestros anunciantes.

AMD Bulldozer. Prestaciones estimadas - LowLevelHardware

En el tercero de esta serie de artículos dedicados a la próxima micro arquitectura de AMD voy a aventurar mis previsiones sobre su nivel prestacional. Además lo compararé con los diseños actuales y con su muy evolucionado y perfeccionado futuro competidor, Intel Sandy Bridge.

Bulldozer_server AMD Bulldozer, la próxima micro arquitectura.

Bulldozer module, el módulo Bulldozer:

BulldozerModuleAMD Bulldozer module.

AMD llama módulo al conjunto siguiente:

  • Las etapas de Fetching
  • La circuitería de Decodificación X64
  • Los tres Schedulers independientes
  • Las cachés L1i
  • Los 2 cores de enteros compuestos de 2 ALUs y 2 AGUs
  • Una doble FPU con capacidad FMAC de 128 bit
  • Las cachés L1d
  • La L2 compartida para todas las unidades funcionales dentro del módulo

Este concepto se contrapone a la actual acepción de core. En los actuales diseños entendemos como core al conjunto del procesador excluyendo las interfaces externas, el North Bridge y en todo caso la caché L3 compartida (de haberla).

AMD nos obliga a cambiar el concepto para subrayar que cada módulo contiene dos cores funcionales e independientes de proceso de enteros.

Prestaciones por ciclo esperadas

A estas alturas tengo absolutamente claro que el tamaño en mm2 de la parte lógica (excluyendo L2 e interfaces) de Bulldozer será notable, claramente superior a sus actuales cores K10.5.

AMD ha comunicado que su núcleo K10 fabricado en 32 nm SOI HKMG por GloFo ocupa solamente 9.69 mm2 para 35 M Transistores, 17.7 mm2 incluyendo 1 MB de L2 (110 MT).

AMD_K10_32nm AMD K10 32 nm core 1 MB L2.

Estimo que el área lógica (ALUs + FPU) de Bulldozer se irá a la zona de los 20 mm2 en 32 nm, el doble que K10 32 nm y más área de die que los actuales cores K10.5 de 45 nm de Phenom II (unos 17 mm2).

K10.5_45nm_1MBAMD K10.5 45 nm 1 MB de L2.

Prestaciones en coma flotante (FPU)

Donde habrá un gran incremento en número de transistores será en la gran FPU doble de 128 bit con capacidad FMAC.

La actual implementación en K10.5 de 45 nm (Phenom II) comprende 3 pipelines de coma flotante especializados de 128 bit:

  • FMUL
  • FADD
  • FMISC

Esta limitación reduce su capacidad de proceso FPU puesto que cada unidad procesa un tipo de instrucciones y cada tipo de instrucción debe ir a su unidad y no otra.

En Bulldozer ambos pipelines son generales (ejecutan cualquier instrucción FPU) y simétricos y por ello resulta una arquitectura mucho más potente en cálculo matemático.

En coma flotante espero un gran avance en prestaciones clock for clock respecto a los actuales diseños de AMD, cifrado en torno a un 50% para 4 módulos Bulldozer con sus 4 FPUs dobles frente a las 6 FPUs con 3 pipelines de 128 bit cada una del hexacore Istambul.

Istambul45nm AMD Istambul hexacore, Bulldozer lo superará en un 50% en potencia FPU.

Prestaciones en proceso de enteros

Los Int cores muy probablemente serán más cortos en transistores que los actuales cores de enteros de Phenom II. De hecho reducen su capacidad de 3 ALUs mas 3 AGUs a 2 mas 2 respectivamente. AMD claramente apuesta por un futuro multithread…

Las prestaciones por Int core en cambio serán muy probablemente inferiores a las actuales en Phenom II.

Según las propias estimaciones de AMD, un MCM Bulldozer con 16 Int cores será un 37% más rápido que el doble hexa core Magny Cours. Si calculamos, a igualdad de cores, llegamos a un empate técnico.

Es decir, las prestaciones multithreaded en proceso de enteros serán equivalentes. En cambio, en algoritmos single threaded parece que Bulldozer será inferior a los actuales cores de AMD. Me puedo equivocar pero a la luz de los datos conocidos…

Frecuencias estimadas

La frecuencia de trabajo de un microprocesador actual la determinan numerosos factores:

  • La capacidad de la lógica de procesamiento (ALUs, FPUs…) de funcionar con corrección y estabilidad a esa frecuencia con un voltaje razonable.
  • La capacidad de realizar las comunicaciones inter core en un tiempo suficientemente corto para finalizar la transferencia antes del siguiente tick de reloj.
  • Frecuencia máxima de las cachés a la latencia y voltaje estipulado.
  • Entrar dentro del TDP de diseño (Thermal envelope) a esa frecuencia y voltaje en carga máxima combinada.

Como vemos, por un lado la frecuencia viene determinada por las capacidades del chip, del “silicio”, y por otro lado de no excederse en disipación térmica.

La velocidad de propagación de las señales eléctricas es limitada (y muy, muy inferior a la de la luz contrariamente a lo que algunos piensan) y por ello transcurre un tiempo finito desde que una unidad envía un resultado hasta que otra unidad lo recibe y puede comenzar su procesamiento sobre él. Esto limita la frecuencia de los procesadores y motiva que su diseño sea extremadamente complejo pues hay que posicionar las unidades que necesitan comunicación mutua lo más cerca posible (no en distancia, sino en tiempo – latencia –).

La disipación térmica depende de la frecuencia linealmente y del voltaje. La dependencia del voltaje es con una potencia entre 2 y 3:

  • Doble frecuencia, doble disipación.
  • Doble voltaje, de 4 a 8 veces mayor disipación térmica.

Como todos sabéis, a mayor voltaje (dentro de las limitaciones del diseño y el proceso de fabricación) mayor fiabilidad y linealidad en el rendimiento de los transistores de los que está compuesto el chip.

Todos estos condicionantes dan un rango de voltaje utilizable en el procesador, cuanto más nos acercamos al máximo obtendremos una mayor frecuencia estable pero con un gran consumo y en cambio, en la parte baja del rango obtendremos una menor frecuencia pero un excelente performance per watt.

Estimo que las frecuencias de Bulldozer se moverán en el mismo rango que los actuales cores Shanghai y Interlagos, sus frecuencias máximas rondarán los 3+ GHz. No veo probable cruzar los 4 GHz con TDPs razonables (máximo de 140W).

Si consideras útil el contenido de este Blog, ayuda a mantenerlo ojeando algunas de las ofertas que consideres interesantes de nuestros anunciantes.

Los nuevos Intel dual core: Core i5 y Core i3. Actualizado - LowLevelHardware

Intel va a empezar en breve a desplazar (inicialmente por la gama más alta) a sus excelentes procesadores Core2Duo de 45 nm con las nuevas gamas de 32 nm basadas en núcleos de microarquitectura Westmere (descendiente de Nehalem) en configuración dual core y asociados a GPUs, por primera vez integradas en el mismo chip.

Corei3_i5_desnudoIntel Core i5 y Core i3, el nuevo procesador compuestos de dos dies.

Se trata de procesadores con dos dies en un mismo encapsulado, un MCM (multi chip module):

  • Un die (fabricado en el nuevo proceso de 32 nm con una superficie de unos 74 - 78 mm2) consta de los dos núcleos del procesador dual core junto con la caché L3 compartida de 4 MB, los write buffers de la L3, la circuitería del bus QPI para conexión con el segundo die y otras I/O.

westmere-dualcoree Westmere dual core: un die de 32 nm incluyendo los núcleos, el QPI y la L3 de 4 MB con los write buffers.

  • El segundo (fabricado en 45 nm con una superficie de 111 - 116 mm2) incluye la GPU integrada con 12 clusters de procesadores gráficos DX10, las controladoras de memoria dual channel DDR3, la circuitería QPI para enlazar con la CPU (el primer die), el bus PCIe y el bus DMI para conectividad con el South Bridge.

La GPU es un descendiente directo de la empleada en al chipset de las series G45 para Core 2 Duo, en este caso ve aumentada su capacidad de 10 a 12 procesadores y cuenta con numerosas mejoras que elevan su rendimiento al doble, permitiéndole competir con los chipsets integrados de AMD y nVidia.

Las controladoras de memoria, desafortunadamente, tienen más que ver con las dual DDR3 de chipset P45 y X48 que con las soberbias integradas en Lynnfield o Nehalem.

De echo las latencias de acceso a RAM en estas nuevas CPUs son muy superiores a las de Nehalem1366 o a Lynnfield1156 e incluso son superiores a un simple Core”Duo en una buena placa base P45 con DDR3 1333 y timings 7-7-7-21 2T.

Corei5_i3_desnudo El nuevo multi chip de Intel al descubierto.

Al contar con dos dies en un mismo chip, la superficie total es bastante elevada (sobre los 190 mm2) lo que resulta en unos costes de fabricación correspondientemente altos. Por ello, Intel posiciona estos procesadores en unos precios desde los 113$ (excluyendo al muy “capado” Pentium G9650).

De este modo no espero una rápida transición desde los actuales Core2Duo de 45 nm a estos nuevos chips, será una transición más bien suave…

GamaClarkdale_Excel Clarkdale: los integrantes de las versiones dual core de la gama Core i5 y Core i3.

Los Core i5 de la serie 600 contarán con turbo Mode e HyperThreading (SMT) para un total de cuatro threads. Recordemos que por encima se sitúan los Core i5 de la serie 700, siendo éstos quad core nativos con Turbo Mode pero sin SMT basados en dies Lynnfield.

En cambio los Core i3 de la serie 500 prescinden del turbo Mode aunque mantienen el HyperThreading. En cambio el modelo Pentium G6950 se queda con 3 MB de L3 y sin SMT además de bajar el reloj de la GPU a 533 MHz.

Habrán dos versiones, que realmente serán el mismo chip, aunque con distintas funcionalidades activadas. Una de ellas será la versión de sobremesa, Clarkdale y la segunda la destinada a portátiles o Arrandale.

La nueva arquitectura, simplifica el esquema de los Core2Duo a los que sustituye. Pasamos de tres chips a solamente dos: Procesador (MCM de dos dies) y South Bridge (en placa base).

Clarkdale2chip Reducción de complejidad de la plataforma a dos chips.

De todos modos, esto no se ha hecho del modo más elegante y sobretodo no del más eficiente prestacionalmente hablando, me explico:

Al ser un MCM, Clarkdale pierde la excelente arquitectura de alta integración vista en Nehalem (core i7 serie 900) y Lynnfield (Core i7 serie 800 e i5 serie 700). En un solo die se integraban desde los núcleos pasando por las controladoras de memoria y la L3 hasta los QPI e incluso en el caso de Lynnfield el bus DMI (para comunicar con el chipset P55) y el PCIe 16X (para la GPU).

Wafer de dies de 32 nm.

Los tamaños relativos de ambos dies se observan a continuación:

clarkdaledie_dies Intel Clarkdale dual core, un MCM compuesto de dos dies.

Intel ha tomado “el camino de en medio” y ha diseñado Clarkdale como un MCM con dos dies con distintas funcionalidades en cada una, de hecho el segundo die integra la GPU, el engine de descompresión de video, el bus DMI y las dos controladoras DDR3, y aquí reside el problema:

Al necesitar los cores utilizar el bus QPI para comunicar con el segundo die para realizar escrituras o lecturas a RAM hemos vuelto a una arquitectura “semi-FSB”, siendo este sustituido por un mas eficiente bus QPI a una velocidad reducida (en la fotografía superior marcado en ambos dies como “MCP Interface”).

Westmere_die_sho2 Detalle del die de Clarkdale.

Por otro lado las frecuencias del Uncore en Clarkdale son de 2.13 GHz y 2.4 GHz, frente a los 2.13GHz del i7 920, 940, 950, 960 y los 2.66 GHz del i7 965X y 975X o los 2.4 GHz de Lynnfield. Esto afecta a la latencia y transferencia de la caché L3 que se mantienen en valores similares a Nehalem o Lynnfield.

En cambio, y debido al encontrarse en dies separadas, la latencia de acceso a RAM empeora ostensiblemente, ya que ahora se encuentra a mayor distancia temporal (en ns) y a través de un bus QPI.

Para estos procesadores Intel ha desarrollado varios nuevos chipsets:

clarkdale_chipsets Oferta de chipsets compatible con Clarkdale.

Entre ellos se encuentra el conocido P55 conocido en las placas LGA 1156. Con este chipset se podrán montar estas CPUs pero perdiendo su funcionalidad gráfica integrada ya que no integra el bus IFDI (Intel Flexible Display Interface).

Igualmente los procesadores basados en núcleos Lynnfield (Core i7 serie 800 y Core i5 serie 700) se podrán montar con estos nuevos chipsets sin problemas.

En cuanto a los gráficos integrados Intel ahora los denomina HD Graphics “a secas”, es una evolución del integrado en el chipset P45 Express y sus frecuencias no serán las mismas en toda la gama:

t2[1] Gama Core i5 e i3 junto al Pentium G6950.

Como vemos estas oscilaran de los 533 MHz del Pentium pasando por los 733 MHz de toda la gama excepto el modelo 661 con 900 MHz en su GPU (los modelos acabados en 1 contarán con esta característica). Secundariamente este hecho aumenta su TDP en 14W extra.

Los modelos Arrandale para portátiles contarán con Graphics Turbo Mode, es decir, frecuencias dinámicas en GPU para mantener un TDP global aceptable dentro de los límites del diseño y un consumo contenido para adaptarse a este mercado.

Documentos técnicos de los procesadores Core i7, Core i5 y Core i3.

Si consideras útil el contenido de este Blog, ayuda a mantenerlo ojeando algunas de las ofertas que consideres interesantes de nuestros anunciantes.

Previo AMD Bulldozer. Actualizado - LowLevelHardware

La próxima generación del core de AMD está despertando una gran excitación entre los profesionales de la arquitectura de procesadores, e incluso entre los propios ingenieros en Intel. Tal como ahora la conocemos será un rotundo éxito si es llevada a buen puerto como apuntan los numerosos rumores y las escuetas informaciones del fabricante.

Bulldoxer_4module_8int_cores_L3shared_630 AMD Bulldozer Zambezi 8 cores: 4 módulos y 8 threads con 8 INT cores.

En un artículo anterior, de Enero de este año, hice una pequeña lista de peticiones (wish list) para la próxima generación de procesadores AMD. Todos sabemos que el diseño definitivo del procesador que sustituirá, ya fabricado en 32 nm, a los actuales Opteron y Phenom II basados en núcleos Shanghai es definitivo hace meses y con alta probabilidad están ya en los previos al tape-out del primer stepping bootable.

Un poco de historia: Intel y la era Netburst

Durante años, desde la aparición del flamante Athlon64 en 2003, AMD gozó de una etapa de clara supremacía de sus diseños en prestaciones, consumo y disipación térmica. Intel ya desde el año 2000 comercializó su línea Netburst, unas CPUs basadas en pipelines extraordinariamente largos con la excusa de altísimas frecuencias y con un desafortunado e intrusivo (aunque necesario) mecanismo de Replay de micro operaciones.

Fueron procesadores que más bien parecían diseñados por los equipos de márqueting que por los excelentes grupos de ingeniería en Intel…

Las primera iteración del procesador Pentium 4 (Willamette 180nm) salió a la venta en 2000 compitiendo con el excelente y equilibrado procesador AMD Athlon. Con un pipeline de enteros de 20 etapas (!!) después de los decoders y la trace caché.

Contaba con unos tamaños de caché claramente insuficientes: la ínfima caché L1 de 8 KB y la L2 de 256 KB. El tamaño de la L2 de 256 KB se rumorea que fue una víctima de las prisas de Intel por llevar al mercado el diseño en 180 nm. Sus frecuencias finales fueron de 1.3 a 2.0 GHz.

die_180nm[1]Intel Pentium 4  Willamette 180 nm 256 KB L2.

Era una CPU muy cara y difícil en fabricación dado su tamaño y complejidad, casi toda su superficie era lógica. Contaba con un FSB quad pumped (4 x 100 MHz) de 400 MTs para un dual channel RAMBUS a 800 MHz y 16 bit (en el año 2000 !!). En fín, una plataforma de un coste estratosférico para finalmente y en la práctica obtener rendimientos similares o inferiores a un AMD Athlon con simple memoria SDRAM.

A finales de 2001 llegó, en mi opinión, el mejor integrante de la saga: el procesador Northwood de 130 nm ya con 512 KB de L2 y posteriormente dotado con HyperThreading. Partió de los 2 GHz (FSB 400 MHz) para escalar rápidamente. En esta época ya competía con los Athlon XP de AMD de 180 nm.

die_130nm[2]Intel Pentium 4  Nothwood 130 nm 512 KB L2.

Cuando llegó a frecuencias desde los 2.8 GHz y con un FSB de 800 MHz empezó a ser el líder en prestaciones y los modelos 3.2 y 3.4 gozaron de gran fama y un excelente rendimiento.

En 2004 llegó Prescott en 90 nm (1 MB L2) con un pipeline absurdamente dilatado a más de 30 atapas (!!).

Fue un rediseño absoluto de Netburst, poco tenía que ver con Willamette o Northwood. Incluso se rumoreó el nombre de Pentium 5, posteriormente introdujo el proceso de 64 bit. Sus prestaciones finales fueron desalentadoras, de hecho era algo más lento clock for clock que Northwood… Además su disipación térmica ponía en aprietos al mejor sistema de refrigeración de la época.

die_90nm_1m[1] Intel Pentium 4 Prescott 90 nm 1 MB L2.

Todavía recuerdo cuando probé los primeros engineering samples de Prescott a 2.8 GHz sustituyendo un excelente Nortwood HT a 3.2 GHz obteniendo 20ºC más de temperatura y un rendimiento muy inferior… La cuerpo del disipador daba miedo…

Prescott se diseño para frecuencias máximas sobre los 5 GHz, pero problemas de diseño (excesivo leakage del proceso de 90 nm en Prescott) y su incontenible consumo eléctrico y consiguiente disipación térmica lo hicieron inviable. Intel incluso tuvo en sus roadmap versiones a 4 y 4.2 GHz que más tarde canceló.

En 2005 Intel tenía previsto el lanzamiento de Tejas (con un pipeline previsto sobre 50!!!!!! etapas). Los primeros samples fueron una gran decepción, consumos excesivos rayando lo imposible en plataformas de consumo y un rendimiento decepcionante. Fue sabiamente cancelado.

En Intel se cortaron algunas cabezas en los staff directivos y se replanteó totalmente el diseño de sus futuros microprocesadores. El management dio paso al diseño del equipo en Haifa (Israel), los padres del excelentísimo procesador Pentium M Banias de 90 nm derivado del núcleo Pentium III.

El despertar de un gigante, Intel Conroe (Core 2 Duo / Quad) 65 nm

Tras todos estos hechos, AMD equivocadamente pensó o más bien confió en que Intel continuaría con la evolución de Netburst eternamente.

Se durmieron en los laureles del K8, dedicaron muchos recursos al proyecto K9, un procesador con un pipeline extra largo tipo Netburst y con SMT al estilo HyperThreading que fue tardíamente aunque acertadamente cancelado.

merom_die_image Intel Core 2 Duo Conroe 65 nm, dual core 4 MB L2.

Intel sacó al mercado en 2006 Conroe, el famoso Core 2, dando un vuelco radical mercado y consiguiendo un dominio absoluto en todos los segmentos desde portátiles a sobremesa de consumo y servidores dual core.

En el terreno multisocket AMD mantenía su liderato absoluto en 4 sockets gracias a su más avanzada arquitectura con enlaces HT (HyperTransport) frente al arcaico FSB de Intel. En los servidores de dos socket había una encarnizada pelea, Intel contaba con mejores núcleos de ejecución pero AMD ganaba en ancho de banda.

El éxito de Conroe reside en su poderoso núcleo de ejecución de enteros de cuatro pipelines y sus bien dimensionadas FPU de 128 bit, además de su excelente arquitectura de cachés inclusivas y de gran tamaño (2 MB de L2 por core en 65 nm y 3 MB de L2 por core en 45 nm).

La decepción del AMD Barcelona 65 nm

AMD llegó tarde al mercado con los procesadores Opteron quad core y Phenom basados en cores Barcelona de 65 nm.

Con una exigua caché L3 compartida de solo 2 MB para cuatro núcleos (512 KB por core). Una caché L3 de diseño totalmente asíncrono con los núcleos que imponía altas latencias de acceso cifradas en unos 48 ciclos a frecuencias nominales. Además y debido a su pequeño tamaño, unas bajas tasas de aciertos L3 (cache hits) y grandes cargas en el dual channel DDR2 lo que causaba contención en acceso.

phenom AMD Barcelona 65 nm, quad core nativo con 2 MB de L3 compartida.

Intel hacía meses que disponía del doble dual core Clovertown de 65 nm con dos L2 de 4 MB que aumentó más si cabe el diferencial de prestaciones con AMD, además de ser más barato de fabricar dada su poca superficie y avanzada tecnología de fabricación.

Estaba formado por dos dies Core 2 Duo en un chip:

intel-core-2-quad-q6600-cpus1[2] El Intel Core 2 Quad, un MCM de dos Core 2 Duo. 4 + 4 MB de L2 en 65 nm.

Rápidamente Intel sacó al mercado la evolución de 45 nm de Core 2, los núcleos Penryn con 6 MB de L2 compartida. Contaban con numerosas mejoras que lo hacían sobre un 16% más rápido que su antecesor de 65 nm y recuerdo como todos mis mejores clientes sustituyeron sus CPUs Conroe por Penryn en pocos meses debido a su gran mejora en algoritmos conteniendo divisiones.

Penryn_58 Intel Core 2 Duo Penryn 45 nm, dual core con 6 MB L2 compartida.

Barcelona fue un débil rival para tales procesadores y esto se agravó cuando Intel presento el sustituto de Yorkfield, Harpertown, dotado de cuatro núcleos Penryn y 2 L2 de 6MB y proceso de 45 nm.

penryn_quadcore Los Core 2 quad de la serie 9000, fabricados en 45 nm.

Nivelando el terreno, AMD Shanghai

Por fin AMD introdujo en el mercado, esta vez sí, un procesador competente con la oferta de su rival Intel: el core Shanghai de 45 nm. Lo he analizado en multitud de artículos y desde todos los ángulos en LowLevelHardware (ordenados por fecha):

Y en ProfessionalSAT:

Ha poblado las series Opteron y Phenom II dotado de una L3 de 6 MB y 48 vías desplazando al mediocre chip Barcelona. Con esta evolución logró al fin doblegar a los invencibles hasta el momento Core 2 Quad Penryn. Actualmente se comercializa en versiones hasta los 3.4 GHz (Phenom II X4 965 BE) y este modelo en particular supera a cualquier Core 2 Quad en la media de benchmarks.

K10%20processor%2045nm%20architec%201[1]AMD Shanghai 45 nm, quad core nativo con 6 MB de L3 compartida.

Intel Tick–Tock. Microarquitectura Nehalem con SMT

El pasado año 2008 (en Q4) Intel dio a luz a su última microarquitectura de altas prestaciones: Nehalem. Salió a la venta con el nombre comercial de Core i7.

Este procesador lo he tratado extensamente (quizás me quedo corto…) en varios de mis blogs:

En LowLevelHardware he detallado su microarquitectura:

die Intel Nehalem 45 nm, quad core con SMT (8 threads) y 8 MB L3 compartida.

Su gran  baza es reside en el SMT, el Turbo Mode  y un brutal y desorbitado ancho de banda dado por el triple channel DDR3 además de su excelente arquitectura de caché de tres niveles con unos 38 ciclos de latencia L3 y unas ultrarrápidas L2 de 10 ciclos y 256 KB.

Con Nehalem, Intel ha logrado el liderato destacado en prestaciones en todos los terrenos: enteros, coma flotante, single thread, multithreading, ancho de banda, latencia… y AMD está pasando tiempos difíciles compitiendo con su única arma, el precio… y la inteligencia de su líder.

Un Phenom II X4 965 BE (el tope de gama) compite actualmente con el procesador benjamín de la gama Nehalem el Lynnfield Core i5 750 sin SMT (HyperThreading) y con dual channel DDR3 en prestaciones y precio.

die-angle-620[1] Intel Lynnfield 45 nm. Integra el controlador PCIe 2.0 en el die (a la izquierda).

Por encima de ellos se sitúan los Core i7 Lynnfield de socket LGA1156 con SMT, Turbo Mode agresivo y dual DDR3 Core i7 860 y 870. Este procesador, al integrar el bus PCIe en el die prescinde de los enlaces QPI y del chipset X58.

Lynnfield45nmIntel Lynnfield. 45 nm, 8 MB L3, SMT y PCIe integrado.

La superior gama i7 LGA1366 con SMT y triple DDR3 (asociado por un QPI de 4.8 a 6.4 GT/s con el chipset X58) no cuenta a día de hoy con un procesador equivalente en velocidad en AMD aunque tampoco en precio.

Servidores AMD e Intel en 2009

El año 2009 ha sido excelente para Intel, ha podido desplegar su arquitectura Nehalem hasta los dos sockets. En este terreno AMD no tiene una alternativa en paridad aunque se acerca bastante con su diseño Istambul, un hexa core nativo con 6 MB de L3 y fabricado en 45 nm:

Istambul45nmAMD Istambul. 6 núcleos y 6 MB L3 en 45 nm.

En el espacio 4 socket AMD es imbatible ya que Intel mantiene sus mastodónticos e ineficientes chips Dunnington hexa core basado en núcleos tres Penryn dual core con 3 MB de L2 shared por pareja y 6 MB de L3 compartida con una latencia superior a los 100 ciclos!!!

Dunnington_Xeon Intel Xeon Dunnington. 6 cores 3 L2 de 3 MB y 16 MB de L3 shared en 45 nm.

AMD e Intel en 2010

En 2010 AMD seguirá refinando el diseño de Shanghai. Hace un mes aproximadamente lanzó el nuevo stepping C3 que reduce el consumo y disipación térmica así como permite mayores overclocks en cores y uncore (caché L3, North Bridge y controladoras de memoria).

Introducirá un verdadero estado C1E lo que reducirá el consumo. Probablemente veremos versiones a 3.6 GHz del Phenom II X4 BE y como novedad la introducción del hexa core Istambul de 45 nm y 6 MB de L3 procedente de las actuales gamas de servidores Opteron de la serie (quizás Phenom II X6??) en el mercado de sobremesa llamado Thuban.

Westmere_wafer Wafer de procesadores Intel Westmere de 32 nm.

Intel tiene previsto la migración a 32 nm con los núcleos Westmere, la evolución de Nehalem. En el terreno más prestacional veremos los Westmere de 6 cores con SMT que elevará a 12 el número de threads por procesador. Contarán con 12 MB de L3 y varias mejoras micro arquitecturales.

westmereEl futuro Westmere dual core 32nm, 4 MB de L3 compartida y 256 KB L2 por core.

En principio Intel no tiene planes de un quad core de 32 nm basado en núcleos Westmere, para ello habrá que esperar a Sandy Bridge en 2011. Lo que sí habrá es un hexacore nativo llamado Gulftown:

gulftown32nm_6core Gulftown 6 cores, 12 MB L3 y 12 threads en 32 nm.

La buena noticia para algunos de mis clientes es que será compatible con la mayoría de actuales placas base con chipset X58 y socket LGA 1366.

AMD e Intel en 2011

Intel introducirá Sandy Bridge, su nueva microarquitectura tras Nehalem. Incluirá también SMT y la interconexión del procesador con el Uncore y los buses y cachés L3 compartidas será a través de un anchísimo ring bus que proporcionará latencias menores que en los actuales diseños.

003Sandy Bridge 32 nm, la próxima evolución microarquitectural de Intel.

En el siguiente artículo haré una educada estimación de la siguiente microarquitectura de AMD, el revolucionario core Bulldozer de 32 nm que verá la luz en 2011.

Si consideras útil el contenido de este Blog, ayuda a mantenerlo ojeando algunas de las ofertas que consideres interesantes de nuestros anunciantes.

Phenom II X2, Athlon II X2 y el futuro Athlon II X4. Nuevos cores de AMD – LowLevelHardware

Advanced Micro Devices está ejecutando su roadmap admirablemente, de una manera que pocos esperaban teniendo en cuenta el gran éxito y presión ejercida por su rival y mayor fabricante mundial, Intel Corp.

AthlonIIAthlon II X2: el dual core nativo de 45 nm, codename: Regor.

En las últimas semanas AMD ha presentado tres nuevos diseños:

  • Un hexacore nativo con L3 de 6 MB: AMD Istambul
  • Un dual core nativo con dos L2 de 1 MB: AMD Regor o Athlon II X2
  • Un quad core nativo con cuatro L2 de 512 MB y sin L3: Athlon II X4

En un artículo anterior esbozaba las nuevas estrategias de futuro y la visión más técnica y práctica del nuevo CEO de AMD, Dirk Meyer, todo un profesional del diseño de procesadores.

PhenomII_NO_L3 Athlon II X4: Quad core nativo sin caché L3 y con un solo bus HT bidireccional, codename Propus.

Hablando de un futuro próximo, en breve tendremos en el mercado los nuevos Athlon II X4, de los que os presento arriba fotografía del die y donde observamos que carece de caché L3 y solo cuenta con un link HT. Además las cachés L2 son de 512KB como en Shanghai.

Y en presente… AMD, ya de lleno en el nodo de 45 nm, nos presenta hoy su nueva gama de procesadores dual core para el segmento medio del mercado, compuesta por dos series.

AMD core Regor - Athlon II X2 serie 200

Con este procesador AMD quiere sustituir todos los procesadores basados en los antiguos núcleos Athlon64 X2 Brisbane de 65 nm todavía en el mercado migrando toda la gama X2 a 45 nm y núcleos de arquitectura K10.5.

Sus prestaciones son claramente superiores a los anteriores núcleos K8 y K10 (los primeros Phenom Barcelona de 65 nm) y cuentan con una arquitectura de procesamiento actualizada e idéntica a los Phenom II X4 de 45 nm basados en el núcleo Shanghai.

Analizando el díe observamos algunas características notables:

  • Es un diseño dual core nativo, compacto y muy optimizado en superficie.
  • Se ha reducido notablemente el tamaño del Uncore respecto a Shanghai al no necesitar toda la lógica de gestión de la caché L3.
  • Cuenta con dos L2 discretas e independientes aumentadas a 1 MB y con 16 vías de asociatividad como en los Phenom, Phenom II y en los antiguos Athlon64.
  • Hay dos controladoras de DDR2/DDR3, como en Shanghai (Phenom II).
  • No hay caché L3 para optimizar su tamaño.
  • El número de enlaces HyperTransport se reduce a uno a una frecuencia de 2 GHz.
  • La superficie estimada ronda los 117 mm2 para 234M de transistores, un resultado muy satisfactorio.
  • Las frecuencias iniciales rondan los 3 GHz.

AthlonII_croquis Esquema del procesador Athlon II.

Su disipación térmica se reduce a un TDP máximo de 65W, siendo (ahora sí) una excelente opción para sistemas destinados a reproducción BluRay o DVD de salón.

En pruebas reales ha dado sobre unos 30 – 35 W en carga máxima (consumo aislado del procesador) y en reposo memos de 10W. Realmente podemos decir que es un procesador fácil de refrigerar.

AMD core Callisto - Phenom II X2 serie 500

El procesador Phenom II X2 no es un dual core nativo y por ello su disipación térmica es más elevada que en el caso del nuevo Athlon II, aunque no por ello es excesiva. En medidas reales ronda los 50 W en carga 100 % de los dos núcleos.

Shanghai Die de Shanghai quadcore de 45 nm y 6 MB de caché L3.

El Phenom II X2, igual que el Phenom II X3, comparten die con el “completo” Phenom II X4 quadcore. De hecho todos ellos son el mismo procesador, lo que ocurre es que AMD desactiva respectivamente dos o uno de los núcleos.

Esta inactivación de cores puede responder a dos razones:

  • Alguno de los núcleos no es funcional.
  • Por razones económicas o de stock (exceso de quads o falta de X2s) necesita producir mayor número de CPUs dual core.

El lado positivo es que el AMD Phenom II X2 goza de una caché L3 completa de 6 MB para tan solo dos núcleos (3 MB de L3 por procesador) lo que aumenta sus prestaciones de media sobre un 5 a 8 % sobre el Athlon II X2 clock for clock. En pico llega a ser hasta un 18 % más rápido.

Por contra, al ser un chip de 751M de transistores, su consumo y disipación térmica no pueden ser tan contenidos como en el caso del Athlon II X2 y se acerca incluso a sus parientes quadcore con un TDP de 80W. Siendo para AMD el TDP la potencia máxima teórica consumida por el procesador en carga máxima y en condiciones críticas de temperatura y alimentación eléctrica.

El tesoro oculto en Phenom II X2

Al ser un quadcore nativo con dos núcleos deshabilitados es posible, en ocasiones, volver a activar estos dos procesadores. Para ello necesitamos una placa base que tenga en BIOS la opción del ACC (Advanced Clock Calibration).

Al activar esta opción nos podemos encontrar con dos situaciones:

  • Tenemos un flamante quadcore con 6 MB de L3 perfectamente funcional a precio de dual core.
  • Alguno de los núcleos activados es defectuoso y obtendremos errores, cuelgues o incluso fallos en el arranque.

Ciertamente no hay otro modo de averiguarlo que probar… Sin duda que ahora que salen al mercado hay más probabilidades de que sean quad cores funcionales y conforme avance el proceso de fabricación iremos encontrando más CPUs con núcleos defectuosos.