Mostrando entradas con la etiqueta quad core. Mostrar todas las entradas
Mostrando entradas con la etiqueta quad core. Mostrar todas las entradas

jueves, 2 de febrero de 2017

Previo AMD Bulldozer. Actualizado - LowLevelHardware

La próxima generación del core de AMD está despertando una gran excitación entre los profesionales de la arquitectura de procesadores, e incluso entre los propios ingenieros en Intel. Tal como ahora la conocemos será un rotundo éxito si es llevada a buen puerto como apuntan los numerosos rumores y las escuetas informaciones del fabricante.

Bulldoxer_4module_8int_cores_L3shared_630 AMD Bulldozer Zambezi 8 cores: 4 módulos y 8 threads con 8 INT cores.

En un artículo anterior, de Enero de este año, hice una pequeña lista de peticiones (wish list) para la próxima generación de procesadores AMD. Todos sabemos que el diseño definitivo del procesador que sustituirá, ya fabricado en 32 nm, a los actuales Opteron y Phenom II basados en núcleos Shanghai es definitivo hace meses y con alta probabilidad están ya en los previos al tape-out del primer stepping bootable.

Un poco de historia: Intel y la era Netburst

Durante años, desde la aparición del flamante Athlon64 en 2003, AMD gozó de una etapa de clara supremacía de sus diseños en prestaciones, consumo y disipación térmica. Intel ya desde el año 2000 comercializó su línea Netburst, unas CPUs basadas en pipelines extraordinariamente largos con la excusa de altísimas frecuencias y con un desafortunado e intrusivo (aunque necesario) mecanismo de Replay de micro operaciones.

Fueron procesadores que más bien parecían diseñados por los equipos de márqueting que por los excelentes grupos de ingeniería en Intel…

Las primera iteración del procesador Pentium 4 (Willamette 180nm) salió a la venta en 2000 compitiendo con el excelente y equilibrado procesador AMD Athlon. Con un pipeline de enteros de 20 etapas (!!) después de los decoders y la trace caché.

Contaba con unos tamaños de caché claramente insuficientes: la ínfima caché L1 de 8 KB y la L2 de 256 KB. El tamaño de la L2 de 256 KB se rumorea que fue una víctima de las prisas de Intel por llevar al mercado el diseño en 180 nm. Sus frecuencias finales fueron de 1.3 a 2.0 GHz.

die_180nm[1]Intel Pentium 4  Willamette 180 nm 256 KB L2.

Era una CPU muy cara y difícil en fabricación dado su tamaño y complejidad, casi toda su superficie era lógica. Contaba con un FSB quad pumped (4 x 100 MHz) de 400 MTs para un dual channel RAMBUS a 800 MHz y 16 bit (en el año 2000 !!). En fín, una plataforma de un coste estratosférico para finalmente y en la práctica obtener rendimientos similares o inferiores a un AMD Athlon con simple memoria SDRAM.

A finales de 2001 llegó, en mi opinión, el mejor integrante de la saga: el procesador Northwood de 130 nm ya con 512 KB de L2 y posteriormente dotado con HyperThreading. Partió de los 2 GHz (FSB 400 MHz) para escalar rápidamente. En esta época ya competía con los Athlon XP de AMD de 180 nm.

die_130nm[2]Intel Pentium 4  Nothwood 130 nm 512 KB L2.

Cuando llegó a frecuencias desde los 2.8 GHz y con un FSB de 800 MHz empezó a ser el líder en prestaciones y los modelos 3.2 y 3.4 gozaron de gran fama y un excelente rendimiento.

En 2004 llegó Prescott en 90 nm (1 MB L2) con un pipeline absurdamente dilatado a más de 30 atapas (!!).

Fue un rediseño absoluto de Netburst, poco tenía que ver con Willamette o Northwood. Incluso se rumoreó el nombre de Pentium 5, posteriormente introdujo el proceso de 64 bit. Sus prestaciones finales fueron desalentadoras, de hecho era algo más lento clock for clock que Northwood… Además su disipación térmica ponía en aprietos al mejor sistema de refrigeración de la época.

die_90nm_1m[1] Intel Pentium 4 Prescott 90 nm 1 MB L2.

Todavía recuerdo cuando probé los primeros engineering samples de Prescott a 2.8 GHz sustituyendo un excelente Nortwood HT a 3.2 GHz obteniendo 20ºC más de temperatura y un rendimiento muy inferior… La cuerpo del disipador daba miedo…

Prescott se diseño para frecuencias máximas sobre los 5 GHz, pero problemas de diseño (excesivo leakage del proceso de 90 nm en Prescott) y su incontenible consumo eléctrico y consiguiente disipación térmica lo hicieron inviable. Intel incluso tuvo en sus roadmap versiones a 4 y 4.2 GHz que más tarde canceló.

En 2005 Intel tenía previsto el lanzamiento de Tejas (con un pipeline previsto sobre 50!!!!!! etapas). Los primeros samples fueron una gran decepción, consumos excesivos rayando lo imposible en plataformas de consumo y un rendimiento decepcionante. Fue sabiamente cancelado.

En Intel se cortaron algunas cabezas en los staff directivos y se replanteó totalmente el diseño de sus futuros microprocesadores. El management dio paso al diseño del equipo en Haifa (Israel), los padres del excelentísimo procesador Pentium M Banias de 90 nm derivado del núcleo Pentium III.

El despertar de un gigante, Intel Conroe (Core 2 Duo / Quad) 65 nm

Tras todos estos hechos, AMD equivocadamente pensó o más bien confió en que Intel continuaría con la evolución de Netburst eternamente.

Se durmieron en los laureles del K8, dedicaron muchos recursos al proyecto K9, un procesador con un pipeline extra largo tipo Netburst y con SMT al estilo HyperThreading que fue tardíamente aunque acertadamente cancelado.

merom_die_image Intel Core 2 Duo Conroe 65 nm, dual core 4 MB L2.

Intel sacó al mercado en 2006 Conroe, el famoso Core 2, dando un vuelco radical mercado y consiguiendo un dominio absoluto en todos los segmentos desde portátiles a sobremesa de consumo y servidores dual core.

En el terreno multisocket AMD mantenía su liderato absoluto en 4 sockets gracias a su más avanzada arquitectura con enlaces HT (HyperTransport) frente al arcaico FSB de Intel. En los servidores de dos socket había una encarnizada pelea, Intel contaba con mejores núcleos de ejecución pero AMD ganaba en ancho de banda.

El éxito de Conroe reside en su poderoso núcleo de ejecución de enteros de cuatro pipelines y sus bien dimensionadas FPU de 128 bit, además de su excelente arquitectura de cachés inclusivas y de gran tamaño (2 MB de L2 por core en 65 nm y 3 MB de L2 por core en 45 nm).

La decepción del AMD Barcelona 65 nm

AMD llegó tarde al mercado con los procesadores Opteron quad core y Phenom basados en cores Barcelona de 65 nm.

Con una exigua caché L3 compartida de solo 2 MB para cuatro núcleos (512 KB por core). Una caché L3 de diseño totalmente asíncrono con los núcleos que imponía altas latencias de acceso cifradas en unos 48 ciclos a frecuencias nominales. Además y debido a su pequeño tamaño, unas bajas tasas de aciertos L3 (cache hits) y grandes cargas en el dual channel DDR2 lo que causaba contención en acceso.

phenom AMD Barcelona 65 nm, quad core nativo con 2 MB de L3 compartida.

Intel hacía meses que disponía del doble dual core Clovertown de 65 nm con dos L2 de 4 MB que aumentó más si cabe el diferencial de prestaciones con AMD, además de ser más barato de fabricar dada su poca superficie y avanzada tecnología de fabricación.

Estaba formado por dos dies Core 2 Duo en un chip:

intel-core-2-quad-q6600-cpus1[2] El Intel Core 2 Quad, un MCM de dos Core 2 Duo. 4 + 4 MB de L2 en 65 nm.

Rápidamente Intel sacó al mercado la evolución de 45 nm de Core 2, los núcleos Penryn con 6 MB de L2 compartida. Contaban con numerosas mejoras que lo hacían sobre un 16% más rápido que su antecesor de 65 nm y recuerdo como todos mis mejores clientes sustituyeron sus CPUs Conroe por Penryn en pocos meses debido a su gran mejora en algoritmos conteniendo divisiones.

Penryn_58 Intel Core 2 Duo Penryn 45 nm, dual core con 6 MB L2 compartida.

Barcelona fue un débil rival para tales procesadores y esto se agravó cuando Intel presento el sustituto de Yorkfield, Harpertown, dotado de cuatro núcleos Penryn y 2 L2 de 6MB y proceso de 45 nm.

penryn_quadcore Los Core 2 quad de la serie 9000, fabricados en 45 nm.

Nivelando el terreno, AMD Shanghai

Por fin AMD introdujo en el mercado, esta vez sí, un procesador competente con la oferta de su rival Intel: el core Shanghai de 45 nm. Lo he analizado en multitud de artículos y desde todos los ángulos en LowLevelHardware (ordenados por fecha):

Y en ProfessionalSAT:

Ha poblado las series Opteron y Phenom II dotado de una L3 de 6 MB y 48 vías desplazando al mediocre chip Barcelona. Con esta evolución logró al fin doblegar a los invencibles hasta el momento Core 2 Quad Penryn. Actualmente se comercializa en versiones hasta los 3.4 GHz (Phenom II X4 965 BE) y este modelo en particular supera a cualquier Core 2 Quad en la media de benchmarks.

K10%20processor%2045nm%20architec%201[1]AMD Shanghai 45 nm, quad core nativo con 6 MB de L3 compartida.

Intel Tick–Tock. Microarquitectura Nehalem con SMT

El pasado año 2008 (en Q4) Intel dio a luz a su última microarquitectura de altas prestaciones: Nehalem. Salió a la venta con el nombre comercial de Core i7.

Este procesador lo he tratado extensamente (quizás me quedo corto…) en varios de mis blogs:

En LowLevelHardware he detallado su microarquitectura:

die Intel Nehalem 45 nm, quad core con SMT (8 threads) y 8 MB L3 compartida.

Su gran  baza es reside en el SMT, el Turbo Mode  y un brutal y desorbitado ancho de banda dado por el triple channel DDR3 además de su excelente arquitectura de caché de tres niveles con unos 38 ciclos de latencia L3 y unas ultrarrápidas L2 de 10 ciclos y 256 KB.

Con Nehalem, Intel ha logrado el liderato destacado en prestaciones en todos los terrenos: enteros, coma flotante, single thread, multithreading, ancho de banda, latencia… y AMD está pasando tiempos difíciles compitiendo con su única arma, el precio… y la inteligencia de su líder.

Un Phenom II X4 965 BE (el tope de gama) compite actualmente con el procesador benjamín de la gama Nehalem el Lynnfield Core i5 750 sin SMT (HyperThreading) y con dual channel DDR3 en prestaciones y precio.

die-angle-620[1] Intel Lynnfield 45 nm. Integra el controlador PCIe 2.0 en el die (a la izquierda).

Por encima de ellos se sitúan los Core i7 Lynnfield de socket LGA1156 con SMT, Turbo Mode agresivo y dual DDR3 Core i7 860 y 870. Este procesador, al integrar el bus PCIe en el die prescinde de los enlaces QPI y del chipset X58.

Lynnfield45nmIntel Lynnfield. 45 nm, 8 MB L3, SMT y PCIe integrado.

La superior gama i7 LGA1366 con SMT y triple DDR3 (asociado por un QPI de 4.8 a 6.4 GT/s con el chipset X58) no cuenta a día de hoy con un procesador equivalente en velocidad en AMD aunque tampoco en precio.

Servidores AMD e Intel en 2009

El año 2009 ha sido excelente para Intel, ha podido desplegar su arquitectura Nehalem hasta los dos sockets. En este terreno AMD no tiene una alternativa en paridad aunque se acerca bastante con su diseño Istambul, un hexa core nativo con 6 MB de L3 y fabricado en 45 nm:

Istambul45nmAMD Istambul. 6 núcleos y 6 MB L3 en 45 nm.

En el espacio 4 socket AMD es imbatible ya que Intel mantiene sus mastodónticos e ineficientes chips Dunnington hexa core basado en núcleos tres Penryn dual core con 3 MB de L2 shared por pareja y 6 MB de L3 compartida con una latencia superior a los 100 ciclos!!!

Dunnington_Xeon Intel Xeon Dunnington. 6 cores 3 L2 de 3 MB y 16 MB de L3 shared en 45 nm.

AMD e Intel en 2010

En 2010 AMD seguirá refinando el diseño de Shanghai. Hace un mes aproximadamente lanzó el nuevo stepping C3 que reduce el consumo y disipación térmica así como permite mayores overclocks en cores y uncore (caché L3, North Bridge y controladoras de memoria).

Introducirá un verdadero estado C1E lo que reducirá el consumo. Probablemente veremos versiones a 3.6 GHz del Phenom II X4 BE y como novedad la introducción del hexa core Istambul de 45 nm y 6 MB de L3 procedente de las actuales gamas de servidores Opteron de la serie (quizás Phenom II X6??) en el mercado de sobremesa llamado Thuban.

Westmere_wafer Wafer de procesadores Intel Westmere de 32 nm.

Intel tiene previsto la migración a 32 nm con los núcleos Westmere, la evolución de Nehalem. En el terreno más prestacional veremos los Westmere de 6 cores con SMT que elevará a 12 el número de threads por procesador. Contarán con 12 MB de L3 y varias mejoras micro arquitecturales.

westmereEl futuro Westmere dual core 32nm, 4 MB de L3 compartida y 256 KB L2 por core.

En principio Intel no tiene planes de un quad core de 32 nm basado en núcleos Westmere, para ello habrá que esperar a Sandy Bridge en 2011. Lo que sí habrá es un hexacore nativo llamado Gulftown:

gulftown32nm_6core Gulftown 6 cores, 12 MB L3 y 12 threads en 32 nm.

La buena noticia para algunos de mis clientes es que será compatible con la mayoría de actuales placas base con chipset X58 y socket LGA 1366.

AMD e Intel en 2011

Intel introducirá Sandy Bridge, su nueva microarquitectura tras Nehalem. Incluirá también SMT y la interconexión del procesador con el Uncore y los buses y cachés L3 compartidas será a través de un anchísimo ring bus que proporcionará latencias menores que en los actuales diseños.

003Sandy Bridge 32 nm, la próxima evolución microarquitectural de Intel.

En el siguiente artículo haré una educada estimación de la siguiente microarquitectura de AMD, el revolucionario core Bulldozer de 32 nm que verá la luz en 2011.

Si consideras útil el contenido de este Blog, ayuda a mantenerlo ojeando algunas de las ofertas que consideres interesantes de nuestros anunciantes.

LGA 1156. Intel Core i3, Core i5 y Core i7 – LowLevelHardware

Intel ha desvelado sus planes finales para los sustitutos de sus exitosas líneas Core 2 Duo y Quad, todos ellos serán procesadores de socket LGA 1156 con dos canales de memoria DDR3 y con conexión con el nuevo chipset Intel P55 mediante un simple enlace DMI de 2 – 4 GB/s.

LGA1156 LGA 1156, el nuevo socket mainstream de Intel.

Todos ellos estarán basados en la arquitectura Nehalem ya conocida en los actuales Core i7 LGA 1366. En cuanto a la caché L3, los quad core contarán con 8 MB de L3 y los dual core con la mitad, 4 MB.

Tech_IntelTechnology@Intel

Core i7 LGA 1366 serie 900

La actual serie 900 que todos conocemos con triple canal DDR3 y bus QPI para comunicación con el Intel X58. Seguirá manteniendo el liderato en prestaciones y el mayor precio.

Core i7 LGA 1156 serie 800

i7 Los actuales procesadores Core i7 de socket LGA 1366 quedan como gama alta (serie 900) y se lanzarán varios modelos para placas de socket 1156 y chipset P55 (serie 800) con doble canal DDR3.

Contarán con cuatro núcleos con HyperThreading y Turbo Mode para un total de ocho threads como en la actual gama 900.

Core i5 LGA 1156 serie 600

i5 Habrá modelos de dos y cuatro núcleos, los de dos núcleos contaran con HyperThreading (SMT) y en cambio los quad cores lo llevarán deshabilitado para diferenciarlos de los Core i7. Todos ellos contarán con Turbo Mode.

También como chipset con el Intel P55 mediante DMI.

Core i3 LGA 1156 serie 500

i3 Serán idénticos a los i5 pero con Turbo Mode deshabilitado y seguramente frecuencias inferiores. Igualmente con el Intel P55.

Core i5: Primeras imágenes de Lynnfield – LowLevelHardware

En numerosos artículos he analizado en profundidad la microarquitectura de los procesadores basados en el núcleo Nehalem de Intel y he hecho múltiples pruebas de hardware Core i7 en varios speed bins así como en sus últimos steppings (D0).

1 Intel Lynnfield quadcore, nuevo formato cuadrado.

Lynnfield, al contar con solo dos canales DDR3 y prescindir del QPI no necesita tantos pines de interconexión y se conforma con 1156 lo que le permite un formato cuadrado más reducido que a Core i7 con su conocida forma rectangular.

Lynnfield es la segunda derivativa del núcleo Nehalem, será conocido como Core i5 e irá destinado al segmento medio del mercado (mainstream), en la práctica sustituirá paulatinamente a los exitosos Core 2 Quad Penryn.

2 Nuevo socket LGA 1156 con dos canales DDR3.

Core i5, aún siendo el benjamín de la familia, será funcionalmente idéntico a Core i7 excepto en algunos detalles:

  • No cuenta con enlaces QPI
  • Integra el puente PCIEx en el die
  • Interfaz de memoria doble canal DDR3

En Core i7, la actual versión de sobremesa de Nehalem, el bus QPI se utiliza exclusivamente para comunicar con el Intel X58 a frecuencias de 4.8 a 6.4 GHz. En Core i5 no es necesario pues cuenta con la interfaz PCIEx integrada y únicamente se comunica con el southbridge por DMI.

3 Sujeción trasera del socket LGA 1156, anteriormente 1160.

Le auguro un rotundo éxito comercial debido a sus prestaciones muy cercanas a Core i7, su precio mucho más reducido y a una plataforma de muy menor complejidad, por solo necesitar un chipset compuesto por un chip y por utilizar un dual channel.

4 Dual channel DDR3.

5 Una placa prototipo de Intel con el nuevo microprocesador.

Le corresponde a Intel decir cuando desea traer al mercado esta familia de CPUs ya que debido al enorme éxito de los Core2 Quad basados en núcleos Penryn y a su muy bajo coste de fabricación (por su reducida área de die) no veo al fabricante estadounidense con grandes prisas…

Core i7 stepping D0 – LowLevelHardware

Hoy he tenido oportunidad de probar los primeros ejemplares del nuevo stepping D0 de Nehalem. Según Intel, entre el anterior C0/C1 y éste D0, no hay diferencias apreciables.

PIC02408 El flamante i7 920 en stepping D0

PIC02409 Otra vista

PIC01477aUno de los primeros Core i7 stepping C0 que monté en Noviembre, observad la marca distintiva.

Yo he observado tres diferencias:

  • Un voltaje menor en estado de reposo (inferior a 1 V) comparado con sobre 1.10 V en el primer stepping comercial, el C0.
  • Una menor disipación térmica en carga 100% (unos 10 – 20 W menos en función de la frecuencia)
  • Un ligeramente mayor límite de frecuencia fuera de especificación (unos 100 - 200 MHz)

PIC02410 Ya montado en la Asus P6T

PIC02411Core i7 920 stepping D0 acompañado de 6 GB DDR3 Corsair.

En resumen, un paso evolutivo más por parte de Intel pero nada revolucionario, para eso deberemos esperar a Westmere 32 nm en unos meses…

Phenom II 3.6 GHz / 2.4 GHz uncore. Análisis en RMMA. Ampliado - LowLevelHardware

Ya en dos artículos, uno de ProfessionalSAT y el anterior de LowLevelHardware he analizado varios aspectos de este sistema. Aquí me centraré en las prestaciones del subsistema de memoria dando las cifras efectivos del ancho de banda para varios tamaños de acceso, haciendo un mapa detallado de la arquitectura de caché y memoria del AMD Phenom II.

Image1

RMMT RightMark Memory Analyzer

RMMT es uno de los componentes del avanzado paquete de análisis de microarquitectura RMMA de RightMark.org. Mide el ancho de banda de memoria para diferentes tamaños de acceso en lectura o escritura y es un software totalmente multithread.

Además soporta modos de acceso en lectura con hardware Prefetch y Non Temporal Store para escrituras saltando todos los niveles de caché.

Los valores dados por RMMA pueden considerarse valores reales, es decir, los que verá nuestro software, no como los de otros paquetes de software diseñados para dar un pico máximo que nunca se alcanza con software real (SiSoft Sandra …).

Análisis Phenom II fuera de especificación en RMMA

Configuración del sistema:

  • Procesador AMD Phenom II X4 940 Black Edition a 3.6 / 2.4 GHz
  • Placa Base ASUS M4A79-DeLuxe AMD 790FX – AMD 750
  • 4 GB en dos módulos Kingston HyperX DDR2 1066 5-5-5-15 2T 2.2V

En este artículo se detalla la configuración de BIOS del sistema con los núcleos a 3.6 GHz (3 GHz nominal) y el uncore (caché L3 y controladoras de memoria) a 2.4 GHz (1.8 GHz nominal).

Tabla_AnchoBanda

Ancho de banda del AMD Phenom II para diferentes tamaños de acceso:

  • Zona L1:                              0    -   256 KB
  • Zona L1 + L2:                      256  –  2304 KB (256 + 2048)
  • Zona L1 + L2 + L3:              2304 – 8448 KB (256 + 2048 + 6144)
  • Zona memoria principal:     8448 KB hasta el límite de la memoria física.

image

Phenom 3600 MHz / 2400 MHz uncore / 2 * 2 GB DDR2 1066 5-5-5-18 2T

Como vemos se delimitan perfectamente los diferentes niveles de caché. Todos los datos son en acceso concurrente de los cuatro núcleos, multithreaded x4.

Accesos en lectura dentro de cachés L1:

La caché L1 de los cuatro núcleos que componen un Phenom II es de 64 KB para datos y 64 KB para instrucciones. En este caso solo se testea la L1d y el tamaño total es de 64 x 4 = 256 KB.

16x4

Tamaño 64 KB. Lectura de 408274 MB/s en L1 multithreaded x4.

408274 MB/s equivalen a 399 GB/s. Cada L1 da unos 102000 MB/s (unos 100 GB/s) que una frecuencia de 3.6 GHz son unos 238 bits/ciclo efectivos o casi 30 bytes por ciclo efectivos (!!). Un valor impresionante.

Los procesadores Phenom y Phenom II son capaces de leer de L1 32 bytes por ciclo por núcleo, el valor más alto en la actualidad, duplicando a Core2 o Core i7, lo que queda demostrado por el dato anterior. Están dotados de dos puertos de lectura de 128 bits.

Al superar los 256 KB totales (64 KB x 4) entraremos en el terreno de la L2.

Accesos en lectura dentro de cachés L2:

La caché L2 de un Phenom II se compone de cuatro L2 unificadas discretas por núcleo (para datos e instrucciones) de 512 KB cada una para un total por chip de 2048 KB.

Los procesadores AMD tiene una arquitectura de cachés exclusiva, es decir, no duplican los contenidos de un nivel en el siguiente. Lo que hace que el tamaño efectivo total de caché sea igual al de la suma de los tamaños cada uno de los niveles.

128x4

Tamaño 512 KB. Lectura de 112676 MB/s en L2 multithreaded x4.

256x4

Tamaño 1024 KB. Lectura de 112807 MB/s en L2 multithreaded x4.

512x4

Tamaño 2048 KB. Lectura de 113061 MB/s en L2 multithreaded x4.

576x4_2304KB

Tamaño 2304 KB. Lectura de 111475 MB/s en L2 multithreaded x4.

111478 MB/s equivalen a 109 GB/s. Cada L2 transfiere unos 28000 MB/s (unos 28 GB/s) que una frecuencia de 3.6 GHz son unos 65 bits/ciclo efectivos o algo más de 8 bytes por ciclo efectivos, un valor no muy brillante, Core2 y Core i7 le superan ampliamente en velocidad de L2.

En los 2304 KB (576 KB x 4 núcleos) se sitúa el límite efectivo del tamaño de la L1 + L2 (64 + 512 KB) y por encima de este valor entramos en la zona de la caché L3.

Estrictamente hablando el papel de las L2 privadas de 512 KB consiste en reducir los accesos a la L3 compartida evitando la saturación de sus buses y proporcionar menor latencia y altas tasas de acierto al núcleo de ejecución.

Accesos en lectura dentro de caché L3:

Nota: Debido a que este sistema está fuera de especificación utiliza multiplicadores relativos de cores y L3 no standard y con ello los valores aquí detallados no son representativos del producto comercial en el tramo de L3 (576 – 8448 KB).

La caché L3 de Phenom II consta de 6144 KB unificados y comunes para los cuatro núcleos con buses de 64 bits, solo hay una L3 para servir a los cuatro procesadores. El tamaño efectivo (debido al diseño de cachés exclusivas) de la zona de L3 es de 6144 + (512 x 4) + (64 x 4) o algo más de 8 MB, 8448 KB.

Al superar este tamaño de bloque en acceso entraremos ya en memoria principal.

768x4_3072KB

Tamaño 3072 KB. Lectura de 43609 MB/s en L3 multithreaded x4.

1024x4_4096KB

Tamaño 4096 KB. Lectura de 44055 MB/s en L3 multithreaded x4.

2048x4_8192KB

Tamaño 7168 KB. Lectura de 44264 MB/s en L3 multithreaded x4.

44264 MB/s equivalen a 43 GB/s. La L3 unificada de 6 MB transfiere unos 44264 MB/s a los núcleos (unos 43 GB/s) o unos 11075 MB/s por núcleo.

Globalmente para todos los cores, a una frecuencia de 2.4 GHz (frecuencia del uncore) 44264 MB/s son unos 19.34 bytes/ciclo efectivos o casi 155 bits por ciclo efectivos. Siendo unos 4.83 bytes/ciclo o casi 39 bits/ciclo por cada núcleo referido a la frecuencia del uncore, en este caso en overclock a 2400 MHz.

En los 8448 KB, como he comentado anteriormente se encuentra el límite efectivo de la L3 para accesos multithreaded x4.

Accesos en lectura en memoria principal:

4096x4_16384KB

Tamaño 16384 KB. Lectura de 15041 MB/s en memoria multithreaded x4.

32768x4_131072KB

Tamaño 131072 KB. Lectura de 15024 MB/s en memoria multithreaded x4.

15024 MB/s (14.67 GB/s) se acerca mucho al límite teórico (17 GB/s) del dual channel DDR2 1066 que he instalado en el sistema, concretamente a un 86%. Un resultado excelente teniendo en cuenta que son medidas en condiciones reales.

Si consideras útil el contenido de este Blog, ayuda a mantenerlo ojeando algunas de las ofertas que consideres interesantes de nuestros anunciantes.

Carlos Yus Valero – informaticapremium

domingo, 1 de marzo de 2009

Phenom II X4 940 3.6 GHz: BIOS en detalle. Actualizado - LowLevelHardware

En ProfessionalSAT he tratado este sistema de un modo más superficial, aquí describiré los detalles más interesantes de la configuración BIOS de un AMD Phenom II X4 940 en overclock.

PIC02060

Los parámetros (frecuencias, multiplicadores, voltajes, …) han sido elegidos para un uso continuado sin fallos con cargas del 100 % en cores con total estabilidad y exactitud en los cálculos. Es un sistema pensado para cálculo continuo e ininterrumpido en entorno profesional.

Componentes utilizados:

  • Placa Base ASUS M4A79-DeLuxe AM3. Chipset AMD 790FX – AMD 750
    • Soporta procesadores AM3, AM2+ y AM2 con memoria DDR2 hasta 1066.

PIC02054

  • 4 GB en dos módulos Kingston HyperX DDR2 1066 5-5-5-15 2T 2.2V
  • Procesador AMD Phenom II X4 940 Black Edition

    • Cores con multiplicador 18X para una frecuencia de  3.6 GHz @ 1.425V (+20 %)
    • Uncore a 2.4 GHz (+33%) (incluye la L3 de 6 MB y las dos controladoras de memoria DDR2)
    • Los buses de comunicaciones HyperTransport a 3.6 GHz (sin cambios)

Shanghai_ANÁLISIS

Procesador Phenom II X4 940.

El overclock de los núcleos aumentará las prestaciones linealmente con la frecuencia (sobre el 20%), pero lo más interesante será la influencia del más importante incremento del 33% en la L3 y las IMC.

PIC02050

Sobre el bus HT, en placas monoprocesador se utiliza para comunicación con el PCIEx y el SouthBridge. No se aprecia incremento de prestaciones variando su frecuencia.

PIC01987

Los más de 11 GB/s son producto del incremento de frecuencia IMC/L3 a 2.4 GHz.

Configuración de BIOS:

PIC02046

Vcore 1.425 V, CPU/NB AUTO  y DDR2 2.20V.

Con la L3 y controladoras de memoria a 2.4 MHz aseguramos un ancho de banda más acorde con el dual channel 1066. Recordemos que el AMD Phenom dispone de un exiguo bus de 64 bit entre los núcleos y el uncore.

Con una frecuencia de 2.4 GHz obtenemos un ancho de banda máximo de 19.2 GB/s, suficiente para un dual channel DDR2 1066 (17 GB/s). En la segunda parte de este artículo veremos si esto es suficiente …

PIC02047

Spread Spectrum disabled.

Voltajes CPU VDDA, HT, NB, NB 1.8V y SB siempre en valores mínimos absolutos para mantener la menor disipación térmica y consumo.

PIC02049

Timings de memoria.

Ajustados a 5-5-5-18 2T a 2.20 V. Desafortunadamente, es imposible hacer estable la memoria 1066 MHz a 1T independientemente del voltaje aplicado …

PIC02051

Phenom II X4 940 3600 MHz / 2400 MHz NB clock.

Manteniendo Cool’n’Quiet activado pese al overclock permitimos que el procesador regule automáticamente la frecuencia y el voltaje entre los siguientes estados:

  • Carga máxima: Núcleos 3600 MHz – Uncore 2400 MHz – memoria 1066 MHz – 1.425 V
  • Carga mínima:  Núcleos  800 MHz – Uncore 2400 MHz – memoria 1066 MHz – 1.000 V

De este modo, cuando el sistema está en reposo o con cargas de trabajo bajas, las temperaturas rondan los 25 - 28 ºC en los núcleos y en carga máxima se acerca a los 60 ºC.

En el siguiente artículo un análisis exhaustivo del subsistema de memoria incluyendo las cachés en RMMA y RMMT.

Etiquetas de Technorati: ,,,,