Упаковщик наносит ответный удар: ZA как машина транспонирования -1 09.09.2026 04:12 nonpareil_coder 1 C C++ Assembler
Почему NumPy тормозит на матрицах 16х16 и как микроядро на AVX2 в 100 кб решает эту проблему +2 07.09.2026 14:18 eminsk 0 Python C Алгоритмы Высоконагруженные системы Open source
Микроядро SME2 sgemm: 1024 умножения-сложения за проход +3 18.08.2026 04:29 nonpareil_coder 1 C C++ Assembler
BLIS: недостающую среднюю ступеньку построили тридцать лет назад +4 11.08.2026 04:36 nonpareil_coder 0 Assembler C C++
Умножение матриц: пример использования расширения ARM SME2 в Apple M4 Pro +59 20.03.2026 06:28 olegbor 13 C++ macOS Алгоритмы Компьютерное железо Процессоры
Учимся разрабатывать для GPU на примере операции GEMM +31 07.08.2025 13:07 Mik42 4 YADRO corporate blog Блог компании YADRO GPGPU C++ Алгоритмы
Первый взгляд на производительность реализации floating-point GEMM для CPU на языке Mojo 25.12.2023 22:14 porto 4 Высокая производительность C++ C