127 KiB
127 KiB
| 1 | fd9bd632f346085920d523dd307a3e4c11cc0a05 | e08e473cf292ba73789769b993bb35bcdfc31689 | 2026-06-01T14:15:35+08:00 | wangbomeng | HEAD -> dev, origin/dev | llama-bench: fix device-info |
|---|---|---|---|---|---|---|
| 2 | e08e473cf292ba73789769b993bb35bcdfc31689 | f86112d6758298241ab2fa84ad4f0f7b1ace35c6 | 2026-06-01T11:47:01+08:00 | wangbomeng | llama-bench:add device-info | |
| 3 | ebce9e1a548c2329aa97f53b8b2ad50d968088dc | e850ff4de25ad1221abc9bf3bb30df252ccd9c36 | 2026-05-27T09:38:00+08:00 | Yunzhe Jia | origin/runtime_replace | Refactor cal-llm integration by removing runtime capacity loading and adjusting request handling |
| 4 | e850ff4de25ad1221abc9bf3bb30df252ccd9c36 | 9985688f7fa96f755882f96a2cd8a18114fdc42d | 2026-05-26T10:59:45+08:00 | Yunzhe Jia | Enhance cal-llm integration by adding runtime checks for CALRT_LIBRARY and updating link settings for Linux and Windows | |
| 5 | 38ca6895815671a87ceec86b4aa4eb976580ce76 | ddd60c928224b52eb4e1e60e01e8a1ecbb80ee45 | 2026-05-20T16:37:13+08:00 | Yunzhe Jia | Add support for cal-llm profile dumping to JSONL file | |
| 6 | 2716130010c58f1cdd9d94f0e2f8e047bc92dc66 | b35bda124ccd4ed581dd6088d3ffa4931c2809b6 | 2026-05-18T08:40:54+08:00 | Yunzhe Jia | fix n_ctx_slot error by adding runtime capacity loading for cal-llm | |
| 7 | a43741244a646d3f8fa3ff01bb9b7d059223d0a5 | b2003d6c90ef0fa26ab9e930ba3e22b355eb3d39 | 2026-05-15T14:39:53+08:00 | wangbomeng | run llama-passkey successfully, fix llama-bench, copy 3 times input to infer qwen2.5vl | |
| 8 | 1bec0db5a675ddc60fb793be2a746e8f3c8855dc | 465df20c3e1f3f58d0f5531c796e0941a49c32b0 | 2026-04-30T16:02:59+08:00 | wangbomeng | origin/dev-ben | bench: support 2 calbins |
| 9 | eeeef3f6d6a5aad9296323ca15d9d929745b8932 | 431ad6f1c787f1b47e9e7be14b2e1a7d8565485c | 2026-04-28T16:16:19+08:00 | wangbomeng | add unknown time info: prefill and decode | |
| 10 | a2d5bf362d6c9a546f9deadf4f8975605a915d33 | bd3a57a11aa008e0b5dc2a30f82fcd3a02587208 | 2026-04-09T21:01:46+08:00 | Bomeng Wang | server: comment fixed time | |
| 11 | 18814f9bf1a423ebe8f32d6043c9cbc5b21b0218 | bbee06d6d851e3f84f75b578047967d7e0e4a8dc | 2026-04-08T13:55:52+08:00 | wangbomeng | server : reset inference time | |
| 12 | bbee06d6d851e3f84f75b578047967d7e0e4a8dc | e126c21ed7b793b648d63533ea7ee30885f5a82a | 2026-04-08T11:29:36+08:00 | wangbomeng | calrt: add test time print | |
| 13 | 1e8a16cd0e3ad3c9a0f8746852a0a38c6e52322e | 893e52bda0fee99bbda1521ea733a760bc4201f1 | 2026-04-01T10:14:22+08:00 | wangbomeng | calrt: fix slice and add infer/copy time | |
| 14 | 98e8f9acfe87cd93646482cb2d942b8a132f0852 | 8c8152a04036bb0d4756a4e08e54f514dae4e64d | 2025-12-10T00:20:57+08:00 | Yunzhe Jia | add timestamp | |
| 15 | 5d2387931528fbe04aa8d66de935147efb65ca4d | e6285a748657add8d974b78ca920c5b41753ee12 | 2025-12-08T16:40:34+08:00 | Yunzhe Jia | add timestamp for one decode process | |
| 16 | 7e994168b1ccc12337ba8de939c4fd466107c1fb | bcfa87622ae46be6345a8e3dfdbdc5ba5414042b | 2025-11-03T03:35:33+02:00 | shani-f | SYCL: optimized repeat_back kernel (3× fewer asm instructions, 2× faster)Feature/sycl repeat back opt (#16869) | |
| 17 | 7fd205a8e8832ead273f62c5fd81d2b8aa910535 | 2f68ce7cfd20e9e7098514bf730e5389b7bba908 | 2025-11-02T00:15:31+02:00 | Georgi Gerganov | scripts : add script to bench models (#16894) | |
| 18 | d261223d24e97f2df50220e4a5b7f0adb69bba81 | dcca0d3ab840ebe9b2ccd4719033d408eeb758d7 | 2025-10-30T23:19:14+08:00 | JJJYmmm | model: add support for qwen3vl series (#16780) | |
| 19 | 8b11deea4663f29d3e042ce1056ba643264cd5f1 | b9ce94017729465895402cbcfffb51fa926c15e3 | 2025-10-30T04:34:15+01:00 | Oliver Simons | Hide latency of bias and gate-loading (#16847) | |
| 20 | b9ce94017729465895402cbcfffb51fa926c15e3 | 3464bdac37027c5e9661621fc75ffcef3c19c6ef | 2025-10-29T15:13:10-05:00 | Jeff Bolz | vulkan: Fuse rope+set_rows (#16769) | |
| 21 | 3eb2be1ca5f37480aeb16102970d9e65f43347fe | e41bcce8f0b53032a1fed275cd253e931c041cf6 | 2025-10-29T06:29:12-07:00 | Max Krasnyansky | Hexagon Op queue & dispatch optimizations (#16820) | |
| 22 | f549b0007dbdd683215820f7229ce180a12b191d | 9a3ea685b937c0f0cbfda2e50004ea54bf187512 | 2025-10-29T03:53:04-05:00 | Jeff Bolz | vulkan: Call ggml_vk_buffer_write_2d from ggml_vk_buffer_copy (#16793) | |
| 23 | 338074c383c81366320d176d83b94b0a567ee0c2 | 851553ea6b24cb39fd5fd188b437d777cb411de8 | 2025-10-29T08:14:39+02:00 | YaelLogic | sycl: add RMS_NORM_BACK operation support (#16808) | |
| 24 | a8ca18b4b815a2abdbecb958ee5f4c542d69aac7 | 8284efc35c909217ee1b9a06903245d808ac2283 | 2025-10-28T19:41:43+02:00 | Georgi Gerganov | llama-bench : clarify benchmarked parts of the computation (#16823) | |
| 25 | ad8d36beffd791db10c94eb9e964afb891e3ca55 | c053e18a66dd95dc340aa61317877c2a41d4e3cf | 2025-10-28T03:50:33+02:00 | tamarPal | sycl: add SSM_CONV operation support (#16800) | |
| 26 | 8423d019318b446640bb620e4ce80066d8530f05 | 5cca2542ac3f3f86831d32bce744d08fc2b353b0 | 2025-10-25T00:04:12-05:00 | Jeff Bolz | vulkan: Optimize SSM_SCAN (#16645) | |
| 27 | 63d2fc46e17a06be5b4b5823a5ada088317f1f0a | a2e0088d9242bd9e57f8b852b05a6e47843b5a45 | 2025-10-22T13:47:09-07:00 | Max Krasnyansky | Add experimental ggml-hexagon backend for the Hexagon NPU (#16547) | |
| 28 | 9b9201f65a22c02cee8e300f58f480a588591227 | 19a5a3edfd306516cc419679d69d6435943b6816 | 2025-10-22T16:58:23+02:00 | Pascal | webui: introduce OpenAI-compatible model selector in JSON payload (#16562) | |
| 29 | 6ea37f57391d27736c35cd3c20c1f990b7952b74 | fb349848f387f355450c3187556e71e6d32c145f | 2025-10-20T22:26:17-07:00 | lhez | opencl: fix warnings and clean up profiling (#16688) | |
| 30 | 84bf3c677857279037adf67cdcfd89eaa4ca9281 | c9c1972e2c2cc6a771fcc145bfa138700179f961 | 2025-10-20T21:38:20+02:00 | Sigbjørn Skjæret | model : add BailingMoeV2 support (#16063) | |
| 31 | 9ad4f1931ee0f3b41d9355245ef744786aaae0aa | 79967ec596c0dacfd2251b085a57e79df292b1cc | 2025-10-17T02:33:58-04:00 | Ilia Ilmer | metal : add `CONV_TRANSPOSE_2D` (#16542) | |
| 32 | ceff6bb253dd306f5404d7ccb3f11fadafe71b52 | 1bb4f43380944e94c9a86e305789ba103f5e62bd | 2025-10-17T05:36:40+03:00 | GittyBurstein | SYCL SET operator optimized for F32 tensors (#16350) | |
| 33 | adc9b60f190c1016a09f439862fa1cbb302262ac | ee50ee1eadff58777ae746827b04de7ba0befc55 | 2025-10-16T13:10:32+08:00 | takuya kodama | ggml-cpu: replace putenv with setenv for const-correctness (#16573) | |
| 34 | f4ce81c45e7bd910e36bf44c253fc5255c49b1e4 | 17304cbcc1dd24de7741cbe57925d58e90a98ac1 | 2025-10-15T23:05:56+09:00 | Sam/Samuel | metal: optimise `GGML_OP_SUM` (#16559) | |
| 35 | 7ea15bb64c81e3813eb0babf9a57e1bc5697f569 | 9c7185dd28416cf67f5e3b268381f311b5e3da56 | 2025-10-14T07:51:36-05:00 | Jeff Bolz | vulkan: Improve build time for MSVC (#16545) | |
| 36 | 56fc38b9655fbe1869d8bd6cfb269418196cea69 | 1fb9504eb744969a990bfe4cfcf1d3d7a479541c | 2025-10-13T17:01:24+08:00 | Chenguang Li | CANN: fix CPU memory leak in CANN backend (#16549) | |
| 37 | 1fb9504eb744969a990bfe4cfcf1d3d7a479541c | 3f750f8d760ab5a61491e6a9409072dfeee4b4d7 | 2025-10-13T10:55:32+02:00 | Pascal | fix: add remark plugin to render raw HTML as literal text (#16505) | |
| 38 | f9bc66c3ebcfddb5f09e4b21253623caeb8e414a | a31cf36ad946a13b3a646bf0dadf2a481e89f944 | 2025-10-13T08:52:22+08:00 | hipudding | CANN: Update several operators to support FP16 data format (#16251) | |
| 39 | a2fba89a426ff8005d303c73f0436e7e67368b70 | 20cc625edc2264aae2779e71bef1593e6a4e8c43 | 2025-10-12T07:19:06+02:00 | Daniel Bevenius | hparams : add check for layer index in is_recurrent (#16511) | |
| 40 | 31d0ff1869aa2ea31f4e96d5877d0343e9a2171b | 97870e64975b26c5e06a3540a8dc0ff601351e86 | 2025-10-11T21:39:04+08:00 | Yann Follet | server / ranking : add sorting and management of top_n (#16403) | |
| 41 | 1deee0f8d494981c32597dca8b5f8696d399b0f2 | d00cbea63c671cd85a57adaa50abf60b3b87d86f | 2025-10-09T22:11:15+03:00 | duduta | cpu : optimize the ggml NORM operation (#15953) | |
| 42 | 74b8fc17f92ada295a648e3c5eb28f46bca7d892 | aeaf8a36f06b5810f5ae4bbefe26edb33925cf5e | 2025-10-07T13:48:56-07:00 | Reese Levine | ggml webgpu: profiling, CI updates, reworking of command submission (#16452) | |
| 43 | 8ae32dc9ecd7aeebf3a5b43557e0552a0a04cd4f | 3df2244df40c67dfd6ad548b40ccc507a066af2b | 2025-10-07T08:21:40+03:00 | Georgi Gerganov | metal : various optimizations + refactoring (#16446) | |
| 44 | 04e632a4aab8e6bfff0f8bc216b36ceb1e199ff9 | a80ff183abe4e5a76316257ffa597da41b3b6fa0 | 2025-10-06T14:56:59+02:00 | Daniel Bevenius | ci : remove missing reranker model files (#16444) | |
| 45 | ca71fb9b368e3db96e028f80c4c9df6b6b370edd | 35266573b968e1c947b367782fb4b3eddbb4f3c0 | 2025-10-05T06:57:47-06:00 | Gabe Goodhart | model : Granite docling + Idefics3 preprocessing (SmolVLM) (#16206) | |
| 46 | 898acba6816ad23b6a9491347d30e7570bffadfd | e29acf74fea996014380d59d31aa504ae8964258 | 2025-10-04T12:49:16+03:00 | Radoslav Gerganov | rpc : add support for multiple devices (#16276) | |
| 47 | e29acf74fea996014380d59d31aa504ae8964258 | 128d522c04286e019666bd6ee4d18e3fbf8772e2 | 2025-10-04T11:42:56+02:00 | Acly | vulkan : incremental shader builds (#16341) | |
| 48 | ef07a4090672a3438d7f64f197795d7dc1c18957 | 34fcc5a4ace8c69476ef2ea3857f39a60334acc4 | 2025-10-02T11:00:31-07:00 | Reese Levine | ggml webgpu: add support for soft_max, optimize rms_norm (#16357) | |
| 49 | 34fcc5a4ace8c69476ef2ea3857f39a60334acc4 | 91a2a5655658bb9ab77894716b82fae7ecb4b4d1 | 2025-10-02T19:43:22+02:00 | Piotr Wilkin (ilintar) | model : Apertus model implementation (#15852) | |
| 50 | 364a7a6d4a786e98947c8a90430ea581213c0ba9 | 2df5bcf357dba0c49b4df1d684b2ffc9e88b7054 | 2025-09-30T16:39:44+02:00 | Adrien Gallouët | common : remove common_has_curl() (#16351) | |
| 51 | 6a2c6145a0b91b40eb3c3dba7b20ccc4b270490f | 3b53634fe35771e2e318227aa81585726bae7234 | 2025-09-28T09:34:44+03:00 | Georgi Gerganov | metal : extend mat-mat multiplication support (#16225) | |
| 52 | e6d65fb02d553bd79cad94e517cdca18b687788d | 8656f5de688cddcaea1d6174535eb60ee23ef6a0 | 2025-09-27T16:43:39-04:00 | Jeff Bolz | vulkan: support arbitrary KV dimension in flash attention (#16160) | |
| 53 | 1a189278944d030211f336e103e96b65f976c361 | e0539eb6aed346d4b25a6ea019044e88771e7690 | 2025-09-26T18:35:42+02:00 | Aleksander Grygier | Allow viewing conversations even when llama server is down (#16255) | |
| 54 | 9b26511857ac09ae69ab485168fe2d3ee5fb1d6e | 00217cd41388328c93e9e9644921c4319bb03bcc | 2025-09-26T18:27:25+08:00 | Aaron Teo | ggml-cpu: implement MXFP4 SIMD for s390x (#16193) | |
| 55 | 077c94d0caf87fbd3cf3288dbb5c0fd9670294cf | aa3ee0eb0b80efca126cedf9bcb4fb5864b46ce3 | 2025-09-25T22:35:05+08:00 | Aman Gupta | CUDA: add a fused top-K MoE kernel (#16130) | |
| 56 | 02a6a82ae7c7ddd1819ae26b0cc36675879aecee | c498fc82fe5b83fc8c6e1627286bdc1f93caddbf | 2025-09-25T11:29:08+03:00 | Georgi Gerganov | metal : restore im2col perf (#16219) | |
| 57 | bee378e0988b44bbe93b0768208080951b312363 | 5fb557653b8756ac2b6c6a102b1e44abcadf552f | 2025-09-25T05:06:06Z | Eve | ci: run the x64 and arm ci on the github machines instead (#16183) | |
| 58 | f2a789e33490deb483a2694b066b37e45524bb79 | 3a599719673c850647e3bb911ed6d91109bb91d2 | 2025-09-24T16:17:49+02:00 | Acly | ggml : split graph allocations according to backend max buffer size (#15815) | |
| 59 | 3a599719673c850647e3bb911ed6d91109bb91d2 | 63b54c81a620981be020184ab99e63a8e50e47cb | 2025-09-24T13:42:26+02:00 | Tarek Dakhran | model : add label for LiquidAI LFM2-2.6B model (#16204) | |
| 60 | 351f3da39c85f59d581fc184f09283da7f099a3b | 3ecb2f671a2f49d56357f99d135a94e841759178 | 2025-09-23T01:57:46+08:00 | Haiyue Wang | clang-tidy : disable warning about performance enum size (#16127) | |
| 61 | 4d0a7cbc617e384fc355077a304c883b5c7d4fb6 | 9073a73d82a916cea0809de225ef5175c3a86e91 | 2025-09-22T08:31:40+03:00 | Georgi Gerganov | ci : adjust params for less runtime (#16167) | |
| 62 | 1eeb523c3e0c7ffbd59469f5463dcbdecba3535e | 5bb4a3edec297e74b0f7bd4ed5d0fdd12e28d858 | 2025-09-21T08:31:55+02:00 | Giuseppe Scrivano | vulkan: optimize UMA buffer operations and fix driver hangs (#16059) | |
| 63 | 803dac2e48ef3ba26a504eb27c4e77ec2d21f7d0 | 459c0c2c1a400f960d7b8e8d94d31a8426f80986 | 2025-09-20T10:42:56+02:00 | Ruben Ortlam | vulkan: use vec dot for matrix matrix multiplications (#16056) | |
| 64 | be79d9fdd95ab8955527c4aaa67b90e8b9516718 | f432d8d83e7407073634c5e4fd81a3d23a10827f | 2025-09-19T15:15:21-07:00 | ssweens | llama-bench: add --devices and --list-devices support (#16039) | |
| 65 | 0dd58b6877f3dc106593d6bc68d98305f553c566 | 69ffd891631befa9e6b485fd646a16dab4f2c007 | 2025-09-19T11:31:56+07:00 | Xuan-Son Nguyen | ggml : refactor forward_dup for cpu backend (#16062) | |
| 66 | 3edd87cd055a45d885fa914d879d36d33ecfc3e1 | c0b45097c33e2667a94444f08cc9e36bec0a5e2e | 2025-09-18T12:03:34-07:00 | Shawn Gu | opencl: optimize mxfp4 kernels (#16037) | |
| 67 | c0b45097c33e2667a94444f08cc9e36bec0a5e2e | 38dbdf4c057515ccea9bec0ca2518f86d5e4d28e | 2025-09-18T13:46:17-05:00 | Jeff Bolz | rename optimize_graph to graph_optimize (#16082) | |
| 68 | 38dbdf4c057515ccea9bec0ca2518f86d5e4d28e | 368560a1e3b9a3bc83af741b0b2bc9e46fb420d2 | 2025-09-18T11:26:03-07:00 | Bowen Han | CUDA: Optimize PAD_REFLECT_1D (#15957) | |
| 69 | 0320ac5264279d74f8ee91bafa6c90e9ab9bbb91 | a7a98e0fffed794396b3fbad4dcdbbc184963645 | 2025-09-17T20:38:12+03:00 | Georgi Gerganov | metal : refactor + optimize v2 (#15995) | |
| 70 | c959b676be29e93f8dbc3bd6056ceba812a9eb72 | cd08fc3ecc0264b4414b68af3874a6c689ed60c1 | 2025-09-17T15:32:42+02:00 | Johannes Gäßler | CUDA: fix FA occupancy, optimize tile kernel (#15982) | |
| 71 | d5fabe3682de515fd09d6c981f7a0d1b75614455 | 8ff206097c2bf3ca1c7aa95f9d6db779fc7bdd68 | 2025-09-17T14:33:08+08:00 | Chenguang Li | CANN: Optimize ggml_cann_set_device (#15935) | |
| 72 | 8ff206097c2bf3ca1c7aa95f9d6db779fc7bdd68 | 77475530b8bbea3bf578632507e1284cdfe2c8c0 | 2025-09-16T16:17:08+02:00 | jacekpoplawski | llama-bench: add --n-cpu-moe support (#15952) | |
| 73 | 77475530b8bbea3bf578632507e1284cdfe2c8c0 | 3913f8730ec6d6245480affc30ae3049107956f4 | 2025-09-16T15:27:52+02:00 | Daniel Bevenius | ci : use macos-latest for arm64 webgpu build (#16029) | |
| 74 | 3913f8730ec6d6245480affc30ae3049107956f4 | 76888d202ed2b835ae19ea9f9db6baf39e419297 | 2025-09-16T15:25:57+02:00 | Daniel Bevenius | ggml : fix padding in timestep embedding kernels (#15932) | |
| 75 | 76888d202ed2b835ae19ea9f9db6baf39e419297 | f1fbffb5c0b34b2a68febb7da3fd0f8333f1ed4c | 2025-09-16T13:41:38+02:00 | Daniel Bevenius | ci : upload xcframework artifact from ios-xcode-build job (#16010) | |
| 76 | 106220562aca42b6738b8f51acfce0db1b8a2fb6 | a68f31edd71cc39141113f05f7133a3e9ece8c61 | 2025-09-15T17:35:11+08:00 | Aman Gupta | CUDA: some micro-optimizations in mmf.cuh for mul_mat_id (#15926) | |
| 77 | b9c9c9f789cd57fb0b28b25223305613cd90fa10 | 50f4281a6f5c3a5d68bdeb12f904fa01e0e2ba91 | 2025-09-13T16:23:30+01:00 | Jeff Bolz | vulkan: initialize vulkan-hpp to allow using extension function pointers (#15705) | |
| 78 | f161463a54d9f93d41246286aa4a9569a91d804d | 84d7b2fca11d1be118ce776f6d72a486c4883b74 | 2025-09-13T13:54:28+03:00 | Georgi Gerganov | metal : allow ops to run concurrently (#15929) | |
| 79 | 00681dfc16ba4cebb9c7fbd2cf2656e06a0692a4 | 4f658855fa8f2e42b7ed9a5b298fa39a2e39b096 | 2025-09-10T22:04:03+02:00 | Oliver Simons | CUDA: Add `fastdiv` to `k_bin_bcast*`, giving 1-3% E2E performance (#15872) | |
| 80 | 9de447d94e1ae9d1a36e5a2e5bf47483352c0d9c | 0f0a3c2851134d49955f3c85afbb0b1bb47c3e07 | 2025-09-10T17:31:40+02:00 | Daniel Bevenius | ggml-cpu : fix padding in ggml_timestep_embedding (#15917) | |
| 81 | e7b6d83b524bbc24a1343d862de6dba8e8eddbd6 | 2cfef4d117d67ab1dec002915b48a15d11ee1973 | 2025-09-10T14:17:09+02:00 | Daniel Bevenius | tests : filter out no-ops from coverage report (#15900) | |
| 82 | ff02caf9eed261423289d1531a56536fbf57bfc2 | ae355f6f7108540297d8b7f7ae71d20fe610a0b7 | 2025-09-10T05:23:19+02:00 | Daniel Bevenius | ci : cache ROCm installation in windows-latest-cmake-hip (#15887) | |
| 83 | a972faebed5fdc4a3d2a844d92d476058c02e02d | 550cf726e133fd0a069d991287fd3a2a3e3e1cbd | 2025-09-09T14:38:02+08:00 | Aman Gupta | CUDA: Add mul_mat_id support for the mmf kernel (#15767) | |
| 84 | 70cd37dbbebdb7a2f84f08207f18eabb0b291a55 | acc1b008cfd95e63d5f99a370dbffb98e5a99d2c | 2025-09-09T06:06:52+02:00 | Daniel Bevenius | requirements : update transformers/torch for Embedding Gemma (#15828) | |
| 85 | e68aa10d8f3d26fdad5b912540362d79de5460e3 | 0a16bf52e6874369cb4fd2bdc4863ef984b688e7 | 2025-09-08T13:10:07-05:00 | Jeff Bolz | vulkan: sort graph to allow more parallel execution (#15850) | |
| 86 | 56920f56651908d5cce7a310dabf54ac4f6fbb7f | b0d52998b962bd2681c34bf52af993af79f178b8 | 2025-09-08T21:50:05+07:00 | Xuan-Son Nguyen | server : bring back timings_per_token (#15879) | |
| 87 | f28d4f4ac963f182ea9d0fe9e269f3f5f3782aaf | 9fcb29f22f5c33c04c7f0daebb24057899d67a1a | 2025-09-08T13:34:56+03:00 | Georgi Gerganov | metal : refactor + optimize (#15857) | |
| 88 | a885dcff11a7b73f9377812d6151f6b15d307de0 | 663027fd5490438ce9c27ea866a560e1e268d11f | 2025-09-08T10:27:07+03:00 | Georgi Gerganov | batched-bench : fix llama_synchronize usage during prompt processing (#15835) | |
| 89 | 3c3635d2f20424d557b5b0605a2a356214ffe048 | 61bdfd5298a78593be649a1035ee2a120b13c4f0 | 2025-09-06T19:45:24+07:00 | Xuan-Son Nguyen | server : speed up tests (#15836) | |
| 90 | 61bdfd5298a78593be649a1035ee2a120b13c4f0 | 01806e77714ae8a78130d432945b959a0956c56f | 2025-09-06T18:35:04+07:00 | Xuan-Son Nguyen | server : implement prompt processing progress report in stream mode (#15827) | |
| 91 | c1c354e44c06d259679bb5bb7a8fa9f0b28480e4 | a68d9144262f1d0ef4f6ba7ad4a7e73e977ba78c | 2025-09-04T20:20:14+08:00 | Chenguang Li | CANN: Refactor ND to NZ workspace to be per-device (#15763) | |
| 92 | 0fce7a1248b74148c1eb0d368b7e18e8bcb96809 | 8227695d7a3e5b357cb37fad263f00a8ca6db710 | 2025-09-03T13:33:15-05:00 | Jeff Bolz | vulkan: don't use std::string in load_shaders, to improve compile time (#15724) | |
| 93 | 661ae31c9c68201577e70278285b349a5a662caf | 407c23786dd0d3a503e9429eead96e611d3950c9 | 2025-09-03T19:59:16+02:00 | Oliver Simons | CUDA: Optimize `rms_norm_f32` kernel and its fused variants, giving 1-6% perf E2E (#15715) | |
| 94 | cdedb70a998cea7052560fe0b0615a839443564d | 2c8dac72eb6acd4e20c0da251535dfc46d35178b | 2025-09-03T18:16:26+03:00 | Georgi Gerganov | sampling : optimize dist sampler (#15704) | |
| 95 | 2c8dac72eb6acd4e20c0da251535dfc46d35178b | 40a751ea9a94364da73537b86502a808ebe1fc3a | 2025-09-03T13:35:49+02:00 | Daniel Bevenius | llama : fix incorrect model type for Gemma 270M (#15764) | |
| 96 | 05c0380f2ae5c7193445e03ebc7b6de9ce49f1a6 | 8c3fdf44ecf08335942f2ba558955f55e88c7991 | 2025-09-03T16:16:21+08:00 | xctan | ggml-cpu : optimize RVV kernels (#15720) | |
| 97 | 9961d244f2df6baf40af2f1ddc0927f8d91578c8 | 25f1045f07cf0daf667d63e35618842e3174a8c7 | 2025-09-02T17:12:37+08:00 | hipudding | CANN: Resolve soft_max precision issue (#15730) | |
| 98 | 02c1813517412f3e00aa6ca7c0273fea64edb492 | 77dee9de97be75b7143a213bc48893e0c0b29af7 | 2025-09-01T16:19:07+02:00 | Ruben Ortlam | Vulkan: Add Integer Dot Product mul_mat_vec shader for legacy quants (#14903) | |
| 99 | b9382c3877c6067feccf182efe9449a2d1cb24c7 | 3dc7397a2799bdc07bccf637ab7ae5a1e786d1a4 | 2025-09-01T08:57:23+08:00 | hipudding | CANN: Optimize MUL_MAT_ID (#15658) | |
| 100 | 3dc7397a2799bdc07bccf637ab7ae5a1e786d1a4 | e92d53b29e393fc4c0f9f1f7c3fe651be8d36faa | 2025-09-01T08:57:00+08:00 | hipudding | CANN: fix RoPE cache issue on multi-device (#15629) | |
| 101 | e92d53b29e393fc4c0f9f1f7c3fe651be8d36faa | 0d161f021aa33ec0e90cce96f5d1a88925557327 | 2025-08-31T20:41:02+03:00 | Georgi Gerganov | sampling : optimize samplers by reusing bucket sort (#15665) | |
| 102 | c37052ab4d6d1ae73c0e90bc6e560cc6409e1311 | 5c16b9c87d840e4d5d55fa83c732c6b693346f40 | 2025-08-31T02:06:43-05:00 | Jeff Bolz | vulkan: mul_mat_id coopmat2 optimizations (#15546) | |
| 103 | e8d99dd0b67f2ecc1e45fca8074a3a18c3e036d2 | a8bca68f727844e7dcf24a956003b3c2039ea563 | 2025-08-28T18:39:31-06:00 | Gabe Goodhart | nvidia nemotron nano v2 (nemotronh) (#15507) | |
| 104 | fbef0fad7a7c765939f6c9e322fa05cd52cf0c15 | da54f9f1a2db07aaae390024ac466e7867685d94 | 2025-08-27T20:58:09+02:00 | Johannes Gäßler | server: higher timeout for tests (#15621) | |
| 105 | 1e7489745a74996fc36e8fd05b73aa16bc184e0c | 1cf123a343ab7ca5586aacb9e0a1d2de7fe33be4 | 2025-08-27T17:21:41+08:00 | Chenguang Li | CANN: refactor mask handling and improve performance in FA (#15561) | |
| 106 | 8b696861364360770e9f61a3422d32941a477824 | 8ce3ff1d91245e158d98d8062cd64b0dd98dcfe3 | 2025-08-27T00:27:49+05:30 | Akarshan Biswas | SYCL: fix rms_norm_mul_add for tensor dim not a multiple of sg_size (#15592) | |
| 107 | 44b1efa41acd4df3f56ee0e46f898135ecd1a054 | a6a58d64785cb458ed9de52f391aa38142d38d64 | 2025-08-26T15:42:49Z | Eve | tests: add performance test for mul mat id (#15543) | |
| 108 | a6a58d64785cb458ed9de52f391aa38142d38d64 | 0373486dbc0dccbdcb3b5fdd65759d88cec06196 | 2025-08-26T21:05:25+05:30 | shalinib-ibm | llamafile: PowerPC Sgemm Optimization (#15558) | |
| 109 | b3964c1e890ef8c947afb36a5124ce6fcb2136d4 | 79a546220c719e6a70627b243a478ab8d84dc9e1 | 2025-08-26T14:22:14+03:00 | Georgi Gerganov | metal : optimize FA vec for large sequences and BS <= 8 (#15566) | |
| 110 | 1d8d83deaa48d4a5491820d58ff1c0d8cf9d196c | c4e9239064a564de7b94ee2b401ae907235a8fca | 2025-08-26T12:46:15+03:00 | Georgi Gerganov | metal : improve `MUL_MAT_ID` (#15541) | |
| 111 | 0115cfb7c1dec0753aecb34f3af4338bf9de8eeb | 3a617cb18121a85eed17ac5585788810c5d9c1e0 0d5a470223fc90b6b6807921d68011ff06ae7f9e | 2025-08-26T15:19:56+08:00 | Yunzhe Jia | Merge branch 'master' into dev | |
| 112 | 74f52f77f28a5ad6d6075231afcb8d1ad763ca32 | f7207b0415986dd7f48447149da7de3a82338276 | 2025-08-26T05:21:22+08:00 | Qeeweew | CUDA: Accelerate MXFP4 table lookup using `__byte_perm` (#15451) | |
| 113 | 4d917cd4f64cc37744e76d084659475819fb0728 | 886b97a5d693550c2da470c091d9d27bf38398f8 | 2025-08-25T17:56:59+02:00 | Ruben Ortlam | vulkan: fix min subgroup 16 condition for mmid subgroup optimization (#15565) | |
| 114 | 5eff6ec9b1220b599a43b594b1110487ab6aca08 | dfd9b5f6c7586c88588f06a644c131bec071a0a1 | 2025-08-25T17:23:40+02:00 | Johannes Gäßler | CUDA: MoE helper in device code, better tile sizes (#15525) | |
| 115 | 6b64f74b55628e4193f4fb00313f07dbd8556528 | 0d5a470223fc90b6b6807921d68011ff06ae7f9e | 2025-08-25T13:56:43+03:00 | Georgi Gerganov | batched-bench : fix unified KV cache handling + pp timing (#15562) | |
| 116 | 043fb27d3808766d8ea8195bbd12359727264402 | b730706a49e576fb882dc34d9966345778b3ab0b | 2025-08-24T19:36:36+02:00 | Ruben Ortlam | vulkan: apply MUL_MAT_ID subgroup optimization to non-coopmat devices (#15524) | |
| 117 | 611f419cff11e4952228162a1c44cb35dff2274a | b1afcab804e3281867a5471fbd701e32eb32e512 | 2025-08-23T13:16:17-05:00 | Jeff Bolz | vulkan: optimize rms_norm, and allow the work to spread across multiple SMs (#15281) | |
| 118 | 9ef536907de1b50c30e0369284898d30472a755a | 21dc4ddaf21b8ed551d717e7606abd2cffbacdbf | 2025-08-23T12:58:58+02:00 | Johannes Gäßler | scripts: fix compare-llama-bench.py (#15521) | |
| 119 | 289bf4113ef5c02d8f5eb0cf2d86683d8b8bc4d9 | b55f06e1aa67fb10e89f53e31bbccf37eb2678ea | 2025-08-23T02:33:36-05:00 | Jeff Bolz | vulkan: Rewrite synchronization to allow some overlap between nodes (#15489) | |
| 120 | 330c3d2d21b55bca5517db7d2eea2ea8f131df4a | e92734d51bcb82cc35f0a6b5a14928f0036b2c90 | 2025-08-23T01:31:54-05:00 | Jeff Bolz | vulkan: optimize mul_mat_id loading row ids into shared memory (#15427) | |
| 121 | ad5c975c2d0297124fad210776ef8eed6b90d578 | 4afb0a746f22abaa545b3ebdb76a400d7da3a713 | 2025-08-22T16:11:04+08:00 | Aaron Teo | ggml-cpu: Support Q5_0 and Q5_1 on s390x (#15486) | |
| 122 | a0f98dd604d34826eb5ea2560d1e23fe726921df | 54a241f505d515d625767b993bfd573ecee306b9 | 2025-08-22T14:12:07+08:00 | Chenguang Li | CANN: Optimize RMS_NORM using cache (#15419) | |
| 123 | 2758fa10dab0556e6c3f130e664750fd6773dc7c | b108e429043ee5c9fc8fa4957a0a52c3e490d5c9 | 2025-08-21T12:16:54+02:00 | Daniel Bevenius | examples : add model conversion tool/example (#15455) | |
| 124 | fec9519802ae1567048abb126cdd5ea160a22d0f | 657b8a77bd01854f99d37a47318fa24f2e7e298f | 2025-08-20T09:33:14-05:00 | Jeff Bolz | vulkan: shorten pipeline name strings (#15431) | |
| 125 | 37f10f955f70e0158d50343d0b9a3f92d194daae | 2f37014073f4c6ddc8f241c927db87337c71aa52 | 2025-08-20T12:31:16+02:00 | Daniel Bevenius | make : remove make in favor of CMake (#15449) | |
| 126 | a6d3cfe7fa6ea1fb0e1ba8243b731db22ddc0b49 | 67f09a3a27db443f9870aac87e163dba0d08131e | 2025-08-19T21:28:22+08:00 | SHUAI YANG | CANN: optimize rope operator (#15335) | |
| 127 | 6424594c56f4dbd0573455d89a0d89a0ac093d13 | e9288e886970884f288533cd597b3798995b4099 | 2025-08-19T10:54:31+02:00 | Marvin Gießing | ggml-cpu: add mxfp4 VSX intrinsics for Power9+ (ppc64le) hardware (#15385) | |
| 128 | f0d3c7405c323784a60f14ddddfbac3f7404d417 | f08c4c0d8d0cb6caaf8b7ad316039232b9fa059c | 2025-08-19T08:45:12+03:00 | Georgi Gerganov | batched-bench : use rand tokens (#15398) | |
| 129 | de5627910df74298c998e6bb36ee3217375a5719 | 65349f26f2299e06477ec8e85e46243046801358 | 2025-08-17T03:41:45-05:00 | Jeff Bolz | vulkan: Optimize argsort (#15354) | |
| 130 | 1fe00296f587dfca0957e006d146f5875b61e43d | de2192794f4e8e04f2e8167ef2424905145e88fc | 2025-08-16T11:48:22-05:00 | Jeff Bolz | vulkan: fuse adds (#15252) | |
| 131 | 863d341eeb81db104902b14b6f9413daa515e957 | d32e03f4495d3efa1c5126f53b449f1d429c5664 | 2025-08-14T08:38:10-05:00 | Jeff Bolz | vulkan: perf_logger improvements (#15246) | |
| 132 | 5cdb27e0917479d2d742cea7beee089574bb09fa | 3ea913f1ce9567289aedd866a569dbab8fb8e419 | 2025-08-14T03:03:57-07:00 | Jonathan Graehl | finetune: SGD optimizer, more CLI args (#13873) | |
| 133 | 6028bf74351d35a06bd98498624f8c2f029f7d1a | bc5182272c373267352bc689e5fca276934bea2d | 2025-08-13T10:04:46+02:00 | Oliver Simons | CUDA: Optimize `reduce_rows_f32` kernel, leading up to 25x perf improvement on kernel-level and 10% perf increase for Gemma3n (#15132) | |
| 134 | bbd57b7eafb3b32e3f7f3a2175bce0b35abc7de8 | 25ff6f7659f6a5c47d6a73eada5813f0495331f0 | 2025-08-12T16:12:13+08:00 | Chenguang Li | CANN: GGML_OP_CPY optimization (#15070) | |
| 135 | 4850b52aedceeb70bb4fe49f2d7cd1df6ee98682 | cd6983d56d2cce94ecb86bb114ae8379a609073c | 2025-08-08T23:04:36+02:00 | Johannes Gäßler | server-bench: external OAI servers, sqlite (#15179) | |
| 136 | 9a96389544a08fd829fccda28142ce2066017fde | 1d72c841888b9450916bdd5a9b3274da380f5b36 | 2025-08-07T13:45:41+02:00 | Christian Kastner | ggml: Skip backend library linking code when GGML_BACKEND_DL=ON (#15094) | |
| 137 | 2241453252147bb7362a286977ee9f9a92130062 | 9515c6131aecaccc955fdedcfe16c3e030aaefcb | 2025-08-06T14:12:42+08:00 | Chenguang Li | CANN: add support for ACL Graph (#15065) | |
| 138 | fd1234cb468935ea087d6929b2487926c3afff4b | f324a3b715d5c1081c110ce459f8a8486fb1ee89 | 2025-08-05T22:10:36+03:00 | Georgi Gerganov | llama : add gpt-oss (#15091) | |
| 139 | 4cb208c93c1c938591a5b40354e2a6f9b94489bc | 3025b621d12a6931ff5e9775d4f644719980ad91 | 2025-08-02T04:21:37-05:00 | Jeff Bolz | vulkan: coopmat2 mul_mat optimizations (#14934) | |
| 140 | 3025b621d12a6931ff5e9775d4f644719980ad91 | ec0b18802c91badd3ff1388ffd09ee163251bd72 | 2025-08-02T17:20:40+08:00 | R0CKSTAR | llama-bench: rename DB table name from test to llama_bench (#15003) | |
| 141 | a9f7541ec25c4c8547daf5ff48700ad2836e2b7d | 9c35706b98ea271858acef4194f526a71b24cdc9 | 2025-08-02T02:57:04-05:00 | Jeff Bolz | vulkan: optimizations for direct convolution (#14933) | |
| 142 | 484b2091ce5017901483b5204c07878f171d1441 | daf2dd788066b8b239cb7f68210e090c2124c199 | 2025-08-01T08:47:27+08:00 | R0CKSTAR | compare-commits.sh: support both llama-bench and test-backend-ops (#14392) | |
| 143 | c7aa1364fd59b2ac06fd9e0a719253d968472dc3 | 1a67fcc30677e96dda76bb1b290788e7d8852b51 | 2025-07-29T17:43:43+02:00 | uvos | HIP: Ignore unsupported unroll transformation in fattn-vec (#14931) | |
| 144 | bbd0f917797e9d524680f1b30d34a46eb06d7651 | 0a5036bee9cfb946870689db4400e9e0d17844c9 | 2025-07-29T10:40:50+02:00 | Johannes Gäßler | server-bench: make seed choice configurable (#14929) | |
| 145 | bda62193b2a6bebbf515c3c389303094a44458c1 | c556418b600ad5792440942079d93e393595688b | 2025-07-28T09:04:27-07:00 | Leonard Mosescu | test-backend-ops : extend test case filtering (#14865) | |
| 146 | c556418b600ad5792440942079d93e393595688b | db16e2831c0f344f041af3d067db81c42b16eb22 | 2025-07-28T18:59:04+03:00 | Radoslav Gerganov | llama-bench : use local GPUs along with RPC servers (#14917) | |
| 147 | 66906cd82a4a1fd10151707cee3f66cb61fc4055 | 11dd5a44eb180e1d69fac24d3852b5222d66fb7f | 2025-07-26T18:28:14-04:00 | deepsek | HIP: Enable Matrix cores for MMQ Kernels, Enable stream-K for CDNA 3 (#14624) | |
| 148 | 793c0d7f46384001738c337d7afa46b45ae32745 | ce111d39d666f4a3b6a561ad020f6feb8cc67790 | 2025-07-25T10:47:39-06:00 | Gabe Goodhart | metal: SSM_SCAN performance (#14743) | |
| 149 | e4868d16d24dec55e61bcaadaca28feed8f98b13 | 820de57d4faa427a3d0bfb14e48057247fae036e | 2025-07-24T16:31:48+03:00 | Georgi Gerganov | context : perform output reorder lazily upon access after sync (#14853) | |
| 150 | a86f52b2859dae4db5a7a0bbc0f1ad9de6b43ec6 | b284197df426fb189cdcfe56a43c863a788ac756 | 2025-07-23T21:43:25+02:00 | Johannes Gäßler | CUDA: fix overflow in FA, tune performance (#14840) | |
| 151 | d1aa0cc5d13ec3fa553de5d298f9166679e58479 | c8ade30036139e32108fee53d8b7164dbfda4bee | 2025-07-22T13:33:37+01:00 | Ed Addario | imatrix: add option to display importance score statistics for a given imatrix file (#12718) | |
| 152 | a979ca22db0d737af1e548a73291193655c6be99 | 90083283ec254fa8d33897746dea229aee401b37 | 2025-07-19T21:59:08+02:00 | Ervin Áron Tasnádi | ggml: adds CONV_2D op and direct GEMM Vulkan implementation (#14316) | |
| 153 | 90083283ec254fa8d33897746dea229aee401b37 | d4b91ea7b2da253e1355b503f0fcb7b428ce005d | 2025-07-19T12:51:22-04:00 | compilade | imatrix : use GGUF to store importance matrices (#9400) | |
| 154 | 01612b74090df592663cfa01f661c9628f403b59 | 086cf81e88fb75287b71ff19c08a206b7bc2e02f | 2025-07-17T19:08:33+03:00 | Georgi Gerganov | llama : reuse compute graphs (#14482) | |
| 155 | 225e7a1438f4ea85eaa7b5ef3ab3b266ee4d9c06 | ab140198211385b85eeeb0abd549a4bbe259e10d | 2025-07-16T16:35:42+03:00 | Georgi Gerganov | llama : add high-throughput mode (#14363) | |
| 156 | ab140198211385b85eeeb0abd549a4bbe259e10d | 64978340b0b4a0a6e2fb74270c1509383d2eff32 | 2025-07-16T20:03:51+08:00 | Aman Gupta | Support diffusion models: Add Dream 7B (#14644) | |
| 157 | 5cae76654113160f691f581930b69fc5535e8159 | 4b91d6f71f14040979bcdb7b6729b3bca93ec1c1 | 2025-07-16T09:33:28+02:00 | Johannes Gäßler | scripts: synthetic prompt mode for server-bench.py (#14695) | |
| 158 | 79e0b68c178656bb0632cb8602d2940b755077f8 | c81f4192f91a1e209c1eec7a84fe5371ef9175da | 2025-07-16T12:00:42+08:00 | Min-Hua | llama: add LLAMA_API to deprecated llama_kv_self_seq_div (#14708) | |
| 159 | 494c5899cb76859f32ddd913534f2685fd684a3d | 0f4c6ec0f1a9607ba67071f8a02c69b0afc2f91e | 2025-07-14T13:14:30+02:00 | Johannes Gäßler | scripts: benchmark for HTTP server throughput (#14668) | |
| 160 | 05fec5bd298d3c0243cbb9336e59b8b6aff75a81 | dcf7f2ea3c4e3cf36dd9ab5a36785c00e6033267 | 2025-07-13T10:36:33+03:00 | Georgi Gerganov | ggml : add build-time message to remind about ggml_set_rows (#14661) | |
| 161 | b3ad3a0191994d6c47b2bd389d5c7431526ecd2c | 98197e5c98388470030d908f355ec5937dcccaaa | 2025-07-12T05:12:26-05:00 | Jeff Bolz | vulkan: support SET_ROWS (#14587) | |
| 162 | 98197e5c98388470030d908f355ec5937dcccaaa | f5e96b368f1acc7f53c390001b936517c4d18999 | 2025-07-12T04:51:58-05:00 | Jeff Bolz | vulkan: optimizations for deepseek prompt processing (#14555) | |
| 163 | 0aedae00e6fb48680324a5ac5da9cba0e35de6b5 | 6bdda13981d6c8189b7dc4f9fb8ecb91c21529f8 | 2025-07-10T18:20:13-06:00 | Gabe Goodhart | model : Granite Four (#13550) | |
| 164 | 4a5686da22057867c23bd4a6be941ddc8c51e585 | 98bab638fb28cf95a5a66dd2d51b40d6c8f6d69a | 2025-07-09T14:59:57-04:00 | compilade | llama : support Jamba hybrid Transformer-Mamba models (#7531) | |
| 165 | 6efcd65945a98cf6883cdd9de4c8ccd8c79d219a | 699f4392a33f57c3352cf8d60bdc53db7ca235e7 | 2025-07-08T13:11:42-05:00 | Jeff Bolz | vulkan: optimize flash attention split_k_reduce (#14554) | |
| 166 | 53903ae6fa5f1caf187889c839cdd1ad25da4018 | 4d0dcd4a06080e796e6742a88f2ffa7fc41b28b8 | 2025-07-08T02:38:31-05:00 | Jeff Bolz | vulkan: increase timeout for CI (#14574) | |
| 167 | 5d46babdc2d4675d96ebcf23cac098a02f0d30cc | e17991c466ac835b2c71bd813c1ca7ff8dd97b94 | 2025-07-02T13:10:24-04:00 | compilade | llama : initial Mamba-2 support (#9126) | |
| 168 | caf5681fcb47dfe9bafee94ef9aa8f669ac986c7 | 83790b0e7e09ab17238b16452a33053a71dbdfad | 2025-06-29T20:02:53+02:00 | matteo | server : support jinja extra template kwargs (Qwen3 enable_thinking feature), from command line and from client (#13196) | |
| 169 | a0535ffa0d35fccfec3e1a0a3bfc9dbb6054d7c0 | bd9c981d7226107f18deb8344c3301450311bb8b | 2025-06-29T11:04:10+02:00 | Sigbjørn Skjæret | ggml : implement REGLU/GEGLU/SWIGLU ops (#14158) | |
| 170 | bd9c981d7226107f18deb8344c3301450311bb8b | 27208bf657cfe7262791df473927225e48efe482 | 2025-06-29T02:43:36-05:00 | Jeff Bolz | vulkan: Add fusion support for RMS_NORM+MUL (#14366) | |
| 171 | 8d94219a4a7f2da72ee542019ca01f36af93d1d6 | f667f1e6244e1f420512fa66692b7096ff17f366 | 2025-06-27T16:41:40+03:00 | Radoslav Gerganov | ggml : add ggml_set_rows (#14274) | |
| 172 | 8f52c6f8abb2ed9ad967cc0bfb90acb073011193 | d2f325130c4ed77a3dcff2c23a926587fb08e2cc | 2025-06-26T15:10:45+08:00 | Yunzhe Jia | Squashed commit of the following: | |
| 173 | 60ef23d6c14d325d83eae5752e5de39ad268e9b0 | b193d5306912a2adae0fde7481819f6ee0941bc6 | 2025-06-26T05:49:04+08:00 | Aaron Teo | ggml-cpu: enable IBM NNPA Vector Intrinsics (#14317) | |
| 174 | 0142961a2e67909e33cdf410274b56c08c5dce7a | ce82bd0117bd3598300b3a089d13d401b90279c7 | 2025-06-24T01:12:56+02:00 | uvos | CUDA/HIP: optimize mmv paths taken for HIP devices (#14324) | |
| 175 | 812939a9e90f99d1bd5bb1bc6b99d12600671d50 | 4c9fdfbe1580a66fd7d77c77418ce2c606a29fdd | 2025-06-20T10:50:27+03:00 | Georgi Gerganov | model : more uniform output id handling (#14275) | |
| 176 | 8f71d0f3e86ccbba059350058af8758cafed73e6 | 381174bbdaf10d6a80dc2099f284b20544d86962 | 2025-06-19T12:24:14-07:00 | Diego Devesa | ggml-cpu : remove unnecesary arm feature detection (#14281) | |
| 177 | fffcce535ebbdc25f81966a15b758658788e7466 | 5fc7856815920f828f9e90cb759ac82c7f0c1ea5 | 2025-06-19T13:24:12+03:00 | bashayer hijji | llama-bench : add --no-warmup flag (#14224) (#14270) | |
| 178 | 8d947136546773f6410756f37fcc5d3e65b8135d | 50d2227953ca9024f04255b4f116d06fcc0db74c | 2025-06-19T01:10:26+08:00 | Aaron Teo | docs: add s390x build documentation (#14264) | |
| 179 | 0dbcabde8c006d5cf781ca0fe071c41559572a72 | ad590be98c83217fcf1a101d78d9ab389fd5dc0b | 2025-06-16T10:32:13-03:00 | bandoti | cmake: clean up external project logic for vulkan-shaders-gen (#14179) | |
| 180 | b9912ac570de8945ae9383c9ca8291027bf287dd | 00ba7726100d7e1941d9f5a06f56a7559945b33c | 2025-06-15T09:18:37+03:00 | Georgi Gerganov | batch : auto-gen positions + verify multi-sequence input (#14177) | |
| 181 | 2e42be42bd6bf1dcc643d6ac4e77419bfe5dd24f | fb85a288d72abbd5e5daa8de96e6f8bfa7b5ab46 | 2025-06-14T16:34:20+08:00 | Aman Gupta | compare-llama-bench: add option to plot (#14169) | |
| 182 | c61285e7396c8e526fe7794c19e8d4f1c99bfc51 | 09cf2c7c655c90e53e100f29b830a788bab0653d | 2025-06-13T08:45:37+01:00 | Ewan Crawford | SYCL: Bump oneMath commit (#14152) | |
| 183 | 532802f938c6a18cc6a704057ab571f253fd77ed | d4e0d95cf581f50c9a21d06eaecae2dd580076bd | 2025-06-11T19:07:44Z | Christian Kastner | Implement GGML_CPU_ALL_VARIANTS for ARM (#14080) | |
| 184 | 3a12db23b6918682ccb70ab15d897f11fe5fc320 | ae92c1855b1a5b604fa1bfcced19a556ab3e78c5 | 2025-06-10T16:48:07+01:00 | Juk Armstrong | Fixed spec timings to: accepted/tested instead of accepted/drafted (#14104) | |
| 185 | 228f34c9ceefa3ea4f4d6933edd858121e8106cb | 0974ad7a7cd4bca846b15c484ff3be890135a52c | 2025-06-07T18:58:20+05:30 | Akarshan Biswas | SYCL: Implement few same quantized type copy kernels (#13739) | |
| 186 | 7e00e60ef86645a01fda738fef85b74afa016a34 | ea1431b0fa3a8108aac1e0a94a13ccc4a749963e | 2025-06-03T13:30:22-05:00 | Jeff Bolz | vulkan: fix warnings in perf logger querypool code (#13937) | |
| 187 | 71e74a3ac929b8af91f16f73f3c2b9b2f796d207 | bfb1e012a0b7658e8f00ed4333d059943ea9d648 | 2025-06-02T16:54:58-07:00 | lhez | opencl: add `backend_synchronize` (#13939) | |
| 188 | 093e3f1feb16e25e58f7d61e01266c830dd424b8 | 663445b0deb21fb602176da030d4154197a4fca6 | 2025-06-02T17:48:36+05:30 | shalinib-ibm | cmake : Handle mixed-case 'Power' strings in POWER CPU detection (#13966) | |
| 189 | 053b1539c02617eff744f89525ee57497c3c1fbe | b3a89c3d9e34c28c5be70d8b687a84775746d4a0 | 2025-05-31T15:39:19-07:00 | Max Krasnyansky | threading: support for GGML_SCHED_PRIO_LOW, update thread info on Windows to avoid throttling (#12995) | |
| 190 | b49a8ff96b769b8a4c36d89fb783ec0135be582b | 53f925074de02c5304b00c14b4d6d8910c58667d | 2025-05-30T19:40:57+05:30 | Akarshan Biswas | SYCL: Add mrope kernel (#13755) | |
| 191 | 54a2c7a8cd8a32b44e3a98c2999b0f5c9114be5c | 21fcc21ad5e5de2daa5da8d08dbbcc86b8d815d7 | 2025-05-29T19:39:20+08:00 | Yibo Cai | arm64: optimize q4_k_q8_k kernel with i8mm (#13886) | |
| 192 | bef817638780dcbd8c0c80c97b7a4f8e92c8fe74 | 34b7c0439ed0f98575cc4689dfecd98991dee8be | 2025-05-27T11:39:07-05:00 | Jeff Bolz | vulkan: use timestamp queries for GGML_VULKAN_PERF (#13817) | |
| 193 | bc583e3c63c04a11d287c108ea9e6a515ead0423 | 72b090da2c50e540143fd312a2f9aa5f151e6136 | 2025-05-27T14:06:10+02:00 | Xuan-Son Nguyen | mtmd : support Qwen 2.5 Omni (input audio+vision, no audio output) (#13784) | |
| 194 | f5cd27b71da3ac375a04a41643d14fc779a8057b | a2d02d5793fd9af7a7224773456501691b95fd02 | 2025-05-25T01:48:08+01:00 | Olivier Chafik | `server`: streaming of tool calls and thoughts when `--jinja` is on (#12379) | |
| 195 | 2bd1b30f6979235ec67b95c183b9b77baa7ab9ce | 259469c4b57c1a32606353bcac52ba683424a990 | 2025-05-24T13:26:47-07:00 | Diego Devesa | ggml-cpu : set openmp wait time if not set (#13758) | |
| 196 | f7c9429c85748cde9599499601ba48d0057722e6 | 1dfbf2cf3a9f15193dd893396d07762bbd2c4785 | 2025-05-20T02:54:43+02:00 | Nicolò Scipione | sycl : Overcoming workaround for mmap() allocation on Windows (#13482) | |
| 197 | 725f23f1f3f0d3adf49f95d8dfa6e7c74adff149 | 92ecdcc06a4c405a415bcaa0cb772bc560aa23b1 | 2025-05-19T14:38:20+01:00 | Alberto Cabrera Pérez | sycl : backend documentation review (#13544) | |
| 198 | 6c8b91500e75df6664278d1e9af3e39e8a2fb0d0 | 3cc1f1f1d24472a6558c942b1c78989ff4b0e569 | 2025-05-15T06:46:55-07:00 | Diego Devesa | llama-bench : fix -ot with dl backends (#13563) | |
| 199 | b2838049ccf50859cea4c390e81405c2fb01e820 | aa48e373f256df9608395ee6881e7010840d6202 | 2025-05-15T05:57:02+03:00 | Georgi Gerganov | bench : handle decode errors (#13548) | |
| 200 | 5ab5d5fb256aa23f8ab4de8463515ea627f43006 | 3198405e98530c683d12fd123e3920f2bd2aafa5 | 2025-05-15T03:53:52+08:00 | Yibo Cai | arm64: optimize q6_k_q8_k kernel with i8mm (#13519) | |
| 201 | 24e86cae7219b0f3ede1d5abdf5bf3ad515cccb8 | bb1681fbd532eba26ae4c14cd8be884c8afeb31c | 2025-05-14T18:55:26+09:00 | Jeff Bolz | vulkan: KHR_coopmat flash attention (#13506) | |
| 202 | be1d4a13db26750fac702ceb3af88ae4f39dc9f4 | ab3971f2a0a526564bfde0e4cc8a5b90f9d33ad2 | 2025-05-14T08:41:01+02:00 | Sigbjørn Skjæret | scripts : fix compare-llama-bench.py show parameter (#13514) | |
| 203 | f0995d28ce3d15095b6845d94ce4465e46575873 | c252e0c4097b34666e5a81db9d0450d71fa3098f | 2025-05-13T18:04:39+03:00 | Georgi Gerganov | metal : use FA-vec kernel up to batch size 20 (#13496) | |
| 204 | c252e0c4097b34666e5a81db9d0450d71fa3098f | 4f711afed5e7ef4304b567c8888ee1aa60e868eb | 2025-05-13T18:04:00+03:00 | Georgi Gerganov | metal : optimize multi-sequence FA vec kernel (#13493) | |
| 205 | b89d605a91dee0a518ecd582f8991a07d523e2fa | b4726345aca49e2ad62d615e6e370b3dbad6434f | 2025-05-13T18:01:53+03:00 | Georgi Gerganov | batched-bench : fix pp batch contents (#13492) | |
| 206 | bf7937112058f2815fc3825a9ff7b536ecafa3bb | d590cd4c244e5f260c42c290b83a358b9d86d763 | 2025-05-13T15:31:12+02:00 | Sigbjørn Skjæret | scripts : support arbitrary input file formats in compare-llama-bench.py (#13455) | |
| 207 | cf0a43bb6490bd49344775abb22ba26f8047cb54 | f0d46ef15717cd609a7b69cf6190edde64d466c8 | 2025-05-12T15:31:37-07:00 | Diego Devesa | llama-bench : add defrag-thold, check for invalid ranges (#13487) | |
| 208 | 22cdab343b63edd0906f1c132616746085f81983 | a71a4075cdb8e81eaaa834e48ffda88b038286bc | 2025-05-12T13:08:22+02:00 | Diego Devesa | llama-bench : accept ranges for integer parameters (#13410) | |
| 209 | 09232370fc6426aa5dd9be01a8271b9c28f5af3a | 7474e00b34629e9cd8b06bc87ad935584ea30f8e | 2025-05-11T16:20:39+02:00 | Sigbjørn Skjæret | scripts : exit compare-llama-bench.py gracefully when there's nothing to compare (#13451) | |
| 210 | 7f323a589f8684c0eb722e7309074cb5eac0c8b5 | 3eac209319a6726fd9687c6188fc6b916b65953d | 2025-05-11T20:18:39+08:00 | David Huang | Add `--no-op-offload` to improve `-ot` pp perf in MoE models like llama4 400B (#13386) | |
| 211 | dc1d2adfc0f4de84da7923866d00781ec5c4e666 | 7c28a74e0783f4bb74a246fb9f19bf212139e365 | 2025-05-09T23:07:07-07:00 | Jeff Bolz | vulkan: scalar flash attention implementation (#13324) | |
| 212 | 33eff4024084d1f0c8441b79f7208a52fad79858 | 17512a94d636c4b6c1332370acb3e5af3ca70918 | 2025-05-09T19:29:37+02:00 | Xuan-Son Nguyen | server : vision support via libmtmd (#12898) | |
| 213 | 611aa914ef4231fab5d1ad04773c42e119ae2d2e | 0cf6725e9f9a164c39f7a87214d60342f7f946d8 | 2025-05-09T15:14:56+03:00 | Georgi Gerganov | metal : optimize MoE for large batches (#13388) | |
| 214 | 1e333d5bba18e99bc328bb87ac1ee6a4e6260e0e | 2f54e348ad2999c4e31b8777592247622b20420f | 2025-05-06T20:27:06+05:30 | Akarshan Biswas | SYCL: Disable reorder optimize by default and stop setting tensor extras when optimize is disabled (#13254) | |
| 215 | b34c859146630dff136943abc9852ca173a7c9d6 | 9b61acf06041dcbaff6afa5f28940e93297f8520 | 2025-05-05T17:03:31+03:00 | igardev | server : Webui - change setText command from parent window to also send the message. (#13309) | |
| 216 | b34443923cad751483cc53af2e680d595daadce7 | a75cb30dc9e63488c3614e2d5a9fe2306eaf47cd | 2025-05-02T20:54:30+03:00 | Georgi Gerganov | sync : ggml (#13268) | |
| 217 | 3f3769ba76061a511f02f2a48da2ad2d93fce511 | 2f567611c0234bbca0a4009762acb47b56866095 | 2025-05-02T22:23:12+05:30 | shalinib-ibm | ggml : Enable MMA for BF16 in llamafile_sgemm (#13148) | |
| 218 | 19e899ce21a7c9ffcf8bb2b22269a75f6e078f8f | e2e1ddb93a01ce282e304431b37e60b3cddb6114 | 2025-04-29T23:32:04+02:00 | Johannes Gäßler | scripts: n_depth for compare-llama-bench [no ci] (#13201) | |
| 219 | 5a6398011704c31178d7b774be67856ba57647c8 | cdf76586b23c67abd3ca064ee2c084c57ae240bd | 2025-04-29T16:24:36+01:00 | Alberto Cabrera Pérez | llama-bench: fixed size of fields to correctly map to values (#13183) | |
| 220 | 1831f538f720d1d99fba146f24f0a8e970838cc4 | 4e87962e34a4b257ec374c4baf6b1568554b81a9 | 2025-04-28T20:20:39+05:30 | Vishal Agarwal | llama-bench: add `-d` depth arg (#13096) | |
| 221 | c0a97b762e5ec767dc414f0dc4979befd4c09a52 | ced44be34290fab450f8344efa047d8a08e723b4 | 2025-04-27T14:48:26-07:00 | 4onen | llama-bench : Add `--override-tensors` arg (#12922) | |
| 222 | 2d451c80590b9ac250322769ac13d3b4870dbcf7 | 4753791e70acd4d4e02f2098f14a03df26c992bd | 2025-04-26T22:58:12+02:00 | Xuan-Son Nguyen | common : add common_remote_get_content (#13123) | |
| 223 | 77d5e9a76a7b4a8a7c5bf9cf6ebef91860123cba | d5fe4e81bd447124836ecfb47d794f8768665b9f | 2025-04-26T22:05:31+08:00 | SXX | ggml: move fp16/bf16 conversion optimizations to CPU backend + export conversion APIs (#13107) | |
| 224 | 553a5c3a9fdf771be2101bc3529937963f817457 | 13be08daf992c89d5169518229b3740041c0f419 | 2025-04-25T10:08:08+03:00 | Radoslav Gerganov | rpc : do not wait for response when sending RPC_CMD_SET_TENSOR (#12943) | |
| 225 | 7a395f67a7a02bb361d944b816d6e933889e28e1 | 971f245b3b5f3f55991bb779cb541b00f82eea1d | 2025-04-17T20:34:16+08:00 | hipudding | CANN: Add support for async operator submission (#12864) | |
| 226 | 015022bb53387baa8b23817ac03743705c7d472b | b43d89e311c5e7fbf62e5ec3c0401eb536677267 | 2025-04-16T13:37:25-05:00 | Jeff Bolz | vulkan: enable coopmat2 FA gqa and split_k optimizations more often (#12931) | |
| 227 | 84778e97703740d8ac5fb64e14d83b80eafa0f3c | 510676475f885ec064ff147af9f20ee7a9b12a50 | 2025-04-15T17:20:38+08:00 | David Huang | CUDA/HIP: Share the same unified memory allocation logic. (#12934) | |
| 228 | daa422881a0ec7944771bcc8ff8de34d11f5bd3b | eccc7a1602f0752507de4aaad1008b9618a282c8 | 2025-04-15T07:49:57+01:00 | Juk Armstrong | llama : DeepSeek V2/V3 MLA implementation (#12801) | |
| 229 | 0019279bb56f028e4eee19b59b19750736c719f7 | b0c75ac9f93322b45e3766e149417334b4fd1ed9 | 2025-04-15T10:09:35+08:00 | Chenguang Li | CANN: Opt ROPE optimization (#12865) | |
| 230 | b0c75ac9f93322b45e3766e149417334b4fd1ed9 | d6d2c2ab8c8865784ba9fef37f2b2de3f2134d33 | 2025-04-15T10:04:24+08:00 | Xinpeng Dou | CANN: Optimize CANN buffer pool memory management (#12875) | |
| 231 | d6d2c2ab8c8865784ba9fef37f2b2de3f2134d33 | 75afa0ae31f0a51aaadcc5ff146eb7a32a7f9088 | 2025-04-15T01:18:20+08:00 | Russyyds | Add performance print for gemma3 in example (#12929) | |
| 232 | 8b9cc7cdd8a0dcf0176c60c755322c95b5965299 | 64eda5deb9859e87a020e56bab5d2f9ca956f1de | 2025-04-10T22:57:16+02:00 | Xuan-Son Nguyen | llava : introduce libmtmd (#12849) | |
| 233 | 0090950f679475c5ecaac2f7bca5049cca96492b | 7ecd780b1a1d5214b8d04c25ebfc194d310816ed | 2025-04-09T00:25:08-05:00 | Jeff Bolz | vulkan: In coopmat2 mmq, load q4_k/q5_k scales through shared memory (#12833) | |
| 234 | 8ca6e1c3a4deb6bb27ee294bfd5706098d94ae88 | 656babd6c21a3b9b3622324cfcc80a2ab78da25b | 2025-04-08T14:14:59+05:00 | characharm | server : webui : Improve Chat Input with Auto-Sizing Textarea (#12785) | |
| 235 | 6bf28f0111ff9f21b3c1b1eace20c590281e7ba6 | f1e3eb4249db68d97be352c0adf16eef7ae53795 | 2025-04-05T18:04:03+02:00 | 0cc4m | Vulkan: Tune Vulkan mmq int dot shader for performance (#12767) | |
| 236 | 74d4f5b041ad837153b0e90fc864b8290e01d8d5 | 35e592eb30832187412360912ab8f2f5b7984df1 | 2025-04-04T00:54:35-05:00 | Jeff Bolz | vulkan: Hybrid waitForFences/getFenceStatus to reduce fence latency (#12630) | |
| 237 | c262beddf29f3f3be5bbbf167b56029a19876956 | 5dd5d1ab00d074e3b7c02ca3ae12f6bf3e86336a | 2025-04-03T21:50:29+05:30 | Gaurav Garg | CUDA: Prefer vector flash decoding kernel for Gemma models (#12738) | |
| 238 | be0a0f8cae039e2286f757612accebfb8f21b36e | 92e3006bb69dfeb656ccf5c7c1c1efadb03c88c2 | 2025-04-02T12:40:32-05:00 | Jeff Bolz | vulkan: Implement grouped query attention in the coopmat2 FA shader (#12559) | |
| 239 | 9bacd6b37461608385360fd64326c13247ccf18e | 267c1399f15a278ec8c3cdcf9c90dc94151fbc38 | 2025-04-02T15:22:13+08:00 | Chenguang Li | [CANN] get_rows and dup optimization (#12671) | |
| 240 | e408d4351a4ad143656672479d8ae1479306ce31 | 3891e183c61c1e25c2c61afe68d7b95019ea3f89 | 2025-03-24T09:53:38+01:00 | Daniel Bevenius | ggml : add logging for native build options/vars (whisper/2935) | |
| 241 | 3891e183c61c1e25c2c61afe68d7b95019ea3f89 | af6ae1efb27a9a7c3f7f7f84639d2243f7303ac1 | 2025-03-20T07:02:18+01:00 | Daniel Bevenius | examples : command.wasm updates (whisper/2904) | |
| 242 | b4ae50810e4304d052e630784c14bde7e79e4132 | b86f6007234da4bff51a3ebef2bdb952b52059c6 | 2025-03-28T20:21:59+02:00 | Georgi Gerganov | metal : improve FA + improve MoE (#12612) | |
| 243 | 5d01670266859444366e4f333ade5e0e5e2ae63d | ef03229ff423dd1991f4f44ef1352f03334d86eb | 2025-03-28T01:05:44-07:00 | Benson Wong | server : include speculative decoding stats when timings_per_token is enabled (#12603) | |
| 244 | 13731766db91ec927c1b61bf502ac7a9be2b11b9 | ab6ab8f809bd514d88e02a63869b4d619f13fa86 | 2025-03-28T13:13:22+05:30 | amritahs-ibm | llamafile : ppc64le GEMV forwarding for FP32. (#12594) | |
| 245 | c7b43ab60855f752ae79937fb93d561bc30b69a4 | 24feaec05792b972d5ff3e2b12d9237ebd50d1ac | 2025-03-27T12:21:47+05:30 | amritahs-ibm | llamafile : ppc64le MMA implementation for Q4_0. (#12489) | |
| 246 | ef19c71769681a0b3dde6bc90911728376e5d236 | 053b3f9aae63151732eccf6b7408c6418ba8746e | 2025-03-25T17:46:11Z | Eric Curtin | run: de-duplicate fmt and format functions and optimize (#11596) | |
| 247 | e2f560175a195f63c3276972a3d1caec0bd13e05 | 36ee06dd2dcf8d3d1157ebe36366d7670770e75f | 2025-03-25T16:10:18+05:30 | Akarshan Biswas | SYCL: disable Q4_0 reorder optimization (#12560) | |
| 248 | eddfb438502bd5d1014d63a812e9b6d03d326f8c | 4375415b4abf94fb36a5fd15f233ac0ee23c0bd1 | 2025-03-22T03:40:11-05:00 | Jeff Bolz | vulkan: Optimize mul_mat_vec p021 and nc shaders (#12505) | |
| 249 | 732b5fbf5e7f9cf069942f0c5850ee959ef321ba | 568013d0cd3d5add37c376b3d5e959809b711fc7 | 2025-03-20T02:36:37-04:00 | Bartowski | convert : avoid calls to tokenizer.added_tokens_decoder (#12473) | |
| 250 | 517b5ddbf002b91fd6d6daf5d8db8c88a0173039 | a9b59288e222f39fc0311dc66944ed5a86c815fa | 2025-03-20T01:22:06+05:30 | Gaurav Garg | CUDA: Improve flash decoding kernel GPU occupancy for BS=1 case (#12183) | |
| 251 | a9b59288e222f39fc0311dc66944ed5a86c815fa | 0fd8487b142b2b92565bc95b39ddc440955a237c | 2025-03-19T13:56:23-05:00 | Jeff Bolz | vulkan: optimize iq1 coopmat2 dequant functions (#12427) | |
| 252 | c446b2edd2a9fe2772a1a18923c3e54a6749c364 | d84635b1b085d54d6a21924e6171688d6e3dfb46 | 2025-03-19T02:26:26-05:00 | Jeff Bolz | vulkan: Submit once enough matmul work has been recorded (#12406) | |
| 253 | d84635b1b085d54d6a21924e6171688d6e3dfb46 | 75422e8bc42646005be0754f7aa438b97a5e777e | 2025-03-18T12:54:55-07:00 | lhez | opencl: improve profiling (#12442) | |
| 254 | 484a8ab513bbd740cc49f30280c1acf52cb4e7e9 | cf2270e4d3685ac46f4a166d8718997ba7cbc45a | 2025-03-17T09:26:18-05:00 | Jeff Bolz | vulkan: Add N/2 and N/4 optimized paths in coopmat2 shader (#12312) | |
| 255 | 891c63956dbfbdf7ed2ecd0b5882cff49dbfe90f | 2f21123c1deb3ce1be3c0578c5f6980fe19ed077 | 2025-03-17T04:41:59-05:00 | Jeff Bolz | vulkan: Pad N dimension of B matrix for coopmat2 perf, to avoid bounds checking (#12273) | |
| 256 | 92a391327e9201b9b5b32fdd3afb452026c22d4c | 9f2250ba722738ec0e6ab684636268a79160c854 | 2025-03-15T09:31:08+08:00 | Chenguang Li | [CANN]MUL_MAT optimization (#12382) | |
| 257 | 9f2250ba722738ec0e6ab684636268a79160c854 | 774973b8f3d5e375b0b74d58638eeb1817e950a8 | 2025-03-14T16:41:20Z | Eric Curtin | Add CLI arg to llama-run to adjust the number of threads used (#12370) | |
| 258 | 5e2d57b2b2e43eadbe6d66ba3e873a824b95e725 | f1648e91cf6c52e9593810aa70857e412d474c09 | 2025-03-07T15:35:57+08:00 | BB-fat | metal : simplify kernel arguments using a struct (#3229) (#12194) | |
| 259 | e721c05c9336a72fbb59d5c75967360bc67036c6 | 57b6abf85acb1f697913a44e5e105e333d894b78 | 2025-03-06T08:20:52+01:00 | uvos | HIP/CUDA: set the paramerter value in maintain_cuda_graph instead of replaceing it. (#12209) | |
| 260 | ed4ce0dda24986c80d58e2ce112049af00f632f4 | 07d15723470a0a5b15d8ccad1aff5b20354ffbe1 | 2025-03-06T09:30:05+08:00 | simon886212 | opencl : fix profile-related errors (#12095) | |
| 261 | 669912d9a5bf927312c553332ff997f0a99da8fb | fa31c438e0e709242ab7334d26fc3be3dcda07a0 | 2025-03-05T13:05:13Z | Olivier Chafik | `tool-call`: fix Qwen 2.5 Coder support, add micro benchmarks, support trigger patterns for lazy grammars (#12034) | |
| 262 | 3ccbfe5a71c74ac574b00607067d0aa0a49df04c | 06a92a193a07afe445929607be9d5e4d033956fb | 2025-03-05T08:34:02+01:00 | Daniel Bevenius | ci : remove xframework upload (#12190) | |
| 263 | 2679c3b55d1c9c3fed56dea00fea713622e42594 | c43af9276b119dae7436b7878d59671d0f6b1a97 | 2025-03-03T16:17:36+01:00 | Daniel Bevenius | ci : set GITHUB_ACTION env var for server tests (#12162) | |
| 264 | 7b69003af74924ac04d97313c2e57c45ba56b616 | ece9745bb8079b9f4af45df29b67ad0c6e50584d | 2025-03-03T11:42:45+01:00 | Xuan-Son Nguyen | webui : add ?m=... and ?q=... params (#12148) | |
| 265 | 438a83926afcff3643ffef5543db67545ceffe39 | 9c42b1718ca8299f9afeabdc122badeab64c9690 | 2025-02-28T09:42:52+01:00 | Rémy O | vulkan: add specific MMV kernels for IQ2 and IQ3 quants + optimizations (#11595) | |
| 266 | 581650b7cacec2872982fde381bd3bcda0f78699 | b95c8af37ccf169b0a3216b7ed691af0534e5091 | 2025-02-28T06:52:51Z | Daniele | vulkan: improve im2col (#11826) | |
| 267 | 7a2c913e66353362d7f28d612fd3c9d51a831eda | 08d5986290cc42d2c52739e046642b8252f97e4b | 2025-02-24T09:09:51-07:00 | Alex Brooks | llava : Add Granite Vision Support (#11794) | |
| 268 | 08d5986290cc42d2c52739e046642b8252f97e4b | 651adf4b6675339465179b81b194d98cc14704d6 | 2025-02-24T22:33:23+08:00 | Neo Zhang Jianyu | [SYCL] Optimize mul_mat for Q4_0 on Intel GPU (#12035) | |
| 269 | af7747c95ae71a5db4184947f837179e82c70b77 | a28e0d5eb18c18e6a4598286158f427269b1444e | 2025-02-23T05:39:24+08:00 | Aaron Teo | ggml-cpu: Support s390x SIMD Instruction Set (#12019) | |
| 270 | 36c258ee921dbb5c96bdc57c0872e4a9a129bef6 | f3e64859edb0d55d4223ead78672597cd1a218df | 2025-02-22T22:28:28+08:00 | Ting Lou | llava: build clip image from pixels (#11999) | |
| 271 | 5fa07c2f93c73161bf09ef0b23b5d2686f9a073e | 335eb04a91f481f37c0c9b302ee31b449b04c3e9 | 2025-02-22T12:20:17+01:00 | Johannes Gäßler | CUDA: optimize FA for GQA + large batches (#12014) | |
| 272 | 6dde1782483d6b0a1d59f5a5fbcb3119b9d34c27 | fc10c38ded84670955d4c44770f8acfb64617e15 | 2025-02-15T20:23:22+01:00 | Johannes Gäßler | scripts: fix compare-llama-bench commit hash logic (#11891) | |
| 273 | 22885105a6b034abaf1c1471ad90fb2ae96146bb | c2cd24fbfdfeacc2fc6ad03878379de104264114 | 2025-02-15T19:39:20+01:00 | Adrian Kretz | metal : optimize dequant q6_K kernel (#11892) | |
| 274 | fc1b0d0936e4dfc52a81f38e7420c7d23f6caa88 | 89daa2564f6eab33be53c6a1b39273af536d6bb3 | 2025-02-15T09:01:40+01:00 | Rémy O | vulkan: initial support for IQ1_S and IQ1_M quantizations (#11528) | |
| 275 | 38e32eb6a0cec32130b699ce9fefad6c74571953 | a4f011e8d02179f032627130f961eb77ee30401c | 2025-02-14T16:54:27+08:00 | Jinyang He | ggml: optimize some vec dot functions for LoongArch ASX (#11842) | |
| 276 | a7b8ce226071b2b0faaad0d36cc5ebd7fb074730 | 04045bb84288dc7e9e424d4e2bf7f40d259b4c6a | 2025-02-14T09:13:43+08:00 | theraininsky | llama-bench : fix unexpected global variable initialize sequence issue (#11832) | |
| 277 | 27e8a23300e30cd6ff6107ce262acf832ca60597 | e4376270d971cff7992bdb6c5412a739195b1459 | 2025-02-13T00:45:57-06:00 | Vinesh Janarthanan | sampling: add Top-nσ sampler (#11223) | |
| 278 | be3bbd62153820ff6d358c817360927f429105c4 | 31afcbee0eebbc998ab311aa314e389d60aa2127 | 2025-02-13T00:33:45+01:00 | Xuan-Son Nguyen | ggml : x2 speed for WASM by optimizing SIMD (#11453) | |
| 279 | c2a67efe38e6782c0217e1de3edc68de6951612b | b044a0fe3ca0cbef9dd041edce3ebda8c501fae4 | 2025-02-10T07:17:21+01:00 | Danny Milosavljevic | vulkan: Make Vulkan optional at runtime (#11493). (#11494) | |
| 280 | 55ac8c7791ff44aeb82bd7fe3ca2041844fc77f1 | e6e658319952f7ad269dc11275b9edddc721fc6d | 2025-02-08T21:54:50+01:00 | Xuan-Son Nguyen | server : (webui) revamp Settings dialog, add Pyodide interpreter (#11759) | |
| 281 | 2d219b389e8c8c40bce547b08c8aa7add60fde1f | 333820d7491cd31c707a340ff23b984a84e40154 | 2025-02-07T08:55:47-05:00 | Christian Fillion | vocab : ignore invalid UTF-8 input in the BPE tokenizer (#11729) | |
| 282 | 7ee953a64a40c09438b2064539becdbc577cefd0 | ec3bc8270bc67b58955748d40a3e558a05b2d8f2 | 2025-02-07T04:33:27-05:00 | Christian Fillion | llama : add llama_sampler_init for safe usage of llama_sampler_free (#11727) | |
| 283 | 225bbbfa39930cda38a2e5d1f3e5b38226732009 | 855cd0734aca26c86cc23d94aefd34f934464ac9 | 2025-02-07T15:38:31+08:00 | Jinyang He | ggml : optimize and build warning fix for LoongArch (#11709) | |
| 284 | 2fb3c32a1634488a5265d1304ab37628eeb5480d | 9ab42dc722ad19a12af80f38a06474d498f96da3 | 2025-02-06T17:32:29+01:00 | Xuan-Son Nguyen | server : (webui) migrate project to ReactJS with typescript (#11688) | |
| 285 | 2c6c8df56d8a3edd657b9a295e95d469a37f0044 | 8a7e3bf17aa5a8412854787746c92a28623a8925 | 2025-02-06T00:15:30-06:00 | Jeff Bolz | vulkan: optimize coopmat2 iq2/iq3 callbacks (#11521) | |
| 286 | 84ec8a58f7b6aad6887bbfbd1321f3ff417341a5 | bfcce4d693617ec843d0b2510f6ee16e6bc6720d | 2025-02-02T16:14:48+01:00 | Eric Curtin | Name colors (#11573) | |
| 287 | ff227703d6d6e1888bdc7af6138514092ffcdb96 | 0cec062a638700495673f5494d200b74340538be | 2025-02-01T23:55:32-08:00 | Michał Moskal | sampling : support for llguidance grammars (#10224) | |
| 288 | 66ee4f297cff3c7ce98b31dbc0ce909d41b9e408 | e51c47b401f8cb5f21630a05171e2529cde4d186 | 2025-01-29T18:29:39+01:00 | Rémy Oudompheng | vulkan: implement initial support for IQ2 and IQ3 quantizations (#11360) | |
| 289 | be5ef7963fcf14a9c77c963fdd3f7b606eacb498 | cae9fb4361138b937464524eed907328731b81f6 | 2025-01-28T23:06:32+01:00 | uvos | HIP: Supress transformation warning in softmax.cu | |
| 290 | cae9fb4361138b937464524eed907328731b81f6 | 7fee2889e6565830631fbe76d47ef85cf8fd946a | 2025-01-28T07:42:20-08:00 | Nikita Sarychev | HIP: Only call rocblas_initialize on rocblas versions with the multiple instantation bug (#11080) | |
| 291 | f643120bad8ab3a753daa64aaac8288ee5800e06 | 6e84b0ab8e10b8f6f99a32855f976ebcd35b0353 | 2025-01-28T11:42:32+01:00 | Nuno | docker: add perplexity and bench commands to full image (#11438) | |
| 292 | a5203b4465c5c87813936bde98170e25bb09024f | df984e014714cba4c99ef894b20b51cbcef31b16 | 2025-01-27T17:42:09+04:00 | lexasub | llama : minor fixes for up llama load model speed (#11448) | |
| 293 | 4a75d19376f2f00dbae6c266eb9c4f3001872b52 | 26771a1491f3a4c3d5b99c4c267b81aca9a7dfa0 | 2025-01-25T15:29:57-06:00 | Jeff Bolz | vulkan: compile shaders on-demand (#11406) | |
| 294 | 58456616408c828a1ce6d2481940fd1c97bce3b5 | f211d1dc10332b7e89a4abd1041903fa63bfed27 | 2025-01-23T13:56:05+01:00 | Xuan Son Nguyen | server : add more clean up when cancel_tasks is called (#11340) | |
| 295 | 92bc493917d43b83e592349e138b54c90b1c3ea7 | b9daaffe02d6a77d85f0420bce5dfe0e00daeff6 | 2025-01-19T20:22:30+02:00 | Georgi Gerganov | tests : increase timeout when sanitizers are enabled (#11300) | |
| 296 | 44e18ef93995f3040660750b527e5becf85899d0 | 3edfa7d3753c29e44b964c0ff424d2ea8d5fdee6 | 2025-01-18T02:26:50-06:00 | Jeff Bolz | vulkan: fix coopmat2 flash attention for non-contiguous inputs (#11281) | |
| 297 | 466300fe1416de2802b710215817db28d4496f41 | 206bc53422521a67de5e2caba661e21d590d2bae | 2025-01-16T15:23:49-06:00 | Jeff Bolz | vulkan: optimize coopmat2 q4_k/q5_k dequant functions. (#11206) | |
| 298 | 206bc53422521a67de5e2caba661e21d590d2bae | 4dbc8b9cb71876e005724f4e8f73a3544646bcf5 | 2025-01-16T15:16:39-06:00 | Jeff Bolz | vulkan: optimize coopmat2 q2_k dequant function (#11130) | |
| 299 | adc5dd92e8aea98f5e7ac84f6e1bc15de35130b5 | f11cfdfd7fe29436fce512d934c2ff6b94bd89d2 | 2025-01-15T19:50:13Z | Eve | vulkan: scale caching for k quants + misc fixes (#11081) | |
| 300 | 39509fb082895d1eae2486f8ad2cbf0e905346c4 | a29f0870d4846f52eda14ae28cea612ab66d903c | 2025-01-13T16:45:53+01:00 | Andreas Kieslinger | cuda : CUDA Graph Compute Function Refactor (precursor for performance improvements) (#11042) | |
| 301 | afa8a9ec9b520137bbd1ca6838cda93ee39baf20 | c05e8c9934f94fde49bc1bc9dc51eed282605150 | 2025-01-12T11:32:42+02:00 | Georgi Gerganov | llama : add `llama_vocab`, functions -> methods, naming (#11110) | |
| 302 | 8cef75c743ba13ebbd6d380c531200c768a8b8aa | 0d52a69e4bf0d6181beec7853307bdcdeec9905b | 2025-01-08T16:24:19+05:30 | amritahs-ibm | llamafile : ppc64le MMA INT8 implementation (#10912) | |
| 303 | 02f04301417e7fb44fa1025bc1b0aef866e2ca89 | bec2183f2c8d37cf1278c11d1adb9311e9eaa242 | 2025-01-08T09:18:13+01:00 | Mathieu Baudier | Disable GL_KHR_cooperative_matrix Vulkan extension if not available. (#11117) | |
| 304 | 2f0ee84b9b02d2a98742308026f060ebdc2423f1 | 0da5d860266c6928b8c9408efbd264ae59fedda6 | 2025-01-02T18:06:12+01:00 | Pierrick Hymbert | server: bench: minor fixes (#10765) | |
| 305 | 716bd6dec3e044e5c325386b5b0483392b24cefe | c250ecb3157f3bae0a45f44c3c953b5414d4c2f7 | 2024-12-30T11:27:11-06:00 | Jeff Bolz | vulkan: optimize mul_mat for small values of N (#10991) | |
| 306 | a813badbbdf0d38705f249df7a0c99af5cdee678 | fdd21889123bec62b1db3b2fc22b5a4abab32174 | 2024-12-29T03:16:34-06:00 | Jeff Bolz | vulkan: im2col and matmul optimizations for stable diffusion (#10942) | |
| 307 | 2cd43f4900ba0e34124fdcbf02a7f9df25a10a3d | 09fe2e76137dde850b13313f720e7ffa17efdefa | 2024-12-24T18:54:49+01:00 | Djip007 | ggml : more perfo with llamafile tinyblas on x86_64 (#10714) | |
| 308 | 7024d59e6a572730626cb11896829d115043a1b1 | 7c0e28585843b366864b43b48f92425e2ea17df6 | 2024-12-22T16:20:11-08:00 | yuri@FreeBSD | ggml : fix run-time on FreeBSD in get_executable_path() (#10948) | |
| 309 | a91a41364b25705dbb81ae996bc35c3440c63b35 | e34c5af43f941f0ddb92466776339897295aca11 | 2024-12-21T01:04:45-06:00 | Jeff Bolz | vulkan: optimize coopmat2 dequant functions (#10855) | |
| 310 | 644fd71b44c4cdbfc6482fbf0353d289c3bc29e6 | 4ddd199f6f6b980e0a7ed9f9b44efeae2fbdf5c4 | 2024-12-16T12:31:14+02:00 | Georgi Gerganov | sampling : refactor + optimize penalties sampler (#10803) | |
| 311 | e52aba537a34d51a65cddec6bc6dafc9031edc63 | ba1cb19cdd0d92e012e0f6e009e0620f854b6afd | 2024-12-14T18:17:36Z | Evgeny Kurnevsky | nix: allow to override rocm gpu targets (#10794) | |
| 312 | 64ae0655114f84f11a724bc6878c6f8f4a55560b | 83ed24a97b500ccdb32b90b94e6f9621ad8db79e | 2024-12-13T08:42:04Z | Eve | vulkan: small mul_mat_vec optimizations (#10665) | |
| 313 | 235f6e14bf0ed0211c51aeff14139038ae1000aa | 1a31d0dc00ba946d448e16ecc915ce5e8355994e | 2024-12-11T20:52:14+01:00 | Xuan Son Nguyen | server : (UI) add tok/s, get rid of completion.js (#10786) | |
| 314 | 19d8762ab61df8286367588a80b9c7db4cb568db | c2a16c0bdbe2e51adf318918bad82f0c3e3d6f3b | 2024-12-07T13:37:50+01:00 | Djip007 | ggml : refactor online repacking (#10446) | |
| 315 | 3df784b3050f657ea681f804187ce5bddb433e88 | 86a1934978ce5daffc7e5b4251f6540ee5e7b47b | 2024-12-07T10:24:15+01:00 | 0cc4m | Vulkan: VK_KHR_cooperative_matrix support to speed up prompt processing (#10597) | |
| 316 | 40c6d79fb52f995f47507fedfeaae2ac05d9b35c | 98036d5670f21e9b9a99d5e3dbb3bf7589f5c4e3 | 2024-12-04T02:29:20+01:00 | Nicolò Scipione | SYCL : Move to compile time oneMKL interface backend selection for NVIDIA backend (#10584) | |
| 317 | cc98896db858df7aa40d0e16a505883ef196a482 | 91c36c269bca75b2d08119c653512cd20b4ea2ba | 2024-12-03T13:29:54-06:00 | Jeff Bolz | vulkan: optimize and reenable split_k (#10637) | |
| 318 | efb6ae963031709fc331e6e48cc4606ac8f9c3a7 | 667d70d1704dfa6977505f5d01d4638669b90dce | 2024-12-02T19:27:24+01:00 | PAB | feat: add `GGML_UNARY_OP_ARGMAX` Metal kernel (ggml/1019) | |
| 319 | 938f6087421889a3af7d0786c64406ced2be81b8 | f095a649ec390e04dfab1b04e646ae8549dafaef | 2024-11-29T14:46:55+08:00 | Chenguang Li | CANN: RoPE operator optimization (#10563) | |
| 320 | f095a649ec390e04dfab1b04e646ae8549dafaef | 678d7994f4da0af3d29046be99950ac999ee9762 | 2024-11-29T00:18:02-06:00 | Jeff Bolz | vulkan: get the first command buffer submitted sooner (#10499) | |
| 321 | c202cef1686182a78f8f4e253ab8d0c0ffe2fcc8 | 2025fa67e94358deda4740a74fe9803916cb2f60 | 2024-11-28T20:52:03+08:00 | Shupei Fan | ggml-cpu: support IQ4_NL_4_4 by runtime repack (#10541) | |
| 322 | b7420131bf8ab3e067bc660439ab1ab18be7edbd | 9f912511bc9414fa7a3c521378b6388cd932b58d | 2024-11-28T14:24:46+08:00 | Chenguang Li | CANN: ROPE operator optimization (#10540) | |
| 323 | 3ad5451f3b75809e3033e4e577b9f60bcaf6676a | 46c69e0e752ff16206347bb12f96ed69f4a01abf | 2024-11-27T17:10:08+01:00 | uvos | Add some minimal optimizations for CDNA (#10498) | |
| 324 | 46c69e0e752ff16206347bb12f96ed69f4a01abf | 9e2301f4a4ef1690bd99360c11de43fe830b1c8d | 2024-11-27T11:03:25+01:00 | Diego Devesa | ci : faster CUDA toolkit installation method and use ccache (#10537) | |
| 325 | 249a7902ec710c8d027b9cc0ed10219d2b4184f8 | 71a64989a5d2e25c13507efada145f12cf358914 | 2024-11-27T01:21:59-06:00 | Jeff Bolz | vulkan: further optimize q5_k mul_mat_vec (#10479) | |
| 326 | 4a57d362e1948ada50af997a92c3cbff9711e78b | c9b00a70b080d5c0668608024afc3e0e2fed822f | 2024-11-27T01:00:50-06:00 | Jeff Bolz | vulkan: optimize Q2_K and Q3_K mul_mat_vec (#10459) | |
| 327 | 9a4b79bcfa4338b922fa8cf903bd5ac058aaf46f | 7066b4cce2898993e943ad6af5d8f1de5840c8e9 | 2024-11-26T18:08:37+08:00 | Shanshan Shen | CANN: Improve the Inferencing Performance for Ascend NPU Device (#10454) | |
| 328 | 7066b4cce2898993e943ad6af5d8f1de5840c8e9 | 0eb4e12beebabae46d37b78742f4c5d4dbe52dc1 | 2024-11-26T17:31:05+08:00 | Chenguang Li | CANN: RoPE and CANCAT operator optimization (#10488) | |
| 329 | 6dfcfef0787e9902df29f510b63621f60a09a50b | 599b3e0cd40432cd1975a8906f3db70bbe53b627 | 2024-11-22T17:44:08+08:00 | 蕭澧邦 | ci: Update oneAPI runtime dll packaging (#10428) | |
| 330 | a5e47592b6171ae21f3eaa1aba6fb2b707875063 | 1bb30bf28cb5a7adf111bc41c935bdaf128397e7 | 2024-11-21T18:18:50+01:00 | Diego Devesa | cuda : optimize argmax (#10441) | |
| 331 | 1bacb9f62514b520bdf74ed6feb46c80508dad38 | ad21c9e1f14d82b8c15ae369a8839019e3d498b4 | 2024-11-20T01:11:00-06:00 | Jeff Bolz | vulkan: further optimize mul_mat_vec using larger loads (#10387) | |
| 332 | 2a1507c1629975d9d20a503d6a14f44eff292c25 | b3e585988fc65d3a8083c6d94dfc0629f9ce226d | 2024-11-19T09:02:23+01:00 | Romain Biessy | sycl : Add option to set the SYCL architecture for all targets (#10266) | |
| 333 | b3e585988fc65d3a8083c6d94dfc0629f9ce226d | 557924f22237c76387a39c4db5abae154d57e754 | 2024-11-19T01:25:17-06:00 | Jeff Bolz | vulkan: Optimize soft_max (#10301) | |
| 334 | cf32a9b93ad859ea592c31785b6bd3b4b2121463 | a43178299c2f74f14bcfc659bfd9fd32d931d1f4 | 2024-11-17T11:23:01+02:00 | Georgi Gerganov | metal : refactor kernel args into structs (#10238) | |
| 335 | 8a43e940ab0daaff198809bf9277289994ec62f5 | 5c9a8b22b10132db620529435e3cfa49304b65cc | 2024-11-16T22:17:59+02:00 | Johannes Gäßler | ggml: new optimization interface (ggml/988) | |
| 336 | f245cc28d4eb900efad0bc740145f58d713c6e4f | 772703c8fffdd83d2e28f60119e83525f1189412 | 2024-11-16T10:32:50+02:00 | Georgi Gerganov | scripts : fix missing key in compare-llama-bench.py (#10332) | |
| 337 | 772703c8fffdd83d2e28f60119e83525f1189412 | dd3a6ce9f84d21ba05fe98af9f983bdea0398e6c | 2024-11-16T00:26:57-06:00 | Jeff Bolz | vulkan: Optimize some mat-vec mul quant shaders (#10296) | |
| 338 | 1e58ee1318429a3e97aa66f3034cdfd65ffc6c34 | 89e4caaaf081f4712af61a3e08cb67b406c02b80 | 2024-11-16T01:53:37+01:00 | Dan Johansson | ggml : optimize Q4_0 into Q4_0_X_Y repack (#10324) | |
| 339 | 4047be74da398acb8717a4d21b77b929ad7ed4f7 | 883d206fbd2c5b2b9b589a9328503b9005e146c9 | 2024-11-15T21:19:03+01:00 | Johannes Gäßler | scripts: update compare-llama-bench.py (#10319) | |
| 340 | 18429220bdb344da1bc7df9bc580c7b41b3cd57b | f0204a0ec70d50ca60e07bc0096ec1d6508ab0c7 | 2024-11-15T11:47:58Z | Eve | AVX BF16 and single scale quant optimizations (#10212) | |
| 341 | 5a54af4d4f588f109f31e456483fdf77096399d9 | 1607a5e5b08f4e55f118af3d7de325949d8f1835 | 2024-11-15T04:09:12+01:00 | Romain Biessy | sycl: Use syclcompat::dp4a (#10267) | |
| 342 | af148c9386da825a60c7038549c121c35ca56b50 | 66798e42fbe636f1cb6236e4bc30939d23ef7c25 | 2024-11-13T23:22:55-06:00 | Jeff Bolz | vulkan: Optimize binary ops (#10270) | |
| 343 | 2e82ffa4af29f87e7d3d6dff8060a2a79613b72f | 80dd7ff22fd050fed58b552cc8001aaf968b7ebf | 2024-11-13T09:40:57Z | Alberto Cabrera Pérez | sycl : Fixes to broken builds and test-backend-ops (#10257) | |
| 344 | 80dd7ff22fd050fed58b552cc8001aaf968b7ebf | 54ef9cfc726a799e6f454ac22c4815d037716eda | 2024-11-13T00:58:57-06:00 | Jeff Bolz | vulkan: Optimize contiguous copies (#10254) | |
| 345 | e89213492d3e01705739789733f0f2d250b4c449 | 8fc393f246c550d2481e53323a47644a94e8d01f | 2024-11-09T12:47:50+05:30 | amritahs-ibm | ggml : optimize llamafile cpu matrix multiplication for ppc64le (#10156) | |
| 346 | 841f27abdbbcecc9daac14dc540ba6202e4ffe40 | d05b3127bd30515955aa4ee2bacdb68ebafe88f4 | 2024-11-08T13:47:22+02:00 | Georgi Gerganov | metal : optimize FA kernels (#10171) | |
| 347 | 3bcd40b3c593d14261fb2abfabad3c0fb5b9e318 | 5c333e014059122245c318e7ed4ec27d1085573c | 2024-11-07T18:19:10+11:00 | Zhiyuan Li | Optimize RWKV6 Operator Naming and Implement Multi-core CPU/ SYCL Acceleration (#10133) | |
| 348 | 340736477651095a98a3b10e19b038ec62593a1d | d5a409e57fe8bd24fef597ab8a31110d390a6392 | 2024-11-04T22:06:31Z | Eve | Q6_K AVX improvements (#10118) | |
| 349 | fc83a9e58479e4dd70054daa7afe5184c1bbe545 | c5b0f4b5d90297f3e729fca7f78ddb25fcab5ddc | 2024-10-30T15:00:40+08:00 | xctan | ggml : add Q4_0_8_8 RISC-V GEMV and GEMM kernels (#10029) | |
| 350 | 8f275a7c4593aa34147595a90282cf950a853690 | 8d8ff715367480b856ad86ac3888e9742b13a6fa | 2024-10-29T17:52:56+09:00 | Changyeon Kim | ggml: Add POOL2D OP for GPU acceleration to the Vulkan backend in the MobileVLM model. (#9763) | |
| 351 | 2d3aba9ee8da9c026d54e8a912a1d64f56809be3 | 80273a306d07ed95059d6130389deacb3b2d7196 | 2024-10-23T17:16:56+03:00 | Georgi Gerganov | llama.vim : bump generation time limit to 3s [no ci] | |
| 352 | 4c9388fb96ac2415fbb1239b7ba8346616606e2e | 873279b1592e433c4d9eb5065091cc98473c7bee | 2024-10-23T19:33:45+09:00 | Jun Hee Yoo | metal : add POOL2D and fix IM2COL (#9943) | |
| 353 | cda0e4b648dde8fac162b3430b14a99597d3d74f | afd9909a6481402844aecefa8a8908afdd7f52f1 | 2024-10-18T23:18:01+02:00 | Xuan Son Nguyen | llama : remove all_pos_0, all_pos_1, all_seq_id from llama_batch (#9745) | |
| 354 | 13dca2a54a394757d56fdd652b9f0df08f44ea22 | d4c19c0f5cdb1e512573e8c86c79e8d0238c73c4 | 2024-10-14T01:49:08+01:00 | agray3 | Vectorize load instructions in dmmv f16 CUDA kernel (#9816) | |
| 355 | edc265661cd707327297b6ec4d83423c43cb50a5 | 1bde94dd024b632f98428f4bf2ce483295130779 | 2024-10-12T16:14:27+03:00 | Georgi Gerganov | server : add option to time limit the generation phase (#9865) | |
| 356 | a39ab216aa624308fda7fa84439c6b61dc98b87a | f536f4c4391bec74c432a924625c04e8c484d3ee | 2024-10-02T15:49:55+02:00 | Xuan Son Nguyen | llama : reduce compile time and binary size (#9712) | |
| 357 | 76b37d1541a880b9645557c8715a343fd074cc5c | 148844fe97fff4c1563a3111bf238ba4dd22ef56 | 2024-10-02T15:21:57+08:00 | Zhenwei Jin | gguf-split : improve --split and --merge logic (#9619) | |
| 358 | 148844fe97fff4c1563a3111bf238ba4dd22ef56 | 3f1ae2e32cde00c39b96be6d01c2997c29bae555 | 2024-10-02T10:14:44+03:00 | Georgi Gerganov | examples : remove benchmark (#9704) | |
| 359 | cb00020504416606601f8cb35f55ee07b710b4b7 | 6c5322481a75f1be54e58a000c3f78484d07f948 | 2024-09-30T09:14:09+02:00 | Salvatore Mesoraca | vulkan : mul_mat: fix UB with small warps (ggml/952) | |
| 360 | 1b2f992cd2cff0b69e5abe78bb8888d51ed19d67 | 739842703e32cd43443c45e0b4f6647cc4e6b3d6 | 2024-09-28T14:32:46+02:00 | slaren | test-backend-ops : use flops for some performance tests (#9657) | |
| 361 | 6a0f7794847244fb3b99a983e03137d7e832b585 | 89f9944981010d195e411a9fbfbb19959412f710 | 2024-09-28T14:06:16+02:00 | Dan Johansson | ggml : add run-time detection of neon, i8mm and sve (#9331) | |
| 362 | 1e436302188a704ac9ea044af03193648806f19c | afbbfaa537a96f562c34df4542930fa951b40d9e | 2024-09-25T15:12:20+02:00 | Charles Xu | ggml : remove assert for AArch64 GEMV and GEMM Q4 kernels (#9217) | |
| 363 | 904837e0cb2f5f01bf5d5901b7aa57a026860ae4 | 70392f1f81470607ba3afef04aa56c9f65587664 | 2024-09-25T11:30:38+08:00 | Dou Xinpeng | cann: fix crash when llama-bench is running on multiple cann devices (#9627) | |
| 364 | f0c7b5edf82aa200656fd88c11ae3a805d7130bf | 1d48e98e4f3316bd2f6b187d288c7b6cb88d5cb3 | 2024-09-23T11:42:43-07:00 | Max Krasnyansky | threads: improve ggml_barrier scaling with large number of threads (#9598) | |
| 365 | 424c5d00a9b97dd5559635872db9b57f87c23b02 | a6809c6a2e8163cba296d4cc0c5cd4bbc8073638 | 2024-09-20T19:04:44+03:00 | Johannes Gäßler | ggml/examples: add backend support for numerical optimization (ggml/949) | |
| 366 | 7be099fa817e9c53ffb4c3ed7d063e1cffcd675a | 8b836ae731bbb2c5640bc47df5b0a78ffcb129cb | 2024-09-17T22:41:38+02:00 | Michael Podvitskiy | llama-bench: correct argument parsing error message (#9524) | |
| 367 | acb2c32c336ce60d765bb189563cc216e57e9fc2 | a6a3a5c531c73aef85750a847d21e7d4671e723d | 2024-09-16T13:07:13+02:00 | Daniel Bevenius | llama : rename n_embed to n_embd in rwkv6_time_mix (#9504) | |
| 368 | 5c3d0f1824714e9a97fc9b06e046eefcb6ecc721 | 0aadac10c7dd704f8285ddf5a63d6f764cb340aa | 2024-09-16T06:48:24Z | Eve | ggml : IQ4_NL sgemm + Q4_0 AVX optimization (#9422) | |
| 369 | 0abc6a2c25272d5cf01384dda8ee8bfec4ba8745 | bd35cb0ae357185c173345f10dc89a4ff925fc25 | 2024-09-13T09:53:38+03:00 | Georgi Gerganov | llama : llama_perf + option to disable timings during decode (#9355) | |
| 370 | d2b496bff4f353a6429f8e833448f071bd237ba7 | b34e02348064c2f0cef1f89b44d9bee4eb15b9e7 | 2024-09-11T10:03:54+03:00 | Georgi Gerganov | batched-bench : remove unused code (#9305) | |
| 371 | 0b4ac75772b744bb0a0d674927587621d1057884 | fb3f2498156b3140e2050ec9c7bf61372f63ff56 | 2024-09-10T15:02:30+08:00 | Molly Sophia | RWKV v6: Add time_mix_decay_w1/w2 in quant exclusion list (#9387) | |
| 372 | b2e89a327457179a34eae4d7de0d412ed945679c | daa9623ab051a8162ae750b150b9522571b55f21 | 2024-09-09T09:02:45+02:00 | Dan Johansson | Arm AArch64: Documentation updates (#9321) | |
| 373 | 1b9ae5189cd279c6b45e36d43e4f9ccae628d02f | e32d0816edfd247784f6780b0bb9ae0bceef5e47 | 2024-09-07T20:43:51+02:00 | Xuan Son Nguyen | common : refactor arg parser (#9308) | |
| 374 | df270ef74596da8f1178f08991f4c51f18c9ee82 | 947538acb8617756a092042ff7e58db18dde05ec | 2024-09-07T15:16:19+03:00 | Georgi Gerganov | llama : refactor sampling v2 (#9294) | |
| 375 | 134bc38ecf3e2c5460581badce289a1ffa680453 | 815b1fb20a53e439882171757825bacb1350de04 | 2024-09-07T00:03:01+03:00 | Aarni Koskela | llama-bench : log benchmark progress (#9287) | |
| 376 | 815b1fb20a53e439882171757825bacb1350de04 | 409dc4f8bb5185786087f52259ee4626be93f54d | 2024-09-06T18:59:58+03:00 | Aarni Koskela | batched-bench : add `--output-format jsonl` option (#9293) | |
| 377 | 9bc6db28d011d47a5f318dc4aebbe7927fac4629 | 32b2ec88bc44b086f3807c739daf28a1613abde1 | 2024-09-05T21:48:47-04:00 | compilade | ggml-quants : ternary packing for TriLMs and BitNet b1.58 (#8151) | |
| 378 | bdf314f38a2c90e18285f7d7067e8d736a14000a | 581c305186a0ff93f360346c57e21fe16e967bb7 | 2024-09-05T02:19:39+02:00 | slaren | llama-bench : fix NUL terminators in CPU name (#9313) | |
| 379 | 8962422b1c6f9b8b15f5aeaea42600bcc2d44177 | b69a480af4db8ffd6cbb2efe7ed8132bc7d39073 | 2024-09-03T20:58:54+03:00 | Aarni Koskela | llama-bench : add JSONL (NDJSON) output mode (#9288) | |
| 380 | 48baa61eccdca9205daf8d620ba28055c2347b64 | f1485161e58d562099dd050f8ac3a9ea9f4cd765 | 2024-09-02T22:08:38+02:00 | Xuan Son Nguyen | server : test script : add timeout for all requests (#9282) | |
| 381 | 8f1d81a0b6f50b9bad72db0b6fcd299ad9ecd48c | a47667cff41f5a198eb791974e0afcc1cddd3229 | 2024-09-01T22:38:17+08:00 | Molly Sophia | llama : support RWKV v6 models (#8980) | |
| 382 | ea5d7478b1edcfc83f8ea8f9f0934585cc0b92e3 | 49271efbaf3f7a4ae52c4ca299b6d4e82598a97d | 2024-08-31T13:50:35+05:30 | Srihari-mcw | sgemm : improved Q4_0 and Q8_0 performance via 4xN and Mx4 gemm (#8908) | |
| 383 | 42c76d1358021ccdbe8ba89109c143dd7ae166df | 9f7d4bcf5c27d37b0c7da82eeaf9c1499510554b | 2024-08-29T19:20:53-04:00 | Faisal Zaghloul | Threadpool: take 2 (#8672) | |
| 384 | f12ceaca0c7b59def30b7a832a6904df7ed3f4f7 | 436787f170329b3f549e6c2c46593d2af8482e7c | 2024-08-26T11:03:30+02:00 | slaren | ggml-ci : try to improve build time (#9160) | |
| 385 | 436787f170329b3f549e6c2c46593d2af8482e7c | 93bc3839f980ff14be86efe408b4cd7e89b26835 | 2024-08-25T23:09:53-07:00 | Justine Tunney | llama : fix time complexity of string replacement (#9163) | |
| 386 | 2f3c1466ff46a2413b0e363a5005c46538186ee6 | 50addec9a532a6518146ab837a85504850627316 | 2024-08-21T04:00:00+09:00 | Changyeon Kim | llava: Add ACC OP for GPU acceleration to the Vulkan backend in the LLAVA CLIP model. (#8984) | |
| 387 | d5492f0525fa533817a67e93a4bde9d71d81cf58 | 234b30676a97ce227b604c38beb9dcaca406dea9 | 2024-08-15T10:11:11+03:00 | Georgi Gerganov | ci : disable bench workflow (#9010) | |
| 388 | 5fd89a70ead34d1a17015ddecad05aaa2490ca46 | 98a532d474c73d3494a5353024cb6a4fbbabbb35 | 2024-08-14T18:32:53+02:00 | 0cc4m | Vulkan Optimizations and Fixes (#8959) | |
| 389 | 7c5bfd57f83fd3630934cfa70892aa4022d3faf7 | 6e02327e8b7837358e0406bf90a4632e18e27846 | 2024-08-11T10:09:09+02:00 | Markus Tavenrath | Optimize Vulkan backend for better CPU performance and less GPU synchronization overhead. (#8943) | |
| 390 | 506122d854c5d05b4a3d45a294f14bd4c02d9868 | 725e3d94379d5b619c027347308bccf2e0ead89f | 2024-08-07T09:01:06+08:00 | Zhenwei Jin | llama-bench : add support for getting cpu info on Windows (#8824) | |
| 391 | bc0f887e159c0d78c28121e2c8b5c58094170875 | b42978e7e4d56eaaa93588414e804d9fbbc3cae2 | 2024-08-05T21:10:37+08:00 | wangshuai09 | cann: fix buffer_num and runtime speed slowly error (#8865) | |
| 392 | a3738b2fa7c60ef2c4592435d1aa7fb8f1f69c3e | 655858ace0cf2720e56eb01f84ad05e0c94ada3c | 2024-08-04T17:28:08+02:00 | 0cc4m | vulkan : implement Stable Diffusion operators (ggml/904) | |
| 393 | 0d6fb52be0c1b7e77eb855f3adc4952771c8ce4c | 978ba3d83d17b10fdf9807006048432b5b3769fc | 2024-08-04T14:17:16-04:00 | Brandon Squizzato | Install curl in runtime layer (#8693) | |
| 394 | ecf6b7f23e664afd7ff856ec39034240ce438daa | 01aae2b4975b57a265ce8194928fd87f2d71027e | 2024-08-04T03:55:03-07:00 | Brian Cunnie | batched-bench : handle empty `-npl` (#8839) | |
| 395 | 76614f352e94d25659306d9e97321f204e5de0d3 | b72c20b85c1029d135022d39e9a20d4807c11893 | 2024-08-04T01:34:41+09:00 | jdomke | ggml : reading the runtime sve config of the cpu (#8709) | |
| 396 | ed9d2854c9de4ae1f448334294e61167b04bec2a | 398ede5efeb07b9adf9fbda7ea63f630d476a792 | 2024-07-31T15:51:06-04:00 | Clint Herron | Build: Fix potential race condition (#8781) | |
| 397 | 268c5660062270a2c19a36fc655168aa287aaec2 | 7e72aa74fd676a093eb9970e761085ec22734c71 | 2024-07-30T23:35:30+03:00 | Someone | nix: cuda: rely on propagatedBuildInputs (#8772) | |
| 398 | c887d8b01726b11ea03dbcaa9d44fa74422d0076 | 75af08c475e285888f66556d0f459c533b7deb95 | 2024-07-30T14:56:51+08:00 | zhentaoyu | [SYCL] Add `TIMESTEP_EMBEDDING` OP (#8707) | |
| 399 | a05ca9369716a8319014cd1fc365980d43f8aae9 | 9f77d899b7b0d56496f679e54b797da6199fed8e | 2024-07-25T00:54:08-07:00 | Mahesh Madhav | ggml : loop tiling optimizations for scalar path (ggml/898) | |
| 400 | b5e95468b1676e1e5c9d80d1eeeb26f542a38f42 | 92090eca212650727e38b335c1d4accfbcc9b79c | 2024-07-27T05:03:45-07:00 | Jeffrey Morgan | llama : add support for llama 3.1 rope scaling factors (#8676) | |
| 401 | 46e47417aa4f18c08738afd4d9a3e838e97ca03f | e7e6487ba06634edf58dfdf9673bad9df41b445a | 2024-07-23T10:50:40+02:00 | Jeroen Mostert | Allow all RDNA2 archs to use sdot4 intrinsic (#8629) | |
| 402 | 566daa5a5b38018b2727950bbd280239adb981b6 | 6f11a83e4e7700fdf353ed4a29599cb662c792f6 | 2024-07-22T15:44:53+02:00 | Jiří Podivín | *.py: Stylistic adjustments for python (#8233) | |
| 403 | 22f281aa16f44d8f6ec2c180a0685ff27e04e714 | 328884f4219c0228673cf1870ac63987fb4f9fd0 | 2024-07-20T22:09:17-04:00 | M-A | examples : Rewrite pydantic_models_to_grammar_examples.py (#8493) | |
| 404 | 7acfd4e8d55082c1b597dfc3ffe04fb5d530c6dc | 97bdd26eee11fe109dec00de75690ceef61c03f2 | 2024-07-15T23:13:10-04:00 | compilade | convert_hf : faster lazy safetensors (#8482) | |
| 405 | 808aba39161e5d7ca2ff24110b5aa14d2e536988 | a977c115448e40856fb9cbe3ceb6d8ce802553b0 | 2024-07-11T16:47:47+02:00 | Johannes Gäßler | CUDA: optimize and refactor MMQ (#8416) | |
| 406 | dd07a123b79f9bd9e8a4ba0447427b3083e9347a | f4444d992c16b6b9442f4770c7c3a10b19a08343 | 2024-07-10T12:35:18-04:00 | Clint Herron | Name Migration: Build the deprecation-warning 'main' binary every time (#8404) | |
| 407 | 0f1a39f3439825acf7e3a1663566d410be152170 | 83321c6958acf20747d288031174cc1bf8816e33 | 2024-07-10T07:14:51-05:00 | Dibakar Gope | ggml : add AArch64 optimized GEMV and GEMM Q4 kernels (#5780) | |
| 408 | fd560fe680c72fd0a0af2bc8881add20ad919071 | e500d6135ac42c4a23baf6a9a1a934dc023e5c7d | 2024-07-09T11:58:44-07:00 | Andy Salerno | Update README.md to fix broken link to docs (#8399) | |
| 409 | e500d6135ac42c4a23baf6a9a1a934dc023e5c7d | a03e8dd99d3954e7547137936c5a2a3b348bdb7f | 2024-07-09T11:54:43-04:00 | Clint Herron | Deprecation warning to assist with migration to new binary names (#8283) | |
| 410 | 470939d483d1c89b7292f78bac1fd27c42c171ce | 6f0dbf6ab087bcd286fb78560099ca0458316735 | 2024-07-08T03:26:53-04:00 | Kevin Wang | common : preallocate sampling token data vector (#8363) | |
| 411 | 3fd62a6b1c9ca7b7c0093e984cc9c133c6f2726d | a8db2a9ce64cd4417f6a312ab61858f17f0f8584 | 2024-07-07T15:04:39-04:00 | compilade | py : type-check all Python scripts with Pyright (#8341) | |
| 412 | 905942abdba5ba0b28a1b0805e51e4f818c54bc9 | b5040086d436e7345e4fa33a5b9558060c75603f | 2024-07-07T20:52:10+08:00 | toyer | llama : support glm3 and glm4 (#8031) | |
| 413 | 0a423800ffe4e5da3d83527ef3473da88cd78146 | d12f781074b92589a72a36ffabb583933f7b9dc0 | 2024-07-05T07:06:09Z | Daniele | CUDA: revert part of the RDNA1 optimizations (#8309) | |
| 414 | f09b7cb609d80b8031803f89255991dc8b35db69 | a38b884c6c4b0c256583acfaaabdf556c62fabea | 2024-07-05T10:32:29+08:00 | Neo Zhang Jianyu | rm get_work_group_size() by local cache for performance (#8286) | |
| 415 | d23287f122c34ebef368742116d53a0ccb2041ee | 5f2d4e60e202aabee10051e6615bb821e51787be | 2024-07-03T23:02:58Z | Daniele | Define and optimize RDNA1 (#8085) | |
| 416 | cb5fad4c6c2cbef92e9b8b63449e1cb7664e4846 | dae57a1ebc1c9bd5693ab999e19d77c5506ae559 | 2024-07-01T20:39:06+02:00 | Johannes Gäßler | CUDA: refactor and optimize IQ MMVQ (#8215) | |
| 417 | 9a590c82262dd518137f85406e65e452fdf2aca3 | 52fc8705a0617452df08333e1161838726c322b4 | 2024-06-24T12:41:23+02:00 | Johannes Gäßler | CUDA: optimize MMQ int8 tensor core performance (#8062) | |
| 418 | 95f57bb5d5b18ef0beb2702a0d6c06e46804075c | e112b610a1a75cb7fa8351e1a933e2e7a755a5ce | 2024-06-24T03:07:59+02:00 | slaren | ggml : remove ggml_task_type and GGML_PERF (#8017) | |
| 419 | a927b0f3dd9a86ee042cd2bdcc8c9da4a855926b | 80ea089d771f0c2d97afa8bead80ded412f600d7 | 2024-06-21T08:51:28+03:00 | Georgi Gerganov | llama : optimize long word tokenization with WPM (#8034) | |
| 420 | 61665277afde2add00c0d387acb94ed5feb95917 | b96f9afb0d58b003ac8d1d0c94cd99393a3bc437 | 2024-06-18T14:00:14+02:00 | Ulrich Drepper | Allow compiling with CUDA without CUDA runtime installed (#7989) | |
| 421 | 6a2f0b3474d479bda4ac2ee7cfd5dcdcf0be1f79 | 21be9cab94e0b5b53cb6edeeebf8c8c799baad03 | 2024-06-17T16:10:15+02:00 | Markus Tavenrath | Implement non-mapped async IO for CUDA on Windows. (#7896) | |
| 422 | b5fcf8ef5c29df53cfff60e180b4992a3b2332a6 | 398105ff4373eea385ea8e8625cb417b2ae51134 | 2024-06-16T16:53:11+08:00 | Hong Bo PENG | ggml : fix and optimize ppc64le (ggml/849) | |
| 423 | e65bbf606c61f49dc06c7ac060cd5ba7ae446025 | 6fcd1331efbfbb89c8c96eba2321bb7b4d0c40e4 | 2024-06-14T16:47:41+03:00 | Radoslav Gerganov | llama-bench : fix RPC indication (#7936) | |
| 424 | f578b86b2123d0f92afbaa98a031df4d4464e582 | 1c641e6aac5c18b964e7b32d9dbbb4bf5301d0d7 | 2024-06-13T03:11:35+02:00 | slaren | move BLAS to a separate backend (#6210) | |
| 425 | 148995e5e57b313cce2672f75610db58c6327a51 | 4bfe50f741479c1df1c377260c3ff5702586719e | 2024-06-11T14:45:40+02:00 | Johannes Gäßler | llama-bench: more compact markdown tables (#7879) | |
| 426 | 5795b941827fdec6c1662986de962badff456718 | ed9f2521185706481501a5e6d5315397b11802ff | 2024-06-08T22:47:25-04:00 | compilade | convert-hf : match model part name prefix and suffix (#7687) | |
| 427 | 55b2d0849d3ec9e45e4a4d9e480f5fa7977872a6 | f5d7b268ec4bf8628aa6ccc9f6631d0230dde76f | 2024-06-06T10:07:06+01:00 | Olivier Chafik | grammars: x{min,max} repetition operator (#6640) | |
| 428 | 1442677f92e45a475be7b4d056e3633d1d6f813b | 554c247caffed64465f372661f2826640cb10430 | 2024-06-04T21:23:39+03:00 | Georgi Gerganov | common : refactor cli arg parsing (#7675) | |
| 429 | adc9ff384121f4d550d28638a646b336d051bf42 | 987d743d6bc4cee4bde6820733ea33a2abc0afac | 2024-06-04T14:32:42+02:00 | slaren | llama-bench : allow using a different printer for stderr with -oe (#7722) | |
| 430 | 2ac95c9d5678d05e253691fb1f26471675bff5ad | 750f60c03e4d3f53fa51910551ce87a3d508d2d7 | 2024-06-01T21:50:18+05:30 | HanishKVC | SimpleChat: Simple histogram/repeatMatching driven garbageTrimming, Settings UI, Streaming mode, OpenAi Compat (Model, Authorization Bearer), Save/Restore session, Auto Settings UI (#7548) | |
| 431 | c8047d538f3addab40e3112be60bb92e70ce1a50 | 30e238b246f8002cc6eb7cb79afe242243f1f66d | 2024-05-31T16:26:21+02:00 | Johannes Gäßler | scripts: update compare_llama_bench.py [no ci] (#7673) | |
| 432 | 210d99173dc82aafb48f6e39d787c387951fe3a9 | 87bdf2a199acd62e19814d7a4d0500a04a7f09f3 | 2024-05-29T14:45:44+03:00 | Radoslav Gerganov | llama-bench : add support for the RPC backend (#7435) | |
| 433 | b9adcbbf92fc7096bee23fe61496d25652ebf765 | 9588f196b1d7b21bdff013fcf958c249576b2619 | 2024-05-26T06:26:34+05:30 | HanishKVC | SimpleChat Completion Mode flexibility and cleanup, Settings gMe, Optional sliding window (#7480) | |
| 434 | 1e374365d170b7f692fd7753c145e21bc14486c8 | 197ff91462dd05bb9a3be03578114abf0c355536 | 2024-05-22T23:23:21+05:30 | HanishKVC | SimpleChat: a simple and dumb web front end for testing /chat/completions and /completions end points and try chat (#7350) | |
| 435 | b18532a4efeca8796fea8e36195c81cbfd596a4a | fcda1128bc5f8eb7e1811708fe9d9867b9aec815 | 2024-05-22T16:10:46+02:00 | slaren | phi3 : duplicate rope factors in each layer (#7447) | |
| 436 | 65c58207ece92ad213f4bfd0f91dcb2dfb664f5b | 1cc0155d04918cb3017afa472acea51b77483c4a | 2024-05-20T15:19:21+08:00 | junchao-loongson | ggml : add loongarch lsx and lasx support (#6454) | |
| 437 | 1cc0155d04918cb3017afa472acea51b77483c4a | e932094d58f513d5996c3efc9f6fed8238894c57 | 2024-05-20T10:16:41+03:00 | Georgi Gerganov | server : tuning tests (#7388) | |
| 438 | d273c1402b25086fd91aef2467ac13f2e49fa0ea | 27b040691cbe45314147c2745e891a38e9c048d4 | 2024-05-17T15:11:45+03:00 | Aarni Koskela | py : convert-hf-to-gguf-update improvements (#7340) | |
| 439 | 934266c0e0b2aa9781fdba2deb112c161ff038a9 | 9c4fdcbec8c7fcc428e723b0d8a1cf1f351ba642 | 2024-05-17T02:58:52-04:00 | Justine Tunney | ggml : rewrite silu and softmax for cpu (#7154) | |
| 440 | 13ad16af1231ab2d245d35df3295bcfa23de1305 | 8f7080bf48828b538bc9387c3d150bbd4fb4cf2d | 2024-05-15T19:47:36-07:00 | Max Krasnyansky | Add support for properly optimized Windows ARM64 builds with LLVM and MSVC (#7191) | |
| 441 | 583fd6b000ec9ad1b465b5c98524f4a0ae388077 | 9f773486ab78d65f5cca3f7e31c862b7043bf721 | 2024-05-15T08:44:16+02:00 | Johannes Gäßler | server bench: fix bench not waiting for model load (#7284) | |
| 442 | 0d26d8ccd8caebab75af697c0275f599075fdacf | 4f0263633b40e94e8b69fd6e7e4395cfedfd5c12 | 2024-05-12T17:17:18+08:00 | Hong Bo PENG | ggml : optimize for ppc64le using VSX intrinsics (ggml/784) | |
| 443 | cbf75894d256f1861f6409565db599365de3d4b8 | 0d5cef78aeafae4d4e6d56e2d4bcda771af58cc9 | 2024-05-13T08:04:29+08:00 | Neo Zhang | [SYCL] Add oneapi runtime dll files to win release package (#7241) | |
| 444 | e849648888a11de13aaaa4cb2eda3f5a9c7b444d | 18e437665ce626dddbd79119aa7498493e7cb13b | 2024-05-10T18:03:54+02:00 | slaren | llama-bench : add pp+tg test type (#7199) | |
| 445 | fd9f92b154850014146f61717cd292a59a5cee5a | 22842164bcae3251b81ad9e497a16ef66833cb9e | 2024-05-09T13:03:29+02:00 | Daniel Bevenius | llama : update llama_timings.n_p_eval setting (#7160) | |
| 446 | bc4bba364fb96d908f2698e908648df5e6f55e02 | c12452c7aec8a02264afc00196a13caa591a13ac | 2024-05-08T21:55:49+01:00 | agray3 | Introduction of CUDA Graphs to LLama.cpp (#6766) | |
| 447 | acdce3cdef6fc2f0b7b5623231fd7762c0884d1c | 3855416027cb25d9a708ffa5581cf503a87856a6 | 2024-05-08T18:54:39+10:00 | Brian | compare-llama-bench.py: add missing basicConfig (#7138) | |
| 448 | 3855416027cb25d9a708ffa5581cf503a87856a6 | c0e6fbf8c380718102bd25fcb8d2e55f8f9480d1 | 2024-05-08T02:30:09-04:00 | Justine Tunney | ggml : introduce bfloat16 support (#6412) | |
| 449 | 858f6b73f6e57a62523d16a955d565254be889b4 | b3a995b416e13ae3123a117a743e11d0ede0ca4c | 2024-05-06T11:12:14-07:00 | William Tambellini | Add an option to build without CUDA VMM (#7067) | |
| 450 | 628b299106d1e9476fdecb3cbe546bf5c60f1b89 | 8f8acc8683a00ce40fa5a81161a079d2167126e6 | 2024-05-05T07:17:47-05:00 | kunnis | Adding support for the --numa argument for llama-bench. (#7080) | |
| 451 | 8f8acc8683a00ce40fa5a81161a079d2167126e6 | ca3632602091e959ed2ad4c09c67a7c790b10d31 | 2024-05-05T13:38:55+02:00 | Sigbjørn Skjæret | Disable benchmark on forked repo (#7034) | |
| 452 | a2ac89d6efb41b535778bfeaecaae8fe295b6ed3 | 433def286e98751bf17db75dce53847d075c0be5 | 2024-05-04T05:36:41+10:00 | Brian | convert.py : add python logging instead of print() (#6511) | |
| 453 | 9c67c2773d4b706cf71d70ecf4aa180b62501960 | 952d03dbead16e4dbdd1d3458486340673cc2465 | 2024-04-30T12:16:08+03:00 | Georgi Gerganov | ggml : add Flash Attention (#5021) | |
| 454 | b8a7a5a90fd3187175d84227dad705ade395ba46 | d2c898f746a527f09effb061829e68b2e1812a28 | 2024-04-29T17:02:45+01:00 | Olivier Chafik | build(cmake): simplify instructions (`cmake -B build && cmake --build build ...`) (#6964) | |
| 455 | 5790c8dac1a4f0aa80b4efee3b962d8c04c829e8 | 46e12c4692a37bdd31a0432fc5153d7d22bc7f72 | 2024-04-26T09:26:16+02:00 | Pierrick Hymbert | bench: server add stop word for PHI-2 (#6916) | |
| 456 | 5cf5e7d490dfdd2e70bface2d35dfd14aa44b4fb | 40f74e4d739e9250431cf339ae7588b28d8d0663 | 2024-04-21T18:48:53+01:00 | Olivier Chafik | `build`: generate hex dump of server assets during build (#6661) | |
| 457 | 9958c81b798a5872087b30b360e4674871f2479e | 8b1b1f4982d3e9b994308d05a1c8b9e45c23edb5 | 2024-04-19T09:35:54Z | nopperl | Implement the OLMo architecture (#6741) | |
| 458 | 8cc91dc63c0df397d644a581b2cbeea74eb51ae0 | dbceec87c0221ec952e69448df6a71f1372a7487 | 2024-04-16T14:55:30-04:00 | Justine Tunney | ggml : add llamafile sgemm (#6414) | |
| 459 | de17e3f7455dc7fd298cc61d86798533b9ca7a29 | b5e7285baffb0da8a6619567b52d8e67de41291d | 2024-04-14T10:42:29+08:00 | Neo Zhang Jianyu | fix memcpy() crash, add missed cmd in guide, fix softmax (#6622) | |
| 460 | ab9a3240a9da941fdef5cd4a25f2b97c2f5a67aa | fbbc030ba93561fac842af994c5c6c4c1147f13b | 2024-04-12T19:43:38+01:00 | Olivier Chafik | JSON schema conversion: ⚡️ faster repetitions, min/maxLength for strings, cap number length (#6555) | |
| 461 | 04a5ac211ef40936295980b7cdf0ba6e97093146 | f7001ccc5aa359fcf41bba19d1c99c3d25c9bcc7 | 2024-04-11T21:44:50-04:00 | Clint Herron | Optimization: eliminate addition of redundant stacks when advancing grammar. (#6616) | |
| 462 | 57dd02c44b2a0eb79e28f6c5eb8242a5d2d3174d | 75cd4c77292034ecec587ecb401366f57338f7c0 | 2024-04-06T10:31:33-04:00 | Clint Herron | Tests: Added integration tests for GBNF parser (#6472) | |
| 463 | 75cd4c77292034ecec587ecb401366f57338f7c0 | a8bd14d55717754a1f48313a846a2b16fa998ad2 | 2024-04-06T05:40:47+02:00 | Pierrick Hymbert | ci: bench: support sse and fix prompt processing time / server: add tokens usage in stream OAI response (#6495) | |
| 464 | 87e21bbacd830437ab653cf03b6f26d45c15395d | 1b496a745c315022df2d919374052e6004ced8d3 | 2024-04-06T01:34:53+07:00 | Ting Sun | bench : make n_batch and n_ubatch configurable in Batched bench (#6500) | |
| 465 | 7dda1b727ef1730783a6077136d28b83e70dd397 | c666ba26c39d5c07e07b4e1e411332f408e309ad | 2024-04-05T01:30:53+09:00 | Minsoo Cheong | ci: exempt master branch workflows from getting cancelled (#6486) | |
| 466 | 8120efee1d9931b514aeb5a047209d576f23286c | a74401f0e5ebb15fa4d8b6619d1baa6ea9179123 | 2024-04-04T16:59:04+02:00 | Pierrick Hymbert | ci: bench fix concurrency for workflow trigger dispatch with sha1 (#6478) | |
| 467 | 7a2c92637ae265654a68f62e6a7610b358255d3f | 4bcd6b959ca3991084ad1d8464caf2a734e29b1d | 2024-04-04T11:57:58+02:00 | Pierrick Hymbert | ci: bench: add more ftype, fix triggers and bot comment (#6466) | |
| 468 | 5fb1574c8112c757fc202fdae279da883f34e610 | 60cdf40cc32f0ad4cb11e0ca8fd38f3b93d8d640 | 2024-04-03T13:22:57-07:00 | Fattire | A few small fixes to server's README docs (#6428) | |
| 469 | 33a52448061cfd2ea44da9e6cb30b2ec22e2f6d0 | 226e819371eec0f298d9075198394a07b23ecfa9 | 2024-04-01T13:30:43+02:00 | Johannes Gäßler | compare-llama-bench.py: fix long hexsha args (#6424) | |
| 470 | 37e7854c104301c5b5323ccc40e07699f3a62c3e | c342d070c64a1ffe35d22c1b16b672e684a30297 | 2024-03-30T11:36:07+01:00 | Pierrick Hymbert | ci: bench: fix Resource not accessible by integration on PR event (#6393) | |
| 471 | 057400a3fd457f4f214684eeb171444663b47a23 | b75c38166cf0c66793a32d5c3d6cb69929dd083d | 2024-03-29T08:23:22+01:00 | Daniel Bevenius | llama : remove redundant reshape in build_kv_store (#6369) | |
| 472 | 28cb9a09c4d10a489be1238abe7a858dcd4d65f2 | cfc4d75df6399b36153ef739f2c1abee4c114bb8 | 2024-03-28T11:27:56+01:00 | Pierrick Hymbert | ci: bench: fix master not schedule, fix commit status failed on external repo (#6365) | |
| 473 | a016026a3ac16d8c9b993a3573f19b9556d67de4 | 53c7ec53d5eca26b2c0c648605543a5fa6c12817 | 2024-03-27T20:26:49+01:00 | Pierrick Hymbert | server: continuous performance monitoring and PR comment (#6283) | |
| 474 | 557410b8f06380560155ac7fcb8316d71ddc9837 | 55c1b2a3bbd470e9e2a3a0618b92cf64a885f806 | 2024-03-26T10:46:41-04:00 | compilade | llama : greatly reduce output buffer memory usage (#6122) | |
| 475 | 55c1b2a3bbd470e9e2a3a0618b92cf64a885f806 | e097633f63fdd26d492844f7eff056e4083fd9eb | 2024-03-26T15:21:27+01:00 | Kawrakow | IQ1_M: 1.75 bpw quantization (#6302) | |
| 476 | cfd3be76e37dab92c846d75a2421178f20db4a11 | 5b7b0ac8dfdd800c0fd0dc69b69991e8cb19fb46 | 2024-03-21T13:59:38+01:00 | Kawrakow | ggml : same IQ4_NL quantization for CPU/CUDA/Metal (#6196) | |
| 477 | 5b7b0ac8dfdd800c0fd0dc69b69991e8cb19fb46 | 1943c0198125a0da1a200390e82cf461f9080d99 | 2024-03-21T11:50:43Z | Olivier Chafik | json-schema-to-grammar improvements (+ added to server) (#5978) | |
| 478 | 76aa30a26353f597e4fbe3cf776772ae812af89a | c5b8595e3f4f4ed319ef71c9c9d868d1b7a27626 | 2024-03-21T08:27:57+01:00 | Kawrakow | Add ability to use Q5_0, Q5_1, and IQ4_NL for quantized K cache (#6183) | |
| 479 | bd60d82d0cc8b6852ec535495a5042dbdf05de24 | 6c0b287748327741b113d7d6018b68c63039b1c5 | 2024-03-20T01:33:49-04:00 | Jared Van Bortel | server tests : more pythonic process management; fix bare `except:` (#6146) | |
| 480 | a56d09a4407f29c21e149b44fd5308f83aa1cb09 | d84c48505f60bcd358b82a751d40418c4d235643 | 2024-03-16T13:20:53+01:00 | Pierrick Hymbert | ci : close inactive issue with workflow (#6053) | |
| 481 | b0bc9f4a9da7c19f4779106ea83b23feca747566 | 4755afd1cbd40d93c017e5b98c39796f52345314 | 2024-03-15T09:22:24+01:00 | slaren | llama-bench : use random tokens to improve accuracy with mixtral (#6069) | |
| 482 | 6e0438da3cc95b89cdbf55f45fa4e324d9076792 | 727107707a73b3dc8a497cf9fc9405722c16dd2b | 2024-03-14T14:29:32-04:00 | Steve Grubb | gguf : fix resource leaks (#6061) | |
| 483 | 43241adf22e8231ffaf3827d2c9310cc0ffd5ac5 | a44bc969e4cd62ca9f4332e17fe3c51f2093e7c6 | 2024-03-14T12:15:39+01:00 | Pierrick Hymbert | server: disable debug release type sanitizer, simplify trigger (#6047) | |
| 484 | 2c4fb69246834503db7b78bcbedcef506bbc60c4 | 3ca23481dd309bd51cc31c73a4cc34f922cc372f | 2024-03-14T11:56:48+01:00 | Michael Podvitskiy | llama : optimize defrag moves + fix fragmentation calculation (#6037) | |
| 485 | f30ea47a87ed4446ad55adb265755dc9102956a2 | d8fd0ccf6ac8b07791ffd1575eed436930854ae3 | 2024-03-13T18:54:21+01:00 | slaren | llama : add pipeline parallelism support (#6017) | |
| 486 | 44ca159faf4fbe1a7ace13a962845ba7cdfd95ec | 05b06210c954491cf0f12034b0a62bd4d69ce78b | 2024-03-11T16:53:15+01:00 | Kawrakow | 1.5 bit: we can do even better (#5999) | |
| 487 | be858f620508385ad12d0e5e862010e666ca729c | ef3ced26a3817d92890b97b83acaeb018ade02d0 | 2024-03-11T07:51:49+01:00 | Kawrakow | Better 1.5 bit quantization (#5971) | |
| 488 | 621e86b331f8b0e71f79fd82a4ae1cd54c3e4396 | 77d1ac7e00bf049b9f2bba1b5a310a78318c49c4 | 2024-03-09T23:41:49+01:00 | Pierrick Hymbert | server: benchmark: chat/completions scenario and other llm servers comparison (#5941) | |
| 489 | c2101a2e909ac7c08976d414e64e96c90ee5fa9e | 515f7d0d4fce41c752fc253acf30707c3be2531e | 2024-03-08T17:31:00-05:00 | compilade | llama : support Mamba Selective State Space Models (#5328) | |
| 490 | 76e868821a94072fbc87cb1fcca291694319eae8 | e457fb3540e0aaec47cfde0abf784c213f9216ee | 2024-03-08T12:25:04+01:00 | Pierrick Hymbert | server: metrics: add llamacpp:prompt_seconds_total and llamacpp:tokens_predicted_seconds_total, reset bucket only on /metrics. Fix values cast to int. Add Process-Start-Time-Unix header. (#5937) | |
| 491 | 6cdabe652695167263c8b447520987b11856f7ca | 89fb735fcfd21781a8194b211cf32824beb3f71f | 2024-03-07T16:32:38+02:00 | Georgi Gerganov | llama-bench : add embeddings option (#5924) | |
| 492 | 2002bc96bf2cbf5ab981a17d7e994d817c9801f5 | ceca1aef0738b57951cd12c603c3477e75312dec | 2024-03-07T11:41:53+02:00 | Georgi Gerganov | server : refactor (#5882) | |
| 493 | 652ca2bded3c818320d92c70d2b67f64bdbff5e5 | bd836944f826f07e19b7edcf994a78728da49c1c | 2024-03-05T22:27:29+01:00 | slaren | compare-llama-bench.py : remove mul_mat_q (#5892) | |
| 494 | 61d1c88e155515dd03940913a5707ea84a8b119b | 21b08674331e1ea1b599f17c5ca91f0ed173be31 | 2024-03-05T13:33:42+01:00 | 0cc4m | Vulkan Improvements (#5835) | |
| 495 | 21b08674331e1ea1b599f17c5ca91f0ed173be31 | 6a87ac3a52668e117d97bcea07b529c93188b303 | 2024-03-05T16:08:35+08:00 | Neo Zhang Jianyu | [SYCL] fix mul_mat fault in CI/unit-test (#5862) | |
| 496 | 7d43c585dc174bb586775c22c15e5db9242b5b4b | 82f3e668adafba647de703f835991e91a96b5ac4 | 2024-03-03T20:23:52+08:00 | leejet | add some new ops, fix some operators and add batch operations to certain operators. (ggml/747) | |
| 497 | 9731134296af3a6839cd682e51d9c2109a871de5 | 4a6e2d6142ab815c964924896891e9ab3e050632 | 2024-03-02T22:00:14+01:00 | Pierrick Hymbert | server: tests: passkey challenge / self-extend with context shift demo (#5832) | |
| 498 | 3ab8b3a92ede46df88bc5a2dfca3777de4a2b2b6 | 9600d59e010c18f5872580a21734ea1bf1968d04 | 2024-03-01T12:39:06+01:00 | Pierrick Hymbert | llama : cleanup unused mmq flags (#5772) | |
| 499 | 9600d59e010c18f5872580a21734ea1bf1968d04 | 5cb02b4a012bb16c6c699c0c62c05ffa653eee0f | 2024-03-01T03:15:36-06:00 | Douglas Hanley | unicode : switch to multimap based nfd_map (#5799) | |
| 500 | 87c91c07663b707e831c59ec373b5e665ff9d64a | 317709b2a81dbaf87850202686ec5bb2602a504e | 2024-02-28T21:44:21+02:00 | Georgi Gerganov | ci : reduce 3b ppl chunks to 1 to avoid timeout (#5771) | |
| 501 | 0becb22ac05b6542bd9d5f2235691aa1d3d4d307 | c24a2a6e6005e5d424301525a42ba45a4a362d30 | 2024-02-27T16:34:24+02:00 | Kawrakow | IQ4_XS: a 4.25 bpw quantization (#5747) | |
| 502 | e3965cf35aac00d4e24998c8a3d0093ae1d98bd3 | 8b350356b28f782deab63d8b0e9ae103ceb25fcd | 2024-02-25T22:48:33+01:00 | Pierrick Hymbert | server: tests - slow inference causes timeout on the CI (#5715) | |
| 503 | 4c4cb30736582cacb1a164a9d4bc8e17b1014be7 | 525213d2f5da1eaf4b922b6b792cb52b2c613368 | 2024-02-24T16:23:52+02:00 | Kawrakow | IQ3_S: a much better alternative to Q3_K (#5676) | |
| 504 | 70847553963c85e86051d06df848236829f5f951 | 4480542b2271ba1438f0daff8e5f3a74b1dc8609 | 2024-02-19T09:31:59+01:00 | Daniel Bevenius | llava : avoid changing the original BakLLaVA model (#5577) | |
| 505 | fc0c8d286a533363a9a663510b62af85ffad58b3 | bd2d4e393b2b7d2a1b2e201058e26017c9728ead | 2024-02-18T17:19:23+01:00 | Daniel Bevenius | llava : update surgery script to not remove tensors (#5536) | |
| 506 | 8f1be0d42f23016cb6819dbae01126699c4bd9bc | 6e4e973b2615f8d390b1c4f4a7e05a119078bb0f | 2024-02-17T23:04:16+02:00 | Georgi Gerganov | ggml : add ALiBi support for ggml_soft_max_ext (#5488) | |
| 507 | d2819d5577b35507be83d0c3f4d2d3c0ab1488ca | 4cb072769804c77ab466bc8351c76ede9d5ba49d | 2024-02-16T15:14:40+02:00 | Georgi Gerganov | scripts : add helpers script for bench comparing commits (#5521) | |
| 508 | 9060a1e9dfca6038906e819be5fa42217f49028c | 9350a1cf21b1492c69b20175b73a419b897d6a3a | 2024-02-15T16:49:01+01:00 | slaren | cuda : print message when initialization fails (#5512) | |
| 509 | 0d4177126b0556e202efb85bf3f768be81076400 | 7930a8a6e89a04c77c51e3ae5dc1cd8e845b6b8f | 2024-02-15T09:01:57+01:00 | Elbios | llava : fix memory management bug (#5491) | |
| 510 | 704359e29985a06a389337a2617b7f3fa8eff908 | 594fca3fefe27b8e95cfb1656eb0e160ad15a793 | 2024-02-15T17:11:15+11:00 | Neuman Vong | vulkan: Find optimal memory type but with fallback (#5381) | |
| 511 | 49cc1f7d67de2da99f3ac185f9ff1319b7bf35f8 | 99b8b43d7b185a6483f28cf798a2d968b2e16ca7 | 2024-02-13T13:01:29+02:00 | Georgi Gerganov | bert : add tests + fix quantization (#5475) | |
| 512 | 85910c5b30f6e268321be8df044f5528a6efac52 | 139b62a839825ef20084ed75ed624db7a5ad554a | 2024-02-11T15:35:50+02:00 | Georgi Gerganov | main : ctrl+C print timing in non-interactive mode (#3873) | |
| 513 | a07d0fee1f05c5c1dc49948ae1a3293db017275f | e4640d8fdf56f14a6db3d092bcd3d2d315cb5d04 | 2024-02-11T07:22:33-06:00 | snadampal | ggml : add mmla kernels for quantized GEMM (#4966) | |
| 514 | e4640d8fdf56f14a6db3d092bcd3d2d315cb5d04 | 907e08c1109f498b01036367804cff3082c44524 | 2024-02-11T12:44:51+01:00 | Johannes Gäßler | lookup: add print for drafting performance (#5450) | |
| 515 | 4b7b38bef5addbd31f453871d79647fbae6bec8a | e00d2a62dd1441e3b089570ec06d05c18800d368 | 2024-02-10T05:30:19+11:00 | Neuman Vong | vulkan: Set limit for task concurrency (#5427) | |
| 516 | 6fdfa2ecc684000a25a4ad91823bc82a6652b645 | a2d60c9158435ae9a6f14632f07f1acf7a3becef | 2024-02-05T10:46:06+02:00 | Kawrakow | iq2_xxs: tune quantization (#5320) | |
| 517 | 3cc5ed353c07201d8d5b98b0a4713ab633da6d04 | 60ecf099eddfe70fec797ef6790572e452054add | 2024-02-03T20:14:59+01:00 | Johannes Gäßler | make: fix nvcc optimization flags for host code (#5309) | |
| 518 | e920ed393d989ed35625ddaf182ebb52cda07fcd | 52bb63c7082c859c3f1dfc527227e6a95b299c7c | 2024-02-03T18:15:00+01:00 | 0cc4m | Vulkan Intel Fixes, Optimizations and Debugging Flags (#5301) | |
| 519 | af3ba5d94627d337e32a95129e31a3064c459f6b | e1e721094d8169636d55f68efe37f222cd3f0677 | 2024-02-02T15:53:27+08:00 | Neo Zhang Jianyu | [SYCL] update guide of SYCL backend (#5254) | |
| 520 | 128dcbd3c9c4b12f42b560a4430427d7b2828628 | 4d0924a8902010d31bd737b6f1f594943d120d0f | 2024-02-02T03:48:53+08:00 | Neo Zhang Jianyu | add --no-mmap in llama-bench (#5257) | |
| 521 | e8dc55d0065d076d4c20f3c4bfca562701b4edfe | e0085fdf7c758f0bc2746fc106fb29dd9df959de | 2024-01-30T19:04:37-05:00 | Jared Van Bortel | kompute : llama-bench support and ggml_cpu_has_kompute() (#5226) | |
| 522 | 8e14e3ddb3744566aef7bc0fa734180e47ae6bdf | f4d7e5497485ce6ce0e322533930b7da4657dd2d | 2024-01-30T15:15:07+02:00 | Kawrakow | Faster AVX2 dot product for IQ2_XS (#5187) | |
| 523 | f4d7e5497485ce6ce0e322533930b7da4657dd2d | 2256f36b79a932a478d4dcdf02c1e5a60056e5f3 | 2024-01-30T15:14:12+02:00 | Kawrakow | SOTA 3-bit quants (#5196) | |
| 524 | 2307523d322af762ae06648b29ec5a9eb1c73032 | 0f648573dde61c510560f68244f70ece7e60d8c1 | 2024-01-28T18:03:59+01:00 | 0cc4m | ggml : add Vulkan backend (#2059) | |
| 525 | 0f648573dde61c510560f68244f70ece7e60d8c1 | b764b8f1d079ba44d912801ce6d29bd0d94d51cf | 2024-01-28T21:26:23+05:30 | Abhilash Majumder | ggml : add unified SYCL backend for Intel GPUs (#2690) | |
| 526 | 7032f4f6349c17a8352f9f93f7d2122f45469e59 | 5f1925a8cef81eb9b372faaae34b0dd76d5361d4 | 2024-01-26T11:17:59-06:00 | snadampal | ggml : update softmax n_task calculation (#5126) | |
| 527 | 5eaf9964fc797d4585c214db32a463d557f3ed33 | d292f4f2047963f558dd516f1baaa71793e9acf2 | 2024-01-26T05:06:22+09:00 | l3utterfly | llama : dynamic temperature sampling (#4972) | |
| 528 | 3ce7e8f8e7ccfce07e5947ac5f1f3f4628cf68ea | b2d80e105a59b54822edf7ce7f3ed5f317e96e21 | 2024-01-22T21:09:35+08:00 | XiaotaoChen | llava : MobileVLM support (#4954) | |
| 529 | 726c0fa9a2da976e9c5d5c51e185d9dd453fc9e5 | 942c0107a7301434c0a5e7da46bc4cf2393aa556 | 2024-01-21T08:01:20+02:00 | Kawrakow | Slightly faster imatrix (#5050) | |
| 530 | 77bc1bbd05f0c31cb45773eb5eb59b9ff2b07e1b | 48e2b1337257bb77573bf76cfffcff3a5efa8704 | 2024-01-20T08:11:31Z | Herman Semenov | cmake : add support for ccache (#5002) | |
| 531 | 381ee195721d8e747ee31a60c0751822b3072f02 | a5cacb22b2114fd9adf61c00cbb237384d86bced | 2024-01-19T13:20:50-05:00 | Uzo Nweke | finetune : fix ggml_allocr lifetimes (tmp workaround) (#5033) | |
| 532 | 7051aacfac0057fa5fac9ea46c55bffc3892d810 | 2b3b999cacc7ad1207c32fbdf3479a19c06e1a34 | 2024-01-19T11:39:11+02:00 | Kawrakow | winogrande: evaluate log-probs in parallel (#5036) | |
| 533 | 3e945cc1e9c06d2001031360e4e303e9548fb02c | ad19812cda4062c9f154ef16315df41fbe6a770a | 2024-01-18T19:18:21+02:00 | Kawrakow | HellaSwag: speed up by parallelizing log-prob evaluation (#5020) | |
| 534 | ba69bbc84ced580fe4fdb0713ca2d95634325b7a | 44a1a4a41a4c0b03afaa7d9e06bcbc7cf95aa1e6 | 2024-01-17T18:46:30+02:00 | Georgi Gerganov | imatrix : offload to GPU support (#4957) | |
| 535 | 44a1a4a41a4c0b03afaa7d9e06bcbc7cf95aa1e6 | c918fe8dca8fa1c4602427e0a4b88e20046f6c34 | 2024-01-17T18:39:41+02:00 | Georgi Gerganov | backend : add eval callback (#4935) | |
| 536 | 158f8c9e21302114bac3c646f80ea85b52ffa0bd | 862f5e41ab1fdf12d6f59455aad3f5dd8258f805 | 2024-01-16T17:05:19Z | Paul Tsochantaris | metal : localized logic in `ggml_metal_graph_compute` (#4924) | |
| 537 | 862f5e41ab1fdf12d6f59455aad3f5dd8258f805 | 3a48d558a69c88ac17efcaa5900cd9eb19596ac4 | 2024-01-17T00:47:34+11:00 | Neuman Vong | android : introduce starter project example (#4926) | |
| 538 | a0b3ac8c48b66206b9c5921ce57bd5c0ea6557c3 | d75c232e1da56f19ac4d2530dadbe0ab3a11fde5 | 2024-01-16T03:16:33-08:00 | Justine Tunney | ggml : introduce GGML_CALL function annotation (#4850) | |
| 539 | 7dc78764e2ff86512e6e31cb0fcb8087df4b4708 | 356327feb3f66980ab687040495d722696d98970 | 2024-01-13T15:52:53+01:00 | Johannes Gäßler | compare-llama-bench: tweak output format (#4910) | |
| 540 | e7e4df031b9e29d4b55a4e0b0295187f6b213db1 | 584d674be622fbf1578694ada6e62eebedbfd377 | 2024-01-12T20:07:38+01:00 | slaren | llama : ggml-backend integration (#4766) | |
| 541 | e739de790921e6abbc8c70398303cacd74913f61 | c910e3c28a1caee8cb1398143d582dd9ab697e68 | 2024-01-10T21:13:42+08:00 | leejet | ggml : change GGML_MAX_NAME at compile time (ggml/682) | |
| 542 | d34633d8db6c2e400355de4862cd699154ecc73f | 4f56458d34cb13dcbf69aca650e9bf77d5497e6f | 2024-01-10T14:37:09+01:00 | John | clip : support more quantization types (#4846) | |
| 543 | 4f56458d34cb13dcbf69aca650e9bf77d5497e6f | 6efb8eb30e7025b168f3fda3ff83b9b386428ad6 | 2024-01-10T01:04:33+01:00 | Johannes Gäßler | Python script to compare commits with llama-bench (#4844) | |
| 544 | 6efb8eb30e7025b168f3fda3ff83b9b386428ad6 | 36e5a08b203542dca53cca4eaf172c5dc4bbc991 | 2024-01-09T13:46:46-05:00 | Austin | convert.py : fix vanilla LLaMA model conversion (#4818) | |
| 545 | dd5ae06405c5565b99889bdb3f168f4351252cfb | 668b31fc7d86245435ad6574e0e1126e734049e2 | 2024-01-08T16:02:32+01:00 | Kawrakow | SOTA 2-bit quants (#4773) | |
| 546 | 226460cc0d5b185bc6685fb76f418fd9418d7add | d5a410e8556191672465f7ff58682ea2474038b0 | 2024-01-07T17:59:01+01:00 | slaren | llama-bench : add no-kv-offload parameter (#4812) | |
| 547 | f3f62f0d835d559e80714bbeb05d03125574e3dd | 0ef3ca2ac62016c0c545de1c89dc2e3e130f4a99 | 2024-01-02T21:07:47+02:00 | Georgi Gerganov | metal : optimize ggml_mul_mat_id (faster Mixtral PP) (#4725) | |
| 548 | 26f3071d714f0b27ad7f021a46a66a1085480258 | 775ac8712a7b42cfead2585f42cec0dfd56644ab | 2024-01-02T16:23:38+07:00 | Nam D. Tran | py : re-enable mmap in convert hf (#4732) | |
| 549 | 68eccbdc5b56f2a2450f9a8463f9934388cafabf | 97bbca6e8522d18041fcde6c3d0907a52ce36446 | 2023-12-29T06:42:26-08:00 | Philip Taron | flake.nix : rewrite (#4605) | |
| 550 | db49ff8ed7f0bb201176703441cc02911b08ef2a | 60f55e888c29cbd87c4238dd19e85d0eef87245d | 2023-12-29T06:24:12-08:00 | Justine Tunney | server : replace sleep with condition variables (#4673) | |
| 551 | afd997ab6011dfefe9e917425b04ef4d83614841 | c8255f8a6b2a3b3ebc6cb340cc2487f39fc95ffc | 2023-12-29T05:58:56-08:00 | Peter Sugihara | llama.swiftui : fix infinite loop, ouput timings, buff UI (#4674) | |
| 552 | 65e5f6dadbba4b496bba27f573e473c66b446496 | ea5497df5d138c83b2b0ca70aefdc4b1175c1001 | 2023-12-28T11:20:00-08:00 | Justine Tunney | Fix OpenAI server sampling w.r.t. temp and seed (#4668) | |
| 553 | f6793491b5af6da75edad34d6f503ef86d31b09f | 879b690a9e1eb1ab0a29b58236fc76978fb4d902 | 2023-12-27T22:39:45+07:00 | Nam D. Tran | llama : add AWQ for llama, llama2, mpt, and mistral models (#4593) | |
| 554 | 48b7ff193e64c97ab174280ba0eb8d14b47c49ba | 48b24b170e3b4f9dc28200306840cb07d1c123df | 2023-12-22T12:12:53+01:00 | slaren | llama : fix platforms without mmap (#4578) | |
| 555 | d232aca5a73b290e218a2e48b91023d5e994203f | 31f27758faf4a4bd08101a57c7ec3a473f771f86 | 2023-12-21T21:07:46+01:00 | slaren | llama : initial ggml-backend integration (#4520) | |
| 556 | 800a489e4a8be199122259a995b1ee9dd7fae320 | f7f468a97dceec2f8fe8b1ed7a2091083446ebc7 | 2023-12-17T19:38:41+02:00 | Georgi Gerganov | llama.swiftui : add bench functionality (#4483) | |
| 557 | 799a1cb13b0b1b560ab0ceff485caed68faa8f1f | fecac45658a99eddc4d6e36ba0310ca8f87a77f0 | 2023-12-13T13:04:25+01:00 | slaren | llama : add Mixtral support (#4406) | |
| 558 | bcc0eb4591bec5ec02fad3f2bdcb1b265052ea56 | 81bc9214a389362010f7a57f4cbc30e5f83a2d28 | 2023-12-07T13:03:17+02:00 | Georgi Gerganov | llama : per-layer KV cache + quantum K cache (#4309) | |
| 559 | 81bc9214a389362010f7a57f4cbc30e5f83a2d28 | 05cd6e5036d72d0930de4d8f6be7bce09e8dda24 | 2023-12-07T02:25:22-08:00 | Hongyu Ouyang | train : fix #4227 (double free in examples/train-text-from-scratch/train-text-from-scratch.cpp) (#4351) | |
| 560 | 5aa365d88fdb8fdd430ef3fc141c7a5fd37c3502 | 52c8bc3cf312e1caf02d37bfb9d9d865cbe33594 | 2023-12-05T10:19:18-07:00 | Kerfuffle | llama : allow overriding GGUF metadata when loading model (#4092) | |
| 561 | ef47ec18da469423c276b683dd9b5741cee7023e | 1d144112c0fbbb4ecc07dbcf4f05a380148bd6de | 2023-12-01T10:51:24+02:00 | Georgi Gerganov | ggml : add ggml_soft_max_ext (#4256) | |
| 562 | 8e672efe632bb6a7333964a255c4b96f018b9a65 | 0b871f1a04ef60e114bbe43004fd9c21114e802d | 2023-11-21T16:22:30+01:00 | Galunid | stablelm : simplify + speedup generation (#4153) | |
| 563 | f23c0359a32871947169a044eb1dc4dbffd0f405 | 40a34fe8d034bd484efd79ccbb95059ca6308dcb | 2023-11-20T11:35:47+01:00 | Galunid | ci : add flake8 to github actions (python linting) (#4129) | |
| 564 | f7d5e975424ff0eea55ca5a9181ac8e15553c1fc | ba4cf5c0bf37a729d29e899dadf14541cddd23d4 | 2023-11-17T16:20:53+01:00 | Jiří Podivín | py : remove superfluous import statements (#4076) | |
| 565 | 3e916a07ac093045d88ef0c4fa78647ae0efc010 | 947f64f1630bb8b0b363a3bb5e29e11425312d57 | 2023-11-17T14:48:19Z | gwjr | finetune : speed-up ggml_compute_forward_out_prod_f32 via BLAS (#4079) | |
| 566 | 91f6499393d2d999331fbfdba47a7f8b9f913f0d | 8da46278e1a57107591653275f8e03a281de94f0 | 2023-11-16T19:14:37-07:00 | Kerfuffle | Respect tokenizer.ggml.add_bos_token value when tokenizing (#4040) | |
| 567 | ca190bca8e844d171020d6147687e71472d71734 | 71e3718abdb2771b50c9606d3a7569623a0b0afe | 2023-11-01T09:28:28Z | Adrian Hesketh | server : re-enable completion and embedded at the same time (#3876) | |
| 568 | 71e3718abdb2771b50c9606d3a7569623a0b0afe | 238657db2364cfb728c694470a4a81702afea760 | 2023-11-01T08:04:02+02:00 | Georgi Gerganov | llama : refactor graph build code (#3837) | |
| 569 | 2f9ec7e271220a78fe27c9e6ccbcc0dda31cda0f | 34b2a5e1ee4fe6295fb4420eb91131d743694c65 | 2023-10-27T17:01:23+03:00 | Georgi Gerganov | cuda : improve text-generation and batched decoding performance (#3776) | |
| 570 | 6961c4bd0b5176e10ab03b35394f1e9eab761792 | cc448774866e6479c750bd7c135cd8f92cedee67 | 2023-10-25T10:26:27+03:00 | Georgi Gerganov | batched-bench : print params at start | |
| 571 | 2b4ea35e56792064598e922e46d081e02bc96b94 | daab3d7f45832e10773c99f3484b0d5b14d86c0c | 2023-10-24T16:48:37+03:00 | Georgi Gerganov | cuda : add batched cuBLAS GEMM for faster attention (#3749) | |
| 572 | 438c2ca83045a00ef244093d27e9ed41a8cb4ea9 | 9e70cc03229df19ca2d28ce23cc817198f897278 | 2023-10-22T22:53:08+03:00 | Georgi Gerganov | server : parallel decoding and multimodal (#3677) | |
| 573 | a5e7dbd6141128bfa3c40a19c2945a181df625d3 | d3956aea53369455008159cc405ed4c496976692 | 2023-10-22T12:14:56-06:00 | Kerfuffle | llama : validate special token ids are in range when loading GGUF model (#3635) | |
| 574 | f439e506e8ae8b01df2ae2156380f8156d7553e3 | e78f3ef24af4ca74e77e725644b41ae8ca3b10a5 | 2023-10-20T10:02:12Z | Herman Semenov | ggml : fix rope + llama minor optimizations (#3560) | |
| 575 | 370359e5baf619f3a8d461023143d1494b1e8fde | 9e24cc6e2e589d405bd1720c400f5b0b9d0ca3ee | 2023-10-12T18:23:18+03:00 | M. Yusuf Sarıgöz | examples: support LLaVA v1.5 (multimodal model) (#3436) | |
| 576 | 8c70a5ff25964f0a81e20d142a2f5ac5baff22fc | 24ba3d829e31a6eda3fa1723f692608c2fa3adda | 2023-10-11T21:25:33+03:00 | Georgi Gerganov | batched : add bench tool (#3545) | |
| 577 | b0ec5218c3d24755786b80ecce9cf4ffc07583f8 | 63d3b06a4318329f92b078e8aa0be7ab6e9f871f | 2023-10-08T10:01:53+03:00 | Georgi Gerganov | metal : support MTLGPUFamily < Apple7, formatting, style (#3524) | |
| 578 | f93af02488179b9c52d0d391b08ae4c4d891b8d3 | f72f8f22c9cb60465b2e79df2767e4ba9604e576 | 2023-10-04T15:29:58+03:00 | Georgi Gerganov | sync : ggml (conv 1d + 2d updates, UB fixes) (#3468) | |
| 579 | 79f34abddb72ac5ddbf118f3d87520b611a10a7d | 8186242b6d67cf87ae179fb1a62f52fdf0e5c5eb | 2023-10-03T23:38:19+05:00 | Tameem | ggml : add RISC-V Vector Support for K-Quants and improved the existing intrinsics (#3453) | |
| 580 | f5ef5cfb18148131fcf45bdd2331f0db5ab7c3d0 | 40e07a60f9ce06e79f3ccd4c903eba300fb31b5e | 2023-09-30T18:12:57+02:00 | slaren | ggml-cuda : perform cublas mat mul of quantized types as f16 (#3412) | |
| 581 | 16bc66d9479edd5ee12ec734973554d4493c5dfa | 0512d66670de3f650c579519833c085014b0f200 | 2023-09-28T21:42:38+02:00 | slaren | llama.cpp : split llama_context_params into model and context params (#3301) | |
| 582 | 0e76a8992c8200237bbc6471a53fb8796b3872f7 | 2db94d98eda56982d80238840b0652b4137a2a84 | 2023-09-28T20:40:11+02:00 | xaedes | train : finetune LORA (#2632) | |
| 583 | ec893798b7a2a803466cc8f063051499ec3d96f7 | 45855b3f1c7bdd0320aa632334d0b3e8965c26c4 | 2023-09-28T19:04:36+03:00 | Georgi Gerganov | llama : custom attention mask + parallel decoding + no context swaps (#3228) | |
| 584 | da0400344be12074e67dcabc565140289cf7efaa | e519621010cac02c6fec0f8f3b16cda0591042c0 | 2023-09-28T12:08:28+02:00 | slaren | ggml-cuda : perform cublas fp16 matrix multiplication as fp16 (#3370) | |
| 585 | c091cdfb24621710c617ea85c92fcd347d0bf340 | 51a7cf5c6e490b2f51c82daa76c4ca4f8d845826 | 2023-09-23T21:48:24+02:00 | slaren | llama-bench : add README (#3317) | |
| 586 | 65c2c1c5ab7c5089dbc6d10bc49b9c58f0164317 | 80834daecf4b9021770361a6d5e1b9c7a60e6854 | 2023-09-20T12:06:08-04:00 | Cebtenzzre | benchmark-matmult : do not use integer abs() on a float (#3277) | |
| 587 | d119c04c159d015a93567df7e73e0e45a22d0f1d | 8781013ef654270cbead3e0011e33a6d690fb168 | 2023-09-20T10:02:39+03:00 | Georgi Gerganov | examples : fix benchmark-matmult (#1554) | |
| 588 | 8c00b7a6ff38e27fa1e471452b8a480913772c2a | 7e50d34be68aae2cc766203703dd188e910e033a | 2023-09-15T19:06:03+03:00 | Georgi Gerganov | sync : ggml (Metal F32 support + reduce ggml-alloc size) (#3192) | |
| 589 | 83a53b753a9499a2a3535c93975b430cb2c828a9 | 5c872dbca2c7979b1f6dafc97db0774b8bbf9372 | 2023-09-14T20:21:25+03:00 | Alon | CI: add FreeBSD & simplify CUDA windows (#3053) | |
| 590 | d54a4027a6ebda98ab0fef7fa0c2247d0bef132a | 1b0d09259e37898c519edb6c52d58f4d096f10bd | 2023-09-11T19:55:51+02:00 | Johannes Gäßler | CUDA: lower GPU latency + fix Windows performance (#3110) | |
| 591 | f31b6f4e2d6def3c0bd7c75f75c0c1e8698e0589 | 6eeb4d90839bac1e6085e5544654ab5c319ad09a | 2023-09-11T09:30:11+02:00 | Kawrakow | metal : PP speedup (#3084) | |
| 592 | ba7ffbb2517ff8cf4c689f94a9ad866f3ee71225 | e64f5b55783e910d8287363895d652b4bea6527a | 2023-09-08T18:01:04+02:00 | Kawrakow | metal : Q3_K speedup (#2995) | |
| 593 | 15b67a66c2f2d6032415b28a699b5131962318f1 | be8c9c245bd129ebabb80e0a7a8dd7daeb4d30af | 2023-09-07T15:52:34+02:00 | slaren | llama-bench : use two tokens in the warmup run for prompt evals (#3059) | |
| 594 | 31035681445181fb414e0def7ec3f84462b3bd97 | 5b8530d88c489f9d0c0ef3d0886b369f655b792e | 2023-09-04T06:40:18-04:00 | Cebtenzzre | llama-bench : make cpp file non-executable (#2999) | |
| 595 | 47068e517004d90f13c16352bb3b4cafd53a00cd | 8f429fa5111901f9646cf998643ac5310846d487 | 2023-09-03T15:12:08+03:00 | Georgi Gerganov | speculative : PoC for speeding-up inference via speculative sampling (#2926) | |
| 596 | ca82cf7bac0c91d03e3d320b3a865dd006f854ac | 6a31a3bd9806c85ed08266f6ab65181da0f30d03 | 2023-09-03T11:06:22+03:00 | Kawrakow | metal : more optimizations (#2959) | |
| 597 | 13268c533177a4dc76bce0b465645d74f0d51d55 | 4dcd47d71df8ca4edcc31302744bd93f0c31298e | 2023-09-01T13:42:41+03:00 | Georgi Gerganov | metal : slight speed-up for add and mul kernels (#2917) | |
| 598 | 95b6e5212f5e4e1419de1d833d7f8d788f9f2227 | 44c117f41ee01c5ac8fb86bba041f08d8b87b46d | 2023-08-28T23:33:27-07:00 | Marcus Dunn | added `struct` to llama_dump_timing_info_yaml's `llama_context` (#2857) | |
| 599 | 44c117f41ee01c5ac8fb86bba041f08d8b87b46d | 43033b7bb4858da4f591715b3babdf906c9b7cbc | 2023-08-28T21:51:47+02:00 | xaedes | train : mem usage and other improvements (#2439) | |
| 600 | 43033b7bb4858da4f591715b3babdf906c9b7cbc | 6b73ef120114beb5664ea94aab48d07ed248ee52 | 2023-08-28T19:19:18+02:00 | slaren | llama-bench : set locale to utf8 (#2832) | |
| 601 | 463173a6c0ff353055eb90665794884c888c790f | eaa13a48ff4136f01c1cdb79cacd61b67ec53095 | 2023-08-27T16:50:33+03:00 | Kawrakow | llama : speedup tokenization (#2831) | |
| 602 | 789c8c945a2814e1487e18e68823d9926e3b1454 | c1ac54b77aaba10d029084d152be786102010eb2 | 2023-08-27T09:03:27+02:00 | slaren | ci : add LoRA test to CI (#2650) | |
| 603 | 730d9c681e339b76407659344e5a2cd50af7d7d5 | c7d92e6dfec3f54849f3a0ba373054d29f321ea2 | 2023-08-26T14:13:36-06:00 | Kerfuffle | convert.py : advanced option (#2753) | |
| 604 | 154725c5436808e5c519685d0279e850596dbe62 | 12e2e33a977af73e75885eeee91c5575a77f4e5f | 2023-08-25T15:16:19+02:00 | slaren | llama-bench : add model sizes (#2771) | |
| 605 | 6bbc598a632560cb45dd2c51ad403bda8723b629 | 3f460a2b723c8b936ac29ecfd02f244b3adeba55 | 2023-08-25T12:09:42+03:00 | Henri Vasserman | ROCm Port (#1087) | |
| 606 | 38b16dfca6e5032e6cfb90c1653bf1ba4cf647b4 | 8f8c28e89cb9531211783da697d6e7c445e2af1d | 2023-08-24T12:27:25-04:00 | Shouzheng Liu | metal : bug-fix when enable ggml-alloc (#2757) | |
| 607 | 6e91a1b0706c2e0e52b9d9be7ee82d3c1e7a33c1 | 44d5462b5cddc1c5cbcd7647646f7b55b175b01f | 2023-08-24T00:07:13-04:00 | Evan Jones | llama : fix grammar sometimes generating null char (#2756) | |
| 608 | cf658adc832badaaa2ca119fe86070e5a830f8f6 | a192860cfec89a38d59a943623bf595b1fe4495b | 2023-08-23T23:08:04+03:00 | Georgi Gerganov | llm : add Falcon support (#2717) | |
| 609 | 7f7ddd5002040804e33fcdbde44aa22f8635f57d | b8ad1b66b23f9b2e6e4531e9a62753323036a556 | 2023-08-23T06:31:09-03:00 | IgnacioFDM | Fix ggml to gguf conversion on Windows (#2733) | |
| 610 | 8e4364f2af9cd5d57240f23e83c0e29bc068bc02 | 1e3bc523d8053a77df3ac7126a84d0297ee97ef6 | 2023-08-22T09:56:03+02:00 | slaren | llama-bench : minor fixes (#2695) | |
| 611 | 097e121e2f17ed3541cf02c55ff7e9febc091b19 | eaf98c2649d7da705de255712f0038ac7e47c610 | 2023-08-18T12:44:58+02:00 | slaren | llama : add benchmark example (#2626) | |
| 612 | a872a2b28eaefc8d464eaa535c94deeb501666f9 | 0919a0f73d95cfb93a1646a1d1741a0615fe2c5e | 2023-08-17T03:35:53-04:00 | Shouzheng Liu | ggml-alloc : fix discrepency between measure&eval (#2639) | |
| 613 | bf83bff6742c0f1795b4c18695a13a34ac7adf62 | b5ffb2849d23afe73647f68eec7b68187af09be6 | 2023-08-16T16:07:04-04:00 | Shouzheng Liu | metal : matrix-matrix multiplication kernel (#2615) | |
| 614 | 5517d6e69214cdead000a76983b9fe175c3f8329 | f31b5397143009d682db90fd2a6cde83f1ef00eb | 2023-08-14T15:16:54+08:00 | Jhen-Jie Hong | server : implement json-schema-to-grammar.mjs & add grammar param in the UI (#2588) | |
| 615 | f64d44a9b9581cd58f7ec40f4fa1c3ca5ca18e1e | b19edd54d51cef5e3616c18b1d0d8626895b2cba | 2023-08-13T00:24:45+02:00 | Johannes Gäßler | CUDA: Fixed OpenLLaMA 3b mmq, reduced compile time (#2590) | |
| 616 | 53dc399472d5bd35ee739b865e843b1996bd3814 | 9ca4abed893685692f90413e4d43153af12342d9 | 2023-08-12T06:35:14+08:00 | Equim | server: fixed wrong variable name in timing json (#2579) | |
| 617 | 1a941869cbef8e9cc351a6c6987e4ae3b0f021f7 | b5472ea0ada081a6e1c06998ebbc9a24aa2cd4a4 | 2023-07-27T11:00:54+03:00 | Georgi Gerganov | metal : disable graph concurrency optimization due to bug (#2413) | |
| 618 | da1889834a036a63ead2b0ca5c9ed8967712568c | 82552b7f5403ca13957ac9a2cdc1732470057b62 | 2023-07-25T14:32:20+02:00 | slaren | ggml : improve graph build time via hash table lookup (#2329) | |
| 619 | 1aa18ef994a6a2b531434eb13251ef48e56d345b | 9a08eaf3c4010962d0126e9e5bfbe9af64b2ac90 | 2023-07-25T08:00:19-04:00 | Shouzheng Liu | metal : concurrently dispatch commands (#2358) | |
| 620 | 9a08eaf3c4010962d0126e9e5bfbe9af64b2ac90 | 129d844c87d90e74aafc23dcc84c980fd408def4 | 2023-07-25T13:48:29+03:00 | Kawrakow | Another speed gain for Q4_0 and Q4_1 on Metal (#2375) | |
| 621 | 2f9cf974a066ac0e03fbb235d834b01b0164d743 | 4f06592cc6b83979e4b442e8cb97b3948c857188 | 2023-07-24T00:19:47+03:00 | Kawrakow | Some more Q4_K and Q5_K speedup on CUDA (#2346) | |
| 622 | d2a43664f93ba30a84e42713bb69f936cbdacf2a | b9b7d94fc10a8039befd1bc3af4f4b09c620c351 | 2023-07-23T08:49:20+03:00 | Kawrakow | Speed up Q4_K (#2322) | |
| 623 | b47b8a9cfeb439d271bf997fb985fd6d82b3af5e | b5fe67f8c69113bd9354bc1adcfe2df6be323740 | 2023-07-22T21:17:57+03:00 | Georgi Gerganov | llama : optimize memory buffers (#2325) | |
| 624 | 5d500e8ccf5eee3de3ae66685cc3be75e43e08b9 | 7d5f18468ceabd7a38f414f9f21b26b0c137f994 | 2023-07-22T11:48:22+03:00 | Georgi Gerganov | ci : add 7B CUDA tests (#2319) | |
| 625 | 4d76a5f49b9b5382dba5d13d92edb9159536c225 | 0db14fef06836caaa13cc123c0a24dc598bdb9f0 | 2023-07-21T17:05:30+03:00 | Kawrakow | Faster Q3_K implementation on Metal (#2307) | |
| 626 | e782c9e735f93ab4767ffc37462c523b73a17ddc | 785829dfe8baf0213f2ff66963d28c62f92d7930 | 2023-07-20T18:19:45+03:00 | Kawrakow | Faster Q5_K and Q6_K on Metal (#2294) | |
| 627 | 417a85a0010519224cf154eb85d383ffeafeeead | 294f424554c1599784ac9962462fc39ace92d8a5 | 2023-07-20T06:32:22-04:00 | Shouzheng Liu | metal: minor q4 optimization and reduce code size (#2248) | |
| 628 | 294f424554c1599784ac9962462fc39ace92d8a5 | 45a1b07e9b20c33d71d8c849ff27d693a75a0269 | 2023-07-19T15:06:40+08:00 | Rinne | llama : extend API to get max devices at runtime (#2253) | |
| 629 | 672dda10e4d8ac79df5d5970da7fb69d242ca9a7 | 27ab66e437797aedbb23b3599385756b6c26ac39 | 2023-07-17T03:57:28+08:00 | Qingyou Meng | ggml : fixed runtime bugs and compile errors related to GGML_PERF and GGML_DEBUG (#2219) | |
| 630 | c9c74b4e3f9dcfab8b0032749ff8a579ab4e4d8d | 3ec7e596b2ba3f43c22f441254ca2bcfa91102ba | 2023-07-12T00:18:43+08:00 | Bach Le | llama : add classifier-free guidance (#2135) | |
| 631 | 18780e0a5e17348236230bbe891901b9b5718709 | 3bbc1a11f04a9adc0d0e08c2940ba4d2978755ab | 2023-07-09T05:20:43-03:00 | JackJollimore | readme : update Termux instructions (#2147) | |
| 632 | 1d656d6360359cfdaaf5d64ed9690047b600dbcb | 72421402834141df6cbdcf595fe46dbd11874dce | 2023-07-08T00:24:01+08:00 | Qingyou Meng | ggml : change ggml_graph_compute() API to not require context (#1999) | |
| 633 | a17a2683d8fdb899ba497d0c28ccafb28c62efb6 | 31cfbb1013a482e89c72146e2063ac4362becae7 | 2023-07-06T09:17:50-07:00 | tslmy | alpaca.sh : update model file name (#2074) | |
| 634 | 31cfbb1013a482e89c72146e2063ac4362becae7 | 983b555e9ddb36703cee4d22642afe958de093b7 | 2023-07-05T16:51:13-04:00 | Tobias Lütke | Expose generation timings from server & update completions.js (#2116) | |
| 635 | 051c70dcd55709c9cbbfa849af035951fe720433 | 9e4475f5cf639315f61ed7b8da6258bb0c7c5ca9 | 2023-07-05T18:31:23+08:00 | Howard Su | llama: Don't double count the sampling time (#2107) | |
| 636 | b2132270678c473f7cd9ba871b03d694126bc33a | 2f8cd979ecd1fa582852e7136e92ff8990b98fd8 | 2023-07-01T20:31:44+02:00 | Daniel Drake | cmake : don't force -mcpu=native on aarch64 (#2063) | |
| 637 | b8c8dda75fdf5fdea49c80af36818e7c30fe0ddf | 96a712ca1b7f427e3bd7ffc0c70b2105cfc7fbf1 | 2023-06-29T21:15:15+08:00 | Howard Su | Use unsigned for random seed (#2006) | |
| 638 | 96a712ca1b7f427e3bd7ffc0c70b2105cfc7fbf1 | d3494bb86bf7ad5b0b60aae0220ea576f273b5c0 | 2023-06-29T11:56:43+08:00 | LostRuins | Porting the improved K-Quant CUDA kernels to OpenCL (#1966) | |
| 639 | a84ab1da8dc6a59a5b67420ae1322f09503ffc72 | 5743ca80928d8410754ec64a5673d5c2dd6cfbb7 | 2023-06-27T01:47:02+09:00 | katsu560 | tests : fix quantize perf (#1990) | |
| 640 | 6769e944c727c63612dcafbef52009d21ae00fff | cbebf61ca7584e9709265395f0127ae7fc0f1882 | 2023-06-26T19:43:07+03:00 | Kawrakow | k-quants : support for super-block size of 64 (#2001) | |
| 641 | 18b35625c3c19c64b7818a12460ba5ddb006dfdc | ba4e85a8339b9dd7cdffad31838235f2fe45a8ea | 2023-06-19T20:43:30+03:00 | Georgi Gerganov | ggml : fix bug in LBFGS optimizer (found by ggml tests) | |
| 642 | 794db3e7b982fee37e3995db9c3a216a57ff65e3 | 5ddf7ea1fb42bac21026de2f77e0f9c069b92234 | 2023-06-17T07:53:04-04:00 | Randall Fitzgerald | Server Example Refactor and Improvements (#1570) | |
| 643 | 3d0112261042b356621e93db3fa4c6798a5d098f | 602c748863e15270d80d74aa2c3bf86ab8139e07 | 2023-06-16T20:08:44+03:00 | Kawrakow | CUDA : faster k-quant dot kernels (#1862) | |
| 644 | a09f9195be39afb4b023b646c0a6ec8a86915174 | bed92756172d4514b23aaf9744cf8e2dc892fc7b | 2023-06-15T21:49:08+02:00 | Johannes Gäßler | Fixed CUDA runtime version check (#1879) | |
| 645 | 254a7a7a5ff4c874ff8488f1f5cbdd7e9c89d682 | 92549202659fc23ba9fec5e688227d0da9b06b40 | 2023-06-14T19:47:19+02:00 | Johannes Gäßler | CUDA full GPU acceleration, KV cache in VRAM (#1827) | |
| 646 | e32089b2c20b1b87b22912f4a8b93fe01647d5b9 | 2347e45e7bdb09c9a7d74b2c0bc86c2b65f0c343 | 2023-06-13T21:04:40+02:00 | xaedes | train : improved training-from-scratch example (#1652) | |
| 647 | 2347e45e7bdb09c9a7d74b2c0bc86c2b65f0c343 | 74d4cfa3438cb58bd177eed30014e6588694aaa8 | 2023-06-13T20:20:07+03:00 | Georgi Gerganov | llama : do a warm-up eval at start for better timings (#1824) | |
| 648 | 74a6d922f12ccfe16b0c265f43be8978c6f25e98 | e4caa8da59c1c97dc23fa336f4d726984a20560f | 2023-06-12T22:39:21+03:00 | Kawrakow | Metal implementation for all k_quants (#1807) | |
| 649 | e9b66ee9829039d4ab54550d6222e42a0b31e52a | 4f0154b0bad775ac4651bf73b5c216eb43c45cdc | 2023-06-10T11:28:11+03:00 | Kawrakow | metal : add Q4_1 implementation (#1785) | |
| 650 | 4f0154b0bad775ac4651bf73b5c216eb43c45cdc | ef3171d16241c18581d4d08374f0b9e396ade6b7 | 2023-06-10T01:59:17-06:00 | Kerfuffle | llama : support requantizing models instead of only allowing quantization from 16/32bit (#1691) | |
| 651 | 72ff5282bf0388c60821f504c4c8cc2b1f491aa6 | 0bf7cf1b296fc9fca05411b37afdf08a531487d2 | 2023-06-08T22:28:21+03:00 | Kawrakow | metal : add Q2_K implementation (#1762) | |
| 652 | 0f291e1f65c1d68201e71ce99c89562a36686b6d | 8fc8179919a11738910db07a800f2b176f8adf09 | 2023-06-08T19:46:22+03:00 | Kawrakow | metal : Q6_K implementation (#1752) | |
| 653 | 4161bdc04debb70bf5f275492b4d89fd9330087c | 0035858273ebe0694926bf4414d279f3e1cd109d | 2023-06-08T10:08:23+03:00 | Kawrakow | metal : add Q4_K implementation (#1733) | |
| 654 | 5c64a0952ee58b2d742ee84e8e3d43cce5d366db | 5b57a5b72676540b6a45a3f527126299969ad241 | 2023-06-07T10:59:52+03:00 | Georgi Gerganov | k-quants : allow to optionally disable at compile time (#1734) | |
| 655 | 35a84916fb029905c44746127026079268216e7a | 2d7bf110edd8c49209401a16132052cba706ffd0 | 2023-06-07T04:10:17+02:00 | Willy Tarreau | main: add the possibility to open the prompt cache read-only (#1640) | |
| 656 | f4c55d3bd7e124b101bc974cbbf0e0dbbc32d5a3 | f1465624c2cbc8ee65b566e3d87f2af27796d4c4 | 2023-06-05T23:32:36+03:00 | Yuval Peled | docs : add performance troubleshoot + example benchmark documentation (#1674) | |
| 657 | efe05076323f5c6bafece109e21cce046f5e4b07 | e7fe66e670537990ccc075cce9286df88bba052a | 2023-06-05T22:11:49+02:00 | grahameth | ggml : fix internal overflow in ggml_time_us on Windows (#1702) | |
| 658 | 99009e72f8072fa552eb02efee436be596c71cdd | 5220a991a5e92bddad9542267ab445a2c033681c | 2023-06-05T22:56:18+03:00 | Kawrakow | ggml : add SOTA 2,3,4,5,6 bit k-quantizations (#1684) | |
| 659 | 5220a991a5e92bddad9542267ab445a2c033681c | d1f563a743a83dabc11e125d4a7d64189c16498c | 2023-06-05T13:43:08+03:00 | Henri Vasserman | Increase 3B scratch buffers. (#1698) | |
| 660 | ecb217db4fcfa3880300ad08531a5fb6bb142d45 | dcb2ed48268e421baf25adc00d602dad0f415564 | 2023-06-04T23:34:30+03:00 | Georgi Gerganov | llama : Metal inference (#1642) | |
| 661 | 1fcdcc28b119a6608774d52de905931bd5f8a43d | ac7876ac20124a15a44fd6317721ff1aa2538806 | 2023-05-25T23:07:29+02:00 | Johannes Gäßler | cuda : performance optimizations (#1530) | |
| 662 | affc76edfdefa7b326f526e463cc65ff13fcfb92 | ea600071cb005267e9e8f2629c1e406dd5fde083 | 2023-05-20T14:19:28+02:00 | Johannes Gäßler | cuda : loading models directly into VRAM, norm calculation on GPU, broadcasting for ggml_mul (#1483) | |
| 663 | 2d5db48371052087a83974abda3767d1aedec598 | 6986c7835adc13ba3f9d933b95671bb1f3984dc6 | 2023-05-19T22:17:18+03:00 | Georgi Gerganov | ggml : use F16 instead of F32 in Q4_0, Q4_1, Q8_0 (#1508) | |
| 664 | c238b5873a1ea496db03ffcfe124c9d0d83afbc6 | 2b2646931bd2a2eb3e21c6f3733cc0e090b2e24b | 2023-05-17T22:47:58+08:00 | rankaiyx | benchmark-matmul: Print the average of the test results (#1490) | |
| 665 | b5c9295eef2b56e307393b35b3a923e3518d226e | eb363627fda5f47de8ab5e9be8abd426049d00df | 2023-05-14T22:46:00+02:00 | slaren | benchmark-matmul: fix clang-tidy issues, report results in GFLOPS (#1458) | |
| 666 | bda4d7c215aa16b2a78e522521dfc0e1c2e8b194 | 5a5aeb1e91009c72bf816400b758bb8a305616d7 | 2023-05-13T17:25:09+03:00 | Georgi Gerganov | make : fix PERF build with cuBLAS | |
| 667 | f954edda935a70a14cf0cc45ecc7fe7d60cf3e4b | f048af0230ad5381bb20b9e3c1467ec6fc7debdf | 2023-05-13T14:56:40+02:00 | xaedes | ggml : implement backward pass for llama + small training-llama-from-scratch example (#1360) | |
| 668 | b9fd7eee57df101d4a3e3eabc9fd6c2cb13c9ca1 | b608b55a3ea8e4760c617418538465449175bdb8 | 2023-05-12T00:23:08+03:00 | Georgi Gerganov | ggml : remove bit shuffling (#1405) | |
| 669 | 1b0fd454650ef4d68a980e3225488b79e6e9af25 | 3924088512d9e12e90ed6dbf28a6c5712481d33e | 2023-05-07T10:03:23+07:00 | swittk | ggml : Allow usage of CLBlast alongside Accelerate.framework (#1336) | |
| 670 | 58b367c2d757c0ea12aec672382462b42204c724 | ea3a0ad6b6b5ca4693b94acd4cb32e2803f66fae | 2023-05-01T18:11:07+02:00 | slaren | cuBLAS: refactor and optimize f16 mat mul performance (#1259) | |
| 671 | f0d70f147d969e41fa410b8af2965a27aa901eb9 | 3e5aa8a1c44051153d6d7b3eeca2f4b4e5fb310c | 2023-04-30T12:32:37Z | Stephan Walter | Various fixes to mat_mul benchmark (#1253) | |
| 672 | 7296c961d9303010a2b98379f738da2a8a55aa1b | 78ec543733d10a1629f984fd0302fdaa4e87fe66 | 2023-04-28T16:57:16+02:00 | 0cc4m | ggml : add CLBlast support (#1164) | |
| 673 | 574406dc7e350ddbffaeca33bf0392b7bfeb1436 | 87a6f846d3e929632c45916dd08f1e2a9c72d2a3 | 2023-04-26T23:14:13+03:00 | Georgi Gerganov | ggml : add Q5_0 and Q5_1 quantization (#1187) | |
| 674 | 87a6f846d3e929632c45916dd08f1e2a9c72d2a3 | ea3ad7eb60cfb44526a58122e8019850f437cd1b | 2023-04-26T20:08:43Z | Ásgeir Bjarni Ingvarsson | Allow setting the rng seed after initialization. (#1184) | |
| 675 | ec9cdb6752dd96b3cc74d90ad1adeba5b4fa2b0e | e4422e299c10c7e84c8e987770ef40d31905a76b | 2023-04-23T18:32:52+03:00 | Georgi Gerganov | ggml : do not print perf ops that have not been used at all | |
| 676 | 5f939498d517b4dddbe904f202e895a3ecfb9dc4 | 36b4f7e06406eed8a605cc9f2921d9244ef6a8e5 | 2023-04-22T11:10:39+02:00 | unbounded | ggml : unit test for quantization functions (#953) | |
| 677 | 36b4f7e06406eed8a605cc9f2921d9244ef6a8e5 | 10f19c1121068ce3dab9bece03a8b9caaea2db36 | 2023-04-22T16:56:35+08:00 | wbpxre150 | llama : print timings on ctrl+c exit (#1021) | |
| 678 | c5aa5e577741d0359ad26ec50b9e21a74c65d911 | e9a9cb0c54461ffbda75b7b2f99f3ea5562291c2 | 2023-04-22T07:37:05Z | Stephan Walter | ggml : AVX2 optimization for vec_dot_q4_3_q8_0 and refactoring (#1099) | |
| 679 | 50cb666b8a2e35a49b08c0f6bc81138c8f6f2ac1 | 25d7abbd1f73582b7e0fdc422a936e8541c0780b | 2023-04-21T21:59:17+02:00 | slaren | Improve cuBLAS performance by using a memory pool (#1094) | |
| 680 | 1bfc153e2f35ddd9d64b084e8d1a5e6fa57ad1c9 | 3d59769c3bb7e72c915646ddb1e239b1face19f5 | 2023-04-21T17:18:26+02:00 | Kawrakow | ggml : a faster version for Q4_1 x Q8_0 dot products (#1083) | |
| 681 | c8c2c524827be8fd681a63f0e5a697b0bf4c587b | 02d6988121510c067e06d498a273a351a888f5b9 | 2023-04-20T06:45:41Z | Stephan Walter | AVX2 optimization for vec_dot_q4_2_q8_0 (#1068) | |
| 682 | 02d6988121510c067e06d498a273a351a888f5b9 | 834695fe3a3ed2a962e774c9615e3f7b41d360a8 | 2023-04-20T03:14:14+02:00 | slaren | Improve cuBLAS performance by dequantizing on the GPU (#1065) | |
| 683 | f7d05095b404b5500b4a702ea16f67fc22446e49 | 884e7d7a2bfd7325b107442d6758983f5886ed3d | 2023-04-19T20:20:14+02:00 | Kawrakow | Q4_2 quantization with rmse-optimized scale and quants (#1062) | |
| 684 | 884e7d7a2bfd7325b107442d6758983f5886ed3d | 7cd5c4a3e9106151d48f328bb3c94c298a211f18 | 2023-04-19T20:10:08+03:00 | Georgi Gerganov | ggml : use 8-bit precision for Q4_1 intermediate results (#1047) | |
| 685 | 77a73403ca8eaced2590559d0f9cebd2b3649d32 | 50a8a2af97cb92e53e7a3195aa201c3d87da5415 | 2023-04-18T23:54:57+03:00 | Georgi Gerganov | ggml : add new Q4_2 quantization (ARM only) (#1046) | |
| 686 | 50a8a2af97cb92e53e7a3195aa201c3d87da5415 | 4caebf6d408b91c2d29d0abc7b1e867b5de64db5 | 2023-04-18T23:11:23+03:00 | Georgi Gerganov | ggml : scratch that - vmlaq_n_f32 is always better | |
| 687 | dcdd65e2969bc03c91a1ebd1160162d5054e6923 | 5ecff35151156118c2df74899637ad34ee384b9b | 2023-04-18T22:59:17+03:00 | Georgi Gerganov | ggml : optimize ggml_vec_dot_q4_0_q8_0() using vectorized accumulators | |
| 688 | 5ecff35151156118c2df74899637ad34ee384b9b | 7faa7460f03bdd88becf1e659cf359f274055404 | 2023-04-18T21:00:14+02:00 | Kawrakow | Adding a simple program to measure speed of dot products (#1041) | |
| 689 | f266259ad9a2bce5a34d919592310147af23f3dc | 47f61aaa5f76d04286792e2fbd0c95b659ab2af0 | 2023-04-17T15:10:57+02:00 | Ivan Komarov | Speedup the AVX-512 implementation of ggml_vec_dot_q4_0() (#933) | |
| 690 | 489537e6cf6c93b74a029a11533dbcaa89791dcc | 2d3481c72125cd388258864c7ad8d7d36777bad7 | 2023-04-16T12:13:00+02:00 | Pavol Rusnak | examples: add missing <ctime> include for time() (#1011) | |
| 691 | e95b6554b493e71a0275764342e09bd5784a7026 | aa485cee334e84437e21681c14b6f80b65876d8b | 2023-04-15T17:53:22+03:00 | Georgi Gerganov | ggml : add Q8_0 quantization for intermediate results (#951) | |
| 692 | c12b14b77fced0ce9a0e2d81f670c3a746dec251 | 106faaf2971d6c89d6010279a9a95737772470ef | 2023-04-15T07:51:54+02:00 | Ivan Komarov | benchmark : fix result validation in benchmark-q4_0-matmult (#987) | |
| 693 | 723dac55fa2ba7adc6e3fc8609781d1ad0378906 | 0f07cacb05f49704d35a39aa27cfd4b419eb6f8d | 2023-04-14T00:03:03-07:00 | comex | py : new conversion script (#545) | |
| 694 | c5d70f5c9ea5a8f0f6b0d6aa741455978a1dabfd | be87b6ed20a5f7528bf491a83e759a9fc6a24fea | 2023-04-14T14:24:52+08:00 | Howard Su | ggml : optimize rope function to avoid call powf in the tight loop (#807) | |
| 695 | d990e3fffc5b0f5448e90a16c79a4f2675100af0 | 9190e8eac8bdc108c40d2d7505e9b45fa773251f | 2023-04-13T18:32:36+03:00 | Georgi Gerganov | ggml : speed-up ggml_vec_dot_q4_1() ARM_NEON + 32-bit ARM support (#900) | |
| 696 | c85980acd04631a7c43d13676276f76ec72f5dfe | 6232f2d7fd7a22d5eeb62182b2f21fcf01359754 | 2023-04-13T18:01:22+03:00 | Georgi Gerganov | gitignore : benchmark | |
| 697 | 6232f2d7fd7a22d5eeb62182b2f21fcf01359754 | 6c248707f51c8a50f7792e7f7787ec481881db88 | 2023-04-13T14:59:50Z | Stephan Walter | ggml : optimize non-SIMD Q4_0 vector dot product (#703) | |
| 698 | 95ea26f6e92d620a5437f576b80868aee7f808d6 | 82d146df9b43cf677e0dbce20b03cf864958a0cc | 2023-04-13T14:46:23+02:00 | SebastianApel | benchmark : add tool for timing q4_0 matrix multiplication (#653) | |
| 699 | c3ac702e5ee3533457e0489df4906ee112fe88e7 | 9d634ef452d0fc24fcd49592952d13d0ab0f41b7 | 2023-04-10T22:40:28+03:00 | Georgi Gerganov | ggml : add ggml_cont() + optimize ggml_cpy() for contiguous dst | |
| 700 | f963b63afa0e057cfb9eba4d88407c6a0850a0d8 | aaf3b23debc1fe1a06733c8c6468fb84233cc44f | 2023-04-08T12:24:37-07:00 | comex | Rewrite loading code to try to satisfy everyone: | |
| 701 | eeaa7b0492fc79baab8bb1fe195d6c87159f2bd3 | 986b6ce9f99503c51ec5afd8a10baa32359434c6 | 2023-04-05T22:11:03+03:00 | Georgi Gerganov | ggml : multi-thread ggml_rope() (~3-4 times faster on M1) (#781) | |
| 702 | 986b6ce9f99503c51ec5afd8a10baa32359434c6 | 34162989297fdfe3ab7305451ce55bc87e3f4c9c | 2023-04-05T22:07:33+03:00 | Georgi Gerganov | ggml, llama : avoid heavy V transpose + improvements (#775) | |
| 703 | 0c44427df10ee024b4e7ef7bfec56e993daff1db | 594cc95fabab0b662dabba3ea619ca5dca18bf6b | 2023-04-05T17:38:37+03:00 | Ivan Stepanov | make : missing host optimizations in CXXFLAGS (#763) | |
| 704 | 437e77855a54e69c86fe03bc501f63d9a3fddb0e | cd7fa956904cb8e321b72b3499f4a3a82e43c266 | 2023-04-03T09:52:28+02:00 | SebastianApel | 10+% performance improvement of ggml_vec_dot_q4_0 on AVX2 (#654) | |
| 705 | 1d08882afa647c44195f4f6495a68ea455650cae | 02c5b27e91a6d18cf1043d3a2d8dbc59610ac257 | 2023-03-31T17:55:52+02:00 | slaren | Optimize AVX2 ggml_vec_dot_q4_0 (#642) | |
| 706 | 78ca9838ee36660a776e97e3391b6fb5dcaacf7f | a017390358cdb23fffb30988dc84bb190d0403ca | 2023-03-29T13:51:37-07:00 | Justine Tunney | Make loading weights 10-100x faster | |
| 707 | b51c717d5cf9181c33afcb84554e47f6d539c891 | 0ba76c1e73ae21038b80bfb5a746157376c88173 | 2023-03-29T22:15:34+03:00 | Georgi Gerganov | ggml : init time on first ggml_init() call | |
| 708 | 53635c081c49321d523567112f9fddfbba6b787b | 41318d708ed196ff727dce14d263a64b23c7333d | 2023-03-29T19:29:26+03:00 | Georgi Gerganov | py : add GPT4All conversion script | |
| 709 | 436e56193199a1625f8c561069f702e8840a9e08 | 20e1e84884376b3fb44ffbfd48d478b2934b0b5e | 2023-03-28T16:48:20Z | Stephan Walter | all : be more strict about converting float to double (#458) | |
| 710 | 29b7baab670ae8b76ac0da21c2ded69ff18971ee | 4a7129acd2e939b92d70dd568c746f2fa078232c | 2023-03-25T15:34:23+01:00 | slaren | Add timings for the prompt evaluation (#478) | |
| 711 | 481044d50cfe8eaa6cd0c1a1b445680e4b0b3ebc | 563cdc391dde140f1084d1012234e8e6f57f881f | 2023-03-24T08:19:26-07:00 | Cameron Kaiser | additional optimizations for POWER9 (#454) | |
| 712 | 8d4a855c241ecb0f3ddc03447fe56002ebf27a37 | b6b268d4415fd3b3e53f22b6619b724d4928f713 | 2023-03-24T08:05:13-07:00 | Luciano | Add embedding mode with arg flag. Currently working (#282) | |
| 713 | 305ba6f0e6daa3796aad9dd18053a1945dd4cc58 | 4122dffff958cd137175b58f1f27c0913528d7ba | 2023-03-22T18:16:35+01:00 | tjohnman | Don't force immediate interactive without `-i` (#354) | |
| 714 | f5a77a629bd0f37ae1696747633ab42a5530ec15 | da0e9fe90ccf6e73597eb19dd0cfc0a28363fb3b | 2023-03-22T07:32:36+02:00 | Georgi Gerganov | Introduce C-style API (#370) | |
| 715 | 353ec251a42491f5192c48561da4b444ef67f23c | 89d5d90f3b6d25f134da7a8e252c3432bffcf674 | 2023-03-21T14:21:50-03:00 | Fabio R. Sluzala | We could use std::unordered_map over std::map (#305) | |
| 716 | 16ffc013c62f22bdaa3cdc022d7a13fd952d73fc | 486ae645fd3eda8b9d7413d5ff34fb65a3e337fb | 2023-03-21T09:42:25-07:00 | comex | Importer for GPTQ quantized LLaMA models (#301) | |
| 717 | 486ae645fd3eda8b9d7413d5ff34fb65a3e337fb | 3ab3e6582f7320c2b6568c892fdfc8215caf7e6c | 2023-03-21T09:27:42-07:00 | Gary Linscott | Compute perplexity over prompt (#270) | |
| 718 | 2e664f1ff413995506c9a54f3a8d5b8c64e37a91 | 8cf9f34eddc124d4ab28f4d2fe8e99d574510bde | 2023-03-21T07:35:42-07:00 | Casey Primozic | Add initial AVX512 support for dot product on Linux (#320) | |
| 719 | 2af23d30434a677c6416812eea52ccc0af65119c | 904d2a8d6acd667c9633138d45a361d40fbf76d0 | 2023-03-17T10:47:06+01:00 | Bernat Vadell | 🚀 Dockerize llamacpp (#132) | |
| 720 | 904d2a8d6acd667c9633138d45a361d40fbf76d0 | 721311070e31464ac12bef9a4444093eb3eaebf7 | 2023-03-17T05:48:39+01:00 | Matvey Soloviev | Q4_1 quantization (#193) | |
| 721 | 84d9015c4a91ab586ba65d5bd31a8482baf46ba1 | 63fd76fbb06f9b723ca11505352387a3148b1814 | 2023-03-13T18:36:44+02:00 | Georgi Gerganov | Use vdotq_s32 to improve performance (#67) | |
| 722 | 63fd76fbb06f9b723ca11505352387a3148b1814 | 2a20f48efad692a8c2744f10c673bbdbe0c751b7 | 2023-03-14T01:33:43+09:00 | uint256_t | Reduce model loading time (#43) | |
| 723 | 113a9e83ebc0f788f861394437087bf3ca0e019b | 404fac0d623c9eea74ad7a9347da69e33f10984e | 2023-03-13T00:56:10+02:00 | Georgi Gerganov | 10% performance boost on ARM |