Files
calculet-npu-research-archive/history/llama.cpp/topics/09-fixes-reverts-failures.tsv
T

628 KiB

1fd9bd632f346085920d523dd307a3e4c11cc0a05e08e473cf292ba73789769b993bb35bcdfc316892026-06-01T14:15:35+08:00wangbomengHEAD -> dev, origin/devllama-bench: fix device-info
2f86112d6758298241ab2fa84ad4f0f7b1ace35c6d1bc743c10080fed1253686ce01749b42611ded42026-05-29T16:40:38+08:00wangbomengadd dump_pos,fix pos_tensor of pre_by_embeds
3f131bf1908b8c5dd1f49d7ae7f616506fc47166633d96dae28e17208ef61a71dba40cda3c04f135a2026-05-27T09:38:51+08:00wangbomengfix patch of qwen2.5vl,n_patch of minicpm = 64,fix n_ctx_slot,comment out M-ROPE
463442fde8dc285817f725bd6c5fae80f478a3813fc3f4a9fab88e98eff8eeca8cbc6617333edba2c2026-05-20T11:47:42+08:00wangbomengfix ubatch and cmakelist
5c931ef3163940227c9b6291e04216245cce21429a43741244a646d3f8fa3ff01bb9b7d059223d0a52026-05-18T17:34:37+08:00wangbomengcalrt: fix prefill_by_ids.fix create_buf
62716130010c58f1cdd9d94f0e2f8e047bc92dc66b35bda124ccd4ed581dd6088d3ffa4931c2809b62026-05-18T08:40:54+08:00Yunzhe Jiafix n_ctx_slot error by adding runtime capacity loading for cal-llm
7a43741244a646d3f8fa3ff01bb9b7d059223d0a5b2003d6c90ef0fa26ab9e930ba3e22b355eb3d392026-05-15T14:39:53+08:00wangbomengrun llama-passkey successfully, fix llama-bench, copy 3 times input to infer qwen2.5vl
8b35bda124ccd4ed581dd6088d3ffa4931c2809b681a2cbd4cef5d28334ff513d6b69e593d9d1cb492026-05-15T09:19:31+08:00Yunzhe JiaImplement vocab-only model initialization and enhance cal-llm backend error handling
9fabcc7dac4b34d83fe430980bb364b81087c7ee91e9787962f20a7e82c71589ac1dd0585454e4bfe2026-04-30T16:17:17+08:00wangbomengcalrt: fix encode dump
10f584311c716dd078c4b737eebbfda97fe12b7274a339954cc2a145a80c5ea349e7896211916cbed92026-04-30T16:05:15+08:00wangbomengcalrt: fix encode dump
110b8e43943846a1cd05c26c9186b9ef778ebae6e25eb46fffbd2e260c540fb112314ad67bbb8f56b62026-04-26T08:43:43+08:00wangbomengto debug
12509670642e8090a1713f5d73590b549be827aaef5d219bfcef239c1e3ddd1baecc0514a9462ff6a82026-04-24T09:40:34+08:00wangbomengrm debug code
1399dd308adb8488fa869bb669e3335e646a938eff06c7852e99e34c71e24e3ef6001cb54c72970e4d2026-04-21T15:50:01+08:00wangbomengtag: v0.2.1server: fix max_seq_len
14ed62eb33447f993d578e156a3c7e38c91b420ece015e988a271573a7c11e2a4b45084e1219d69d502026-04-21T15:05:22+08:00wangbomengtry server-test:not success
15015e988a271573a7c11e2a4b45084e1219d69d5099962021f2dd1994dbbf90d5712f0ca2633f20f82026-04-17T16:56:08+08:00wangbomenglittle change
16d8b2aaa00049978cebac15041f960d75b552f97bb6f29ec8140028619efaa50aa6e73146cecf631d2026-04-13T11:23:44+08:00wangbomengserver: fix context-shift
17b6f29ec8140028619efaa50aa6e73146cecf631d6d55eae7e76b768acfcec045b8e84cded8ae3b552026-04-13T11:23:31+08:00wangbomengserver: fix context-shift
1842a181674565411efa5c8b318bc77d6fd084df8abd3a57a11aa008e0b5dc2a30f82fcd3a025872082026-04-10T09:06:55+08:00Yunzhe Jiafix prompt_cache issue
19a2d5bf362d6c9a546f9deadf4f8975605a915d33bd3a57a11aa008e0b5dc2a30f82fcd3a025872082026-04-09T21:01:46+08:00Bomeng Wangserver: comment fixed time
20fcfcdf80b01664a08fb12df879a05df3cc0eba700cd44929b442860dc0e5f88976108be82350f9dc2026-04-09T19:41:52+08:00Yunzhe Jiatmp fix one run >4K problem
21b8153b6b8f244b223c9f4c2940ae1f212634519e82842cfc3fa3d5c004c4540aeff8a81f38509bee2026-04-09T15:07:02+08:00wangbomengserver: fix limit tokens to max_seq_len
2282842cfc3fa3d5c004c4540aeff8a81f38509bee622a22991089c6debd5f4b57738f3df3a0bda8b52026-04-09T15:06:26+08:00wangbomengserver: fix limit tokens to max_seq_len
23ecf01a17651cd7b1e8b85fd6075e83831463ee2399d2078e89305035d87d966cee7987c7d50b39252026-04-09T09:47:55+08:00Yunzhe Jiafix n_parallel problem
2499d2078e89305035d87d966cee7987c7d50b39259626239f5a9e568c9975d67dd6745fef90279a872026-04-08T19:01:16+08:00Yunzhe Jiafix buffer resize problem
259626239f5a9e568c9975d67dd6745fef90279a87da724f3e2a8af2c2537e3edcff41e9415ac66fef2026-04-08T17:47:04+08:00wangbomengcalrt: fix MapBuf
26e126c21ed7b793b648d63533ea7ee30885f5a82a5603e050af07173589f3b8850121263d86da01fd2026-04-01T10:07:12+08:00wangbomengsever: fix commit id
271e8a16cd0e3ad3c9a0f8746852a0a38c6e52322e893e52bda0fee99bbda1521ea733a760bc4201f12026-04-01T10:14:22+08:00wangbomengcalrt: fix slice and add infer/copy time
283c08ebf0e442cd730ddffd959ec676f9caf31c82613bc2b9a9d7af92efbe42d876ffcdb244f7a00e2026-03-24T02:43:03+08:00wangbomengcalrt: comment LOG_ERROR in untile_decode_cpy
29613bc2b9a9d7af92efbe42d876ffcdb244f7a00e4e194ecc6c4b8ebe4c72d93f6055e3605dbfcefa2026-03-24T02:30:12+08:00wangbomengcalrt: fix max_seq_len judgment
304e194ecc6c4b8ebe4c72d93f6055e3605dbfcefa16cbf81a731f5839a2f6b0eb9d8539826353748b2026-03-24T01:59:03+08:00wangbomengcalrt: fix ubatch.embd cpy
3116cbf81a731f5839a2f6b0eb9d8539826353748b8b4e17d990c23025148c4abadefe1010a0dd07342026-03-23T09:38:21+08:00wangbomengcalrt: fix model_name of untile_cpy
3207817cefc14fa359dcecad0630defd3610f8f5c8b2c45d8ddefb7ec09435231c8ec5b736fabf9c912026-03-10T16:32:07+08:00Yunzhe Jiafix kv issue
33f8fba66b657c51a1df1efc7267bfea9f6140cebfdb4a61d2234c2f457b42ecc3f7219a1e1a35508a2026-03-06T15:06:36+08:00Yunzhe Jiafix calrt_install include path
347a3a9a0e76bb5f530beafcfe52e87e388e93117a583c387efaf7bc030574e554088de79d09a27fbd2026-03-05T07:24:59+08:00wangbomengcalrt_infer: fix past_kv_len
350bd95719fed2f0247c8d0199dd897d24157dfae6365eb0b719e30b0f9e348d854f11c9c3f954a96e2026-02-07T10:25:06+08:00Yunzhe Jiafix get_model_by_name
36886cd1fb3b217efcf51c46209fcb6940223467979328f21378275f2354a19c3af907332b216ab4922026-02-06T17:36:54+08:00Yunzhe Jiafix compile problem
377eeb241aad429a68fb8cfa3ba85d000fb2348cd2dfb6250031a25058dbc3757e8a7ec75d90dcb48a2025-11-21T09:20:01+08:00Yunzhe Jiafix byte_size error
381f5accb8d0056e6099cd5b772b1cb787dd590a132759ccdb4adc8568add4316780d5e675519b07752025-11-04T05:04:59ZNoahFix garbled output with REPACK at high thread counts (#16956)
39c5023daf607c578d6344c628eb7da18ac3d92d32e7da30b584dc1f2ee0414c4a1298ce64eef97e8d2025-11-03T11:47:57-08:00lhezopencl: support imrope (#16914)
40e7da30b584dc1f2ee0414c4a1298ce64eef97e8ded8aa63320393512bdcfe4b05b5ae01ba91888e12025-11-03T18:53:26+01:00Aleksander Grygierfix: Viewing multiple PDF attachments (#16974)
41ed8aa63320393512bdcfe4b05b5ae01ba91888e148bd26501b08a3f0bff1249db47f313641f7bebb2025-11-03T18:01:59+01:00Daniel Beveniusmodel-conversion : pass config to from_pretrained (#16963)
42fcfce040e816c542f374ad51461b3561d73c4bc9ee3a5a10adf9e83722d1914dddc56a0623ececaf2025-11-03T14:40:02+08:00Jinyang Heggml : LoongArch fixes (#16958)
437e994168b1ccc12337ba8de939c4fd466107c1fbbcfa87622ae46be6345a8e3dfdbdc5ba5414042b2025-11-03T03:35:33+02:00shani-fSYCL: optimized repeat_back kernel (3× fewer asm instructions, 2× faster)Feature/sycl repeat back opt (#16869)
44bcfa87622ae46be6345a8e3dfdbdc5ba5414042ba2054e3a8ff0da3978a4acc18c349ff58554d3362025-11-03T00:41:08+01:00Sascha Rogmannfeat(webui): improve LaTeX rendering with currency detection (#16508)
45a2054e3a8ff0da3978a4acc18c349ff58554d336dd5286805004db1f9ac3176a1cbbfe373bdda0f82025-11-03T04:40:30+05:30Shagun Beratest-backend-ops : fix segfault in moe-expert-reduce test in support mode and coverage (#16936)
46dd5286805004db1f9ac3176a1cbbfe373bdda0f86b9a52422bac0f50dd8f1f8386744fa3ce9783bf2025-11-02T23:11:21+01:00Sigbjørn Skjæretci : disable failing riscv cross build (#16952)
472f966b8ed87514e74bb96592217226cb6a6974ddcd5e3b57541ecc52421130742f4d89acbcf77cd42025-11-02T22:21:48+02:00Georgi Gerganovclip : use FA (#16837)
48cd5e3b57541ecc52421130742f4d89acbcf77cd487c9efc3b297b8a498716b1db3d061842e6fc85b2025-11-02T18:14:04+02:00Georgi Gerganovserver : support unified cache across slots (#16736)
49a864132ba546b6385922226480ee4e392aaa065cd38d9f0877a5872daa3c5f06fb9a86376bf15d502025-11-02T08:48:46+08:00Aaron Teodevops: fix failing s390x docker build (#16918)
502f68ce7cfd20e9e7098514bf730e5389b7bba908e4a71599e5846110159955dec0008eb4aa24222b2025-11-01T19:49:51+01:00Pascalwebui: auto-refresh /props on inference start to resync model metadata (#16784)
51cf659bbb8ef9eb048e5153a27cf787fd83c05560d8b860a219c2415faac8cc0e50b48b4aa11e3b642025-11-01T15:51:36+01:00Xuan-Son Nguyenmtmd: refactor preprocessing + support max/min pixels (#16878)
521ae74882f8f6755e44dff8f23f3abdc5b53ab7c1961660b8c395afb8903f61ace69396a158ea0cb42025-11-01T15:02:57+01:00Jaromír Hradílekwebui: recognize AsciiDoc files as valid text files (#16850)
535d8bb900bc7daa84bfa7bb1d25ab7e32394919f32e76e013600cb0d51ccf158571ca1d0502952a072025-11-01T00:52:14-05:00Jeff Bolzvulkan: Fix multi_add invalid descriptor usage (#16899)
542e76e013600cb0d51ccf158571ca1d0502952a07d3dc9dd898be805c23a408cc36daed5b3bf292212025-11-01T00:45:28-05:00Jeff Bolzvulkan: fuse mul_mat+add and mul_mat_id+add_id (#16868)
55d3dc9dd898be805c23a408cc36daed5b3bf29221bea04522ff1a0d8559ccfd353aa018dcfbb608cc2025-11-01T06:13:26+01:00Oliver SimonsCUDA: Remove unneded bias/gate dims in fused mmvq (#16858)
56bea04522ff1a0d8559ccfd353aa018dcfbb608cc0de0a01576772032008a689afc4d7c80685074c42025-10-31T23:40:23+01:00Piotr Wilkin (ilintar)refactor : llama-model.cpp (#16252)
578da3c0e200a586f768ada6f38745acb01380174cc22473b580807929fd9e3a3344a48e8cfbe6c88f2025-10-31T13:50:33+02:00Georgi Gerganovbatch : fix consistency checks for the input positions (#16890)
580f715b4e759acceccb9f437cfd2a988fff85514ad2d931f173b8a736b08999436e9259aafddec7182025-10-31T09:51:26+01:00Daniel Beveniusserver : fix typos in server.cpp comments [no ci] (#16883)
592976b0374d36609b0429dd6ce48807e2ad39a7c2d2a2673dd1c86a01ab010e18b13b8bb959968c482025-10-31T16:18:59+09:00Masato Nakasakavulkan: Fix crash when FP16 mul_mat accumulation is not supported (#16796)
60d2a2673dd1c86a01ab010e18b13b8bb959968c4813002a08960e51a76c4d696165b5d7638d2f2b992025-10-31T08:14:49+01:00Ruben Ortlamvulkan: fix shmem overrun in mmq id shader (#16873)
619984cbb61d12491d604484fb38b678fa15064061ce18efeaf1234bd08f25bc08f88ef95cf5d9e51f2025-10-30T16:00:20-07:00lhezopencl: fix boundary handling for mul_mm (#16875)
62b52edd25586fabb70f0c21b274473b307cf14499517b7170e1a4d733583c4b07c5b7a49acc05911c2025-10-30T18:42:57+02:00Georgi Gerganovserver : remove n_past (#16818)
63835e918d8428f5119927d7150bf5a26176dedda0d261223d24e97f2df50220e4a5b7f0adb69bba812025-10-30T21:17:31+05:30Shagun Beracommon: fix typo in cli help text (#16864)
64d261223d24e97f2df50220e4a5b7f0adb69bba81dcca0d3ab840ebe9b2ccd4719033d408eeb758d72025-10-30T23:19:14+08:00JJJYmmmmodel: add support for qwen3vl series (#16780)
65bacddc049a00786df44e682262f6e298742bfbc3229bf686287d18f82c44e89888cc662145ecfdb42025-10-30T07:18:50-04:00Tianyue-Zhaomodel: Add support for CogVLM model (#15002)
66229bf686287d18f82c44e89888cc662145ecfdb4d7395115baf395b75a73a17b0b796e746e468da92025-10-30T08:56:28+01:00Sigbjørn Skjæretcuda : fix argsort with 64k+ rows (#16849)
673464bdac37027c5e9661621fc75ffcef3c19c6efe3af5563bd049141e036b50f843196db33d23e972025-10-29T20:11:39+01:00Xuan-Son Nguyenllama: fix ASAN error with M-RoPE (#16848)
68e3af5563bd049141e036b50f843196db33d23e9710fcc41290e233788f5a4215314156e8e023eb922025-10-29T18:09:18+01:00Xuan-Son Nguyenllama: store mrope data in KV cell (#16825)
69bcf5bda6f5df559565d11d7c8e8295c1159a85ec3eb2be1ca5f37480aeb16102970d9e65f43347fe2025-10-29T14:39:03+01:00Ruben OrtlamVulkan MMQ Integer Dot Refactor and K-Quant support (#16536)
709a3ea685b937c0f0cbfda2e50004ea54bf187512338074c383c81366320d176d83b94b0a567ee0c22025-10-29T15:55:06+08:00Aman GuptaCUDA: Fix bug in topk-moe for gpt-oss (#16821)
71338074c383c81366320d176d83b94b0a567ee0c2851553ea6b24cb39fd5fd188b437d777cb411de82025-10-29T08:14:39+02:00YaelLogicsycl: add RMS_NORM_BACK operation support (#16808)
721c1409e13169d0ced4b1b4d39fb5b268b75250917a0e900e3615fa46c074a7fdf900b47d3c0a1c7e2025-10-28T03:51:41-07:00Sam Malayekembedding: add raw option for --embd-output-format (#16541)
73ad8d36beffd791db10c94eb9e964afb891e3ca55c053e18a66dd95dc340aa61317877c2a41d4e3cf2025-10-28T03:50:33+02:00tamarPalsycl: add SSM_CONV operation support (#16800)
74e1ab0848037c9f9bfe68b3e1cee9ee375e1018a35a4ff43e7dd049e35942bc3d12361dab2f1555442025-10-27T23:12:16+01:00Xuan-Son Nguyenmtmd : fix idefics3 preprocessing (#16806)
755a4ff43e7dd049e35942bc3d12361dab2f15554410640e31aab0819f31c1e1f2d008b019ee7372322025-10-27T13:51:28-07:00Diego Devesallama : disable pipeline parallelism if compute buffer allocation fails (#16748)
7610640e31aab0819f31c1e1f2d008b019ee73723280d28f104c0c3e61c11d6af073642b246a9fc19c2025-10-27T21:50:22+01:00Aclyggml : fix interpolate with align-corners and ne=1 (#16700)
7780d28f104c0c3e61c11d6af073642b246a9fc19cc55d53acec864f64afa1ba92972203dce1bf88f52025-10-27T21:39:49+01:00Johannes GäßlerHIP: fix AMDGPU_TARGETS, update documentation (#16803)
78945501f5ea4b8ca56b181ecb035e9ee3fb31f43275cbdd3fce38ea12d50cd19e73a069aa5dbbd5fa2025-10-27T09:17:31+01:00Johannes Gäßlerllama: fix leaked buffers for mmap + split files (#16765)
7975cbdd3fce38ea12d50cd19e73a069aa5dbbd5fa2b9bd9bf4e759c05db629ec1c391dc8aeaa718872025-10-27T09:25:10+08:00Aman Guptatest-backend-ops: print failed tests at the end (#16785)
802b9bd9bf4e759c05db629ec1c391dc8aeaa7188759fc1ec8e83b14354c1a3a8acf8c5c2cbf9af42f2025-10-27T03:20:24+02:00tamarPalsycl: add ROLL operation support (#16665)
8159fc1ec8e83b14354c1a3a8acf8c5c2cbf9af42f75d33b9302f84a5b89f82205d2bcd8def5a64e0a2025-10-27T03:19:50+02:00shani-fsycl: add REPEAT_BACK operation support (#16734)
82bbac6a26b2bd7f7c1f0831cb1e7b52734c66673b73a48c9790d320476b3e5ef75bda09f2f8269e6e2025-10-27T02:13:31+08:00leejetggml: fix cuda kernel launch configuration for k_compute_batched_ptrs to support large batch (#16744)
833cfa9c3f125763305b4226bc032f1954f08990dc5d195f17bc60eacc15cfb929f9403cf29ccdf4192025-10-26T06:37:38+02:00Gilad S.vulkan: deduplicate Microsoft Direct3D12 devices (#16689)
845d195f17bc60eacc15cfb929f9403cf29ccdf419226f295f4dd92ad714533adc5497afed5fa88bb82025-10-25T20:41:36+02:00Galunidconvert : handle mmproj filename/path properly (#16760)
8555945d2ef51b93821d4b6f4a9b994393344a90db0bcb40b48c6fc6f17ba9672625e526ab2574344b2025-10-25T03:39:37+08:00leejetggml: fix CUDA grid launch condition for large block_nums.y in binbcast (#16742)
8669e9ff010309a1155d704cf9320bdb3aaf4160ca5a91109a5d7dab5d7adc40bedb397ede99a705b12025-10-24T14:10:29+02:00Florian Badiewebui: support q URL parameter (#16728)
875a91109a5d7dab5d7adc40bedb397ede99a705b1f8f071faddf32ea09f4234edb6e809b380a9ee262025-10-24T12:02:02+02:00Daniel Beveniusmodel-conversion : add trust_remote_code for orig model run [no ci] (#16751)
88f8f071faddf32ea09f4234edb6e809b380a9ee260bf47a1dbba4d36f2aff4e8c34b06210ba34e6882025-10-23T16:31:41-04:00compiladeconvert : handle pre-quantized models (#14810)
89dd62dcfab97e420949519fd0eac9fca7bf97e635d0660f237a5c31771a3d6d1030ebe3e0c409ba922025-10-23T15:54:46+02:00Julien Denizeconvert : Make mistral-common dependency optional (#16738)
90d0660f237a5c31771a3d6d1030ebe3e0c409ba92fe6a9882acf5c02f96624ed8f80144100d7006cb2025-10-23T15:00:49+02:00Xuan-Son Nguyenmtmd-cli : allow using --jinja (#16718)
919de9672adb0f4ca4e39483ac3ffed52b3f70a55d63d2fc46e17a06be5b4b5823a5ada088317f1f0a2025-10-22T20:05:15-05:00Matthew Michelsycl: use async memory allocation to fix crashes during graph recording (#16644)
9263d2fc46e17a06be5b4b5823a5ada088317f1f0aa2e0088d9242bd9e57f8b852b05a6e47843b5a452025-10-22T13:47:09-07:00Max KrasnyanskyAdd experimental ggml-hexagon backend for the Hexagon NPU (#16547)
939b9201f65a22c02cee8e300f58f480a58859122719a5a3edfd306516cc419679d69d6435943b68162025-10-22T16:58:23+02:00Pascalwebui: introduce OpenAI-compatible model selector in JSON payload (#16562)
94d8eaa26e4d9228df3aa46a930db60c8eaab67c1b9285325ce0174631c3cd6121d56084adc4ef2d8f2025-10-22T12:01:22+02:00Aclytests : fix test-thread-safety when compiling with multiple backends (#16699)
959285325ce0174631c3cd6121d56084adc4ef2d8f03792ad93609fc67e41041c6347d9aa14e5e0d742025-10-22T12:33:08+08:00Aman GuptaCUDA: fix bug in topk-moe softmax (#16711)
9651d1a8c997bd2629ef211a30208058ea87a309824926419c4d74a1cf724e7163d937eb72f36e7b262025-10-21T15:27:53+02:00Johannes GäßlerCUDA: better error for FA kernel with 0 occupancy (#16643)
976ea37f57391d27736c35cd3c20c1f990b7952b74fb349848f387f355450c3187556e71e6d32c145f2025-10-20T22:26:17-07:00lhezopencl: fix warnings and clean up profiling (#16688)
986de8ed75196c7cd98c1f34bbf3a7452451ba8ac284bf3c677857279037adf67cdcfd89eaa4ca92812025-10-21T01:21:12+03:00YehuditEsycl : add PAD_REFLECT_D1 operator support (#16145)
9984bf3c677857279037adf67cdcfd89eaa4ca9281c9c1972e2c2cc6a771fcc145bfa138700179f9612025-10-20T21:38:20+02:00Sigbjørn Skjæretmodel : add BailingMoeV2 support (#16063)
100b617cfd2896edd592a36ebbc041817eb030a100579068501fac9a74cca7129a8e5a8281b410a853e2025-10-20T05:53:50-07:00Diego Devesaggml-alloc : fix leak when reusing a tensor with a larger size (#16679)
10179068501fac9a74cca7129a8e5a8281b410a853e0e4a0cf2fae667d3efcf52f2f52398779d986b1d2025-10-20T14:21:12+02:00Aleksander GrygierPrevent premature submission on IME input (#16673)
1020e4a0cf2fae667d3efcf52f2f52398779d986b1d13f2cfad4170c096c51a02c24a6a158cb47f14802025-10-20T13:29:14+02:00Aleksander GrygierImport/Export UX improvements (#16619)
10313f2cfad4170c096c51a02c24a6a158cb47f148006332e28672356b964d6dfc2ba4657e20581cd432025-10-20T12:41:13+02:00Aleksander GrygierEnable per-conversation loading states to allow having parallel conversations (#16327)
10406332e28672356b964d6dfc2ba4657e20581cd4372d53e6c4decee8b339e49aed8cc0e234b9639dc2025-10-20T16:27:09+08:00takuya kodamallama-batch: fix build fails with `-Werror=missing-braces` (#16614)
1052330de7b847ca84eac766df372c604c26db727477062dd8460685d6700ed7621e50a22c6f3400ca32025-10-20T11:08:32+03:00safranowithSYCL: Add support for FLOOR,CEIL,ROUND and TRUNC unary operators (#16613)
1067062dd8460685d6700ed7621e50a22c6f3400ca30398752dd450dfabdd1b9e289f6364c2600f6ab52025-10-20T15:44:21+08:00takuya kodamallama-context: only warn on pooling_type when user specified (#16674)
107c20c0a5c0c44179f5267a262546624854b1203d162425b3a7e8b169a3bbe6ce8c7324513a7fcee8c2025-10-20T14:41:08+08:00Yunzhe Jiakv: turn on common-prefix mtmd: fix output size bug
1084f73d0a95120687e2c527739f771330a5271259acec5edbcaec69bbf6d5851cabce4ac148be417012025-10-20T05:06:39+08:00Aaron Teoci : fix binaries release failure for s390x (binaries may not work yet) (#16664)
109ee09828cb057460b369576410601a3a09279e23ce56abd2098dd2e2b0804691b93c13b48ae4216272025-10-18T14:47:32+02:00Johannes GäßlerHIP: fix GPU_TARGETS (#16642)
11081387858f1fbcc1acedbd308486e1016618ca8f866b0dbcb2d462e7b70ba5a69ee8c3899ac2efb1c2025-10-17T17:55:32-07:00Shawn Guopencl: transposed gemm/gemv moe kernel with mxfp4,f32 (#16602)
11166b0dbcb2d462e7b70ba5a69ee8c3899ac2efb1c41386cf365d894134ee0813d15e2f5d76f6a4d8e2025-10-17T17:41:09+02:00Johannes Gäßlerllama-model: fix insonsistent ctxs <-> bufs order (#16581)
11241386cf365d894134ee0813d15e2f5d76f6a4d8e3d4e86bbeb15f487d6da6174ba6191b7c212cc252025-10-17T18:02:52+03:00Radoslav Gerganovrpc : report actual free memory (#16616)
113342c728d031d50673feded797520a44127d73379ababae7e1ec3e9cfdab0322ee55ea3389e82a4d52025-10-17T18:01:23+08:00muggle-stackggml : fix SpaceMit IME array out-of-bounds in task assignment (#16629)
114ababae7e1ec3e9cfdab0322ee55ea3389e82a4d5b19491599d4d42c606601d75e95c1d1de3291f8e2025-10-17T10:35:03+02:00Pascalwebui: reorganize settings layout (#16607)
115b19491599d4d42c606601d75e95c1d1de3291f8e9ad4f1931ee0f3b41d9355245ef744786aaae0aa2025-10-17T02:31:04-05:00Jeff Bolzvulkan: fix debug build (add_rms_len/data not found) (#16624)
1169ad4f1931ee0f3b41d9355245ef744786aaae0aa79967ec596c0dacfd2251b085a57e79df292b1cc2025-10-17T02:33:58-04:00Ilia Ilmermetal : add `CONV_TRANSPOSE_2D` (#16542)
117ceff6bb253dd306f5404d7ccb3f11fadafe71b521bb4f43380944e94c9a86e305789ba103f5e62bd2025-10-17T05:36:40+03:00GittyBursteinSYCL SET operator optimized for F32 tensors (#16350)
118683fa6ba4ed3a23b939d3e11e6dc860bd47a0ccfb22572e97dc51757d3ebe917a5a283385010ec682025-10-16T16:28:41+02:00Pascalfix: added a normalization step for MathJax-style \[\] and \(\) delimiters (#16599)
11962425b3a7e8b169a3bbe6ce8c7324513a7fcee8c76a63a2998286c1649de2496bccb7d8a465498952025-10-16T17:34:39+08:00Yunzhe Jiakv: let seq_rm free whole seq since current hw-op cannot support common-prefix
1207a50cf388a530127cbbdd2a507ef81a451c9d8196f5d924637a15abedb111cbbffd7da5f31c818552025-10-16T16:41:11+08:00Chenguang LiCANN: format code using .clang-format (#15863)
12176a63a2998286c1649de2496bccb7d8a46549895b67217078aa748b06e1b2269d88dd18c0aca2c262025-10-16T16:31:15+08:00Yunzhe Jiakv: fix common-prefix bug by implementing llama_memory_seq_rm
1226f5d924637a15abedb111cbbffd7da5f31c81855adc9b60f190c1016a09f439862fa1cbb302262ac2025-10-16T01:11:33-04:00takasurazeemcommon : Update the docs on -t --threads (#16236)
123adc9b60f190c1016a09f439862fa1cbb302262acee50ee1eadff58777ae746827b04de7ba0befc552025-10-16T13:10:32+08:00takuya kodamaggml-cpu: replace putenv with setenv for const-correctness (#16573)
124ee50ee1eadff58777ae746827b04de7ba0befc557adc79c03234de9a20661fd6dbf2d02c32ca7acb2025-10-16T07:21:28+03:00yael-worksSYCL: Add GGML_OP_MEAN operator support (#16009)
1257adc79c03234de9a20661fd6dbf2d02c32ca7acb466c1911ab736f0b7366127edee99f8ee56874172025-10-15T22:43:08+02:00Aleksei Nikiforovgguf-py : add support for endian conversion of BF16 data (#16594)
1260cb7a0683b0529172472d74d21f05470a607f297d93f8439b08c4f35e13a41a7366901fdbe770fc82025-10-15T10:51:04-07:00lhezopencl: add q8_0 mm support (#16469)
127d93f8439b08c4f35e13a41a7366901fdbe770fc8f9fb33f2630b4b4ba9081ce9c0c921f8cd8ba4eb2025-10-15T10:48:28-07:00lhezopencl: fix FA for f32 (#16584)
128f9fb33f2630b4b4ba9081ce9c0c921f8cd8ba4ebf4ce81c45e7bd910e36bf44c253fc5255c49b1e42025-10-15T16:22:20+02:00Aleksander GrygierAdd server-driven parameter defaults and syncing (#16515)
129f4ce81c45e7bd910e36bf44c253fc5255c49b1e417304cbcc1dd24de7741cbe57925d58e90a98ac12025-10-15T23:05:56+09:00Sam/Samuelmetal: optimise `GGML_OP_SUM` (#16559)
13017304cbcc1dd24de7741cbe57925d58e90a98ac13e3cb19f6449f9168a128eaeae01f8f41b049acc2025-10-15T16:53:12+03:00Georgi Gerganovserver : fix img token logs (#16595)
1313e3cb19f6449f9168a128eaeae01f8f41b049acc5acd455460f457942d8dd02e3dd9b1eebfce99fe2025-10-15T14:48:08+02:00Xuan-Son Nguyenllama-quant: add support for mmproj (#16592)
1325acd455460f457942d8dd02e3dd9b1eebfce99fe554fd578a5ed78a10f371f5850c6a69aa83df15a2025-10-15T13:54:15+02:00Julius TischbeinCUDA: Changing the CUDA scheduling strategy to spin (#16585)
133554fd578a5ed78a10f371f5850c6a69aa83df15afa882fd2b1bcb663de23af06fdc391489d05b0072025-10-15T12:51:27+03:00Georgi Gerganovserver : fix mtmd checkpoints (#16591)
134fa882fd2b1bcb663de23af06fdc391489d05b007ffa059034c1e41f3e58363ef3c46d2fcf854bc4d2025-10-14T20:33:05+03:00Georgi Gerganovmetal : avoid using Metal's gpuAddress property (#16576)
135120bf7046d85a893f064c12abe58bfeebd735f844258e0cfe72c72ad2787be1e9f93253e892194552025-10-14T22:48:08+08:00Aman GuptaCUDA + openCL: fix bug in accessing rms_norm->src while doing fusion (#16577)
1361ee9d0b415cdf5240418c110a18b419f4002b15448e2fa9fb7c2de1e53808fdb65ec33f916020fc42025-10-14T19:16:21+08:00Aman GuptaCUDA: use fastdiv + ggml_cuda_mad for mmvf (#16557)
13748e2fa9fb7c2de1e53808fdb65ec33f916020fc45b6913c47b6bc71a6f927805a45387d5657d8b892025-10-14T19:15:15+08:00Aman GuptaCUDA: add fp kernel for larger batch size MoE (#16512)
138e38b7c6e9e4453e3b3e96d76e38bc2ccb6bce4585016b7286240d29f8f640039989b84ea3a8543442025-10-13T22:42:37+03:00Georgi Gerganovgraph : support cacheless embeddings with FA and iSWA (#16528)
1395016b7286240d29f8f640039989b84ea3a8543447049736b2dd9011bf819e298b844ebbc4b5afdc92025-10-13T11:50:37-07:00lhezopencl: fix build targeting CL 2 (#16554)
1407049736b2dd9011bf819e298b844ebbc4b5afdc901d2bdc2bc61b676706830305b286b08b9885a412025-10-13T16:29:45+02:00Johannes GäßlerCUDA: fix numerical issues in tile FA kernel (#16540)
14101d2bdc2bc61b676706830305b286b08b9885a4156fc38b9655fbe1869d8bd6cfb269418196cea692025-10-13T20:48:47+08:00Jie Fu (傅杰)ggml : fix build broken with -march=armv9-a on MacOS (#16520)
14256fc38b9655fbe1869d8bd6cfb269418196cea691fb9504eb744969a990bfe4cfcf1d3d7a479541c2025-10-13T17:01:24+08:00Chenguang LiCANN: fix CPU memory leak in CANN backend (#16549)
1431fb9504eb744969a990bfe4cfcf1d3d7a479541c3f750f8d760ab5a61491e6a9409072dfeee4b4d72025-10-13T10:55:32+02:00Pascalfix: add remark plugin to render raw HTML as literal text (#16505)
144c515fc577166042234241c6bd0da9b08dcbe2bb9f9bc66c3ebcfddb5f09e4b21253623caeb8e414a2025-10-13T11:22:27+03:00Georgi Gerganovggml : fix scalar path for computing norm (#16558)
145f9bc66c3ebcfddb5f09e4b21253623caeb8e414aa31cf36ad946a13b3a646bf0dadf2a481e89f9442025-10-13T08:52:22+08:00hipuddingCANN: Update several operators to support FP16 data format (#16251)
146a31cf36ad946a13b3a646bf0dadf2a481e89f94481d54bbfd599811b354c39f04550888168be77802025-10-13T02:43:14+08:00Sam/Samuelmetal : add opt_step_adamw and op_sum (#16529)
14781d54bbfd599811b354c39f04550888168be7780c7be9febcbafa9af7d1b9443f86475c59c9c5f872025-10-12T18:06:41+02:00Pascalwebui: remove client-side context pre-check and rely on backend for limits (#16506)
148c7be9febcbafa9af7d1b9443f86475c59c9c5f878415f61e23d04427cd0d912fbb9d33b85f8494562025-10-12T21:53:35+08:00Neo Zhang Jianyu[SYCL] fix UT fault cases: count-equal, argsort, pad OPs (#16521)
1498415f61e23d04427cd0d912fbb9d33b85f8494562c301e91abb92d03c1a682b4b540ba835562a74b2025-10-12T15:48:03+02:00Mathieu Baudierci : add Vulkan on Ubuntu with default packages build (#16532)
1504b2dae383df708e2afc49c4859a81cd074f5ac1041aac5c69b5fb281bc1f486afb053f78101bb39e2025-10-12T09:29:13+03:00Georgi Gerganovcommon : update presets (#16504)
15141aac5c69b5fb281bc1f486afb053f78101bb39ea2fba89a426ff8005d303c73f0436e7e67368b702025-10-12T00:25:37-05:00sirus20x6ggml : Fix FP16 ELU positive branch (#16519)
152a2fba89a426ff8005d303c73f0436e7e67368b7020cc625edc2264aae2779e71bef1593e6a4e8c432025-10-12T07:19:06+02:00Daniel Beveniushparams : add check for layer index in is_recurrent (#16511)
15320cc625edc2264aae2779e71bef1593e6a4e8c4311f0af5504252e453d57406a935480c909e3ff372025-10-12T00:15:00-05:00sirus20x6ggml: Correct SVE implementation in ggml_vec_dot_f16_unroll (#16518)
154a3cb04744fb5c591985f53b749fef5407d07a1454a8fbe0a5eb75f339782ebcf29c17848122184d32025-10-11T16:54:10+03:00Georgi Gerganovmetal : fix mul-mm condition + fix mul-mv permuted kernels (#16494)
1554a8fbe0a5eb75f339782ebcf29c17848122184d331d0ff1869aa2ea31f4e96d5877d0343e9a2171b2025-10-11T15:50:49+02:00Pascalfeat: render user content as markdown option (#16358)
15631d0ff1869aa2ea31f4e96d5877d0343e9a2171b97870e64975b26c5e06a3540a8dc0ff601351e862025-10-11T21:39:04+08:00Yann Folletserver / ranking : add sorting and management of top_n (#16403)
157477a66b03501cf3bd067f8968b77ca4d053ff1bde60f01d941bc5b7fae62dd57fee4cec76ec0ea6e2025-10-11T11:33:41+03:00amirai21convert : correctly handle LLaMA tokenizer for Jamba (#16470)
158e60f01d941bc5b7fae62dd57fee4cec76ec0ea6e81086cd6a3ca1252f0dc0f938171648399179c532025-10-10T22:15:05+03:00Georgi Gerganovserver : fix division by zero when reporting stats (#16501)
15968ee98ae181a5c83a5cc6261daeee69a1f588c15cdb6da468cc33323955a523738d2e1675aeb5e9a2025-10-10T17:11:07+03:00Radoslav Gerganovserver : return HTTP 400 if prompt exceeds context length (#16486)
1601faa13a1187051af66b0fd9f0d6effe4c77f0b3e1deee0f8d494981c32597dca8b5f8696d399b0f22025-10-09T22:54:57+02:00Pascalwebui: updated the chat service to only include max_tokens in the req… (#16489)
161d00cbea63c671cd85a57adaa50abf60b3b87d86f8328fd4bae76fc027f8ca0e9a05acd3788dabe3f2025-10-09T18:54:51+03:00Georgi Gerganovserver : host-memory prompt caching (#16391)
1628328fd4bae76fc027f8ca0e9a05acd3788dabe3f56b4795842d852152222ca7a2d4304008facf1b92025-10-09T17:36:29+02:00PascalNo markdown in cot (#16483)
16356b4795842d852152222ca7a2d4304008facf1b92c0d875ae6c6043fbbafd2831e160955e9ca6af12025-10-09T14:35:22+02:00Daniel Beveniusmodel-conversion : add support for SentenceTransformers (#16387)
164b2602137557b2b28a39e03612717d85ead9a6f5ae08db4259521de493b7aeb49dadf29ebd1ee966a2025-10-09T15:25:11+08:00Neo Zhang Jianyu[SYCL] refactor soft_max, add soft_max_back (#16472)
165e08db4259521de493b7aeb49dadf29ebd1ee966a12bbc3fa50b6df03318a4451c9a2210200a0b28d2025-10-09T08:39:18+02:00Saba Fallahmodel: EmbeddingGemma Adding Support for SentenceTransformers Dense Modules (#16367)
16612bbc3fa50b6df03318a4451c9a2210200a0b28d9d0882840e6c3fb62965d03af0e22880ea90e0122025-10-08T22:18:41+02:00Pascalrefactor: centralize CoT parsing in backend for streaming mode (#16394)
167d2ee056e1df0fdf646270fb5621e9f92084b59a7b2c08c9ec4cd59ed88c1ebdd94f109af5ccc978e2025-10-08T17:20:18+09:00issixxserver : fix cancel pending task (#16467)
168b2c08c9ec4cd59ed88c1ebdd94f109af5ccc978e7fdd16b432d247121fe5fe7b21f8805f85266c852025-10-08T10:57:53+03:00Georgi Gerganovmetal : mark FA blocks (#16372)
16974b8fc17f92ada295a648e3c5eb28f46bca7d892aeaf8a36f06b5810f5ae4bbefe26edb33925cf5e2025-10-07T13:48:56-07:00Reese Levineggml webgpu: profiling, CI updates, reworking of command submission (#16452)
170aeaf8a36f06b5810f5ae4bbefe26edb33925cf5edf1b612e29ba97a2e67db339b1e8c7465702b7e82025-10-07T20:03:35+02:00Tarek Dakhranllama : support LiquidAI LFM2-MoE hybrid model (#16464)
1714e0388aa8a1f4ef1065701dc9c3947aea0a1b9a5ef4c5b87ea2556ff8ca99cca3abdf48bdbca22f22025-10-07T11:11:08+02:00Sascha Rogmannwebui : added download action (#13552) (#16282)
172ef4c5b87ea2556ff8ca99cca3abdf48bdbca22f2c61ae20d05bd4fdd8551311325a28453364494262025-10-07T10:32:32+03:00Georgi Gerganovpresets : fix pooling param for embedding models (#16455)
1733df2244df40c67dfd6ad548b40ccc507a066af2bc08002a1988348403a5fd59b1fa3de3a10a6f92f2025-10-06T12:55:53-05:00Gadflyiillama : add --no-host to disable host buffers (#16310)
174c08002a1988348403a5fd59b1fa3de3a10a6f92f3a002afafa8e06555f11aed88b02d055d8a166f32025-10-06T10:59:40-06:00Gabe Goodhartchat : Granite Docling stopping (#16438)
175a23b9bdbd3b64ce172f9962249f432d01aea743704e632a4aab8e6bfff0f8bc216b36ceb1e199ff92025-10-06T16:05:27+03:00Georgi Gerganovggml : fix unaligned access in AMX code (#16315)
17604e632a4aab8e6bfff0f8bc216b36ceb1e199ff9a80ff183abe4e5a76316257ffa597da41b3b6fa02025-10-06T14:56:59+02:00Daniel Beveniusci : remove missing reranker model files (#16444)
177a80ff183abe4e5a76316257ffa597da41b3b6fa01d49ca37594fb49db6aa9518ba7c512e5ccd01082025-10-06T14:17:12+02:00Daniel Beveniusggml-cpu : fix leftover handling in ggml_vec_scale_f32 for SVE (#16443)
178ca71fb9b368e3db96e028f80c4c9df6b6b370edd35266573b968e1c947b367782fb4b3eddbb4f3c02025-10-05T06:57:47-06:00Gabe Goodhartmodel : Granite docling + Idefics3 preprocessing (SmolVLM) (#16206)
17935266573b968e1c947b367782fb4b3eddbb4f3c086df2c9ae4f2f1ee63d2558a9dc797b98524639b2025-10-04T20:59:31-07:00Reese Levineggml webgpu: actually add softmax, fix rms_norm offset (#16400)
18086df2c9ae4f2f1ee63d2558a9dc797b98524639bf39283960b58a92ecc0c72567711318b20e22b552025-10-04T20:04:27ZEvevulkan: use a more appropriate amount of threads when generating shaders (#16418)
181898acba6816ad23b6a9491347d30e7570bffadfde29acf74fea996014380d59d31aa504ae89642582025-10-04T12:49:16+03:00Radoslav Gerganovrpc : add support for multiple devices (#16276)
182e29acf74fea996014380d59d31aa504ae8964258128d522c04286e019666bd6ee4d18e3fbf8772e22025-10-04T11:42:56+02:00Aclyvulkan : incremental shader builds (#16341)
183f6dcda390004b627ef30af378d0c01ad2519289e606a73f53175077429484b23dcf799f69a31d0bd2025-10-03T13:34:51-05:00ddh0server : context checkpointing for hybrid and recurrent models (#16382)
184606a73f53175077429484b23dcf799f69a31d0bd946f71ed9ade07e319859b5ce656144140e066fb2025-10-03T19:18:56+03:00Georgi Gerganovmetal : fix loop bound in ggml_mem_ranges (#16412)
185946f71ed9ade07e319859b5ce656144140e066fb638d330246954e88dffc22ce01fec15e6894e5442025-10-03T14:40:25+02:00Sigbjørn Skjæretllama : fix shapes for bert/mpt q/k norm (#16409)
186638d330246954e88dffc22ce01fec15e6894e54484c8e305e8010a1a3d43bdd0a25f737ac67809a42025-10-03T13:49:08+02:00Aclyggml : fix graph reallocation with multiple chunks (#16396)
18784c8e305e8010a1a3d43bdd0a25f737ac67809a42aaf0a2a2056d75d0dd53ab8a181473760e6ab222025-10-03T12:51:40+02:00Aleksander GrygierFix missing messages on sibling navigation (#16408)
1882aaf0a2a2056d75d0dd53ab8a181473760e6ab220e1f83855609d73beaf05d818640b6cfd39d287b2025-10-03T05:50:46-05:00Jeff Bolzvulkan: Replace uses of maxMemoryAllocationSize and VK_WHOLE_SIZE (#16354)
1890e1f83855609d73beaf05d818640b6cfd39d287bad126479c25cf983a0f994a08ba0911cf49ed62b2025-10-03T04:52:46-05:00Jeff Bolzvulkan: Fix FA coopmat1 invalid array indexing (#16365)
190ad126479c25cf983a0f994a08ba0911cf49ed62b77233277c912d495d1069543ca540c21a2f9e5b42025-10-03T11:45:16+02:00Daniel Beveniusci : change macos-13 to macos-15-intel (#16401)
191136bda78c5679b266362b39c58338fff46fd25925113efd34ceda709292de26c72716c49e024fb322025-10-03T09:11:34+02:00Aleksander Grygierwebui : Fix messages payload sent to chat completions (#16402)
1925113efd34ceda709292de26c72716c49e024fb32d64c8104f090b27b1f99e8da5995ffcfa6b726e22025-10-03T08:01:31+02:00Pascalfix: track viewportHeight via window.innerHeight to avoid unwanted scrolling (#16356)
193ef07a4090672a3438d7f64f197795d7dc1c1895734fcc5a4ace8c69476ef2ea3857f39a60334acc42025-10-02T11:00:31-07:00Reese Levineggml webgpu: add support for soft_max, optimize rms_norm (#16357)
19434fcc5a4ace8c69476ef2ea3857f39a60334acc491a2a5655658bb9ab77894716b82fae7ecb4b4d12025-10-02T19:43:22+02:00Piotr Wilkin (ilintar)model : Apertus model implementation (#15852)
19572ee736c447be4ededb51ab97904b4d33c90c261f09aefaa84d7f4d5df3f400f67944b94fef5b7952025-10-02T13:51:36+02:00Sigbjørn Skjæretci : fix ubuntu-latest-cmake-rpc (disable ccache) (#16388)
196bbd32bc0384fbfcf07369617de58856b1e0e95a32be72c2b121ee99f33927149265ce6073ade9e592025-10-02T10:35:43+03:00Georgi Gerganovci : fix clean-up of old logs (#16381)
1972be72c2b121ee99f33927149265ce6073ade9e5995ce0985449c52fb9d6849b95563f7cf933ea0e32025-10-02T15:16:25+08:00Neo Zhang JianyuSYCL: Update to oneAPI 2025.2 (#16371)
198e95fec640f43623911a2cd5bda8b19b1898c530cded67b94446ef4f7fd988dbde7a12deef9870c132025-10-01T23:09:25+02:00uvosHIP: Disable ROCWMMA fattn on CDNA when compiled against ROCWMMA 2.0.0 (#16221)
199ded67b94446ef4f7fd988dbde7a12deef9870c131fe4e38cc20af058ed320bd46cac9349911900562025-10-02T06:08:15+09:00Shunta Saitollama : parameter conversion and loading fixes for PLaMo2 variants (#16075)
2004201deae9c2ae4732db8957b6ce0808d02ec597c764799279f801c696503bacca490b4358587d94c2025-10-01T19:22:18+02:00Adrien Gallouëtcommon: introduce http.h for httplib-based client (#16373)
201764799279f801c696503bacca490b4358587d94c2a9b63383a448ec18c754dfdc6e95cb853940a522025-10-01T18:18:10+02:00Aleksander GrygierConversation action dialogs as singletons from Chat Sidebar + apply conditional rendering for Actions Dropdown for Chat Conversation Items (#16369)
202132d673554e65282e92505f4f77401ab971528bbaa9538a63aef35f0224b2502f13b19d650a8ce042025-10-01T07:56:36ZEvevulkan: make ggml_vk_default_dispatcher support older vulkan headers (#16345)
203b2ba81dbe07b6dbea9c96b13346c66973dede32cbf6f3b3a1965d70e07ca94aab7b01268fe483e962025-09-30T21:41:42+02:00Sigbjørn Skjæretci : fix ccache key for ubuntu-cpu-cmake (#16355)
20416b0ca0d2e63fc1a0a43795f8552f9cb61d9f7a58d78cd2613ccdeb3cc86f59bc8f9ddd31cfbd3ed2025-09-30T19:18:54+02:00PascalChatapi ignore empty sampling (#16330)
2058d78cd2613ccdeb3cc86f59bc8f9ddd31cfbd3edd1c84a662daa91be975863913a59975b114581412025-09-30T09:57:51-07:00Reese Levineggml webgpu: support for rope,div,sub,glu,scale,cont operators (#16187)
206a014310374a16f9204f2bcc1b458fc1eda67e46935fb82497ec6c5904b0adb7e1c881a76c1c692db2025-09-30T08:13:22Zanavp-nvidiacuda : Enable CUDA Graph usage for Nemotron Nano v2 (NemotronH) (#16328)
207f1eb1cb1eba042b2d583234e80f65e2e225d8995de41f2b7bffab7582944b213ce12b605f8cf6e0f2025-09-30T09:07:20+02:00Charles Xukleidiai : fix work size and threads sync for fp16 (#16246)
208a74a0d69f34f52fa10d4f0a7ce749fb3490d07745f7e166cbf7b9ca928c7fad990098ef32358ac752025-09-29T19:26:34-05:00Jeff Bolztests: override test_set_rows::max_nmse_err to allow for occasional rounding differences (#16295)
2095f7e166cbf7b9ca928c7fad990098ef32358ac75d72f5f7ba260b546190338b0b76f2f152581424f2025-09-29T18:49:47+02:00PascalFix thinking blocks with quotes + add handling `[THINK]...[/THINK]` blocks (#16326)
210d72f5f7ba260b546190338b0b76f2f152581424fb77e6c18e1a6fac5705ed95f03af5436d67484c12025-09-29T17:51:48+03:00Georgi Gerganovci : add AMD runners and workflows (#16249)
211b77e6c18e1a6fac5705ed95f03af5436d67484c12ddd3f2356c313385fafc19a9f0ce678c8fe03ee2025-09-29T22:50:44+08:00alex-spacemitggml: riscv: add riscv spacemit backend (#15288)
2124d3d455d3c8719eb8f206de328d1b9ba191efd7cc9b1c06467aca8d30fafcab51292bcb285df5b0d2025-09-29T16:49:11+03:00Georgi Gerganovsync : whisper.cpp (ggml/1359)
213c9b1c06467aca8d30fafcab51292bcb285df5b0db6ae75afb49b23db3dfbc2b01e8aabfb047e68802025-09-26T17:34:42+02:00Daniel Beveniusggml : remove -dev suffix from release version (ggml/1355)
21402463ab27b1379ff5e3d936ce8b3bfd356872ea6adc76347d73b3d915e946efa5de8d0ad9f3904c22025-09-29T13:17:09+02:00Rafal Lewczukggml-backend : add root cause in error message if loading backend library fails (#16172)
2153a2bdcda0b31e51db954551e0cd49424133a84f366bb7985c3fcefda7a74aae9f8321f70eb1646c42025-09-29T10:37:20+02:00Aleksander GrygierImprove Mobile UI for dialogs and action dropdowns (#16222)
21666bb7985c3fcefda7a74aae9f8321f70eb1646c42f61c0f5bf8a620ca4c3872408803ab38cfb96132025-09-29T09:08:41+02:00Pascalfix: preserved zero values in chat settings inputs and textareas by switching to nullish coalescing for field values and default placeholders (#16312)
2172f61c0f5bf8a620ca4c3872408803ab38cfb96133ffd0fae473c954bb3e67526b31262048fb508d42025-09-29T12:33:12+05:30Vinkalllama-cli: prevent spurious assistant token (#16202)
218a4a0aa5ea2a88e4858996199fefd5439f17b481c92cd103f627015a95f2107f1c27dc218c7b8ec642025-09-29T08:41:28+03:00Georgi Gerganovggml : fix dependencies for ggml_set_rows (#16318)
21992cd103f627015a95f2107f1c27dc218c7b8ec64b887d2f3413ac231e3cb5925260c39902af4a70c2025-09-28T23:50:37-05:00Jeff Bolzvulkan: Fix validation failure in quantized flash attention (#16292)
220b887d2f3413ac231e3cb5925260c39902af4a70cbd0af02fc96c2057726f33c0f0daf7bb8f3e462a2025-09-28T23:15:03+02:00Sigbjørn Skjæretggml : fix GGML_F32_VEC_FMA argument order in ggml_vec_mad1_f32 (#16307)
221bd0af02fc96c2057726f33c0f0daf7bb8f3e462ad9e0e7c8194dfd7d23bf3a86608c9ece68d77c932025-09-28T14:13:50-04:00crat0zcommon : fix reasoning before forced tool call via tool_choice = required (#16264)
222d9e0e7c8194dfd7d23bf3a86608c9ece68d77c930124ac989f7e7bf08803788f66dbe4106bdcdd582025-09-28T22:38:15+08:00R0CKSTARci : fix musa docker build (#16306)
2232811c65286ae954bec87049f75b86dc022006dccd8359f5fde480da030bf75c7711573c7c4d993ba2025-09-28T12:04:46+01:00Imad SaddikFixed a few typos in the README of the LLaMA.cpp HTTP Server [no ci] (#16297)
224d8359f5fde480da030bf75c7711573c7c4d993ba6a2c6145a0b91b40eb3c3dba7b20ccc4b270490f2025-09-28T01:38:37-05:00Jeff Bolzvulkan: 64-bit im2col (#16135)
2251384abf8b8d5894d32fada453ccf4d196ffba7dee6d65fb02d553bd79cad94e517cdca18b687788d2025-09-27T20:36:34-05:00Jeff Bolzvulkan: handle mat_mul with A matrix > 4GB (#16176)
226e6d65fb02d553bd79cad94e517cdca18b687788d8656f5de688cddcaea1d6174535eb60ee23ef6a02025-09-27T16:43:39-04:00Jeff Bolzvulkan: support arbitrary KV dimension in flash attention (#16160)
2278656f5de688cddcaea1d6174535eb60ee23ef6a04807e8f96a61b2adccebd5e57444c94d18de72642025-09-27T22:41:03+02:00Aclyvulkan : make the vulkan.hpp dynamic dispatcher instance private (#16224)
2284807e8f96a61b2adccebd5e57444c94d18de7264c0bfc57af421f8fd63c946c13b7666aed82560e22025-09-27T19:56:40+02:00Aleksander GrygierShow message actions by default (#16289)
2290499b29c6f64c705faaf5860dc4600fca23671f4234e2ff8ed09716fb553437596779399bee31b112025-09-27T19:26:46+03:00Dmytro Minochkinvulkan: throw system error instead of SIGABRT during init on older devices (#16156)
2303f81b4e91c1d5f098148af117e3f13cf4b077f52ace6a54565444b6377bee8e7ac693238e77662792025-09-27T06:36:11-04:00Jeff Bolzvulkan: support GET_ROWS for k-quants (#16235)
231ace6a54565444b6377bee8e7ac693238e776627972b24d96c6888c609d562779a23787304ae4609c2025-09-27T11:12:46+02:00Adrien Gallouëtbuild : add LLAMA_OPENSSL option (#16287)
23272b24d96c6888c609d562779a23787304ae4609c624207e676ab5eb3ce7af631902bb45fb73a83592025-09-27T02:58:29+05:30Vinkalmodel : make minicpm embedding_scale, residual_scale and logit_scale optional with legacy defaults (#16273)
233624207e676ab5eb3ce7af631902bb45fb73a8359807e8c6d310952f2f5656afc63dab9d7083dcb5c2025-09-27T02:03:33+08:00Aaron Teodevops: add s390x & ppc64le CI (#15925)
2341a189278944d030211f336e103e96b65f976c361e0539eb6aed346d4b25a6ea019044e88771e76902025-09-26T18:35:42+02:00Aleksander GrygierAllow viewing conversations even when llama server is down (#16255)
235e0539eb6aed346d4b25a6ea019044e88771e76905d0a40f390732cbf85d8a3b7b0fc3cbebffe780a2025-09-26T11:36:48-04:00Isaac McFadyenwebui: switch to hash-based routing (alternative of #16079) (#16157)
236cc1cfa277b3aae1f6cc9180472072336597a78d454dbc37053f7d75ea5b0631d5ee88f19391e43142025-09-26T15:00:44+02:00Aleksei Nikiforovmtmd : fix uninitialized variable in bicubic_resize (#16275)
23754dbc37053f7d75ea5b0631d5ee88f19391e4314b995a10760cb93d23d617d76ecb82a5f95b5e0d32025-09-26T14:14:28+03:00Georgi Gerganovmetal : report OOM errors (#16274)
2384710dd31bbcef79d04f85a3a6a8c7d9439c5c79a9b26511857ac09ae69ab485168fe2d3ee5fb1d6e2025-09-26T12:39:35+02:00Adrien Gallouëtbuild : fix build-ios-device (#16257)
2399b26511857ac09ae69ab485168fe2d3ee5fb1d6e00217cd41388328c93e9e9644921c4319bb03bcc2025-09-26T18:27:25+08:00Aaron Teoggml-cpu: implement MXFP4 SIMD for s390x (#16193)
2400f7c69689f4e681948a6005adea9bee9c08ff903835b2b915c52bcabcd688d025eacff9a07b65f522025-09-26T08:56:10+08:00R0CKSTARmusa: fix build warnings (#15611)
241835b2b915c52bcabcd688d025eacff9a07b65f52b05a9d650f4da1e70e7e2cbe8fe44e61b39656db2025-09-25T19:50:28+02:00Sigbjørn Skjæretmodel : add GroveMoE support (#15510)
242077c94d0caf87fbd3cf3288dbb5c0fd9670294cfaa3ee0eb0b80efca126cedf9bcb4fb5864b46ce32025-09-25T22:35:05+08:00Aman GuptaCUDA: add a fused top-K MoE kernel (#16130)
243d0991da39d3c39b3980c24cdfccb9a4c95a46870aa719c2f886c445b78113bf1e5849f1fce4124a72025-09-25T11:36:47+02:00Daniel Beveniusserver : add support for external server for tests (#16243)
244aa719c2f886c445b78113bf1e5849f1fce4124a74cdd0bb4537f9617e9efcfef6b9454fcefe2ff082025-09-25T17:22:55+08:00junchao-zhaoggml : fix loongarch lsx compilation error (#15864)
2454cdd0bb4537f9617e9efcfef6b9454fcefe2ff08b5bd037832bcb8ed3086dfe26ce9090bea989af12025-09-25T11:12:27+02:00Johannes Gäßlerdocs: fix typo [no ci] (#16244)
246dfcd53f7ecb9bb897a9d752d09c59d10be47237a4ea00794b8c995b6deaf4bac159c1778dc27419a2025-09-25T11:30:16+03:00Georgi Gerganovmetal : fuse NORM + MUL + ADD, support non-multiples of 4 (#16220)
247c498fc82fe5b83fc8c6e1627286bdc1f93caddbfe7a5130a20cf45a3358308356c249734ca9821432025-09-25T10:20:02+03:00Radoslav Gerganovrpc : use ggml logging facilities
248bee378e0988b44bbe93b0768208080951b3123635fb557653b8756ac2b6c6a102b1e44abcadf552f2025-09-25T05:06:06ZEveci: run the x64 and arm ci on the github machines instead (#16183)
2495fb557653b8756ac2b6c6a102b1e44abcadf552f4ae88d07d026e66b41e85afece74e88af54f4e662025-09-25T11:36:30+08:00Aaron Teodevops: fix s390x docker release failure (#16231)
250f2a789e33490deb483a2694b066b37e45524bb793a599719673c850647e3bb911ed6d91109bb91d22025-09-24T16:17:49+02:00Aclyggml : split graph allocations according to backend max buffer size (#15815)
2513a599719673c850647e3bb911ed6d91109bb91d263b54c81a620981be020184ab99e63a8e50e47cb2025-09-24T13:42:26+02:00Tarek Dakhranmodel : add label for LiquidAI LFM2-2.6B model (#16204)
2527735706b939847df2c6c00b44c36f95a20137c614d9ea03d170cf504a40bf3a85788af84cccaee802025-09-24T14:46:52+08:00Jie Fu (傅杰)model-conversion : run-org-model.py fails to run on mac m1 (#16213)
2534d9ea03d170cf504a40bf3a85788af84cccaee808ba548dae251f8f2e3834ed5226b76b6e4f4a4852025-09-24T08:10:09+02:00Daniel Beveniuscodeowners : use slash prefix for root files [no ci] (#16210)
2548ba548dae251f8f2e3834ed5226b76b6e4f4a485f505bd83ca7a43c4585ff3d59135e77eae9c793b2025-09-24T12:19:23+08:00Jie Fu (傅杰)model-conversion : fix the make targets in the README.md (#16209)
255f505bd83ca7a43c4585ff3d59135e77eae9c793b0889589dbe8c67dd518c58a57afbb02dde2dccbe2025-09-23T20:41:40+03:00Georgi Gerganovci : disable AMD workflows + update NVIDIA workflows (#16200)
256f6b4af3d04763b1e0130f5b5fce19c4bc6f83f1c264f1b51872c125e23fa0ac1da5e2a1170de9a082025-09-23T10:25:20+02:00Sigbjørn Skjæretggml : fix uninitialized is_on_grid in quantize_row_iq3_xxs_impl (#15928)
257264f1b51872c125e23fa0ac1da5e2a1170de9a080bc7cc715472fe28822e57f036f0746592ed2c042025-09-23T14:53:05+08:00Aaron Teozdnn: refactor codebase + add docs (#16178)
2584b9f4cb0f89a88de4bdf97727d0457b0c648804c85e72271ba1ce78adf34fd8997803c991e617ca62025-09-23T13:59:34+08:00Aaron Teodevops: add s390x containers (#15915)
25985e72271ba1ce78adf34fd8997803c991e617ca61d0125bcf1cbd7195ad0faf826a20bc7cec7d3f42025-09-23T05:59:03+02:00Daniel Beveniusggml-cpu : fix typo in gemm comments [no ci] (#16189)
2603ecb2f671a2f49d56357f99d135a94e841759178432cf4304c5379bfbd1f3feed65ec205955b2f4b2025-09-22T19:13:00+02:00Sigbjørn Skjæretggml : implement set_rows with i32 index (#16159)
26137a23c17bdc9c99c9c6ad41168e4ced3724b72cd138c87ce8bd558b2cc134ada7316a3dad8eb67ac2025-09-22T14:13:51+02:00Adrien Gallouëtcommon : enable `--offline` mode without curl support (#16137)
262138c87ce8bd558b2cc134ada7316a3dad8eb67acc6db9a10278f40b4b8d3f6931728f2cce2356daa2025-09-22T10:53:13+02:00Quentin Bramaswebui : fix handling incomplete chunks (#16107)
263c6db9a10278f40b4b8d3f6931728f2cce2356daad05affbab7d1364fa7ac06c03cd33f03235ae8402025-09-22T10:49:58+02:00GideonSerfembedding : fix typos in README (#16171)
264d05affbab7d1364fa7ac06c03cd33f03235ae8404f324a556caa5be0be2261604ef4aab0faf36eb82025-09-22T16:48:42+08:00Haiyue Wangcommon : remove unused local variables (#16140)
2654f324a556caa5be0be2261604ef4aab0faf36eb8a71ae3ba7a857394103f12e30b387c48242c84f22025-09-22T11:12:37+03:00Georgi Gerganovggml : extend ggml_can_fuse to work with non-sequential nodes (#16123)
26696fdca043be8fa733bbd59868a75517f92633376b2d980fce063fa3591c59ad50b946c8da66c294f2025-09-22T17:04:01+09:00Shin-myoung-serpVulkan: add conv_transpose_2d operation (#16022)
267a20d810d79adfbf82e0eb703af6f27a0e2d1a5394d0a7cbc617e384fc355077a304c883b5c7d4fb62025-09-22T00:37:17-05:00Jeff Bolzvulkan: add RTE variants of exp shader (#16165)
2689073a73d82a916cea0809de225ef5175c3a86e9151f5a45fbe575dcd54bdd2a339ef8e8424d1c12a2025-09-22T07:22:43+02:00Ruben Ortlamvulkan: vec dot matrix multiplication fix (#16151)
26951f5a45fbe575dcd54bdd2a339ef8e8424d1c12ac4510dc9374e17dcb8726902ab5216067a92b3d32025-09-21T16:42:10-07:00lhezopencl: fix concat crash on win arm64 with Adreno (#15944)
27028baac9c9f491c872e2c37762d3bd90446b005e91eeb523c3e0c7ffbd59469f5463dcbdecba3535e2025-09-21T16:50:45+03:00Georgi Gerganovci : migrate ggml ci to self-hosted runners (#16116)
2711eeb523c3e0c7ffbd59469f5463dcbdecba3535e5bb4a3edec297e74b0f7bd4ed5d0fdd12e28d8582025-09-21T08:31:55+02:00Giuseppe Scrivanovulkan: optimize UMA buffer operations and fix driver hangs (#16059)
2725bb4a3edec297e74b0f7bd4ed5d0fdd12e28d8587f766929ca8e8e01dcceb1c526ee584f7e5e14082025-09-21T01:23:37-05:00Jeff Bolzvulkan: fix validation error about VK_PIPELINE_CREATE_CAPTURE_STATISTICS_BIT_KHR (#16086)
273405921dcefdd4e90ed948a4bf179007c2fa92b2dfa6383ca7e7ccb8ca3bdfeb37e348ddc4113aa262025-09-16T06:16:52+02:00Daniel Beveniusggml : introduce semantic versioning (ggml/1336)
274803dac2e48ef3ba26a504eb27c4e77ec2d21f7d0459c0c2c1a400f960d7b8e8d94d31a8426f809862025-09-20T10:42:56+02:00Ruben Ortlamvulkan: use vec dot for matrix matrix multiplications (#16056)
275459c0c2c1a400f960d7b8e8d94d31a8426f80986be79d9fdd95ab8955527c4aaa67b90e8b95167182025-09-20T07:56:30+02:00Benniserver: fix SSE and OpenAI compatibility for error messages when streaming (#16109)
276be79d9fdd95ab8955527c4aaa67b90e8b9516718f432d8d83e7407073634c5e4fd81a3d23a10827f2025-09-19T15:15:21-07:00ssweensllama-bench: add --devices and --list-devices support (#16039)
277f432d8d83e7407073634c5e4fd81a3d23a10827f4067f07fc5aa5722b87db303b561597004696f6c2025-09-20T00:57:30+09:00shun095chat: Fix streaming parser for granite models (#15682)
2784067f07fc5aa5722b87db303b561597004696f6c4b8560ab56fdd9819358b47c338bbc8ec357c57e2025-09-19T09:52:27+02:00Aleksander Grygierfeat: Improve mobile UI for Settings Dialog (#16084)
2794b8560ab56fdd9819358b47c338bbc8ec357c57e0dd58b6877f3dc106593d6bc68d98305f553c5662025-09-19T13:02:51+07:00Xuan-Son Nguyenchat : fix build on arm64 (#16101)
28069ffd891631befa9e6b485fd646a16dab4f2c007246c0d9c795fb25da8268625d597580155a3672f2025-09-18T23:07:26+02:00Adrien Gallouëtggml-amx : fix ggml_amx_init() on generic Linux (#16049)
281246c0d9c795fb25da8268625d597580155a3672f3edd87cd055a45d885fa914d879d36d33ecfc3e12025-09-18T23:07:18+02:00Adrien Gallouëtcmake : fix static linking for OpenMP on Unix-like systems (#16031)
282368560a1e3b9a3bc83af741b0b2bc9e46fb420d24ca088b036313c2d8e682f4cfeb7c29edd85d0b92025-09-18T19:28:32+02:00Johannes GäßlerCUDA: fix compilation on CC 6.0 (#16091)
283d304f459d8619399eb232b1e3689379306f439d30320ac5264279d74f8ee91bafa6c90e9ab9bbb912025-09-17T13:09:40-07:00Reese LevineGGML WebGPU: Support for ADD, MUL, RMS_NORM, GET_ROWS operators (#16018)
2840320ac5264279d74f8ee91bafa6c90e9ab9bbb91a7a98e0fffed794396b3fbad4dcdbbc1849636452025-09-17T20:38:12+03:00Georgi Gerganovmetal : refactor + optimize v2 (#15995)
2858f8f2274ee3601fecf6e2d57b52f701c81bede21c959b676be29e93f8dbc3bd6056ceba812a9eb722025-09-18T00:18:21+07:00Xuan-Son Nguyenconvert : add Llama4ForCausalLM (#16042)
286c959b676be29e93f8dbc3bd6056ceba812a9eb72cd08fc3ecc0264b4414b68af3874a6c689ed60c12025-09-17T15:32:42+02:00Johannes GäßlerCUDA: fix FA occupancy, optimize tile kernel (#15982)
287cd08fc3ecc0264b4414b68af3874a6c689ed60c1cb5bb6cc05119c24e7711ca2956cd0e6d409d3962025-09-17T01:08:02-07:00David Ribeiro Alvescommon : Fix corrupted memory error on json grammar initialization (#16038)
288a91d035b901e8a9edf810f63d130ee49adf27be2745cbcf2fe1eb88f8db615ac622f0b944d924ad62025-09-17T09:34:09+02:00Daniel Beveniusci : revert back to macos-13 for macOS-latest-cmake-x64 (#16040)
289745cbcf2fe1eb88f8db615ac622f0b944d924ad61cbd80f8cf80a817715b1ccc5680fe2a3c5172c82025-09-17T15:30:55+08:00Jie Fu (傅杰)llama-quant : fix the verification of attention layers for encoder-decoder models (#16023)
29085286f354813056f6c835046c0acfa3bf6ba9432d5fabe3682de515fd09d6c981f7a0d1b756144552025-09-17T00:01:58-07:00Shane Amodel : add OLMo3 support (#16015)
291d5fabe3682de515fd09d6c981f7a0d1b756144558ff206097c2bf3ca1c7aa95f9d6db779fc7bdd682025-09-17T14:33:08+08:00Chenguang LiCANN: Optimize ggml_cann_set_device (#15935)
29277475530b8bbea3bf578632507e1284cdfe2c8c03913f8730ec6d6245480affc30ae3049107956f42025-09-16T15:27:52+02:00Daniel Beveniusci : use macos-latest for arm64 webgpu build (#16029)
2933913f8730ec6d6245480affc30ae3049107956f476888d202ed2b835ae19ea9f9db6baf39e4192972025-09-16T15:25:57+02:00Daniel Beveniusggml : fix padding in timestep embedding kernels (#15932)
29476888d202ed2b835ae19ea9f9db6baf39e419297f1fbffb5c0b34b2a68febb7da3fd0f8333f1ed4c2025-09-16T13:41:38+02:00Daniel Beveniusci : upload xcframework artifact from ios-xcode-build job (#16010)
295f1fbffb5c0b34b2a68febb7da3fd0f8333f1ed4c51abc96bdc52ba8cd6ad78dcf12ed9a041d7b4422025-09-15T23:59:19-07:00Bowen Hanfix: apply clang-format to CUDA macros (#16017)
29651abc96bdc52ba8cd6ad78dcf12ed9a041d7b44207808ebb07e2b1aa19032705e332679ddf9676142025-09-16T05:57:16+02:00Daniel Beveniusci : update macos-latest* jobs to use macos-latest (#15938)
2973d4053f77f0f78ee2b791088c02af653ebee42dddc381aa9a6dc45f00673471d34b8bddd30e775702025-09-15T16:28:31-06:00Jake KarnesCUDA: fix im2col_3d to respect non-contiguous inputs (views) (#15956)
29828c39da7c645185ade5436767929d7ec33006033106220562aca42b6738b8f51acfce0db1b8a2fb62025-09-15T13:08:30+03:00Nikolay Popovllama-run: Fix model download on Windows (#15988)
299a68f31edd71cc39141113f05f7133a3e9ece8c61b8e09f08b9a91c0401bc67d17a17c907564203462025-09-15T02:54:57-05:00ddh0fix KLD percentile output (#15999)
300b8e09f08b9a91c0401bc67d17a17c907564203466c019cb04e86e2dacfe62ce7666c64e9717dde1f2025-09-14T23:00:59+02:00Sigbjørn Skjæretmodel : add grok-2 support (#15539)
3010fa154e3502e940df914f03b41475a2b80b985b0261e6a20ffdb79c4875e674b4f6b514bc73cff8f2025-09-15T04:43:54+10:00Adamrocm.Dockerfile: added gfx1200,gfx1201 architectures to support AMD Radeon RX 9000 series (#15994)
302261e6a20ffdb79c4875e674b4f6b514bc73cff8fa0e13dcbe5bae7025660349ef3e4ead060e507f22025-09-14T16:56:28+02:00Ruben OrtlamVulkan: Clean up mul_mm shader (#15987)
303a0e13dcbe5bae7025660349ef3e4ead060e507f2a14bd350141fb42b8bf2dd2342cebc27bfdce3992025-09-14T22:20:35+08:00lcybuild: fix the build failures of Windows HIP release job (#15984)
304a14bd350141fb42b8bf2dd2342cebc27bfdce399918b26f197f55d5d562446dfc876d0e637929d072025-09-14T15:33:22+03:00Georgi Gerganovmetal : fix kernel requirements (#15983)
305918b26f197f55d5d562446dfc876d0e637929d079ecb88434644c865232bb665d2f6f05049fc64562025-09-14T12:28:18+03:00Radoslav Gerganovrpc : fix regression when --device is used (#15981)
3066380d6a3e709cb02a8695afdd96b40e674477332aa0c461efe3603639af1a1defed2438d9c16ca0f2025-09-14T13:37:03+08:00Aaron Teoggml-zdnn: rm user mapped buffers (#15965)
307aa0c461efe3603639af1a1defed2438d9c16ca0fb9c9c9f789cd57fb0b28b25223305613cd90fa102025-09-13T16:29:43+01:00Jeff Bolzvulkan: fix failing dequant shaders (#15862)
308b9c9c9f789cd57fb0b28b25223305613cd90fa1050f4281a6f5c3a5d68bdeb12f904fa01e0e2ba912025-09-13T16:23:30+01:00Jeff Bolzvulkan: initialize vulkan-hpp to allow using extension function pointers (#15705)
309f161463a54d9f93d41246286aa4a9569a91d804d84d7b2fca11d1be118ce776f6d72a486c4883b742025-09-13T13:54:28+03:00Georgi Gerganovmetal : allow ops to run concurrently (#15929)
31084d7b2fca11d1be118ce776f6d72a486c4883b7440be51152d4dc2d47444a4ed378285139859895b2025-09-13T12:45:04+03:00Georgi Gerganovmetal : fix memory leaks (#15962)
31140be51152d4dc2d47444a4ed378285139859895b4bf5549269d99bac936a65892da2312cc71b24212025-09-13T02:39:52+08:00Aaron Teoggml-zdnn: fix #15414, activate FP16 and BF16 acceleration and incorrect zTensor free (#15839)
312304ac5693d1e2124f83e0584bc5eea6311d3d3b46c88ad8fa741a2182a2dcf8c5353ae4b5c66e6562025-09-12T13:24:21+02:00Ruben OrtlamVulkan iGPU device selection overhaul and PCI ID API support (#15947)
3130e6ff0046f4a2983b2c77950aa75960fe4b4f0e2df082f56309073ecf885eceaa21b86e8a487e61b2025-09-11T21:19:58+02:00Johannes GäßlerCUDA: larger SRAM reads for tile FA, AMD FP16 dot (#15927)
31424a6734daf6932ff29ba8c1ff0245c51d76f783e2b3efea9a4d91216850856fbb77075db26f6a6eb2025-09-11T15:39:12+02:00Daniel Beveniusggml-cpu : add check for ARM MATMUL_INT8/i8mm support (#15922)
3152b3efea9a4d91216850856fbb77075db26f6a6ebc0389dba43d50695f9d3f57dd1f1a14cbefc100c2025-09-11T12:45:40+02:00Charles Xukleidiai: fix GGML_ASSERT(*cur_backend_id != -1) failed (#15614)
316c0389dba43d50695f9d3f57dd1f1a14cbefc100c00681dfc16ba4cebb9c7fbd2cf2656e06a0692a42025-09-11T15:59:37+08:00hipuddingCANN: Disable acl_graph for prefill stage (#15933)
31700681dfc16ba4cebb9c7fbd2cf2656e06a0692a44f658855fa8f2e42b7ed9a5b298fa39a2e39b0962025-09-10T22:04:03+02:00Oliver SimonsCUDA: Add `fastdiv` to `k_bin_bcast*`, giving 1-3% E2E performance (#15872)
3189de447d94e1ae9d1a36e5a2e5bf47483352c0d9c0f0a3c2851134d49955f3c85afbb0b1bb47c3e072025-09-10T17:31:40+02:00Daniel Beveniusggml-cpu : fix padding in ggml_timestep_embedding (#15917)
3190f0a3c2851134d49955f3c85afbb0b1bb47c3e0733daece86b65607451d0d4378d2d04ba6a20ad552025-09-10T17:52:35+03:00Georgi Gerganovmetal : make the backend async (#15906)
32010d8b2b6b0ac2cae252a80b4daea5da55ab63c2f28b5f190ef1dbea5edf82dbc8b4407b721fadd132025-09-10T18:42:00+08:00Chenguang LiCANN: Add ROPE sin/cos cache for reuse (#15912)
32128b5f190ef1dbea5edf82dbc8b4407b721fadd1386587da03bd78df8f4e7d8b111a0c1d2494d6ed02025-09-10T15:29:12+08:00Chenguang LiCANN: implement LRU cache for ACL graphs (#15814)
32286587da03bd78df8f4e7d8b111a0c1d2494d6ed0ff02caf9eed261423289d1531a56536fbf57bfc22025-09-10T05:33:58+02:00Daniel Beveniusllama : check returned fn ptrs from ggml_backend_reg_get_proc_address (#15893)
323ff02caf9eed261423289d1531a56536fbf57bfc2ae355f6f7108540297d8b7f7ae71d20fe610a0b72025-09-10T05:23:19+02:00Daniel Beveniusci : cache ROCm installation in windows-latest-cmake-hip (#15887)
324ae355f6f7108540297d8b7f7ae71d20fe610a0b74f63cd705c7b6f457f36c63fdc053e07f6f3cc6b2025-09-09T22:26:03+02:00Ruben Ortlamvulkan: throw the oom error instead of no memory type found (#15905)
3254f63cd705c7b6f457f36c63fdc053e07f6f3cc6b17bc5a815f0bebc1844c99796760cd7df5e9b8d92025-09-09T07:41:15-05:00Jeff Bolzvulkan: Fix OOB accesses in soft_max_back (#15861)
326ed54e32558ffe0f2c3b1d31f3227211fae05bd49a972faebed5fdc4a3d2a844d92d476058c02e02d2025-09-09T15:01:15+03:00lksj92hsWorkaround for subgroup arithmetic failing on MoltenVK with AMD GPUs (issue 15846) (#15886)
327a972faebed5fdc4a3d2a844d92d476058c02e02d550cf726e133fd0a069d991287fd3a2a3e3e1cbd2025-09-09T14:38:02+08:00Aman GuptaCUDA: Add mul_mat_id support for the mmf kernel (#15767)
328550cf726e133fd0a069d991287fd3a2a3e3e1cbdc252ce67c4b99f056eeb18d42a289e28fee034752025-09-09T08:11:01+02:00Johannes GäßlerCUDA: fix GET_ROWS for large tensors (#15882)
32970cd37dbbebdb7a2f84f08207f18eabb0b291a55acc1b008cfd95e63d5f99a370dbffb98e5a99d2c2025-09-09T06:06:52+02:00Daniel Beveniusrequirements : update transformers/torch for Embedding Gemma (#15828)
330acc1b008cfd95e63d5f99a370dbffb98e5a99d2c7057faf64b514e991e2f70147f82bb13d544b1c02025-09-09T06:05:55+02:00Piotr Wilkin (ilintar)model-conversion : add extra debugging support for model conversion (#15877)
331e68aa10d8f3d26fdad5b912540362d79de5460e30a16bf52e6874369cb4fd2bdc4863ef984b688e72025-09-08T13:10:07-05:00Jeff Bolzvulkan: sort graph to allow more parallel execution (#15850)
33288021565f08e0b7c4e07ac089a15ec16fae9166c56920f56651908d5cce7a310dabf54ac4f6fbb7f2025-09-08T10:59:48-04:00Jessechat : Deepseek V3.1 reasoning and tool calling support (OpenAI Style) (#15533)
333b0d52998b962bd2681c34bf52af993af79f178b8f28d4f4ac963f182ea9d0fe9e269f3f5f3782aaf2025-09-08T13:56:51+03:00Georgi Gerganovcuda : fix supports_op condition for get_rows when number of blocks is too large (#15868)
334f28d4f4ac963f182ea9d0fe9e269f3f5f3782aaf9fcb29f22f5c33c04c7f0daebb24057899d67a1a2025-09-08T13:34:56+03:00Georgi Gerganovmetal : refactor + optimize (#15857)
3359fcb29f22f5c33c04c7f0daebb24057899d67a1a5ef22d281de9c5eaaf616874bc490b89241128cb2025-09-08T17:33:01+07:00Xuan-Son Nguyenggml: allow casting between f32 and i32 (#15783)
336233d773d02c37982badddf3994e9953a175f34daa885dcff11a7b73f9377812d6151f6b15d307de02025-09-08T09:44:34+02:00Daniel Beveniusconvert : force setting sliding_window from original config (#15867)
337a885dcff11a7b73f9377812d6151f6b15d307de0663027fd5490438ce9c27ea866a560e1e268d11f2025-09-08T10:27:07+03:00Georgi Gerganovbatched-bench : fix llama_synchronize usage during prompt processing (#15835)
338663027fd5490438ce9c27ea866a560e1e268d11fcf0e3ba1500bd23635b444f64ba23cbdb56c92ef2025-09-08T10:26:36+03:00Georgi Gerganovcontext : fix n_outputs during reserve (#15858)
339cf0e3ba1500bd23635b444f64ba23cbdb56c92efd413dca00360a7e4cb71441dacecfa32556fcc312025-09-08T10:25:33+03:00Georgi Gerganovmodel : avoid ggml_cont_3d for fused QKV weights (#15662)
340d36e61c580bf7fc7879c443c542312a42b718e11c97b5e5854b47b18a248d77edb693c63018a08652025-09-08T02:18:28+08:00Aaron Teoggml-cpu: clean up s390x SIMD (#15855)
341267e99867f09bec8bcc2e424ad9bcddd6cccf9d03b15924d71237a43bb5ad71f5b885ee66a8213422025-09-07T11:53:07-05:00Jeff Bolzvulkan: Use larger loads in scalar/coopmat1 matmul (#15729)
3423b15924d71237a43bb5ad71f5b885ee66a82134279bc429262268ad2ac8a364cfe6c2d6b9c5f008a2025-09-07T10:19:45+02:00Daniel Beveniusggml WebGPU: remove userdata from request adapter callback (#15527)
34361bdfd5298a78593be649a1035ee2a120b13c4f001806e77714ae8a78130d432945b959a0956c56f2025-09-06T18:35:04+07:00Xuan-Son Nguyenserver : implement prompt processing progress report in stream mode (#15827)
344fd621880f3fd908424e675a41715a2dc760247a24281c7b315f8a904549fe527039b976e08098d1a2025-09-05T17:32:39-06:00Gabe GoodhartaLoRA Support (#15327)
3455fac79cbc77b6d12c9feb5f34fc63586b35fd561408ff524b40baf4f51a81d42a9828200dd4fcb6b2025-09-05T14:31:24-06:00Gabe GoodhartThinking model disabled assistant prefill (#15404)
346408ff524b40baf4f51a81d42a9828200dd4fcb6b5143fa895e7725c5bd2135daf7d8f793d98fa91c2025-09-05T19:43:59+01:00Eric CurtinImplement --log-colors with always/never/auto (#15792)
347a81283820a466f2ace06ce4d4bc9512761f9365fc610b6c11b1ef7d678671dcf15acd7187a7ad8f32025-09-05T11:34:28+02:00Erik Scholzgguf: gguf_writer refactor (#15691)
348c610b6c11b1ef7d678671dcf15acd7187a7ad8f35d6688de08e73acc2532d668380801ed79d704eb2025-09-05T10:39:22+03:00Georgi Gerganovkv-cache : fix SWA checks + disable cacheless iSWA (#15811)
3495d6688de08e73acc2532d668380801ed79d704eb4fd1242bef6cb2325b4ff1c1a80f3b54b64508a62025-09-05T04:36:23+02:00Daniel Beveniusmodel-conversion : add --embeddings flag to modelcard.template [no ci] (#15801)
3504fd1242bef6cb2325b4ff1c1a80f3b54b64508a6b2426e469e2fdb6c44216d56baa4cfff4f39ae002025-09-05T01:24:08+02:00ExtReMLapinchat : fixed crash when Hermes 2 <tool_call> had a newline before it (#15639)
351b2426e469e2fdb6c44216d56baa4cfff4f39ae009e2b1e83c68a38ea0c64f726dd979439bd02189b2025-09-05T01:22:22+02:00Piotr Wilkin (ilintar)chat : nemotron thinking & toolcalling support (#15676)
3529e2b1e83c68a38ea0c64f726dd979439bd02189bfb15d649ed14ab447eeab911e0c9d21e35fb243e2025-09-05T01:05:12+02:00Piotr Wilkin (ilintar)scripts : add Jinja tester PySide6 simple app (#15756)
353d1e2adba65208d6de3d7f6f23b00c562ff5bb777c1c354e44c06d259679bb5bb7a8fa9f0b28480e42025-09-04T15:40:44+02:00Daniel Beveniusllama : set n_outputs to 1 to avoid 0 outputs mean-pooling (#15791)
354c1c354e44c06d259679bb5bb7a8fa9f0b28480e4a68d9144262f1d0ef4f6ba7ad4a7e73e977ba78c2025-09-04T20:20:14+08:00Chenguang LiCANN: Refactor ND to NZ workspace to be per-device (#15763)
355a68d9144262f1d0ef4f6ba7ad4a7e73e977ba78cbadb80cadbc40e047b30c43611aba575fc8d68452025-09-04T11:50:23+02:00Xuan-Son Nguyenserver: add exceed_context_size_error type (#15780)
356badb80cadbc40e047b30c43611aba575fc8d68450a1b3982cd0bd18730d50a693053b88c13fd04a62025-09-04T10:49:44+01:00Eric CurtinDocument the new max GPU layers default in help (#15771)
3570a1b3982cd0bd18730d50a693053b88c13fd04a65421f63ab08ca1e1a093662a5ccd0117e461185f2025-09-04T16:38:49+08:00leejetggml: add ops for WAN video model (cuda && cpu) (#15669)
3585421f63ab08ca1e1a093662a5ccd0117e461185f820bc9853100708011036e10f40b923968dd9b662025-09-04T15:12:30+08:00hipuddingCANN: Fix precision issue on 310I DUO multi-devices (#15784)
359239b60e8986bbcb944f57311a02ac994431bf652dff7551bfdbdd6e57c13e523d7dcca317640e9072025-09-04T11:03:02+08:00Chenguang LiCANN: fix acl_rstd allocation size in ggml_cann_rms_norm (#15760)
360dff7551bfdbdd6e57c13e523d7dcca317640e9070fce7a1248b74148c1eb0d368b7e18e8bcb968092025-09-03T22:55:10+02:00Ruben Ortlamvulkan: fix mmv subgroup16 selection (#15775)
361661ae31c9c68201577e70278285b349a5a662caf407c23786dd0d3a503e9429eead96e611d3950c92025-09-03T19:59:16+02:00Oliver SimonsCUDA: Optimize `rms_norm_f32` kernel and its fused variants, giving 1-6% perf E2E (#15715)
362407c23786dd0d3a503e9429eead96e611d3950c9cdedb70a998cea7052560fe0b0615a839443564d2025-09-03T18:28:36+02:00Daniel Beveniusmodel-conversion : fix pyright errors (#15770)
3632c8dac72eb6acd4e20c0da251535dfc46d35178b40a751ea9a94364da73537b86502a808ebe1fc3a2025-09-03T13:35:49+02:00Daniel Beveniusllama : fix incorrect model type for Gemma 270M (#15764)
36405c0380f2ae5c7193445e03ebc7b6de9ce49f1a68c3fdf44ecf08335942f2ba558955f55e88c79912025-09-03T16:16:21+08:00xctanggml-cpu : optimize RVV kernels (#15720)
365f6da8cb86a28f0319b40d9d2a957a26a7d875f8c8a2234ea0c89f212190c176d741b7742f00825822025-09-03T14:08:22+08:00hipuddingCANN: Mask unsupported TRANSPOSE_1D operator (#15733)
3668a2234ea0c89f212190c176d741b7742f00825823de008208b9b8a33f49f979097a99b4d59e6e5212025-09-03T10:43:53+08:00Chenguang LiCANN: Fix type float_t to float (#15736)
3673de008208b9b8a33f49f979097a99b4d59e6e52169db8a52e6dd0db81ec05c581150cc1e43b8ac462025-09-03T03:27:30+08:00SnA1lGofix: resolve unsigned int initialization warning for n_dims/size in gguf.cpp (#15754)
3680a2a3841e8ebc570da343e8cf58a21c1010b41e79961d244f2df6baf40af2f1ddc0927f8d91578c82025-09-02T16:02:26+02:00Ruben Ortlamvulkan: fix shaders gen when no integer dot is available (#15740)
3699961d244f2df6baf40af2f1ddc0927f8d91578c825f1045f07cf0daf667d63e35618842e3174a8c72025-09-02T17:12:37+08:00hipuddingCANN: Resolve soft_max precision issue (#15730)
37025f1045f07cf0daf667d63e35618842e3174a8c797669e40735d08db65ef094a8faae8e8411a97db2025-09-02T01:37:01-05:00Jeff Bolzvulkan: Fix macro parameter order for f32 matmul shaders (#15716)
3712f853687b3bce15e143a22f678d1715060fd606cef2af57ddf04ab367f6ba6e8ed100fc56785e4b72025-09-02T14:07:48+08:00Chenguang LiCANN: Support eager execution mode under ACL graph compilation (#15712)
372d4d8dbe383e8b9600cbe8b42016e3a4529b5121935a42edac84690990a75726898d975cd08d220c02025-09-01T22:17:42+03:00Gilad S.vulkan: use memory budget extension to read memory usage (#15545)
373a0c2b207c596d1092a08615de61ab56a7d63515f4b20d8b7e31718d3fe8b4f12d220a9d19e4f19972025-09-01T23:43:16+05:30Prashant Vithuleggml: aarch64: Implement SVE F16 kernels for vector functions (#15115)
37402c1813517412f3e00aa6ca7c0273fea64edb49277dee9de97be75b7143a213bc48893e0c0b29af72025-09-01T16:19:07+02:00Ruben OrtlamVulkan: Add Integer Dot Product mul_mat_vec shader for legacy quants (#14903)
375b66df9d9c942254d03209186ef24ed7c994a576eb9382c3877c6067feccf182efe9449a2d1cb24c72025-09-01T06:55:06+05:30Akarshan BiswasCUDA: fix build error from ambiguous __half conversions in conv2d (#15690)
3763dc7397a2799bdc07bccf637ab7ae5a1e786d1a4e92d53b29e393fc4c0f9f1f7c3fe651be8d36faa2025-09-01T08:57:00+08:00hipuddingCANN: fix RoPE cache issue on multi-device (#15629)
377e92d53b29e393fc4c0f9f1f7c3fe651be8d36faa0d161f021aa33ec0e90cce96f5d1a889255573272025-08-31T20:41:02+03:00Georgi Gerganovsampling : optimize samplers by reusing bucket sort (#15665)
3780d161f021aa33ec0e90cce96f5d1a889255573274efd5a83163ff383285b3a4c2106feabf5c695572025-08-31T20:11:58+03:00Georgi Gerganovserver : enable /slots by default and make it secure (#15630)
3794efd5a83163ff383285b3a4c2106feabf5c69557274966226f87f301ac132da898280ca3142b60e52025-08-31T19:43:30+03:00Georgi Gerganovmetal : fix checks for available FA kernels (#15700)
380274966226f87f301ac132da898280ca3142b60e59777032dccd67bdc7785aeab7497014a8be8dacc2025-08-31T08:47:05-07:00Diego Devesallama : fix fattn reserve call n_seqs parameter (#15699)
381e81b8e4b7f5ab870836fad26d154a7507b341b3638ad381f9f5d4dd368a96d844fb19cf501ed9d222025-08-30T16:32:10+02:00Johannes Gäßlerllama: use FA + max. GPU layers by default (#15434)
382ef476916bba4b44f44be0c98babc1cb025968e75d82f6aa34a216f5df1945cdfe121ba5e6cd80be02025-08-30T10:18:35+08:00Chenguang LiCANN: FIx compiler warnings (#15661)
38381017865ee444cf49ce0136f2be1e41a0270ff9160e5eee31f1af9bb579ac45380e3857d610020b92025-08-29T21:30:06+08:00Aman GuptaCUDA: fix bug in rms_norm fusion (#15660)
38460e5eee31f1af9bb579ac45380e3857d610020b9009b709d6efd24820ac67765ed339a72dc7978142025-08-29T14:53:41+02:00Piotr Wilkin (ilintar)chat : Seed OSS thinking + tool call support (#15552)
385e8d99dd0b67f2ecc1e45fca8074a3a18c3e036d2a8bca68f727844e7dcf24a956003b3c2039ea5632025-08-28T18:39:31-06:00Gabe Goodhartnvidia nemotron nano v2 (nemotronh) (#15507)
386a8bca68f727844e7dcf24a956003b3c2039ea563c97dc093912ad014f6d22743ede0d4d7fd82365a2025-08-28T15:27:36-05:00Gabe Goodhartfix: Compute the full sum in llama-eval-callback, not just the sum of printed values (#15637)
3876c442f42ff25564a0cd6b1435d9abc1b0178eac573804145ab6c06888e314046abf08f66a01336792025-08-28T22:39:27+08:00Aaron Teoggml-cpu: fix invalid hsum build in debug s390x (#15634)
38873804145ab6c06888e314046abf08f66a0133679c8d0d14e77c3c45df5cbbddde9c2b4c377ec4e7a2025-08-28T10:11:36-04:00compiladeggml : fix SSM_SCAN for n_groups > 1 (#15625)
389c8d0d14e77c3c45df5cbbddde9c2b4c377ec4e7a84ab83cc0b4b7e769451ee48e4c7d1acef91ef252025-08-28T17:09:05+03:00Georgi Gerganovkv-cache : fix find_slot to not search for continuous slot (#15638)
39084ab83cc0b4b7e769451ee48e4c7d1acef91ef2555042b3692cb1467c9ee15c62c4a9fbf180f89e32025-08-28T15:49:50+02:00Sigbjørn Skjæretmodel : jina-embeddings-v3 support (#13693)
391d35a1e8c41f747548775225973a99507896a8c6146d9caa27a0281150e8cf082308c0f9e7576ebe52025-08-28T01:48:20-06:00Joshua Cogliaticli : change log to warning to explain reason for stopping (#15604)
39246d9caa27a0281150e8cf082308c0f9e7576ebe55a0e3ef6f00c658fbae53797f02d5a360ebf8fec2025-08-28T09:26:48+02:00Daniel Beveniusmodel-conversion : add mmproj conversion target (#15628)
3935a0e3ef6f00c658fbae53797f02d5a360ebf8fecfbef0fad7a7c765939f6c9e322fa05cd52cf0c152025-08-27T17:32:36-07:00matiaslincuda: Add cublasLt_static linking when GGML_STATIC is enabled (#15622)
3941e7489745a74996fc36e8fd05b73aa16bc184e0c1cf123a343ab7ca5586aacb9e0a1d2de7fe33be42025-08-27T17:21:41+08:00Chenguang LiCANN: refactor mask handling and improve performance in FA (#15561)
39586076f92de1a547ef87c304facca3b4b9fae6c21bcbddcd54f0d5c22eab180831fdea6484107112f2025-08-27T08:36:05+02:00rmatifOpenCL: add fused group_norm/norm, mul, add (#15314)
39687932ec016f0ec81e98a13ce5212851f8c12458a0115cfb7c1dec0753aecb34f3af4338bf9de8eeb2025-08-27T14:29:18+08:00Yunzhe Jiafix merge problem
397bcbddcd54f0d5c22eab180831fdea6484107112f8b696861364360770e9f61a3422d32941a4778242025-08-26T13:14:38-07:00Diego Devesatests : fix test-opt with GGML_BACKEND_DL (#15599)
3988b696861364360770e9f61a3422d32941a4778248ce3ff1d91245e158d98d8062cd64b0dd98dcfe32025-08-27T00:27:49+05:30Akarshan BiswasSYCL: fix rms_norm_mul_add for tensor dim not a multiple of sg_size (#15592)
3998ce3ff1d91245e158d98d8062cd64b0dd98dcfe344b1efa41acd4df3f56ee0e46f898135ecd1a0542025-08-26T20:05:50+02:00fidorielmtmd : fix mtmd ios build (#15579)
400a6a58d64785cb458ed9de52f391aa38142d38d640373486dbc0dccbdcb3b5fdd65759d88cec061962025-08-26T21:05:25+05:30shalinib-ibmllamafile: PowerPC Sgemm Optimization (#15558)
4010373486dbc0dccbdcb3b5fdd65759d88cec0619662cef26ac5b6b7acb635d3dc963813b43952dc2b2025-08-26T17:45:17+03:00Georgi Gerganovgraph : fix assert in memory-less build_attn (#15590)
40262cef26ac5b6b7acb635d3dc963813b43952dc2b8f5afa94c4f929da71f560db7c9f38ef6a783d952025-08-26T16:12:29+02:00Daniel Beveniusmodel-conversion : add qat-q4 quantization targets (#15588)
403b3964c1e890ef8c947afb36a5124ce6fcb2136d479a546220c719e6a70627b243a478ab8d84dc9e12025-08-26T14:22:14+03:00Georgi Gerganovmetal : optimize FA vec for large sequences and BS <= 8 (#15566)
40479a546220c719e6a70627b243a478ab8d84dc9e185cc1ae998e4898d9fa992cb9b8620338cee97bf2025-08-26T12:54:19+02:00Xuan-Son Nguyenmtmd : support Kimi VL model (#15458)
4054c37636b3ea96f2574eeb7668b93fcc0e64b05dd34bdbbd7c2b70b848718e95bc48010f6aecd28162025-08-26T13:15:33+07:00Yoshi_likes_e4Add a warning for special devices (#15563)
406f7207b0415986dd7f48447149da7de3a823382764d917cd4f64cc37744e76d084659475819fb07282025-08-25T14:18:09-07:00lhezopencl: fix support ops condition for `rms_norm` (#15560)
4074d917cd4f64cc37744e76d084659475819fb0728886b97a5d693550c2da470c091d9d27bf38398f82025-08-25T17:56:59+02:00Ruben Ortlamvulkan: fix min subgroup 16 condition for mmid subgroup optimization (#15565)
408886b97a5d693550c2da470c091d9d27bf38398f8111f8d06f0b9169059779a35f655b343242ccbb62025-08-25T10:47:16-05:00Jeff Bolztests: Generate unique input values for count_equal (#15487)
409111f8d06f0b9169059779a35f655b343242ccbb65eff6ec9b1220b599a43b594b1110487ab6aca082025-08-25T11:27:34-04:00Ihar Hrachyshkametal: fix regression when no metal devices are present (#15531)
4105a6bc6b1a6cb665a944426c2055794950e524bf56b64f74b55628e4193f4fb00313f07dbd85565282025-08-25T14:25:25+02:00Daniel Beveniusmodel-conversion : add model card template for embeddings [no ci] (#15557)
4116b64f74b55628e4193f4fb00313f07dbd85565280d5a470223fc90b6b6807921d68011ff06ae7f9e2025-08-25T13:56:43+03:00Georgi Gerganovbatched-bench : fix unified KV cache handling + pp timing (#15562)
4127da9fed0d6f1750a8783436f6f313b87e76e6378c247d06f38fc09059c9607a28aa44f5ff6be208d2025-08-25T14:32:16+08:00RunningLeonconvert : support interns1-mini (#15412)
413043fb27d3808766d8ea8195bbd12359727264402b730706a49e576fb882dc34d9966345778b3ab0b2025-08-24T19:36:36+02:00Ruben Ortlamvulkan: apply MUL_MAT_ID subgroup optimization to non-coopmat devices (#15524)
414a9c6ffcbfacee092bfaaa400306fceda18199737e78cf0d4b1bdbbc2479f11d58ce0c8f51f7558752025-08-24T10:48:53+02:00Ruben Ortlamvulkan: enable Conv2D for Apple after MoltenVK fixed the bug (#15526)
415e78cf0d4b1bdbbc2479f11d58ce0c8f51f755875710dfc465a68f7443b87d9f792cffba00ed739fe2025-08-24T03:48:21-05:00Jeff Bolzvulkan: workaround MoltenVK compile failure in multi_add (#15506)
416710dfc465a68f7443b87d9f792cffba00ed739fe611f419cff11e4952228162a1c44cb35dff2274a2025-08-23T21:37:06+02:00Johannes GäßlerCUDA: fix half2 -> half conversion for HIP (#15529)
417611f419cff11e4952228162a1c44cb35dff2274ab1afcab804e3281867a5471fbd701e32eb32e5122025-08-23T13:16:17-05:00Jeff Bolzvulkan: optimize rms_norm, and allow the work to spread across multiple SMs (#15281)
418b1afcab804e3281867a5471fbd701e32eb32e5129ef536907de1b50c30e0369284898d30472a755a2025-08-23T15:21:52+02:00Piotr Wilkin (ilintar)model : add support for Seed-OSS (#15490)
4199ef536907de1b50c30e0369284898d30472a755a21dc4ddaf21b8ed551d717e7606abd2cffbacdbf2025-08-23T12:58:58+02:00Johannes Gäßlerscripts: fix compare-llama-bench.py (#15521)
42021dc4ddaf21b8ed551d717e7606abd2cffbacdbf289bf4113ef5c02d8f5eb0cf2d86683d8b8bc4d92025-08-23T16:38:30+08:00LaffeyNyaachat : fix debug build assertion in trim function (#15520)
4210a9b43e507a359ca392c037cf341f55137ad0b69330c3d2d21b55bca5517db7d2eea2ea8f131df4a2025-08-23T08:35:21+02:00Aclyvulkan : support ggml_mean (#15393)
42245363632cbd593537d541e81b600242e0b3d47fc32732f2459a598606055f0403f0e4ec148d06d682025-08-22T11:28:03-07:00Reese Levineggml WebGPU: add support for quantization types (#15440)
423ad5c975c2d0297124fad210776ef8eed6b90d5784afb0a746f22abaa545b3ebdb76a400d7da3a7132025-08-22T16:11:04+08:00Aaron Teoggml-cpu: Support Q5_0 and Q5_1 on s390x (#15486)
424a0f98dd604d34826eb5ea2560d1e23fe726921df54a241f505d515d625767b993bfd573ecee306b92025-08-22T14:12:07+08:00Chenguang LiCANN: Optimize RMS_NORM using cache (#15419)
42554a241f505d515d625767b993bfd573ecee306b9cd36b5e5c7fed2a3ac671dd542d579ca40b48b542025-08-21T14:09:32-07:00Diego Devesasched : fix possible use of wrong ids tensor when offloading moe prompt processing (#15488)
4269ad5e60dba38a6718366b7ac43e7d8e8abdc36c9715a6db02ccb16284837885f2c6fab05d8f7a6ee2025-08-21T22:53:13+08:00Jie Fu (傅杰)examples : fix some typos in examples/model-conversion/README.md (#15477)
427029bb39eb1e7ae0e5df817ce97931abcd5fa52a930649cab657d87ac46692332a76e1b75d5d22e002025-08-21T17:52:16+05:00Ali Tariqci : enable RVV1.0 native build (#15386)
428b108e429043ee5c9fc8fa4957a0a52c3e490d5c9245be739df942861ddc52331b095b40f18e2a3f12025-08-21T05:06:46-05:00Michael Gibaci : fix -Werror=return-type in clip.cpp so ci/run.sh can run without issue (#15221)
429245be739df942861ddc52331b095b40f18e2a3f1b2caf67db1208fd38a0570785c39f7370d906d8a2025-08-21T11:47:52+02:00Copilotci : add copilot-instructions.md (#15286)
430b2caf67db1208fd38a0570785c39f7370d906d8a2f3dbffb17ef782edfd50e5a130cec6e8a7e47f82025-08-21T11:19:50+02:00Julien Denizeconvert : make Mistral community chat templates optional via parameter (#15420)
4312f3dbffb17ef782edfd50e5a130cec6e8a7e47f8945e1f12a6b586ebf82fa4fd7f347225e58174c52025-08-21T16:54:34+08:00Jie Fu (傅杰)common : fix incorrect print of non-ascii characters in the logging (#15466)
432945e1f12a6b586ebf82fa4fd7f347225e58174c51b0db8f6e08951969e2447c2d18bf638effb8f752025-08-21T07:32:26+02:00Xuan-Son Nguyenggml : fix condition of im2col on Metal backend (#15460)
4331b0db8f6e08951969e2447c2d18bf638effb8f7529f538ac630d6544406a0702476e36808a6bd1b32025-08-21T07:19:22+02:00stduhpfserver : fix webui (#15462)
43429f538ac630d6544406a0702476e36808a6bd1b38ad038c0fdc719ced9fbf921a02cbae9ad79287f2025-08-21T06:12:28+02:00Daniel Beveniusexamples : remove references to `make` in examples [no ci] (#15457)
4351bc664a26a1d93a48baf2483a7ff95291ca8bcb813aeb7aef284daed4ad07dc14b4b3e2a42b5ea972025-08-21T07:10:08+09:00teoserver: fix OpenAI API compatibility for usage statistics in chat streams (#15444)
436657b8a77bd01854f99d37a47318fa24f2e7e298fec5ab1a36c11dd3efcf4ec8d1ac89a13a8117bc32025-08-20T14:26:01+02:00Daniel Beveniuschat: handle gpt-oss return/end token inconsistency (#15421)
437ec5ab1a36c11dd3efcf4ec8d1ac89a13a8117bc31a99c2d948209d9ea5eac8b6dc0a2971072445402025-08-20T18:33:30+08:00Jie Fu (傅杰)common : fix context shift help message (#15448)
4381a99c2d948209d9ea5eac8b6dc0a29710724454037f10f955f70e0158d50343d0b9a3f92d194daae2025-08-20T18:32:05+08:00xiaobing318cmake : fix target include directories (#15450)
43937f10f955f70e0158d50343d0b9a3f92d194daae2f37014073f4c6ddc8f241c927db87337c71aa522025-08-20T12:31:16+02:00Daniel Beveniusmake : remove make in favor of CMake (#15449)
440a094f381432d92c4bf92d2d6167284316ba73a62fb22dd07a639e81c7415e30b146f545f1a2f2caf2025-08-20T10:17:37+08:00R0CKSTARmusa: fix build warnings (#15258)
4411e19f5d462b6df490a13103ca555d851f47e5fa5d2fcd91cf96b46f4485ce46b4e3a32bf0df377152025-08-19T18:58:14+02:00Gian-Carlo Pascuttocommon : Add top-nsigma sampler to help globally (#15428)
442d2fcd91cf96b46f4485ce46b4e3a32bf0df37715a6d3cfe7fa6ea1fb0e1ba8243b731db22ddc0b492025-08-19T16:46:37+03:00Georgi Gerganovserver : disable context shift by default (#15416)
443a6d3cfe7fa6ea1fb0e1ba8243b731db22ddc0b4967f09a3a27db443f9870aac87e163dba0d08131e2025-08-19T21:28:22+08:00SHUAI YANGCANN: optimize rope operator (#15335)
444d1d82416006e7ff41780cb0e9b5f28d30a267497618575c5825d7d4f170e686e772178d2aae148ae2025-08-18T16:51:42+02:00davidefserver : fix incoming tasks not process in order (#15395)
445618575c5825d7d4f170e686e772178d2aae148aef44f7931729022c57319a0124931120a169e0da92025-08-18T05:50:48-05:00Dobri DanchevFix broken build: require updated pip to support --break-system-packages (#15357)
446f44f7931729022c57319a0124931120a169e0da9ae532eac2c1df1d8edc3d2719145895b966de1bf2025-08-18T03:23:56-04:00compiladeggml-quants : fix make_qp_quants NANs and IQ1 assertion errors (#15379)
447b143fbc87af0324aa49e16cd91faf3ba8bb22231de5627910df74298c998e6bb36ee3217375a57192025-08-17T13:30:23+02:00Sigbjørn Skjæretci : fix hang in windows-hip build/release (#15365)
44865349f26f2299e06477ec8e85e462430468013581fe00296f587dfca0957e006d146f5875b61e43d2025-08-16T23:33:54+02:00Tarek Dakhranmodel : support vision LiquidAI LFM2-VL family (#15347)
4491fe00296f587dfca0957e006d146f5875b61e43dde2192794f4e8e04f2e8167ef2424905145e88fc2025-08-16T11:48:22-05:00Jeff Bolzvulkan: fuse adds (#15252)
450de2192794f4e8e04f2e8167ef2424905145e88fc2e2b22ba6607414a5d619ac6d2f034b5b02214e52025-08-16T04:18:31-05:00Jeff Bolzvulkan: Support mul_mat_id with f32 accumulators (#15337)
451912ff8c119f01ae029543c7fdf7a84f91a0437a35e6229a8409ac786e62cb133d09f1679a9aec13e2025-08-16T10:05:55+02:00rmatifOpenCL: add initial FA support (#14987)
4525e6229a8409ac786e62cb133d09f1679a9aec13ee2c1bfff5305c661ac53e9d57cb732ff626a22422025-08-15T19:50:52+02:00Daniel Beveniuscommon : fix double bos, use common_chat_templates for add_bos and add_eos (#15326)
453e2c1bfff5305c661ac53e9d57cb732ff626a22425edf1592fdb9131d01321aeef4241c6a34969e272025-08-16T00:52:14+08:00lhezopencl: add initial mxfp4 support via mv (#15270)
4545edf1592fdb9131d01321aeef4241c6a34969e27db3010bd23980bad5f5d93ec3e6757ec531a413b2025-08-15T17:16:36+03:00Georgi Gerganovvulkan : fix out-of-bounds access in argmax kernel (#15342)
455db3010bd23980bad5f5d93ec3e6757ec531a413bff27f80a74bbe5303acd511a6781a1de6d619b3c2025-08-15T16:28:28+03:00Georgi Gerganovvulkan : fix compile warnings on macos (#15340)
456ff27f80a74bbe5303acd511a6781a1de6d619b3cd3248d9b6557c75d59954c594bb53cf517591e912025-08-15T21:11:22+08:00Aaron Teoggml: initial IBM zDNN backend (#14975)
457d3248d9b6557c75d59954c594bb53cf517591e917aeee88cfe9c0434eac722b0f7c21404f48758a52025-08-15T14:02:39+02:00Sigbjørn Skjæretci : fix ios-xcode-build (#15324)
458b07791aa1d4831a08ad54ca19aa206c0c5c0f34a4227c9be4268ac844921b90f31595f81236bd3172025-08-15T11:23:17+02:00Johannes Gäßlertest-opt: fix backend support check (#15317)
4594227c9be4268ac844921b90f31595f81236bd317df36bce667bf14f8e538645547754386f95163262025-08-14T23:21:24+02:00Johannes GäßlerCUDA: fix negative KV_max values in FA (#15321)
460df36bce667bf14f8e538645547754386f9516326f75b8306472811ecc4e4457d5573a09201f021832025-08-14T22:10:51+03:00Georgi Gerganoveval-callback : stop on first NaN (#15320)
4617a0de960452f9a57de7f1d167e57b6f3ee5ac1b6e4e915912cfd2ee15c5a4a0074813232134892f62025-08-14T17:56:26+02:00Daniel Beveniusllama : add 18-layer model type for Gemma 3-270m (#15319)
462e4e915912cfd2ee15c5a4a0074813232134892f65ba36f61033d2819be27e2abb70e9a3bd20c0fde2025-08-14T17:45:27+02:00simevodevops : fix compile bug when the BASE_CUDA_DEV_CONTAINER is based on Ubuntu 24.04 (#15005)
463b204a5a234f4cf0b3f449476da639a5510c6d157646944cfa8961afd914dd6637739b3cda9a72e112025-08-14T09:23:11-05:00Aldehir Rojasgpt-oss: implement harmony parsing (#15181)
464863d341eeb81db104902b14b6f9413daa515e957d32e03f4495d3efa1c5126f53b449f1d429c56642025-08-14T08:38:10-05:00Jeff Bolzvulkan: perf_logger improvements (#15246)
465d32e03f4495d3efa1c5126f53b449f1d429c56643973163bff40f7f5161b0f08a0011729e2b0406a2025-08-14T14:59:50+03:00Georgi Gerganovserver : add SWA checkpoints (#15293)
4665ade3000bd6040bf6878eafd6c77168552f73c478b2483730f90d6f23e2b188a54a210498bba937f2025-08-14T19:17:51+08:00Jason Niggml: fix ggml_conv_1d_dw bug (ggml/1323)
467810b9fc8b99dd55517a3e94c6dee29748d4825594ebd0c125b24a0d7a78b0ffc1d9567530ed8f0c42025-08-14T20:03:30+09:00kallewoofperplexity : provide a helpful hint for has_cpl case in split_equal error. (#15304)
4684ebd0c125b24a0d7a78b0ffc1d9567530ed8f0c45cdb27e0917479d2d742cea7beee089574bb09fa2025-08-14T12:22:07+02:00Sigbjørn Skjæretcuda : fix GGML_CUDA_GRAPHS=OFF (#15300)
4695cdb27e0917479d2d742cea7beee089574bb09fa3ea913f1ce9567289aedd866a569dbab8fb8e4192025-08-14T03:03:57-07:00Jonathan Graehlfinetune: SGD optimizer, more CLI args (#13873)
4703ea913f1ce9567289aedd866a569dbab8fb8e41929c8fbe4e05fd23c44950d0958299e25fbeabc5c2025-08-14T15:16:32+09:00kallewoofperplexity: give more information about constraints on failure (#15303)
4711adc9812bd33dc85489bf093528d61c22917d54fb3e16665e14032d1276f9d0263acef8321b6f5182025-08-13T11:21:31-07:00Bas Nijholtfix(nix): remove non-functional llama-cpp cachix cache from flake.nix (#15295)
472d8914fc47e8a69b28c670325cb1c8ce33e3a2960e885445bc1719d2e289a9b2e11714e0f994e68be2025-08-13T12:44:40+02:00Copilot common : add --override-tensor-draft, --cpu-moe-draft and --n-cpu-moe-draft parameters (#15191)
473648ebcdb739abfb5a9be14f4c5c0fd19ff268ef007aa869a91837d95fcb5612c65a188763ac386472025-08-13T15:14:44+05:00Ali Tariqci : Added CI with RISC-V RVV1.0 Hardware (#14439)
4746028bf74351d35a06bd98498624f8c2f029f7d1abc5182272c373267352bc689e5fca276934bea2d2025-08-13T10:04:46+02:00Oliver SimonsCUDA: Optimize `reduce_rows_f32` kernel, leading up to 25x perf improvement on kernel-level and 10% perf increase for Gemma3n (#15132)
475e71d48e3265027351e44a8e198f933c98f242c2eb0493156fa8622694f21f42460a84da3eded0bc02025-08-13T14:54:30+09:00Tak-RSggml-rpc: chunk send()/recv() to avoid EINVAL for very large tensors over RPC (macOS & others) (#15188)
476f4586ee5986d6f965becb37876d6f3666478a96160a76588106d22ccacd6b1a0d15d8545861d0a0d2025-08-12T13:58:22+02:00Romain Biessysycl: Fix and disable more configurations of mul_mat (#15151)
477efe3a90996ca6e67ca90f337fc03ad551082c408bbd57b7eafb3b32e3f7f3a2175bce0b35abc7de82025-08-12T17:21:45+08:00Aman GuptaCUDA cmake: add `-lineinfo` for easier debug (#15260)
47825ff6f7659f6a5c47d6a73eada5813f0495331f0be48528b068111304e4a0bb82c028558b5705f052025-08-12T10:02:51+08:00R0CKSTARmusa: fix failures in test-backend-ops for mul_mat_id op (#15236)
479be48528b068111304e4a0bb82c028558b5705f05cf9e5648a7ae02f7728fefcbcfd2979d83c96e8f2025-08-11T22:50:31+08:00hipuddingCANN: Add broadcast for softmax and FA (#15208)
480cf9e5648a7ae02f7728fefcbcfd2979d83c96e8ffba5c0d680b555cbac563fef57b33bc5c9621e082025-08-11T22:12:12+08:00rainredmtmd : Fix MinicpmV model converter and clip to avoid using hardcode. (#14750)
481fba5c0d680b555cbac563fef57b33bc5c9621e0853d0a1265826f40c5dbc01d06aeab9e14fcbd69b2025-08-11T15:31:35+02:00Xuan-Son Nguyenchat : hotfix gpt-oss jinja raising an exception (#15243)
482228f724d9ce6c56e8cec75bfdabab4dd013def7fcd3069dfcbeee8e0e96cffb93b0ebb9e595e273a2025-08-11T13:58:24+03:00Georgi Gerganovkv-cache : fix seq_rm with seq_id == -1 (#15226)
483cd3069dfcbeee8e0e96cffb93b0ebb9e595e273a50e81bdf5db563ab57a9a722b08f96fa8a76c9272025-08-11T11:21:19+02:00Daniel Beveniuskv-cache : log (debug) all streams in find_slot (#15176)
48450e81bdf5db563ab57a9a722b08f96fa8a76c9271ebbaddff2a44b0599df659175d3274bd5bbeb812025-08-11T11:15:44+02:00Sigbjørn Skjæretconvert : fix merge conflicts (#15229)
4851ebbaddff2a44b0599df659175d3274bd5bbeb81a3a7874272e5a060079658eb5cca4617b7f990622025-08-11T10:21:24+02:00Daniel Beveniusperplexity : update comments/error msg to use decode [no ci] (#15227)
486a3a7874272e5a060079658eb5cca4617b7f99062002cb1bb3345967fbe0fa7766c2d94c2da31ef452025-08-11T10:07:49+02:00Julien Denizeconvert : improve Mistral models integration (#14737)
487002cb1bb3345967fbe0fa7766c2d94c2da31ef4579c1160b073b8148a404f3dd2584be1606dccc662025-08-11T09:59:26+02:00Charles Xukleidiai: fix unsigned overflow bug (#15150)
48879c1160b073b8148a404f3dd2584be1606dccc6634c9d765bf173c551398f1e7fa4595019bc53bab2025-08-09T13:29:43-05:00David Zhaocuda: refactored ssm_scan and use CUB (#13291)
48934c9d765bf173c551398f1e7fa4595019bc53babe54d41befcc1575f4c898c5ff4ef43970cead75f2025-08-09T20:00:24+08:00Aman GuptaCUDA: add attention sinks for tile and wmma (#15178)
490cd6983d56d2cce94ecb86bb114ae8379a609073c6c7e9a54406dbba5e53754a8f70a285414717b062025-08-08T21:37:22+09:00AN Longggml : fix field name when new ggml_backend (#14944)
49150aa9389014bba2dd12234132aa6b8ca3601a17fc4f53563df4575196ea13f5ed669ea8ea659a6be2025-08-07T23:26:03+02:00Xuan-Son Nguyenconvert : support non-mxfp4 HF model (#15153)
49299acbc9921b119aa7ed929eb5780a66a8f06e6d97ad67ba9fe2b909e271dd31b99c5fce3aba358992025-08-08T00:20:40+08:00RunningLeonllama : Support intern-s1 (#14875)
49320638e4f16fcc21f836c7556e83bbf532bb5a0f036d3f00e142696f708ab297b9f8f1c825594712d2025-08-07T08:50:30+02:00Johannes Gäßlerscripts: fix crash when --tool is not set (#15133)
49436d3f00e142696f708ab297b9f8f1c825594712d5fd160bbd9d70b94b5b11b0001fd7f477005e4a02025-08-07T05:31:48+02:00Daniel Beveniusrequirements : fix PyTorch uint64 compatibility (#15134)
4955fd160bbd9d70b94b5b11b0001fd7f477005e4a0756cfea82608911bbfcbf45164b8fdaddbafaa312025-08-06T15:14:40-07:00Reese Levineggml: Add basic SET_ROWS support in WebGPU (#15137)
496756cfea82608911bbfcbf45164b8fdaddbafaa31e725a1a982ca870404a9c4935df52466327bbd022025-08-06T23:17:51+02:00rmatiffix profiling crash (#15072)
497476aa3fd5779b32d06cd84338f777da82341195c0d8831543cdc368fb248bae6f1b4aa5516684edc2025-08-06T17:28:48+01:00Juk ArmstrongFixed name `-override-tensors` to `-override-tensor` (#15129)
4980d8831543cdc368fb248bae6f1b4aa5516684edc65c797c4fad4d9966695ac4b4a1560be441092672025-08-06T05:37:35-07:00Diego Devesaggml : fix fallback to CPU for ununsupported ops (#15118)
49965c797c4fad4d9966695ac4b4a1560be4410926725726898e855ec6dffba227f2233a63c571840362025-08-06T13:26:49+02:00Sigbjørn Skjæretchat : fix yandex chat template (#15116)
50025726898e855ec6dffba227f2233a63c571840362241453252147bb7362a286977ee9f9a921300622025-08-06T17:48:30+08:00stevenkuangchat : fix hunyuan auto-detection (#15114)
5012241453252147bb7362a286977ee9f9a921300629515c6131aecaccc955fdedcfe16c3e030aaefcb2025-08-06T14:12:42+08:00Chenguang LiCANN: add support for ACL Graph (#15065)
5029515c6131aecaccc955fdedcfe16c3e030aaefcbfd1234cb468935ea087d6929b2487926c3afff4b2025-08-05T16:26:38-07:00Reese Levineggml: WebGPU disable SET_ROWS for now (#15078)
503fd1234cb468935ea087d6929b2487926c3afff4bf324a3b715d5c1081c110ce459f8a8486fb1ee892025-08-05T22:10:36+03:00Georgi Gerganovllama : add gpt-oss (#15091)
504f324a3b715d5c1081c110ce459f8a8486fb1ee89be426425817bc3e6a2d91dae476dba6fa85894be2025-08-05T20:43:36+02:00Sigbjørn Skjæretchat : only remove double bos/eos if added (#15086)
5053306ceabf02e3df66666e5851800e843c7ca207ec81de6e107ef51ef76aadcb8a6f008711c4625172025-08-05T18:39:55+02:00Romain Biessysycl: fix mul_mat selection (#15092)
506c81de6e107ef51ef76aadcb8a6f008711c46251722f060c9c4b5ef49a83a20eda25fcb792419580b2025-08-05T13:56:44+01:00Juk ArmstrongFix `glm4moe` bug (#15088)
50722f060c9c4b5ef49a83a20eda25fcb792419580bee3a9fcf88fe5b5e1213711e05861b83cd4fdfe62025-08-05T19:56:44+08:00Alex Wuwebui: fix markdown table (#15081)
508ee3a9fcf88fe5b5e1213711e05861b83cd4fdfe6ec428b02c347767f24c78111309e3f30d2ada2892025-08-05T05:27:45-04:00compiladecontext : fix index overflow on huge outputs (#15080)
50919f68fa5a4c3bf796de52a6db9008e77d29f423a41613437ffee0dbccad684fc744788bc504ec2132025-08-04T17:26:52-04:00compiladeimatrix : warn when GGUF imatrix is saved without .gguf suffix (#15076)
51041613437ffee0dbccad684fc744788bc504ec213e5bebe5251cee2678e8531aa1598ca21b3c6ce1d2025-08-04T21:29:14+02:00Christian Kastnercmake: Add GGML_BACKEND_DIR option (#15074)
511ef0144c087b33e5b8da42d529ac71aaf05cb49df2721257e3e2c4c944ac8a08221113ee7cb503f1b2025-08-05T04:29:25+10:00Sammodel: support GLM 4.5 family of models (#14939)
5122721257e3e2c4c944ac8a08221113ee7cb503f1b587d0118f50b7e8f4bafbcdd218aefd9da0272e12025-08-04T18:11:02+02:00Sigbjørn Skjæretquantize : fix confusing error message if ftype is invalid (#15071)
513587d0118f50b7e8f4bafbcdd218aefd9da0272e15aa1105da24a8dd1661cea3db0582c9b2c2f54d32025-08-04T08:52:43-07:00Reese Levineggml: WebGPU backend host improvements and style fixing (#14978)
5145aa1105da24a8dd1661cea3db0582c9b2c2f54d3d31192b4ee1441bbbecd3cbf9e02633368bdc4f52025-08-04T00:09:19-05:00Jeff Bolzvulkan: fix build when using glslang that does not support coopmat2 (#15062)
515d31192b4ee1441bbbecd3cbf9e02633368bdc4f50a2f5496bef9e54e5f42d6c2c3ad9eb7b379aed02025-08-03T16:00:05-04:00compiladeimatrix : use GGUF by default (#14842)
5160a2f5496bef9e54e5f42d6c2c3ad9eb7b379aed011a3811164ef2d75393c6b0a632f4c608e3e3dd22025-08-03T15:49:13-04:00compiladeimatrix : fix 3d activation handling for hybrid and recurrent models (#14994)
5175c0eb5ef544aeefd81c303e03208f768e158d93c03d46982180c2fb624bd2a233e46426ab22be5d12025-08-02T10:51:18-07:00lhezopencl: fix adreno compiler detection logic (#15029)
5184fdea540bda4648f98b85e8ee9dc66db4bfb5945a4569c41fd2253c89ef52fc2378687bdbf42f61a2025-08-02T16:14:57+02:00Daniel Beveniuskv-cache : skip alignment of n_stream in kv-cache log msg [no ci] (#15040)
519a4569c41fd2253c89ef52fc2378687bdbf42f61a15e92fd33791e60a4ddb5970b47242a855c271172025-08-02T17:14:21+03:00Georgi Gerganovllama : enable LLAMA_SET_ROWS=1 by default (#14959)
52015e92fd33791e60a4ddb5970b47242a855c271172bf3fbf0b54f97aef2b388b76d222789e1c170f12025-08-02T17:13:05+03:00Georgi Gerganovcuda, sycl : fix batched gemm when ne02 == 1 && ne03 > 1 (#15038)
521711d5e6fe66eb6cd7a10d71cec4567321848be08f738989dcb9ccbe468c945553eafbeef7b8696752025-08-02T05:51:02-05:00Douglas Hanleyconvert : fix Qwen3-Embedding pre-tokenizer hash (#15030)
522f738989dcb9ccbe468c945553eafbeef7b8696754cb208c93c1c938591a5b40354e2a6f9b94489bc2025-08-02T18:04:48+08:00Jhen-Jie Hongchat : fix multiple tool_calls on hermes-2-pro (#14962)
523a9f7541ec25c4c8547daf5ff48700ad2836e2b7d9c35706b98ea271858acef4194f526a71b24cdc92025-08-02T02:57:04-05:00Jeff Bolzvulkan: optimizations for direct convolution (#14933)
5249c35706b98ea271858acef4194f526a71b24cdc9c76b420e4ce06f7b7cdfbb0b85d02c90e5cc5a3a2025-08-01T20:47:32+02:00Johannes GäßlerCUDA: fix MMQ nwarps for AMD with warp_size==32 (#15014)
5250f5ccd6fd1a1f709010312933db0316867cc30b61c872f71fb8a25589efa3ee9b6bf8b517cb8caa42025-08-01T21:31:12+08:00stevenkuangmodel : add hunyuan dense (#14878)
526baad94885df512bb24ab01e2b22d1998fce4d00eba42794c9ead96ad52311ba1b23eefcbf3d6f63d2025-08-01T11:50:33+05:30Srihari-mcwggml : Q2k interleaving implementation - x86/x64 SIMD (#14373)
527ba42794c9ead96ad52311ba1b23eefcbf3d6f63d2860d479b456e1caa026b40b829d5b13c42a8ed72025-08-01T06:38:12+03:00Georgi Gerganovgraph : fix equal_seq() check (#14986)
5282860d479b456e1caa026b40b829d5b13c42a8ed7484b2091ce5017901483b5204c07878f171d14412025-08-01T10:02:34+08:00diannaodocker : add cann build pipline (#14591)
529784524053d986255e383dae45235e4f76c6792a7d6818d06a6237631523bc0f45d42e794826679482025-08-01T01:22:58+08:00Aman GuptaFix params bug in diffusion example (#14993)
530e08a98826bcce70a3377592c51d0efed99eafe07952a47f455fbd92e2659b98b9b6317a2dafeb5322025-07-31T17:46:54+02:00Ruben OrtlamVulkan: Fix minor debug mode issues (#14899)
531952a47f455fbd92e2659b98b9b6317a2dafeb53236e5fe7bcd6640f4ff974d4c5cb04a13b5b29bce2025-07-31T23:22:17+08:00tc-mbmtmd : support MiniCPM-V 4.0 (#14983)
53294933c8c2eeaa9a7983e3f6c08af76bd86724094c1dacaa99b4ead6edbac928cd2da59436573f6b02025-07-31T05:25:23-07:00g2mtserver : implement universal assisted decoding (#12635)
5338a4a85627702b569d7d2810f2de06a4321656e9d11490b36723d511d75fb601995c79b5c363ba3a22025-07-31T19:49:09+08:00Aman GuptaAdd LLaDA 8b Diffusion model (#14771)
53411490b36723d511d75fb601995c79b5c363ba3a266625a59a54d0a7504eda4c4e83abfcd83ba1cf82025-07-31T19:47:20+08:00hipuddingCANN: Improve loading efficiency after converting weights to NZ format. (#14985)
535e9192bec564780bd4313ad6524d20a0ab92797db41e78c567e9a8c652e405f4f909deb598deecd312025-07-30T20:11:56+01:00Ed Addarioquantize : fix using combined imatrix GGUFs (multiple datasets) (#14973)
536e228de94496636681b36690247d96f97d5f76c0d73a8e5ca0372f4dcaf1aed4e42261723da0914aa2025-07-30T14:53:16+02:00Kai Pastorcmake : Fix BLAS link interface (ggml/1316)
53773a8e5ca0372f4dcaf1aed4e42261723da0914aa92b8810ec7aa6d778bc287cc918443cf67b962e22025-07-30T14:52:26+02:00Kai Pastorvulkan : fix 32-bit builds (ggml/1313)
5381e15bfd42c3938506e0da5939bf7f42780965f01a118d80233d3bf92569c051346fd2638f87bf2022025-07-30T13:52:11+03:00Georgi Gerganovgraph : fix stack-use-after-return (#14960)
539a118d80233d3bf92569c051346fd2638f87bf20261550f8231dc0aa478e2f537c5009ede6878ce222025-07-30T00:25:05-05:00Douglas Hanleyembeddings: fix extraction of CLS pooling results (#14927)
5401a67fcc30677e96dda76bb1b290788e7d8852b51204f2cf168dc01ca7b200b1510e0ff585ca9a92e2025-07-30T00:05:38+09:00kallewoofcommon : avoid logging partial messages (which can contain broken UTF-8 sequences) (#14937)
541bbd0f917797e9d524680f1b30d34a46eb06d76510a5036bee9cfb946870689db4400e9e0d17844c92025-07-29T10:40:50+02:00Johannes Gäßlerserver-bench: make seed choice configurable (#14929)
542bda62193b2a6bebbf515c3c389303094a44458c1c556418b600ad5792440942079d93e393595688b2025-07-28T09:04:27-07:00Leonard Mosescutest-backend-ops : extend test case filtering (#14865)
543db16e2831c0f344f041af3d067db81c42b16eb22cd1fce6d4f9c191f1c7429cc96f61281c3b63ffc2025-07-28T23:40:24+08:00xctanggml-cpu : deduplicate scalar implementations (#14897)
544cd1fce6d4f9c191f1c7429cc96f61281c3b63ffc00fa15fedc79263fa0285e6a3bbb0cfb3e3878a22025-07-28T20:32:15+05:30Akarshan BiswasSYCL: Add set_rows support for quantized types (#14883)
54500fa15fedc79263fa0285e6a3bbb0cfb3e3878a2946b1f685909c8c9c044f145bce819c02f327eaa2025-07-28T15:01:48+02:00Xuan-Son Nguyenmtmd : add support for Voxtral (#14862)
546946b1f685909c8c9c044f145bce819c02f327eaa6c6e397affc4fac717e718364fb4b635cec6433a2025-07-28T14:30:22+02:00Johannes GäßlerCUDA: fix pointer incrementation in FA (#14916)
5476c6e397affc4fac717e718364fb4b635cec6433aafc0e8969896ada62238da07b98731e5a4b12ba42025-07-28T19:47:00+08:00Dongliang Weimodel : add support for SmallThinker series (#14898)
5487f97599581fcf0c37432dd3b1f503b91bed97695bf78f5439ee8e82e367674043303ebf8e92b48052025-07-27T22:31:11+01:00Ed Addarioquantize : update README.md (#14905)
549ca0ef2dddb022cb1337d775cd05cd27d7808aff489d1029559bd2968f76db854f9f113d73e34527c2025-07-27T12:10:51+02:00Daniel Beveniusllama : clarify comment about pp and tg graphs [no ci] (#14895)
55089d1029559bd2968f76db854f9f113d73e34527cf1a4e72de5950ab7136aeadddd675caf30dd6b3f2025-07-27T12:04:33+02:00Erik Scholzvulkan : add fp16 support for the conv_2d kernel (#14872)
551f1a4e72de5950ab7136aeadddd675caf30dd6b3f4762ad7316dcdec20016ab5985fb46a27902204d2025-07-27T04:05:34-05:00Jeff Bolzvulkan: skip empty set_rows to avoid invalid API usage (#14860)
5524762ad7316dcdec20016ab5985fb46a27902204d1dc9614e0673e794d2e2bf88ba04f7d57b63a57b2025-07-27T03:18:37-05:00Gabriel Larsonmodel : make rope_yarn_log_mul optional for deepseek2 (#14896)
5531dc9614e0673e794d2e2bf88ba04f7d57b63a57b446595b9b3a113d9ba10506922c3a156cca9d4772025-07-27T16:38:44+09:00Shunta Saitollama : fix kq_scale for the attention layers of PLaMo2 (#14892)
55466906cd82a4a1fd10151707cee3f66cb61fc405511dd5a44eb180e1d69fac24d3852b5222d66fb7f2025-07-26T18:28:14-04:00deepsekHIP: Enable Matrix cores for MMQ Kernels, Enable stream-K for CDNA 3 (#14624)
5559b8f3c6c776d77045ee4f7f13fdf7863dfe59e5bc7f3169cd523140a288095f2d79befb20a0b73f42025-07-26T10:36:02+08:00R0CKSTARmusa: fix build warnings (unused variable) (#14869)
556c7f3169cd523140a288095f2d79befb20a0b73f4793c0d7f46384001738c337d7afa46b45ae327452025-07-26T01:09:03+08:00Aaron Teoggml-cpu : disable GGML_NNPA by default due to instability (#14880)
557793c0d7f46384001738c337d7afa46b45ae32745ce111d39d666f4a3b6a561ad020f6feb8cc677902025-07-25T10:47:39-06:00Gabe Goodhartmetal: SSM_SCAN performance (#14743)
558e7fecba93416c8aaf343932b5e36dd5e208a815ee2b7621e7c265a6739225125cf9c534f471b34722025-07-25T23:25:05+09:00wooksongdocs : update HOWTO‑add‑model.md for ModelBase and new model classes (#14874)
559e2b7621e7c265a6739225125cf9c534f471b3472c1dbea752a630169c104118fd0c82f3ffcb19c912025-07-25T13:29:57+02:00Oliver Simonsggml : remove invalid portPos specifiers from dot files (#14838)
560749e0d27f0247337869f4698f59dd7fafba9432664bf1c3744053cf7def10aeed21ff48883ee755b2025-07-25T19:08:04+08:00kiwimtmd : fix 32-bit narrowing issue in export-lora and mtmd clip (#14503)
56164bf1c3744053cf7def10aeed21ff48883ee755bc12bbde37258c6d053322d1cedd4a9672109ae582025-07-25T06:17:02-04:00Chris Rohlfrpc : check for null buffers in get/set/copy tensor endpoints (#14868)
562c12bbde37258c6d053322d1cedd4a9672109ae583f4fc97f1d745f1d5d3c853949503136d419e6de2025-07-25T01:07:26-07:00Diego Devesasched : fix multiple evaluations of the same graph with pipeline parallelism (#14855)
5633f4fc97f1d745f1d5d3c853949503136d419e6de2df255da3cea108de0ae9b302ffdd31674b6d88d2025-07-25T03:05:37+08:00R0CKSTARmusa: upgrade musa sdk to rc4.2.0 (#14498)
56460f816a79dd74007158745530e71738aa6caa67e5592f278b6ec6aa4a1793e89e8c61838a12ebc9d2025-07-22T20:13:21+02:00Kai Pastorcmake : fix usage issues (ggml/1257)
5655592f278b6ec6aa4a1793e89e8c61838a12ebc9de4868d16d24dec55e61bcaadaca28feed8f98b132025-07-21T15:53:12+02:00Daniel Beveniusggml-cpu : remove stdlib include from repack.cpp (ggml/1276)
566820de57d4faa427a3d0bfb14e48057247fae036ecb4a63aad6650c2b536a7578403935388cb2920e2025-07-24T13:59:56+02:00Xuan-Son Nguyenchat : fix kimi-k2 chat template (#14852)
567cb4a63aad6650c2b536a7578403935388cb2920e86f5623d904cfd392fdeb14a143097b4074660f62025-07-24T11:09:57+01:00Alberto Cabrera Pérezsycl: fixed semantics of block offset calculation (#14814)
56886f5623d904cfd392fdeb14a143097b4074660f639cffdf18855e0d2beba62572542251d87421e732025-07-24T17:50:51+08:00yummyllama : fix MiniCPM inference after Granite Four changes (#14850)
569065908cb09adff8b2a5f1173f80050d5d9a6790b4ec6291a2407404de52239c1f9ca66c07e7fb28b2025-07-24T10:24:05+03:00Georgi Gerganovmetal : fix fusion across different encoders (#14849)
5704ec6291a2407404de52239c1f9ca66c07e7fb28ba12363bbf0ca11f787dee9756861043136edc0df2025-07-24T13:50:41+09:00Donghyeon Jeongsycl: fix undefined variable in work group size check (#14843)
571a12363bbf0ca11f787dee9756861043136edc0dfa86f52b2859dae4db5a7a0bbc0f1ad9de6b43ec62025-07-23T23:23:57+02:00jacekpoplawskiconvert : text-only support for GLM-4.1V-9B-Thinking (#14823)
572a86f52b2859dae4db5a7a0bbc0f1ad9de6b43ec6b284197df426fb189cdcfe56a43c863a788ac7562025-07-23T21:43:25+02:00Johannes GäßlerCUDA: fix overflow in FA, tune performance (#14840)
573b284197df426fb189cdcfe56a43c863a788ac756221c0e0c5841a814e95b9bfd549de9d6ae00ac6e2025-07-23T18:22:30+02:00Johannes GäßlerCUDA: fix compilation with GGML_CUDA_F16 (#14837)
57407a19e27a26f76d34be62da53807f93131fb3cab18f3b5ff9e5eda4e7d04bceff8ffdccb0a696ed82025-07-23T12:35:53+02:00Johannes GäßlerCUDA: fix quantized KV cache + multiple sequences (#14822)
5757233358d29df3dfbf80693f2de7e5865401ad7246c88b3bb2509d980e6a64c50fdf8dd304929f7702025-07-23T16:16:41+08:00l3utterflymemory : handle saving/loading null layers in recurrent memory (#14675)
5766c88b3bb2509d980e6a64c50fdf8dd304929f77014c28dfc50a2e3915e697122cd3c5343224009be2025-07-23T14:39:51+08:00lixing-starggml: fix loongarch quantize_row_q8_1 error (#14827)
57714c28dfc50a2e3915e697122cd3c5343224009be8c988fa41db4d9dbc05abfd666c04def1259c6452025-07-23T11:58:00+08:00chen fanCANN: weight format to NZ for Ascend310P3 (#14407)
57884712b60439453fb393c2ca753cee682a4ad41f5d4d1522b20809a350ffb094db20f40f17d3ab80f2025-07-22T10:35:21-05:00Jeff Bolzvulkan: fix rms_norm_mul to handle broadcasting dim0 (#14817)
579d1aa0cc5d13ec3fa553de5d298f9166679e58479c8ade30036139e32108fee53d8b7164dbfda4bee2025-07-22T13:33:37+01:00Ed Addarioimatrix: add option to display importance score statistics for a given imatrix file (#12718)
580c8ade30036139e32108fee53d8b7164dbfda4beee28c0b80c249b5618c3a0d5e960f63929f380ac92025-07-22T12:51:03+02:00stduhpfMtmd: add a way to select device for vision encoder (#14236)
58138d3af1b73302377111e88ddd7252576383392866c9ee3b17e19dcc82ab93d52ae46fdd0226d47772025-07-21T22:55:10+02:00Sigbjørn Skjæretopencl: fix `im2col` when `KW!=KH` (#14803)
5826c9ee3b17e19dcc82ab93d52ae46fdd0226d4777cd465d823c378853f1f6570eebfb77f69c7e1d392025-07-21T19:03:19+02:00rmatifopencl: add conv2d kernel (#14403)
583cd465d823c378853f1f6570eebfb77f69c7e1d39922042601b8a16877ccb1c2afaa2071f76734f102025-07-21T18:39:29+02:00Romain Biessysycl: Fix im2col (#14797)
584922042601b8a16877ccb1c2afaa2071f76734f102ba1333b35e471b344974dde553db11bf1c2836f2025-07-21T15:49:52+02:00Charles Xukleidiai: add support for get_rows (#14676)
5852ba1333b35e471b344974dde553db11bf1c2836fc2e058f1b4e799f1be085560c1bcef95b7b5ed022025-07-21T15:03:49+03:00Radoslav Gerganovdocs : fix backends table in README.md (#14796)
586c2e058f1b4e799f1be085560c1bcef95b7b5ed02c82d48ec23fb8749c341d0838f6891fd5f6b6da02025-07-21T06:35:40-05:00Jeff Bolzvulkan/cuda: Fix im2col when KW!=KH (#14789)
587c82d48ec23fb8749c341d0838f6891fd5f6b6da0b4efd77f8ab407836ca73a5176f041650c5b24112025-07-21T17:38:36+08:00Molly Sophiallama : fix `--reverse-prompt` crashing issue (#14794)
5882be60cbc2707359241c2784f9d2e30d8fc7cdabbb526ad2668944a7b2b1721f606791536463138312025-07-21T02:13:47+08:00Aman Guptadocs : fix link for tools/perplexity in README.md (#14780)
589938b785764683c298e7805e712f8728489cc2f1836c153248faf969af1b62ab231348694b2047b8b2025-07-20T19:42:34+08:00Aman GuptaClang-format: local files first + fix BinPacking (#14779)
590a979ca22db0d737af1e548a73291193655c6be9990083283ec254fa8d33897746dea229aee401b372025-07-19T21:59:08+02:00Ervin Áron Tasnádiggml: adds CONV_2D op and direct GEMM Vulkan implementation (#14316)
59190083283ec254fa8d33897746dea229aee401b37d4b91ea7b2da253e1355b503f0fcb7b428ce005d2025-07-19T12:51:22-04:00compiladeimatrix : use GGUF to store importance matrices (#9400)
59283f5872404baa39d826af2ef66351e63c64205a8f0d4d176df72734a543c29eef9f942850c13311e2025-07-19T17:47:53+02:000cc4mVulkan: Fix fprintf format-security warning (#14770)
5939fb1042ce6719bc46dbe88ab013148aabe3105f12adf8d83acdb9b1bf58db6c9729ac9dc6847a58b2025-07-18T20:08:33+03:00Georgi Gerganovgraph : fix graph reuse reset of params (#14760)
594021cc28bef4dd7d0bf9c91dbbd0803caa6cb15f2d498af3d5a00f96bdd37b534860f03a6d9e98d392025-07-18T13:35:32+02:00Oliver Simonscuda : Fix Gemma3n not executed as CUDA_GRAPH on NVGPUs (#14741)
595eacdeb5bfcb6c6cd54461fd0e9f04cab78bf975be0cb5c5cb8a61ac232130cf6bf878035f93824d92025-07-18T11:53:55+03:00Georgi Gerganovmodel : fix build after merge conflict (#14754)
59609651d09ffc1e941bd1be23163abf5495c416547349ea79fcebc75b0c55bf61594a47736966d4f952025-07-18T06:25:54+02:00Nexes the Eldergraph : Pass the graph placeholder message in debug mode (#14748)
597670e1360cd40f242ae76ba0966542fae6cb59392760b4484e3c192a2649a6ffd0d90086c5558f8492025-07-18T01:17:16+02:00Piotr Wilkin (ilintar)convert : fix Ernie4.5 MoE without shared experts (#14746)
598cb887f1bc1001c92f7b4a595b9014f3a454a07abd6fb3f6b49b27ef1c0f4cf5128e041f7e7dc03af2025-07-17T23:15:32+02:00Piotr Wilkin (ilintar)model: add Ernie 4.5 MoE support (#14658)
599d6fb3f6b49b27ef1c0f4cf5128e041f7e7dc03af01612b74090df592663cfa01f661c9628f403b592025-07-17T20:52:33+03:00Georgi Gerganovkv-cache : fix k-shift for multiple streams (#14742)
60001612b74090df592663cfa01f661c9628f403b59086cf81e88fb75287b71ff19c08a206b7bc2e02f2025-07-17T19:08:33+03:00Georgi Gerganovllama : reuse compute graphs (#14482)
601086cf81e88fb75287b71ff19c08a206b7bc2e02fd9b691081c04ec5fb0daa9d2b979f915c142963d2025-07-17T09:22:11+02:00Tarek Dakhranllama : fix parallel processing for lfm2 (#14705)
602ad57d3edd2f48cf6dc41a98fd9b303435ecb4fb01ba45d49822c39ca9a552c7b75efe0495ff400c32025-07-17T09:45:54+03:00Georgi Gerganovbatch : fix uninitialized has_cpl flag (#14733)
6031ba45d49822c39ca9a552c7b75efe0495ff400c319e5943d9e976b59ccd5a0a87ae3d2ff3da443902025-07-17T01:52:08+02:00Sigbjørn Skjæretci : disable failing vulkan crossbuilds (#14723)
60419e5943d9e976b59ccd5a0a87ae3d2ff3da44390496957e1cbcb522abc63aa18521036e40efce9852025-07-16T23:17:43+02:00Sigbjørn Skjæretconvert : make hf token optional (#14717)
605496957e1cbcb522abc63aa18521036e40efce98521c021745d781edf9c44b4972ef6cbbf53b0ecff2025-07-16T15:17:25-04:00Diner Burgerllama : fix parameter order for hybrid memory initialization (#14725)
60621c021745d781edf9c44b4972ef6cbbf53b0ecffb0f0ecc3dce806c68609d375a2b3edc430d8db182025-07-16T08:18:51-07:00Reese Levineggml: Add initial WebGPU backend (#14521)
607225e7a1438f4ea85eaa7b5ef3ab3b266ee4d9c06ab140198211385b85eeeb0abd549a4bbe259e10d2025-07-16T16:35:42+03:00Georgi Gerganovllama : add high-throughput mode (#14363)
608ab140198211385b85eeeb0abd549a4bbe259e10d64978340b0b4a0a6e2fb74270c1509383d2eff322025-07-16T20:03:51+08:00Aman GuptaSupport diffusion models: Add Dream 7B (#14644)
60964978340b0b4a0a6e2fb74270c1509383d2eff326ffd4e9c442e99afac3d138543ebf86d5fc5ee032025-07-16T14:43:32+03:00Georgi Gerganovggml : add asserts (#14720)
610e4841d24d3485ea4af54f8b65a19ec3123f0ff3c538cc77f7f44dfa047dba6a06d90c86dda69cf1d2025-07-16T19:12:22+09:00Shunta Saitollama : fix parallel processing for plamo2 (#14716)
611538cc77f7f44dfa047dba6a06d90c86dda69cf1d5cae76654113160f691f581930b69fc5535e81592025-07-16T12:13:57+03:00Georgi Gerganovserver : fix handling of the ignore_eos flag (#14710)
61279e0b68c178656bb0632cb8602d2940b755077f8c81f4192f91a1e209c1eec7a84fe5371ef9175da2025-07-16T12:00:42+08:00Min-Huallama: add LLAMA_API to deprecated llama_kv_self_seq_div (#14708)
6134a4f426944e79b79e389f9ed7b34831cb9b637adba1ceb34566c889a1fc500efa79799ffed25d9b02025-07-15T14:54:22-05:00Gabriel Larsonmodel : add Kimi-K2 support (#14654)
614ba1ceb34566c889a1fc500efa79799ffed25d9b010a0351a97c25471aea0bbde9cca54d32d163eec2025-07-15T14:51:09-05:00Jeff Bolzvulkan: fix noncontig check for mat_mul_id splitting (#14683)
61568e37a61a7b24863f67541db65b4f6195962a268cbc68be51d88b1d5531643b926a4b359c3cff1312025-07-16T01:11:42+09:00Shunta Saitomodel : add PLaMo-2 support (#14560)
616cbc68be51d88b1d5531643b926a4b359c3cff131bdca38376f7e8dd928defe01ce6a16218a64b0402025-07-15T15:28:53+08:00R0CKSTARcuda: fix build warnings in set-rows.cu (unused variable) (#14687)
617bdca38376f7e8dd928defe01ce6a16218a64b04055c509daf51d25bfaee9c8b8ce6abff103d4473b2025-07-14T18:12:42+01:00Anton Mitkovsycl: Hotfix for non dnnl codepath (#14677)
618494c5899cb76859f32ddd913534f2685fd684a3d0f4c6ec0f1a9607ba67071f8a02c69b0afc2f91e2025-07-14T13:14:30+02:00Johannes Gäßlerscripts: benchmark for HTTP server throughput (#14668)
619982e347255723fe6d02e60ee30cfdd0559c884c5923e3ea2e3c96a0b4c208f53bc3bc90cdcdf13c02025-07-13T17:02:17+01:00Ed Addarioquantize : fix minor logic flaw in --tensor-type (#14572)
62067eade1bf93f40e7c4975e5bd0782f426c89cff47de5c7cab61d4da4387ed9b216f88b96297bcc2d2025-07-12T19:07:08+02:00Tarek Dakhrandocs : add LFM2 to models section (#14650)
6217de5c7cab61d4da4387ed9b216f88b96297bcc2d8eff95544e817704d44bec20f9fc956ce76a33be2025-07-12T21:31:38+08:00Aman GuptaCUDA: add set rows for f32 and f16 (#14551)
6220c1df14b5f8d992805cb22d0b77b44092a18aeabb3ad3a0191994d6c47b2bd389d5c7431526ecd2c2025-07-12T06:21:02-04:00Douglas Hanleyserver : fix pooled embedding output (#14645)
623b3ad3a0191994d6c47b2bd389d5c7431526ecd2c98197e5c98388470030d908f355ec5937dcccaaa2025-07-12T05:12:26-05:00Jeff Bolzvulkan: support SET_ROWS (#14587)
6240aedae00e6fb48680324a5ac5da9cba0e35de6b56bdda13981d6c8189b7dc4f9fb8ecb91c21529f82025-07-10T18:20:13-06:00Gabe Goodhartmodel : Granite Four (#13550)
6256bdda13981d6c8189b7dc4f9fb8ecb91c21529f80b8855775c6b873931d40b77a5e42558aacbde522025-07-10T23:58:12+02:00rmatifopencl: add tiled mul_mat_f16_f32 (#14535)
6264bb625b713fd9b294b4f7af87eaa752b710c7cc111ee0fea2a24da1d3206eeba8fc52b759d9dfb242025-07-10T13:41:00-04:00Ryan MangenoSmoldocling support (#14597)
62711ee0fea2a24da1d3206eeba8fc52b759d9dfb24a457551332853ef19d0796fec12b62c538126ea52025-07-10T23:29:01+08:00Aman GuptaDocs: script to auto-generate ggml operations docs (#14598)
628704bb7a71c01dc07c1478b85f6322bf5dfde1eaf435a6d10d618a015060e45a38c7e9f27f42433162025-07-10T13:59:38+05:30Akarshan BiswasSYCL: Initial set_rows kernel implementation (#14562)
629435a6d10d618a015060e45a38c7e9f27f4243316f9a867f5921a85f3fa64d7b067f4c8ffc5f62eb42025-07-10T09:00:20+02:00Xuan-Son Nguyenllama : minor coding style fix for smollm3 (#14605)
6304a5686da22057867c23bd4a6be941ddc8c51e58598bab638fb28cf95a5a66dd2d51b40d6c8f6d69a2025-07-09T14:59:57-04:00compiladellama : support Jamba hybrid Transformer-Mamba models (#7531)
63198bab638fb28cf95a5a66dd2d51b40d6c8f6d69a26a48ad699d50b6268900062661bd22f3e7925792025-07-09T18:16:12+02:00Xuan-Son Nguyenggml : add ggml_scale_bias (#14417)
63204655063c47af6cbced295c8c7ad369402b1530020b7bf8a32259ad9189a4797fd3e3a859c537b992025-07-09T12:03:49+04:00ibrahim khadraouimodel : add support for Falcon-H1 family (#14534)
63320b7bf8a32259ad9189a4797fd3e3a859c537b996efcd65945a98cf6883cdd9de4c8ccd8c79d219a2025-07-09T08:26:13+02:00Xuan-Son Nguyenconvert : fix smollm3 jinja template (#14586)
634699f4392a33f57c3352cf8d60bdc53db7ca235e708382869a2d6dca5d84710f2f82cc17a9696585a2025-07-09T00:29:29+08:00stevenkuangmodel : fix hunyuan moe chat template (#14584)
63508382869a2d6dca5d84710f2f82cc17a9696585abb4f7a9e4eec171fecf0f640b1337a1c244855602025-07-08T18:07:01+02:00Xuan-Son Nguyenmodel : add SmolLM3 (#14581)
636bb4f7a9e4eec171fecf0f640b1337a1c24485560b8eeb8741d4483daf576498cf90537b4de71633c2025-07-08T11:37:47-04:00compiladememory : fix broken batch splits for recurrent cache (#14575)
637b8eeb8741d4483daf576498cf90537b4de71633c17a1f0d2d407040ee242e18dd79be8bb212cfcef2025-07-08T08:21:21-05:00Jeff Bolzvulkan : fix rope with partial rotation and non-cont src (#14582)
63817a1f0d2d407040ee242e18dd79be8bb212cfcef8f22dc0a53338c629c1ef8fa878d8e39bfe627c92025-07-08T11:47:33+03:00Alawode Oluwandabiraserver: Add ability to mount server at prefix (#14544)
6398f22dc0a53338c629c1ef8fa878d8e39bfe627c953903ae6fa5f1caf187889c839cdd1ad25da40182025-07-08T10:24:06+02:00Xuan-Son Nguyenmodel : add hunyuan moe (#14425)
6404d0dcd4a06080e796e6742a88f2ffa7fc41b28b875c91de6e955d5b8f3f28173f5040593e1964eb32025-07-08T10:15:21+03:00Georgi Gerganovcuda : fix rope with partial rotation and non-cont src (#14580)
64168155c66f0e76680f34442247e589a090add22d3e1a7059053a9b8958f2d57a21fc46dbc7fb24f8e2025-07-08T07:58:30+08:00R0CKSTARmusa: fix build warnings (unused variable) (#14561)
642e1a7059053a9b8958f2d57a21fc46dbc7fb24f8e12f55c302b35cfe900b84c5fe67c262026af9c442025-07-07T23:35:35+02:00Sigbjørn Skjæretllama : fix incorrect minicpm3 v_states shape (#14571)
643e592be15756ae546ba87bb5a5250b71248121971a0374a67e2924f2e845cdc59dd67d9a44065a89c2025-07-06T03:08:16-05:00Jeff Bolzvulkan: fix rms_norm+mul fusion (#14545)
644a0374a67e2924f2e845cdc59dd67d9a44065a89cddef99522d1ba74193b7394e803fab8db5c78bae2025-07-05T02:26:04-05:00Jeff Bolzvulkan: Handle updated FA dim2/3 definition (#14518)
645ddef99522d1ba74193b7394e803fab8db5c78bae668168814601d2aef6161ce49ab186bc74177ae72025-07-05T09:17:14+02:00Sigbjørn Skjæretserver : fix assistant prefilling when content is an array (#14360)
646b81510a7b78f7c5a6f069c4f3d0e569b9d287913ef797db357e44ecb7437fa9d22f4e1614104b3422025-07-05T12:10:53+08:00R0CKSTARtest-backend-ops: add support for specifying output format (#14368)
6477b63a71a6b0f54effe9b94073d4d0519dcf536760c2ee38ab729f3f6a7c28dc4c5dcd8d5f0cbf8fc2025-07-03T11:00:03+02:00Nicolò ScipioneFix conditional enabling following arch checks for ggml-sycl (#14504)
6489067487c4411efb20400103fcccfdd389c80d428d4cdd9c1c3cebdafca735958597de4ff7b7c0f542025-07-03T10:46:57+03:00Georgi Gerganovggml : fix FA mask dim 2 and 3 (#14505)
6495d46babdc2d4675d96ebcf23cac098a02f0d30cce17991c466ac835b2c71bd813c1ca7ff8dd97b942025-07-02T13:10:24-04:00compiladellama : initial Mamba-2 support (#9126)
650307e79d33d4cdd9f1d6c42fc861724e6ba12b98fd7f5f4e578d1f60b0835d1734a50438c309b3e5c2025-07-02T20:38:10+08:00zhouwgopencl : fix possible buffer overflow in dump_tensor (#14490)
651d7f5f4e578d1f60b0835d1734a50438c309b3e5cc8a4e470f65c3a932e18eddc5fba1844876d74632025-07-02T14:12:07+03:00Georgi Gerganovsimple-chat : fix context-exceeded condition (#14494)
65285841e121db5b96ae4d277a3cd3995eef66b98ec68b3cd65141586ef13a698baa9029627f038f1022025-07-02T13:41:35+08:00Eric Zhanggithub : add OpenCL backend to issue templates (#14492)
65368b3cd65141586ef13a698baa9029627f038f102de569441470332ff922c23fb0413cc957be75b252025-07-02T07:19:31+02:00Björn Gansterggml : Callback before abort (#14481)
654343b6e94b61674ac94e64ede7b7ea3365793f7ed6a746cf9c40f8d93d13eb8a6c2b989a15e7fa61a2025-07-01T16:47:30+08:00Chenguang LiCANN: update aclnnGroupedMatmulV2 to aclnnGroupedMatmulV3 (#14411)
655497be7c01dab243100f9c42e0a763a746e42d03879b33b231774d5c39c8df018e9a276becae6d41a2025-06-24T06:10:16+02:00Daniel Beveniusggml-quants : rename best_mad to best_error (ggml/1283)
6560a5a3b5cdfd887cf0f8e09d9ff89dee130cfcdde745f11fed09ba2303f3f494efb12286d382608e52025-06-30T23:57:04+08:00Aman GuptaAdd Conv2d for CPU (#14388)
657745f11fed09ba2303f3f494efb12286d382608e55dd942de5922a22ec8446a4ad2203738dbcb93892025-06-30T18:03:03+03:00Georgi Gerganovmemory : correctly handle failure in apply() (#14438)
658caf5681fcb47dfe9bafee94ef9aa8f669ac986c783790b0e7e09ab17238b16452a33053a71dbdfad2025-06-29T20:02:53+02:00matteoserver : support jinja extra template kwargs (Qwen3 enable_thinking feature), from command line and from client (#13196)
65983790b0e7e09ab17238b16452a33053a71dbdfadf47c1d7106e49062279bcc57fc1077c0db61e2782025-06-29T19:29:57+02:00Renatserver : fix appearance of the chats list context menu for Safari (#14322)
660f47c1d7106e49062279bcc57fc1077c0db61e278a5d1fb6212298db1be1639db4c03adb2c522ee132025-06-29T21:07:58+05:30Akarshan BiswasSYCL: disable faulty fp16 exp kernel (#14395)
661a5d1fb6212298db1be1639db4c03adb2c522ee13a0535ffa0d35fccfec3e1a0a3bfc9dbb6054d7c02025-06-29T14:38:10+02:00Sigbjørn Skjæretggml : fix unmerged GGML_FPxx_TO_FPxx refactoring (#14443)
662a0535ffa0d35fccfec3e1a0a3bfc9dbb6054d7c0bd9c981d7226107f18deb8344c3301450311bb8b2025-06-29T11:04:10+02:00Sigbjørn Skjæretggml : implement REGLU/GEGLU/SWIGLU ops (#14158)
663bd9c981d7226107f18deb8344c3301450311bb8b27208bf657cfe7262791df473927225e48efe4822025-06-29T02:43:36-05:00Jeff Bolzvulkan: Add fusion support for RMS_NORM+MUL (#14366)
66427208bf657cfe7262791df473927225e48efe48263a7bb3c7e1c6b0a92d03b0a594d3cd501d6ed3e2025-06-29T01:30:53+08:00Aman GuptaCUDA: add bf16 and f32 support to cublas_mul_mat_batched (#14361)
665b25e92774e2fa4ee3820e458d5cf43f40190f8d26609507a910aa7437aaa53fd999447de3947d9982025-06-28T17:35:41+08:00Xinpeng Doufix async_mode bug (#14432)
6666609507a910aa7437aaa53fd999447de3947d998ceb1bf5a34d5e66e28b23dcc7a3cd83fe1e274812025-06-28T09:57:07+02:00Sigbjørn Skjæretci : fix windows build and release (#14431)
667ceb1bf5a34d5e66e28b23dcc7a3cd83fe1e2748172babea5dea56c8a8e8420ccf731b12a5cf378542025-06-27T22:35:30-05:00Jeff Bolzvulkan: Fix GGML_VULKAN_SHADER_DEBUG_INFO (#14427)
6688d94219a4a7f2da72ee542019ca01f36af93d1d6f667f1e6244e1f420512fa66692b7096ff17f3662025-06-27T16:41:40+03:00Radoslav Gerganovggml : add ggml_set_rows (#14274)
669f667f1e6244e1f420512fa66692b7096ff17f3668846aace4934ad29651ea61b8c7e3f6b0556e3d22025-06-27T10:42:19+02:00Sigbjørn Skjæretconvert : fix broken sentencepiece vocab (#14416)
670a01047b041aa04aeea351933658433ed004516abb25346221dadb9101aa9dda55431dde4d35969432025-06-26T13:46:53-03:00bandoticmake: regen vulkan shaders when shaders-gen sources change (#14398)
671b25346221dadb9101aa9dda55431dde4d3596943e8215dbb96b8fb94a24c29cdd228166fb972dbfc2025-06-26T15:01:14+02:00Sigbjørn Skjæretllama : return mistral-v7-tekken as default template only (#14390)
6728f52c6f8abb2ed9ad967cc0bfb90acb073011193d2f325130c4ed77a3dcff2c23a926587fb08e2cc2025-06-26T15:10:45+08:00Yunzhe JiaSquashed commit of the following:
673716301d1b03c31875ec3b24526c48c8b1bd0fd8c60ef23d6c14d325d83eae5752e5de39ad268e9b02025-06-26T12:11:59+08:00R0CKSTARmusa: enable fp16 mma (all) and cublas on qy2 (#13842)
67460ef23d6c14d325d83eae5752e5de39ad268e9b0b193d5306912a2adae0fde7481819f6ee0941bc62025-06-26T05:49:04+08:00Aaron Teoggml-cpu: enable IBM NNPA Vector Intrinsics (#14317)
675b193d5306912a2adae0fde7481819f6ee0941bc62bf9d539dd158345e3a3b096e16474af535265b42025-06-25T23:26:51+02:00Sigbjørn Skjæretggml : do not output unprintable characters on GGUF load failure (#14381)
6762bf9d539dd158345e3a3b096e16474af535265b473e53dc834c0a2336cd104473af6897197b962772025-06-25T17:09:55+01:00Anton Mitkovsycl: GGML_SYCL_DISABLE_OPT on by default for all Intel Devices (#13973)
67762af464227dafa1c55e0535bcb24346326748f46c148cf1946275952a79ad50b6199725f12a704112025-06-24T18:26:30+03:00Georgi Gerganovbatch : fix check for empty sequences in memory (#14364)
6787b50d589a863c7631135c1226f6eab65cb4062123a9457df962b5883f2773f1c295e8c19df60d89f2025-06-23T12:27:35+03:00Georgi Gerganovkv-cells : fix tracking of seq_pos (#14339)
679238005c2dc67426cf678baa2d54c88170169328866aba7aca9a245d71f1ddf02c7a97223529752a82025-06-22T19:46:17+02:00Sigbjørn Skjæretgguf-py : fix SpecialVocab parsing when post_processor is null (#14330)
68066aba7aca9a245d71f1ddf02c7a97223529752a8f1f5e82df6222dcbaca6396c0de44df259a1694f2025-06-23T01:28:06+08:00Ruikai Pengrun : avoid double tokenization (#14327)
681f1f5e82df6222dcbaca6396c0de44df259a1694faf3373f1adfca56119f3e4de0e6a0a8df8edf3d92025-06-22T20:10:07+03:00Georgi Gerganovexamples : fix is_first logic for tokenization (#14329)
6825d5c066de8a3d2cb32f04c4d5ad1560945f30bf340bfa04c95c19fb42bafd4e21b5c2a77718468012025-06-22T21:44:57+09:00yuisekimtmd : fix Pixtral OOM with large images by capping image_size to 1024 (#14326)
683aa0ef5c578eef4c2adc7be1282f21bab5f3e8d26bb16041caef45cd4348cd6f84906b5dfec7a1f6a2025-06-21T18:12:05+02:00Sigbjørn Skjæretgguf-py : fix Qwen3-Embedding eos token (#14314)
684bb16041caef45cd4348cd6f84906b5dfec7a1f6a58cba76a9aab728717509d62b67c13afd8dc227a2025-06-21T08:17:12+02:00Markus TavenrathAdd support for VK_EXT_debug_utils to add labels to Vulkan objects. (#13792)
68558cba76a9aab728717509d62b67c13afd8dc227a67ae5312e255ae97852a4a216e2245580bfafd722025-06-21T07:33:21+02:00Sigbjørn Skjæretgguf-py : fix TemplateProcessing pair when bos/eos is missing (#14312)
68667ae5312e255ae97852a4a216e2245580bfafd72692e3cdd0a069ab56411b64506a67537d767683e2025-06-21T08:04:18+03:00Georgi Gerganovmetal : fix thread-safety (#14300)
687692e3cdd0a069ab56411b64506a67537d767683eb23fa0b3f40165ca3aae8ad4ee756e72f9a130dd2025-06-21T08:03:46+03:00Georgi Gerganovmemory : rename interface to llama_memory_context_i (#14296)
688b23fa0b3f40165ca3aae8ad4ee756e72f9a130dd06cbedfca1587473df9b537f1dd4d6bfa2e3de132025-06-20T21:32:01-07:00Daniel Hanconvert : fix Llama 4 conversion (#14311)
689d860dd99a4178f58d1d1fa64eebc2aabc95392a7c959f462a0b4d42eaf930ffd72df0e435c97d5d52025-06-21T01:43:35+08:00David Chiudocs : fix the link to llama.h (#14293)
690dd6e6d0b6a4bbe3ebfc931d1eb14db2f2b1d70af8308f98c7fb778e54bf75538f5234d8bd20915e92025-06-20T22:13:06+08:00Ruikai Pengvocab : prevent tokenizer overflow (#14301)
691e28c1b93fd7d3f8faf9551d962e8a65fe2122e38d27b3ca1758dfb1718e333d497ef4b68ad109bc22025-06-20T04:57:36-07:00Diego Devesacuda : synchronize graph capture and cublas handle destruction (#14288)
692d27b3ca1758dfb1718e333d497ef4b68ad109bc29230dbe2c757e2d5071329095727d0fa9d4b85c42025-06-20T11:19:15+03:00Georgi Gerganovggml : fix repack work size for mul_mat_id (#14292)
693812939a9e90f99d1bd5bb1bc6b99d12600671d504c9fdfbe1580a66fd7d77c77418ce2c606a29fdd2025-06-20T10:50:27+03:00Georgi Gerganovmodel : more uniform output id handling (#14275)
6949eaa51e7f08593f123f00136591179a8f5956ecd8f71d0f3e86ccbba059350058af8758cafed73e62025-06-20T09:50:24+08:00Aman GuptaCUDA: add conv_2d_dw (#14265)
695456af35eb70177b8dd5779b6d4c21bb020f9cebd600e3e9b50c1f0c9fc4a70356241fd87f00e8e142025-06-19T20:49:48+08:00fanyangbuild : suppress gcc15 compile warnings (#14261)
696fffcce535ebbdc25f81966a15b758658788e74665fc7856815920f828f9e90cb759ac82c7f0c1ea52025-06-19T13:24:12+03:00bashayer hijjillama-bench : add --no-warmup flag (#14224) (#14270)
6975fc7856815920f828f9e90cb759ac82c7f0c1ea5faed5a5f5dde4d816adecdccb4f4682a04126f922025-06-19T12:21:40+02:00pqnetconvert : fix remote option in Windows (#14100)
698edc4a29effe716956fdfd2bc5b9cba2a6d8492f8ed3290ab34493fd3d2e0f925f816a401da4f2dfd2025-06-19T00:08:14-05:00Gabe Goodhartmemory : Hybrid recurrent cache (#13979)
6998d947136546773f6410756f37fcc5d3e65b8135d50d2227953ca9024f04255b4f116d06fcc0db74c2025-06-19T01:10:26+08:00Aaron Teodocs: add s390x build documentation (#14264)
7006231c5cd6d49d61511f328b5f43322407df90a91ef035803eb9dbc306ea9a8ff82e30af12b567cf72025-06-19T01:06:49+08:00Aaron Teoggml-cpu: fix uncaught underscore terminators (#14023)
701413977de32e90712ecec84d0b9c738847da8dc0295402553a5effc61ddc9e29c7bcb56f71311dd4a2025-06-18T10:43:57+02:00Xuan-Son Nguyenmtmd : refactor llava-uhd preprocessing logic (#14247)
70295402553a5effc61ddc9e29c7bcb56f71311dd4a3865cff4f5b84c16119590efd6ce537789a277152025-06-18T09:58:43+02:00Xuan-Son Nguyenllama-chat : fix multiple system message for gemma, orion (#14246)
7033865cff4f5b84c16119590efd6ce537789a27715d03172cc797b6adbbc00bfc09caf614fb0f895a02025-06-18T09:52:07+02:00Sigbjørn Skjæretconvert : fix null head_dim AutoConfig regression (#14248)
704dd8e59f4435342eda93c5b0cf4109e21c9c7d0ebbbe98d27840453c8787d18470963530fdc27d89f2025-06-13T15:06:42+02:00Daniel Beveniusggml : disable warnings for tests when using MSVC (ggml/1273)
705bbe98d27840453c8787d18470963530fdc27d89fc2056ed6d461e6d5432f04f221e221ab795dc6522025-06-13T09:05:44+02:00Daniel Beveniusggml : remove unused ggml_context_container (ggml/1272)
706fe9d60e74a6cb71bcaed2029377bfa2872b4abb0e434e69183fd9e1031f4445002083178c331a28b2025-06-17T17:48:08+08:00R0CKSTARmusa: fix build warning (unused variable) (#14231)
707e434e69183fd9e1031f4445002083178c331a28b89fea80d298184d1cd93564f48e060d9f541f4b42025-06-16T21:58:42+02:00Sigbjørn Skjæretcommon : suggest --jinja when autodetection fails (#14222)
70889fea80d298184d1cd93564f48e060d9f541f4b46adc3c3ebc029af058ac950a8e2a825fdf18ecc62025-06-16T22:33:27+03:00Georgi Gerganovserver : fix incorrect usage of llama_get_embeddings() (#14225)
709ad590be98c83217fcf1a101d78d9ab389fd5dc0b7d6d91babfa129906b39c9099eca4234c44f4f1e2025-06-16T21:53:41+09:00Đinh Trọng Huymodel : add NeoBERT (#14164)
7107d6d91babfa129906b39c9099eca4234c44f4f1ed3e64b9f490cee41b7b9aa275dae2f6568ae30542025-06-16T13:47:38+02:00uvosHIP: disable rocwmma on gfx12 by default until rocm 7.0 (#14202)
711d3e64b9f490cee41b7b9aa275dae2f6568ae30543ba0d843c6bd3faea5cf5e53dc7f3c82be20bffb2025-06-16T14:14:00+03:00Georgi Gerganovllama : rework embeddings logic (#14208)
7120bf49eb668bb95b50e41583e22aaf60ddade1fbe4ad243677bca6c97f14dbc187b2116b51fcb7ffd2025-06-16T09:16:06+01:00Bartowskiconvert : remove arcee change in convert_hf_to_gguf_update.py (#14207)
713c89c2d1ab94b11845240b7d3313c87691ea18d883555b3004ba7687be3d734acade52a3345758aa42025-06-16T00:21:08-06:00Jeff Bolzvulkan: mutex around vkQueueSubmit (#14127)
7143555b3004ba7687be3d734acade52a3345758aa4d7da8dc83a03b30e1ec10317080082ea76840c382025-06-16T13:54:15+08:00xctanggml-cpu : rework weak alias on apple targets (#14146)
715d7da8dc83a03b30e1ec10317080082ea76840c38cd355eda7df1898d25d433b4bdaa4b4b479e0bad2025-06-16T00:04:06+01:00Bartowskimodel : Add support for Arcee AI's upcoming AFM model (#14185)
71630e5b01de2a0bcddc7c063c8ef0802703a958417e54b394082de242be4ee2e692b11fcc8d4eba3712025-06-15T17:53:45+01:00Ed Addarioquantize : change int to unsigned int for KV overrides (#14197)
717e54b394082de242be4ee2e692b11fcc8d4eba3712c2caa444341d99c87ff153f142c2d4762a776a22025-06-15T17:30:13+02:00uvosCUDA/HIP: fix ssm_scan on devices where warp size is not 32 (#14196)
7185fce5f948df8f189a5401a8ecaa9753106e75abb9ae4143bc6ecb4c2f0f0301578f619f6c201b8572025-06-15T10:52:11+03:00Georgi Gerganovkv-cache : fix use-after-move of defrag info (#14189)
719b9912ac570de8945ae9383c9ca8291027bf287dd00ba7726100d7e1941d9f5a06f56a7559945b33c2025-06-15T09:18:37+03:00Georgi Gerganovbatch : auto-gen positions + verify multi-sequence input (#14177)
7203cb203c89f60483e349f841684173446ed23c28f2e42be42bd6bf1dcc643d6ac4e77419bfe5dd24f2025-06-14T18:25:15+02:00Piotrllama-chat : Do not throw when tool parsing fails (#14012)
7212e42be42bd6bf1dcc643d6ac4e77419bfe5dd24ffb85a288d72abbd5e5daa8de96e6f8bfa7b5ab462025-06-14T16:34:20+08:00Aman Guptacompare-llama-bench: add option to plot (#14169)
722fb85a288d72abbd5e5daa8de96e6f8bfa7b5ab4640643edb86eb10b471b0f57d4f3f7eb0e06a0df72025-06-13T20:03:05+03:00Georgi Gerganovvocab : fix build (#14175)
72340643edb86eb10b471b0f57d4f3f7eb0e06a0df73cfbbdb44e08fd19429fed6cc85b982a91f0efd52025-06-13T17:32:56+01:00Svetlozar Georgievsycl: fix docker image (#14144)
72480709b70a2f87c13ccaf1480b79939310999678926ff3685bfbaa4c8838d7afd988b17dd5eb99f922025-06-13T18:35:00+03:00Georgi Gerganovbatch : add LLAMA_BATCH_DEBUG environment variable (#14172)
725ffad04397399ea1650fda6560c7c7530598048760889eba570126f8a2f5a0e88fde776bbc91cca662025-06-13T11:18:25+03:00Georgi Gerganovserver : fix SWA condition for full context reprocess (#14163)
726c61285e7396c8e526fe7794c19e8d4f1c99bfc5109cf2c7c655c90e53e100f29b830a788bab0653d2025-06-13T08:45:37+01:00Ewan CrawfordSYCL: Bump oneMath commit (#14152)
72709cf2c7c655c90e53e100f29b830a788bab0653dc33fe8b8c4427202706b1434e9fc8ab5752c9cac2025-06-13T06:51:34ZChristian Kastnercmake : Improve build-info.cpp generation (#14156)
728f6e1a7aa8787b5c00acba6370cb70a0beff48b1ec3ee46fab49a765d2e32e171e9ed7a5fa121dd9c2025-06-12T11:50:01+03:00Georgi Gerganovcontext : simplify output counting logic during decode (#14142)
729e2c0b6e46a5596665569ae765f0993cea2619af69596506965f65be5d802ecef6a315fe43d2391a82025-06-12T10:14:24+03:00Georgi Gerganovcmake : handle whitepsaces in path during metal build (#14126)
7309596506965f65be5d802ecef6a315fe43d2391a8a20b2b05bce6622c585459ebf46f142f113d021c2025-06-12T10:02:15+03:00Georgi Gerganovkv-cache : fix split_equal handling in unified implementation (#14130)
731a20b2b05bce6622c585459ebf46f142f113d021c2e89f76b7af2c0b827be785e445f2e2b3e52e1ca2025-06-12T02:56:04-04:00compiladecontext : round n_tokens to next multiple of n_seqs when reserving (#14140)
7322e89f76b7af2c0b827be785e445f2e2b3e52e1ca532802f938c6a18cc6a704057ab571f253fd77ed2025-06-11T17:19:44-03:00bandoticommon: fix issue with regex_escape routine on windows (#14133)
733532802f938c6a18cc6a704057ab571f253fd77edd4e0d95cf581f50c9a21d06eaecae2dd580076bd2025-06-11T19:07:44ZChristian KastnerImplement GGML_CPU_ALL_VARIANTS for ARM (#14080)
734bd248d4dc7265437e1918dc53ae3f49a0c592e5f7781e5fe99f2a4fc1c8af0a8488eedac4644cb722025-06-11T09:48:52-05:00Jeff Bolzvulkan: Better thread-safety for command pools/buffers (#14116)
7352baf07727f921d9a4a1b63a2eff941e95d0488ed7ae2932116a4de3141cbc8c488f7f6e4e06d81712025-06-11T06:43:43-04:00Taylorserver : pass default --keep argument (#14120)
7367ae2932116a4de3141cbc8c488f7f6e4e06d81711f7d50b2936023b26eb218e944e62834b80a2ce02025-06-11T12:52:45+03:00Georgi Gerganovkv-cache : add LLAMA_KV_CACHE_DEBUG environment variable (#14121)
737dad5c44398b78467943ed0a603ea427fe9f6fc6255f6b9fa6563f6ae49113f9abdc980c12348cc1c2025-06-10T18:20:14-04:00compiladekv-cache : avoid modifying recurrent cells when setting inputs (#13834)
73855f6b9fa6563f6ae49113f9abdc980c12348cc1c3678b838bb71eaccbaeb479ff38c2e12bfd2f9602025-06-10T23:29:52+02:00Sigbjørn Skjæretconvert : fix duplicate key DeepSeek-R1 conversion error (#14103)
7393a12db23b6918682ccb70ab15d897f11fe5fc320ae92c1855b1a5b604fa1bfcced19a556ab3e78c52025-06-10T16:48:07+01:00Juk ArmstrongFixed spec timings to: accepted/tested instead of accepted/drafted (#14104)
740b7ce1ad1e332da5909772d173a7e6748fbd1887a97340b4c9924be86704dbf155e97c8319849ee192025-06-10T11:34:10+03:00Georgi Gerganovggml : fix weak alias win32 (whisper/0)
74197340b4c9924be86704dbf155e97c8319849ee192bb0467043258bdc58dbaefb33786f1731b389372025-06-10T14:01:33+02:000cc4mVulkan: Don't default to CPU device (like llvmpipe), even if no other device is available, to allow fallback to CPU backend (#14099)
7422bb0467043258bdc58dbaefb33786f1731b38937b8e2194efc529378be45ab9b27d6648a5b81458a2025-06-10T02:41:01-04:00Isaac McFadyenrpc : nicer error messages for RPC server crash (#14076)
7431f63e75f3b5dc7f44dbe63c8a41d23958fe95bc040cbf571c9210031340f022d104317e89a1a6bb22025-06-09T23:05:02+03:00Georgi Gerganovmetal : use less stack memory in FA kernel (#14088)
74440cbf571c9210031340f022d104317e89a1a6bb27f4fbe5183b23b6b2e25fd1ccc5d1fa8bb010cb72025-06-09T23:04:35+03:00Georgi Gerganovkv-cache : fix shift and defrag logic (#14081)
7457f4fbe5183b23b6b2e25fd1ccc5d1fa8bb010cb7f470bc36bed4d836b9de5a483fa0dfaee176d6f52025-06-09T11:03:09-07:00Diego Devesallama : allow building all tests on windows when not using shared libs (#13980)
746f470bc36bed4d836b9de5a483fa0dfaee176d6f58f47e25f56e9792093b7497c68e9f80bab82ed192025-06-09T22:47:13+08:00xctanggml-cpu : split arch-specific implementations (#13892)
7478f47e25f56e9792093b7497c68e9f80bab82ed19201b31dc2e6fef3de598280b53fd3b69420a4e492025-06-09T07:36:26-07:00Diego Devesacuda : fix device sync on buffer clear (#14033)
748201b31dc2e6fef3de598280b53fd3b69420a4e49e21d2d4ae26d6c5daf1602a1061aa4f8e722ca572025-06-09T17:17:31+03:00Georgi Gerganovgraph : fix geglu (#14077)
749e21d2d4ae26d6c5daf1602a1061aa4f8e722ca57dc0623fddb661926e0998538895155e4f081ff092025-06-09T19:47:39+08:00Xinpeng DouCANN: Simplify the environment variable setting(#13104)
750dc0623fddb661926e0998538895155e4f081ff0987d34b381d5868e75586210ec17b5ef5deddc2762025-06-09T18:01:17+08:00R0CKSTARwebui: fix sidebar being covered by main content (#14082)
75187d34b381d5868e75586210ec17b5ef5deddc276b460d16ae858c6624fd37aec316622a4060ca3252025-06-09T12:57:58+03:00Georgi Gerganovserver : fix LRU check (#14079)
752247e5c6e447707bb4539bdf1913d206088a8fc695787b5da57e54dba760c2deeac1edf892e8fc4502025-06-08T11:39:56-07:00Diego Devesacuda : fix buffer type check with integrated GPUs (#14069)
753228f34c9ceefa3ea4f4d6933edd858121e8106cb0974ad7a7cd4bca846b15c484ff3be890135a52c2025-06-07T18:58:20+05:30Akarshan BiswasSYCL: Implement few same quantized type copy kernels (#13739)
7540974ad7a7cd4bca846b15c484ff3be890135a52c745aa5319b9930068aff5e87cf5e9eef7227339b2025-06-07T14:13:12+02:00Sigbjørn Skjæretllama : fix llama_model_chat_template with template name (LLM_KV with suffix) (#14050)
755745aa5319b9930068aff5e87cf5e9eef7227339b487a5e0401423bba02cd6e97e4d45131bb20b22b2025-06-06T14:11:15+03:00Georgi Gerganovllama : deprecate llama_kv_self_ API (#14030)
756487a5e0401423bba02cd6e97e4d45131bb20b22bd17a809ef0af09b16625e991a76f6fe80d9c332e2025-06-06T13:29:18+03:00Georgi Gerganovcontext : fix SWA-related warning for multiple sequences (#14045)
757669c13e0f67edfba891c5bd7105eb4376bcf8626146b88e8b3e16d22cea22f8be982a4d45e913b1e2025-06-05T23:00:29+09:00Masato Nakasakavulkan: Enable VK_KHR_cooperative_matrix extension for Intel Xe2 GPUs (#14001)
758146b88e8b3e16d22cea22f8be982a4d45e913b1e7f37b6cf1e2c1b90bf0d9c8d91904b4b6c5127482025-06-05T06:25:29-07:00pockers21ci: fix CUDA build failure on autodl cloud machines (#14005)
7597f37b6cf1e2c1b90bf0d9c8d91904b4b6c5127483a077146a4761fdbd24bdd8eb098f46b8adc4dda2025-06-05T15:29:22+03:00Georgi Gerganovmemory : migrate from llama_kv_cache to more generic llama_memory (#14006)
7609e31bec4fd53634c9e5b04650488a09a055f5dab5a8ae3053ced350ed300ba91600519fcad1c6ba72025-06-05T09:06:29+03:00Georgi Gerganovcontext : fix pos_min initialization upon error decode (#14008)
7610d3984424f2973c49c4bcabe4cc0153b4f90c6013e63a58ef7addec35408e2eb67850d7cdc935dc32025-06-04T22:02:00+02:00Ervin Áron Tasnádiggml-vulkan: adds support for op CONV_TRANSPOSE_1D (#13813)
7623e63a58ef7addec35408e2eb67850d7cdc935dc32589ad3704559f4dd860f5f303b19349c688a28a2025-06-04T18:58:20+03:00Georgi Gerganovkv-cache : refactor the update/defrag mechanism (#13988)
7630b4be4c435849b00dbd98b109cf7a22298d27b69e0e806f52ebcd0ee285c994fe8fd8b8787d2cb0a2025-06-04T08:57:05+02:00Johannes GäßlerCUDA: fix FTZ in FA for Gemma 3 (#13991)
764e0e806f52ebcd0ee285c994fe8fd8b8787d2cb0a7e00e60ef86645a01fda738fef85b74afa016a342025-06-04T09:50:32+03:00Georgi Gerganovkv-cache : fix unified::seq_rm to work with seq_id < 0 (#13985)
7657e00e60ef86645a01fda738fef85b74afa016a34ea1431b0fa3a8108aac1e0a94a13ccc4a749963e2025-06-03T13:30:22-05:00Jeff Bolzvulkan: fix warnings in perf logger querypool code (#13937)
766bfb1e012a0b7658e8f00ed4333d059943ea9d648363757628848a27a435bbf22ff9476e9aeda5f402025-06-02T23:53:36ZrmatifOpenCL: Add concat, tsembd, upscale, tanh, pad and repeat (#13840)
7675582c49c3961269eca96822abfb87528e942dd07c9bbc77931d223ed7e7cbcf1cb057bc02fd0db192025-06-02T20:54:26+03:00Georgi Gerganovgemma : more consistent attention scaling for v2 and v3 (#13951)
768bfd322796cd838f906535ff3352624fc46338894093e3f1feb16e25e58f7d61e01266c830dd424b82025-06-02T16:29:28+02:00Xuan-Son Nguyenmtmd : fix memory leak in mtmd_helper_eval_chunk_single (#13961)
769093e3f1feb16e25e58f7d61e01266c830dd424b8663445b0deb21fb602176da030d4154197a4fca62025-06-02T17:48:36+05:30shalinib-ibmcmake : Handle mixed-case 'Power' strings in POWER CPU detection (#13966)
770663445b0deb21fb602176da030d4154197a4fca67675c555a13c9f473249e59a54db35032ce8e0fc2025-06-02T10:12:20+01:00Atharva Dubeysycl: quantize and reorder the input to q8_1 when reorder is enabled (#13826)
7717675c555a13c9f473249e59a54db35032ce8e0fc5e1c3aed4074480f63e914d6c44c93536ed1452a2025-06-01T18:08:05+02:00Johannes Gäßlergguf: fix failure on version == 0 (#13956)
7725e1c3aed4074480f63e914d6c44c93536ed1452ac496fe0b1da28618dd17bda8b0a6bf50045540802025-06-01T18:07:21+02:00Sigbjørn Skjæretconvert : fix nomic-bert-moe mask token (#13757)
773c496fe0b1da28618dd17bda8b0a6bf5004554080e57bb87cede38341963a7a884630dbfb09c7dc002025-06-01T17:23:11+02:00Sigbjørn Skjæretconvert : fix vocab padding code for bert models (#13954)
774e57bb87cede38341963a7a884630dbfb09c7dc00f3a4b1659ccc94ebdf3590d472b518377bfecc7a2025-06-01T22:53:57+08:00Aaron Teoggml: check if non-native endian model is being loaded (#13943)
775d337252acf14a91a685c355fa4f3f599a8068207af6f91db470da543dc32bc00c057aad8f060dfdb2025-05-31T12:39:19+02:00Kai Pastorcmake : Fix broken CMake error messages (ggml/1252)
776a7b8d35f780ab3e7639ae5345442fb1ad10f01636eba72b71c677ce9aae33c422a6e67008137987a2025-05-29T13:29:50+03:00Georgi Gerganovsync : whisper.cpp (ggml/1250)
777fedf034a98378059274e4243d2a370a243335e738726392d3d927fe3e504868d3548d694496ee37e2025-05-27T20:58:46-04:00Daniel Tangggml : Print backtrace on uncaught C++ exceptions (ggml/1232)
778c04621711a893cbd09cff6c927cb005bc6749e360fc16b42e8793364918e830c234c1f3caec29dae2025-06-01T11:42:16+03:00Georgi Gerganovparallel : fix n_junk == 0 (#13952)
77951fa76f172957c9916e43aeb581f82c533e1239412d0188c0dc6146ffde6d277a93f232ccbe699f82025-05-31T10:14:29+02:00Xuan-Son Nguyenmtmd : drop `_shared` from `libmtmd` name, merge helpers into libmtmd (⚠️ breaking change) (#13917)
78012d0188c0dc6146ffde6d277a93f232ccbe699f8eb3949938e82a128855bc0676220bb2ce6e4228d2025-05-31T10:24:04+03:00Georgi Gerganovkv-cache : refactor + add llama_memory_state_i (#13746)
781eb3949938e82a128855bc0676220bb2ce6e4228de562eece7cb476276bfc4cbb18deb7c0369b22332025-05-31T14:48:04+08:00Shawn yangCUDA: add a prop in ggml_cuda_device_infor for distinguish iGPU or dGPU in cuda (#13856) (#13895)
782e562eece7cb476276bfc4cbb18deb7c0369b2233b47ab7b8e9c4f6154eb6abb6234866ab117d64c72025-05-30T21:22:03+02:00Johannes GäßlerCUDA: fix typo in FlashAttention code (#13926)
783b47ab7b8e9c4f6154eb6abb6234866ab117d64c7dd665cc9d4b378626cde11ea0c4c91f514fdc9942025-05-30T09:56:19-07:00Diego Devesasched : avoid changing cur_copy when a graph is already allocated (#13922)
78453f925074de02c5304b00c14b4d6d8910c58667ddb38704f0133be7832123495fa8fc2601ea999d42025-05-30T16:25:45+03:00Georgi Gerganovsync : vendor (#13901)
785db38704f0133be7832123495fa8fc2601ea999d407e4351ce663a7802b31f92fd7bc0e555c2044b62025-05-30T14:50:43+02:00Sigbjørn Skjæretconvert : fix rwkv bos/eos token (#13844)
78607e4351ce663a7802b31f92fd7bc0e555c2044b6291f2b6913c7ef8350dbf0e77da38f7af131a08e2025-05-30T12:24:37+02:00Xuan-Son Nguyenconvert : allow partial update to the chkhsh pre-tokenizer list (#13847)
787291f2b6913c7ef8350dbf0e77da38f7af131a08e2c90da4c7ec694797f524042aaafbb047a7e65ff2025-05-30T18:56:02+09:00Đinh Trọng Huyllama : add support for DistilBert (#13907)
78854a2c7a8cd8a32b44e3a98c2999b0f5c9114be5c21fcc21ad5e5de2daa5da8d08dbbcc86b8d815d72025-05-29T19:39:20+08:00Yibo Caiarm64: optimize q4_k_q8_k kernel with i8mm (#13886)
789dd8ba93416f492c168f7e20f0b1434c08ebeaeb566c92061f5c34d2f9a630b7b50cca5ce3ebb4b162025-05-29T14:48:43+05:30Vineel Abhinavggml: aarch64: Implement SVE F32 kernels for Mamba Sequential Scan Algorithm (#13882)
7901b8fb8152d0f3357a9c1d9b4c02f6cc5b9cb723253ae30640e131082d8d19bd80485b47c4553d5512025-05-29T11:31:33+05:30Vineel Abhinavggml: aarch64: Implement SVE F32 kernels for vector functions (#13843)
79153ae30640e131082d8d19bd80485b47c4553d551763d06edb7dd5094ea58bad1d81e2e8d35033e342025-05-28T14:50:20-07:00Beinseziigguf-py : fix SafetensorRemote return on undefined size (< 0) (#13841)
792763d06edb7dd5094ea58bad1d81e2e8d35033e3410961339b26bd2eff01d5479e8879f435da261b72025-05-28T22:35:31+02:00Xuan-Son Nguyenllama : fix KV shift for qwen2vl (#13870)
79310961339b26bd2eff01d5479e8879f435da261b7d98f2a35fcf4a8d3e660ad48cd19e2a1f3d5b2ef2025-05-28T22:35:22+02:00Xuan-Son Nguyenmtmd : move helpers to dedicated library (⚠️ breaking change) (#13866)
794e0e3aa231d899720c2864d09cdb89d4c400eeb55aa6dff05be25709bb218bf648951d690029c4b192025-05-29T02:01:58+09:00Đinh Trọng Huyllama : add support for BertForSequenceClassification reranker (#13858)
795c962ae3382a1e759c8517a229549ee53685313a1a3938fb53d0b5183db4f5a6db21fd9122a0e47802025-05-28T22:33:54+08:00Skyserver: fix remove 'image_url'/'input_audio' json-object effectlly for 'llama_params' in multimodal-model-mode (#13853)
796a3938fb53d0b5183db4f5a6db21fd9122a0e4780f7873fc698c09047e2873630ab7e7730a0bfb2242025-05-28T16:12:35+02:00Xuan-Son Nguyenconvert : fix qwen omni conversion (#13859)
797f7873fc698c09047e2873630ab7e7730a0bfb224a68247439bd6fb756cc93ad2817e55a02aa0b1002025-05-28T14:49:28+01:00Alex Fanthometests : change umlaut test (#11600)
798a68247439bd6fb756cc93ad2817e55a02aa0b10026b79b6cb3e7840ff15729350e95907e19f9f4802025-05-28T13:33:37+02:00Johannes GäßlerCUDA: fix FA tg at long context for CC >= 8.9 (#13852)
79926b79b6cb3e7840ff15729350e95907e19f9f4801e8659e65ad0f640674d2785d02b556ab938728c2025-05-28T10:05:54+02:00Xuan-Son Nguyenconvert : fix tensor naming conflict for llama 4 vision (#13836)
800bef817638780dcbd8c0c80c97b7a4f8e92c8fe7434b7c0439ed0f98575cc4689dfecd98991dee8be2025-05-27T11:39:07-05:00Jeff Bolzvulkan: use timestamp queries for GGML_VULKAN_PERF (#13817)
801f3101a8cc665f73217c752a10a7042889275cfbc1c49c70d07ef87635daa5e8fdd0b5bfd88493dd32025-05-27T20:52:59+05:30Akarshan BiswasSYCL: add gelu_erf kernel (#13749)
802bc583e3c63c04a11d287c108ea9e6a515ead042372b090da2c50e540143fd312a2f9aa5f151e61362025-05-27T14:06:10+02:00Xuan-Son Nguyenmtmd : support Qwen 2.5 Omni (input audio+vision, no audio output) (#13784)
80381713121ee56755ba4a147d1a1e3fa248ec31a66f9cd68398baf2ba8af4725ca9ed00bef205e67062025-05-27T13:49:41+03:00Georgi Gerganovkv-cells : track min/max used cells and per-sequence positions (#13808)
8044f81b33e324b1669b282eb81104e4a1131be7dcecdf94a18023c92f41808ec874ba577d9146747172025-05-27T09:40:59+03:00Georgi Gerganovllama : validate seq id batch input (#13809)
805a26c4cc11ec7c6574e3691e90ecdbd67deeea35b4265a87b59ebfc25f35adbf4db3b608995b0a78a2025-05-26T22:24:01+03:00Georgi Gerganovscripts : add option to compare commits in Debug (#13806)
8064265a87b59ebfc25f35adbf4db3b608995b0a78a6f180b915c9ed9ec0c240b5dcd64644988fb5e822025-05-26T22:14:52+03:00Georgi Gerganovcuda : avoid cuGetErrorString (#13791)
8076f180b915c9ed9ec0c240b5dcd64644988fb5e8203f582ae8fccecff225c30a2802461b44761e8222025-05-26T21:10:36+05:30Akarshan BiswasSYCL: Add non contiguous support in RMS_NORM and NORM kernels (#13611)
80803f582ae8fccecff225c30a2802461b44761e82288c125f2acce0e25e5fc8481ab0681415fc64a102025-05-26T08:03:57-07:00Olivier Chafikserver: fix streaming crashes (#13786)
80988c125f2acce0e25e5fc8481ab0681415fc64a10d74e94c1b3ac02db01e47008e1f8d371029d81ac2025-05-26T23:55:24+09:00standby24x7examples/training: Fix file name in README (#13803)
810d74e94c1b3ac02db01e47008e1f8d371029d81acf13847cfb560d92492b480cca2c5d6aa9473cde32025-05-26T06:56:49-07:00Olivier Chafik`server`: fix format of streamed tool call deltas (diff name, fix id location) (#13800)
811f13847cfb560d92492b480cca2c5d6aa9473cde379c137f77677b3c8ee3c60a7da033721b938399a2025-05-26T06:16:37-07:00Olivier Chafikserver: fix regression on streamed non-chat completion w/ stops (#13785)
8129012eb9b454a82eaa4cd77ae904c0ea391e4db42fef693dc6b959a8e8ba11558fbeaad0b264dd4572025-05-26T10:28:53+02:00Romain Biessysycl: Add more debug prints (#13640)
8132d38b6e4004fb1c341723e657fb1e71a4d3fb473e121edc4324a640be11b7e567edd39b721b0f8e42025-05-26T10:20:18+08:00Bizhao ShiCANN: Add the basic supports of Flash Attention kernel (#13627)
814de2ef53a4b2c0d703749a309d19fe68fd8f1b9acc508256db2de2b032e19c8ed833f4683c827c9a12025-05-25T16:34:36+03:00Georgi Gerganovkv-cache : rework kv_cell (#13706)
815c508256db2de2b032e19c8ed833f4683c827c9a140aaa8a403df5dcfb515eb2fd7a817fd997795262025-05-25T13:35:53+01:00Percy Piperrpc : Fix build on OpenBSD (#13541)
81640aaa8a403df5dcfb515eb2fd7a817fd99779526a08c1d2845dc279d58d826ef3c3ecad97cbbcef72025-05-25T14:06:32+02:00Xuan-Son Nguyenmtmd : add support for Qwen2-Audio and SeaLLM-Audio (#13760)
817a08c1d2845dc279d58d826ef3c3ecad97cbbcef7d785f9c1fd1a1929c6d0e2a0b12cae5db867908b2025-05-25T14:04:49+02:00ddpasadocs : add Moondream2 pre-quantized link (#13745)
818d785f9c1fd1a1929c6d0e2a0b12cae5db867908b4032ca406632212b075e3c61c2a44761283214102025-05-25T10:45:49+01:00Olivier Chafikserver: fix/test add_generation_prompt (#13770)
819f5cd27b71da3ac375a04a41643d14fc779a8057ba2d02d5793fd9af7a7224773456501691b95fd022025-05-25T01:48:08+01:00Olivier Chafik`server`: streaming of tool calls and thoughts when `--jinja` is on (#12379)
820259469c4b57c1a32606353bcac52ba683424a9904c32832c59e97d96c19349fdc92763e8949fda832025-05-24T16:49:12+02:000cc4mMove GLM4 f32 attention fix to the correct function (#13750)
821c3a2624339187e89c4f65fd72a5fe7103968b5adffd0eae60b7642e942c8245b89642527e36099e62025-05-24T12:29:09+02:00Sigbjørn Skjæretvocab : fix ugm tokenizer precision (#13743)
822ffd0eae60b7642e942c8245b89642527e36099e6b775345d788ac16260e7eef49e11fe57ee5677f72025-05-24T11:46:19+02:00Johannes GäßlerCUDA: fix race condition in FA vector kernels (#13742)
823e16c4731c7a6bfa8f61b5b39c77245a37e7fc2321dcd01960c33f52afb782b3d850fc2149a08cc6b2025-05-23T08:12:48+02:00Xuan-Son Nguyenggml : fix the order of ggml_unary_op (#13718)
8243079e9ac8e04ef6eddeb0c164d72edb6b6fd2df58a1d206f1d2b4e45918b589f3165b4be232f7ba82025-05-22T15:21:37-07:00Diego Devesarelease : fix windows hip release (#13707)
8258a1d206f1d2b4e45918b589f3165b4be232f7ba8797990c4bca0dca5be295c63e3fb2800dc0a69c22025-05-22T22:21:07+03:00Georgi Gerganovtts : fix n_ubatch + make WavTokenizer cache-less (#13713)
826797990c4bca0dca5be295c63e3fb2800dc0a69c2ab86335760ebb441574eb47f886fa1ee302e21312025-05-22T20:42:48+02:00Xuan-Son Nguyenmtmd : add ultravox audio input (#13623)
827ab86335760ebb441574eb47f886fa1ee302e2131cc74d5be990e37f201591fd868a92e64abdbf9022025-05-23T02:31:29+08:00Aaron Teocommon: Include torch package for s390x (#13699)
828a4e8912dfd4604be1e39bc86ba4c0b02969967efedbf42edfdabb9cea72ae12137570cf48f5d80762025-05-22T02:21:45+03:00Henry Linjamäkiopencl: Add support for multiple devices (#12622)
829edbf42edfdabb9cea72ae12137570cf48f5d8076d643bb2c798df9c2cd61067d2692b1cd417df4022025-05-21T23:21:17+03:00Henry Linjamäkiopencl: fix couple crashes (#12795)
8305fbfe384d4659f81c47a477eb8ee97692c7ffef9c76532e7ba128bb097bf6836bf0f5592e1b56b762025-05-21T19:46:56+03:00Georgi Gerganovserver : improve error reporting (#13680)
831eb0f5c28d37126baa756117d5bdaadc62e03344ecf4cb59e64d72a1b4c781f71a74de5756a4e23762025-05-21T17:33:54+03:00Emmanuel Ferdmangguf-py : display the invalid gguf type (#13687)
832cf4cb59e64d72a1b4c781f71a74de5756a4e23760d5c74216170ef97e5e7511563837263f2d1a4962025-05-21T16:26:33+02:00Xuan-Son Nguyenggml : add ggml_gelu_erf() (#13667)
83342158ae2e8ead667a83f07247321ce85f32ace66797f2ac0625b22edeff03cc30e0f988da6b6b0682025-05-21T16:07:57+03:00Dorin-Andrei Gemanserver : fix first message identification (#13634)
834797f2ac0625b22edeff03cc30e0f988da6b6b068b44890df2e4fad0ece1d5366dcbc8bedae23b6582025-05-21T15:11:13+03:00Georgi Gerganovkv-cache : simplify the interface (#13660)
835b44890df2e4fad0ece1d5366dcbc8bedae23b65833983057d0f578aca74ba15eccc3de9c267a5ff62025-05-21T13:09:21+03:00Georgi Gerganovmodel : disable SWA for Phi models (#13676)
83633983057d0f578aca74ba15eccc3de9c267a5ff6fb1cab201c6c4cd36731f100df74eece2f4706fa2025-05-21T09:58:49+08:00R0CKSTARmusa: Upgrade MUSA SDK version to rc4.0.1 and use mudnn::Unary::IDENTITY op to accelerate D2D memory copy (#13647)
837fb1cab201c6c4cd36731f100df74eece2f4706fab7a17463ec190aeee7b9077c606c910fb4688b842025-05-20T21:35:16ZEvevulkan: fix warnings (#13626)
838b7a17463ec190aeee7b9077c606c910fb4688b84be0239693c1530a18496086331fc18d8a9adbad12025-05-21T00:55:30+08:00l3utterflymtmd-helper : bug fix to token batching in mtmd (#13650)
839be0239693c1530a18496086331fc18d8a9adbad1a4090d1174aed22dde5cacce2a4c27656b987a2f2025-05-20T19:21:04+03:00Georgi Gerganovmodel : fix llama4 graph (#13663)
840c9c64dee572c5eedf073a6c6eb5d92d8283f7639c00a2634bec49805c6b31438b1a6006a2bd793cb2025-05-20T10:11:56+02:000cc4mSet GLM4 blk.*.attn_output.weight, kqv_out-* matmul to GGML_PREC_F32 to fix infinity values in output (#13639)
841c00a2634bec49805c6b31438b1a6006a2bd793cbe298d2fbd082a52c0f6ed02729f94e9bf630cf172025-05-20T10:41:40+03:00Georgi Gerganovmetal : fix typo in FA kernel comments (#13651)
842e298d2fbd082a52c0f6ed02729f94e9bf630cf17f0adb80bf7c2c0d80abb04f4533b5513622d99642025-05-20T08:05:46+03:00Georgi Gerganovkv-cache : add SWA support (#13194)
843f0adb80bf7c2c0d80abb04f4533b5513622d9964f7c9429c85748cde9599499601ba48d0057722e62025-05-20T11:43:43+08:00Xinpeng DouCANN: Update CANN model support (#13162)
8448960efd0a65e5a4830a14f6937c10703534f2569725f23f1f3f0d3adf49f95d8dfa6e7c74adff1492025-05-19T17:54:08+02:000cc4mVulkan: Add f32 accumulator support to quantized mul mat to fix GLM4 32B incoherence (#13607)
845725f23f1f3f0d3adf49f95d8dfa6e7c74adff14992ecdcc06a4c405a415bcaa0cb772bc560aa23b12025-05-19T14:38:20+01:00Alberto Cabrera Pérezsycl : backend documentation review (#13544)
84692ecdcc06a4c405a415bcaa0cb772bc560aa23b1f71f40a2847d4c9f57b86cd206e0a27b2bfb6d1c2025-05-19T13:04:14+02:00Xuan-Son Nguyenmtmd : add vision support for llama 4 (#13282)
8476c35981a643d4f74a286268b62f65bfa156af2e68b5e19aea6ce9fe44525986639243732340414402025-05-19T09:33:35+02:00Johannes Gäßlermnist: fix segmentation fault (ggml/1227)
8488b5e19aea6ce9fe445259866392437323404144060aea028b575ab54e0dfbb31db641bb93d2ae8c42025-05-18T18:30:13-07:00Diego Devesaggml : fix apple OS check in ggml_print_backtrace (ggml/1229)
84960aea028b575ab54e0dfbb31db641bb93d2ae8c49c55e5c5c24990dd17fd6c8f4f2159052d2b06f12025-05-17T19:06:26-04:00Daniel Tangggml : Fix missing backtrace on Linux (ggml/1228)
8509c55e5c5c24990dd17fd6c8f4f2159052d2b06f133d7aed4a83e7bbecac4af535208d4ed3e1ca8fd2025-05-19T18:25:41+08:00Nickfix: check model pointer validity before use (#13631)
851e3a7cf6c5bf6a0a24217f88607b06e4405a2b5d9518329b2d4434d0683c30b741b4f4cf5734b5f992025-05-17T21:26:43+03:00Gilad S.cmake: use the current build config for vulkan-shaders-gen (#13595)
8522f5a4e1e09567e09be8b84a5f976334de9539d174f41ee11d6a4ddb02e4644922bf0b56880ee6f552025-05-17T16:14:55+09:00Jeff Bolzvulkan: move common FA code to flash_attn_base.comp (#13556)
8533e0be1cacef290c99cbb99ceaa433b4344f873556aa892ec2aa7fe0c93e87c4b970d83a942fb94542025-05-16T14:56:28-06:00Zllguidance : official v0.7.20 release (no actual changes) [noci] (#13594)
8546aa892ec2aa7fe0c93e87c4b970d83a942fb9454aea9f8b4e73876739bf88fb705502f291294e4692025-05-16T21:50:00+02:00Xuan-Son Nguyenserver : do not return error out of context (with ctx shift disabled) (#13577)
855aea9f8b4e73876739bf88fb705502f291294e46906c1e4abc1e50ef6dcf6369f9685ca8fe82d21fe2025-05-16T21:49:01+02:00Xuan-Son Nguyenwebui : improve accessibility for visually impaired people (#13551)
8560a338ed013c23aecdce6449af736a35a465fa60fbc098c3cf0aac93e57e9bda9d95e2456acf888942025-05-16T12:15:29+02:00Łukasz Ślusarczyksycl : fixed compilation warnings (#13582)
85707ad2b6db3c117868728e2cdfe3b711473d66e14c531edfa34fec8074d0b424396cdd450df23b6122025-05-15T12:47:10-04:00Daniel Tanggguf-py : fix disconnect-before-connect in editor-gui (#13569)
858c531edfa34fec8074d0b424396cdd450df23b61202cdd2d8b092b5a4bb18e013c6887ce49ba20ac52025-05-15T17:40:07+02:00Xuan-Son Nguyenconvert : fix conversion for llama 4 (#13567)
8596c8b91500e75df6664278d1e9af3e39e8a2fb0d03cc1f1f1d24472a6558c942b1c78989ff4b0e5692025-05-15T06:46:55-07:00Diego Devesallama-bench : fix -ot with dl backends (#13563)
8603cc1f1f1d24472a6558c942b1c78989ff4b0e569c753d7bed0dc2cc2d5c42dfa9806cba91748392e2025-05-15T14:24:50+02:00Xuan-Son Nguyenwebui : handle PDF input (as text or image) + convert pasted long content to file (#13562)
861c753d7bed0dc2cc2d5c42dfa9806cba91748392eb2838049ccf50859cea4c390e81405c2fb01e8202025-05-15T08:40:58+02:00Piotr Wilkin (ilintar)server : proper error handling for missing elements in messages array (OpenAI compatible backend) (#13540)
862b2838049ccf50859cea4c390e81405c2fb01e820aa48e373f256df9608395ee6881e7010840d62022025-05-15T05:57:02+03:00Georgi Gerganovbench : handle decode errors (#13548)
863aa48e373f256df9608395ee6881e7010840d6202e3a9421b78da5c810d812e6348a405f5acc39f342025-05-15T02:39:51+01:00Olivier Chafik`server`: inject date_string in llama 3.x template + fix date for firefunction v2 (#12802)
864e3a9421b78da5c810d812e6348a405f5acc39f345ab5d5fb256aa23f8ab4de8463515ea627f430062025-05-14T23:15:15+03:00Georgi Gerganovkv-cache : fix out-of-bounds view during reserve graph (#13547)
8655ab5d5fb256aa23f8ab4de8463515ea627f430063198405e98530c683d12fd123e3920f2bd2aafa52025-05-15T03:53:52+08:00Yibo Caiarm64: optimize q6_k_q8_k kernel with i8mm (#13519)
866f5170c1d7a66222ca7c75d2022fec3ed87257e0b017f10b5fa630a013ec4f9936e410a60d4f460d52025-05-14T20:22:49+02:00Sigbjørn Skjæreteditorconfig : fix trailing whitespace from #13542 (#13546)
867017f10b5fa630a013ec4f9936e410a60d4f460d54696d5674999dc10a7fb8c27b33406a929f7463a2025-05-14T19:18:18+03:00Gilad S.fix: crash when calling `llama_state_get_size` on a context without a KV cache (#13542)
8684696d5674999dc10a7fb8c27b33406a929f7463ab7d26720821823e23e2273a99e38398d511242e92025-05-14T16:41:02+02:00Johannes GäßlerCUDA: fix crash on large batch size for quant. MoE (#13537)
869b7d26720821823e23e2273a99e38398d511242e96da34fa27620fa56e3334172e023f4f2533df51f2025-05-14T07:12:36-07:00Diego Devesallama : fix quantize with dl backends (#13539)
8705e7d95e22e386d316f7f659b74c9c34b65507912053174436f3b3cbb01077f26ff17809537b832c72025-05-14T06:53:59-06:00Gabe Goodhartfix: Move build_inp_pos to the top of the graph section for build_granite (#13538)
871360a9c98e13d35f322b4c5b1309aab0cc90ed82b09d13d94fb169093095416ac6323551c37b753392025-05-14T13:35:07+02:00Xuan-Son Nguyenserver : fix cache_tokens bug with no cache_prompt (#13533)
872d486dd3e8ecfba0170f8632a1530540de560f4a321ca987fba504d273ea28ebc4d3e5b3736a11c8e2025-05-14T10:07:31+02:00Luca Stefaniwebui: Allow pasting file from clipboard (#13526)
87321ca987fba504d273ea28ebc4d3e5b3736a11c8ebe1d4a13db26750fac702ceb3af88ae4f39dc9f42025-05-14T09:59:12+02:00ddpasadocs: Update link to ggml-org in multimodal.md (#13513)
874be1d4a13db26750fac702ceb3af88ae4f39dc9f4ab3971f2a0a526564bfde0e4cc8a5b90f9d33ad22025-05-14T08:41:01+02:00Sigbjørn Skjæretscripts : fix compare-llama-bench.py show parameter (#13514)
875ab3971f2a0a526564bfde0e4cc8a5b90f9d33ad2e5c834f718a32b7584f142799bbf508fddb9021c2025-05-14T13:15:50+09:00Jeff Bolzvulkan: workaround FA compile failures on macos (#13517)
87671bdbdb58757d508557e6d8b387f666cdfb25c5ef0995d28ce3d15095b6845d94ce4465e465758732025-05-13T17:07:21+02:00Xuan-Son Nguyenclip : clip.h become private API (⚠️ breaking change) (#13510)
877f0995d28ce3d15095b6845d94ce4465e46575873c252e0c4097b34666e5a81db9d0450d71fa3098f2025-05-13T18:04:39+03:00Georgi Gerganovmetal : use FA-vec kernel up to batch size 20 (#13496)
878c252e0c4097b34666e5a81db9d0450d71fa3098f4f711afed5e7ef4304b567c8888ee1aa60e868eb2025-05-13T18:04:00+03:00Georgi Gerganovmetal : optimize multi-sequence FA vec kernel (#13493)
8794f711afed5e7ef4304b567c8888ee1aa60e868ebb89d605a91dee0a518ecd582f8991a07d523e2fa2025-05-13T17:02:28+02:00Dan Johanssonggml-cpu: Update KleidiAI to v1.6 and fix include directives (#13509)
880b89d605a91dee0a518ecd582f8991a07d523e2fab4726345aca49e2ad62d615e6e370b3dbad6434f2025-05-13T18:01:53+03:00Georgi Gerganovbatched-bench : fix pp batch contents (#13492)
881b4726345aca49e2ad62d615e6e370b3dbad6434fbf7937112058f2815fc3825a9ff7b536ecafa3bb2025-05-13T15:33:58+02:00Xuan-Son Nguyenmtmd : remove libllava, remove clip-quantize-cli (⚠️ breaking change) (#13460)
882d590cd4c244e5f260c42c290b83a358b9d86d7631e2809bc4b5d8db2a9ed12ac872eca832c53f5fd2025-05-13T07:12:01-06:00Gabe Goodhartmodel : Granite MoE shared (#13269)
883cf0a43bb6490bd49344775abb22ba26f8047cb54f0d46ef15717cd609a7b69cf6190edde64d466c82025-05-12T15:31:37-07:00Diego Devesallama-bench : add defrag-thold, check for invalid ranges (#13487)
88410d2af0eaa0aafd7c6577b279dfa5221ff44a63f064cc596ac44308dc326a17c9e3163c34a6f29d12025-05-12T14:44:49+02:00Johannes Gäßlerllama/ggml: add LLM training support (#10544)
885064cc596ac44308dc326a17c9e3163c34a6f29d191159ee9df84edb72ccf874e353d2414f3a8c60d2025-05-12T15:12:27+03:00Georgi Gerganovcontext : fix state io for memory-less contexts (#13470)
88691159ee9df84edb72ccf874e353d2414f3a8c60d22cdab343b63edd0906f1c132616746085f819832025-05-12T18:56:42+07:00Anudit Nagarserver : allow content to be null in oaicompat_completion_params_parse (#13477)
887a71a4075cdb8e81eaaa834e48ffda88b038286bc95e18884fc7ea4031f70f1a518d5d1df616e57172025-05-12T13:06:19+02:00Dan Johanssonggml-cpu: Integrate fp32=bf16xbf16 SME KleidiAI kernel (#13053)
88895e18884fc7ea4031f70f1a518d5d1df616e5717df8491922f0ea4e032338186350dff2fb6b2b4e32025-05-12T10:51:21+02:00Johannes GäßlerCUDA: fix misaligned synchronization in FA (#13469)
8899a390c4829cd3058d26a2e2c09d16e3fd12bf1b109232370fc6426aa5dd9be01a8271b9c28f5af3a2025-05-11T11:08:26-04:00Anthony Umfertools : fix uninitialized llama_batch in server (#13436)
8907474e00b34629e9cd8b06bc87ad935584ea30f8e7f323a589f8684c0eb722e7309074cb5eac0c8b52025-05-11T16:09:33+02:00Johannes GäßlerCUDA: fix crash with partial offloading of MoE (#13439)
891a634d75d1bb4034b8c945042ceea268b5b89573062d4250e52917dc4d634f054b1e2183ed7dee9442025-05-11T11:34:23+02:00Xuan-Son Nguyenmtmd : move helpers to dedicated file (#13442)
89262d4250e52917dc4d634f054b1e2183ed7dee9440208355f42bdab88a08507ead4a6302790a083232025-05-10T22:26:46+02:00Thomas Germerdocs : Fix typo in InternVL3 model name (#13440)
8930208355f42bdab88a08507ead4a6302790a08323d2a4ef05c60506ee48e7375eb36f2257de7ab0d22025-05-10T22:22:48+02:00Johannes GäßlerCUDA: fix race conditions FlashAttention kernels (#13438)
89415e6125a397f6086c1dfdf7584acdb7c730313dc3b24d26c22b9d92b5aa39930988700c84e524cf42025-05-10T19:57:54+02:00Xuan-Son Nguyenmtmd : add hard limit on image resolution for qwen2vl / qwen2.5vl (#13434)
89543dfd741a5da77982e0a94d1e522a2481dfb914db064a51a4e7246fa43a3307f58e59f65e6be170a2025-05-10T17:19:52+02:00Sigbjørn Skjæretllguidance : set tokenizer slices to default (#13424)
896053367d149f778cdabc356ee3024494e0dd53223d8919424f1dee7dc1638349c616f2ef5d2ee16fb2025-05-10T16:26:42+02:00Xuan-Son Nguyenmtmd : support InternVL 2.5 and 3 (#13422)
897d8919424f1dee7dc1638349c616f2ef5d2ee16fb7fef11766cdeb9fa7bbbe3db13580616b7d3d5992025-05-10T09:16:52+02:00Johannes GäßlerCUDA: fix FlashAttention on Turing (#13415)
89833eff4024084d1f0c8441b79f7208a52fad7985817512a94d636c4b6c1332370acb3e5af3ca709182025-05-09T19:29:37+02:00Xuan-Son Nguyen server : vision support via libmtmd (#12898)
89917512a94d636c4b6c1332370acb3e5af3ca70918611aa914ef4231fab5d1ad04773c42e119ae2d2e2025-05-09T16:34:08+01:00Alberto Cabrera Pérezsycl : implementation of reordered Q4_0 MMVQ for Intel GPUs (#12858)
90027ebfcacbaadc6104e2b18acd8f13515cbf63dce5c86c9ed3ef1cc7307fdce05f0f0e2e45253cf902025-05-09T13:02:07+02:00Diego Devesallama : do not crash if there is no CPU backend (#13395)
9015c86c9ed3ef1cc7307fdce05f0f0e2e45253cf90efb8b47eda78ea8ae570d4fece3953aae499289e2025-05-09T12:14:04+02:00Johannes GäßlerCUDA: fix crash on large batch size for MoE models (#13384)
9022189fd3b6327a1d17893694125da8edcf74a64683f96aeff394e9b72bbd2fa665c3e023a70ed86482025-05-09T11:18:02+02:00Xuan-Son Nguyenmtmd : fix batch_view for m-rope (#13397)
9033f96aeff394e9b72bbd2fa665c3e023a70ed8648b486ba05bf973aae3652b3fd593e0b257d3a41d42025-05-09T11:17:51+02:00Xuan-Son Nguyenllama : one-off chat template fix for Mistral-Small-2503 (#13398)
904b486ba05bf973aae3652b3fd593e0b257d3a41d402115dcd9a6d0c03b527d5bee8c1493ab819ddbd2025-05-09T10:31:07+03:00Radoslav Gerganovrpc : add rpc_msg_set_tensor_hash_req (#13353)
90515e03282bb432631193464100c2237a3b6bcfe4cf05a6d71a0f3dbf0730b56a1abbad41c0f42e63d2025-05-08T23:45:22+02:00Diego Devesaci : limit write permission to only the release step + fixes (#13392)
906ee01d71e585f4a17ae83ec55d77acfdcf0bfa7988c83449cb780c201839653812681c3a4cf17feed2025-05-08T18:51:45+02:00Xuan-Son Nguyenserver : (webui) fix a very small misalignment (#13387)
9078c83449cb780c201839653812681c3a4cf17feed1a844be132dbe865358e1de81136920c1d35ac732025-05-08T15:37:29+02:00Xuan-Son Nguyenserver : (webui) revamp the input area, plus many small UI improvements (#13365)
9080ccc1213549e39ef4c1affb1bf5f49651ef4ce486562e5a4d6c58326dcd79002ea396d4141f1b18e2025-05-08T22:03:53+09:00welixmtmd : fix the calculation of n_tokens for smolvlm (#13381)
9098733e0cf6eefc7c7752297cc22d0836706f4222c814f795e063c257f33b921eab4073484238a151a2025-05-08T10:08:01+01:00Alberto Cabrera Pérezsycl: addressing non-contiguous src1 mul_mats (nc and batched) (#13343)
91032916a49072f01c43e20df374af5f8a1f70d6963ffc727203af1061fdeb49efef30f76171722e4032025-05-06T22:40:24+02:00Xuan-Son Nguyenclip : refactor graph builder (#13321)
9111e333d5bba18e99bc328bb87ac1ee6a4e6260e0e2f54e348ad2999c4e31b8777592247622b20420f2025-05-06T20:27:06+05:30Akarshan BiswasSYCL: Disable reorder optimize by default and stop setting tensor extras when optimize is disabled (#13254)
9122f54e348ad2999c4e31b8777592247622b20420f2356fb1d53c86d838756211010bbabfafda7cb942025-05-06T14:25:40+02:00Xuan-Son Nguyenllama : fix build_ffn without gate (#13336)
9132356fb1d53c86d838756211010bbabfafda7cb94764b85627b46f43d7ea801867cd1b6abef4845742025-05-06T13:58:51+02:00Johannes GäßlerCUDA: fix bad asserts for partial offload (#13337)
91415a28ec8c705b188ebe178170966d1dcc36fe151a7366faa5bb2fff97b9fb43340d853709f52d8c92025-05-06T08:36:46+02:00Johannes GäßlerCUDA: fix --split-mode row for MMQ (#13323)
915907036502070ba608bdb2aaebf802092d4cfba07233461f8121455f957a47e6a22a77b3bc88277b02025-05-05T22:32:13+02:00Johannes GäßlerCUDA: fix logic for clearing padding with -ngl 0 (#13320)
916233461f8121455f957a47e6a22a77b3bc88277b0b34c859146630dff136943abc9852ca173a7c9d62025-05-05T17:12:19-03:00oobaboogasampling : Integrate Top-nσ into main sampling chain (and add it to the server) (#13264)
917b34c859146630dff136943abc9852ca173a7c9d69b61acf06041dcbaff6afa5f28940e93297f85202025-05-05T17:03:31+03:00igardevserver : Webui - change setText command from parent window to also send the message. (#13309)
9189b61acf06041dcbaff6afa5f28940e93297f85205215b91e9377ce23e4ccc92ec3156bf5c7f892a32025-05-05T16:02:55+02:00Xuan-Son Nguyenmtmd : rename llava directory to mtmd (#13311)
9195215b91e9377ce23e4ccc92ec3156bf5c7f892a3ae803bfc3d0fc2d0d3e1cce22ee103a30939e1042025-05-05T12:54:44+02:00Xuan-Son Nguyenclip : fix confused naming ffn_up and ffn_down (#13290)
92027aa2595321c4d9cc4086a8e67bdea204b8309b09fdfcdaeddd1ef57c6d041b89cd8fb7048a0f0282025-05-04T23:43:42+02:00Xuan-Son Nguyenmtmd : add C public API (#13184)
92186bd60d3fe4a08b8c9d920e6defbc2412d8035699f2da5871f4bbd205b8a3b952cdc76283218d5952025-05-04T17:05:20+02:00Diego Devesallava/mtmd : fixes to fully support dl backends (#13303)
92293c4e23905987949b714b21ae918ff6bfb55fe368afbd968182909cf93fb15959fc867b6dd3adb532025-05-04T14:16:39+02:00Johannes GäßlerCUDA: fix race condition in MMQ stream-k fixup (#13299)
9238afbd968182909cf93fb15959fc867b6dd3adb538ae5ebcf859b05a2ea3bbd930133a2fe4a89ed3c2025-05-04T13:58:38+02:00Johannes GäßlerCUDA: fix race condition in MMQ ids_dst (#13294)
9243e959f09764a2bb0e64af594eab83f7fb3e08eb236667c8edcded08063ed51c7d57e9e086bbfc9032025-05-04T00:50:37+02:00Johannes Gäßlerimatrix: fix oob writes if src1 is not contiguous (#13286)
92536667c8edcded08063ed51c7d57e9e086bbfc9033bf785f3efa89ed28294fbf73054558a2b034bfb2025-05-03T20:07:54+02:00Xuan-Son Nguyenclip : revert the change of BOI/EOI token for GLM-edge (⚠️ breaking change) (#13259)
926b34443923cad751483cc53af2e680d595daadce7a75cb30dc9e63488c3614e2d5a9fe2306eaf47cd2025-05-02T20:54:30+03:00Georgi Gerganovsync : ggml (#13268)
927a75cb30dc9e63488c3614e2d5a9fe2306eaf47cd3f3769ba76061a511f02f2a48da2ad2d93fce5112025-05-02T20:54:13+03:00Georgi Gerganovcontext : fix reorder logic (#13267)
9283f3769ba76061a511f02f2a48da2ad2d93fce5112f567611c0234bbca0a4009762acb47b568660952025-05-02T22:23:12+05:30shalinib-ibmggml : Enable MMA for BF16 in llamafile_sgemm (#13148)
929074e42ab31de4c99aa7d9d2d239660f64b2380d6c642bc014c105728ce45015813351dc5a37f60a22025-05-02T17:17:15+02:00Xuan-Son Nguyenconvert : converting mmproj for Qwen2/2.5VL from convert_hf_to_gguf (#13209)
930c642bc014c105728ce45015813351dc5a37f60a2cb06a3c363f50cd35113984fe8fb164aea4190772025-05-02T17:48:36+03:00Georgi Gerganovkv-cache : separate recurrent vs non-recurrent impl (#12799)
9312af6880178b4bc2c0eced726bab68b4bf333042be84773ab604fe0d935d03741df003716398dc57b2025-05-02T17:06:09+08:00piDackllama-chat : reset glmedge chat template (#13253)
932e84773ab604fe0d935d03741df003716398dc57bfab647e8842c5f80da7e8f2c625dab6a0e19e5d42025-05-02T14:20:27+06:00Shakil Ahmedmtmd-cli : fix out_of_range when input image path is empty (#13244)
933d24d5928086471063fa9d9fd45aca710fd1336ae8efbdadc616fa717c369059b9b388160958d886c2025-05-01T19:06:39-03:00bandotici: fix cross-compile sync issues (#12804)
934f057808ffadce213f54c1884ab5096e60140f358d7a14c42a1883a34a6553cbfe30da1e1b84dfd6a2025-05-01T13:46:10-07:00Jesse Grossggml: Don't assert fail when tensor data changes (#13222)
935d7a14c42a1883a34a6553cbfe30da1e1b84dfd6ab6e4ff69b8abd509647b531bd5b4e86950204f662025-05-01T21:48:08+02:00Diego Devesabuild : fix build info on windows (#13239)
93679f26e9e125b21760aeb016f34bfd42a93f48351fc727bcdd5a311c7c69a76dbf87f4784e828c7b42025-05-01T13:49:39-05:00Jeff Bolzvulkan: Add bfloat16 support (#12554)
93799881f77d82efda80b21057d84f1cc2df2f1e0f6b5769d92b4510c77691ad9e3f8b643c2ba202e532025-05-01T10:05:24+02:00Daniel Beveniuswhisper : add check that target name exists (whisper/3103)
938b5769d92b4510c77691ad9e3f8b643c2ba202e538936784f7a1ec4f91637d04b77fdc90ec36ebac92025-04-29T15:47:55+02:00Daniel Beveniusggml : suppress Windows compiler warnings (whisper/3075)
9398936784f7a1ec4f91637d04b77fdc90ec36ebac913c9a3319b65469e883c49dd1c478abedc4101572025-05-01T17:05:42+02:00Xuan-Son Nguyenmtmd : add **vision** support for Mistral Small 3.1 (#13231)
940a70183eb0079fdf6ebeaed12966338a039461b5d8d33d740c308fe0049515668aac0e561269afe9e2025-05-01T03:09:41-04:00Jared Van Bortelllama-model : fix the reported size class for nomic-embed-text-v2-moe (#13223)
9414254bb49518e0f920f14c9aadd96eefdfd38b4299998540149a490200894acfe595e9a1546bab7232025-04-30T15:20:40+02:00Diego Devesaggml : fix ggml_gallocr_ptr type (ggml/1205)
9429998540149a490200894acfe595e9a1546bab723e1e8e0991ffd9e99a445c6812bb519d5bac9f4b52025-04-24T18:59:06+03:00Georgi Gerganovcuda : fix unused variable compile warning (whisper/0)
9436f67cf1f480926391ad75ff746e0a021214bf70c16a457facd996915652f6274384c87602b27d21a2025-04-30T22:29:15+02:00Xuan-Son Nguyenarg : -hf do not fail if url mismatch (#13219)
94416a457facd996915652f6274384c87602b27d21a3e168bede4d27b35656ab8026015b87659ecbec22025-04-30T15:28:43-05:00ddh0fix typo: `n_ctx_pre_seq` -> `n_ctx_per_seq` (#13221)
9453e168bede4d27b35656ab8026015b87659ecbec2ceda28ef8e310a8dee60bf275077a3eedae8e36c2025-04-30T16:56:24+02:00Xuan-Son Nguyenconvert : improve model arch handling (#13122)
946e5007a5edf2692ef7151a81a61ce2716b83374e5416313773b53585fddcafbcb914cbbfbaeb94b1f2025-04-30T07:38:37-05:00Jeff Bolzvulkan: use uint array index to avoid glslang bug (#13193)
947416313773b53585fddcafbcb914cbbfbaeb94b1f07c2e2f76cce9a61c110b6995fbb90ccea2c3aaa2025-04-30T16:47:08+05:30shalinib-ibmggml : fix ppc64le build (#13176)
948a0f7016d170ca4bfe24d9a9f26c024d034af69f219e899ce21a7c9ffcf8bb2b22269a75f6e078f8f2025-04-30T14:29:22+08:00xiaofeirpc : fix cache directory initialization (#13188)
949e2e1ddb93a01ce282e304431b37e60b3cddb6114d9d398f84f96d16c308d4976f5e90222ecc2a4922025-04-29T20:33:10+02:00matteoserver : Prefilling assistant message in openai compatible API (#13174)
9505a6398011704c31178d7b774be67856ba57647c8cdf76586b23c67abd3ca064ee2c084c57ae240bd2025-04-29T16:24:36+01:00Alberto Cabrera Pérezllama-bench: fixed size of fields to correctly map to values (#13183)
951cdf76586b23c67abd3ca064ee2c084c57ae240bd7d3af70b089bb349b5d17eb01839224c99ec19522025-04-29T16:00:27+02:00Johannes GäßlerCUDA: fix non-cont. inputs for batched mat mul (#13155)
952b6ce7430b7eb51f032152316880204e0a9c0470e5f5e39e1ba5dbea814e41f2a15e035d749a520bc2025-04-29T08:45:49+02:00Xuan-Son Nguyenllama-graph : fix text position for mrope (#13159)
9535f5e39e1ba5dbea814e41f2a15e035d749a520bceaea3253244dc4bbe07f6cd81325847ccc6cf93e2025-04-28T15:52:15-04:00ATmodel : Nomic Embed Text V2 with Mixture-of-Experts (MoE) architecture (#12466)
954eaea3253244dc4bbe07f6cd81325847ccc6cf93e43ddab6eeeaab5a04fe5a364af0bafb0e4d350652025-04-28T21:23:19+02:00Xuan-Son Nguyenclip : fix model size display (#13153)
95543ddab6eeeaab5a04fe5a364af0bafb0e4d350651831f538f720d1d99fba146f24f0a8e970838cc42025-04-28T21:00:20+03:00Ville Vesilehtofix(rpc): Improve input validation and error handling (#13069)
9561831f538f720d1d99fba146f24f0a8e970838cc44e87962e34a4b257ec374c4baf6b1568554b81a92025-04-28T20:20:39+05:30Vishal Agarwalllama-bench: add `-d` depth arg (#13096)
9574e87962e34a4b257ec374c4baf6b1568554b81a9fb0471d1753824e75474c24f82fbdd54c94dceda2025-04-28T16:12:56+02:00Xuan-Son Nguyenmtmd : fix glm-edge redundant token count (#13139)
9585fa9e63be82225fb3249c76f39ddda3e5bdec0a3a4c340f974f9b7ac0c1aae897aabaa54549a97e52025-04-28T12:18:59+02:00Xuan-Son Nguyenclip : refactor set input for cgraph + fix qwen2.5vl input (#13136)
95943f2b07193cbcccd266734320ea9b948f5a01926e5d6c2554e7597665e26991a93fa2f3d16c79ad52025-04-28T11:57:19+03:00Georgi Gerganovcommon : fix noreturn compile warning (#13151)
960e5d6c2554e7597665e26991a93fa2f3d16c79ad5f0dd6a1926cdb2f4183a937deee40db26ef8f1da2025-04-28T10:11:58+02:00Xuan-Son Nguyenllama-chat : fix typo GML --> GLM (#13143)
961f0dd6a1926cdb2f4183a937deee40db26ef8f1da69699be48a6b94570773532850667f1591dc5bbe2025-04-28T15:33:28+08:00R0CKSTARmusa: fix typo in cc control (#13144)
96269699be48a6b94570773532850667f1591dc5bbe85f36e5e7173eef7c671c778db44c034e1d0ab192025-04-28T09:29:26+02:00Johannes GäßlerCUDA: fix q_nope_absorbed prec for DS 2 Lite f16 (#13137)
96385f36e5e7173eef7c671c778db44c034e1d0ab19c0a97b762e5ec767dc414f0dc4979befd4c09a522025-04-28T07:16:59+02:00Xuan-Son Nguyenarg : fix unused variable (#13142)
964c0a97b762e5ec767dc414f0dc4979befd4c09a52ced44be34290fab450f8344efa047d8a08e723b42025-04-27T14:48:26-07:004onenllama-bench : Add `--override-tensors` arg (#12922)
965ced44be34290fab450f8344efa047d8a08e723b4e291450b7602d7a36239e4ceeece37625f8383732025-04-27T21:57:32+02:00matteollama-chat : fix wrong template in GLM4-0414 (#13140)
966e291450b7602d7a36239e4ceeece37625f83837359e991c23cc44cb5fb657e7b9358cac21fb798282025-04-27T19:22:49+08:00R0CKSTARmusa: fix build warning (#13129)
96759e991c23cc44cb5fb657e7b9358cac21fb79828ca2bb89eac2097ab4620448737e58af8452e444b2025-04-27T18:43:37+08:00LostRuins ConcedoFixes Qwen2.5VL segfault during inference with https://github.com/ggml-org/llama.cpp/pull/12402 as has_qwen2vl_merger migration was incomplete (#13133)
968ca2bb89eac2097ab4620448737e58af8452e444b2d451c80590b9ac250322769ac13d3b4870dbcf72025-04-27T16:10:34+08:00HimariOclip : Add Qwen2.5VL support (#12402)
969295354ea6848a77bdee204ee1c971d9b92ffcca9558a764713468f26f5a163d25a22100c9a04a48f2025-04-25T19:40:11+02:00Diego Devesallama : fix K-shift with quantized K and BLAS backend (#13113)
970558a764713468f26f5a163d25a22100c9a04a48fedb18b6e8f5ea6509ad43057f8bb98fc557dbc4e2025-04-25T14:38:34+02:00CityForce FP32 compute in GLM4 FFN Down (#13101)
971edb18b6e8f5ea6509ad43057f8bb98fc557dbc4e514c45608f93f66106a712dee1abe062099ce7902025-04-25T14:31:42+02:00Xuan-Son Nguyenclip : fix pixtral on some GPU backends (#13097)
972514c45608f93f66106a712dee1abe062099ce790553a5c3a9fdf771be2101bc3529937963f8174572025-04-25T17:37:51+08:00Neo Zhang Jianyuchange the reorder tensor from init to execute OP (#13003)
973553a5c3a9fdf771be2101bc3529937963f81745713be08daf992c89d5169518229b3740041c0f4192025-04-25T10:08:08+03:00Radoslav Gerganovrpc : do not wait for response when sending RPC_CMD_SET_TENSOR (#12943)
974226251ed56b85190e18a1cca963c45b888f4953c87616f0680947800ecba3e9f6bc6e101943bf8e62025-04-24T22:29:22+03:00Georgi Gerganovembeddings : fix batch sizes (#13076)
97587616f0680947800ecba3e9f6bc6e101943bf8e663b4911494afe04778c61b9c19019341d71c99fc2025-04-24T17:22:27+03:00Georgi Gerganovggml : fix trailing whitespaces (#0)
976c6e8cc28c15166dba15629dba6a7366d4d5955cab10d8bfdb1dac40cce34e8860ca5ec7d950c3a442025-04-17T14:16:45+02:00Aclyggml : Depthwise 2D convolution (ggml/1152)
97780982e815e67bae2442237f4e11466f44c9a29887604a7d6b80e78eef8f275fc700d0f64820d672f2025-04-24T12:14:13+02:00Xuan-Son Nguyenarg : clean up handling --mmproj with -hf (#13082)
9787604a7d6b80e78eef8f275fc700d0f64820d672fb3b6d862cfdf190e1b9ad961639a25f5ebc0c7e32025-04-24T10:38:30+03:00Georgi Gerganovmetal : fix floating-point range of attention scores in FA kernels (#13090)
979ecda2ec4b347031a9b8a89ee2efc664ce63f599ceb1776b15a32d832f1266deeeab75b9d255c58492025-04-23T20:21:59+02:00Xuan-Son Nguyenmtmd : Support Pixtral 12B (#13065)
980658987cfc9d752dca7758987390d5fb1a7a0a54adc39a5e7a84815a90fa0c515ed8927870cf858c92025-04-22T21:27:40+02:00Johannes GäßlerCUDA: noncont MMVQ + batched bs1 MUL_MAT_ID (#13014)
981dc39a5e7a84815a90fa0c515ed8927870cf858c9ab47dec3d37aa1927c2ec590e166b76141374ed32025-04-22T16:24:54+02:00Xuan-Son Nguyenmtmd : support SmolVLM (version 1 and 2) (#13050)
9827b53389c24a507564be39e1ea82746a39749059b243453533e029334181dda50d911d5fc5a2b24862025-04-22T16:15:51+03:00Georgi Gerganovmetal : add memory pool for temp allocs (#12850)
983243453533e029334181dda50d911d5fc5a2b24861d735c0b4fa0551c51c2f4ac888dd9a01f4479852025-04-22T10:37:00+02:00Xuan-Son Nguyenllava : update documentations (#13055)
9842016f07bd106c73699ecbaace80f55db5ed95dac6602304814e679cc8c162bb760a034aceb4f89652025-04-20T23:29:36+02:00Xuan-Son Nguyenconvert : experimental support for `--mmproj` flag (#13023)
9856602304814e679cc8c162bb760a034aceb4f896566168204be9559dc841f06f0025f3da01d9a85462025-04-20T03:15:41-07:00Jeffrey Morganllava: fix errors in clip.h on certain compilers (#13030)
986fb28f4f80efb5a2990a6a240433b02e259b0dbb137b9f0d29d7301dd0ec5dfae8f357ccee96325d72025-04-19T16:26:38+02:00Sigbjørn Skjæretgguf-py : fix upload python package workflow (#13020)
9876408210082cc0a61b992b487be7e2ff2efbb9e36aff9d107b066c9d464f7ab1324280acfdcebf5692025-04-18T16:02:55-04:00Daniel Tangmain : Fix Ctrl+D/newline handling (#12951)
98835370ba94593c3abc9550328377d461fc4f822b78d6600576318dfc6b091fca744b0fd36a5e5255f2025-04-18T19:58:12+02:00Xuan-Son Nguyenserver : use std::move whenever possible (#12936)
9898d6600576318dfc6b091fca744b0fd36a5e5255fb9154ecff93ff54dc554411eb844a2a654be49f22025-04-18T19:27:56+05:30Akarshan BiswasSYCL: Refactor and enable FP16 in binary broadcast OPs (#12975)
990b9154ecff93ff54dc554411eb844a2a654be49f22db9ba1464f3de0aceb2b5289963e69fc369cb662025-04-18T10:04:51+02:00Xuan-Son Nguyenmtmd : add methods to access `mtmd_image_tokens` (#12906)
9912db9ba1464f3de0aceb2b5289963e69fc369cb662f74c354c0f752ed9aabf7d3a350e6edebd7e7442025-04-18T10:13:42+03:00Radoslav Gerganovrpc : add RPC_CMD_HELLO (#12955)
9927a395f67a7a02bb361d944b816d6e933889e28e1971f245b3b5f3f55991bb779cb541b00f82eea1d2025-04-17T20:34:16+08:00hipuddingCANN: Add support for async operator submission (#12864)
993971f245b3b5f3f55991bb779cb541b00f82eea1d12b17501e6015ffe568ac54fdf08e6580833bf1b2025-04-17T01:37:05-07:00Mikko Juolallama : recognize IBM Granite 3.3 FIM tokens (#12988)
99412b17501e6015ffe568ac54fdf08e6580833bf1b015022bb53387baa8b23817ac03743705c7d472b2025-04-17T06:25:57+09:00kimminsuopencl: fix incorrect local_size index in profiling log (#12868)
99580f19b41869728eeb6a26569957b92a773a2b2c6f8f820cc4dc37032d5375972ba904ce53043445d2025-04-15T12:26:00-07:00lhezopencl: split `ggml-opencl.cl` into multiple files and cleanup (#12886)
99654a72720432810c89c2693f34908b60b88da1e4684778e97703740d8ac5fb64e14d83b80eafa0f3c2025-04-15T19:08:55+08:00hipuddingCANN: Add x86 build ci (#12950)
997daa422881a0ec7944771bcc8ff8de34d11f5bd3beccc7a1602f0752507de4aaad1008b9618a282c82025-04-15T07:49:57+01:00Juk Armstrongllama : DeepSeek V2/V3 MLA implementation (#12801)
998eccc7a1602f0752507de4aaad1008b9618a282c80019279bb56f028e4eee19b59b19750736c719f72025-04-15T11:52:36+05:30Srihari-mcwggml : Add AVX512 implementation of GEMM - Q4_Kx8 (#12829)
9990019279bb56f028e4eee19b59b19750736c719f7b0c75ac9f93322b45e3766e149417334b4fd1ed92025-04-15T10:09:35+08:00Chenguang LiCANN: Opt ROPE optimization (#12865)
1000b0c75ac9f93322b45e3766e149417334b4fd1ed9d6d2c2ab8c8865784ba9fef37f2b2de3f2134d332025-04-15T10:04:24+08:00Xinpeng DouCANN: Optimize CANN buffer pool memory management (#12875)
100175afa0ae31f0a51aaadcc5ff146eb7a32a7f9088c772d549264c1be058411312a54049e0dc86a0372025-04-14T17:53:53+05:30Akarshan BiswasSYCL: Fix im2col (#12910)
1002a25355e2643b1feb2fcbbc4c00312aa86370d858e959d32b1c16c02c0bc0bcdc7bc3f7077bc32f992025-04-11T12:14:19+05:30cmdr2cpu: fix cpu backend's supports-op for GET_ROWS_BACK. fixes a fatal when running test-backend-ops with only the CPU backend (ggml/1190)
1003307bfa253dea07c9270e78fa53b133504e9c3c9d71e90e8813f90097701e62f7fce137d96ddf41e22025-04-13T22:12:21+01:00Alan Grayggml: disable CUDA graphs for unsupported DUP and CONT node types (#12891)
100471e90e8813f90097701e62f7fce137d96ddf41e2bc091a4dc585af25c438c8473285a8cfec5c76952025-04-13T19:29:28+01:00Ed Addarioquantize: Handle user-defined quantization levels for additional tensors (#12511)
1005e59ea539b83d2c7947c99bd350549364dbba450cc94085df2871d2cad11f6411304d7798d7dd4cdd2025-04-12T01:29:03-04:00Matt Claytonllava: Fix cpu-only clip image encoding sefault (#12907)
1006b6930ebc421e20399663bbd3bc7b7266d5236d0668b08f36d047bfa048ebd7d16262c53bf9ece7012025-04-11T12:47:52-07:00Olivier Chafik`tool-call`: fix non-tool-calling grammar crashes w/ Qwen / Hermes 2 templates (#12900)
1007b2034c2b55b36b2192bdefb3b295db2a911370f506bb53ad9b6e6d92b6ab6979927530080b1c990c2025-04-11T20:01:56+08:00tastelikefeetcontrib: support modelscope community (#12664)
100806bb53ad9b6e6d92b6ab6979927530080b1c990c0c509239445088f21265580b86733c5b184261d92025-04-11T18:10:10+08:00Yuxuan Zhangllama-model : add Glm4Model implementation for GLM-4-0414 (#12867)
10090c509239445088f21265580b86733c5b184261d9fccf9cae83e6c6cd31a0ecb403d237638e427d0a2025-04-11T12:09:39+02:00Xuan-Son Nguyenclip : use smart pointer (⚠️ breaking change) (#12869)
1010ec6c09d0fac1f2699c3ea1994e10482cb4b95e0f8ac9f5d765f2b1b7f821873618c0cff68ca59bc82025-04-11T00:49:09-07:00Daniel Hanconvert : Llama4 RoPE fix (#12889)
101112e9158f25cb47e97ca9b8083e1ec7415f2622605b1f13cb64dbb0de7e95dae86725928d350c188c2025-04-11T09:24:34+02:00Daniel Beveniusxcf : add check for visionos build version (#12854)
10120fed24c34787d2aa916ed204db88889591ad6e5547ba87d0a4f91eb181ea60f8a7fc2539b123aeaf2025-04-11T13:20:07+08:00Aaron Teoggml: fix compilation error s390x (#12848)
10131d2b613445bab6b179296aa63c8ee346fb947cc4eb420e11484ef32cc1abedb2a26ecef1bbf1e31b2025-04-11T00:04:25+03:00Georgi Gerganovtests : fix init order (#0)
1014cb79c2e7fa28e874694c14598c1fd2fde82263e1fe92821ea9ae53f3088cf2699a9e102448295fa02025-04-10T17:53:08+05:30cmdr2ggml: don't include arm_neon.h when using CUDA 12 with ARM Neon (ggml/1187)
1015e4bf72d631434b38656cb97e2411826d900433e88b9cc7cdd8a0dcf0176c60c755322c95b59652992025-04-10T23:59:01+03:00Georgi Gerganovscripts : fix sync-ggml-am.sh
10168b9cc7cdd8a0dcf0176c60c755322c95b596529964eda5deb9859e87a020e56bab5d2f9ca956f1de2025-04-10T22:57:16+02:00Xuan-Son Nguyenllava : introduce libmtmd (#12849)
101764eda5deb9859e87a020e56bab5d2f9ca956f1defe5b78c89670b2f37ecb216306bed3e677b49d9f2025-04-10T17:24:44+02:00Xuan-Son Nguyenconvert : ability to lazy-load safetensors remotely without downloading to disk (#12820)
101811d07e1e69138b46375e9267b31acd58e3813577b0091ecc1e5c0f689be856fade3803a534f35c9f2025-04-10T04:48:01+05:30Prajwal B MehendarkarFixes #12823 (#12830)
101931f7803bc4e7c0dcc279ee04c2ecfb76b2afdd3e2391506ace6abb56186def40c7107fdfa694ed552025-04-09T23:00:34ZPiotr Kubajggml-cpu-impl.h: do not redefine bool on POWER9 (#12856)
10202391506ace6abb56186def40c7107fdfa694ed55d3bd7193ba66c15963fd1c59448f22019a8caf6e2025-04-09T23:00:25ZPiotr Kubajggml-impl.h: fix build on POWER9 (#12855)
1021d3bd7193ba66c15963fd1c59448f22019a8caf6ed9a63b2f2e91cdcb0eda211b7f49fadcdea0f6642025-04-09T17:47:36+08:00Bo Zhengllama : Support Qwen3 and Qwen3MoE (#12828)
1022381603a77504ad1788965f694094540c1bed9ea265a69e6e1b6d55cd5f78f8bcdfaba8a8c59a8d962025-04-09T11:11:11+03:00Plamen Minevci: detach common from the library (#12827)
10230090950f679475c5ecaac2f7bca5049cca96492b7ecd780b1a1d5214b8d04c25ebfc194d310816ed2025-04-09T00:25:08-05:00Jeff Bolzvulkan: In coopmat2 mmq, load q4_k/q5_k scales through shared memory (#12833)
1024a19b5cef16d885c44c635da4a5c97113c1577de878a1ba0a4f2bfed5b8b8e312592143d22e5316982025-04-08T19:54:51+03:00Georgi Gerganovllama : fix FA when KV cache is not used (i.e. embeddings) (#12825)
102578a1ba0a4f2bfed5b8b8e312592143d22e5316982dabf759e7c8c827d38cdd18d0792070e6a4f4e12025-04-08T18:37:06+02:00Xuan-Son Nguyenserver : fix thread.join() on exit (#12831)
1026a226bc7a9ac50551f9f113808de0f0046837f1881466621e738779eefe1bb672e17dc55d63d166bb2025-04-08T03:03:07-04:00compiladegguf-py : support lazy tensor splitting (#12809)
10271466621e738779eefe1bb672e17dc55d63d166bb82974011f312057b446c27267105bd7ad38105992025-04-07T23:06:44+02:00Xuan-Son Nguyenllama : Support llama 4 text-only (#12791)
10281a1ab7e7a4a9b6e6440c1d9965d2b9d1b7e7dafba4e46e28f99d7f64f38d8328cdb6bee5a3a1cd032025-04-07T13:18:07+03:00Georgi Gerganovcuda : fix HIP and MUSA BF16 (#0)
102936ca8b362885e4b4984d72e348ba403568864a95995083e4ed24933e6a289472f9de0f0b53ca5eca2025-04-04T21:05:12+02:00Sigbjørn SkjæretCUDA: don't convert BF16 weights to FP32 (ggml/1174)
1030995083e4ed24933e6a289472f9de0f0b53ca5eca518a01480eb3a7c80a4951b430db9dee554283102025-04-02T17:46:16+05:30cmdr2cpu: move all the operators into a separate c++ file (except mul_mat) (ggml/1167)
1031bd3f59f81289b920bcc597a208c14f55e39ed37e52b3d71f128c1eeab39b918adf1f7a8f5e2566192025-04-07T13:35:19+02:00Xuan-Son Nguyencmake : enable curl by default (#12761)
103252b3d71f128c1eeab39b918adf1f7a8f5e256619d0d5b2232b3826cac2c6e62d0244a474ba79860f2025-04-07T19:34:14+08:00zhouwgCANN: fix typo in ggml-cann (#12733)
1033d0d5b2232b3826cac2c6e62d0244a474ba79860f916c83bfe7f8b08ada609c3b8e583cf5301e594b2025-04-07T17:10:36+08:00hipuddingCANN: Refactor to reduce duplicate code (#12731)
1034916c83bfe7f8b08ada609c3b8e583cf5301e594b0c74b04376b0b9efc096480fe10f866afc8d7c1c2025-04-06T21:23:54+08:00R0CKSTARmusa: fix compilation warnings in mp_22/31 (#12780)
10350c74b04376b0b9efc096480fe10f866afc8d7c1c80b717d493a9a5bae7167ad2384c12c60bb2ef202025-04-06T04:03:47-05:00Jeff Bolzvulkan: fix NaN issue in flash attention shader (#12776)
1036f1e3eb4249db68d97be352c0adf16eef7ae537950364178ca2452bd241a4cdd4350d0d7a6ff8c4b42025-04-05T23:46:00+08:00Sergey Fedorovcommon : fix includes in arg.cpp and gemma3-cli.cpp (#12766)
10370364178ca2452bd241a4cdd4350d0d7a6ff8c4b4c6ff5d2a8da2587cc78c9ede9171dfc3f076c7572025-04-05T17:17:40+02:00Xuan-Son Nguyenclip : refactor clip_init, add tests (#12757)
10387a84777f42a9b3ba47db5d20b7662f8ddf92f6523e1d29348b5d77269f6931500dd1c1a729d429c82025-04-04T13:16:39-07:00Olivier Chafiksync: minja (#12739)
10393e1d29348b5d77269f6931500dd1c1a729d429c81be76e4620ddc99b3cbff0f206436117ae5610472025-04-04T21:48:10+03:00Georgi Gerganovkv-cache : simplify + fix warning for recurrent models (#12756)
1040b7723942970b70412793f1926a35cfb93d5c157c23106f94ea2bc3da929afb7330655fd5515d08dc2025-04-04T09:09:52-05:00Nauful Shaikhserver : webui : Upgrade daisyui, tailwindcss. (#12735)
10419ac4d611d05b03f961e627f4f399e4377bdb4ad3348888e0dc469a476f9e9eccb394893c513daab82025-04-04T15:12:40+02:00Ronny Brendelcmake: fix ggml-shaders-gen compiler paths containing spaces (#12747)
104274d4f5b041ad837153b0e90fc864b8290e01d8d535e592eb30832187412360912ab8f2f5b7984df12025-04-04T00:54:35-05:00Jeff Bolzvulkan: Hybrid waitForFences/getFenceStatus to reduce fence latency (#12630)
10437d7b1bafa7980603a61cb102879fe38a33f66c08c262beddf29f3f3be5bbbf167b56029a198769562025-04-03T22:18:17-07:00lhezopencl: update doc for OpenCL (#12702)
10441c059995e080e37aeaacaae35850fc4c044b9dbe2004644b7a5da6fe080e51861ab583480280f1d32025-04-03T10:08:26-05:00Jeff Bolzvulkan: Fix missing cmake logic for dot product extension (#12721)
1045193c3e03a63ccda3ac3d6a2999e41e6d1414fe2365cfe136a0793b2fdf5af8bdb1ab2cf10c3e1d2e2025-04-03T15:32:55+08:00a3shfix MUSA compiler warning (#12704)
10463f9da22c2b21a2cef216de50006436ef1cab87642a0dc97e56eac6db0a4016f0b45da6d0a0055ef22025-04-03T02:31:15+01:00Alan GraySimplify and improve CUDA graphs through use of indirect copy pointers (#9017)
10472a0dc97e56eac6db0a4016f0b45da6d0a0055ef297a20c012be2f9bfbeee0209405a31001f93ccf92025-04-03T08:49:51+08:00hipuddingCANN: Fix failed test cases (#12708)
1048be0a0f8cae039e2286f757612accebfb8f21b36e92e3006bb69dfeb656ccf5c7c1c1efadb03c88c22025-04-02T12:40:32-05:00Jeff Bolzvulkan: Implement grouped query attention in the coopmat2 FA shader (#12559)
104992e3006bb69dfeb656ccf5c7c1c1efadb03c88c2833e2b7409211a07df97716998c50025266426522025-04-02T19:12:30+02:000cc4mVulkan: Fix mmq int dot float cache size (#12722)
1050833e2b7409211a07df97716998c5002526642652e0e912f49b3195ef9d0c51378629ba03c9b972da2025-04-02T16:38:54+03:00Georgi Gerganovmodel : print tensor size during load (#12711)
1051e0e912f49b3195ef9d0c51378629ba03c9b972daa10b36c91a091f4606710fba4e9327fd71e0e7382025-04-02T14:52:01+02:00Diego Devesallama : add option to override model tensor buffers (#11397)
1052a10b36c91a091f4606710fba4e9327fd71e0e73883a88bd6affbe148a622ac730952ac5b8b5859792025-04-02T14:32:59+03:00Georgi Gerganovllama : refactor kv cache guard (#12695)
105383a88bd6affbe148a622ac730952ac5b8b58597942eb248f46e1175349e553b6eda6cb63027d74d12025-04-02T11:21:48+02:00Sigbjørn Skjæretvocab : BailingMoE : change possessive quantifiers to greedy (#12677)
105442eb248f46e1175349e553b6eda6cb63027d74d19bacd6b37461608385360fd64326c13247ccf18e2025-04-02T09:58:34+02:00Xuan-Son Nguyencommon : remove json.hpp from common.cpp (#12697)
1055267c1399f15a278ec8c3cdcf9c90dc94151fbc38f423981ac806bf031d83784bcb47d2721bc70f972025-04-01T23:44:05+02:00Xuan-Son Nguyencommon : refactor downloading system, handle mmproj with -hf option (#12694)
1056f423981ac806bf031d83784bcb47d2721bc70f97e39e727e9a3daec7082b9c59540a429ad85914af2025-04-02T01:54:34+09:00Junil Kimopencl : fix memory allocation size (#12649)
10575936a616e46cffad4579ccaff8f8fa315809da4c3fd072a54001a908c54e81fd2e82b682ecfdd4752025-04-01T14:37:13+02:00Sigbjørn Skjæretconvert : BailingMoE : fix qkv split when head_dim is 0 (#12687)
10583fd072a54001a908c54e81fd2e82b682ecfdd475a6f32f0b3437ac79827ffb55521cb839343324ab2025-04-01T14:57:19+03:00Georgi Gerganovmetal : use F32 prec in FA kernels (#12688)
1059a6f32f0b3437ac79827ffb55521cb839343324ab2bb3597e426ce092c3e10ae0bdd876963765e6ed2025-04-01T19:12:53+08:00R0CKSTARFix clang warning in gguf_check_reserved_keys (#12686)
10602bb3597e426ce092c3e10ae0bdd876963765e6ed82939705421f4ef27e924879fdeed6d7b5f6d7692025-04-01T06:38:07-03:00Wagner Brunavulkan: fix build when glslc doesn't support coopmat (#12683)
106182939705421f4ef27e924879fdeed6d7b5f6d7698bbf26083d93274240a20d16cda324441c57fcc62025-04-01T10:24:29+02:00Romain BiessySYCL: Rename oneMKL to oneMath (#12192)
1062c80a7759dab10657b9b6c3e87eef988a133b9b6a250d7953e829ff0e16074510fef0e7cec696461b2025-03-31T18:40:56+02:00Daniel Beveniusvocab : add special infill tokens for CodeLlama (#11850)
1063a8a1f3356786cbf8bcc3422e3c8737fc33b453e71790e7315726ceda256ea91eaa66fc36b63f60672025-03-31T14:37:01+02:000cc4mVulkan: Add DP4A MMQ and Q8_1 quantization shader (#12135)
10641790e7315726ceda256ea91eaa66fc36b63f60670114a32da0adc21dc04f05278cd8e3f67ba5f8c72025-03-31T15:05:30+03:00Georgi Gerganovcmake : fix whitespace (#0)
10651a859490670c271e8e992c83cb11459ea0c3580c6c02a032fa21d69e881ef9a5c94ba28ebaf1d7492025-03-31T11:28:30+02:00Sigbjørn Skjæretllava : proper description fix (#12668)
10666c02a032fa21d69e881ef9a5c94ba28ebaf1d749f52d59d771dc231fc2ac39adacf157ddefc977302025-03-31T14:55:24+05:30Akarshan BiswasSYCL: Remove misleading ggml_sycl_op_flatten function (#12387)
1067f52d59d771dc231fc2ac39adacf157ddefc9773052de2e594979be52f0da92601747aa44a13e50e42025-03-31T11:07:07+02:00Sigbjørn Skjæretllava : fix clip loading GGUFs with missing description (#12660)
10684663bd353c61c1136cd8a97b9908755e4ab30cecb3de7cac732e7dc0e10e1bb07502a500b0ee90222025-03-30T22:04:04+03:00Georgi Gerganovmetal : use constexpr in FA kernels + fix typedef (#12659)
10697242dd96756472f90ba41db4e5ebb3969dfc7e7c492d7f1ff77e116e44962b832cc3db24cfc46d242025-03-30T21:12:03+03:00Sergei Vorobyovllama-chat : Add Yandex instruct model template support (#12621)
1070492d7f1ff77e116e44962b832cc3db24cfc46d24d3f1f0acfbf8aaafd2ce494309a10a7cc92042c82025-03-30T16:59:38+08:00R0CKSTARmusa: fix all warnings, re-enable `-DLLAMA_FATAL_WARNINGS=ON` in ci and update doc (#12611)
1071a62d7fa7a979d21bcd760f1d7c19a66e55611f44e408d4351a4ad143656672479d8ae1479306ce312025-03-29T11:37:13+05:30cmdr2cpu: de-duplicate some of the operators and refactor (ggml/1144)
1072e408d4351a4ad143656672479d8ae1479306ce313891e183c61c1e25c2c61afe68d7b95019ea3f892025-03-24T09:53:38+01:00Daniel Beveniusggml : add logging for native build options/vars (whisper/2935)
10733891e183c61c1e25c2c61afe68d7b95019ea3f89af6ae1efb27a9a7c3f7f7f84639d2243f7303ac12025-03-20T07:02:18+01:00Daniel Beveniusexamples : command.wasm updates (whisper/2904)
1074af6ae1efb27a9a7c3f7f7f84639d2243f7303ac10bb2919335d00ff0bc79d5015da95c422de51f032025-03-30T00:07:37+01:00Xuan-Son Nguyenllama : fix non-causal mask for gemma 3 (#12615)
10750bb2919335d00ff0bc79d5015da95c422de51f03a69f8463510a70fe0c85701b8c7ede283a0d1a7d2025-03-29T14:07:37+01:00Djip007llama : change cpu_buft_list order: ACCEL -> GPU host -> CPU extra -> CPU (#12632)
1076a69f8463510a70fe0c85701b8c7ede283a0d1a7dd07a0d7a79bafb01fb3b6c8992121e75c57c0c2f2025-03-29T18:04:58+08:00Jaycmake : fix ccache conflict (#12522)
10773714c3ee1a62ed64ac328ec7d699410ad1219150b4ae50810e4304d052e630784c14bde7e79e41322025-03-28T22:13:02+01:00Sigbjørn Skjæretllama : fix incorrect Qwen2Moe ffn_moe_out graph callback (#12631)
1078b4ae50810e4304d052e630784c14bde7e79e4132b86f6007234da4bff51a3ebef2bdb952b52059c62025-03-28T20:21:59+02:00Georgi Gerganovmetal : improve FA + improve MoE (#12612)
1079b86f6007234da4bff51a3ebef2bdb952b52059c6dd373dd3bf81eced3e711fb7cb49123a6105933e2025-03-29T01:51:06+08:00Icenowy Zhengvulkan: fix coopmat shader generation when cross-compiling (#12272)
1080dd373dd3bf81eced3e711fb7cb49123a6105933e5d01670266859444366e4f333ade5e0e5e2ae63d2025-03-28T18:08:52+01:00Johannes Gäßlerllama: fix error on bad grammar (#12628)
108113731766db91ec927c1b61bf502ac7a9be2b11b9ab6ab8f809bd514d88e02a63869b4d619f13fa862025-03-28T13:13:22+05:30amritahs-ibmllamafile : ppc64le GEMV forwarding for FP32. (#12594)
1082ab6ab8f809bd514d88e02a63869b4d619f13fa862099a9d5dbdcd2841d02dd396a71d0de70bf44902025-03-28T08:18:04+02:00Radoslav Gerganovrpc : send hash when tensor data is above some fixed threshold (#12496)
1083f125b8dccff34439a26bf750c9edef358c48c1f8953c2a62cf487e618140f3ea18d94e3b0257af932025-03-27T10:49:15ZSi1wllama : add PLM GGUF Conversion & Inference Support (#12457)
1084771d84371c0785c2554aef9a47cdd551b8c7ceafdf0665a483b08da1c9b55534b624ae4e1fe897672025-03-27T09:22:30+02:00Georgi Gerganovscripts : update sync + fix cmake merge
1085c7b43ab60855f752ae79937fb93d561bc30b69a424feaec05792b972d5ff3e2b12d9237ebd50d1ac2025-03-27T12:21:47+05:30amritahs-ibmllamafile : ppc64le MMA implementation for Q4_0. (#12489)
108624feaec05792b972d5ff3e2b12d9237ebd50d1acf28bc4c286c453cd8385388eea057a404fdb64022025-03-27T14:38:34+08:00xctanggml : riscv: add 128-bit RVV support (#12530)
1087b3298fa47a2d56ae892127ea038942ab1cada1902447ad8a981253a2b8e9f4b31cc8e7fdff83423e2025-03-26T21:38:38+02:00Georgi Gerganovmetal : refactor mat-vec code (#12569)
108802082f1519565fc7b49de211b28bc5404a69209bdf4d20cd53d5bb6fc21c1dc65f026d53b566d0972025-03-26T22:06:04+08:00Ivy233clip: Fix llama-llava-clip-quantize-cli quantization error under CUDA backend (#12566)
1089df4d20cd53d5bb6fc21c1dc65f026d53b566d0975ed38b6852bd509d56acfdae54bceec8ab3cc3962025-03-26T14:21:05+02:00Georgi Gerganovconvert : fix squeeze for ssm_conv tensors (#12573)
10905ed38b6852bd509d56acfdae54bceec8ab3cc396fd7855f8f522ab26681b25ae506ff99c654e2dd52025-03-26T13:02:00+02:00Georgi Gerganovggml : fix MUL_MAT_ID repack with Q8_K (#12544)
1091fd7855f8f522ab26681b25ae506ff99c654e2dd553af4dba425768fd507ce6b45873cfbb3df2295f2025-03-26T15:09:48+08:00R0CKSTARdoc: [MUSA] minor changes (#12583)
109253af4dba425768fd507ce6b45873cfbb3df2295fef19c71769681a0b3dde6bc90911728376e5d2362025-03-25T23:03:10+01:00Sigbjørn Skjæretconvert: fix Mistral3/Gemma3 model hparams init (#12571)
1093053b3f9aae63151732eccf6b7408c6418ba8746ee2f560175a195f63c3276972a3d1caec0bd13e052025-03-25T12:10:18+01:00Dan Johanssonggml-cpu : update KleidiAI to v1.5.0 (#12568)
10942d77d88e70d017cd82c3f1a4517e3102e2028ac4c95fa362b3587d1822558f7e28414521075f254f2025-03-25T09:19:23+02:00Georgi Gerganovcontext : fix worst-case reserve outputs (#12545)
109548d7021c61ceda6fcf1a7294d2115b8e1a53ae953361e2deba0f24942877559b35c430dec68528c32025-03-24T18:28:32+05:30Akarshan BiswasCI: fix SYCL build (#12546)
10967ea75035b67f44c22ed7039967f718011fd35ce5c54f6b7988b63714b87b0390e01a1e69aee79a122025-03-24T18:28:34+08:00R0CKSTARCUDA: Fix clang warnings (#12540)
10979b169a4d4e01af7bc07a6981b53b27c18c9470d877f9c6bbe55fccd9ea567794024cb809439479012025-03-24T01:56:17-05:00Jeff Bolzvulkan: fix mul_mat_vec failure in backend tests (#12529)
1098ba932dfb50cc694645b1a148c72f8c06ee080b17fac63a3d786b2a0f97876c30add02cb525a9648e2025-03-22T16:23:26+02:00Georgi Gerganovggml : fix quantized cpy op (#12310)
10994375415b4abf94fb36a5fd15f233ac0ee23c0bd130c42ef5cbb2db756eff9aadc6b6c528ba68388d2025-03-21T20:34:50+01:00stduhpfVulkan: RTE rounding for cpy to quant (#12480)
110030c42ef5cbb2db756eff9aadc6b6c528ba68388daf04481e6b3b8dcdf5c1cc7d84bc7ece5658e9ab2025-03-21T19:27:47ZEvevulkan: workaround for AMD Windows driver 16 bit unpack8 bug (#12472)
1101ea1518e839abe668c20f7e0074c0721f803da8981aa87ee53d05505247c54612e40f6a38c680b4332025-03-21T10:12:45+01:00marcoStocchillama-tts : avoid crashes related to bad model file paths (#12482)
11021aa87ee53d05505247c54612e40f6a38c680b4339ffcc9e374080f73b16b7a351e6d76e7a8a19ce32025-03-21T14:58:47+08:00蕭澧邦[SYCL] Fix build on Windows when ccache enabled (#9954) (#9976)
11033d82dbcbce2c677fc35fbf99574ccd107d95a1f8732b5fbf5e7f9cf069942f0c5850ee959ef321ba2025-03-20T17:05:34+05:30Srihari-mcwggml : block interleaving support for Q4_K quantization for x86 AVX2 architecture (#12332)
1104517b5ddbf002b91fd6d6daf5d8db8c88a0173039a9b59288e222f39fc0311dc66944ed5a86c815fa2025-03-20T01:22:06+05:30Gaurav GargCUDA: Improve flash decoding kernel GPU occupancy for BS=1 case (#12183)
11050fd8487b142b2b92565bc95b39ddc440955a237c108e53c2f1b57b79c8bcf9773fba5a82e2f1eeb52025-03-19T10:15:23ZGuus WaalsFix visionOS build and add CI (#12415)
1106c446b2edd2a9fe2772a1a18923c3e54a6749c364d84635b1b085d54d6a21924e6171688d6e3dfb462025-03-19T02:26:26-05:00Jeff Bolzvulkan: Submit once enough matmul work has been recorded (#12406)
1107d84635b1b085d54d6a21924e6171688d6e3dfb4675422e8bc42646005be0754f7aa438b97a5e777e2025-03-18T12:54:55-07:00lhezopencl: improve profiling (#12442)
110875422e8bc42646005be0754f7aa438b97a5e777ebb115d2bf7ed2cdd7dccd7ae74cc9cfe4b0adb712025-03-18T21:35:19+02:00Georgi Gerganovgraph : normalize Q, K, V shapes + sync cross attention (#12449)
1109c6af2161b200284d55633cf184a07406ca89908e99aa304fb900654ec338749f64e62895b9a88afd2025-03-18T19:35:11+02:00Georgi Gerganovspeculative : fix seg fault in certain cases (#12454)
11108551c44d840a7db50adb958ccaf464dc3ded82e735cae5ba05a5292dc3108636a71ec59fa2f80ab72025-03-18T13:05:49+02:00Georgi Gerganovcontext : always use non-causal attention for encoder graphs (#12447)
111135cae5ba05a5292dc3108636a71ec59fa2f80ab7810e0af3f50379682dd46b7967c4aadf3f8286f62025-03-18T11:16:31+01:00Łukasz ŚlusarczykSYCL: using graphs is configurable by environment variable and compile option (#12371)
1112810e0af3f50379682dd46b7967c4aadf3f8286f6eba92d64c3f6d86de2e6b4dd3a540d2805a22b0c2025-03-18T12:05:42+02:00Georgi Gerganovserver : fix warmup draft cache type (#12446)
1113eba92d64c3f6d86de2e6b4dd3a540d2805a22b0cd9a14523bb9074eef42d1b43ae4a1e149f81b7e22025-03-18T15:07:33+05:30Prajwal B Mehendarkarcmake : fix PowerPC build (#12241)
1114fd123cfead49eb32e386e26b8ef7a6d41554dda5a53f7f7b8859f3e634415ab03e1e295b9861d7e62025-03-18T07:21:40+01:000cc4mVulkan: Default to 1GB allocations instead of 4GB to avoid fragmentation and driver issues (#12434)
1115a53f7f7b8859f3e634415ab03e1e295b9861d7e67dfad387e3f6ac98d383ded2d175eb59736a39932025-03-18T01:51:25+01:00Łukasz Ślusarczykfixed compilation warnings in ggml-sycl (#12424)
11167dfad387e3f6ac98d383ded2d175eb59736a399360c902926c928f9c2cd6390ce411876f92feeaf32025-03-18T07:27:50+08:00Molly Sophiallama: Add support for RWKV v7 architecture (#12412)
1117b1b132efcba216c873715c483809730bb253f4a101e8f2138b2e40902afe2983ecbf503a08d74b1d2025-03-17T23:55:13+05:30Gaurav Gargcuda : enable CUDA Graph on CUDA Toolkit < 12.x (#12394)
1118cf2270e4d3685ac46f4a166d8718997ba7cbc45af07690c930f74d82d4f108e567c7092544847f772025-03-17T12:42:33+01:00Danielevulkan: subgroup size tuning (#12087)
11198ba95dca2065c0073698afdfcda4c8a8f08bf0d9dc079cfdffa1141a6caf5d41a33d73a1ef03da552025-03-16T18:46:36+01:00Sigbjørn Skjæretllama : fix OLMo-2-0325-32B-Instruct K-norm size (#12400)
1120dc079cfdffa1141a6caf5d41a33d73a1ef03da557b61bcc87cfdeab88350e82df1c4b7be64331ea62025-03-16T19:29:36+02:00Georgi Gerganovcontext : fix init of n_outputs (#12397)
11217b61bcc87cfdeab88350e82df1c4b7be64331ea6f4c3dd5daa3a79f713813cf1aabdc5886071061d2025-03-16T18:22:05+01:00Daniel Beveniusci : add --symlinks to xcframework zip command (#12409)
1122f4c3dd5daa3a79f713813cf1aabdc5886071061d3d35d87b4113648e224b837bb88e6b2c4c7f29e52025-03-15T17:23:11+01:00marcoStocchillama-tts : add '-o' option (#12398)
11239f2250ba722738ec0e6ab684636268a79160c854774973b8f3d5e375b0b74d58638eeb1817e950a82025-03-14T16:41:20ZEric CurtinAdd CLI arg to llama-run to adjust the number of threads used (#12370)
112484d547554123a62e9ac77107cb20e4f6cc503af4be7c3034108473beda214fd1d7c98fd6a7a3bdf52025-03-13T19:08:07+02:00Georgi Gerganovllama : fix Gemma3 SWA KV cache shift (#12373)
1125e0dbec0bc6cd4b6230cda7a6ed1e9dac08d1600b2048b5913d51beab82dfe29955f9008130b936c02025-03-13T12:35:44+02:00Georgi Gerganovllama : refactor llama_context, llama_kv_cache, llm_build_context (#12181)
11262048b5913d51beab82dfe29955f9008130b936c0f08f4b3187b691bb08a8884ed39ebaa94e9567072025-03-13T06:10:05-04:00Ishaan Gandhiserver : fix crash when using verbose output with input tokens that are not in printable range (#12178) (#12338)
112780a02aa8588ef167d616f76f1781b104c245ace0363f8c5d67dcf80e00c39580dfa86dc2774d74c22025-03-12T13:45:32+01:00Daniel Beveniusllama.swiftui : fix xcframework dir in README [no ci] (#12353)
112834c961b181836a4f06ab4c56d5ce61ce03fc478b7841fc723e059d1fd9640e5c0ef19050fcc7c6982025-03-12T10:14:11+01:00uvosCUDA/HIP: Fix fattn-vec-* when device warp size is not 32 (#12315)
11297841fc723e059d1fd9640e5c0ef19050fcc7c698bf69cfe62f9ccc01112c0232a55820b95a8c1fda2025-03-12T09:30:24+01:00Xuan-Son Nguyenllama : Add Gemma 3 support (+ experimental vision capability) (#12343)
1130bf69cfe62f9ccc01112c0232a55820b95a8c1fda10f2e81809bbb69ecfe64fc8b4686285f84b0c072025-03-12T00:59:19-05:00Jeff Bolzvulkan: fix bug in coopmat1 mul_mat_id (#12316)
1131ba7654380a3c7c1b5ae154bea19134a3a9417a1e6ab2e4765a673abcd162258a2671560a76106d692025-03-11T21:25:17+08:00jklincnggml-backend : fix backend search path (#12330)
113296e1280839561aaabb73851f94972a2cd37b2d962c9f833d17bb5b8ea89dec663b072b5420fc54382025-03-11T09:20:16+01:00Xuan-Son Nguyenclip : bring back GPU support (#12322)
11338acdacb3ea00697477eb019efbb6fc183371055c89b2b56e8658800375a8314200870b1ad4208a0b2025-03-10T18:57:00+02:00Henry Linjamäkiopencl: use OpenCL C standard supported by the device (#12221)
1134e128a1bf5b65741b485dd094a4201264d0580d686ef79a67caf1159b0150b44ee80888c7ec98b83f2025-03-10T14:07:15+02:00Georgi Gerganovtests : fix test-quantize-fns to init the CPU backend (#12306)
11356ef79a67caf1159b0150b44ee80888c7ec98b83f4e39a3c332f84b890e91353ec448502cb8373a6f2025-03-10T12:34:13+01:00marcoStocchicommon : refactor '-o' option (#12278)
11362b3a25c212f8c4d8a49cec23e03343a7719d51c98352cdc87b207a735d34c431a36c425728cb45862025-03-10T09:44:42ZOlivier Chafik`sampler`: fixes trigger tokens + lazy grammars (fix typo cast from token to string) (#12291)
11378352cdc87b207a735d34c431a36c425728cb45861e2f78a00450593e2dfa458796fcdd9987300dfc2025-03-10T16:33:24+08:00tc-mbllava : fix bug in minicpm-v code (#11513)
11387c7f3b7f435f41f2508e0e3010f0013cd8335156102ac1891db32c346a7b6b96145a2a23c1e4c3522025-03-07T14:15:27+01:00Daniel Beveniusggml : skip intermediate .air file when compiling .metallib (#12247)
1139ea002810a209246d034d1b6ddac387f7787515888fad3c7a7c54a25a1ca38dfb08244df55288e6752025-03-07T12:19:31+02:00Georgi Gerganovci : fix save-load test invocations (#12245)
11408fad3c7a7c54a25a1ca38dfb08244df55288e6757cf64f6beecf54c6ac71503181f154667fd4228a2025-03-07T11:15:33+01:00Sigbjørn Skjæretserver : Log original chat template parsing error (#12233)
11415e2d57b2b2e43eadbe6d66ba3e873a824b95e725f1648e91cf6c52e9593810aa70857e412d474c092025-03-07T15:35:57+08:00BB-fatmetal : simplify kernel arguments using a struct (#3229) (#12194)
1142f1648e91cf6c52e9593810aa70857e412d474c09d6c95b0740510231b3797b80d6d3440d8fe188b62025-03-07T15:06:08+08:00David HuangHIP: fix rocWMMA build flags under Windows (#12230)
1143d6c95b0740510231b3797b80d6d3440d8fe188b6d76a86d967ef491d530400b08bc8ef8a148079362025-03-07T06:23:16+01:00Daniel Beveniusmetal : fix default.metallib build (#12224)
1144776f9e59cc8a85e840d1d4af8540d199c77190ac3d652bfddfba09022525067e672c3c145c0746492025-03-07T06:58:25+08:00xiaofeicmake : fix undefined reference errors for std::filesystem in ggml (#12092) (#12094)
11455220a16d18563d3ffc509002f0514415fdda40363ffbbd5ce130859be91909e9b77d4c1962a6be2c2025-03-06T18:45:09+01:00Johannes GäßlerCUDA: fix FA logic for PTX 7.0 and CC >= 7.5 (#12222)
114657b6abf85acb1f697913a44e5e105e333d894b7894bb63e4f0f6135579b88e5700ed40cefa374e092025-03-05T22:22:49-08:00Han Yinandroid : fix KV cache log message condition (#12212)
114794bb63e4f0f6135579b88e5700ed40cefa374e09f79243992cd31e4e4844d5158d2f3325b1d2d8112025-03-06T03:33:40+02:00Henry Linjamäkiopencl : fix buffer alignment (#12197)
1148f79243992cd31e4e4844d5158d2f3325b1d2d811ed4ce0dda24986c80d58e2ce112049af00f632f42025-03-06T03:31:14+02:00Henry Linjamäkiopencl : fix `ulong` kernel args were set from `int` variables (#12174)
1149ed4ce0dda24986c80d58e2ce112049af00f632f407d15723470a0a5b15d8ccad1aff5b20354ffbe12025-03-06T09:30:05+08:00simon886212opencl : fix profile-related errors (#12095)
115016e4b22c5e58ee200ede913fd7b7b8ba92132ce8074c4fd39df3af974e10fbee6cc6db5d9304655b2025-03-05T17:16:01+02:00Plamen Minevggml : fix GGMLMetalClass ODR (#12200)
1151074c4fd39df3af974e10fbee6cc6db5d9304655b669912d9a5bf927312c553332ff997f0a99da8fb2025-03-05T14:16:40+01:00Daniel Beveniusci : add fetch-depth to xcframework upload (#12195)
1152669912d9a5bf927312c553332ff997f0a99da8fbfa31c438e0e709242ab7334d26fc3be3dcda07a02025-03-05T13:05:13ZOlivier Chafik`tool-call`: fix Qwen 2.5 Coder support, add micro benchmarks, support trigger patterns for lazy grammars (#12034)
1153fa31c438e0e709242ab7334d26fc3be3dcda07a03ccbfe5a71c74ac574b00607067d0aa0a49df04c2025-03-05T10:22:29+01:00Daniel Beveniusci : fix xcframework artifact tag (#12191)
11543ccbfe5a71c74ac574b00607067d0aa0a49df04c06a92a193a07afe445929607be9d5e4d033956fb2025-03-05T08:34:02+01:00Daniel Beveniusci : remove xframework upload (#12190)
115506a92a193a07afe445929607be9d5e4d033956fba057897ad4e48e3df0354256e0cc80dadcb575952025-03-05T15:25:45+08:00Clauszyserver : fix cache reuse logic (#12161)
1156a057897ad4e48e3df0354256e0cc80dadcb575955bbe6a9fe9a8796a9389c85accec89dbc4d91e392025-03-05T06:30:31+01:00Daniel Beveniusllama : add xcframework build script (#11996)
11575bbe6a9fe9a8796a9389c85accec89dbc4d91e3920a9b8f5e1380243ed03aeb50ae1bf94b8d685012025-03-04T17:53:26+01:00mgroeber9110ggml : portability fixes for VS 2017 (#12150)
115820a9b8f5e1380243ed03aeb50ae1bf94b8d6850156d7a9f81274717fe035db192f315a049261c7fa2025-03-04T18:42:44+02:00Georgi Gerganovreadme : fix roadmap link (#12185)
115956d7a9f81274717fe035db192f315a049261c7fa1a24c4621f0280306b0d53a4fa474fc65d3f1b2e2025-03-04T17:19:39+01:00Sigbjørn Skjæretmain: allow preloading conversation with -p and add -st / --single-turn (#12145)
11601a24c4621f0280306b0d53a4fa474fc65d3f1b2ebecade5de77674696539163dfbaf5c041a1a8e972025-03-04T06:24:07ZOlivier Chafik`server`: fix deadly typo in response_format.json_schema.schema handling (#12168)
116187abb7e903635a2660e89f9336122f374d683e0a6d4c23b81b03c7b089a5f7a21ca73d1385d371912025-02-28T12:34:39+05:30cmdr2cuda/cpu: Increase support for fp16 unary operations (ggml/1125)
11626d4c23b81b03c7b089a5f7a21ca73d1385d371916512a9003741bd3fe2e11bf3bb3608ec497d368d2025-02-27T13:35:07+01:00Diego Devesawhisper : support GGML_BACKEND_DL (whisper/2843)
11636512a9003741bd3fe2e11bf3bb3608ec497d368d4512055792cff7ea107f2d2231f79aa1af073c622025-02-05T04:41:10-08:00midnightcmake : fix compile assumptions for power9/etc (whisper/2777)
1164aede2074f608d7bf6614cdd047bce687a2b3d9082679c3b55d1c9c3fed56dea00fea713622e425942025-02-28T09:09:38+02:00Georgi Gerganovscripts : sync-ggml-am.sh fix
11652679c3b55d1c9c3fed56dea00fea713622e42594c43af9276b119dae7436b7878d59671d0f6b1a972025-03-03T16:17:36+01:00Daniel Beveniusci : set GITHUB_ACTION env var for server tests (#12162)
1166c43af9276b119dae7436b7878d59671d0f6b1a97d5c63cd7f932663a20a860ef11a238e627abac532025-03-03T21:09:29+08:00dm4tts: add speaker file support (#12048)
11679660ffef582ca275092b621c87085a6eea136a90c950a1f69269bff416d74349a82d78181ce6f0f82025-03-03T20:54:08+08:00ag2s20150909ggml : fix kleidiai build (#12159)
11687b69003af74924ac04d97313c2e57c45ba56b616ece9745bb8079b9f4af45df29b67ad0c6e50584d2025-03-03T11:42:45+01:00Xuan-Son Nguyenwebui : add ?m=... and ?q=... params (#12148)
1169ece9745bb8079b9f4af45df29b67ad0c6e50584dcc473cac7cea1484c1f870231073b0bf0352c6f92025-03-03T15:37:22+05:30Akarshan BiswasSYCL: Move CPY kernels to a separate file and add few missing kernels (#12133)
117014dec0c2f29ae56917907dbf2eed6b19438d0a0e1782cdfed60952f9ff333fc2ab5245f2be7024532025-03-02T14:53:48+01:00Sigbjørn Skjæretmain: use jinja chat template system prompt by default (#12118)
117180c41ddd8f11b8094018296d9820c2b6c119ac122cc4a5e44a3a9ab94426816770d611b33fae8f772025-03-01T12:57:22+01:00Erik ScholzCUDA: compress mode option and default to size (#12029)
11722cc4a5e44a3a9ab94426816770d611b33fae8f7706c2b1561d8b882bc018554591f8c35eb04ad30e2025-03-01T15:45:09+05:30Vivianwebui : minor typo fixes (#12116)
117306c2b1561d8b882bc018554591f8c35eb04ad30e70680c48e5f77d2d3138712a6582bd8c1e5489222025-02-28T17:44:46+01:00Xuan-Son Nguyenconvert : fix Norway problem when parsing YAML (#12114)
117470680c48e5f77d2d3138712a6582bd8c1e548922c43a3e7996e585e2addde1e44057a4f3cdbadef82025-02-28T05:41:47-08:00William Tambelliniggml : upgrade init_tensor API to return a ggml_status (#11854)
1175c43a3e7996e585e2addde1e44057a4f3cdbadef884d5f4bc195b9540fcb902d869015fba7ef6baa42025-02-28T12:44:11+01:00Xuan-Son Nguyenllama : add Phi-4-mini support (supersede #12099) (#12108)
1176438a83926afcff3643ffef5543db67545ceffe399c42b1718ca8299f9afeabdc122badeab64c96902025-02-28T09:42:52+01:00Rémy Ovulkan: add specific MMV kernels for IQ2 and IQ3 quants + optimizations (#11595)
11779c42b1718ca8299f9afeabdc122badeab64c969005e6f5aad0a4bb48fb2775f2a78505540fdbc47d2025-02-28T09:26:43+01:00Johannes GäßlerCUDA: fix logic for V100 + GGML_CUDA_FORCE_MMQ (#12098)
1178673cfef9aa8daad09966208909f346eb996628a4fbeda9002d4b8b79a4f9288a7ff0d34ef4fb23d52025-02-28T15:23:47+08:00hipuddingCANN: Fix build error with GCC 13 (#11990)
1179b95c8af37ccf169b0a3216b7ed691af0534e5091a800ae46da2ed7dac236aa6bf2b595da6b6294b52025-02-27T08:42:48+01:00Vladimir Vuksanoviccmake: Fix ggml backend dependencies and installation (#11818)
118069050a11be0ae3e01329f11371ecb6850bdaded53567ee3a94d57ba72b6d023ca507d11e75767edb2025-02-26T14:04:48+01:00Sigbjørn SkjæretRefactor gguf scripts to improve metadata handling (#11909)
1181a82c9e7c23ef6db48cebfa194dc9cebbc4ac3552401af80b546005a06854827b732e3b46979ae0282025-02-25T09:30:21-06:00Jeff Bolzvulkan: fix assertion when qy_needs_dequant (#12068)
1182393fca629e6ec391b76edf778cb3f7a8a3bc56f961d4f39dfeaf3bbcf4e1535ac03953a5d766680b2025-02-25T19:28:22+08:00Molly Sophiaggml-cpu: Fix build with sve (#12059)
118334a846b5847a18d133b360074f1fb485b2632b2d7a2c913e66353362d7f28d612fd3c9d51a831eda2025-02-24T13:47:07-08:00lhezopencl: fix for small models (#11950)
11847a2c913e66353362d7f28d612fd3c9d51a831eda08d5986290cc42d2c52739e046642b8252f97e4b2025-02-24T09:09:51-07:00Alex Brooksllava : Add Granite Vision Support (#11794)
118508d5986290cc42d2c52739e046642b8252f97e4b651adf4b6675339465179b81b194d98cc14704d62025-02-24T22:33:23+08:00Neo Zhang Jianyu[SYCL] Optimize mul_mat for Q4_0 on Intel GPU (#12035)
11868303e8b0fb2c1e26a8edd58071f9120a5bd6930a7ad0779f5de84a68143b2c00ab5dc94a948925d32025-02-24T15:48:25+05:30Akarshan BiswasSYCL: Fix GGML_SYCL_DEBUG macro (#11995)
11877ad0779f5de84a68143b2c00ab5dc94a948925d3f777a73e18c218848bca0748581c043987348a5d2025-02-23T18:15:51+01:00Florent BENOITrun: allow to customize prompt by env var LLAMA_PROMPT_PREFIX (#12041)
1188f777a73e18c218848bca0748581c043987348a5daf7747c95ae71a5db4184947f837179e82c70b772025-02-23T13:14:32ZEric CurtinSome llama-run cleanups (#11973)
1189af7747c95ae71a5db4184947f837179e82c70b77a28e0d5eb18c18e6a4598286158f427269b1444e2025-02-23T05:39:24+08:00Aaron Teoggml-cpu: Support s390x SIMD Instruction Set (#12019)
1190f3e64859edb0d55d4223ead78672597cd1a218df5fa07c2f93c73161bf09ef0b23b5d2686f9a073e2025-02-22T15:03:00+02:00Georgi Gerganovci : fix arm upload artifacts (#12024)
11910b3863ff9576872855b0265da2cab2ce7e25c4d9ee02ad02c56ff36a5edd22d8617ab3f9546ce7fe2025-02-21T15:46:23+08:00BodhiMUSA: support ARM64 and enable dp4a .etc (#11843)
1192ee02ad02c56ff36a5edd22d8617ab3f9546ce7fec392e5094deaf2d1a7c18683214f007fad3fe42b2025-02-20T23:11:03-07:00Alex Brooksclip : fix visual encoders with no CLS (#11982)
1193c392e5094deaf2d1a7c18683214f007fad3fe42bc5d91a74006c49376590ef2b67420bc7ce2063972025-02-21T03:43:22+09:00momongaserver (webui): Fix Premature Submission During IME Conversion (#11971)
11944806498bf15ef767de3776b00856e56c373dd1b10d559580a0a74c842c3a876035ba96a338aabfb22025-02-20T15:38:32+05:30Prashant Vithuleggml: aarch64: implement SVE kernels for q3_K_q8_K vector dot (#11917)
11950d559580a0a74c842c3a876035ba96a338aabfb2d04e7163c85a847bc61d58c22f2c503596db7aa82025-02-20T09:35:11+01:00Michael Engelrun : add --chat-template-file (#11961)
1196d07c621393fab6cf32f3add2aa65e4d5331d4a67abd4d0bc4f1a9a0e429bc8ee0d5ece2a394a0a392025-02-19T12:29:52+01:00Daniel Beveniuscommon : add llama.vim preset for Qwen2.5 Coder (#11945)
1197abd4d0bc4f1a9a0e429bc8ee0d5ece2a394a0a399626d9351a6dfb665400d9fccbda876a0a96ef672025-02-19T13:29:42+02:00Georgi Gerganovspeculative : update default params (#11954)
11989626d9351a6dfb665400d9fccbda876a0a96ef67b58934c1836b5ea51dbacbe899eee125775e77c92025-02-19T06:16:23+01:00Daniel Beveniusllama : fix indentation in llama-grammar [no ci] (#11943)
1199b58934c1836b5ea51dbacbe899eee125775e77c963e489c025d61c7ca5ec06c5d10f36e2b76aaa1d2025-02-19T00:01:44+02:00igardevserver : (webui) Enable communication with parent html (if webui is in iframe) (#11940)
120063e489c025d61c7ca5ec06c5d10f36e2b76aaa1d63ac12856303108ee46635e6c9e751f81415ee642025-02-18T18:03:23ZOlivier Chafiktool-call: refactor common chat / tool-call api (+ tests / fixes) (#11900)
120163ac12856303108ee46635e6c9e751f81415ee645137da7b8c3eaa090476a632888ca178ba109f8a2025-02-18T14:21:41+01:00Xuan-Son Nguyenserver : add TEI API format for /rerank endpoint (#11942)
120209aaf4f1f5b69b5173b7fcd24eab96729f6b242a73e2ed3ce3492d3ed70193dd09ae8aa44779651d2025-02-18T17:12:49+08:00xiaobing318docs : Fix duplicated file extension in test command (#11935)
1203c4d29baf3236b011730b6ccaae6852e781fb1b912eea03d86a2d132c8245468c26290ce07a27a8e82025-02-17T11:25:12+01:00Antoine Viallonserver : fix divide-by-zero in metrics reporting (#11915)
12042eea03d86a2d132c8245468c26290ce07a27a8e80f2bbe656473177538956d22b6842bcaa0449fab2025-02-17T07:55:57+01:00Rémy Ovulkan: implement several ops relevant for ggml_opt (#11769)
1205fe163d5bf3fb8e99c96ff6d21775fa3d1daee3cf818a340ea8be55b3706e1772527cb8738e90a8c72025-02-16T18:51:13+09:00standby24x7common : Fix a typo in help (#11899)
1206818a340ea8be55b3706e1772527cb8738e90a8c7bf42a23d0a515a508aecf10fde1d52c5ed5104c62025-02-16T10:36:39+01:00Xuan-Son Nguyenci : fix (again) arm64 build fails (#11895)
1207c2ea16f260445d1f2bd9fee78fb8acb2b3aaaad46dde1782483d6b0a1d59f5a5fbcb3119b9d34c272025-02-16T14:50:26+08:00Hale Chanmetal : fix the crash caused by the lack of residency set support on Intel Macs. (#11904)
12086dde1782483d6b0a1d59f5a5fbcb3119b9d34c27fc10c38ded84670955d4c44770f8acfb64617e152025-02-15T20:23:22+01:00Johannes Gäßlerscripts: fix compare-llama-bench commit hash logic (#11891)
1209fc10c38ded84670955d4c44770f8acfb64617e1522885105a6b034abaf1c1471ad90fb2ae96146bb2025-02-15T20:03:30+01:00708-145examples: fix typo in imatrix/README.md (#11884)
1210c2cd24fbfdfeacc2fc6ad03878379de10426411468ff663a04ed92044a9937bcae353e9d9733f9cd2025-02-15T20:29:56+02:00Georgi Gerganovreadme : add notice about new package registry (#11890)
1211f3552296924e704c11ca936907b9cad7873db8e2fc1b0d0936e4dfc52a81f38e7420c7d23f6caa882025-02-15T10:11:36ZOlivier Chafikserver: fix type promotion typo causing crashes w/ --jinja w/o tools (#11880)
121289daa2564f6eab33be53c6a1b39273af536d6bb3300907b2110cc17b4337334dc397e05de2d8f5e02025-02-14T12:46:08-08:00Michał Moskalllguidance build fixes for Windows (#11664)
1213300907b2110cc17b4337334dc397e05de2d8f5e094b87f87b502d2ab6c8b28d2b5935cf008ca15052025-02-14T11:12:23-08:00lhezopencl: Fix rope and softmax (#11833)
121494b87f87b502d2ab6c8b28d2b5935cf008ca1505dbc2ec59b5603fbd25f3833b2407b4f3612b9f022025-02-14T15:33:52+01:00Diego Devesacuda : add ampere to the list of default architectures (#11870)
1215a4f011e8d02179f032627130f961eb77ee30401ca7b8ce226071b2b0faaad0d36cc5ebd7fb0747302025-02-14T02:59:40ZEvevulkan: linux builds + small subgroup size fixes (#11767)
1216a7b8ce226071b2b0faaad0d36cc5ebd7fb07473004045bb84288dc7e9e424d4e2bf7f40d259b4c6a2025-02-14T09:13:43+08:00theraininskyllama-bench : fix unexpected global variable initialize sequence issue (#11832)
1217c48f630d1c1942fce08aa7cb18a53ace443cd611bd6e55bfd3f3af3e5705cf87a10e5178cef7c3c12025-02-13T14:46:59+01:00Daniel Beveniusllama : add --completion-bash option (#11846)
1218c7f460ab882065ec5696e3d51e24dbf67b53928727e8a23300e30cd6ff6107ce262acf832ca605972025-02-13T10:05:16ZOlivier Chafik`server`: fix tool-call of DeepSeek R1 Qwen, return reasoning_content (Command 7RB & DeepSeek R1) unless `--reasoning-format none` (#11607)
121927e8a23300e30cd6ff6107ce262acf832ca60597e4376270d971cff7992bdb6c5412a739195b14592025-02-13T00:45:57-06:00Vinesh Janarthanansampling: add Top-nσ sampler (#11223)
1220e4376270d971cff7992bdb6c5412a739195b14593e693197724c31d53a9b69018c2f1bd0b93ebab22025-02-13T01:25:34-05:00Oleksandr Kuvshynovllama.cpp: fix warning message (#11839)
12213e693197724c31d53a9b69018c2f1bd0b93ebab2a394039db004c6ee00098250d160b5aa018c23142025-02-13T07:07:51+01:00Daniel Beveniusllama : update llama_decode_internal ref [no ci] (#11840)
1222a394039db004c6ee00098250d160b5aa018c2314be3bbd62153820ff6d358c817360927f429105c42025-02-13T01:02:38+01:00Diego Devesaggml-cpu : add chunking support to mul_mat_id (#11666)
1223be3bbd62153820ff6d358c817360927f429105c431afcbee0eebbc998ab311aa314e389d60aa21272025-02-13T00:33:45+01:00Xuan-Son Nguyenggml : x2 speed for WASM by optimizing SIMD (#11453)
1224bfd11a2344ce6005bfbd5432a06fc7325bc0ecae0fb77f821f6e70ad8b8247a97d1022f0fef789912025-02-12T20:36:11ZJCFix: Compile failure due to Microsoft STL breaking change (#11836)
1225fef0cbeadf5c8e221f832158cb4006ade39ef786748ee9fe9312acb8755ee4bf46fd9de2e6a45f292025-02-12T10:06:53-04:00bandoticleanup: fix compile warnings associated with gnu_printf (#11811)
1226748ee9fe9312acb8755ee4bf46fd9de2e6a45f29198b1ec611a2c551ea40e5b9c0b862f37555a4cc2025-02-12T13:57:33ZRichardggml : fix multi-threaded clamp_f32 (#11824)
1227198b1ec611a2c551ea40e5b9c0b862f37555a4ccc3d6af7cd2d79dc89da086b2d08c777d0319d8292025-02-12T20:22:58+08:00Weizhao Ouyangggml-cpu: Fix duplicate MATMUL_INT8 (#11817)
1228c3d6af7cd2d79dc89da086b2d08c777d0319d829369be5598ac5f71f6aa6d6606e9aec769a23dafa2025-02-12T13:16:39+01:00Johannes GäßlerCUDA: fix CUDART_VERSION checks (#11821)
1229369be5598ac5f71f6aa6d6606e9aec769a23dafa4078c77f9891831f29ffc7c315c8ec6695ba5ce72025-02-12T08:40:01+01:00Daniel Beveniusllama : fix typo in llama-grammar.h [no ci] (#11816)
123090e4dba461b07e635fd1daf3b491c978c7dd0013a18f481f99962638092d6f1c98b1d34d3e3256de2025-02-11T10:55:45-05:00Sheldon RobinsonFix #11802: Compile bug - RegQueryValueExA changed to RegQueryValueEx (#11803)
1231a18f481f99962638092d6f1c98b1d34d3e3256deb9ab0a4d0b2ed19effec130921d05fb5c30b68c52025-02-11T14:06:45+01:00Daniel Beveniusserver : use common_token_to_piece instead of common_detokenize (#11740)
12327b891bdc863663b4dc1155aa9429b58c721524b281732619fd2d570712dc78db5965cee9224b38bd2025-02-10T23:21:31+01:00Maxim Evtushfix: typos in documentation files (#11791)
123319b392d58dc08c366d0b29bd3b9c6991fa4e16620893e0114e934bdd0eba0ff69d9ef8c59343cbc32025-02-10T19:58:18+01:00Wilken Gottwaltllama-mmap: fix missing include (#11796)
12349ac3457b39c78c5eb103280e08fb6163642484ffc2a67efe38e6782c0217e1de3edc68de6951612b2025-02-10T16:05:57+08:00pascal-lcUpdate README.md [no ci] (#11781)
123555ac8c7791ff44aeb82bd7fe3ca2041844fc77f1e6e658319952f7ad269dc11275b9edddc721fc6d2025-02-08T21:54:50+01:00Xuan-Son Nguyenserver : (webui) revamp Settings dialog, add Pyodide interpreter (#11759)
1236bdcf8b6a56f4d49d3420ae5b21cdf9a1160405514d3465c5aeca8be29cac77f1535c35f4fb274eca2025-02-08T16:49:38+02:00Georgi Gerganovcont : fix mmap flag print (#11699)
12374d3465c5aeca8be29cac77f1535c35f4fb274ecad80be897acdca45f8f7ea2e52c930b1d0e738a142025-02-08T15:30:53+01:00Karol Kontnyggml: Fix data race in ggml threadpool (#11736)
1238d80be897acdca45f8f7ea2e52c930b1d0e738a143ab410f55f26038de45d6cc569aaa5cb29acb9182025-02-08T10:46:07+01:00Johannes GäßlerCUDA: fix min. version for movmatrix (#11751)
12390cf867160ca9d492e06c0bc688b337cffd1eb187d2fe216fb2fb7ca8627618c9ea3a2e78863257802025-02-08T10:42:34+01:00Xuan-Son Nguyenserver : (webui) fix numeric settings being saved as string (#11739)
1240d2fe216fb2fb7ca8627618c9ea3a2e7886325780ed926d8833df3c29797edbc98dafd9b575aa07292025-02-07T14:42:46ZEric CurtinMake logging more verbose (#11714)
1241ed926d8833df3c29797edbc98dafd9b575aa07292d219b389e8c8c40bce547b08c8aa7add60fde1f2025-02-07T16:05:34+02:00Georgi Gerganovllama : fix defrag logic (#11707)
12422d219b389e8c8c40bce547b08c8aa7add60fde1f333820d7491cd31c707a340ff23b984a84e401542025-02-07T08:55:47-05:00Christian Fillionvocab : ignore invalid UTF-8 input in the BPE tokenizer (#11729)
1243333820d7491cd31c707a340ff23b984a84e40154c026ba3c23765a648ca27c7a15ecf179f8e27f262025-02-07T15:48:47+02:00magicsellama : fix progress dots (#11730)
1244b7552cfcbc7defccd8bdefd0a7b9c47d145ed3d7225bbbfa39930cda38a2e5d1f3e5b382267320092025-02-07T09:15:22+01:00Daniel Beveniuscommon : add default embeddings presets (#11677)
1245225bbbfa39930cda38a2e5d1f3e5b38226732009855cd0734aca26c86cc23d94aefd34f934464ac92025-02-07T15:38:31+08:00Jinyang Heggml : optimize and build warning fix for LoongArch (#11709)
1246855cd0734aca26c86cc23d94aefd34f934464ac98a59053f63fffc24e730cd3ea067760abfe4a9192025-02-06T22:48:51+01:00tv1wndllama : fix old glm4 models (#11670)
12471d20e53c40c3cc848ba2b95f5bf7c075eeec8b192fb3c32a1634488a5265d1304ab37628eeb5480d2025-02-06T09:29:13-05:00Patrick Pengrpc: fix known RCE in rpc-server (ggml/1103)
12482fb3c32a1634488a5265d1304ab37628eeb5480d9ab42dc722ad19a12af80f38a06474d498f96da32025-02-06T17:32:29+01:00Xuan-Son Nguyenserver : (webui) migrate project to ReactJS with typescript (#11688)
1249c0d4843225eed38903ea71ef302a02fa0b27f0488d4d2be143a3919c3d194b9bf7a221e50abed8932025-02-06T12:08:13+01:00Adrien Gallouëtbuild : fix llama.pc (#11658)
12508d4d2be143a3919c3d194b9bf7a221e50abed8932c6c8df56d8a3edd657b9a295e95d469a37f00442025-02-06T17:20:00+08:00junchao-zhaoggml : fix LoongArch compile error with 128-bit SIMD (#11701)
12512c6c8df56d8a3edd657b9a295e95d469a37f00448a7e3bf17aa5a8412854787746c92a28623a89252025-02-06T00:15:30-06:00Jeff Bolzvulkan: optimize coopmat2 iq2/iq3 callbacks (#11521)
12521ec208083cb896dd8772a2f962151fa3d4a74e369f4cc8f8d310b13ab3fc93a9be81b1d1376a7fa62025-02-05T14:45:40+07:00SAMIllava: add quantization for the visual projector LLAVA, Qwen2VL (#11644)
1253db288b60cb49eab69703f995379b8d75c18bf5b3106045e7bb8db481bb2ebbc60e3b53cb27ada1172025-02-04T15:48:53ZOlivier Chafik`tool-call`: command r7b fix for normal responses (#11608)
1254f117d84b48104992ba16961b35a96fa93efbb355534c46b53c23613628d72e93c63ea01ea4d1e2ac2025-02-04T19:15:24+08:00Jhen-Jie Hongswift : fix llama-vocab api usage (#11645)
1255b34aedd558dcf67f7e96b0260d6b554877bd3499cde383323959544abe10a4d79e1d3e1ee479933c2025-02-04T09:30:42+02:00Georgi Gerganovci : do not stale-close roadmap issues
1256cde383323959544abe10a4d79e1d3e1ee479933cb3451785aca16fbf4214eeba7e4612676cdf8ccb2025-02-03T23:49:27ZOlivier Chafik`tool-call`: allow `--chat-template chatml` w/ `--jinja`, default to chatml upon parsing issue, avoid double bos (#11616)
1257b3451785aca16fbf4214eeba7e4612676cdf8ccb1d1e6a90bcf485ad2dee309c31cf19bd802465e52025-02-04T00:10:52+01:00Xuan-Son Nguyenserver : (webui) revert hacky solution from #11626 (#11634)
12585598f475be3e31430fbe17ebb85654ec90dc201e8ec05832fa8409c49b3bbd13f957c6ae8486e6182025-02-03T16:45:38+01:00Daniel Beveniusserver : remove CPPHTTPLIB_NO_EXCEPTIONS define (#11622)
125921c84b5d2dc04050714567501bf78762bfa17846d92cb67e37abc23b1c6f7b0ef27a9889da8537e32025-02-03T13:25:56+01:00Johannes GäßlerCUDA: fix Volta FlashAttention logic (#11615)
1260d92cb67e37abc23b1c6f7b0ef27a9889da8537e36eecde3cc8fda44da7794042e3668de4af3c32c62025-02-03T09:42:55Zmashdragonserver : (webui) Fix Shift+Enter handling (#11609)
12616eecde3cc8fda44da7794042e3668de4af3c32c6396856b40029dd6747d2fbdb179e8286834180452025-02-02T23:48:29+01:00Johannes GäßlerHIP: fix flash_attn_stream_k_fixup warning (#11604)
12624d0598e1445a64c99cf2faac72f8d5d023f1e6a190f9b88afb6447d3929843a2aa98c0f11074762d2025-02-02T22:08:05+01:00uvosHIP: add GGML_CUDA_CC_IS_* for amd familys as increasing cc archtectures for amd gpus are not supersets of eatch other (#11601)
126390f9b88afb6447d3929843a2aa98c0f11074762d864a0b67a6c8f648c43ce8271f9cb2e12dd5df6e2025-02-02T19:58:34ZOlivier Chafiknit: more informative crash when grammar sampler fails (#11593)
126469804487e0b10f2c5c06316f0ac0eb6ada68433fff227703d6d6e1888bdc7af6138514092ffcdb962025-02-02T09:10:15ZOlivier ChafikFix exotic ci env that lacks ostringstream::str (#11581)
1265ff227703d6d6e1888bdc7af6138514092ffcdb960cec062a638700495673f5494d200b74340538be2025-02-01T23:55:32-08:00Michał Moskalsampling : support for llguidance grammars (#10224)
12660cec062a638700495673f5494d200b74340538be53debe6f3c9cca87e9520a83ee8c14d88977afa42025-02-02T15:48:46+08:00piDackllama : add support for GLM-Edge and GLM-Edge-V series models (#10573)
1267a83f528688324a21484a97af1d1be5e1bc8d4c8eb1bcd309fc8ac929cbd4a6207b3a19886bda031f2025-01-31T14:15:25ZOlivier Chafik`tool-call`: fix llama 3.x and functionary 3.2, play nice w/ pydantic_ai package, update readme (#11539)
1268b1bcd309fc8ac929cbd4a6207b3a19886bda031f5783575c9d99c4d9370495800663aa5397ceb0be2025-01-31T13:48:31ZOlivier Chafikfix stop regression (#11543)
12695783575c9d99c4d9370495800663aa5397ceb0be4a2b196d03d52da31236390e9f5694a88d43d11d2025-01-31T08:24:29ZOlivier ChafikFix chatml fallback for unsupported builtin templates (when --jinja not enabled) (#11533)
12704a2b196d03d52da31236390e9f5694a88d43d11d1bd3047a939e561adfb3c7dd2e17c4cc7a4e4e6f2025-01-31T08:12:40ZOlivier Chafikserver : fix --jinja when there's no tools or schema (typo was forcing JSON) (#11531)
12711bd3047a939e561adfb3c7dd2e17c4cc7a4e4e6fa2df2787b32e0846205f7151dfad88ceab592beb2025-01-31T00:58:55-05:00Steve Grubbcommon: Add missing va_end (#11529)
12724314e56c4f8c5091f45732f39bd94c0c6c323798496e5bf46bab757d05e18227cb4e17055ae42f422025-01-30T11:05:00+01:00Daniel Beveniusserver : use lambda instead of std::bind (#11507)
1273e0449763a4f335cca374254a72892141f41eaa59eb7cf15a808d4d7a71eef89cc6a9b96fe82989dc2025-01-30T05:48:14+01:00Daniel Beveniusserver : update json snippets in README.md [no ci] (#11492)
127466ee4f297cff3c7ce98b31dbc0ce909d41b9e408e51c47b401f8cb5f21630a05171e2529cde4d1862025-01-29T18:29:39+01:00Rémy Oudomphengvulkan: implement initial support for IQ2 and IQ3 quantizations (#11360)
1275e51c47b401f8cb5f21630a05171e2529cde4d1862711d0215ff6a1ecb2202ac8c1f135bceed7057b2025-01-29T16:34:18+01:00Daniel Beveniusserver : update auto gen files comments [no ci] (#11484)
12762711d0215ff6a1ecb2202ac8c1f135bceed7057bf0d4b29edfc633ec3ba6442482a6b43a5cd80a012025-01-29T09:26:50-06:00Jeff Bolzvulkan: Catch pipeline creation failure and print an error message (#11436)
1277f0d4b29edfc633ec3ba6442482a6b43a5cd80a01815857791d3639a4d544d0a8cf25a49b0325c08c2025-01-29T12:23:10+01:00Eric CurtinParse https://ollama.com/library/ syntax (#11480)
12781a0e87d29152cb9d4ce13b4ad64b0382c9ba1ab6d2e518e9b4231077013ffb0e5c4cc24a0c4c1b7d2025-01-23T11:59:08-08:00William Tambelliniggml : add option to not print stack on abort (ggml/1081)
1279d2e518e9b4231077013ffb0e5c4cc24a0c4c1b7db636228c0ad0db95bf73008094c6145a05615cf62025-01-17T21:29:08+09:00issixxggml-cpu : fix ggml_graph_compute_thread did not terminate on abort. (ggml/1065)
1280b636228c0ad0db95bf73008094c6145a05615cf6325afb370a1a7b32b5fe46a749bc840c66db97652025-01-29T09:38:54+01:00Daniel Beveniusembedding : enable --no-warmup option (#11475)
1281325afb370a1a7b32b5fe46a749bc840c66db9765794fe23f29fb40104975c91fe19f23798f7c726e2025-01-29T12:07:21+08:00Molly Sophiallama: fix missing k_cache store for rwkv6qwen2 (#11445)
1282cf8cc856d7d02165bd08593b4757e1256a62d501d0c08040b6c8bebeade7b8d5764df6cf901678d52025-01-28T16:03:42-07:00peidaqiserver : Fixed wrong function name in llamacpp server unit test (#11473)
1283d0c08040b6c8bebeade7b8d5764df6cf901678d5be5ef7963fcf14a9c77c963fdd3f7b606eacb4982025-01-29T00:02:56+01:00Xuan-Son Nguyenci : fix build CPU arm64 (#11472)
1284cae9fb4361138b937464524eed907328731b81f67fee2889e6565830631fbe76d47ef85cf8fd946a2025-01-28T07:42:20-08:00Nikita SarychevHIP: Only call rocblas_initialize on rocblas versions with the multiple instantation bug (#11080)
12854bf3119d61c1de5660025fd5a611effe503e3d2bf643120bad8ab3a753daa64aaac8288ee5800e062025-01-28T09:15:34-05:00someone13574cmake : don't fail on `GGML_CPU=OFF` (#11457)
12866e84b0ab8e10b8f6f99a32855f976ebcd35b03532b8525d5c89b124c4578a2621cbeb64354ff3d9c2025-01-28T15:26:58+05:30Akarshan BiswasSYCL : SOFTMAX F16 mask support and other fixes (#11261)
12872b8525d5c89b124c4578a2621cbeb64354ff3d9ca4417ddda98fd0558fb4d802253e68a933704b592025-01-28T09:32:40+01:00Michael EngelHandle missing model in CLI parameters for llama-run (#11399)
1288a5203b4465c5c87813936bde98170e25bb09024fdf984e014714cba4c99ef894b20b51cbcef31b162025-01-27T17:42:09+04:00lexasubllama : minor fixes for up llama load model speed (#11448)
1289acd38efee316f3a5ed2e6afcbc5814807c347053caf773f249aa267c78d3da5567b8ab156080ea592025-01-27T02:41:59-05:00Ihar Hrachyshkametal: Handle null returned from MTLCreateSystemDefaultDevice() (#11441)
1290caf773f249aa267c78d3da5567b8ab156080ea59178a7eb952d211b8d4232d5e50ae1b64519172a92025-01-26T22:45:32+01:00Xuan Son Nguyendocker : fix ARM build and Vulkan build (#11434)
1291178a7eb952d211b8d4232d5e50ae1b64519172a96f53d8a6b41e48c73b345fc6c712c3b00ea4fb932025-01-26T20:06:16+02:00Georgi Gerganovmetal : use residency sets (#11427)
129219f65187cbf009801288861133267ee5573ceead1d8ee06000ecdd274e7f0a0465d6bf26ad2b34912025-01-26T12:07:48-04:00bandoticmake: add ggml find package (#11369)
12931d8ee06000ecdd274e7f0a0465d6bf26ad2b34912cc9b8c32c78d09cd1b4df0aaa605ab2d01762432025-01-26T23:20:34+08:00Frank Mairpc: fix register position (#11424)
12944a75d19376f2f00dbae6c266eb9c4f3001872b5226771a1491f3a4c3d5b99c4c267b81aca9a7dfa02025-01-25T15:29:57-06:00Jeff Bolzvulkan: compile shaders on-demand (#11406)
129549b0e3cec4b67dc9f4debe3a16acd4c819f751d620a758155bc5f37290b20ea44d76ba99c4e7f2cb2025-01-25T16:36:44+01:00Xuan Son Nguyenserver : fix cleaning up stream task (#11418)
129620a758155bc5f37290b20ea44d76ba99c4e7f2cb00c24acb2ac49d9f8318e808b6ada2f5649f253f2025-01-25T15:22:29+01:00Diego Devesadocker : fix CPU ARM build (#11403)
129700c24acb2ac49d9f8318e808b6ada2f5649f253f466ea66f338d63109540dae1df97ccfdbf4cd08f2025-01-25T13:36:48+02:00Georgi Gerganovci : fix line breaks on windows builds (#11409)
1298466ea66f338d63109540dae1df97ccfdbf4cd08f5f0db9522f347b095f84c3033d6c1c1895402e252025-01-25T07:26:01+08:00jiahao suCANN: Add Ascend CANN build ci (#10217)
1299c5d9effb49649db80a52caf5c0626de6f342f5269fbadaef4f0903c64895ba9c70f02ac6e6a4b41c2025-01-24T21:02:43+01:00Johannes GäßlerCUDA: fix FP16 cuBLAS GEMM (#11396)
13009755129c27da76d768bd7e47e206bac61b40cf18a07c2c8a52464646ce13040e62c1ea04459f721e2025-01-24T18:41:30+02:00Georgi Gerganovrelease : pack /lib in the packages (#11392)
13018137b4bb2b5fd4cb4a752bfe69ccfd915a313d581af6945eb0d0e97525dc0ec18167abf05c28f4822025-01-24T12:38:31+01:00Johannes GäßlerCPU/CUDA: fix (GQA) mul mat back, add CUDA support (#11380)
13021af6945eb0d0e97525dc0ec18167abf05c28f48201f37edf1a6fae76fd9e2e02109aae6995a914f02025-01-24T12:21:35+01:00Bernhard M. Wiedemanncmake : avoid -march=native when reproducible build is wanted (#11366)
1303c07e87f38bd0c22ec6dbc852ae50aaa1c64632d4564804b79b78df1469ec8646869972de5e885ec42025-01-24T09:02:38+01:00stduhpfserver : (webui) put DeepSeek R1 CoT in a collapsible <details> element (#11364)
1304564804b79b78df1469ec8646869972de5e885ec405f63cc9ee859de07f585f7b12939345f39ada8b2025-01-23T14:51:24-06:00Jeff Bolztests: fix some mul_mat test gaps (#11375)
130558456616408c828a1ce6d2481940fd1c97bce3b5f211d1dc10332b7e89a4abd1041903fa63bfed272025-01-23T13:56:05+01:00Xuan Son Nguyenserver : add more clean up when cancel_tasks is called (#11340)
1306f211d1dc10332b7e89a4abd1041903fa63bfed27955a6c2d91480954e90469517c4b91c4052c6a592025-01-23T10:38:20ZEric CurtinTreat hf.co/ prefix the same as hf:// (#11350)
1307955a6c2d91480954e90469517c4b91c4052c6a591971adf55e3ebbfab83771d6174d37b77c352c712025-01-23T15:14:28+08:00amd-dwangVulkan-run-test: fix mmq_wg_denoms (#11343)
13081971adf55e3ebbfab83771d6174d37b77c352c715245729e3317064959faefc5e5cbc63f4e9cfbea2025-01-23T01:07:50-06:00Jeff Bolzvulkan: sort shaders for more deterministic binary (#11315)
13095245729e3317064959faefc5e5cbc63f4e9cfbea6152129d05870cb38162c422c6ba80434e021e9f2025-01-23T01:01:17-06:00Jeff Bolzvulkan: fix diag_mask_inf (#11323)
13106152129d05870cb38162c422c6ba80434e021e9f16d3df7ab0bb9def78047eab4d9b15393997f4952025-01-22T19:22:20+01:00Diego Devesamain : update README documentation for batch size (#11353)
131112c2bdf2de34f747d13b270fc9d3b52490bf194fc64d2becb13f2a7c0145b516a05f028d949a046b2025-01-22T17:44:40+01:00Diego Devesaserver : fix draft context not being released (#11354)
13123e3357fd77bcf5bd8cfcc53ca53d4a5532e67e1b6171c9d25820ccf676b243c172868819d882848f2025-01-22T15:35:48+08:00tc-mbllava : support Minicpm-omni (#11289)
13136171c9d25820ccf676b243c172868819d882848fe28245f35f2faaf249dd352998b3693a8cc28c512025-01-21T13:18:51ZOlivier ChafikAdd Jinja template support (#11016)
1314e28245f35f2faaf249dd352998b3693a8cc28c516da5bec81c34f3b8a8f1b367cf23ad016e83d3322025-01-21T14:07:12+01:00Xuan Son Nguyenexport-lora : fix tok_embd tensor (#11330)
13152139667ec419cdd953987f4df2ace9da87bbda2880d0d6b4b7abca342fc990399e78af8d213eabaf2025-01-21T08:48:13+02:00Georgi Gerganovmetal : fix out-of-bounds write (#11314)
131680d0d6b4b7abca342fc990399e78af8d213eabafaea8ddd5165d525a449e2fc3839db77a71f4a3182025-01-20T22:29:43+02:00Georgi Gerganovcommon : add -hfd option for the draft model (#11318)
1317aea8ddd5165d525a449e2fc3839db77a71f4a3189f7add1cde670ff744b791f5ed6649e86a0c586c2025-01-20T10:38:32-06:00Jeff Bolzvulkan: fix coopmat2 validation failures (#11284)
13189f7add1cde670ff744b791f5ed6649e86a0c586c90d987b105db6016cb395f673b4d21e02129721e2025-01-20T16:36:08+02:00Georgi Gerganovexamples : fix add_special conditions (#11311)
1319a4251edd6fc16d168f517a7e4b0936212b296603ec7f3ac9ab33e46b136eb5ab6a76c4d81f57c7f12025-01-20T15:02:15+01:00Michael Podvitskiycmake: fix shell command quoting in build-info script (#11309)
1320ef6dada60ca710f4edfbb6fd9e1258685d8ea49dae3c1db2f9c4beec0737c6a82d1f3791fd6fcdb22025-01-20T09:29:32+02:00Georgi Gerganovcont : fix whitespaces (#11305)
132192bc493917d43b83e592349e138b54c90b1c3ea7b9daaffe02d6a77d85f0420bce5dfe0e00daeff62025-01-19T20:22:30+02:00Georgi Gerganovtests : increase timeout when sanitizers are enabled (#11300)
1322b9daaffe02d6a77d85f0420bce5dfe0e00daeff699487b57d47e14dc342b7b89d238ca11c03452412025-01-19T18:12:09+02:00Georgi Gerganovsimple-chat : fix BOS being added to each message (#11278)
13234dd34ff83165a483ebff7bd43621b28490fa1fd6f30f099228f774209aa3010b78dfbe5d262e69aa2025-01-18T16:18:15+02:00Georgi Gerganovcmake : add sanitizer flags for llama.cpp (#11279)
1324f30f099228f774209aa3010b78dfbe5d262e69aaf26c87417999209e7f4576b4f3ecf7a5b9c66a292025-01-18T14:12:05+01:00Xuan Son Nguyenserver : implement cancellable request (#11285)
13256390a998bfc63241fde8509022b0768a71bf20bb44e18ef93995f3040660750b527e5becf85899d02025-01-18T18:20:57+08:00LostRuins Concedotts : add guide tokens support (#11186)
132644e18ef93995f3040660750b527e5becf85899d03edfa7d3753c29e44b964c0ff424d2ea8d5fdee62025-01-18T02:26:50-06:00Jeff Bolzvulkan: fix coopmat2 flash attention for non-contiguous inputs (#11281)
1327a133566d34a1dd3693c504786963bf1b7b7d8c0e960ec65273a9554ff2510ba285a970289256ebfb2025-01-17T09:28:00+02:00Georgi Gerganovvocab : fix double-eos check (#11273)
1328960ec65273a9554ff2510ba285a970289256ebfb7a689c415e2aecea1a5ae438542afeaf69815d522025-01-17T02:12:01-05:00David Renshawllama : fix deprecation message: vocabable -> vocab (#11269)
13294dbc8b9cb71876e005724f4e8f73a3544646bcf59c8dcefe171ba70ed14f2a64d1433da12d0dd1c12025-01-17T02:10:38+08:00RunningLeonllama : add internlm3 support (#11233)
1330c67cc9837d48ea7f612b5666b90d189e63dfd7d3adc5dd92e8aea98f5e7ac84f6e1bc15de35130b52025-01-16T18:11:49+09:00fj-y-saitoggml: aarch64: implement SVE kernels for q4_K_q8_K vector dot (#11227)
1331adc5dd92e8aea98f5e7ac84f6e1bc15de35130b5f11cfdfd7fe29436fce512d934c2ff6b94bd89d22025-01-15T19:50:13ZEvevulkan: scale caching for k quants + misc fixes (#11081)
1332f11cfdfd7fe29436fce512d934c2ff6b94bd89d21d8504338ea27c7331998c11afdbd47ce5a9daac2025-01-15T18:28:35+02:00Georgi Gerganovci : use -no-cnv in gguf-split tests (#11254)
13331d8504338ea27c7331998c11afdbd47ce5a9daac432df2d5f901a8ac93d1befad916144a0478bd9e2025-01-15T22:17:42+09:00Junil Kimfix: ggml: fix vulkan-shaders-gen build (#10448)
1334432df2d5f901a8ac93d1befad916144a0478bd9e0ccd7f3eb2debe477ffe3c44d5353cc388c9418d2025-01-15T12:51:37+01:00Johannes GäßlerRoPE: fix back, CUDA support for back + noncont. (#11240)
13350ccd7f3eb2debe477ffe3c44d5353cc388c9418df446c2cf6a56a750b67c967505e717a996d2f2fd2025-01-15T05:44:38+01:00Daniel Beveniusexamples : add embd_to_audio to tts-outetts.py [no ci] (#11235)
1336504af20ee4eae72080a56d59d744f6774f7901ce84a44815f704aaed8e8edec7a39e846a975c7ba92025-01-13T22:53:31+03:30ebraminioserver : (UI) Improve messages bubble shape in RTL (#11220)
133739509fb082895d1eae2486f8ad2cbf0e905346c4a29f0870d4846f52eda14ae28cea612ab66d903c2025-01-13T16:45:53+01:00Andreas Kieslingercuda : CUDA Graph Compute Function Refactor (precursor for performance improvements) (#11042)
133800b4c3da6202e855087a4986bf19bb41b959e3337426a26b2492fc546a4db6991e871ee6057140932025-01-13T13:56:23+01:00Xuan Son Nguyencommon : support tag-based --hf-repo like on ollama (#11195)
13397426a26b2492fc546a4db6991e871ee6057140938f70fc3d1b1d3c17b61842330dd106d391cc12272025-01-13T14:46:36+02:00Georgi Gerganovcontrib : add naming guidelines (#11177)
13408f70fc3d1b1d3c17b61842330dd106d391cc12271244cdcf14900dd199907b13f25d9c91a507f5782025-01-13T13:38:20+01:00Daniel Beveniusllama : remove 'd' from bad special token log (#11212)
13411244cdcf14900dd199907b13f25d9c91a507f578924518e2e5726e81f3aeb2518fb85963a500e93a2025-01-13T13:31:41+02:00Radoslav Gerganovggml : do not define GGML_USE_CUDA when building with GGML_BACKEND_DL (#11211)
13429a483999a6fda350772aaf7bc541f1cb246f8a2908f10f69c38288e9e8bb1f933af63a3fc9013d402025-01-12T13:45:14+01:00Xuan Son Nguyenllama : fix chat template gguf key (#11201)
1343afa8a9ec9b520137bbd1ca6838cda93ee39baf20c05e8c9934f94fde49bc1bc9dc51eed2826051502025-01-12T11:32:42+02:00Georgi Gerganovllama : add `llama_vocab`, functions -> methods, naming (#11110)
1344c05e8c9934f94fde49bc1bc9dc51eed2826051502739a71e4b88474833b64aa974ca4515574fd3c42025-01-11T03:42:31-06:00Vinesh Janarthanangguf-py: fixed local detection of gguf package (#11180)
13452739a71e4b88474833b64aa974ca4515574fd3c4ba8a1f9c5b675459c55a83e3f97f10df3a66c7882025-01-11T05:50:33+01:00Daniel Beveniusconvert : sort print supported models [no ci] (#11179)
1346ba8a1f9c5b675459c55a83e3f97f10df3a66c788ff3fcabc727b2dd0c477d23a258217b27cc639fb2025-01-10T13:16:16+01:00Daniel Beveniusexamples : add README.md to tts example [no ci] (#11155)
1347ff3fcabc727b2dd0c477d23a258217b27cc639fbc3f9d25706ac84297067aeaa662c1f1af42ed4432025-01-10T11:30:53+01:00Daniel Beveniusconvert : add --print-supported-models option (#11172)
1348c3f9d25706ac84297067aeaa662c1f1af42ed443ee7136c6d1e0ba7633294dad137b1573048031ec2025-01-10T06:39:33+01:000cc4mVulkan: Fix float16 use on devices without float16 support + fix subgroup_size_control validation error (#11161)
1349ee7136c6d1e0ba7633294dad137b1573048031ecc6860cc7346c90219475e4467bb8a288e0df975c2025-01-10T09:58:08+08:00Molly Sophiallama: add support for QRWKV6 model architecture (#11001)
1350c6860cc7346c90219475e4467bb8a288e0df975c1204f9727005974587d6fc1dcd4d4f0ead87c8562025-01-10T05:43:03+05:30Akarshan BiswasSYCL: Refactor ggml_sycl_compute_forward (#11121)
13518eceb888d7b7f5e93d20a4f85ca6511022b87040f8feb4b01af374ad2fce302fd5790529c615710b2025-01-09T11:28:29+01:00Daniel Beveniusserver : add tooltips to settings and themes btn (#11154)
13528d59d911711b8f1ba9ec57c4b192ccd2628af0338a1d9c25fafbaf4182dd0b785dd6303ee40d55bc2025-01-09T04:03:28+08:00hydaifix: add missing msg in static_assert (#11143)
13538a1d9c25fafbaf4182dd0b785dd6303ee40d55bc1bf839b1e8b9d043306c65eddd9021fe4337733e2025-01-08T12:54:58-06:00Vinesh Janarthanangguf-py : move scripts directory (#11116)
13541bf839b1e8b9d043306c65eddd9021fe4337733ef7cd13301c2a88f97073fd119072b4cc92c08df12025-01-08T18:47:05ZEric CurtinEnhance user input handling for llama-run (#11138)
135580ccf5d725571035b454659e3c1b4b2b07b65e71a3c1232c3f475f0a77b9cc5225516ac31c567a062025-01-08T12:07:20+01:00Xuan Son Nguyenci : pin dependency to specific version (#11137)
13568cef75c743ba13ebbd6d380c531200c768a8b8aa0d52a69e4bf0d6181beec7853307bdcdeec9905b2025-01-08T16:24:19+05:30amritahs-ibmllamafile : ppc64le MMA INT8 implementation (#10912)
13570d52a69e4bf0d6181beec7853307bdcdeec9905b02f04301417e7fb44fa1025bc1b0aef866e2ca892025-01-08T11:29:34+02:00Georgi Gerganovci : fix cmake option (#11125)
1358bec2183f2c8d37cf1278c11d1adb9311e9eaa24253ff6b9b9fb25ed0ec0a213e05534fe7c3d0040f2025-01-08T16:17:29+08:00ag2s20150909fix: Vulkan shader gen binary path when Cross-compiling (#11096)
135953ff6b9b9fb25ed0ec0a213e05534fe7c3d0040f017cc5f446863316d05522a87f25ec48713a94922025-01-07T18:01:58+01:00Johannes GäßlerGGUF: C++ refactor, backend support, misc fixes (#11030)
1360017cc5f446863316d05522a87f25ec48713a9492a3d50bc022bedd6c7754c24749a1fef4d2d60c7c2025-01-07T16:11:57+01:00Diego Devesaggml-backend : only offload from host buffers (fix) (#11124)
1361a4dd490069a66ae56b42127048f06757fc4de4f7c0d6f790d07aa78be15584ec394ac20739ade93b2025-01-07T08:37:02+02:00Radoslav Gerganovrpc : code cleanup (#11107)
1362c0d6f790d07aa78be15584ec394ac20739ade93bdc7cef9f373f2a24b851f0df7a618c5209e593fa2025-01-07T11:56:07+05:30Akarshan BiswasSYCL: Use get_multi_ptr instead of deprecated get_pointer in wkv6 (#11087)
1363dc7cef9f373f2a24b851f0df7a618c5209e593faecebbd292d741ac084cf248146b2cfb17002aa1d2025-01-06T22:45:28ZEric Curtinllama-run : fix context size (#11094)
136496be8c32649378a23031630a48c440f3a5d0839be6e7c75d94adf4d39e846d30807c531ff22865e72025-01-06T16:34:49+01:00Xuan Son Nguyengithub : add cmd line field to bug report (#11090)
1365e6e7c75d94adf4d39e846d30807c531ff22865e709186fabbe05236f2b9446ba6c643cb737540d102025-01-06T15:36:08+02:00Georgi Gerganovserver : fix extra BOS in infill endpoint (#11106)
136647182dd03fe04a4ffda5d7f4c8a109ae0056cf563e6e7a6bc2c4b980a0cf0fcb5cb3b79a965b5f142025-01-06T10:55:18+02:00Georgi Gerganovllama : update llama_model API names (#11063)
1367ae2f606bb598b287f5fb69c9fdfc98b86598c6cc727368c60f2ebf2d6a7473a4a9f80957ab063a8e2025-01-06T10:52:38+02:00Georgi Gerganovmmap : fix fileno macro clash (#11076)
1368727368c60f2ebf2d6a7473a4a9f80957ab063a8e5047dd3546951dea3d65c02257d06c46c86623382025-01-06T10:52:15+02:00Georgi Gerganovllama : use LLAMA_TOKEN_NULL (#11062)
13695047dd3546951dea3d65c02257d06c46c866233846e3556e01b824e52395fb050b29804b6cff2a7c2025-01-06T10:52:01+02:00Georgi Gerganovllama : use _impl suffix instead of _internal (#11060)
1370f922a9c542ee117550a168395c63ea79261f5c9946be942214e295cd34660bbbd6b846155d1c36a02025-01-04T16:10:30Zmatt23654[GGML][RPC] Support for models with non-512-aligned tensors over RPC. (#11047)
1371db68c93b57bfdf6da1fbdae81080382d6998cbc9c31fc8b966817b2f0b277fd28e04a189e388972a2024-12-19T03:50:12+01:00Daniel Beveniusggml : improve inputs log sched_print_assignments (ggml/1053)
1372c31fc8b966817b2f0b277fd28e04a189e388972a4b0c638b9a68f577cb2066b638c9f622d91ee6612025-01-04T10:17:31+02:00Gilad S.fix: Vulkan shader gen binary path (#11037)
1373f66f5829276650cd83a087ab2cfed1a760183ea12f0ee84b9b02d2a98742308026f060ebdc2423f12025-01-03T10:18:53+02:00Georgi Gerganovllama : refactor `src/llama.cpp` (#10902)
13742f0ee84b9b02d2a98742308026f060ebdc2423f10da5d860266c6928b8c9408efbd264ae59fedda62025-01-02T18:06:12+01:00Pierrick Hymbertserver: bench: minor fixes (#10765)
13750da5d860266c6928b8c9408efbd264ae59fedda6a45433ba209ee0b33d02c7dc4c31f29894ad83a62025-01-02T15:05:18+01:00Xuan Son Nguyenserver : allow using LoRA adapters per-request (#10994)
13760827b2c1da299805288abbd556d869318f2b121e45095a61bfd164e87563a0dc0fbd7b0e9891590b2024-12-31T19:53:33+05:30Srihari-mcwggml : fixes for AVXVNNI instruction set with MSVC and Clang (#11027)
137745095a61bfd164e87563a0dc0fbd7b0e9891590b5896c65232c7dc87d78426956b16f63fbf58dcf62024-12-31T15:22:01+01:00Xuan Son Nguyenserver : clean up built-in template detection (#11026)
1378bc7b1f86324279a3dabb705c04ad754a2b27df166e1531aca5ed17f078973b4700fcdadbda4a34a52024-12-31T19:04:48+08:00ymckiconvert : fix Llama-3_1-Nemotron-51B rope settings (#11008)
13796e1531aca5ed17f078973b4700fcdadbda4a34a5716bd6dec3e044e5c325386b5b0483392b24cefe2024-12-31T11:46:06+11:00Petercommon, examples, ggml : fix MSYS2 GCC compiler errors and warnings when building with LLAMA_CURL=ON and GGML_OPENCL=ON (#11013)
1380c250ecb3157f3bae0a45f44c3c953b5414d4c2f7a813badbbdf0d38705f249df7a0c99af5cdee6782024-12-30T20:35:13+08:00ag2s20150909android : fix llama_batch free (#11014)
1381a813badbbdf0d38705f249df7a0c99af5cdee678fdd21889123bec62b1db3b2fc22b5a4abab321742024-12-29T03:16:34-06:00Jeff Bolzvulkan: im2col and matmul optimizations for stable diffusion (#10942)
138216cdce7b68218959e0658e2f95b4572573d5008ed79d8f39b4da6deca4aea8bf130c6034c482b3202024-12-28T15:08:54ZAlexey Parfenovserver : fix token duplication when streaming with stop strings (#10997)
1383d79d8f39b4da6deca4aea8bf130c6034c482b320d283d02bf254a7f2991e1502066330cc0d4321a62024-12-26T10:54:44-05:00Evevulkan: multi-row k quants (#10846)
1384d283d02bf254a7f2991e1502066330cc0d4321a69ba399dfa7f115effc63d48e6860a94c9faa31b22024-12-27T00:59:11+11:00Peterexamples, ggml : fix GCC compiler warnings (#10983)
13852cd43f4900ba0e34124fdcbf02a7f9df25a10a3d09fe2e76137dde850b13313f720e7ffa17efdefa2024-12-24T18:54:49+01:00Djip007ggml : more perfo with llamafile tinyblas on x86_64 (#10714)
138609fe2e76137dde850b13313f720e7ffa17efdefa30caac3a68a54de8396b21e20ba972554c5872302024-12-24T19:39:49+03:00NeverLuckyserver: allow filtering llama server response fields (#10940)
13873327bb0f8dea381118f8e66c18ea14db56d3b94232d6ee6385b3fc908b283f509b845f757a6e72062024-12-24T04:05:17+01:00Diego Devesaggml : fix arm enabled features check (#10961)
138832d6ee6385b3fc908b283f509b845f757a6e720614b699ecde8f1e9e251ebff9eca39ebc5603b83b2024-12-23T20:25:52+01:00Diego Devesaggml : fix const usage in SSE path (#10962)
138914b699ecde8f1e9e251ebff9eca39ebc5603b83b485dc01214f266afff7004bc702498b491abc4042024-12-23T12:52:25+01:00Xuan Son Nguyenserver : fix missing model id in /model endpoint (#10957)
1390b92a14a841fb4dfaf27b29d982ec8ba5289a3bff6f0c9e034bb398915a6617ee4acc62adb87d387d2024-12-23T08:35:44+08:00Yun Doullama : support InfiniAI Megrez 3b (#10893)
13917024d59e6a572730626cb11896829d115043a1b17c0e28585843b366864b43b48f92425e2ea17df62024-12-22T16:20:11-08:00yuri@FreeBSDggml : fix run-time on FreeBSD in get_executable_path() (#10948)
13927ae33a616f44ecc081f3dcb589be20962d1d4a92ebdee9478ca7ba65497b9b96f7457698c6ee51152024-12-23T01:09:58+03:00Billel Mokeddemllama : add Falcon3 support (#10883)
1393ebdee9478ca7ba65497b9b96f7457698c6ee51155cd85b5e008de2ec398d6596e240187d627561e32024-12-22T03:44:01-06:00Jeff Bolzvulkan: build fixes for 32b (#10927)
1394a91a41364b25705dbb81ae996bc35c3440c63b35e34c5af43f941f0ddb92466776339897295aca112024-12-21T01:04:45-06:00Jeff Bolzvulkan: optimize coopmat2 dequant functions (#10855)
1395eb5c3dc64bd967f2e23c87d9dec195f45468de600ca416c91aea4549d9c77e3efeca403e15aa6c752024-12-20T21:01:28+05:30Akarshan BiswasSYCL: Migrate away from deprecated ggml_tensor->backend (#10840)
13960ca416c91aea4549d9c77e3efeca403e15aa6c7521ae3b9be83820565d1a720999b7f63ce95b49202024-12-20T14:12:06+01:00Xuan Son Nguyenserver : (UI) fix copy to clipboard function (#10916)
139721ae3b9be83820565d1a720999b7f63ce95b49200a11f8b7b5c39fdf6e91ef9674bc68ff08681af72024-12-20T13:31:28+01:00Diego Devesaggml : add test for SVE and disable when it fails (#10906)
13980a11f8b7b5c39fdf6e91ef9674bc68ff08681af7d408bb9268a988c5a60a5746d3a6430386e7604d2024-12-20T17:44:58+08:00Molly Sophiaconvert : fix RWKV v6 model conversion (#10913)
139957bb2c40cd94c5a09f5210ed8264cc93b21c4b7ea3c33b1dce2d4f25040b75f66629104bd1e401282024-12-19T15:40:08+01:00Xuan Son Nguyenserver : fix logprobs, make it OAI-compatible (#10783)
1400a3c33b1dce2d4f25040b75f66629104bd1e401282fffc52b50992ac5bc64db19d33c39cbc06f52cf2024-12-19T14:20:41+01:00Adrien Gallouëtggml: fix arm build with gcc (#10895)
14012fffc52b50992ac5bc64db19d33c39cbc06f52cf7585edbdebd02861e0994dae67c9338731fb3fc52024-12-19T06:04:51-07:00Sukriti Sharmallama : fix Roberta embeddings (#10856)
14027585edbdebd02861e0994dae67c9338731fb3fc5cd920d0ac38ec243605a5a57c50941140a193f9e2024-12-19T10:37:12+01:00fairydreamingconvert : Add support for Microsoft Phi-4 model (#10817)
14037909e8588ddf70820adf1f325490eb3f67b328759177484f589d770ffc4e655b9819124d6a22c1d92024-12-19T02:58:00ZEric Curtinllama-run : improve progress bar (#10821)
14049177484f589d770ffc4e655b9819124d6a22c1d90bf2d10c5514ff61b99897a4a5054f846e384e1e2024-12-18T23:21:42+01:00Diego Devesaggml : fix arm build (#10890)
14050bf2d10c5514ff61b99897a4a5054f846e384e1e7bbb5acf125d1d2840cac7d31b9aaa72210dd5ec2024-12-18T19:27:21+02:00Georgi Gerganovtts : add OuteTTS support (#10784)
14067bbb5acf125d1d2840cac7d31b9aaa72210dd5ec152610eda91217ac409342cd976d05f5114ad39f2024-12-18T04:00:07-10:00Gaetan Bissonserver: avoid overwriting Authorization header (#10878)
1407152610eda91217ac409342cd976d05f5114ad39f0e70ba686e6c717a0aa41d88284e2a392c2bd0cd2024-12-18T13:01:41+02:00Georgi Gerganovserver : output embeddings for all tokens when pooling = none (#10861)
14086b064c92b4c0228e333193c167f2c98d2ec8d9bc4da69d1abd15263061aff94c10f205836a96a4bc2024-12-18T00:35:00-08:00redbearddocs: Fix HIP (née hipBLAS) in README (#10880)
14098dd19a48129d578972ea3d98896edbbf492891a9130d0c90bd26b25e3a713b17a61a5d4eb0a664052024-12-16T19:34:38+09:00gn64vulkan : fix soft_max.comp division by zero (whisper/2633)
1410130d0c90bd26b25e3a713b17a61a5d4eb0a664053919da8e335dbfd0741d239932a9b9e72061bf272024-12-14T03:23:08+01:00Daniel Beveniusggml : remove return from ggml_gallocr_allocate_node (ggml/1048)
14113919da8e335dbfd0741d239932a9b9e72061bf270006f5a74a59945f22ff966e723c3d566b3ca8d02024-12-13T08:19:38+01:00Daniel Beveniusggml : add check for grad_accs (ggml/1046)
14120006f5a74a59945f22ff966e723c3d566b3ca8d005c3a444b8b017b01b366b725ba22c740aae6b382024-12-17T18:35:42+02:00Georgi Gerganovggml : update ggml_backend_cpu_device_supports_op (#10867)
1413227d7c5a7f4cc7734fde8a4ef4382d613486d3c87b1ec53f56bb72c49e4c8434157895f94d3709c22024-12-17T09:52:09+01:00Xuan Son Nguyenserver : (UI) fix missing async generator on safari (#10857)
14147b1ec53f56bb72c49e4c8434157895f94d3709c2160bc039c862c10b9938269a90ddb09d794a7b0d2024-12-17T05:52:55ZEvevulkan: bugfixes for small subgroup size systems + llvmpipe test (#10809)
1415160bc039c862c10b9938269a90ddb09d794a7b0d08ea539df211e46bb4d0dd275e541cb591d5ebc82024-12-17T05:00:46+08:00Zhiyuan Lirwkv6: add wkv6 support for Vulkan backend (#10829)
1416644fd71b44c4cdbfc6482fbf0353d289c3bc29e64ddd199f6f6b980e0a7ed9f9b44efeae2fbdf5c42024-12-16T12:31:14+02:00Georgi Gerganovsampling : refactor + optimize penalties sampler (#10803)
1417a0974156f334acf8af5858d7ede5ab7d7490d41587cf323cef80f6aa530f047ab05b539ebc6b7e3c2024-12-16T00:02:46+07:00Valentin Mamedovllama : add Deepseek MoE v1 & GigaChat models (#10827)
14185478bbcd173e7027af7689493c7421719f5c43dfb5ae1ddff93403300fc79c7ab5ee73b8cfbb34572024-12-15T05:55:54-06:00Vinesh Janarthananserver: (UI) add syntax highlighting and latex math rendering (#10808)
141989d604f2c87af9db657d8a27a1528bc4b7579c29e52aba537a34d51a65cddec6bc6dafc9031edc632024-12-14T22:29:45ZMichelle Tanserver: Fix `has_next_line` in JSON response (#10818)
1420ba1cb19cdd0d92e012e0f6e009e0620f854b6afd56eea0781cbd2608ed8ff524955495569b9264be2024-12-14T20:43:46+08:00HimariOllama : add Qwen2VL support + multimodal RoPE (#10361)
142156eea0781cbd2608ed8ff524955495569b9264bea76c56fa1a3d27467eb97468d8c3b2fe1243b61a2024-12-13T23:21:49+01:00cdukRemoves spurious \r in output that causes logging in journalctl to treat lines as binary and therefore hidden by default (#10771)
1422a76c56fa1a3d27467eb97468d8c3b2fe1243b61ac27ac678dd393af0da9b8acf10266e760c8a09122024-12-13T12:23:52-08:00lhezIntroducing experimental OpenCL backend with support for Qualcomm Adreno GPUs (#10693)
142311e07fd63bac1cb642380a7a3eac03fd8703e9484601a8bb6784d2ab8b4b605354b51979fbeea1d32024-12-13T18:23:50+01:00Corentin REGALfix: graceful shutdown for Docker images (#10815)
14244601a8bb6784d2ab8b4b605354b51979fbeea1d39f35e44592a7646a5803620eb6a3f0ed5ac905532024-12-13T15:48:44+01:00Jett Janiakgguf-py : numpy 2 newbyteorder fix (#9772)
14259f35e44592a7646a5803620eb6a3f0ed5ac9055364ae0655114f84f11a724bc6878c6f8f4a55560b2024-12-13T12:56:07Z谢乃闻Fix crash caused by ggml_backend_load_all when launching on Android Activity (#10812)
142664ae0655114f84f11a724bc6878c6f8f4a55560b83ed24a97b500ccdb32b90b94e6f9621ad8db79e2024-12-13T08:42:04ZEvevulkan: small mul_mat_vec optimizations (#10665)
142783ed24a97b500ccdb32b90b94e6f9621ad8db79ed583cd03f663701858ba152a334cbb467fabe3422024-12-13T12:12:15+05:30Akarshan BiswasSYCL: Reduce most of the compiler warnings (#10748)
1428d583cd03f663701858ba152a334cbb467fabe342adffa6ffd59997da59f62b72d2b79fc37e085e842024-12-13T01:04:19+01:00Karol Kontnyggml : Fix compilation issues on ARM platform when building without fp16 (#10811)
1429cb13ef85a444eb52a3f1b82dce198ceb256065834064c0e3b6c27440f5d12b7caaf90b4088c28c612024-12-12T19:02:49+01:00Diego Devesaremove CMAKE_WINDOWS_EXPORT_ALL_SYMBOLS (#10797)
1430dc5301d565b7d0b2c691f7df13099aab3997479c9fdb1243049aa7e8211693f116daf2052d47507d2024-12-12T18:35:37+01:000cc4mVulkan: Add VK_EXT_subgroup_size_control support to ensure full subgroups for coopmats (#10721)
1431235f6e14bf0ed0211c51aeff14139038ae1000aa1a31d0dc00ba946d448e16ecc915ce5e8355994e2024-12-11T20:52:14+01:00Xuan Son Nguyenserver : (UI) add tok/s, get rid of completion.js (#10786)
1432484d2f31aed34ff9f096e3961125762e81d9b7d64b4d92b0986e3b627b9a9ef4782973108bf476912024-12-11T22:48:04+09:00kallewoofbug-fix: snprintf prints NULL in place of the last character (#10419)
14334b4d92b0986e3b627b9a9ef4782973108bf4769143041d2eb32623d5b6ca734313327abe96f731462024-12-11T10:47:43ZCentricStormdocs: fix server documentation formatting (#10776)
143443041d2eb32623d5b6ca734313327abe96f73146b685daf3867c54e42a9db484d7b92619021d45102024-12-11T02:47:21+02:00Gilad S.ggml: load all backends from a user-provided search path (#10699)
1435dafae66cc242eb766797194d3c85c5e502625623ae4b922614d452477cf5d2fb8cad247c9c12596c2024-12-10T19:33:23ZEvevulkan: dynamic subgroup size for the remaining k quants (#10745)
1436750cb3e246f7e544124cf18cb0c5e0c8b7e38738a86ad841f103e471ac0fd7ee8852d1eb5015ce892024-12-10T18:23:24+01:00Andreas KieslingerCUDA: rename macros to avoid conflicts with WinAPI (#10736)
1437a05e2afcc241c1ecd38ec5cb4c579d90cdf3f91826a8406ba9198eb6fdd8329fa717555b4f77f05f2024-12-10T11:22:20-06:00Jeff Bolzvulkan: disable spirv-opt for coopmat shaders (#10763)
143826a8406ba9198eb6fdd8329fa717555b4f77f05fc37fb4cf62ddf0d33562c4c4a4d6fb45e32ad3b62024-12-09T20:07:12+01:00Johannes GäßlerCUDA: fix shared memory access condition for mmv (#10740)
1439c37fb4cf62ddf0d33562c4c4a4d6fb45e32ad3b63d98b4cb226c3140bd1ae6c65ed126b7d90332fa2024-12-09T23:10:19+05:30Srihari-mcwChanges to CMakePresets.json to add ninja clang target on windows (#10668)
14403d98b4cb226c3140bd1ae6c65ed126b7d90332fa1a05004743e00aca400833be625f0ec8cce176a72024-12-09T01:24:01-06:00Jeff Bolzvulkan: fix compile warnings (#10731)
1441ce8784bdb153ff7794dde5a50b0ebfa51baa6171e52522b8694ae73abf12feb18d29168674aa1c1b2024-12-08T23:04:29+01:00Xuan Son Nguyenserver : fix format_infill (#10724)
144206d70147e6480c021e493c442ae0f0d83ae366de43ed389a3f102517e6f7d5620d8e451e88afbf272024-12-08T19:19:19+01:00stduhpfVulkan: fix NaN in tanh.comp with AMD proprietary driver on Windows (#10723)
144343ed389a3f102517e6f7d5620d8e451e88afbf27ecc93d0558fc3ecb8a5af69d2ece02fae4710ade2024-12-08T12:14:54+01:00Diego Devesallama : use cmake for swift build (#10525)
14443573fa8e7b7f0865638b52b4e9b4d2006f0558a2d9c3ba2b7749c00df477599aa141a98b4521aa2c2024-12-07T20:21:09+01:00Xuan Son Nguyenserver : (refactor) no more json in server_task input (#10691)
1445ce4a7b849388b67d45ad420bdd82d5efcd55647a19d8762ab61df8286367588a80b9c7db4cb568db2024-12-07T18:02:05+02:00Georgi Gerganovserver : various fixes (#10704)
144619d8762ab61df8286367588a80b9c7db4cb568dbc2a16c0bdbe2e51adf318918bad82f0c3e3d6f3b2024-12-07T13:37:50+01:00Djip007ggml : refactor online repacking (#10446)
1447c2a16c0bdbe2e51adf318918bad82f0c3e3d6f3b3df784b3050f657ea681f804187ce5bddb433e882024-12-07T11:52:44+02:00Georgi Gerganovserver : fix free of spec context and batch (#10651)
14483df784b3050f657ea681f804187ce5bddb433e8886a1934978ce5daffc7e5b4251f6540ee5e7b47b2024-12-07T10:24:15+01:000cc4mVulkan: VK_KHR_cooperative_matrix support to speed up prompt processing (#10597)
14496c5bc0625fae6909cb40def15bc4bb45db6f7f4d7736837d62efed1dbebfe579472fca041eda12d62024-12-06T11:14:32+01:00Xuan Son Nguyenserver : (refactoring) do not rely on JSON internally (#10643)
14507736837d62efed1dbebfe579472fca041eda12d6c9c6e01daedac542b174c235872569fce53859822024-12-05T23:36:41+02:00Plamen Minevfix(server) : not show alert when DONE is received (#10674)
1451f112d198cd9953b633ac662c2705d6e4234387171da7b765692764a8b33b08da61cbee63812a7bd92024-12-05T03:49:20+05:30aryantandon01Update deprecation-warning.cpp (#10619)
14521da7b765692764a8b33b08da61cbee63812a7bd959f4db10883a4f3e855cffbf2c3ab68430e952722024-12-04T22:38:20+02:00Georgi Gerganovserver : fix speculative decoding with context shift (#10641)
14532803540814bf0a4e44d0960ff6afda6bac971c17253b7fde910731104670724391bfbcb94d97d0c32024-12-04T14:40:44+01:00Diego Devesaggml-cpu : fix HWCAP2_I8MM value (#10646)
1454253b7fde910731104670724391bfbcb94d97d0c38d0cfd554a9ae545ff94d27e04458f537b4e8c0e2024-12-04T09:45:48ZltoniazziFix HF repo commit to clone lora test models (#10649)
145598036d5670f21e9b9a99d5e3dbb3bf7589f5c4e3cd2f37b304f8e88b9de8424b31078b97f9cf7c602024-12-04T09:22:50+08:00Wang Ran (汪然)fix typo of README.md (#10605)
145691c36c269bca75b2d08119c653512cd20b4ea2ba1cd3df46bd49a0c1c78da8b68c956448a73b74762024-12-03T19:38:44+01:00Xuan Son Nguyenserver : (web ui) Various improvements, now use vite as bundler (#10599)
1457efb6ae963031709fc331e6e48cc4606ac8f9c3a7667d70d1704dfa6977505f5d01d4638669b90dce2024-12-02T19:27:24+01:00PABfeat: add `GGML_UNARY_OP_ARGMAX` Metal kernel (ggml/1019)
145882bca2257b3cec72676abb26011f1b99fcdab29d0115df2f65ac7c64dd0e5915c72ecc4a9343a1302024-12-03T12:50:08+02:00Nikolaos Pothitosreadme : add option, update default value, fix formatting (#10271)
1459515d4e53727924e48774f45ecb15bdacbf851e13844e2e1feec887c803845a3b8762f3b15979b0952024-12-03T11:21:43+02:00Georgi Gerganovgithub : minify link [no ci] (revert)
146070b98fadbc8c07a0144f3b50a4d7ab7e2aeff878642330ac7cea11dc1f9d3df2b8f3dbd10b5e3f3e2024-12-03T11:20:00+02:00Georgi Gerganovserver : fix default draft model parameters (#10586)
1461642330ac7cea11dc1f9d3df2b8f3dbd10b5e3f3e8648c521010620c2daccfa1d26015c668ba2c7172024-12-02T22:10:19+01:00Xuan Son Nguyenllama : add enum for built-in chat templates (#10623)
14628648c521010620c2daccfa1d26015c668ba2c71764ed2091b24b2f9747148fdf49a34ed5938762c32024-12-02T21:22:53+02:00Georgi Gerganovmake : deprecate (#10514)
1463991f8aabeec89d801300bb179e52013fb0eb05844cb003dd8d1f37523120a21e4b1a50a2adcb8c842024-12-02T12:34:11+05:30Akarshan BiswasSYCL: Fix and switch to GGML_LOG system instead of fprintf (#10579)
1464917786f43d0f29b7c77a0c56767c0fa4df68b1c55e1ed95583ca552a98d8528b73e1ff81249c2bf92024-12-01T22:09:49ZJuk ArmstrongAdd `mistral-v1`, `mistral-v3`, `mistral-v3-tekken` and `mistral-v7` chat template types (#10572)
14655c7a5aa0c32eb19ce03e178560797db5875d76923420909dffa50e70660524797a1e715a717684d22024-12-01T10:11:42-08:00Wang Qinci: add error handling for Python venv creation in run.sh (#10608)
14663420909dffa50e70660524797a1e715a717684d286dc11c5bcf34db2749d8bd8d4fa07a542c94f842024-12-01T16:12:41+01:00Diego Devesaggml : automatic selection of best CPU backend (#10606)
146743957ef203b4c9ceaee42c176b3ef44ea4359c850c39f44d70d058940fe2afe50cfc789e3e44d7562024-11-30T19:19:44-08:00Wang Qinbuild: update Makefile comments for C++ version change (#10598)
1468abadba05be52cccf6c0da49534e37f6062ce8ded0533e7fb3842a523f64dc533bd7bd7147ec2c63a2024-11-30T09:47:07+02:00Georgi Gerganovreadme : refresh (#10587)
14690533e7fb3842a523f64dc533bd7bd7147ec2c63a7cc2d2c88908fc92b97b28acafb82f7d6e425b852024-11-30T07:00:02ZEvevulkan: Dynamic subgroup size support for Q6_K mat_vec (#10536)
1470b782e5c7d453b3f1fa8dc6c34cde7e2fa946af933a8e9af402f7893423bdab444aa16c5d9a2d429a2024-11-29T21:48:56+01:00Xuan Son Nguyenserver : add more test cases (#10569)
1471f0678c5ff4cb8873d6ff48801475ff270db656fa4b3242bbea172ac0980378496fbc676d44c4f4592024-11-29T16:25:39+02:00Georgi Gerganovggml : fix I8MM Q4_1 scaling factor conversion (#10562)
14724b3242bbea172ac0980378496fbc676d44c4f4590f77aae5608f16780a49926b67be6d56ec4b09bd2024-11-29T21:49:02+08:00Shupei Fanggml-cpu: fix typo in gemv/gemm iq4_nl_4_4 (#10580)
1473266b8519ee6d21e7ba2bf56f5629e20a181fee8b938f6087421889a3af7d0786c64406ced2be81b82024-11-29T09:49:43ZAlberto Cabrera Pérezsycl : Reroute permuted mul_mats through oneMKL (#10408)
1474f095a649ec390e04dfab1b04e646ae8549dafaef678d7994f4da0af3d29046be99950ac999ee97622024-11-29T00:18:02-06:00Jeff Bolzvulkan: get the first command buffer submitted sooner (#10499)
1475890719311b6535e572f15965c6d7ec4ac2537f607281cf13addfae9b64bb2be87e3b5b1914505d632024-11-28T18:15:25+01:00Johannes Gäßlercommon: fix warning message when no GPU found (#10564)
14767281cf13addfae9b64bb2be87e3b5b1914505d63e90688edd004fdb7063f463bd18408ba9ae008dd2024-11-28T23:03:11+08:00Random Flydocs: fix outdated usage of llama-simple (#10565)
1477e90688edd004fdb7063f463bd18408ba9ae008dd76b27d29c22af03172cf211a8a31025c7c828a572024-11-28T15:58:54+01:00Diego Devesaci : fix tag name in cuda and hip releases (#10566)
147876b27d29c22af03172cf211a8a31025c7c828a57eea986f215e1dc490654d012ccf2ab62fe8f606d2024-11-28T14:56:37+02:00Georgi Gerganovggml : fix row condition for i8mm kernels (#10561)
1479eea986f215e1dc490654d012ccf2ab62fe8f606dc202cef1686182a78f8f4e253ab8d0c0ffe2fcc82024-11-28T14:56:23+02:00Georgi Gerganovcmake : fix ARM feature detection (#10543)
1480605fa66c509f9f117bd654cf0b9b3ea08bb86e80b7420131bf8ab3e067bc660439ab1ab18be7edbd2024-11-28T15:25:24+08:00leo-ponyCANN: Fix SOC_TYPE compile bug (#10519)
14819f912511bc9414fa7a3c521378b6388cd932b58d3ad5451f3b75809e3033e4e577b9f60bcaf6676a2024-11-27T22:30:52+01:00Xuan Son Nguyencommon : fix duplicated file name with hf_repo and hf_file (#10550)
14829e2301f4a4ef1690bd99360c11de43fe830b1c8dfee824a1a1e35b5c49d482f654613addade617642024-11-27T11:22:14+02:00Georgi Gerganovmetal : fix group_norm support condition (#0)
14835b3466bedfa84aa29c6871c7254467550186ecc6249a7902ec710c8d027b9cc0ed10219d2b4184f82024-11-27T01:30:27-06:00Jeff Bolzvulkan: Handle GPUs with less shared memory (#10468)
1484c9b00a70b080d5c0668608024afc3e0e2fed822fde5097351caffb3deaea3393633609df49ef41d02024-11-26T22:12:10+01:00Diego Devesaci : fix cuda releases (#10532)
1485de5097351caffb3deaea3393633609df49ef41d05a349f2809dc825960dfcfdf8f76b19cd0345be72024-11-26T12:55:29-08:00Shane AAdd OLMo 2 model in docs (#10530)
1486be0e350c8b69632b27d5fb41fa064fa256dd7fbf249cd93da3df9c8fa78869b0522526d1625aca912024-11-26T19:27:28+01:00Tristan DruyenFix HIP flag inconsistency & build docs (#10524)
1487904109ed0d97c9b656a5e8bf612925f739bb816645abe0f74ee281aea6e5283c1e738061256cfcae2024-11-26T09:45:05-06:00Jeff Bolzvulkan: fix group_norm (#10496)
148845abe0f74ee281aea6e5283c1e738061256cfcae0bbd2262a3263f37385297b30de37941836e57f72024-11-26T16:20:18+01:00Xuan Son Nguyenserver : replace behave with pytest (#10416)
1489ab96610b1e58684bc5e8b810130c4cf6d8252e217db3846a94ce7683b3e8120abe427457edf840c92024-11-26T14:18:08+02:00Georgi Gerganovcmake : enable warnings in llama (#10474)
149084e1c33cde9e0a7aafcda2d4f21ba51c300482d7811872a59daefb25fc0c4326bcb6d8ae893c2f7c2024-11-26T13:36:40+02:00Georgi Gerganovserver : fix parallel speculative decoding (#10513)
14910eb4e12beebabae46d37b78742f4c5d4dbe52dc10cc63754b831d3a6c37bc5d721d12ce9540ffe762024-11-26T10:47:20+09:00Junil Kimvulkan: Fix a vulkan-shaders-gen arugment parsing error (#10484)
14929fd8c2687f5aa2f095ac6e12a376e1c0583888e847f931c8f9a26c072d71224bc8013cc66ea9e4452024-11-25T22:28:27+02:00Georgi Gerganovserver : add more information about error (#10455)
149347f931c8f9a26c072d71224bc8013cc66ea9e445106964e3d266740f571b5aad7b57545b4a901ac92024-11-25T21:50:07+02:00Georgi Gerganovserver : enable cache_prompt by default (#10501)
149410bce0450f0c4d80087e06312b9dbbab3e87f16b1f922254f0c984a8fb9fbaa0c390d7ffae49aedb2024-11-25T19:30:06+01:00Diego Devesallama : accept a list of devices to use to offload a model (#10497)
14951f922254f0c984a8fb9fbaa0c390d7ffae49aedba9a678a6b2264e5895533217b0cf8f250534cc582024-11-25T19:18:37+01:00Johannes GäßlerGithub: update issue templates [no ci] (#10489)
1496f6d12e7df8fe64384f1939976871252e6422a01eb756441104ca8384640d6df22ba4ea6dab7ad7992024-11-25T15:17:32+02:00Georgi Gerganovtests : fix compile warning
14975a8987793f3e7c1fbfa6806bfcd17d578071b6c9d9d54e498d38ec99bbc0031022f9c92711e97bbc2024-11-25T17:31:10+08:00Neo Zhang Jianyu[SYCL] Fix building Win package for oneAPI 2025.0 update (#10483)
1498d9d54e498d38ec99bbc0031022f9c92711e97bbccce5a9007572c6e9fa522296b77571d2e50713572024-11-25T09:58:41+02:00Georgi Gerganovspeculative : refactor and add a simpler example (#10362)
1499dc39012cbaf8752fabecaeb60af78ccdd1dfb73b9336db462c0c34bbe2055413fe4e16442626c38b2024-11-24T16:10:26+01:00Diego Devesallama : fix op mul check with command-r-plus (#10476)
150096fa2c5e2d6cb5319f34c3a7fb0cec05694b22f155ed008b2de01592659b9eba068ea01bb2f721602024-11-24T09:09:22+09:00momongafix gguf-py: Conversion error when multiple licenses are configured (#9807)
1501599b3e0cd40432cd1975a8906f3db70bbe53b627c18610b4ee29ca056bb4f2d375a4ad1b16f44ef72024-11-22T08:32:40+01:00Johannes GäßlerGitHub: ask for more info in issue templates (#10426)
1502a5e47592b6171ae21f3eaa1aba6fb2b7078750631bb30bf28cb5a7adf111bc41c935bdaf128397e72024-11-21T18:18:50+01:00Diego Devesacuda : optimize argmax (#10441)
150302e4eaf22f229a114054b053a9eff614836536709abe9eeae98b11fa93b82632b264126a010225ff2024-11-20T14:56:04+01:00Johannes Gäßlerggml-opt: fix data corruption (ggml/1022)
15049abe9eeae98b11fa93b82632b264126a010225fff95caa79546271722ada703da20ffb1cfcd21fed2024-11-20T13:47:36-06:00Jeff Bolzvulkan: predicate max operation in soft_max shaders/soft_max (#10437)
15051bacb9f62514b520bdf74ed6feb46c80508dad38ad21c9e1f14d82b8c15ae369a8839019e3d498b42024-11-20T01:11:00-06:00Jeff Bolzvulkan: further optimize mul_mat_vec using larger loads (#10387)
15063952a221af54b8a6549bc2bd4a7363ef7ad3081e42ae10bbcd7b56f29a302c86796542a6dadf46c92024-11-19T23:18:17+01:00Anthony Van de GejuchteFix missing file renames in Makefile due to changes in commit ae8de6d50a (#10413)
15073ee6382d48b07b31e64983969c16019490e197408e752a777b272606f22cb741b03e062de4ddb8fe2024-11-19T14:29:38+01:00Diego Devesacuda : fix CUDA_FLAGS not being applied (#10403)
1508557924f22237c76387a39c4db5abae154d57e754d3481e631661b5e9517f78908cdd58cee63c49032024-11-19T00:50:04ZAlberto Cabrera Pérezsycl: Revert MUL_MAT_OP support changes (#10385)
1509f139d2ea611c5604395c95160d3c53f7c4eaf2202eb76b2a5e4ea395b971a419c95b473ab6f253e42024-11-18T08:28:42-06:00Jeff Bolzvulkan: remove use of null initializer (#10372)
15109b75f03cd2ec9cc482084049d87a0f08f9f0151775207b3a887f91f813de1eb6e9fd135d3cb2b8c62024-11-18T11:02:43+01:000cc4mVulkan: Fix device info output format specifiers (#10366)
151176e9e58b7847112848aa1f40b65d1cbcd6d5f5a3ce2e59ba107cf71ed566040ff20a15d1c58e09c22024-11-17T23:20:42+01:00Johannes GäßlerCUDA: fix MMV kernel being used for FP16 src1 (#10357)
1512ce2e59ba107cf71ed566040ff20a15d1c58e09c2be5caccef945546ee9fd25a151330a88d785faf92024-11-17T12:59:38+01:00Johannes GäßlerCMake: fix typo in comment [no ci] (#10360)
1513be5caccef945546ee9fd25a151330a88d785faf920a780c7b64c38071fe70ad23e16e80c23c0147b2024-11-17T12:25:45+01:00Diego Devesallama : only use default buffer types for the KV cache (#10358)
1514a43178299c2f74f14bcfc659bfd9fd32d931d1f4c3ea58aca406911eb4d409cdbfc76683393442b62024-11-17T21:39:22+13:00FirstTimeEZggml : fix undefined reference to 'getcpu' (#10354)
1515467576b6cc7d2b9220f55bc635aa51469cf26fb5eda7e1d4f54711de1c9b40502d6c88bbc217da602024-11-17T09:06:34+01:00Johannes GäßlerCMake: default to -arch=native for CUDA build (#10320)
1516eda7e1d4f54711de1c9b40502d6c88bbc217da6024203e9dd7355a4a10bc32d959fd0148d37bf6662024-11-17T07:31:17+01:00Diego Devesaggml : fix possible buffer use after free in sched reserve (#9930)
151768fcb4759c0ca2874b59d9c1e6a35ceca1cc04ce8a43e940ab0daaff198809bf9277289994ec62f52024-11-16T21:32:41+02:00Georgi Gerganovggml : fix compile warnings (#0)
1518db4cfd5dbc31c90f0d5c413a2e182d068b8ee3088ee0d09ae6928d0501765cfc4e430b9236730caf2024-11-16T17:58:56+02:00Georgi Gerganovllamafile : fix include path (#0)
1519f245cc28d4eb900efad0bc740145f58d713c6e4f772703c8fffdd83d2e28f60119e83525f11894122024-11-16T10:32:50+02:00Georgi Gerganovscripts : fix missing key in compare-llama-bench.py (#10332)
1520dd3a6ce9f84d21ba05fe98af9f983bdea0398e6c1e58ee1318429a3e97aa66f3034cdfd65ffc6c342024-11-16T14:59:33+13:00FirstTimeEZvulkan : add cmake preset debug/release (#10306)
152189e4caaaf081f4712af61a3e08cb67b406c02b8074d73dc85cc2057446bf63cc37ff649ae7cebd802024-11-16T13:42:13+13:00FirstTimeEZllama : save number of parameters and the size in llama_model (#10286)
152274d73dc85cc2057446bf63cc37ff649ae7cebd804047be74da398acb8717a4d21b77b929ad7ed4f72024-11-16T02:57:00+05:30Srihari-mcwMake updates to fix issues with clang-cl builds while using AVX512 flags (#10314)
1523883d206fbd2c5b2b9b589a9328503b9005e146c909ecbcb596ed8fa97d503d7440f0b3eff872e8f12024-11-15T20:20:54+01:00slarenggml : fix some build issues
152409ecbcb596ed8fa97d503d7440f0b3eff872e8f13225008973579cc6a784890c237e1bfc9de418192024-11-15T15:35:22+02:00Georgi Gerganovcmake : fix ppc64 check (whisper/0)
152518429220bdb344da1bc7df9bc580c7b41b3cd57bf0204a0ec70d50ca60e07bc0096ec1d6508ab0c72024-11-15T11:47:58ZEveAVX BF16 and single scale quant optimizations (#10212)
15269901068ac78838745e604fffb4601d315a610456231f9360d94446cd083b6b116f63991b1328c4842024-11-15T05:48:49-04:00Xuan Son Nguyenserver : (web UI) add copy button for code block, fix api key (#10242)
15274802ad350b8e19cbc7a77269b4494c896f6e08965a54af4d4f588f109f31e456483fdf77096399d92024-11-15T08:38:43+02:00Georgi Gerganovscripts : fix regex in sync [no ci]
15285a54af4d4f588f109f31e456483fdf77096399d91607a5e5b08f4e55f118af3d7de325949d8f18352024-11-15T04:09:12+01:00Romain Biessysycl: Use syclcompat::dp4a (#10267)
15292a82891a853db908679f7b24b04586e6f6393fe0af148c9386da825a60c7038549c121c35ca56b502024-11-14T11:44:15+02:00Georgi Gerganovspeculative : fix out-of-bounds access (#10289)
1530fb4a0ec0833c71cff5a1a367ba375447ce6106eb5ea926dad7f62ebccff7b24784bd1e01a06d13ae2024-11-13T20:00:35+02:00Michael Podvitskiyllama : propagate the results of `graph_compute` (#9525)
15310e712a5acbbdd1593e5aeb86d4f6b896a11b438ca0ec17b32ec6077f5ca22fe833ebdc9b86795a4d2024-11-13T19:15:23+08:00Jhen-Jie Hongserver : fix incorrect res in validate_model_chat_template (#10272)
15322e82ffa4af29f87e7d3d6dff8060a2a79613b72f80dd7ff22fd050fed58b552cc8001aaf968b7ebf2024-11-13T09:40:57ZAlberto Cabrera Pérezsycl : Fixes to broken builds and test-backend-ops (#10257)
153380dd7ff22fd050fed58b552cc8001aaf968b7ebf54ef9cfc726a799e6f454ac22c4815d037716eda2024-11-13T00:58:57-06:00Jeff Bolzvulkan: Optimize contiguous copies (#10254)
153454ef9cfc726a799e6f454ac22c4815d037716edab0cefea58a20020754b7431e3c725625274372a52024-11-11T11:13:51-06:00Jeff Bolzvulkan: Throttle the number of shader compiles during the build step. (#10222)
1535b141e5f6efbab3a00633df88c4f9425bfe8b78ab4b3a9212b602be3d4e2e3ca26efd796cef13c55e2024-11-11T08:38:43+02:00Georgi Gerganovserver : enable KV cache defrag by default (#10233)
1536505f33274d60676320216b662a97672a76ec600e160687b3ed002eee83a04de83a9cd752f928ced12024-11-11T00:42:25+05:00MaggotHATEserver : (web UI) Add back sampler settings (#10239)
1537160687b3ed002eee83a04de83a9cd752f928ced16423c65aa8be1b98f990cf207422505ac5a441a12024-11-10T05:37:56-06:00Jeff Bolzvulkan: Fix newly added tests for permuted mul_mat and 1D im2col (#10226)
153839a334a9aaf2000f93a899d9f43d889e460640eebb38cdd8baf37de1fadab3e867c6ba4ae452eff62024-11-09T11:53:02+02:00Georgi Gerganovmetal : fix build and some more comments (#10229)
1539bb38cdd8baf37de1fadab3e867c6ba4ae452eff6f018acba22095b8995bf6c5ef815b16a3ce4cf1b2024-11-09T11:52:45+02:00Georgi Gerganovmetal : fix F32 accumulation in FA vec kernel (#10232)
1540f018acba22095b8995bf6c5ef815b16a3ce4cf1b46323fa9efd5e6c8aeef8d6eb6c332ee0d95eb132024-11-09T11:26:34+02:00Georgi Gerganovllama : fix Qwen model type strings
154146323fa9efd5e6c8aeef8d6eb6c332ee0d95eb135b359bb1e3585de45bec79fd6c18934897662cdf2024-11-09T11:21:49+02:00Georgi Gerganovmetal : hide debug messages from normal log
15425b359bb1e3585de45bec79fd6c18934897662cdfe89213492d3e01705739789733f0f2d250b4c4492024-11-09T15:35:46+08:00SXXggml: fix zero division in ‘dne’ calculation in CUDA COUNT_EQUAL operator when ‘ne’ is small (#10213)
1543e89213492d3e01705739789733f0f2d250b4c4498fc393f246c550d2481e53323a47644a94e8d01f2024-11-09T12:47:50+05:30amritahs-ibmggml : optimize llamafile cpu matrix multiplication for ppc64le (#10156)
15448fc393f246c550d2481e53323a47644a94e8d01fec450d3bbf9fdb3cd06b27c00c684fd1861cb0cf2024-11-09T15:06:54+08:00haopengscripts : fix pattern and get n_tokens in one go (#10221)
1545ec450d3bbf9fdb3cd06b27c00c684fd1861cb0cf695ad752b2631af84ba321177656705b30c6e4012024-11-08T21:59:46+02:00Georgi Gerganovmetal : opt-in compile flag for BF16 (#10218)
1546841f27abdbbcecc9daac14dc540ba6202e4ffe40d05b3127bd30515955aa4ee2bacdb68ebafe88f42024-11-08T13:47:22+02:00Georgi Gerganovmetal : optimize FA kernels (#10171)
154776c6e7f10551960e4ec9e14e0535b72081f1c7ada71d81cf8c1afb26b166f897c94ee1581f9fac7d2024-11-07T18:44:38-04:00Xuan Son Nguyenserver : minor UI fix (#10207)
1548a71d81cf8c1afb26b166f897c94ee1581f9fac7deec4d71737b32f312e0082b671629a0368e1a20d2024-11-07T17:31:10-04:00Xuan Son Nguyenserver : revamp chat UI with vuejs and daisyui (#10175)
15495107e8cea35be46a27cfc940e6841c0cf81c05252319126a70b541f8670225a04a38202bbdccbedb2024-11-07T08:20:25-07:00wwoodsTMDRY: Fixes clone functionality (#10192)
15502319126a70b541f8670225a04a38202bbdccbedb3bcd40b3c593d14261fb2abfabad3c0fb5b9e3182024-11-07T02:02:08-06:00snadampalfix q4_0_8_8 format for corrupted tokens issue (#10198)
15513bcd40b3c593d14261fb2abfabad3c0fb5b9e3185c333e014059122245c318e7ed4ec27d1085573c2024-11-07T18:19:10+11:00Zhiyuan LiOptimize RWKV6 Operator Naming and Implement Multi-core CPU/ SYCL Acceleration (#10133)
15525c333e014059122245c318e7ed4ec27d1085573cb11f9ba9b8ce319f04b88afe40d264e6b7f4ba462024-11-06T19:53:51+02:00Georgi Gerganovmetal : add BF16 support (#8439)
155394d8cb8be13b7c4d04eeca5a2b956b9148e6f2221dc04b2deed2d2f2ae3aff9b14ae29674dee1fb82024-11-06T12:10:07+01:00Diego Devesametal : fix from ptr buffer name (#10189)
1554a1eaf6a9600bb1608753420ba886a3b0a208ffc0b8deef0ec0af5febac1d2cfd9119ff330ed0b7622024-11-06T10:24:23+02:00Georgi Gerganovmetal : add quantized FA support (#10149)
1555a9e8a9a0306a8093eef93b0022d9f45510490072340736477651095a98a3b10e19b038ec62593a1d2024-11-04T23:17:01+01:00Diego Devesaggml : fix arch check in bf16_to_fp32 (#10164)
1556d5a409e57fe8bd24fef597ab8a31110d390a6392401558b7ba7a08175c153cd3607230f63c8a528e2024-11-04T20:06:58+01:00Diego Devesaggml : fix gelu tables initialization (#10172)
1557401558b7ba7a08175c153cd3607230f63c8a528e9e0ecfb697d297355e43c20559d29bcc71beb0c32024-11-04T17:34:08+01:00Diego Devesaggml : fix q4xx mat mul, increase ggml_aligned_malloc alignment (#10167)
15589e0ecfb697d297355e43c20559d29bcc71beb0c36a066b9978533e2ab9890b7f4f8c0262d91798b32024-11-04T16:33:29+01:00Xuan Son Nguyenserver : clarify /slots endpoint, add is_processing (#10162)
15596a066b9978533e2ab9890b7f4f8c0262d91798b3ea02c753ebf9342114cb173f10b3ffc2af1e7d042024-11-04T09:08:33-06:00snadampalfix build break on arm64 linux (#10166)
1560ea02c753ebf9342114cb173f10b3ffc2af1e7d0405697f670b1ea28b80c39854832ea53527f75c552024-11-04T13:10:23+01:00Diego Devesacuda : clear error after changing peer access (#10153)
1561e2292aaa17cf8530b0d0d899909588c3a095799d9f409893519b4a6def46ef80cd6f5d05ac0fb1572024-11-01T16:55:10+02:00Plamen Minevmetal : fix minor string leaks (ggml/1004)
156208828a6d7d0006a487c9655ba8ace0ebe35ecad11839f69130151ceeac4d01c0ef8964e1fb43bba62024-11-03T15:18:40+02:00Georgi Gerganovmetal : minor fixup in FA kernel (#10143)
156342cadc74bda60afafb45b71b1a39d150ede0ed4d45950415ed985830c59bf42cf9c9216b20cf08ef2024-11-02T16:34:56Zsasha0552server : fix slot selection by lru (#10126)
156445950415ed985830c59bf42cf9c9216b20cf08ef1926d6e39d6f6358bc1a4c52316a560178be72332024-11-02T18:34:00+02:00Georgi Gerganovserver : fix endpoint checks (#10135)
15651926d6e39d6f6358bc1a4c52316a560178be7233b634f8a26fef65210fd9fb2f87e83a2809535e892024-11-02T15:18:56+02:00Georgi Gerganovllama : adjust default context size + print warnings (#10136)
15667554aa4655f44b33a29068f2b18c5976fae45f9da6744e43e80f4be6398fc7733a01642c846dce1d2024-11-02T12:53:17+01:00Xuan Son Nguyenconvert-lora : make `--base` optional (#10110)
1567418f5eef262cea07c2af4f45ee6a88d882221fcbba6f62eb793d6617892d252f5c04d7685d908a382024-11-02T02:33:14+08:00Shupei Fanvulkan : improve ggml_vk_create_buffer error handling (#9898)
1568d865d1478cd4e403f82d793c2afcd0f943412f051804adb0cfee4811eaf633741503d683a46e4c772024-11-01T13:33:14Zsasha0552server : fix smart selection of available slot (#10120)
1569e597e50794f07ec8dc24b9efb18f94ec6386fda085679d37f34f66783cc04664a06c405b28e8e0352024-11-01T11:09:59+08:00Zhenwei Jinbuild: fix build error in Windows env with OneAPI setup (#10107)
15701e9f94994ef908d964cf81069f03d9d3668beb7dc02e5ab2a675c8bc1abc8b1e4cb6a93b26bdcce72024-11-01T00:45:34+01:00Diego Devesaquantize : fix --keep-split (#10114)
1571c02e5ab2a675c8bc1abc8b1e4cb6a93b26bdcce7ab3d71f97f5b2915a229099777af00d3eada1d242024-10-31T22:54:23+01:00Diego Devesallama : fix buffer checks for mamba and rwk (#10111)
1572b9e02e8184f5e6094a9e87eaf040becd404bfc906763f713bb692910e9b2d9d1a82d6959cee2dcf32024-10-30T14:51:21+01:00Diego Devesaggml : fix memory leaks when loading invalid gguf files (#10094)
1573fc83a9e58479e4dd70054daa7afe5184c1bbe545c5b0f4b5d90297f3e729fca7f78ddb25fcab5ddc2024-10-30T15:00:40+08:00xctanggml : add Q4_0_8_8 RISC-V GEMV and GEMM kernels (#10029)
15748f275a7c4593aa34147595a90282cf950a8536908d8ff715367480b856ad86ac3888e9742b13a6fa2024-10-29T17:52:56+09:00Changyeon Kimggml: Add POOL2D OP for GPU acceleration to the Vulkan backend in the MobileVLM model. (#9763)
157561715d5cc83a28181df6a641846e4f6a740f3c7407028f9d74d895da2ca4a1956624e3f07e04e6202024-10-28T10:45:33-07:00arch-btwllama : Add IBM granite template (#10013)
15768841ce3f439de6e770f70319b7e08b6613197ea7cc2983d3753c94a630ca7257723914d4c4f6122b2024-10-27T20:59:58+02:00Georgi Gerganovllama : switch KQ multiplication to F32 precision by default (#10015)
15779e4a2563eadf34e9432d248224d4f43e8495e8fe668750357e66bfa3d1504b65699f5a0dfe3cb7cb2024-10-26T10:33:31+03:00Georgi Gerganovscripts : fix amx sync [no ci]
1578ff252ea48e90e6552010fd74584334fb41bdd387d80fb71f8b8bf69ec095ba281f8248d136d21c762024-10-25T10:07:34-06:00wwoodsTMllama : add DRY sampler (#9702)
1579d80fb71f8b8bf69ec095ba281f8248d136d21c762f8bd2b90133cf37ae752015e1bfd738cc6d01122024-10-25T17:57:54+02:00Michael Podvitskiyllama: string_split fix (#10022)
1580958367bf530d943a902afa1ce1c342476098576b40f2555797f97314de749873cdc29dc102be66e22024-10-24T21:51:22+02:00Xuan Son Nguyenserver : refactor slot input data, move tokenizer to HTTP thread (#10023)
158140f2555797f97314de749873cdc29dc102be66e2167a515651a4b065a16225ffc69564c5674f3d0f2024-10-24T21:23:33+03:00Georgi Gerganovci : fix cmake flags for SYCL
1582167a515651a4b065a16225ffc69564c5674f3d0fc39665f589091903396a442a6ee56613303e03502024-10-24T14:40:23+02:00Johannes GäßlerCUDA: fix insufficient buffer clearing for MMQ (#10032)
1583c39665f589091903396a442a6ee56613303e03500a1c750c80147687df267114c81956757cc143822024-10-24T11:09:36+02:00Johannes GäßlerCUDA: fix MMQ for non-contiguous src0, add tests (#10021)
158480273a306d07ed95059d6130389deacb3b2d7196c19af0acb1fe6d0fdbecadd8483c1fbe5d68d0952024-10-18T09:24:44+02:00Johannes GäßlerCUDA: fix 1D im2col, add tests (ggml/993)
1585c19af0acb1fe6d0fdbecadd8483c1fbe5d68d095ac113a0feee0935b2018312f7bc8d7a646b117ed2024-10-16T20:10:01+02:00Daniel Beveniusggml : remove redundant set of contexts used field (ggml/978)
1586ac113a0feee0935b2018312f7bc8d7a646b117ed4c9388fb96ac2415fbb1239b7ba8346616606e2e2024-10-23T07:09:26-04:00Michael Coppolallama.vim : add classic vim support (#9995)
15874c9388fb96ac2415fbb1239b7ba8346616606e2e873279b1592e433c4d9eb5065091cc98473c7bee2024-10-23T19:33:45+09:00Jun Hee Yoometal : add POOL2D and fix IM2COL (#9943)
1588c8c07d658a6cefc5a50cfdf6be7d72650361230319d900a7565b8f6b0a708836a57d26966cb9efe22024-10-22T16:59:02+02:00Xuan Son Nguyenllama : fix empty batch causing llama_batch_allocr to crash (#9966)
158919d900a7565b8f6b0a708836a57d26966cb9efe211d47057a51f3d9b9231e6b57d0ca36020c0ee992024-10-22T15:31:06+02:00Daniel Beveniusllama : rename batch to ubatch (#9950)
159011d47057a51f3d9b9231e6b57d0ca36020c0ee99c421ac072d46172ab18924e1e8be53680b54ed3b2024-10-22T21:22:26+08:00Molly SophiaRwkv chat template fix (#10001)
15914ff7fe1fb36b04ddd158b2de881c348c5f0ff5e46b8447352df3d662b56280c8fc38d7f0928857872024-10-22T18:33:37+08:00Molly Sophiallama : add chat template for RWKV-World + fix EOT (#9968)
15926b8447352df3d662b56280c8fc38d7f092885787674804a99617b4f90292b4080ecab450ea3d30ba2024-10-22T16:16:01+08:00leo-pony[CANN] Adapt to dynamically loadable backends mechanism (#9970)
1593674804a99617b4f90292b4080ecab450ea3d30bae94a138d644a9b34da61805f7aeb8af595c61b532024-10-22T09:40:02+02:00Daniel Beveniusarg : fix typo in embeddings argument help [no ci] (#9994)
1594e94a138d644a9b34da61805f7aeb8af595c61b53e01c67affe450638162a1a457e2e57859ef6ebf02024-10-22T00:35:25+03:00Georgi Gerganovllama.vim : fix info text display [no ci] (#9787)
159594008cc76075fb4a29ee371e7ac255378d1bce6cdbd5f2f5736aec6ff8fd63df3b351dae23c43e2f2024-10-21T20:12:52+02:00Daniel Beveniusarg : fix attention non-causal arg value hint (#9985)
159655e47786e373c90fc7803e718e3e1dd6d53c3db6bc219750845a59166d79f0d4ee3da1993b369b8a2024-10-21T09:46:40+03:00Georgi Gerganovllama : default sampling changes + greedy update (#9897)
1597bc219750845a59166d79f0d4ee3da1993b369b8a1db8c84fc62857e1e45c1c7ea93bcd5344cb3d312024-10-21T09:37:12+03:00Georgi Gerganovspeculative : fix handling of some input params (#9963)
15981db8c84fc62857e1e45c1c7ea93bcd5344cb3d3145f097645efb11b6d09a5b4adbbfd7c312ac01262024-10-21T14:26:09+08:00Neo Zhang Jianyufix mul_mat_vec_q and *_vec_q error (#9939)
1599cda0e4b648dde8fac162b3430b14a99597d3d74fafd9909a6481402844aecefa8a8908afdd7f52f12024-10-18T23:18:01+02:00Xuan Son Nguyenllama : remove all_pos_0, all_pos_1, all_seq_id from llama_batch (#9745)
160060ce97c9d809f4b040e90b597468b839df5728d08901755ba328643c9ab071c20e1939ea52951a0e2024-10-18T13:34:36+08:00Ma Mingfeiadd amx kernel for gemm (#8998)
16019f45fc1e9950a496febc575cdd196cd5cad000cc99bd4ac28c32cd17c0e337ff5601393b033dc5fc2024-10-17T23:26:32+03:00Georgi Gerganovllama : change warning to debug log
160221942002780352b4a54f4bd3e5eefa3bc7f14fe673afe681aa76e818733fc1f30de082c1d6910bcd2024-10-17T02:34:22+03:00Gilad S.fix: allocating CPU buffer with size `0` (#9917)
160373afe681aa76e818733fc1f30de082c1d6910bcd9e041024481f6b249ab8918e18b9477f873b5a5e2024-10-17T01:36:51+03:00Gilad S.fix: use `vm_allocate` to allocate CPU backend buffer on macOS (#9875)
16049e041024481f6b249ab8918e18b9477f873b5a5edbf18e4de9e7aa496871f1555f9f0c8d845671082024-10-16T19:34:28+02:00Daniel Beveniusllama : suppress conversion from 'size_t' to 'int' (#9046)
1605dbf18e4de9e7aa496871f1555f9f0c8d8456710866c2c93082289325199ae1f773f3b0ab2e399a472024-10-16T19:24:05+02:00Daniel Beveniusllava : fix typo in error message [no ci] (#9884)
160666c2c93082289325199ae1f773f3b0ab2e399a4710433e8b457c4cfd759cbb41fc55fc398db4a5da2024-10-16T09:03:24-07:00Joe Eli McIlvaingrammar : fix JSON Schema for string regex with top-level alt. (#9903)
16071f66b699c48cb5ab3265ed72c48e8549b16742910e41b300ed28f7fe185d938b2e3d56a0bf7411ed2024-10-16T08:35:53ZAlexey Parfenovserver : fix the disappearance of the end of the text (#9867)
1608becfd387f6919d99ec34b76c2522f90ac250c489755a9b2bf00fbae988e03a47e852b66eaddd113a2024-10-16T08:51:46+08:00leo-pony[CANN] Fix cann compilation error (#9891)
1609fbc98b748e7b075e327bcf13237057f647678049dcdd535302fc9702a4709be25f56540d65163a442024-10-15T15:54:55+05:00MaggotHATEsampling : add XTC sampler (#9742)
16101bde94dd024b632f98428f4bf2ce48329513077995c76e8e92ecc93f784b185eafae36a0e7ad2fa32024-10-12T16:06:31+03:00Georgi Gerganovserver : remove self-extend features (#9860)
161195c76e8e92ecc93f784b185eafae36a0e7ad2fa311ac9800aff532715a5bc7991062c68ba3472e6e2024-10-12T14:51:54+03:00Georgi Gerganovserver : remove legacy system_prompt feature (#9857)
161296776405a17034dcfd53d3ddf5d142d34bdbb6577eee341bee09957139789c2d828995953f0fc7ff2024-10-11T15:34:45+02:00Diego Devesaggml : move more prints to the ggml log system (#9839)
16137eee341bee09957139789c2d828995953f0fc7ff0e9f760eb12546704ef8fa72577bc1a3ffe1bc042024-10-10T22:57:42+02:00Diego Devesacommon : use common_ prefix for common library functions (#9805)
1614c81f3bbb051f8b736e117dfc78c99d7c4e0450f6e7022064ab637ccb5f37867196f1802c4a453c912024-10-09T18:49:52+02:00Diego Devesacmake : do not build common library by default when standalone (#9804)
1615e7022064ab637ccb5f37867196f1802c4a453c913dc48fe75ad48f8856118520a267c96f74df8e902024-10-09T17:00:18+03:00Georgi Gerganovperplexity : fix integer overflow (#9783)
1616dca1d4b58a7f1acf1bd253be84e50d6367f492fd458367a90606448a9c0262b276947c9e536086e02024-10-08T14:21:43+02:00Diego Devesaggml : fix BLAS with unsupported types (#9775)
1617458367a90606448a9c0262b276947c9e536086e0fa42aa6d8902cc4eaf31866b3b3b7b61b69da9302024-10-08T13:27:04+02:00Xuan Son Nguyenserver : better security control for public deployments (#9776)
1618fa42aa6d8902cc4eaf31866b3b3b7b61b69da9306374743747b14db4eb73ce82ae449a2978bc3b472024-10-08T15:19:53+09:00standby24x7scripts : fix spelling typo in messages and comments (#9782)
16196374743747b14db4eb73ce82ae449a2978bc3b47f1af42fa8c925096407c61ff0a3d5d5d669cc5352024-10-07T21:55:08+02:00Diego Devesaggml : add backend registry / device interfaces to BLAS backend (#9752)
1620d5ac8cf2f2e30459489e6721a17d15b92a0c42a696b69121033d2b6b951d1b6b1b43f8b4f97dac992024-10-07T18:27:51+03:00Georgi Gerganovggml : add metal backend registry / device (#9713)
1621f4b2dcdf4992ef11a854abc9b662624490e37b4cb6d6c5289f1c9c677657c380591201ddb210b6492024-10-06T13:49:41+03:00Georgi Gerganovreadme : fix typo [no ci]
16228c475b97b8ba7d678d4c9904b1161bd8811a9b4458b16695e146628481c6b9b8a3b101c0c9bac00f2024-10-05T15:55:04+03:00Georgi Gerganovrerank : use [SEP] token instead of [BOS] (#9737)
162355951c018d7c107b6ef0a4c8561a6e68183d19d9ff565769f289c6adcc91ed1b8fdabaf9a0d4f6ee2024-10-04T15:46:18+02:00Daniel Beveniusggml : fix typo in example usage ggml_gallocr_new (ggml/984)
1624ff565769f289c6adcc91ed1b8fdabaf9a0d4f6eef3fdcfaa79afa12047def3a8793d4a566e0532d42024-10-04T08:41:40+02:00Diego Devesaggml : fixes after sync (ggml/983)
1625133c7b46b3482f7c126c0c4ba14265f684138306d5ed2b929d85bbd7dbeecb690880f07d9d7a60772024-10-04T10:54:44+02:00Daniel KleineFixed RNG seed docs (#9723)
16265d5ab1e5cca0d6d63701a1cb85dbe26cb57d2c4ea7ad553513a5d70b4ceacd36f64705cf3654dc972024-10-03T11:01:46-07:00Jack Mousseaumetal : fix compute pass descriptor autorelease crash (#9718)
1627d6fe7abf04e8ec5240dead6e2773ed1b7e7495d3e3c355ba654d4164c1c09e5d0dcacecb8b214af82024-10-03T12:39:03-03:00bandotiggml: unify backend logging mechanism (#9709)
16285639971466ed74386a1811938022f0c333007b55c83ad6d01e7b89ec71080d97c7e5db7ac1f4fda62024-10-03T07:50:44+01:00Ouadie EL FAROUKIFixed dequant precision issues in Q4_1 and Q5_1 (#9711)
1629a39ab216aa624308fda7fa84439c6b61dc98b87af536f4c4391bec74c432a924625c04e8c484d3ee2024-10-02T15:49:55+02:00Xuan Son Nguyenllama : reduce compile time and binary size (#9712)
1630e98c1c188ebbeb55d0cd6389ad03f0cbf995b451cb00020504416606601f8cb35f55ee07b710b4b72024-09-30T09:55:23+02:00Johannes Gäßlertest: fix OPT_STEP_ADAMW for test-backend-ops (ggml/974)
1631cb00020504416606601f8cb35f55ee07b710b4b76c5322481a75f1be54e58a000c3f78484d07f9482024-09-30T09:14:09+02:00Salvatore Mesoracavulkan : mul_mat: fix UB with small warps (ggml/952)
16326c5322481a75f1be54e58a000c3f78484d07f9487254cdf7e8d6312840509ca8d766358c687c62662024-09-30T10:11:41+03:00Borislav Stanimirovggml : fix ggml_cast (ggml/973)
16337254cdf7e8d6312840509ca8d766358c687c6266cad341d88924788b940997c55e7bef000c99e7842024-09-29T23:18:02+02:00Johannes Gäßlerggml: fix gradient allocation logic (ggml/966)
16341927378bcce20ba72b6c89d5977b854a4bcaeb5d6f1d9d71f4c568778a7637ff6582e6f6ba5fb9d32024-10-01T02:31:36-04:00compiladeconvert : refactor rope_freqs generation (#9396)
16356f1d9d71f4c568778a7637ff6582e6f6ba5fb9d3511636df0c90826b4dd1fc21ff260c19d69a3b5d2024-09-30T21:57:12+03:00serhii-nakonFix Docker ROCM builds, use AMDGPU_TARGETS instead of GPU_TARGETS (#9641)
16368277a817f18967581b02b2248989d773e8e99998c919d5db39c8a7fcb64737f008e4b105ee0acd202024-09-30T13:53:42+05:30Ruchira Hasarangaconsole : utf-8 fix for windows stdin (#9690)
16370de8b203f1d31cf5ee0d2a3560a0ad78d44f4d4c544f409b4bd8fc98a3e87820f0ac934e00402de72024-09-27T02:58:01-05:00Jeff Bolzvulkan : fix build for GGML_VULKAN_RUN_TESTS, add TFLOPS to log (ggml/961)
1638544f409b4bd8fc98a3e87820f0ac934e00402de76084bfb261b03f812de2255b05b6b5bb8d1c71712024-09-26T08:59:42+02:00Salvatore Mesoracavulkan : argsort barriers must be under uniform control flow (ggml/951)
16396084bfb261b03f812de2255b05b6b5bb8d1c7171faac0bae265449fd988c57bf894018edc36fbe1e2024-09-24T13:23:59+03:00Georgi Gerganovggml : fix GGML_MAX_N_THREADS + improve formatting (ggml/969)
1640faac0bae265449fd988c57bf894018edc36fbe1ef99d3f8367174f7aba73c07fd87de687d4a0ece12024-09-29T05:25:00-07:00matiaslincommon : ensure llama_batch size does not exceed max size (#9668)
1641f4d2b8846a6b34419ff9e9491aee6cd95e444bfc1b2f992cd2cff0b69e5abe78bb8888d51ed19d672024-09-28T17:42:03+03:00Georgi Gerganovllama : add reranking support (#9510)
16426102037bbb55521880ae78a6ee6c2a0c00c901df9a913110cf471a8287ac06c43cbe307d3cf6df992024-09-28T20:10:58+08:00Zhenwei Jinvocab : refactor tokenizer to reduce init overhead (#9449)
16439a913110cf471a8287ac06c43cbe307d3cf6df9943bcdd9703ec19af7d2a519640b5ed6f4aac3d532024-09-28T12:08:43Znopperlllama : add support for Chameleon (#8543)
1644ea9c32be71b91b42ecc538bd902e93cbb5fb36cb1e436302188a704ac9ea044af03193648806f19c2024-09-25T17:26:01+02:00Xuan Son Nguyenci : fix docker build number and tag name (#9638)
16451e436302188a704ac9ea044af03193648806f19cafbbfaa537a96f562c34df4542930fa951b40d9e2024-09-25T15:12:20+02:00Charles Xuggml : remove assert for AArch64 GEMV and GEMM Q4 kernels (#9217)
16463d6bf6919f7b10726421779cd344f2da05421c68904837e0cb2f5f01bf5d5901b7aa57a026860ae42024-09-25T01:06:52-06:00Gabe Goodhartllama : add IBM Granite MoE architecture (#9438)
1647904837e0cb2f5f01bf5d5901b7aa57a026860ae470392f1f81470607ba3afef04aa56c9f655876642024-09-25T11:30:38+08:00Dou Xinpengcann: fix crash when llama-bench is running on multiple cann devices (#9627)
1648c038931615d2525d732943fa8661e29aa361b19231ac5834fe75c296476658a124c06c84772aa6412024-09-20T21:50:16+03:00Georgi Gerganovexamples : adapt to ggml.h changes (ggml/0)
1649b0f27361f3539a81d983a8b045f3c61e682d9fc0c087b6f11d3385f4293b6841ebfb7550634794902024-09-24T09:03:17+03:00Georgi Gerganovsampling : avoid expensive softmax during greedy sampling (#9605)
1650c087b6f11d3385f4293b6841ebfb755063479490116efee0eef09d8c3c4c60b52fa01b56ddeb432c2024-09-23T21:18:48-07:00Max Krasnyanskythreads: fix msvc build without openmp (#9615)
1651116efee0eef09d8c3c4c60b52fa01b56ddeb432c0b3bf966f47bf2ba88e5d4e3ed429602008c7e632024-09-24T03:14:24+03:00Ivancuda: add q8_0->f32 cpy operation (#9571)
16520b3bf966f47bf2ba88e5d4e3ed429602008c7e63f0c7b5edf82aa200656fd88c11ae3a805d7130bf2024-09-23T22:23:54+02:00Xuan Son Nguyenserver : add --no-context-shift option (#9607)
1653f0c7b5edf82aa200656fd88c11ae3a805d7130bf1d48e98e4f3316bd2f6b187d288c7b6cb88d5cb32024-09-23T11:42:43-07:00Max Krasnyanskythreads: improve ggml_barrier scaling with large number of threads (#9598)
1654912c331d3dba3a079815844208dc36164baa8cc7a5b57b08ce1998f7046df75324e86b9e2561c7af2024-09-22T21:26:50+08:00Molly SophiaFix merge error in #9454 (#9589)
1655d09770cae71b416c032ec143dda530f7413c403841f477879fd5ccc31211634292e8e293ec700e852024-09-21T14:24:23+02:00slarenggml-alloc : fix list of allocated tensors with GGML_ALLOCATOR_DEBUG (#9573)
165641f477879fd5ccc31211634292e8e293ec700e85e948a7da7af7f2dbfdcd695b3ba903ab12575f782024-09-21T01:41:07+01:00agray3Update CUDA graph on scale change plus clear nodes/params (#9550)
165763351143b2ea5efe9f8b9c61f553af8a51f1deffd13edb17ed1ce3b961016cbdb616b1c8d161c0262024-09-20T20:55:36+02:00slarenquantize : improve type name parsing (#9570)
1658d13edb17ed1ce3b961016cbdb616b1c8d161c02627609c49b94766a136764ce7919c8a082bf715482024-09-20T20:12:52+03:00Georgi Gerganovggml : fix builds (#0)
165927609c49b94766a136764ce7919c8a082bf7154843015353262de835215103475055b74045cb9f492024-09-20T19:13:02+03:00Georgi Gerganovggml : fix trailing whitespace (#0)
1660424c5d00a9b97dd5559635872db9b57f87c23b02a6809c6a2e8163cba296d4cc0c5cd4bbc80736382024-09-20T19:04:44+03:00Johannes Gäßlerggml/examples: add backend support for numerical optimization (ggml/949)
1661a6809c6a2e8163cba296d4cc0c5cd4bbc80736385cb12f68395a5ec00b357e408883ce124a11dcdb2024-09-08T11:10:43+03:00Georgi Gerganovexamples : add null threadpool args where needed (ggml/0)
16625cb12f68395a5ec00b357e408883ce124a11dcdbd39e26741f9f02340651dbc640c9776e1a1128ef2024-09-20T18:35:35+02:00Johannes GäßlerCUDA: fix sum.cu compilation for CUDA < 11.7 (#9562)
1663722ec1eb51ed53be2ab1ef31c6a1da8261803c716026da52d6942b253df835070619775d849d02582024-09-20T08:38:10+02:00Sigbjørn Skjæretperplexity : do not escape input data by default (#9548)
1664eca0fab44eb449ed34e17a9b651ae7398b49411764c6af3195c3cd4aa3328a1282d29cd2635c34c92024-09-19T09:58:14+02:00Sigbjørn Skjæretimatrix : disable prompt escape by default (#9543)
166564c6af3195c3cd4aa3328a1282d29cd2635c34c90d2f22e45c3c3b6f8222acb6284d0c8c93443ba12024-09-18T19:13:08+02:00slarenggml : fix n_threads_cur initialization with one thread (#9538)
16666443ddd98576a9da904ef9f07df4e4398bb6a01a8a308354f6520df6bea851b435bd8054ee5617b42024-09-18T13:42:36+02:00Daniel Beveniusllama : use reserve/emplace_back in sampler_sample (#9534)
1667f799155ab8279cfa668086ce584aa52ecc05f5e5faf67b3de4688f47c3b1019c89df255df2fd59b42024-09-18T14:28:20+08:00Eric Zhangserver : fix OpenSSL build (remove obsolete `LOG_INFO`) (#9529)
1668faf67b3de4688f47c3b1019c89df255df2fd59b47be099fa817e9c53ffb4c3ed7d063e1cffcd675a2024-09-18T08:30:31+08:00Neo Zhang Jianyu[SYCL]set context default value to avoid memory issue, update guide (#9476)
16697be099fa817e9c53ffb4c3ed7d063e1cffcd675a8b836ae731bbb2c5640bc47df5b0a78ffcb129cb2024-09-17T22:41:38+02:00Michael Podvitskiyllama-bench: correct argument parsing error message (#9524)
16708344ef58f8cdb8ebd6faf4463ca32ae91c374c810226613853133c081b55bb892a41bb5eacc0bc942024-09-17T12:18:22+02:00Michael Podvitskiyllama : fix n_vocab init for 'no_vocab' case (#9511)
16710226613853133c081b55bb892a41bb5eacc0bc94503147a9f9d195d6a14e7c998df23b6eb61f2bae2024-09-17T01:19:46-07:00Max Krasnyanskythreadpool : skip polling for unused threads (#9461)
16720d2ec438330271d201c2e9224aca23d0d5c908bf37f3a3810e545be6ac835c726f97956c1403ea022024-09-17T00:44:58-06:00Gabe Goodhartllama : support IBM Granite architecture (#9412)
1673acb2c32c336ce60d765bb189563cc216e57e9fc2a6a3a5c531c73aef85750a847d21e7d4671e723d2024-09-16T13:07:13+02:00Daniel Beveniusllama : rename n_embed to n_embd in rwkv6_time_mix (#9504)
16745c3d0f1824714e9a97fc9b06e046eefcb6ecc7210aadac10c7dd704f8285ddf5a63d6f764cb340aa2024-09-16T06:48:24ZEveggml : IQ4_NL sgemm + Q4_0 AVX optimization (#9422)
1675441b72b91f818fe69497e5816f87969e90c73c43c4965a64f72ac9434c21cf0e1c3421d13e8891552024-09-16T01:20:01-05:00Vinesh Janarthananmain : option to disable context shift (#9484)
1676e6deac31f7e62db43b6afbc3be814f764fd5a1876988da94a261444859f78595899212eeedc5ff9d2024-09-15T19:02:27+02:00slarengguf-split : add basic checks (#9499)
1677d6b37c881f056bd32b681dcd7658a37ea6ec3a1e7596487bebd58eade3cd0133d42a9008aaaf9d092024-09-15T10:36:53+03:00OSecretreadme : update tools list (#9475)
16787596487bebd58eade3cd0133d42a9008aaaf9d09822b6322dea704110797a5671fc80ae39ee6ac972024-09-15T09:06:38+02:00Michael Podvitskiycmake : try to fix sycl+intel build (#9487)
16791f4111e540bacec8d00ca9fd96417bf4c1339394befaf1197fa447f61714de041828852a270659d22024-09-14T10:55:05+03:00Georgi Gerganovcmake : use list(APPEND ...) instead of set() + dedup linker (#9463)
1680befaf1197fa447f61714de041828852a270659d2feff4aa8461da7c432d144c11da4802e41fef3cf2024-09-14T09:50:12+02:00Daniel Beveniusllama : make cell_id const in inp_s_mask block (#9470)
1681feff4aa8461da7c432d144c11da4802e41fef3cf0abc6a2c25272d5cf01384dda8ee8bfec4ba87452024-09-13T14:23:11+02:00Xuan Son Nguyenserver : add loading html page while model is loading (#9468)
16820abc6a2c25272d5cf01384dda8ee8bfec4ba8745bd35cb0ae357185c173345f10dc89a4ff925fc252024-09-13T09:53:38+03:00Georgi Gerganovllama : llama_perf + option to disable timings during decode (#9355)
1683bd35cb0ae357185c173345f10dc89a4ff925fc2578203641fee3b1f82abaff0c7f667e1b4a2863902024-09-13T04:54:49+03:00Gilad S.feat: remove a sampler from a chain (#9445)
168478203641fee3b1f82abaff0c7f667e1b4a286390e6b7801bd189d102d901d3e72035611a25456ef12024-09-12T22:30:11+02:00Mathijs Henquetserver : Add option to return token pieces in /tokenize endpoint (#9108)
1685e6b7801bd189d102d901d3e72035611a25456ef1e665744317c77fc3483fc5224fe6d586b5166b332024-09-12T19:46:43+08:00Dou Xinpengcann: Add host buffer type for Ascend NPU (#9406)
1686e665744317c77fc3483fc5224fe6d586b5166b33d4c3c10fad1bd6adec72d2f1f236761a8d6a07f82024-09-12T19:34:22+08:00fengerhu1llava : fix the script error in MobileVLM README (#9054)
1687d4c3c10fad1bd6adec72d2f1f236761a8d6a07f82a825116b6f7f3a9b1726e5e0c3eb22f7768bd332024-09-12T13:33:57+02:00Xuan Son Nguyenlora : raise error if lm_head is ignored (#9103)
16882a825116b6f7f3a9b1726e5e0c3eb22f7768bd334dc4f5f14ae522494649d82ad06b031cf95010382024-09-12T13:30:01+02:00Michael Podvitskiycmake : fix for builds without `GGML_CDEF_PUBLIC` (#9338)
1689ff76e18516dbe269b35ba1bb500524ed5e39225c39f852f44039b058fdd0611ee127c6efa7ba4a042024-09-12T13:27:14+02:00Michael Podvitskiycmake : fixed the order of linking libraries for llama-quantize (#9450)
1690d6a04f872dea8ade92527bb1488d4b0b90cc49f0c9c8575a1a8a170329afca4c4df4c005806efb1d2024-09-12T14:23:49+03:00Georgi Gerganovggml : hide ggml_object, ggml_cgraph, ggml_hash_set (#9408)
1691c9c8575a1a8a170329afca4c4df4c005806efb1ddf4b7945aeccae2a71348e5a9c1eab5241e3e0ef2024-09-12T17:44:17+08:00Neo Zhang Jianyuenhance run script to be easy to change the parameters (#9448)
1692df4b7945aeccae2a71348e5a9c1eab5241e3e0ef449ccfb6f5f1bbd70e04f75a330d9d7c1af821872024-09-12T09:02:35+08:00Xinpeng Doucann: Fix error when running a non-exist op (#9424)
16938db003a19d7055b5bd248ce2afff9324e5b8da950996c5597f680effacc046832bb807c14900e22d2024-09-11T15:29:51+03:00Pavel Zloipy : support converting local models (#7547)
169467155ab7f5e47c01b62aa989eab30f517bf6dc675af118efdaf1098798a06b24fd8a557760e996312024-09-11T12:52:37+03:30Farbod Bijaryfeat: Implements retrying logic for downloading models using --model-url flag (#9255)
16955af118efdaf1098798a06b24fd8a557760e99631d2b496bff4f353a6429f8e833448f071bd237ba72024-09-11T10:22:40+02:00Johannes GäßlerCUDA: fix --split-mode row race condition (#9413)
169600ba2ff78100e187ae17987bacd1c916211718b283008b7cfe90ad89d0c0ed2c2424fd75edc25ac12024-09-10T10:17:03+03:00Georgi Gerganovmetal : fix compile warning with GGML_METAL_NDEBUG (#0)
169783008b7cfe90ad89d0c0ed2c2424fd75edc25ac10b4ac75772b744bb0a0d674927587621d10578842024-09-10T09:03:21+02:00Daniel Beveniusllama : update llm_build_copy_mask_state comment [no ci] (#9385)
1698bfe76d4a17228bfd1565761f203123bc4914771b293bebe0773c907c0c866213856eeba41b035df12024-09-09T23:36:09+02:00Xuan Son Nguyencommon : move arg parser code to `arg.cpp` (#9388)
1699293bebe0773c907c0c866213856eeba41b035df15fac4d57643b1de8e9ab746f14d2fc4e319ae0c22024-09-09T18:40:10+03:00Radoslav Gerganovrpc : fix segfault with nkvo (#9389)
17005fac4d57643b1de8e9ab746f14d2fc4e319ae0c25fb5e24811cb01d48b482c15a974bfbd9f433e1d2024-09-09T21:07:18+05:30Prashant Vithuleggml : vector length agnostic SVE support (#9290)
17018e6e2fbe1458ac91387266241262294a964d6b955ed087573e1f326cfa70e29c1895d074a7a1a00c2024-09-09T14:22:53+02:00Johannes GäßlerCUDA: fix variable name conflict for Windows build (#9382)
17025ed087573e1f326cfa70e29c1895d074a7a1a00c54f376d0b92c6ff6feb1fa2ef8ed2022348100ba2024-09-09T14:21:38+03:00Antonis Makropoulosreadme : add LLMUnity to UI projects (#9381)
1703daa9623ab051a8162ae750b150b9522571b55f21e079bffb6678e1b5ded21c719600bedd7175e7262024-09-08T21:43:48+02:00Markus TavenrathOverlap cmdbuffer creation and cmdbuffer execution in Vulkan backend by submitting smaller cmdbuffers early. (#9118)
1704e079bffb6678e1b5ded21c719600bedd7175e7263f7ccfd649abc83d059b5462221ac14de4ede6b72024-09-08T22:01:02+03:00Georgi Gerganovcuda : fix FA Q src index (1 -> 0) (#9374)
17053f7ccfd649abc83d059b5462221ac14de4ede6b7a249843d89bd6373772eede26d7f2aa708b266002024-09-08T18:08:55+02:00Xuan Son Nguyencommon : bring back missing args, add env var duplication check (#9375)
170600b02bb249406ec0123757a67a5b714c3f33a699a8768614558262b6762fc0feeddcc6f7ce4bc5fc2024-09-08T12:12:17+02:00Xuan Son Nguyenimatrix : fix arg parser for imatrix (#9366)
1707a8768614558262b6762fc0feeddcc6f7ce4bc5fc385decbd632f70db9f1fbd93dbb2b908853e135c2024-09-08T09:57:57+03:00Georgi Gerganovmetal : update support condition for im2col + fix warning (#0)
1708406c1a32a18807b9b5711aa2fa1859527106bc1d9cb9260861e464e40d38764cfb021856786c72022024-09-06T14:34:25+02:00Salvatore Mesoracavulkan: add dryrun support to sin and cos ops (ggml/947)
17099cb9260861e464e40d38764cfb021856786c7202202084d31d4247764fc6d6d40d2e2bda0c89a73a2024-09-06T14:34:07+02:00Salvatore Mesoracavulkan: correctly report support for OP_CONT (ggml/946)
1710dbbebcab339c7d63d3806e8f32574bb9aad9a694ba1cf846edeb94fc567a9ab0f7ef705282e6d7d32024-08-31T14:35:42+02:00Johannes Gäßlerggml: fix ggml_graph_cpy undefined behavior (ggml/943)
1711ba1cf846edeb94fc567a9ab0f7ef705282e6d7d3d2d3200b385970cb2a4658fd9342a3b1212bdb462024-08-28T18:45:01+03:00Georgi Gerganovcann : fix doxy (ggml/0)
1712efe6a83e3046a94cda38c8be5a7801eadc21d78dfbb7fcffbcfc50009c275e75982b1603a6cb6b802024-08-28T10:23:02+02:00Salvatore Mesoracaggml : fix cont with transposed tensors when one dimension is 1 (ggml/934)
1713a5b5d9a1014248f385939e6739e9db9de7147e55f12295b8a9336962bf02a359beb1be0d322b4be72024-09-08T00:33:50+03:00Georgi Gerganovllama.android : fix build (#9350)
1714f12295b8a9336962bf02a359beb1be0d322b4be7faf69d4237c9ae4d7f572b4674d1002463e8acd32024-09-08T00:33:33+03:00Georgi Gerganovllama : fix empty ring buffer push (#9358)
1715faf69d4237c9ae4d7f572b4674d1002463e8acd3e536426ded3fb4a8cd13626e53508cd92928d6c22024-09-08T00:33:13+03:00Georgi Gerganovllama : sanitize invalid tokens (#9357)
17161b9ae5189cd279c6b45e36d43e4f9ccae628d02fe32d0816edfd247784f6780b0bb9ae0bceef5e472024-09-07T20:43:51+02:00Xuan Son Nguyencommon : refactor arg parser (#9308)
1717947538acb8617756a092042ff7e58db18dde05ec6c89eb0b4749184f4d19e96ada5dcb8847129b9c2024-09-07T12:01:34+02:00Xuan Son Nguyenggml : fix missing `cpu_set_t` on emscripten (#9336)
17189b2c24c0993487d3b34a873980e292da571481f3134bc38ecf3e2c5460581badce289a1ffa6804532024-09-06T23:21:29+02:00Xuan Son Nguyenserver : simplify state machine for slot (#9283)
1719409dc4f8bb5185786087f52259ee4626be93f54d4a1411b4f17b6569dc0a067e5914dcc0f738b3702024-09-06T21:54:50+09:00Changyeon Kimggml : fix build break for the vulkan-debug (#9265)
17204a1411b4f17b6569dc0a067e5914dcc0f738b3708ebe8ddebd68526757c631cd019de009697c63c22024-09-06T14:06:04+02:00Xuan Son Nguyenserver : fix missing lock (#9334)
17218ebe8ddebd68526757c631cd019de009697c63c29bc6db28d011d47a5f318dc4aebbe7927fac46292024-09-06T08:56:17+02:00Markus TavenrathImprove Vulkan shader build system (#9239)
17229bc6db28d011d47a5f318dc4aebbe7927fac462932b2ec88bc44b086f3807c739daf28a1613abde12024-09-05T21:48:47-04:00compiladeggml-quants : ternary packing for TriLMs and BitNet b1.58 (#8151)
17231031771faaba28d07b4ec6a812cb21532efc8c314db04784f96757d74f74c8c110c2a00d55e335142024-09-06T00:14:12+02:00Michael PodvitskiyCMake fix: host for msvc compiler can only be x86 or x64 (#8624)
17244db04784f96757d74f74c8c110c2a00d55e33514bdf314f38a2c90e18285f7d7067e8d736a14000a2024-09-05T11:13:11+02:00slarencuda : fix defrag with quantized KV (#9319)
1725bdf314f38a2c90e18285f7d7067e8d736a14000a581c305186a0ff93f360346c57e21fe16e967bb72024-09-05T02:19:39+02:00slarenllama-bench : fix NUL terminators in CPU name (#9313)
1726581c305186a0ff93f360346c57e21fe16e967bb75910ea942772ab6cbc21d0ad2d1208750ba39e1d2024-09-04T22:21:22+05:30Srihari-mcwggml : AVX2 support for Q4_0_8_8 (#8713)
17275910ea942772ab6cbc21d0ad2d1208750ba39e1dc8671ae28214b29920b86c66a5d36fd6dd0db8702024-09-04T16:26:33+01:00Ouadie EL FAROUKI[SYCL] Fix DMMV dequantization (#9279)
1728c8671ae28214b29920b86c66a5d36fd6dd0db87082e3b03c11826d20a24ab66d60f4de58f48ddcdb2024-09-04T19:45:28+08:00杨朱 · KikiFix broken links in docker.md (#9306)
1729f1485161e58d562099dd050f8ac3a9ea9f4cd765048de848ee4baad4531fcd6239438f5d55be365c2024-09-03T01:53:23+08:00Zhenwei Jinsrc: make tail invalid when kv cell is intersection for mamba (#9249)
1730048de848ee4baad4531fcd6239438f5d55be365cf771d064a95d212ddadea452ad0cc1e42b2c3db32024-09-02T18:11:13+02:00slarendocker : fix missing binaries in full-cuda image (#9278)
17316e7d133a5f9409dd257fad90d7f320721b07a1b2b60074f1c26d8354053a952844ef3f7ebefd88032024-09-02T17:11:51+02:00Xuan Son Nguyenserver : refactor multitask handling (#9274)
17329c1ba557335c3cab46807e6478eb7d17a63361f1c6d4cb46559b359d2682cf2a002e7fe01bb7a7672024-09-02T16:51:01+05:30Tusharbuild(nix): Package gguf-py (#5664)
17338f1d81a0b6f50b9bad72db0b6fcd299ad9ecd48ca47667cff41f5a198eb791974e0afcc1cddd32292024-09-01T22:38:17+08:00Molly Sophiallama : support RWKV v6 models (#8980)
1734a47667cff41f5a198eb791974e0afcc1cddd3229ea5d7478b1edcfc83f8ea8f9f0934585cc0b92e32024-08-22T17:19:14-04:00Echo Nolannix: fix CUDA build - replace deprecated autoAddOpenGLRunpathHook
173549271efbaf3f7a4ae52c4ca299b6d4e82598a97d0ab30f8d82fc7156b750c194d64a887e80cbfb822024-08-31T09:50:22+02:00Daniel Beveniusllama : fix typo in xcda_array_view comment [no ci] (#9132)
17360ab30f8d82fc7156b750c194d64a887e80cbfb82cddae4884c853b1a7ab420458236d666e2e344232024-08-31T03:08:10+09:00Sutou Kouheillama : fix llama_split_mode enum values in main_gpu document (#9057)
173742c76d1358021ccdbe8ba89109c143dd7ae166df9f7d4bcf5c27d37b0c7da82eeaf9c1499510554b2024-08-29T19:20:53-04:00Faisal ZaghloulThreadpool: take 2 (#8672)
17389f7d4bcf5c27d37b0c7da82eeaf9c1499510554b1d1ccce67613674c75c9c7e3fa4c1e24e428ba482024-08-27T18:28:06+08:00Jan Boonserver : fix crash when error handler dumps invalid utf-8 json (#9195)
173920f1789dfb4e535d64ba2f523c64929e7891f428231cff5f6f1c050bcb448a8ac5857533b4c05dc72024-08-27T22:10:58+03:00Georgi Gerganovvulkan : fix build (#0)
17403246fe84d78c8ccccd4291132809236ef477e9ea78eb487bb0038eae95506d3d832b94c979185b092024-08-27T20:33:08+08:00Xie YanboFix minicpm example directory (#9111)
174178eb487bb0038eae95506d3d832b94c979185b09a77feb5d71831c61e455541e8a655b9f0337ea8c2024-08-27T06:09:23-04:00compiladellama : fix qs.n_attention_wv for DeepSeek-V2 (#9156)
17422e59d61c1b321431c597c1f12249273427d5640d75e1dbbaaba5d762223370f3dab9db24a7f534652024-08-27T14:58:22+08:00CausalLMllama : fix ChatGLM4 wrong shape (#9194)
174375e1dbbaaba5d762223370f3dab9db24a7f53465ad76569f8e78ab6ca921bda25cef25a1573617192024-08-27T08:53:40+02:00Carsten Kragelund Jørgensenllama : fix llama3.1 rope_freqs not respecting custom head_dim (#9141)
1744ad76569f8e78ab6ca921bda25cef25a1573617197d787ed96c32be18603c158ab0276992cf0dc3462024-08-26T22:58:50-07:00arch-btwcommon : Update stb_image.h to latest version (#9161)
17457d787ed96c32be18603c158ab0276992cf0dc34606658ad7c37f440502de2b9486ce43c47b4ec7102024-08-26T19:44:43+02:00slarenggml : do not crash when quantizing q4_x_x with an imatrix (#9192)
1746879275ac984235373dd44ed780d5e3a3883cb5587a3df798fc43e1b366146b1ad99137a9e95c87dd2024-08-26T16:30:25+03:00Georgi Gerganovtests : fix compile warnings for unreachable code (#9185)
1747436787f170329b3f549e6c2c46593d2af8482e7c93bc3839f980ff14be86efe408b4cd7e89b268352024-08-25T23:09:53-07:00Justine Tunneyllama : fix time complexity of string replacement (#9163)
174893bc3839f980ff14be86efe408b4cd7e89b26835f91fc5639be1e272194303ea26e1d4c226ec981b2024-08-25T22:54:37ZHerman Semenovcommon: fixed not working find argument --n-gpu-layers-draft (#9175)
1749f91fc5639be1e272194303ea26e1d4c226ec981be11bd856d538e44d24d8cad4b0381fba0984d1622024-08-25T22:11:48+02:00Johannes GäßlerCUDA: fix Gemma 2 numerical issues for FA (#9166)
17508f824ffe8ee1feadd14428f1dda1283fa3b933be3ba780e2a8f0ffe13f571b27f0bbf2ca5a199efc2024-08-24T07:22:45+01:00João Dinis Ferreiraquantize : fix typo in usage help of `quantize.cpp` (#9145)
17513ba780e2a8f0ffe13f571b27f0bbf2ca5a199efca07c32ea54850c989f0ef6989da5b955b77b71722024-08-23T12:58:53+02:00Xuan Son Nguyenlora : fix llama conversion script with ROPE_FREQS (#9117)
1752a1631e53f6763e17da522ba219b030d8932900bdfc54ef0d1c138133a01933296d50a36a1ab647352024-08-21T17:58:11-04:00compiladellama : simplify Mamba with advanced batch splits (#8526)
1753b40eb84895bf723c7b327a1e3bf6e0e2c41877f8f63f603c879c2232eaeded8c0aeba4244471d7202024-08-21T12:06:36+04:00Younes Belkadallama : support for `falcon-mamba` architecture (#9074)
17542f3c1466ff46a2413b0e363a5005c46538186ee650addec9a532a6518146ab837a855048506273162024-08-21T04:00:00+09:00Changyeon Kimllava: Add ACC OP for GPU acceleration to the Vulkan backend in the LLAVA CLIP model. (#8984)
17554f8d19ff17faa601f456ee1db7d8b8a15fa3f90b90db8146d56d83a605f2c475eca39bcda29cf16d2024-08-20T23:06:51+08:00zhentaoyu[SYCL] Fix SYCL `im2col` and `convert` Overflow with Large Dims (#9052)
17561b6ff90ff8301d9fe2027be2bb9fea26177d775e18eaf29f4c5f7c8e89412f3a9a0392a9e4e01d752024-08-19T10:11:45+03:00Radoslav Gerganovrpc : print error message when failed to connect endpoint (#9042)
175718eaf29f4c5f7c8e89412f3a9a0392a9e4e01d75554b049068de24201d19dde2fa83e35389d4585d2024-08-19T10:10:21+03:00Radoslav Gerganovrpc : prevent crashes on invalid input (#9040)
17582339a0be1c8e31fcf4531427183b94f2ef019e562fb9267887d24a431892ce4dccc75c7095b0d54d2024-08-18T10:58:04+01:00ltoniazzitests : add integration test for lora adapters (#8957)
17592fb9267887d24a431892ce4dccc75c7095b0d54d8b3befc0e2ed8fb18b903735831496b8b0c809492024-08-17T06:34:21-07:00Yoshi SuharaFix incorrect use of ctx_split for bias tensors (#9063)
17608b3befc0e2ed8fb18b903735831496b8b0c80949d565bb2fd5a2a58b9924a7a34e77a87c78c521372024-08-16T17:19:05+02:00Xuan Son Nguyenserver : refactor middleware and /health endpoint (#9056)
1761d565bb2fd5a2a58b9924a7a34e77a87c78c52137ee2984bdaf10c14d440ad873a049bcc09b786d9b2024-08-16T21:34:41+08:00tc-mbllava : support MiniCPM-V-2.6 (#8967)
1762ee2984bdaf10c14d440ad873a049bcc09b786d9bc8ddce85606d9fb6e30745b6e4fe103eecadc73f2024-08-16T14:06:30+03:30Farbod Bijarypy : fix wrong input type for raw_dtype in ggml to gguf scripts (#8928)
1763c8ddce85606d9fb6e30745b6e4fe103eecadc73f23fd4535445e3e859ded2f02d6142b6e93b438902024-08-16T19:08:59+10:00AisukoFix inference example lacks required parameters (#9035)
1764c679e0cb5c378bfb63643c44a453345ba8b90126fb487bb5671b37267f35ff43fe8849ddccd925cd2024-08-16T15:35:18+09:00Minsoo Cheongllama : add EXAONE model support (#9025)
1765fb487bb5671b37267f35ff43fe8849ddccd925cd2a24c8caa6d10a7263ca317fa7cb64f0edc72aae2024-08-16T14:23:12+08:00Liu Jiacommon : add support for cpu_get_num_physical_cores() on Windows (#8771)
17662a24c8caa6d10a7263ca317fa7cb64f0edc72aaee3f6fd56b1ab3c426596217d786910d641ae6ce02024-08-15T19:23:33-07:00Yoshi SuharaAdd Nemotron/Minitron GGUF Conversion & Inference Support (#8922)
1767e3f6fd56b1ab3c426596217d786910d641ae6ce04b9afbbe9037f8a2d659097c0c7d9fce32c6494c2024-08-16T04:22:55+02:00Nico Bosshardggml : dynamic ggml_sched_max_splits based on graph_size (#9047)
17684b9afbbe9037f8a2d659097c0c7d9fce32c6494c37501d9c79ed5897db4b73ea7502211d25b3f7632024-08-15T15:40:12+08:00gtygoretrieval : fix memory leak in retrieval query handling (#8955)
176937501d9c79ed5897db4b73ea7502211d25b3f7634af8420afba39de4968adf2695ce12fd42422a132024-08-15T15:28:05+08:00Riceball LEEserver : fix duplicated n_predict key in the generation_settings (#8994)
1770234b30676a97ce227b604c38beb9dcaca406dea95fd89a70ead34d1a17015ddecad05aaa2490ca462024-08-15T08:21:57+02:00Jiří Podivínserver : init stop and error fields of the result struct (#9026)
17715fd89a70ead34d1a17015ddecad05aaa2490ca4698a532d474c73d3494a5353024cb6a4fbbabbb352024-08-14T18:32:53+02:000cc4mVulkan Optimizations and Fixes (#8959)
177298a532d474c73d3494a5353024cb6a4fbbabbb3543bdd3ce188cd247bda7c1bd1ad01fa64e5666902024-08-14T02:51:02-04:00compiladeserver : fix segfault on long system prompt (#8987)
177306943a69f678fb32829ff06d9c18367b17d4b361828d6ff7d796f48b2c345f6be2805a3c531a089c2024-08-13T21:13:15+02:00Daniel Beveniusggml : move rope type enum to ggml.h (#8949)
1774828d6ff7d796f48b2c345f6be2805a3c531a089cfc4ca27b25464a11b3b86c9dbb5b6ed6065965c22024-08-13T11:41:14+02:00Xuan Son Nguyenexport-lora : throw error if lora is quantized (#9002)
1775fc4ca27b25464a11b3b86c9dbb5b6ed6065965c21f67436c5ee6f4c99e71a8518bdfc214c27ce9342024-08-12T13:28:23-03:00Diogo Teles Sant'Annaci : fix github workflow vulnerable to script injection (#9008)
17761262e7ed13ac197c944f15e1ddb083cb4f36cf65df5478fbea7e652cfad4ee7974ac3b624fd6c7f62024-08-12T13:36:41+01:00DavidKorczynskigrammar-parser : fix possible null-deref (#9004)
1777df5478fbea7e652cfad4ee7974ac3b624fd6c7f62589292cde038ba876c041bcd7b3f0c81f3f11fe2024-08-12T13:21:41+01:00DavidKorczynskiggml: fix div-by-zero (#9003)
17782589292cde038ba876c041bcd7b3f0c81f3f11fed3ae0ee8d75033921a076131d4d0fa1c6ec579a72024-08-12T17:46:03+08:00Liu JiaFix a spelling mistake (#9001)
1779d3ae0ee8d75033921a076131d4d0fa1c6ec579a75ef07e25ac39e62297a67208c5bcced50835a2dd2024-08-12T11:02:01+03:00Georgi Gerganovpy : fix requirements check '==' -> '~=' (#8982)
1780a21c6fd45032a20180e026773582d21294c8561933309f661a93c9c0ab65a79e5e7e30fa6162992e2024-08-11T16:37:43+08:00Neo Zhangupdate guide (#8909)
17817c5bfd57f83fd3630934cfa70892aa4022d3faf76e02327e8b7837358e0406bf90a4632e18e278462024-08-11T10:09:09+02:00Markus TavenrathOptimize Vulkan backend for better CPU performance and less GPU synchronization overhead. (#8943)
17826e02327e8b7837358e0406bf90a4632e18e278467eb23840ed0f388e10c4bbc4d65802fdfb977b402024-08-10T15:42:10+02:00slarenmetal : fix uninitialized abort_callback (#8968)
17837eb23840ed0f388e10c4bbc4d65802fdfb977b407c3f55c10051c634546247387c5c359c9d4993602024-08-10T13:04:40+02:00Xuan Son Nguyenllama : default n_swa for phi-3 (#8931)
1784911b437f228e75aa3d235acec21bfddd23ecce2fb72942fac998672a79a1ae3c03b340f7e629980b2024-08-10T07:58:49+02:00Matteo Mortarigguf-py : fix double call to add_architecture() (#8952)
1785272e3bd95e620d285b2fb9faaa7b6b1b8edbbf3a45a55b91aa87958a75d691be64b070266d4fbb942024-08-09T18:24:30+03:00Georgi Gerganovmake : fix llava obj file race (#8946)
17863071c0a5f218f107dabd13b73f6090af683ef5ec4305b57c80eff4f0df5f6acb60b292f03b8f0dd02024-08-09T18:33:53+08:00tc-mbllava : support MiniCPM-V-2.5 (#7599)
178770c0ea35609a2ab87a358e25f4ffad1aad4089925b2c04f4925e152c362b824f4b41eb2a081fa6232024-07-16T03:21:09-04:00Matt Stephensonwhisper : use vulkan as gpu backend when available (whisper/2302)
17885b2c04f4925e152c362b824f4b41eb2a081fa6236f6496bb0999d1bce5daff0cfc55ceb0dd13c8882024-08-09T08:33:30+02:00Daniel Beveniusembedding : add --pooling option to README.md [no ci] (#8934)
17896f6496bb0999d1bce5daff0cfc55ceb0dd13c888daef3ab233fc02e4c53afd9b07366379876f00d12024-08-09T08:32:23+02:00Daniel Beveniusllama : fix typo in llama_tensor_get_type comment [no ci] (#8937)
17903a14e00366399040a139c67dd5951177a8cb5695afd27f01fe832ece3d07ef03b7d34a9e80c4a8952024-08-08T13:33:09-04:00compiladegguf-py : simplify support for quant types (#8838)
1791366d486c163ea883442313cff1a3b154ab93e168e44a561ab090b11d3a6fe539b768404663e4c3d22024-08-08T14:40:12+03:00Georgi Gerganovscripts : fix sync filenames (#0)
17925b33ea1ee72fadfa4f96d86dc614631739758cce85fca8deb6273b956bc9184bc9d70a07e1d50d072024-08-07T09:57:00+03:00Georgi Gerganovmetal : fix struct name (ggml/912)
1793be55695eff44784a141a863f273661a6bce63dfc0478174d5959b66096ae6609fcb0df14cab66b512024-08-07T13:29:02+02:00slarenggml-backend : fix async copy from CPU (#8897)
17940478174d5959b66096ae6609fcb0df14cab66b51a8dbc6f753f296108121d50f78f67463403dd6fc2024-08-07T11:25:36+01:00Ouadie EL FAROUKI[SYCL] Updated SYCL device filtering (#8901)
1795a8dbc6f753f296108121d50f78f67463403dd6fc506122d854c5d05b4a3d45a294f14bd4c02d98682024-08-07T09:07:52+02:00Johannes GäßlerCUDA/HIP: fix tests/test-backend-ops (#8896)
17961e6f6554aa11fa10160a5fda689e736c3c34169f641f5dd2a6422941faa9f32ab5cb50fc1b24c1f52024-08-06T17:33:39+02:00Xuan Son Nguyenserver : add lora hotswap endpoint (WIP) (#8857)
1797641f5dd2a6422941faa9f32ab5cb50fc1b24c1f55f4dcb1e60bbfe936b45778dad177a5b9a09b0662024-08-06T17:13:55+02:00Johannes GäßlerCUDA: fix padding logic for FP16/FP32 (#8884)
1798db20f50cf4710c46e3a996919a26858cae8c80edefda90c93a62274ec0b0bfa80c4eee4bdb6966d02024-08-06T17:21:47+04:00Jaeden Amerocmake : Link vulkan-shaders-gen with pthreads (#8835)
1799efda90c93a62274ec0b0bfa80c4eee4bdb6966d00bf16de07b0692e7df26b9a633e232bbd66e03602024-08-06T16:32:03+05:00MaggotHATE[Vulkan] Fix compilation of `vulkan-shaders-gen` on w64devkit after `e31a4f6` (#8880)
1800cdd1889de62a7140c8c016405ec917464bde8bd3c21a896405de4cdf4207eb8130555ceaac0ab1102024-08-06T02:20:54-05:00Douglas Hanleyconvert : add support for XLMRoberta embedding models (#8658)
1801c21a896405de4cdf4207eb8130555ceaac0ab110d4ff847153e9cf7220d1b39aa21172069e6e8cea2024-08-06T12:42:42+08:00Mengqing Cao[CANN]: Fix ggml_backend_cann_buffer_get_tensor (#8871)
18020a4ce786814b123096d18aadca89cd352b9e590bbc0f887e159c0d78c28121e2c8b5c580941708752024-08-06T00:14:10+08:00Liu Jiacommon : Changed tuple to struct (TODO fix) (#8823)
1803bc0f887e159c0d78c28121e2c8b5c58094170875b42978e7e4d56eaaa93588414e804d9fbbc3cae22024-08-05T21:10:37+08:00wangshuai09cann: fix buffer_num and runtime speed slowly error (#8865)
1804b9dfc25ca385a83bde9e9456c4d4fae15377bc7b1ef14b30075da594cb24f0ab858a14bf1d8d17972024-08-05T05:43:40-07:00Justine Tunneyggml : fix overflows in elu function (#8866)
18051ef14b30075da594cb24f0ab858a14bf1d8d1797d3f0c7166adfa952237e0f437a5344362d8256d42024-08-05T21:15:28+10:00Brianpy: Add more authorship metadata from model card (#8810)
1806e31a4f679779220312c165b0f5994c680a610e38400ae6f65f0b55babd48d1e3ec7fd663a97fc8d02024-08-05T08:18:27+02:00stduhpfcmake: fix paths for vulkan shaders compilation on Windows (#8573)
1807064cdc265fb63590c7c8f04a609d36ef200d55a75587e57a76630651752031223cc7024cb32cf3082024-08-05T07:52:55+02:000cc4mvulkan : fix Qantized Mat-Vec Mul on AMD GPUs for ncols < 64 (#8855)
1808a3738b2fa7c60ef2c4592435d1aa7fb8f1f69c3e655858ace0cf2720e56eb01f84ad05e0c94ada3c2024-08-04T17:28:08+02:000cc4mvulkan : implement Stable Diffusion operators (ggml/904)
1809ecf6b7f23e664afd7ff856ec39034240ce438daa01aae2b4975b57a265ce8194928fd87f2d71027e2024-08-04T03:55:03-07:00Brian Cunniebatched-bench : handle empty `-npl` (#8839)
181076614f352e94d25659306d9e97321f204e5de0d3b72c20b85c1029d135022d39e9a20d4807c118932024-08-04T01:34:41+09:00jdomkeggml : reading the runtime sve config of the cpu (#8709)
1811b72c20b85c1029d135022d39e9a20d4807c11893e09a800f9a9b19c73aa78e03b4c4be8ed988f3e62024-08-02T21:11:39+02:00Sigbjørn SkjæretFix conversion of unnormalized BF16->BF16 weights (#7843)
1812e09a800f9a9b19c73aa78e03b4c4be8ed988f3e60fbbd884589d585c3b43cae8c16938ffffb863b92024-08-02T16:50:53+08:00Mengqing Caocann: Fix ggml_cann_im2col for 1D im2col (#8819)
18130fbbd884589d585c3b43cae8c16938ffffb863b9afbb4c1322a747d2a7b4bf67c868148f8afcc6c82024-08-02T01:55:17+01:00Ouadie EL FAROUKI[SYCL] Fixing wrong VDR iq4nl value (#8812)
1814afbb4c1322a747d2a7b4bf67c868148f8afcc6c8b7a08fd5e0e7c898c68d1743066ea495202d96082024-08-01T23:28:28+02:00matteoggml-cuda: Adding support for unified memory (#8035)
1815b7a08fd5e0e7c898c68d1743066ea495202d96087a11eb3a260915aee16101808f291a244e2facc72024-08-01T12:53:46-04:00Alex O'ConnellBuild: Only include execinfo.h on linux systems that support it (#8783)
18167a11eb3a260915aee16101808f291a244e2facc7c8a0090922bad576623de4aae2277170852492622024-08-01T15:26:22+02:00slarencuda : fix dmmv cols requirement to 2*GGML_CUDA_DMMV_X (#8800)
1817afbbcf3c04e3c6420cad3d72571478cd62ac176ced9d2854c9de4ae1f448334294e61167b04bec2a2024-07-31T18:59:09-05:00Igor Okulistserver : update llama-server embedding flag documentation (#8779)
1818ed9d2854c9de4ae1f448334294e61167b04bec2a398ede5efeb07b9adf9fbda7ea63f630d476a7922024-07-31T15:51:06-04:00Clint HerronBuild: Fix potential race condition (#8781)
181944d28ddd5caaa5e9de573bdaaa5b5b2448a29ace268c5660062270a2c19a36fc655168aa287aaec22024-07-31T16:40:08+03:00Borislav Stanimirovcmake : fix use of external ggml (#8787)
182075af08c475e285888f66556d0f459c533b7deb95439b3fc75a8deb42899ac47a8f52aae75e0339fe2024-07-30T00:38:34+08:00CarterLi999ggml: bugfix: fix the inactive elements is agnostic for risc-v vector (#8748)
18214730faca618ff9cee0780580145e3cbe86f248764c676c85e59ef8f771f3a129e6eb2175521392312024-07-28T03:52:42-04:00Austinchore : Fix vulkan related compiler warnings, add help text, improve CLI options (#8477)
18224c676c85e59ef8f771f3a129e6eb217552139231e54c35e4fb5777c76316a50671640e6e144c95382024-07-28T00:42:05-04:00compiladellama : refactor session file management (#8699)
1823e54c35e4fb5777c76316a50671640e6e144c95385e2727fe0321c38d1664d26173c654fa1801dc5f2024-07-28T07:41:25+08:00R0CKSTARfeat: Support Moore Threads GPU (#8383)
1824203b7f1531303a060730ec1d1e01920e70302398d2b851bfa131478665315bc5c7c707506c14d7032024-07-20T20:49:44+02:00Tony Wasserkavulkan : initialize vk_buffer_struct members to VK_NULL_HANDLE (ggml/893)
18259d03d085dd6cb275c078690bb64073b9b043e95fbfb4c74981f0a40d757b450b596a9fe4ca983d262024-07-27T12:45:02+02:00Daniel Beveniuscommon : add --no-warmup option for main/llama-cli (#8712)
1826bfb4c74981f0a40d757b450b596a9fe4ca983d262b1f616b208a4a21c4ee7a7eb85d822ff1d787af2024-07-27T16:36:44+08:00wangshuai09cann: Fix Multi-NPU execution error (#8710)
18272b1f616b208a4a21c4ee7a7eb85d822ff1d787af01245f5b1629075543bc4478418c7d72a0b4b3c72024-07-27T04:41:55+02:00slarenggml : reduce hash table reset cost (#8698)
182801245f5b1629075543bc4478418c7d72a0b4b3c701aec4a6310ab0160483196db0e726d78d4c94b62024-07-26T16:38:12+08:00Juddllama : fix order of parameters (#8706)
182901aec4a6310ab0160483196db0e726d78d4c94b641cd47caab88c442edc50e90c8d8d0ac3e82768d2024-07-25T18:10:16-04:00Yaikoserver : add Speech Recognition & Synthesis to UI (#8679)
183041cd47caab88c442edc50e90c8d8d0ac3e82768d49ce0ab6d45402e8bb622bf86f86529f2b0ba5522024-07-25T23:49:39+02:00Xuan Son Nguyenexamples : export-lora : fix issue with quantized base models (#8687)
183149ce0ab6d45402e8bb622bf86f86529f2b0ba5524226a8d10e3904db3a1297919fe6c7f06beba6c02024-07-25T22:23:05+01:00DavidKorczynskiggml: handle ggml_init failure to fix NULL pointer deref (#8692)
18324226a8d10e3904db3a1297919fe6c7f06beba6c0bf5a81df375f1c71e41462e1f48d57db359c9e802024-07-25T19:57:31+03:00Georgi Gerganovllama : fix build + fix fabs compile warnings (#8683)
1833bf5a81df375f1c71e41462e1f48d57db359c9e8088954f7fbd31aeb8c75140edee03e7a8ad5e2d9c2024-07-25T18:01:00+02:00Andreas (Andi) Kunarggml : fix build on Windows with Snapdragon X (#8531)
183488954f7fbd31aeb8c75140edee03e7a8ad5e2d9ced67bcb24f2d6ac0072cae72620b2bd971741b982024-07-25T18:57:44+03:00Georgi Gerganovtests : fix printfs (#8068)
1835ed67bcb24f2d6ac0072cae72620b2bd971741b98eddcb5238b2e09a37798b87cde1244017a194bcc2024-07-25T11:45:18ZChen Xi[SYCL] fix multi-gpu issue on sycl (#8554)
1836be6d7c079173d941b4f784500f9148f46cec27244b0eff3df58d8d86e47348fb73d54da3194d416d2024-07-25T10:39:04+02:00Xuan Son Nguyenexamples : remove `finetune` and `train-text-from-scratch` (#8669)
18374b0eff3df58d8d86e47348fb73d54da3194d416d8a4bad50a8ed24ed1e9df003521468dcc37320e82024-07-25T13:43:27+05:30Ujjawal Panchaldocs : Quantum -> Quantized (#8666)
18388a4bad50a8ed24ed1e9df003521468dcc37320e868504f0970db5a3602d176953690f503059906b12024-07-25T15:21:09+08:00Fan Shupeillama: use sliding window for phi3 (#8627)
183996952e7181929c6001b2bc69a33f240de731cc3a79167d9e49aef9caa98e13ee7ca067ec9f88b4b52024-07-24T13:48:46+02:00Xuan Son Nguyenllama : fix `llama_chat_format_single` for mistral (#8657)
1840de280085e7917dbb7f5753de5842ff4455f82a81b841d0740855c5af1344a81f261139a45a2b39ee2024-07-23T23:48:37+02:00Xuan Son Nguyenexamples : Fix `llama-export-lora` example (#8607)
1841b841d0740855c5af1344a81f261139a45a2b39ee64cf50a0ed62d41e4f6c13e08a9b6b0816f46c6e2024-07-23T17:37:42+03:00Vali Malinoiuserver : fix URL.parse in the UI (#8646)
1842938943cdbf4dd79005a394d732bc226f9e34e0ff751fcfc6c33ea5f43cadd4d976f8fb176871df5e2024-07-23T13:10:17+03:00Georgi Gerganovllama : move vocab, grammar and sampling into separate files (#8508)
1843751fcfc6c33ea5f43cadd4d976f8fb176871df5e46e47417aa4f18c08738afd4d9a3e838e97ca03f2024-07-23T10:56:49+02:000cc4mVulkan IQ4_NL Support (#8613)
1844e7e6487ba06634edf58dfdf9673bad9df41b445a063d99ad11f1295046610ce5b97e105849a4b5732024-07-23T11:28:38+03:00Georgi Gerganovcontrib : clarify PR squashing + module names (#8630)
1845063d99ad11f1295046610ce5b97e105849a4b573081fe431aa8fb6307145c4feb3eed4f48cab19f82024-07-23T07:43:28Zluoyu-intel[SYCL] fix scratch size of softmax (#8642)
1846081fe431aa8fb6307145c4feb3eed4f48cab19f8d94c6e0ccbd29ee1ba4f44e9caa8682ad94df9fa2024-07-23T00:43:43+08:00Keke Hanllama : fix codeshell support (#8599)
184704bab6b7da0ed2b0a57174a57784d602aabb6c10b7c11d36e605b35206901d0e21905f1b99508e332024-07-22T15:56:45+08:00Mark Zhuangggml: fix compile error for RISC-V (#8623)
1848b7c11d36e605b35206901d0e21905f1b99508e3345f2c19cc57286eead7b232ce8028273a817aa4d2024-07-22T14:54:42+08:00devojonyexamples: fix android example cannot be generated continuously (#8621)
184922f281aa16f44d8f6ec2c180a0685ff27e04e714328884f4219c0228673cf1870ac63987fb4f9fd02024-07-20T22:09:17-04:00M-Aexamples : Rewrite pydantic_models_to_grammar_examples.py (#8493)
1850328884f4219c0228673cf1870ac63987fb4f9fd0c69c63039cd75f8f33f253ab7485d82a8b4cd4032024-07-20T21:58:49-04:00compiladegguf-py : fix some metadata name extraction edge cases (#8591)
1851c69c63039cd75f8f33f253ab7485d82a8b4cd40369c487f4ed57bb4d4514a1b7ff12608d5a8e7ef02024-07-20T21:53:01-04:00compiladeconvert_hf : fix Gemma v1 conversion (#8597)
185207283b1a90e1320aae4762c7e03c879043910252940362224d20e35f13aa5fd34a0d937ae57bdf7d2024-07-20T17:15:42+03:00Georgi Gerganovgguf : handle null name during init (#8587)
1853940362224d20e35f13aa5fd34a0d937ae57bdf7d69b9945b44c3057ec17cb556994cd36060455d442024-07-20T09:43:51-04:00Michael Coppolallama : add support for Tekken pre-tokenizer (#8579)
185469b9945b44c3057ec17cb556994cd36060455d44c3776cacabce2ee35f172fb72be7a519752125fa2024-07-20T09:09:37-04:00Huifeng Oullama.swiftui: fix end of generation bug (#8268)
1855c3776cacabce2ee35f172fb72be7a519752125fa87e397d00bdcedd5cbf6dfda06a7b0f3024627282024-07-20T17:35:25+10:00Briangguf_dump.py: fix markddown kv array print (#8588)
185687e397d00bdcedd5cbf6dfda06a7b0f30246272857b1d4f9eb6f2c139b31ea79626d954b261e10512024-07-19T17:17:27+02:00slarenggml : fix quant dot product with odd number of blocks (#8549)
1857be0cfb41752551a4680ee7dfd29f2a05b50db442b57eb9ca4fb79f3163c6a69e154ff76157a4f7162024-07-19T14:34:55+03:00Georgi Gerganovreadme : fix server badge
1858b57eb9ca4fb79f3163c6a69e154ff76157a4f716f299aa98ecc19cbc574e9d698e03999e89de3d3d2024-07-19T07:05:45-04:00Clint Herronggml : add friendlier error message to fopen errors (#8575)
1859f299aa98ecc19cbc574e9d698e03999e89de3d3d3d0e4367d99087892e355ddbeebd232a0b2f40de2024-07-19T17:44:41+08:00Frank Maifix: typo of chatglm4 chat tmpl (#8586)
1860a15ef8f8a08e12f9c5162c221e67779e71182073705b7ecf60e667ced57c15d67aa86865e3cc7aa72024-07-18T23:48:47+02:00Johannes GäßlerCUDA: fix partial offloading for ne0 % 256 != 0 (#8572)
1861705b7ecf60e667ced57c15d67aa86865e3cc7aa70d2c7321e9678e91b760ebe57f0d063856bb018b2024-07-18T07:47:12-07:0065acmake : install all ggml public headers (#8480)
18620d2c7321e9678e91b760ebe57f0d063856bb018b672a6f101839a150180fc28891ebed379c8f23532024-07-18T18:43:49+08:00Eric Zhangserver: use relative routes for static files in new UI (#8552)
1863672a6f101839a150180fc28891ebed379c8f23533807c3de04cde853418033c95e96642876545f3e2024-07-18T20:40:15+10:00Brianconvert-*.py: GGUF Naming Convention Refactor and Metadata Override Refactor (#7499)
1864e02b597be3702174e7b47b44cd03e1da1553284bb3283448ce9a5098226afe1d8648ccc578511fe42024-07-17T23:35:44+02:00Johannes Gäßlerlookup: fibonacci hashing, fix crashes (#8548)
1865b3283448ce9a5098226afe1d8648ccc578511fe430f80ca0bcee58669ada7a94244eeccc8c4807cc2024-07-17T20:21:55+02:00Al Mochkinbuild : Fix docker build warnings (#8535) (#8537)
18661bdd8ae19f50bc6f108fa247e90688e5c60559fcda3913d8f9475b0d4bcbeb4936c724af4eade0922024-07-17T19:23:50+08:00hipudding[CANN] Add Ascend NPU backend (#6035)
1867da3913d8f9475b0d4bcbeb4936c724af4eade092d65a8361fed8be97389776fb94217e937ec6b03c2024-07-17T16:34:28+09:00Masaya, Katobatched: fix n_predict parameter (#8527)
186837b12f92ab696d70f9a65d7447ce721b094fb32e0efec57787cb8d8d76b17cd3765e6521e22c1f192024-07-16T00:04:45-07:00Steve Bondsexport-lora : handle help argument (#8497)
18697acfd4e8d55082c1b597dfc3ffe04fb5d530c6dc97bdd26eee11fe109dec00de75690ceef61c03f22024-07-15T23:13:10-04:00compiladeconvert_hf : faster lazy safetensors (#8482)
187097bdd26eee11fe109dec00de75690ceef61c03f24db8f60fe79a391e82b0464013ada123baced96a2024-07-15T20:50:47+02:00Xuan Son NguyenRefactor lora adapter support (#8332)
18714db8f60fe79a391e82b0464013ada123baced96a8fac431b0692e88cdc55250f29f8d4386be82c5d2024-07-15T19:23:10+02:00Xuan Son Nguyenfix ci (#8494)
1872f17f39ff9cb71fa7b0eda0c649bb0ce9b2d8a6b89104bc20edf47f74dc49379b7d61d0c6e85a48822024-07-15T08:04:56-04:00M-Aserver: update README.md with llama-server --help output [no ci] (#8472)
1873fc690b018e459012cd82c37f1343e9bb658987d116bdfa42acb09175e88cf97e9d9e4e48f616d1202024-07-15T04:46:39-07:00NikolaiLyssogordocs: fix links in development docs [no ci] (#8481)
1874bda62d7999caa8c222b6c354ac1e7c7442508539090fca7a073efe9ad3dd2b9ac12491a4f20ac9572024-07-15T09:38:52+02:000cc4mVulkan MMQ Fix (#8479)
1875090fca7a073efe9ad3dd2b9ac12491a4f20ac957aaab2419eaa17ab3aa38f4ba49c7eea406999e992024-07-14T19:51:21-04:00compiladepydantic : replace uses of __annotations__ with get_type_hints (#8474)
187673cf442e7bc9baca7b3e213b261551812f1676c9e236528e7628a0e59751eee9addf21fc3c33d3762024-07-14T14:05:09+03:00Georgi Gerganovllama : fix Gemma-2 Query scaling factors (#8473)
1877fa79495bb4897953a75607addd9d2cdd2ec6322217eb6aa8a992cda37ee65cf848d9289bd6cad8602024-07-13T23:35:10-04:00compiladellama : fix pre-tokenization of non-special added tokens (#8228)
187817eb6aa8a992cda37ee65cf848d9289bd6cad860c917b67f06c42d8ca8391b9bc73f5fe62c83bf702024-07-13T13:12:39-03:00bandotivulkan : cmake integration (#8119)
18796af51c0d96e6268769fc05c98d5b1a5e832c0017f53226245f421bd01b47cce43a47e791de82c6362024-07-12T14:48:04+03:00Georgi Gerganovmain : print error on empty input (#8456)
1880c3ebcfa148e867a68e78fd5c4f0c23e8f84c788b8a4441ea1a2564578134404f31158c318e9c0bf32024-07-12T03:14:12-05:00Douglas Hanleyserver : ensure batches are either all embed or all completion (#8420)
18818a4441ea1a2564578134404f31158c318e9c0bf35aefbce27a66473d4b1263ba3f7bdd3d142459752024-07-12T04:08:19-04:00Armen Kaleshiandocker : fix filename for convert-hf-to-gguf.py in tools.sh (#8441)
1882370b1f7e7a7514d9a63daf15f7b0f00319b7f908b549a1bbefb2f1fbb8b558bac1f2ae7967e609642024-07-12T10:46:02+03:00Georgi Gerganovggml : minor naming changes (#8433)
1883b549a1bbefb2f1fbb8b558bac1f2ae7967e60964368645698ab648e390dcd7c00a2bf60efa654f572024-07-12T00:52:04ZChen Xi[SYCL] fix the mul_mat_id ut issues (#8427)
1884b078c619aa4e97fe726d61b0b5499a2e19a418a4808aba39161e5d7ca2ff24110b5aa14d2e5369882024-07-11T17:53:42+02:00Daniel Beveniuscuda : suppress 'noreturn' warn in no_device_code (#8414)
1885278d0e18469aacf505be18ce790a63c7cc31be26dd07a123b79f9bd9e8a4ba0447427b3083e9347a2024-07-10T20:08:17-04:00Clint HerronInitialize default slot sampling parameters from the global context. (#8418)
18860f1a39f3439825acf7e3a1663566d410be15217083321c6958acf20747d288031174cc1bf8816e332024-07-10T07:14:51-05:00Dibakar Gopeggml : add AArch64 optimized GEMV and GEMM Q4 kernels (#5780)
1887e4dd31ff892627665d3c53c5d1a03c0d282d9d458f0fad42b9589f9b11362c74ea5338c51e4c7e612024-07-10T19:26:40+08:00RunningLeonpy : fix converter for internlm2 (#8321)
18888f0fad42b9589f9b11362c74ea5338c51e4c7e61a59f8fdc85e1119d470d8766e29617962549d9932024-07-10T19:19:10+08:00laikpy : fix extra space in convert_hf_to_gguf.py (#8407)
1889a59f8fdc85e1119d470d8766e29617962549d993fd560fe680c72fd0a0af2bc8881add20ad9190712024-07-09T18:26:40-04:00Clint HerronServer: Enable setting default sampling parameters via command-line (#8402)
1890fd560fe680c72fd0a0af2bc8881add20ad919071e500d6135ac42c4a23baf6a9a1a934dc023e5c7d2024-07-09T11:58:44-07:00Andy SalernoUpdate README.md to fix broken link to docs (#8399)
1891e500d6135ac42c4a23baf6a9a1a934dc023e5c7da03e8dd99d3954e7547137936c5a2a3b348bdb7f2024-07-09T11:54:43-04:00Clint HerronDeprecation warning to assist with migration to new binary names (#8283)
18929beb2dda038e2107a39a95def94a4cf971e048ea7d0e23d72ef4540d0d4409cb63ae682c17d539262024-07-09T09:16:00+03:00daghanerdonmezreadme : fix typo [no ci] (#8389)
1893c4dd11d1d3903e1922c06242e189f6310fc4d8c32ec846d558f6385ea647f7b8e665eb249c1ebce72024-07-08T22:19:24+08:00b4b4oreadme : fix web link error [no ci] (#8347)
18942ec846d558f6385ea647f7b8e665eb249c1ebce73f2d538b817112ad8429341c7e8657dcd660f4d32024-07-08T14:22:41+01:00Alberto Cabrera Pérezsycl : fix powf call in device code (#8368)
18953f2d538b817112ad8429341c7e8657dcd660f4d32ee44c9a1865a928ccbbc16a2d7841d7513f31c12024-07-08T13:51:31+03:00Georgi Gerganovscripts : fix sync for sycl
18966847d54c4f72f8bf6767b6feae7a95394654335efde13b3bb9f569f07fd8af74696ee48a43d051312024-07-08T10:39:36+03:00Georgi Gerganovtests : fix whitespace (#0)
1897fde13b3bb9f569f07fd8af74696ee48a43d05131470939d483d1c89b7292f78bac1fd27c42c171ce2024-07-02T11:09:52-05:00John Balisfeat: cuda implementation for `ggml_conv_transpose_1d` (ggml/854)
18986f0dbf6ab087bcd286fb78560099ca0458316735ffd00797d81ef7db1528b9e10adbdc333ade64952024-07-08T09:34:35+03:00Georgi Gerganovinfill : assert prefix/suffix tokens + remove old space logic (#8351)
18993fd62a6b1c9ca7b7c0093e984cc9c133c6f2726da8db2a9ce64cd4417f6a312ab61858f17f0f85842024-07-07T15:04:39-04:00compiladepy : type-check all Python scripts with Pyright (#8341)
1900a8db2a9ce64cd4417f6a312ab61858f17f0f85844090ea5501c702cd858095c394ba068919c56cc82024-07-07T09:08:28-06:00Denis SpasyukUpdate llama-cli documentation (#8315)
1901f1948f1e108157d5e7eb60fc8f24a10412e5d4fff7cab35ef9e66c57b4a416d09eb6c814e0ba4e4c2024-07-07T06:21:37-07:00Andy Taireadme : update bindings list (#8222)
1902f7cab35ef9e66c57b4a416d09eb6c814e0ba4e4c905942abdba5ba0b28a1b0805e51e4f818c54bc92024-07-07T22:58:43+10:00Briangguf-hash: model wide and per tensor hashing using xxhash and sha1 (#8048)
1903905942abdba5ba0b28a1b0805e51e4f818c54bc9b5040086d436e7345e4fa33a5b9558060c75603f2024-07-07T20:52:10+08:00toyerllama : support glm3 and glm4 (#8031)
1904b5040086d436e7345e4fa33a5b9558060c75603fd39130a3985ce0747d7229a6b7ebebb6376b5abf2024-07-07T14:59:02+03:00Georgi Gerganovllama : fix n_rot default (#8348)
1905210eb9ed0ac3979a93e37568d96447ec3e95ad05cb4d86c4d723af87d3d7e3177e9485f2003913842024-07-07T19:37:47+09:00standby24x7finetune: Rename an old command name in finetune.sh (#8344)
1906cb4d86c4d723af87d3d7e3177e9485f20039138486e7299ef5dff0f388922dc6fcbce009e99d80052024-07-07T11:10:38+02:00Bjarke Viksøeserver: Retrieve prompt template in /props (#8337)
190786e7299ef5dff0f388922dc6fcbce009e99d800560d83a0149849e9217e4b8ae26e277a41aea906e2024-07-06T15:32:04-05:00Derrick T. Woolworthadded support for Authorization Bearer tokens when downloading model (#8307)
190887e25a1d1bd26eb06d1cab9e2ee4e14a7a0be33c213701b51a17175d0d326b566efc03f30ec7fbe62024-07-06T09:22:16+02:00Daniel Beveniusllama : add early return for empty range (#8327)
1909213701b51a17175d0d326b566efc03f30ec7fbe6be20e7f49d9e5c6d9e8d9b4871eeba3df7a1639d2024-07-05T19:01:35+02:00jaime-m-pDetokenizer fixes (#8039)
1910be20e7f49d9e5c6d9e8d9b4871eeba3df7a1639d7ed03b8974269b6c48e55c4245d12fb3264a6cf52024-07-05T18:08:32+02:00Xuan Son NguyenReorganize documentation pages (#8325)
19117ed03b8974269b6c48e55c4245d12fb3264a6cf51d894a790e62b10d066adcdd9c9feb559455b7d22024-07-05T17:32:09+03:00Georgi Gerganovllama : fix compile warning (#8304)
19120a423800ffe4e5da3d83527ef3473da88cd78146d12f781074b92589a72a36ffabb583933f7b9dc02024-07-05T07:06:09ZDanieleCUDA: revert part of the RDNA1 optimizations (#8309)
1913bcefa03bc01a41aace2e200ee8e77827d6d39b4f5a7447c5692c9e3dde1161e8e69edb76d3d347142024-07-05T09:05:34+02:00Johannes GäßlerCUDA: fix MMQ stream-k rounding if ne00 % 128 != 0 (#8311)
19145a7447c5692c9e3dde1161e8e69edb76d3d3471461ecafa3905a02a299b7ae889b5578cfeb8d79df2024-07-05T02:58:41-04:00Pieter Ouwerkerkreadme : fix minor typos [no ci] (#8314)
1915aa5898dc53afcf77f16222cd719e10b29049f95a6c05752c507f51b88348f16d9e2c8df49f66c0282024-07-05T09:10:03+03:00Georgi Gerganovllama : prefer n_ over num_ prefix (#8308)
1916a9554e20b66546b0549aebe2e1034bc8afe9d809e235b267a2539d043734ff340eff74107722eb572024-07-05T05:06:13Zluoyu-intel[SYCL] Fix WARP_SIZE=16 bug of Intel GPU (#8266)
1917e235b267a2539d043734ff340eff74107722eb57f09b7cb609d80b8031803f89255991dc8b35db692024-07-05T07:53:33+03:00Georgi Gerganovpy : switch to snake_case (#8305)
1918d7fd29fff16456ce9c3a23fd2d09a66256b05aff6f63d646c1a06a6e09f721009a2676864ae04e312024-07-05T05:14:21+12:00Icecream95llama : add OpenELM support (#7359)
19196f63d646c1a06a6e09f721009a2676864ae04e3151d2ebadbbf365b894f3888361df42dbacb12b7a2024-07-04T18:38:58+02:00Daniel Beveniustokenize : add --show-count (token) option (#8299)
192007786a61a2097306ee496f565f78796f1aa205e6de14e2ea2b542386dcb800226eb360be76f433fd2024-07-02T15:35:43+05:30ditsukechore: Fixup requirements and build
1921821922916f95cc3853fc7f58ea2f1e15a0ffa669b1c3f26e5e882fa46d7a6704d893b31a025e90002024-03-10T23:21:46+05:30ditsukefix: Update script paths in CI scripts
1922b1c3f26e5e882fa46d7a6704d893b31a025e9000b0a46993dfbf8b8127598f319d4dcfdd83824ba82024-02-29T01:47:15+05:30ditsukefix: Actually include scripts in build
1923f8c4c0738d72d2162736edd72dd5db8b269adca1402d6feffa0572d1c7a957901b6d1702bd1884842024-07-04T12:53:42+02:00Daniel Beveniustests : add _CRT_SECURE_NO_WARNINGS for WIN32 (#8231)
192420fc3804bfb727074bc270b6eacb60af8d0bf7d4f619024764e72261f14d7c31d892b8fb976603b42024-07-04T10:41:03+03:00Georgi Gerganovconvert : fix gemma v1 tokenizer convert (#8248)
19255f2d4e60e202aabee10051e6615bb821e51787be916248af1f3c16abd7408de848e025da095c621c2024-07-03T19:33:31+02:00slarenppl : fix n_seq_max for perplexity (#8277)
1926916248af1f3c16abd7408de848e025da095c621cf8d6a23804f3798ff2869da68c1223b618df09ec2024-07-03T16:01:54+02:00Xuan Son Nguyenfix phi 3 conversion (#8262)
1927f8d6a23804f3798ff2869da68c1223b618df09ecfadde6713506d9e6c124f5680ab8c7abebe318372024-07-03T20:40:16+08:00Juddfix typo (#8267)
1928a27152b602b369e76f85b7cb7b872a321b7218f73e2618bc7bf9e9fbf58c32cc3c8dd7d5df1de27e2024-07-02T22:56:46+02:00MistApproachfix: add missing short command line argument -mli for multiline-input (#8261)
1929023b8807e10bc3ade24a255f01c1ad2a01bb42280e0590adab9f367b15ae2bf090a6d24f9df47ff12024-07-02T08:40:49+02:00Daniel Beveniusconvert-hf : print output file name when completed (#8181)
1930a9f3b102157ba992cfe058909b7f6e1906d2d647d08c20eddedb24515a3212e2de66bdff41a26b8c2024-07-02T04:50:07Zluoyu-intel[SYCL] Fix win build conflict of math library (#8230)
1931d08c20eddedb24515a3212e2de66bdff41a26b8c5fac350b9cc49d0446fc291b9c4ad53666c775912024-07-02T02:16:00Zluoyu-intel[SYCL] Fix the sub group size of Intel (#8106)
19325fac350b9cc49d0446fc291b9c4ad53666c77591cb5fad4c6c2cbef92e9b8b63449e1cb7664e48462024-07-02T01:07:23+02:00Xuan Son NguyenFix gemma2 tokenizer convert (#8244)
1933cb5fad4c6c2cbef92e9b8b63449e1cb7664e4846dae57a1ebc1c9bd5693ab999e19d77c5506ae5592024-07-01T20:39:06+02:00Johannes GäßlerCUDA: refactor and optimize IQ MMVQ (#8215)
193449122a873f54615626d1b49a2a39013ed4be98d50ddeff10230b88f1fa9866bbe5fe0d71ba2323a02024-07-01T18:48:34+02:00Xuan Son Nguyengemma2: add sliding window mask (#8227)
19359ef07800622e4c371605f9419864d15667c3558f1c5eba6f8e628fb0a98afb27d8aaeb3b0e1364512024-06-30T20:27:13+02:00Xuan Son NguyenFix new line issue with chat template, disable template when in-prefix/suffix is set (#8203)
19361c5eba6f8e628fb0a98afb27d8aaeb3b0e13645172272b83a3878e91251218c981b4c6ec16c339122024-06-29T20:44:08-07:00Andreillama: Add attention and final logit soft-capping, update scaling factor to Gemma2 (#8197)
193772272b83a3878e91251218c981b4c6ec16c339128748d8ac6f172b99826ab18f01d9a3a165987d542024-06-29T00:14:20+02:00Xuan Son Nguyenfix code typo in llama-cli (#8198)
193826a39bbd6b0bbd66118bb68569f0276d7fe7df6c38373cfbab5397cc2ab5c3694a3dee12a9e58f452024-06-28T15:11:44+02:00Xuan Son NguyenAdd MiniCPM, Deepseek V2 chat template + clean up `llama_chat_apply_template_internal` (#8172)
1939b851b3fba0a1b06a1129189bac300e07dd1648c8139cc621e90b4f61830515c3c124cf35b3d7a6dc2024-06-28T12:37:45+02:00slarencmake : allow user to override default options (#8178)
1940139cc621e90b4f61830515c3c124cf35b3d7a6dce57dc62057d41211ac018056c19c02cd544694df2024-06-28T09:26:45+01:00Olivier Chafik`json`: restore default additionalProperties to false, fix some pattern escapes (#8180)
1941e57dc62057d41211ac018056c19c02cd544694dfa27aa50ab7e07fe46aae619076b6e31d5663e9142024-06-28T00:00:43-04:00pcullitonllama: Add support for Gemma2ForCausalLM (#8156)
1942cb0b06a8a613f7a2ccb7253b2a3c00fdd397ba1c558f44bf83d78242d4e5c4ab98d0be9125cb97802024-06-27T22:08:42+01:00Olivier Chafik`json`: update grammars/README w/ examples & note about additionalProperties (#8132)
1943558f44bf83d78242d4e5c4ab98d0be9125cb97808172ee9da9921ca53d698c7438c2d792b3f3f2c82024-06-27T15:01:23-04:00loonerinCI: fix release build (Ubuntu+Mac) (#8170)
19448172ee9da9921ca53d698c7438c2d792b3f3f2c816791b8f0b4526aafbf5d0e5bbbd2e99c22534182024-06-27T20:04:39+02:00slarencmake : fix deprecated option names not working (#8171)
194597877eb10bd8e7f8023420b5b5300bcbdadd62dc387952651a8fc493f8c85ea4c9774bd4a5694f872024-06-27T15:48:07+01:00jukofyorkControl vector loading fixes (#8137)
1946387952651a8fc493f8c85ea4c9774bd4a5694f876030c61281c8a7eb94eceb7396a608fac8b715552024-06-27T20:09:29+05:30Raj Hammeer Singh HadaDelete examples/llama.android/llama/CMakeLists.txt (#8165)
194785a267daaa1c6f8fd69160445bcb88717031d10cf675b20a3b7f878bf3be766b9a737e2c8321ff0d2024-06-27T16:26:05+02:00Johannes GäßlerCUDA: fix MMQ stream-k for --split-mode row (#8167)
1948911e35bb8bb2fd1c7d3f40f27e96ff432eae7e14ac146628e47451c531a3c7e62e6a973a2bb467a02024-06-27T09:46:41+02:00Sigbjørn Skjæretllama : fix CodeLlama FIM token checks (#8144)
19499b31a40c6ddabe552875b811d7127aa039ca9703c70d117c37cc7876e775d1e2722208a50c52edb32024-06-27T01:50:09+02:00Daniel Beveniusclip : suppress unused variable warnings (#8105)
1950c70d117c37cc7876e775d1e2722208a50c52edb3ae5d0f4b899ff2842bfca561370c945ad8d4368b2024-06-26T23:25:22+03:00Georgi Gerganovscripts : fix filename sync
1951ae5d0f4b899ff2842bfca561370c945ad8d4368b31ec3993f6e050322a249c07af79dbde66ea6ddc2024-06-26T21:59:28+02:00slarenci : publish new docker images only when the files change (#8142)
1952c7ab7b612cbdce04499575e713076a026af4b9c5f2d48fffde76d959fdb0da37316bdc09e5518eb12024-06-26T20:20:22+02:00slarenmake : fix missing -O3 (#8143)
1953f3f65429c44bb195a9195bfdc19a30a79709db7b88540445615e77a0177fcca43aaa8e9d8eea68642024-06-26T18:33:02+03:00Georgi Gerganovllama : reorganize source code + improve CMake (#8006)
195488540445615e77a0177fcca43aaa8e9d8eea6864c8771ab5f89387cdd7d9a8a69280dac46b45e02f2024-06-26T02:29:28-04:00Isaac McFadyenClarify default MMQ for CUDA and LLAMA_CUDA_FORCE_MMQ flag (#8115)
1955c8771ab5f89387cdd7d9a8a69280dac46b45e02f494165f3b6c4cbcd793123cb57fb3e1f5477f1db2024-06-26T08:28:02+02:00Johannes GäßlerCUDA: fix misaligned shared memory read (#8123)
19566777c544bdd8c5d9de3220d6e2557957bbbf2a4f163d50adaf8897d8b734d701ff332de6be63d4842024-06-26T01:45:58+01:00Olivier Chafik`json`: fix additionalProperties, allow space after enum/const (#7840)
1957163d50adaf8897d8b734d701ff332de6be63d4846fcbf6823553efabe52ed83e3c2a3329aa3387d12024-06-25T21:47:40+01:00jukofyorkfixes #7999 (adds control vectors to all `build_XXX()` functions in `llama.cpp` [needs testing] (#8060)
1958e6bf007744eb06336a231ef39cf08146dd16d2ce84631fe1504de40427dc4b4cdac92fa7ebf659552024-06-25T21:07:28+02:00Daniel Beveniusllama : return nullptr from llama_grammar_init (#8093)
195984631fe1504de40427dc4b4cdac92fa7ebf65955dd047b476c8b904e0c25e5dbc5bee6ffde2f6e172024-06-25T20:06:20+01:00Olivier Chafik`json`: support integer minimum, maximum, exclusiveMinimum, exclusiveMaximum (#7797)
196048e6b92cc378c937e59719f2c0f482bf76c9ca813791ad219323389106dc3fd80814eb5bbb7b80de2024-06-25T13:56:49+02:00Xuan Son NguyenAdd chat template support for llama-cli (#8068)
19612df373ac40ea581ccca8a58c713f03ad9d4b658d3b099bcd9cbf2434f90cbe40eba6fa2189ed1d022024-06-25T01:22:33+02:00Johannes GäßlerCUDA: fix matrix multiplication algorithm choice (#8102)
19623b099bcd9cbf2434f90cbe40eba6fa2189ed1d02a818f3028d1497a51cb2b8eb7d993ad58784940e2024-06-24T22:15:33+02:00Johannes GäßlerCUDA: fix MMQ writeback for int8 tensor cores (#8100)
1963a818f3028d1497a51cb2b8eb7d993ad58784940ed62e4aaa02540c89be8b59426340b909d02bbc9e2024-06-24T17:43:42+02:00Johannes GäßlerCUDA: use MMQ instead of cuBLAS by default (#8075)
1964d62e4aaa02540c89be8b59426340b909d02bbc9e9a590c82262dd518137f85406e65e452fdf2aca32024-06-24T14:13:39+02:00fairydreaminggguf-py : fix tensor groups for encoder-decoder models in gguf-dump.py (#8090)
196552fc8705a0617452df08333e1161838726c322b48cb508d0d5c024e12692370d85237b45469a004b2024-06-24T05:42:03-04:00Christian Zhou-ZhengOption to split during conversion (#6942)
1966646ef4a9cfb6f40236d3b9ef07ac03700b6efcc7de0d6a68ac99f307fe889c48e21124bc3b7ca29a2024-06-24T13:30:24+08:00Yann Folletembedding : more cli arguments (#7458)
1967e112b610a1a75cb7fa8351e1a933e2e7a755a5ce6a2f298bd784403c5c33eebb822217ec5d9b55902024-06-24T02:27:57+08:00Eddie-Wangllama : add support for BitnetForCausalLM (#7931)
19686a2f298bd784403c5c33eebb822217ec5d9b559011318d9aa1f668aa10407a5cb9614371af32f3ce2024-06-23T18:03:08+03:00Aarni Koskelaserver : fix JSON-Scheme typo (#7975)
196911318d9aa1f668aa10407a5cb9614371af32f3ceb6b9a8e606da7764bd3649c2ea574979c85abd432024-06-23T15:39:45+02:00Daniel BeveniusFix typo in llama_set_embeddings comment (#8077)
1970b6b9a8e606da7764bd3649c2ea574979c85abd4345c0e2e4c1268c2d7c8c45536f15e3c9a731ecdc2024-06-23T13:14:45+02:00slarenfix CI failures (#8066)
197145c0e2e4c1268c2d7c8c45536f15e3c9a731ecdcb5a5f34efadec8d8f0057b35cb04742abfeb2ef52024-06-23T10:21:25+02:000cc4mRefactor Vulkan backend to allow multiple contexts (#7961)
19723e58b0ee355f78be41cf5211b68426761339bc3cadf480c3ab3abedc964c8ae381476257583ae1342024-06-22T18:11:30+02:00Xuan Son Nguyencvector: fix CI + correct help message (#8064)
1973adf480c3ab3abedc964c8ae381476257583ae1343aa184a8c7c553b5dfcc142d919f3db695df297a2024-06-22T17:19:37+02:00HatsuneMikuUwU33cvector-generator: Moe Moe Fixie-Fixie for Lots of Formats~! ♡(ᐢ ᴥ ᐢ)♡ (#8052)
19743aa184a8c7c553b5dfcc142d919f3db695df297a5b48cd53a87928db0c6447f0c9dac4db5802102d2024-06-22T09:37:41-04:000xspringtimeconvert-hf : change assert to exception (#8015)
1975c5a8d4b749352645afd4c024f85d6eca2ca72c6d557b653dc9ed91e8c313e87500e0050c775f81b62024-06-21T23:18:36-04:00Clint HerronJSON Schema to GBNF integration tests (#7790)
1976557b653dc9ed91e8c313e87500e0050c775f81b67d5e8777ae1d21af99d4f95be10db4870720da912024-06-21T16:28:20+08:00k.h.laivulkan: detect multiple devices by deviceUUID instead of deviceID (#8022)
19777d5e8777ae1d21af99d4f95be10db4870720da91a927b0f3dd9a86ee042cd2bdcc8c9da4a855926b2024-06-21T05:57:36ZEveggml : AVX IQ quants (#7845)
197817b291a6a581c47f24f99bad926b42617894f99fabd894ad96a242043b8e197ec130d8649eead22e2024-06-20T20:59:59+01:00Hamdoud Hakemconvert-hf : Fix the encoding in the convert-hf-to-gguf-update.py (#8040)
1979abd894ad96a242043b8e197ec130d8649eead22ede391e4c803383bbea054b6edd016e78c024a74d2024-06-20T16:40:13+02:00Johannes Gäßlercommon: fix warning (#8036)
1980de391e4c803383bbea054b6edd016e78c024a74dd50f8897a797a5a03f31228d1b5a7b8130ee1bc22024-06-20T13:19:05Zluoyu-intel[SYCL] Fix windows build and inference (#8003)
1981d50f8897a797a5a03f31228d1b5a7b8130ee1bc22075a66a96cc1b04eabec7cf4b3051193d6f719e2024-06-20T14:39:21+02:00Johannes GäßlerCUDA: stream-k decomposition for MMQ (#8018)
19822075a66a96cc1b04eabec7cf4b3051193d6f719eba5899315283eb1df3902363daf79bdc5eefe4262024-06-19T22:32:01-07:00Michael de Gansmetal : fix `ggml_metal_supports_op` for BF16 (#8021)
1983ba5899315283eb1df3902363daf79bdc5eefe426a7854743c5e6216a6178824a603aa9479728ddd52024-06-19T23:57:10Zsasha0552server : fix smart slot selection (#8020)
1984a7854743c5e6216a6178824a603aa9479728ddd59c77ec1d74874ee22bdef8f110e8e8d41389abf22024-06-19T13:10:42-07:00Michael de Gansun-ignore `build-info.cmake` and `build-info.sh` (#7996)
1985623494a478134432fd2d7ee40135770a3340674f37bef8943312d91183ff06d8f1214082a17344a52024-06-19T09:11:51+08:00Meng, Hengyu[SYCL] refactor (#6408)
198637bef8943312d91183ff06d8f1214082a17344a591c188d6c296bd3384f2a02a83b71187aa3d18b32024-06-18T18:40:52+02:00jaime-m-ptokenizer : BPE fixes (#7530)
198784f6de17f6a8602e7ff7f7c7bda36a73f510a2dd61665277afde2add00c0d387acb94ed5feb959172024-06-18T09:18:32-03:00jojorneFix no gcc pragma on Windows (#7751)
198861665277afde2add00c0d387acb94ed5feb95917b96f9afb0d58b003ac8d1d0c94cd99393a3bc4372024-06-18T14:00:14+02:00Ulrich DrepperAllow compiling with CUDA without CUDA runtime installed (#7989)
1989e6ecc2be470e3c5c6c5c9d8b90aa83a1f7725084a94e6ff8774b7c9f950d9545baf0ce35e8d1ed2f2024-06-18T09:37:20+03:00Georgi Gerganovwhisper : use ggml_backend_sched (whisper/2239)
1990a94e6ff8774b7c9f950d9545baf0ce35e8d1ed2f5b6da187508f49a9fa9d95fa22ae804a0780d2562024-06-17T22:08:46+03:00Ștefan-Gabriel Muscaluupdate: support Qwen2-57B-A14B (#7835)
1991c637fcd34d135a9ff4f97d3a53ad03a910a4a31f6a2f0b3474d479bda4ac2ee7cfd5dcdcf0be1f792024-06-17T22:11:08+08:00Frank Maifix: divide 0 exception in mamba (#7932)
19926a2f0b3474d479bda4ac2ee7cfd5dcdcf0be1f7921be9cab94e0b5b53cb6edeeebf8c8c799baad032024-06-17T16:10:15+02:00Markus TavenrathImplement non-mapped async IO for CUDA on Windows. (#7896)
199321be9cab94e0b5b53cb6edeeebf8c8c799baad03006167aaf6b6aaa4daa52961035f7460af19f4692024-06-17T11:09:20+03:00Georgi Gerganovrpc : fix load/store misaligned addresses (#7948)
1994006167aaf6b6aaa4daa52961035f7460af19f469df68d4fa5dc929217d3e64d673e099d7a417b2062024-06-17T15:25:20+10:00Briangguf-dump.py: add --markdown dump output (#7853)
199543b35e38ba371f9a7faa6dca4c5d1e8f698ffd8719b7a836f6658e18e973af532a5cc6ad6b3a27f82024-06-16T15:23:04-07:00Calvin LaurensonAdd support for sqrt on CUDA (#7953)
199619b7a836f6658e18e973af532a5cc6ad6b3a27f8b5fcf8ef5c29df53cfff60e180b4992a3b2332a62024-06-11T17:39:01+03:00Georgi Gerganovcuda : fix bounds check for src0 rows in MMVQ kernel (whisper/2231)
1997b5fcf8ef5c29df53cfff60e180b4992a3b2332a6398105ff4373eea385ea8e8625cb417b2ae511342024-06-16T16:53:11+08:00Hong Bo PENGggml : fix and optimize ppc64le (ggml/849)
1998cddaf028adc738b5a7ecc60809cb78e0ba0f97c1c8a82194a888f68f259e0d0fa96f3332ac7c5cb62024-06-16T14:50:12+03:00Georgi Gerganovggml : fix handling of zero blocks in IQ quants (#7955)
19997c7836d9d4062d6858e3fb337b135c417ccee6ce0c7b3595b9e5ad2355818e259f06b0dc3f0065b32024-06-16T07:17:31+02:000cc4mVulkan Shader Refactor, Memory Debugging Option (#7947)
20000c7b3595b9e5ad2355818e259f06b0dc3f0065b37b2f4a7d193ef2475259bbe7656fcccfab4b12172024-06-15T18:53:40+02:00Xuan Son NguyenAdd `cvector-generator` example (#7514)
2001f8ec8877b75774fc6c47559d529dac423877bcad76d66ee0be91e2bec93206e821ee1db8d023cff52024-06-14T20:28:34+03:00olexiybci : fix macos x86 build (#7940)
200276d66ee0be91e2bec93206e821ee1db8d023cff566ef1ceedf983773c8ceb4d925285d41d4e50e2a2024-06-14T18:41:49+02:00Johannes GäßlerCUDA: faster q2_K, q3_K MMQ + int8 tensor cores (#7921)
2003e65bbf606c61f49dc06c7ac060cd5ba7ae4460256fcd1331efbfbb89c8c96eba2321bb7b4d0c40e42024-06-14T16:47:41+03:00Radoslav Gerganovllama-bench : fix RPC indication (#7936)
200441b9260f18eb7f325c952006ac46afc1d0d8ad2f172c8256840ffd882ab9992ecedbb587d9b21f152024-06-14T13:16:49+03:00Elaineconvert : add Poro-34B-chat tokenizer support (#7713)
2005172c8256840ffd882ab9992ecedbb587d9b21f15a55eb1bf0fa2fd84147bdfd384391e029d9882532024-06-13T15:18:44+03:00Radoslav Gerganovrpc : fix ggml_backend_rpc_supports_buft() (#7918)
2006f578b86b2123d0f92afbaa98a031df4d4464e5821c641e6aac5c18b964e7b32d9dbbb4bf5301d0d72024-06-13T03:11:35+02:00slarenmove BLAS to a separate backend (#6210)
20071c641e6aac5c18b964e7b32d9dbbb4bf5301d0d7963552903f51043ee947a8deeaaa7ec00bc3f1a42024-06-13T00:41:52+01:00Olivier Chafik`build`: rename main → llama-cli, server → llama-server, llava-cli → llama-llava-cli, etc... (#7809)
2008963552903f51043ee947a8deeaaa7ec00bc3f1a4a9cae48003dfc4fe95b8f5c81682fc6e634252352024-06-12T17:41:51+02:00Johannes GäßlerCUDA: fix broken oob check for FA vec f32 kernel (#7904)
2009dcf752707d96eb305f546526c7bc5d01f0831130f2b5764beb35583295e2475479c18f249b139b582024-06-12T17:05:35+08:00Meng, Hengyuupdate intel docker oneapi-basekit to 2024.1.1-devel-ubuntu22.04 (#7894)
2010f2b5764beb35583295e2475479c18f249b139b5873bac2b11d7d3e20982fc9ee607625836387db8b2024-06-12T03:18:16+02:00Patrice FerletFix a typo and add Fedora 40 pacakge to install for Vulkan (#7794) [no ci]
2011ef52d1d16afc695d798396cdd13594ea5e45a9dd14f83526cd27f638c856ea6eff08110b9860eb2a2024-06-11T21:20:29+02:000cc4mUpdate Vulkan RoPE implementation (#7818)
201214f83526cd27f638c856ea6eff08110b9860eb2a6fe42d073f0554eada93ac9d40574025aeedb7032024-06-11T12:18:58-04:00Deven Mistryfix broken link in pr template (#7880) [no ci]
2013c2ce6c47e4f2d891bf29d8810832a3b310a8f205b61eb9644d64e90123ac805436d95b94b3b4cc3f2024-06-11T07:59:20+02:00slarenfix CUDA CI by using a windows-2019 image (#7861)
2014396b18dfec2c56846e80362db70af09b9e1d70ba864a99e7a01d9422d2f55618dbe62c8099a2175c2024-06-11T01:00:30+01:00Olivier Chafik`json`: document schema conversion in GBNF readme, align manual grammar examples & converters (#7841)
2015864a99e7a01d9422d2f55618dbe62c8099a2175cfd5ea0f897ecb3659d6c269ef6f3d833e865ead72024-06-10T18:32:10-04:00Jared Van Bortelcmake : fix CMake requirement for CUDA (#7821)
20161f0dabda8d5c131f9d4632aa41de74317cdd61fbaf4ae502ddaeb03cd5861273ca2e9a5ae4551db72024-06-10T11:45:13+02:00Johannes GäßlerCUDA: use tensor cores for MMQ (#7676)
201757bf62ce7cb75cca589943e2050d29bff4026e763e2ee443159724e2d3a0741f6b167e599ec088aa2024-06-09T11:24:29-04:00Nicolás Pérezdocs: Added initial PR template with directions for doc only changes and squash merges [no ci] (#7700)
20182decf57bc6e4a6b45176c3727d964a01161beecc5795b941827fdec6c1662986de962badff4567182024-06-09T06:39:25Zsasha0552convert-hf : set the model name based on cli arg, if present (#7693)
20195795b941827fdec6c1662986de962badff456718ed9f2521185706481501a5e6d5315397b11802ff2024-06-08T22:47:25-04:00compiladeconvert-hf : match model part name prefix and suffix (#7687)
2020ed9f2521185706481501a5e6d5315397b11802fffe1e3917cfa0f9397a765cfd0aef880674d938d52024-06-08T22:34:29-04:00compiladegguf-py : decouple adding metadata from writing in GGUFWriter (#7827)
20217a16ce7db2a74a223f0f3b9cee66d4539c5bce8fda799b41891e34aac86ce4e173f9c4c0afd4fab32024-06-08T07:50:31Zsasha0552server : smart slot selection using Longest Common Prefix (#7728)
2022da799b41891e34aac86ce4e173f9c4c0afd4fab3c00fad71e507ff386d42bd74846fe06d19dd63a42024-06-07T19:47:49+02:00slarenvulkan : reuse parent extra for views (#7806)
2023c00fad71e507ff386d42bd74846fe06d19dd63a427615f5ab21060d96953c9c1e223051ab2188f572024-06-07T08:56:01-04:00Christian Zhou-Zhenggguf-split : change binary multi-byte units to decimal (#7803)
202427615f5ab21060d96953c9c1e223051ab2188f577027b27d765db95d4ac6b569d976e387a87158812024-06-07T05:15:07-07:00intelmattcmake : fix BUILD_SHARED_LIBS=ON build (#7784)
2025d5c938cd7716b9a2ace49a43a469dfbffcff4d28c9ee7118d5644dd3df70ea6878b36a9761616aab2024-06-07T14:28:26+08:00pengxin99[SYCL] fix softmax r2r result wrong issue (#7811)
2026ee459f40f65810a810151b24eba5b8bd174ceffef83351f9a62a6262f1fc3d08f320033089cddfb52024-06-06T19:19:59+03:00Georgi Gerganovserver : fix --threads-http arg (#7801)
2027f83351f9a62a6262f1fc3d08f320033089cddfb5ad675e1c67a05b16e4e12abe30dbecfc808e7b7e2024-06-06T16:30:58+03:00Georgi Gerganovimatrix : migrate to gpt_params (#7771)
2028a143c04375828b1f72eb1a326115791b63e7934555b2d0849d3ec9e45e4a4d9e480f5fa7977872a62024-06-06T09:17:54-03:00Mattheus ChediakREADME minor fixes (#7798) [no ci]
202955b2d0849d3ec9e45e4a4d9e480f5fa7977872a6f5d7b268ec4bf8628aa6ccc9f6631d0230dde76f2024-06-06T10:07:06+01:00Olivier Chafikgrammars: x{min,max} repetition operator (#6640)
2030f5d7b268ec4bf8628aa6ccc9f6631d0230dde76f2d08b7fbb483c14bd2b173d4cd51ea3a4f862e8f2024-06-06T09:22:41+02:00Joan Fontanalsllama : add jina v2 base code (#7596)
20317672adeec7a79ea271058c63106c142ba84f951a7d1a378b8fb266782d9248538a661405aad807682024-06-05T19:07:24+02:00GalunidFix encoding in python scripts (#7733)
20327d1a378b8fb266782d9248538a661405aad807682b3389677a833cee0880226533a1768b1a9508d22024-06-05T16:53:00+02:00Johannes GäßlerCUDA: refactor mmq, dmmv, mmvq (#7716)
20332b3389677a833cee0880226533a1768b1a9508d29973e81c5ccf4f31b3980f5aa73f5cfea86998602024-06-05T11:29:20+03:00Georgi Gerganovggml : refactor rope norm/neox (#7634)
2034c90dbe026b456a233f8f0fbe752212e6a0503ca2b90dc566c1c615289b05b50d61680f23744a21e72024-06-05T01:26:14+02:00jaime-m-pFix per token atrributes bits (#7749)
2035b90dc566c1c615289b05b50d61680f23744a21e71442677f92e45a475be7b4d056e3633d1d6f813b2024-06-04T21:06:49+01:00agray3Allow number of nodes in CUDA graph to change (#7738)
20361442677f92e45a475be7b4d056e3633d1d6f813b554c247caffed64465f372661f2826640cb104302024-06-04T21:23:39+03:00Georgi Gerganovcommon : refactor cli arg parsing (#7675)
2037987d743d6bc4cee4bde6820733ea33a2abc0afacb226c1227bcf6412076ecf787421135fd2c42ef02024-06-04T12:09:15ZDanieleImprove hipBLAS support in CMake (#7696)
20386d1616944d9efd342ed2a4fd318722adfc9febcdbde7cd3cd949c1a85d3a199498ac98e78039d46f2024-06-04T10:01:09+03:00Georgi Gerganovggml : prevent builds with -ffinite-math-only (#7726)
2039bde7cd3cd949c1a85d3a199498ac98e78039d46fa5735e4426b19a3ebd0c653ad8ac01420458ee952024-06-03T20:03:26+03:00Radoslav Gerganovllama : offload to RPC in addition to other backends (#7640)
2040a5735e4426b19a3ebd0c653ad8ac01420458ee950b832d53ba0ffcc759c8d62ede3772dd62321f8e2024-06-04T00:14:15+09:00Masaya, Katoggml : use OpenMP as a thread pool (#7606)
20410b832d53ba0ffcc759c8d62ede3772dd62321f8e3d7ebf63123b8652fb7bbecef7ba7312023099012024-06-03T16:28:58+02:00Johannes Gäßlermake: fix debug options not being applied to NVCC (#7714)
20423d7ebf63123b8652fb7bbecef7ba731202309901a10cda58d3199cd85305e0f03a8c6056714ae2e82024-06-03T10:59:14+02:000cc4mVulkan Mixture of Experts (MoE) support (#7628)
20436f28a333c1e3fdfdc7b4f9d0367f2b41a9b7e9d4549279d8049d78620a2b081e26edb654f83c3bbd2024-06-03T15:49:30+08:00zhangkaihuollama : MiniCPM support tied embeddings (#7664)
20443413ae2193d0693f14bead02e5018f442cbf579b1669810d7c2446af8425aa54ff6611bf6f14646c2024-06-03T07:59:54+10:00Dave Airliefix bug introduced in using calloc (#7701)
2045e141ce624af57bdffbaf57014a044eb1d96892302e666832e6ac78194edf030bd1c295e21bdb022c2024-06-01T23:26:10+02:00Johannes GäßlerFix FlashAttention debug test, FP32 assert (#7684)
20462e666832e6ac78194edf030bd1c295e21bdb022c2ac95c9d5678d05e253691fb1f26471675bff5ad2024-06-01T21:31:48+02:00Yazan Agha-Schraderserver : new UI (#7633)
20472ac95c9d5678d05e253691fb1f26471675bff5ad750f60c03e4d3f53fa51910551ce87a3d508d2d72024-06-01T21:50:18+05:30HanishKVCSimpleChat: Simple histogram/repeatMatching driven garbageTrimming, Settings UI, Streaming mode, OpenAi Compat (Model, Authorization Bearer), Save/Restore session, Auto Settings UI (#7548)
2048750f60c03e4d3f53fa51910551ce87a3d508d2d79b596417af11c9ac44fcae0fcfbc6f36650890832024-06-01T15:47:04+02:00Johannes GäßlerCUDA: fix Pascal FA, deq. KV to FP16 for batch > 8 (#7681)
20499b596417af11c9ac44fcae0fcfbc6f3665089083a323ec60af14a33d560df98f2cc41b4112cb4f802024-06-01T08:44:14+02:00Johannes GäßlerCUDA: quantized KV support for FA vec (#7527)
20500515ad93f48df63bbff204eddb0cac75e8585c65c8047d538f3addab40e3112be60bb92e70ce1a502024-05-31T17:42:33+02:00Galunidconvert-hf : Handle NotImplementedError in convert-hf-to-gguf (#7660)
20510c27e6f62eea80140daf152d7b6c154466614e5c2e32f874e675f7bc5307cb7b4470ddbe090bab8f2024-05-31T14:17:10+03:00Georgi Gerganovggml : fix loongson compile warnings (#7537)
20529022c33646fbf78da35f40c3f98576cc08c40ddf5921b8f089d3b7bda86aac5a66825df6a6c106032024-05-30T21:32:38+01:00JohnnyBFixed painfully slow single process builds. (#7326)
20535dcdf946764fae49a8e2a90bf2f0960bde1c44e82e2340de1740b07f2418c04792607387d4dc14422024-05-30T17:07:39+02:00Martin DelilleFix conan badge display [no ci] (#7645)
2054e6157f94c8f835f7f774b98409078867472a34fe9c4c9cc83f7297a10bb3b2af54a22ac154fd5b202024-05-30T21:55:36+10:00Briangithub: add contact links to issues and convert question into research [no ci] (#7612)
20559c4c9cc83f7297a10bb3b2af54a22ac154fd5b2059b0d077662fab430446b3119fa142f3291c45b22024-05-30T13:40:00+02:00GalunidMove convert.py to examples/convert-legacy-llama.py (#7430)
2056d5c05821f3c3d6cabe8ac45776fe0ecb0da13eca972b555ab935705f3437abd5909a5c46852811f62024-05-30T17:30:10+08:00junchao-loongsonggml : fix loongarch build (O2 issue) (#7636)
20573854c9d07f67de7f8cd6d86117bfaef47549b05aeb57fee51f7b4d78039f003249873c2eb46f12f62024-05-30T14:19:08+08:00Meng, Hengyu[SYCL] fix intel docker (#7630)
205855d62262a99cd8bc28a1492975791fe433c8cc0f975ec63ff26cdf96156d1126d86f75a395fdc43a2024-05-29T22:20:40+03:00Georgi Gerganovmetal : remove invalid asserts (#7617)
2059fb76ec31a9914b7761c1727303ab30380fd4f05ccce3dcffc5695bd24835f04e6080070a2a1198732024-05-29T20:17:31+03:00Georgi Gerganovggml : fix YARN + add tests + add asserts (#7617)
2060504f0c340f6b5e04de682f6ddefdd3b81208df5db864b50ce5e2beefc8c2fd31733e4e1a978b77542024-05-29T10:09:31+08:00zhouwgggml : fix typo in ggml.c (#7603)
206102c1ecad07f0e2d2febe8196271bcc64bdc9c0066bd12ce409f949012935b7d1b15a21ffa473a5652024-05-28T21:46:34+02:00jaime-m-pTokenizer WPM fixes (#7500)
20626bd12ce409f949012935b7d1b15a21ffa473a5655442939fcc5e6ae41abf40612a95fd71377e487e2024-05-28T22:22:50+03:00Georgi Gerganovsycl : fix assert (#7563)
20635442939fcc5e6ae41abf40612a95fd71377e487e56411a950f255b523a9edd684fd16327524743992024-05-28T20:49:49+02:00Giuseppe Scrivanollama : support small Granite models (#7481)
2064edc29433fa08b4e5aeb67649a29fc7713af13d048b99e2aa66ba39e4e1114effea6ef7430881eca42024-05-28T15:04:09+03:00Georgi Gerganovtests : fix test-tokenizer-0.sh
2065271ff3fc44a6ecfcea3ebc192e67567d578b7772e2b065071c5fc8ac5697d12ca343551faee465cc2024-05-28T20:27:27+10:00Briangithub: add refactor to issue template (#7561)
2066e2b065071c5fc8ac5697d12ca343551faee465cc0548a4187f2e53b8fc6d9ff0f4c71988f708ff422024-05-28T17:53:37+08:00Neo Zhang[SYCL]fix ggml_sycl_mul_mat_id() to match the change of api (#7436)
20670548a4187f2e53b8fc6d9ff0f4c71988f708ff429335b969e86a222e247adacedf814d8abfff88472024-05-28T11:04:19+03:00Georgi Gerganovggml : generalize GGML_OP_CONCAT (#7563)
2068c41767154eb82aa3fe7568fc816c3402b78eae9474b239b3d5f067470d7ef5e26e2e059720572e322024-05-28T00:41:14-04:00Nathan EpsteinMarkdownish code block fix (#7571)
206910b1e4587670feba2c7730a645accf8234873113197c00681b80f9dea17d11a4436b6b8ef1be0ce82024-05-27T19:34:40+02:00Johannes Gäßlermake: add --device-debug to NVCC debug flags (#7542)
2070197c00681b80f9dea17d11a4436b6b8ef1be0ce895f84d5ce8b449a9b16009434aca800df504a02e2024-05-27T18:33:42+01:00agray3Allow multiple copy function pointers for CUDA graph kernel param updates (#7565)
207195f84d5ce8b449a9b16009434aca800df504a02e5487593bc7ee0b65b9d2e2985b4b61dc770431012024-05-27T17:34:51+01:00AidanBeltonSFix q_xxs using mul_mat_q (#7459)
2072d6ef0e77dd25f54fb5856af47e3926cf6f36c281dff451cfa1f297348751ce6b538670e1ae9a7d5b2024-05-27T10:54:30+10:00Briangithub: add self sorted issue ticket forms (#7543)
2073d298382ad977ec89c8de7b57459b9d7965d2c27232a28217f475119926c603341e8273b26932b56a2024-05-27T00:10:17+10:00Brianmain: replace --no-special with --special (#7534)
207432a28217f475119926c603341e8273b26932b56ac429b33beb35f13934a4dfbe0c138d30b45e5d542024-05-26T16:02:34+02:00GalunidFix aya-23 conversion scripts (#7539)
2075b9adcbbf92fc7096bee23fe61496d25652ebf7659588f196b1d7b21bdff013fcf958c249576b26192024-05-26T06:26:34+05:30HanishKVCSimpleChat Completion Mode flexibility and cleanup, Settings gMe, Optional sliding window (#7480)
20769588f196b1d7b21bdff013fcf958c249576b26193cbd23ed88c03a27e1eb6090ac4a8186ca9ac29a2024-05-25T15:21:30+03:00Georgi Gerganovtrain : change default FA argument (#7528)
207700c63907931bb08a0ed2b7e38cf44dd290143cb9faa0e6979a11dcb731e9d778ad42ceaa0302015e2024-05-25T05:04:03-04:00Justine Tunneymain : don't print special tokens with --grammar (#6923)
2078902184dd3a9d6685e752b19027a48423742531db57684331fc2d685f7d1f5775af0b9e47d18298332024-05-25T05:30:59+02:00Xuan Son Nguyenfix missing slash in `fs_get_cache_directory()` (#7503)
207957684331fc2d685f7d1f5775af0b9e47d1829833b83bab15a5d2a1e7807d09613a9b34309d86cfaa2024-05-24T18:14:42-07:00Mikko JuolaMake tokenize CLI tool have nicer command line arguments. (#6188)
2080b83bab15a5d2a1e7807d09613a9b34309d86cfaad041d2ceaaf50e058622d92921b3e680ffa4e9e72024-05-24T21:11:48-04:00compiladegguf-py : fix and simplify quantized shape round-trip (#7483)
20811debe72737ea131cb52975da3d53ed3a835df3a6007489e895bad02e4e54758bf0bdf2d6a4cdb7c12024-05-23T17:17:43+03:00Georgi Gerganovggml : silence UB sanitizer error during iq2_xxs quantization (#0)
2082007489e895bad02e4e54758bf0bdf2d6a4cdb7c18b94e799dfa482adf63419df4905dc79b37e179f2024-05-23T16:15:15+02:00Tristan DruyenFix phi3 chat template confusion with zephyr (#7449)
208355ac3b7aeaf52f19786ed96e885d89521fc0f6c8dacfcebd6022175848e978f82811a244f10330382024-05-23T15:28:14+03:00Georgi Gerganovci : use Pythia models instead of OpenLlama (#7470)
2084cd93a28cb1446319af5e2f4b416174c3a8e435461e374365d170b7f692fd7753c145e21bc14486c82024-05-23T00:31:20+02:00Johannes GäßlerCUDA: fix FA out-of-bounds reads (#7479)
20851e374365d170b7f692fd7753c145e21bc14486c8197ff91462dd05bb9a3be03578114abf0c3555362024-05-22T23:23:21+05:30HanishKVCSimpleChat: a simple and dumb web front end for testing /chat/completions and /completions end points and try chat (#7350)
20866ff13987ad1a9519bee13dd98b6a21cd98979aab38c03478a37e460ecd3a21155b338a83bfed7f902024-05-22T20:04:20+03:00Georgi Gerganovcommon : normalize naming style (#7462)
208738c03478a37e460ecd3a21155b338a83bfed7f90b18532a4efeca8796fea8e36195c81cbfd596a4a2024-05-22T17:58:25+02:00Johannes GäßlerCUDA: fix FA out-of-bounds writes (#7465)
2088b18532a4efeca8796fea8e36195c81cbfd596a4afcda1128bc5f8eb7e1811708fe9d9867b9aec8152024-05-22T16:10:46+02:00slarenphi3 : duplicate rope factors in each layer (#7447)
2089fcda1128bc5f8eb7e1811708fe9d9867b9aec81503d8900ebe062355e26a562379daee5f17ea099f2024-05-22T20:53:21+08:00k.h.laivulkan: add workaround for iterator boundary check to fix clang-cl debug build (#7426)
20909b3d83318931aa98c487baaa977626931d059e6a95fb0aefab568348da159efdd370e064d1b35f972024-05-22T12:36:37+03:00Georgi Gerganovcuda : fix compile warning (#7454)
20913e5faa85032ec3106a2ad831bf412be9ff139f47201cc11afa0a1950e1f632390b2ac6c937a0d8f02024-05-22T11:01:35+03:00Georgi Gerganovcuda : fix rope + add tests (#7452)
2092201cc11afa0a1950e1f632390b2ac6c937a0d8f06369bf04336ab60e5c892dd77a3246df910151472024-05-22T04:28:32+08:00liuwei-gitllama : add phi3 128K model support (#7225)
20936369bf04336ab60e5c892dd77a3246df91015147e402de364b643cb89ea9f43057733b5d362986702024-05-21T23:03:42+03:00Georgi Gerganovmetal : handle F16 inf values, fix FA partial offload (#7434)
2094e402de364b643cb89ea9f43057733b5d36298670fcf6538ba6702c55eaec70da9a75c81d04900a722024-05-21T20:40:00+01:00Olivier Chafik`grammars`: fix resampling logic regression (#7424)
2095fcf6538ba6702c55eaec70da9a75c81d04900a72c3f8d583560b4f261fa21c976793e538c60cd66c2024-05-21T19:27:12+02:00Johannes GäßlerCUDA: fix unused warning in mmq.cu (#7442)
2096d7e852c1bc8e85bf62a6f1aede08cd2de723404a917dc8cfa67a72fb7c8bf7392270da3bf4833af42024-05-21T14:39:48+02:00jaime-m-pTokenizer SPM fixes for phi-3 and llama-spm (bugfix) (#7425)
2097917dc8cfa67a72fb7c8bf7392270da3bf4833af4fabf30b4c4fca32e116009527180c252919ca9222024-05-20T20:15:57+02:00jaime-m-pTokenizer SPM fixes for phi-3 and llama-spm (#7375)
20983bc10cb485dd7efa4da6c64e73ad0c9e2bfe08216bf9b66fa3f263ca2175dcb5f6d0a658581e1dfb2024-05-20T15:10:03+03:00Georgi Gerganovserver : fix temperature + disable some tests (#7409)
209965c58207ece92ad213f4bfd0f91dcb2dfb664f5b1cc0155d04918cb3017afa472acea51b77483c4a2024-05-20T15:19:21+08:00junchao-loongsonggml : add loongarch lsx and lasx support (#6454)
21001cc0155d04918cb3017afa472acea51b77483c4ae932094d58f513d5996c3efc9f6fed8238894c572024-05-20T10:16:41+03:00Georgi Gerganovserver : tuning tests (#7388)
2101e932094d58f513d5996c3efc9f6fed8238894c572789baf480ba7dc9281b65f601f0918e58920f542024-05-20T08:56:05+03:00Georgi Gerganovserver : return error on too large embedding input (#7389)
21022789baf480ba7dc9281b65f601f0918e58920f5433c8d50accd6dca73c9c4af00a05e24209c160fe2024-05-20T08:55:09+03:00Georgi Gerganovtests : fix --keep_split -> --keep-split (#7374)
21031ea2a0036e88172d6c8bf7e1a1989a03894dc955f030ec1f7a72aa825b2104823946551b9ec5dfc12024-05-19T11:37:04-05:00Fred Douglasquantize : fix --keep-split check (#7374)
2104f030ec1f7a72aa825b2104823946551b9ec5dfc1e4e6f67be6a8a697f5f89a28c98934e53c99c3592024-05-19T17:19:53+02:000cc4mVulkan Embedding Fix (#7360)
2105e4e6f67be6a8a697f5f89a28c98934e53c99c3595ca49cbecda27ce0a7266658fc3b640bff3ed3862024-05-19T17:08:46+02:00slarenggml : fix another case of quants nans (#7387)
210641858392e17abead21735309bf17cb55183d8c316aade19ee74b896c59929676629340b36be3e22c2024-05-19T16:06:33+02:00Johannes Gäßlerserver: fix seed being reported back (#7382)
21076aade19ee74b896c59929676629340b36be3e22cab33f7a338593f6cf1ae98b10b6f8684f63bd72c2024-05-19T14:46:46+02:00Anas AhouziAdd StableLM2 pre-tokenizer (#7349)
2108ab33f7a338593f6cf1ae98b10b6f8684f63bd72ce23b974f4cf9270d05062d446f406e3ff55d94512024-05-19T14:19:37+02:00slarencuda : clear error after buffer allocation failure (#7376)
2109f5bf761747988ee1832766f7d1433739aff810da059031b8c40e1f4ba60586842c5b1ed3ddf618422024-05-19T01:44:42+03:00fraxy-vCapture CUDA logging output (#7298)
2110059031b8c40e1f4ba60586842c5b1ed3ddf61842511182eabb36f6ec9776e2b3c4d7e16d93d0ac0d2024-05-18T18:55:54+03:00Georgi Gerganovci : re-enable sanitizer runs (#7358)
21110f98acfac6cc561dc57586bfff778405e42b576bca57e0f35e33f714b9a6c2c4482b87bfe059c8192024-05-18T10:04:55+02:00Steffen Röckerllama : add support for larger Granite Code Models (20B, 34B) (#7324)
2112ca57e0f35e33f714b9a6c2c4482b87bfe059c819c1b295eea5c49887a066559527a74e8b94fe9db02024-05-18T00:57:08-07:00strawberrymelonpandaperplexity : ndot progress and show stats with < 100 tasks (#7348)
2113c1b295eea5c49887a066559527a74e8b94fe9db0de731963441ff128248259e1b99573d75264d2102024-05-18T08:10:58+02:000cc4mUpdate and fix Vulkan soft_max and argsort implementations (#7237)
2114b49a13dd2fa9c94c2c19a8c248bb7fa45499f9a805834841dcb4f922983ea976539c70472272df9a2024-05-18T08:46:20+03:00Georgi Gerganovconvert : fix set_vocab_sentencepiece (#6866)
211505834841dcb4f922983ea976539c70472272df9aef277de2add255a08b2b909ebfbf70364d1f4dc42024-05-18T02:39:54+02:00slarenggml : fix quants nans when all the group weights are very close to zero (#7313)
2116ef277de2add255a08b2b909ebfbf70364d1f4dc4b43272afa29a64dcb8bcf26a96a05bac40792b922024-05-17T18:39:25-06:00Engininja2cmake : fix typo in AMDGPU_TARGETS (#7356)
2117b43272afa29a64dcb8bcf26a96a05bac40792b920fc1e820a9900a3dd08ddd3c6abe6604c53b689b2024-05-18T01:09:13+02:00jaime-m-pUnicode codepoint flags for custom regexs (#7245)
211882ca83db3c8d45df559c03a4225b6eb34808a2dbf4bd8b3d260bb09491ba63c77ab7012b744362ef2024-05-17T11:03:03-04:00Gavin ZhaoROCm: use native CMake HIP support (#5966)
211951e9d02599336e62948d29f1d6c05addeb921ac2d273c1402b25086fd91aef2467ac13f2e49fa0ea2024-05-17T22:40:14+10:00BrianAdded a single test function script and fix debug-test.sh to be more robust (#7279)
2120d273c1402b25086fd91aef2467ac13f2e49fa0ea27b040691cbe45314147c2745e891a38e9c048d42024-05-17T15:11:45+03:00Aarni Koskelapy : convert-hf-to-gguf-update improvements (#7340)
2121e18bc6aaf3b547890609ed254ee5248e720e5840ee94172d33399d2e814ca05c8a3ff8c523ebb0932024-05-17T12:31:58+05:30amd-lalithncconvert : fix Qwen/Qwen-7b conversion (#7308)
2122934266c0e0b2aa9781fdba2deb112c161ff038a99c4fdcbec8c7fcc428e723b0d8a1cf1f351ba6422024-05-17T02:58:52-04:00Justine Tunneyggml : rewrite silu and softmax for cpu (#7154)
2123ad52d5c259344888b06fd5acd3344c663dd0621d172b78210aae0e54d3668c5de14200efab9fac232024-05-16T07:38:43+02:00Vaibhav Srivastavdoc: add references to hugging face GGUF-my-repo quantisation web tool. (#7288)
2124172b78210aae0e54d3668c5de14200efab9fac2313ad16af1231ab2d245d35df3295bcfa23de13052024-05-15T22:36:43-07:00Max Krasnyanskyci: fix bin/Release path for windows-arm64 builds (#7317)
212513ad16af1231ab2d245d35df3295bcfa23de13058f7080bf48828b538bc9387c3d150bbd4fb4cf2d2024-05-15T19:47:36-07:00Max KrasnyanskyAdd support for properly optimized Windows ARM64 builds with LLVM and MSVC (#7191)
2126e1b40ac3b94824d761b5e26ea1bc5692706029d9dc020985b8755dd6aa93a2f002f43c3ede808cce2024-05-15T12:59:12-05:00kunnisggml : use dynamic thread scheduling for matrix multiplication (#6915)
2127dc020985b8755dd6aa93a2f002f43c3ede808cce344f9126cc0d15891fde9472fe40b8572628ad7d2024-05-15T14:44:49+01:00agray3Avoid unnecessarily disabling CUDA graphs (#7302)
212848aa8fd1f213a69b41569f809cc954f24dbc4366583fd6b000ec9ad1b465b5c98524f4a0ae3880772024-05-15T03:52:33-05:00John Balisggml : add `ggml_upscale_ext` (ggml/814)
2129583fd6b000ec9ad1b465b5c98524f4a0ae3880779f773486ab78d65f5cca3f7e31c862b7043bf7212024-05-15T08:44:16+02:00Johannes Gäßlerserver bench: fix bench not waiting for model load (#7284)
2130c3c88f296a72432edb697ac8026dbf2ec18f2b21182adefcf36fc5f4263082ff032c0796fda655782024-05-12T20:36:31+03:00Georgi Gerganovggml : try fix ppc64 (whisper/0)
21310d26d8ccd8caebab75af697c0275f599075fdacf4f0263633b40e94e8b69fd6e7e4395cfedfd5c122024-05-12T17:17:18+08:00Hong Bo PENGggml : optimize for ppc64le using VSX intrinsics (ggml/784)
21324f0263633b40e94e8b69fd6e7e4395cfedfd5c121265c670fd8e41e1947352c96c5179adda97fb2c2024-05-14T10:11:24-04:00Steve Grubbserver: free sampling contexts on exit (#7264)
21335e31828d3e35c76ecfee665bc23771a4bec1d130541600201e6480f54ae09e58d16b154d4b4b331d2024-05-14T14:27:19+03:00Radoslav Gerganovggml : add RPC backend (#6829)
213427f65d6267cf22a44c5ccefa7765d53a05bd1259ee52225067622babc277371511b8124884e1c7972024-05-14T14:20:47+09:00Ryueidocs: Fix typo and update description for --embeddings flag (#7026)
213530e70334f71b3bd115024affcf98cac3d79aaa951c570d8beeebad95872dc738ea542a4a0022f78a2024-05-13T22:02:36+08:00k.h.laillava-cli: fix base64 prompt (#7248)
2136b1f8af1886e8187db6bb2a9b87cfc1c0f175f629e586ee42595500c53938e937b6b6ad5353ad76dc2024-05-13T12:56:47+10:00Brianconvert.py: Outfile default name change and additional metadata support (#4858)
2137e586ee42595500c53938e937b6b6ad5353ad76dccbf75894d256f1861f6409565db599365de3d4b82024-05-12T19:40:08-07:00Benjamin Findleychange default temperature of OAI compat API from 0 to 1 (#7226)
2138cbf75894d256f1861f6409565db599365de3d4b80d5cef78aeafae4d4e6d56e2d4bcda771af58cc92024-05-13T08:04:29+08:00Neo Zhang[SYCL] Add oneapi runtime dll files to win release package (#7241)
21390d5cef78aeafae4d4e6d56e2d4bcda771af58cc9dc685be46622a8fabfd57cfa804237c8f15679b82024-05-13T08:02:55+08:00Neo Zhang[SYCL] update CI with oneapi 2024.1 (#7235)
2140dc685be46622a8fabfd57cfa804237c8f15679b86f1b63606fc68a09d62d1d74dbd156c35219026d2024-05-12T19:40:45+02:00Johannes GäßlerCUDA: add FP32 FlashAttention vector kernel (#7188)
21416f1b63606fc68a09d62d1d74dbd156c35219026db228aba91ac2cd9eb90e9d423ba1d0d20e0117e22024-05-12T18:30:23+03:00Georgi Gerganovcmake : fix version cmp (#7227)
21427bd4ffb78062587e4012a1c24186223f09b1bc701622ac023f42e5e01c163321cd98c6596aa9402d2024-05-11T21:36:20+03:00Georgi Gerganovmetal : fix warnings (skipme) (#0)
21436aeff24f8b91e145e92d17ec7ce3adc4ef60b8e9325756d28df7d018a7bac424e1b3bc8acb4ecf072024-05-11T16:57:53+03:00Georgi Gerganovmetal : fix indent (ggml/0)
2144fed0108491a3a3cbec6c6480dc8667ffff9d765972c177c1f6c16693eee319d4ebd4eaab5e630dd22024-05-11T12:26:35-05:00Josh RamerScripting & documenting debugging one test without anything else in the loop. (#7096)
214572c177c1f6c16693eee319d4ebd4eaab5e630dd25a419926b0c4efab0531401aea91522aaea9fd072024-05-11T17:28:10+02:00Xuan Son Nguyenfix system prompt handling (#7153)
21465a419926b0c4efab0531401aea91522aaea9fd07fae9d234b6606693704eca62fe4aefbb6c6abb452024-05-11T11:06:26-04:00compiladeconvert-hf : support bfloat16 conversion (#7158)
2147ef0d5e3ec9f99003af3ff326384816c02850ea3f3292733f95d4632a956890a438af5192e7031c122024-04-25T17:24:07+03:00Borislav Stanimirovbuild: fix and ignore msvc warnings (ggml/805)
2148f99e1e456eaf69cc38c1982a2693ce41c0f897ef5ae3426b0b64672991563d4c28b2018b9f9614672024-05-11T16:12:06+08:00Haoxiang Feillama : lookup word in vocab before doing BPE merges (#7193)
21495ae3426b0b64672991563d4c28b2018b9f961467b83cc3f5b303ff30c52874b2d5864dc6385ebf9f2024-05-11T10:11:28+02:00Johannes Gäßlerserver: fix reported top tokens for temperature 0 (#7203)
2150b83cc3f5b303ff30c52874b2d5864dc6385ebf9f9cb317f77e53067f7a138cc89ef7657148eae8e62024-05-11T09:46:09+02:00Joan Fontanalsllama : add Jina Embeddings architecture (#6826)
21519cb317f77e53067f7a138cc89ef7657148eae8e6e849648888a11de13aaaa4cb2eda3f5a9c7b444d2024-05-11T10:32:41+03:00Georgi Gerganovggml : full ALiBi support (#7192)
215218e437665ce626dddbd79119aa7498493e7cb13b8c660242d708d3913a2adc2b6e4a9ee9cf5e4ce72024-05-10T18:20:10+03:00Georgi Gerganovmetal : fix flash attention kernel requirements (#7169)
21534e3880978f8b1bf546dd4e6f3b524d6b8739c49cf89fe2732c5709f6e86d5f4aee2e6d2a561f2eb22024-05-10T07:01:08-04:00Justine TunneyFix memory bug in grammar parser (#7194)
2154d11afd665241c1b3910ab5f040d0216403019d878c570c9496212073079476651c7517c02581101f2024-05-10T02:41:10-04:00Andreillava : fix moondream support (#7163)
2155eaf4bd8b399a6ed4b834f91d22409d2a05c4d266befddd0f15de6efb15d7e7f5b527dfb671f4196f2024-05-10T01:04:12+02:00slareneval-callback : fix conversion to float (#7184)
2156befddd0f15de6efb15d7e7f5b527dfb671f4196fd46dbc76f8770caec0175f1e57777173c70556a02024-05-09T20:39:54+02:000cc4mVulkan Bugfixes and Improvements (#7084)
215743248e559472556f368988575d9fba906b3eb139a743d76a01f23038b2c85af1e9048ee836767b442024-05-09T15:30:44+02:00jaime-m-pllama3 custom regex split (#6965)
2158a743d76a01f23038b2c85af1e9048ee836767b44f31ec120bc36c6270e4948e6a065a7c4cfa0c4042024-05-09T14:32:02+02:00Johannes GäßlerCUDA: generalize FP16 fattn vec kernel (#7061)
2159f31ec120bc36c6270e4948e6a065a7c4cfa0c404fd9f92b154850014146f61717cd292a59a5cee5a2024-05-09T14:13:05+02:00GalunidAdd warning if token is invalid (#7173)
2160fd9f92b154850014146f61717cd292a59a5cee5a22842164bcae3251b81ad9e497a16ef66833cb9e2024-05-09T13:03:29+02:00Daniel Beveniusllama : update llama_timings.n_p_eval setting (#7160)
216122842164bcae3251b81ad9e497a16ef66833cb9e47345248827f426038098d016ed11975021b49192024-05-09T12:56:00+02:00Sigbjørn Skjæretgguf-py : add special token modification capability (#7166)
216207cd41d0965829463eff73eda3348aedbfd3a4444426e2987b566f09c7aa96ada9706cc7786376202024-05-09T11:16:45+03:00Ahmet ZeerTypoFix (#7162)
21634426e2987b566f09c7aa96ada9706cc778637620f98eb31c517c95960df1d0abc48002787f145f3b2024-05-08T19:55:32-04:00Jared Van Bortelcmake : fix typo (#7151)
2164f98eb31c517c95960df1d0abc48002787f145f3bbc4bba364fb96d908f2698e908648df5e6f55e022024-05-08T18:16:38-04:00compiladeconvert-hf : save memory with lazy evaluation (#7075)
2165bc4bba364fb96d908f2698e908648df5e6f55e02c12452c7aec8a02264afc00196a13caa591a13ac2024-05-08T21:55:49+01:00agray3Introduction of CUDA Graphs to LLama.cpp (#6766)
2166bd1871fa2b1bf8a081b43ba9bc85f8ffd46fac4626458af1d63c85195cd96cd1673051e332d06d302024-05-08T20:12:06+01:00JohnnyBserver : add themes + favicon (#6848)
216726458af1d63c85195cd96cd1673051e332d06d3083330d8cd6491e53e1aca4c5dfc47e039b3c04ff2024-05-08T22:08:10+03:00Gilad Smetal : use `vm_allocate` instead of `posix_memalign` on macOS (#7078)
2168229ffff872f8ad0d21c997d18ee7a23692ae60a01fd9c1741d864d01cd7ec6d67227b92d7bfabf222024-05-08T20:06:43+08:00Ren Xuanchengllama : add BPE pre-tokenization for Qwen2 (#7114)
2169acdce3cdef6fc2f0b7b5623231fd7762c0884d1c3855416027cb25d9a708ffa5581cf503a87856a62024-05-08T18:54:39+10:00Briancompare-llama-bench.py: add missing basicConfig (#7138)
21703855416027cb25d9a708ffa5581cf503a87856a6c0e6fbf8c380718102bd25fcb8d2e55f8f9480d12024-05-08T02:30:09-04:00Justine Tunneyggml : introduce bfloat16 support (#6412)
2171c0e6fbf8c380718102bd25fcb8d2e55f8f9480d1c780e75305dba1f67691a8dc0e8bc8425838a4522024-05-08T09:14:50+03:00Georgi Gerganovmetal : fix unused warning
2172c780e75305dba1f67691a8dc0e8bc8425838a45248b2f9c1fc71ab7df5432be2ed9fa7cdf5e8405e2024-05-07T21:26:43-03:00JeximoFurther tidy on Android instructions README.md (#7077)
217348b2f9c1fc71ab7df5432be2ed9fa7cdf5e8405eaf0a5b616359809ce886ea433acedebb39b129692024-05-08T01:24:16+01:00jukofyorkFixed save_imatrix to match old behaviour for MoE (#7099)
2174af0a5b616359809ce886ea433acedebb39b12969b6aa6702030320a3d5fbc2508307af0d7c947e402024-05-07T23:07:58+02:00Johannes Gäßlerserver: fix incorrectly reported token probabilities (#7125)
2175b6aa6702030320a3d5fbc2508307af0d7c947e40260b7c65296fba0568eeb1ff05244ea0be206b542024-05-07T19:39:43ZnopperlFix OLMo HF to GGUF conversion (#6910)
217604976db7a819fcf8bfefbfc09a3344210b79dd27947d3ad27d94f1addef76b5d64c314618f0639332024-05-07T17:20:33+02:00omahsdocs: fix typos (#7124)
2177858f6b73f6e57a62523d16a955d565254be889b4b3a995b416e13ae3123a117a743e11d0ede0ca4c2024-05-06T11:12:14-07:00William TambelliniAdd an option to build without CUDA VMM (#7067)
2178bcdee0daa7c5e8e086b719e5eb4073b00df70e01628b299106d1e9476fdecb3cbe546bf5c60f1b892024-05-06T09:31:30+03:00Georgi Gerganovminor : fix trailing whitespace
21798f8acc8683a00ce40fa5a81161a079d2167126e6ca3632602091e959ed2ad4c09c67a7c790b10d312024-05-05T13:38:55+02:00Sigbjørn SkjæretDisable benchmark on forked repo (#7034)
2180cf768b7e71cbcc9886c753ae963c2b68893d02e4fcd84a0f5a584ab5271745d7ffef21c8a6bc7b0c2024-05-04T13:10:15-03:00JeximoTidy Android Instructions README.md (#7016)
2181fcd84a0f5a584ab5271745d7ffef21c8a6bc7b0c03fb8a002df2e96104f9e06de9c78d2a8ed91e922024-05-04T15:26:53+02:00viricFix Linux /sys cpu path to guess number of cores (#7064)
218203fb8a002df2e96104f9e06de9c78d2a8ed91e9292139b90af4841d7fd060b526bdd443b621770ff2024-05-04T12:06:40+03:00maor-psIf first token generated from the server is the stop word the server will crash (#7038)
218392139b90af4841d7fd060b526bdd443b621770ffa2ac89d6efb41b535778bfeaecaae8fe295b6ed32024-05-04T08:32:32+03:00Georgi Gerganovtests : add test-tokenizer-0.sh + fix some tokenizers (#7036)
2184a2ac89d6efb41b535778bfeaecaae8fe295b6ed3433def286e98751bf17db75dce53847d075c0be52024-05-04T05:36:41+10:00Brianconvert.py : add python logging instead of print() (#6511)
21856ecf3189e00a1e8e737a78b6d10e1d7006e050a2b0d943de179ad5dbd83d51f327fb566066f4ccda2024-05-02T23:56:41+08:00alwqxchore: fix typo in llama.cpp (#7032)
2186b0d943de179ad5dbd83d51f327fb566066f4ccda8d608a81b7bd170f700648f8214e6f3279d4d7152024-05-01T17:31:30-04:00Andrew DowningUpdate LOG_IMPL and LOG_TEE_IMPL (#7029)
21878d608a81b7bd170f700648f8214e6f3279d4d7153ea0d36000e2314baba7e9fc6a97f08670a6f7e42024-05-02T04:27:41+09:00l3utterflymain : fix off by one error for context shift (#6921)
2188c4ec9c0d3d67e6b33638e6dad86419e6fd5ffe01a8f9b076316e16aadd0791015b3bfd446fe1e9042024-05-01T07:13:59+02:00slarenci : exempt confirmed bugs from being tagged as stale (#7014)
218977e15bec6217a39be59b9cc83d6b9afb6b0d8167a68a1e7ed060ee5af2d638585d19e3510ddbf16c2024-04-30T15:52:21+03:00Georgi Gerganovmetal : remove deprecated error code (#7008)
2190a68a1e7ed060ee5af2d638585d19e3510ddbf16c9c67c2773d4b706cf71d70ecf4aa180b625019602024-04-30T02:34:50-07:00Kevin Gibbonsmetal : log more info on error (#6987)
21919c67c2773d4b706cf71d70ecf4aa180b62501960952d03dbead16e4dbdd1d3458486340673cc24652024-04-30T12:16:08+03:00Georgi Gerganovggml : add Flash Attention (#5021)
21928843a98c2ba97a25e93319a104f9ddfaf83ce4c4b8c1476e44cc1f3a1811613f65251cf7790676362024-04-30T00:52:50+01:00Olivier ChafikImprove usability of --model-url & related flags (#6930)
2193b8c1476e44cc1f3a1811613f65251cf7790676365539e6fdd1b97e0c37c54d34df67f334fc344a262024-04-29T14:40:14-04:00Clint HerronExtending grammar integration tests (#6644)
21945539e6fdd1b97e0c37c54d34df67f334fc344a26b8a7a5a90fd3187175d84227dad705ade395ba462024-04-29T19:56:59+02:00Daniel Beveniusmain : fix typo in comment in main.cpp (#6985)
2195b8a7a5a90fd3187175d84227dad705ade395ba46d2c898f746a527f09effb061829e68b2e1812a282024-04-29T17:02:45+01:00Olivier Chafikbuild(cmake): simplify instructions (`cmake -B build && cmake --build build ...`) (#6964)
2196d2c898f746a527f09effb061829e68b2e1812a28544f1f10adeec3d5ed91c4d3bd3f903904ecea632024-04-29T18:36:39+03:00Georgi Gerganovci : tmp disable gguf-split (#6983)
2197544f1f10adeec3d5ed91c4d3bd3f903904ecea63ffe666572f98a686b17a2cd1dbf4c0a982e5ac0a2024-04-29T17:55:02+03:00Georgi Gerganovggml : fix __MSC_VER -> _MSC_VER (#6977)
2198f4ab2a41476600a98067a9474ea8f9e6db41bcfa3f167476b11efa7ab08f6cacdeb8cab0935c12492024-04-29T16:58:41+03:00Georgi Gerganovllama : fix BPE pre-tokenization (#6920)
21993f167476b11efa7ab08f6cacdeb8cab0935c12493055a4180557c6cbe29eacc8284c9e070ac10eab2024-04-29T09:35:45-04:00David Renshawsampling : use std::random_device{}() for default random seed (#6962)
22003055a4180557c6cbe29eacc8284c9e070ac10eab577277ffd203b190c3dc2ab3e737946dc432132c2024-04-29T09:34:41-04:00Christian Zhou-Zhengconvert : fix conversion of some BERT embedding models (#6937)
2201577277ffd203b190c3dc2ab3e737946dc432132cca7f29f568803bee4c92d1b3e41c7d721b0dc5702024-04-29T15:08:20+02:00Przemysław Pawełczykmake : change GNU make default CXX from g++ to c++ (#6966)
2202c4f708a93f1df5e35167f9313e000d381298be7fe00b4a8f816ebc45b98a46e5f5231359b9a017e02024-04-29T14:36:22+02:00Johannes Gäßlerllama : fix typo LAMMAFILE -> LLAMAFILE (#6974)
2203e00b4a8f816ebc45b98a46e5f5231359b9a017e07bb36ccf91b8a2e92b182dd75624f1fd7cb205ac2024-04-28T18:38:44-04:00DAN™Fix more int overflow during quant (PPL/CUDA). (#6563)
2204b7368332e24c5b2c8038bf8267f43632783fcc35928e0b7013c862cf10701957b3d654aa70f11bd82024-04-27T17:50:48+02:00Pierrick Hymbertci: server: tests python env on github container ubuntu latest / fix n_predict (#6935)
2205017e6999b5184234370b22a2f868e1be911e8d88e2764cd7ca1112d9303eba9e81c9935ee67352ff2024-04-26T18:39:58+02:00slarenadd basic tensor data validation function (#6884)
2206e2764cd7ca1112d9303eba9e81c9935ee67352ff4b1c3c98b442a4c84a788fff6323f6fa7e678a5b2024-04-26T17:07:42+02:00slarengguf : fix mismatch between alloc and free functions (#6929)
2207bbe3c6e76157a5d806fdc155451f0ca8936248ee7f5ff558eed0f732af8f25c2ab0645610bdec80c2024-04-26T12:27:25+02:00Pierrick Hymbertci: server: fix python installation (#6925)
22087f5ff558eed0f732af8f25c2ab0645610bdec80c9e4e077ec50fde6049b128662c72d37a3c28e34b2024-04-26T12:15:30+02:00Pierrick Hymbertserver: stop generation at `n_ctx_train` if `n_predict` is not set (#6638)
22099e4e077ec50fde6049b128662c72d37a3c28e34b83b72cb086ce46a33dececc86bfe4648b6120aa82024-04-26T11:11:51+02:00Pierrick Hymbertci: server: fix python installation (#6922)
221083b72cb086ce46a33dececc86bfe4648b6120aa8d4a9afc1009f0da88d04b2c5f672d81d5ae946752024-04-26T10:41:53+03:00Georgi GerganovMerge pull request from GHSA-p5mv-gjc5-mwqv
2211d4a9afc1009f0da88d04b2c5f672d81d5ae946757d641c26ac73956a54b204cabefe85c7648236782024-04-26T09:27:49+02:00Pierrick Hymbertci: server: fix python installation (#6918)
22127d641c26ac73956a54b204cabefe85c7648236785790c8dac1a4f0aa80b4efee3b962d8c04c829e82024-04-26T09:26:59+02:00Pierrick Hymbertci: fix concurrency for pull_request_target (#6917)
221346e12c4692a37bdd31a0432fc5153d7d22bc7f72dba497e0c1eff27cf0e85d1d73c86fa08e1b55572024-04-25T12:38:31-07:00vikllava : add support for moondream vision language model (#6899)
2214dba497e0c1eff27cf0e85d1d73c86fa08e1b5557fa0b4ad25208d5ec2df6b998ccb29b49b249e82c2024-04-25T21:31:17+03:00Georgi Gerganovcmake : restore LLAMA_LLAMAFILE_DEFAULT
2215853d06ffe26621176d60909a6e3f7c4cd067b3053fe0596c1817a6114ffffb6dbfd6c36ca7815dc72024-04-25T17:06:27+03:00Georgi Gerganovci : tmp disable slow tests
221651543729ff5b1361ebfb164875c93dff0850d5fe4ab99d8d4762869506bb675b36501fd7c2af00b22024-04-25T15:48:25+03:00Georgi Gerganovggml : fix redefinition of vaddvq_f32 for 32-bit ARM (#6906)
22174ab99d8d4762869506bb675b36501fd7c2af00b254770413c484660d021dd51b5dbacab7880b88272024-04-25T14:38:14+02:00Daniel Beveniusclip : rename lerp function to avoid conflict (#6894)
221854770413c484660d021dd51b5dbacab7880b8827aa750c1ede6232c91de890a14a7731d6daa2bc8e2024-04-25T15:12:28+03:00Georgi Gerganovggml : fix MIN / MAX macros (#6904)
2219aa750c1ede6232c91de890a14a7731d6daa2bc8e1966eb2615242f224bf9ca939db8905ab6a174a02024-04-25T14:27:20+03:00Georgi Gerganovtests : minor bash stuff (#6902)
22201966eb2615242f224bf9ca939db8905ab6a174a0784e11dea1f5ce9638851b2b0dddb107e2a609c82024-04-25T18:29:35+08:00jiezquantize : add '--keep-split' to quantize model into shards (#6688)
2221b4e4b8a9351d918a56831c73cf9f25c1837b80d13fe847b5747676ee1bf90371c46ed0bc66b572402024-04-24T08:10:07-05:00Douglas Hanleyllama : add llama_get_pooling_type function (#6862)
222237246b1031b1680c0dcaf20aef736d6b446203fa28103f4832e301a9c84d44ff0df9d75d46ab6c762024-04-24T05:15:29-05:00Kyle Mistelecommon : revert showing control tokens by default for server (#6860)
222328103f4832e301a9c84d44ff0df9d75d46ab6c76c0d1b3e03e27634ac2871761f5033cf9324d472d2024-04-24T11:08:36+02:00Johannes GäßlerServer: fix seed for multiple slots (#6835)
2224abd3314064cd3c513f9eef34c3ba6c23a107442c3fec68be4e9577fc53158366d3b3af039c17bb1f2024-04-24T10:52:37+02:00Tristan Druyenllama : add phi 3 chat template (#6857)
22253fec68be4e9577fc53158366d3b3af039c17bb1fc8297c6af5693555652c40b95974b95d49d2674d2024-04-24T15:16:21+08:00Junyang Linconvert : add support of codeqwen due to tokenizer (#6707)
2226c8297c6af5693555652c40b95974b95d49d2674d4e96a812b3ce7322a29a3008db2ed73d9087b1762024-04-24T15:00:37+08:00liuwei-gitllama : add phi3 support (#6852)
22274e96a812b3ce7322a29a3008db2ed73d9087b176192090bae47960f0d38d4967abe398a5d190057e2024-04-23T02:53:18+02:00Anas Ahouzi[SYCL] Windows default build instructions without -DLLAMA_SYCL_F16 flag activated (#6767)
2228192090bae47960f0d38d4967abe398a5d190057ee931888d5024de814ce7119a18d6a959bfff38212024-04-22T15:00:36-04:00Justine Tunneyllamafile : improve sgemm.cpp (#6796)
2229e931888d5024de814ce7119a18d6a959bfff38218960fe86ae075c846c5df8848230d1904ba8877f2024-04-23T00:05:06+10:00Dave Airlieggml : fix calloc argument ordering. (#6820)
22308960fe86ae075c846c5df8848230d1904ba8877fc0956b09ba845a7cd787d5580d7c8b96e80f40f52024-04-22T15:41:11+03:00Georgi Gerganovllama : fix typo in <|im_end|> token text (#6745)
2231c0956b09ba845a7cd787d5580d7c8b96e80f40f5e9b4a1bf68c18beff4e33f23ea62c1245b2969152024-04-22T13:22:54+02:00Pierrick Hymbertci: fix job are cancelling each other (#6781)
223240f74e4d739e9250431cf339ae7588b28d8d0663b9cc76d87e3d7ae5900f19d4fe8f8976d0a358882024-04-21T18:36:45+03:00Georgi Gerganovllama : add option to render special/control tokens (#6807)
2233b9cc76d87e3d7ae5900f19d4fe8f8976d0a358887dbdba5690ca61b3ee8c92cfac8e7e251042e7872024-04-21T16:47:57+03:00Georgi Gerganovggml : fix ggml_backend_cpu_supports_op() for CPY (#0)
22347dbdba5690ca61b3ee8c92cfac8e7e251042e787c1386c936e9fbc38eb2816c711ab28f13355708e2024-04-21T15:03:39+02:00Wouterllama : add llama-3 chat template (#6751)
223589b0bf0d5dc123cc1053708f5f84b89e52cdc80bb97bc3966e852adb626c90be64fd48282800f5042024-04-21T08:19:04-04:00Justine Tunneyllava : use logger in llava-cli (#6797)
2236b97bc3966e852adb626c90be64fd48282800f504b8109bc0139f15a5b321909f47510b89dca47ffc2024-04-21T13:50:41+02:00Pedro Cuencallama : support Llama 3 HF conversion (#6745)
2237aed82f6837a3ea515f4d50201cfc77effc7d41b40e4802b2ecbaab04b4f829fde4a3096ca19c84b52024-04-20T13:27:12+03:00Georgi Gerganovcommon : try to fix Android CI (#6780)
22380e4802b2ecbaab04b4f829fde4a3096ca19c84b5637e9a86c220718d008b54842dfd294aa96d3b7a2024-04-19T13:03:35-04:00loonerinci: add ubuntu latest release and fix missing build number (mac & ubuntu) (#6748)
22399958c81b798a5872087b30b360e4674871f2479e8b1b1f4982d3e9b994308d05a1c8b9e45c23edb52024-04-19T09:35:54ZnopperlImplement the OLMo architecture (#6741)
2240bca40e98149c7b673558ddd7a3ebeffef789349d0d56246f4b9764158525d894b96606f6163c53a82024-04-19T09:16:31+08:00Neo Zhangfix wrong parameter in cmd in readme-sycl.md (#6755)
22410d56246f4b9764158525d894b96606f6163c53a803c0946d73c63ea73e1d85015b7088298443d4382024-04-18T15:18:48+02:00slarenggml : group all experts in a single ggml_mul_mat_id (#6505)
224203c0946d73c63ea73e1d85015b7088298443d438e11b2e6e1e18522ca7cf129600875a0f6fb9307d2024-04-18T13:49:01+02:00Sigbjørn Skjæretconvert : support models with multiple chat templates (#6588)
2243c71bfd736ee99a56e697697b39240f2ee06ed26d3b8f1ec4b18770531d0b1d792f3edf08254e4f0c2024-04-18T09:04:47+02:00slarenllama : fix compatibility with old 2 expert models (#6735)
22443b8f1ec4b18770531d0b1d792f3edf08254e4f0c8dd1ec8b3ffbfa2d26e82e672cea89f5eeb2f1412024-04-17T23:58:26+03:00Georgi Gerganovllamafile : tmp disable + build sgemm.o when needed (#6716)
2245facb8b56f8fd3bb10a693bf0943ae9d69d0828ef532c1737a14bb4b99747e6f460874947df37e4502024-04-17T04:51:07+08:00Zheng.Dengconvert : fix autoawq gemma (#6704)
2246666867b799ddd9da7dfdc905ece291ecf286effa8cc91dc63c0df397d644a581b2cbeea74eb51ae02024-04-16T23:50:22+03:00Georgi Gerganovggml : fix llamafile sgemm wdata offsets (#6710)
22478cc91dc63c0df397d644a581b2cbeea74eb51ae0dbceec87c0221ec952e69448df6a71f1372a74872024-04-16T14:55:30-04:00Justine Tunneyggml : add llamafile sgemm (#6414)
2248dbceec87c0221ec952e69448df6a71f1372a7487f4dea7da1841a92d2788b0535063abf2f0e284612024-04-16T08:48:35-07:00Ashishllama : add StableLM2 12B (#6635)
2249f4dea7da1841a92d2788b0535063abf2f0e284618a56075b07a8b571bf95a912ffdce4c928c2b4142024-04-16T23:40:48+08:00Shijiellama : add qwen2moe (#6074)
22507593639ce335e8d7f89aa9a54d616951f273af60132f55795e51094954f1b1f647f97648be724a3a2024-04-15T18:35:21+01:00Olivier Chafik`main`: add --json-schema / -j flag (#6659)
2251132f55795e51094954f1b1f647f97648be724a3a3272896d79465fd2befef3425dac8e83933b7ea42024-04-15T08:56:55-04:00compiladellama : fix restoring the number of outputs from state files (#6687)
225217e98d4c96a583d420f12046bc92102381dbd28e1958f7e06ca2d2e3ab5698cc67513ba359144d8e2024-04-15T17:12:26+08:00Neo Zhang Jianyufix mul_mat_id() for new input, make the ut pass (#6682)
225304fbc5f23e9708136ff03ebe194c7a7e965a7ca4f184dd920852d6d372b754f871ee06cfe6f977ad2024-04-15T00:16:34+08:00Chao JiangAdd Command R chat template (#6650)
22548800226d65d5c98cd34eede6a6c05c78405c52dae689fc4e912feb19085be6894f475a873759cbfe2024-04-14T13:12:59+02:00Sigbjørn SkjæretFix --split-max-size (#6655)
2255e689fc4e912feb19085be6894f475a873759cbfea4ec34e1cd68560e7ff16e21ddc6962b6abd3d1d2024-04-14T20:12:36+09:00Jaemin Son[bug fix] convert github repository_owner to lowercase (#6673)
2256de17e3f7455dc7fd298cc61d86798533b9ca7a29b5e7285baffb0da8a6619567b52d8e67de41291d2024-04-14T10:42:29+08:00Neo Zhang Jianyufix memcpy() crash, add missed cmd in guide, fix softmax (#6622)
2257b5e7285baffb0da8a6619567b52d8e67de41291d4bd0f93e4ab4fe6682e7d0241c1bdec1397e954a2024-04-14T00:21:55+02:00Johannes GäßlerCUDA: fix matrix multiplication logic for tests (#6667)
2258ab9a3240a9da941fdef5cd4a25f2b97c2f5a67aafbbc030ba93561fac842af994c5c6c4c1147f13b2024-04-12T19:43:38+01:00Olivier ChafikJSON schema conversion: ⚡️ faster repetitions, min/maxLength for strings, cap number length (#6555)
22595c4d767ac028c0f9c31cba3fceaf765c6097abfcef21ce4ccb41164cb52997bd2210d92bc6a6c5d12024-04-12T10:52:36+02:00Rene Leonhardtchore: Fix markdown warnings (#6625)
2260ef21ce4ccb41164cb52997bd2210d92bc6a6c5d1dee7f8d6928cc680cc969f7d93f98c3e24dcad412024-04-12T11:49:58+03:00Georgi Gerganovimatrix : remove invalid assert (#6632)
2261f7001ccc5aa359fcf41bba19d1c99c3d25c9bcc7a474f50ebb3e10be3371562f75f3f573f1a86b5f2024-04-11T17:44:48-04:00Clint HerronAs suggested by @slaren, disabling Metal for test to fix CI build on OSX from #6576 (#6619)
2262a474f50ebb3e10be3371562f75f3f573f1a86b5fcbaadc92942c50aab599a9e4c163afc1f44f7c262024-04-11T21:56:29+02:00NikolasRefactor Error Handling for CUDA (#6575)
2263cbaadc92942c50aab599a9e4c163afc1f44f7c261bbdaf6ecda6f0a360dfb307b256fcb6838c560b2024-04-11T19:47:34+01:00Olivier Chafikgrammars: 1.5x faster inference w/ complex grammars (vector reserves / reuses) (#6609)
22641bbdaf6ecda6f0a360dfb307b256fcb6838c560bf4183afe6a22f356ee222a710686ae7f83dbd9492024-04-11T19:52:21+02:00Hugo Rousselci: download artifacts to release directory (#6612)
2265f4183afe6a22f356ee222a710686ae7f83dbd949b804b1ef77351d2a11be945462c6c251710476cb2024-04-11T15:22:47+02:00Daniel Beveniusscripts : add --outdir option to hf.sh (#6600)
2266b804b1ef77351d2a11be945462c6c251710476cb8228b66dbc16290c5cbd70e80ab47c068e2569d82024-04-11T14:51:07+02:00Pierrick Hymberteval-callback: Example how to use eval callback for debugging (#6576)
226767fac4b95fcccfda8ab965e9ba4992a9ddf3a25f29122d32ac8075ad27b7a8be05dcad2b7e7a5f9e2024-04-10T08:58:48+02:00Pierrick Hymbertdocs : how to add a model (#6565)
226829122d32ac8075ad27b7a8be05dcad2b7e7a5f9eb231b37b095f172b26b1300ca442a147ea048b642024-04-10T00:49:12-06:00Artem Zinnatullinreadme : fix ROCm link (#6579)
2269ba5e134e073ec6837078c874aba44a702944a6761b67731e184e27a465b8c5476061294a4af668ea2024-04-10T00:23:02+02:00Jiří Sejkorareadme: fix typo in amdgpu target name (#6573)
22701b67731e184e27a465b8c5476061294a4af668eac4a3a4ff47d62d2503ddf9bd91b58c21f04fe3c32024-04-09T13:44:08-04:00Jared Van BortelBERT tokenizer fixes (#6498)
22715dc9dd7152dedc6046b646855585bd070c91e8c8e11a8999b5690f810c2c99c14347f0834e68c5242024-04-09T09:16:13+01:00Carolinabananallama : add Command R Plus support (#6491)
2272cc4a95426d17417d3c83f12bdb514fbe8abe2a88cecd8d3c98b48f51aaa1d4c729e55bd319f6799c2024-04-08T22:25:49+03:00Georgi Gerganovllama : fix attention layer count sanity check (#6550)
2273b73e564b16086845a8b4fffd26e22685d3e0c3dbe3c337d87ca650972105a51c6ce302dd236c07ad2024-04-08T16:23:01+03:00Georgi Gerganovquantize : fix precedence of cli args (#6541)
2274e3c337d87ca650972105a51c6ce302dd236c07adbeea6e1b16e783a0886e78dec01002a8c00db24d2024-04-08T06:02:30-07:00Rick Gllama : support negative ith in llama_get_ API (#6519)
2275beea6e1b16e783a0886e78dec01002a8c00db24d87fb5b4234d4b9c56ac94cf7aa229c8fd7defdb02024-04-08T20:43:30+08:00Jan Boonllama : save and restore kv cache for single seq id (#6341)
2276855f54402e866ed19d8d675b56a81c844c64b325b909236c0bf0b6e872af95df9490492ecec310ac2024-04-07T19:52:19+01:00Mark FairbairnChange Windows AMD example to release build to make inference much faster. (#6525)
2277f77261a7c525fa1fa47b18a3d78cd308ae41cafc43e8995e754b8e04642e92822055d193a3272b372024-04-04T14:49:24+02:00Slava Primenkoggml: bypass code incompatible with CUDA < 11.1 (whisper/2020)
2278d4f220a5ccdc6308173c1a31fad21d7c3fbc96c154ea0698fbf87e36a5d68a98c95f6bdd0fb915572024-04-07T10:55:59+08:00Neo Zhang Jianyusupport/fix OPs GGML_TYPE_IQ4_NL, GGML_TYPE_IQ4_XS, GGML_TYPE_IQ3_XXS, GGML_TYPE_IQ3_S, GGML_TYPE_IQ2_XXS, GGML_TYPE_IQ2_XS, GGML_TYPE_IQ2_S, GGML_TYPE_IQ1_S, GGML_TYPE_IQ1_M (#6521)
2279b66aec675c1571a06b3570b858ae711246f96f8457dd02c44b2a0eb79e28f6c5eb8242a5d2d3174d2024-04-03T22:57:20+02:00Daniel Beveniusbackend : fix typo in scheduler documentation (ggml/781)
228057dd02c44b2a0eb79e28f6c5eb8242a5d2d3174d75cd4c77292034ecec587ecb401366f57338f7c02024-04-06T10:31:33-04:00Clint HerronTests: Added integration tests for GBNF parser (#6472)
228175cd4c77292034ecec587ecb401366f57338f7c0a8bd14d55717754a1f48313a846a2b16fa998ad22024-04-06T05:40:47+02:00Pierrick Hymbertci: bench: support sse and fix prompt processing time / server: add tokens usage in stream OAI response (#6495)
22821b496a745c315022df2d919374052e6004ced8d3a307375c02cac45cff53cf2520330b43fecc77182024-04-05T14:35:06+01:00Ouadie EL FAROUKI[SYCL] Fixed minor bug when enabling FP16 for non intel targets (#6464)
2283b660a5729e1e7508671d3d0515fd7efaeaeb85b90a1d889e27d6aaa3293dd2c692b849a9bcf4b4742024-04-05T01:16:37+08:00Jun Jiereadme : fix typo (#6481)
22840a1d889e27d6aaa3293dd2c692b849a9bcf4b4747dda1b727ef1730783a6077136d28b83e70dd3972024-04-04T17:31:22+01:00Ed Lepedusserver: add cURL support to server Dockerfiles (#6474)
22858120efee1d9931b514aeb5a047209d576f23286ca74401f0e5ebb15fa4d8b6619d1baa6ea91791232024-04-04T16:59:04+02:00Pierrick Hymbertci: bench fix concurrency for workflow trigger dispatch with sha1 (#6478)
22867a2c92637ae265654a68f62e6a7610b358255d3f4bcd6b959ca3991084ad1d8464caf2a734e29b1d2024-04-04T11:57:58+02:00Pierrick Hymbertci: bench: add more ftype, fix triggers and bot comment (#6466)
22874bcd6b959ca3991084ad1d8464caf2a734e29b1d9b84ae1806cded4d6683c7b810925da5ead406072024-04-04T09:49:21+02:00Daniel Beveniuscommon: remove duplicate check for curl (#6471)
22889b84ae1806cded4d6683c7b810925da5ead406074399f13fb9462cd06f3f154d0aee738425000fea2024-04-04T03:44:28-04:00Clint Herronexamples : add GBNF validator program (#5948)
228972d73af65132792a52433952ca4729b01c36cde25fb1574c8112c757fc202fdae279da883f34e6102024-04-04T02:32:53-04:00Clint Herronconvert : fix for lint error complaining of bare except (#6470)
22905fb1574c8112c757fc202fdae279da883f34e61060cdf40cc32f0ad4cb11e0ca8fd38f3b93d8d6402024-04-03T13:22:57-07:00FattireA few small fixes to server's README docs (#6428)
2291bb43cf7e9d86d69ffd9c7f008f75db890a35b45a9f62c0173d964972849251c8ad12fc356f5b78962024-04-04T02:05:10+08:00bryanSwkllama : add SEA-LION support (#6448)
2292e69945d953b651674d6e6978022edf00c3a34d03db214fa578e00b01e0884fc2725c9349608bdab52024-04-03T14:48:07-03:00Joycesecurity : create policy (#6354)
2293db214fa578e00b01e0884fc2725c9349608bdab51ff4d9f3d683f02ef8a12e04bfac84300c44bd3a2024-04-03T21:12:52+05:30Abhishek Gopinath KMissing tokenizer.model error during gguf conversion (#6443)
22941ff4d9f3d683f02ef8a12e04bfac84300c44bd3a076b08649ecc3b0e1c0709c2a086a63eddd1bf322024-04-03T23:24:31+08:00kaizauAdd OpenChat, Alpaca, Vicuna chat templates (#6397)
229508a0c0206075556e82aca0feafad530dcc5f142652604860f93063ef98863921da697576af1c76652024-04-03T15:07:05+02:00slarenggml : mul_mat_id use the same tensor for all the experts (#6387)
229633a52448061cfd2ea44da9e6cb30b2ec22e2f6d0226e819371eec0f298d9075198394a07b23ecfa92024-04-01T13:30:43+02:00Johannes Gäßlercompare-llama-bench.py: fix long hexsha args (#6424)
2297226e819371eec0f298d9075198394a07b23ecfa9c50a82ce0f71558cbb8e555146ba124251504b382024-04-01T12:36:40+02:00Pierrick Hymbertci: server: verify deps are coherent with the commit (#6409)
229837e7854c104301c5b5323ccc40e07699f3a62c3ec342d070c64a1ffe35d22c1b16b672e684a302972024-03-30T11:36:07+01:00Pierrick Hymbertci: bench: fix Resource not accessible by integration on PR event (#6393)
2299c342d070c64a1ffe35d22c1b16b672e684a30297f7fc5f6c6f3700da311de7fe93977c81798f02d32024-03-30T01:29:56+03:30Mohammadreza HendianiFedora build update (#6388)
2300f7fc5f6c6f3700da311de7fe93977c81798f02d3ba0c7c70ab5b15f1f2be7fb0dfbe0366dda30d6c2024-03-29T22:34:44+01:00Xuan Son Nguyensplit: allow --split-max-size option (#6343)
2301ba0c7c70ab5b15f1f2be7fb0dfbe0366dda30d6cd48ccf3ad4fea5b9ede209c7f40be65371987bfe2024-03-29T17:29:21+01:000cc4mVulkan k-quant mmq and ggml-backend offload functionality (#6155)
2302069574775cea67d8a977904e4d534aff47a671f4cfde806eb95de06d84162bdee593dad33a1d26932024-03-29T21:37:03+08:00hxer7963[Model] Add support for xverse (#6301)
2303cfde806eb95de06d84162bdee593dad33a1d2693b910287954d4462fd3d48938336770e2584596772024-03-29T14:34:28+02:00Georgi Gerganovci : fix BGE wget (#6383)
2304b75c38166cf0c66793a32d5c3d6cb69929dd083dbfe7dafc9cf96b9a09ead347fed9a547930fc6312024-03-29T08:15:00+01:00Pedro Cuencaconvert : allow conversion of Mistral HF models (#6144)
230566ba56025602270152f5ba5234f3a80be3dee1c90308f5e3d7bf9879f818b1a4ae589ff36b242af52024-03-28T22:33:10+08:00Ziang Wullava : fix MobileVLM (#6364)
23060308f5e3d7bf9879f818b1a4ae589ff36b242af528cb9a09c4d10a489be1238abe7a858dcd4d65f22024-03-28T08:05:54-04:00compiladellama : fix command-r inference when omitting outputs (#6367)
230728cb9a09c4d10a489be1238abe7a858dcd4d65f2cfc4d75df6399b36153ef739f2c1abee4c114bb82024-03-28T11:27:56+01:00Pierrick Hymbertci: bench: fix master not schedule, fix commit status failed on external repo (#6365)
2308cfc4d75df6399b36153ef739f2c1abee4c114bb86902cb7f2e3479f364ee177118200fb7e4e9fc922024-03-28T16:51:06+08:00Ting Sundoc: fix outdated default value of batch size (#6336)
2309f6a0f5c6422200764b7929064c39dcf4bb0e9cd6d0e2f6416bd43eddb70137f6b96c7bc3d02461022024-02-15T14:25:04+01:00hutlinix: .#widnows: init
2310d0e2f6416bd43eddb70137f6b96c7bc3d024610225f4a613c4ed6451162a87cb90be10d610b49f0f2024-03-28T12:03:30+08:00Ziang Wudoc: fix typo in MobileVLM-README.md (#6181)
231125f4a613c4ed6451162a87cb90be10d610b49f0fa016026a3ac16d8c9b993a3573f19b9556d67de42024-03-28T08:55:24+08:00Neo Zhang Jianyu[SYCL] fix set main gpu crash (#6339)
2312a016026a3ac16d8c9b993a3573f19b9556d67de453c7ec53d5eca26b2c0c648605543a5fa6c128172024-03-27T20:26:49+01:00Pierrick Hymbertserver: continuous performance monitoring and PR comment (#6283)
231353c7ec53d5eca26b2c0c648605543a5fa6c12817e5b89a441af23a74b861b0bf8db32391390418762024-03-27T16:17:46ZSomeone Sergenix: ci: dont test cuda and rocm (for now)
2314e5b89a441af23a74b861b0bf8db32391390418763a0345970ed0353fa857df3c8a62a2b3318b13642024-03-27T15:07:50+01:00slarenggml : fix bounds checking of zero size views (#6347)
2315e82f9e2b833d88cd2b30123ef57346c2cb8abd99cbc83436197cde617cad696e665879c20df77daa2024-03-27T08:16:40ZAidanBeltonS[SYCL] Fix batched impl for NVidia GPU (#6164)
2316e562b9714b9b3e242361a7f74bbbeb00f6bd99ac2ab4f00d25c0682a74472412d66454df211e4b0e2024-03-27T08:23:10+01:00Sigbjørn Skjæretcommon : change --no-penalize-nl to --penalize-nl (#6334)
23170642b22cd12af278d6e7e459b73411947c169381a4f569e8a316cbd33d2b4de94b694d111507475a2024-03-27T13:55:29+08:00Eric Zhangserver: public: use relative routes for static files (#6325)
2318a4f569e8a316cbd33d2b4de94b694d111507475a32c8486e1f0297393cb22ac0a0d26a6b17ad4d542024-03-27T09:47:06+08:00Neo Zhang Jianyu[SYCL] fix no file in win rel (#6314)
2319557410b8f06380560155ac7fcb8316d71ddc983755c1b2a3bbd470e9e2a3a0618b92cf64a885f8062024-03-26T10:46:41-04:00compiladellama : greatly reduce output buffer memory usage (#6122)
232055c1b2a3bbd470e9e2a3a0618b92cf64a885f806e097633f63fdd26d492844f7eff056e4083fd9eb2024-03-26T15:21:27+01:00KawrakowIQ1_M: 1.75 bpw quantization (#6302)
2321e097633f63fdd26d492844f7eff056e4083fd9ebd25b1c31b07c3675443a55a828dd58cfef5a241c2024-03-26T13:32:19+01:00Pedro Cuencaconvert-hf : fix exception in sentencepiece with added tokens (#6320)
2322deb7240100da99555b9ab9dc635021e591fceaf53d032ece8e6973441273601ca2981130608e287d2024-03-26T18:11:46+09:00Minsoo Cheongembedding : adjust `n_ubatch` value (#6296)
2323e190f1fca6f60d80944f9e8709d343a025c4d245280345968dabc00d212d43e31145f5c9961a76042024-03-25T20:51:46-04:00Joseph Stahlnix: make `xcrun` visible in Nix sandbox for precompiling Metal shaders (#6118)
2324b06c16ef9f81d84da520232c125d4d8a1d2737361f2fd4e727a707f85d58e0b56075c3e6334d18d82024-03-25T18:52:45+01:00Christian Köglernix: fix blas support (#6281)
23252f34b865b62b1d2b5eb8a27885e4de220deeacbdae1f211ce2138448b47ebb148e25c584068452782024-03-25T15:43:22+01:00slarencuda : fix LLAMA_CUDA_F16 build (#6298)
2326ad3a0505e3b6cd777259ee35e61d428357ffc56595ad616cddda50273e955bfe192328acd9aa48962024-03-25T09:42:17+01:00Xuan Son NguyenServer: clean up OAI params parsing function (#6284)
232795ad616cddda50273e955bfe192328acd9aa489664e7b47c6986221f2ff5c57c89dfc018bb0e9e6d2024-03-25T15:52:41+08:00Neo Zhang Jianyu[SYCL] fix SYCL backend build on windows is break by LOG() error (#6290)
23287733f0c76081b2a69b5f8b192db2db7c43629d58a32b77c4b2c1808654d0b952f26c37d73d2e746b2024-03-25T01:39:56-04:00Justine Tunneyggml : support AVX512VNNI (#6280)
2329a32b77c4b2c1808654d0b952f26c37d73d2e746ba0e584defd8c16e7a51ab895f595df0448d710d02024-03-24T14:45:56-07:00Rick GFix heap corruption from wmode out-of-bound writes on windows (#6272)
2330a0e584defd8c16e7a51ab895f595df0448d710d07aed0ffe6855e9cadcf413f288753af4566bfeb82024-03-24T16:18:45+02:00Georgi Gerganovimatrix : fix wname for mul_mat_id ops (#6271)
23317aed0ffe6855e9cadcf413f288753af4566bfeb8ea279d56091b90fbbe063b598f5229d95f58ef682024-03-24T14:21:17+01:00Johannes GäßlerFixed lookup compilation issues on Windows (#6273)
2332ea279d56091b90fbbe063b598f5229d95f58ef68586e7bc561be88e929a9afca7e67d8ead00c53bd2024-03-24T09:57:06+01:00Pierrick Hymbertci : close inactive issue, increase operations per run (#6270)
2333586e7bc561be88e929a9afca7e67d8ead00c53bdddf65685105a39a57b1e7f80c3aa502a6313af242024-03-24T17:54:07+09:00Minsoo Cheongsampling : deduplicated code for probability distribution access (#6240)
2334d03224ac9840351023ff8abcf4aa0542258a53df94d1b3b4119209efcdd08df0dceaecbd1fe7f85c2024-03-24T09:44:01+08:00Neo Zhang JianyuSupport build win release for SYCL (#6241)
233594d1b3b4119209efcdd08df0dceaecbd1fe7f85c95562175f83a49755ff6fd3bad09409417c8e6f92024-03-23T18:48:02-04:00Jared Van Borteluse _wfopen instead of fopen on Windows (#6248)
2336f482bb2e4920e544651fb832f2e0bcb4d2ff69ab1997577d5e121568ae39f538021733ccd4278c232024-03-23T18:07:00+01:00Pierrick Hymbertcommon: llama_load_model_from_url split support (#6192)
2337476b0251b27fb64c575507024a671e639d67559421cad01b6e6e1a96f99391f95e8ea8ae25c8288e2024-03-23T17:41:53+01:00Julius Arkenbergllama : add grok-1 support (#6204)
233850ccaf5eacb50a2ca378a4ef0dc7aeb45fead65256a00f0a2f48a85376f48b5ce77699df781631ae2024-03-23T01:24:36+01:00Johannes Gäßlerlookup: complement data from context with general text statistics (#5479)
233956a00f0a2f48a85376f48b5ce77699df781631ae92397d87a45a09b5449d845a64856f177cd7a9202024-03-22T21:10:39+02:00Georgi Gerganovcommon : default --hf-file to --model (#6234)
2340dba1af612926cbd4ebe2d876277af1e3305177e0ee804f6223777019cf921e0d99cc24669313ab982024-03-22T19:00:01+01:00Pierrick Hymbertllama_model_loader: support multiple split/shard GGUFs (#6187)
234180bd33bc2c4be352697dc8473339f25e1085d117e80f06d2a194be62ab5b1cd7ef7c7a5b241dd4fb2024-03-22T15:33:38+02:00Georgi Gerganovcommon : add HF arg helpers (#6234)
234272114edf068a9b2f54d3b09e9a198f611be397e82f0e81e053b41ca28e73a841e7bdbf9820baaa572024-03-22T13:07:44ZOlivier Chafikjson-schema-to-grammar : fix order of props + non-str const/enum (#6232)
23436b8bb3a31d260a01020497c5f01025c34222fcb968e210b3543e0cc71268bee0920441747679ee132024-03-22T19:12:05+08:00Jan Boonserver : fix n_keep always showing as 0 in response (#6211)
234468e210b3543e0cc71268bee0920441747679ee13b3e94f26bab8e3b5338b5902e5af5bb01894cb4a2024-03-22T13:08:28+02:00Georgi Gerganovserver : enable continuous batching by default (#6231)
2345b3e94f26bab8e3b5338b5902e5af5bb01894cb4ab2075fd6a578f5685060df4baa90ae9e48e98c702024-03-22T11:35:53+02:00Georgi Gerganovmetal : proper assert for mat-mat memory alignment (#6225)
2346fa046eafbc70bf97dcf39843af0323f19a8c9ac3be07a03217376c53b1d95e5f658adbbbb28315552024-03-21T21:32:42-04:00DAN™Fix params underscore convert to dash. (#6203)
2347d0a71233fbf8ade8ef06ad8e6b81d1d7b254895ff372c49ccdc561ab96fb3c7d2b7cbc0f89a4b3592024-03-21T19:54:28+01:00slarencuda : disable host register by default (#6206)
234803a8f8fafec2e21009be9fe7297d92e5d4538964cfd3be76e37dab92c846d75a2421178f20db4a112024-03-21T13:59:53+01:00slarencuda : fix LLAMA_CUDA_F16 build (#6197)
2349cfd3be76e37dab92c846d75a2421178f20db4a115b7b0ac8dfdd800c0fd0dc69b69991e8cb19fb462024-03-21T13:59:38+01:00Kawrakowggml : same IQ4_NL quantization for CPU/CUDA/Metal (#6196)
23505b7b0ac8dfdd800c0fd0dc69b69991e8cb19fb461943c0198125a0da1a200390e82cf461f9080d992024-03-21T11:50:43ZOlivier Chafikjson-schema-to-grammar improvements (+ added to server) (#5978)
23511943c0198125a0da1a200390e82cf461f9080d995e43ba87429d85acbde97d16b2f48d9de992cc802024-03-21T10:30:40+01:00Vaibhav Srivastavci : fix indentation error (#6195)
235242e21c68826f2e56b9592dccd9f3c43895b6890d1c51f98adcbad40e3c41f0a6ffadeb723190b4172024-03-21T01:47:46+01:00slarencuda : fix conflict with std::swap (#6186)
23531c51f98adcbad40e3c41f0a6ffadeb723190b417f9c7ba34476ffc4f13ae2cdb1aec493a16eb8d472024-03-20T21:03:26+01:00slarencuda : print the returned error when CUDA initialization fails (#6185)
2354272935b281fee5c683e3d6d1eb580b84553cf503ccf58aa3ec4d20b10162ba40898dc038ad4c3fad2024-03-20T23:02:32+08:00Ziang Wullava : add MobileVLM_V2 backup (#6175)
235591f8ad167dcd24b54615b468d9dd764ebe1d37ad6b7e76d28cdf4361740054140708c718284535222024-03-20T13:30:36+01:00Xuan Son NguyenServer: version bump for httplib and json (#6169)
2356f8c4e745e1e728204ab26dbadf52853545e6789c47cc7a7bf9793f81a6dfe7c2096c499403f64dd62024-03-20T19:20:37+08:00Ziang Wullava : add a MobileVLM_V2-1.7B backup (#6152)
2357bd60d82d0cc8b6852ec535495a5042dbdf05de246c0b287748327741b113d7d6018b68c63039b1c52024-03-20T01:33:49-04:00Jared Van Bortelserver tests : more pythonic process management; fix bare `except:` (#6146)
2358d0d5de42e5a65865b5fddb6f5c785083539b74c3b80cf3b2d1dee0ad325f7a794fecc66befce73362024-03-19T12:05:44+01:00Pierrick Hymbertgguf-split: split and merge gguf per batch of tensors (#6135)
2359b80cf3b2d1dee0ad325f7a794fecc66befce7336970a48060ab9a6cc67aa063870323781c2a7bd7d2024-03-19T10:21:54+02:00Georgi Gerganovcommon : disable repeat penalties by default (#6127)
2360104f5e0fc156d48476258295457cafeec2a2af105e1b7f94a03e0b3b8e4578625bbdadc7bbd2b93c2024-03-18T16:40:22+01:00Felixclip : fix memory leak (#6138)
2361ac9ee6a4ad740bc1ee484ede43e9f92b5af244c14f6d1337ca5a409dc74aca8c479b7c34408a69c02024-03-18T13:45:38+02:00Georgi Gerganovci : disable stale issue messages (#6126)
23622bf8d0f7c4cc1235755ad06961ca761e458c5e55496bc79bc2b79bfd6124b8687a8dbd6a646e9b062024-03-18T11:03:04+01:00slarenbackend : offload large batches to GPU (#6083)
23633a6efdd03c46c5ba08e43880d34260c02dd9999bd01b3c4c32357567f3531d4e6ceffc5d23e875832024-03-18T09:04:41+01:00Romain Dconvert : use f32 outtype for bf16 tensors (#6106)
2364cd776c37c945bf58efc8fe44b370456680cb1b59dc0f6125487dcfbff913360f9d877bc0ccf6aa572024-03-17T19:51:57+02:00Georgi Gerganovci : close all stale issues at once (#6115)
2365dc0f6125487dcfbff913360f9d877bc0ccf6aa57c47cf414efafb8f60596edc7edb5a2d68065e9922024-03-18T01:12:22+08:00GainLeeggml:fix finding transfer queue family index error (#6094)
2366b5f4ae09c3244ae1644b67c03ed9f4227ab25ad2dfbfdd60f90207404039c6578d709231496831d92024-03-16T16:46:29+01:00Daniel Beveniusgritlm : add initial README.md (#6086)
236715961ec04dbd59d21d8984d42e4c0f7e7e7d320aa56d09a4407f29c21e149b44fd5308f83aa1cb092024-03-16T11:39:15-04:00DAN™common : refactor nested if causing error C1061 on MSVC (#6101)
2368a56d09a4407f29c21e149b44fd5308f83aa1cb09d84c48505f60bcd358b82a751d40418c4d2356432024-03-16T13:20:53+01:00Pierrick Hymbertci : close inactive issue with workflow (#6053)
2369d84c48505f60bcd358b82a751d40418c4d235643877b4d0c628cc70dddb5df72ed8fc14d126ca7e82024-03-15T22:14:16+01:00slarenllama : fix Baichuan2 13B (#6092)
2370877b4d0c628cc70dddb5df72ed8fc14d126ca7e812247f4c69a173b9482f68aaa174ec37fc909ccf2024-03-15T13:43:02-07:00Theia Vogelllama : add support for control vectors (#5970)
237112247f4c69a173b9482f68aaa174ec37fc909ccf4e9a7f7f7fb6acbddd1462909c8d696e38edbfcc2024-03-15T16:41:22-04:00Andrew Canisllama : add Command-R support (#6033)
23724e9a7f7f7fb6acbddd1462909c8d696e38edbfcc3020327f6cd6d2ce50528dd65f4b199d2ea8b1ae2024-03-15T22:31:05+08:00Ting Loullava : change API to pure C style for Rust FFI bindgen (#6079)
237346acb3676718b983157058aecf729a2064fc7d34131b0584096ee9df4d07cb28759dfea6efe6475f2024-03-15T18:53:53+08:00Neo Zhang Jianyufix set main gpu error (#6073)
2374753e36f650fa2a5869f89188d9ee745dc74cf14b7ce2c77f88e1ca66ec48417e56f91746bac018c22024-03-15T09:26:20ZAidanBeltonS[SYCL] Fix non-intel device selection (#6042)
23757ce2c77f88e1ca66ec48417e56f91746bac018c2aab606a11fc0a9740a7f297521c3eef851dfb3512024-03-15T02:46:51-06:00Ondřej Čertíkgguf : add support for I64 and F64 arrays (#6062)
23764755afd1cbd40d93c017e5b98c39796f523453146e0438da3cc95b89cdbf55f45fa4e324d90767922024-03-14T22:58:41+02:00Georgi Gerganovllama : fix integer overflow during quantization (#6063)
23776e0438da3cc95b89cdbf55f45fa4e324d9076792727107707a73b3dc8a497cf9fc9405722c16dd2b2024-03-14T14:29:32-04:00Steve Grubbgguf : fix resource leaks (#6061)
237869ff61397d2b7b550dcdda4a35b35128892408b0044ec4b2a567f649459ccd20af2f387c784faa512024-03-14T17:21:56+01:00Michael Podvitskiyllama : support models without vocabulary (#5798)
237977178eedc83d49f31bf757d8e12315d76460be7815a333260ab637a040ed0864c206a2ceaf806bb82024-03-14T13:32:14+02:00Georgi Gerganovgguf-py : fix dtype check (#6045)
238043241adf22e8231ffaf3827d2c9310cc0ffd5ac5a44bc969e4cd62ca9f4332e17fe3c51f2093e7c62024-03-14T12:15:39+01:00Pierrick Hymbertserver: disable debug release type sanitizer, simplify trigger (#6047)
2381a44bc969e4cd62ca9f4332e17fe3c51f2093e7c62c4fb69246834503db7b78bcbedcef506bbc60c42024-03-14T13:13:06+02:00Georgi Gerganovllama : fix typo
23822c4fb69246834503db7b78bcbedcef506bbc60c43ca23481dd309bd51cc31c73a4cc34f922cc372f2024-03-14T11:56:48+01:00Michael Podvitskiyllama : optimize defrag moves + fix fragmentation calculation (#6037)
2383381da2d9f0940d7009e3e918bed36338c8ff2fbb0fd6c1f015f6cccf3b527f7dbd8386a4347281262024-03-14T11:55:23+02:00Georgi Gerganovmetal : build metallib + fix embed path (#6015)
238476a936c8939c249a7c3e8e66dfefbab13eae194f463628372d5fe3a0c1e5864aa5fc57deb73870392024-03-13T20:33:56+02:00Georgi Gerganovreadme : update API changes and hot topics
2385f30ea47a87ed4446ad55adb265755dc9102956a2d8fd0ccf6ac8b07791ffd1575eed436930854ae32024-03-13T18:54:21+01:00slarenllama : add pipeline parallelism support (#6017)
2386d8fd0ccf6ac8b07791ffd1575eed436930854ae3b3d978600f07f22e94f2e797f18a8b5f6df23c892024-03-13T14:58:30+01:00slarentest-backend-ops : skip CPU backend by default (#6028)
2387184215e783dfad76aded2c68244c327a5c507df548358b2e5b3983c41ba7e61a493e84d3901dc7b92024-03-12T13:49:55+02:00Georgi Gerganovggml : fix UB in IQ2_S and IQ3_S (#6012)
238848358b2e5b3983c41ba7e61a493e84d3901dc7b95cdb371731caa2c41fcca42d4d2d43f94f6883b42024-03-12T11:15:05+02:00Georgi Gerganovsycl : update IQ1_S kernels (WIP - not working!) (#5995)
23895cdb371731caa2c41fcca42d4d2d43f94f6883b444ca159faf4fbe1a7ace13a962845ba7cdfd95ec2024-03-11T20:59:03+01:00glipticgrammar : fix unnecessarily retained pointer to rules (#6003)
239044ca159faf4fbe1a7ace13a962845ba7cdfd95ec05b06210c954491cf0f12034b0a62bd4d69ce78b2024-03-11T16:53:15+01:00Kawrakow1.5 bit: we can do even better (#5999)
239105b06210c954491cf0f12034b0a62bd4d69ce78b83796e62bc9f6caae6228168e359890f51e60fee2024-03-11T17:49:47+02:00Georgi Gerganovllama : more consistent names of count variables (#5994)
239283796e62bc9f6caae6228168e359890f51e60fee828defefb66fc8a25404f5de845897145bf340612024-03-11T17:47:47+02:00Georgi Gerganovllama : refactor unicode stuff (#5992)
2393caa106d4e05a0ab94225c220b81f9e2cd522339b3202361c5b1ba15e695b31209567ef42c22c5c322024-03-11T10:56:41+01:00Xuan Son NguyenServer: format error to json (#5961)
23943202361c5b1ba15e695b31209567ef42c22c5c32332bdfd7980718abf664bfa5460f2288a33149842024-03-11T10:28:51+01:00Michael Podvitskiyggml, ci : Windows ARM runner and build fixes (#5979)
2395ecab1c75de68de7c41c254e2ae170d3b07bee6d4ee35600b9061b1ea0c4ea87fce6844297632b2a82024-03-11T10:00:08+02:00Gilad Scmake : fix subdir for `LLAMA_METAL_EMBED_LIBRARY` (#5985)
2396ee35600b9061b1ea0c4ea87fce6844297632b2a8be858f620508385ad12d0e5e862010e666ca729c2024-03-11T09:56:47+02:00Georgi Gerganovllama : fix F16/F32 downcast + improve names (#5980)
2397be858f620508385ad12d0e5e862010e666ca729cef3ced26a3817d92890b97b83acaeb018ade02d02024-03-11T07:51:49+01:00KawrakowBetter 1.5 bit quantization (#5971)
2398ef3ced26a3817d92890b97b83acaeb018ade02d03814a07392d2bdc22911652bc7c2f9bdb0ce042e2024-03-11T10:27:56+05:30Abhilash Majumder[SYCL] Add q3_s and q1_s (#5886)
23993814a07392d2bdc22911652bc7c2f9bdb0ce042ebb6d00bbf98476215596b9df3870b5504ef5a29a2024-03-11T01:13:57ZAidanBeltonS[SYCL] Add support for SYCL Nvidia target (#5738)
24007ab7b733bb48250b2df26c12b00256ef42c76932d9f65c97c3dc3aa6fa27470b8c6e69b437ec1a272024-03-11T04:03:17+08:00Deanandroid : fix utf8 decoding error (#5935)
2401df4dc3e7cb43162862f339525638ba4febcb6158bf47a5eefc669fdba71af096942af999bc1167d42024-03-08T23:45:07+02:00Georgi Gerganovggml : try fix 32-bit arm compat (whisper/1938)
2402fa8a809a9119411bc9c3f00026550d0343f4d9b7bcebd7dbf62fd7b293d5ed089023e4e733269c712024-03-10T18:17:47+01:00Pierrick Hymbertserver: ci: windows build and tests (#5968)
2403bcebd7dbf62fd7b293d5ed089023e4e733269c712960eae847f8dbde23be6d170a61bcf44ebf32de2024-03-10T11:56:30-04:00DAN™llama : add support for GritLM (#5959)
2404621e86b331f8b0e71f79fd82a4ae1cd54c3e439677d1ac7e00bf049b9f2bba1b5a310a78318c49c42024-03-09T23:41:49+01:00Pierrick Hymbertserver: benchmark: chat/completions scenario and other llm servers comparison (#5941)
24058380ecfb219c2e73cc706fcc83935b7c806cc7c358308a0ecce7cc261b802f4803c38d420063db212024-03-09T17:36:20+02:00Georgi Gerganovggml : fix unnecessary f32 -> f16 -> f32 casts (mmla) (#5951)
240658308a0ecce7cc261b802f4803c38d420063db215b09797321430f08caf0473143a962916ab2ea892024-03-09T17:34:15+02:00Georgi Gerganovserver : fix metrics init (#5964)
24075b09797321430f08caf0473143a962916ab2ea8997c09585d65a95864773b4d25d66d0f708baf38d2024-03-09T15:53:59+02:00Georgi Gerganovggml : remove old quantization functions (#5942)
240897c09585d65a95864773b4d25d66d0f708baf38dfb215c3832236fec7380c4fb618bd7154cb196ef2024-03-09T15:47:47+02:00Georgi Gerganovserver : clarify some items in the readme (#5957)
24090db32beaf09d90b8959d3d0cc493ed1e456853538a3012a4ad08112bb3dc3f1399afec4e93780c442024-03-09T11:16:53ZAlexey Parfenovserver : fix passing prompt as tokens (#5955)
24108a3012a4ad08112bb3dc3f1399afec4e93780c449674aaf35cb81478eb38c3f3ebde713ec72fbb792024-03-09T12:47:57+02:00Georgi Gerganovggml : add ggml-common.h to deduplicate shared code (#5940)
2411950ba1ab84db199f0bbdecdb2bb911f35261b321e1fa9569ba8ce276bc7801a3cebdcf8b1aa116ea2024-03-09T11:27:53+01:00Xuan Son NguyenServer: reorganize some http logic (#5939)
2412c2101a2e909ac7c08976d414e64e96c90ee5fa9e515f7d0d4fce41c752fc253acf30707c3be2531e2024-03-08T17:31:00-05:00compiladellama : support Mamba Selective State Space Models (#5328)
2413515f7d0d4fce41c752fc253acf30707c3be2531e76e868821a94072fbc87cb1fcca291694319eae82024-03-08T10:53:37-05:00compiladellama : fix quantization of shared token_embd (#5944)
241476e868821a94072fbc87cb1fcca291694319eae8e457fb3540e0aaec47cfde0abf784c213f9216ee2024-03-08T12:25:04+01:00Pierrick Hymbertserver: metrics: add llamacpp:prompt_seconds_total and llamacpp:tokens_predicted_seconds_total, reset bucket only on /metrics. Fix values cast to int. Add Process-Start-Time-Unix header. (#5937)
2415af37fd8b30e37ccbffdd82e6f48559e2fb7ce7dd581ed5c4fe3a8909aaa8313633ac443f471ba7552024-03-08T12:40:02+02:00Georgi Gerganovserver : fix EOS token detection with disabled cache (#5938)
2416581ed5c4fe3a8909aaa8313633ac443f471ba7556cdabe652695167263c8b447520987b11856f7ca2024-03-08T04:35:04-05:00UEXTM.comlog : fix MSVC compile errors (#5643)
24176cdabe652695167263c8b447520987b11856f7ca89fb735fcfd21781a8194b211cf32824beb3f71f2024-03-07T16:32:38+02:00Georgi Gerganovllama-bench : add embeddings option (#5924)
24182002bc96bf2cbf5ab981a17d7e994d817c9801f5ceca1aef0738b57951cd12c603c3477e75312dec2024-03-07T11:41:53+02:00Georgi Gerganovserver : refactor (#5882)
2419ceca1aef0738b57951cd12c603c3477e75312dece04e04f8fad549bb0b3ec1c91f0413aeb08baf292024-03-07T16:34:31+08:00Neo Zhang Jianyu[SYCL] fix error when set main gpu to non-zero (#5901)
2420e04e04f8fad549bb0b3ec1c91f0413aeb08baf29e25fb4b18fcedb9bed6be4585cf842e9a669b28b2024-03-06T15:42:23-05:00Jared Van Bortelggml : use SYS_get_cpu if SYS_getcpu is not defined (#5906)
2421bd836944f826f07e19b7edcf994a78728da49c1c3de31677d36aa4f82d4d99898902d7bcf398e6662024-03-05T11:56:37-05:00Jared Van Bortelquants : use MM256_SET_M128I consistently to fix gcc 7 build (#5889)
242261d1c88e155515dd03940913a5707ea84a8b119b21b08674331e1ea1b599f17c5ca91f0ed173be312024-03-05T13:33:42+01:000cc4mVulkan Improvements (#5835)
242321b08674331e1ea1b599f17c5ca91f0ed173be316a87ac3a52668e117d97bcea07b529c93188b3032024-03-05T16:08:35+08:00Neo Zhang Jianyu[SYCL] fix mul_mat fault in CI/unit-test (#5862)
24246a87ac3a52668e117d97bcea07b529c93188b30329eee404746e4696143a4f3a642660a4793a15d82024-03-05T15:12:23+09:00Minsoo Cheongfix editorconfig check break (#5879)
242529eee404746e4696143a4f3a642660a4793a15d81d41d6f7c2a666eb9c18a686a4684c4b03289bf32024-03-04T19:23:06-08:00Jeffrey Quesnellefix speculative decoding build on windows (#5874)
242629ae62d2ae163e2b68aa0ad3bf2ab4636de0c957e0843afe1b37890b631bc7d3d2da2ed36c862b912024-03-04T22:31:20+02:00Georgi Gerganovllama : fix embeddings (#5796)
2427e0843afe1b37890b631bc7d3d2da2ed36c862b91a1c6d96ed8f906aa1cda439f7386b1171a22bf9f2024-03-04T21:50:50+02:00Georgi Gerganovflake : fix
2428a1c6d96ed8f906aa1cda439f7386b1171a22bf9fefd8533ef8d0752cef7119eb5dbee412c4dba2702024-03-04T20:53:27+02:00Georgi Gerganovggml : fix unknown status (#0)
24299fa262734733573fa629ffc97dfcb971fe3f4832fe52be11e35358d2fd249f19d7ef5b6f9c08b16b2024-03-04T10:05:42+01:00Michael Podvitskiyggml : introduce ggml_status (ggml/750)
24306d341ab6c53cd51f2921d986d0090cc8b049b39a4ffcdce2ff877ebb683cd217ea38faf20faa5ffe2024-03-05T03:24:00+09:00Minsoo Cheongspeculative : implement stochastic speculative sampling (#5625)
24317d43c585dc174bb586775c22c15e5db9242b5b4b82f3e668adafba647de703f835991e91a96b5ac42024-03-03T20:23:52+08:00leejetadd some new ops, fix some operators and add batch operations to certain operators. (ggml/747)
243282f3e668adafba647de703f835991e91a96b5ac45a51cc1bb4592f0d71f9af89cd08b11a066ba4472024-03-04T03:08:19-05:00DAN™common : use LLAMA_DEFAULT_SEED (#5855)
243367be2ce1015d070b3b2cd488bcb041eefb61de72231ae28f078c3148d097b301f2145f1e3e816cc12024-03-03T14:26:18+01:00slarencuda : fix data race in soft max (#5853)
2434231ae28f078c3148d097b301f2145f1e3e816cc1475df1d6cf817060028d3ff763cb8097d4ec40d62024-03-03T12:44:03+02:00Georgi Gerganovreadme : add API changes section
2435de9692a7d2db66e29e5cb373c6551acc49145ccde6029348e86c3810d4435faee54ba822cb43e2ef2024-03-03T03:41:55-05:00compiladellama : fix llama_copy_state_data with fragmented KV cache (#5840)
24369731134296af3a6839cd682e51d9c2109a871de54a6e2d6142ab815c964924896891e9ab3e0506322024-03-02T22:00:14+01:00Pierrick Hymbertserver: tests: passkey challenge / self-extend with context shift demo (#5832)
24374a6e2d6142ab815c964924896891e9ab3e050632494c87032613e31c0be99b2735e732871f2c4e4d2024-03-02T20:52:25+01:00Michael Podvitskiyllama : add abort_callback to interrupt computation (#5409)
2438494c87032613e31c0be99b2735e732871f2c4e4d4d4d2366fc9c54d4a275065cfe9299c6cf7c5b782024-03-02T20:00:49+02:00Georgi Gerganovggml : fix IQ3_S AVX implementation (#5834)
2439bbde6eb2561153aabbdfac5001c690fe00cad639ef2cd694c4155fbf25bae61c5178c47eb3676dba2024-03-02T17:00:51+02:00Kawrakowggml : IQ3_S improvements (#5829)
2440802da0091ba646ecf02e1a8fae2da0b8e76409bd715641391dda1ff9762dc5d99d9a30acce99f2c62024-03-02T08:42:56-05:00compiladellama : fix segfault from unknown model arch name (#5820)
2441715641391dda1ff9762dc5d99d9a30acce99f2c69bf297a02bfbd474e51912409a470dd797e2fe132024-03-02T19:49:30+08:00Neo Zhang JianyuSupport multiple GPUs (split mode) on SYCL backend (#5806)
24429bf297a02bfbd474e51912409a470dd797e2fe13cb5e8f7fc4ee57d4bcccafbe04a82cededd354862024-03-02T00:11:06-05:00crasmworkflows : remove nocleanup arg for check-requirements.sh (#5826)
2443c29af7e2252d288f2ea58a7d437c1cb7c0abf16038d16b142624bdd7c41d9955752b7f7b59c5e0482024-03-02T01:00:46+05:30Sourab Mangrulkarllama : add StarCoder2 support (#5795)
2444c2224f003bf9cf558b1a3c57033563e11a4de9a5e7433867288d2f142cffe596f3751bda5d7ee2c72024-03-01T18:00:00+01:00ddpasaggml-vulkan: fix VULKAN_CHECK_RESULTS flag, which was previously broken (#5813)
2445e7433867288d2f142cffe596f3751bda5d7ee2c7f49a5356865ced0eca1df9f9d84631dfef71b9dc2024-03-01T06:08:08-08:00kunal-vaishnavigemma : fix bfloat16 -> float16 conversion issue (#5810)
2446f49a5356865ced0eca1df9f9d84631dfef71b9dc3ab8b3a92ede46df88bc5a2dfca3777de4a2b2b62024-03-01T22:48:56+09:00Miwa / Ensancommon : fix flag `--logits-all` to `--all-logits` (#5805)
24479600d59e010c18f5872580a21734ea1bf1968d045cb02b4a012bb16c6c699c0c62c05ffa653eee0f2024-03-01T03:15:36-06:00Douglas Hanleyunicode : switch to multimap based nfd_map (#5799)
2448f105471ef6aa4727afac8240da398590d7277f4538d152160898b0173ffe4dc7df5daadcbd2eceb02024-03-01T09:59:43+02:00Georgi Gerganovserver : fix newlines in help (#5785)
2449052051d8ae4639a1c3c61e7da3237bcc572469d4d5ab29757ebc59a30f03e408294ec20628a6374e2024-02-29T21:42:11+01:00Xuan Son NguyenServer: normalize naming (#5779)
24502774b0c97427ee3ad3e2ee121354d078794e89d95f706718566e3a5147916dc381f3b99de0ffad472024-02-25T20:41:35+01:00slarenadd google magika inference example (ggml/748)
24515f706718566e3a5147916dc381f3b99de0ffad47a693bea1e6762a17b78b6ddf4611e54136941ea22024-02-24T11:27:36-05:00UEXTM.comIntroduce backend GUIDs (ggml/743)
2452adcb12a9bad87bc96f2f158c95892b3d04aa7ffb177628bfd85565070916ad66a5ac4071ee0527d82024-02-28T03:52:56-05:00compiladellama : fix non-quantization of expert gating tensors (#5754)
24537c4263d4261d6ee6f0539d53eb9e1b4d120ba8afcb49e0f8c906e5da49e9f6d64a57742a9a241c6a2024-02-28T10:37:02+02:00Kawrakowggml : make i-quants work with super-blocks of 64 (CPU,Metal) (#5760)
2454cb49e0f8c906e5da49e9f6d64a57742a9a241c6a0becb22ac05b6542bd9d5f2235691aa1d3d4d3072024-02-27T19:16:49+02:00KawrakowAttempt to fix android build (#5752)
24550becb22ac05b6542bd9d5f2235691aa1d3d4d307c24a2a6e6005e5d424301525a42ba45a4a362d302024-02-27T16:34:24+02:00KawrakowIQ4_XS: a 4.25 bpw quantization (#5747)
24561f30b7a9f1b86baa455072d3182b9ebeee0cd8459d533a77d0c3850ce09d736bc1baa67fd6ad27b32024-02-27T06:50:18-06:00Engininja2ggml-quants : fix avx2 iq1_s vec_dot when compiled with gcc (#5742)
24579d533a77d0c3850ce09d736bc1baa67fd6ad27b3cbbd1efa06f8c09f9dff58ff9d9af509cc4c152b2024-02-27T14:35:51+02:00Georgi Gerganovllama : fix defrag bugs + add parameter (#5735)
2458cbbd1efa06f8c09f9dff58ff9d9af509cc4c152bb11a93df41921846a10628a7c306d5c82a5499392024-02-27T10:03:06+08:00le.changMakefile: use variables for cublas (#5689)
2459b11a93df41921846a10628a7c306d5c82a549939a33e6a0d2a66104ea9a906bdbf8a94d050189d912024-02-26T23:15:48+01:00Xuan Son Nguyenfix server hangs on empty prompt (#5733)
246047bb7b48c7cec9d8f57d56812ce811ec130b89a3c4d7f8178608440506e5489bae0109e4ca12e44a2024-02-26T15:36:38+01:00Johannes GäßlerCUDA: fix DEBUG_CUDA_MALLOC (#5729)
2461e849078c6e09e72fdd2c95ba61f5fba9a7b2d9ef67fd33132fab93e6c2087bd6fa656a8a57419efa2024-02-26T14:02:11ZAidanBeltonS[SYCL] Add support for soft_max ALiBi (#5639)
24624804215cb833841ffb15a710a16b77ca0a29eb4b8a533f0d9078396ebaee9ba213038a1322976dee2024-02-26T11:41:34+01:00Pierrick Hymbertserver: CI fix trailing space (#5728)
2463269de86ba073b5dc9ce687c11a3bc4d7d873b962c39373398803c669056304090050fe3f44b41bf92024-02-26T08:30:17+02:00Georgi Gerganovllama : fix Gemma rope type (#5691)
2464bf08e00643fd529f748f0a858fd79f3061e3fa18f7625019c51ca437a5840576d92362cfa710e4a22024-02-25T22:12:24+02:00Georgi Gerganovllama : refactor k-shift implementation + KV defragmentation (#5691)
2465f7625019c51ca437a5840576d92362cfa710e4a2abbabc5e51d0d4656b438aec10b7fae9479ef37d2024-02-25T13:43:50-05:00compiladeserver : fix crash when system prompt is bigger than batch size (#5714)
2466abbabc5e51d0d4656b438aec10b7fae9479ef37df1a98c52546d009f742bdec2154c2a314ea950a62024-02-25T19:43:00+01:00Radosław Grytaggml-quants : provide ggml_vqtbl1q_u8 for 64bit compatibility (#5711)
2467f1a98c52546d009f742bdec2154c2a314ea950a67d548a1827f6fc6aece6db74c9d112da42c40d682024-02-26T00:46:49+08:00kwin1412make : fix nvcc version is empty (#5713)
2468930b1780269a69948d106e2d1b838ab7661f679ad52d7819b8ced70c642a88a59da8c78208dc58ec2024-02-25T13:50:32+01:00Pierrick Hymbertserver: logs - unified format and --log-format option (#5700)
2469d52d7819b8ced70c642a88a59da8c78208dc58ec12894088170f62e4cad4f8d6a3043c185b414bab2024-02-25T13:49:43+01:00Pierrick Hymbertserver: concurrency fix + monitoring - add /metrics prometheus compatible endpoint (#5708)
247012894088170f62e4cad4f8d6a3043c185b414babab336a9d5e5352ecdcdf4c12d2d54cf4ef82ce312024-02-25T11:53:11+01:00Radosław Grytacmake : fix compilation for Android armeabi-v7a (#5702)
247169917dfa55674c608360638bb4d6a12a315e28109e359a4f47c1b2dceb99e29706c9f7403d32ab5e2024-02-25T10:54:04+01:00Anas Ahouzipy : fix StableLM conversion after config.json changes (#5703)
24729e359a4f47c1b2dceb99e29706c9f7403d32ab5e4c4cb30736582cacb1a164a9d4bc8e17b1014be72024-02-24T19:16:04+01:00Pierrick Hymbertserver: continue to update other slots on embedding concurrent request (#5699)
24734c4cb30736582cacb1a164a9d4bc8e17b1014be7525213d2f5da1eaf4b922b6b792cb52b2c6133682024-02-24T16:23:52+02:00KawrakowIQ3_S: a much better alternative to Q3_K (#5676)
2474525213d2f5da1eaf4b922b6b792cb52b2c613368fd43d66f46ee3b5345fb8a74a252d86ccd34a4092024-02-24T12:28:55+01:00Pierrick Hymbertserver: init functional tests (#5566)
247554fbcd2ce6c48c9e22eca6fbf9e53fb68c3e72ea15499eb94227401bdc8875da6eb85c15d37068f72024-02-23T13:39:14-05:00Jared Van Bortelconvert : fix missing ftype for gemma (#5690)
24767e4f339c404dbe029d4a117c03b37a9bf646cf0e334f76fa385ed81095165e5ae0687562148939012024-02-22T23:21:39+02:00Georgi Gerganovggml : always define ggml_fp16_t as uint16_t (#5666)
24775a9e2f60ba3d8362ba17c77ac3092906d49b813f373ee3fbbabc4c1508eed4f5c3795b23a20939a32024-02-22T20:13:25+02:00Georgi Gerganovpy : minor fixes (#5668)
24783a03541cedea474fa9d41214484cc3fbcf468a9e56d03d92be57f5880b9ed94542d87bb6effae31f2024-02-22T13:54:03+02:00Georgi Gerganovminor : fix trailing whitespace (#5638)
2479a46f50747b2028f7f9c9883b26bfba12bf92556ec5688c6250430d2b8e0259efcf26c16dfa4c1f462024-02-22T09:33:24+01:00Xuan Son Nguyenserver : fallback to chatml, add AlphaMonarch chat template (#5628)
2480973053d8b0d04809836b3339a50f68d9c842de907c8bcc11dc61cf5930b70cd0168b84afcebe12a92024-02-22T00:42:09+01:00slarenllama : fix loading models with shared tok_embd and output (#5651)
24817c8bcc11dc61cf5930b70cd0168b84afcebe12a97fe4678b0244ba7b03eae66ebeaa947e2770bb1a2024-02-22T00:31:00+01:00Xuan Son NguyenAdd docs for llama_chat_apply_template (#5645)
24827fe4678b0244ba7b03eae66ebeaa947e2770bb1aba2135ccae7462470b3865c6e41d2e1d734eac052024-02-21T22:52:39+01:00slarenllama : fix session save/load with quantized KV (#5649)
24831ecea255ebb70750b52688393f37a63606b90e3fa00a35cef93e057eace8351a667d14d152a91ebc2024-02-21T15:47:48+01:00Pierrick Hymbertserver: health: fix race condition on slots data using tasks queue (#5634)
2484eccd7a26ddbff19e4b8805648f5f14c501957859c14f72db9c62d71d35eb1c141745c0bd0cb27b492024-02-21T16:17:10+02:00Georgi Gerganovsync : ggml (#5633)
2485cc6cac08e38e32bf40bbe07e9e8f8f0130b5fd94580111d42b3b6ad0a390bfb267d6e3077506eb312024-02-21T14:36:57+01:00Daniel Beveniusllava : add --skip-unknown to 1.6 convert.py (#5632)
2486a14679cc30c785e75d38028bae6ec39c6209ddef6560bed3f066c876682464762cad90f1e28e3f1b2024-02-21T11:39:52+02:00KawrakowIQ4_NL: 4-bit non-linear quants with blocks of 32 (#5590)
24876560bed3f066c876682464762cad90f1e28e3f1b06bf2cf8c406e6b70dbf9b431a02fa0ad845b9df2024-02-20T11:07:22-08:00CJ Paisserver : support llava 1.6 (#5553)
248806bf2cf8c406e6b70dbf9b431a02fa0ad845b9df4ed8e4fbef6a15afd993bfcd9ffa279841e18ef12024-02-20T20:06:17+01:00slarenmake : fix debug build with CUDA (#5616)
24899c405c9f9a7cfd23511fd6b2de05dc72481119b45207b3fbc500f89dfe528693e96540956dbaed962024-02-20T15:58:27+01:00Xuan Son NguyenServer: use llama_chat_apply_template (#5593)
2490c0a8c6db371cb3e4379900867b948879f5842201b9111bd209c7b11b0592450a6ed2e0ca545b2c842024-02-20T08:48:19+01:00Pierrick Hymbertserver : health endpoint configurable failure on no slot (#5594)
2491b9111bd209c7b11b0592450a6ed2e0ca545b2c84633782b8d949f24b619e6c68ee37b5cc791671732024-02-20T07:01:25ZAidanBeltonSUpdate ggml_sycl_op_mul_mat_vec_q (#5502)
249242f664a3825dfde13a32c3577ab66d10c56f3aa65dde5408978eda22242b87e22e306d1c2d1a58342024-02-03T18:00:11ZMathijs de BruinResolve ErrorIncompatibleDriver with Vulkan on MacOS.
249340c3a6c1e11040088b4a1ce0abc4651cb3011dd4f24ed14ee0ce28dfe98115c378b37da1449120162024-02-19T23:40:26+01:00slarencuda : ignore peer access already enabled errors (#5597)
2494d0e3ce51f45bd6a646da1952d7e5d143a087db3e68a6b98b3c8af7e5baade3ee45fe1d2c7b9323a92024-02-19T14:45:41+02:00Georgi Gerganovci : enable -Werror for CUDA builds (#5579)
249568a6b98b3c8af7e5baade3ee45fe1d2c7b9323a970d45af0efce9ed360e1858b827989d971dd9caf2024-02-19T13:41:51+02:00Georgi Gerganovmake : fix CUDA build (#5580)
249670d45af0efce9ed360e1858b827989d971dd9caf13e2c771aa4212cd5405cf310203848d50f7f8592024-02-19T02:37:10-08:00valirayreadme : fix typo in README-sycl.md (#5353)
249713e2c771aa4212cd5405cf310203848d50f7f859f53119cec4f073b6d214195ecbe1fad3abdf2b342024-02-19T14:45:18+05:30Abhilash Majumdercmake : remove obsolete sycl compile flags (#5581)
2498f53119cec4f073b6d214195ecbe1fad3abdf2b3470847553963c85e86051d06df848236829f5f9512024-02-19T10:34:10+02:00Georgi Gerganovminor : fix trailing whitespace (#5538)
249970847553963c85e86051d06df848236829f5f9514480542b2271ba1438f0daff8e5f3a74b1dc86092024-02-19T09:31:59+01:00Daniel Beveniusllava : avoid changing the original BakLLaVA model (#5577)
25004480542b2271ba1438f0daff8e5f3a74b1dc860911b12de39bd787c0494da0cd405958fdfedc29c42024-02-19T03:25:38-05:00NawafAlansaribaby-llama : allocate graphs in ggml_context (#5573)
The file is too large to be shown. View Raw